16. 5. 2026

Lokálni AI coding agenti: Tetris test ukazuje dnešný praktický strop

Realistický cover pro článek o lokálních AI coding agentech a Tetris benchmarku

Jirka Herník 16. mája 2026 spravil presne ten typ testu, ktorý je pre AI prax často užitočnejší než ďalšia abstraktná benchmarková tabuľka: šesť lokálnych modelov, jedna cloudová baseline a pre všetkých rovnaké zadanie. Napíš Tetris ako jeden HTML súbor.

Bežalo to na silnej, ale stále realistickej domácej pracovnej stanici: Ryzen 9 5950X, RTX 3070 s 8 GB VRAM, 128 GB RAM a LM Studio ako lokálny server. Do toho opencode ako coding agent, Playwright MCP na kontrolu v prehliadači a GPT-5.5 cez OpenRouter ako referenčný cloudový výsledok.

Lokální coding agent: Tetris test

Prečo je to dobrý test

Tetris nie je enterprise aplikácia, ale je lepší test než ďalšia TODO appka. Model musí udržať stav hry, rotácie, kolízie, vykresľovanie, časovanie, vstup z klávesnice a chyby v JavaScripte. Keď má výsledok bežať ako jeden HTML súbor, nie je sa veľmi kam schovať.

Čo dopadlo zle

Najmenšie modely narazili rýchlo. Nemotron 3 Nano 4B podľa videa vrátil Pythonovskú syntax v JavaScripte a skončil na 0/11. Qwen 9B Q4 spadol na SyntaxError a tiež skončil na 0/11.

To neznamená, že tieto modely sú zbytočné. Je to pripomienka, že „lokálna AI“ nie je jedna kategória. Model, ktorý dobre odpovedá v chate alebo zvláda jednoduchú extrakciu, ešte nemusí byť použiteľný ako coding agent, ktorý má vytvoriť funkčnú interaktívnu aplikáciu.

Kde už lokálny model začína dávať zmysel

Zaujímavejší je stred. Gemma 4 E4B skončila na 3/11 a Gemma 4 E2B na 5/11, hoci pri nej nebola viditeľná aktívna kocka. Znie to komicky, ale pre prax je to dôležité: lokálny model sa už môže hodiť na návrhy, menšie úpravy, jednoduchý refaktoring, vysvetlenie kódu alebo prvý draft.

Skutočne zaujímavý výsledok bol gpt-oss 20B. Ten podľa testu zvládol 9/11 a hra bola naozaj hrateľná. To je hranica, kde lokálny model prestáva byť iba hračka. Stále by som ho nepustil bez kontroly na produkčný kód, ale ako lacná prvá iterácia začína dávať zmysel.

Prečo cloudová baseline stále vyhrala

GPT-5.5 cez OpenRouter zvládla 11/11: ghost piece, 7-bag randomizer aj wall-kick rotácie. To je presne rozdiel medzi „nejako to beží“ a „rozumie tomu ako malej aplikácii.“

Praktické pravidlo je jednoduché: lokálny model môže byť lacná prvá vrstva, ale ťažké prípady, finálne review a zložitejšia architektúra stále patria silnejšiemu modelu. Nie preto, že cloud je magický. Pretože schopnosť udržať viac pravidiel a edge casov naraz je pri coding agentovi zásadná.

Ako by som to použil vo workflow

Lokálny model by som dnes použil na:

  • jednoduché generovanie boilerplate,
  • vysvetlenie cudzieho kódu,
  • prvý návrh malej funkcie,
  • rýchle refaktoringy bez citlivých dát,
  • predspracovanie úloh pred drahším modelom.

Silnejší model alebo cloudovú baseline by som nechal na:

  • návrh architektúry,
  • zložité opravy,
  • testy a edge cases,
  • finálne review,
  • rozhodnutia, kde chyba stojí viac než tokeny.

Záver

Tento test nie je o tom, že lokálna AI prehrala. Skôr ukazuje, že lokálna AI konečne začína byť praktická, len sa musí správne zaradiť do workflow.

RTX 3070 s 8 GB VRAM stále nie je náhrada frontier modelu. Ale už stačí na to, aby lokálny agent spravil prvý kus práce lacno a bez posielania všetkého do cloudu. Produkčná hodnota nevzniká tým, že jeden model zvládne Tetris. Vzniká tým, že máte router, testy, fallback a človeka, ktorý pozná rozdiel medzi hrateľným demom a spoľahlivým softvérom.


Zdroje: Jirka Herník: Tetris od 6 lokálních AI, LM Studio, opencode, Playwright MCP, OpenRouter, OpenAI: gpt-oss, Google Gemma, Qwen, NVIDIA Nemotron.