22. 7. 2026

Gemini 3.6 Flash a 3.5 Flash-Lite: dva modely pre agentný router, nie jeden víťaz

Realistic AI engineer routing business documents between fast and capable production models

Google 21. júla vydal dva všeobecne dostupné produkčné modely: Gemini 3.6 Flash a Gemini 3.5 Flash-Lite. Oznámil aj Gemini 3.5 Flash Cyber, no ten zatiaľ nie je verejný model do Gemini API. Má byť iba v obmedzenom pilote CodeMender pre vlády a dôveryhodných partnerov.

Pre firmy je podstatná prvá dvojica. Nie sú to dva modely, z ktorých musí jeden vyhrať. Sú to dve vrstvy agentného routeru: 3.6 Flash pre zložitejšie rozhodovanie a prácu s viacerými nástrojmi, Flash-Lite pre lacné, rýchle a opakované kroky vo veľkom objeme.

Krátka mapa: kam ktorý model patrí

Model API cena za 1M tokenov Najlepšia rola Typický workflow
Gemini 3.6 Flash $1.50 input / $7.50 output hlavný pracovný agent e-mail + príloha + RAG + interné API, multimodálna analýza, náročnejší coding task
Gemini 3.5 Flash-Lite $0.30 input / $2.50 output lacný worker alebo subagent klasifikácia ticketov, extrakcia polí, JSON normalizácia, agentné search, hromadné spracovanie dokumentov
Gemini 3.5 Flash Cyber nezverejnené pre bežné API bezpečnostný pilot v CodeMender dnes ho neplánujte ako dostupnú komponentu

Oba verejné modely majú 1M tokenový kontext, maximálny output 64k tokenov, thinking a vstavané nástroje vrátane Computer Use. To neznamená, že treba každému ticketu poslať milión tokenov. Kontext je stále cena, latencia a plocha na chybu; router má poslať iba zdroje, ktoré konkrétny prípad potrebuje.

Gemini 3.6 Flash: keď agent musí spojiť viac krokov

Google stavia 3.6 Flash ako hlavný workhorse pre coding, knowledge work a multimodalitu. Podľa ich oznámenia má oproti 3.5 Flash spotrebovať o 17 % menej output tokenov a cena outputu klesla z predchádzajúcich 9 na 7,50 USD za milión tokenov.

Benchmarky, ktoré Google uvádza, sú najmä porovnania s predchodcom:

  • DeepSWE: 49 % vs. 37 % — agentné softvérové úlohy. Signál: lepší kandidát na opravy, migrácie a coding agentov než starší Flash, nie dôkaz, že môže bez review mergovať produkčné PR.
  • MLE-bench: 63,9 % vs. 49,7 % — úlohy machine-learning research. Signál: silnejšia viac-kroková práca s nástrojmi, nie náhrada záverečného výskumného rozhodnutia.
  • OSWorld-Verified: 83,0 % vs. 78,4 % — overené úlohy používania počítača. Signál: vhodnejší na UI automatizácie; peniaze, práva a publikovanie stále potrebujú explicitný kontrolný bod.
  • GDPval-AA v2: 1421 vs. 1349 — knowledge-work úlohy. Signál: lepší kandidát pre analýzu dokumentov, návrhy reportov a prácu nad viacerými zdrojmi.

Najlepšie nasadenie: agent prečíta e-mail a prílohu, cez RAG dohľadá firemný postup, zavolá CRM alebo ERP v read-only režime, vytvorí štruktúrovaný návrh a až validácia rozhodne, či sa môže pokračovať. 3.6 Flash nech rozhoduje o trase workflow, nie o nevratnom zápise bez pravidiel.

Gemini 3.5 Flash-Lite: keď je dôležitejšia priechodnosť než maximálna schopnosť

Flash-Lite je výrazne lacnejší a Google ho označuje za najrýchlejší model rady 3.5: podľa Artificial Analysis má dosahovať 350 output tokenov za sekundu. Rýchlosť má hodnotu tam, kde rovnakú úzku operáciu opakujete tisíckrát.

Google uvádza tieto porovnania so staršími Flash-Lite / Flash modelmi:

  • Terminal-Bench 2.1: 54 % vs. 31 % oproti 3.1 Flash-Lite. Signál: lepší subagent na obmedzené terminálové a coding úlohy, nie náhrada architekta.
  • GDM-MRCR v2: 72,2 % vs. 60,1 % — práca s dlhým kontextom. Signál: vhodný na hľadanie a triedenie nad veľkým dokumentovým súborom, ak retrieval stále zmenší vstup na relevantné časti.
  • GDPval-AA v2: 1140 vs. 642 oproti 3.1 Flash-Lite. Signál: lacnejší model zvládne viac knowledge-work krokov, no 3.6 Flash ostáva silnejšia eskalačná vrstva.
  • SWE-Bench Pro: 54,2 % vs. 49,6 % oproti Gemini 3 Flash a OSWorld-Verified: 74,0 % vs. 65,1 %. Signál: Lite nie je len klasifikátor, ale ekonomiku má v opakovaných, obmedzených úlohách.

Flash-Lite by som použil na prvý priechod supportu, extrakciu položiek z faktúr, deduplikáciu kontaktov, pevné JSON schema, content pipeline, hľadanie kandidátnych dokumentov alebo samostatných subagentov s malým rozpočtom tool callov.

Router namiesto hromadného prepnutia

Rozumná architektúra v n8n alebo Make: lacný deterministický filter najprv skontroluje typ vstupu, PII a povinné polia. Flash-Lite vytiahne a zaradí bežné prípady; JSON validator odmietne neplatný výstup. Iba nejasné prípady alebo úlohy s viacerými zdrojmi prejdú na 3.6 Flash. Akcie s finančným, právnym alebo bezpečnostným dopadom idú na človeka.

Ako čítať benchmarky bez hype

Čísla vyššie sú výsledky zverejnené Googlem, nie nezávislý rebríček všetkých modelov. Každý benchmark meria iný diel práce: DeepSWE a Terminal-Bench sú bližšie softvérovým agentom, OSWorld ovládaniu UI, GDM-MRCR dlhému kontextu a GDPval knowledge work. Vysoké skóre nehovorí, ako model zvládne vaše faktúry, interné skratky alebo neporiadok v CRM.

Pred migráciou si pripravte 50–100 anonymizovaných reálnych prípadov. Na rovnakej sade zmerajte presnosť, validný JSON, tool cally, latenciu, cenu za schválený výsledok a opravy človekom. Prepnite po jednom workflow, nie celý stack naraz.

Zdroje: Google: Gemini 3.6 Flash, 3.5 Flash-Lite a 3.5 Flash CyberGoogle AI for Developers: model ID, ceny, schopnosti a migračné poznámky.