Gemini 3.6 Flash a 3.5 Flash-Lite: dva modely pre agentný router, nie jeden víťaz

Google 21. júla vydal dva všeobecne dostupné produkčné modely: Gemini 3.6 Flash a Gemini 3.5 Flash-Lite. Oznámil aj Gemini 3.5 Flash Cyber, no ten zatiaľ nie je verejný model do Gemini API. Má byť iba v obmedzenom pilote CodeMender pre vlády a dôveryhodných partnerov.
Pre firmy je podstatná prvá dvojica. Nie sú to dva modely, z ktorých musí jeden vyhrať. Sú to dve vrstvy agentného routeru: 3.6 Flash pre zložitejšie rozhodovanie a prácu s viacerými nástrojmi, Flash-Lite pre lacné, rýchle a opakované kroky vo veľkom objeme.
Krátka mapa: kam ktorý model patrí
| Model | API cena za 1M tokenov | Najlepšia rola | Typický workflow |
|---|---|---|---|
| Gemini 3.6 Flash | $1.50 input / $7.50 output | hlavný pracovný agent | e-mail + príloha + RAG + interné API, multimodálna analýza, náročnejší coding task |
| Gemini 3.5 Flash-Lite | $0.30 input / $2.50 output | lacný worker alebo subagent | klasifikácia ticketov, extrakcia polí, JSON normalizácia, agentné search, hromadné spracovanie dokumentov |
| Gemini 3.5 Flash Cyber | nezverejnené pre bežné API | bezpečnostný pilot v CodeMender | dnes ho neplánujte ako dostupnú komponentu |
Oba verejné modely majú 1M tokenový kontext, maximálny output 64k tokenov, thinking a vstavané nástroje vrátane Computer Use. To neznamená, že treba každému ticketu poslať milión tokenov. Kontext je stále cena, latencia a plocha na chybu; router má poslať iba zdroje, ktoré konkrétny prípad potrebuje.
Gemini 3.6 Flash: keď agent musí spojiť viac krokov
Google stavia 3.6 Flash ako hlavný workhorse pre coding, knowledge work a multimodalitu. Podľa ich oznámenia má oproti 3.5 Flash spotrebovať o 17 % menej output tokenov a cena outputu klesla z predchádzajúcich 9 na 7,50 USD za milión tokenov.
Benchmarky, ktoré Google uvádza, sú najmä porovnania s predchodcom:
- DeepSWE: 49 % vs. 37 % — agentné softvérové úlohy. Signál: lepší kandidát na opravy, migrácie a coding agentov než starší Flash, nie dôkaz, že môže bez review mergovať produkčné PR.
- MLE-bench: 63,9 % vs. 49,7 % — úlohy machine-learning research. Signál: silnejšia viac-kroková práca s nástrojmi, nie náhrada záverečného výskumného rozhodnutia.
- OSWorld-Verified: 83,0 % vs. 78,4 % — overené úlohy používania počítača. Signál: vhodnejší na UI automatizácie; peniaze, práva a publikovanie stále potrebujú explicitný kontrolný bod.
- GDPval-AA v2: 1421 vs. 1349 — knowledge-work úlohy. Signál: lepší kandidát pre analýzu dokumentov, návrhy reportov a prácu nad viacerými zdrojmi.
Najlepšie nasadenie: agent prečíta e-mail a prílohu, cez RAG dohľadá firemný postup, zavolá CRM alebo ERP v read-only režime, vytvorí štruktúrovaný návrh a až validácia rozhodne, či sa môže pokračovať. 3.6 Flash nech rozhoduje o trase workflow, nie o nevratnom zápise bez pravidiel.
Gemini 3.5 Flash-Lite: keď je dôležitejšia priechodnosť než maximálna schopnosť
Flash-Lite je výrazne lacnejší a Google ho označuje za najrýchlejší model rady 3.5: podľa Artificial Analysis má dosahovať 350 output tokenov za sekundu. Rýchlosť má hodnotu tam, kde rovnakú úzku operáciu opakujete tisíckrát.
Google uvádza tieto porovnania so staršími Flash-Lite / Flash modelmi:
- Terminal-Bench 2.1: 54 % vs. 31 % oproti 3.1 Flash-Lite. Signál: lepší subagent na obmedzené terminálové a coding úlohy, nie náhrada architekta.
- GDM-MRCR v2: 72,2 % vs. 60,1 % — práca s dlhým kontextom. Signál: vhodný na hľadanie a triedenie nad veľkým dokumentovým súborom, ak retrieval stále zmenší vstup na relevantné časti.
- GDPval-AA v2: 1140 vs. 642 oproti 3.1 Flash-Lite. Signál: lacnejší model zvládne viac knowledge-work krokov, no 3.6 Flash ostáva silnejšia eskalačná vrstva.
- SWE-Bench Pro: 54,2 % vs. 49,6 % oproti Gemini 3 Flash a OSWorld-Verified: 74,0 % vs. 65,1 %. Signál: Lite nie je len klasifikátor, ale ekonomiku má v opakovaných, obmedzených úlohách.
Flash-Lite by som použil na prvý priechod supportu, extrakciu položiek z faktúr, deduplikáciu kontaktov, pevné JSON schema, content pipeline, hľadanie kandidátnych dokumentov alebo samostatných subagentov s malým rozpočtom tool callov.
Router namiesto hromadného prepnutia
Rozumná architektúra v n8n alebo Make: lacný deterministický filter najprv skontroluje typ vstupu, PII a povinné polia. Flash-Lite vytiahne a zaradí bežné prípady; JSON validator odmietne neplatný výstup. Iba nejasné prípady alebo úlohy s viacerými zdrojmi prejdú na 3.6 Flash. Akcie s finančným, právnym alebo bezpečnostným dopadom idú na človeka.
Ako čítať benchmarky bez hype
Čísla vyššie sú výsledky zverejnené Googlem, nie nezávislý rebríček všetkých modelov. Každý benchmark meria iný diel práce: DeepSWE a Terminal-Bench sú bližšie softvérovým agentom, OSWorld ovládaniu UI, GDM-MRCR dlhému kontextu a GDPval knowledge work. Vysoké skóre nehovorí, ako model zvládne vaše faktúry, interné skratky alebo neporiadok v CRM.
Pred migráciou si pripravte 50–100 anonymizovaných reálnych prípadov. Na rovnakej sade zmerajte presnosť, validný JSON, tool cally, latenciu, cenu za schválený výsledok a opravy človekom. Prepnite po jednom workflow, nie celý stack naraz.
Zdroje: Google: Gemini 3.6 Flash, 3.5 Flash-Lite a 3.5 Flash Cyber a Google AI for Developers: model ID, ceny, schopnosti a migračné poznámky.