22. 7. 2026

Gemini 3.6 Flash a 3.5 Flash-Lite: dva modely pro agentní router, ne jeden vítěz

Realistic AI engineer routing business documents between fast and capable production models

Google 21. července vydal dva běžně dostupné produkční modely: Gemini 3.6 Flash a Gemini 3.5 Flash-Lite. Vedle nich oznámil Gemini 3.5 Flash Cyber, ale ten zatím není veřejný model do Gemini API. Má být dostupný jen v omezeném pilotu CodeMender pro vlády a důvěryhodné partnery.

Pro firmy je podstatná první dvojice. Nejsou to dva modely, mezi nimiž je potřeba vybrat jednoho vítěze. Jsou to dvě odlišné vrstvy pro agentní router: 3.6 Flash pro složitější rozhodování a práci s více nástroji, Flash-Lite pro levné, rychlé a opakované kroky ve velkém objemu.

Krátká mapa: kam který model patří

Model API cena za 1M tokenů Nejlepší role Typické workflow
Gemini 3.6 Flash $1.50 input / $7.50 output hlavní pracovní agent e-mail + příloha + RAG + interní API, multimodální analýza, složitější coding task
Gemini 3.5 Flash-Lite $0.30 input / $2.50 output levný worker nebo subagent klasifikace ticketů, extrakce polí, JSON normalizace, agentní search, hromadné zpracování dokumentů
Gemini 3.5 Flash Cyber nepublikováno pro běžné API bezpečnostní pilot v CodeMender dnes neplánovat jako dostupnou komponentu

Oba veřejné modely mají 1M tokenový kontext, maximální výstup 64k tokenů, thinking a vestavěné nástroje včetně Computer Use. To ale neznamená, že je vhodné posílat každému ticketu milion tokenů kontextu. Kontext je stále cena, latence a plocha pro chybu. Router má vždy poslat jen zdroje, které konkrétní případ potřebuje.

Gemini 3.6 Flash: když agent musí spojit víc kroků

Google staví 3.6 Flash jako hlavní „workhorse“ pro coding, knowledge work a multimodalitu. Podle jejich oznámení má proti 3.5 Flash spotřebovat o 17 % méně output tokenů; cena outputu klesla z dřívějších 9 na 7,50 USD za milion tokenů.

Benchmarky, které Google uvádí, jsou především porovnáním s předchůdcem:

  • DeepSWE: 49 % vs. 37 % — test agentního řešení reálnějších softwarových úloh. Signál: 3.6 Flash dává větší smysl pro opravy, migrace a coding agenty než starší Flash; není to důkaz, že může bez review mergovat produkční PR.
  • MLE-bench: 63,9 % vs. 49,7 % — úlohy kolem machine-learning research. Signál: lepší práce s více kroky, hypotézami a nástroji, ne důvod svěřit mu finální výzkumné závěry.
  • OSWorld-Verified: 83,0 % vs. 78,4 % — ověřené úlohy používání počítače. Signál: vhodnější pro UI automatizace, ale každá akce s penězi, právy nebo publikací pořád potřebuje explicitní kontrolní bod.
  • GDPval-AA v2: 1421 vs. 1349 — knowledge-work úlohy. Signál: lepší kandidát pro analýzu dokumentů, report drafty a práci nad více zdroji.

Nejlepší nasazení: agent přečte e-mail a přílohu, přes RAG dohledá firemní postup, zavolá CRM nebo ERP v read-only režimu, vytvoří návrh strukturovaného výsledku a teprve validace rozhodne, zda se může pokračovat. 3.6 Flash bych nechal rozhodovat o trase workflow, ne o nevratném zápisu bez pravidel.

Gemini 3.5 Flash-Lite: když je důležitější průchodnost než maximální schopnost

Flash-Lite je výrazně levnější a Google jej označuje za nejrychlejší model v řadě 3.5: podle Artificial Analysis má dosahovat 350 output tokenů za sekundu. Vysoká rychlost sama o sobě nestačí; její hodnota se projeví tam, kde stejnou úzkou operaci opakujete tisíckrát.

Google uvádí tato srovnání se staršími Flash-Lite / Flash modely:

  • Terminal-Bench 2.1: 54 % vs. 31 % oproti 3.1 Flash-Lite. Signál: lepší subagent pro omezené terminálové a coding úlohy, ne náhrada architekta.
  • GDM-MRCR v2: 72,2 % vs. 60,1 % — test práce s dlouhým kontextem. Signál: vhodný pro hledání a třídění nad velkým souborem dokumentů, pokud retrieval zmenší vstup na relevantní části.
  • GDPval-AA v2: 1140 vs. 642 oproti 3.1 Flash-Lite. Signál: levnější model už zvládne více knowledge-work kroků, ale 3.6 Flash zůstává silnější vrstva pro nejasné případy.
  • SWE-Bench Pro: 54,2 % vs. 49,6 % oproti Gemini 3 Flash a OSWorld-Verified: 74,0 % vs. 65,1 %. Signál: Lite není jen klasifikátor, ale jeho skutečná ekonomika je v opakovaných, omezených úkolech.

Flash-Lite bych použil na první průchod supportu, extrakci položek z faktur, deduplikaci kontaktů, přepis do pevného JSON schema, content pipeline, vyhledání kandidátních dokumentů nebo samostatné subagenty s malým rozpočtem tool callů.

Router místo hromadného přepnutí

Rozumná architektura v n8n nebo Make může být jednoduchá:

1. Levný deterministický filtr zkontroluje typ vstupu, PII a povinná pole. 2. Flash-Lite vytěží a zařadí běžné případy; JSON validator odmítne neplatný výstup. 3. Jen nejasné případy nebo úlohy s více zdroji přejdou na 3.6 Flash. 4. Akce s finančním, právním nebo bezpečnostním dopadem jdou na člověka – model může připravit podklady, ne rozhodnout.

Tím nesnižujete jen cenu. Získáte čitelnější audit: proč se případ eskaloval, který model byl použit, jaká verze promptu, kolik stál a zda výsledek prošel validací.

Jak číst benchmarky bez hype

Čísla výše jsou výsledky zveřejněné Googlem; nejsou nezávislým žebříčkem všech modelů. Navíc každý benchmark měří jiný kus práce: DeepSWE a Terminal-Bench jsou blíž k softwarovým agentům, OSWorld k ovládání UI, GDM-MRCR k dlouhému kontextu a GDPval k knowledge work. Ani vysoké skóre neříká, jak model zvládne vaše faktury, interní zkratky nebo nepořádek v CRM.

Proto si před migrací připravte 50–100 anonymizovaných reálných případů. Na stejné sadě změřte přesnost, validní JSON, počet tool callů, latenci, cenu za schválený výsledek a počet oprav člověkem. Pak přepínejte po jednom workflow, ne celý stack najednou.

Zdroje: Google: představení Gemini 3.6 Flash, 3.5 Flash-Lite a 3.5 Flash CyberGoogle AI for Developers: model ID, ceny, schopnosti a migrační poznámky.