19. 5. 2026

Gemini 3.5 Flash: rychlý pracovní model, který stojí za vlastní článek

Realistický cover pro článek o Gemini 3.5 Flash, API benchmarcích a modelových srovnáních

Google 19. května 2026 na I/O vydal Gemini 3.5 Flash. A podle mě si zaslouží samostatný článek, ne jen odstavec v obecném přehledu novinek z Google I/O.

Důvod je jednoduchý: 3.5 Flash není jen další model do tabulky. Je to typ modelu, který může změnit architekturu běžných AI automatizací. Ne tím, že bude vždy nejlepší, ale tím, že může být dost chytrý, hodně rychlý a použitelný jako pracovní vrstva pro opakované API kroky, agenty, třídění, extrakce a multimodální vstupy.

Zároveň to není model, kterému bych bez měření předal všechno. Nezávislé benchmarky ukazují silný agentní výkon a velmi dobrou rychlost, ale také vyšší cenu proti předchozímu Flashi a oblasti, kde pořád dává smysl eskalovat na Pro model, jiný specializovaný model nebo člověka.

Kde dává Gemini 3.5 Flash smysl v AI architektuře

Co Google reálně vydal

Gemini 3.5 Flash je první model nové řady Gemini 3.5. Google ho staví hlavně kolem agentů, kódování, rychlého UI generování, práce s nástroji a multimodálních vstupů.

Důležité parametry pro praxi:

  • dostupný v Gemini API přes Google AI Studio a Android Studio,
  • dostupný také v Google Antigravity, Gemini Enterprise a Gemini app,
  • kontextové okno 1 milion tokenů,
  • vstup: text, obraz, video a řeč,
  • výstup: text,
  • cena v placené API vrstvě: 1,50 USD za 1M input tokenů a 9 USD za 1M output tokenů včetně thinking tokenů,
  • cached input: 0,15 USD za 1M tokenů plus storage.

U chatového modelu člověk často řeší hlavně kvalitu odpovědi. U API modelu navíc řeší cenu na tisíce volání, latenci, validaci výstupu, fallbacky, práci s dlouhým kontextem a to, jestli model zvládne držet workflow v nástrojích.

Co říkají nezávislé benchmarky

Google má vlastní benchmarky a demo scénáře. Ty jsou užitečné pro pochopení směru. Ale pro srovnání s ostatními modely jsem víc vycházel z nezávislých zdrojů.

Artificial Analysis naměřil Gemini 3.5 Flash Intelligence Index 55, tedy o 9 bodů víc než u Gemini 3 Flash. Podle jejich analýzy se tím dostává před Grok 4.3 high a Claude Sonnet 4.6 max. Zároveň uvádí výstupní rychlost kolem 284 tokenů za sekundu. To je v API světě zásadní, protože rychlost rozhoduje, jestli se AI dá použít v interaktivním nástroji, interním agentovi nebo workflow, které má doběhnout v minutách.

Silně vychází agentní testy. Artificial Analysis uvádí GDPval-AA 1656 Elo, těsně za GPT-5.4 xhigh na 1674 Elo. BenchLM dává Gemini 3.5 Flash v agentní kategorii skóre 97,3 a řadí ho na 3. místo ze 116 modelů. To je podle mě nejdůležitější signál celé novinky.

Nezávislé benchmarkové signály pro Gemini 3.5 Flash

BenchLM ale ukazuje i střízlivější obrázek. Celkově má Gemini 3.5 Flash skóre 87 a je na 11. místě ze 116 modelů, ale v coding kategorii je 23. a v instruction following 37. To neznamená, že neumí kódovat. Znamená to, že není automaticky nejlepší volba pro každý refaktor, architektonické rozhodnutí nebo dlouhé zadání s jemnými instrukcemi.

Arena signál je slušný: BenchLM uvádí text Elo kolem 1480 při 5907 hlasech. To je dobrý obecný signál kvality odpovědí, ale nebral bych ho jako náhradu za API testy nad konkrétním workflow.

V čem je opravdu silný

První silná oblast je rychlost. Pokud stavíte interní nástroj, který má odpovědět během pár sekund, rychlý model často vyhraje nad o trochu chytřejším modelem, který je pomalejší a dražší. U triage e-mailů, support ticketů, CRM enrichmentu nebo předzpracování dokumentů často nepotřebujete absolutně nejlepší reasoning. Potřebujete spolehlivý první průchod.

Druhá silná oblast jsou agentní kroky. Google ho staví kolem Antigravity, subagentů, práce s nástroji a dlouhých workflow. Nezávislá čísla z Artificial Analysis a BenchLM tomu dávají oporu: model vypadá jako dobrý motor pro opakované plánování, volání nástrojů a iterace.

Třetí oblast je multimodalita. Google uvádí text, obraz, video a řeč na vstupu. Artificial Analysis ukazuje silné multimodální výsledky včetně MMMU-Pro kolem 84 %. V praxi to může dávat smysl pro faktury, screenshoty, dokumenty, jednoduché video analýzy nebo interní workflow, kde vstup není jen čistý text.

Kde bych byl opatrný

První háček je cena. Gemini 3.5 Flash je pořád levnější než velké frontier modely, ale proti Gemini 3 Flash je dražší. Artificial Analysis uvádí, že jejich Intelligence Index run stál 1552 USD, což je 5,5× víc než u Gemini 3 Flash. U velkých objemů se špatná architektura rychle prodraží.

Druhý háček je faktická přesnost. Artificial Analysis uvádí u AA-Omniscience výrazně nižší hallucination rate než u Gemini 3 Flash, ale stále kolem 60,7 %. To je dobrý posun, ne povolenka vypnout ověřování. Pokud má být výstup fakticky přesný, patří k tomu citace, retrieval, kontrola zdrojů nebo následná validace.

Třetí háček je kódování a instruction following. Pro menší UI části, migrace, návrhy změn nebo agentní iterace může být výborný. Pro finální architekturu, bezpečnostní změny, složité refaktory a code review bych pořád držel silnější model nebo člověka v procesu.

Jak bych ho nasadil v praxi

Ne jako jeden model na všechno. Spíš jako první pracovní vrstvu:

  • Gemini 3.5 Flash zpracuje vstup: e-mail, dokument, ticket, screenshot nebo text.
  • Vrátí strukturovaný JSON: typ úkolu, prioritu, extrahovaná data, rizika a doporučený další krok.
  • Automatická validace zkontroluje schéma, prázdná pole, limity a pravidla.
  • Jednoduché případy se vyřeší rovnou.
  • Sporné nebo drahé případy se pošlou na silnější model nebo člověka.

Konkrétní příklady:

  • třídění support ticketů podle typu problému, priority a týmu,
  • extrakce dat z faktur, objednávek a smluvních příloh,
  • předvyplnění CRM z e-mailové komunikace,
  • rychlá sumarizace dokumentů před schůzkou,
  • kontrola screenshotů a jednoduchých vizuálních vstupů,
  • generování návrhů odpovědí, které člověk schválí,
  • agentní kroky v n8n nebo Make, kde Flash připraví plán a nástroje provedou akce.

Důležité je měřit vlastní dataset. Pokud máte 500 reálných ticketů, 100 faktur nebo 50 typických e-mailů, udělejte malý eval: přesnost extrakce, počet oprav člověkem, průměrná cena na případ, latence a počet eskalací.

Kdy použít Flash, kdy ne

Gemini 3.5 Flash bych dnes zvažoval jako výchozí model pro rychlé API vrstvy, agentní operace, multimodální předzpracování a rutinní firemní automatizace.

Nepoužil bych ho samotný pro finální právní nebo finanční verdikty, bezpečnostní změny v produkčním kódu, složité architektonické rozhodování nebo workflow, kde chyba spustí nevratnou akci. Tam patří validace, fallback a člověk.

Pokud už používáte levnější Flash model a funguje vám, nepřepínal bych všechno naslepo. 3.5 Flash je chytřejší a rychlejší, ale taky dražší. Nejlepší přechod je vybrat úkoly, kde starší Flash chyboval nebo kde potřebujete lepší agentní schopnosti, a tam měřit rozdíl.

Závěr

Gemini 3.5 Flash je podle mě jedna z nejdůležitějších novinek z Google I/O 2026. Ne proto, že by měl být „nejlepší model na světě.“ Ale proto, že dobře zapadá do toho, kam se AI aplikace posouvají: od jednoho chatu k vrstvě rychlých pracovních modelů, validací, nástrojů a eskalací.

Pokud stavíte automatizace, stojí za test. Hlavně pro agentní workflow, rychlé API odpovědi a multimodální vstupy. Jen bych ho nebral jako náhradu za měření. Benchmarky ukazují velmi silný model, ale taky jasně říkají: v nákladech, těžkém kódování, instruction following a faktické přesnosti pořád záleží na architektuře kolem modelu.


Zdroje: Google: Gemini 3.5 – frontier intelligence with action, Google AI for Developers: Gemini API pricing, Google DeepMind: Gemini 3.5 Flash model card, Artificial Analysis: Gemini 3.5 Flash analysis, Artificial Analysis: Gemini 3.5 Flash model page, BenchLM: Gemini 3.5 Flash benchmarks, Arena text leaderboard.