19. 5. 2026

Gemini 3.5 Flash: rýchly pracovný model, ktorý si zaslúži vlastný článok

Realistický cover pro článek o Gemini 3.5 Flash, API benchmarcích a modelových srovnáních

Google 19. mája 2026 na I/O vydal Gemini 3.5 Flash. A podľa mňa si zaslúži samostatný článok, nie len odsek vo všeobecnom prehľade noviniek z Google I/O.

Dôvod je jednoduchý: 3.5 Flash nie je len ďalší model do tabuľky. Je to typ modelu, ktorý môže zmeniť architektúru bežných AI automatizácií: dosť inteligentný, veľmi rýchly a použiteľný ako pracovná vrstva pre opakované API kroky, agentov, triedenie, extrakcie a multimodálne vstupy.

Zároveň to nie je model, ktorému by som bez merania odovzdal všetko. Nezávislé benchmarky ukazujú silný agentný výkon a veľmi dobrú rýchlosť, ale aj vyššiu cenu oproti predchádzajúcemu Flashu a oblasti, kde stále dáva zmysel eskalovať na Pro model, špecializovaný model alebo človeka.

Kde dáva Gemini 3.5 Flash zmysel v AI architektúre

Čo Google reálne vydal

Gemini 3.5 Flash je prvý model novej rady Gemini 3.5. Google ho stavia hlavne okolo agentov, kódovania, rýchleho generovania UI, práce s nástrojmi a multimodálnych vstupov.

Dôležité parametre pre prax:

  • dostupný v Gemini API cez Google AI Studio a Android Studio,
  • dostupný aj v Google Antigravity, Gemini Enterprise a Gemini app,
  • kontextové okno 1 milión tokenov,
  • vstup: text, obraz, video a reč,
  • výstup: text,
  • cena v platenej API vrstve: 1,50 USD za 1M input tokenov a 9 USD za 1M output tokenov vrátane thinking tokenov,
  • cached input: 0,15 USD za 1M tokenov plus storage.

Pri chatovom modeli človek často rieši hlavne kvalitu odpovede. Pri API modeli navyše riešite cenu za tisíce volaní, latenciu, validáciu výstupu, fallbacky, prácu s dlhým kontextom a to, či model zvládne držať workflow v nástrojoch.

Čo hovoria nezávislé benchmarky

Google má vlastné benchmarky a demo scenáre. Tie sú užitočné na pochopenie smeru. Na porovnanie s ostatnými modelmi som však viac vychádzal z nezávislých zdrojov.

Artificial Analysis nameral Gemini 3.5 Flash Intelligence Index 55, teda o 9 bodov viac než pri Gemini 3 Flash. Podľa ich analýzy sa tým dostáva pred Grok 4.3 high a Claude Sonnet 4.6 max. Zároveň uvádza výstupnú rýchlosť okolo 284 tokenov za sekundu. V API svete je rýchlosť zásadná, pretože rozhoduje, či sa AI dá použiť v interaktívnom nástroji, internom agentovi alebo workflow, ktoré má dobehnúť rýchlo.

Silno vychádzajú agentné testy. Artificial Analysis uvádza GDPval-AA 1656 Elo, tesne za GPT-5.4 xhigh na 1674 Elo. BenchLM dáva Gemini 3.5 Flash v agentnej kategórii skóre 97,3 a radí ho na 3. miesto zo 116 modelov. To je podľa mňa najdôležitejší signál celej novinky.

Nezávislé benchmarkové signály pre Gemini 3.5 Flash

BenchLM však ukazuje aj triezvejší obraz. Celkovo má Gemini 3.5 Flash skóre 87 a je na 11. mieste zo 116 modelov, ale v coding kategórii je 23. a v instruction following 37. To neznamená, že nevie kódovať. Znamená to, že nie je automaticky najlepšia voľba pre každý refaktor, architektonické rozhodnutie alebo dlhé zadanie s jemnými inštrukciami.

Arena signál je tiež slušný: BenchLM uvádza text Elo okolo 1480 pri 5907 hlasoch. To je dobrý všeobecný signál kvality odpovedí, ale nebral by som ho ako náhradu za API testy nad konkrétnym workflow.

V čom je naozaj silný

Prvá silná oblasť je rýchlosť. Ak staviate interný nástroj, ktorý má odpovedať v priebehu pár sekúnd, rýchly model často vyhrá nad o trochu inteligentnejším modelom, ktorý je pomalší a drahší. Pri triage e-mailov, support ticketov, CRM enrichmente alebo predspracovaní dokumentov často nepotrebujete absolútne najlepší reasoning. Potrebujete spoľahlivý prvý priechod.

Druhá silná oblasť sú agentné kroky. Google ho stavia okolo Antigravity, subagentov, práce s nástrojmi a dlhých workflow. Nezávislé čísla z Artificial Analysis a BenchLM tomu dávajú oporu: model vyzerá ako dobrý motor pre opakované plánovanie, volanie nástrojov a iterácie.

Tretia oblasť je multimodalita. Google uvádza text, obraz, video a reč na vstupe. Artificial Analysis ukazuje silné multimodálne výsledky vrátane MMMU-Pro okolo 84 %. V praxi to môže dávať zmysel pre faktúry, screenshoty, dokumenty, jednoduché video analýzy alebo interné workflow, kde vstup nie je len čistý text.

Kde by som bol opatrný

Prvý háčik je cena. Gemini 3.5 Flash je stále lacnejší než veľké frontier modely, ale oproti Gemini 3 Flash je drahší. Artificial Analysis uvádza, že ich Intelligence Index run stál 1552 USD, čo je 5,5× viac než pri Gemini 3 Flash. Pri veľkých objemoch sa zlá architektúra rýchlo predraží.

Druhý háčik je faktická presnosť. Artificial Analysis uvádza pri AA-Omniscience výrazne nižší hallucination rate než pri Gemini 3 Flash, ale stále okolo 60,7 %. To je dobrý posun, nie povolenie vypnúť overovanie. Ak má byť výstup fakticky presný, patria k tomu citácie, retrieval, kontrola zdrojov alebo následná validácia.

Tretí háčik je kódovanie a instruction following. Pre menšie UI časti, migrácie, návrhy zmien alebo agentné iterácie môže byť výborný. Pre finálnu architektúru, bezpečnostné zmeny, zložité refaktory a code review by som stále držal silnejší model alebo človeka v procese.

Ako by som ho nasadil v praxi

Nie ako jeden model na všetko. Skôr ako prvú pracovnú vrstvu:

  • Gemini 3.5 Flash spracuje vstup: e-mail, dokument, ticket, screenshot alebo text.
  • Vráti štruktúrovaný JSON: typ úlohy, prioritu, extrahované dáta, riziká a odporúčaný ďalší krok.
  • Automatická validácia skontroluje schému, prázdne polia, limity a pravidlá.
  • Jednoduché prípady sa vyriešia rovno.
  • Sporné alebo drahé prípady sa pošlú na silnejší model alebo človeka.

Konkrétne príklady:

  • triedenie support ticketov podľa typu problému, priority a tímu,
  • extrakcia dát z faktúr, objednávok a zmluvných príloh,
  • predvyplnenie CRM z e-mailovej komunikácie,
  • rýchla sumarizácia dokumentov pred stretnutím,
  • kontrola screenshotov a jednoduchých vizuálnych vstupov,
  • generovanie návrhov odpovedí, ktoré človek schváli,
  • agentné kroky v n8n alebo Make, kde Flash pripraví plán a nástroje vykonajú akcie.

Dôležité je merať vlastný dataset. Ak máte 500 reálnych ticketov, 100 faktúr alebo 50 typických e-mailov, spravte malý eval: presnosť extrakcie, počet opráv človekom, priemerná cena na prípad, latencia a počet eskalácií.

Kedy použiť Flash a kedy nie

Gemini 3.5 Flash by som dnes zvažoval ako predvoleného kandidáta pre rýchle API vrstvy, agentné operácie, multimodálne predspracovanie a rutinné firemné automatizácie.

Nepoužil by som ho samotný pre finálne právne alebo finančné verdikty, bezpečnostné zmeny v produkčnom kóde, zložité architektonické rozhodovanie alebo workflow, kde chyba spustí nevratnú akciu. Tam patrí validácia, fallback a človek.

Ak už používate lacnejší Flash model a funguje vám, neprepínal by som všetko naslepo. 3.5 Flash je inteligentnejší a rýchlejší, ale aj drahší. Najlepší prechod je vybrať úlohy, kde starší Flash chyboval alebo kde potrebujete lepšie agentné schopnosti, a tam merať rozdiel.

Záver

Gemini 3.5 Flash je podľa mňa jedna z najdôležitejších noviniek z Google I/O 2026. Nie preto, že by mal byť „najlepší model na svete,“ ale preto, že dobre zapadá do toho, kam sa AI aplikácie posúvajú: od jedného chatu k vrstve rýchlych pracovných modelov, validácií, nástrojov a eskalácií.

Ak staviate automatizácie, stojí za test. Hlavne pre agentné workflow, rýchle API odpovede a multimodálne vstupy. Len by som ho nebral ako náhradu za meranie. Benchmarky ukazujú veľmi silný model, ale tiež jasne hovoria: v nákladoch, ťažkom kódovaní, instruction following a faktickej presnosti stále záleží na architektúre okolo modelu.


Zdroje: Google: Gemini 3.5 — frontier intelligence with action, Google AI for Developers: Gemini API pricing, Google DeepMind: Gemini 3.5 Flash model card, Artificial Analysis: Gemini 3.5 Flash analysis, Artificial Analysis: Gemini 3.5 Flash model page, BenchLM: Gemini 3.5 Flash benchmarks, Arena text leaderboard.