Haiku / Sonnet / Opus už není nejlepší API mapa

Když se bavíme o Claude, hodně lidí pořád přemýšlí v původní trojici: Haiku, Sonnet, Opus. Levný model, pracovní model, nejsilnější model. V předplatném a v editoru je to praktická mentální mapa.
V API už ale tahle mapa nestačí. Jakmile model zapojíte do n8n, Make, interního agenta nebo produkční automatizace, začnou rozhodovat jiné věci: cena za milion tokenů, rychlost, délka výstupů, caching, bezpečnost dat a hlavně počet opakovaných volání.
Proč už nestačí myslet jen v Claude řadě
V API se neptám jen „který Claude model vybrat.“ Ptám se, jaký model je nejlepší pro levné opakované volání, jaký má být hlavní worker, jaký má dostat jen složité případy a co se stane s rozpočtem, když workflow poběží 500× denně.
V tomhle pohledu už Claude nevypadá jako automatický default. Haiku je dražší než levné modely OpenAI a Gemini. Sonnet je výborný v editoru, ale jako API worker bývá dražší. Opus je silný specialista, ale pro běžné workflow ekonomicky nedává smysl.
Levná vrstva: šetří se na tisících volání
Tohle jsou kroky, které běží pořád: klasifikace e-mailu, detekce jazyka, kontrola prázdného vstupu, jednoduchá extrakce, předčištění dat, rozhodnutí jestli workflow vůbec pokračuje.
Claude Haiku není špatný model. Jen už není automatická API odpověď. Pokud řeším objem, často začnu u levnějších modelů OpenAI nebo Gemini a teprve problematické případy pošlu výš.
Hlavní worker: Sonnet je dobrý kolega, ale drahý default
Sonnet mám rád pro práci v editoru. V Claude Code je to často výborný pracovní nástroj. Ale pro n8n, Make nebo interní API workflow bych jako default častěji testoval Gemini Flash nebo GPT mini.
Typické úlohy pro tuhle vrstvu: extrakce údajů z faktur, sumarizace zákaznické komunikace, odpovědi interního helpdesku, zápis do CRM, převod PDF do strukturovaného JSONu nebo triage ticketů.
Nová vrstva: malé guardrail a PII modely
Update z 16. května 2026: do téhle mapy bych dnes přidal ještě jednu vrstvu před hlavní LLM. Fastino Labs 14. května 2026 vydalo GLiGuard a GLiNER2-PII, dva malé open-source modely o 300 milionech parametrů. Podle oznámení běží pod 100 ms a cílí na bezpečnostní klasifikaci, jailbreak detection, refusal detection a detekci osobních údajů.
To je přesně typ komponenty, která do produkční automatizace patří před drahý model:
- levný filtr před hlavním LLM,
- PII redakce před odesláním dat ven,
- kontrola jailbreaku u veřejných formulářů,
- separátní auditní krok v agentním workflow,
- rychlá klasifikace, jestli má úloha vůbec pokračovat.
Tohle není konkurence pro Opus nebo GPT-5.5. Je to hygienická vrstva, která chrání rozpočet i data.
Top vrstva: Opus není default, ale specialista
Opus má pořád místo: složité technické rozbory, těžké refaktoringy, dlouhé právní nebo produktové texty, kritická revize a úkoly, kde jedno špatné rozhodnutí stojí víc než tokeny.
Ale pokud ho pošlete na každou extrakci, každé mezikolo agenta a každý JSON výstup, nevyužíváte silný model. Stavíte drahé workflow.
Praktická architektura pro n8n a API
Místo jednoho modelu na všechno bych stavěl router:
1. Malý filtr zkontroluje typ vstupu, riziko a PII. 2. Levný model rozhodne, o jaký typ úlohy jde. 3. Gemini Flash nebo GPT mini udělá hlavní extrakci a strukturovaný výstup. 4. Gemini Pro, GPT-5.5 nebo Claude Opus dostane jen složité případy. 5. Člověk schvaluje citlivé nebo drahé výstupy.
Tohle je rozdíl mezi demo automatizací a produkčním workflow. Demo často funguje s jedním silným modelem. Produkce potřebuje limity, routing, audit a kontrolu nákladů.
Celkové srovnání
Závěr
Claude je pořád výborný pracovní nástroj. Jen bych ho v API nepoužíval jako výchozí odpověď na všechno.
Původní mapa Haiku / Sonnet / Opus je moc úzká. Pro API dává větší smysl porovnávat modely po třídách: guardrail/PII filtr, levná vrstva, hlavní worker a top specialista.
A právě v tomhle vrstvení vzniká reálná úspora. Ne tím, že najdete jeden zázračný model. Ale tím, že silný model používáte jen tam, kde jeho síla opravdu něco řeší.
Zdroje: OpenRouter: Anthropic / Google / OpenAI models, Google Gemini API pricing, Google Vertex AI data governance, Anthropic Privacy Center, Fastino Labs: GLiGuard a GLiNER2-PII, Gartner: inference costs by 2030, Tomáš AI: Nová AI inovace zlevní AI 1000x, AI ta Krajta #50.