Kimi K3: open-source Fable? Model pro dlouhé AI agenty, který stojí za test

Kimi K3 je přesně ten typ novinky, u které je snadné sklouznout k tabulce benchmarků. Čínský model dohání nebo místy poráží západní modely, trhy reagují, sociální sítě řeší, jestli je to další DeepSeek moment. To je zajímavé, ale pro firmu zavádějící AI do procesů je důležitější jiná otázka: kde by se takový model vůbec měl použít?
YouTube signál přišel 17. července 2026 hned ze dvou sledovaných kanálů. Marek Bartoš upozornil na Kimi K3 jako levnější, otevřený a velmi silný model. Zaujaloma AI ho zařadila mezi hlavní novinky vedle Claude a ChatGPT. Tvrdá fakta ale stojí hlavně na primárních zdrojích Kimi/Moonshot.
Moonshot AI v oficiálním blogu uvádí, že Kimi K3 je 2,8bilionový model postavený na Kimi Delta Attention a Attention Residuals, s nativním porozuměním obrazu a 1M tokenovým kontextem. Důležité je také opatrné čtení: Kimi říká, že plné váhy mají být vydané do 27. července 2026. V době psaní článku tedy K3 není prakticky totéž jako už hotový self-hosting model pro každou firmu.
Je to open-source Fable? Téměř jako směr, ne jako hotový verdikt
Zkratka „open-source Fable“ je užitečná pro pochopení, proč K3 budí pozornost: míří na stejnou kategorii dlouhých coding a knowledge-work agentů jako Claude Fable 5 a GPT‑5.6 Sol, ale Moonshot plánuje zveřejnit plné váhy. Není ale přesné tvrdit, že už dnes jde o otevřenou náhradu Fable. Kimi samo uvádí, že celkově za Fable 5 a Sol stále zaostává, a v době aktualizace jsou váhy stále deklarované jako plánované.
Co skutečně říkají ověřené benchmarky
Srovnat lze jen čísla s jasně uvedeným nastavením – a ani pak to není čisté „apple-to-apple“. Kimi publikovalo pro DeepSWE v1.1 skóre 67,3 % s mini-SWE-agent harness; OpenAI ve své tabulce uvádí 72,7 % pro GPT‑5.6 Sol a 69,7 % pro Claude Fable 5. U BrowseComp Kimi uvádí 90,4 % při 1M kontextu bez context managementu; OpenAI uvádí shodných 90,4 % pro Sol a 84,3 % pro Fable 5.
Ta čísla jsou dobrý signál, ne nákupní rozhodnutí. Harness se liší: Kimi popisuje KimiCode či Claude Code, Sol je často měřen přes Codex; u některých Kimi srovnání běžely modely na H20 místo referenčních H100 a Kimi samo upozorňuje, že Fable v jednom SWE Marathon běhu použil fallback ve 35 % úloh. Proto z nich nelze poctivě vyčíst „Kimi poráží Fable“ ani „Sol je vždy lepší.“ Vypovídají ale o tom, že K3 už patří do stejného shortlistu pro pilot dlouhých agentních úloh.
Prakticky: berte K3 jako kandidáta na otevřenější specialist model, ne jako argument pro globální přepnutí stacku. Stejné zadání, stejný repozitář nebo sada dokumentů, stejný harness, limit nákladů a lidské review – teprve takový interní eval ukáže, zda vám open alternativa Fable opravdu dává smysl.
Kde K3 běží a kolik stojí
Dnes ho provozujete jako službu, ne na vlastních GPU. K3 je dostupné na Kimi.com, v Kimi Work, v terminálu a IDE přes Kimi Code a přes Kimi API pod modelem ’kimi-k3’. API je OpenAI-compatible Chat Completions a podporuje JSON Schema; pro týmovou správu Kimi nabízí Enterprise. Plné váhy Moonshot plánuje vydat do 27. července 2026. Do té doby tedy „open-source Fable“ neznamená self-hosting: pro produkci volíte vendor API a řešíte obvyklé otázky regionu, DPA, retention a přístupu ke zdrojovým datům.
| Model | Kde jej dnes provozovat | Cena API za 1M tokenů |
|---|---|---|
| Kimi K3 | Kimi API, Kimi Code, Kimi Work/Kimi.com | $3 vstup, $0,30 cached vstup, $15 výstup |
| Claude Fable 5 | Claude Platform/API, Claude.ai, Claude Code a Claude Cowork; dostupnost je také obnovována u AWS, Google Cloud a Microsoft Foundry | $10 vstup, $50 výstup |
| GPT‑5.6 Sol | OpenAI API, ChatGPT, ChatGPT Work a Codex | $5 vstup, $0,50 cached vstup, $30 výstup |
Nejužitečnější pohled je cena konkrétního běhu, ne cena jednoho tokenu. Při 1M necachovaných vstupních a 1M výstupních tokenů vychází ceníkově K3 na $18, Sol na $35 a Fable na $60. Pokud se vstup K3 skutečně trefí do cache, stejný objem je zhruba $15,30; u Sol $30,50. Fable v citovaném launch oznámení uvádí vstup a výstup, ne srovnatelnou cached-input cenu, proto ji do tabulky nedopočítávám.
To není slib, že K3 bude vždy nejlevnější. Delší reasoning, opakované tool cally, fallback, retry a slabší první výsledek cenu snadno převrátí. Pro n8n/Make nebo interního agenta bych proto měřil cenu za schválený výstup: například jednu opravenou fakturu, jeden validní CRM záznam, jeden PR připravený k review nebo jedno ověřené rozhodovací memo.
Co je na Kimi K3 podstatné
K3 není jen chatovací model. Kimi ho staví jako model pro dlouhé coding úlohy, znalostní práci a agentní workflow. V praxi to znamená tři vrstvy.
První je Kimi Code. Oficiální dokumentace uvádí model ID k3, použití v CLI a IDE, plánové limity a až 1M kontext u vyšších plánů. Pro vývojářské týmy je to důležité, protože model není prezentovaný jen jako API endpoint, ale jako pracovní prostředí pro dlouhé zásahy v repozitáři.
Druhá je Kimi Work a knowledge work. Kimi mluví o výstupech jako dokumenty, prezentace, dashboardy, výzkumné reporty a interaktivní vizualizace. To je směr, který už vidíme i u ChatGPT Work, Claude Cowork a dalších pracovních AI vrstev: model neodpovídá jen na otázku, ale skládá artefakt.
Třetí je API. Kimi API dokumentace používá OpenAI-compatible Chat Completions rozhraní, model kimi-k3, automatické context caching a strukturované výstupy přes JSON Schema. Cena podle oficiálního blogu je 0,30 USD za milion cache-hit input tokenů, 3 USD za milion cache-miss input tokenů a 15 USD za milion output tokenů. To není ultra levný filtr pro každou drobnost, ale může to být zajímavý worker pro dlouhé úlohy, kde se vyplatí cache a kde dražší model šetří lidské hodiny.
Proč z toho neudělat jen další default model
Největší chyba by byla přečíst si benchmark a přepnout všechno na Kimi K3.
Kimi samo v blogu říká, že uživatelská zkušenost stále zaostává za nejsilnějšími proprietárními modely. Dokumentace také uvádí praktická omezení: K3 má stále zapnuté reasoning, aktuálně jen s výchozím max effort v API, při vícekrokovém tool callingu je potřeba vracet kompletní assistant message včetně reasoning části, a přepínání modelů v rozehrané session může zhoršit kvalitu i cenu kvůli cache.
Tohle jsou přesně věci, které v automatizaci rozhodují. Model může být výborný v jedné dlouhé úloze a špatný default pro tisíce malých requestů. Může být silný v agentním codingu, ale zbytečně drahý pro support classification. Může mít 1M kontext, ale pokud do něj bez strategie sypete celé CRM exporty, jen vyrábíte účet za tokeny.
Kde bych ho testoval
První kandidát je dlouhý coding agent. Ne rychlá oprava překlepu, ale úloha typu: projdi větší repozitář, najdi souvislosti, navrhni změnu, napiš testy, spusť je, přečti chyby a iteruj. Tady dává smysl porovnat Kimi K3 proti tomu, co už tým používá: Claude Code, Codex, Cursor, GLM-5.2 nebo interní agentní stack.
Druhý kandidát je dokumentová extrakce s velkým kontextem. Například due diligence složka, technická dokumentace, veřejné zakázky, smlouvy nebo support knowledge base. K3 by neměl jen shrnout dokumenty. Měl by vyrobit strukturovaný výstup, citace, seznam nejistot a návrh, co má ověřit člověk.
Třetí kandidát je interní research agent. Typicky monitoring trhu, vendorů, legislativy, konkurence nebo technických release notes. Agent může zpracovat velký balík zdrojů, vyrobit dashboard a připravit rozhodovací memo. Ale pořád musí existovat pravidlo, kdy stačí AI výstup a kdy je potřeba primární zdroj nebo lidský review.
Čtvrtý kandidát je multimodální kontrola výstupů. Kimi zmiňuje vision-in-the-loop pro frontend, hry nebo CAD. To je prakticky zajímavé: agent nejen napíše kód, ale podívá se na screenshot nebo výstup a opraví ho. U webových aplikací to může snížit počet ručních kontrol, pokud se spojí s Playwrightem, screenshoty a jasnými akceptačními pravidly.
Jak bych ho zapojil do model-routeru
Do firemního routeru bych Kimi K3 nezařadil jako jediný model. Dal bych mu specializovanou roli.
Levná vrstva zůstává pro klasifikace, normalizace, extrakce jednoduchých polí, e-mailové návrhy a triage. Tam často vyhraje levnější a rychlejší model, protože počet requestů je vysoký a chyba se dá zachytit pravidly.
Střední vrstva řeší strukturované výstupy a běžnou znalostní práci: CRM enrichment, faktury, support, content pipeline, interní reporty. Tady se rozhoduje podle přesnosti, latence, ceny a schopnosti držet formát.
Kimi K3 bych testoval ve specialist vrstvě: dlouhé coding agenty, rozsáhlé dokumentové kontexty, research workflow, vizuální kontrolu a úlohy, kde agent běží desítky minut a musí si udržet plán. Tam může být dražší output token pořád levnější než hodina seniorního člověka.
Nad tím musí být auditní vrstva. Každý model v routeru má ukládat vstupní zdroje, verzi modelu, náklady, výstup, confidence nebo nejistotu, schválení člověkem a výsledek po nasazení. Bez toho se z model-routeru stane jen složitější ruleta.
Co si pohlídat při pilotu
Začal bych třemi testovacími scénáři a měřil bych je proti současnému workflow.
První scénář: agentní coding. Metriky nejsou jen benchmark body, ale počet úspěšných PR, čas do merge, počet review připomínek, počet rozbitých testů, cena tokenů a kolikrát člověk musel agenta zastavit.
Druhý scénář: dokumentová extrakce. Měřil bych přesnost polí, citace, počet opravených závěrů, práci s nejistotou a cenu na jeden schválený dokument. U faktur, smluv nebo RFP je důležitější audit než hezký souhrn.
Třetí scénář: research memo. Agent dostane balík zdrojů a má připravit rozhodnutí pro CTO nebo vedení. Metriky: kolik tvrzení má primární zdroj, kolik zdrojů bylo špatně pochopeno, jak rychle člověk memo ověří a kolik doporučení opravdu změnilo rozhodnutí.
Závěr
Kimi K3 stojí za samostatnou pozornost, protože spojuje několik trendů najednou: extrémně velký open model, dlouhý kontext, agentní coding, znalostní práci, vision a API cenu, která může dávat smysl ve specialist vrstvě.
Zároveň bych ho nebral jako důvod vyhodit současný stack. Plné váhy jsou teprve plánované, benchmarky jsou vendor benchmarky s různými harnessy a reálná cena závisí na reasoning výstupu, cache hit rate a délce session.
Praktická otázka tedy nezní: „Je Kimi K3 lepší než Claude nebo GPT?“ Lepší otázka je: „Které tři úlohy máme tak dlouhé, drahé a auditovatelné, že stojí za to dát jim specialist model a změřit výsledek?“ Tam Kimi K3 dává smysl testovat.
Zdroje: YouTube signály Marek Bartoš Čínský AI model Kimi K3 a Zaujaloma AI Čínska AI dobieha Fable5 a GPT, Kimi/Moonshot [Kimi K3: Open Frontier Intelligence], Anthropic Redeploying Claude Fable 5, OpenAI GPT-5.6: Frontier intelligence that scales with your ambition a Anthropic Claude Fable 5 and Claude Mythos 5(https://www.kimi.com/blog/kimi-k3), Kimi API docs Kimi K3 quickstart, Kimi Code docs Model Configuration a Cloudflare Workers AI docs Kimi K3 model page.