18. 7. 2026blog.updatedAt 19. 7. 2026

Kimi K3: open-source Fable? Model pre dlhých AI agentov, ktorý stojí za test

Realistické pracoviště vývojáře, který kontroluje agentní coding workflow na monitoru

Kimi K3 je presne ten typ novinky, pri ktorej sa ľahko skĺzne k tabuľke benchmarkov. Čínsky model dobieha alebo miestami predbieha západné modely, trhy reagujú, sociálne siete riešia, či je to ďalší DeepSeek moment. Je to zaujímavé, ale pre firmu zavádzajúcu AI do procesov je dôležitejšia iná otázka: kde by sa taký model vôbec mal použiť?

YouTube signál prišiel 17. júla 2026 hneď z dvoch sledovaných kanálov. Marek Bartoš upozornil na Kimi K3 ako lacnejší, otvorený a veľmi silný model. Zaujaloma AI ho zaradila medzi hlavné novinky vedľa Claude a ChatGPT. Tvrdé fakty však stoja hlavne na primárnych zdrojoch Kimi/Moonshot.

Moonshot AI v oficiálnom blogu uvádza, že Kimi K3 je 2,8-biliónový model postavený na Kimi Delta Attention a Attention Residuals, s natívnym porozumením obrazu a 1M tokenovým kontextom. Dôležité je aj opatrné čítanie: Kimi hovorí, že plné váhy majú byť vydané do 27. júla 2026. V čase písania článku teda K3 nie je prakticky to isté ako hotový self-hosting model pre každú firmu.

Je to open-source Fable? Takmer ako smer, nie ako hotový verdikt

Skratka „open-source Fable“ dobre vysvetľuje, prečo K3 budí pozornosť: mieri na rovnakú kategóriu dlhých coding a knowledge-work agentov ako Claude Fable 5 a GPT‑5.6 Sol, pričom Moonshot plánuje zverejniť plné váhy. Nie je však presné tvrdiť, že už dnes ide o otvorenú náhradu Fable. Kimi samo uvádza, že celkovo za Fable 5 a Sol stále zaostáva, a v čase aktualizácie sú váhy stále deklarované ako plánované.

Čo naozaj hovoria overené benchmarky

Porovnávať sa dajú iba čísla s jasne uvedeným nastavením — a ani potom nejde o čisté porovnanie. Kimi publikovalo pre DeepSWE v1.1 skóre 67,3 % s mini-SWE-agent harness; OpenAI vo svojej tabuľke uvádza 72,7 % pre GPT‑5.6 Sol69,7 % pre Claude Fable 5. Pri BrowseComp Kimi uvádza 90,4 % pri 1M kontexte bez context managementu; OpenAI uvádza zhodných 90,4 % pre Sol84,3 % pre Fable 5.

Tieto čísla sú dobrý signál, nie nákupné rozhodnutie. Harness sa líši: Kimi opisuje KimiCode či Claude Code, Sol je často meraný cez Codex; pri niektorých Kimi porovnaniach bežali modely na H20 namiesto referenčných H100 a Kimi samo upozorňuje, že Fable v jednom SWE Marathon behu použil fallback v 35 % úloh. Preto z nich nemožno poctivo vyčítať „Kimi poráža Fable“ ani „Sol je vždy lepší.“ Naznačujú však, že K3 už patrí do rovnakého shortlistu pre pilot dlhých agentných úloh.

Prakticky: berte K3 ako kandidáta na otvorenejší specialist model, nie ako argument pre globálne prepnutie stacku. Rovnaké zadanie, rovnaký repozitár alebo sada dokumentov, rovnaký harness, limit nákladov a ľudské review — až taký interný eval ukáže, či vám open alternatíva Fable naozaj dáva zmysel.

Kde K3 beží a koľko stojí

Dnes ho prevádzkujete ako službu, nie na vlastných GPU. K3 je dostupné na Kimi.com, v Kimi Work, v termináli a IDE cez Kimi Code a cez Kimi API pod modelom ’kimi-k3’. API je OpenAI-compatible Chat Completions a podporuje JSON Schema; pre tímovú správu Kimi ponúka Enterprise. Plné váhy Moonshot plánuje vydať do 27. júla 2026. Dovtedy teda „open-source Fable“ neznamená self-hosting: pre produkciu volíte vendor API a riešite obvyklé otázky regiónu, DPA, retention a prístupu k zdrojovým dátam.

Model Kde ho dnes prevádzkovať Cena API za 1M tokenov
Kimi K3 Kimi API, Kimi Code, Kimi Work/Kimi.com $3 vstup, $0,30 cached vstup, $15 výstup
Claude Fable 5 Claude Platform/API, Claude.ai, Claude Code a Claude Cowork; dostupnosť sa obnovuje aj v AWS, Google Cloud a Microsoft Foundry $10 vstup, $50 výstup
GPT‑5.6 Sol OpenAI API, ChatGPT, ChatGPT Work a Codex $5 vstup, $0,50 cached vstup, $30 výstup

Najužitočnejší pohľad je cena konkrétneho behu, nie cena jedného tokenu. Pri 1M necachovaných vstupných a 1M výstupných tokenov vychádza cenníkovo K3 na $18, Sol na $35 a Fable na $60. Ak sa vstup K3 skutočne trafí do cache, rovnaký objem je približne $15,30; pri Sol $30,50. Fable v citovanom launch oznámení uvádza vstup a výstup, nie porovnateľnú cached-input cenu, preto ju do tabuľky nedopočítavam.

Nie je to sľub, že K3 bude vždy najlacnejšie. Dlhší reasoning, opakované tool cally, fallback, retry a slabší prvý výsledok cenu ľahko prevrátia. Pre n8n/Make alebo interného agenta by som preto meral cenu za schválený výstup: napríklad jednu opravenú faktúru, jeden validný CRM záznam, jedno PR pripravené k review alebo jedno overené rozhodovacie memo.

Čo je na Kimi K3 podstatné

K3 nie je len chatovací model. Kimi ho stavia ako model pre dlhé coding úlohy, znalostnú prácu a agentné workflow. V praxi to znamená tri vrstvy.

Prvá je Kimi Code. Oficiálna dokumentácia uvádza model ID k3, použitie v CLI a IDE, plánové limity a až 1M kontext pri vyšších plánoch. Pre vývojárske tímy je to dôležité, pretože model nie je prezentovaný iba ako API endpoint, ale ako pracovné prostredie pre dlhé zásahy v repozitári.

Druhá je Kimi Work a knowledge work. Kimi hovorí o výstupoch ako dokumenty, prezentácie, dashboardy, výskumné reporty a interaktívne vizualizácie. Je to smer, ktorý vidíme aj pri ChatGPT Work, Claude Cowork a ďalších pracovných AI vrstvách: model neodpovedá len na otázku, ale skladá artefakt.

Tretia je API. Kimi API dokumentácia používa OpenAI-compatible Chat Completions rozhranie, model kimi-k3, automatické context caching a štruktúrované výstupy cez JSON Schema. Cena podľa oficiálneho blogu je 0,30 USD za milión cache-hit input tokenov, 3 USD za milión cache-miss input tokenov a 15 USD za milión output tokenov. Nie je to ultra lacný filter pre každú drobnosť, ale môže to byť zaujímavý worker pre dlhé úlohy, kde sa oplatí cache a kde drahší model šetrí ľudské hodiny.

Prečo z toho nerobiť ďalší default model

Najväčšia chyba by bola prečítať si benchmark a prepnúť všetko na Kimi K3.

Kimi samo v blogu hovorí, že používateľská skúsenosť stále zaostáva za najsilnejšími proprietárnymi modelmi. Dokumentácia tiež uvádza praktické obmedzenia: K3 má stále zapnuté reasoning, aktuálne iba s predvoleným max effort v API, pri viackrokovom tool callingu je potrebné vracať kompletnú assistant message vrátane reasoning časti a prepínanie modelov v rozbehnutej session môže zhoršiť kvalitu aj cenu kvôli cache.

Toto sú presne veci, ktoré v automatizácii rozhodujú. Model môže byť výborný v jednej dlhej úlohe a zároveň zlý default pre tisíce malých requestov. Môže byť silný v agentnom codingu, ale zbytočne drahý pre support classification. Môže mať 1M kontext, ale ak doň bez stratégie sypete celé CRM exporty, hlavne vyrábate účet za tokeny.

Kde by som ho testoval

Prvý kandidát je dlhý coding agent. Nie rýchla oprava preklepu, ale úloha typu: prejdi väčší repozitár, nájdi súvislosti, navrhni zmenu, napíš testy, spusti ich, prečítaj chyby a iteruj. Tu dáva zmysel porovnať Kimi K3 proti tomu, čo tím už používa: Claude Code, Codex, Cursor, GLM-5.2 alebo interný agentný stack.

Druhý kandidát je dokumentová extrakcia s veľkým kontextom. Napríklad due diligence zložka, technická dokumentácia, verejné obstarávania, zmluvy alebo support knowledge base. K3 by nemal len zhrnúť dokumenty. Mal by vyrobiť štruktúrovaný výstup, citácie, zoznam neistôt a návrh, čo má overiť človek.

Tretí kandidát je interný research agent. Typicky monitoring trhu, vendorov, legislatívy, konkurencie alebo technických release notes. Agent môže spracovať veľký balík zdrojov, vyrobiť dashboard a pripraviť rozhodovacie memo. Ale stále musí existovať pravidlo, kedy stačí AI výstup a kedy je potrebný primárny zdroj alebo ľudské review.

Štvrtý kandidát je multimodálna kontrola výstupov. Kimi spomína vision-in-the-loop pre frontend, hry alebo CAD. Prakticky je to zaujímavé: agent nielen napíše kód, ale pozrie sa na screenshot alebo výstup a opraví ho. Pri webových aplikáciách to môže znížiť počet ručných kontrol, ak sa spojí s Playwrightom, screenshotmi a jasnými akceptačnými pravidlami.

Ako by som ho zapojil do model-routera

Do firemného routera by som Kimi K3 nezaradil ako jediný model. Dal by som mu špecializovanú rolu.

Lacná vrstva zostáva pre klasifikácie, normalizácie, extrakcie jednoduchých polí, návrhy e-mailov a triage. Tam často vyhrá lacnejší a rýchlejší model, pretože počet requestov je vysoký a chybu vedia zachytiť pravidlá.

Stredná vrstva rieši štruktúrované výstupy a bežnú znalostnú prácu: CRM enrichment, faktúry, support, content pipeline, interné reporty. Tu sa rozhoduje podľa presnosti, latencie, ceny a schopnosti držať formát.

Kimi K3 by som testoval v specialist vrstve: dlhí coding agenti, rozsiahle dokumentové kontexty, research workflow, vizuálna kontrola a úlohy, kde agent beží desiatky minút a musí si udržať plán. Tam môže byť drahší output token stále lacnejší než hodina seniorného človeka.

Nad tým musí byť auditná vrstva. Každý model v routeri má ukladať vstupné zdroje, verziu modelu, náklady, výstup, confidence alebo neistotu, schválenie človekom a výsledok po nasadení. Bez toho sa z model-routera stane len zložitejšia ruleta.

Čo si pohlídat pri pilote

Začal by som tromi testovacími scenármi a meral by som ich proti súčasnému workflow.

Prvý scenár: agentný coding. Metriky nie sú iba benchmark body, ale počet úspešných PR, čas do merge, počet review pripomienok, počet rozbitých testov, cena tokenov a koľkokrát musel človek agenta zastaviť.

Druhý scenár: dokumentová extrakcia. Meral by som presnosť polí, citácie, počet opravených záverov, prácu s neistotou a cenu na jeden schválený dokument. Pri faktúrach, zmluvách alebo RFP je dôležitejší audit než pekný súhrn.

Tretí scenár: research memo. Agent dostane balík zdrojov a má pripraviť rozhodnutie pre CTO alebo vedenie. Metriky: koľko tvrdení má primárny zdroj, koľko zdrojov bolo zle pochopených, ako rýchlo človek memo overí a koľko odporúčaní naozaj zmenilo rozhodnutie.

Záver

Kimi K3 stojí za samostatnú pozornosť, pretože spája niekoľko trendov naraz: extrémne veľký open model, dlhý kontext, agentný coding, znalostnú prácu, vision a API cenu, ktorá môže dávať zmysel v specialist vrstve.

Zároveň by som ho nebral ako dôvod vyhodiť súčasný stack. Plné váhy sú zatiaľ plánované, benchmarky sú vendor benchmarky s rôznymi harnessmi a reálna cena závisí od reasoning výstupu, cache hit rate a dĺžky session.

Praktická otázka teda neznie: „Je Kimi K3 lepší než Claude alebo GPT?“ Lepšia otázka je: „Ktoré tri úlohy máme také dlhé, drahé a auditovateľné, že stojí za to dať im specialist model a zmerať výsledok?“ Tam dáva Kimi K3 zmysel testovať.

Zdroje: YouTube signály Marek Bartoš Čínský AI model Kimi K3 a Zaujaloma AI Čínska AI dobieha Fable5 a GPT, Kimi/Moonshot [Kimi K3: Open Frontier Intelligence], Anthropic Redeploying Claude Fable 5, OpenAI GPT-5.6: Frontier intelligence that scales with your ambition a Anthropic Claude Fable 5 and Claude Mythos 5(https://www.kimi.com/blog/kimi-k3), Kimi API docs Kimi K3 quickstart, Kimi Code docs Model Configuration a Cloudflare Workers AI docs Kimi K3 model page.