4. 9. 2026

GPT‑6 Astra: asynchrónni agenti menia architektúru viac než benchmarky

Realistické řídicí pracoviště s několika paralelními agentními úlohami a lidským dohledem

GPT‑6 Astra nie je model, ktorý by som dal za každý prompt. Za 10 USD za milión vstupných a 50 USD za milión výstupných tokenov je dvaapolkrát drahší než GPT‑5.6 Sol. Pri úzkej skupine agentov však môže byť lacnejší na hotovú úlohu, pretože mení spôsob riadenia dlhého behu.

OpenAI model predstavilo 4. septembra 2026. Najprv ho sprístupňuje firmám v programe Trusted Access; API a tarify Plus, Pro, Business a Enterprise majú nasledovať počas ďalších dní. Dokumentácia je zverejnená, no dostupnosť nemusí byť okamžitá na každom účte.

Čo prináša oproti GPT‑5.6

Astra má kontext 1,05 milióna tokenov, maximálny výstup 128-tisíc tokenov a reasoning effort od ‚low‘ po ‚max.‘ Režim ‚none‘ nepodporuje. K dispozícii sú dôležité nástroje z GPT‑5.6: web a file search, code interpreter, hosted shell, apply patch, skills, computer use, MCP aj tool search.

Pre produkčných agentov sú najdôležitejšie tri nové možnosti.

Asynchrónne volanie nástrojov umožní agentovi pokračovať v uvažovaní alebo nezávislej práci, kým beží pomalý export, render, databázový dotaz či externé API. Aplikácia označí funkciu alebo custom tool pomocou ’async: true’, sama nástroj vykoná a neskôr vráti výsledok s pôvodným ’call_id’.

Mid-turn steering dovolí používateľovi počas behu opraviť smer, doplniť požiadavku alebo zmeniť prioritu. Pri spojení cez WebSocket sa už dokončená práca zachová a nová inštrukcia sa pridá do pokračovania.

Zmena reasoning effortu bez prestavby promptového prefixu používa položku ’configuration_update’. Workflow môže zvýšiť effort pri ťažkej výnimke a znížiť ho pri rutinnom pokračovaní bez straty cache stabilnej časti promptu.

Asynchrónny agent potrebuje trvalý stav

Asynchrónny tool call nezabezpečí paralelizmus aplikácie automaticky. OpenAI ponecháva spúšťanie nástrojov a správu čakajúcej práce na aplikácii.

Každá operácia by mala mať ’run_id’, ’call_id’, stav, vlastníka, timeout, počet pokusov a idempotency key. Výsledok sa musí pripojiť k správnemu volaniu, aj keď príde neskoro alebo v inom poradí. Po reštarte workera musí byť možné obnoviť beh zo stavu uloženého mimo kontextu modelu.

Pri faktúrach môže agent naraz spustiť OCR, kontrolu dodávateľa a načítanie objednávky. Kým čaká na OCR, pripraví validačnú schému a overí menu či IČ DPH z dostupných dát. Po doručení výsledkov ich spojí podľa ’call_id’, vyhodnotí rozpory a pošle len výnimku na ľudské schválenie.

Pri CRM enrichmente môžu súbežne bežať firemný register, verejný web a interná história. Incidentný agent môže čakať na export logov a zároveň kontrolovať zmeny v repozitári. Hodnota vzniká skrátením skutočnej kritickej cesty, nie maximalizáciou počtu súbežných volaní.

Astra patrí do eskalačnej vrstvy

Štandardné API ceny sú 10 USD za milión vstupných tokenov, 1 USD za cache read, 12,50 USD za cache write a 50 USD za milión výstupných tokenov. Batch a Flex stoja polovicu sadzby Standard, Fast dvojnásobok. Pri požiadavke nad 272-tisíc vstupných tokenov sa celý request účtuje s dvojnásobnou cenou vstupu a cache a 1,5-násobnou cenou výstupu.

GPT‑5.6 Sol stojí 4/0,40/20 USD za vstup, cache a výstup; Terra 2/0,20/12 a Luna 0,20/0,02/1,20. Astra si musí svoje miesto obhájiť menším počtom opakovaní, tool callov alebo review cyklov pri náročnej práci.

Praktický router môže používať Lunu na triedenie e-mailov, ticketov a leadov, Terru na štandardnú extrakciu a JSON, Sol na zložitejšie prípady a kód a Astru na dlhý incident, audit naprieč systémami, náročný refaktoring alebo výnimku, pri ktorej je opakované zlyhanie drahšie než jeden kvalitnejší beh.

Merajte cenu za uzavretý ticket, správne spárovanú faktúru, prijatý pull request alebo audit, ktorý prešiel kontrolou. Cena tokenu je iba jeden zo vstupov.

Migračné pasce v API

Migrácia vyžaduje viac než zmenu model ID na ’gpt-6-astra’.

OpenAI odporúča pre nástroje Responses API. Astra podporuje Chat Completions, no migračný návod viaže tool calling na Responses. Odstráňte nepodporované parametre ‚temperature‘, ’top_p’ a ’top_logprobs’; pri Chat Completions aj ‚logprobs‘ a pri Responses zahrnutie ’message.output_text.logprobs’.

Ak integrácia používa reasoning ‚none‘ alebo ‚minimal‘, začnite test s ‚low.‘ Effort medzi krokmi meňte pomocou ’configuration_update’, nie prestavbou celého prefixu, ak chcete zachovať cache.

Pri migrácii z GPT‑5.5 alebo staršej verzie nahraďte ’prompt_cache_retention’ za ’prompt_cache_options.ttl: „30m“’. Skontrolujte hranice cache a do nákladov zahrňte aj spoplatnené cache writes.

Fast mode nie je pri Astre dostupný s EU data residency. Ak je umiestnenie dát zmluvnou požiadavkou, plánujte Standard processing a pred prísľubom latencie overte konkrétnu konfiguráciu účtu.

Steering nesmie obísť pravidlá

Ukladajte pôvodné zadanie, každú zmenu počas behu, čas jej prijatia a kroky, ktoré už boli dokončené. Inak sa užitočná funkcia zmení na medzeru v audite.

Nová inštrukcia typu „pošli to priamo zákazníkovi“ nesmie obísť schvaľovaciu bránu navrhnutú pre prípravu návrhu. Steering môže zmeniť smer agenta, nie bezpečnostnú politiku orchestrátora.

OpenAI tiež upozorňuje, že Astra môže citlivejšie reagovať na inštrukcie v skills, ’AGENTS.md’ a ďalších dostupných súboroch. Prejdite tieto zdroje, odstráňte konflikty a nedávajte nedôveryhodnému dokumentu rovnakú autoritu ako systémovým pravidlám.

Ako by som Astru otestoval

Vybral by som 20 až 50 reálnych úloh, pri ktorých Sol alebo iný model občas zlyháva: dlhé reklamácie, rozporné zmluvy, incidenty s viacerými zdrojmi, refaktoring cez viac repozitárov alebo audit procesu.

Okrem úspešnosti by som meral počet tool callov, čakanie na nástroje, opakované pokusy, cache hit rate, celkový vstup a výstup, zásahy človeka a čas do schváleného výsledku. Otestujte aj chyby: oneskorený výsledok, duplicitný callback, timeout, reštart workera a používateľskú zmenu uprostred práce.

Až potom rozhodnite, či Astra nahradí Sol v konkrétnej vetve workflow. Pri väčšine rutinných automatizácií zostane správnym defaultom lacnejší model. Pri malej skupine drahých výnimiek však môže nový spôsob riadenia agenta znížiť celkové množstvo práce.

Zdroje: OpenAI GPT‑6 Astra model card, model guidance a migračné poznámky, porovnanie modelov a cien a YouTube signál Jirka Herník: Nové modely za zlomok ceny.