4. 9. 2026

GPT‑6 Astra: asynchronní agenti mění architekturu víc než benchmarky

Realistické řídicí pracoviště s několika paralelními agentními úlohami a lidským dohledem

GPT‑6 Astra není model, který bych dal do každého promptu. Za 10 USD za milion vstupních a 50 USD za milion výstupních tokenů je proti GPT‑5.6 Sol dvaapůlkrát dražší. Přesto může být pro některé agenty levnější na hotový úkol. Ne kvůli magii v benchmarku, ale protože mění způsob, jak může aplikace řídit dlouhý běh.

OpenAI model představilo 4. září 2026. V den oznámení ho zpřístupňuje firmám v programu Trusted Access; API a tarify Plus, Pro, Business a Enterprise mají následovat v dalších dnech. To je důležitá provozní poznámka: dokumentace už existuje, ale dostupnost nemusí být na každém účtu okamžitá.

Co přináší oproti GPT‑5.6

Astra má kontext 1,05 milionu tokenů, maximální výstup 128 tisíc tokenů a reasoning effort od ‚low‘ po ‚max.‘ Režim ‚none‘ nepodporuje. Umí stejné důležité nástroje jako GPT‑5.6: web a file search, code interpreter, hosted shell, apply patch, skills, computer use, MCP i tool search.

Zajímavější jsou tři nové možnosti pro dlouhé agenty.

První je asynchronní volání nástrojů. Agent nemusí nečinně čekat, než doběhne pomalý export, render, databázový dotaz nebo externí API. Aplikace označí funkci či custom tool pomocí ’async: true’, agent může mezitím pokračovat v nezávislé práci a výsledek později přiřadí přes původní ’call_id’.

Druhá je mid-turn steering. Uživatel může během běhu doplnit požadavek, opravit směr nebo změnit prioritu. Přes WebSocket se zachová už dokončená práce a instrukce se přidá do pokračování. U dvacetiminutového auditu tak nemusíte volit mezi čekáním na špatný výsledek a zrušením celého běhu.

Třetí je změna reasoning effortu během konverzace bez přepsání promptového prefixu. ’configuration_update’ dovolí zvýšit effort u složité výjimky a následně ho snížit u rutinního kroku. Při správné implementaci zůstane zachovaná cache stabilní části promptu.

Asynchronní agent potřebuje stav, ne jen delší prompt

Asynchronní tool call není paralelní magie uvnitř vaší aplikace. OpenAI výslovně říká, že nástroj stále spouští a jeho čekající stav spravuje vaše aplikace. To přesouvá část odpovědnosti do orchestrace.

Každý čekající krok by měl mít alespoň ’run_id’, ’call_id’, stav, vlastníka, timeout, počet pokusů a idempotency key. Výsledek musíte připojit ke správnému volání, i když dorazí pozdě nebo ve změněném pořadí. Po pádu workeru musí jít běh obnovit ze stavu mimo kontext modelu.

Příklad z faktur: agent spustí OCR příloh, kontrolu dodavatele a načtení objednávky. Zatímco OCR čeká, může připravit validační schéma a ověřit měnu či DIČ z dostupných dat. Až výsledky dorazí, spáruje je podle ’call_id’, vyhodnotí rozpory a pošle jen výjimku k lidskému schválení.

Podobně u CRM enrichmentu mohou běžet paralelně firemní rejstřík, web firmy a interní historie. U incidentu může agent čekat na log export a mezitím projít změny v repozitáři. Přínosem není víc souběžných požadavků samo o sobě. Přínosem je kratší kritická cesta, pokud workflow skutečně obsahuje nezávislé větve.

Cena: Astra patří do eskalační vrstvy

Standardní API ceny jsou 10 USD za milion vstupních tokenů, 1 USD za cache read, 12,50 USD za cache write a 50 USD za milion výstupních tokenů. Batch a Flex stojí polovinu standardní sazby, Fast dvojnásobek. Požadavek nad 272 tisíc vstupních tokenů zdraží celý request: vstup a cache na dvojnásobek, výstup na 1,5násobek.

To je dost silný důvod nedělat z Astry nový univerzální default. GPT‑5.6 Sol stojí 4/0,40/20 USD za vstup, cache a výstup; Terra 2/0,20/12 a Luna 0,20/0,02/1,20. Astra má dávat smysl tam, kde schopnější řízení nástrojů nebo méně opakovaných kroků sníží cenu hotového a schváleného úkolu.

Praktický router může vypadat takto:

  • Luna nebo levnější model třídí e-maily, tickety a leady.
  • Terra zpracuje standardní extrakci, JSON a běžné CRM záznamy.
  • Sol řeší složitější případy, kód a vícekrokové workflow.
  • Astra dostane dlouhý incident, audit napříč systémy, těžký refaktoring nebo výjimku, u které opakované selhání levnějších modelů stojí víc než jeden kvalitní běh.

Měřil bych cenu za uzavřený ticket, správně spárovanou fakturu, přijatý pull request nebo audit bez vrácení k přepracování. Cena tokenu sama nerozhodne.

Migrační pasti v API

Přechod není jen změna model ID na ’gpt-6-astra’.

Pro nástroje OpenAI doporučuje Responses API. Astra sice podporuje Chat Completions, ale tool calling je podle migračního průvodce navázané na Responses. Nepodporované jsou ‚temperature‘, ’top_p’ a ’top_logprobs’; u Chat Completions také ‚logprobs‘ a u Responses zahrnutí ’message.output_text.logprobs’.

Pokud dnes používáte reasoning ‚none‘ nebo ‚minimal‘, začněte při testu s ‚low.‘ Změnu effortu mezi kroky posílejte pomocí ’configuration_update’, ne přepisem parametru celého requestu, pokud chcete zachovat cache prefixu.

Při migraci z GPT‑5.5 nebo starší verze se mění také nastavení cache: starý ’prompt_cache_retention’ nahrazuje ’prompt_cache_options.ttl’ s hodnotou ’30m’. Je potřeba projít hranice cache a počítat i zpoplatněné cache writes.

Pro evropské nasazení platí ještě jedna výjimka. Fast mode není u Astry dostupný s EU data residency. Pokud je umístění dat smluvní požadavek, počítejte se Standard processing a ověřte konkrétní konfiguraci účtu dřív, než budete slibovat latenci.

Na co si dát pozor u řízení během běhu

Mid-turn steering je užitečný, ale může rozbít audit, pokud nové instrukce jen přepíšou původní cíl. Do logu proto ukládejte původní zadání, každou změnu, okamžik jejího přijetí a seznam kroků, které proběhly před ní.

U workflow s externími akcemi musí zůstat hranice. Změna „pošli to rovnou zákazníkovi“ během přípravy návrhu nesmí obejít schválení e-mailu. Steering smí měnit pracovní směr agenta, ne bezpečnostní pravidla orchestrátoru.

Stejně důležitá je ochrana instrukcí. OpenAI upozorňuje, že Astra citlivěji reaguje na instrukce ve skills, ’AGENTS.md’ a dalších souborech. Před nasazením proto projděte všechny zdroje instrukcí, odstraňte konflikty a nedávejte neověřenému dokumentu stejnou autoritu jako systémovým pravidlům.

Jak bych Astry testoval ve firmě

Vybral bych dvacet až padesát skutečných úloh, na kterých dnes Sol nebo jiný model občas selže: dlouhé reklamace, rozporné smlouvy, incidenty s více zdroji, refaktoring přes několik repozitářů nebo audit datového procesu.

Vedle úspěšnosti bych měřil počet tool callů, čekání na nástroje, počet opakovaných pokusů, cache hit rate, celkový vstup a výstup, zásahy člověka a čas do schváleného výsledku. Asynchronní běh testujte i na chybách: opožděný výsledek, duplicitní callback, timeout, restart workeru a instrukce přidaná uprostřed práce.

Teprve potom rozhodujte, zda Astra nahradí Sol pro konkrétní větev. U většiny rutinních automatizací bude správnou odpovědí stále levnější model. U několika drahých výjimek ale může nový způsob řízení agenta vyhrát, i když má výrazně vyšší cenu za token.

Zdroje: OpenAI GPT‑6 Astra model card, model guidance a migrační poznámky, porovnání modelů a cen a YouTube signál Jirka Herník: Nové modely za zlomek ceny.