Codex v laboratóriu: AI agent riadi merania, nie iba ďalší softvér

Najzaujímavejšia AI automatizácia tohto týždňa nie je chatbot ani ďalší generátor aplikácií. Výskumníci z MIT EQuS prepojili Codex s GPT-5.6 Sol so softvérom, ktorý riadi merania reálnych kvantových čipov. Agent volil parametre, ovládal prístroje, analyzoval grafy, ukladal kalibrácie a podľa výsledku rozhodol, či meranie spresniť alebo pokračovať.
Pre firmy je dôležitý najmä vzor: agent uzatvára slučku medzi akciou, telemetriou, vyhodnotením a ďalším krokom. Rovnaká architektúra sa objavuje vo výrobnej kontrole, laboratórnej automatizácii, prevádzke infraštruktúry aj dokumentových procesoch. Rozdiel je v tom, že zlý zásah do fyzického zariadenia sa nedá vždy vrátiť pomocou Undo.
Čo presne MIT testovalo
Prípadová štúdia opisuje dovtedy nemeraný čip so šiestimi qubitmi: štyrmi s pevnou a dvomi s laditeľnou frekvenciou. Agent bežal cez Codex s GPT-5.6 Sol na úrovni Ultra a používal existujúci Jupyter orchestration softvér skupiny cez jednoduché interné MCP.
Dostal viac než chatové inštrukcie. Kontext zahŕňal živé parametre merania, programy, grafy, surové dáta, logy, databázu výsledkov a zdrojový kód orchestrácie. Výskumníci vytvorili skills pre jednotlivé merania s predpokladmi, šablónovým kódom, odporúčaním parametrov, typickými fyzikálnymi príčinami zlyhania a príkladmi dobrých aj zlých grafov.
Táto príprava je podstatnou časťou výsledku. Tím uvádza, že hľadanie správneho kontextu a skills trvalo niekoľko mesiacov iterácií. Agent nebol kompetentný „z krabice“; bol vložený do existujúceho softvérového procesu a dostal konkrétnu prevádzkovú skúsenosť.
Výsledok: 36 zo 40 bez zásahu, no s jasnými hranicami
Agent našiel všetkých šesť rezonátorov a vhodné počiatočné výkony čítacích pulzov. Pri 40 cieľových meraniach na štyroch qubitoch s pevnou frekvenciou výskumníci zasiahli iba pri štyroch. Samostatný automatický loop bežal 12 hodín cez noc, vykonal 200 meraní a agent potom preskúmal body, kde postup zlyhal.
Slabý signál ukázal hranicu. Pri laditeľných qubitoch agent potreboval výrazné vedenie skúseného výskumníka, niekedy sledoval nesprávnu stopu a raz označil nedostatočný výsledok za prijateľný. Autori tiež uvádzajú, že agent bol podľa ich skúsenosti pomalší než expert. Fyzické meranie trvá sekundy až desiatky minút a prebieha sériovo, takže bottleneck nemožno vyriešiť paralelným swarmom agentov.
Nejde teda o „AI nahradila vedca.“ Agent prevzal dobre opísanú rutinu a uvoľnil výskumníkovi čas na návrh experimentu a interpretáciu nejasných fyzikálnych javov. Práve tam dnes dáva autonómia najväčší zmysel.
Architektúra uzavretej slučky
Podobný produkčný systém by som rozdelil na šesť vrstiev:
- Pevný stavový automat určuje povolené fázy a prechody.
- Skills opisujú parametre, závislosti, známe chyby a príklady úspechu aj zlyhania.
- Agent volí ďalšie meranie alebo diagnostický krok iba v povolenom priestore.
- Deterministické kontroly overujú rozsahy, kvalitu fitu, povinné dáta a technické limity.
- Stop podmienky prerušia beh pri neobvyklom šume, drifte, opakovaní alebo prekročení rozpočtu.
- Človek rozhoduje nejasné prípady a schvaľuje akcie, ktoré môžu poškodiť zariadenie, dáta alebo nadväzujúci proces.
Každý krok potrebuje auditnú stopu: vstupný stav, verziu skillu a modelu, nástroj, parametre, surové dáta, interpretáciu, dôvod pokračovania a zásah človeka. Bez nej nemožno incident reprodukovať ani zlepšovať evaluáciu.
Čo preniesť do bežnej firmy
Začal by som procesom, ktorý už dnes ovláda softvér a má merateľnú spätnú väzbu. Vo výrobe môže agent posúdiť snímku a vyžiadať opakované meranie, nie autonómne prestaviť stroj. V IT prevádzke môže zhromaždiť logy, spustiť diagnostiku a odporučiť playbook, zatiaľ bez reštartu kritickej služby. Pri faktúrach môže extrahovať dáta, porovnať ich s objednávkou a vyžiadať chýbajúci doklad — nie odoslať platbu.
V n8n alebo Make by agent nemal byť jediný veľký krok „vyrieš prípad.“ Orchestrátor má držať stav a oprávnenia, každý nástroj má mať úzky kontrakt a validátor rozhoduje, či možno pokračovať. Agent je adaptívna vrstva v procese, nie náhrada procesu.
Rozumný pilot postupuje po etapách:
- shadow mode nad historickými prípadmi,
- návrhy krokov bez oprávnenia vykonať ich,
- obmedzená autonómia iba pre vratné a nízkorizikové akcie,
- povinná eskalácia pri slabom signále alebo konflikte pravidiel,
- meranie času človeka, počtu zásahov, chybných akcií a ceny jedného správne dokončeného behu.
Čo tento prípad nedokazuje
Ide o spoločnú štúdiu autorov z MIT a OpenAI na relatívne jednoduchom benchmarkovom čipe, nie o nezávislé porovnanie viacerých modelov. Uvádza konkrétne počty meraní a zásahov, ale nie kompletnú ekonomiku ani presnú časovú úsporu. Zložitejšie a nové experimenty môžu vyžadovať podstatne viac ľudskej intuície.
Napriek tomu je to silnejší dôkaz nasadenia než väčšina agentných dem. Agent pracoval so živou telemetriou, ovládal existujúce nástroje, bežal cez noc a narazil na chyby, ktoré autori otvorene opísali. Práve kombinácia úspechu a viditeľných obmedzení robí tento prípad užitočným.
Zdroje: OpenAI: How GPT-5.6 Sol helps run quantum computing experiments a technická prípadová štúdia MIT/OpenAI Agentic Calibration of Superconducting Qubits.