DeepSWE: nový benchmark ukazuje, prečo coding agenti zlyhávajú na dlhých úlohách

Datacurve 26. mája 2026 zverejnil DeepSWE, nový benchmark pre coding agentov. Na prvý pohľad je to ďalší leaderboard. Prakticky je dôležitejšie niečo iné: DeepSWE meria typ práce, ku ktorému sa dnes posúvajú Claude Code, Codex, Cursor, Gemini CLI a ďalší agenti. Nie jeden izolovaný patch, ale dlhšiu úlohu v cudzom repozitári, kde agent musí nájsť súvislosti, spraviť zmenu, overiť ju a nerozbiť zvyšok projektu.
To je dôležité pre firmy, ktoré už neriešia otázku „vie AI napísať funkciu“, ale „môžem agentovi zveriť reálny issue a dostať pull request, ktorý prejde review.“

Čo DeepSWE meria inak
DeepSWE vznikol ako reakcia na to, že verejné coding benchmarky začínajú pri frontier modeloch strácať rozlišovaciu schopnosť. Modely v nich vyzerajú podobne silné, ale vývojári v praxi vidia oveľa väčšie rozdiely.
Datacurve preto postavil benchmark na štyroch princípoch:
- úlohy sú písané nanovo, nie prevzaté z existujúcich pull requestov,
- sada pokrýva 91 aktívnych open-source repozitárov v 5 jazykoch,
- riešenia sú výrazne väčšie než pri bežných SWE-bench úlohách,
- verifikácia testuje správanie softvéru, nie konkrétny tvar autorského riešenia.
DeepSWE má 113 úloh. Referenčné riešenia priemerne pridávajú 668 riadkov kódu a menia približne 7 súborov. Na porovnanie, Datacurve uvádza pri SWE-bench Pro priemer okolo 120 pridaných riadkov. To je rozdiel medzi „oprav jeden dobre popísaný bug“ a „urob zmenu, ktorú by ste reálne mohli nechať agentovi cez noc.“
Aktuálne výsledky: GPT-5.5 vedie, Opus 4.8 je silný, ale drahý
Leaderboard bol aktualizovaný 30. mája 2026 a pribudol aj Claude Opus 4.8. Horná časť tabuľky aktuálne vyzerá takto:
| Model / režim | DeepSWE Pass@1 | Priemerná cena úlohy | Priemerný čas | Výstupné tokeny |
|---|---|---|---|---|
| GPT-5.5 xhigh | 70 % ± 4 % | $6.61 | 21 min | 47k |
| Claude Opus 4.8 max | 58 % ± 5 % | $12.58 | 43 min | 136k |
| GPT-5.4 xhigh | 56 % ± 5 % | $4.38 | 27 min | 71k |
| Claude Opus 4.7 max | 54 % ± 5 % | $18.19 | 39 min | 103k |
| Claude Sonnet 4.6 high | 32 % ± 4 % | $5.52 | 42 min | 76k |
| Gemini 3.5 Flash medium | 28 % ± 4 % | $7.42 | 17 min | 189k |
Dôležitá poznámka: toto nie je čisté meranie „modelu vo vákuu.“ Všetky modely bežia v rovnakom harnessi ’mini-swe-agent’, aby sa obmedzil vplyv natívnych produktov a vendor-specific promptov. To je dobré pre benchmark, ale neznamená to, že rovnaký výsledok dostanete v Claude Code, Codexe alebo Cursore.
Praktický záver
Za mňa sú dôležité tri veci.
Prvá: pri coding agentoch už nestačí pozerať len na SWE-bench Verified alebo jednu marketingovú hodnotu v release článku. Potrebujete vedieť, ako sa model správa na dlhej úlohe, koľko tokenov spáli, ako dlho beží a koľko opráv po ňom musí spraviť človek.
Druhá: Opus 4.8 potvrdzuje, že Anthropic je v agentickom kódovaní stále veľmi silný. DeepSWE však zároveň ukazuje cenu dlhého premýšľania. V tomto behu má Opus 4.8 vyššiu priemernú cenu, čas aj počet výstupných tokenov než GPT-5.5.
Tretia: lacný model automaticky neznamená lacné workflow. Gemini 3.5 Flash bol rýchlejší, ale produkoval veľmi veľa výstupných tokenov a mal nižší pass rate. Ak agent beží dlho, opakuje pokusy a človek po ňom musí opravovať výsledok, lacný token rýchlo prestane byť lacný.
Ako by som DeepSWE použil vo firme
Nepoužil by som ho ako absolútnu pravdu. Použil by som ho ako filter.
Pri výbere coding agenta by som začal takto:
1. Vyberte 10 až 20 reálnych interných úloh z posledných mesiacov. 2. Rozdeľte ich na malé opravy, stredné zmeny a dlhé agentické úlohy. 3. Merajte nielen úspech, ale aj cenu, čas, počet iterácií, veľkosť diffu a náročnosť review. 4. Pri drahých zásahoch nechajte agenta vždy vytvoriť plán, testy a samostatné zhrnutie rizík. 5. Model nepúšťajte priamo do produkcie. Nech pripraví pull request, ktorý prejde normálnym review.
DeepSWE je užitočný hlavne pre tretiu kategóriu: dlhé úlohy, kde sa neukáže len schopnosť generovať kód, ale schopnosť udržať zámer cez viac krokov.
Limity benchmarku
DeepSWE je lepší signál než mnoho starších coding leaderboardov, ale stále je to benchmark.
Datacurve má vlastný komerčný záujem. ’mini-swe-agent’ nie je to isté ako reálna práca v Claude Code alebo Codexe. A každý verejný benchmark časom začne trpieť tým, že sa naň laboratóriá a používatelia začnú ladiť.
Preto by som DeepSWE nečítal ako vetu „GPT-5.5 je vždy najlepší coding agent.“ Čítal by som ho ako silné upozornenie: dlhé coding-agent úlohy merajú niečo iné než krátke patche. A rozdiely medzi modelmi sú tam väčšie, než naznačujú staršie tabuľky.
Verdikt
DeepSWE si zaslúži samostatný článok, pretože neposúva len poradie modelov. Posúva otázku, ktorú si máme pri coding agentoch klásť.
Nie „ktorý model má najvyššie číslo“, ale „ktorý agent za rozumnú cenu prejde dlhú úlohu, otestuje vlastnú prácu a vytvorí zmenu, ktorú človek skutočne môže zreviewovať.“
To je hranica, na ktorej sa coding agenti menia z lepšieho autocomplete na reálnu vývojársku kapacitu.