26. 5. 2026Aktualizováno 30. 5. 2026

DeepSWE: nový benchmark ukazuje, proč coding agenti selhávají na dlouhých úkolech

Realistický cover pro článek o DeepSWE benchmarku coding agentů

Datacurve 26. května 2026 zveřejnil DeepSWE, nový benchmark pro coding agenty. Na první pohled je to další leaderboard. Prakticky je důležitější něco jiného: DeepSWE měří přesně ten typ práce, kam se dnes posouvají Claude Code, Codex, Cursor, Gemini CLI a další agenti. Ne jeden izolovaný patch, ale delší úkol v cizím repozitáři, kde agent musí najít souvislosti, udělat změnu, ověřit ji a nerozbít zbytek projektu.

Tohle je důležité pro firmy, které už neřeší otázku „umí AI napsat funkci“, ale „můžu agentovi svěřit reálný issue a dostat výsledek, který projde review.“

DeepSWE ukazuje workflow pro dlouhé coding-agent úlohy

Co DeepSWE měří jinak

DeepSWE vznikl jako reakce na to, že veřejné coding benchmarky začínají u frontier modelů ztrácet rozlišovací schopnost. Modely se v nich tváří podobně silné, ale vývojáři v praxi vidí rozdíly mnohem výrazněji.

Datacurve proto postavil benchmark na čtyřech principech:

  • úlohy jsou psané nově, ne převzaté z existujících pull requestů,
  • sada pokrývá 91 aktivních open-source repozitářů v 5 jazycích,
  • řešení jsou výrazně větší než u běžných SWE-bench úloh,
  • verifikace testuje chování softwaru, ne konkrétní tvar autorského řešení.

Konkrétně: DeepSWE má 113 úloh. Referenční řešení průměrně přidává 668 řádků kódu a mění zhruba 7 souborů. Pro srovnání, Datacurve uvádí u SWE-bench Pro průměr kolem 120 přidaných řádků. To je přesně rozdíl mezi „oprav jeden bug v dobře popsaném issue“ a „udělej změnu, kterou by si opravdu mohl vzít agent přes noc.“

Aktuální výsledky: GPT-5.5 vede, Opus 4.8 je silný, ale drahý

Leaderboard byl aktualizovaný 30. května 2026 a přidal i Claude Opus 4.8. Aktuální horní část tabulky vypadá takto:

Model / režim DeepSWE Pass@1 Průměrná cena úlohy Průměrný čas Výstupní tokeny
GPT-5.5 xhigh 70 % ± 4 % $6.61 21 min 47k
Claude Opus 4.8 max 58 % ± 5 % $12.58 43 min 136k
GPT-5.4 xhigh 56 % ± 5 % $4.38 27 min 71k
Claude Opus 4.7 max 54 % ± 5 % $18.19 39 min 103k
Claude Sonnet 4.6 high 32 % ± 4 % $5.52 42 min 76k
Gemini 3.5 Flash medium 28 % ± 4 % $7.42 17 min 189k

Důležitá poznámka: tohle není čisté měření „modelu v prázdnu.“ Všechny modely běží ve stejném harnessu ’mini-swe-agent’, aby se omezil vliv nativních produktů a rozdílných promptů. To je fér pro benchmark, ale neznamená to, že stejný výsledek dostanete v Claude Code, Codexu nebo Cursoru.

Co si z toho vzít prakticky

Za mě jsou důležité tři závěry.

První: u coding agentů už nestačí koukat jen na SWE-bench Verified nebo jednu marketingovou hodnotu v release článku. Potřebujete vědět, jak se model chová na dlouhém úkolu, kolik tokenů spálí, jak dlouho běží a kolik oprav pak musí udělat člověk.

Druhý: Opus 4.8 potvrzuje, že Anthropic je v agentickém kódování pořád velmi silný. Ale DeepSWE zároveň ukazuje cenu dlouhého přemýšlení. V tomhle běhu má Opus 4.8 výrazně vyšší průměrnou cenu, čas i počet výstupních tokenů než GPT-5.5.

Třetí: levný model automaticky neznamená levné workflow. Gemini 3.5 Flash běžel rychleji, ale produkoval extrémně hodně výstupních tokenů a měl nižší pass rate. Pokud agent běží dlouho, opakuje pokusy a člověk po něm musí opravovat výsledek, levný token se rychle přestane tvářit levně.

Jak bych DeepSWE použil ve firmě

Nepoužil bych ho jako absolutní pravdu. Použil bych ho jako filtr.

Pokud vybíráte coding agenta pro firmu, začal bych takhle:

1. Vyberte 10 až 20 reálných interních úloh z posledních měsíců. 2. Rozdělte je na malé opravy, střední změny a dlouhé agentické úkoly. 3. Měřte nejen úspěch, ale i cenu, čas, počet iterací, velikost diffu a náročnost review. 4. U drahých zásahů nechte agenta vždy vytvořit plán, testy a samostatné shrnutí rizik. 5. Model nepouštějte přímo do produkce. Nechte ho připravit pull request, který projde normálním review.

DeepSWE je užitečný hlavně pro třetí kategorii: dlouhé úkoly, kde se neukáže jen schopnost generovat kód, ale schopnost udržet záměr přes několik kroků.

Limity benchmarku

DeepSWE je lepší signál než mnoho starších coding leaderboardů, ale pořád je to benchmark.

Datacurve má vlastní komerční zájem. ’mini-swe-agent’ není totéž jako reálná práce v Claude Code nebo Codexu. A i když jsou úlohy nové, každý veřejný benchmark časem začne trpět tím, že se na něj laboratoře a uživatelé začnou ladit.

Proto bych DeepSWE nečetl jako větu „GPT-5.5 je vždy nejlepší coding agent.“ Četl bych ho jako silné upozornění: dlouhé coding-agent úlohy měří něco jiného než krátké patche. A rozdíly mezi modely jsou tam větší, než naznačují starší tabulky.

Verdikt

DeepSWE stojí za samostatný článek, protože neposouvá jen pořadí modelů. Posouvá otázku, kterou si máme u coding agentů klást.

Ne „který model má nejvyšší číslo“, ale „který agent za rozumnou cenu projde dlouhý úkol, otestuje vlastní práci a vytvoří změnu, kterou člověk skutečně může zreviewovat.“

To je přesně hranice, na které se coding agenti mění z lepšího autocomplete na reálnou vývojářskou kapacitu.

Zdroje