Claude Opus 5.5 v testech: kolik připlatíte za Max
V CursorBench dělí High a Max jen 1,8 bodu, účet je ale 3,4krát vyšší. Grafy Artificial Analysis a Cursoru ukazují, kde nový Opus získává náskok.
Claude Opus 5.5 se v den vydání dostal na první místo žebříčku Artificial Analysis. Při výběru modelu pro práci na webu nás ale zajímá i druhá otázka: kolik stojí dostat z něj maximum? Data Cursoru ukazují, že poslední zlepšení mohou být podstatně dražší než ta předchozí.
Anthropic nový Opus vydal 22. září 2026. Je určený pro delší práci s kódem a firemními podklady. Pro nás je zajímavý třeba při úpravě formuláře, která zasahuje do vzhledu, ověřování údajů i jejich ukládání.
Stav dat: 22. září 2026. Grafy jsme sestavili ze zveřejněných měření Artificial Analysis a Cursoru.
Artificial Analysis: Opus před Fable i Astrou
V Artificial Analysis Intelligence Indexu má Opus 5.5 na Max zaokrouhlené skóre 58. Fable 5.1 a GPT-6 Astra mají na Max po 53 bodech, předchozí Opus 5 má 51. Výsledek tak podporuje tvrzení, že novinka posouvá schopnosti řady Opus.
Zvětšit graf. Zdroj: Artificial Analysis. Hodnoty jsou zaokrouhlené jako ve veřejném žebříčku.
Index podle metodiky verze 4.3.2 kombinuje deset hodnocení, například práci s nástroji, programování, znalosti a vědecké uvažování. Jde převážně o textové úlohy v angličtině. Skóre 58 proto neznamená 58% úspěšnost při tvorbě českého webu.
U Opusu 5.5 a Fable 5.1 je také podstatné označení with fallback. Měření počítá s možností předat odmítnutý požadavek náhradnímu modelu. Výsledek patří této konfiguraci; při jiném nastavení se může změnit.
CursorBench: co kupuje příplatek za Max
Cursor sestavuje úlohy z reálných zadání svého týmu. Zajímají ho změny napříč soubory i neúplná zadání, u kterých musí agent nejprve pochopit záměr. To je blíž běžné práci na aplikaci než izolovaná programátorská hádanka.
V aktuálním CursorBench 4.0 dosáhl Opus 5.5 na High skóre 56,0 % za průměrných 3,97 USD na úkol. Max přidal 1,8 procentního bodu, ale stál 13,43 USD. To je přibližně 3,4krát tolik.
Zvětšit graf. Zdroj: CursorBench 4.0.
Cena v grafu je průměrný náklad na tokeny během úkolu, včetně cache. Drobné rozdíly skóre mohou být v mezích variability měření.
Z toho bychom pro běžný vývoj vyvodili jednoduchý postup: začít na Medium nebo High a Max zkusit u problému, který na nižším nastavení zůstává nevyřešený. U chyby blokující spuštění aplikace může i malé zvýšení šance na úspěch stát za příplatek.
Levnější tokeny a levnější úkol jsou dvě různé věci
Podle ceníku Claude API stojí milion vstupních tokenů Opusu 5.5 čtyři dolary a milion výstupních dvacet. U Opusu 5 to bylo pět a dvacet pět dolarů. Token je jednotka zpracovávaného obsahu, obvykle část slova.
USD za milion tokenů | Opus 5.5 | Opus 5 |
|---|---|---|
Vstup | 4 | 5 |
Výstup | 20 | 25 |
Čtení z cache | 0,20 | 0,50 |
Vstup a výstup zlevnily o 20 %, opakované čtení dříve zpracovaných podkladů z cache o 60 %. Zápis do cache se účtuje zvlášť. Tabulka uvádí základní sazby přímého API, nikoli cenu předplatného Claude.
Anthropic zároveň uvádí 40% pokles nákladů na typické úlohy při výchozím nastavení. Započítává do něj nižší sazby i menší spotřebu tokenů. Právě nastavení a počet kroků vysvětlují, proč samotný ceník nestačí k odhadu účtu za hotovou práci.
Při přechodu ve vlastní aplikaci zkontrolujte API
Nová verze mění i kompatibilitu. Migrační průvodce upozorňuje, že Opus 5.5 už nepřijímá vypnuté přemýšlení ani vynucení konkrétního nástroje přes tool_choice typu tool či any. Výchozí úroveň přemýšlení je nově medium.
Změnily se také průběžné zprávy mezi použitím nástrojů. Přicházejí v blocích thinking, které ve výchozím nastavení nemají viditelný text. Vlastní rozhraní tak může přestat ukazovat průběh práce, přestože model dál pracuje.
Jak mu zadat větší úpravu webu
Anthropic ukazuje také konkrétní delší úkol: převod HAProxy z jazyka C do Rustu. Opus 5.5 jej v interním testu dokončil za 9,5 hodiny, Fable 5.1 za 12 hodin. Náklady byly u Opusu o 51 % nižší. Oba přepisy prošly téměř všemi původními regresními testy. Je to příklad od výrobce, ne náš vlastní experiment.
Pro redesign webu je podobná schopnost zajímavá při převodu stránky do nové struktury. Zadání může zahrnovat obsah, odkazy i chování na telefonu. U firemního webu zase celý průchod poptávkovým formulářem včetně situace, kdy se odeslání nepovede.
Vlastní AI ilustrace Chciweeeb znázorňuje kontrolu webu na počítači a telefonu.
V takovém zadání má mít agent prostor projít související kód, úpravu dokončit a ověřit. Do porovnání modelů bychom pak zahrnuli i čas člověka, který výsledek přebírá. Levnější běh ztrácí výhodu, pokud po něm zbude hodina ručních oprav.
Zdroje a další čtení
- Artificial Analysis: žebříček modelů a Intelligence Index
- Artificial Analysis: metodika Intelligence Indexu v4.3.2
- CursorBench 4.0: aktuální skóre a průměrné náklady
- Cursor: jak vznikají úlohy CursorBench
- Anthropic: představení Opusu 5.5 a ukázka převodu HAProxy
- Claude Platform: parametry a datum vydání Opusu 5.5
- Claude Platform: ceník API a cache
- Claude Platform: odmítnutí požadavků a náhradní modely
- Claude Platform: přechod na Opus 5.5
- Claude Platform: změny chování v Opusu 5.5
Komentáře
Načítání komentářů…