Přeskočit na obsah
Vývoj webů

Claude Opus 5.5 v testech: kolik připlatíte za Max

V CursorBench dělí High a Max jen 1,8 bodu, účet je ale 3,4krát vyšší. Grafy Artificial Analysis a Cursoru ukazují, kde nový Opus získává náskok.

Tým ChciweeebZobrazení se souhlasem: 0
Ilustrace vytvořená AI: lesklé modré číslice 5.5 před bílým modelem okna prohlížeče.

Claude Opus 5.5 se v den vydání dostal na první místo žebříčku Artificial Analysis. Při výběru modelu pro práci na webu nás ale zajímá i druhá otázka: kolik stojí dostat z něj maximum? Data Cursoru ukazují, že poslední zlepšení mohou být podstatně dražší než ta předchozí.

Anthropic nový Opus vydal 22. září 2026. Je určený pro delší práci s kódem a firemními podklady. Pro nás je zajímavý třeba při úpravě formuláře, která zasahuje do vzhledu, ověřování údajů i jejich ukládání.

Stav dat: 22. září 2026. Grafy jsme sestavili ze zveřejněných měření Artificial Analysis a Cursoru.

Artificial Analysis: Opus před Fable i Astrou

V Artificial Analysis Intelligence Indexu má Opus 5.5 na Max zaokrouhlené skóre 58. Fable 5.1 a GPT-6 Astra mají na Max po 53 bodech, předchozí Opus 5 má 51. Výsledek tak podporuje tvrzení, že novinka posouvá schopnosti řady Opus.

Graf Intelligence Indexu: vybrané modely na Max. Opus 5.5 vede; u Opusu 5.5 a Fable 5.1 je zapnutý fallback.

Zvětšit graf. Zdroj: Artificial Analysis. Hodnoty jsou zaokrouhlené jako ve veřejném žebříčku.

Index podle metodiky verze 4.3.2 kombinuje deset hodnocení, například práci s nástroji, programování, znalosti a vědecké uvažování. Jde převážně o textové úlohy v angličtině. Skóre 58 proto neznamená 58% úspěšnost při tvorbě českého webu.

U Opusu 5.5 a Fable 5.1 je také podstatné označení with fallback. Měření počítá s možností předat odmítnutý požadavek náhradnímu modelu. Výsledek patří této konfiguraci; při jiném nastavení se může změnit.

CursorBench: co kupuje příplatek za Max

Cursor sestavuje úlohy z reálných zadání svého týmu. Zajímají ho změny napříč soubory i neúplná zadání, u kterých musí agent nejprve pochopit záměr. To je blíž běžné práci na aplikaci než izolovaná programátorská hádanka.

V aktuálním CursorBench 4.0 dosáhl Opus 5.5 na High skóre 56,0 % za průměrných 3,97 USD na úkol. Max přidal 1,8 procentního bodu, ale stál 13,43 USD. To je přibližně 3,4krát tolik.

Graf CursorBench 4.0 porovnává skóre a průměrné náklady pěti nastavení Opusu 5.5, Opusu 5 Max a Fable 5.1 Max.

Zvětšit graf. Zdroj: CursorBench 4.0.

Cena v grafu je průměrný náklad na tokeny během úkolu, včetně cache. Drobné rozdíly skóre mohou být v mezích variability měření.

Z toho bychom pro běžný vývoj vyvodili jednoduchý postup: začít na Medium nebo High a Max zkusit u problému, který na nižším nastavení zůstává nevyřešený. U chyby blokující spuštění aplikace může i malé zvýšení šance na úspěch stát za příplatek.

Levnější tokeny a levnější úkol jsou dvě různé věci

Podle ceníku Claude API stojí milion vstupních tokenů Opusu 5.5 čtyři dolary a milion výstupních dvacet. U Opusu 5 to bylo pět a dvacet pět dolarů. Token je jednotka zpracovávaného obsahu, obvykle část slova.

USD za milion tokenů

Opus 5.5

Opus 5

Vstup

4

5

Výstup

20

25

Čtení z cache

0,20

0,50

Vstup a výstup zlevnily o 20 %, opakované čtení dříve zpracovaných podkladů z cache o 60 %. Zápis do cache se účtuje zvlášť. Tabulka uvádí základní sazby přímého API, nikoli cenu předplatného Claude.

Anthropic zároveň uvádí 40% pokles nákladů na typické úlohy při výchozím nastavení. Započítává do něj nižší sazby i menší spotřebu tokenů. Právě nastavení a počet kroků vysvětlují, proč samotný ceník nestačí k odhadu účtu za hotovou práci.

Při přechodu ve vlastní aplikaci zkontrolujte API

Nová verze mění i kompatibilitu. Migrační průvodce upozorňuje, že Opus 5.5 už nepřijímá vypnuté přemýšlení ani vynucení konkrétního nástroje přes tool_choice typu tool či any. Výchozí úroveň přemýšlení je nově medium.

Změnily se také průběžné zprávy mezi použitím nástrojů. Přicházejí v blocích thinking, které ve výchozím nastavení nemají viditelný text. Vlastní rozhraní tak může přestat ukazovat průběh práce, přestože model dál pracuje.

Jak mu zadat větší úpravu webu

Anthropic ukazuje také konkrétní delší úkol: převod HAProxy z jazyka C do Rustu. Opus 5.5 jej v interním testu dokončil za 9,5 hodiny, Fable 5.1 za 12 hodin. Náklady byly u Opusu o 51 % nižší. Oba přepisy prošly téměř všemi původními regresními testy. Je to příklad od výrobce, ne náš vlastní experiment.

Pro redesign webu je podobná schopnost zajímavá při převodu stránky do nové struktury. Zadání může zahrnovat obsah, odkazy i chování na telefonu. U firemního webu zase celý průchod poptávkovým formulářem včetně situace, kdy se odeslání nepovede.

Ilustrace vytvořená AI: stejný firemní web na počítači a telefonu s modrou lupou u formuláře.

Vlastní AI ilustrace Chciweeeb znázorňuje kontrolu webu na počítači a telefonu.

V takovém zadání má mít agent prostor projít související kód, úpravu dokončit a ověřit. Do porovnání modelů bychom pak zahrnuli i čas člověka, který výsledek přebírá. Levnější běh ztrácí výhodu, pokud po něm zbude hodina ručních oprav.

Zdroje a další čtení

Komentáře

Načítání komentářů…

Přidat komentář

Pište k tématu a bez osobních údajů. Komentáře před zveřejněním kontrolujeme, i s pomocí AI.

Jméno a text schváleného komentáře budou veřejné. Ochrana osobních údajů.