Karta tytułowa z napisem „Claude Opus 5.5 przewodzi Coding Agent Index z wynikiem 66” i podtytułem „Tańsze tokeny, wyższy rachunek za zadanie” oraz trzema zaokrąglonymi kartami pod nią: Coding Agent Index 66, koszt na zadanie 13,04 USD, wzrost o 21%, i Claude Opus 5: 60 przy 10,79 USD.
Guides & Insights

Claude Opus 5.5 prowadzi w Coding Agent Index z wynikiem 66 — a rachunek za zadania rośnie o 21%

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dostawca obniżył Claude Opus 5.5 ceny tokenów o 20% 22 września 2026 r. Dwa dni później Artificial Analysis opublikowało pomiar agentów kodujących, który pokazuje, co obniżka zrobiła z rachunkiem agenta: koszt na zadanie wzrósł o 21%, do $13.04, z $10.79, które ten sam indeks nalicza za Claude Opus 5. Wynik też wzrósł — 66 w Coding Agent Index, który Artificial Analysis opisuje jako najwyższy, jaki zmierzyło, o sześć punktów przed Claude Opus 5 i o cztery przed Claude Fable 5.1 w tej samej konfiguracji. Obie te rzeczy są prawdziwe jednocześnie, a powód, dla którego są prawdziwe jednocześnie, to cała historia tego rankingu. Tańszy token, którego model zużywa więcej, to nie tańsze zadanie, a przy maksymalnym wysiłku rozumowania w długich przebiegach agenta Claude Opus 5.5 zużywa ich znacznie więcej.

Co tak naprawdę ocenia Coding Agent Index

To nie jest ranking modeli. Każdy wiersz na tej liście to para środowiska testowego i modelu — punkt kontrolny uruchamiany w konkretnym agencie kodującym, przy konkretnym ustawieniu wysiłku. Wiersz, który wszyscy cytują, to Claude Opus 5.5 przy wysiłku maksymalnym wewnątrz Claude Code, czyli środowiska, które Anthropic tworzy i pod które dostraja. Wyniki 60 dla Claude Opus 5 i 62 dla Claude Fable 5.1 pochodzą z tego samego środowiska i tego samego ustawienia wysiłku, i to właśnie czyni je uczciwym porównaniem; wiersz dla któregokolwiek z tych modeli w innym agencie kodującym to inny pomiar i nie jest tu podawany tak, jakby chodziło o ten sam.

Indeks jest wersjonowany, a wersja ma większe znaczenie niż widniejąca na nim nazwa marki. Ranking obecnie publikowany jako v1.5 uśrednia trzy ewaluacje, z których każda ma jednakową wagę i każda jest raportowana jako pass@1 uśrednione z trzech prób na zadanie:

Terminal-Bench 4.0 — praca agentowa w powłoce i wierszu poleceń: poruszanie się po systemie plików, poprawne korzystanie z narzędzi, odzyskiwanie po pośredniej awarii i ukończenie wieloetapowego przepływu pracy.

DeepSWE v1.1 — zadania z inżynierii oprogramowania, praca związana z edycją repozytorium.

SWE-Atlas-QnA — pytania o rozumienie repozytorium, w których odpowiedź znajduje się poprzez czytanie bazy kodu, a nie poprzez jej zmienianie.

Trzy oceny, jedna liczba i kolumna kosztu na zadanie wydrukowana obok niej. Ta kolumna kosztów jest powodem, dla którego ten indeks jest bardziej użyteczny niż sam wynik, a także dlatego liczba nagłówkowa jest trudniejsza do odczytania, niż się wydaje.

A two-column scoreboard comparing Claude Opus 5.5 against Claude Opus 5, both in the Claude Code harness at max reasoning effort: Coding Agent Index 66 vs 60, Terminal-Bench 4.0 63.1% vs 54.5%, DeepSWE v1.1 68.4% vs 62.5%, SWE-Atlas-QnA 66.4% vs 62.1%, cost per task $13.04 vs $10.79, and tokens per task 15.6M vs 11.4M.

Trzy komponenty i skąd pochodzi sześć punktów

Artificial Analysis opublikował wiersze komponentów wraz z wynikiem zbiorczym, a nie zmieniają się one równomiernie:

Terminal-Bench 4.063,1% dla Claude Opus 5.5 wobec 54,5% dla Claude Opus 5, wzrost o 8,6 punktu. To największa pojedyncza poprawa w zestawie.

DeepSWE v1.168,4% wobec 62,5%, wzrost o 5,9 punktu.

SWE-Atlas-QnA66,4% wobec 62,1%, wzrost o 4,3 punktu.

Uśrednij te trzy i otrzymasz 66,0, co jest wartością złożoną. Kształt wzrostu jest najciekawszy: model poprawił się najmniej w czytaniu kodu źródłowego, a najbardziej w obsłudze powłoki. Terminal-Bench to ewaluacja najbliższa temu, co ludzie rzeczywiście mają na myśli, mówiąc „agent kodujący” — długotrwała pętla, w której model wybiera polecenia, czyta dane wyjściowe i decyduje, co zrobić dalej, bez człowieka w pętli między krokami. Skok o 8,6 punktu w tym miejscu to stwierdzenie o trwałym korzystaniu z narzędzi, a nie o generowaniu kodu.

Zwróć uwagę, co to oznacza w kwestii tego, gdzie należy spodziewać się poprawy. Jeśli twoim obciążeniem jest „wyjaśnij to repozytorium”, Claude Opus 5.5 to skromne ulepszenie względem Claude Opus 5 — cztery punkty. Jeśli twoim obciążeniem jest „uruchamiaj, aż zestaw testów przejdzie, naprawiając to, co się psuje”, to największy skok w tabeli.

Screenshot of the Artificial Analysis Coding Agent Benchmarks page, showing the Coding Agent Index v1.5 composite of three equally weighted evaluations — DeepSWE v1.1 at 113 tasks by Datacurve, Terminal-Bench 4.0 at 66 tasks by Laude Institute and SWE-Atlas-QnA at 124 tasks by Scale AI — with Claude Opus 5.5 at 66 at the top of the index highlight chart and a cost-per-task bar of about $13.

Liczba wydrukowana obok rankingu: $13.04 za zadanie

Oto arytmetyka, która sprawia, że obniżka cen wygląda inaczej niż sposób, w jaki została ogłoszona. Cena katalogowa Anthropic za Claude Opus 5.5 wynosi 4,00 USD za milion tokenów wejściowych i 20,00 USD za milion tokenów wyjściowych, wobec 5,00 USD i 25,00 USD w przypadku Claude Opus 5, a odczyty z pamięci podręcznej spadły o 60%, do 0,20 USD za milion. Każda z tych pozycji jest tańsza. Szacunek Artificial Analysis dotyczący kosztu zadania przy maksymalnym wysiłku i tak jest wyższy:

Koszt na zadanie — 13,04 USD dla Claude Opus 5.5 w porównaniu z 10,79 USD dla Claude Opus 5, wzrost o 21% na tym samym indeksie, tym samym zestawie testowym, tym samym ustawieniu wysiłku.

Łączna liczba tokenów na zadanie — około 15,6 mln w porównaniu z 11,4 mln, wzrost o około 37%.

Tokeny wyjściowe na zadanie — około 333 000 wobec 137 000, ponad dwukrotnie więcej. Wyjście to kosztowny kierunek, a to właśnie ta pozycja zmieniła się najbardziej.

Wejście z pamięci podręcznej na zadanie — około 14,6 mln w porównaniu z 10,9 mln, wzrost o około 34%. Obniżka odczytu z pamięci podręcznej o 60% robi tu prawdziwą robotę; po prostu nie wystarcza, aby zrekompensować zadanie, które odczytuje o jedną trzecią więcej kontekstu.

Policz to na opublikowanych stawkach, a obraz sam się wyłoni. Weź same tokeny wyjściowe: 333 000 tokenów po 20,00 USD za milion to około $6.66 — mniej więcej połowa całego szacunku wynoszącego 13,04 USD, z jednej pozycji, która się podwoiła. Pozycja odczytu z pamięci podręcznej ma ogromny wolumen i jest niemal darmowa pod względem ceny: 14,6 mln tokenów po 0,20 USD za milion to poniżej 3 USD. Obniżka o 20% jest realna i obniżka kosztów pamięci podręcznej jest realna; przy maksymalnym wysiłku w pętli agenta po prostu przeważa nad nimi model, który myśli dłużej i pisze więcej.

Ma to bezpośrednie konsekwencje dla sposobu, w jaki planujesz budżet. Jeśli twój zespół wykonuje 500 zadań agenta kodującego dziennie przy maksymalnym wysiłku, różnica między 10,79 USD a 13,04 USD wynosi około 1 125 USD dziennie — mniej więcej 34 000 USD miesięcznie — przy tej samej liczbie zadań. To jest liczba, którą należy przedstawić osobie zatwierdzającej zmianę modelu, i nie jest to liczba, którą sugeruje obniżka ceny.

Dlaczego 5,98 USD i 13,04 USD są jednocześnie prawdziwe

Artificial Analysis opublikowało inną wartość kosztu na zadanie dla tego samego modelu kilka dni wcześniej, a czytanie obu tych wartości razem, bez etykiet, sprawia, że wyglądają one jak sprzeczność. Nie są nią — to dwie różne ewaluacje, a różnica jest pouczająca.

W Intelligence Index, opracowanie z 22 września podało koszt zadania Claude Opus 5.5 na poziomie 5,98 USD, mniej więcej na poziomie 5,86 USD dla Claude Opus 5, mimo około 119 000 tokenów wyjściowych na zadanie wobec 73 000 w Opus 5. Tam obniżka ceny i dodatkowe tokeny znoszą się niemal dokładnie. W Coding Agent Index, przy maksymalnym wysiłku, w Claude Code, ten sam model kosztuje 13,04 USD wobec 10,79 USD.

Oba są uczciwymi pomiarami różnych obciążeń. Ewaluacja odpowiadania na pytania to krótka wymiana; zadanie agenta to długa pętla wywołań narzędzi z rosnącym kontekstem, a ten wzrost kumuluje się w kierunku wyjścia, gdzie cena jest najwyższa. Praktyczna lekcja jest taka, że „czy obniżka ceny równoważy dodatkowe tokeny?” nie ma jednej odpowiedzi — zależy od długości zadania, a im dłuższe i bardziej agentowe jest zadanie, tym gorsza staje się kompensacja. Jeśli planujesz budżet na podstawie benchmarku krótkich odpowiedzi, zaniżysz rachunek za agenta.

Trzy zastrzeżenia, które powinny znaleźć się w tym wierszu

66 to wynik Claude Code, a nie wynik nagiego modelu. Indeks celowo łączy modele z harnessami, wychodząc z założenia, że routing narzędzi, logika ponowień i zarządzanie kontekstem są nierozerwalnie związane z mierzoną wydajnością agenta. Działa to tu na korzyść Anthropic, ponieważ harness, w którym model jest oceniany, jest jej własny. Artificial Analysis zapowiada, że widok porównania harnessów pojawi się wkrótce; dopóki go nie ma, nikt nie może stwierdzić, ile z sześciopunktowej przewagi to zasługa checkpointu, a ile otaczającej go otoczki.

Własny wynik Anthropic w Terminal-Bench 4.0 jest wyższy niż ten komponent i został uzyskany przez Anthropic. Materiały z premiery podają 66.4% przy xhigh poziomie wysiłku; komponent Coding Agent Index to 63.1% przy ustawieniu max, a osobny, niezależny przebieg Artificial Analysis zmierzył 59.6% we własnym środowisku testowym na tej samej wersji benchmarku. Trzy liczby, trzy konfiguracje, trzech producentów. Wartość 63.1% w wierszu powyżej to komponent samego indeksu i należy ją porównywać wyłącznie z pozostałymi liczbami w tym indeksie; 66.4% dostawcy jest raportowane przez dostawcę, niepowtórzone przez stronę trzecią i dotyczy innego ustawienia wysiłku.

Rewizja indeksu postępuje. Ten blog podawał inne wiersze Coding Agent Index na początku września, w oparciu o wcześniejszą wersję tej samej tablicy, a te starsze liczby nie są porównywalne z v1.5 — sam zestaw ewaluacyjny zmienił się, gdy Terminal-Bench 4.0 zastąpił wcześniejszą wersję. Lustra stron trzecich nadal zawierają nieaktualne migawki ze starszymi etykietami wersji. Jeśli liczba dla Claude Opus 5.5 w tym indeksie nie pochodzi z bieżącego wiersza v1.5, nie umieszczaj jej obok liczby z v1.5 i nie obliczaj delty między nimi.

Screenshot of the OrcaRouter model page for Claude Opus 5.5, model id anthropic/claude-opus-5.5, showing the 2026-09-22 date by Anthropic, a 1M-token context window with 128K max output, text plus image plus file input, input $4.00 and output $20.00 per 1M tokens, and a Python snippet calling the model through api.orcarouter.ai.

Co tak naprawdę wdrożyć

Ten ranking to liczba dla maksymalnego wysiłku, a maksymalny wysiłek to ustawienie, którego niemal nikt nie powinien stosować domyślnie. Claude Opus 5.5 ma pięć ustawień wysiłku — low, medium, high, xhigh i max — a model domyślnie działa na medium. Artificial Analysis nie opublikowało wierszy Coding Agent Index dla niższych ustawień, więc oszczędności kosztów są tam nieokreślone na tym indeksie; w Intelligence Index ten sam model na medium uzyskał 51 — tyle samo co Claude Opus 5 na max — przy $1.34 na zadanie. To właśnie w tym kierunku kryją się oszczędności, i jest to ustawienie, a nie inny model.

Realistyczny wzorzec to podział: zachowaj maksymalny wysiłek dla długich autonomicznych pętli, w których 8,6-punktowy zysk w Terminal-Bench jest tym, co kupujesz, a rutynową pracę wykonuj przy niższym wysiłku, gdzie model wciąż jest znacznie przed tym, gdzie zakończył Claude Opus 5. Ponieważ wysiłek jest parametrem żądania, a nie wdrożeniem, ten podział to reguła routingu, a oba modele znajdują się w tym samym katalogu — Anthropic przekazuje ceny katalogowe z 0% marżą, więc obniżka ceny dostawcy obowiązuje w anthropic/claude-opus-5.5 tego samego dnia, w którym zostanie ogłoszona, a porównywanie A/B obu modeli na własnych zadaniach nie wymaga drugiej umowy ani zmiany w kodzie. W szczególności dla ścieżki maksymalnego wysiłku, gdzie pojedyncze zadanie może być długim przebiegiem bez nadzoru, automatyczne przełączanie awaryjne sprawia, że zablokowany dostawca nie kosztuje cię całej pętli.

Co jest wciąż niezmierzone?

Trzy rzeczy zmieniłyby ten obraz, a żadna z nich jeszcze nie istnieje. Nie ma porównania Claude Opus 5.5 z konkurencyjnym checkpointem przy dopasowanym wysiłku i dopasowanym harnessie — każde dostępne porównanie między dostawcami to dwie tabele dostawców ustawione obok siebie. Nie opublikowano żadnego przebiegu Coding Agent Index przy średnim lub wysokim wysiłku, a właśnie tam znajdowałaby się większość ruchu produkcyjnego. A kwestia atrybucji harnessu — jaka część wyniku 66 pochodzi od modelu, a jaka od Claude Code — została przez indeks dostrzeżona i odłożona na później.

To, na podstawie czego możesz dziś działać, jest węższe i bardziej użyteczne niż ranking. Claude Opus 5.5 jest naprawdę lepszy w długotrwałej pracy agentowej sterowanej powłoką niż Claude Opus 5 — to jedyny element z dużym, spójnym, niezależnie uzyskanym zyskiem. Kosztuje też więcej na zadanie przy ustawieniu, w którym zmierzono ten zysk, o około 2,25 USD na zadanie, a obniżka ceny za token nie sięga tej liczby. Wdrażaj go przy maksymalnym poziomie wysiłku tam, gdzie pętla jest długa, a koszt awarii wysoki; wszędzie indziej zachowaj tańsze ustawienie; i sprawdź ponownie indeks, gdy pojawią się wiersze dla niższego poziomu wysiłku, ponieważ to konfiguracja, za którą większość zespołów faktycznie zapłaci. Jeśli przełączasz się wyłącznie z powodu obniżki ceny, kupujesz nie to, co trzeba — model jest tańszy za token i droższy za zadanie, a tylko jedna z tych dwóch liczb pojawia się na twojej fakturze.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie