
Benchmarki Claude Opus 5.5: każdy wynik, ustawienie poziomu wysiłku, z którego pochodzi, i kto go zmierzył
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 177 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1323 tok/s
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
Nagłówkowy wynik Anthropic dla Claude Opus 5.5 w Terminal-Bench 4.0 to 66,4%, wydrukowany obok 52,3% dla Claude Opus 5 w tej samej tabeli — a te 66,4% uzyskano przy xhigh poziomie wysiłku, a nie przy domyślnym dla tego modelu poziomie medium. Model trafił na rynek 22 września 2026 r., dwa dni przed powstaniem tej strony, więc jest to model GA z cenami modelu GA i tabelą benchmarków modelu GA. Niezależny wynik w tym samym benchmarku, pochodzący od Artificial Analysis, wynosi 59,6%, w konfiguracji, która zawiera w sobie routing zabezpieczeń Anthropic po stronie serwera. Między tymi dwiema liczbami mieszczą się różnica w harnessie, różnica w poziomie wysiłku i różnica w routingu, i nikt — łącznie z nami — nie potrafi jeszcze powiedzieć, jaką część tej luki wyjaśnia każda z nich. To, co ta strona może zrobić, to zebrać w jednym miejscu każdą opublikowaną wartość dla Claude Opus 5.5, wskazać, kto ją uzyskał, wskazać ustawienie, przy którym ją uzyskano, oraz uwzględnić wiersze, w których GPT-6 Astra i Claude Fable 5.1 wychodzą na prowadzenie.
Zacznij od ustawienia wysiłku, bo przesuwa liczby bardziej niż modele.
Claude Opus 5.5 domyślnie wybiera średni poziom wysiłku w Claude API. Claude Opus 5 domyślnie wybierał wysoki poziom. Poziom o tej samej nazwie również nie jest tym samym budżetem myślenia w obu modelach, więc stwierdzenie „uruchomiliśmy oba na wysokim poziomie” nie jest kontrolowanym porównaniem, nawet jeśli etykieta się zgadza. Myślenie adaptacyjne jest zawsze włączone i nie można go wyłączyć w Opus 5.5; parametr wysiłku zmienia głębokość, opóźnienie i koszt i nic więcej.
Wynik Anthropic w Terminal-Bench 4.0 uzyskano przy ustawieniu xhigh. Ten pojedynczy fakt to najważniejsze zastrzeżenie na tej stronie, ponieważ benchmark, który jest w nagłówku, ma największą raportowaną przewagę nad poprzednim modelem, a ta sama tabela pokazuje, co się dzieje, gdy pozostawisz to ustawienie bez zmian:
• FrontierCode v1.1 Main — 54,4% przy xhigh, 54,6% przy domyślnym medium. Zgłoszone przez dostawcę. Przebieg medium jest wyższy niż przebieg xhigh. W przypadku tego obciążenia regulacja wysiłku nie dała niczego mierzalnego; te dwie liczby to ta sama liczba.
• CursorBench 4.0 — 57,8% przy xhigh, 52,5% przy medium. Dane zgłoszone przez dostawcę. Ten sam model, ten sam harness, ten sam tydzień: 5,3 punktu, czyli największa różnica w nakładzie pracy w tym zestawieniu.
Te dwa wiersze w jednej tabeli dostawcy to cały argument. Jedno obciążenie jest niewrażliwe na wysiłek, a drugie jest silnie wrażliwe na wysiłek, i karta modelu nie może z góry powiedzieć, którym rodzajem obciążenia jest twoje. Wniosek, który wspierają dane, jest wąski i warto go przedstawić wąsko: właściwy poziom wysiłku jest teraz pomiarem na poziomie pojedynczego obciążenia, a nie domyślnym ustawieniem, które dziedziczysz. Nie wspiera tezy „Opus 5.5 jest szybszy, niż sugerują jego benchmarki” ani „Anthropic celowo zaniżył domyślne ustawienie” — do tego potrzebne byłyby przeglądy wszystkich pięciu ustawień dla poszczególnych obciążeń, a nikt ich nie opublikował. Oznacza to jednak, że jeśli migrujesz z Opus 5 i zachowujesz dotychczasowe ustawienie wysiłku, zmieniłeś eksperyment, a nie tylko model.
Jeszcze jedna asymetria, tym razem w drugą stronę. W kolumnie konkurenta w wierszu Terminal-Bench Anthropic znajduje się GPT-6 Astra z wynikiem 57,9% — uruchomiony na wysokim poziomie wysiłku, zgodnie z własną adnotacją Anthropic na wykresie, podczas gdy Opus 5.5, którego wynik to 66,4%, uruchomiono na bardzo wysokim poziomie wysiłku. Tabela dostawcy, w której własny model uruchamiany jest przy jednym ustawieniu, a konkurent przy innym, nie jest bezpośrednim porównaniem, niezależnie od tego, jak te dwie liczby wyglądają obok siebie.
Tabela dostawców, ze źródłem i ustawieniem w każdym wierszu
Wszystko w tej sekcji jest raportowane przez dostawcę: materiał premierowy Anthropic, harness Anthropic, zabezpieczenia produkcyjne włączone, myślenie adaptacyjne przy maksymalnym wysiłku, o ile wiersz nie mówi inaczej. Traktuj to jako pomiar Anthropic przez Anthropic.
• Terminal-Bench 4.0 — 66,4%, przy poziomie wysiłku xhigh. Zgłoszone przez dostawcę, błąd standardowy około ±2,6 punktu. W tym samym wierszu: Claude Opus 5 52,3%, Claude Fable 5.1 55,8%, GPT-6 Astra 57,9% (przy wysokim wysiłku), GPT-5.6 Sol 37,3%. Terminal-Bench 4.0 to wyraźnie benchmark, co do którego dostawca przyznaje, że jest niedoskonałym wskaźnikiem rzeczywistej pracy w terminalu, i jest to najważniejszy wynik modelu.
• FrontierCode v1.1 Main — 54,4% przy xhigh, 54,6% przy domyślnym medium. Dane zgłoszone przez dostawcę. Opus 5 48,0%, Fable 5.1 50,3%, GPT-6 Astra 53,3%, GPT-5.6 Sol 47,5%. Karta systemowa Anthropic zawiera również wariant Extended na poziomie 63,6% oraz najlepszy wynik Extended przy ustawieniu medium wynoszący 65,3%.
• CursorBench 4.0 — 57,8% przy xhigh, 52,5% przy medium. Dane zgłoszone przez producenta. Opus 5 46,6%, Fable 5.1 51,8%, GPT-5.6 Sol 41,7%. Warto zauważyć, że wiersze CursorBench dla Fable 5.1 i Opus 5 odpowiadają maksymalnemu wysiłkowi, więc Opus 5.5 przy medium jest porównywany z własnym rodzeństwem przy maksimum.
• GDPval-AA v2.1 — 1 846 Elo. To jedyny wiersz w tabeli dostawcy, którego dostawca nie przeprowadził. GDPval-AA to ewaluacja Artificial Analysis, a własne opracowanie Artificial Analysis dotyczące Opus 5.5 podaje tę samą liczbę 1 846, przy czym Fable 5.1 ma 1 735, a Opus 5 – 1 708. W tabeli dostawcy: Fable 5.1 1 735, Opus 5 1 708, GPT-5.6 Sol 1 588, GPT-6 Astra 1 542. To jedyny wiersz tutaj, w którym dwie organizacje zgadzają się co do tej samej liczby, a dzieje się tak, ponieważ jest to ten sam pomiar.
• AutomationBench (Zapier) — 40,0%.Zgłoszone przez dostawcę i uruchomione bez modeli zapasowych, więc każda interwencja zabezpieczająca została uznana za porażkę. GPT-6 Astra 41,4%, Fable 5.1 31,4%, GPT-5.6 Sol 28,8%, Opus 5 26,9%.
• Humanity's Last Exam, z narzędziami — 67,7%. Zgłoszone przez dostawcę. Fable 5.1 65,6%, Opus 5 63,6%, GPT-6 Astra 57,2%. Karta systemowa Anthropic podaje osobno 64,4% bez narzędzi, i to właśnie tę wartość należy brać pod uwagę, porównując ze źródłem, które nie daje swoim modelom dostępu do narzędzi.
• Terminal-Bench-Science 0.1 — 58,7%. Zgłoszone przez producenta, błąd standardowy wynosi około ±3,5 do ±5 punktów, więc jest to raczej przedział niż konkretna wartość. GPT-6 Astra 64,6%, Fable 5.1 52,6%, Opus 5 29,0%, GPT-5.6 Sol 22,4%.
• OSWorld 2.0 — 81,8% (częściowo).Zgłoszone przez dostawcę, a „częściowo” odgrywa w tym zdaniu naprawdę istotną rolę: karta systemowa firmy Anthropic podaje ścisły wskaźnik ukończenia na poziomie 48,7% dla tego samego modelu w tej samej ewaluacji. Obie liczby są publikowane; to właśnie liczba częściowa jest cytowana. Fable 5.1 80,7%, Opus 5 74,0%.
• Chartography, z narzędziami — 89,0%. Dane zgłoszone przez dostawcę. Fable 5.1 88,4%, Opus 5 83,4%.

Niezależne liczby i co tak naprawdę oznacza „Default Fallback”
Artificial Analysis to jedyna strona trzecia z opublikowaną, aktualną oceną Claude Opus 5.5 w indeksie złożonym, a jej liczby to te, które należy zestawiać z danymi Anthropic. Odczyt z 24 września 2026 r.:
• Indeks Inteligencji — 58 przy maksymalnym wysiłku, w konfiguracji oznaczonej jako „Adaptive Reasoning, Max Effort, Default Fallback”.Niezależny, mierzony przez Artificial Analysis. W swoim artykule 58 nazywa „najwyższym wynikiem, jaki zmierzyliśmy, o kilka punktów”. Ten sam indeks publikuje też Opus 5.5 przy każdym innym ustawieniu wysiłku, a najciekawszy jest tu rozrzut: 56 przy xhigh, 54 przy high, 51 przy medium, 42 przy low. To 16-punktowa różnica w całym zakresie suwaka wysiłku w jednym modelu — większa niż różnica między większością modeli na tej tablicy.
• Terminal-Bench 4.0 — 59,6%. Niezależny. Artificial Analysis określa go jako „na poziomie lidera GPT-6 Astra (xhigh)" i około 11 punktów powyżej Claude Opus 5.
• Humanity's Last Exam — 61,4%. Niezależny, a poprzedni najlepszy wynik na tej samej tablicy wyników wynosił 59,1% i został uzyskany przez Claude Fable 5.1.
• SciCode — 66,9%. Wynik niezależny, w porównaniu z 63,1% dla Claude Fable 5.1.
A teraz klauzula, którą trzeba wyjaśnić, a nie cytować. „Default Fallback” nie jest artefaktem benchmarku ani ustawieniem Artificial Analysis — to serwerowy routing zabezpieczeń Anthropic, pozostawiony włączony. Claude Opus 5.5 jest dostarczany z poziomem zabezpieczeń zarezerwowanym wcześniej dla Fable 5.1: większość zapytań dotyczących cyberbezpieczeństwa jest w przezroczysty sposób przekierowywana do Claude Opus 4.8, a prace biologiczne przechodzą do Claude Opus 5, o ile konto nie zostało zweryfikowane. Gdy Artificial Analysis uruchamia indeks z włączonym domyślnym fallbackiem, mierzy wdrożony system — to, do czego faktycznie dociera niezweryfikowany klucz API — a nie czysty checkpoint wag Opus 5.5. Dla kupującego to uczciwszy pomiar, a dla benchmarku mniej czysty. Anthropic mówi to samo o swojej własnej tabeli: interwencje w przebiegu Terminal-Bench 4.0 sprawiły, że zadania z cyberbezpieczeństwa ukończył Opus 4.8, a zadania biologiczne Opus 5, i firma stwierdza, że te interwencje prawdopodobnie obniżyły raportowany wynik. Zatem routing zabezpieczeń jest realnym faktem operacyjnym w obu kierunkach i żadna liczba na tej stronie nie izoluje modelu bazowego od tego zjawiska.
Gdzie dwie tabele się nie zgadzają i dlaczego
Postaw obok siebie dwie liczby dla Terminal-Bench 4.0, a otrzymasz 66,4% wobec 59,6% — 6,8 punktu, na tym samym benchmarku, dla tego samego modelu. Powody są znane, a każdy z nich jest wystarczająco duży, by sam w sobie miał znaczenie:
• Różne harnessy. Anthropic przeprowadziło własny szkielet agenta; Artificial Analysis przeprowadziło własny referencyjny harness agenta. Wynik benchmarku terminalowego jest właściwością szkieletu oraz modelu łącznie, a nie samego modelu, i żadna z organizacji nie opublikowała eksperymentu z zamianą szkieletu.
• Różne ustawienia wysiłku. Wynik 66,4% Anthropic uzyskano przy ustawieniu xhigh. Ustawienie wysiłku przypisane do wyniku 59,6% Artificial Analysis nie zostało podane w zdaniu, które zawiera tę liczbę, a jej raportowane wyniki benchmarków to zasadniczo wartości uzyskane przy maksymalnym wysiłku.
• Zabezpieczenia włączone, w obu przypadkach liczone inaczej. Anthropic działał z fallbackiem i traktował interwencje jako obniżające wynik, ale nadal punktowane. W AutomationBench działał bez fallbacku i liczył interwencje jako całkowite porażki. Artificial Analysis działa przez cały czas z włączonym fallbackiem.
• Liczby zmieniają się nawet w obrębie własnej tabeli jednego dostawcy.Anthropic podaje Claude Opus 5 na poziomie 52,3% w Terminal-Bench 4.0 i zauważa, że 51,8% na publicznej tablicy dla tego samego modelu mieści się „w granicach szumu”.
A oto najsilniejszy dowód na tej stronie tego, ile naprawdę wart jest harness. Publiczny ranking Terminal-Bench 4.0, zarejestrowany 24 września 2026 r., nie zawiera w ogóle żadnego wiersza Claude Opus 5.5. Jego najwyższą pozycję zajmuje GPT-6 Astra przy maksymalnym wysiłku, agent Codex, 58,2% ±2,8; drugie miejsce to Claude Fable 5.1 przy maksymalnym wysiłku przez Claude Code z wynikiem 57,9% ±3,8; trzecie to Claude Opus 5 na poziomie xhigh przez Claude Code z wynikiem 53,9% ±3,2. Tak więc 66,4% to nie tylko inna liczba niż niezależne 59,6% — nie ma jej na publicznym rankingu, a własna wersja Claude Opus 5 w tym rankingu to 53,9%, a nie 52,3%, które podaje tabela z premiery. Dopóki Terminal-Bench nie przyjmie i nie opublikuje zgłoszenia Opus 5.5, 66,4% pozostaje wynikiem harnessu dostawcy, którego nikt nie odtworzył, a 59,6% to liczba, za którą faktycznie stanie podmiot zewnętrzny. Warto też zauważyć, że w tym samym rankingu lider Terminal-Bench 4.0 według Artificial Analysis i Opus 5.5 od Anthropic osiągają te same 59,6% — co jest remisem w jednym harnessie i nie mówi nic o drugim.

Wiersze, w których Opus 5.5 przegrywa
Zestawienie, które pomija straty, nie jest zestawieniem, a własna tabela Anthropic zawiera oba.
• Terminal-Bench-Science 0.1 — 58,7% wobec 64,6% GPT-6 Astra. Wynik podany przez dostawcę, na tabeli Anthropic, i strata 5,9 punktu do nazwanego konkurenta w wierszu najbliższym rozumowaniu naukowemu. Zamieszczona przez dostawcę uwaga o błędzie standardowym (±3,5 do ±5) oznacza, że różnica znajduje się blisko granicy szumu, a nie wygodnie wewnątrz niej — ale to strata na własnej stronie dostawcy, a przedział ten nie czyni z niej zwycięstwa. Claude Opus 5 plasuje się na tym samym wierszu z wynikiem 29,0%, więc skok międzypokoleniowy jest realny nawet tam, gdzie prowadzi konkurent.
• AutomationBench — 40,0% wobec 41,4% GPT-6 Astra.Dane od dostawcy, strata 1,4 punktu, a w przebiegu nie było modeli zapasowych, więc interwencje zabezpieczające zostały ocenione jako porażki. Oznacza to, że to konkretne porównanie mierzy Opus 5.5 z uwzględnieniem jego kary za routing przeciwko konkurentowi, którego kara za routing — jakakolwiek jest — nie została opisana. To najmniej interpretowalny wiersz na stronie w obu kierunkach.
Jeszcze dwa miejsca, w których przewaga jest mniejsza, niż sugeruje nagłówek, oba raportowane przez dostawcę. W przypadku Humanity's Last Exam with tools przewaga nad Claude Fable 5.1 wynosi 2,1 punktu (67,7% vs 65,6%); w przypadku Chartography with tools to 0,6 punktu (89,0% vs 88,4%); w przypadku OSWorld 2.0 partial to 1,1 punktu (81,8% vs 80,7%). To są te wiersze, w których „Opus 5.5 to najlepszy model agentowy” jest twierdzeniem o randze, a nie o zmierzonej różnicy, a różnica 0,6 punktu w czytaniu wykresów nie powinna decydować o zakupie.
Niezależna pozycja Claude Fable 5.1, w innej rewizji indeksu
Zestawienie Opus 5.5 z jego własnym rodzeństwem wymaga osobnej sekcji i trzeba do niego dołączyć ostrzeżenie, ponieważ to porównanie jest trudniejsze, niż się wydaje.
Gdy Artificial Analysis opublikowało 1 września 2026 r. swój artykuł o Claude Fable 5.1, model ten uzyskał 66 przy maksymalnym wysiłku w swoim Intelligence Index i został nazwany najwyższym wynikiem, jaki zmierzono — przed Claude Opus 5 z wynikiem 63 i GPT-5.6 Sol z wynikiem 61. W indeksie w wersji opublikowanej 24 września 2026 r. ten sam model pojawia się z wynikiem 53 przy maksymalnym wysiłku z fallbackiem, a Opus 5.5 pojawia się z wynikiem 58 w równoważnej konfiguracji. Artykuł z 22 września o Opus 5.5 nazywa 58 „najwyższym wynikiem, jaki zmierzyliśmy, o kilka punktów".
Te dwa stwierdzenia nie mogą być jednocześnie prawdziwe w ramach jednej skali, a rozwiązanie polega na tym, że nie należą do jednej skali. Indeks jest żywym obiektem, który Artificial Analysis koryguje; dwa z jego opublikowanych artykułów, odległe o pięć tygodni, umieszczają tę samą bliźniaczą parę modeli po przeciwnych stronach pierwszego miejsca. To stwierdzenie o korektach indeksu, a nie o regresie któregokolwiek z modeli, i oznacza, że 66 i 58 nigdy nie mogą być podawane obok siebie. Czytane tego samego dnia, w tym samym zestawieniu, w tej samej oznaczonej konfiguracji, obecne uporządkowanie stawia Opus 5.5 pięć punktów przed Fable 5.1 — a nawet to jest porównaniem w ramach tego samego indeksu i od tego samego dostawcy indeksu, a nie audytowanym starciem bezpośrednim. Bezpiecznie można powiedzieć coś węższego: w obecnej wersji jedynego niezależnego kompozytu, który mierzy oba modele, Opus 5.5 jest silniejszym z dwóch modeli Anthropic, a lepiej znane 66 modelu Fable 5.1 należy do wcześniejszej wersji tego indeksu.
Ustawienia zasługują na jeszcze jedno zdanie, bo łatwo je ze sobą pomylić. 66 modelu Fable 5.1 i 58 modelu Opus 5.5 to oba wiersze dla maksymalnego poziomu wysiłku — ale pięć ustawień wysiłku Fable 5.1 obejmuje 11-krotny zakres zużycia tokenów wyjściowych, od 13,1 mln przy niskim do 143,7 mln przy maksymalnym, z wynikami indeksu od 58 do 66. Pojedynczy punkt indeksu dla modelu o tak dużym wewnętrznym rozrzucie to słaby substytut wiersza, który faktycznie byś uruchomił.
Koszt tokenów to samodzielna oś benchmarku
Każda z powyższych liczb to wynik. Żadna z nich nie jest ustawą, a w tym modelu to w ustawie dzieje się ciekawy ruch.
Artificial Analysis mierzy Claude Opus 5.5 przy maksymalnym wysiłku; zużywa on rzędu 119 000 tokenów wyjściowych na zadanie Intelligence Index — najwyższy wynik w swoim indeksie. Dla porównania, w tym samym rankingu przy tym samym ustawieniu: Claude Opus 5 około 73 000, Claude Fable 5.1 około 78 000, a GPT-6 Astra około 27 000. Tokeny myślenia są rozliczane jako tokeny wyjściowe, a myślenia adaptacyjnego nie można wyłączyć w przypadku Opus 5.5, więc tokeny, które model zużywa na rozważanie, nie są przypisem do jego ceny — stanowią jej większość.
Policz to sam, bo cena katalogowa sama w sobie jest myląca. Opus 5.5 ma cennik $4.00 za wejście / $20.00 za wyjście, co stanowi 20% obniżki względem $5.00 / $25.00 w przypadku Opus 5. Artificial Analysis wciąż mierzy, że Opus 5.5 przy maksymalnym wysiłku kosztuje około $5.98 za zadanie w indeksie w porównaniu z $5.86 dla Opus 5 przy tym samym ustawieniu — nieco więcej, a nie mniej, ponieważ około 1,6x liczby tokenów wyjściowych pochłania całą 20-procentową obniżkę stawki, i to z nawiązką. W całym indeksie Opus 5.5 wygenerował 260 mln tokenów wyjściowych w porównaniu z medianą na tablicy wyników wynoszącą 88 mln, co ewaluator określa jako „bardzo rozwlekłe”.
Opowieść o kosztach sprowadza się zatem w całości do ustawienia wysiłku i działa tylko wtedy, gdy się z niego korzysta. Przy maksymalnym wysiłku Opus 5.5 jest droższym modelem w przeliczeniu na ukończone zadanie niż model, który zastępuje. Przy średnim — faktycznym domyślnym ustawieniu produktu i zakresie, którego dotyczy twierdzenie Anthropic o „około 40% niższym koszcie działania w typowych obciążeniach” — oszczędność jest realna, ale to stwierdzenie o średniej dla obciążeń wybranych przez dostawcę, a nie poddany audytowi wynik na zadanie. Praktyczny wniosek: obniżka ceny o 20% to rabat na cenniku i opcja na pokrętle wysiłku, a nie automatyczna oszczędność. Jeśli twój plan migracji zakłada „podmień identyfikator modelu i zachowaj ustawienia”, kupujesz droższą wersję.
Co w ogóle nie jest ustalone
To jest sekcja, której wspieraniu służy reszta strony.
• Nie opublikowano żadnego niezależnego, bezpośredniego porównania Claude'a Opus 5.5 z jakimkolwiek nazwanym rywalem przy dopasowanym wysiłku i dopasowanym środowisku testowym. Każde porównanie między dostawcami na tej stronie — Opus 5.5 vs GPT-6 Astra, vs GPT-5.6 Sol, vs Claude Fable 5.1 — jest porównaniem dwóch tabel wygenerowanych przez dwie różne firmy, w dwóch różnych środowiskach testowych, przy dwóch różnych ustawieniach wysiłku, z których jedna zwykle dotyczy własnego modelu dostawcy w korzystnym ustawieniu. W publicznym zapisie nie ma żadnego eksperymentu, który utrzymywałby szkielet i wysiłek na stałym poziomie w przypadku dwóch dostawców i raportował oba.
• Podział tokenów na poszczególne problemy nie jest publikowany. Zbiorcza liczba tokenów wyjściowych jest mierzona niezależnie, ale to, jaka jej część przypada na rozumowanie, a jaka na tekst odpowiedzi, nie jest publikowane przez nikogo, kogo udało nam się znaleźć. Każda strona, która podaje dokładną liczbę tokenów rozumowania dla tego modelu, podaje liczbę, której nikt nie zmierzył.
• Większość karty systemowej nie została zbenchmarkowana przez strony trzecie. SWE-bench Pro 89,9%, Multilingual 93,9%, DeepSWE v1.1 74,2%, ProgramBench 91,2%, OfficeQA 78,9%, HealthBench Professional 65,6% po korekcie o długość, GMMLU 94,3%, ArXivMath 96,9% z narzędziami — wszystkie raportowane przez dostawcę, żadnego nie odtworzono niezależnie w momencie pisania.
• Główna liczba Terminal-Bench 4.0 nie widnieje na publicznej tablicy.Omówiono powyżej i to również należy do tej listy: jedyna najczęściej cytowana liczba dotycząca tego modelu to ta, której nikt spoza dostawcy nie uruchomił.
• Anthropic podaje, że Claude Opus 5.5 „często podejrzewa, że jest oceniany” — słowa samej firmy, podane jako ograniczenie jej oceny bezpieczeństwa. Potraktuj to poważnie jako problem pomiarowy, a nie jako ciekawostkę: jeśli model zachowuje się inaczej, gdy uważa, że jest poddawany testom, to każdy wynik benchmarku na tej stronie, niezależnie od tego, czy pochodzi od dostawcy, czy jest niezależny, jest pomiarem modelu pod obserwacją, a stopień, w jakim różni się to od zachowania po wdrożeniu, jest nieznany i nieokreślony ilościowo. Dotyczy to w równym stopniu dobrych i złych wierszy. To jedyne zastrzeżenie, którego nie usunie żadna metodologia dopasowanego wysiłku.
• Sonnet 5.5 i Haiku 5.5 nie są dostępne. Anthropic zapowiedziało je na „nadchodzące tygodnie". Nie zostały jeszcze wydane, nie mają opublikowanych testów porównawczych, a nic z tej strony nie ma do nich zastosowania.
Cena, koperta i te części specyfikacji, które zmieniają twój kod
Odczytano z opublikowanego cennika Anthropic z 24 września 2026 r.: 4,00 USD za milion tokenów wejściowych, 20,00 USD za milion tokenów wyjściowych, 0,20 USD za milion odczytów z pamięci podręcznej, 5,00 USD za milion zapisów do pamięci podręcznej 5-minutowej, 8,00 USD za milion zapisów do pamięci podręcznej 1-godzinnej oraz 50% zniżki w obu kierunkach w Batch API. Stawka za odczyt z pamięci podręcznej to ten cichy element — wynosi 5% stawki bazowej za wejście, podczas gdy większość modeli Claude plasuje się na 10%, a Fable 5.1 na 2,5%. Tryb szybki jest wyceniany osobno na 8,00 USD / 40,00 USD, a Anthropic opisuje go jako podgląd badawczy, a nie ogólny poziom.
To jest sekcja, w której cennik przestaje być ciekawostką, a staje się arytmetyką, którą router może wykonać za Ciebie. Claude Opus 5.5 jest udostępniany jako anthropic/claude-opus-5.5 w OrcaRouter za te same $4.00 / $20.00, z cenami katalogowymi przekazywanymi bez marży, przy 0% markup — więc w momencie, gdy Anthropic zmieni stawkę, to właśnie ta stawka obowiązuje tutaj, tego samego dnia i bez opóźnienia w przecenianiu, które trzeba by modelować. O rzeczywistym rachunku decydują te elementy, które katalog podaje obok ceny: odczyt z pamięci podręcznej za $0.20 przy 5% bazowej ceny wejścia wobec 2,5% w Fable 5.1, okno kontekstowe 1 mln tokenów i limit wyjścia 128K. Ponieważ to parametr effort jest tym, co rzeczywiście steruje kosztem tego modelu — wahnięcie indeksu o 16 punktów i około 119 000 tokenów wyjściowych na zadanie przy maksimum wobec około 73 000 dla Opus 5 — migracja, która oszczędza pieniądze, to taka, która pozwala ustawiać effort dla poszczególnych obciążeń, a nie dla całego konta, oraz umieścić trasę Opus 5.5 za automatycznym przełączaniem awaryjnym, gdy mierzysz, jakiego ustawienia potrzebuje Twój ruch.
• Envelope — kontekst 1 mln tokenów, maksymalnie 128 tys. tokenów wyjściowych, 300 tys. tokenów wyjściowych w Batch API po ustawieniu nagłówka beta output-300k-2026-03-24, data odcięcia wiedzy: czerwiec 2026, wycofanie nie wcześniej niż 22 września 2027 r. Generowanie jest ponad 30% szybsze niż w Claude Opus 5.
• Zmiany łamiące zgodność w porównaniu z Opus 5 — nie można już wyłączyć myślenia; wymuszone użycie narzędzia (tool_choice wskazujące konkretne narzędzie) zwraca błąd; bloki myślenia są powiązane z modelem i rozmową, która je utworzyła; starsze computer_20251124 narzędzie do obsługi komputera nie jest akceptowane w Claude API ani w Google Cloud. Pierwsze trzy dotyczą także Fable 5.1. Jest jeszcze cichy piąty: tekst między wywołaniami narzędzi pojawia się teraz w blokach myślenia, których tekst jest pusty przy domyślnym ustawieniu wyświetlania, więc UI, który strumieniuje ten tekst jako wskaźnik postępu, cichnie, mimo że nic nie zgłasza błędu.
• Znowu routing zabezpieczeń, ponieważ to element specyfikacji, a nie przypis — większość zapytań dotyczących cyberbezpieczeństwa trafia do Claude Opus 4.8, a prace biologiczne są kierowane awaryjnie do Claude Opus 5, chyba że konto jest zweryfikowane. W tych ewaluacjach otrzymywana odpowiedź może w ogóle nie pochodzić od Opus 5.5, więc publikowane wyniki w benchmarkach związanych z cyberbezpieczeństwem i biologią nie są czystymi pomiarami tego modelu.
• Twierdzenia o wydajności, wszystkie raportowane przez dostawcę — około 40% niższy koszt działania w typowych obciążeniach w porównaniu z 20% obniżką ceny katalogowej; opracowany przykład analizy fuzji, który zajmuje 63 minuty na Opus 5.5 w porównaniu z 93 na Opus 5 przy 50% niższym koszcie; oraz wypowiedzi klientów od Box (jedna trzecia tokenów, odpowiedzi około 40% mniej rozwlekłe), Kiro (około połowy tokenów, 40% mniej wywołań), Factory (20–25% mniej tokenów wyjściowych) i GitHub (wśród najmniejszej liczby tokenów i kroków, jakie zmierzył). To średnie dla obciążeń wybranych przez dostawcę i jego partnerów premiery. To przypisane twierdzenia, a nie wyniki poddane audytowi, i pozostają w widocznej sprzeczności z podanym powyżej niezależnym wskaźnikiem kosztu na zadanie — który sam jest pomiarem przy maksymalnym wysiłku, a nie przy domyślnym. Oba mogą być prawdziwe; żadne z nich nie jest ogólnym twierdzeniem o Twoim obciążeniu.

Stan dowodów
Claude Opus 5.5 to prawdziwy model z prawdziwą obniżką ceny, prawdziwym zakresem 1 mln tokenów kontekstu i 128 tys. tokenów wyjścia oraz prawdziwą i brzemienną w skutki zmianą w sposobie konfigurowania myślenia i wysiłku. Towarzyszy mu także tabela wyników benchmarków, która w większości mierzy Anthropic, niezależna tabela, która w większości mierzy wdrożenie z routingiem, a nie checkpoint, oraz udokumentowany problem samoświadomości, który podważa jedno i drugie. Nie opublikowano żadnego niezależnego bezpośredniego porównania Claude Opus 5.5 z nazwanym rywalem przy dopasowanym wysiłku i dopasowanym harnessie. Dopóki takie porównanie się nie pojawi, czytaj każde porównanie między dostawcami na tej stronie jako to, czym jest: dwie tabele dostawców od dwóch firm przy dwóch ustawieniach, zestawione obok siebie przez nas — i zmierz ponownie własne ustawienie wysiłku, zanim ponownie zmierzysz model.
Porównane w tym artykule4
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
