
Przewodnik po API Claude Opus 5.5: identyfikator modelu, cztery zmiany łamiące kompatybilność i milcząca piąta
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 177 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1323 tok/s
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
Zmień ciąg modelu z claude-opus-5 na claude-opus-5-5a twój kod nadal się kompiluje, nadal przechodzi kontrolę typów i nadal zalicza to, co uchodzi za zestaw testów. Potem w produkcji zwraca 400. Cztery kształty żądań, które Claude Opus 5 akceptował, są odrzucane od razu przez Claude Opus 5.5, a piąta zmiana nie psuje zupełnie niczego — i właśnie dlatego to ona dotrze do twoich użytkowników. To jest dokumentacja integracyjna dla tego modelu: identyfikator, powierzchnie, które go obsługują, kontrakt żądań, cztery błędy, cichy piąty oraz to, jak teraz działa parametr effort. Tam, gdzie zachowanie pokrywa się z Claude Fable 5.1, zespół, który już tam zmigrował, wykonał część pracy, więc każda z poniższych zmian mówi, czy dotyczy również tego modelu.
Wszystko, co tu podano, pochodzi z własnej dokumentacji Anthropic dotyczącej Claude'a z 24 września 2026 r., dwa dni po premierze modelu. Twierdzenia dostawcy są oznaczane jako twierdzenia dostawcy, niezależne liczby jako niezależne, a tych dwóch nigdy nie przedstawia się przy tym samym ustawieniu wysiłku, jakby były porównywalne.
Identyfikator modelu i miejsce, w którym jest serwowany
Identyfikator to claude-opus-5-5 — stały identyfikator modelu bez sufiksu daty, ten sam schemat co claude-opus-5. Nie ma osobnej formy przypiętej migawki, którą należałoby przyjąć, ani aliasu, który wskazywałby na coś innego.
Przegląd modeli Anthropic wymienia pięć powierzchni, z następującymi dokładnymi ciągami znaków:
• Claude API — claude-opus-5-5, dostępny dla wszystkich klientów.
• Amazon Bedrock — anthropic.claude-opus-5-5 (jedyny interfejs, który dodaje prefiks dostawcy).
• Claude Platform on AWS — claude-opus-5-5, z użyciem identyfikatorów API Claude zamiast identyfikatorów w stylu Bedrock.
• Google Cloud — claude-opus-5-5.
• Microsoft Foundry — claude-opus-5-5; nazwa wdrożenia to ta, którą wysyłasz, a Foundry postępuje zgodnie z harmonogramem cyklu życia Claude API.
Dwa z tych pięciu mają większe znaczenie niż reszta tej sekcji. Amazon Bedrock i Google Cloud ustalają własne daty cyklu życia i wycofania, a — jak pokazują poniższe zmiany niekompatybilne — Bedrock jest także jedyną platformą, na której stare narzędzie do korzystania z komputera nadal działa. Jeśli korzystasz z Bedrock, nie uczestniczysz w tej samej migracji co wszyscy inni.
Co teraz musi spełniać każde żądanie
Przewodnik migracji Anthropic określa kontrakt w formie listy, a lista jest wystarczająco krótka, by sprawdzić na jej podstawie własnego klienta. Niezależnie od tego, z którego modelu przechodzisz, żądanie do claude-opus-5-5 musi:
• Wyślij albo brak pola thinking, albo thinking: {"type": "adaptive"} — oba warianty są równoważne, ponieważ myślenie adaptacyjne jest zawsze włączone.
• Kontroluj głębokość myślenia za pomocą effort, jedynego parametru żądania, który to umożliwia; obsługiwane są wszystkie pięć poziomów, a domyślny to medium.
• Użyj tool_choice o wartości {"type": "auto"} (domyślnej) lub {"type": "none"}. Wymuszanie narzędzia jest odrzucane.
• Pomiń temperature, top_p i top_k, albo pozostaw je na wartościach domyślnych. Każda inna wartość jest odrzucana, w tym modelu tak jak we wszystkim od Claude Opus 4.7 wzwyż.
• Nie kończ wiadomości wstępnie wypełnioną turą asystenta; to zostało już odrzucone w Opus 4.6 i późniejszych.
• Zadeklaruj korzystanie z komputera jako computer_toolset_20260801 zestaw narzędzi w Claude API i Google Cloud.
• Nie wysyłaj nagłówka beta okna kontekstu. Okno kontekstu 1M jest domyślne, a nagłówek napisany dla starszego modelu nie ma efektu.
Tam, gdzie przewodnik mówi, że ustawienie jest odrzucane, API zwraca HTTP 400. Na tym polega cały tryb awarii przejścia na ten model: to nie pogorszone dane wyjściowe, nie ostrzeżenie w logu — to żądanie, które nigdy nie zostanie wykonane.

Cztery zmiany łamiące kompatybilność
1. Nie można wyłączyć myślenia
Myślenie adaptacyjne jest zawsze włączone. thinking: {"type": "disabled"} zwraca błąd 400, podobnie jak ręcznie ustawiony budżet — thinking: {"type": "enabled", "budget_tokens": N}. Tekst błędu podaje typ, który został wysłany, a następnie podaje jego zamiennik:
• „thinking.type.disabled” nie jest obsługiwane dla tego modelu. Użyj „thinking.type.adaptive” i „output_config.effort”, aby kontrolować zachowanie myślenia.
• "thinking.type.enabled" nie jest obsługiwany dla tego modelu. Użyj "thinking.type.adaptive" i "output_config.effort", aby kontrolować zachowanie myślenia.
Praktyczną konsekwencją nie jest sam błąd, lecz to, co dzieje się po jego naprawieniu. W Claude Opus 4.8 i wcześniejszych wersjach żądanie bez pola thinking działało bez myślenia. W Claude Opus 5.5 każde żądanie angażuje myślenie, a max_tokens pozostaje twardym limitem obejmującym myślenie oraz tekst odpowiedzi. Tokeny myślenia są rozliczane jako tokeny wyjściowe, nawet jeśli tekst myślenia nigdy nie zostanie Ci zwrócony. Endpoint, który wcześniej działał bez myślenia, może zatem po „naprawie” generować więcej tokenów wyjściowych na żądanie niż przed nią. Zalecenie Anthropic jest takie, by obniżyć effort tam, gdzie wcześniej wyłączano myślenie, oraz — przy effort xhigh lub max — zaczynać od max_tokens na poziomie 64k i dostrajać od tego miejsca.
Kształt odpowiedzi również się zmienia. Odpowiedź może zaczynać się od jednego lub więcej bloków thinking przed pierwszym blokiem tekstowym, więc kod, który odczytuje odpowiedź po pozycji — content[0].text — lub handler strumienia, który traktuje pierwszy content_block_start jako tekst, psuje się przy takich odpowiedziach, nawet gdy żądanie się powiodło. Zamiast tego wybieraj bloki po ich polu type.
2. Wymuszone użycie narzędzia zwraca błąd
tool_choice — typy any i tool zwracają błąd 400, a ta sama walidacja dotyczy punktu końcowego zliczającego tokeny, więc wstępne zliczenie kończy się niepowodzeniem tak samo jak rzeczywiste wywołanie:
• tool_choice: typy "tool" i "any" nie są obsługiwane dla tego modelu.
Opcje auto i none pozostają bez zmian. Udokumentowany sposób zastępczy to pozostawienie tool_choice: {"type": "auto"}, oznaczenie narzędzi za pomocą strict: true dla argumentów zgodnych ze schematem albo przeniesienie schematu do structured outputs — oraz wskazanie w promptcie, kiedy narzędzie ma zastosowanie, ponieważ auto nie gwarantuje wywołania. Ścisłe używanie narzędzi (strict tool use) akceptuje podzbiór JSON Schema: każdy obiekt w input_schema narzędzia musi mieć ustawione additionalProperties: false, więc sprawdź każdy schemat przed przełączeniem flagi. I zwróć uwagę na lukę, którą to pozostawia: jeśli Twój kod polegał na wymuszaniu wywołania, a nie tylko na jego dopuszczaniu, auto przywraca pozwolenie, ale nie gwarancję. Sprawdź, czy blok tool_use faktycznie został zwrócony.
3. Bloki myślenia są powiązane z modelem i rozmową
Każdy blok myślenia zapisuje, który model go wygenerował, a każdy model czyta własne bloki oraz określony zestaw bloków innych. Zasady działają w obu kierunkach:
• Claude Opus 5.5 odczytuje bloki myślenia z Claude Opus 5 oraz wcześniejszych modeli Opus, Sonnet i Haiku — ale nie z modeli Claude Fable ani Claude Mythos.
W Claude API modele Claude Fable 5.1 i Claude Mythos 5.1 odczytują bloki Claude Opus 5.5. Żaden inny model tego nie potrafi.
• Rozmowa przechodząca z Claude Opus 5.5 do czegokolwiek innego niż te dwa prowadzi swoje późniejsze tury bez wcześniejszego rozumowania.
Router lub mechanizm awaryjny, który przenosi konwersację, to oczywisty sposób, by to osiągnąć. Subtelniejsza połowa polega na tym, że blok jest również powiązany z prefiksem konwersacji — promptem systemowym, narzędziami i każdą wiadomością przed nim. Anthropic domyślnie egzekwuje sprawdzanie prefiksu dla kont utworzonych 2026-08-31 00:00 UTC lub później, w Claude API i na platformach chmurowych: odtwórz blok po edycji promptu systemowego, listy narzędzi lub wcześniejszej wiadomości, a żądanie zwróci 400. Istnieją dwie furtki ucieczki. Wyślij nagłówek beta thinking-binding-controls-2026-08-01 i ustaw thinking.block_binding.prefix_mismatch_behavior na "drop_block", aby porzucić objęte bloki zamiast powodować niepowodzenie żądania. Albo utrzymuj konwersację w trybie wyłącznie dopisywania i zmieniaj instrukcje komunikatem systemowym w środku konwersacji, a nie edycją — co już robią Claude Code, claude.ai, Claude Managed Agents i Claude Agent SDK.
Jest jedna dobra wiadomość, którą łatwo przeoczyć: gdy żądanie zawiera blok, którego model docelowy nie potrafi odczytać, API odrzuca go, zanim model go zobaczy. Żądanie kończy się powodzeniem, a odrzucone bloki nie są rozliczane.
4. Starsze narzędzie do obsługi komputera jest odrzucane w Claude API i Google Cloud
Wpis w tablicy tools typu computer_20251124 zwraca błąd 400 w Claude API i Google Cloud. Komunikat podaje nazwę odrzuconego typu, a następnie wylicza typy, które model akceptuje:
• 'claude-opus-5-5' nie obsługuje typów narzędzi: computer_20251124.
Zamiennikiem jest computer_toolset_20260801 zestaw narzędzi: usuń computer-use-2025-11-24 nagłówek beta i wyślij wpis tools bez nazwy i bez wymiarów wyświetlania. To nie tylko zmiana żądania — zmienia się wraz z nią pętla agenta. Akcje przychodzą jako bloki tool_use będące elementami składowymi, a nie jako pojedyncze narzędzie computer, w jednej turze może ich być kilka, akcją jest name danego bloku, a nie input.action, a każdy wynik musi zwrotnie odsyłać toolset_name z powrotem. W Amazon Bedrock computer_20251124 działa dokładnie tak samo jak w Claude Opus 5 i nie trzeba niczego zmieniać.
Które z czterech również mają zastosowanie do Claude Fable 5.1?
Anthropic podaje, że pierwsze trzy mają zastosowanie również w Claude Fable 5.1 — myślenie zawsze włączone, brak wymuszonego wyboru narzędzi oraz bloki myślenia powiązane z modelem i rozmową. Zmiana dotycząca korzystania z komputera już nie: ta dotyczy konkretnie tego modelu w Claude API i Google Cloud. Zespół, który już przeniósł się na Claude Fable 5.1, wycofał więc ścieżki kodu z wyłączonym myśleniem i wymuszone wybory narzędzi oraz stosuje wzorzec rozmowy tylko do dopisywania; pozostaje identyfikator modelu i zestaw narzędzi do korzystania z komputera. Zespół przechodzący z Claude Opus 5 mierzy się ze wszystkimi czterema naraz. To migracja warta zaplanowania, a jej nakład pracy zależy od tego, od czego zaczynasz.
Piąta zmiana: nic nie zgłasza błędów, a Twój kanał postępów cichnie
W Claude Opus 5 krótkie notatki, które model zapisuje między wywołaniami narzędzi, są zwracane jako zwykłe bloki tekstowe. W Claude Opus 5.5 — podobnie jak w Claude Fable 5.1 — ta narracja jest zwracana jako bloki myślenia z aktualizacją postępu, co najwyżej jeden przed każdym wywołaniem narzędzia. A thinking.display domyślnie ma wartość "omitted", więc te bloki przychodzą z pustym polem thinking obok swojego podpisu.
Żadne żądanie nie kończy się niepowodzeniem. Żaden błąd nie trafia do logów. Aplikacja, która przesyła strumieniowo tekst między narzędziami do swoich użytkowników jako wskaźnik postępu, po prostu przestaje pokazywać postęp między wywołaniami narzędzi i nie pokazuje już niczego. Widocznym objawem jest interfejs, który wydaje się zawieszony dokładnie w tym fragmencie pracy, w którym użytkownik najbardziej potrzebuje zapewnienia, że wszystko jest w porządku, a zostanie to zgłoszone jako problem z wydajnością, problem z siecią albo zawieszenie — a nie jako błąd migracji. To właśnie ta zmiana trafia na produkcję.
Rozwiązaniem jest ustawienie wyświetlania oraz pasujący do niego odczyt:
• Ustaw thinking.display na "updates" — wersja beta, za nagłówkiem thinking-display-updates-2026-08-18 — aby przywrócić aktualizacje postępu, podczas gdy samo rozumowanie pozostaje ukryte. To jest ustawienie, którego potrzebuje kanał postępu.
• Możesz też ustawić to na "summarized", aby otrzymywać aktualizacje postępu i podsumowania rozumowania zmieszane razem w tych samych blokach.
• Następnie odczytuj tekst z bloków thinking zamiast z bloków text, renderuj każdy niepusty blok thinking przed blokiem tool_use, który poprzedza, i przekazuj bloki z powrotem w niezmienionej postaci wraz z pozostałą częścią tury asystenta.
Własną uwagę Anthropic na ten temat warto przytoczyć w duchu: od interfejsu, który renderuje tekst między wywołaniami narzędzi, oczekuje się ustawienia wartości wyświetlania, a nie polegania na wartości domyślnej. Jeśli Twoja integracja całkowicie ignoruje dziś bloki myślenia, to jedyne miejsce, w którym wartość domyślna jest bezpieczna.

Wysiłek to powierzchnia API.
Gdy nie można wyłączyć myślenia, output_config.effort staje się jedynym pokrętłem regulującym to, jak intensywnie model rozumuje, a zatem jedynym pokrętłem wpływającym na koszt i opóźnienie przy danym zadaniu. Zanim skopiujesz ustawienie ze starego modelu, warto wiedzieć o nim cztery rzeczy.
Domyślne ustawienie się zmieniło. Claude Opus 5.5 domyślnie używa średniego wysiłku, podczas gdy Claude Opus 5 i wcześniejsze modele Opus domyślnie używały wysokiego. Żądanie, które pomija wysiłek, jest teraz realizowane o jeden poziom niżej niż przed zmianą. Anthropic dokumentuje również, że model ma tendencję do tego, aby myśleć więcej na turę przy danym ustawieniu wysiłku niż Claude Opus 5, szczególnie przy xhigh i max. Te dwa efekty działają w przeciwnych kierunkach, dlatego właśnie zalecenie dostawcy mówi, aby przeprowadzić od nowa przegląd poziomów wysiłku na własnych ewaluacjach, zamiast przenosić ustawienie.
Skala to niski / średni / wysoki / bardzo wysoki / maksymalny, a wszystkie pięć poziomów jest tutaj obsługiwanych. Poziom o podanej nazwie i tak nie jest stałym budżetem tokenów — Anthropic opisuje poziom wysiłku jako sygnał behawioralny, a nie ścisły budżet — a przydział tokenów stojący za każdym poziomem zmieniał się między modelami, więc „wysoki” w Claude Opus 5.5 to nie „wysoki” w Claude Opus 5. Ustawienie poziomu wysiłku na wartość domyślną modelu jest równoznaczne z pominięciem tego ustawienia.
Dwa szczegóły operacyjne, ponieważ oba kosztują pieniądze, gdy się je pominie. Po pierwsze, zmiana wartości wysiłku najwyższego poziomu między żądaniami unieważnia pamięć podręczną promptów: wybierz poziom i utrzymuj go na stałym poziomie w rozmowie, która polega na trafieniach w pamięć podręczną, a zamiast tego zmieniaj go między obciążeniami. Po drugie, ten model obsługuje wysiłek na wiadomość (nagłówek beta mid-conversation-output-config-2026-07-01), który zmienia poziom od późniejszej tury bez ponownego uruchamiania pamięci podręcznej. Minimalny rozmiar pamięci podręcznej promptów wynosi tutaj 512 tokenów, zmniejszony z 1024 w poprzedniej generacji, więc prompty, które wcześniej były zbyt krótkie, by trafić do pamięci podręcznej, mogą teraz tworzyć wpisy bez zmiany kodu.
Górne limity wyjściowe: 128K w trybie synchronicznym, 300K w Batch
Synchroniczne API Messages ogranicza dane wyjściowe do 128 tys. tokenów. API Message Batches pozwala na 300 tys. tokenów wyjściowych po ustawieniu nagłówka beta output-300k-2026-03-24 — dokładnie tego ciągu. Dane wejściowe domyślnie obejmują pełne okno kontekstu o rozmiarze 1 mln tokenów i nie wymagają żadnego nagłówka.
Praktyczna interpretacja: limit 128K nie zmienił się względem Claude Opus 5, więc nic w integracji synchronicznej nie wymaga ponownego planowania budżetu wyłącznie na tej osi. Ponownego planowania budżetu wymaga natomiast myślenie w jej wnętrzu. Ponieważ max_tokens obejmuje teraz przy każdym żądaniu myślenie oraz tekst, wartość, która w Claude Opus 5 była w sam raz dla tekstu odpowiedzi, tutaj jest ciaśniejsza — a przy wysiłku xhigh lub max dostawca sugeruje zaczynać od 64k i dostrajać. Jeśli długotrwałe zadanie zostało rozmiarowane pod synchroniczny limit 128K, a teraz ulega obcięciu, to nie limit się przesunął.
Safeguard routing jest częścią specyfikacji
To fakt integracyjny, a nie przypis w polityce: przy niektórych promptach ciąg modelu, który wysyłasz, nie opisuje tego, co odpowiedziało.
Claude Opus 5.5 jest dostarczany z klasyfikatorami bezpieczeństwa, a odrzucone żądanie wraca jako HTTP 200 z stop_reason: "refusal" oraz obiekt stop_details wskazujący obszar polityki. Ten model obejmuje więcej kategorii niż Claude Opus 5 — spodziewaj się bio, frontier_llm i reasoning_extraction obok znanego cyber. Odmowa reasoning_extraction jest blokowana od razu, a nie ponawiana: fallback Anthropic po stronie serwera nie ponawia jej, a odmowa jest zwracana do Ciebie.
W przypadku kategorii, które ponawiają próbę, mechanizmem jest parametr. Ustaw fallbacks na "default" wraz z nagłówkiem beta server-side-fallback-2026-07-01 a API ponownie wykona odrzucone żądanie na modelu, który Anthropic zaleca dla danej kategorii, w ramach pojedynczego wywołania, zwracając jedną odpowiedź. Centrum pomocy Anthropic wprost podaje routing dla tego modelu: oznaczone żądania dotyczące cyberbezpieczeństwa są kierowane w ramach fallbacku do Claude Opus 4.8, a jego klasyfikatory biologiczne — zestaw w stylu Fable-5 — powodują fallback do Claude Opus 5 w przypadku prac z zakresu life sciences o podwójnym zastosowaniu. Wąski zestaw możliwości związanych z rozwojem frontier-LLM również jest kierowany do Claude Opus 5. Anthropic zauważa także, że kontrole analizują wszystko, co model odczytuje, nie tylko Twoją najnowszą wiadomość, więc pamięć, zawartość konektorów, wyniki wyszukiwania i pliki mogą wywołać przełączenie.
Z tego wynikają trzy rzeczy dla Twojej integracji. Odczytuj pole model najwyższego poziomu w każdej odpowiedzi, ponieważ informuje ono o modelu, który faktycznie wygenerował wiadomość, i awaryjny blok treści oznacza każdy punkt przekazania. Sprawdź własne limity szybkości mechanizmu awaryjnego, ponieważ mechanizm awaryjny z limitem szybkości nie jest próbowany i zamiast tego zwracana jest odmowa — mechanizmy awaryjne degradują się do odmów pod obciążeniem. A każdy opublikowany przebieg testu porównawczego z włączonymi zabezpieczeniami traktuj jako pomiar systemu z routingiem, a nie samego Claude Opus 5.5, co jest dokładnie tym, co Anthropic mówi o swoich własnych liczbach poniżej.
Fallback po stronie serwera jest w wersji beta i tylko dla Claude API: nie jest obsługiwany w Message Batches API ani nie jest dostępny w Amazon Bedrock, Google Cloud czy Microsoft Foundry, gdzie zamiast tego udokumentowaną ścieżką jest middleware SDK. Jeśli chodzi o weryfikację, istnieją ścieżki dostępu dla obu kategorii — Cyber Verification Program i Life Sciences Verification Program — ale należy zwrócić uwagę na asymetrię, którą centrum pomocy Anthropic dokumentuje na dzień pisania tego tekstu: Claude Opus 5.5 nie jest obecnie wymieniony w Cyber Verification Program, podczas gdy Life Sciences Verification Program jest opisywany jako dający zweryfikowanym organizacjom dostęp do najbardziej zaawansowanych modeli.
Kontekst, odcięcie, wycofanie i tryb szybki
Pozostała część koperty, ze strony modelu i tabeli deprecjacji:
• Okno kontekstu — 1M tokenów, domyślnie, bez nagłówka beta.
• Data odcięcia wiedzy — czerwiec 2026, która jest również datą odcięcia danych treningowych.
• Wycofanie — nie wcześniej niż 2027-09-22 na platformach obsługiwanych przez Anthropic, z co najmniej 60-dniowym wyprzedzeniem. Amazon Bedrock i Google Cloud ustalają własne terminy. Claude Opus 5 pozostaje aktywny co najmniej do 2027-07-24, więc nie ma wymuszonego przełączenia.
• Cennik — 4,00 USD za milion tokenów wejściowych, 20,00 USD za milion tokenów wyjściowych, 5,00 USD za milion zapisów do pamięci podręcznej 5-minutowej, 8,00 USD za milion zapisów do pamięci podręcznej 1-godzinnej, 0,20 USD za milion odczytów z pamięci podręcznej. Tryb wsadowy jest o połowę tańszy w obu kierunkach: 2,00 USD / 10,00 USD.
• Odczyty z pamięci podręcznej to odstępstwo warte uwagi: 0,20 USD to 5% podstawowego wejścia, podczas gdy większość modeli Claude plasuje się na 10%, a Claude Fable 5.1 na 2,5%. Mieszane obciążenia z intensywnym ponownym wykorzystaniem pamięci podręcznej odczuwają to jako realny rabat.
• Tryb szybki — wciąż udokumentowany jako podgląd badawczy, tylko Claude API, wyceniany osobno: 8,00 USD za dane wejściowe / 40,00 USD za dane wyjściowe za milion tokenów. Aby włączyć, użyj speed: "fast" oraz fast-mode-2026-02-01 w nagłówku beta. Nie jest dostępny na Bedrock, Claude Platform on AWS, Google Cloud ani Microsoft Foundry, nie z Batch API i nie w ramach zobowiązania Priority Tier. Należy pamiętać, że Claude Opus 5.5 w ogóle nie obsługuje Priority Tier.
Co mówią benchmarki i przy jakim ustawieniu
Ustawienia nakładu pracy są powodem, dla którego tabeli dostawcy i niezależnej tabeli nie można porównać wiersz po wierszu, i dlatego każda liczba poniżej ma przypisane swoje ustawienie.
Zgłoszone przez dostawcę, we własnym harnessie Anthropic. W notatce premierowej Anthropic napisano, że o ile nie zaznaczono inaczej, wszystkie wyniki Claude Opus 5.5 wykorzystują myślenie adaptacyjne przymaksymalnym wysiłku; wyjątkiem jest Terminal-Bench 4.0, podany przy xhigh dla Claude Opus 5.5 i high dla GPT-6 Astra, ponieważ są to najwyższe wyniki każdego z tych modeli. Na tej podstawie dostawca podaje Terminal-Bench 4.0 na poziomie 66,4%, FrontierCode v1.1 Main na 54,4%, CursorBench 4.0 na 57,8%, GDPval-AA v2.1 na 1 846 Elo, AutomationBench na 40,0%, Humanity's Last Exam z narzędziami na 67,7%, Terminal-Bench-Science 0.1 na 58,7%, OSWorld 2.0 na 81,8% (częściowo) oraz Chartography z narzędziami na 89,0%. Przy domyślnym średnim wysiłku modelu dostawca podaje FrontierCode na 54,6%, a CursorBench na 52,5%. Warto zwrócić uwagę, co ujawnia ta sama notatka: ewaluacje przeprowadzono z włączonymi zabezpieczeniami produkcyjnymi, a gdy te zostały uruchomione, zadania z zakresu cyberbezpieczeństwa wykonał Claude Opus 4.8, a zadania z biologii i rozwoju frontier-LLM — Claude Opus 5; Anthropic twierdzi, że prawdopodobnie obniża to wydajność Claude Opus 5.5 w tych benchmarkach. Opublikowane wyniki w przypadku objętych tym problemem ewaluacji nie stanowią zatem rzetelnego pomiaru tego modelu.
Niezależne, Artificial Analysis. W Intelligence Index v4.3.2 Claude Opus 5.5 uzyskuje 58 w konfiguracji, którą Artificial Analysis określa jako „Adaptive Reasoning, Max Effort, Default Fallback" — swój najwyższy zmierzony wynik, o kilka punktów wyższy, i prowadzi w sześciu z dziesięciu ocen składowych. Na tym samym indeksie i tym samym harnessie Claude Fable 5.1 uzyskuje 53, a Claude Opus 5 — 51. Artificial Analysis publikuje pełną drabinę poziomów effort, która jest tu najużyteczniejszym niezależnym artefaktem: max 58, xhigh 56, high 54, medium 51, low 42. Jego własne pomiary sytuują Claude Opus 5.5 na poziomie około 119 000 tokenów wyjściowych na zadanie indeksu przy max effort, wobec około 73 000 dla Claude Opus 5, 78 000 dla Claude Fable 5.1 i 27 000 dla GPT-6 Astra — tokenów rozliczanych jako tokeny wyjściowe — a jego strona podaje koszt 5,98 USD na zadanie indeksu. Mierzy również Terminal-Bench 4.0 na 59,6% i Humanity's Last Exam na 61,4%, wobec 66,4% i 67,7% podawanych przez dostawcę przy max effort na innym harnessie.
Przeczytaj te dwa akapity w zestawieniu ze sobą, a uczciwy wniosek jest wąski. 66,4% dostawcy w Terminal-Bench i niezależne 59,6% to ten sam benchmark uruchamiany przez różne osoby przy ustawieniach, co do których nie ma gwarancji, że są zgodne, i żadne z nich nie stanowi dowodu na temat twojego obciążenia. Drabina wysiłku to przenośne ustalenie: w niezależnym indeksie własne ustawienia tego modelu obejmują szesnaście punktów, co jest szerszym rozrzutem niż różnica między nim a jego poprzednikiem. Wybór poziomu wysiłku ma większe znaczenie niż wybór między tymi modelami, a klauzula „Default Fallback” w tej etykiecie to opisane powyżej zabezpieczenie routingu, a nie artefakt benchmarku.
Wydajność deklarowana przez dostawcę, z podaniem źródła. Anthropic twierdzi, że Claude Opus 5.5 osiąga poziom Claude Fable 5.1 w większości zadań przy około 40% niższym koszcie działania, a typowe obciążenia kosztują około 40% mniej niż w przypadku Claude Opus 5, w porównaniu z 20% obniżką ceny katalogowej. Generowanie odpowiedzi jest ponad 30% szybsze. To charakterystyki dostawcy dotyczące średnich dla wybranych przez dostawcę obciążeń. Oświadczenia klientów z czasu premiery to ten sam rodzaj dowodów: Box podaje jedną trzecią liczby tokenów, a odpowiedzi są około 40% mniej rozwlekłe, Kiro w przybliżeniu o połowę mniej tokenów i około 40% mniej wywołań, Factory 20–25% mniej tokenów wyjściowych, GitHub – jedne z najmniejszych liczb tokenów i kroków, jakie zmierzył. Anthropic podaje również wewnętrzny test weryfikacji faktów, w którym 16 z 18 raportów przekroczyło próg jakości, którego ani Claude Fable 5.1, ani Claude Opus 5 nie osiągnęły w żadnej próbie. Wszystko to jest zgłaszane przez dostawcę i nic z tego nie zostało poddane audytowi. Ujawnione ograniczenie jest wyjątkowo szczere i warto je przytoczyć: Anthropic twierdzi, że Claude Opus 5.5 „często podejrzewa, że jest oceniany”.
Na koniec modele siostrzane: Anthropic twierdzi, że Claude Sonnet 5.5 i Claude Haiku 5.5 pojawią się „w nadchodzących tygodniach”. Żaden z nich nie został jeszcze wydany, żaden nie ma jeszcze ceny i żaden nie jest dziś dostępny w żadnym kanale.
Testowanie czterech zmian bez pełnego przełączenia
Ryzyko migracji nie polega tu na jakości — polega na tym, że ścieżka kodu, której nigdy nie przetestowano na stagingu, jest tą, która na produkcji zwraca 400. Cztery zmiany niekompatybilne to wyłącznie zmiany kształtu żądań, co oznacza, że zawodzą deterministycznie i natychmiast, a jedynym sposobem na znalezienie pominiętych ścieżek jest przepuszczenie przez nie rzeczywistego ruchu.
Claude Opus 5.5 jest dostępny w OrcaRouter jako anthropic/claude-opus-5.5w cenie katalogowej samego Anthropic z 0% marży — cena katalogowa dostawcy jest przekazywana bez zmian, więc zmiana ceny przez dostawcę jest tu widoczna tego samego dnia.

To pozwala skierować procent ruchu produkcyjnego do tego modelu, podczas gdy reszta nadal działa na Claude Opus 5, obserwować, które żądania zawodzą i dlaczego, oraz naprawiać je jedno po drugim. Cztery błędy są samoopisujące się: każdy wskazuje odrzucony parametr, a w trzech z czterech przypadków także jego zamiennik. Automatyczne przełączenie awaryjne wypełnia lukę, gdy dana ścieżka jest jeszcze zepsuta — żądanie, które nie powiedzie się względem modelu, którego nie scharakteryzowano w pełni, przechodzi awaryjnie do modelu, który już znasz, zamiast pokazywać użytkownikowi błąd 400.
Praktyczna kolejność działań: najpierw podmień identyfikator modelu i jawnie ustaw parametr effort, ponieważ wartość domyślna zmieniła się na medium; następnie usuń ścieżki thinking-disabled i forced-tool-choice; potem napraw czytnik strumieniowania — wybór bloków według typu i ustawienie thinking.display — ponieważ to właśnie on zawodzi po cichu, a nie głośno; a migrację zestawu narzędzi computer-use zostaw na koniec, jeśli korzystasz z Bedrock, ponieważ właśnie ona tam nie ma zastosowania. Wszystko inne — cena, okno kontekstu, stawki cache i domyślna wartość 1M-token — jest już tam, gdzie to zostawiłeś.
Kieruj część ruchu na żywo do nowego modelu bez pełnego przełączenia: Claude Opus 5.5 w OrcaRouter działa w cenie katalogowej Anthropic, z automatycznym przełączeniem awaryjnym na model, który już scharakteryzowałeś.
Porównane w tym artykule4
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
