Karta tytułowa dla Claude Sonnet 5.5 z nagłówkiem „ta sama cena, mniej pracy”, z podtytułem „2 USD / 10 USD za milion tokenów, bez zmian względem Sonnet 5” oraz trzema kartami statystyk: 56 (AA Intelligence Index), #3 / 216 (miejsce w tym indeksie) i 7,60 USD (koszt zadania przy maksymalnym wysiłku).
Guides & Insights

Claude Sonnet 5.5: Twierdzenie o 30% kosztów i sześć zmian, które łamią kod Sonnet 5

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Claude Sonnet 5.5 został wydany 28 września 2026 roku po dokładnie takich samych stawkach jak Claude Sonnet 5 — 2 dolary za milion tokenów wejściowych, 10 dolarów za milion tokenów wyjściowych, 0,20 dolara za milion odczytów z pamięci podręcznej — podczas gdy ogłoszenie Anthro​pic zaczyna się od „działa ponad 30% szybciej i kosztuje do 30% mniej w większości zadań”. Oba stwierdzenia są prawdziwe, a odległość między nimi to cała historia. Oszczędności nie wynikają z cennika, ponieważ cennik się nie zmienił. Pochodzą one z uruchamiania modelu z niższym ustawieniem wysiłku niż wymagał jego poprzednik, co oznacza, że liczba 30% to twierdzenie o punkcie operacyjnym, który musisz wybrać, a nie cena, którą dziedziczysz. Niezależny pomiar wyostrza ten podział: w Artificial Analysis, Claude Sonnet 5.5 przy maksymalnym wysiłku kosztuje 7,60 dolara za zadanie w Intelligence Index, w porównaniu do 5,09 dolara dla Claude Sonnet 5 przy maksimum — około 49% więcej, a nie 30% mniej. To nie jest sprzeczność z liczbą Anthro​pic. To drugi koniec tej samej krzywej i to tam wyląduje większość migracji domyślnie, jeśli nikt nie powtórzy swojego przeglądu wysiłku.

Dwa twierdzenia pod jednym numerem

Post Anthropica formułuje twierdzenie o wyniku na zadanie w trzech miejscach i każde z nich opiera się na poziomie wysiłku. Najmocniejsza wersja: na Terminal-Bench 4.0, przy średnim poziomie wysiłku — domyślnym w aplikacjach Claude — Sonnet 5.5 „znacznie przewyższa najlepszy wynik Sonnet 5 za mniej niż jedną dziesiątą kosztu na zadanie”. Na AA-Briefcase v1.1, przy średnim poziomie wysiłku, bije najlepszy wynik Sonnet 5 za około jedną dziewiątą kosztu. Na CursorBench 4.0, przy niskim poziomie wysiłku, przewyższa najlepszy wynik Sonnet 5 za mniej niż jedną dziesiątą.

Czytając je razem jako zestaw, mechanizm jest jasny. Dolna granica Sonnet 5.5 leży powyżej górnej granicy Sonnet 5 w kilku ewaluacjach. Nie zyskujesz tych 30% przez płacenie mniej za token; zyskujesz je, ponieważ przestajesz potrzebować tego drogiego ustawienia. Anthropic mówi o tym wprost w dokumentacji migracji, stronę dalej od materiałów marketingowych: "Poziomy wysiłku zostały skalibrowane od nowa. Poziom wysiłku nie daje takiej samej ilości myślenia jak w Claude Sonnet 5. Przeprowadź ponownie przegląd poziomów wysiłku, zamiast przenosić ustawienie."

To zdanie to najważniejsza z operacyjnego punktu widzenia informacja, jaką Anthropic opublikował w tym tygodniu — i właśnie ona nie trafiła do większości materiałów o premierze.

Co opublikował Anthropic — zgłoszone przez dostawcę, nieodtworzone

Wszystko w tej sekcji to pomiary samego Anthropic, pochodzące z ogłoszenia Sonnet 5.5 i karty systemowej. To twierdzenie producenta, a nie niezależny wynik, a ścieżka przypisów ma równie duże znaczenie jak liczby z nagłówka.

• Terminal-Bench 4.0 (kodowanie agentowe) — Sonnet 5.5 70,6% vs Sonnet 5 10,3%. To siedmiokrotny skok w jednym, najczęściej cytowanym wierszu — i to właśnie ta liczba otwierała większość doniesień.

• FrontierCode 1.1 (Main) — Sonnet 5.5 52,1% przy Xhigh i 46,2% przy Max; Sonnet 5 42,4%; Claude Opus 5.5 54,4%; GPT-6 Sol 49,3%. Zwróć uwagę na odwrócenie: Sonnet 5.5 uzyskuje niższy wynik przy Max niż przy Xhigh.

• CursorBench 4.0 — 55,5% dla Sonnet 5.5 vs 34,1% dla Sonnet 5 i 57,8% dla Opus 5.5. CursorBench 4.0 nie publikuje publicznie wyników GPT-6 Sol.

• GDPval-AA v2.1 (praca wiedzowa) — Sonnet 5.5 1844 Elo, Sonnet 5 1449, Opus 5.5 1846, GPT-6 Sol 1487.

• AA-Briefcase v1.1 — 1811 / 1359 / 1822 / 1483 na tych samych czterech modelach.

• Humanity's Last Exam (z narzędziami) — 64.5% / 54.9% / 67.7%.

• OSWorld 2.1 (użycie komputera, częściowa punktacja) — 80,1% / 57,0% / 81,8%.

• Chartography (wizualne rozpoznawanie wykresów, bez narzędzi) — 61,6% / 15,6% / 64,4% / 53,6%.

Trzy przypisy powinny raczej towarzyszyć tym wierszom niż znajdować się pod nimi. Po pierwsze, wynik Opus 5.5 na Terminal-Bench 4.0 wynoszący 66,4% jest podawany przy wysiłku Xhigh, czyli najwyżej punktowanej konfiguracji Opus 5.5. Po drugie, wyjaśniono odwrócenie wyniku w FrontierCode Max: przy Max Sonnet 5.5 częściej uruchamiał umiejętność przeglądu kodu Claude Code, która rozdziela przegląd między wiele subagentów, a w dwóch przypadkach skutkowało to przekroczeniem limitu czasu lub zmianami wykraczającymi poza zakres zadania — FrontierCode karze zmiany poza zakresem, nawet gdy są dobre. Po trzecie — i najmniej wygodne dla dostawcy — Artificial Analysis uruchomiło GDPval-AA i AA-Briefcase na przedpremierowym wdrożeniu Sonnet 5.5, które według Anthropic miało błąd pogarszający odpowiedzi na żądania o ustrukturyzowanym formacie wyjściowym. Anthropic spodziewa się, że efekt jest niewielki i zaniża wyniki Sonnet 5.5, oraz twierdzi, że błąd został naprawiony. Zauważa również, że OpenAI niedawno naprawiło błąd rozumienia obrazu w GPT-6 Sol, więc wyniki GPT-6 Sol w tych wierszach mogą jeszcze nie odzwierciedlać obecnego modelu.

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56 at rank #3 of 216, $2.00 input and $10.00 output per 1M tokens, and a $7.60 average cost per index task with 410M tokens generated.

Co mówi niezależne uruchomienie o tym samym modelu

Artificial Analysis ma już zmierzony Sonnet 5.5, a jego strona podaje dokładną konfigurację: „Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)". W tej samej wersji indeksu, 216 modeli w klasie:

• Claude Sonnet 5.5 — Indeks Inteligencji 56, pozycja #3 z 216. Koszt 7,60 USD na zadanie indeksowe. Podczas przebiegu indeksu wygenerował 410 mln tokenów wyjściowych, przy medianie wynoszącej 88 mln.

• Claude Sonnet 5 — Indeks 38, sklasyfikowany na pozycji #58 spośród 216, na własnej stronie oznaczonej jako „(Adaptive Reasoning, Max Effort)”. Koszt 5,09 USD na zadanie. 370 mln tokenów wyjściowych.

• Claude Opus 5.5 — Indeks 58, 1. miejsce na 216. 5,98 USD za zadanie. 95,3 tokena wyjściowego na sekundę.

• GPT-6 Sol — Indeks 48, pozycja 20 z 216, przy cenniku $2/$10. $1,06 za zadanie, 89,8 tokena wyjściowego na sekundę.

Luka w Intelligence Index — 56 przeciwko 38, osiemnaście punktów — to najsilniejsze niezależne potwierdzenie w tym tekście i to jest liczba, którą czytelnik powinien faktycznie zapamiętać. Wartość kosztu wymaga zastrzeżenia i warto ująć to precyzyjnie: oba punkty to konfiguracje maksymalnego wysiłku, a maksymalny wysiłek w przypadku modelu, który rozumuje dłużej, to celowo kosztowne miejsce, na którym się stoi. Sonnet 5.5 spalił 410 mln tokenów w przebiegu indeksu, podczas gdy Sonnet 5 spalił 370 mln, a oba wyniki są znacznie powyżej mediany 88 mln. Model, który myśli dłużej przy najwyższym ustawieniu, kosztuje więcej przy najwyższym ustawieniu. To, co ta liczba falsyfikuje, to nie „taniej na zadanie”, lecz każde odczytanie jej jako właściwości modelu, a nie ustawienia.

Artificial Analysis nie opublikowało jeszcze danych o szybkości generowania dla Sonnet 5.5 — na jego stronie widnieje N/A dla liczby tokenów wyjściowych na sekundę, wobec 78,7 dla Sonnet 5 i 95,3 dla Opus 5.5. Zatem część twierdzenia Anthropic o „30%+ szybciej” jest na tym etapie wyłącznie deklaracją dostawcy. Traktuj to jako orientacyjne, dopóki nie zmierzy tego niezależna strona trzecia.

A two-column comparison scoreboard titled 'Claude Sonnet 5.5 vs Claude Sonnet 5 - the cost-per-task fork'. The left column, Claude Sonnet 5.5, reads AA Intelligence Index 56, rank #3 of 216, cost per task at max effort $7.60, 410M output tokens on the index run, $2 / $10 input and output price, default effort high. The right column, Claude Sonnet 5, reads 38, #58 of 216, $5.09, 370M, $2 / $10, high.

Skąd tak naprawdę biorą się oszczędności i jak je uzyskać

Jeśli zaakceptujesz ten mechanizm, instrukcje migracji piszą się same, a Anthropic je opublikował:

• Domyślnie zacznij od high, a nie od tego, co mówiła twoja konfiguracja Sonnet 5. Zalecenie Anthropic to high, chyba że twoje obciążenie jest agentowe lub wrażliwe na opóźnienia.

• Kodowanie agentowe i wieloetapowe korzystanie z narzędzi — zacznij od poziomu średniego w przypadku dobrze określonych zadań, a przy trudniejszych lub dłuższych przejdź na wysoki.

• Czat i inne zadania wrażliwe na opóźnienia — zacznij od średniego lub niskiego. To przedział, w którym pojawiają się twierdzenia o „jednej dziesiątej kosztu”.

Istnieje spójne wyjaśnienie, dlaczego niższe ustawienie działa, i nie jest to marketing. Wcześni testerzy Anthropic raportowali, że Sonnet 5.5 częściej grupuje wywołania narzędzi razem niż Sonnet 5, co przekłada się na mniej kroków na zadanie. Uwaga CodeRabbit w ogłoszeniu jest nietypowo konkretna jak na cytat z premiery: „skłonność Sonnet 5 do zbyt częstego sięgania po wyszukiwanie w sieci oraz wysokie zużycie tokenów zniknęły w tym nowym modelu”. Sonnet 5.5 zachował też ten sam tokenizer co Sonnet 5, więc identyczny tekst kosztuje tyle samo tokenów — redukcja to mniejsza liczba tur i mniejsza liczba zbędnych wywołań, a nie tańszy słownik. Oznacza to również, że liczby tokenów w Twoich logach pozostają porównywalne po aktualizacji, co sprawia, że pomiar przed i po jest prosty.

Sześć zmian, które łamią lub zmieniają kod Sonnet 5

To jest ta część wydania, która pochłania czas inżynierów, i to tutaj przewodnik migracji jest wart więcej niż wykres benchmarku. Pięć z sześciu zwraca twarde błędy; szósty zawodzi po cichu.

• thinking: {"type": "disabled"} zwraca teraz błąd 400. Zamiennikiem jest thinking: {"type": "between_tools"}, który wyłącza wstępne myślenie i jest najniższym ustawieniem myślenia w tym modelu. Działa przy niskim, średnim i wysokim wysiłku, nie wymaga nagłówka beta i jest dostępny na każdej platformie obsługującej Sonnet 5.5. Przy wysiłku xhigh lub max sam between_tools zwraca błąd 400 — użyj myślenia adaptacyjnego (pomiń pole lub wyślij {"type": "adaptive"}), jeśli potrzebujesz tych poziomów. W przypadku between_tools nie można też zmienić poziomu wysiłku w trakcie rozmowy.

• Wymuszone używanie narzędzi nie jest obsługiwane. Ustawienie tool_choice na {"type": "any"} lub {"type": "tool", "name": "..."} zwraca błąd 400 z komunikatem "tool_choice: type 'tool' and 'any' are not supported for this model." Ta sama kontrola dotyczy punktu końcowego zliczania tokenów. Udokumentowanym rozwiązaniem zastępczym dla danych wejściowych zgodnych ze schematem jest tool_choice: {"type": "auto"} oraz strict: true w narzędziu, albo przeniesienie schematu do ustrukturyzowanych wyników.

• Bloki myślenia są powiązane z modelem i rozmową. Sonnet 5.5 odczytuje bloki myślenia z Sonnet 5, Opus 4.8, Haiku 4.5 i wcześniejszych — nie z Opus 5, Opus 5.5 ani żadnego modelu Fable lub Mythos. Żaden inny model nie odczytuje bloków Sonnet 5.5. Przenieś rozmowę z Sonnet 5 do 5.5, a rozumowanie przetrwa; przenieś ją z Sonnet 5.5 do czegokolwiek innego, a późniejsze tury przebiegną bez niego. Osobno API sprawdza teraz, czy prompt systemowy, lista narzędzi lub wcześniejsza wiadomość zmieniły się od czasu utworzenia bloku myślenia, i na kontach utworzonych 31 sierpnia 2026 r. lub później zwraca 400, gdy tak się stało. Prowadź rozmowy w trybie tylko do dopisywania albo wyślij nagłówek beta thinking-binding-controls-2026-08-01 z prefix_mismatch_behavior: "drop_block".

• computer_20251124 jest odrzucane w Claude API i Google Cloud. Korzystanie z komputera wymaga tam zestawu narzędzi computer_toolset_20260801. Amazon Bedrock nadal akceptuje starsze narzędzie — rozbieżność między platformami, którą warto odnotować, jeśli uruchamiasz tego samego agenta na obu.

• Niektóre pary doradców zniknęły. Executor Sonnet 5.5 akceptuje Mythos 5.1, Fable 5.1, Mythos 5, Fable 5, Opus 5.5, Opus 5 lub sam Sonnet 5.5 jako doradcę. Doradcy Opus 4.8, Opus 4.7 i Sonnet 5, którzy działają z executorem Sonnet 5, zwracają błąd 400 z executorem Sonnet 5.5. Każdy doradca akceptowany przez Sonnet 5.5 zwraca poradę zaszyfrowaną, więc Twój klient nie może odczytać tekstu porady.

• Tekst między wywołaniami narzędzi pojawia się teraz wewnątrz bloków myślenia — a przy domyślnym ustawieniu wyświetlania: „omitted” jest pusty. To jest ten cichy przypadek. Notatki dłuższe niż jedno lub dwa zdania między wywołaniami narzędzi wracają jako bloki myślenia z aktualizacją postępu, a nie jako tekst. Aplikacja, która strumieniuje tę narrację do swoich użytkowników, milknie między wywołaniami narzędzi, bez błędu i bez niczego w logach. Poprawka polega albo na ustawieniu thinking.display tak, aby tekst był zwracany, albo na przełączeniu na between_tools, w którym to przypadku tekst wraca jako zwykły tekst.

Jeszcze dwie rzeczy, których dotyczy migracja — żadna nie jest błędem. Monitorowanie odmów: Sonnet 5.5 zwraca stop_reason: „refusal” z obiektem stop_details wskazującym jeden z pięciu obszarów polityki — cyber, bio, frontier_llm, reasoning_extraction, general_harms — a serwerowy fallback Anthropic ponowi odrzucone żądania w obszarach cyber i frontier_llm na Sonnecie 5, ale nie w pozostałych trzech. A podejście do bezpieczeństwa naprawdę się zmieniło: Sonnet 5.5 to pierwszy model Sonnet dostarczany z zabezpieczeniami cybernetycznymi i mechanizmami fallback jak w klasie Opus, co oznacza, że żądania dotyczące cyberbezpieczeństwa o wyższym ryzyku w widoczny sposób przechodzą w ramach fallbacku na Sonnet 5, oraz pierwszy Sonnet z klasyfikatorami przeciwko ekstrakcji rozumowania. Jeśli propozycja wartości Twojego produktu to narzędzie bezpieczeństwa, przetestuj tę granicę, zanim wdrożysz podmianę modelu.

Cennik i to, co tak naprawdę jest dziś na naszej trasie

Cennik pozostaje niezmieniony względem Sonnet 5, a jego pełny, opublikowany kształt jest na tyle krótki, że można go przedstawić wprost:

• Wejście — 2,00 USD za milion tokenów. Wyjście — 10,00 USD za milion tokenów. Oba identyczne z Sonnet 5, co potwierdzono na stronie modelu Anthropic dla Sonnet 5.5.

• Odczyt z pamięci podręcznej — 0,20 USD za milion, 90% zniżki na dane wejściowe; zapis do pamięci podręcznej na 5 minut 2,50 USD za milion; zapis do pamięci podręcznej na 1 godzinę 4,00 USD za milion. Minimalna długość promptu możliwego do zapisania w pamięci podręcznej to 512 tokenów w Sonnet 5.5, w porównaniu z 1024 w Sonnet 5.

• Batch — 50% zniżki w obu kierunkach, czyli 1,00 USD / 5,00 USD za milion. W Message Batches API dane wyjściowe mogą wynosić do 300 tys. tokenów dzięki nagłówkowi beta output-300k-2026-03-24.

• W porównaniu z Opus 5.5 — Sonnet 5.5 to dokładnie połowa: 2/10 USD wobec 4/20 USD, przy zapisach do pamięci podręcznej na poziomie połowy i identycznych odczytach z pamięci podręcznej po 0,20 USD. To migracja, która się opłaca, a Anthropic mówi to wprost: oba modele najlepiej się uzupełniają, gdy Sonnet działa z niższym nakładem, a Opus "pozostaje wyraźnie silniejszy w złożonej, otwartej pracy wymagającej trwałego osądu".

• Kontekst i dane wyjściowe — kontekst 1 mln tokenów, maksymalnie 128 tys. tokenów danych wyjściowych, adaptacyjne myślenie domyślnie włączone, domyślny poziom wysiłku: wysoki, wiarygodny punkt odcięcia wiedzy: czerwiec 2026, dostępne zerowe przechowywanie danych, wycofanie nie wcześniej niż 28 września 2027.

Jedna uwaga o dostępności, którą wolimy powiedzieć wprost, niż tylko ją sugerować: Claude Sonnet 5.5 nie znajduje się w naszym katalogu modeli na dzień 29 września 2026 r. Jego poprzednik anthropic/claude-sonnet-5 i jego większy brat anthropic/claude-opus-5.5 oba się w nim znajdują, a jego stawki po naszej stronie są stawkami samego dostawcy — 2,00 USD za wejście, 10,00 USD za wyjście, 0,20 USD za odczyt z pamięci podręcznej, 2,50 USD za zapis do pamięci podręcznej dla Sonnet 5, bez doliczanej marży, więc zmiana ceny u dostawcy obowiązuje tutaj tego samego dnia, w którym się pojawia, a nie dopiero w kolejnym cyklu rozliczeniowym. To właśnie ta ostatnia właściwość sprawia, że odczyt cennika jest użyteczny, a nie tylko dekoracyjny.

OrcaRouter model page for anthropic/claude-sonnet-5, attributed to Anthropic and dated 2026-06-30, showing a 1M-token context window, up to 128K output tokens, and the unchanged rates of $2.00 per million input tokens and $10.00 per million output tokens. The page carries a link reading 'the Claude Sonnet 5 API'.

Co możesz z tym zrobić już dziś

Uczciwa kolejność działań dla zespołu, który już używa Claude Sonnet 5 na produkcji, to trzy kroki — i żaden z nich nie polega na „podmianie ciągu znaków modelu i obserwowaniu grafu”.

Najpierw ponownie przeprowadź przegląd poziomów wysiłku. Jeśli przeniosłeś ustawienie wysokie lub maksymalne z Sonnet 5, ponieważ tego wymagała twoja poprzeczka jakości, to teraz płacisz za rozumowanie, którego nie musisz już kupować. Niezależne wskaźniki kosztu na zadanie mówią, że szczyt drabiny stał się bardziej kosztowny, a nie mniej, a wszystkie własne twierdzenia dostawcy o kosztach opisują środek tej drabiny. Po drugie, napraw dwie ścieżki błędów przed wdrożeniem — wyłączone myślenie i wymuszone użycie narzędzi — ponieważ obie zawodzą głośno i natychmiast, co jest dobrą wiadomością. Po trzecie, obserwuj ścieżkę narracji, ponieważ zawodzi po cichu.

Jeśli modelu nie ma jeszcze na trasie, której używasz, niskoryzykownym sposobem na jego ocenę jest uruchomienie go równolegle, a nie zamiast: pozostaw Sonnet 5 przypięty jako fallback na tym samym kluczu, tak aby odmowa, przekroczenie limitu czasu lub zły wynik ewaluacji kierowały żądanie do modelu, któremu już ufasz, a automatyczne przełączanie awaryjne zamyka pętlę bez drugiej integracji. To cały argument za ocenianiem nieprzetestowanego modelu za jednym punktem końcowym, a nie przed Twoimi użytkownikami — i tutaj ma zastosowanie podwójnie, ponieważ kategorie odmów Sonnet 5.5 są nowe, a jego kalibracja wysiłku wyraźnie różni się od tej w poprzedniku. Gdy będziesz gotowy przenieść domyślny model, lista na jednym kluczu sięga do ponad 200 modeli, co sprawia, że porównanie staje się zmianą konfiguracji, a nie drugą umową.

Co obejrzeć

Trzy rzeczy rozstrzygną otwarte kwestie w tym tekście, a żadna z nich jeszcze nie miała miejsca.

Niezależny pomiar szybkości generowania jest pierwszy. Anthropic twierdzi, że jest o co najmniej 30% szybszy niż Sonnet 5; Artificial Analysis nie opublikowało wyniku dla Sonnet 5.5, a to twierdzenie ma realne znaczenie w argumentacji kosztowej, ponieważ szybszy model kończy to samo zadanie w krótszym czasie rzeczywistym i często przy użyciu mniejszej liczby tokenów. Drugi to Claude Haiku 5.5 — Anthropic mówi, że pojawi się „w nadchodzących tygodniach” i znajdzie się poniżej Sonnet 5.5, co zmienia kalkulację dla segmentu czatu o dużym wolumenie, w którym średni i niski poziom wysiłku już czyni Sonnet 5.5 konkurencyjnym. Trzeci to przebieg korekcyjny: Artificial Analysis uruchomiło GDPval-AA i AA-Briefcase na przedpremierowej kompilacji z błędem w ustrukturyzowanym wyjściu, Anthropic oczekuje, że te wyniki zaniżają możliwości modelu, a żadnej z tych liczb nie przeliczono ponownie. Jeśli wzrosną, luka w pracy opartej na wiedzy względem Opus 5.5 jeszcze się zmniejszy, a argument „połowa ceny” zyska na sile.

Do tego czasu możliwe do obrony podsumowanie jest węższe niż ogłoszenie i bardziej użyteczne niż wykres benchmarku. Claude Sonnet 5.5 to wzrost inteligencji o osiemnaście punktów względem Sonnet 5 w niezależnym indeksie, przy tych samych publikowanych stawkach, z realną i mierzalną oszczędnością dostępną dla każdego, kto zejdzie niżej na drabinie wysiłku — oraz realną i mierzalną karą dla każdego, kto tego nie zrobi.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie