
Claude Sonnet 5.5 vs Claude Opus 5.5: Benchmarki się zbiegają, rachunek nie
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 984 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 195 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
Claude Sonnet 5.5 osiągnął ogólną dostępność 28 września 2026 roku w cenie 2,00 USD za milion tokenów wejściowych i 10,00 USD za milion tokenów wyjściowych. Claude Opus 5.5, flagowy model Anthropic, trafił na rynek sześć dni wcześniej, 22 września, w cenie 4,00 i 20,00 USD — dokładnie dwa razy więcej w obu pozycjach. Nasuwająca się interpretacja jest taka, że Opus 5.5 to sufit, a Sonnet 5.5 to kompromis, na który się godzisz, gdy budżet jest realny. Własna tabela premierowa Anthropic nie potwierdza tej interpretacji. Według liczb opublikowanych przez firmę Claude Sonnet 5.5 uzyskuje 1844 wobec 1846 Opusa 5.5 w GDPval-AA v2.1, 1811 wobec 1822 w AA-Briefcase v1.1 oraz 70,6% wobec 66,4% w Terminal-Bench 4.0 — wygrywa w jedynym benchmarku, który mierzy pracę faktycznie wykonywaną w terminalu. Dwie linijki poniżej tych liczb podpis samego Anthropic głosi, że Opus 5.5 „pozostaje wyraźnie silniejszy w złożonej, otwartej pracy”. Oba stwierdzenia są prawdziwe, a ustalenie, jak utrzymać je jednocześnie, to w dużej mierze cel tego porównania.
Co mówi tabela startowa, a czego nie mówi
Wzorzec w bloku benchmarków Anthropic to model, który nadrobił większość luki, a nie taki, który objął prowadzenie. GDPval-AA v2.1, ważony ekonomicznie zestaw zadań, to dwupunktowy remis. AA-Briefcase v1.1, ocena dokumentów i rezultatów, to jedenastopunktowy remis. CursorBench 4.0 wypada odwrotnie: 55,5% dla Sonnet 5.5 wobec 57,8% dla Opus 5.5. OSWorld 2.1 osiąga 80,1% wobec 81,8%, a Humanity's Last Exam 64,5% z narzędziami wobec 67,7%. Tylko Terminal-Bench 4.0 przełamuje ten wzorzec i robi to mocno — 70,6% wobec 66,4%, czteropunktowa przewaga Sonnet w agentowej pracy w wierszu poleceń.
Czytaj etykiety wierszy, a nie liczby, a wyłania się coś jeszcze. Kilka z tych pozycji Opus 5.5 zawiera adnotację o wysiłku — 66,4% przy Xhigh — a przypis stwierdza, że konfiguracja Max uzyskuje niższy wynik niż Xhigh na FrontierCode, a nie wyższy. Wyższy wysiłek nie jest monotoniczny. Zespół dbający o budżet, który zakłada, że „maksymalny wysiłek” to darmowe ulepszenie, kupuje tokeny za gorszą odpowiedź w co najmniej jednym z własnych testów Anthropic. A w FrontierCode 1.1 ten sam przypis umieszcza Sonnet 5.5 na poziomie 46,2% w konfiguracji Max w porównaniu z 54,4% w przypadku Opus 5.5, co jest najwyraźniejszą pojedynczą liczbą pokazującą, gdzie flagowiec wciąż zyskuje przewagę: długoterminowa praca nad kodem w ramach definicji zadania, która nagradza wytrwałość.
Jest jeszcze jedno zastrzeżenie, które warto powiedzieć wprost, a nie je zakopywać. Anthropic zauważa, że uruchomienia GDPval-AA i AA-Briefcase, które publikuje, wykonano na wdrożeniu przedpremierowym, które miało błąd w ustrukturyzowanych danych wyjściowych. Dotyczy to obu modeli w tej samej tabeli, więc porównanie nie zostaje unieważnione, ale oznacza to, że wartości bezwzględne należy traktować jako migawkę, a nie ustalony wynik. Tabele benchmarków dostawców to artefakty marketingowe z aneksem metodologicznym, a ta jedna ma dołączony własny aneks.
Gdzie ląduje niezależny pomiar
Artificial Analysis ocenia oba modele w ramach jednego zestawu testowego, w tej samej konfiguracji, którą określa jako „Adaptive Reasoning, Max Effort, Default Fallback”, w Intelligence Index v4.3. Claude Opus 5.5 ma wynik 58. Claude Sonnet 5.5 ma wynik 56. To dwupunktowa różnica na skali, na której ten sam ewaluator umieszcza Opus 5 na 51, Sonnet 5 na 38, DeepSeek V4 Pro na 36, a Gemini 3.1 Pro Preview na 30. Nowy Sonnet, który wypada dwa punkty poniżej flagowego modelu i pięć punktów powyżej poprzedniej generacji Opus, to zasadnicza teza tej premiery, i jest to teza strony trzeciej, a nie dostawcy.
Potem ta sama strona odwraca jego ekonomikę. Artificial Analysis podaje, że uruchomienie ewaluacji Sonnet 5.5 kosztuje 7,60 USD za zadanie w porównaniu z 5,98 USD dla Opus 5.5, mimo że Sonnet 5.5 jest o połowę tańszy w przeliczeniu na token. Przyczyna jest wprost na tej stronie: Sonnet 5.5 wygenerował 410 milionów tokenów w całym zestawie indeksowym w porównaniu z medianą 88 milionów dla śledzonych modeli — „bardzo gadatliwy”, jak ujmuje to oceniający. Opus 5.5 wygenerował 260 milionów w tym samym zestawie. Przy 10 USD za milion tokenów wyjściowych wobec 20 USD współczynnik gadatliwości około 1,6 wciąż sprawia, że Sonnet 5.5 płaci około 27% więcej za ukończone zadanie.
To jest ta część porównania, której arkusz cen za token nie może ci pokazać, i to jest powód, dla którego obie liczby współistnieją bez sprzeczności. Za token Sonnet 5.5 jest o połowę tańszy. Za ukończone zadanie, w zestawie ewaluacyjnym z otwartymi promptami i bez dyscypliny dotyczącej długości odpowiedzi, może być droższy. To, który z tych przypadków opisuje twoje obciążenie, jest właściwą decyzją.
Poziomy wysiłku, limity wyjściowe i kształt integracji
Dla kupującego mechanicznie istotne właściwości są niemal identyczne w obu tych modelach.
• Kontekst — 1 000 000 tokenów w obu przypadkach, od tego samego dostawcy, więc założenia dotyczące inżynierii promptów przenoszą się bez zmian
• Maksymalna długość wyjścia — 128 000 tokenów w obu przypadkach; generowanie masowe nie jest tu czynnikiem wyróżniającym
• Modalność — wprowadzanie tekstu, obrazów i plików w obu; żadne z nich nie obsługuje dźwięku ani wideo
• Sterowanie rozumowaniem — myślenie adaptacyjne w obu przypadkach, a głębokość jest ustalana przez parametr wysiłku, a nie budżet tokenów myślenia. Na Claude Platform domyślnie jest wysoka; w aplikacjach Claude jest średnia.
• Zapis do pamięci podręcznej — 5,00 USD za milion dla Claude Opus 5.5 wobec 2,50 USD dla Claude Sonnet 5.5, jedyna pozycja, w której tańszy model jest również tańszym modelem do karmienia przebudowanym prefiksem
• Odczyt z pamięci podręcznej — 0,20 USD za milion w obu przypadkach, dokładny remis w pozycji, która dominuje w długich przebiegach agenta
Ponieważ interfejsy są zgodne, migracja między nimi to zmiana ciągu znaków modelu i ponowna ocena nakładu pracy, a nie projekt integracyjny. To nietypowe wśród dostawców i właśnie dlatego ta konkretna para w ogóle zasługuje na porównanie: dwaj kandydaci różnią się ceną i głębokością, a nie API, które trzeba napisać.
Jedna różnica operacyjna zasługuje na osobne zdanie. Anthropic podaje, że Claude Sonnet 5.5 to pierwszy Sonnet, który debiutuje z zabezpieczeniami cybernetycznymi i mechanizmami awaryjnymi na równi z jego modelami najwyższej klasy, co oznacza, że żądania dotyczące cyberbezpieczeństwa o wyższym ryzyku są w widoczny sposób kierowane do poprzedniego Sonneta, a nie obsługiwane przez model, który wskazano. Jeśli Twoje obciążenie dotyczy tej dziedziny, ciąg identyfikujący model nie gwarantuje, który model odpowiedział — na żadnym z poziomów. Anthropic zauważa również, że jeśli uruchamiasz Sonnet z wyłączonym myśleniem, musisz przełączyć się na zachowanie między narzędziami, co jest zmianą w kodzie, a nie flagą konfiguracyjną. Żadna z tych rzeczy nie jest powodem, by unikać tego modelu; obie są powodem, by wiedzieć o tym przed wdrożeniem.
W OrcaRouterClaude Opus 5.5 można już routować na tych samych poświadczeniach co każdy inny model w katalogu, w cenie katalogowej dostawcy z 0% marży, z dostępnym pod spodem automatycznym przełączaniem awaryjnym. Claude Sonnet 5.5 nie jest jeszcze trasą na naszej platformie — model ma jeden dzień, a dopóki nie zostanie wpisany do oferty, uczciwym stwierdzeniem jest, że dotarlibyście do niego przez własne API Anthropic. Każdy, kto obecnie korzysta z Opus 5.5 za naszym pośrednictwem, może w dniu jego pojawienia się wycenić to przejście, nie zmieniając niczego innego w swojej integracji.
Który gdzie umieścić
Podział, który wynika z liczb: Claude Sonnet 5.5 do pracy agentów związanej z terminalem, gdzie jest silniejszy z tej dwójki według własnego wyniku Anthropic w Terminal-Bench 4.0 i o połowę tańszy; Claude Sonnet 5.5 do wszystkiego, co ma charakter przepustowościowy, ponieważ różnica w kosztach zmniejsza się tylko wtedy, gdy zadanie wymusza długie dane wyjściowe; Claude Opus 5.5 do pracy klasy FrontierCode, długofalowych refaktoryzacji w dużych bazach kodu oraz każdego obciążenia, w którym przewaga 54,4% do 46,2% odzwierciedla kształt twojego rzeczywistego problemu, a nie wiersz w tabeli liderów.
Jeśli Twoje zadania są otwarte i nie potrafisz przewidzieć długości wyników, uznaj cenę za token za całkowicie niewłaściwą liczbę. Przez tydzień mierz liczbę tokenów na ukończone zadanie na własnym ruchu, zanim podejmiesz decyzję w którąkolwiek stronę; wartość artificial-analysis wynosząca 7,60 USD wobec 5,98 USD to ostrzeżenie, że tani model może przegrać w metryce, za którą faktycznie płacisz.
Szczera ocena: to już nie jest kompromis między możliwościami a kosztem. To kwestia tego, czy twoja praca jest ograniczona. W przypadku zadań ograniczonych, masowych i opartych na narzędziach tańszy model jest również lepszy, sądząc po dostępnych dowodach, a model flagowy nie jest wart podwójnej ceny. W przypadku pracy otwartej i długoterminowej zdanie samego Anthropic — że Opus 5.5 pozostaje wyraźnie silniejszy — jest tym, w które należy wierzyć, i jak dotąd żadna zbieżność benchmarków tego nie zmienia.



