
Claude Sonnet 5.5 kontra GPT-6 Sol: W segmencie za 2 dolary są teraz dwa flagowce
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 984 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 195 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
Claude Sonnet 5.5 i GPT-6 Sol mają identyczną cenę — $2 za milion tokenów wejściowych, $10 za milion tokenów wyjściowych — i pojawiły się w odstępie sześciu dni pod koniec września 2026 r. Ten zbieg okoliczności nie jest jednak najciekawszy. Najciekawsze jest to, że gdy Artificial Analysis zmierzyło oba modele na swoim Intelligence Index v4.3.2, średniej klasy model Anthropic wyprzedził model, który OpenAI sprzedaje jako swój model flagowy: 56 dla Claude Sonnet 5.5 wobec 47 dla GPT-6 Sol. W tej samej wersji indeksu Claude Sonnet 5 — model zastępowany przez Sonnet 5.5 — ma 38.
To już nie jest więc porównanie taniej wersji z drogą. To porównanie dwóch modeli w tej samej cenie, z dwóch laboratoriów, z 18-punktową różnicą między modelem Anthropic a jego własnym poprzednikiem oraz dziewięciopunktową przewagą Anthropic nad flagowym wydaniem OpenAI. Wszystko poniżej to próba ustalenia, która z tych różnic przetrwa zderzenie z rzeczywistym obciążeniem, a która jest wyłącznie artefaktem benchmarku.
Czym tak naprawdę jest każdy model
Claude Sonnet 5.5 to drugi model w generacji 5.5 Anthropic, wydany 28 września 2026 r., pięć dni po premierze Claude Opus 5.5, która go zapowiadała. Nosi identyfikator claude-sonnet-5-5 w Claude API, Amazon Bedrock, Google Cloud i Microsoft Foundry, zachowuje okno kontekstowe o rozmiarze 1 mln tokenów i limit wyjścia 128K dla tej klasy oraz dokładnie te same ceny co Claude Sonnet 5: 2 USD za wejście, 10 USD za wyjście, 0,20 USD za milion odczytów z pamięci podręcznej i 2,50 USD za zapis do pamięci podręcznej na pięć minut. Jest dostępny z zerowym przechowywaniem danych od pierwszego dnia, a zobowiązanie Anthropic do wycofania obowiązuje do 28 września 2027 r.

GPT-6 Sol jest następcą modelu o mylącej nazwie GPT-5.6 Sol — tego, który OrcaRouter wciąż wymienia jako dostępny w cenie 4 USD za wejście i 20 USD za wyjście, a który Artificial Analysis od tego czasu oznaczyło jako przestarzały, ze wskazaniem na GPT-6 Sol. Nowy model zadebiutował 22 września 2026 r. w cenie 2 USD / 10 USD, z oknem kontekstowym 1 050 000 tokenów, pułapem wyjściowym 128K i stawką progową: stawka bazowa 2 USD / 10 USD obowiązuje do 272 000 tokenów wejściowych, a wszystko powyżej jest rozliczane według 4 USD / 15 USD.
Ten ostatni szczegół to pierwsze miejsce, w którym załamuje się narracja o „identycznym cenniku”.
Równość cen zachodzi tylko w przypadku krótkich promptów.
Obie karty stawek podają 2 USD i 10 USD, a niemal każde porównanie z dnia premiery na tym poprzestało. Zestaw je ze sobą według warunków, które decydują o wysokości rachunku:
• Stawka wiodąca — Claude Sonnet 5.5 2 / 10 USD vs GPT-6 Sol 2 / 10 USD
• Stawka za długi kontekst — Sonnet 5.5 rozlicza pełne okno 1 mln według standardowej stawki; GPT-6 Sol podwaja do 4 / 15 USD powyżej 272 000 tokenów wejściowych
• Okno kontekstu — 1 000 000 tokenów vs 1 050 000 tokenów
• Maksymalna liczba tokenów wyjściowych — 128 tys. tokenów w synchronicznym API dla obu; Sonnet 5.5 osiąga 300 tys. w Message Batches API za output-300k-2026-03-24nagłówkiem
• Rabat wsadowy — 50% zniżki na wejście i wyjście dla Sonnet 5.5; sprawdź aktualne warunki OpenAI dla Sol, zamiast zakładać parytet
• Odczyty z pamięci podręcznej — 0,20 USD za milion w obu przypadkach
Przeszukanie repozytorium o rozmiarze 800 000 tokenów kosztuje dwukrotnie więcej za token na GPT-6 Sol niż na Claude Sonnet 5.5, a to jest dokładnie ten rodzaj obciążenia, dla którego oba modele są reklamowane. Jeśli Twoje prompty są krótkie, cenniki rzeczywiście są remisowe i cena nie powinna o niczym decydować. Jeśli są długie, już zdecydowała.
Własna tablica wyników Anthropic — czytaj uważnie.
Anthropic opublikowało czterokolumnowe porównanie z Claude Sonnet 5, Claude Opus 5.5 i GPT-6 Sol. Dane liczbowe podane przez dostawcę, których nie odtworzyła jeszcze żadna strona trzecia:

• Terminal-Bench 4.0 — Sonnet 5.5 70,6% vs Sonnet 5 10,3%
• FrontierCode 1.1, Main — Sonnet 5.5 46,2% przy maksymalnym wysiłku, Sonnet 5 42,4%, Opus 5.5 54,4%, GPT-6 Sol 49,3%
• CursorBench 4.0 — Sonnet 5.5 55,5% vs Sonnet 5 34,1% vs Opus 5.5 57,8%
• GDPval-AA v2.1 — Sonnet 5.5 1844 vs Sonnet 5 1449 vs Opus 5.5 1846 vs GPT-6 Sol 1487
• AA-Briefcase v1.1 — Sonnet 5.5 1811 vs Sonnet 5 1359 vs Opus 5.5 1822 vs GPT-6 Sol 1483
• Humanity's Last Exam, z narzędziami — Sonnet 5.5 64,5% kontra Sonnet 5 54,9% kontra Opus 5.5 67,7%
OSWorld 2.1, częściowo — Sonnet 5.5 80,1% vs Sonnet 5 57,0% vs Opus 5.5 81,8%
• Chartography, bez narzędzi — Sonnet 5.5 61,6% vs Sonnet 5 15,6% vs Opus 5.5 64,4% vs GPT-6 Sol 53,6%
Dwa z tych wierszy mają przypisy i oba mają znaczenie. Wartości GDPval-AA, AA-Briefcase i Chartography dla GPT-6 Sol są oznaczone przez Anthropic jako zmierzone po poprawce rozumienia obrazu po stronie OpenAI, a liczba FrontierCode dla Sonnet 5.5 to jego wynik przy Max-effort, który — jak zauważa Anthropic — wypadł poniżej jego własnego wyniku Xhigh w tej samej ewaluacji. Producent porównujący się z rywalem na benchmarku, który sam prowadzi, z przypisami zastrzegającymi obie strony, nie jest neutralnym dowodem. To najlepszy dowód dostępny w dniu premiery i nie jest tym samym co pomiar.
Co mówią niezależne liczby, a czego nie
Artificial Analysis opublikowało pierwszy niezależny przebieg: Index 56 na v4.3.2, koszt 7,60 USD za zadanie Index oraz wskaźnik gadatliwości wynoszący 410 mln tokenów wyjściowych wobec mediany 88 mln. Ta liczba dotycząca gadatliwości zasługuje na więcej uwagi, niż się jej obecnie poświęca. Oznacza to, że model ma tendencję do zużywania bardzo wielu tokenów na drodze do odpowiedzi, i jest mechanizmem stojącym za jedynym twierdzeniem o efektywności, które nie pochodzi z własnej tabeli Anthropic.
Anthropic twierdzi, że Claude Sonnet 5.5 generuje wyniki o 30% szybciej niż Claude Sonnet 5 i kosztuje „nawet o 30% mniej na zadanie” przy tej samej stawce za token. Te dwa twierdzenia razem opisują model, który wykonuje tę samą pracę przy mniejszej liczbie tokenów, a nie tańszy cennik. To, czy tak jest, to dokładnie to, do czego służy odczyt gadatliwości na poziomie 410 mln tokenów, a jeden niezależny przebieg nie wystarczy, by to rozstrzygnąć — ale wystarczy, by powiedzieć, że zdanie marketingowe i zmierzona liczba tokenów wskazują przeciwne kierunki, a to zmierzone jest tym, które pojawia się na fakturze.
Zauważ też, czego niezależny indeks jeszcze nie zawiera. Nie ma opublikowanej replikacji OSWorld, Terminal-Bench ani CursorBench autorstwa kogokolwiek innego niż Anthropic. A 56 to wynik złożony: nie mówi nic o tym, która z dziesięciu ewaluacji w nim zawartych odpowiadała za różnicę do wyniku Sola wynoszącego 47. Dziewięciopunktowa przewaga w wyniku złożonym może ukryć piętnastopunktową stratę w tej jednej ewaluacji, od której zależy twoje obciążenie.
Tam, gdzie rozchodzą się w sposób, którego nie pokaże cennik
Cena i wynik indeksu to dwie łatwe osie. O migracji decydują te behawioralne, a tutaj oba modele nie są sobie bliskie.

Claude Sonnet 5.5 domyślnie uruchamia myślenie adaptacyjne z high jako domyślnym poziomem wysiłku i usuwa trzy rzeczy, na które pozwalała poprzednia generacja: wysyłanie thinking: {"type": "disabled"} zwraca teraz błąd 400 i musi zostać zastąpione przez between_tools; wymuszone użycie narzędzia — tool_choice ustawione na "any" lub nazwane narzędzie — zwraca od razu błąd 400; a starsze computer_20251124 (narzędzie do obsługi komputera) jest odrzucane w Claude API i Google Cloud na rzecz zestawu narzędzi. Bloki myślenia są teraz również powiązane z modelem, który je wygenerował, więc rozmowa może przejść z Claude Sonnet 5 na Claude Sonnet 5.5 i zachować swoje rozumowanie, ale nie może już z nim wrócić.
Jeśli Twoja pętla agenta ustawia tool_choice: "any", aby wymusić wywołanie zgodne ze schematem, Claude Sonnet 5.5 będzie odrzucać żądanie, dopóki nie przełączysz się na auto ze ścisłym użyciem narzędzi lub ustrukturyzowanymi danymi wyjściowymi. To prawdziwe zadanie migracyjne i coś, co zamienia podmianę identyfikatora modelu w jednej linii w całe popołudnie.
Koszt przejścia na GPT-6 Sol jest odmienny rodzajowo, ponieważ zastępowany przez niego model wciąż znajduje się w katalogu i wciąż jest wywoływany. GPT-5.6 Sol nie został wycofany; jest oznaczony jako przestarzały w Artificial Analysis, wyceniony na dwukrotność nowego modelu i wciąż odbiera ruch. Własne pomiary OrcaRouter pokazują, że przetwarza około 95 milionów tokenów tygodniowo, co jest rozsądnym przybliżeniem tego, ile integracji jeszcze nie przeprowadziło migracji. Przejście na GPT-6 Sol to decyzja cenowa, którą możesz podjąć później; nie musisz podejmować jej teraz.
Uruchamianie porównania dla jednego klucza
Praktyczny problem z porównaniem dwóch dostawców polega na tym, że zwykle kosztuje to dwa konta, dwie ścieżki SDK i dwa zestawy limitów szybkości, zanim czegokolwiek się dowiesz. OrcaRouter istnieje po to, aby to zredukować: jeden punkt końcowy zgodny z OpenAI, ponad 200 modeli, cena katalogowa dostawcy przekazywana bez marży oraz automatyczne przełączanie awaryjne między dostawcami.
Oba modele, które mają tu znaczenie, można już dziś kierować przez tę platformę. GPT-6 Sol jest w katalogu w cenie 2 / 10 USD, z zachowanym poziomem długiego kontekstu, a Claude Sonnet 5 — model, na którym wciąż opiera się większość ruchu w Claude API, ze zmierzonymi 150 tokenami wyjściowymi na sekundę i medianą (p50) czasu do pierwszego tokena wynoszącą około pięciu sekund — jest na platformie od 30 czerwca w cenie 2 / 10 USD stosowanej przez samo Anthropic.
Sam Claude Sonnet 5.5 nie znajduje się jeszcze w naszym katalogu. Choć to prawda, uczciwa droga do niego wiedzie przez własne API dostawcy i trzy chmury, które wymienia Anthropic, a uczciwym sposobem jego oceny jest skierowanie go na wycinek ruchu, na którego utratę możesz sobie pozwolić. Do tego właśnie służy warstwa routingu: zwiększaj udział procentowy, obserwuj wskaźnik awaryjności i zachowaj poprzedni model jako rozwiązanie awaryjne, a nie jako plan wycofania.
Który z nich trafia na produkcję?
Wybieraj ze względu na kształt obciążenia, a nie na wynik zbiorczy.
Claude Sonnet 5.5 to lepszy zakup do pracy z długim kontekstem, dla wszystkiego, co zostało już napisane pod kątem interfejsu Anthropic do użycia narzędzi i computer-use, oraz dla zespołów, których prompty rutynowo przekraczają ćwierć miliona tokenów — okno stałej stawki jest tam warte więcej niż jakakolwiek delta indeksu. Trzeba zaakceptować, że do migracji dołączona jest lista kontrolna: wymuszone użycie narzędzi, przełącznik myślenia, pary narzędzi doradczych i zmiana narzędzia computer-use.
GPT-6 Sol to bezpieczniejszy wybór pod względem ciągłości dla stosu wzorowanego na OpenAI i tańszy, jeśli twoje prompty są krótkie, a integracje są już zbudowane. Jego zaletą nie są możliwości — w zbiorczym zestawieniu wypada słabiej — lecz to, że jego poprzednik wciąż działa, a migracja nie ma terminu.
Na podstawie dostępnych dziś danych liczbowych Claude Sonnet 5.5 wygrywa w bezpośrednim starciu pod względem niezależnego indeksu i ekonomiki długiego kontekstu, a nie przegrywa w niczym, co jakikolwiek opublikowany pomiar jest jeszcze w stanie wykryć poza poziomem ufności własnej tabeli dostawcy. To węższe twierdzenie niż to, które głoszą materiały premierowe, i to właśnie ono jest warte, by na jego podstawie działać.
To, co zmieniłoby odpowiedź, to drugi niezależny przebieg ewaluacji agentowych oraz opublikowany wskaźnik liczby tokenów na zadanie dla obu modeli na tych samych zadaniach. Dopóki nie powstaną oba, indeks złożony to dziewięciopunktowa przewaga dla modelu tańszego w eksploatacji, a dziewięciopunktowa przewaga w indeksie złożonym to nie to samo co dziewięciopunktowa przewaga w Twoim obciążeniu.
Porównane w tym artykule3
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
