
Claude Sonnet 5.5 vs Qwen3.8 Max: Sześć tygodni, dwa poziomy, jeden werdykt o kosztach
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 984 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 195 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
Przeprowadź obliczenia dla trzech promptów, a porównanie w większości rozstrzygnie się, zanim dotrzesz do benchmarków. Krótkie wywołanie w odpowiedzi na zgłoszenie do wsparcia: 2000 tokenów wejściowych, 500 wyjściowych. W Qwen3.8 Max przy 2 dolarach za milion tokenów wejściowych i 6 dolarach za milion wyjściowych to cztery dziesiąte centa; w Claude Sonnet 5.5 przy 2 i 10 dolarach to dziewięć dziesiątych centa. Refaktoryzacja repozytorium: 400 000 wejściowych, 30 000 wyjściowych — czterdzieści trzy centy w porównaniu z osiemdziesięcioma trzema. Długa sesja agentowa, która naprawdę wykorzystuje swój budżet: dwa miliony tokenów wejściowych, 200 000 wyjściowych, czyli 5,20 dolara kontra 6,30 dolara, gdy liczby stają się wystarczająco duże, by strona wejściowa zaczęła dominować.
Przepaść, która zaczyna się jako 2,25× różnica w cenie tokenów wyjściowych, zwęża się do około 1,2× w skali agentowej, a to skalowanie nie jest ciekawostką. Qwen3.8 Max i Claude Sonnet 5.5 to dwa modele 1M-tokenowe o wysokich limitach tokenów wyjściowych; oba wyceniono na 2 USD za milion tokenów wejściowych i oba wydano w ciągu ośmiu tygodni od siebie — wydanie dostawcy 3 sierpnia 2026 r. z aktualizacją z 2 września, a Anthropic 28 września. Różnica między nimi nie tkwi w cenniku. Tkwi w tym, ile każde z nich wydaje, aby ukończyć zadanie.
Co wysłano i kiedy
Qwen3.8 Max to najwyższy pod względem możliwości poziom Alibaby do tej pory. Alibaba w swoim własnym przewodniku migracji stawia go bezpośrednio w konkurencji z GPT-5.5, Claude Opus 4.7 i Gemini 3.1 Pro i zaleca go zawsze, gdy zadanie wymaga najsilniejszego dostępnego rozumowania. Ma okno kontekstowe 1M tokenów, przyjmuje dane wejściowe w postaci tekstu, obrazu i wideo, a zwraca tekst — obsługa wejścia wideo to jedyna funkcja tutaj, której nie ma Claude Sonnet 5.5. Ceny kształtują się następująco: 2 USD za milion tokenów wejściowych i 6 USD za milion tokenów wyjściowych, przy czym odczyty z pamięci podręcznej kosztują 0,25 USD, a zapisy do pamięci podręcznej 2,50 USD. Do wpisu z 3 sierpnia w naszym katalogu dołącza odświeżona wersja z 2 września oznaczona jako Qwen3.8 Max (0902), która ma takie same stawki podstawowe i limit wyjściowy 131K.

Claude Sonnet 5.5 to drugi model w generacji 5.5 firmy Anthropic, wydany 28 września 2026 r., sześć dni po Claude Opus 5.5. Jest udostępniany jako claude-sonnet-5-5 w Claude API oraz w Amazon Bedrock, Google Cloud i Microsoft Foundry, z oknem 1 mln tokenów i synchronicznym limitem wyjścia 128K, który można rozszerzyć do 300K w Message Batches API przy użyciu nagłówka output-300k-2026-03-24, a stawki Claude Sonnet 5 pozostały dokładnie takie same: 2 USD za wejście, 10 USD za wyjście, 0,20 USD za odczyty z pamięci podręcznej, 2,50 USD za zapisy do pamięci podręcznej. Zerowa retencja danych od momentu premiery, wycofanie nie wcześniej niż 28 września 2027 r.
Więc stawka za wejście jest identyczna, okna kontekstowe mają ten sam rozmiar, a obaj dostawcy odświeżyli swoje modele w odstępie miesiąca. Wszystko, co ich różni, tkwi w kosztach wyjściowych albo w benchmarkach.
Benchmarki: tabela dostawcy kontra niezależny indeks
Istnieją tu dwa rodzaje dowodów i nie są one wymienne.
Tabela premierowa Anthropic pochodzi z raportu dostawcy, nie została odtworzona przez żadną stronę trzecią i obejmuje osiem ewaluacji. Wiersze, które naprawdę się liczą
• Terminal-Bench 4.0 — Claude Sonnet 5.5: 70,6% wobec 10,3% Claude Sonnet 5
• CursorBench 4.0 — 55,5% w porównaniu z 34,1% Claude Sonnet 5
• GDPval-AA v2.1 — 1844 w porównaniu z 1449 dla Claude Sonnet 5, 1846 dla Claude Opus 5.5 i 1487 dla GPT-6 Sol
• Humanity's Last Exam, z narzędziami — 64,5% wobec 54,9%; Claude Opus 5.5 osiąga 67,7%
• OSWorld 2.1, częściowo — 80,1% wobec 57,0%
• Kartografia, bez narzędzi — 61,6% wobec 15,6%
Alibaba nie publikuje bezpośrednio równoważnej tabeli czterokolumnowej, więc jedynymi wartościami, które można umieścić na tej samej osi, są wartości niezależne. Artificial Analysis, wersja v4.3.2
• Indeks Inteligencji Złożonej — Claude Sonnet 5.5 56 na 3. miejscu spośród 216; Qwen3.8 Max 45 na 27. miejscu
• Koszt na zadanie Intelligence Index — 7,60 USD wobec 5,41 USD
• Szybkość generowania — model firmy Anthropic jest porównywany z wartością bazową Claude Sonnet 5, która wynosi zmierzone 78,7 tokena na sekundę; dla Qwen3.8 Max zmierzono 39,1
• Gadatliwość — 410 mln tokenów wyjściowych w Indeksie w porównaniu z 190 mln
Własne wyniki Qwen3.8 Max w poszczególnych ewaluacjach są przyzwoite, a nie marginalne: 92,8% w GPQA Diamond, 88,8% w Terminal-Bench 2.1, 80,3% w przywoływaniu długiego kontekstu, 47,8% w tau-banking. Traci pozycję w wyniku zbiorczym, ponieważ nie wygrywa niczego zdecydowanie, a nowszy poziom Anthropic wygrywa kilka rzeczy bezapelacyjnie. Zauważ również, że niezależna strona dla Qwen3.8 Max podaje datę wydania 2 września 2026 i odczyt kontekstu 984K — opisuje ona odświeżenie (0902), a nie sierpniową kompilację, a mieszanie danych między tymi dwoma byłoby błędem.

To, czego brakuje w obu kolumnach, jest równie ważne jak to, co się w nich znajduje. Nikt niezależnie nie odtworzył liczb Anthropic dla OSWorld lub Terminal-Bench. Nikt nie opublikował wyniku Chartography ani CursorBench dla Qwen3.8 Max. Wynik złożony to jedyna liczba mierzona w ten sam sposób na obu modelach, i właśnie dlatego wskaźnik kosztu na zadanie pod nim odgrywa tak dużą rolę.
Liczba, która o tym decyduje, a nie ma jej na żadnej z tych dwóch kart stawek
Artificial Analysis rozlicza oba modele w ten sam sposób: uruchom dziesięć ewaluacji w Indeksie, policz tokeny, pomnóż przez cenę katalogową. Claude Sonnet 5.5 wypada na 7,60 USD za zadanie, a Qwen3.8 Max na 5,41 USD — o 40% drożej w przypadku modelu Anthropic mimo wyższego wyniku złożonego. Odczyty rozwlekłości wyjaśniają kierunek — 410 mln tokenów wobec 190 mln — a odczyty szybkości wyjaśniają resztę: model, który generuje mniej tokenów i potrzebuje więcej czasu na token, nie jest tym, który płaci za wyjście dwa razy większą stawkę.
Własne twierdzenie Anthropic o efektywności wpisuje się w tę samą historię, a nie stoi z nią w sprzeczności. Firma twierdzi, że Claude Sonnet 5.5 generuje wyniki o ponad 30% szybciej niż Claude Sonnet 5 i kosztuje „do 30% mniej na zadanie” przy identycznych cenach — to twierdzenie o liczbie tokenów na zadanie, a nie o stawkach. To, czy utrzymuje się ono w starciu z modelem, który zużywa mniej niż połowę tylu tokenów, jest dokładnie tym, o co pyta liczba $7.60, a jeden niezależny przebieg to jeden punkt danych.
Praktyczna konsekwencja: stawka za tokeny wyjściowe 6 USD kontra 10 USD to liczba, na którą spojrzy dział zakupów, i jest to najmniej predykcyjna liczba w artykule. Liczbą, która pozwala przewidywać, jest liczba tokenów przypadających na zadanie przy twoich własnych promptach, a żaden z dostawców nie poda ci jej.
Wejścia, wideo i pułapka migracji
Różnica w możliwościach, która od razu rzuca się w oczy, dotyczy modalności. Qwen3.8 Max przyjmuje wideo obok tekstu i obrazów; Claude Sonnet 5.5 przyjmuje tekst i obrazy. W przypadku analizy nagrań ekranu, potoków przetwarzania nagrań ze spotkań czy czegokolwiek, co traktuje wideo jako wejście pierwszej klasy, nie jest to luka w benchmarku — to zero-jedynkowe pytanie o kwalifikowalność i tylko jeden z tych modeli je przechodzi.

Różnica, która ujawnia się tydzień później, ma charakter behawioralny. Claude Sonnet 5.5 wprowadza pięć zmian łamiących zgodność w kodzie działającym na Claude Sonnet 5. Ustawienie inne niż domyślne dla temperature, top_p lub top_k zwraca teraz błąd 400. Wysłanie thinking: {"type": "disabled"} zwraca błąd 400 wskazujący na between_tools, nowe najniższe ustawienie myślenia, akceptowane przy niskim, średnim i wysokim poziomie wysiłku i odrzucane przy xhigh lub max. Wymuszone użycie narzędzi — tool_choice ustawiony na "any" lub na nazwane narzędzie — zwraca od razu błąd 400. Starsze narzędzie computer_20251124 do obsługi komputera jest odrzucane w Claude API i Google Cloud. A bloki myślenia są powiązane z modelem i kontem, które je utworzyły, więc rozumowanie można przenosić dalej z Claude Sonnet 5, ale nie do innej rodziny, a edytowany prefiks rozmowy może sprawić, że ponowne odtworzenie zakończy się błędem.
Qwen3.8 Max nie wymaga niczego z tego. To model w formacie OpenAI o konwencjonalnej powierzchni żądań, a przejście na niego z innego poziomu Qwen to zmiana ciągu modelu.
Zważ uczciwie oba koszty. Wybór modelu Qwen kosztuje cię jedenastopunktową różnicę w wyniku złożonym oraz liczby dostawcy Anthropic, których i tak nie możesz niezależnie zweryfikować. Wybór modelu Anthropic kosztuje cię wejście wideo i listę kontrolną czterech zmian w API, z których każda przy pierwszym wywołaniu głośno zawiedzie błędem 400 — co jest tym dobrym rodzajem porażki, ale tak czy inaczej dniem pracy.
Gdzie pasuje OrcaRouter
Powód, dla którego należy raczej kierować ruch niż dokonywać wyboru, jest taki, że decydującej liczby — kosztu na zadanie w Twoim ruchu — nie da się obliczyć na podstawie dokumentacji żadnego z dostawców.
OrcaRouter to pojedynczy endpoint zgodny z OpenAI obejmujący ponad 200 modeli, w którym ceny katalogowe dostawców są przekazywane bez narzutu, więc obniżka ceny lub zmiana poziomu po którejkolwiek ze stron obowiązuje tego samego dnia, w którym zostanie ogłoszona. Obie wersje Qwen3.8 Max znajdują się w katalogu w cenie, jaką podaje sam Alibaba: $2 / $6 — sierpniowe wydanie i odświeżenie (0902) — obok Claude Sonnet 5, modelu, na którym nadal działa większość ruchu Claude API, routowalnego od 30 czerwca w cenie Anthropic $2 / $10 ze zmierzonymi 150 tokenami wyjściowymi na sekundę. Sam Claude Sonnet 5.5 nie znajduje się jeszcze w naszym katalogu; choć to prawda, uczciwa droga do niego prowadzi przez własne API dostawcy i trzy chmury wymieniane przez Anthropic, a sposobem na wypróbowanie go bez przenoszenia obciążenia jest część ruchu za automatycznym przełączaniem awaryjnym do Claude Sonnet 5 lub Qwen3.8 Max.
Który do jakiej pracy
Qwen3.8 Max wygrywa w zakresie wejścia wideo, tempa generowania wyników, zmierzonego kosztu na zadanie indeksowania oraz nakładu związanego z integracją. To właściwy domyślny wybór do pracy o dużym wolumenie i dobrze określonych wymaganiach, w której dwunastopunktowa różnica w wyniku złożonym nie uwidacznia się w jakości wyników.
Claude Sonnet 5.5 wygrywa w niezależnym kompozycie, w ewaluacjach kodowania agentowego, gdzie liczby dostawcy Anthropic pokazały 60-punktowy skok w porównaniu z własnym poprzednikiem w Terminal-Bench 4.0, w pułapie 300K wyjścia wsadowego i w decyzji ukształtowanej przez zadanie, której nie może podjąć cennik: to model, który należy wybrać, gdy zadanie jest tak trudne, że bycie poprawnym liczy się bardziej niż bycie tanim.
To, co zmieniłoby odpowiedź w obu przypadkach, to ta sama rzecz, i nie jest to nowe wydanie benchmarku. To liczba tokenów na zadanie na twoich własnych promptach, przy twoich własnych ustawieniach wysiłku, dla obu modeli. Parametr wysiłku Anthropic i pułap wyjściowy Qwen to dźwignie wpływające na tę liczbę, a obie są ustawiane przez ciebie, a nie przez cennik dostawcy.
Jedno, co to porównanie rzeczywiście rozstrzyga: przy 2 dolarach za milion tokenów wejściowych wejściowa strona rachunku nie jest już czynnikiem odróżniającym chiński flagowiec od modelu średniej klasy Anthropic. Ten wyścig już miesiące temu przeniósł się na stronę wyjściową i na liczbę tokenów.
Porównane w tym artykule3
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
