Hero-kort med rubriken Claude Sonnet 5.5 vs Qwen3.8 Max, med underrubriken sex veckor, två nivåer, en slutsats om kostnad, med piller som anger input $2 för båda, output $10 vs $6 och Index 56 vs 45, samt en sidfot som hänvisar till Artificial Analysis v4.3.2 och leverantörspriser.
Guides & Insights

Claude Sonnet 5.5 vs Qwen3.8 Max: Sex veckor, två nivåer, en slutsats om kostnad

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Räkna på tre prompter och jämförelsen är i stort sett avgjord innan du ens når benchmarkarna. Ett kort supportsvarsanrop: 2 000 indatatoken, 500 utdata. På Qwen3.8 Max till $2 per miljon in och $6 per miljon ut är det fyra tiondels cent; på Claude Sonnet 5.5 till $2 och $10 är det nio tiondels cent. En refaktorering av ett kodförråd: 400 000 indata, 30 000 utdata — fyrtiotre cent mot åttiotre. En lång agentisk session som faktiskt spenderar sin budget: två miljoner token in, 200 000 ut, så $5,20 mot $6,30 när siffrorna blir tillräckligt stora för att indatasidan ska dominera.

Klyftan som börjar som en skillnad på 2,25× i priset för utdata krymper till ungefär 1,2× vid agentisk skala, och den skalningen är inte en kuriositet. Qwen3.8 Max och Claude Sonnet 5.5 är båda modeller med 1M tokens och höga utdatatak, båda prissatta till 2 USD per miljon för indata, och båda släppta inom åtta veckor från varandra – leverantörens den 3 augusti 2026 med en daterad uppdatering den 2 september, och Anthropics den 28 september. Skillnaden mellan dem är inte prislistan. Det är vad var och en gör av med för att slutföra.

Vad som släpptes, och när

Qwen3.8 Max är Alibabas högsta kapacitetsnivå hittills. Alibaba positionerar den direkt mot GPT-5.5, Claude Opus 4.7 och Gemini 3.1 Pro i sin egen migreringsguide och rekommenderar den när en uppgift kräver den starkaste tillgängliga resonemangsförmågan. Den har ett kontextfönster på 1M tokens, tar emot text-, bild- och videoindata och skickar ut text – videoindatafunktionen är den enda kapaciteten här som Claude Sonnet 5.5 inte har. Priset är $2 per miljon indatatoken och $6 per miljon utdatatoken, med cacheläsningar på $0.25 och cacheskrivningar på $2.50. Katalogposten från 3 augusti får sällskap av en uppdatering från 2 september listad som Qwen3.8 Max (0902), som har samma angivna priser och ett utdatatak på 131K.

Two-column scoreboard for Claude Sonnet 5.5 and Qwen3.8 Max across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, text and image input, AA Intelligence Index 56, cost per Index task $7.60, released September 28 2026. Right column Qwen3.8 Max: input $2.00 per million, output $6.00 per million, text image and video input, AA Intelligence Index 45, cost per Index task $5.41, September 2 2026 refresh. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

Claude Sonnet 5.5 är den andra modellen i Anthropics 5.5-generation, släppt den 28 september 2026, sex dagar efter Claude Opus 5.5. Den levereras som claude-sonnet-5-5 i Claude API och via Amazon Bedrock, Google Cloud och Microsoft Foundry, med ett fönster på 1 miljon tokens, ett synkront utdatatak på 128K som utökas till 300K i Message Batches API bakom headern output-300k-2026-03-24, och med Claude Sonnet 5:s priser oförändrade: 2 USD in, 10 USD ut, 0,20 USD för cachereads, 2,50 USD för cachewrites. Noll datalagring från lanseringen, avveckling tidigast den 28 september 2027.

Så indataraten är identisk, kontextfönstren är lika stora, och de två leverantörerna uppdaterade inom en månad från varandra. Allt som skiljer dem åt finns på utdatasidan av fakturan eller i benchmarkarna.

Prestandatester: leverantörstabell mot oberoende index

Det finns två typer av bevis här, och de är inte utbytbara.

Anthropics lanseringstabell är leverantörsrapporterad, inte reproducerad av någon tredje part och omfattar åtta utvärderingar. Raderna som spelar roll

• Terminal-Bench 4.0 — Claude Sonnet 5.5 70,6 % mot Claude Sonnet 5:s 10,3 %

• CursorBench 4.0 — 55,5 % mot Claude Sonnet 5:s 34,1 %

• GDPval-AA v2.1 — 1844 mot 1449 för Claude Sonnet 5, 1846 för Claude Opus 5.5 och 1487 för GPT-6 Sol

• Humanity's Last Exam, med verktyg — 64,5 % mot 54,9 %; Claude Opus 5.5 ligger på 67,7 %

• OSWorld 2.1, partiell — 80,1 % mot 57,0 %

• Chartography, inga verktyg — 61,6 % mot 15,6 %

Alibaba publicerar inte en direkt motsvarande fyrkolumnstabell, så de enda siffror som kan placeras på samma axel är de oberoende. Artificial Analysis, v4.3.2-revision

• Sammansatt intelligensindex — Claude Sonnet 5.5 56 på plats 3 av 216; Qwen3.8 Max 45 på plats 27

• Kostnad per Intelligence Index-uppgift — 7,60 $ mot 5,41 $

• Utdatashastighet — Anthropics modell körs mot en baslinje för Claude Sonnet 5 uppmätt till 78,7 tokens per sekund; Qwen3.8 Max uppmätts till 39,1

• Mångordighet — 410M utdatatokens på Index mot 190M

Qwen3.8 Maxs egna poäng per utvärdering är respektabla snarare än marginella: 92,8 % på GPQA Diamond, 88,8 % på Terminal-Bench 2.1, 80,3 % på återkallelse i lång kontext, 47,8 % på tau-banking. Det tappar mark i det sammansatta resultatet eftersom det inte vinner något på ett avgörande sätt och den nyare Anthropic-nivån vinner flera saker rakt av. Notera också att den oberoende sidan för Qwen3.8 Max har ett releasedatum den 2 september 2026 och en kontextangivelse på 984K – den beskriver (0902)-uppdateringen, inte augustiversionen, och att blanda siffror mellan de två vore ett misstag.

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56, a price of $2.00 per million input tokens and $10.00 per million output tokens, a cost of $7.60 per Intelligence Index task, a verbosity of 410M output tokens against a median of 88M, and a 1M-token context window.

Det som saknas i båda kolumnerna är lika viktigt som det som finns i dem. Ingen har oberoende reproducerat Anthropics OSWorld- eller Terminal-Bench-siffror. Ingen har publicerat en Chartography- eller CursorBench-siffra för Qwen3.8 Max. Kompositvärdet är det enda talet som har mätts på samma sätt på båda modellerna, vilket är precis varför siffran för kostnad per uppgift under det gör så mycket arbete.

Siffran som avgör saken, och den finns inte på någon av de båda prislistorna

Artificial Analysis debiterar båda modellerna på samma sätt: kör de tio utvärderingarna i Index, räkna tokens och multiplicera med listpriset. Claude Sonnet 5.5 hamnar på 7,60 dollar per uppgift och Qwen3.8 Max på 5,41 dollar, en premie på 40 % för Anthropic-modellen trots en högre sammanvägd poäng. Verbositetsmätningarna förklarar riktningen – 410M tokens mot 190M – och hastighetsmätningarna förklarar resten: en modell som avger färre tokens och tar längre tid per token är inte den som betalar för utdata till dubbelt så hög taxa.

Anthropics eget effektivitetspåstående passar in i samma bild i stället för att motsäga den. Företaget säger att Claude Sonnet 5.5 genererar utdata 30 %+ snabbare än Claude Sonnet 5 och kostar "upp till 30 % mindre per uppgift" vid identiska priser – ett påstående om tokens per uppgift, inte om taxor. Huruvida det håller mot en modell som förbrukar mindre än hälften så många tokens är precis vad siffran 7,60 dollar frågar efter, och en oberoende körning är en datapunkt.

Den praktiska konsekvensen: utdatapriset på 6 dollar mot 10 dollar är den siffra som inköpsavdelningen kommer att titta på, och det är den minst prediktiva siffran i artikeln. Den prediktiva siffran är tokens per uppgift på dina egna prompter, och ingen av leverantörerna kommer att ge dig den.

Ingångar, video och migrationsfällan

Den förmågeskillnad som omedelbart framträder är modaliteten. Qwen3.8 Max tar emot video tillsammans med text och bilder; Claude Sonnet 5.5 tar emot text och bilder. För analys av skärminspelningar, pipelines för mötesinspelningar eller vad som helst som behandlar video som förstklassig indata är det inte en benchmark-skillnad – det är en binär behörighetsfråga, och bara en av dessa modeller är behörig.

OrcaRouter model page for qwen/qwen3.8-max, attributed to Qwen and dated 2026-08-03, showing a 1M-token context window, text, image and video input, an input price of $2.00 and output price of $6.00 per million tokens, a p50 time to first token of 2.25 seconds, and 53.0M tokens of traffic in the last seven days.

Skillnaden som visar sig en vecka senare är beteendemässig. Claude Sonnet 5.5 gör fem brytande ändringar i kod som körs på Claude Sonnet 5. En icke-standard temperature, top_p eller top_k returnerar nu en 400. Att skicka thinking: {"type": "disabled"} returnerar en 400 som pekar på between_tools, den nya lägsta thinking-inställningen, accepterad vid low, medium och high effort och avvisad vid xhigh eller max. Forcerad verktygsanvändning — tool_choice av "any" eller ett namngivet verktyg — returnerar en 400 direkt. Det äldre computer_20251124 computer-use-verktyget avvisas i Claude API och Google Cloud. Och thinking-block är bundna till modellen och kontot som producerade dem, så resonemang kan föras vidare från Claude Sonnet 5 men inte ut till en annan familj, och ett redigerat konversationsprefix kan göra en återuppspelning till ett fel.

Qwen3.8 Max begär inget av det. Det är en modell i OpenAI-format med en konventionell anropsyta, och att byta till den från en annan Qwen-nivå är en ändring av modellsträngen.

Väg de två kostnaderna ärligt. Att välja Qwen-modellen kostar dig det sammansatta gapet på elva punkter och de Anthropic-leverantörssiffror som du ändå inte kan verifiera oberoende. Att välja Anthropic-modellen kostar dig videoinmatning och en checklista med fyra API-ändringar som var och en kommer att misslyckas högljutt med en 400 första gången de anropas – vilket är den bra sortens fel, men en dags arbete ändå.

Var OrcaRouter passar in

Anledningen till att routa i stället för att välja är att det avgörande talet – kostnad per uppgift på din trafik – inte kan beräknas utifrån någon av leverantörernas dokumentation.

OrcaRouter är en enda OpenAI-kompatibel slutpunkt över 200+ modeller med leverantörens listpris vidarebefordrat utan påslag, så en prissänkning eller en nivåändring hos endera parten är live samma dag som den meddelas. Båda byggena av Qwen3.8 Max finns i katalogen till Alibabas egna $2 / $6 — augustiversionen och (0902)-uppdateringen — tillsammans med Claude Sonnet 5, modellen som merparten av Claude API-trafiken fortfarande körs på, kan routas sedan 30 juni till Anthropics $2 / $10 med en uppmätt hastighet på 150 utdatatokens per sekund. Claude Sonnet 5.5 finns ännu inte i vår katalog; även om det stämmer är den ärliga vägen till den leverantörens eget API och de tre molntjänster som Anthropic listar, och sättet att testa den utan att flytta en arbetsbelastning är en del av trafiken bakom automatisk failover till Claude Sonnet 5 eller Qwen3.8 Max.

Vilken, för vilket jobb

Qwen3.8 Max vinner på videoinmatning, på utdatahastighet, på uppmätt kostnad per indextask och på integrationsinsats. Det är rätt standardval för högvolymarbete med tydlig specifikation, där en sammansatt skillnad på tolv punkter inte syns i utdatakvaliteten.

Claude Sonnet 5.5 vinner i den oberoende sammanvägningen, i agentiska kodutvärderingar där Anthropics leverantörssiffror visade ett hopp på 60 punkter jämfört med sin egen föregångare på Terminal-Bench 4.0, på taket om 300K för batchutdata och i ett beslut format efter uppdraget som ett prisblad inte kan fatta: det är modellen att välja när uppgiften är tillräckligt svår för att det ska vara viktigare att ha rätt än att vara billig.

Det som skulle ändra svaret för endera av dem är samma sak, och det är inte ett nytt benchmark-släpp. Det är ett antal tokens per uppgift för dina egna prompter, med dina egna effort-inställningar, för båda modellerna. Anthropics effort-parameter och Qwens utdatatak är båda spakar som påverkar den siffran, och båda ställs in av dig snarare än av leverantörens prislista.

Det enda den här jämförelsen faktiskt slår fast: vid 2 dollar per miljon för input är inputsidan av kostnaden inte längre en särskiljande faktor mellan en kinesisk flaggskeppsmodell och Anthropics mellannivå. Det racet flyttade över till outputsidan och tokenantalet redan för månader sedan.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen