
Claude Sonnet 5.5 vs Qwen3.8 Max: Sex veckor, två nivåer, en slutsats om kostnad
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 984 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 195 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
Räkna på tre prompter och jämförelsen är i stort sett avgjord innan du ens når benchmarkarna. Ett kort supportsvarsanrop: 2 000 indatatoken, 500 utdata. På Qwen3.8 Max till $2 per miljon in och $6 per miljon ut är det fyra tiondels cent; på Claude Sonnet 5.5 till $2 och $10 är det nio tiondels cent. En refaktorering av ett kodförråd: 400 000 indata, 30 000 utdata — fyrtiotre cent mot åttiotre. En lång agentisk session som faktiskt spenderar sin budget: två miljoner token in, 200 000 ut, så $5,20 mot $6,30 när siffrorna blir tillräckligt stora för att indatasidan ska dominera.
Klyftan som börjar som en skillnad på 2,25× i priset för utdata krymper till ungefär 1,2× vid agentisk skala, och den skalningen är inte en kuriositet. Qwen3.8 Max och Claude Sonnet 5.5 är båda modeller med 1M tokens och höga utdatatak, båda prissatta till 2 USD per miljon för indata, och båda släppta inom åtta veckor från varandra – leverantörens den 3 augusti 2026 med en daterad uppdatering den 2 september, och Anthropics den 28 september. Skillnaden mellan dem är inte prislistan. Det är vad var och en gör av med för att slutföra.
Vad som släpptes, och när
Qwen3.8 Max är Alibabas högsta kapacitetsnivå hittills. Alibaba positionerar den direkt mot GPT-5.5, Claude Opus 4.7 och Gemini 3.1 Pro i sin egen migreringsguide och rekommenderar den när en uppgift kräver den starkaste tillgängliga resonemangsförmågan. Den har ett kontextfönster på 1M tokens, tar emot text-, bild- och videoindata och skickar ut text – videoindatafunktionen är den enda kapaciteten här som Claude Sonnet 5.5 inte har. Priset är $2 per miljon indatatoken och $6 per miljon utdatatoken, med cacheläsningar på $0.25 och cacheskrivningar på $2.50. Katalogposten från 3 augusti får sällskap av en uppdatering från 2 september listad som Qwen3.8 Max (0902), som har samma angivna priser och ett utdatatak på 131K.

Claude Sonnet 5.5 är den andra modellen i Anthropics 5.5-generation, släppt den 28 september 2026, sex dagar efter Claude Opus 5.5. Den levereras som claude-sonnet-5-5 i Claude API och via Amazon Bedrock, Google Cloud och Microsoft Foundry, med ett fönster på 1 miljon tokens, ett synkront utdatatak på 128K som utökas till 300K i Message Batches API bakom headern output-300k-2026-03-24, och med Claude Sonnet 5:s priser oförändrade: 2 USD in, 10 USD ut, 0,20 USD för cachereads, 2,50 USD för cachewrites. Noll datalagring från lanseringen, avveckling tidigast den 28 september 2027.
Så indataraten är identisk, kontextfönstren är lika stora, och de två leverantörerna uppdaterade inom en månad från varandra. Allt som skiljer dem åt finns på utdatasidan av fakturan eller i benchmarkarna.
Prestandatester: leverantörstabell mot oberoende index
Det finns två typer av bevis här, och de är inte utbytbara.
Anthropics lanseringstabell är leverantörsrapporterad, inte reproducerad av någon tredje part och omfattar åtta utvärderingar. Raderna som spelar roll
• Terminal-Bench 4.0 — Claude Sonnet 5.5 70,6 % mot Claude Sonnet 5:s 10,3 %
• CursorBench 4.0 — 55,5 % mot Claude Sonnet 5:s 34,1 %
• GDPval-AA v2.1 — 1844 mot 1449 för Claude Sonnet 5, 1846 för Claude Opus 5.5 och 1487 för GPT-6 Sol
• Humanity's Last Exam, med verktyg — 64,5 % mot 54,9 %; Claude Opus 5.5 ligger på 67,7 %
• OSWorld 2.1, partiell — 80,1 % mot 57,0 %
• Chartography, inga verktyg — 61,6 % mot 15,6 %
Alibaba publicerar inte en direkt motsvarande fyrkolumnstabell, så de enda siffror som kan placeras på samma axel är de oberoende. Artificial Analysis, v4.3.2-revision
• Sammansatt intelligensindex — Claude Sonnet 5.5 56 på plats 3 av 216; Qwen3.8 Max 45 på plats 27
• Kostnad per Intelligence Index-uppgift — 7,60 $ mot 5,41 $
• Utdatashastighet — Anthropics modell körs mot en baslinje för Claude Sonnet 5 uppmätt till 78,7 tokens per sekund; Qwen3.8 Max uppmätts till 39,1
• Mångordighet — 410M utdatatokens på Index mot 190M
Qwen3.8 Maxs egna poäng per utvärdering är respektabla snarare än marginella: 92,8 % på GPQA Diamond, 88,8 % på Terminal-Bench 2.1, 80,3 % på återkallelse i lång kontext, 47,8 % på tau-banking. Det tappar mark i det sammansatta resultatet eftersom det inte vinner något på ett avgörande sätt och den nyare Anthropic-nivån vinner flera saker rakt av. Notera också att den oberoende sidan för Qwen3.8 Max har ett releasedatum den 2 september 2026 och en kontextangivelse på 984K – den beskriver (0902)-uppdateringen, inte augustiversionen, och att blanda siffror mellan de två vore ett misstag.

Det som saknas i båda kolumnerna är lika viktigt som det som finns i dem. Ingen har oberoende reproducerat Anthropics OSWorld- eller Terminal-Bench-siffror. Ingen har publicerat en Chartography- eller CursorBench-siffra för Qwen3.8 Max. Kompositvärdet är det enda talet som har mätts på samma sätt på båda modellerna, vilket är precis varför siffran för kostnad per uppgift under det gör så mycket arbete.
Siffran som avgör saken, och den finns inte på någon av de båda prislistorna
Artificial Analysis debiterar båda modellerna på samma sätt: kör de tio utvärderingarna i Index, räkna tokens och multiplicera med listpriset. Claude Sonnet 5.5 hamnar på 7,60 dollar per uppgift och Qwen3.8 Max på 5,41 dollar, en premie på 40 % för Anthropic-modellen trots en högre sammanvägd poäng. Verbositetsmätningarna förklarar riktningen – 410M tokens mot 190M – och hastighetsmätningarna förklarar resten: en modell som avger färre tokens och tar längre tid per token är inte den som betalar för utdata till dubbelt så hög taxa.
Anthropics eget effektivitetspåstående passar in i samma bild i stället för att motsäga den. Företaget säger att Claude Sonnet 5.5 genererar utdata 30 %+ snabbare än Claude Sonnet 5 och kostar "upp till 30 % mindre per uppgift" vid identiska priser – ett påstående om tokens per uppgift, inte om taxor. Huruvida det håller mot en modell som förbrukar mindre än hälften så många tokens är precis vad siffran 7,60 dollar frågar efter, och en oberoende körning är en datapunkt.
Den praktiska konsekvensen: utdatapriset på 6 dollar mot 10 dollar är den siffra som inköpsavdelningen kommer att titta på, och det är den minst prediktiva siffran i artikeln. Den prediktiva siffran är tokens per uppgift på dina egna prompter, och ingen av leverantörerna kommer att ge dig den.
Ingångar, video och migrationsfällan
Den förmågeskillnad som omedelbart framträder är modaliteten. Qwen3.8 Max tar emot video tillsammans med text och bilder; Claude Sonnet 5.5 tar emot text och bilder. För analys av skärminspelningar, pipelines för mötesinspelningar eller vad som helst som behandlar video som förstklassig indata är det inte en benchmark-skillnad – det är en binär behörighetsfråga, och bara en av dessa modeller är behörig.

Skillnaden som visar sig en vecka senare är beteendemässig. Claude Sonnet 5.5 gör fem brytande ändringar i kod som körs på Claude Sonnet 5. En icke-standard temperature, top_p eller top_k returnerar nu en 400. Att skicka thinking: {"type": "disabled"} returnerar en 400 som pekar på between_tools, den nya lägsta thinking-inställningen, accepterad vid low, medium och high effort och avvisad vid xhigh eller max. Forcerad verktygsanvändning — tool_choice av "any" eller ett namngivet verktyg — returnerar en 400 direkt. Det äldre computer_20251124 computer-use-verktyget avvisas i Claude API och Google Cloud. Och thinking-block är bundna till modellen och kontot som producerade dem, så resonemang kan föras vidare från Claude Sonnet 5 men inte ut till en annan familj, och ett redigerat konversationsprefix kan göra en återuppspelning till ett fel.
Qwen3.8 Max begär inget av det. Det är en modell i OpenAI-format med en konventionell anropsyta, och att byta till den från en annan Qwen-nivå är en ändring av modellsträngen.
Väg de två kostnaderna ärligt. Att välja Qwen-modellen kostar dig det sammansatta gapet på elva punkter och de Anthropic-leverantörssiffror som du ändå inte kan verifiera oberoende. Att välja Anthropic-modellen kostar dig videoinmatning och en checklista med fyra API-ändringar som var och en kommer att misslyckas högljutt med en 400 första gången de anropas – vilket är den bra sortens fel, men en dags arbete ändå.
Var OrcaRouter passar in
Anledningen till att routa i stället för att välja är att det avgörande talet – kostnad per uppgift på din trafik – inte kan beräknas utifrån någon av leverantörernas dokumentation.
OrcaRouter är en enda OpenAI-kompatibel slutpunkt över 200+ modeller med leverantörens listpris vidarebefordrat utan påslag, så en prissänkning eller en nivåändring hos endera parten är live samma dag som den meddelas. Båda byggena av Qwen3.8 Max finns i katalogen till Alibabas egna $2 / $6 — augustiversionen och (0902)-uppdateringen — tillsammans med Claude Sonnet 5, modellen som merparten av Claude API-trafiken fortfarande körs på, kan routas sedan 30 juni till Anthropics $2 / $10 med en uppmätt hastighet på 150 utdatatokens per sekund. Claude Sonnet 5.5 finns ännu inte i vår katalog; även om det stämmer är den ärliga vägen till den leverantörens eget API och de tre molntjänster som Anthropic listar, och sättet att testa den utan att flytta en arbetsbelastning är en del av trafiken bakom automatisk failover till Claude Sonnet 5 eller Qwen3.8 Max.
Vilken, för vilket jobb
Qwen3.8 Max vinner på videoinmatning, på utdatahastighet, på uppmätt kostnad per indextask och på integrationsinsats. Det är rätt standardval för högvolymarbete med tydlig specifikation, där en sammansatt skillnad på tolv punkter inte syns i utdatakvaliteten.
Claude Sonnet 5.5 vinner i den oberoende sammanvägningen, i agentiska kodutvärderingar där Anthropics leverantörssiffror visade ett hopp på 60 punkter jämfört med sin egen föregångare på Terminal-Bench 4.0, på taket om 300K för batchutdata och i ett beslut format efter uppdraget som ett prisblad inte kan fatta: det är modellen att välja när uppgiften är tillräckligt svår för att det ska vara viktigare att ha rätt än att vara billig.
Det som skulle ändra svaret för endera av dem är samma sak, och det är inte ett nytt benchmark-släpp. Det är ett antal tokens per uppgift för dina egna prompter, med dina egna effort-inställningar, för båda modellerna. Anthropics effort-parameter och Qwens utdatatak är båda spakar som påverkar den siffran, och båda ställs in av dig snarare än av leverantörens prislista.
Det enda den här jämförelsen faktiskt slår fast: vid 2 dollar per miljon för input är inputsidan av kostnaden inte längre en särskiljande faktor mellan en kinesisk flaggskeppsmodell och Anthropics mellannivå. Det racet flyttade över till outputsidan och tokenantalet redan för månader sedan.
Jämförda i den här artikeln2
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
