
Claude Sonnet 5.5 vs Qwen3.8 Max: Zes weken, twee niveaus, één oordeel over kosten
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 984 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 195 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
Voer de rekensom uit voor drie prompts en de vergelijking is meestal al beslecht voordat je bij de benchmarks aankomt. Een korte call voor een supportantwoord: 2.000 invoertokens, 500 uitvoertokens. Bij Qwen3.8 Max tegen $2 per miljoen in en $6 per miljoen uit is dat vier tiende cent; bij Claude Sonnet 5.5 tegen $2 en $2 is dat negen tiende cent. Een repository-refactor: 200.000 in, 30.000 uit — veertig cent tegen tachtig. Een lange agentische sessie die zijn rekensom uitvoert: twee miljoen tokens in, 200.000 uit, $5,20 tegen $6,30 wanneer de getallen groot genoeg worden om de inputkant te laten domineren.
Het verschil dat begint als een verschil van 2,25× in outputprijs, krimpt bij agentische schaal tot ongeveer 1,2×, en die opschaling is geen curiositeit. Qwen3.8 Max en Claude Sonnet 5.5 zijn beide 1M-tokenmodellen met forse outputplafonds, beide geprijsd op $2 per miljoen voor input, en beide uitgebracht binnen acht weken na elkaar — die van de leverancier op 3 augustus 2026 met een op 2 september gedateerde refresh, die van Anthropic op 28 september. Het verschil tussen beide is niet de tariefkaart. Het is wat elk ervan besteedt om af te ronden.
Wat is er uitgebracht, en wanneer
Qwen3.8 Max is het krachtigste niveau van Alibaba tot nu toe. Alibaba positioneert het rechtstreeks tegenover GPT-5.5, Claude Opus 4.7 en Gemini 3.1 Pro in zijn eigen migratiegids, en beveelt het aan zodra een taak het sterkste beschikbare redeneervermogen vereist. Het heeft een contextvenster van 1 miljoen tokens, accepteert tekst-, afbeeldings- en video-invoer en levert tekst op — de video-invoermogelijkheid is hier het enige vermogen dat Claude Sonnet 5.5 niet heeft. De prijs bedraagt $2 per miljoen input en $6 per miljoen output, met cache-reads tegen $0,25 en cache-writes tegen $2,50. Naast de vermelding van 3 augustus in onze catalogus komt een vernieuwing van 2 september, vermeld als Qwen3.8 Max (0902), met dezelfde hoofdtarieven en een uitvoerplafond van 131K.

Claude Sonnet 5.5 is het tweede model in de 5.5-generatie van Anthropic, uitgebracht op 28 september 2026, zes dagen na Claude Opus 5.5. Het is beschikbaar als claude-sonnet-5-5 op de Claude API en via Amazon Bedrock, Google Cloud en Microsoft Foundry, met een venster van 1M tokens, een synchrone uitvoerlimiet van 128K die op de Message Batches API wordt uitgebreid naar 300K achter de output-300k-2026-03-24-header, en de tarieven van Claude Sonnet 5 exact gehandhaafd: $2 in, $10 uit, $0,20 voor cache-leesbewerkingen, $2,50 voor cache-schrijfbewerkingen. Zero data retention vanaf de lancering, buiten gebruikstelling niet eerder dan 28 september 2027.
Dus het inputtarief is identiek, de contextvensters zijn even groot, en de twee leveranciers hebben binnen een maand na elkaar vernieuwd. Alles wat hen onderscheidt, zit aan de outputkant van de factuur of in de benchmarks.
Benchmarks: leverancierstabel afgezet tegen onafhankelijke index
Twee soorten bewijs bestaan hier en ze zijn niet uitwisselbaar.
Anthropic's lanceringstabel is door de leverancier gerapporteerd, door geen enkele derde partij gereproduceerd en omvat acht evaluaties. De rijen die ertoe doen
• Terminal-Bench 4.0 — Claude Sonnet 5.5 70,6% tegen 10,3% van Claude Sonnet 5
• CursorBench 4.0 — 55,5% tegenover de 34,1% van Claude Sonnet 5
• GDPval-AA v2.1 — 1844 tegen 1449 voor Claude Sonnet 5, 1846 voor Claude Opus 5.5 en 1487 voor GPT-6 Sol
• Humanity's Last Exam, met hulpmiddelen — 64,5% tegen 54,9%; Claude Opus 5.5 staat op 67,7%
• OSWorld 2.1, gedeeltelijk — 80,1% tegen 57,0%
• Chartography, geen hulpmiddelen — 61,6% tegen 15,6%
Alibaba publiceert geen direct equivalent vierkolommentabel, dus de enige cijfers die op dezelfde as kunnen worden geplaatst, zijn de onafhankelijke. Artificial Analysis, v4.3.2-revisie
• Samengestelde Intelligentie-index — Claude Sonnet 5.5 56 op rang 3 van 216; Qwen3.8 Max 45 op rang 27
• Kosten per Intelligence Index-taak — $7,60 tegenover $5,41
• Uitvoersnelheid — het model van Anthropic wordt gemeten ten opzichte van een Claude Sonnet 5-baseline van 78,7 tokens per seconde; Qwen3.8 Max wordt gemeten op 39,1
• Uitvoerigheid — 410M uitvoertokens op de Index tegenover 190M
De eigen scores per evaluatie van Qwen3.8 Max zijn respectabel in plaats van marginaal: 92,8% op GPQA Diamond, 88,8% op Terminal-Bench 2.1, 80,3% op long-context recall, 47,8% op tau-banking. Het verliest terrein op de samengestelde score omdat het niets beslissend wint en de nieuwere Anthropic-tier verschillende onderdelen ronduit wint. Merk ook op dat de onafhankelijke pagina voor Qwen3.8 Max een releasedatum van 2 september 2026 en een contextwaarde van 984K vermeldt — die beschrijft de (0902)-refresh, niet de augustusbuild, en het door elkaar halen van cijfers tussen de twee zou een fout zijn.

Wat in beide kolommen ontbreekt, is net zo belangrijk als wat erin staat. Niemand heeft de OSWorld- of Terminal-Bench-cijfers van Anthropic onafhankelijk gereproduceerd. Niemand heeft een Chartography- of CursorBench-cijfer voor Qwen3.8 Max gepubliceerd. De composiet is het enige getal dat op beide modellen op dezelfde manier is gemeten, en dat is precies waarom het kosten-per-taakcijfer daaronder zoveel werk verzet.
Het getal dat de doorslag geeft, en het staat op geen van beide tariefkaarten
Artificial Analysis rekent beide modellen op dezelfde manier af: de tien evaluaties in de Index uitvoeren, de tokens tellen en vermenigvuldigen met de lijstprijs. Claude Sonnet 5.5 komt uit op $7,60 per taak en Qwen3.8 Max op $5,41, een opslag van 40% voor het Anthropic-model ondanks een hogere samengestelde score. De verbositeitswaarden verklaren de richting — 410M tokens tegenover 190M — en de snelheidswaarden verklaren de rest: een model dat minder tokens uitstuurt en langer over elk token doet, is niet het model dat het dubbele tarief voor output betaalt.
De eigen efficiëntieclaim van Anthropic past in hetzelfde verhaal in plaats van het tegen te spreken. Het bedrijf zegt dat Claude Sonnet 5.5 30%+ sneller output genereert dan Claude Sonnet 5 en 'tot 30% minder per taak' kost tegen identieke tarieven — een bewering over tokens per taak, niet over tarieven. Of die standhoudt tegenover een model dat minder dan half zoveel tokens verbruikt, is precies de vraag die het cijfer van $7,60 oproept, en één onafhankelijke run is één datapunt.
De praktische consequentie: het outputtarief van $6 tegenover $10 is het getal waar de inkoopafdeling naar zal kijken, en het is het minst voorspellende getal in het artikel. Het voorspellende getal is tokens per taak bij je eigen prompts, en geen van beide leveranciers zal het je geven.
Inputs, video en de migratieval
Het capaciteitsverschil dat onmiddellijk opvalt, is modaliteit. Qwen3.8 Max accepteert video naast tekst en afbeeldingen; Claude Sonnet 5.5 accepteert tekst en afbeeldingen. Voor analyse van schermopnames, pijplijnen voor vergaderopnamen of alles wat video als eersteklas input behandelt, is dat geen benchmarkkloof — het is een binaire geschiktheidsvraag, en slechts één van deze modellen voldoet.

Het verschil dat een week later zichtbaar wordt, is gedragsmatig van aard. Claude Sonnet 5.5 introduceert vijf breaking changes in code die op Claude Sonnet 5 draait. Een niet-standaard temperature, top_p of top_k geeft nu een 400. Het verzenden van thinking: {"type": "disabled"} geeft een 400 die wijst naar between_tools, de nieuwe laagste thinking-instelling, geaccepteerd bij low, medium en high effort en geweigerd bij xhigh of max. Geforceerd gebruik van tools — tool_choice van "any" of een benoemde tool — geeft direct een 400. De oudere computer_20251124 computer-use-tool wordt geweigerd op de Claude API en Google Cloud. En thinking-blokken zijn gebonden aan het model en het account die ze hebben geproduceerd, dus reasoning kan worden meegenomen vanuit Claude Sonnet 5, maar niet naar een andere familie, en een bewerkte gespreksprefix kan een replay in een fout veranderen.
Qwen3.8 Max vraagt niets van dat alles. Het is een model in OpenAI-formaat met een conventioneel requestoppervlak, en overstappen ernaar vanaf een andere Qwen-tier is een wijziging van de modelstring.
Weeg de twee kosten eerlijk af. Het kiezen van het Qwen-model kost je het verschil van elf punten in de samengestelde score en de leverancierscijfers van Anthropic die je toch niet onafhankelijk kunt verifiëren. Het kiezen van het Anthropic-model kost je video-input en een checklist van vier API-wijzigingen die elk luidruchtig zullen falen met een 400-fout de eerste keer dat ze worden aangeroepen — wat de goede soort fout is, maar sowieso een dag werk.
Waar OrcaRouter past
De reden om te routeren in plaats van te kiezen is dat het beslissende getal — kosten per taak voor je verkeer — uit de documentatie van geen van beide leveranciers kan worden berekend.
OrcaRouter is één enkel OpenAI-compatibel eindpunt voor meer dan 200 modellen, waarbij de lijstprijs van de provider zonder opslag wordt doorgegeven, zodat een tariefverlaging of een tierwijziging aan weerszijden dezelfde dag waarop die wordt aangekondigd live is. Beide Qwen3.8 Max-builds staan in de catalogus tegen Alibaba's eigen tarief van $2 / $6 — de augustusversie en de (0902)-refresh — naast Claude Sonnet 5, het model waarop het meeste Claude API-verkeer nog steeds draait, routeerbaar sinds 30 juni tegen Anthropic's $2 / $10 met een gemeten 150 outputtokens per seconde. Claude Sonnet 5.5 zelf staat nog niet in onze catalogus; hoewel dat waar is, is de eerlijke route ernaartoe de eigen API van de leverancier en de drie clouds die Anthropic vermeldt, en de manier om het te proberen zonder een workload te verplaatsen is een deel van het verkeer achter automatische failover naar Claude Sonnet 5 of Qwen3.8 Max.
Welke, voor welke klus
Qwen3.8 Max wint op video-invoer, op uitvoersnelheid, op gemeten kosten per indextaak en op integratie-inspanning. Het is de juiste standaard voor hoogvolume, goed gespecificeerd werk waar een samengesteld verschil van twaalf punten niet terug te zien is in de uitvoerkwaliteit.
Claude Sonnet 5.5 wint op de onafhankelijke samengestelde maatstaf, op agentische codeerevaluaties waar de leverancierscijfers van Anthropic een sprong van 60 punten lieten zien ten opzichte van zijn eigen voorganger op Terminal-Bench 4.0, op het plafond van 300K voor batchuitvoer, en op een taakgerichte beslissing die een tariefkaart niet kan nemen: het is het model om te kiezen wanneer de taak zo moeilijk is dat het belangrijker is om correct te zijn dan om goedkoop te zijn.
Wat het antwoord voor elk van beide zou veranderen, is hetzelfde, en het is geen nieuwe benchmarkrelease. Het is een telling van tokens per taak op je eigen prompts, met je eigen effort-instellingen, voor beide modellen. De effort-parameter van Anthropic en het outputplafond van Qwen zijn beide hefbomen voor dat aantal, en beide worden door jou ingesteld in plaats van door de prijslijst van de leverancier.
Het enige wat deze vergelijking wel beslecht: tegen $2 per miljoen voor input is de inputkant van de rekening niet langer een onderscheidende factor tussen een Chinees vlaggenschipmodel en Anthropics middenklasse. Die race is maanden geleden al verschoven naar de outputkant en naar het aantal tokens.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
