Hero-kaart getiteld Claude Sonnet 5.5 vs Qwen3.8 Max, met ondertitel Zes weken, twee niveaus, één oordeel over kosten, met pillen die lezen: input $2 beide, output $10 vs $6, en Index 56 vs 45, en een voettekst die Artificial Analysis v4.3.2 en leveranciersprijzen citeert.
Guides & Insights

Claude Sonnet 5.5 vs Qwen3.8 Max: Zes weken, twee niveaus, één oordeel over kosten

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Voer de rekensom uit voor drie prompts en de vergelijking is meestal al beslecht voordat je bij de benchmarks aankomt. Een korte call voor een supportantwoord: 2.000 invoertokens, 500 uitvoertokens. Bij Qwen3.8 Max tegen $2 per miljoen in en $6 per miljoen uit is dat vier tiende cent; bij Claude Sonnet 5.5 tegen $2 en $2 is dat negen tiende cent. Een repository-refactor: 200.000 in, 30.000 uit — veertig cent tegen tachtig. Een lange agentische sessie die zijn rekensom uitvoert: twee miljoen tokens in, 200.000 uit, $5,20 tegen $6,30 wanneer de getallen groot genoeg worden om de inputkant te laten domineren.

Het verschil dat begint als een verschil van 2,25× in outputprijs, krimpt bij agentische schaal tot ongeveer 1,2×, en die opschaling is geen curiositeit. Qwen3.8 Max en Claude Sonnet 5.5 zijn beide 1M-tokenmodellen met forse outputplafonds, beide geprijsd op $2 per miljoen voor input, en beide uitgebracht binnen acht weken na elkaar — die van de leverancier op 3 augustus 2026 met een op 2 september gedateerde refresh, die van Anthropic op 28 september. Het verschil tussen beide is niet de tariefkaart. Het is wat elk ervan besteedt om af te ronden.

Wat is er uitgebracht, en wanneer

Qwen3.8 Max is het krachtigste niveau van Alibaba tot nu toe. Alibaba positioneert het rechtstreeks tegenover GPT-5.5, Claude Opus 4.7 en Gemini 3.1 Pro in zijn eigen migratiegids, en beveelt het aan zodra een taak het sterkste beschikbare redeneervermogen vereist. Het heeft een contextvenster van 1 miljoen tokens, accepteert tekst-, afbeeldings- en video-invoer en levert tekst op — de video-invoermogelijkheid is hier het enige vermogen dat Claude Sonnet 5.5 niet heeft. De prijs bedraagt $2 per miljoen input en $6 per miljoen output, met cache-reads tegen $0,25 en cache-writes tegen $2,50. Naast de vermelding van 3 augustus in onze catalogus komt een vernieuwing van 2 september, vermeld als Qwen3.8 Max (0902), met dezelfde hoofdtarieven en een uitvoerplafond van 131K.

Two-column scoreboard for Claude Sonnet 5.5 and Qwen3.8 Max across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, text and image input, AA Intelligence Index 56, cost per Index task $7.60, released September 28 2026. Right column Qwen3.8 Max: input $2.00 per million, output $6.00 per million, text image and video input, AA Intelligence Index 45, cost per Index task $5.41, September 2 2026 refresh. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

Claude Sonnet 5.5 is het tweede model in de 5.5-generatie van Anthropic, uitgebracht op 28 september 2026, zes dagen na Claude Opus 5.5. Het is beschikbaar als claude-sonnet-5-5 op de Claude API en via Amazon Bedrock, Google Cloud en Microsoft Foundry, met een venster van 1M tokens, een synchrone uitvoerlimiet van 128K die op de Message Batches API wordt uitgebreid naar 300K achter de output-300k-2026-03-24-header, en de tarieven van Claude Sonnet 5 exact gehandhaafd: $2 in, $10 uit, $0,20 voor cache-leesbewerkingen, $2,50 voor cache-schrijfbewerkingen. Zero data retention vanaf de lancering, buiten gebruikstelling niet eerder dan 28 september 2027.

Dus het inputtarief is identiek, de contextvensters zijn even groot, en de twee leveranciers hebben binnen een maand na elkaar vernieuwd. Alles wat hen onderscheidt, zit aan de outputkant van de factuur of in de benchmarks.

Benchmarks: leverancierstabel afgezet tegen onafhankelijke index

Twee soorten bewijs bestaan hier en ze zijn niet uitwisselbaar.

Anthropic's lanceringstabel is door de leverancier gerapporteerd, door geen enkele derde partij gereproduceerd en omvat acht evaluaties. De rijen die ertoe doen

• Terminal-Bench 4.0 — Claude Sonnet 5.5 70,6% tegen 10,3% van Claude Sonnet 5

• CursorBench 4.0 — 55,5% tegenover de 34,1% van Claude Sonnet 5

• GDPval-AA v2.1 — 1844 tegen 1449 voor Claude Sonnet 5, 1846 voor Claude Opus 5.5 en 1487 voor GPT-6 Sol

• Humanity's Last Exam, met hulpmiddelen — 64,5% tegen 54,9%; Claude Opus 5.5 staat op 67,7%

• OSWorld 2.1, gedeeltelijk — 80,1% tegen 57,0%

• Chartography, geen hulpmiddelen — 61,6% tegen 15,6%

Alibaba publiceert geen direct equivalent vierkolommentabel, dus de enige cijfers die op dezelfde as kunnen worden geplaatst, zijn de onafhankelijke. Artificial Analysis, v4.3.2-revisie

• Samengestelde Intelligentie-index — Claude Sonnet 5.5 56 op rang 3 van 216; Qwen3.8 Max 45 op rang 27

• Kosten per Intelligence Index-taak — $7,60 tegenover $5,41

• Uitvoersnelheid — het model van Anthropic wordt gemeten ten opzichte van een Claude Sonnet 5-baseline van 78,7 tokens per seconde; Qwen3.8 Max wordt gemeten op 39,1

• Uitvoerigheid — 410M uitvoertokens op de Index tegenover 190M

De eigen scores per evaluatie van Qwen3.8 Max zijn respectabel in plaats van marginaal: 92,8% op GPQA Diamond, 88,8% op Terminal-Bench 2.1, 80,3% op long-context recall, 47,8% op tau-banking. Het verliest terrein op de samengestelde score omdat het niets beslissend wint en de nieuwere Anthropic-tier verschillende onderdelen ronduit wint. Merk ook op dat de onafhankelijke pagina voor Qwen3.8 Max een releasedatum van 2 september 2026 en een contextwaarde van 984K vermeldt — die beschrijft de (0902)-refresh, niet de augustusbuild, en het door elkaar halen van cijfers tussen de twee zou een fout zijn.

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56, a price of $2.00 per million input tokens and $10.00 per million output tokens, a cost of $7.60 per Intelligence Index task, a verbosity of 410M output tokens against a median of 88M, and a 1M-token context window.

Wat in beide kolommen ontbreekt, is net zo belangrijk als wat erin staat. Niemand heeft de OSWorld- of Terminal-Bench-cijfers van Anthropic onafhankelijk gereproduceerd. Niemand heeft een Chartography- of CursorBench-cijfer voor Qwen3.8 Max gepubliceerd. De composiet is het enige getal dat op beide modellen op dezelfde manier is gemeten, en dat is precies waarom het kosten-per-taakcijfer daaronder zoveel werk verzet.

Het getal dat de doorslag geeft, en het staat op geen van beide tariefkaarten

Artificial Analysis rekent beide modellen op dezelfde manier af: de tien evaluaties in de Index uitvoeren, de tokens tellen en vermenigvuldigen met de lijstprijs. Claude Sonnet 5.5 komt uit op $7,60 per taak en Qwen3.8 Max op $5,41, een opslag van 40% voor het Anthropic-model ondanks een hogere samengestelde score. De verbositeitswaarden verklaren de richting — 410M tokens tegenover 190M — en de snelheidswaarden verklaren de rest: een model dat minder tokens uitstuurt en langer over elk token doet, is niet het model dat het dubbele tarief voor output betaalt.

De eigen efficiëntieclaim van Anthropic past in hetzelfde verhaal in plaats van het tegen te spreken. Het bedrijf zegt dat Claude Sonnet 5.5 30%+ sneller output genereert dan Claude Sonnet 5 en 'tot 30% minder per taak' kost tegen identieke tarieven — een bewering over tokens per taak, niet over tarieven. Of die standhoudt tegenover een model dat minder dan half zoveel tokens verbruikt, is precies de vraag die het cijfer van $7,60 oproept, en één onafhankelijke run is één datapunt.

De praktische consequentie: het outputtarief van $6 tegenover $10 is het getal waar de inkoopafdeling naar zal kijken, en het is het minst voorspellende getal in het artikel. Het voorspellende getal is tokens per taak bij je eigen prompts, en geen van beide leveranciers zal het je geven.

Inputs, video en de migratieval

Het capaciteitsverschil dat onmiddellijk opvalt, is modaliteit. Qwen3.8 Max accepteert video naast tekst en afbeeldingen; Claude Sonnet 5.5 accepteert tekst en afbeeldingen. Voor analyse van schermopnames, pijplijnen voor vergaderopnamen of alles wat video als eersteklas input behandelt, is dat geen benchmarkkloof — het is een binaire geschiktheidsvraag, en slechts één van deze modellen voldoet.

OrcaRouter model page for qwen/qwen3.8-max, attributed to Qwen and dated 2026-08-03, showing a 1M-token context window, text, image and video input, an input price of $2.00 and output price of $6.00 per million tokens, a p50 time to first token of 2.25 seconds, and 53.0M tokens of traffic in the last seven days.

Het verschil dat een week later zichtbaar wordt, is gedragsmatig van aard. Claude Sonnet 5.5 introduceert vijf breaking changes in code die op Claude Sonnet 5 draait. Een niet-standaard temperature, top_p of top_k geeft nu een 400. Het verzenden van thinking: {"type": "disabled"} geeft een 400 die wijst naar between_tools, de nieuwe laagste thinking-instelling, geaccepteerd bij low, medium en high effort en geweigerd bij xhigh of max. Geforceerd gebruik van tools — tool_choice van "any" of een benoemde tool — geeft direct een 400. De oudere computer_20251124 computer-use-tool wordt geweigerd op de Claude API en Google Cloud. En thinking-blokken zijn gebonden aan het model en het account die ze hebben geproduceerd, dus reasoning kan worden meegenomen vanuit Claude Sonnet 5, maar niet naar een andere familie, en een bewerkte gespreksprefix kan een replay in een fout veranderen.

Qwen3.8 Max vraagt niets van dat alles. Het is een model in OpenAI-formaat met een conventioneel requestoppervlak, en overstappen ernaar vanaf een andere Qwen-tier is een wijziging van de modelstring.

Weeg de twee kosten eerlijk af. Het kiezen van het Qwen-model kost je het verschil van elf punten in de samengestelde score en de leverancierscijfers van Anthropic die je toch niet onafhankelijk kunt verifiëren. Het kiezen van het Anthropic-model kost je video-input en een checklist van vier API-wijzigingen die elk luidruchtig zullen falen met een 400-fout de eerste keer dat ze worden aangeroepen — wat de goede soort fout is, maar sowieso een dag werk.

Waar OrcaRouter past

De reden om te routeren in plaats van te kiezen is dat het beslissende getal — kosten per taak voor je verkeer — uit de documentatie van geen van beide leveranciers kan worden berekend.

OrcaRouter is één enkel OpenAI-compatibel eindpunt voor meer dan 200 modellen, waarbij de lijstprijs van de provider zonder opslag wordt doorgegeven, zodat een tariefverlaging of een tierwijziging aan weerszijden dezelfde dag waarop die wordt aangekondigd live is. Beide Qwen3.8 Max-builds staan in de catalogus tegen Alibaba's eigen tarief van $2 / $6 — de augustusversie en de (0902)-refresh — naast Claude Sonnet 5, het model waarop het meeste Claude API-verkeer nog steeds draait, routeerbaar sinds 30 juni tegen Anthropic's $2 / $10 met een gemeten 150 outputtokens per seconde. Claude Sonnet 5.5 zelf staat nog niet in onze catalogus; hoewel dat waar is, is de eerlijke route ernaartoe de eigen API van de leverancier en de drie clouds die Anthropic vermeldt, en de manier om het te proberen zonder een workload te verplaatsen is een deel van het verkeer achter automatische failover naar Claude Sonnet 5 of Qwen3.8 Max.

Welke, voor welke klus

Qwen3.8 Max wint op video-invoer, op uitvoersnelheid, op gemeten kosten per indextaak en op integratie-inspanning. Het is de juiste standaard voor hoogvolume, goed gespecificeerd werk waar een samengesteld verschil van twaalf punten niet terug te zien is in de uitvoerkwaliteit.

Claude Sonnet 5.5 wint op de onafhankelijke samengestelde maatstaf, op agentische codeerevaluaties waar de leverancierscijfers van Anthropic een sprong van 60 punten lieten zien ten opzichte van zijn eigen voorganger op Terminal-Bench 4.0, op het plafond van 300K voor batchuitvoer, en op een taakgerichte beslissing die een tariefkaart niet kan nemen: het is het model om te kiezen wanneer de taak zo moeilijk is dat het belangrijker is om correct te zijn dan om goedkoop te zijn.

Wat het antwoord voor elk van beide zou veranderen, is hetzelfde, en het is geen nieuwe benchmarkrelease. Het is een telling van tokens per taak op je eigen prompts, met je eigen effort-instellingen, voor beide modellen. De effort-parameter van Anthropic en het outputplafond van Qwen zijn beide hefbomen voor dat aantal, en beide worden door jou ingesteld in plaats van door de prijslijst van de leverancier.

Het enige wat deze vergelijking wel beslecht: tegen $2 per miljoen voor input is de inputkant van de rekening niet langer een onderscheidende factor tussen een Chinees vlaggenschipmodel en Anthropics middenklasse. Die race is maanden geleden al verschoven naar de outputkant en naar het aantal tokens.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt