Een gegenereerde titelkaart met de tekst 'Claude Haiku 5.5 vs Qwen3.8-Flash-Next' en de ondertitel 'Het open-weightmodel is niet het goedkope model', een balk met het label 'Kosten per afgeronde Intelligence Index-taak', met $0,21 voor Claude Haiku 5.5 en $0,37 voor Qwen3.8-Flash-Next, en een voetregel met de tekst 'Onafhankelijke cijfers volgens Artificial Analysis; prijzen volgens Anthropic en Alibaba.' Het echte OrcaRouter-logo is rechtsonder gecompositeerd.
Guides & Insights

Claude Haiku 5.5 vs Qwen3.8-Flash-Next: het open-weightmodel is niet de goedkope optie

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het instinct zegt dat een open-weightmodel uit de flash-tier van Alibaba een gesloten klein model van Anthropic op prijs zal onderbieden, en op de twee stickerprijzen doet het dat ook: Qwen3.8-Flash-Next wordt aangeboden voor $0,15 per miljoen inputtokens en $0,47 per miljoen outputtokens via de eigen API van Alibaba, tegenover $0,10 en $0,50 voor Claude Haiku 5.5. Laat je beide echter tegen dezelfde benchmarksuite lopen, dan slaat de ordening om. Artificial Analysis meet Claude Haiku 5.5 bij Max effort op $0,21 per voltooide Intelligence Index-taak; Qwen3.8-Flash-Next kost $0,37 bij dezelfde meting, voor een score die drie punten lager ligt. Het goedkopere prijskaartje is voor het model met de grotere rekening, en de reden is dezelfde als die de meeste van dit soort vergelijkingen beslist: de tariefkaart is niet de prijs, en het open-weightmodel verdient zijn geld ergens anders dan via een beheerde API-factuur. Dat 'ergens anders' is het eigenlijke onderwerp van deze confrontatie.

Wat elk is

De twee kwamen zes weken na elkaar aan en het zijn niet hetzelfde soort artefact.

• Claude Haiku 5.5 — een model met gesloten gewichten dat op 7 oktober 2026 is uitgebracht via de Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry en Claude Platform on AWS. Context van 1M tokens, tot 128.000 outputtokens op de synchrone Messages API, adaptief denken met een inspanningsschakelaar van Laag tot Max en een standaard van medium, een kennisafsluitdatum van juni 2026, en een tariefkaart die verspringt bij 100.000 tokens.

• Qwen3.8-Flash-Next — een open-weight mixture-of-experts-model dat op 26 augustus 2026 is uitgebracht onder de qwen-community-1.0-licentie, door Alibaba beschreven als een experimentele preview van de architectuur die ten grondslag zal liggen aan Qwen4. Het bevat 125B parameters van het hoofdmodel plus een aparte 51B n-gram-embeddingtabel — ruwweg 176B vóór een 4B-module voor multi-tokenvoorspelling — en activeert 6B per token, met 512 experts, top-10-routing en 48 lagen. Het ondersteunt standaard 262.144 tokens context, uitbreidbaar tot 1M met YaRN, en accepteert tekst-, afbeeldings- en video-invoer.

• Qwen3.8-Flash — de aangeboden commerciële tegenhanger, ook live sinds 26 augustus 2026 op Alibaba's QwenCloud voor $0,16 per miljoen inputtokens en $0,47 per miljoen outputtokens, met standaard een context van 1 miljoen tokens. Het loont om deze apart te houden van Flash-Next: de ene is een checkpoint die je kunt downloaden en inspecteren, de andere is een beheerd endpoint met een prijs.

Het onderscheid tussen de laatste twee is precies wat deze vergelijking interessant maakt. Claude Haiku 5.5 en Qwen3.8-Flash-Next concurreren op heel weinig vlakken, omdat slechts één van hen op je eigen hardware kan draaien.

De gemeten snavel, die de andere kant op wijst.

Alle volgende onafhankelijke cijfers zijn afkomstig van Artificial Analysis op Intelligence Index v4.3.2. De tariefkaarten van Anthropic en Alibaba zijn de door de leveranciers zelf gepubliceerde prijzen.

• Intelligence Index — Claude Haiku 5,5 bij maximale inspanning 43, tweede van 182 modellen. Qwen3.8-Flash-Next 40, zesde van 117 in zijn klasse. Drie punten verschil, in het voordeel van Anthropic.

• Kosten per taak — $ 0,21 tegenover $ 0,37. Het model dat per token duurder is, is 43% goedkoper per afgeronde taak.

• Outputtokens op de Index-run — 440 miljoen voor Claude Haiku 5.5 en 240 miljoen voor Qwen3.8-Flash-Next, beide tegenover een mediaan van 100 miljoen. Het Qwen-model is de efficiëntere schrijver en toch de duurdere taak, wat aangeeft dat het verschil niet alleen in tokenvolume zit, maar in de mix van input en de waardering die de evaluator toepast.

• Uitvoersnelheid — 241,9 tokens per seconde tegenover 56,0. Claude Haiku 5.5 is meer dan vier keer sneller bij dezelfde meting, en de tijd tot het eerste token van 295 seconden in die run is een artefact van denken op Max effort in plaats van een netwerkcijfer; de tijd tot het eerste token van Qwen3.8-Flash-Next is 2,53 seconden.

• Vorm van de tariefkaart — Claude Haiku 5.5 gaat van $0,10 en $0,50 naar $0,50 en $2,50 bij 100.000 tokens. Qwen3.8-Flash is vlak op $0,16 en $0,47 ongeacht de lengte, wat een oprecht voordeel is bij lange prompts en de enige plek waar het stickerargument de confrontatie met een lang document overleeft.

• Tokenizer — Claude Haiku 5.5 gebruikt de nieuwere tokenizer die ook door Claude 4.7 en later wordt gebruikt, waardoor dezelfde tekst als ongeveer 30% meer tokens telt dan bij de vorige Haiku. Dat blaast prompts op richting de stap van 100.000 tokens; het komt uit Anthropic's eigen documentatie, en het werkt in het nadeel van het model in precies het geval van lange prompts waarin het vaste tarief van Qwen het beste lijkt.

Dus de vorm van de afweging is: betaal meer per token, krijg een sneller, iets slimmer antwoord dat minder kost per voltooide taak, met een tariefkloof om in het oog te houden bij lange inputs. Of betaal minder per token en krijg een langzamer model dat meer kost per voltooide taak, met een vast tarief en een native contextvenster van 262.144 tokens.

A screenshot of OrcaRouter's model page for qwen/qwen3.8-flash, showing the model card and its list pricing of $0.15 per million input tokens and $0.47 per million output tokens, captured in English.A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 at maximum effort, showing an Intelligence Index of 43 on v4.3.2 at rank 2 of 182 models, a 1,000,000-token context window, 241.9 output tokens per second at rank 8 of 182, a cost of $0.21 per Intelligence Index task, and 440 million output tokens against a 100 million median.

Waar de open gewichten de rekensom daadwerkelijk veranderen

Alles hierboven vergelijkt twee beheerde API's, en dat is de vergelijking die Qwen3.8-Flash-Next niet ontworpen is om te winnen. Wat ervoor pleit, is dat het niet gehuurd hoeft te worden.

• Ondersteuning voor serving vanaf dag één. SGLang heeft een cookbook-pagina en een speciale image uitgebracht; vLLM heeft er een build voor, terwijl de pull request voor architectuurondersteuning nog open is. NVIDIA heeft beide plus TensorRT LLM gevalideerd op een GB300 NVL72-rack, en NeMo ondersteunt fine-tuning.

• De minimale hardwarevereisten voor een 176B-checkpoint zijn laag. De 51B n-gram-embedding kan in hostgeheugen staan in plaats van in VRAM, omdat de opzoekadressen vooraf bekend zijn en kunnen worden geprefetcht. Dat is wat het model laat draaien op DGX Spark-clusters en 4×RTX PRO 6000-workstations, en community-quantiseringen van dezelfde dag — 1-bit builds die in 75GB RAM passen bij ongeveer 80% van de volledige nauwkeurigheid — zetten het op hardware die een klein team bezit.

• Fine-tuning is beschikbaar. Niet in de zin van een gehoste tuning-API: de gewichten zijn van jou, onder een communitylicentie met de gebruikelijke voorwaarden, en de architectuur is gedocumenteerd in een technisch rapport dat de ablaties en de negatieve resultaten publiceert.

• Het venster is kleiner dan het lijkt. 262.144 tokens native, uitbreidbaar tot 1M met YaRN — tegenover 1M native op Claude Haiku 5.5, zonder rope-scaling-voorbehoud. Bij de workloads met lange documenten waar het vaste Qwen-tarief het aantrekkelijkst lijkt, is het model dat het document daadwerkelijk kan bevatten het andere.

• De benchmarks zijn door de leverancier gerapporteerd. Alibaba's eigen tabel plaatst Flash-Next voor DeepSeek-V4-Flash-0731 op DeepSWE 1.1 (58,7 tegen 54,4), SWE-bench Pro (62,5 tegen 56,0) en GPQA Diamond (91,7 tegen 90,8), en erachter op NL2Repo-Bench (48,1 tegen 54,2) — codegeneratie op repositoryniveau, de enige agentische dimensie waarin het kleinere model niet bijblijft. Niets ervan is door een derde partij gereproduceerd, en het model is zes weken oud.

Dat is de eerlijke grens tussen de twee. Claude Haiku 5.5 is een service die per verbruik wordt afgerekend, met een vast kwaliteitsplafond en geen operationeel oppervlak. Qwen3.8-Flash-Next is een artefact waarvan de kostencurve naar beneden buigt richting de prijs van elektriciteit en waarvan het kwaliteitsplafond alles is wat je kunt serveren, plus het risico van een niet-gereproduceerde benchmarktabel en een architectuur die nog door de runtimes moet worden opgenomen.

De realistische manier om te beslissen

Drie vragen beslissen het, en alleen de eerste gaat over benchmarks.

Heb je GPU's, of wil je ze? Zo niet, dan is het zelf-host-scenario theoretisch en is de bovenstaande vergelijking met beheerde diensten het hele verhaal — en dat pleit voor Claude Haiku 5.5 op het gebied van kosten per taak, snelheid en score, met de kanttekening dat de stap van 100.000 tokens lange prompts zwaar bestraft. Heb je wel accelerators die onder een bezettingsdoel blijven hangen, dan is Qwen3.8-Flash-Next een van de weinige open modellen waarbij een decode met 6B actieve parameters echt goedkoop op volume te draaien is, en dan is het cijfer van $0,37 per taak niet meer het relevante getal.

Hoe lang is de gemiddelde prompt? Dit is de enige plek waar het stickerargument opgaat. Onder 100.000 tokens — na een tokenizer die met ongeveer 30% opblaast — is Claude Haiku 5.5 op elke meter goedkoper. Daarboven is de vaste $0,16 en $0,47 de betere kaart, en het voordeel groeit met de lengte tot aan het native venster van 262.144 tokens, en voorbij dat punt is YaRN-extensie een ander engineeringprobleem.

Hoeveel tolerantie heeft de workload voor latentievariantie? 241,9 outputtokens per seconde tegenover 56,0 is een groot verschil, en een zelfgehoste implementatie voegt daar wachtrijvorming aan toe. Een live-support- of browser-aansturende agent — de workloads die Anthropic voor deze tier noemt — zal het verschil voelen.

Voor iedereen die de tweede en derde vragen wil beantwoorden in plaats van erover te redeneren, is het goedkoopste instrument een gedeeld endpoint. Qwen3.8-Flash-Next staat nog niet in de catalogus van OrcaRouter, en Claude Haiku 5.5 ook niet; het Qwen-zustermodel dat we wel routeren is Qwen3.8-Flash, tegen de lijstprijs van de provider met 0% opslag die wordt doorgegeven, wat het dichtstbijzijnde aangeboden equivalent is van het model in deze vergelijking en de juiste baseline voor een kostentest met lange prompts. Aan de Anthropic-kant zijn Claude Haiku 4.5, Claude Sonnet 5.5 en Claude Opus 5.5 vandaag allemaal aanroepbaar met dezelfde sleutel, dus een prijsexperiment over twee generaties is een configuratie in plaats van een tweede contract — en omdat de prijsstelling pass-through is in plaats van blended, verschijnt een korting van een leverancier op een van beide onderdelen aan onze kant op dezelfde dag dat die wordt aangekondigd. Automatische failover is wat het experiment veilig maakt om op echt verkeer te draaien: een previewmodel of een niet-gereproduceerde benchmarktabel is precies het geval om een route naar iets nieuws te richten terwijl een vertrouwd model erachter zit.

Wat zou het antwoord veranderen

Twee dingen, beide controleerbaar. Het eerste is de onafhankelijke evaluatie van Qwen3.8-Flash-Next op een testharnas dat ook Claude Haiku 5.5 draait — de leverancierstabel is tegen DeepSeek, en de 40 van de onafhankelijke ranglijst is een enkele plaatsing. Een coderingsscore op repositoryniveau is de rij om in de gaten te houden, want NL2Repo is waar al is aangetoond dat het model achterloopt. Het tweede is of het runtimewerk landt: de vLLM-ondersteuning wordt nog steeds via open pull requests samengevoegd, en totdat dat gebeurt, is het zelf hosten van deze architectuur een oefening voor teams die van dat soort dingen houden in plaats van een ondersteund pad.

Tot dan is de samenvatting kort. Qwen3.8-Flash-Next is het interessantere model om te bezitten en het duurdere om te huren. Claude Haiku 5.5 is de goedkopere, snellere, hoger scorende beheerde endpoint, met een tariefkaart die alles wat lang is bestraft. Kies op basis van de vraag of je tokens koopt of een checkpoint koopt — en als je tokens koopt, let er dan op dat het open-weightmodel niet de korting is die je veronderstelde.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8-Flash-Next — the scoreboard'. Left column Claude Haiku 5.5: weights, closed and API-only; input price $0.10 per million up to 100,000 tokens; output price $0.50 per million up to 100,000 tokens; native context 1,000,000 tokens; independent score 43 on Intelligence Index v4.3.2 at Max effort, rank 2 of 182; cost per task $0.21; measured output speed 241.9 tokens per second. Right column Qwen3.8-Flash-Next: weights, open under the qwen-community-1.0 license; served price $0.16 per million input and $0.47 per million output, flat; native context 262,144 tokens, extensible to 1M with YaRN; independent score 40, rank 6 of 117; cost per task $0.37; measured output speed 56.0 tokens per second. A footer line reads 'Vendor pricing per Anthropic and Alibaba; independent figures per Artificial Analysis.' The real OrcaRouter logo is composited bottom-right.