
Claude Haiku 5.5 vs Qwen3.8 27B: Een volledige overwinning op de API, en waarom de open gewichten nog steeds bestaan
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
De meeste vergelijkingen in deze reeks komen neer op een afweging. Deze niet, en het ontbreken van een afweging is op zichzelf de bevinding. Claude Haiku 5.5, uitgebracht op 7 oktober 2026, verslaat Qwen3.8 27B, het open-weight 27B dense model van 14 augustus 2026, op de samengestelde intelligentiescore, op kosten per token, op kosten per voltooide taak, op contextvenster, op responsplafond, op agentisch programmeren, en op de rijen voor wetenschappelijk redeneren — en doet dat via één enkele propriëtaire API waarvoor geen hardware nodig is. De enige rij die Qwen3.8 27B overtuigend wint, is video-invoer, en het andere is een licentie.
Dat is geen reden om het model af te schrijven, want een Apache-2.0-licentie en een videomodaliteit zijn geen troostprijzen. Het is een reden om precies te zijn over waarom iemand voor de open-weights-kant zou kiezen, en om op te houden te doen alsof het argument over benchmarks gaat.
De getallen waarop beide modellen daadwerkelijk zijn uitgevoerd
Per miljoen tokens in Amerikaanse dollars. De tarieven van de leverancier zijn afkomstig uit zijn eigen prijsdocumentatie; de gedeelde metingen zijn Artificial Analysis Intelligence Index v4.3.2, gelezen op 2026-10-08, beide in hun hoogst gepubliceerde inspanningsconfiguratie.

• Invoer — Claude Haiku 5.5 $ 0,10 tot 100.000 tokens en daarboven $ 0,50; Qwen3.8 27B $ 0,50 tegen het door het bestuur geregistreerde tarief voor derden.
• Uitvoer — Claude Haiku 5.5 $0,50 tot 100.000 tokens en $2,50 daarboven; Qwen3.8 27B $3,00.
• Gecachte input — Claude Haiku 5.5 $0,01 en $0,05, een korting van 90%; Qwen3.8 27B $0,10, een korting van 80%.
• Onafhankelijke score — 43,40 voor Claude Haiku 5.5 (Max) tegenover 33,70 voor Qwen3.8 27B (Xhigh). Een verschil van 9,70 punten, het grootste in deze batch.
• Kosten per voltooide taak — $0,21 tegenover $1,01, in dezelfde evaluatierun. Een verschil van 4,7x, ook het grootste hier.
• Context en output — 1 mln tokens en een responsplafond van 128.000 tokens voor Claude Haiku 5.5; een context van 256K tokens voor Qwen3.8 27B.
• Modaliteit — beide nemen tekst en afbeeldingen en geven tekst terug. Qwen3.8 27B voegt video-invoer toe; Claude Haiku 5.5 niet.
• Gewichten — Qwen3.8 27B is 27B dense parameters onder Apache 2.0, downloadbaar. Claude Haiku 5.5 is propriëtair en alleen via API beschikbaar.

Waarom het verschil per taak vier keer het verschil per token is
De tariefkaart toont al een 5x inputverschil en een 6x outputverschil in het voordeel van de leverancier, dus de richting staat niet ter discussie. Wat de moeite waard is om te lezen, is het volgende: het bedrag per taak is kleiner dan het bedrag per token, wat het tegenovergestelde is van wat er bij de andere matchups in deze batch gebeurde, en de reden is leerzaam.
Claude Haiku 5.5 genereert 162.164 uitvoertokens per Intelligence Index-taak — 129.047 redeneertokens en 33.118 antwoordtokens. Qwen3.8 27B genereert 66.797 tokens, verdeeld over 47.711 redeneertokens en 19.087 antwoordtokens. Het model van de leverancier verbruikt 2,4 keer zoveel tokens per taak, waardoor het voordeel van 6x in uitvoersnelheid teruggebracht wordt tot een voordeel van 4,7x per taak. Het is nog steeds enorm. Het is alleen niet het getal dat de tariefkaart adverteert.
De blend-wiskunde is een schonere manier om de vorm ervan te zien. Bij een input-zware 7:2:1-blend — de weging die het meeste productieverkeer in de praktijk heeft — komt Claude Haiku 5.5 uit op $0,077 per miljoen tokens tegenover $0,470 voor Qwen3.8 27B. Bij een gebalanceerde 1:1-blend is dat $0,30 tegenover $1,75. De 100.000-tokenklif van de leverancier is het enige dat dit ooit dicht: voorbij die grens worden de meters van Claude Haiku 5.5 $0,50 en $2,50 voor de hele aanvraag, en komen de twee modellen op ongeveer dezelfde prijs uit — op welk punt je een scorepremie van 9,7 punten voor niets betaalt.
Waar de leverancierskaart en de onafhankelijke raad het oneens zijn
Dit is de rijenset waarbij het de moeite loont om even stil te staan, want de eigen modelkaart van Qwen3.8 27B oogt aanzienlijk sterker dan de onafhankelijke metingen, en dat verschil is precies de reden waarom een claim als "een 27B-model dat veel grotere modellen evenaart" een tweede bron nodig heeft.
De eigen gepubliceerde cijfers van de leverancier, zoals vastgelegd op onze cataloguspagina voor het model, omvatten 90,3 op LiveCodeBench v6, 89,2 op GPQA Diamond, 84,3 op OSWorld-Verified en 79,0 op QwenSWEBench. Deze zijn door de leverancier gerapporteerd en niet gereproduceerd, en ze beschrijven een model dat ver boven zijn gewichtsklasse concurrerend is.
In de onafhankelijke run van Artificial Analysis scoort Qwen3.8 27B 0,0556 op Terminal-Bench 4.0, 0,4664 op SciCode, 0,3392 op Humanity's Last Exam en 1.423,21 op GDPval-AA v2.1. Zet die 0,0556 naast de 84,3 die de leverancierskaart op OSWorld rapporteert, en de aard van de discrepantie is duidelijk: bij agentisch werk op computers en terminals plaatst de onafhankelijke ranglijst dit model ongeveer waar een dense 27B-model thuishoort, en de leverancierskaart doet dat niet.
Twee rijen wijzen juist de andere kant op, en ze zijn om dezelfde reden het vermelden waard. Qwen3.8 27B scoort 0,4824 op AutomationBench tegenover de 0,3541 van Claude Haiku 5.5 — een onafhankelijke overwinning van 12,8 punten op het ding dat het dichtst bij een benchmark voor bedrijfsautomatisering komt dat een van beide boards heeft. Dat is een concreet getal uit dezelfde run, op de rij die het dichtst ligt bij waarvoor mensen daadwerkelijk kleine modellen inzetten.
De eerlijke lezing is niet: 'de leverancier heeft alles opgeblazen.' Het is dat een modelkaart de taken meet die de auteurs hebben gekozen, dat het onafhankelijke panel een vaste set meet, en dat de sterke punten van Qwen3.8 27B op de lijst van de leverancier staan en niet op die van het panel.
De economie verandert wanneer je de hardware bezit.
Het hierboven genoemde tarief is een API-prijs, en voor Qwen3.8 27B is dat het verkeerde kader.
Dit is een 27B dense model onder Apache 2.0. Het past op één moderne accelerator bij de kwantisatie die de meeste teams zouden accepteren, wat betekent dat de marginale kosten van een token niet langer de meter van een leverancier zijn, maar je eigen benutting worden. Dat is waarom de prijs om het aan te roepen per host verschilt op een manier die geen van de propriëtaire modellen in deze vergelijking ooit zou kunnen: het bord registreert een tarief van derden van $0,50 in en $3,00 uit, en de OrcaRouter-catalogus biedt het aan voor $0,33 in en $2,40 uit zonder enige cache-read-regel, omdat we de gewichten op onze eigen infrastructuur draaien in plaats van iemands endpoint door te verkopen.
Voor een team dat al voor GPU's betaalt, is de vergelijking niet $0,21 tegenover $1,01 per taak. Het is het door de leverancier gefactureerde tarief tegenover de incrementele kosten van een verzoek op hardware die je zelf bezit, en dat zijn verschillende getallen. Dat is het argument voor de open-weights-kant, en het is het enige dat contact met de benchmarktabel overleeft.
Er is een tweede, minder voor de hand liggend gevolg van het feit dat de licentie Apache 2.0 is: het model kan in een product worden meegeleverd, op je eigen verkeer worden fijn afgestemd, aan een specifieke revisie worden vastgezet en tot op de gewichten worden gecontroleerd. Niets daarvan is tegen welke prijs dan ook beschikbaar bij een propriëtair model dat alleen een API biedt, en voor gereguleerde omgevingen is het vaak de beslissende beperking in plaats van een voorkeur.

Een van beide bellen
Qwen3.8 27B is on the OrcaRouter catalogue as qwen/qwen3.8-27b at $0.33 and $2.40 per million tokens, self-hosted on our own infrastructure, with the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1. Run against our own traffic over the last week it returns a median 1,837 ms to first token at 319 output tokens per second — a fast model, measured on our playground rather than a standardised harness, so treat that as a serving figure and not a benchmark. Video, image and text input, 262K-token context, native tool calling, structured outputs and a reasoning mode are all supported on the same key as everything else on the catalogue.
Claude Haiku 5.5 staat niet in de catalogus. Het is rechtstreeks bereikbaar via de API van de leverancier en via AWS, Azure en de grote cloudplatforms, en dat is de correcte bewering. Wat de catalogus wel uit het aanbod van de leverancier bevat, is Claude Sonnet 5.5 en Claude Opus 5.5, waardoor het escalatiepad van een zelfgehost klein model naar een gehost agentisch model uit de middenklasse een routeringswijziging is in plaats van een tweede integratie — automatische failover zit hoe dan ook daaronder.
Het vonnis, dat ongewoon eenzijdig is
Als API-aanroep op tekst of afbeeldingen wint Claude Haiku 5.5 deze vergelijking op elke rij die niet over licenties gaat. Negen komma zeven indexpunten, 4,7x goedkoper per afgeronde taak, vier keer het contextvenster, twee keer het responsplafond, en een vijf- tot zesmaal lager prijskaartje binnen het regime voor korte prompts. Er is geen argument over de vorm van de workload dat Qwen3.8 27B op prijs redt, want het nadeel van de leverancier — zwaar gebruik van outputtokens — is veel minder waard dan zijn tariefvoordeel.
Wat het redt, is alles wat de API-prijs niet vastlegt: een licentie die herdistributie toestaat, gewichten die je kunt vasthouden en vastpinnen, video-invoer, en een self-hosted pad waarbij de kosten per token je eigen hardware zijn in plaats van de kaart van een leverancier. Als je op zoek bent naar de goedkoopste manier om tekst te classificeren, extraheren, samen te vatten en te routeren, is Claude Haiku 5.5 het antwoord en is het verschil niet klein. Als je op zoek bent naar een model dat je in je eigen product kunt stoppen, op je eigen hardware, onder je eigen audit, dan is de benchmarkkloof al een paar alinea's geleden opgehouden de vraag te zijn.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
