
Claude Haiku 5.5 vs Ling 3.0 Flash: Een van deze modellen heeft al een opvolger
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Begin met het merkwaardige feit, want dat is het feit dat de beslissing zou moeten vormgeven. Ling 3.0 Flash — het open-weightmodel van Ant Group met 124 miljard parameters, in augustus 2026 uitgebracht onder MIT — is nu gemarkeerd als verouderd, waarbij Ling 3.1 Flash als vervanger is genoemd. Claude Haiku 5.5 verscheen op 7 oktober 2026, twee dagen voor het schrijven hiervan, en Anthropic heeft toegezegd het niet vóór oktober 2027 uit te faseren. Twee modellen in dezelfde prijsklasse, en voor een van beide wordt al naar zijn eigen opvolger verwezen.
Die asymmetrie is geen oordeel over kwaliteit. Ling 3.0 Flash is een echt snel model met open gewichten en een ongebruikelijke architectuur, en op verschillende assen verslaat het de Anthropic-klasse regelrecht. Maar het betekent wel dat deze vergelijking een houdbaarheidsdatum heeft, en elk stuk dat de twee als even duurzaam behandelt, verkoopt je het deel dat verloopt.
Twee releases, twee heel verschillende tijdperken
De onafhankelijke cijfers hier zijn afkomstig van Artificial Analysis; de leveranciersspecifieke claims komen uit de modelkaarten en documentatie, en zijn gelabeld.
• Release — Ling 3.0 Flash op 4 augustus 2026, met de Hugging Face-repository gedateerd op 2 augustus. Claude Haiku 5.5 op 7 oktober 2026.
• Licentie — MIT voor Ling 3.0 Flash, wat ongeveer zo permissief is als open gewichten maar kunnen zijn. Claude Haiku 5.5 is propriëtair, alleen via API.
• Status — Ling 3.0 Flash heeft een deprecatievlag die verwijst naar Ling 3.1 Flash. Claude Haiku 5.5 is actueel, met een toezegging tot niet-buiten-gebruik-stelling tot en met oktober 2027.
• Adoptie — de Ling 3.0 Flash-repository heeft 11.797 downloads en 427 likes verzameld. Dat is een reële maar bescheiden voetafdruk, en het is een redelijke proxy voor hoeveel tooling van derden rond het model is gegroeid.
Het leeftijdsverschil is belangrijker dan de zes weken doen vermoeden. Ling 3.0 Flash werd uitgebracht in een periode waarin zijn eigen familie al in beweging was; Claude Haiku 5.5 verscheen als het nieuwste lid van een lijn die geen aangekondigde opvolger heeft.
De architectuur is het deel dat de moeite waard is om twee keer te lezen.

Ling 3.0 Flash is een mixture-of-expertsmodel met 124 miljard totale parameters en 5,1 miljard actieve per token. Die verhouding is het hele economische argument: je past de geheugenvoetafdruk van een groot model in en betaalt de rekenkracht van een klein model. De gepubliceerde configuratie is specifiek, en het is geen herverpakking van een standaardtransformer:
• Laagopbouw — 35 KDA-lagen met 7 Gated MLA-lagen in een 5:1-verhouding, plus 2 dense lagen. Het gepubliceerde trainingsrecept brengt het contextvenster in fasen van 8K naar 32K naar 256K, in plaats van het lange venster vanaf nul te trainen.
• Experts — 512 gerouteerde experts met één gedeelde expert, waarvan er per token 8 worden geactiveerd, met een verborgen grootte van 2.560, een expert-tussenlaaggrootte van 768 en een dense-tussenlaaggrootte van 6.144. De woordenschat omvat 157.184 tokens.
• Serving — de referentie-implementatie van de kaart gebruikt SGLang met --context-length 262144, en meldt dat HiCache met Mooncake-caching de tijd tot het eerste token met 60–80% of meer verkort bij lange inputs. Dat is een door de leverancier gerapporteerd cijfer en het wordt ook als zodanig vermeld.
Niets daarvan is een gimmick. Een actieve footprint van 5,1B is waarom Ling 3.0 Flash kan worden aangeboden bij de doorvoer die het haalt, en het cachewerk is waarom de latentie van de eerste token bij lange prompts bruikbaar blijft. De aanpak van Claude Haiku 5.5 is het tegenovergestelde: één dense propriëtair model achter een API, met een venster van 1.000.000 tokens en adaptief denken dat per verzoek bepaalt hoeveel werk er moet worden gedaan. Twee coherente antwoorden op dezelfde kostenkwestie.
De cijfers, naast elkaar

• Onafhankelijke score — Claude Haiku 5.5 met 43 op de Intelligence Index, tweede van 182. Ling 3.0 Flash met 20, derde van 65 in zijn eigen klasse.
• Invoerprijs per miljoen tokens — Claude Haiku 5.5 $0,10 tot 100.000 tokens, $0,50 daarboven. Ling 3.0 Flash $0,075, met een cachekorting van 80%.
• Prijs voor output per miljoen tokens — Claude Haiku 5.5: $0,50 tot 100.000 tokens, $2,50 daarboven. Ling 3.0 Flash: $0,22.
• Gemengde kosten — $0,05 per miljoen tokens voor Ling 3.0 Flash, tegenover $0,08 voor Claude Haiku 5.5 volgens de eigen mengeling van het leaderboard.
• Snelheid — 333,6 outputtokens per seconde voor Ling 3.0 Flash, de eerste van 65 in zijn klasse, tegenover 240,4 voor Claude Haiku 5.5. De tijd tot het eerste token is vrijwel gelijk: 2,50 seconden tegenover de meting van het leaderboard voor het Anthropic-model.
• Context — 262.000 tokens voor Ling 3.0 Flash; 1.000.000 voor Claude Haiku 5.5.
• Invoermodaliteit — alleen tekst voor Ling 3.0 Flash. Tekst en afbeeldingen voor Claude Haiku 5.5.
• Gewichten — MIT en downloadbaar voor Ling 3.0 Flash. Propriëtair voor Claude Haiku 5.5.
Lings pleidooi is snelheid en prijs, niet diepgang
Het Index-verschil van 23 punten tussen 43 en 20 is het belangrijkste nieuws, en het wijst dezelfde kant op als bij elke vergelijking van dit soort: Claude Haiku 5.5 is het sterkere model, en het verschil is niet klein. Maar de Ling-kolom wint twee rijen overtuigend, en beide zijn van het soort dat opduikt op een factuur of in een latencybudget.
Ten eerste, doorvoer. 333,6 tokens per seconde is het snelst in zijn klasse op de ranglijst, ongeveer 39% voor op Claude Haiku 5.5, en in combinatie met lagere gemengde kosten betekent het dat bulkgeneratie — classificatierondes, datalabeling, grootschalige gestructureerde extractie — aantoonbaar goedkoper is om te draaien op Ling 3.0 Flash. Wanneer de taak goed gespecificeerd is en de faalmodus duidelijk is, kan een model dat 23 Index-punten achterloopt nog steeds de juiste keuze zijn.
Ten tweede, de 80%-cachekorting. Voor een workload met een grote stabiele prefix en een kleine variërende staart zakt het effectieve invoertarief op Ling 3.0 Flash ruim onder de stickerprijs, en het cachingontwerp in de modelkaart is precies op dat patroon gericht. Het cache-leestarief van Claude Haiku 5.5 van $0,01 is in absolute termen goedkoper, maar het schrijven naar de cache kost $0,125 en het model kent een prijstrap bij 100.000 invoertokens die Ling niet heeft.
Het tegenwicht is verboseheid, en het is hetzelfde tegenwicht dat geldt voor het Anthropic-model. Artificial Analysis registreerde 260 miljoen outputtokens bij het draaien van de Index op Ling 3.0 Flash, tegen een mediaan van 100 miljoen, en bestempelt het als verbose. Bij een model dat per token wordt geprijsd, tast dat het tariefvoordeel aan — een 2,3x goedkoper outputtarief dat deels wordt opgeslokt door een model dat meer tokens schrijft, is een kleiner voordeel dan de kaart suggereert.
Wat de benchmarks van leveranciers beweren, en wat ze niet beweren.
De eigen kaart van Ling 3.0 Flash meldt een sterke set: MathArena AIME 2026 op 93,2, HMMT februari 2026 op 87, SWE-Bench Pro op 56,6, SWE-Bench Multilingual Resolved op 72,4, en Humanity's Last Exam op 22,7. Elk daarvan is door de leverancier gerapporteerd en geen ervan is hier onafhankelijk gereproduceerd. Ze zijn ook niet gemeten tegen Claude Haiku 5.5 op dezelfde harness — Anthropic publiceert zijn eigen set (GDPval-AA v2.1 op 1620, OSWorld 2.1 op 72,4%, Terminal-Bench 4.0 op 39,2%) en de twee leveranciers gebruikten verschillende suites. De enige gedeelde meting is het onafhankelijke scorebord, en daar is het antwoord ondubbelzinnig.
Het is de moeite waard om naast de wiskundescores te vermelden: dat HLE-cijfer van 22,7 ligt ruim onder de 45,9 zonder tools die Anthropic voor Claude Haiku 5.5 rapporteert. Verschillende harnesses, dus geen directe vergelijking, maar ook geen kloof die door de keuze van harness wordt wegverklaard.

Het opvolgerprobleem
Dit is het onderdeel dat de vergelijking bepaalt voor iedereen die verder kijkt dan het huidige kwartaal, en het heeft niets met benchmarks te maken.
Ling 3.0 Flash is gedeprecieerd ten faveure van Ling 3.1 Flash. Dat betekent niet dat het stopt met werken — open gewichten verlopen niet, en MIT-licenties kunnen niet worden ingetrokken. Maar het betekent wel dat het ecosysteem eromheen zal afdrijven: ondersteuning voor inference-frameworks, kwantisatie-releases, bugfixes en community-tooling volgen allemaal het huidige model, en een gedeprecieerd model krijgt slechts het staartje van die aandacht. Als je vandaag op Ling 3.0 Flash bouwt, bouw je op gewichten die bevroren en afgerond zijn, wat prima is voor een stabiele workload en onhandig voor alles waarvan je verwacht dat het beter wordt.
Claude Haiku 5.5 heeft de spiegelbeeldige set garanties: je krijgt de gewichten niet, maar je krijgt een leverancier wiens commerciële belang erin bestaat het model snel, gepatcht en beschikbaar te houden, plus een toezegging om het niet uit dienst te nemen tot en met oktober 2027 en een gepubliceerd migratiepad voor wanneer dat afloopt.
Beide kanten van deze route, via één sleutel
De eerlijke beschikbaarheidslijn: OrcaRouter biedt Ling 3.0 Flash niet aan, en Claude Haiku 5.5 evenmin. Ling 3.0 Flash wordt geleverd via de eigen distributie van de leverancier en verschillende platforms van derde partijen; Claude Haiku 5.5 staat op de API van Anthropic en de grote cloudplatforms.
Wat dat achterlaat, is de routeringsvraag die beide modellen oproepen. Claude Haiku 5.5 met 43 en een venster van 1M is een natuurlijk escalatiedoel; Ling 3.0 Flash met 333 tokens per seconde is een natuurlijke bulkroute. Een route die hoogvolume, goed gespecificeerd werk naar een snelle tier stuurt en alles wat niet door een lengte- of kwaliteitscontrole komt, escaleert naar een sterkere, is precies de opzet die een router samenstelt — op OrcaRouter staan Anthropic's Claude Haiku 4.5, Claude Sonnet 5.5 en Claude Opus 5.5 vandaag in de catalogus, naast grote open-weight opties zoals DeepSeek V4.1 Flash en GLM 5.3 Flash, zodat zowel de escalatie- als de bulkroute nu gebouwd en load-getest kunnen worden. Eén sleutel, automatische failover eronder, lijstprijzen van providers doorgegeven met 0% markup, zodat een prijswijziging dezelfde dag live is.
Welke van de twee, en hoe lang?
Neem Claude Haiku 5.5 als het werk open-eindig is, als je afbeeldingen of een contextvenster van een miljoen tokens nodig hebt, als je wilt dat een leverancier verantwoordelijk is voor uptime, of als je verder dan volgend kwartaal vooruitplant. Het staat 23 Index-punten voor, het is actueel in plaats van verouderd, en het prijsverschil is klein genoeg dat het scoreverschil overheerst.
Kies Ling 3.0 Flash als de workload bulk, goed gespecificeerd en latentiegevoelig is, als de MIT-licentie of de open gewichten het punt zijn, of als een cachekorting van 80% op een stabiele prefix werkelijk is waar je factuur zit. Het is het snellere model en het goedkopere per token, en het is echt goed in de taken die een 20-Index-model aankan. Houd er alleen rekening mee dat je een afgerond model overneemt in plaats van een onderhouden model, en dat de opvolger waarop het wijst al bestaat.
