
Claude Haiku 5.5 vs Ling 3.1 Flash: Een model met 560 miljard parameters dat vier keer meer per antwoord kost
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Er zitten zes dagen tussen. InclusionAI bracht Ling 3.1 Flash op 1 oktober 2026 uit; de leverancier bracht Claude Haiku 5.5 op 7 oktober uit. Beide worden verkocht als modellen in de flash-tier, beide hebben een contextvenster van één miljoen tokens, en op de redeneringsrijen van het enige onafhankelijke scorebord dat beide modellen heeft gedraaid, liggen ze zo dicht bij elkaar dat het verschil binnen de ruis valt. Dan kom je bij de rij die meet of een agent de taak daadwerkelijk afmaakt, en daar liggen ze 26 punten uit elkaar — en bij de rij die meet wat een afgeronde taak kost, waar het model met 560 miljard parameters viereneenhalf keer zo duur is als het model waarvan niemand het aantal parameters heeft gepubliceerd.
Geen van beide tariefkaarten voorspelt dat. Ling 3.1 Flash heeft een tarief van $0,30 per miljoen inputtokens en $0,90 per miljoen outputtokens. Claude Haiku 5.5 heeft een tarief van $0,10 en $0,50 voor prompts tot 100.000 tokens, en gaat daarboven naar $0,50 en $2,50. Als je dit als prijs per token leest, is Ling drie keer zo duur qua input en iets minder dan twee keer zo duur qua output, wat het soort verschil is dat een vergelijking in één regel beëindigt.
Dit maakt er geen einde aan, want de tariefkaart wordt per token geprijsd en de beslissing per taak. Die twee getallen komen met tegengestelde tekens uit deze confrontatie, en de reden daarvoor is niet breedsprakigheid.
Wat een afgeronde taak kost, niet wat een token kost
Op de Artificial Analysis Intelligence Index v4.3.2 bedragen de gemeten kosten om één volledige indextaak te voltooien $0,21 voor Claude Haiku 5.5 en $0,99 voor Ling 3.1 Flash. Dat is een verschil van 4,6× — groter dan de invoerverhouding van 3×, en in dezelfde richting.
De voor de hand liggende verklaring — dat het dure model meer praat — is de verkeerde. Ling 3.1 Flash genereerde 100.671 uitvoertokens per indextaak; Claude Haiku 5.5 genereerde er 162.164. Het goedkopere model is het praatgraagste, met meer dan 60%. Het geld gaat dus ook niet naar waar de tariefkaart op wijst.
Splits de kosten per taak op, en ze komen terecht waar de indexmethodologie ze daadwerkelijk besteedt. Van de $0,21 van Claude Haiku 5.5 is ruwweg 62% aan de inputzijde; van de $0,99 van Ling 3.1 Flash is ruwweg 91% dat. Dit zijn cache-intensieve redeneerruns, en de twee leveranciers hanteren heel verschillende prijzen voor een gecachte inputtoken: $0,01 per miljoen voor Claude Haiku 5.5 tegenover $0,06 per miljoen voor Ling 3.1 Flash — een 6× verschil op die ene regel die de rekening domineert. De gepubliceerde tariefkaart vergelijkt $0,10 met $0,30. De regel die de factuur bepaalt, vergelijkt $0,01 met $0,06.
Onze eigen catalogus geeft de lijstprijzen van de aanbieder door tegen 0% opslag, en daaraan kun je de twee situaties van elkaar onderscheiden op een echte factuur in plaats van op een gemodelleerde. Ling 3.1 Flash staat niet in de catalogus onder welke spelling van het leverancierspad we ook maar konden achterhalen — niet onder InclusionAI, niet onder Ling, niet onder een van de acht vormen die we hebben geprobeerd — de $0,30 en $0,90 hierboven zijn de eigen gepubliceerde tarieven van de leverancier en niets wat wij vandaag voor je kunnen routeren. Claude Haiku 5 staat ook niet in de catalogus; die loopt via de eigen API van Anthropic. Wat de catalogus wél bevat uit de buurt van deze vergelijking is GLM 5.3 Flash, DeepSeek V4.1 Flash, Qwen3.8 Flash en Gemini 3.8 Flash, elk tegen de lijstprijs van de aanbieder met 0% opslag, zodat een tariefwijziging van een leverancier onze kant op dezelfde dag bereikt als de hunne. Als uit de bevinding hieronder blijkt dat het agentische profiel van Ling 3.1 Flash is wat je workload nodig heeft, is de praktische volgende stap een rechtstreekse vergelijking met de agentisch capabele modellen die wij wél routeren, op één sleutel met automatische failover daaronder en de routing-DSL wanneer het kostenplafond in de route thuishoort en niet in applicatiecode.

Zeven rijen waarin beide werden gemeten
Artificial Analysis is het enige platform dat beide modellen heeft uitgevoerd, en de overlap is smal maar informatief. De rijen komen niet met elkaar overeen, en de richting van de discrepantie is niet willekeurig.
• Intelligence Index v4.3.2 — 43,40 voor Claude Haiku 5.5 (Max) tegenover 41,09 voor Ling 3.1 Flash. Een voorsprong van 2,31 punten voor Anthropic.
• Kosten per voltooide Index-taak — $0,21 tegenover $0,99 op hetzelfde bord.
Tijd per Index-taak — 424,6 seconden voor Claude Haiku 5.5 tegen 360,4 seconden voor Ling 3.1 Flash. Dit is de rij waarin de verwachting wordt doorbroken: het model met 560 miljard parameters is over de index als geheel genomen het snelst van de twee, met ongeveer 15%.
• Terminal Bench 4.0 — 0,3283 tegen 0,3333. Ling 3.1 Flash staat een half punt voor, wat op een benchmark die beide leveranciers aanhalen een gelijkspel is.
• SciCode — 0,5498 tegen 0,5405. Claude Haiku 5.5 met 0,9 punten. Ook een gelijkspel.
• Humanity's Last Exam, zonder tools — 0.4439 tegenover 0.3943. Claude Haiku 5.5 met 5 punten verschil, de eerste echte scheiding.
• AutomationBench, gedeeltelijke score — 0.3541 tegenover 0.6174. Ling 3.1 Flash met 26 punten verschil, en met een grotere marge dan alle andere verschillen op deze lijst samen.
Er bestaan nog twee rijen buiten die gedeelde set, en die zijn de moeite waard om op te nemen, want het zijn juist de rijen die kopers het meest opvallen. Op GDPval-AA, dat Artificial Analysis over 44 beroepen afneemt, staan de twee op 1620,05 en 1621,75 — een statistisch gelijkspel. Op AA-Briefcase v1.1, een met Elo beoordeelde langvormige evaluatie van professioneel werk, scoort Claude Haiku 5.5 1577,72 tegenover de 1400,35 van Ling 3.1 Flash, een gat van 177 punten in het voordeel van Anthropic. Dat is de grootste niet-agentische afstand tussen hen op de hele ranglijst.
De enkele rij die de meeste van deze gesprekken zou moeten beslissen
Gemiddelden op indexniveau verbergen waar de tijd en het geld daadwerkelijk naartoe gingen, en dit paar is daarvan het duidelijkste geval in de batch. De cijfers per evaluatie op Terminal Bench 4.0 liggen in geen enkele dimensie dicht bij elkaar, behalve wat betreft de score.
• Terminal Bench 4.0, Ling 3.1 Flash — 0,3333 bij $5,49 per taak en 1.283 seconden per taak.
• Terminal Bench 4.0, Claude Haiku 5.5 — 0,3283 tegen $ 0,65 per taak en 908 seconden per taak.
Vijfduizendsten van een scorepunt scheiden hen. De kosten zijn 8,4× en de kloktijd is 1,4×. Een team dat de benchmarktabel leest en het model kiest dat 0,3333 scoort, heeft volgens de eigen berekening van Artificial Analysis ervoor gekozen om acht keer zoveel te betalen om een derde van een minuut later met hetzelfde antwoord uit te komen.
Dit is geen betoog dat de score betekenisloos is; het is een betoog dat een score een verhouding is tussen uitgevoerd werk en werk waarvoor een poging is gedaan, en het zegt niets over de middelen die zijn verbruikt om daar te komen. Benchmarks voor agentische voltooiing zijn precies de context waarin dat onderscheid het meest pijn doet, want een agent die opnieuw probeert, is een agent die bij elke nieuwe poging de volle prijs betaalt, en een model dat acht keer zoveel per poging kost, verandert een herhalingslus in een begrotingspost.

De 560 miljard parameters zonder iets te downloaden
Dit is het deel van het specificatieblad van Ling 3.1 Flash dat echt ongewoon is, en dat is niet de grootte.
Ling 3.1 Flash is een sparse mixture-of-experts-model — 560 miljard parameters in totaal, 25 miljard actief per token — en Artificial Analysis classificeert het als propriëtair. Er zijn geen gewichten, geen licentiebestand en geen repository. Een groot sparse model van die vorm zou normaal gesproken als een open release verschijnen, want dat is wat de rest van deze categorie doet: GLM 5.3 Flash levert MIT-gewichten bij 320 miljard totaal en 18 miljard actief, en DeepSeek V4.1 Flash levert MIT-gewichten bij 552 miljard totaal en 16 miljard actief. Ling 3.1 Flash is dezelfde klasse van architectuur op dezelfde orde van schaal, uitsluitend gepubliceerd als API.
Die keuze heeft een consequentie die de benchmarkrijen niet laten zien. Een model met 25 miljard actieve parameters moet ergens worden geserveerd, en als je het checkpoint niet kunt vasthouden, kun je niet kiezen waar of tegen welke marge — dan huur je de servering van het model bij de leverancier. De prijs van $5,49 voor de Terminal Bench-taak hierboven is niet in de eerste plaats een artefact van het token-tarief; het is wat het kost om een groot sparse model te huren bij de enige partij die het kan draaien. De open-weights-soortgenoten in deze categorie geven je de mogelijkheid om dat getal zelf te bepalen.
Het werkt ook de andere kant op, en dezelfde eerlijkheid geldt. Een open release is niet automatisch het betere product: je erft de serverlast, de kwantisatiekeuzes en de upgrade-tredmolen samen met de gewichten, en een licentiebestand is geen supportcontract. Anthropic publiceert voor Claude Haiku 5.5 een uitfaseringstoezegging van niet eerder dan 7 oktober 2027, op een first-party-API met een systeemkaart. Welke van die twee constructies je wilt, is een vraag over je team, niet over een van beide modellen.
Waarvoor Ling 3.1 Flash is bedoeld
Lees het profiel in zijn geheel en het beschrijft een coherent product in plaats van een product dat concessies doet: een groot, sparse, long-contextmodel dat autonome workflows met meerdere stappen beter afrondt dan al het andere dat in deze prijsklasse is gemeten, niet bijzonder is in moeilijke single-shotredeneringen, en dat doet tegen een vast tarief zonder promptlengte-cliff. Op AutomationBench ligt het 26 punten voor op Claude Haiku 5.5, en zijn AA-Briefcase-score is het enige punt in deze vergelijking waarop het achter de middenmoot van het veld eindigt in plaats van aan de kop ervan.
Dat is een verdedigbare beschrijving van een batch-agentische worker: richt hem op een wachtrij van gestructureerde jobs die elk moeten worden voltooid, accepteer dat de taak in minuten wordt gemeten, houd de prompt lang genoeg zodat een drempelstap bestraffend zou zijn, en hecht meer waarde aan betrouwbaarheid bij de finish dan aan de kosten van één enkele token. Waar hij niet goed voor is, is hetgeen waarvoor flash-tier-modellen gewoonlijk worden gekocht. Hij accepteert alleen tekst — helemaal geen beeldinvoer, terwijl Claude Haiku 5.5 tekst en afbeeldingen accepteert. De index-taaktijd is korter, maar de Terminal Bench-taaktijd is langer, en met $0,99 per voltooide index-taak tegenover $0,21 besteedt hij viereneenhalf keer zoveel om op vrijwel dezelfde composietscore uit te komen.

Welke van de twee, op grond van het beschikbare bewijs
Als je werk tekst in, tekst uit is, per token geprijsd bij volume, wint Claude Haiku 5.5 deze vergelijking op elke regel die een factuur bereikt: lagere index-taakkosten, lagere werkelijke taakkosten op de benchmark die het belangrijkst is voor agents, een hogere samengestelde score, betere scores voor langvormig professioneel werk, betere getrouwheid, en beeldinvoer die het andere model helemaal niet biedt.
Als jouw werk een agent zonder toezicht is die een workflow met meerdere stappen moet voltooien, scoort Ling 3.1 Flash 26 punten hoger dan Claude Haiku 5.5 op de enige gedeelde benchmark die precies dat meet, en dat is het testen waard in plaats van het op prijs af te wijzen. Test het op je eigen trace, niet op deze tabel — en begroot de test per voltooide opdracht, want dat is het getal dat verandert wanneer een agent opnieuw probeert.
Als je de gewichten in handen moet hebben, is geen van deze twee jouw model. Ling 3.1 Flash is propriëtair met 560 miljard parameters; Claude Haiku 5.5 is propriëtair zonder gepubliceerd aantal. De open releases in deze categorie staan ergens anders op het bord, en die vergelijking begint helemaal bij een andere set rijen.
De composiet zegt 2,31 punten. De agentische benchmark zegt 26 de andere kant op. De tariefkaart zegt 3× op invoer; de kosten per voltooide taak zeggen 4,6× in dezelfde richting als de kaart. Vier getallen, twee richtingen — daarom is de enige betrouwbare manier om dit te beslechten beide tegen een trace van je eigen werk te draaien en de kosten af te lezen van de voltooide taken in plaats van de tokens.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
