
Ling-3.1-flash scoort 41 op de Artificial Analysis Intelligence Index: de 560B MoE verdubbelt de score van zijn voorganger
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Ling-3.1-flash, de mixture-of-experts van Ant Group met 560 miljard parameters, draagt nu een cijfer dat zijn eigen lab niet heeft geschreven: 41 op de Artificial Analysis Intelligence Index. De index wordt uitgevoerd door de onafhankelijke evaluator, op hardware die de evaluator zelf beheert, tegen een vaste suite — en plaatst het model 21 punten boven zijn eigen directe voorganger, Ling-3.0-flash, die nog steeds op 20 staat in dezelfde index. Ant kondigde Ling-3.1-flash eind september 2026 aan, Artificial Analysis dateert de release op 1 oktober, en het is drie maanden jonger dan het model waarvan het de score verdubbelt.
Die kloof is het verhaal. Een beweging van 21 punten op een samengestelde score die door tien verschillende evaluaties wordt gevoed, is niet iets wat een leveranciersgrafiek kan faken, en het is niet iets waarover deze blog twee weken geleden had kunnen schrijven, toen de enige bestaande meting van Ling-3.1-flash Ants eigen benchmarkkaart was: 1.673 Elo op GDPval-AA v2.1, 75,16 op FrontierSWE, 65,35 op HealthBench Professional. Die cijfers waren echte claims van een echt lab, maar niet gereproduceerd. De 41 is van een andere aard. Het is het eerste cijfer in deze release waaraan een derde partij kan worden gehouden.
Wat de 41 eigenlijk meet
De Artificial Analysis Intelligence Index v4.3.2 is een gewogen samengestelde score van tien evaluaties: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience en AA-LCR v1.1. Een samengestelde score op zichzelf lezen is een vergissing, dus de rijen per evaluatie zijn belangrijker dan het hoofdlijncijfer:
• GDPval-AA — 1.621,75 voor Ling-3.1-flash tegenover 948,35 voor Ling-3.0-flash. Dit is de grootste afzonderlijke sprong in de reeks en degene waarop het grootste deel van de indexbeweging berust.
• GDP.pdf — 0,100 all-pass, gestegen van 0,054. Nog steeds laag in absolute termen, maar bijna een verdubbeling.
• AA-LCR v1.1 redeneren met lange context — 0,83 tegen 0,73 voor de voorganger, en gelijk aan DeepSeek V4.1 Flash (Max) op 0,84.
• SciCode — 0,541 tegen 0,420. Een winst op het gebied van code-wetenschap, geen winst in chatkwaliteit.
• CritPt natuurkundig redeneren — 0,180, tegen 0,017 voorheen. Tien keer de voorganger op een kleine basis.
• AA-Omniscience — +2,22, tegenover −17,88 voor Ling-3.0-flash. Deze wordt hieronder besproken, omdat die tegen de kop indruist.
Ling-3.0-flash verloor op deze rijen niet alleen van Ling-3.1-flash; op twee ervan stortte het in. Het scoorde 0,032 op AutomationBench-AA en exact 0,000 op Terminal-Bench 4.0. Dat is de context waarin de 41 gelezen moet worden — de voorganger was een efficiënt, goedkoop open-weightmodel dat vrijwel geen enkele agentische-terminalcapaciteit had.

Waar de winst vandaan kwam: agentisch werk, niet conversatie
Vergelijk de bijdragen van Ling-3.1-flash aan de index met de twee modellen in de Flash-klasse waarmee het het vaakst naast elkaar wordt gezet, en er verschijnt een patroon dat het geaggregeerde cijfer verbergt. DeepSeek V4.1 Flash (Max) scoort 39 op dezelfde index en GLM 5.3 Flash scoort 42, dus alle drie vallen ze binnen een bandbreedte van drie punten. Maar ze komen daar via verschillende wegen.
• Agentisch terminalwerk — Ling-3.1-flash 0.333 op Terminal-Bench 4.0, DeepSeek V4.1 Flash (Max) 0.268, GLM 5.3 Flash 0.328.
• Agentisch werk in de echte wereld — Ling-3.1-flash 1.621,75 Elo op GDPval-AA, DeepSeek V4.1 Flash (Max) 1.600, GLM 5.3 Flash 1.646,86.
• AutomationBench-AA — Ling-3.1-flash 0.617, DeepSeek V4.1 Flash (Max) 0.689, GLM 5.3 Flash 0.604.
• Programmeerwetenschap — Ling-3.1-flash 0,541 op SciCode, DeepSeek V4.1 Flash (Max) 0,519, GLM 5.3 Flash 0,516.
De beperkte lezing is dat Ling-3.1-flash concurrerend is op agentische benchmarks en iets voorloopt op SciCode. De nuttige lezing is dat het de sterkste van de drie is op de twee agentische terminalmaatstaven die de meeste mensen bedoelen wanneer ze zeggen 'kan het een tool-lus aansturen' — en het blijft achter bij beide op de kennisbetrouwbaarheidsmaatstaf. Dat is een specifieke vorm, geen algemene overwinning, en het is de moeite waard om die te benoemen voordat iemand een workload aanschaft op basis van alleen het indexcijfer.
De rekening die meekomt met een groter model
Ling-3.0-flash was geprijsd op $0,07 per miljoen inputtokens en $0,22 per miljoen outputtokens via de eigen API van Ant, en de modelgewichten waren open onder MIT. Ling-3.1-flash is nog geen van beide. Artificial Analysis noteert de gebruikskosten op $0,30 per miljoen input en $0,90 per miljoen output — met een tarief voor cachehits van $0,06, een korting van 80% op input — gemeten tegen de eigen API van InclusionAI als de aanbieder van de service. Dat is ruwweg een viervoudige stijging van de inputprijs ten opzichte van het model dat het vervangt, voor een indexwinst van 21 punten.
Of die afweging goed is, hangt volledig af van de workload, en de index zelf kan er een prijs op plakken: alle tien Intelligence Index-evaluaties uitvoeren tegen Ling-3.1-flash kost ongeveer $960 tegen die tarieven, tegenover ruwweg $477 voor DeepSeek V4.1 Flash (Max) en $280 voor GLM 5.3 Flash. De reden is niet alleen het tariefkaartje. Ling-3.1-flash is een zeer praatgraag redeneermodel — het verbruikte 220 miljoen outputtokens bij het doorwerken van de index, ruim boven de mediaan voor zijn prijsklasse, en zijn evaluatieruns duren gemiddeld ongeveer 357 seconden per taak tegenover 285 seconden voor DeepSeek V4.1 Flash (Max) en 979 seconden voor GLM 5.3 Flash. Per taak kost Ling-3.1-flash ongeveer $0,99 tegenover $0,27 voor DeepSeek en $0,25 voor GLM 5.3 Flash.
Niets hiervan is zichtbaar vanaf de 41, en het belandt allemaal op de factuur. Een model kan een index winnen en een budget verliezen.
De twee cijfers die de kop tegenspreken
Het eerste is de betrouwbaarheid van kennis. Ling-3.1-flash scoort +2,22 op AA-Omniscience, dat meet of een model weet wat het weet: juiste antwoorden leveren punten op, hallucinaties kosten punten, en weigeringen kosten niets. De nauwkeurigheidsgraad is 29,1% en het hallucinatiepercentage is 37,9%. Naast zijn stalgenoten is dat het zwakste profiel in de groep — GLM 5.3 Flash scoort +7,47 met een hallucinatiepercentage van 27,6%, en DeepSeek V4.1 Flash (Max) scoort −5,30 met een verbijsterend hallucinatiepercentage van 96,5% onder de beantwoorde vragen. De samengestelde score beloont Ling-3.1-flash voor het vermogen dat het laat zien, niet voor de betrouwbaarheid waarmee het dat doet, en een model dat een derde van wat het beweert verzint, moet in productie omringd worden door retrieval.
Het tweede is context. Artificial Analysis vermeldt Ling-3.1-flash met een contextvenster van 1.000.000 tokens. Ants eigen releasemateriaal noemt ook 1M als het doel. Maar Ants ontwikkelaarsdocumentatie, die de vensters van de familie model voor model opsomt, geeft Ling-3.0-flash een native 256K dat uitbreidbaar is tot 1M en bevat nog helemaal geen vermelding voor Ling-3.1-flash. De kenmerkende lange-contextrij die wel werd gemeten — AA-LCR op 0,83 — is een score voor redeneren over lange context, geen meting van het geleverde venster. Beschouw 1M als het opgegeven plafond en valideer het geleverde venster met je eigen lange-contextverzoek voordat je eromheen gaat ontwerpen.
Hoe het zich verhoudt op het specificatieblad
Het beeld dimensie voor dimensie, onderwerp eerst, op elke regel:
• Totaal aantal parameters — Ling-3.1-flash 560B vs DeepSeek V4.1 Flash (Max) 552B vs GLM 5.3 Flash 320B.
• Actieve parameters per token — Ling-3.1-flash 25B vs DeepSeek V4.1 Flash (Max) 16B vs GLM 5.3 Flash 18B. Ling-3.1-flash activeert het meest, wat een van de redenen is waarom de serveerkosten op dat niveau liggen.
• Gewichten en licentie — Ling-3.1-flash niet gepubliceerd (propriëtair, geen licentietekst) vs DeepSeek V4.1 Flash (Max) open onder MIT vs GLM 5.3 Flash open onder MIT.
• Opgegeven context — Ling-3.1-flash 1M vs DeepSeek V4.1 Flash (Max) 1M vs GLM 5.3 Flash 1M. Alle drie claimen hetzelfde plafond; slechts twee ervan hebben een downloadbaar checkpoint waartegen je het kunt verifiëren.
• Modaliteit — Ling-3.1-flash tekst in, tekst uit versus DeepSeek V4.1 Flash (Max) tekst en afbeelding in versus GLM 5.3 Flash tekst, afbeelding en video in. Dit is de enige as waarop Ling-3.1-flash simpelweg achterloopt, en geen enkele benchmarkrij compenseert daarvoor.
• Prijs op de API van de leverancier — Ling-3.1-flash $0,30 / $0,90 per miljoen invoer / uitvoer vs DeepSeek V4.1 Flash (Max) $0,30 / $1,20 vs GLM 5.3 Flash $0,15 / $0,50.
• Indexscore — 41 vs. 39 vs. 42. Een spreiding van drie punten bij een vergelijking tussen drie partijen is geen rangschikking; het is een gelijkspel dat wordt beslecht door de evaluatie waarop de werklast van de lezer toevallig lijkt.
Waar je het kunt bellen
Ling-3.1-flash staat vandaag niet in de OrcaRouter-catalogus — een opzoeking tegen onze publieke model-API voor het model onder InclusionAI levert not-found op, en we zullen niet suggereren dat het anders is. Het draait momenteel op Ants eigen API en op platforms van derden die de release aanbieden, wat de eerlijke omvang van de beschikbaarheid ervan is. Wat het vermelden waard is voor iedereen die de drie bovenstaande modellen vergelijkt, is dat de andere twee nu routeerbaar zijn: DeepSeek V4.1 Flash en GLM 5.3 Flash staan beide in de OrcaRouter-catalogus tegen de lijstprijzen van hun providers met nul opslag, achter één API-sleutel, met automatische failover tussen hen. Als de bovenstaande vergelijking zegt dat jouw workload meer om kennisbetrouwbaarheid geeft dan om agentisch terminalwerk, dan is GLM 5.3 Flash degene om te proberen — en je kunt hem tegen DeepSeek V4.1 Flash op dezelfde sleutel proberen zonder een tweede contract of een regel nieuwe clientcode.
Wat de 41 verandert, en wat niet
Wat het verandert, is de status van de release. Ling-3.1-flash is niet langer een specificatie met een leveranciersgrafiek eraan vast; het is een model met een onafhankelijk gemeten positie, en die positie is een echte generationele sprong in agentische capaciteit ten opzichte van Ling-3.0-flash — het soort sprong dat voortkomt uit een ontwerpwijziging in plaats van meer rekenkracht op hetzelfde recept. Wat het niet verandert, is iets aan inkoop. De gewichten zijn nog steeds gesloten, de licentie staat nog steeds niet op papier, de modaliteit is nog steeds alleen tekst, en de prijs is ongeveer vier keer die van zijn voorganger voor een winst die geconcentreerd is in agent- en terminaltaken.
Als je werk bestaat uit agent-loops, het aansturen van tools en lange tool-ketens, dan is de 41 het meest betekenisvolle cijfer dat tot nu toe over dit model is vrijgegeven, en het verdient een serieuze blik zolang de beschikbaarheid nog wordt uitgebreid. Als je werk multimodaal is, of kenniskritische vraagbeantwoording betreft, of budgetgevoelige inferentie met hoge volumes, dan raakt de 41 jouw probleem niet — en GLM 5.3 Flash, al routeerbaar en al open onder MIT tegen de helft van de outputprijs, is het beter gepositioneerde model van de drie. De index vertelt je waar Ling-3.1-flash staat. Hij vertelt je niet of het je iets zou moeten schelen, en die vraag wordt beantwoord door wat je bouwt.


Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
