
Ling-3.1-flash vs Ling-3.0-flash: wat een 1M-tokenvenster en 4,5x zoveel parameters echt veranderen
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 262 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- xAISpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
De Ling-familie van Ant Group heeft een nieuwe snelle tier, en dit keer is die pas één zin oud. Ling-3.1-flash werd aangekondigd op 30 september 2026 — ruwweg 560 miljard totale parameters, ongeveer 25 miljard actief per token, een contextvenster dat wordt opgegeven als maximaal 1 miljoen tokens, en een standaardzinnetje eraan vastgeplakt: "We zijn van plan het model binnenkort open source te maken." Het model dat het bovenaan de snelle lijn vervangt, Ling-3.0-flash, is in elk opzicht een ander beest: 124 miljard totale parameters, 5,1 miljard actief per token, een geserveerde context van 262.144 tokens, onder MIT-licentie vrijgegeven gewichten op Hugging Face sinds 7 augustus, en een onafhankelijke Artificial Analysis Intelligence Index van 20. Een van deze modellen kun je vandaag downloaden. Over het andere kun je alleen lezen. Ze vergelijken is oprecht nuttig, maar alleen als de vergelijking daar begint.
De rekensom in de kop is eenvoudig en enigszins misleidend. Ling-3.1-flash heeft ongeveer 4,5× het totale aantal parameters van Ling-3.0-flash en ongeveer 4,9× het aantal actieve parameters — 25B tegen 5,1B per token. Een oppervlakkige lezing zegt: 'veel groter model, dus veel slimmer model.' De zorgvuldiger lezing is dat Ant ongeveer de sparsityratio heeft behouden bij het opschalen van de body, en wat dat oplevert is capaciteit, niet noodzakelijkerwijs redeneerdiepte per token: een model dat 25B van zijn 560B door elk token routeert, verricht meer werk per token dan een model dat 5,1B routeert, maar het betaalt ook ongeveer vijf keer zoveel rekenkracht per token om dat te doen. Waar die afweging op uitdraait, hangt volledig af van of de architectuur van Ant de extra parameters efficiënt verwerkt — en dat is een vraag die de aankondiging niet beantwoordt.
De twee modellen, naast elkaar
Zet de gepubliceerde feiten naast elkaar en houd de generaties netjes gescheiden. Elke regel hieronder vermeldt wat Ant of een onafhankelijke evaluator daadwerkelijk heeft gepubliceerd; waar een getal ontbreekt, ontbreekt het omdat niemand het heeft gepubliceerd.
• Totaal aantal parameters — Ling-3.1-flash: ~560B (leverancier). Ling-3.0-flash: 124B (modelkaart).
• Actieve parameters per token — Ling-3.1-flash: ~25B (leverancier). Ling-3.0-flash: 5,1B (modelkaart).
• Contextvenster — Ling-3.1-flash: tot 1M tokens (leverancier). Ling-3.0-flash: 256K native, aangeboden op 262,144 (modelkaart en inferentierecepten).
• Gewichten en licentie — Ling-3.1-flash: niet gepubliceerd; geen repository, geen licentie (gecontroleerd op 30 september en nogmaals op 1 oktober 2026). Ling-3.0-flash: MIT, op Hugging Face als inclusionAI/Ling-3.0-flash en op ModelScope sinds 7 augustus 2026.
• Gewichtsformaten — Ling-3.1-flash: geen beschikbaar. Ling-3.0-flash: BF16 (~255GB) en FP8 (~128GB) van het lab, plus quants uit de community.
• Herkomst van benchmarks — Ling-3.1-flash: volledig door de leverancier gerapporteerd, geen publieke harness, geen gewichten om opnieuw te draaien. Ling-3.0-flash: onafhankelijk gescoord door Artificial Analysis met een Intelligence Index van 20, met daarnaast gepubliceerde gemeten uitvoersnelheid en token-generatievolume.
• Beschikbaarheid — Ling-3.1-flash: alleen het eigen Ling Studio-product van Ant. Ling-3.0-flash: zelf te hosten, plus aanroepbaar via de developer-API van Ant.

Waar de extra capaciteit waarschijnlijk voor is
De eigen beschrijving in één regel die Ant van Ling-3.1-flash geeft, is het meest informatieve in de release. De Ling Studio-app positioneert het voor "algemene agenten, zoeken, routinematig kantoorwerk en software-/codeontwikkeling" — een kantoorwerk- en agentische framing, niet een redeneerbenchmarkframing. Dat is consistent met hoe de familie is georganiseerd: Ling is de algemene tekst-en-tool-lijn, Ring is de redeneerlijn en Ming behandelt multimodale zaken. Ling-3.0-flash bezette één generatie eerder dezelfde positie, en het was expliciet de snelle, goedkope tier in plaats van het vlaggenschip.
Bekijk de opschaling in dat licht, en het is logisch. Agentische workloads en workloads met tool-calling zijn lang, repetitief en contexthongerig: één enkele agentloop kan tienduizenden tokens aan verzamelde tool-output verbruiken voordat hij een actie onderneemt, dus een venster van 1M tokens is een functionele vereiste in plaats van specsheet-franje. Het totale aantal parameters opschalen terwijl je een grote actieve fractie behoudt, is hoe je wereldkennis en diepgang in het opvolgen van instructies toevoegt aan een model dat nog steeds snel genoeg moet zijn om in een loop te passen. Ant bouwt hier geen trager, slimmer vlaggenschip; het bouwt een grotere snelle tier.
Het tegenargument is kosten, en het is dezelfde rekensom die vanuit de andere richting komt. De extra capaciteit is niet gratis tijdens inferentie — er wordt voor elk token voor betaald, en Ant heeft helemaal geen prijs gepubliceerd voor Ling-3.1-flash: geen API-tarievenlijst, geen cachekorting, niets vergelijkbaars met de $0.075/$0.22 per miljoen tokens die de vorige generatie vermeldt. Dat is het ontbrekende getal dat deze vergelijking zou beslissen, en het ontbreekt.
Benchmarks, en wie ze heeft uitgevoerd
Ling-3.1-flash komt met drie scores die los bekeken sterk lijken: 1.673 Elo op GDPVal-AA v2.1, 75,16 op FrontierSWE en 65,35 op HealthBench Professional. Alle drie zijn van Ant zelf en komen uit de aankondiging, en geen ervan is door een extern lab gereproduceerd. Het praktische gevolg is dat ze wel vergeleken kunnen worden met cijfers van andere leveranciers, maar niet met onafhankelijke cijfers — en de Intelligence Index van 20 punten van Artificial Analysis voor Ling-3.0-flash is een onafhankelijk cijfer op een andere schaal, dus de twee naast elkaar zetten zou een meting met een bewering vergelijken. Op het moment van schrijven is er geen Ling-3.1-flash-pagina op Artificial Analysis.
Eén voetnoot bij de eigen grafiek van Ant verdient op zichzelf al aandacht. De kaart vermeldt dat het HealthBench Professional-resultaat is geëvalueerd in de "AQ-omgeving" en dat de gezondheidszorgmogelijkheden van Ling-3.1-flash momenteel alleen in AQ kunnen worden ervaren. Geen enkele openbare documentatie legt uit wat AQ is. Een topscore met een niet nader genoemde omgevingskwalificatie is iets wat een extern team niet kan reproduceren, zelfs niet wanneer de gewichten bestaan.
Welke moet ik deze week nou echt gebruiken?
De generatiekwestie valt anders uit, afhankelijk van wat je vandaag nodig hebt, en voor bijna iedereen is het antwoord op dit moment niet het nieuwere model.
Als je deze week iets wilt draaien, is Ling-3.0-flash de enige van de twee die in een bruikbare vorm bestaat: MIT-gewichten die je zelf kunt hosten, FP8 als je een kleinere voetafdruk wilt, gepubliceerde prijzen voor de first-party API, en een onafhankelijke score die je vertelt wat je krijgt. Het is een echt goed model in zijn klasse — de onafhankelijke evaluatie plaatste het op de open-weights-Paretofrontier voor intelligentie afgezet tegen totale parameters, en beoordeelde de snelheid ervan hoog, met de kanttekening dat het ongewoon breedsprakig is en tijdens de evaluatie ongeveer 260M tokens genereerde, tegen een mediaan van bijna 100M.
Als je voor de komende zes maanden plant, is Ling-3.1-flash de richting waarin het zich beweegt en nog geen component. De specifieke dingen om in de gaten te houden voordat het er een wordt: of de gewichten daadwerkelijk open gaan en onder welke licentie, of het geserveerde venster echt 1M is of een uitbreiding van een kortere native context, wat het per miljoen tokens kost, en of een onafhankelijk lab de 75,16 op FrontierSWE reproduceert. Als een van die punten werkelijkheid wordt, is dat een reden om de vergelijking opnieuw uit te voeren. Geen ervan is werkelijkheid geworden.

Waar dit past in een routingstack
Geen van beide Ling-modellen staat vandaag in onze catalogus — Ling-3.0-flash, Ling-3.0-flash-VL en Ling-3.1-flash geven allemaal 'not-found' terug tegen de OrcaRouter-model-API, dus het eerlijke antwoord op "kan ik het via jullie aanroepen" is voorlopig nee. Waar een routeringslaag in een week als deze echt goed voor is, is de andere helft van het probleem: de modellen waarmee je een kandidaat zou benchmarken. Claude Opus 5, GPT-5.6 Sol en DeepSeek-V4.1-Flash zijn allemaal live routes tegen de lijstprijs van de provider met nul markup, en een router die ze achter één sleutel houdt met automatische failover is hoe je een evaluatieharnas op een bewegend doel gericht houdt zonder vier integraties te onderhouden. Wanneer de gewichten van Ling-3.1-flash beschikbaar komen en de licentie leesbaar is, is dat ook de vorm van de beslissing: één endpoint toevoegen, niet de stack herbouwen.
De generatiesamenvatting is kort. Ling-3.0-flash is een geleverd, onafhankelijk gescoord, onder een permissieve licentie vrijgegeven model dat vandaag zelf te hosten is. Ling-3.1-flash is een grotere belofte, met een langere context en duurder om te draaien, die Ant nog niet heeft geleverd in enige voor een ontwikkelaar bruikbare vorm. De tweede als een upgrade ten opzichte van de eerste behandelen is de fout waartoe deze release uitnodigt, en de cijfers ondersteunen dit nog niet.

