Gegenereerde redactionele hero-kaart met de titel "Ling-3.1-flash vs Ling-3.0-flash" en de ondertitel "De ene is vandaag downloadbaar. De andere is een zin in een persbericht." Twee vergelijkingskolommen: "Ling-3.1-flash (aangekondigd)" somt "~560B totaal / ~25B actief", "tot 1M-token context" en "geen weights, geen licentie" op; "Ling-3.0-flash (uitgebracht)" somt "124B totaal / 5.1B actief", "262.144-token geleverde context" en "MIT-weights op Hugging Face" op.
Guides & Insights

Ling-3.1-flash vs Ling-3.0-flash: wat een 1M-tokenvenster en 4,5x zoveel parameters echt veranderen

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De Ling-familie van Ant Group heeft een nieuwe snelle tier, en dit keer is die pas één zin oud. Ling-3.1-flash werd aangekondigd op 30 september 2026 — ruwweg 560 miljard totale parameters, ongeveer 25 miljard actief per token, een contextvenster dat wordt opgegeven als maximaal 1 miljoen tokens, en een standaardzinnetje eraan vastgeplakt: "We zijn van plan het model binnenkort open source te maken." Het model dat het bovenaan de snelle lijn vervangt, Ling-3.0-flash, is in elk opzicht een ander beest: 124 miljard totale parameters, 5,1 miljard actief per token, een geserveerde context van 262.144 tokens, onder MIT-licentie vrijgegeven gewichten op Hugging Face sinds 7 augustus, en een onafhankelijke Artificial Analysis Intelligence Index van 20. Een van deze modellen kun je vandaag downloaden. Over het andere kun je alleen lezen. Ze vergelijken is oprecht nuttig, maar alleen als de vergelijking daar begint.

De rekensom in de kop is eenvoudig en enigszins misleidend. Ling-3.1-flash heeft ongeveer 4,5× het totale aantal parameters van Ling-3.0-flash en ongeveer 4,9× het aantal actieve parameters — 25B tegen 5,1B per token. Een oppervlakkige lezing zegt: 'veel groter model, dus veel slimmer model.' De zorgvuldiger lezing is dat Ant ongeveer de sparsityratio heeft behouden bij het opschalen van de body, en wat dat oplevert is capaciteit, niet noodzakelijkerwijs redeneerdiepte per token: een model dat 25B van zijn 560B door elk token routeert, verricht meer werk per token dan een model dat 5,1B routeert, maar het betaalt ook ongeveer vijf keer zoveel rekenkracht per token om dat te doen. Waar die afweging op uitdraait, hangt volledig af van of de architectuur van Ant de extra parameters efficiënt verwerkt — en dat is een vraag die de aankondiging niet beantwoordt.

De twee modellen, naast elkaar

Zet de gepubliceerde feiten naast elkaar en houd de generaties netjes gescheiden. Elke regel hieronder vermeldt wat Ant of een onafhankelijke evaluator daadwerkelijk heeft gepubliceerd; waar een getal ontbreekt, ontbreekt het omdat niemand het heeft gepubliceerd.

• Totaal aantal parameters — Ling-3.1-flash: ~560B (leverancier). Ling-3.0-flash: 124B (modelkaart).

• Actieve parameters per token — Ling-3.1-flash: ~25B (leverancier). Ling-3.0-flash: 5,1B (modelkaart).

• Contextvenster — Ling-3.1-flash: tot 1M tokens (leverancier). Ling-3.0-flash: 256K native, aangeboden op 262,144 (modelkaart en inferentierecepten).

• Gewichten en licentie — Ling-3.1-flash: niet gepubliceerd; geen repository, geen licentie (gecontroleerd op 30 september en nogmaals op 1 oktober 2026). Ling-3.0-flash: MIT, op Hugging Face als inclusionAI/Ling-3.0-flash en op ModelScope sinds 7 augustus 2026.

• Gewichtsformaten — Ling-3.1-flash: geen beschikbaar. Ling-3.0-flash: BF16 (~255GB) en FP8 (~128GB) van het lab, plus quants uit de community.

• Herkomst van benchmarks — Ling-3.1-flash: volledig door de leverancier gerapporteerd, geen publieke harness, geen gewichten om opnieuw te draaien. Ling-3.0-flash: onafhankelijk gescoord door Artificial Analysis met een Intelligence Index van 20, met daarnaast gepubliceerde gemeten uitvoersnelheid en token-generatievolume.

• Beschikbaarheid — Ling-3.1-flash: alleen het eigen Ling Studio-product van Ant. Ling-3.0-flash: zelf te hosten, plus aanroepbaar via de developer-API van Ant.

Headless capture of the Artificial Analysis model page for Ling 3.0 Flash. The page shows the model's stat strip with text input and text output, a 262k-token context window, 5.1B active parameters, and a written summary stating that Ling 3.0 Flash scores 20 on the Artificial Analysis Intelligence Index against a median of 8, generated 260M tokens during evaluation, is priced at $0.07 per 1M input tokens and $0.22 per 1M output tokens, and runs at 325 tokens per second.

Waar de extra capaciteit waarschijnlijk voor is

De eigen beschrijving in één regel die Ant van Ling-3.1-flash geeft, is het meest informatieve in de release. De Ling Studio-app positioneert het voor "algemene agenten, zoeken, routinematig kantoorwerk en software-/codeontwikkeling" — een kantoorwerk- en agentische framing, niet een redeneerbenchmarkframing. Dat is consistent met hoe de familie is georganiseerd: Ling is de algemene tekst-en-tool-lijn, Ring is de redeneerlijn en Ming behandelt multimodale zaken. Ling-3.0-flash bezette één generatie eerder dezelfde positie, en het was expliciet de snelle, goedkope tier in plaats van het vlaggenschip.

Bekijk de opschaling in dat licht, en het is logisch. Agentische workloads en workloads met tool-calling zijn lang, repetitief en contexthongerig: één enkele agentloop kan tienduizenden tokens aan verzamelde tool-output verbruiken voordat hij een actie onderneemt, dus een venster van 1M tokens is een functionele vereiste in plaats van specsheet-franje. Het totale aantal parameters opschalen terwijl je een grote actieve fractie behoudt, is hoe je wereldkennis en diepgang in het opvolgen van instructies toevoegt aan een model dat nog steeds snel genoeg moet zijn om in een loop te passen. Ant bouwt hier geen trager, slimmer vlaggenschip; het bouwt een grotere snelle tier.

Het tegenargument is kosten, en het is dezelfde rekensom die vanuit de andere richting komt. De extra capaciteit is niet gratis tijdens inferentie — er wordt voor elk token voor betaald, en Ant heeft helemaal geen prijs gepubliceerd voor Ling-3.1-flash: geen API-tarievenlijst, geen cachekorting, niets vergelijkbaars met de $0.075/$0.22 per miljoen tokens die de vorige generatie vermeldt. Dat is het ontbrekende getal dat deze vergelijking zou beslissen, en het ontbreekt.

Benchmarks, en wie ze heeft uitgevoerd

Ling-3.1-flash komt met drie scores die los bekeken sterk lijken: 1.673 Elo op GDPVal-AA v2.1, 75,16 op FrontierSWE en 65,35 op HealthBench Professional. Alle drie zijn van Ant zelf en komen uit de aankondiging, en geen ervan is door een extern lab gereproduceerd. Het praktische gevolg is dat ze wel vergeleken kunnen worden met cijfers van andere leveranciers, maar niet met onafhankelijke cijfers — en de Intelligence Index van 20 punten van Artificial Analysis voor Ling-3.0-flash is een onafhankelijk cijfer op een andere schaal, dus de twee naast elkaar zetten zou een meting met een bewering vergelijken. Op het moment van schrijven is er geen Ling-3.1-flash-pagina op Artificial Analysis.

Eén voetnoot bij de eigen grafiek van Ant verdient op zichzelf al aandacht. De kaart vermeldt dat het HealthBench Professional-resultaat is geëvalueerd in de "AQ-omgeving" en dat de gezondheidszorgmogelijkheden van Ling-3.1-flash momenteel alleen in AQ kunnen worden ervaren. Geen enkele openbare documentatie legt uit wat AQ is. Een topscore met een niet nader genoemde omgevingskwalificatie is iets wat een extern team niet kan reproduceren, zelfs niet wanneer de gewichten bestaan.

Welke moet ik deze week nou echt gebruiken?

De generatiekwestie valt anders uit, afhankelijk van wat je vandaag nodig hebt, en voor bijna iedereen is het antwoord op dit moment niet het nieuwere model.

Als je deze week iets wilt draaien, is Ling-3.0-flash de enige van de twee die in een bruikbare vorm bestaat: MIT-gewichten die je zelf kunt hosten, FP8 als je een kleinere voetafdruk wilt, gepubliceerde prijzen voor de first-party API, en een onafhankelijke score die je vertelt wat je krijgt. Het is een echt goed model in zijn klasse — de onafhankelijke evaluatie plaatste het op de open-weights-Paretofrontier voor intelligentie afgezet tegen totale parameters, en beoordeelde de snelheid ervan hoog, met de kanttekening dat het ongewoon breedsprakig is en tijdens de evaluatie ongeveer 260M tokens genereerde, tegen een mediaan van bijna 100M.

Als je voor de komende zes maanden plant, is Ling-3.1-flash de richting waarin het zich beweegt en nog geen component. De specifieke dingen om in de gaten te houden voordat het er een wordt: of de gewichten daadwerkelijk open gaan en onder welke licentie, of het geserveerde venster echt 1M is of een uitbreiding van een kortere native context, wat het per miljoen tokens kost, en of een onafhankelijk lab de 75,16 op FrontierSWE reproduceert. Als een van die punten werkelijkheid wordt, is dat een reden om de vergelijking opnieuw uit te voeren. Geen ervan is werkelijkheid geworden.

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Bar-chart panels cover GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge, with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash as the comparison set. A footnote states HealthBench Professional was evaluated in the AQ environment.

Waar dit past in een routingstack

Geen van beide Ling-modellen staat vandaag in onze catalogus — Ling-3.0-flash, Ling-3.0-flash-VL en Ling-3.1-flash geven allemaal 'not-found' terug tegen de OrcaRouter-model-API, dus het eerlijke antwoord op "kan ik het via jullie aanroepen" is voorlopig nee. Waar een routeringslaag in een week als deze echt goed voor is, is de andere helft van het probleem: de modellen waarmee je een kandidaat zou benchmarken. Claude Opus 5, GPT-5.6 Sol en DeepSeek-V4.1-Flash zijn allemaal live routes tegen de lijstprijs van de provider met nul markup, en een router die ze achter één sleutel houdt met automatische failover is hoe je een evaluatieharnas op een bewegend doel gericht houdt zonder vier integraties te onderhouden. Wanneer de gewichten van Ling-3.1-flash beschikbaar komen en de licentie leesbaar is, is dat ook de vorm van de beslissing: één endpoint toevoegen, niet de stack herbouwen.

De generatiesamenvatting is kort. Ling-3.0-flash is een geleverd, onafhankelijk gescoord, onder een permissieve licentie vrijgegeven model dat vandaag zelf te hosten is. Ling-3.1-flash is een grotere belofte, met een langere context en duurder om te draaien, die Ant nog niet heeft geleverd in enige voor een ontwikkelaar bruikbare vorm. De tweede als een upgrade ten opzichte van de eerste behandelen is de fout waartoe deze release uitnodigt, en de cijfers ondersteunen dit nog niet.

Generated two-lane information card. Top lane headed "Independently measured" holds "Ling-3.0-flash — AA Intelligence Index 20 (v4.3)" and "Ling-3.0-flash — 325 tokens/sec, 260M tokens generated". Bottom lane headed "Vendor-reported only" holds "Ling-3.1-flash — 1,673 Elo GDPval-AA v2.1", "Ling-3.1-flash — 75.16 FrontierSWE" and "Ling-3.1-flash — 65.35 HealthBench Professional (AQ environment, undefined)".