Gegenereerde redactionele hero-kaart met de titel "Ling-3.1-flash is live en twee weken lang gratis" en de ondertitel "Wat de 560B MoE vandaag daadwerkelijk aanbiedt". Vier afgeronde kaarten tonen "Parameters: 560B totaal / ~25B actief", "Context: 262.144 tokens", "Uitvoerlimiet: 32.768 tokens" en "Gewichten: niet gepubliceerd", boven een voetregel met de tekst "Specificaties volgens de leverancier; geen gepubliceerde prijs na de proefperiode."
Guides & Insights

Ling-3.1-flash is live en twee weken gratis: wat de 560B MoE werkelijk levert

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Ling-3.1-flash, het mixture-of-experts-model met ongeveer 560 miljard parameters dat het inclusionAI-lab van Ant Group op 29 en 30 september 2026 aankondigde, is deze week opgehouden een persbericht te zijn: het beantwoordt nu verzoeken via een live commerciële API. Het model draait als een gratis proefperiode van twee weken op een inferentie-gateway van een derde partij, en het verschijnt ook in Ants eigen Ling Studio-product — waardoor de vraag verschuift van "bestaat het?" naar "wat biedt het daadwerkelijk aan?" Het antwoord is beperkter dan de opvallende cijfers doen vermoeden. Ling-3.1-flash is tekst-in, tekst-uit; het bedient een context van 262.144 tokens (256K), ook al noemt de aankondiging 1M als het uiteindelijke doel; de uitvoer is beperkt tot 32.768 tokens; en niemand heeft de prijs gepubliceerd die je op dag vijftien zult betalen, wanneer het gratis venster sluit en de gewichten zouden moeten volgen.

Die kloof tussen de aankondigingskaart en het live endpoint is het nuttige ding om aan vast te houden, want de meeste berichtgeving over deze release leest de specificaties alsof het model ze vandaag al levert. Dat is niet zo. Ling-3.1-flash is het tweede model van dit lab in drie maanden dat verschijnt als wat de onafhankelijke tracker LLM Releases botweg onder "weights not released" schaart, en het verschil tussen wat Ant zegt dat het model is en wat een ontwikkelaar op dit moment kan aanroepen, is waar een budget of een pilot stilletjes mis kan gaan.

Wat is er veranderd tussen de aankondiging en vandaag?

De aankondiging zelf was een specificatiebericht: ~560 miljard parameters in totaal, ~25 miljard actief per token, tot 1 miljoen tokens context, drie opvallende evaluatiecijfers en een belofte: "we zijn van plan het model binnenkort open source te maken." Daar is niets van veranderd. Wat wel is veranderd, is de beschikbaarheid. Binnen een dag na de aankondiging was het model bereikbaar via een commerciële edge, en de gratis proefperiode ontsluit hetzelfde echte endpoint als een betaalde versie: hetzelfde API-oppervlak, dezelfde modaliteit met alleen tekst, dezelfde schakelaar voor de denkmodus voor langetermijn-agentwerk.

Voor iedereen die besluit of hij er engineeringtijd aan wil besteden: de proefperiode is deze week het hele verhaal, en het snijdt aan twee kanten. Twee weken gratis inferentie is een oprecht goedkope manier om te zien hoe het model zich gedraagt op je eigen prompts — een zeldzaamheid voor een model van deze omvang. Maar gratis is een promotiestatus, geen prijs. Er is nog nergens een gepubliceerde tariefkaart na de proefperiode voor Ling-3.1-flash, dus elk kostenmodel dat je op de gratis laag bouwt, is een placeholder totdat Ant en zijn hosts er cijfers op plakken.

Het specificatieblad, en de drie cijfers die nog beloftes zijn

• Parameters — 560 miljard totaal, ~25 miljard actief per token. Door de leverancier opgegeven, en ongeveer vier keer de 124 miljard totaal / 5,1 miljard actief van de vorige generatie. De sparsityratio blijft rond 1 op 22, dus de activatie is niet dramatisch veel zuiniger — het model is gewoon veel groter dan zijn voorganger.

• Context — vandaag geserveerd op 262.144 tokens. "Tot 1M" is het doel zodra het venster is geactiveerd; het is niet wat het trial-endpoint je oplevert, en het is de meest voorkomende verkeerde interpretatie van deze release.

• Uitvoer — maximaal 32.768 tokens. Redelijk voor agentlussen, krap als je van plan bent lange documenten in één keer te genereren.

• Modaliteit — tekst in, tekst uit. Dit is een tekstmodel. Beeld, audio en bestandsinvoer maken geen deel uit van de lancering, en er is geen datum voor gegeven.

• Redeneren — een hybride stack met een expliciete schakelaar voor de denkmodus, hetzelfde patroon dat de vorige generatie gebruikte, gericht op meerstaps agent- en tool-calling-werk in plaats van single-turnchat.

• Gewichten en licentie — niet gepubliceerd. Dit is het cijfer dat het meest van belang is en het enige dat tot nu toe helemaal geen waarde heeft: er is op dit moment geen Hugging Face-repository, geen licentietekst en geen downloadbaar checkpoint.

Ant Group's own Ling-3.1-flash benchmark chart, published 30 September 2026. Twelve bar-chart panels cover GDPval-AA v2.1 (1,673 for Ling-3.1-flash), tau-squared Banking (47.60), SkillsBench (69.70), Automationbench public (52.50), Terminal-Bench 4.0 (40.40), CyberGym (87.90), FrontierSWE (75.16), SWE Atlas Codebase QnA (55.92), Finance Agent v2 (57.87), HealthBench Professional (65.35), DRACO (85.49) and MultiChallenge (69.78), with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 flash and DeepSeek-V4.1-Flash as the comparison set. A footnote states HealthBench Professional was evaluated in the AQ environment and that Ling-3.1-flash's healthcare capabilities can currently be experienced only in AQ.

De benchmarkkaart, gelezen met de korting die nodig is

In de eigen rapportage van Ant komt Ling-3.1-flash uit op een samengestelde score van 81,0 over vijf agentbenchmarks, met 40,4% op Terminal-Bench 4.0, 55,9% op SWE-Atlas en 65,35% op HealthBench Professional; de eigen opgave van het bedrijf voegt daar 1.673 Elo op GDPVal-AA v2.1 en 75,16 op FrontierSWE aan toe. Elk van die cijfers is first-party. Er is geen harness, geen promptset en geen gewichten voor anderen om de suite opnieuw te draaien, wat de standaardkanttekening is bij een model in dit stadium — en hier is het de moeite waard om het ronduit te zeggen: een niet-gereproduceerde leveranciersscore is een bewering over een model, niet een meting ervan.

De kaart is ook op een manier informatief die de auteurs misschien niet hebben bedoeld. Het resultaat van 40,4% op Terminal-Bench 4.0 blijft ruim achter de frontierlaag; Claude Sonnet 5.5, een model van middelzwaar kaliber in plaats van een vlaggenschip, scoort 70,6% op dezelfde versie van die benchmark. De eerlijke lezing is niet dat Ling-3.1-flash zwak is — 40,4% is een respectabele agentic-terminal-score voor een model dat op kosten is gepositioneerd — maar dat de framing "dicht bij de frontier op belangrijke benchmarks" die op de aankondigingsdag op sociale media circuleerde, geen stand houdt bij contact met de specifieke regels. De benchmark waarop het model het sterkst lijkt, HealthBench Professional met 65,35, is ook degene met de ongemakkelijke voetnoot: Ant stelt dat het werd geëvalueerd in een omgeving die het AQ noemt en dat de gezondheidszorgcapaciteit van het model "momenteel alleen in AQ kan worden ervaren", zonder ergens publiekelijk te definiëren wat AQ is. Een score die de krantenkoppen haalt, met een naamloze omgeving eraan vast, is een demo, geen reproduceerbaar resultaat.

Waarom een groot model dat als proefversie verschijnt het echte nieuws is

De interessantere zet hier is de volgorde, niet de parameters. Ling-3.0-flash bracht meteen open gewichten uit. Deze wordt eerst als proefversie uitgebracht, waarbij gewichten, licentie en officiële prijsstelling allemaal worden achtergehouden, met een publieke toezegging om pas open source te worden nadat de gratis periode eindigt. Dat is een draaiboek voor een commerciële release in de vermomming van een open-modelaankondiging, en het is een echte verandering die het waard is om te volgen: als de gewichten onder een permissieve licentie verschijnen, krijgt de community een 560B-basismodel om te fine-tunen en te distilleren; als ze met commerciële voorwaarden komen, was de tweewekelijkse proefperiode het product en was de 'open source'-belofte marketing. Hoe dan ook valt de keuze binnen het proefvenster, en dat is wat je in de gaten moet houden, niet een of andere losse benchmarkrij.

Waar het draait, en het eerlijke routingbeeld

Voorlopig is Ling-3.1-flash bereikbaar via het eigen productoppervlak van de leverancier en via externe inferentieplatforms die de proefversie draaien — en meer is het niet. Het staat vandaag niet in de catalogus van OrcaRouter; een opzoeking via onze publieke model-API naar Ling-3.1-flash, Ling-3.0-flash en de Ling-3.0 vision-variant levert telkens 'not-found' op, en we zullen niet doen alsof het anders is. Wanneer een Ant-endpoint eenmaal algemeen beschikbaar is met een gepubliceerde lijstprijs, is het pass-throughmodel waarop OrcaRouter draait — de lijstprijs van de provider wordt zonder enige opslag doorgegeven, zodat een prijsverlaging van een leverancier dezelfde dag bij ons live staat — precies de constructie die past bij een model waarvan de prijsstelling nog niet is vastgelegd.

Wat je vandaag kunt doen, zonder te wachten op de licentiebeslissing, is de vergelijking uitvoeren die er echt toe doet voor een onbewezen model: meet het af tegen de Flash-tier-modellen die je nu kunt aanroepen. Gemini 3.8 Flash en DeepSeek-V4.1-Flash staan beide in onze catalogus tegen de listprijzen van hun aanbieders, achter één API-sleutel, met automatische failover tussen beide. Voor een model in een gratis proefperiode waarvan zowel de gewichten als de tariefkaart onbekend zijn, is dat de verstandige manier om het aan te houden — nog een kandidaat waar je naartoe kunt routeren zolang de proefperiode duurt, en een productiepad dat niet afhankelijk is van wat er op dag vijftien gebeurt.

Headless capture of Ant's Ling Studio interface with Ling-3.1-flash selected in the model picker. The centre panel shows the model-experience card headed "Ling-3.1-flash Model Experience", describing the model as strong at general-purpose agents, search, routine office work and software/code development, above three starter tasks (Hot Spot Scout, Interaction Design Master, Product Assistant). The Model Settings panel on the right shows Max Length 262144, temperature 0.6, top_k 20, top_p 0.95 and Thinking enabled.

Wat deze week te doen

Als het model relevant is voor je werk, is de proefperiode de reden om nu te handelen in plaats van te wachten tot de open-weight-kwestie is opgelost — twee weken gratis inferentie op een 560B MoE is de goedkoopste evaluatie die je zult krijgen, en het antwoord op "houdt het stand bij mijn prompts" is vandaag beschikbaar, ook al is het antwoord op "kan ik het zelf hosten" dat niet. Drie dingen om te controleren terwijl het venster open is, in volgorde:

• Draai je eigen workload, niet de benchmarkkaart. De gepubliceerde cijfers zijn Ant's selectie van taken; jouw prompts zijn degenen die je stack bepalen.

• Test de context die je daadwerkelijk zult gebruiken. Het endpoint ondersteunt 262.144 tokens, niet 1M. Als je ontwerp afhankelijk is van het grotere venster, ontwerp je op basis van een belofte.

• Bouw geen kostenmodel op "gratis." Gratis is een toestand van twee weken. Totdat een tariefkaart is gepubliceerd, plan je de terugschakeling naar een geprijsd Flash-tier-model als standaard en behandel je Ling-3.1-flash als aanvullende capaciteit.

De aankondiging is echt en het model draait, wat een week geleden nog niet gezegd kon worden. Maar vrijgegeven-en-open en op-proef-draaien zijn verschillende toestanden, en deze bevindt zich onmiskenbaar in de tweede — een specificatie van 560B, een 256K-endpoint, een benchmarkkaart die uitsluitend door de leverancier wordt geleverd, en een klok van twee weken die de enige harde deadline in de hele release is.

Generated editorial card titled "Ling-3.1-flash on trial - what to verify this week" listing six rounded rows: "Your workload: run it, not the card"; "Context: 262,144 served, not 1M"; "Cost model: free is a two-week state"; "Weights: none published, promise only"; "Fallback: keep a priced Flash-tier route"; "Deadline: the trial window is the only firm date", above a footer reading "Vendor-stated specs; no published post-trial rate card."

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt