Ling-3.0-flash: Wat we werkelijk weten over Ant Group's nieuwe Fast-Tier MoE (en wat niet)
Guides & Insights

Ling-3.0-flash: Wat we werkelijk weten over Ant Group's nieuwe Fast-Tier MoE (en wat niet)

Auteur

Jim Song

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Ant Group's InclusionAI-lab heeft Ling-3.0-flash uitgebracht op of rond 23 juli 2026 — wat betekent dat het slechts dagen oud is op het moment van deze briefing. Het is een mixture-of-experts (MoE) taalmodel met 124B totale parameters en ongeveer 5,1B actieve parameters per token (ongeveer een 24:1 sparsity ratio), ontworpen voor tekstgeneratie en tool-calling. Het wordt gepositioneerd als de snelle, goedkope laag van de Ling-familie; de vlaggenschippositie blijft bij de veel grotere Ling-2.6-1T (1T totaal / 63B actief). Toegang is vandaag alleen via API — via Ant's eigen ontwikkelaarsportaal, via OpenRouter als inclusionai/ling-3.0-flash, en via ZenMux.

Dat is het volledige bevestigde beeld, en het is de moeite waard om openhartig te zijn over waarom deze brief voorzichtiger overkomt dan een typische modelbeschrijving. Er zijn geen Hugging Face-gewichten, geen GitHub-repository voor Ling-V3 en geen duidelijke licentiestatus — een echt verschil met Ling 2.0 en Ling 2.6, die beide als open gewichten onder MIT werden uitgebracht. Er is ook geen onafhankelijke benchmarkdata van welke aard dan ook: Artificial Analysis, de meest geciteerde externe evaluator voor dit type model, heeft er nog geen pagina voor. Elk prestatie- en snelheidscijfer dat momenteel in omloop is, herleidt tot Ant Group zelf.

TL;DR.Ling-3.0-flash is een 124B/5.1B-actief MoE-model van Ant Group's InclusionAI, dat in de afgelopen dagen is uitgebracht, alleen via API zonder Hugging Face-gewichten en met een niet-bevestigde licentie. Verkopersclaims — 1000 tokens/seconde piekdoorvoer, sub-100ms tijd-tot-eerste-token — hebben nog geen onafhankelijke verificatie, en er is geen Artificial Analysis-score voor dit specifieke model. De vorige generatie Ling-2.6-flash behaalde een Artificial Analysis Intelligence Index van slechts 14 (Ling-2.6-1T scoorde 26), wat nuttige context is maar geen vervanging voor de werkelijke capaciteit van 3.0-flash. Prijzen (¥0.40 in / ¥1.20 uit per 1M tokens, momenteel gratis tijdens de lanceerweek met 500k gratis tokens/dag) zijn expliciet promotioneel en zullen waarschijnlijk veranderen. Beschouw dit alles als een voorbeeld, niet als een oordeel.

Belangrijkste conclusies

Het is de snelle/goedkope laag, niet het vlaggenschip. Ling-2.6-1T blijft InclusionAI's grootste model; Ling-3.0-flash is een kleinere, goedkopere, snellere broer/zus die gericht is op gebruik in grote volumes.

Er bestaat nog geen onafhankelijke benchmark.Artificial Analysis heeft geen pagina voor Ling-3.0-flash. De enige openbare cijfers zijn die van Ant Group, en de documentatie van Ant toont momenteel helemaal geen benchmarktabel voor dit model.

Snelheidsclaims zijn alleen van de leverancier. Piek van 1000 tokens/sec en sub-100 ms tijd tot eerste token komen van Ant Group, zonder een door een derde partij uitgevoerde doorvoertest om een van beide cijfers te bevestigen.

Geen open gewichten, licentie niet bevestigd. Er is geen Hugging Face-repo en geen GitHub Ling-V3-project. Eerdere Ling-generaties waren MIT-gelicentieerd; of 3.0-flash dat zal volgen is onbekend.

Prijsstelling is een promotie voor de lanceerweek. ¥0.40/¥1.20 per 1M tokens op Ant's platform wordt momenteel kwijtgescholden, met 500k gratis tokens per dag en een gratis OpenRouter-vermelding — waarvan niet mag worden aangenomen dat ze blijven gelden zodra de promotie eindigt.

Het is een onderdeel van een familie van drie modellen. InclusionAI splitst zijn line-up op in Ling (algemeen doel MoE, dit model), Ring (redeneringsgericht) en Ming (multimodaal).

Een opmerking over hoe u deze samenvatting moet lezen: elke specificatie, benchmark en prijs hieronder is voorzien van een bron. Waar Ant Group de enige bron is, vermelden we dat duidelijk en passen we onze uitspraken aan. Waar eerdere generaties Ling-modellen onafhankelijke scores hebben, citeren we die ter context — niet als vervanging voor gegevens over Ling-3.0-flash zelf, die nog niet bestaan. Dit zal waarschijnlijk een vervolg nodig hebben zodra onafhankelijke tests de achterstand hebben ingehaald.

Wat we eigenlijk weten

Architectonisch gezien is Ling-3.0-flash een schaars MoE-model: in totaal 124B parameters, waarvan er bij een gegeven token ongeveer 5,1B actief zijn, wat het goedkoop en snel maakt om te draaien in verhouding tot de totale omvang. De contextvenster is 256K tokens volgens Ant's eigen documentatie, met een leveranciersclaim dat het uitbreidbaar is tot 1M; OpenRouter's vermelding toont 262.144 tokens, wat overeenkomt met het getal van 256K. De maximale uitvoerlengte is nergens te vinden die we hebben kunnen vinden. Het model ondersteunt standaard tekstgeneratie en tool-calling, maar er wordt geen multimodale invoer of uitvoer vermeld — die mogelijkheid zit bij de aparte Ming-lijn.

Wat betreft beschikbaarheid is het plaatje alleen via API en consistent over de drie routes die we vonden: Ant Group's eigen ontwikkelaarsplatform, OpenRouter (vermeld als inclusionai/ling-3.0-flash), en ZenMux. Geen van deze stelt downloadbare gewichten beschikbaar. Er is geen GitHub-organisatiepagina voor een "Ling-V3"-project, en de documentatie van Ant vermeldt geen licentie voor dit specifieke model — een betekenisvolle leemte, aangezien Ling 2.0 en Ling 2.6 beide zijn uitgebracht als open gewichten onder MIT. Totdat InclusionAI dit verduidelijkt, ga er niet van uit dat Ling-3.0-flash open zal zijn, en ga er ook niet van uit dat het dat niet zal zijn.

De hiaten: wat ongeverifieerd is

De grootste lacune zijn benchmarks. Op het moment van schrijven heeft Artificial Analysis — de onafhankelijke evaluator die het meest wordt aangehaald voor precies deze klasse modellen — geen pagina voor Ling-3.0-flash; het URL-patroon dat normaal gesproken de host zou zijn, retourneert een 404. Dat betekent dat er momenteel geen third-party redeneer-, codeer- of wiskundescore is voor dit model, van Artificial Analysis of enige andere onafhankelijke evaluator die we konden vinden. Ant's eigen documentatie verergert dit: het publiceert helemaal geen benchmarktabel voor 3.0-flash, noch van de leverancier noch anderszins, wat ongebruikelijk is voor een modelrelease en op zichzelf het vermelden waard.

Voor ruwe context hebben eerdere generaties Ling-modellen wel onafhankelijke scores. Ling-2.6-flash behaalde een Artificial Analysis Intelligence Index van 14, en de grotere Ling-2.6-1T scoorde 26 — beide ruim achter de toonaangevende open-weight modellen die Artificial Analysis destijds volgde. Ants eigen verkoperscijfers voor Ling-2.6-flash claimden 61,2% op SWE-bench Verified en 73,85% op AIME2026. Geen van deze getallen mag direct worden doorgetrokken naar Ling-3.0-flash; een nieuwe generatie met een nieuwe architectuur kan beide kanten op bewegen, en totdat een onafhankelijke evaluator het daadwerkelijk test, is elke capaciteitsclaim voor 3.0-flash een gok vermomd als feit.

Snelheidsclaims van leveranciers: snel op papier, ongeverifieerd in de praktijk.

De hoofdprestatieclaim van Ant Group voor Ling-3.0-flash is niet de redeneerkwaliteit, maar de ruwe snelheid. De leverancier claimt een piekdoorvoer van 1000 tokens per seconde en een time-to-first-token onder 100 milliseconden, beide zouden oprecht snel zijn indien bevestigd. Maar "indien bevestigd" doet echt werk in die zin: deze cijfers komen uitsluitend van Ant Group's eigen materiaal, gemeten onder omstandigheden die Ant controleert en niet volledig heeft bekendgemaakt (hardware, batchgrootte, promptlengte en belasting veranderen de doorvoercijfers aanzienlijk). Geen onafhankelijk laboratorium heeft een hermeting gepubliceerd. Totdat iemand buiten Ant een vergelijkbare test uitvoert, beschouw 1000 tok/s en sub-100ms TTFT als marketingcijfers die het waard zijn om tegen uw eigen workload te controleren, geen vaststaande feiten.

Prijzen, en waarom het een bewegend doelwit is

Op het eigen platform van Ant Group bedraagt de lijstprijs voor Ling-3.0-flash ¥0,40 per 1M invoertokens en ¥1,20 per 1M uitvoertokens — goedkoop door ontwerp, in lijn met zijn positionering als de snelle/goedkope laag. Maar die lijstprijs is momenteel niet wat iemand betaalt: Ant voert een gratis lanceringweekpromotie uit en biedt daarnaast dagelijks 500k gratis tokens op zijn platform. OpenRouter's aanbieding toont een ling-3.0-flash:free variant op $0/$0. Dit alles mag niet worden aangezien voor een stabiele prijs. Lanceringpromoties verlopen, gratis lagen krijgen een maximum, en de ¥0,40/¥1,20 cijfers zelf kunnen verschuiven zodra er echte gebruiksgegevens binnenkomen. Als u productie-uitgaven rond dit model plant, begroot dan tegen de lijstprijs, niet de promotionele, en controleer opnieuw voordat u zich vastlegt.

De familie Ling / Ring / Ming

Ling-3.0-flash bestaat niet op zichzelf — InclusionAI organiseert zijn releases in drie benoemde families, elk gericht op een andere taak. Ling is de algemene MoE-lijn, bedoeld voor alledaagse tekstgeneratie en tool-calling; Ling-3.0-flash bevindt zich aan de snelle/goedkope kant hiervan, met Ling-2.6-1T nog steeds de grotere vlaggenschip. Ring is InclusionAI's redeneergerichte lijn, gebouwd voor taken die leunen op meerstaps chain-of-thought in plaats van pure doorvoer. Ming is de multimodale lijn, die afbeeldingen en andere niet-tekstuele modaliteiten verwerkt waar Ling zelf niet aan komt. Als je taak zwaardere redenering of multimodale invoer vereist, is het juiste InclusionAI-model waarschijnlijk niet Ling-3.0-flash — het is gebouwd voor volume en snelheid binnen de tekst-en-tools baan, niet om zich uit te strekken naar het terrein van de andere twee families.

Voor wie is het bedoeld: drie scenario's

1. Tekst- of tool-aanroepende pijplijnen met hoog volume en lage latentie — als pilot, geen verplichting.

Als je workload wordt gedomineerd door doorvoergevoelige tekstgeneratie of tool-gebruik — chat, lichtgewicht agenten, hoogfrequente API-aanroepen — dan maakt Ling-3.0-flash's positionering (klein aantal actieve parameters, beweerde sub-100ms TTFT, bijna gratis lanceringsprijzen) het de moeite waard voor een pilot. Het voorbehoud is dat "de moeite waard voor een pilot" iets anders is dan "de moeite waard om productieverkeer naar over te schakelen." Zonder onafhankelijke benchmarkdata ben jij nu zelf de benchmark: draai je eigen evaluatieset erdoorheen voordat je het vertrouwt met iets dat klantgericht is, en bouw geen kostenmodellen rond de huidige promotionele prijzen.

2. Teams die lange context nodig hebben met een beperkt budget

Een contextvenster van 256K (met een leveranciersclaim van uitbreidbaarheid tot 1M) tegen een werkelijk lage catalogusprijs is een aantrekkelijke combinatie voor retrieval-intensieve of documentverwerkende gebruiksscenario's, op voorwaarde dat de werkelijke redeneerkwaliteit van het model standhoudt over die contextlengte — wat, nogmaals, geen onafhankelijke bron heeft getest. Dit is een redelijke kandidaat om op de shortlist te zetten naast gevestigde goedkope lange-contextopties, maar het moet naast hen worden geëvalueerd in plaats van te worden aangenomen op basis van Ant's specificatieblad alleen.

3. Waarnemers die het China's MoE-landschap en de InclusionAI-roadmap volgen.

Voor teams die het concurrentielandschap van Chinese open en semi-open modellabs in de gaten houden, in plaats van een enkel model in productie te nemen, is Ling-3.0-flash een nuttig datapunt: het geeft aan dat InclusionAI snel iteraties doorvoert op zijn snelle laag, mogelijk terugstapt van open gewichten (althans voor nu), en blijft inzetten op een structuur van drie families (Ling/Ring/Ming) in plaats van één algemeen model. Het is de moeite waard om te bookmarken en opnieuw te bekijken zodra er duidelijkheid is over benchmarks en licenties.

Wanneer het niet te gebruiken

Sla Ling-3.0-flash over voor alles waarvoor je een geverifieerde capaciteitsclaim moet aanhalen — er is geen onafhankelijke benchmark om naar te verwijzen, dus elke uitspraak over zijn redeneer-, codeer- of wiskundige vaardigheden is momenteel onweerlegbaar. Sla het over als je open gewichten nodig hebt voor self-hosting, fine-tuning of compliance-redenen; er zijn geen beschikbaar, en de licentie voor dit specifieke model is nog niet eens vermeld, laat staan bevestigd als permissief. Sla het over voor multimodale taken — dat is de taak van de Ming-lijn, niet van Ling. Wees voorzichtig met het opbouwen van een kostenmodel rond de huidige prijzen: de gratis startweek, de 500k gratis dagelijkse tokens en de gratis OpenRouter-laag zijn allemaal promotioneel, en de ¥0,40/¥1,20 catalogusprijs waarnaar het waarschijnlijk terugkeert, is zelf niet getest tegen realistische gebruikspatronen.

Veelgestelde vragen

Is Ling-3.0-flash open gewicht?

Momenteel niet. Er is geen Hugging Face-repository en geen GitHub Ling-V3-project op het moment van schrijven. Eerdere Ling-generaties (2.0 en 2.6) werden onder MIT uitgebracht als open gewichten, maar niets bevestigt dat Ling-3.0-flash dat patroon zal volgen — of dat het dat niet zal doen.

Hoe presteert Ling-3.0-flash op benchmarks?

Er is nog geen onafhankelijke benchmark voor — Artificial Analysis heeft geen pagina voor dit model. Ant Group's eigen documentatie publiceert er ook geen benchmarktabel voor. Voor ruwe historische context scoorde de vorige generatie Ling-2.6-flash een Artificial Analysis Intelligence Index van 14, en Ling-2.6-1T scoorde 26, maar geen van beide getallen mag worden verondersteld over te dragen naar deze nieuwe generatie.

Hoe snel is het echt?

Ant Group claimt een piekdoorvoer van 1000 tokens/sec en een time-to-first-token van minder dan 100 ms. Beide zijn leveranciersspecifieke cijfers waarvoor tot nu toe geen onafhankelijke hermeting is gepubliceerd. Beschouw ze als claims die u op uw eigen workload moet verifiëren, niet als bevestigde prestaties.

Wat kost Ling-3.0-flash?

De vermelde prijzen op het platform van Ant zijn ¥0,40 per 1M invoertokens en ¥1,20 per 1M uitvoertokens, maar het is momenteel gratis tijdens een promotie voor de lanceerweek, met ook 500k gratis tokens per dag beschikbaar. OpenRouter vermeldt ook een gratis variant. Verwacht dat deze promotievoorwaarden veranderen.

Hoe groot is het contextvenster?

256K tokens volgens de documentatie van Ant, met een claim van de leverancier dat het uitbreidbaar is tot 1M. De vermelding van OpenRouter toont 262.144 tokens, consistent met het getal van 256K. De maximale uitvoerlengte wordt niet bekendgemaakt.

Wat is het verschil tussen Ling, Ring en Ming?

Ling is InclusionAI's algemene tekst- en tool-calling MoE-lijn, en Ling-3.0-flash bevindt zich aan het snelle/goedkope uiteinde. Ring is de op redenering gerichte lijn. Ming behandelt multimodale taken. Het zijn aparte modelfamilies gebouwd voor verschillende taken, geen niveaus van hetzelfde model.

Is Ling-3.0-flash hetzelfde als Ling-2.6-1T?

Nee. Ling-2.6-1T is InclusionAI's grotere vlaggenschip (1T totaal / 63B actieve parameters) en blijft een apart, groter model. Ling-3.0-flash (124B totaal / ~5.1B actief) is de nieuwere, kleinere, snellere release.

Moet ik vandaag Ling-3.0-flash in productie gebruiken?

Alleen na het uitvoeren van je eigen evaluatie. Zonder onafhankelijke benchmark, een onbevestigde licentie en prijzen die momenteel promotioneel zijn, is het redelijk om te testen, maar voorbarig om productiekritieke of compliance-gevoelige workloads eraan toe te vertrouwen zonder je eigen testen en een plan voor wat er gebeurt wanneer de promotionele voorwaarden eindigen.

Kortom

Ling-3.0-flash is een daadwerkelijk nieuwe release die het volgen waard is — een 124B/5.1B-actief MoE-model dat zich richt op snel, goedkoop, hoog-volume tekst- en tool-calling werk, van een lab dat eerder geloofwaardige modellen heeft uitgebracht. Maar op dit moment is het een specificatieblad en een reeks leveranciersclaims, geen geverifieerd product: geen onafhankelijke benchmark, geen open gewichten, geen bevestigde licentie, en prijzen die expliciet promotioneel zijn. Dat is geen reden om het af te wijzen — het is een reden om het voorzichtig te testen, de claims die voor jou van belang zijn rechtstreeks te verifiëren, en deze samenvatting opnieuw te bekijken zodra Artificial Analysis of een andere onafhankelijke evaluator echte cijfers publiceert.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

Neem contact op

Word lid van de community

DiscordEmailXGitHubYouTube