Ling-3.0-flash: Wat we nu weten over Ant Group's open-gewicht snelle-laag MoE
Guides & Insights

Ling-3.0-flash: Wat we nu weten over Ant Group's open-gewicht snelle-laag MoE

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het InclusionAI-lab van Ant Group heeft officieel Ling-3.0-flash uitgebracht — aangekondigd op 24 juli 2026 en op 7 augustus onder de MIT-licentie open-sourced — en het beeld is sinds de preview die we hier in juli publiceerden flink veranderd. Het is een native hybride redenerend mixture-of-experts-model met 124B totale parameters en slechts 5,1B actieve parameters per token, gebouwd als de snelle, goedkope laag van de Ling-familie. De twee getallen die alles veranderden: Artificial Analysis scoort het nu op 38 op de Intelligence Index (24 punten hoger dan de vorige generatie van de snelle laag, Ling-2.6-flash) en plaatst het op de open-weights Pareto-grens voor intelligentie versus totale parameters. De gewichten zijn live op Hugging Face en ModelScope.

Toen we dit model op 24 juli voor het eerst bespraken, was de eerlijke samenvatting: alleen API, geen gewichten, geen licentieverklaring, geen onafhankelijke benchmark. Al deze vier constateringen zijn inmiddels verouderd. Ant heeft de gewichten op 7 augustus onder de MIT-licentie openbaar gemaakt, en Artificial Analysis heeft sindsdien een volledige onafhankelijke evaluatie gepubliceerd. Deze update herziet het oorspronkelijke artikel dienovereenkomstig — de labels “ongeverifieerd” die in de juli-post de boventoon voerden, gelden nu voor een veel beperktere reeks beweringen, voornamelijk Ants pieksnelheidscijfers, in plaats van voor het model als geheel.

Samenvatting. Ling-3.0-flash is de snelle MoE met open gewichten van Ant Group: 124B totaal / 5.1B actief, MIT-licentie, 256K native context (262K zoals aangeboden). Artificial Analysis geeft het een Intelligentie-Index van 38 — 24 punten hoger dan de vorige generatie Ling-2.6-flash en op het Pareto-frontier voor open gewichten wat betreft intelligentie versus totale parameters — met een gemeten output van ongeveer 368 tokens/sec. De gewichten staan op Hugging Face en ModelScope onder MIT. Nog steeds uitsluitend van de leverancier: de claim van meer dan 1.100 tokens/sec piekdoorvoer, de tijd-tot-eerste-token onder 100 ms, en de benchmarktabel van de modelkaart. De prijzen van de eigen API zijn $0,075 invoer / $0,22 uitvoer per 1M tokens (80% korting bij cache-hits); de bij de lancering geldende gratis laag eindigde op 3 augustus.

Belangrijkste conclusies

• Het is het snelle/goedkope niveau, niet het vlaggenschip.Het vlaggenschip van de vorige generatie met 1T-parameters blijft InclusionAI's grootste model; Ling-3.0-flash is het kleinere, snellere zustermodel, gericht op tekstverwerking in grote volumes en tool-calling.

• De gewichten zijn nu open onder MIT. De gewichten verschenen op 7 augustus op Hugging Face (inclusionAI/Ling-3.0-flash) en ModelScope onder de MIT-licentie — een omkering van het "alleen-API"-beeld van juli.

• Het heeft eindelijk een onafhankelijke score. Artificial Analysis meet een Intelligence Index van 38, 24 hoger dan Ling-2.6-flash, en plaatst het model op de open-weights Pareto-frontier voor intelligentie versus totale parameters.

• Snelheid wordt nu gedeeltelijk gemeten.AA levert ongeveer 368 tokens/sec uitvoer en een ~1.98s tijd tot eerste token; de door Ant geclaimde piek van 1.100+ tokens/sec is nog steeds alleen een leveranciersclaim.

• De prijzen staan vast en de gratis lancering is voorbij. De first-party API vermeldt $0,075 in / $0,22 uit per 1M tokens met een 80% cache-hit korting; de gratis lanceringstier eindigde op 3 augustus.

• Het is één onderdeel van een familie van drie modellen. InclusionAI verdeelt zijn aanbod in Ling (algemeen toepasbare tekst- en tool-MoE, dit model), Ring (redeneren) en Ming (multimodaal).

Een opmerking over hoe u deze update moet lezen: dit is een herziening van de preview van 24 juli, geschreven nadat de gewichten openbaar waren geworden en de eerste onafhankelijke scores verschenen. Elke specificatie, benchmark en prijs hieronder is voorzien van een bronlabel. Waar Ant Group de enige bron is — de claims over pieksnelheid en de benchmarktabel van de modelkaart — zeggen we dat ronduit. Waar Artificial Analysis iets onafhankelijk heeft gemeten, citeren we dat.

Wat we eigenlijk weten

De architectuur is nu volledig gedocumenteerd op de modelkaart. Ling-3.0-flash gebruikt een native hybride lineaire aandachtsstack — Kimi Delta Attention (KDA) en Gated MLA-lagen die elkaar afwisselen in een verhouding van 5:1 (35 KDA + 7 MLA), met fijnmazige diagonale gating bij KDA — bovenop een 1/64 sparse MoE (512 gerouteerde experts, 8 geactiveerd per token). Zo bereikt het 124B totale parameters met slechts 5,1B actief. Het contextvenster is native 256K, geserveerd op 262.144 tokens in de inferentierecepten, en Ant claimt dat de architectuur schaalt naar 1M. De maximale outputlengte wordt niet bekendgemaakt. Het model is text-only met tool-calling-ondersteuning; multimodale invoer bevindt zich in de aparte Ming-lijn.

Twee gewichtsformaten worden door het lab gepubliceerd — BF16 (ongeveer 255GB) en FP8 (ongeveer 128GB) — en door de community gekwantiseerde varianten zijn al gelinkt vanaf de modelkaart. De eigen implementatierecepten van het lab richten zich op SGLang en vLLM.

Beschikbaarheid: open gewichten onder MIT

Op 7 augustus heeft het InclusionAI-team van Ant Group de gewichten als open source uitgebracht onder de MIT-licentie op Hugging Face (inclusionAI/Ling-3.0-flash) en ModelScope. Dat is een permissieve, commercieel bruikbare licentie — dezelfde waaronder Ling 2.0 en Ling 2.6 zijn uitgebracht — en het betekent dat je Ling-3.0-flash zelf kunt hosten, fine-tunen en implementeren in plaats van het via een API te huren. Het model is ook aan te roepen via Ant's eigen ontwikkelaars-API en verschillende platforms van derden. Voor een snel model in deze prijsklasse is de interessantere vraag of je het zelf host (FP8 draait op ongeveer 128GB) of bij een API blijft.

Onafhankelijke scores: een AA Intelligence Index van 38

De grootste verandering ten opzichte van de juli-post is dat er nu onafhankelijke cijfers bestaan. Artificial Analysis heeft een pagina voor Ling-3.0-flash en meet het op 38 op de Intelligence Index — 24 punten boven de vorige fast-tier-generatie, Ling-2.6-flash (14), en gelijk met MiMo-V2.5 en Qwen 3.6 27B terwijl het slechts een fractie van hun parameters activeert. Artificial Analysis plaatst het model ook op de open-weights Pareto-frontier voor intelligentie versus totale parameters: geen enkel open-weights model met minder totale parameters scoort hoger. De flash-tier open-weights-leider op AA, DeepSeek V4 Flash, scoort nog steeds hoger (Index 52 bij maximale redeneerinspanning).

De agentische en long-context resultaten zijn ook qua richting sterk. Op AA's τ3-Bench Banking-suite scoort Ling-3.0-flash 27%, tweede onder flash-tier open-weights modellen, achter DeepSeek V4 Flash (39%). Op GDPval-AA v2 bereikt het een Elo van 1108, tegen 545 voor Ling-2.6-flash. Ant trainde het model in meer dan 10.000 interactieve omgevingen (door leverancier gerapporteerd) en positioneert het als een uitvoeringsknooppunt voor agent-workflows — snel, goedkoop en wegwerpbaar, terwijl het zware redeneerwerk aan een groter vlaggenschip wordt overgelaten.

Eén kanttekening bij de bronvermelding: de benchmarktabel op Ant’s modelkaart — SWE-Bench Pro 56.6, SWE-bench Multilingual 72.4, MathArena AIME 2026 93.2, HLE 22.7 — is door de leverancier gerapporteerd en is nog niet onafhankelijk gereproduceerd. Beschouw het als de eigen beweringen van het lab, in dezelfde categorie als de pieksnelheidscijfers hieronder.

Snelheid: gemeten, daarna geclaimd

Het snelheidsverhaal is nu twee verschillende verhalen. Onafhankelijk meet Artificial Analysis een uitvoer van ongeveer 368 tokens/sec en een ~1,98s time-to-first-token op de first-party API — echt snel voor een 5.1B-actieve MoE, en genoeg om het model in de buurt van de top van zijn klasse te plaatsen wat betreft snelheid. Afzonderlijk claimt Ant Group een gemiddelde uitvoersnelheid van meer dan 1.100 tokens/sec op gespecificeerde GPU-configuraties en een time-to-first-token van onder de 100 ms met een clusterbrede hiërarchische cachinglaag gebouwd op SGLang HiCache en Mooncake. Die tweede reeks cijfers is alleen afkomstig van de leverancier — gemeten op hardware- en batchconfiguraties die Ant controleert, zonder dat er een onafhankelijke herhaling is gepubliceerd. Gebruik voor de planning het AA-cijfer; behandel 1.100+ tok/s als een marketingplafond om op je eigen workload te verifiëren.

Prijzen: goedkoop, en de actie is voorbij.

Artificial Analysis vermeldt de first-party API op $0,075 per 1M invoertokens en $0,22 per 1M uitvoer, met cache-hits op $0,015 (−80%) — allemaal door de leverancier bepaalde prijzen. De gratis lanceerlaag (500k gratis tokens per dag, gratis API-toegang) eindigde op 3 augustus, en Ant hield een tijdelijke 75%-kortingsperiode op zijn Ling Studio tot en met 31 augustus 2026, waarna de lijstprijzen van toepassing zijn. Zelfs tegen de volledige lijstprijs plaatst $0,075/$0,22 Ling-3.0-flash stevig in het goedkope segment voor een model met een Index van 38.

Bij deze lage prijzen wegen de overstapkosten zwaarder dan de prijs per token. OrcaRouter bestaat om die overstap goedkoop te maken: één API voor 200+ modellen, de prijslijstprijzen van providers worden doorberekend met 0% opslag, en automatische failover tussen providers — dus wanneer een nieuw beschikbaar model zoals dit er op papier goed uitziet, kun je het testen tegen je echte workload zonder een tweede contract, en terugvallen op een ander model achter dezelfde sleutel als het ondermaats presteert op een specifieke taak.

De familie Ling / Ring / Ming

Ling-3.0-flash bestaat niet op zichzelf — InclusionAI organiseert zijn releases in drie benoemde families, elk gericht op een andere taak. Ling is de algemene MoE-lijn voor dagelijkse tekstgeneratie en tool-calling, en Ling-3.0-flash zit aan het snelle/goedkope uiteinde, een stap onder het vlaggenschip met 1T parameters van de vorige generatie. Ring is de op redeneren gerichte lijn, gebouwd voor meerstaps chain-of-thought. Ming is de multimodale lijn. Als je taak zwaardere redeneringen of beeldinvoer nodig heeft, is het juiste InclusionAI-model waarschijnlijk niet Ling-3.0-flash — het is gebouwd voor volume en snelheid binnen het tekst-en-tools-domein.

Voor wie het is: drie scenario's

Latentiegevoelige tekst- of tool-aanroeppipelines met een hoog volume.

Dit is het thuisveld van het model. Met een onafhankelijke Index van 38, een MIT-licentie en een gemeten snelheid van ongeveer 368 tok/s is de snelle-tier-inzet nu testbaar in plaats van hypothetisch — je kunt er je eigen evaluatieset doorheen draaien, of de weights downloaden en zelf hosten. Bouw je oplossing alleen niet rond de door de leverancier opgegeven limiet van 1.100+ tok/s totdat je die op je eigen workload hebt gemeten.

{{1}}2. Teams die lange context willen binnen een beperkt budget{{/1}}

Een native context van 256K (262K geleverd) met een aangegeven pad naar 1M, voor $0.075/$0.22, is een aantrekkelijke combinatie voor retrieval-intensief of documentverwerkingswerk. De long-context cijfers op de modelkaart zijn door de leverancier gerapporteerd, dus zet het op de shortlist tegenover gevestigde long-context opties en verifieer het op je eigen corpus voordat je je vastlegt.

3. Waarnemers die China's MoE-landschap en de InclusionAI-roadmap volgen

De vraag van juli — zou InclusionAI open blijven? — heeft nu een antwoord: ja, MIT, en snel. Ling-3.0-flash die met 5,1B actieve parameters op de AA-Pareto-grens landt, is een datapunt voor iedereen die bijhoudt hoe Chinese labs concurreren op efficiëntie in plaats van op het ruwe aantal parameters.

Wat is er nog niet geverifieerd?

Een korte lijst, nu de grote hiaten zijn gesloten. De pieksnelheidsclaims van de leverancier (1,100+ tok/s, sub-100ms TTFT) zijn niet onafhankelijk opnieuw gemeten. De benchmarktabel in de modelcard is door de leverancier gerapporteerd. De FP4/INT4-varianten en het single-DGX-Spark-implementatiepad zijn door de leverancier vermeld. En wat kennis betreft, toont AA's Omniscience Index aan dat de verbetering ten opzichte van de vorige generatie grotendeels voortkwam uit onthouding — hallucinaties daalden (97% → 44%) terwijl de nauwkeurigheid slechts licht steeg (16% → 18%) — dus verwar de opvallende sprong in de index niet met een algehele kennissprong.

Wanneer het niet te gebruiken

Sla {{1}}Ling-3.0-flash{{/1}} over voor multimodaal werk — dat is de lijn van {{2}}Ming{{/2}}. Sla het over als je een zwaar reasoning-vlaggenschip nodig hebt in plaats van een snelle uitvoerder — dat is het terrein van {{3}}Ring{{/3}}. Als je van plan bent om zelf te hosten, reken dan op de echte hardware: {{4}}BF16{{/4}} is ongeveer 255GB, {{5}}FP8{{/5}} ongeveer 128GB. En als een bewering voor jou belangrijk is, verifieer die — de cijfers voor pieksnelheid en lange context zijn van {{6}}Ant{{/6}} totdat een onafhankelijk lab ze opnieuw uitvoert.

Veelgestelde vragen

Is Ling-3.0-flash open gewicht?

Ja. De gewichten zijn op 7 augustus als open source vrijgegeven onder de MIT-licentie, op Hugging Face (inclusionAI/Ling-3.0-flash) en ModelScope. Dat is een permissieve, commercieel bruikbare licentie — dezelfde waaronder ook Ling 2.0 en Ling 2.6 zijn uitgebracht.

Hoe presteert Ling-3.0-flash op benchmarks?

Artificial Analysis meet een intelligentie-index van 38, 24 punten hoger dan Ling-2.6-flash, en plaatst het model op de open-weights-Pareto-frontier voor intelligentie versus totale parameters. De benchmarktabel op Ants modelkaart (bijvoorbeeld SWE-Bench Pro 56.6) is door de leverancier gerapporteerd en is niet onafhankelijk gereproduceerd.

Hoe snel is het echt?

Artificial Analysis meet een uitvoersnelheid van ongeveer 368 tokens/seconde met een time-to-first-token van ~1,98 s op de first-party API. Ant claimt een piekdoorvoer van 1.100+ tokens/seconde en een TTFT onder de 100 ms op gespecificeerde GPU-configuraties — dat zijn leverancierscijfers zonder onafhankelijke hermeting.

Wat kost Ling-3.0-flash?

AA vermeldt de first-party API voor $0.075 per 1M invoertokens en $0.22 per 1M uitvoer, met een korting van 80% bij cache-hits. De gratis launch-tier eindigde op 3 augustus, en een tijdelijke kortingsperiode van 75% op Ling Studio loopt tot en met 31 augustus 2026.

Hoe groot is het contextvenster?

256K native, geleverd met 262.144 tokens; Ant beweert dat de architectuur schaalt naar 1M. De maximale uitvoerlengte wordt niet bekendgemaakt.

Wat is het verschil tussen Ling, Ring en Ming?

Ling is InclusionAI’s MoE-lijn voor algemene tekst- en tool-calling-taken, met Ling-3.0-flash aan het snelle/goedkope uiteinde. Ring is de lijn die zich richt op redeneren. Ming verzorgt multimodale taken. Het zijn afzonderlijke families voor verschillende taken, geen niveaus van één model.

Is Ling-3.0-flash hetzelfde als het vorige 1T-vlaggenschip?

Nee. Ling-3.0-flash is de nieuwere, kleinere fast-tier release (124B totaal / 5.1B actief). Het vlaggenschip van de vorige generatie met 1T-parameters blijft het grotere model.

Moet ik vandaag Ling-3.0-flash in productie gebruiken?

Meer verdedigbaar dan in juli, nu er een onafhankelijke score en een MIT-licentie is. Draai eerst je eigen evaluatieset, verifieer de snelheidsclaims van de leverancier tegen je workload, en besluit tussen de API en self-hosting (FP8 draait in ongeveer 128GB). De overige leverancierspecifieke cijfers zijn smal genoeg om op te plannen.

Kortom

Ling-3.0-flash is in twee weken gepromoveerd van “specificatieblad en leveranciersclaims” naar “open gewicht en onafhankelijk gescoord”. Een AA Intelligence Index van 38 bij 5,1 miljard actieve parameters — op de Pareto-frontier van open gewichten, onder MIT-licentie, voor $0,075/$0,22 — maakt het een van de meest efficiënte open-gewichtmodellen waar je nu naar kunt verwijzen, en een die je daadwerkelijk zelf kunt draaien. De kanttekeningen zijn beperkter dan voorheen: de pieksnelheid- en modelkaartcijfers zijn nog steeds van Ant totdat een onafhankelijk lab ze reproduceert. Voor grote volumes tekst en tool-aanroepen heeft het voor deze prijs een echte evaluatie verdiend.