
Ling-3.0-flash-VL: Ants 5,5B-actieve visionmodel komt binnen op 25 in de Intelligence Index
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Ling-3.0-flash-VL heeft nu een benchmarkcijfer dat niemand bij Ant Group heeft getypt, en dat is het nieuws. Het eerste native multimodale model uit het inclusionAI-lab van Ant krijgt een score van 25 op de Artificial Analysis Intelligence Index — een onafhankelijke run, op de huidige v4.3-schaal, gepubliceerd naast een modelpagina met snelheid, latentie en prijs. Het verschijnt drie weken nadat de eigen modelkaart van de leverancier claimde 42 op dezelfde index, en het nuttigste wat een lezer met die twee cijfers kan doen, is begrijpen waarom ze geen tegenstelling vormen: Ant heeft gemeten volgens het Intelligence Index-protocol v4.1.1, Artificial Analysis heeft gemeten volgens v4.3, en dat zijn verschillende meetlatten die uit verschillende evaluatiesets zijn gebouwd. Het leverancierscijfer heeft het contact met een derde partij niet zozeer overleefd, maar is veeleer opnieuw gemeten op een schaal die nog niet bestond toen het werd opgeschreven.
Het model achter de score is een sparse mixture-of-experts met in totaal 124B parameters en ongeveer 5,5B actief per token, vrijgegeven onder de MIT-licentie met BF16- en FP8-gewichten, dat tekst, afbeeldingen en video accepteert en tekst retourneert. Dat aantal actieve parameters is het hele argument voor dit ding. Bij 5,5B actief bevindt Ling-3.0-flash-VL zich op wat de meest interessante curve in open modellen is geworden — de frontier van intelligentie uitgezet tegen geactiveerde parameters in plaats van totale omvang — en het zit daar omdat het een behoorlijke hoeveelheid werk verzet per eenheid inferentiecompute, niet omdat het enorm is.
Dit stuk behandelt wat er daadwerkelijk is uitgebracht en wanneer, wat de onafhankelijke run zegt, waarom de Pareto-claim beter standhoudt dan de meeste, wat het model kost en waar je het echt kunt aanroepen. De korte versie, voor wie alleen dat wil: Ling-3.0-flash-VL is echt, open-weight, ongewoon goedkoop om te serveren, meetbaar bovengemiddeld voor zijn grootteklasse, en merkbaar uitgebreider en langzamer om uit te brengen dan de ruwe score doet vermoeden. De door de leverancier geclaimde 42 is nooit onafhankelijk gereproduceerd en is niet vergelijkbaar met de 25 die nu op het scorebord staat.
Wat er daadwerkelijk is opgeleverd, en de tijdlijn die maar steeds wordt afgevlakt
Coverage of this release tends to collapse several separate events into one launch date, and the dates matter because they explain why early write-ups described a model that nobody outside Ant could score. The Hugging Face repository inclusionAI/Ling-3.0-flash-VL was created on September 4, 2026 — 64 shards of BF16 weights, an MIT license, a custom-code stack for the bailing_moe_v3_vl architecture, and, for a few days, almost nobody downloading it. The FP8 quantization followed on September 8, roughly 126 GB across 64 shards, with the vision tower kept at higher precision than the expert weights. Artificial Analysis lists the release as September 10, 2026, which is the date its own page anchors to, and the model page carrying the score went live around then.
Dus "uitgebracht in september 2026" is accuraat maar nutteloos. De praktische volgorde was: gewichten op de 4e, een tweede precisieformaat op de 8e, en een onafhankelijke meting op de 10e. De reden dat dit ertoe doet, is dat een model met gewichten op schijf maar zonder gehost endpoint en zonder score van derden voor de meeste teams nog niet iets is dat je kunt evalueren — het is een download waarvoor je capaciteit moet inrichten. Ling-3.0-flash-VL passeerde die grens toen zowel de API als de onafhankelijke score bestond.
Ondersteuning voor serving kwam samen met de gewichten in plaats van erna. Ant publiceerde een SGLang deployment-cookbook en onderhoudt een op Ling afgestemde fork van vLLM voor de architectuur, het onderdeel van een open release dat gewoonlijk weken achterloopt. Hier liep het niet achter.
Het nummer op het bord, en dat op de kaart
Hier is het onafhankelijke beeld van Artificial Analysis, de enige meting door derden van dit model die momenteel bestaat:
• Intelligence Index — 25 op v4.3, gerangschikt als #2 van 64 in zijn grootteklasse, tegen een mediaan in de klasse van 8br /> • Totaal aantal parameters — 124Bbr /> • Actieve parameters — 5,5B per tokenbr /> • Uitvoersnelheid — 142,9 tokens/seconde, #10 van 64, tegen een mediaan onder vakgenoten van 105,1br /> • Tijd tot eerste token — 2,21 seconden, tegen een mediaan onder vakgenoten van 2,29br /> • Contextvenster — 262K tokens zoals gemeten door Artificial Analysis, tegen de 256K die de modelkaart zelf vermeldtbr /> • Licentie — MIT, open gewichten
En hier is het leverancierscijfer waar het zo vaak naast wordt afgedrukt: 42 op het Artificial Analysis Intelligence Index-protocol v4.1.1, vier punten hoger dan wat de alleen-tekst Ling-3.0-flash op hetzelfde protocol scoorde. Die bewering staat in de modelkaart, er is geen gepubliceerd evaluatiespoor, en het is niet het cijfer dat Artificial Analysis rapporteert. Er zijn twee dingen tegelijk waar: de 42 is niet gereproduceerd, en het is geen bewijs van iets oneerlijks, omdat v4.1.1 en v4.3 niet hetzelfde meten. Artificial Analysis heeft zijn index in september 2026 herformuleerd en zijn hele leaderboard opnieuw gescoord; v4.3 omvat tien evaluaties, waaronder AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench v4.0 en Humanity's Last Exam. Elk artikel dat nog steeds een 42 naast een 25 citeert zonder de versie te vermelden, vergelijkt twee verschillende tests en noemt dat een daling.

Het detail dat naast de hoofduitslag het vermelden waard is, is breedsprakigheid. Artificial Analysis registreert dat Ling-3.0-flash-VL 160M output-tokens uitgeeft om de Intelligence Index te voltooien, gerangschikt op #8 van 64 tegen een mediaan van 84M, en bestempelt het als "zeer breedsprakig." Voor een model waarvan de belofte goedkope inferentie is via een klein aantal actieve parameters, snijdt dat recht tegen die belofte in. Je betaalt per token, niet per parameter. Een model dat 5,5B activeert maar bijna het dubbele van de mediane tokentelling uitstuurt om dezelfde vragen te beantwoorden, levert een deel van dat structurele voordeel weer in bij de kassa — precies het soort interactie dat een prijstabel per token verbergt en een meting van de kosten per taak blootlegt.
De Pareto-claim, een beetje onder druk gezet
De bewering dat Ling-3.0-flash-VL zich op de Pareto-grens van intelligentie versus actieve parameters bevindt, is ongewoon genoeg een bewering die door de onafhankelijke data wordt ondersteund in plaats van slechts mogelijk gemaakt. De klassenmediaan op deze index is 8; Ling-3.0-flash-VL scoort 25; en dat doet het terwijl het 5,5 miljard parameters per token activeert. Voor teams van wie de bindende beperking serveerbare doorvoer is — één accelerator, een vast verzoekbudget, een edge-implementatie — bepaalt die verhouding de hele beslissing, en het is een werkelijk sterke prestatie.
Twee kanttekeningen maken het geen onbetwiste overwinning. De eerste is de discrepantie in het aantal parameters: de modelkaart zegt ongeveer 5,5 miljard actieve parameters, terwijl het SGLang-cookbook een model met 5,1 miljard actieve parameters beschrijft. Beide zijn Ant-documenten, het verschil is klein, en het verandert de vorm van de curve enigszins, niet de richting. De tweede is dat "frontier" een relatieve bewering is over een vakgebied dat wekelijks verandert. De beste zijn qua intelligentie per actieve parameter bij een bepaalde omvang is een positie die je vasthoudt totdat het volgende model in die band uitkomt, en die band is overvol.
De demonstratie waarmee de leverancier zelf uitpakt — dat Ling-3.0-flash-VL, die onder de naam "linthium" meedoet aan de Image-to-WebDev Arena, scoorde 1.441tegen deGPT-5.4-score van 1.440 — moet worden gelezen als een aandachtstrekker, niet als een resultaat. Een marge van één punt valt binnen de ruis van een arena-Elo, het is door de leverancier zelf gerapporteerd, en het is niet het soort verschil dat ergens de doorslag geeft. De capaciteitsclaim erachter is interessanter dan het getal: het model is gebouwd voor een visuele feedbacklus waarin het front-endcode genereert op basis van een lay-out, zijn eigen output rendert, naar de render kijkt en corrigeert — observeren, handelen, verifiëren, corrigeren, in plaats van één keer een bijschrift te geven en dan te stoppen.

Wat het kost, wat minder duidelijk is dan het lijkt
De pagina van Artificial Analysis vermeldt Ling-3.0-flash-VL tegen $0,00 per 1M input en $0,00 per 1M outputtokens, tegenover medianen van $0,14 en $0,40 bij vergelijkbare modellen. Dat is geen prijs. Het is de schijn ervan. Artificial Analysis beprijst het endpoint dat het kan zien, en het endpoint dat het kan zien is gratis — het model draait op de Ling Studio van Ant als gratis proefversie, en gratis promotionele toegang is wat de vermelding weerspiegelt. De eigen multimodale documentatie van Ant publiceert helemaal geen prijs per token voor het visionmodel, dus er is geen tariefkaart van de leverancier om de nul tegen te controleren. Ter vergelijking: het tekst-only broertje Ling-3.0-flash werd rond $0,075 per 1M input en $0,22 per 1M output vermeld, en de domeinspecifieke Ling-varianten van Ant werden ook als gratis API's gelanceerd.
Treat the zero as a testing window rather than a tariff. Free tiers on freshly released models are a customer-acquisition instrument, and the honest planning assumption is that Ling-3.0-flash-VL will eventually carry a price somewhere in the neighbourhood of its text sibling. There is also a live ambiguity the arrival of a paid endpoint will not resolve: Ant's own API examples use the model identifier Ling-3.0-flash-VL-rc1, a release-candidate marker, and it remains unclear whether the served checkpoint is byte-identical to the September 4 open weights. If you are benchmarking your own prompts against the hosted API and expecting the results to transfer to a self-hosted BF16 build, that is an assumption you should test before you build on it.
Het kostenplaatje keert om, afhankelijk van aan welke kant je staat. Voor een team dat al accelerators heeft, past de FP8-build van ongeveer 126 GB binnen een achtvoudige node van de 80GB-klasse, en het aantal actieve parameters van 5,5B betekent dat je de geamortiseerde kosten van die node afzet tegen een zeer kleine rekenvoetafdruk per token — de goedkoopste mogelijke versie van dit model is de versie die je zelf host. Voor een team zonder accelerators is de vraag of een betaald endpoint beschikbaar komt voordat de gratis laag sluit.
Waar je het daadwerkelijk kunt noemen, inclusief het gedeelte waar we nee zeggen.
Ling-3.0-flash-VL is reachable through Ant's own platform — an OpenAI-compatible endpoint at api.ant-ling.com/v1/chat/completions and an Anthropic-compatible one alongside it — plus free trial access on Ling Studio, plus open weights you can serve yourself. Independent gateways have begun listing it as well, and that is genuinely the fastest way to try it without provisioning anything.
The thing worth stating plainly is that OrcaRouter does not route Ling-3.0-flash-VL today. It is not on our model catalogue, so anything you read here about calling it through us would be fiction, and we would rather you knew that up front. What we do route is the vision model most directly comparable to it: DeepSeek V4 Flash Vision Exp, DeepSeek's experimental multimodal build, which is live on our catalogue with a 1M-token context window and a published rate. If your actual requirement is a capable vision model behind one OpenAI-compatible endpoint — with a fallback chain configured so a provider hiccup retries before your response starts, and provider list pricing passed through with nothing added on top, so a vendor price change reaches you the same day it lands — that is the model to try first while Ling-3.0-flash-VL remains off-catalogue.

Wat u vanaf hier kunt kijken
Drie dingen zullen bepalen of deze release over zes maanden significant lijkt. Het eerste is een tweede onafhankelijke run: één score van één evaluator is één datapunt, en de interessante vraag is of de positie van Ling-3.0-flash-VL op de intelligentie-versus-actieve-parametercurve standhoudt bij een andere harness. Het tweede is echte prijsstelling. Totdat Ant een tariefkaart voor het visionmodel publiceert, is elke kostenvergelijking waarbij het betrokken is een schatting in de kleren van een getal, en doet de gratis tier het werk dat een prijs anders zou doen. Het derde is de FP8-kwaliteitsdelta — de visiontoren werd in die build bewust op hogere precisie gehouden dan de expertgewichten, en of de gekwantiseerde versie BF16 evenaart op fijnmazige visuele taken is precies het soort vraag dat pas opduikt wanneer mensen het in productie draaien in plaats van het te benchmarken.
Het oordeel dat vandaag beschikbaar is, is beperkter dan de berichtgeving rond de lancering suggereerde en nuttiger dan de score alleen. Ling-3.0-flash-VL is een echt, onder MIT-licentie vrijgegeven, zelf te hosten visionmodel dat een kleine fractie van zijn 124B parameters activeert, 25 scoort op een actuele onafhankelijke index tegen een klassemediaan van 8, en een deel van dat voordeel weer inlevert door uitvoerigheid. Dat is een goed model met een eerlijke vorm. De 42 op de kaart is een getal van een liniaal die niet meer bestaat.
