
Ling-3.0-flash-VL: Ant opent een multimodaal model op de snelle Ling-lijn
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Op 4 september 2026 publiceerde het inclusionAI-lab van Ant Group de onder MIT-licentie uitgebrachte gewichten van Ling-3.0-flash-VL op Hugging Face en werkte het diezelfde dag de ontwikkelaarsdocumentatie van het Ant Ling-platform bij om daarmee in lijn te zijn. Ling-3.0-flash-VL is het eerste checkpoint met visuele mogelijkheden in de Ling-3.0-flash-familie: dezelfde sparse mixture-of-experts-backbone van circa 124 miljard parameters die het tekst-only Ling-3.0-flash tot een van de meest besproken goedkope redeneermodellen van de nazomer maakte, leest nu naast tekst ook afbeeldingen en korte videoclips. De FP8-kwantificatie volgde op 8 september, de ochtend waarop dit stuk wordt geschreven. Zo kreeg de release binnen vier dagen drie aangrijpingspunten waar een lezer op kan acteren — open gewichten, een officiële API op het Ling-platform van Ant, en een door de leverancier gerapporteerde score van 42 op het Artificial Analysis Intelligence Index-protocol versie 4.1.1, vier punten boven de onafhankelijk gemeten 38 van het tekstmodel. Wat de release nog niet heeft, is een formele aankondiging: de Hugging Face-kaart en de ontwikkelaarstutorial vormen de volledige lancering, en daarom scheidt dit artikel wat de leverancier stelt van wat een buitenstaander kan verifiëren.
De release is belangrijk vanwege wat het betekent voor het productlandschap van Ant. Tot halverwege 2026 was het multimodale werk binnen de modelportfolio van Ant ondergebracht in de afzonderlijke Ming-lijn, terwijl Ling-3.0-flash — ook in de eigen explainer van deze blog voor het tekstmodel — werd gepositioneerd als de snelle, op tekst en tools gerichte laag voor agents, coderen en diepgaand onderzoek. Ling-3.0-flash-VL doorbreekt die grens: het brengt visuele informatie in een redeneermodel dat is opgebouwd rond een ongewoon kleine footprint van geactiveerde parameters en lange agentische runs, en biedt ontwikkelaars het resultaat op drie manieren tegelijk aan. Dat maakt dit een wezenlijk andere keuze dan de eerdere domeinspecifieke varianten (Ling-3.0-flash-Fin, Ling-3.0-flash-Sante), die als gratis API's werden uitgebracht zonder de gewichten vrij te geven. Dit model is open, draait op het betaalde platform van Ant en is zo nieuw dat er buiten de leverancier nog niemand een onafhankelijke run heeft gepubliceerd. Dat laatste feit is het belangrijkste van dit artikel.
Wat is er uitgebracht, en wanneer
Elke datum hieronder is controleerbaar via de repositories en de documentatie; niets ervan is gebaseerd op een persbericht dat niet bestaat.
• 4 september — de Hugging Face-repository inclusionAI/Ling-3.0-flash-VL werd om 15:24 UTC aangemaakt met 64 bf16-shards aan gewichten, een volledige custom-code-stack voor de bailing_moe_v3_vl architectuur, een chattemplate waarbij denken standaard is ingeschakeld, en een MIT-licentie. Het aantal downloads ligt op het moment van schrijven in de tientallen: dit is een release die alleen een repo-watcher op dag één zou hebben opgemerkt.
• 4 september — Het ontwikkelaarsportaal van Ants Ling-platform voegde de tutorial over multimodaal begrip toe die het model op de officiële API documenteert (de eigen 'laatst bijgewerkt'-stempel van de pagina vermeldt 4 september 2026). Chinese ontwikkelaarsmedia berichtten de volgende dag over de functionaliteit en presenteerden die als het begrijpen van afbeeldingen en korte video's voor visuele vraagbeantwoording en inhoudsanalyse.
• Vanaf 5 september — ondersteuning voor serving en deployment verscheen snel: een SGLang deployment-cookbook voor het model, een aangepaste vLLM-fork die wordt onderhouden door de inclusionAI-organisatie, en een vermelding in een bring-your-own-weights deployment-bibliotheek met een kant-en-klaar chat-completions-eindpunt. Dit zijn runtimes en infrastructuur, geen aankondigingen, maar ze laten zien dat het model is gebouwd om te worden geserveerd, niet alleen om te worden gepubliceerd.
• 8 september — de FP8-kwantiseringsversie inclusionAI/Ling-3.0-flash-VL-fp8 is uitgebracht (64 shards, ~126 GB), met de vision-toren die bewust in hogere precisie is gelaten terwijl de MoE-gewichten naar FP8 E4M3 zijn gecomprimeerd. Voor self-hosting op minder of kleinere GPU's is dit de checkpoint die de meeste mensen daadwerkelijk zullen downloaden.

Bovenstaande kaart komt het dichtst bij een lanceerbericht voor deze release — modelbeschrijving, architectuur, links naar de SGLang- en vLLM-recepten, en verder nergens een aankondiging die we kunnen vinden. Let op de discrepantie die we vooraf willen signaleren: de modelkaart vermeldt "slechts 5.5B parameters geactiveerd per token", terwijl het SGLang-cookbook dat rond dezelfde release is geschreven een "5.1B actief"-model beschrijft. Bij een gloednieuw checkpoint is het verschil waarschijnlijk toe te schrijven aan de vision-tower-berekening in plaats van aan twee verschillende modellen, maar het is precies het soort detail dat als onopgelost moet worden bestempeld in plaats van te worden gladgestreken.
Een 124B-model dat 5.5B activeert — nu met ogen
Ling-3.0-flash-VL behoudt het hybride sparse-MoE-recept dat het tekstuele zustermodel kenmerkte. De kaart beschrijft een backbone van 42 lagen die Kimi-Delta-Attention- en Gated-MLA-lagen afwisselt in een verhouding van 5:1 — hetzelfde structurele ritme als Ling-3.0-flash — met in totaal ongeveer 124,8 miljard parameters en slechts een klein deel dat per token wordt geactiveerd. Nieuw is de perceptiestack: een ViT-beeldencoder waarvan de uitvoer via een twee-laags MLP-projector in de taalbackbone terechtkomt, plus VideoRoPE om zowel ruimtelijke als temporele positie te coderen, zodat videoframes van een volgorde worden voorzien waarover het model kan redeneren. Invoer is tekst, beeld en video; uitvoer is tekst.
• Parameters — 124B totaal, ~5.5B geactiveerd per token volgens de leverancierskaart (zie de boekhoudkundige kanttekening hierboven).
• Context — geadverteerd als 'tot 1M tokens'; de implementatierecepten die vandaag beschikbaar zijn, gebruiken 256K via YaRN-rope-schaling. Dat is het eerlijke praktische getal om als uitgangspunt te nemen totdat iemand een geverifieerde langere run publiceert.
• Denken — redeneren is standaard ingeschakeld via de chat-sjabloon; zowel de officiële API-voorbeelden als de serving-recepten tonen een per-verzoek enable_thinking: false schakelaar voor latentiegevoelige aanroepen.
• Licentie — MIT, voor beide precisieformaten, zonder bijkomende voorwaarden. Dit is dezelfde schone licentie die de open-sourcing van het tekstmodel in augustus opmerkelijk maakte, en het is de hele reden waarom self-hosting een realistische optie is in plaats van een grijs gebied.
De ontwerpintentie is net zo belangrijk als het specificatieblad. Ant positioneert Ling-3.0-flash-VL als een model dat "visuele informatie inbrengt in het volledige proces van begrijpen, redeneren, handelen en verifiëren" — en dat is de taal van agentische workloads, niet van beeldbeschrijving. Een model dat een schermopname van 30 seconden kan bekijken, een lange tool-calling-sessie in zijn context kan vasthouden en zijn geactiveerde kosten rond de 5 miljard parameters houdt, is rechtstreeks gericht op computergebruik en agenten die op korte video's zijn gebaseerd. Dat is een ander product dan de visie-taalmodellen die zijn geoptimaliseerd voor vraagbeantwoording bij één enkele afbeelding, en het is het kader waartegen elke onderstaande benchmark moet worden gelezen.
Wat de officiële API eigenlijk accepteert
De Ant Ling-platformtutorial documenteert Ling-3.0-flash-VL voor twee API-vormen: een OpenAI-compatibele endpoint op api.ant-ling.com/v1/chat/completions en een Anthropic-compatibele op api.ant-ling.com/anthropic/v1/messages. De beperkingen zijn het waard om te kennen voordat je hierop bouwt:
• Afbeeldingen — JPEG en PNG, uitsluitend base64, maximaal 40 afbeeldingen per verzoek, elke afbeelding maximaal 16.384 × 784 pixels en elke base64-string maximaal 32 MB. De OpenAI-compatibele image_url.detail parameter wordt genegeerd; de engine bepaalt intern de resolutie.
• Video — MP4, MOV of WMV, één clip per verzoek, maximaal 30 seconden, gesampled met een vaste snelheid van 2 frames per seconde, tot maximaal 32 frames, base64 tot 32 MB. Video werkt alleen op het OpenAI-compatibele eindpunt; het Anthropic-compatibele eindpunt accepteert tekst en afbeeldingen, maar geen video.
• Model-ID — de curl-voorbeelden in de tutorial noemen het model Ling-3.0-flash-VL-rc1 in plaats van Ling-3.0-flash-VL. Dat -rc1-achtervoegsel is een releasekandidaatmarkering en een werkelijk openstaande vraag: nergens in de documentatie staat welke gewichten het platform serveert, noch of de API-checkpoint overeenkomt met de open-weights-build van 4 september. Als je de API vergelijkt met de open weights, is dat het eerste wat je moet testen, niet iets om zomaar aan te nemen.

De bovenstaande pagina is waar de invoerbeperkingen zijn vastgelegd — beeld- en videoformaten, limieten per aanvraag, en de twee endpointvormen. Het is ook waar wordt bevestigd dat het model een levende commerciële API-aanbieding is in plaats van een alleen-documentatie-stub.
De cijfers — en wie ze heeft gerapporteerd

Het enige kopcijfer op de kaart is 42 op het Artificial Analysis Intelligence Index-protocol versie 4.1.1, waarvan Ant zegt dat het vier punten boven de score van 38 van de tekst-only Ling-3.0-flash ligt. Het onderscheid in die zin is essentieel. De 38 is een Artificial Analysis-meting — onafhankelijk uitgevoerd, gepubliceerd op hun leaderboard, en goedkeurend aangehaald in de branchebrede berichtgeving over het tekstmodel. De 42 is een bewering op Ant's eigen modelkaart, gedaan onder een AA-indexprotocol maar nog niet vermeld door Artificial Analysis, dat op het moment van schrijven geen pagina had voor Ling-3.0-flash-VL. Niemand buiten Ant heeft deze checkpoint al gedraaid. Behandel 42 als een leverancierscijfer uit dezelfde familie die het echte 38 van het tekstmodel heeft opgeleverd — een reden om te kijken, geen getal om als vaststaand te citeren.
Al het overige in de release is kwalitatief of methodologisch. De modelkaart beschrijft het model in een capaciteitenoverzicht met “begrijpen, redeneren, handelen” en zinspeelt op een agentische Terminal-Bench-evaluatie die volgens een protocol in AA-stijl is uitgevoerd, maar publiceert geen numerieke tekstresultaten die we hier kunnen reproduceren. Het deploymentcookbook vermeldt nauwkeurigheidsscores (MMMU-Pro, GSM8K) die aan specifieke servingconfiguraties zijn gekoppeld. Deze zijn de moeite waard om te lezen, maar het zijn infrastructuurgerelateerde metingen, geen onafhankelijke evaluaties. De eerlijke samenvatting is kort: een aannemelijk, goedkoop te draaien redeneermodel met visuele mogelijkheden, maar nog zonder openbaar onafhankelijk scorebord.
Wat het kost, en wat de familiegeschiedenis suggereert
De multimodale tutorial van Ant bevat geen prijs per token voor Ling-3.0-flash-VL, dus alles wat hier over prijzen wordt gezegd is een afgeleide schatting, duidelijk als zodanig gemarkeerd. Het bruikbare ankerpunt is het tekstmodel op hetzelfde platform: de eigen catalogusprijs van Ling-3.0-flash ligt op ongeveer $0,075 per 1M invoertokens en $0,22 per 1M uitvoertokens, met cache-uitlezingen die ruwweg 80% goedkoper zijn. De Chinese console hanteert prijzen in renminbi (¥0,40 invoer / ¥1,20 uitvoer per 1M tokens) na een vroege actie met 75% korting die op 31 augustus eindigde. Een multimodaal model van 124B-A5.5B is duurder om te draaien dan een tekstmodel van 124B-A5.1B — de vision-toren is dense en draait voor elke beeldtoken — dus een prijs op of iets boven die bandbreedte is de realistische verwachting. De familiegeschiedenis wijst echter ook de andere kant op: de domeinvarianten Fin en Sante werden gelanceerd als gratis API's, dus Ant heeft laten zien dat het nulprijzen gebruikt om adoptie te stimuleren voor een Ling-variant die het in de markt wil hebben. Of de VL het betaalde prijsniveau van het tekstmodel volgt of het patroon van de gratis varianten, is simpelweg nog niet openbaar.
Voor de self-hostroute zijn de cijfers concreet omdat de bestanden openbaar zijn. De bf16-release is een download van ruwweg 250 GB verdeeld over 64 shards — een multi-GPU-aangelegenheid op alles behalve de grootste losse nodes — terwijl de FP8-release (~126 GB, vision-toren in bf16 gehouden) comfortabel past op een node met 8 accelerators van de 80 GB-klasse en de versie is die de meeste teams daadwerkelijk zullen draaien. Doorvoerclaims uit het serving-cookbook bestaan, maar grenzen aan leverancierspraat; verwacht het gebruikelijke voorbehoud dat de echte token/s afhangt van je hardware en je batch.
Waar een routinglaag past — eerlijk gezegd.
Bij de lancering vermeldt geen enkele grote externe modelgateway die we hebben gecontroleerd Ling-3.0-flash-VL, en OrcaRouter — het routeringsplatform waar deze blog bij hoort — biedt het ook niet aan. Niets in dit stuk mag zo gelezen worden alsof dat wel zo is. Dat is de eerlijke stand van zaken voor een model dat vier dagen oud is, en het is de moeite waard om dat ronduit te zeggen, omdat de opties die een lezer vandaag daadwerkelijk heeft er precies twee zijn: de officiële API van Ant aanroepen, of de MIT-gewichten zelf hosten. De routeringshoek is wat er daarna gebeurt. Zodra een model als dit beschikbaar komt via externe servers, zijn de economische voordelen van een pass-through-router de reden om het voor evaluatie te verkiezen: de catalogusprijs van de provider wordt doorgegeven met 0% opslag, dus een prijsverlaging door de leverancier (of een free-tier-experiment zoals de Fin- en Sante-lanceringen) is live op dezelfde dag dat deze wordt aangekondigd, en automatische failover stelt je in staat om een echte workload op een paar dagen oud open model te richten zonder je stack te verwedden op de uptime van één leverancier of het gedrag van één checkpoint. Voor een familie die zichzelf één keer opnieuw heeft geprijsd en in zes weken tijd is gefragmenteerd in vier varianten, is dat geen hypothese — het is het verschil tussen elke keer dat Ant beweegt handmatig opnieuw testen en één keer opnieuw testen via één API.
Wat te kijken
Deze release is zo nieuw dat de bruikbare signalen vooral controles zijn die iedereen kan uitvoeren. Ten eerste: of Artificial Analysis (of een ander onafhankelijk lab) Ling-3.0-flash-VL vermeldt en de 42 bevestigt of corrigeert — dat ene datapunt scheidt "het beste model van de familie" van "weer een leveranciersnummer". Ten tweede: of de -rc1-identifier op de officiële API overeenkomt met de open gewichten van 4 september; zo niet, dan zijn de API en het self-host-pad verschillende modellen en moet elke vergelijking die je leest vermelden welk model is gebruikt. Ten derde, prijs: een gepubliceerd VL-tarief op het Ling-platform, en de vraag of dit de betaalde tariefklasse van het tekstmodel volgt of het gratis-API-draaiboek van Fin/Sante. Ten vierde: of de FP8-checkpoint de nauwkeurigheid van de kaart behoudt bij echte serving — de vision-toren in bf16 is een goed teken, maar claims over gekwantiseerde vision vereisen een run, geen configuratie. En ten vijfde, de productpositioneringsvraag: nu vision in de snelle Ling-lijn zit, let op of Ant Ming als apart multimodaal merk houdt of de twee laat convergeren.
Voor een ontwikkelaar is het antwoord op korte termijn kort. Als je hier vandaag op wilt voortbouwen, is de officiële API het pad zonder infrastructuur en zijn de FP8-gewichten het pad om zelf te hosten; beide zijn sinds deze week een feit. Als je wilt voortbouwen op het getal 42, wacht dan tot iemand buiten Ant het heeft gereproduceerd. Alles wat echt nuttig is aan Ling-3.0-flash-VL — MIT-gewichten, een aannemelijke architectuur, een agressief prijs-tot-activatie-ontwerp en een leveranciersscore die je serieus moet nemen — is aanwezig; alles wat het tot een veilige standaardoptie zou maken, staat nog open.
