
Ling-3.0-flash-VL versus Ling 3.0 Flash: één 124B-brein, nu met ogen
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
Ling-3.0-flash-VL en Ling 3.0 Flash zijn geen concurrenten, en wie deze combinatie als een modelvergelijking leest, komt tot de verkeerde conclusie. Ling-3.0-flash-VL is de vision-language-checkpoint die Ant Group's inclusionAI-lab deze week heeft uitgebracht — de gewichten staan sinds 4 september 2026 op Hugging Face onder een MIT-licentie — en het is rechtstreeks gebouwd op Ling 3.0 Flash, het open-weight-tekstmodel van het lab met 124B-parameters, dat sinds eind juli de snelle laag vormt. De twee delen hetzelfde hybride-lineaire MoE-ontwerp, dezelfde spaarzame-activerings-economie, dezelfde 256K-context-serveerreceptuur en dezelfde MIT-licentie. Wat de VL-checkpoint toevoegt, is het enige dat het tekstmodel nooit had: native beeld- en video-invoer, via een ViT-encoder, een twee-laags MLP-projector en VideoRoPE-temporele codering. Dus de vergelijking komt neer op één praktische vraag: als je workload nooit naar een afbeelding kijkt, verdient het model met ogen dan de overstap?
De reden dat de vraag überhaupt de moeite waard is, is dat inclusionAI Ling-3.0-flash-VL niet als een aparte productlijn neerzet. De modelkaart noemt het "ons native multimodale model van de volgende generatie," gebouwd op Ling-3.0-flash, dat de taal-, redeneer- en lange-contextmogelijkheden van dat model erft en deze uitbreidt met visie die deelneemt aan de volledige cyclus van begrijpen, redeneren, handelen en verifiëren — niet visie als een achteraf aangekoppelde invoer. Voor een modelfamilie waarvan de eerdere vlaggenschiprelease expliciet alleen tekst was, is dat een echte verschuiving, en het verandert op welk checkpoint een tekst-en-tools-team zich moet standaardiseren.
Twee checkpoints, één backbone
Ling 3.0 Flash, de tegenstander in deze vergelijking, is de volwassen versie van de twee. Aangekondigd eind juli 2026 en open-sourcemaakt onder MIT op 7 augustus, is het een hybride-lineair mixture-of-experts-model met 124B totale parameters en ruwweg 5,1B actieve parameters per token — 35 KDA-lagen en 7 Gated MLA-lagen gestapeld in een verhouding van 5:1, 512 gerouteerde experts met 8 geactiveerde, een native context van 256K bediend op 262.144 tokens. Het is uitsluitend tekstgebaseerd, met ondersteuning voor toolaanroepen, denken standaard ingeschakeld via de chattemplate, en een opmerkelijk laag kostprofiel voor zijn omvang. Het is ook de gedocumenteerde helft van het paar: Artificial Analysis vermeldt het op zijn live leaderboard, waar het als eerste staat gerangschikt onder de 63 modellen in zijn klasse, en heeft een output gemeten van ruwweg 313 tokens per seconde op de vendor-API.
Ling-3.0-flash-VL behoudt die architectuur en voegt er een visuele stack bovenop toe. De modelkaart beschrijft een ViT-visuele encoder waarvan de features door een twee-laags MLP-projector in de tekstruimte worden uitgelijnd, terwijl VideoRoPE zowel de ruimtelijke positie als de temporele volgorde codeert, zodat het model gebeurtenislokalisatie en redenering over lange video’s kan uitvoeren. De backbone is dezelfde 5:1 KDA-tot-MLA-hybride, dit keer met 124B totaal / 5.5B actief per token, met een trunk van 42 lagen. De invoer bestaat uit tekst, beeld en video; de uitvoer is tekst. De context wordt opgegeven tot 1M tokens, met het aanbevolen SGLang-recept dat via YaRN-schaling 256K bedient. Net als zijn tekstvariant wordt het standaard met thinking-modus aan geleverd (per verzoek uitschakelbaar met chat_template_kwargs), en het draait onder zowel SGLang als een aangepaste inclusionAI-vLLM-fork. De BF16-release is ongeveer 250 GB op schijf, verdeeld over 64 safetensor-shards — dezelfde kwart-terabyteklasse als de gewichten van het tekstmodel.
Hoe vers is het? Op het moment van schrijven heeft de VL-repository een downloadaantal van enkele tientallen, werd de modelkaart nog steeds bijgewerkt en heeft Artificial Analysis het niet opgenomen in de lijst. Al het onderstaande dat niet expliciet aan Artificial Analysis wordt toegeschreven, is eigen rapportage van inclusionAI.

Het scorebord
De asymmetrie hier is geen kwestie van kwaliteit — het is modaliteit. Zes dimensies bepalen de beslissing:
• Intelligence (leverancierskaart, AA Index v4.1.1) — Ling-3.0-flash-VL: 42, door leverancier gerapporteerd. Ling 3.0 Flash: 38, het eerdere indexcijfer dat de kaart aanhaalt.
• AA live board van vandaag (v4.3) — Ling-3.0-flash-VL: nog niet vermeld. Ling 3.0 Flash: geschat op 25, #1 van 63 in zijn klasse.
• Invoer — Ling-3.0-flash-VL: tekst, beeld en video. Ling 3.0 Flash: alleen tekst.
• Context — beide claimen tot 1M tokens; beide worden vandaag de dag in de praktijk op 256K (262.144) aangeboden.
• Prijs — Ling-3.0-flash-VL: nog geen catalogusprijs; alleen open MIT-gewichten. Ling 3.0 Flash: ongeveer $0,07 per 1M invoer en $0,22 per 1M uitvoer op de eerste-partij-API van de leverancier.
• Kies het voor — Ling-3.0-flash-VL: documenten, schermafbeeldingen, grafieken, video en GUI-actieve agenten. Ling 3.0 Flash: tekstintensieve tool-calling en langetermijn-agentische pipelines.

Het scorebord dat het tekstmodel niet kan betreden.
Hier lopen de twee daadwerkelijk uiteen, en het verschil is structureel in plaats van competitief: op beeld- en videobenchmarks heeft de tekst-only Ling 3.0 Flash helemaal geen vermelding, omdat het de invoer niet kan accepteren. De eigen grafiek van Ling-3.0-flash-VL — de evaluatie van inclusionAI, niet onafhankelijk gereproduceerd, deels intern uitgevoerd en deels via de API's van concurrenten onder officiële testomstandigheden — laat cijfers zien in de drie categorieën die de kaart benadrukt. Bij het begrijpen van complexe beelden scoort het een MMMU-Pro van 79.0 en een MathVision van 84.87, met een veel lagere 19.88 op Humanity's Last Exam-Multimodal, wat weerspiegelt hoe moeilijk die set voor iedereen is. Op document- en grafiekwerk is het sterk: OmniDocBench1.5 op 91.35 en CharXiv_RQ op 81.30. En bij de agentische multimodale suites die deze release interessant maken — ClawEval-MM op 59.9, WebVoyager op 90.83, Vision2Web op 57.69 — wordt het gevraagd om een interface te lezen en erop te handelen, en dat is precies de GUI-agenttaak die het tekstmodel niet kan uitvoeren.
Lees die in context en er ontstaat een samenhangend beeld: dit is geen model dat is afgestemd om beeldtrivia te winnen, het is een model dat is afgestemd om pixels om te zetten in actie — de lay-out lezen, de grafiek volgen, de pagina bedienen. Op de eigen grafiek van de leverancier voert het de driewegvergelijking aan (Qwen3.8-27B met hoge redeneerinspanning, Gemini 3.5 Flash-Lite en Kimi-K2.6) op OmniDocBench, WebVoyager en ClawEval-MM, en blijft het achter op moeilijke kennis- en redeneersets zoals MathVision en HLE-MM. Beschouw elk van die cijfers als een claim van inclusionAI totdat een neutraal lab ze bevestigt — maar de richting van de afstemming is duidelijk en consistent.
Het enige getal dat het waard is om over te discussiëren: 42 vs 38
De claim die een team dat uitsluitend met tekst werkt het meest waarschijnlijk zou doen overstappen, is die uit de kop: inclusionAI meldt dat Ling-3.0-flash-VL een score van 42 haalt op de Artificial Analysis Intelligence Index (v4.1.1), vier punten hoger dan de 38 die het aan Ling 3.0 Flash toeschrijft op dezelfde indexversie. Let op wat die index meet: de samengestelde v4.1.1-score is gebaseerd op tekst- en agentische testsuites — GDPval, Terminal-Bench, SciCode, GPQA Diamond, Humanity's Last Exam en dergelijke; geen daarvan is een beeldtaak. De leverancier beweert dus dat het toevoegen van visuele training aan de gedeelde backbone de tekstintelligentie van het model met vier punten heeft verhoogd, niet slechts dat het nu afbeeldingen kan beschrijven. Dat is een opvallende en volkomen plausibele bewering — multimodale instructietuning verbetert doorgaans tekstvaardigheid.
Twee bronkanttekeningen houden dat getal in proportie. Ten eerste is de 38 een cijfer van een oudere indexgeneratie: Artificial Analysis heeft zijn live leaderboard inmiddels verplaatst naar een nieuwere indexversie (v4.3), waar het Ling 3.0 Flash momenteel op een geschatte 25 laat noteren, terwijl het het model nog altijd als eerste rangschikt onder de 63 modellen in zijn klasse. Het 42-tegen-38-paar van de leverancier staat op de oudere schaal, dus het moet niet worden gelezen als "vier punten boven waar AA het tekstmodel vandaag de dag scoort." Ten tweede is de 42 een eigen cijfer van inclusionAI voor een model dat Artificial Analysis nog niet heeft opgenomen, en inclusionAI heeft de resultaten van de VL-checkpoint op de afzonderlijke tekstsuites (SWE-Bench, Terminal-Bench) die de eigen tekstmodelgrafiek uitsplitst, niet gepubliceerd. Vier punten is precies de omvang van de winst die je zou willen reproduceren voordat je op grond daarvan een tekst-only pipeline migreert.

Prijs: de ene heeft een catalogusprijs, de andere niet.
De kostenvergelijking is op dit moment een vergelijking met slechts één prijs erin. Ling 3.0 Flash is vandaag aanroepbaar via de eigen API van de leverancier voor ongeveer $0.07 per 1M input en $0.22 per 1M output — door de leverancier vastgestelde prijzen, bevestigd in de lijst van Artificial Analysis — waarbij gecachte input goedkoper is, en de introductiekortingen zijn geëindigd. Ling-3.0-flash-VL heeft nergens een gepubliceerde API-prijs; je kunt er nog niet per token voor betalen. Als je het deze week wilt, moet je het zelf hosten: MIT-gewichten van ongeveer 250 GB in BF16, op dezelfde hardwareklasse die het tekstmodel al nodig heeft — 4× 141GB GPU's (H20-3e of H200) of een 4-GPU Blackwell-node met tensor-parallel 4, of 8× 80GB H100/H800 met TP8.
Dat herformuleert de economische rekensom voor een team dat uitsluitend met tekst werkt. Wie tokens inkoopt, heeft in het tekstmodel voor $0,07/$0,22 een goedkoop en bewezen alternatief. Wie het 124B-tekstmodel al zelf host, doet met de VL-checkpoint geen tweede investering in infrastructuur — het is gewoon nog eens ~250 GB aan gewichten op dezelfde machineklasse, en dat is alleen te rechtvaardigen voor workloads die daadwerkelijk pixels verwerken. Het model met ogen verdient pas zijn geld wanneer er ogen in de loop zitten.
Wie moet welke kiezen
• Tekst-only en hoge volumes — blijf op Ling 3.0 Flash. Je krijgt een bewezen, AA-genoteerd model, een echte prijs per token en volwassen tool-calling. De vierpuntswinst van het VL-model op de index is niet gereproduceerd en zijn doorvoer aan de tekstzijde is niet gemeten; er is nog geen bewijs dat het het betere tekstmodel is, alleen een bewering dat het dat is.
• Vision komt de lus binnen — documenten, schermafbeeldingen, grafieken, foto’s, videoframes of een UI die je agent moet lezen en aanklikken — Ling-3.0-flash-VL is de voor de hand liggende keuze, omdat het dezelfde redeneerkern is die je al kent, met de vision-stack eraan toegevoegd, in plaats van een apart multimodaal model dat je helemaal opnieuw moet evalueren.
• Gemengd verkeer, nog niet beslist — de risicoarme stap is om beide beschikbaar te houden en per verzoek te routeren in plaats van de architectuur rond één daarvan te herontwerpen. Dat is precies wat een modelgateway je moet geven: één API voor 200+ modellen, lijstprijzen van providers die met 0% opslag worden doorberekend, en automatische failover wanneer een provider minder presteert. Geen van beide Ling-checkpoints staat al achter een OrcaRouter-endpoint — voor het tekstmodel geldt de eigen prijs van de leverancier en het VL-model heeft helemaal geen gehoste prijs — maar wanneer het VL-model er een krijgt, is het verplaatsen van een deel van het verkeer ernaartoe en het meten daarvan een configuratiewijziging, geen integratieproject.
Wat ontbreekt er nog?
• Een onafhankelijke run van Ling-3.0-flash-VL op een huidige Artificial Analysis Intelligence Index — de 42 is inclusionAI's woord over een eerdere indexversie.
• Elke prijs voor een gehoste API van het VL-model, wat verreweg de grootste belemmering vormt voor informele adoptie.
• Publiceerde tekst-only splits (SWE-Bench Pro, Terminal-Bench 2.1) voor de VL-checkpoint, zodat een tekstintensief team kan verifiëren dat de vision-stack het niets heeft gekost.
• Een end-to-end latentie- of doorvoerwaarde voor VL onder beeldbelasting — de snelheid van het tekstmodel wordt gemeten; die van het visionmodel niet.
Neutrale bevestiging van de vision-benchmarkgrafiek, waarvan delen zijn uitgevoerd op inclusionAI's eigen harness en ten minste één interne benchmark staat gepland voor latere release.
Het vonnis
Dit is geen modelkwaliteitswedstrijd; het is een modaliteitsbeslissing met een vierpuntsclaim eraan vast. Als je invoer tekst is, houd dan Ling 3.0 Flash aan — die is goedkoper, AA-genoteerd en gemeten, en het voordeel dat het VL-model daarop heeft, is vooralsnog een leverancierscijfer op een oudere indexschaal. Als je workload begint vanaf een scherm — een documentpagina, een screenshot, een grafiek, een videoframe, een GUI die je agent moet bedienen — dan is Ling-3.0-flash-VL hetzelfde 124B-brein dat je al kent, dat nu kan zien, en dat is een werkelijk nieuwe optie die een week geleden nog niet bestond in de Ling fast-tier. Zet het in waar visie echt aan de orde is, valideer de 42 voordat je op grond daarvan iets migreert, en houd de keuze omkeerbaar op de routeringslaag totdat er een onafhankelijke score en een catalogusprijs beschikbaar zijn.
