
Ling-3.0-flash-VL vs DeepSeek V4 Flash Vision Exp: Twee weddenschappen op open visie
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Ling-3.0-flash-VL en DeepSeek V4 Flash Vision Exp zijn de twee open-weight visiemodellen in deze gewichtsklasse die een team vandaag realistisch kan downloaden en draaien, en ze zijn gebouwd door mensen die van mening verschillen over waar visie voor dient. Ling-3.0-flash-VL, van Ant Groups inclusionAI-lab, activeert ongeveer 5,5 miljard van zijn 124 miljard parameters per token en beschouwt visie als iets dat binnen een terugkoppelingslus moet worden toegepast — genereren, renderen, kijken, corrigeren — tegen de laagst mogelijke inferentiekosten. DeepSeek V4 Flash Vision Exp, DeepSeek's eerste multimodale build, combineert een contextvenster van 1M tokens met een maximale output van 384K tokens en beschouwt visie als nog een input die een agent leest op weg naar het afronden van een lange klus. De ene is geoptimaliseerd voor hoe weinig het kost om te denken. De andere is geoptimaliseerd voor hoeveel het kan bevatten terwijl het dat doet.
Dat verschil, niet een benchmarkdelta, is wat de keuze zou moeten sturen. De twee modellen hebben geen gedeeld evaluatieprotocol om tegen te vergelijken, en slechts één ervan heeft überhaupt een onafhankelijke score. Wat volgt is de eerlijke vorm van de onderlinge vergelijking: de architecturale gokken, de specificaties die daadwerkelijk uiteenlopen, de benchmarksituatie inclusief waarom die mager is, wat elk kost, en welke wint voor welke taak — plus het deel waarin we ronduit zeggen welke van de twee in onze catalogus staat.
De twee weddenschappen, precies geformuleerd
De Ling-kant hiervan is een weddenschap op activatiesparsiteit als de primaire kostenhefboom. Ling-3.0-flash-VL is een sparse mixture-of-experts met 124B totale parameters — de modelkaart toont ongeveer 124,8B, en het SGLang-cookbook beschrijft 5,1B actief waar de kaart ongeveer 5,5B zegt — met een hybride trunk van 42 lagen die Kimi Delta Attention afwisselt met gegate MLA-blokken in een verhouding van 5:1. Een vision-encoder met willekeurige resolutie en een tweelaagse MLP-projector voeden die trunk, waarbij VideoRoPE de ruimtelijke en temporele positie afhandelt zodat videoframes in een coherente volgorde terechtkomen. De architectonische consequentie is een model dat per token slechts een kleine fractie kost van een dense 124B-model om te draaien, wat de hele reden is dat het op de frontier van intelligentie versus actieve parameters verschijnt.
De DeepSeek-kant is een weddenschap op context en agentische volharding. DeepSeek V4 Flash Vision Exp neemt de tekstarchitectuur van DeepSeek-V4-Flash en voegt een vision-encoder en een aligner toe, en gaat daarna verder met trainen — één bron schat het resultaat op ongeveer 305B parameters, wat DeepSeek niet in detail heeft bevestigd. Het heeft een contextvenster van 1.048.576 tokens en een maximale uitvoer van 384.000 tokens, ondersteunt JSON-uitvoer, tool calls, de Responses API, de Anthropic API en voortzetting van gespreksprefixen, en DeepSeek heeft expliciet aangegeven dat dit geen model voor visuele vraagbeantwoording is. Het is perceptie voor agents: webscreenshots, software-interfaces en grafieken lezen en vervolgens doorgaan naar tool calls. Afbeeldingen worden omgezet in tokens en als zodanig gefactureerd, met een maximum van 384 tokens per afbeelding.
Lees die twee alinea's samen en de vorm van de beslissing wordt zichtbaar. Als je werklast is "kijk hiernaar, beslis iets, handel, kijk opnieuw", dan is Ling's aantal actieve parameters wat de lus betaalbaar maakt, en het ontwerp met visuele feedback is precies daarop gericht. Als je werklast is "lees dit document van 400 pagina's met figuren erin en ga door", dan is DeepSeek's contextvenster de functie en niets aan de Ling-kant kan daarmee concurreren.
Waarom de benchmarkvergelijking dunner is dan hij lijkt
Dit is het onderdeel dat de meeste vergelijkingen overslaan, en als je het overslaat, levert dat een tabel met cijfers op die niets betekenen. Dit is de werkelijke stand van het bewijs.
Ling-3.0-flash-VL heeft één onafhankelijke meting: 25 op de Artificial Analysis Intelligence Index v4.3, gerangschikt als #2 van de 64 in zijn grootteklasse tegen een klassemediaan van 8. De kaart van de leverancier claimt afzonderlijk 42 op het Intelligence Index-protocol v4.1.1, een buiten gebruik gestelde schaal die niet vergelijkbaar is — beschouw de 42 als niet gereproduceerd.
DeepSeek V4 Flash Vision Exp heeft helemaal geen Artificial Analysis-pagina. Elk cijfer dat voor dit model is gepubliceerd, is van DeepSeek zelf, afkomstig uit de releaseaankondiging, en verschillende ervan zijn expliciet relatief ten opzichte van Opus-4.8 in plaats van ten opzichte van een vast protocol. Dat is geen kritiek op de cijfers; het is een uitspraak over wat je ermee kunt doen. Je kunt een onafhankelijk gescoord model en een alleen door de leverancier gescoord model niet in dezelfde kolom zetten en een winnaar uitroepen, en elke pagina die dat doet, fabriceert een resultaat.
Wat legitiem is, is elk model vergelijken met zijn eigen gerapporteerde record, met de herkomst erbij:
• Ling-3.0-flash-VL, onafhankelijk — Intelligence Index 25 op v4.3, #2 van 64 in de klasse, klassemediaan 8, volgens Artificial Analysisbr /> • Ling-3.0-flash-VL, leverancier — 42 op het teruggetrokken v4.1.1-protocol, en 1,441 tegenover 1,440 van GPT-5.4 in de Image-to-WebDev Arena als "linthium"; beide door de leverancier gerapporteerd en de marge in de arena valt binnen de Elo-ruisbr /> • DeepSeek V4 Flash Vision Exp, leverancier — Terminal Bench 2.1 83.9; DeepSWE 59.3 tegenover 58.0 van Opus-4.8; Agents' Last Exam 27.3 tegenover 25.7 van Opus-4.8; Toolathlon-Verified 75.9; Cybergym 75.3; Chartography 64.3; NL2Repo 57.7; DSBench-Hard 63.6; ZeroBench Pass@5 35.0; ApexBench Pass@1 36.5; AutomationBench 25.7br /> • DeepSeek V4 Flash Vision Exp, onafhankelijk — niets gepubliceerd
Merk op waaruit de DeepSeek-lijst grotendeels bestaat: agentische en software-engineeringevaluaties, geen vision-evaluaties. De eigen framing van DeepSeek is dat het visiemodel bij pure-teksttaken de officiële DeepSeek-V4-Flash evenaart zonder regressie, en dat de winst zit bij multimodale agent-benchmarks — waar DeepSeek het resultaat omschrijft als het naderen van Opus-4.8 in plaats van het verslaan ervan, en toegeeft dat er een gat van ongeveer tien punten is op de gestructureerde data-science- en codetaken NL2Repo en DSBench-Hard. Dat is een ongewoon voorzichtige reeks beweringen, en het maakt duidelijk dat het model in de markt wordt gezet als een perceptie-upgrade voor een bestaande agent-stack, niet als een nieuw plafond.

De specificaties die daadwerkelijk afwijken
Op de meeste punten komen de twee specificatiebladen overeen: beide zijn open-weight onder MIT, beide accepteren tekst en afbeeldingen en retourneren tekst, beide leveren BF16-gewichten met gekwantiseerde builds, van beide zijn serving-recepten gepubliceerd, en beide gaan op een of andere manier met video om. De verschillen concentreren zich op vier punten.
• Parameters — Ling-3.0-flash-VL heeft 124B totaal met ongeveer 5,5B actief per token; DeepSeek V4 Flash Vision Exp zou rond de 305B liggen, zonder gepubliceerd cijfer voor actieve parametersbr /> • Contextvenster — Ling-3.0-flash-VL meet 262K tokens volgens Artificial Analysis, tegenover de 256K die de eigen modelkaart vermeldt; DeepSeek V4 Flash Vision Exp draait native op 1.048.576 tokensbr /> • Maximale uitvoer — Ling-3.0-flash-VL is veel korter, in de tienduizenden tokens; DeepSeek V4 Flash Vision Exp bereikt 384.000br /> • Beeldverwerking — Ling-3.0-flash-VL accepteert tot 40 afbeeldingen per verzoek van maximaal 16.384 × 784 pixels per stuk, uitsluitend base64; DeepSeek V4 Flash Vision Exp accepteert base64, externe URL's of een Files API-referentie, en beperkt de beeldkosten tot 384 tokens per afbeeldingbr /> • Actieve parameters — Ling-3.0-flash-VL activeert ongeveer 5,5B per token; DeepSeek V4 Flash Vision Exp heeft geen cijfer voor actieve parameters gepubliceerd
De rij voor beeldverwerking is degene die wordt onderschat. Een harde limiet van 384 tokens per afbeelding betekent dat een dichte grafiek of een schermafbeelding van een volledige pagina wordt gecomprimeerd tot ongeveer hetzelfde budget als een miniatuur — goedkoop, en met verlies op een manier die van belang is voor fijnmazige leestaken. De aanpak van Ling gaat de andere kant op: een zeer groot pixelbudget per afbeelding, transport uitsluitend via base64, en dus een veel zwaardere payload per verzoek. Welke beter is, hangt volledig af van of je afbeeldingen foto's zijn van documenten die je precies moet lezen, of UI-schermafbeeldingen die je ongeveer moet begrijpen.
De tweede ondergewaardeerde rij is maximale output. Het plafond van tienduizenden tokens van Ling-3.0-flash-VL is prima voor een beschrijf-dan-corrigeer-lus en beperkend voor alles wat een groot artefact wil produceren — een lang gegenereerd bestand, een volledige herschrijving van een document, een diff van meerdere duizenden regels. De 384K-output van DeepSeek bestaat precies omdat de beoogde werklast eindigt in een groot resultaat van een toolaanroep of een gegenereerd artefact. Als je pipeline verwacht dat het model iets langs teruggeeft, bepaalt die enkele rij de uitkomst van de vergelijking al voordat welke benchmark dan ook dat doet.
Prijs, en het verschil tussen gratis en zonder prijs
DeepSeek V4 Flash Vision Exp heeft een concreet getal in onze catalogus: $0,24 per 1 miljoen inputtokens en $0,73 per 1 miljoen outputtokens, met een contextvenster van 1.048.576 tokens en een maximale output van 384.000 tokens, bereikbaar als deepseek/deepseek-v4-flash-vision-exp. Dat is een gepubliceerd tarief, op dezelfde manier gefactureerd als de tekst-V4-Flash, waarbij afbeeldingen worden omgezet in tokens tegen maximaal 384 per afbeelding. Het is een tarief dat je in een spreadsheet kunt zetten.
Ling-3.0-flash-VL heeft er geen. De pagina van Artificial Analysis vermeldt het als $0,00 per 1 miljoen input en $0,00 per 1 miljoen output tegen medianen van concurrenten van $0,14 en $0,40 — maar dat weerspiegelt de gratis proefperiode die op Ling Studio van Ant draait, geen tarief. De multimodale documentatie van Ant publiceert geen prijs per token voor het visiemodel, dus er is niets om de nul tegen af te zetten. De alleen-tekst-tegenhanger Ling-3.0-flash staat genoteerd rond $0,075 per 1 miljoen input en $0,22 per 1 miljoen output, en de domeinspecifieke Ling-releases van Ant zijn gelanceerd als gratis API's, wat een vergelijkbare uiteindelijke vorm suggereert — maar een suggestie is geen prijs.
Zet die eerlijk naast elkaar en de kostenvergelijking is: het ene model heeft een tarief, het andere een promotievenster en een plausibele gok. Wie beweert dat Ling-3.0-flash-VL goedkoper is dan DeepSeek V4 Flash Vision Exp, vergelijkt een gratis proefperiode met een lijstprijs. De verdedigbare bewering is dat Ling-3.0-flash-VL zeer waarschijnlijk goedkoper per token zal zijn zodra er een prijs is, omdat 5,5B actieve parameters een structureel voordeel zijn dat geen enkele tariefwijziging tenietdoet — met de kanttekening dat de breedsprakigheid van Ling-3.0-flash-VL daar een hap uit neemt. Artificial Analysis registreert dat het 160M outputtokens verbrandt op de Intelligence Index, gerangschikt als #8 van 64 tegen een mediaan van 84M en bestempeld als "zeer breedsprakig". Je betaalt per gegenereerd token, dus een model dat bijna twee keer zoveel zegt om tot hetzelfde antwoord te komen, levert een deel in van wat zijn sparse activatie wint.
Welke, waarvoor?
De eerlijke beslissingsboom splitst op context en outputlengte voordat hij op iets anders splitst, omdat dat de dimensies zijn waarop de twee modellen geen substituten voor elkaar zijn.
Kies DeepSeek V4 Flash Vision Exp wanneer je taak lang is en eindigt in een artefact: documenten van honderden pagina's met figuren, codebases die van begin tot eind worden gelezen, agent-loops die een groot resultaat moeten opleveren, workloads waarbij je een afbeelding wilt aanleveren via een URL of een Files API-referentie in plaats van base64, en pipelines waarin je de Responses API, prefix continuation of een gepubliceerd tarief per token nodig hebt waarop je kunt budgetteren. Het is ook de enige van de twee met een leverancier die op teksttaken gelijkwaardigheid met zijn eigen tekstmodel claimt, wat van belang is als één model twee modellen in je stack vervangt.
Kies Ling-3.0-flash-VL wanneer je bindende beperking de kosten per aanroep zijn en je lus kort is: GUI-automatisering, herhaalde screenshotinspectie, front-endgeneratie met een render-en-correctiecyclus, steekproefcontroles van medische of financiële documenten waarbij je een hoge resolutie per afbeelding nodig hebt en een kleine output kunt accepteren. Het aantal actieve parameters van 5,5B is de reden om het te kiezen, de MIT-licentie is de reden dat het veilig is om zelf te hosten, en het ontwerp met de vision-feedbacklus is precies gericht op het patroon waarnemen-handelen-verifiëren-corrigeren. Houd er rekening mee dat je een model zonder prijs kiest met een gratis instappad en geen toezegging over wat volgt.
En als wat je echt nodig hebt één model is dat afbeeldingen bekwaam kan lezen zonder dat een van beide uitersten nodig is — geen 5,5B-sparsitytruc, geen venster van een miljoen tokens — dan is geen van beide het interessante antwoord, en de gewone visiemodellen uit het middensegment zullen je beter en goedkoper van dienst zijn dan welke van de twee specialisten dan ook.
Het runnen ervan, en waar we eerlijk gezegd passen
DeepSeek V4 Flash Vision Exp staat in onze catalogus. Je kunt het aanroepen via OrcaRouter's OpenAI-compatibele endpoint met de modelstring deepseek/deepseek-v4-flash-vision-exp, met dezelfde sleutel die je voor al het andere gebruikt, tegen het gepubliceerde tarief van $0.24/$0.73 zonder dat er iets bovenop komt — de adviesprijs van de provider wordt rechtstreeks doorgegeven, dus als DeepSeek het tarief verlaagt, bereikt dat jou dezelfde dag in plaats van bij de volgende contractvernieuwing. Als je voor het eerst een visionmodel in een productiepad zet, is dit van de twee de veiligere om mee te beginnen op een routeringslaag, omdat je een fallback-keten kunt configureren zodat een providerfout opnieuw wordt geprobeerd via een andere route voordat je antwoord begint. Niemand wil dat zijn eerste productie-aanroep naar een visionmodel degene is die hem leert over het falen van één enkele provider.

Ling-3.0-flash-VL staat niet in onze catalogus, en we gaan niet suggereren van wel. Het is bereikbaar via Ants eigen platform, dat een OpenAI-compatibel endpoint publiceert en een Anthropic-compatibel endpoint, via gratis proeftoegang op Ling Studio, en via de open gewichten op Hugging Face, die je zelf kunt serveren met het gepubliceerde SGLang-recept of Ants eigen vLLM-fork. Eén ding om te verifiëren voordat je in dat pad investeert: Ants API-voorbeelden gebruiken de identificatie Ling-3.0-flash-VL-rc1, een release-candidate-marker, en of de geserveerde checkpoint overeenkomt met de open gewichten is publiekelijk niet vastgesteld. Als je benchmarkt tegen de gehoste API in de verwachting dat de cijfers overdraagbaar zijn naar een zelfgehoste BF16-implementatie, test die aanname dan eerst.

De samenvatting die de toets der kritiek doorstaat: dit zijn geen concurrerende antwoorden op één vraag. DeepSeek V4 Flash Vision Exp is een perceptielaag met lange context voor agents, met een gepubliceerde prijs en een door de leverancier gerapporteerd benchmarkoverzicht dat leunt op agentische evaluaties. Ling-3.0-flash-VL is een goedkoop te serveren visionmodel met één echte onafhankelijke score, een gratis niveau zonder prijs en een ontwerp dat is gericht op korte corrigerende lussen. Stem de vorm van je workload af op de vorm van het model, en het feit dat slechts één van hen een onafhankelijke score op het scorebord heeft, zou moeten meewegen in hoeveel gewicht je aan de marketing van de ander toekent.
Dezelfde sleutel geeft toegang tot de rest van de catalogus, en je kunt de volledige modellencatalogus bekijken om te zien wat er nog meer achter één OpenAI-compatibel endpoint schuilt.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
