Hero-titelkaart voor 'Ling-3.1-flash vs DeepSeek V4.1 Flash', met ondertitel 'Twee punten index, drie keer de rekening'. Twee afgeronde kaarten staan naast elkaar met een duidelijke tussenruimte: links, gelabeld 'Ling-3.1-flash', staat 'AA Index: 41', 'Kosten per taak: $0.99', 'Gewichten: gesloten'; rechts, gelabeld 'DeepSeek V4.1 Flash (Max)', staat 'AA Index: 39', 'Kosten per taak: $0.27', 'Gewichten: MIT'. Een voetregel luidt: 'Kosten en indexcijfers volgens Artificial Analysis.' Het OrcaRouter-logo is in de rechteronderhoek samengevoegd.
Guides & Insights

Ling-3.1-flash vs DeepSeek V4.1 Flash: twee punten op de index, drie keer de rekening

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Ling-3.1-flash en DeepSeek V4.1 Flash (Max) liggen twee punten uit elkaar op de Artificial Analysis Intelligence Index — 41 tegen 39 — en qua prijs liggen ze mijlenver uit elkaar. Voer de tien evaluaties waaruit die index bestaat uit op elk model, en Ling-3.1-flash kost ongeveer $0,99 per taak, tegenover $0,27 voor Deep​Seek's. Beide zijn mixture-of-experts-modellen met ~550 miljard parameters en een beweerd contextvenster van 1M tokens. De ene is een gesloten, alleen-tekst-model van Ant Groups InclusionAI-lab, uitgebracht op 2026-10-01 en nog steeds zonder gepubliceerde gewichten of licentie. De andere is sinds 2026-09-10 open onder MIT, accepteert zowel afbeeldingen als tekst, draait bij 23 providers, en is het model dat de meeste teams al in een configuratiebestand zouden hebben staan. De vergelijking is op de meeste assen allesbehalve close. De interessante vraag is waarom die twee punten überhaupt bestaan.

Waar Ling-3.1-flash echt vooroploopt

Het loopt voorop bij de evaluaties die het bedienen van een terminal en het schrijven van code die moet werken meten, en die voorsprong is het vermelden waard, juist omdat het totaalcijfer die verbergt.

• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 vs DeepSeek V4.1 Flash (Max) 0.268. Beide zijn bescheiden cijfers in absolute termen; het verschil is een kwart van de score van DeepSeek.

• SciCode — 0,541 vs. 0,519.

• CritPt natuurkundig redeneren — 0,180 vs 0,143.

• GDPval-AA agentisch werk in de echte wereld — 1.621,75 Elo vs 1.600 Elo.

Twee van die vier zijn vrijwel gelijk, één is een nipte overwinning, en Terminal-Bench 4.0 is de enige rij waar het verschil een wijziging van de seed zou overleven. Zet dat tegenover waar DeepSeek wint: AA-Briefcase v1.1 agentisch kenniswerk op 1.420,47 Elo tegen 1.400,35, AutomationBench-AA op 0,689 tegen 0,617, AA-LCR redeneren met lange context op 0,84 tegen 0,83, en — de rij die het meest van belang is voor productie — AA-Omniscience op −5,30 tegen +2,22 van Ling-3.1-flash op een maatstaf waarbij een hallucinatie erger is dan een weigering. De nauwkeurigheid van DeepSeek daar is 46,4% met een hallucinatiepercentage van 96,5% onder de vragen die het beantwoordt; Ling-3.1-flash antwoordt 29,1% correct met een hallucinatiepercentage van 37,9%. Geen van beide is een model dat je op een kennisbank richt zonder er retrieval voor te zetten.

Het prijsverschil is groter dan het indexverschil, en het is niet alleen de tariefkaart.

De headline-tarieven lijken bijna identiek. Artificial Analysis noteert beide op $0,30 per miljoen inputtokens. Op de andere twee cijfers lopen ze scherp uiteen:

• Output — Ling-3.1-flash $0,90 per miljoen vs DeepSeek V4.1 Flash (Max) $1,20 per miljoen. Hier is Ling-3.1-flash zonder meer het goedkopere model, met 25%.

• Cachelezen — Ling-3.1-flash $0,06 per miljoen versus DeepSeek V4.1 Flash (Max) $0,006 per miljoen, een korting van 98% tegenover een van 80%. Dit is het punt waarop de twee modellen niet meer met elkaar te vergelijken zijn.

Het gemengde tarief bij een 7:2:1-verhouding van cache-hit/input/output komt uit op $0,192 voor Ling-3.1-flash en $0,184 voor DeepSeek V4.1 Flash (Max) — nagenoeg gelijk. Maar de mix is een aanname over hoe je een model gebruikt, en die aanname is behoorlijk bepalend. Elke workload met intensief hergebruik van prompts — een lange systeemprompt, een retrieval-preamble, een agent-loop die bij elke beurt de opgebouwde context opnieuw verstuurt — duwt de effectieve mix richting cache-reads, en daar krijgt het 10×-verschil in cacheprijsstelling de overhand. Het tokenvolume versterkt dit op dezelfde manier: Ling-3.1-flash is een redeneermodel dat graag praat: het genereert 220 miljoen outputtokens tijdens de indexevaluaties, tegenover 250 miljoen van DeepSeek, en is gemiddeld ongeveer 357 seconden per evaluatietaak bezig, tegenover 285 van DeepSeek. Het denkt meer per antwoord en doet er langer over.

A two-column generated scoreboard titled 'Ling-3.1-flash vs DeepSeek V4.1 Flash — the scoreboard'. The left column, 'Ling-3.1-flash', reads 'AA Index: 41', 'Cost per task: $0.99', 'Terminal-Bench: 0.333', 'Cache read: $0.06', 'Weights: closed', 'Modality: text'; the right column, 'DeepSeek V4.1 Flash (Max)', reads 'AA Index: 39', 'Cost per task: $0.27', 'Terminal-Bench: 0.268', 'Cache read: $0.006', 'Weights: MIT', 'Modality: text + image'. A footer line reads 'Both columns per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

Een uitgewerkt voorbeeld: dezelfde agentlus op beide

Neem een agent die tools aanstuurt en per taak 1M invoertokens verwerkt, waarvan 90% uit cache wordt geleverd, en die 200.000 uitvoertokens retourneert. Bij Ling-3.1-flash en de bovenstaande cijfers: 900.000 gecachte invoertokens tegen $0,06 plus 100.000 nieuwe invoertokens tegen $0,30 plus 200.000 uitvoertokens tegen $0,90 komt neer op ongeveer $0,26 per taak. De identieke lus op DeepSeek V4.1 Flash (Max) komt neer op ongeveer $0,14 — ongeveer de helft.

Pas nu DeepSeek's schema toe, want dit is het onderdeel dat de meeste vergelijkingen overslaan. DeepSeek's dalurentarief is het bovenstaande, en daluren gelden in het weekend en het grootste deel van de dag; maar tijdens twee vensters op weekdagen, 01:00–04:00 en 06:00–10:00 UTC, verdubbelen de prijzen voor input en cache. Verplaats dezelfde loop naar een piekvenster en DeepSeek's kosten komen uit op ongeveer $0,28 — op dat punt is de vaste, hogere tariefkaart van Ling-3.1-flash de goedkopere optie voor dat uur en is de 10× cachekorting geneutraliseerd door de klok.

Dat is de hele beslissing in één getallenpaar. Als je agentverkeer cache-intensief is en je het kunt inplannen, is DeepSeek V4.1 Flash (Max) ongeveer de helft van de kosten van Ling-3.1-flash voor een indexverschil van twee punten. Als je verkeer cache-intensief is en in de piekvensters van DeepSeek valt, kosten de twee modellen ongeveer hetzelfde en wordt de iets betere terminal-agent-rij van Ling-3.1-flash de doorslaggevende factor.

De assen waar geen vergelijking te maken valt

Drie dimensies ontlopen elkaar behoorlijk, en het zijn juist die dimensies die doorgaans de architectuur bepalen voordat er over prijs wordt gesproken.

• Gewichten en licentie — Ling-3.1-flash heeft geen gewichten gepubliceerd, heeft geen licentietekst en Artificial Analysis classificeert het als propriëtair. DeepSeek V4.1 Flash (Max) heeft open gewichten onder MIT, is downloadbaar vanaf Hugging Face, met commercieel gebruik toegestaan. Een van deze kan zelf worden gehost, worden gefinetuned en in een air-gapped omgeving draaien; de andere niet.

• Modaliteit — Ling-3.1-flash is tekst in, tekst uit. DeepSeek V4.1 Flash (Max) accepteert afbeeldingen naast tekst en wordt beoordeeld op multimodale benchmarks. Als enig onderdeel van je pipeline het model een screenshot, een grafiek of een scan voorlegt, houdt de vergelijking daar op.

• Serveeroppervlak — DeepSeek V4.1 Flash (Max) is beschikbaar via 23 providers, waaronder OrcaRouter; Ling-3.1-flash draait via de eigen API van de leverancier en de platforms van derden die de release ervan aanbieden. Voor een productiepad is het aantal providers een veerkrachteigenschap, geen populariteitswedstrijd.

Nog een asymmetrie die in geen van die lijsten voorkomt: DeepSeek V4.1 Flash (Max) biedt 384.000 outputtokens in één enkele respons. Ant heeft geen maximale uitvoerlengte voor Ling-3.1-flash gepubliceerd, dus een workload voor het genereren van lange teksten kan daar nog niet op worden afgestemd. Het ontbreken van een gepubliceerde limiet is niet hetzelfde als een kleine limiet, maar het is ook geen getal waarop je kunt ontwerpen.

Beide uitvoeren, en hoe dat er daadwerkelijk uitziet

Ling-3.1-flash staat vandaag niet in de OrcaRouter-catalogus — een zoekopdracht tegen onze publieke model-API geeft not-found terug voor het model onder InclusionAI, en dit stuk zal niet doen alsof het anders is. DeepSeek V4.1 Flash is op dit moment routeerbaar tegen de lijstprijs van de provider zonder markup, dus een prijswijziging van een leverancier is bij ons live op dezelfde dag dat die binnenkomt, en het zit achter dezelfde enkele API-sleutel als de rest van de catalogus, met automatische failover tussen upstreamproviders.

Die asymmetrie heeft een praktische vorm. De verstandige manier om een vergelijking te hanteren waarin het ene model gesloten is, ongeveer vier keer de prijs van zijn voorganger kost en via één leverancier bereikbaar is, is om het open, breed aangeboden model als standaardpad te houden en de uitdager te behandelen als iets dat je test in plaats van iets waaraan je je vastlegt. DeepSeek V4.1 Flash (Max) kan vandaag de productielus dragen — open gewichten, beeldinvoer, 384K uitvoer, 98% cachekorting — terwijl Ling-3.1-flash het agent-specifieke werk krijgt waar zijn marges op Terminal-Bench en SciCode daadwerkelijk van toepassing zijn. Omdat beide het OpenAI-compatibele chat-completions-formaat spreken, is die splitsing een routeringsbeslissing in plaats van een integratieproject: één endpoint, één sleutel, en een regel die de taken doorstuurt waarin elk model aantoonbaar beter is.

Het vonnis

Op basis van het beschikbare bewijs wint DeepSeek V4.1 Flash (Max) deze confrontatie, en het wint vooral op zaken die niets te maken hebben met twee Index-punten: open weights onder MIT, beeldinvoer, 384.000 uitvoertokens, 98% cachekorting, en 23 providers om tussen te failoveren. Het pleidooi voor Ling-3.1-flash is beperkter en reëel — het is de betere terminal- en toolagent van de twee, en het is de enige van het tweetal die geen tariefschema heeft gepubliceerd met een piekurenfactor die erin is ingebakken.

Twee dingen zouden deze beoordeling veranderen. Als Ant de gewichten onder een permissieve licentie publiceert, sluit de openheidskloof en wordt de vergelijking een rechtstreeks gesprek over capaciteiten en kosten. En als het long-contextvenster dat Ant serveert, wordt gevalideerd op de 1M tokens die beide modellen opgeven, is de bewering over contextpariteit niet langer alleen een bewering. Tot dan is de eerlijke samenvatting dat een model een rij in een agentische benchmark kan winnen en toch de evaluatie kan verliezen — en dat het indexverschil van twee punten tussen deze modellen ongeveer 3,6× de kosten per taak waard is, een afweging die alleen een specifieke workload zou moeten maken.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, in English, captured 2026-10-07. The page header reads 'DeepSeek V4.1 Flash', 'ctx 1M tokens', 'Max output 384K', inputs 'text + image' and output 'text', with vision, tools, JSON and reasoning capability icons and a release date of 2026-09-10. Four stat tiles read $0.15, $0.60, 1.81 s and 6.04 s. The description states the model 'accepts text and image input, carries a context window of 1,048,576 tokens, and can generate up to 384,000 tokens in a single response. OrcaRouter bills it at $0.15 per 1M input tokens and $0.60 per 1M output tokens.' A code sample shows base_url https://api.orcarouter.ai/v1 with model 'deepseek/deepseek-v4.1-flash'.Screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash (Max), in English, captured 2026-10-07, marked 'Open weights model' and 'Released September 2026'. It shows an Intelligence Index of 39, 227 output tokens per second, $0.27 cost per Intelligence Index task, 250M output tokens generated across the index, input $0.30 with a 98% cache discount and output $1.20 per 1M tokens, a 1M context window, text and image input, 552B total parameters, 16B active parameters, and a licence of MIT with weights on Hugging Face.