Ett titelkort som kontrasterar Ling-3.0-flash-VL och DeepSeek V4 Flash Vision Exp, och visar Ling med 124B totalt och 5,5B aktiva parametrar med ett kontextfönster på 262K mot DeepSeek V4 Flash Vision Exp vid ungefär 305B parametrar, ett kontextfönster på 1M tokens och maximal utdata på 384K, med en sidfot som anger att Ling-indexet är enligt Artificial Analysis och DeepSeek-siffrorna är leverantörsrapporterade.
Guides & Insights

Ling-3.0-flash-VL vs DeepSeek V4 Flash Vision Exp: Två satsningar på öppen vision

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Ling-3.0-flash-VL och DeepSeek V4 Flash Vision Exp är de två öppenviktade visionsmodellerna i den här viktsklassen som ett team realistiskt kan ladda ner och köra idag, och de byggdes av människor som inte är ense om vad vision är till för. Ling-3.0-flash-VL, från Ant Groups inclusionAI-labb, aktiverar cirka 5,5B av sina 124B parametrar per token och behandlar vision som något som ska tillämpas i en återkopplingsslinga – generera, rendera, titta, korrigera – till lägsta möjliga inferenskostnad. DeepSeek V4 Flash Vision Exp, DeepSeeks första multimodala bygge, kombinerar ett kontextfönster på 1M token med 384K token i maximal utdata och behandlar vision som ännu en indata som en agent läser på vägen mot att slutföra ett långt jobb. Den ena är optimerad för hur lite det kostar att tänka. Den andra är optimerad för hur mycket den kan hålla medan den gör det.

Den skillnaden, inte en benchmark-delta, är vad som bör styra valet. De två modellerna har inget gemensamt utvärderingsprotokoll att jämföra mot, och bara en av dem har överhuvudtaget en oberoende poäng. Det som följer är den ärliga bilden av matchningen: arkitektursatsningarna, specifikationerna som faktiskt skiljer sig, benchmark-situationen inklusive varför den är tunn, vad var och en kostar, och vilken som vinner för vilket jobb – plus delen där vi rakt ut säger vilken av de två som finns i vår katalog.

De två satsningarna, precist formulerade

Ling-sidan av detta är en satsning på aktiveringsgleshet som den primära kostnadshävstången. Ling-3.0-flash-VL är en gles mixture-of-experts-modell med 124B parametrar totalt – modellkortet visar omkring 124,8B, och SGLang-cookbooken beskriver 5,1B aktiva där kortet säger ungefär 5,5B – och kör en 42-lagers hybridstam som alternerar Kimi Delta Attention med gated MLA-block i förhållandet 5:1. En visionskodare med godtycklig upplösning och en tvålagers MLP-projektor matar denna stam, medan VideoRoPE hanterar rumslig och temporal position så att videoramar hamnar i en sammanhängande ordning. Den arkitektoniska konsekvensen är en modell som kostar en liten bråkdel av en tät 124B att köra per token, vilket är hela anledningen till att den dyker upp på fronten för intelligens kontra aktiva parametrar.

DeepSeek-sidan är en satsning på kontext och agentisk uthållighet. DeepSeek V4 Flash Vision Exp utgår från textarkitekturen i DeepSeek-V4-Flash och lägger till en visionsencoder och en aligner, och fortsätter sedan att träna – en källa uppskattar resultatet till cirka 305B parametrar, vilket DeepSeek inte har bekräftat i detalj. Den har ett kontextfönster på 1 048 576 tokens och en maximal utdata på 384 000 tokens, stöder JSON-utdata, verktygsanrop, Responses API, Anthropic API och fortsättning av konversationsprefix, och DeepSeek har uttryckligen sagt att detta inte är en modell för visuella frågor och svar. Det är perception för agenter: att läsa skärmbilder från webben, mjukvarugränssnitt och diagram och sedan gå vidare till verktygsanrop. Bilder omvandlas till tokens och faktureras som sådana, med ett tak på 384 tokens per bild.

Läs de två styckena tillsammans, och beslutets form framträder. Om din arbetsbelastning är "titta på det här, besluta något, agera, titta igen", är Lings antal aktiva parametrar det som gör loopen överkomlig, och dess design för visionsåterkoppling är avsedd för exakt det. Om din arbetsbelastning är "läs det här 400-sidiga dokumentet med figurer i och fortsätt", är Deep​Seeks kontextfönster funktionen, och inget på Ling-sidan konkurrerar med det.

Varför benchmark-jämförelsen är tunnare än den verkar

Det här är avsnittet som de flesta jämförelser hoppar över, och att hoppa över det ger en tabell med siffror som inte betyder något. Här är det faktiska bevisläget.

Ling-3.0-flash-VL har en oberoende mätning: 25 på Artificial Analysis Intelligence Index v4.3, rankad #2 av 64 i sin storleksklass mot en klassmedian på 8. Leverantörens modellkort uppger separat 42 på Intelligence Index-protokollet v4.1.1, vilket är en utfasad skala och inte jämförbar — behandla 42:an som icke reproducerad.

DeepSeek V4 Flash Vision Exp har ingen Artificial Analysis-sida alls. Varje siffra som publiceras för den är DeepSeeks egna, från lanseringsmeddelandet, och flera av dem är uttryckligen relativa till Opus-4.8 snarare än till ett fast protokoll. Det är inte en kritik av siffrorna; det är ett påstående om vad man kan göra med dem. Man kan inte sätta en oberoende bedömd modell och en modell som endast bedömts av leverantören i samma kolumn och utropa en vinnare, och varje sida som gör det fabricerar ett resultat.

Det som är legitimt är att jämföra varje modell mot dess egen rapporterade historik, med proveniensen bifogad:

• Ling-3.0-flash-VL, oberoende — Intelligence Index 25 på v4.3, #2 av 64 i klassen, klassmedian 8, enligt Artificial Analysisbr /> • Ling-3.0-flash-VL, leverantör — 42 på det avvecklade v4.1.1-protokollet, och 1 441 mot GPT-5.4:s 1 440 i Image-to-WebDev Arena som "linthium"; båda är leverantörsrapporterade och arenamarginalen ligger inom Elo-brusetbr /> • DeepSeek V4 Flash Vision Exp, leverantör — Terminal Bench 2.1 83,9; DeepSWE 59,3 mot Opus-4.8:s 58,0; Agents' Last Exam 27,3 mot Opus-4.8:s 25,7; Toolathlon-Verified 75,9; Cybergym 75,3; Chartography 64,3; NL2Repo 57,7; DSBench-Hard 63,6; ZeroBench Pass@5 35,0; ApexBench Pass@1 36,5; AutomationBench 25,7br /> • DeepSeek V4 Flash Vision Exp, oberoende — inga publicerade

Lägg märke till vad Deep​Seek-listan mestadels består av: agentiska utvärderingar och utvärderingar av mjukvaruutveckling, inte visionsutvärderingar. Deep​Seeks egen formulering är att visionsmodellen på rent textbaserade uppgifter matchar den officiella DeepSeek-V4-Flash utan försämring, och att vinsterna finns på multimodala agentbenchmarks — där Deep​Seek beskriver resultatet som att närma sig Opus-4.8 snarare än att slå det, och medger en skillnad på ungefär tio punkter på de strukturerade data science- och koduppgifterna NL2Repo och DSBench-Hard. Det är en ovanligt försiktig uppsättning påståenden, och det säger dig att modellen säljs som en perceptionsuppgradering till en befintlig agentstack snarare än som ett nytt tak.

A two-column comparison scoreboard for Ling-3.0-flash-VL and DeepSeek V4 Flash Vision Exp across six shared dimensions: Intelligence Index 25 on v4.3 versus none published, active parameters 5.5B versus undisclosed, context window 262K versus 1M tokens, max output tens of thousands versus 384K, license MIT versus MIT, and independent score yes versus none, with a footer noting the Ling figure is per Artificial Analysis and all DeepSeek figures are vendor-reported.

Specarna som faktiskt avviker

Det mesta i de två specifikationsbladen stämmer överens: båda är open-weight under MIT, båda tar emot text och bilder och returnerar text, båda levereras med BF16-vikter med kvantiserade byggen, båda har publicerade recept för servering, och båda hanterar video i någon form. Skillnaderna är koncentrerade till fyra ställen.

• Parametrar — Ling-3.0-flash-VL har totalt 124 B med ungefär 5,5 B aktiva per token; DeepSeek V4 Flash Vision Exp rapporteras ligga på omkring 305 B utan publicerad siffra för aktiva parametrarbr /> • Kontextfönster — Ling-3.0-flash-VL uppmäts till 262K tokens enligt Artificial Analysis, jämfört med de 256K som dess eget modellkort anger; DeepSeek V4 Flash Vision Exp kör 1 048 576 tokens nativtbr /> • Maximal utdata — Ling-3.0-flash-VL är mycket kortare, i storleksordningen tiotusentals tokens; DeepSeek V4 Flash Vision Exp når 384 000br /> • Bildhantering — Ling-3.0-flash-VL accepterar upp till 40 bilder per begäran på upp till 16 384 × 784 pixlar vardera, endast base64; DeepSeek V4 Flash Vision Exp accepterar base64, externa URL:er eller en Files API-referens och begränsar bildkostnaden till 384 tokens per bildbr /> • Aktiva parametrar — Ling-3.0-flash-VL aktiverar ungefär 5,5 B per token; DeepSeek V4 Flash Vision Exp har inte publicerat någon siffra för aktiva parametrar

Bildhanteringsraden är den som underskattas. Ett hårt tak på 384 tokens per bild innebär att ett tätt diagram eller en skärmbild av en hel sida komprimeras till ungefär samma budget som en miniatyrbild – billigt, och med förluster på ett sätt som har betydelse för detaljerade läsuppgifter. Lings angreppssätt går åt andra hållet: en mycket stor pixelbudget per bild, överföring enbart via base64, och därmed en mycket tyngre nyttolast i förfrågan. Vilket som är bättre beror helt och hållet på om dina bilder är fotografier av dokument som du behöver läsa exakt, eller UI-skärmbilder som du behöver förstå på ett ungefär.

Den andra underskattade raden är maxutdata. Ling-3.0-flash-VLs tak på tiotusentals tokens fungerar bra för en beskriv-sedan-rätta-loop och är begränsande för allt som vill producera en stor artefakt – en lång genererad fil, en fullständig dokumentomskrivning, en diff på flera tusen rader. Deep​Seeks 384K-utdata finns just därför att den avsedda arbetsbelastningen slutar i ett stort verktygsanropsresultat eller en genererad artefakt. Om din pipeline förväntar sig att modellen ska lämna tillbaka något långt, avgör den enda raden matchningen innan någon benchmark gör det.

Pris, och skillnaden mellan gratis och utan pris

DeepSeek V4 Flash Vision Exp har ett verkligt pris i vår katalog: $0,24 per 1 miljon indatatoken och $0,73 per 1 miljon utdatatoken, med ett kontextfönster på 1 048 576 token och en maximal utdata på 384 000 token, nåbar som deepseek/deepseek-v4-flash-vision-exp. Det är en publicerad taxa, fakturerad på samma sätt som text-V4-Flash, med bilder omvandlade till token med upp till 384 per bild. Det är en taxa du kan lägga in i ett kalkylblad.

Ling-3.0-flash-VL har inget pris. Artificial Analysis-sidan listar den till $0.00 per 1M input och $0.00 per 1M output mot medianvärden på $0.14 och $0.40 för jämförbara modeller – men det återspeglar den kostnadsfria provperioden som körs på Ants Ling Studio, inte en taxa. Ants multimodala dokumentation publicerar inget pris per token för visionsmodellen, så det finns inget att kontrollera nollan mot. Det textbaserade syskonet Ling-3.0-flash har listats till omkring $0.075 per 1M input och $0.22 per 1M output, och Ants domänspecifika Ling-släpp lanserades som kostnadsfria API:er, vilket antyder en liknande framtida form – men en antydan är inte ett pris.

Ställ dem ärligt sida vid sida och kostnadsjämförelsen är: den ena modellen har en taxa, den andra har ett kampanjfönster och en rimlig gissning. Den som hävdar att Ling-3.0-flash-VL är billigare än DeepSeek V4 Flash Vision Exp jämför en gratis provperiod med ett listpris. Det försvarbara påståendet är att Ling-3.0-flash-VL mycket sannolikt är billigare per token när priset väl är satt, eftersom 5,5B aktiva parametrar är en strukturell fördel som ingen taxeändring suddar ut — med förbehållet att Ling-3.0-flash-VL:s mångordighet äter upp en del av det. Artificial Analysis noterar att den bränner 160M uttoken på Intelligence Index, rankad #8 av 64 mot en median på 84M och märkt ”mycket mångordig”. Du betalar per emitterad token, så en modell som säger nästan dubbelt så mycket för att nå samma svar ger tillbaka en del av det som dess glesa aktivering vinner.

Vilken, för vad?

Det ärliga beslutsträdet delar sig efter kontext och utdatalängd innan det delar sig efter något annat, eftersom det är de dimensioner där de två modellerna inte är substitut.

Välj DeepSeek V4 Flash Vision Exp när ditt jobb är långt och slutar i en artefakt: dokument på flera hundra sidor med figurer, kodbaser som läses från början till slut, agentloopar som behöver producera ett stort resultat, arbetsbelastningar där du vill lämna över en bild via URL eller en Files API-referens i stället för base64, och pipelines där du behöver Responses API, prefixfortsättning eller en publicerad per-token-taxa som du kan budgetera mot. Det är också den enda av de två med en leverantör som hävdar paritet med sin egen textmodell på textuppgifter, vilket spelar roll om en modell ersätter två i din stack.

Välj Ling-3.0-flash-VL när din bindande begränsning är kostnaden per anrop och din loop är kort: GUI-automatisering, upprepad granskning av skärmbilder, frontend-generering med en rendera-och-korrigera-cykel, stickprovskontroller i medicinska eller finansiella dokument där du behöver hög upplösning per bild och kan acceptera begränsad utdata. Antalet aktiva parametrar på 5,5B är anledningen att välja den, MIT-licensen är anledningen till att den är säker att självhosta, och designen med återkopplingsslinga för vision är inriktad på exakt mönstret observera-agera-verifiera-korrigera. Var medveten om att du väljer en modell utan pris med en gratis ingångsväg och inget åtagande om vad som följer.

Och om det du faktiskt behöver är en enda modell som läser bilder kompetent utan någon av ytterligheterna – inget 5,5B-sparsitetstrick, inget fönster på en miljon token – då är ingen av dessa det intressanta svaret, och vanliga visionsmodeller i mellanklassen kommer att fungera bättre och billigare för dig än någon av specialisterna.

Att köra dem, och var vi passar in ärligt

DeepSeek V4 Flash Vision Exp finns i vår katalog. Du kan anropa den via OrcaRouters OpenAI-kompatibla endpoint med modellsträngen deepseek/deepseek-v4-flash-vision-exp, med samma nyckel som du använder för allt annat, till det publicerade priset $0.24/$0.73 utan något påslag — leverantörens listpris förs vidare direkt, så om DeepSeek sänker priset når det dig samma dag i stället för vid nästa avtalsförnyelse. Om du sätter en visionsmodell i en produktionsväg för första gången är detta det säkrare av de två att börja med på ett routinglager, eftersom du kan konfigurera en reservkedja så att en begäran som möter ett leverantörsfel görs om mot en annan rutt innan ditt svar börjar. Ingen vill att deras första produktionsanrop för vision ska vara det som lär dem om fel hos en enda leverantör.

The OrcaRouter model page for DeepSeek V4 Flash Vision (Exp) showing a $0.24 per 1M input and $0.73 per 1M output token price, a 1,048,576-token context window, a 384,000-token maximum output, p50 time to first token of 1.31 seconds, the deepseek/deepseek-v4-flash-vision-exp model identifier, and Python and cURL code samples against https://api.orcarouter.ai/v1.

Ling-3.0-flash-VL finns inte i vår katalog, och vi kommer inte att antyda något annat. Den går att nå via Ants egen plattform, som publicerar en OpenAI-kompatibel endpoint och en Anthropic-kompatibel sådan, via kostnadsfri provåtkomst på Ling Studio, och via de öppna vikterna på Hugging Face, som du kan servera själv med det publicerade SGLang-receptet eller Ants egen vLLM-fork. En sak att verifiera innan du satsar på den vägen: Ants API-exempel använder identifieraren Ling-3.0-flash-VL-rc1, en markör för release candidate, och huruvida den serverade checkpointen matchar de öppna vikterna har inte fastställts offentligt. Om du benchmarkar mot det hostade API:et och förväntar dig att siffrorna ska överföras till en självhostad BF16-driftsättning, testa det antagandet först.

The Artificial Analysis model page for Ling-3.0-flash-VL showing an Intelligence Index of 25 on v4.3, a class rank of #2 of 64, 124B total and 5.5B active parameters, 142.9 output tokens per second, and a listed price of $0.00 per 1M tokens in and out reflecting free trial access.

Sammanfattningen som håller för granskning: detta är inte konkurrerande svar på en och samma fråga. DeepSeek V4 Flash Vision Exp är ett perceptionslager med lång kontext för agenter, med ett publicerat pris och ett av leverantören rapporterat benchmarkblad som lutar sig mot agentiska utvärderingar. Ling-3.0-flash-VL är en visionmodell som är billig att köra, med en enda genuin oberoende poäng, en oprissatt gratisnivå och en design inriktad på korta korrigerande loopar. Anpassa formen på din arbetsbelastning till formen på modellen, och det faktum att bara en av dem har en oberoende poäng på resultattavlan bör påverka hur mycket vikt du lägger vid den andra modellens marknadsföring.

Samma nyckel når resten av katalogen, och du kan bläddra i hela modellkatalogen för att se vad mer som finns bakom en OpenAI-kompatibel endpoint.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen