
Ling-3.0-flash-VL: Ants 5,5B-aktiva visionsmodell landar på 25 på Intelligence Index
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Ling-3.0-flash-VL har nu ett benchmarkvärde som ingen på Ant Group har skrivit, och det är nyheten. Den första nativt multimodala modellen från Ant Groups inclusionAI-lab får 25 på Artificial Analysis Intelligence Index — en oberoende körning, på den aktuella v4.3-skalan, publicerad tillsammans med en modellsida som listar dess hastighet, latens och pris. Den kommer tre veckor efter att leverantörens eget modellkort hävdade 42 på samma index, och det mest användbara en läsare kan göra med dessa två siffror är att förstå varför de inte är en motsägelse: Ant mätte mot Intelligence Index-protokollet v4.1.1, Artificial Analysis mätte mot v4.3, och det är olika linjaler byggda från olika utvärderingsuppsättningar. Leverantörens siffra överlevde inte kontakten med en tredje part; snarare togs den om på en skala som inte fanns när den skrevs.
Modellen bakom poängen är en gles mixture-of-experts med 124B totala parametrar och ungefär 5,5B aktiva per token, släppt under MIT-licensen med BF16- och FP8-vikter, som tar emot text, bilder och video och returnerar text. Den siffran för aktiva parametrar är hela argumentet för den. Med 5,5B aktiva ligger Ling-3.0-flash-VL på vad som har blivit den mest intressanta kurvan bland öppna modeller – intelligensfronten plottad mot aktiverade parametrar i stället för total storlek – och den är där eftersom den gör en hygglig mängd arbete per enhet beräkningskraft vid inferens, inte för att den är enorm.
Det här stycket täcker vad som faktiskt släpptes och när, vad den oberoende körningen säger, varför Pareto-påståendet håller bättre än de flesta, vad modellen kostar och var du faktiskt kan anropa den. Den korta versionen, för alla som bara vill ha den: Ling-3.0-flash-VL är verklig, med öppna vikter, ovanligt billig att köra, mätbart över genomsnittet för sin storleksklass, och märkbart mer ordrik och långsammare att släppa än den råa poängen antyder. Dess leverantörspåstådda 42 reproducerades aldrig oberoende och är inte jämförbar med den 25 som nu finns på tavlan.
Vad som faktiskt levererades, och tidslinjen som ständigt plattas ut
Bevakningen av den här utgåvan tenderar att slå samman flera separata händelser till ett enda lanseringsdatum, och datumen spelar roll eftersom de förklarar varför tidiga artiklar beskrev en modell som ingen utanför Ant kunde poängsätta. Hugging Face-repositoriet inclusionAI/Ling-3.0-flash-VL skapades den 4 september 2026 — 64 shards av BF16-vikter, en MIT-licens, en anpassad kodstack för bailing_moe_v3_vl arkitekturen, och under några dagar laddade nästan ingen ner den. FP8-kvantiseringen följde den 8 september, ungefär 126 GB över 64 shards, där vision-tornet hölls i högre precision än expertvikterna. Artificial Analysis listar utgåvan som 10 september 2026, vilket är det datum som dess egen sida anknyter till, och modellsidan som bär poängen gick live ungefär då.
Så "släppt i september 2026" är korrekt men värdelöst. Den praktiska sekvensen var: vikter den 4:e, ett andra precisionsformat den 8:e och en oberoende mätning den 10:e. Anledningen till att detta spelar roll är att en modell med vikter på disk men ingen hostad slutpunkt och ingen poäng från tredje part för de flesta team ännu inte är något man kan utvärdera – det är en nedladdning man måste avsätta resurser för. Ling-3.0-flash-VL passerade den gränsen när både API:et och den oberoende poängen fanns.
Stödet för serving kom samtidigt med vikterna i stället för efter dem. Ant publicerade en kokbok för SGLang-driftsättning och underhåller en Ling-finjusterad fork av vLLM för arkitekturen, vilket är den del av en öppen lansering som vanligtvis släpar efter med veckor. Här släpade den inte efter.
Numret på tavlan, och det på kortet
Här är den oberoende bilden från Artificial Analysis, som är den enda tredjepartsmätningen av denna modell som för närvarande finns:
• Intelligence Index — 25 i v4.3, rankad #2 av 64 i sin storleksklass, mot en klassmedian på 8br /> • Totala parametrar — 124Bbr /> • Aktiva parametrar — 5,5B per tokenbr /> • Utdatashastighet — 142,9 tokens/sekund, #10 av 64, mot en median för jämbördiga på 105,1br /> • Tid till första token — 2,21 sekunder, mot en median för jämbördiga på 2,29br /> • Kontextfönster — 262K tokens enligt mätning av Artificial Analysis, mot de 256K som modellkortet självt angerbr /> • Licens — MIT, öppna vikter
Och här är leverantörssiffran som den så ofta trycks bredvid: 42 enligt Artificial Analysis Intelligence Index-protokollet v4.1.1, fyra poäng över vad den textbaserade Ling-3.0-flash fick på samma protokoll. Det påståendet finns i modellkortet, har inget publicerat utvärderingsspår och är inte det tal som Artificial Analysis rapporterar. Två saker är sanna samtidigt: 42:an är inte reproducerad, och den är inte bevis för något ohederligt, eftersom v4.1.1 och v4.3 inte mäter samma sak. Artificial Analysis omformulerade sitt index i september 2026 och ompoängsatte hela sin resultattavla; v4.3 omfattar tio utvärderingar, inklusive AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench v4.0 och Humanity's Last Exam. Varje artikel som fortfarande citerar en 42:a bredvid en 25:a utan att ange versionen jämför två olika tester och kallar det en nedgång.

Detaljen värd att lyfta fram bortom huvudresultatet är mångordigheten. Artificial Analysis registrerar att Ling-3.0-flash-VL spenderar 160 miljoner utdatatokens för att slutföra Intelligence Index, placerad #8 av 64 mot en median på 84 miljoner, och betecknar den som "mycket mångordig". För en modell vars pitch är billig inferens genom ett litet antal aktiva parametrar talar det direkt emot själva pitchen. Du betalar per token, inte per parameter. En modell som aktiverar 5,5B men genererar nästan dubbelt så många tokens som medianen för att svara på samma frågor lämnar tillbaka en del av det strukturella försprånget i kassan — vilket är precis den typ av interaktion som en per-token-pristabell döljer och en mätning av kostnad per uppgift avslöjar.
Pareto-påståendet, satt under lite press
Påståendet att Ling-3.0-flash-VL ligger på Pareto-fronten för intelligens kontra aktiva parametrar är, ovanligt nog, ett som de oberoende data stöder snarare än bara tillåter. Klassmedianen på detta index är 8; Ling-3.0-flash-VL får 25; och det gör den samtidigt som den aktiverar 5,5B parametrar per token. För team vars bindande begränsning är genomströmning som går att betjäna — en enda accelerator, en fast budget för förfrågningar, en edge-driftsättning — är den kvoten hela beslutet, och det är en genuint stark prestation.
Två förbehåll hindrar det från att vara en ren vinst. Det första är diskrepansen i parameterantal: modellkortet anger cirka 5,5B aktiva, medan SGLang-cookbooken beskriver en modell med 5,1B aktiva. Båda är Ant-dokument, skillnaden är liten, och den ändrar kurvans form en aning snarare än riktningen. Det andra är att "frontier" är ett relativt påstående om ett fält som rör sig varje vecka. Att vara bäst på intelligens per aktiv parameter vid en given storlek är en position man håller tills nästa modell i det bandet lanseras, och det bandet är trångt.
Leverantörens egen huvuddemonstration – att Ling-3.0-flash-VL, som tävlar i Image-to-WebDev Arena under namnet "linthium", fick 1 441 mot GPT-5.4:s 1 440 – bör läsas som ett blickfång snarare än ett resultat. En marginal på en poäng ligger inom bruset för ett arena-Elo, den är leverantörsrapporterad, och det är inte den typ av gap som avgör något. Kapacitetspåståendet bakom den är mer intressant än siffran: modellen är byggd för en visuell återkopplingsloop där den genererar front-end-kod från en layout, renderar sin egen utdata, tittar på renderingen och korrigerar – observera, agera, verifiera, korrigera, i stället för att beskriva en gång och stanna.

Vad det kostar, vilket är mindre klart än det verkar
Sidan Artificial Analysis listar Ling-3.0-flash-VL till $0.00 per 1 miljon indata och $0.00 per 1 miljon utdatatokens, mot medianvärden på $0.14 och $0.40 för jämförbara modeller. Det är inte ett pris. Det är skenet av ett. Artificial Analysis prissätter den endpoint den kan se, och endpointen den kan se är gratis — modellen körs på Ants Ling Studio som en gratis provperiod, och det listningen återspeglar är gratis kampanjåtkomst. Ants egen multimodala dokumentation publicerar inte prissättning per token för visionsmodellen över huvud taget, så det finns ingen leverantörsprislista att kontrollera nollan mot. För att ge en känsla av skalan har den textbaserade syskonmodellen Ling-3.0-flash listats kring $0.075 per 1 miljon indata och $0.22 per 1 miljon utdata, och Ants domänspecifika Ling-varianter lanserades också som kostnadsfria API:er.
Betrakta nollan som ett testfönster snarare än en taxa. Gratisnivåer för nyligen lanserade modeller är ett instrument för kundvärvning, och det ärliga planeringsantagandet är att Ling-3.0-flash-VL så småningom kommer att bära ett pris i närheten av sitt textsyskon. Det finns också en aktuell oklarhet som tillkomsten av en betald slutpunkt inte kommer att lösa: Ants egna API-exempel använder modellidentifieraren Ling-3.0-flash-VL-rc1, en markör för releasekandidat, och det är fortfarande oklart huruvida den betjänade checkpunkten är byte-identisk med de öppna vikterna från den 4 september. Om du benchmarkar dina egna prompter mot det hostade API:et och förväntar dig att resultaten ska överföras till ett självhostat BF16-bygge, är det ett antagande du bör testa innan du bygger vidare på det.
Kostnadsbilden inverteras beroende på vilken sida du står på. För ett team som redan har acceleratorer får FP8-bygget på ungefär 126 GB plats i en åttavägs 80GB-klassnod, och det aktiva parameterantalet på 5,5B innebär att du betalar nodens amorterade kostnad mot ett mycket litet beräkningsavtryck per token — den billigaste möjliga versionen av denna modell är den du serverar själv. För ett team utan acceleratorer är frågan huruvida en betald endpoint anländer innan den kostnadsfria nivån stängs.
Där du faktiskt kan ringa det, inklusive den delen där vi säger nej
Ling-3.0-flash-VL nås via Ants egen plattform – en OpenAI-kompatibel endpoint på api.ant-ling.com/v1/chat/completions och en Anthropic-kompatibel bredvid den – plus kostnadsfri provåtkomst på Ling Studio, plus öppna vikter som du kan servera själv. Oberoende gateways har också börjat lista den, och det är verkligen det snabbaste sättet att prova den utan att behöva etablera något.
Det som är värt att säga rakt ut är att OrcaRouter inte dirigerar Ling-3.0-flash-VL i dag. Den finns inte med i vår modellkatalog, så allt du läser här om att anropa den via oss vore fiktion, och vi skulle hellre vilja att du visste det redan från början. Det vi dirigerar är den visionsmodell som är mest direkt jämförbar med den: DeepSeek V4 Flash Vision Exp, DeepSeeks experimentella multimodala version, som är live i vår katalog med ett kontextfönster på 1M tokens och ett publicerat pris. Om ditt faktiska behov är en kapabel visionsmodell bakom en OpenAI-kompatibel endpoint – med en reservkedja konfigurerad så att ett tillfälligt leverantörsproblem gör att ett nytt försök sker innan ditt svar börjar, och leverantörernas listpriser förs vidare utan något påslag, så att en leverantörsprisändring når dig samma dag som den träder i kraft – är det modellen du bör prova först medan Ling-3.0-flash-VL förblir utanför katalogen.

Vad att se upp för härifrån
Tre saker avgör om det här släppet framstår som betydelsefullt om sex månader. Den första är en andra oberoende körning: en poäng från en utvärderare är en datapunkt, och den intressanta frågan är om Ling-3.0-flash-VL:s placering på kurvan för intelligens kontra aktiva parametrar överlever ett annat testramverk. Den andra är verklig prissättning. Tills Ant publicerar en prislista för visionsmodellen är varje kostnadsjämförelse som involverar den en uppskattning klädd i siffrors kläder, och gratisnivån gör det arbete som ett pris annars skulle göra. Den tredje är FP8-kvalitetsdeltat — visionstornet hölls medvetet på högre precision än expertvikterna i den byggversionen, och huruvida den kvantiserade versionen matchar BF16 på finkorniga visuella uppgifter är precis den sorts fråga som bara dyker upp när folk kör den i produktion i stället för att benchmarka den.
Domen som finns i dag är snävare än vad lanseringsbevakningen antydde och mer användbar än enbart poängen. Ling-3.0-flash-VL är en riktig, MIT-licensierad, självhostbar visionsmodell som aktiverar en liten del av sina 124B parametrar, får 25 poäng på ett aktuellt oberoende index mot en klassmedian på 8, och lämnar tillbaka en del av den fördelen genom sin mångordighet. Det är en bra modell med en ärlig profil. 42:an på kortet är ett nummer från en linjal som inte längre existerar.
