
Ling-3.0-flash-VL: Ant öppnar en multimodal modell på den snabba Ling-linjen
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Den 4 september 2026 publicerade Ant Groups inclusionAI-labb MIT-licensierade vikter för Ling-3.0-flash-VL på Hugging Face och uppdaterade samma dag utvecklardokumentationen för Ant Ling-plattformen i enlighet därmed. Ling-3.0-flash-VL är den första synkompatibla checkpointen i Ling-3.0-flash-familjen: samma ~124-miljarder-parameterstora, glesa mixture-of-experts-stomme som gjorde den textbaserade Ling-3.0-flash till en av sensommarens mest omtalade prisvärda resonemangsmodeller – nu med förmågan att läsa bilder och korta videoklipp såväl som text. FP8-kvantiseringen följde den 8 september, samma morgon som detta skrivs. Så inom fyra dagar fick releasen tre ytor som en läsare kan agera på – öppna vikter, ett officiellt API på Ants Ling-plattform och en leverantörsrapporterad poäng på 42 i Artificial Analysis Intelligence Index-protokollet version 4.1.1, fyra poäng över textsyskonets oberoende uppmätta 38. Vad den ännu inte har fått är ett formellt tillkännagivande: Hugging Face-kortet och utvecklarhandledningen utgör hela lanseringen, vilket är anledningen till att denna artikel skiljer mellan vad leverantören uppger och vad en utomstående kan verifiera.
Utgivningen är viktig på grund av vad den innebär för Ants produktkarta. Fram till mitten av 2026 låg det multimodala arbetet i Ants modellportfölj i den separata Ming-serien, medan Ling-3.0-flash positionerades – även i denna bloggs egen förklaring av textmodellen – som den snabba, text- och verktygsinriktade nivån för agenter, kodning och djup forskning. Ling-3.0-flash-VL river ner den gränsen: den för in visuell information i en resonerande modell som är uppbyggd kring ett ovanligt litet avtryck av aktiverade parametrar och långa agentiska körningar, och den lämnar över resultatet till utvecklare på tre sätt samtidigt. Det gör den till ett genuint annorlunda beslut jämfört med de tidigare domänanpassade varianterna (Ling-3.0-flash-Fin, Ling-3.0-flash-Sante), som lanserades som gratis API:er utan vikter. Den här är öppen, körs på Ants betalda plattform och är så ung att ingen utanför leverantören ännu har publicerat en oberoende körning. Det sista faktumet är det viktigaste i hela inlägget.
Vad som släpptes, och när
Alla datum nedan är kontrollerbara via arkiven (repositories) och dokumentationen; inget av det bygger på ett pressmeddelande som inte existerar.
• 4 september — Hugging Face-repositoriet inclusionAI/Ling-3.0-flash-VL skapades kl. 15:24 UTC med 64 bf16-viktshardar, en komplett specialskriven kodstack för bailing_moe_v3_vl-arkitekturen, en chattmall med tankeläge aktiverat som standard och en MIT-licens. I skrivande stund är antalet nedladdningar i dussintal: det här är ett släpp som bara en repo-bevakare skulle ha fångat upp på dag ett.
• 4 september — Ants utvecklarportal för Ling-plattformen lade till handledningen om multimodal förståelse som dokumenterar modellen på det officiella API:et (sidans egen ”senast uppdaterad”-stämpel visar 4 september 2026). Kinesiska utvecklarmedier rapporterade om förmågan dagen därpå och beskrev den som bild- och kortvideoförståelse för visuellt frågebesvar och innehållsanalys.
Från och med 5 september — stöd för serving och driftsättning dök snabbt upp: en SGLang-cookbook för driftsättning av modellen, en anpassad vLLM-fork som underhålls av inclusionAI-organisationen, och en lista i ett deployment-bibliotek med egna vikter (bring-your-own-weights) som har en färdig chat-completions-endpoint. Det här är körtider och infrastruktur, inte tillkännagivanden, men de talar om att modellen byggdes för att serveras, inte bara publiceras.
• 8 september — FP8-kvantiseringen inclusionAI/Ling-3.0-flash-VL-fp8 landade (64 shards, ~126 GB), där visionstornet medvetet lämnades i högre precision medan MoE-vikterna komprimerades till FP8 E4M3. För självhosting på färre eller mindre GPU:er är detta den checkpoint som de flesta faktiskt kommer att ladda ner.

Kortet ovan är det närmaste den här releasen har till ett lanseringsinlägg — modellbeskrivning, arkitektur, länkar till SGLang- och vLLM-recepten, och ingen annonsering någon annanstans som vi kan hitta. Notera avvikelsen som är värd att flagga redan från början: modellkortet säger ”endast 5,5 miljarder parametrar aktiveras per token”, medan SGLang-cookboken som skrevs i anslutning till samma release beskriver en modell med ”5,1 miljarder aktiva parametrar”. För en helt ny checkpoint handlar skillnaden troligen om hur vision-tower räknas in snarare än att det rör sig om två olika modeller, men det är precis den typen av detalj som borde märkas som obekräftad snarare än att slätas över.
En 124B-modell som aktiverar 5.5B — nu med ögon
Ling-3.0-flash-VL behåller det hybrida sparse-MoE-receptet som definierade textvarianten. Kortet beskriver en 42-lagers ryggrad som växlar Kimi-Delta-Attention- och Gated-MLA-lager i förhållandet 5:1 — samma strukturella rytm som Ling-3.0-flash — med totalt cirka 124,8 miljarder parametrar och endast en liten bråkdel aktiverad per token. Det nya är perceptionstacken: en ViT-visuell kodare som matar en tvålagers MLP-projektor in i språkryggraden, plus VideoRoPE för att koda både rumslig och tidsmässig position så att videoramar anländer i en ordning som modellen kan resonera kring. Indata är text, bild och video; utdata är text.
• Parametrar — 124B totalt, ~5.5B aktiverade per token enligt leverantörskortet (se redovisningsförbehållet ovan).
• Kontext — annonserat som "upp till 1M tokens"; de distributionsrecept som finns idag utnyttjar 256K via YaRN rope scaling, vilket är den ärliga praktiska siffran att planera utifrån tills någon publicerar en verifierad längre körning.
• Tänkande — resonemang är aktiverat som standard via chatmallen; både de officiella API-exemplen och recepten för serving visar en switch per förfrågan, enable_thinking: false, för latenskänsliga anrop.
• Licens — MIT, båda precisionsformaten, utan tilläggsvillkor. Det är samma rena licens som gjorde textmodellens öppnande i augusti anmärkningsvärt, och det är hela anledningen till att självhostning är ett realistiskt alternativ snarare än en gråzon.
Designavsikten är lika viktig som specifikationen. Ant positionerar Ling-3.0-flash-VL som en modell som ”för in visuell information i hela processen för förståelse, resonemang, agerande och verifiering” – vilket är språket för agentiska arbetsbelastningar, inte bildtextning. En modell som kan titta på en 30-sekunders skärminspelning, hålla en lång verktygsanropssession i kontextfönstret och hålla sin aktiveringskostnad nära 5B parametrar är riktad rakt mot datoranvändningsagenter och kortvideogrundade agenter. Det är en annan produkt än de vision-språkmodeller som är optimerade för frågebesvarande på enstaka bilder, och det är den tolkningsram som varje riktmärke nedan bör läsas mot.
Vad det officiella API:t faktiskt accepterar
Handledningen för Ant Ling-plattformen dokumenterar Ling-3.0-flash-VL på två API-varianter: en OpenAI-kompatibel endpoint vid api.ant-ling.com/v1/chat/completions och en Anthropic-kompatibel sådan vid api.ant-ling.com/anthropic/v1/messages. Begränsningarna är värda att känna till innan du bygger mot den:
• Bilder — JPEG och PNG, endast base64, upp till 40 bilder per begäran, varje bild upp till 16 384 × 784 pixlar och varje base64-sträng upp till 32 MB. Den OpenAI-kompatibla image_url.detail-parametern ignoreras; motorn avgör upplösningen internt.
• Video — MP4, MOV eller WMV, ett klipp per begäran, max 30 sekunder, samplad med fast hastighet på 2 bildrutor per sekund, upp till 32 bildrutor, base64 upp till 32 MB. Video fungerar endast på den OpenAI-kompatibla endpointen; den Anthropic-kompatibla endpointen accepterar text och bilder men inte video.
• Modellidentifierare — handledningens curl-exempel anropar modellen Ling-3.0-flash-VL-rc1 i stället för Ling-3.0-flash-VL. Detta -rc1-suffix är en releasekandidatmarkör och en genuint öppen fråga: det framgår inte av dokumentationen vilka vikter plattformen använder, eller huruvida API-checkpointen matchar bygget med öppna vikter från den 4 september. Om du utvärderar API:et mot de öppna vikterna är det det första du bör testa, inte ett antagande att göra.

Sidan ovan är där indatabegränsningarna finns — bild- och videoformat, maxtak per anrop och de två endpoint-formerna. Det är också där det bekräftas att modellen är ett levande kommersiellt API-erbjudande snarare än en ren dokumentationsstub.
Siffrorna — och vem som rapporterade dem.

Den enda rubriksiffran på kortet är 42 på Artificial Analysis Intelligence Index-protokollet version 4.1.1, vilket Ant säger är fyra poäng före den textbaserade Ling-3.0-flashs poäng på 38. Åtskillnaden i den meningen är bärande. 38:an är en mätning från Artificial Analysis – oberoende genomförd, publicerad på deras ledartavla och citerad med gillande i branschens rapportering om textmodellen. 42:an är ett påstående på Ants eget modellkort, gjort under ett AA-indexprotokoll men ännu inte listat av Artificial Analysis, som inte hade någon sida för Ling-3.0-flash-VL när detta skrivs. Ingen utanför Ant har kört denna checkpoint ännu. Behandla 42 som en leverantörssiffra från samma familj som producerade textmodellens äkta 38 – en anledning att titta, inte en siffra att citera som etablerad.
Allt annat i releasen är kvalitativt eller metodologiskt. Modellkortet beskriver modellen utifrån ett diagram över förmågorna "förstå, resonera, agera" och antyder en agentisk Terminal-Bench-utvärdering som körts under ett protokoll i AA-stil, men publicerar inga numeriska textresultat som vi kan återge här; driftsättningshandboken listar noggrannhetsvärden (MMMU-Pro, GSM8K) knutna till specifika serveringskonfigurationer som är värda att läsa men som är infrastrukturnära mätningar, inte oberoende utvärderingar. Den ärliga sammanfattningen är kort: en trovärdig, billig att driftsätta, synkapabel resonemangsmodell utan något offentligt oberoende resultat ännu.
Vad det kostar, och vad familjehistorien antyder
Ants multimodala handledning listar inget pris per token för Ling-3.0-flash-VL, så allt här är inferens, tydligt märkt som sådant. Den användbara referenspunkten är textvarianten på samma plattform: listpriset för Ling-3.0-flash är cirka 0,075 USD per 1M inmatningstokens och 0,22 USD per 1M utmatningstokens, med cacheavläsningar cirka 80 % billigare, och den kinesiska konsolen prissätter den i renminbi (¥0,40 inmatning / ¥1,20 utmatning per 1M tokens) efter en tidig kampanj med 75 % rabatt som avslutades den 31 augusti. En multimodal modell på 124B-A5.5B är dyrare att leverera än en textmodell på 124B-A5.1B – visionstornet är tätt och körs för varje bildtoken – så ett pris i nivå med eller något över det intervallet är den rimliga utgångspunkten. Familjehistorien talar också åt andra hållet: domänvarianterna Fin och Sante lanserades som gratis API:er, så Ant har visat att de kommer att använda nollprissättning för att stimulera användningen av en Ling-variant de vill ha på marknaden. Huruvida VL följer det betalda textmodellintervallet eller gratisvariantens mönster är helt enkelt inte offentligt ännu.
För den självhostade vägen är siffrorna konkreta eftersom filerna är offentliga. bf16-utgåvan är ungefär en 250 GB-nedladdning över 64 shards — ett multi-GPU-åtagande på allt utom de största enskilda noderna — medan FP8-utgåvan (~126 GB, vision tower behålls i bf16) ryms bekvämt på en nod med 8 × 80 GB-klass acceleratorer och är den version de flesta team faktiskt kommer att köra. Genomströmningspåståenden från serveringskokboken finns men är leverantörsnära; förvänta dig den vanliga varningen att verkliga token/s beror på din hårdvara och din batch.
Var ett routinglager passar in — ärligt talat.
Vid lanseringen listar ingen av de större tredjepartsgateways för modeller som vi granskade Ling-3.0-flash-VL, och OrcaRouter – routningsplattformen som denna blogg tillhör – erbjuder den inte heller. Ingenting i detta inlägg ska läsas som att den gör det. Det är den ärliga bilden av en fyra dagar gammal modell, och det är värt att säga rakt ut eftersom alternativen en läsare faktiskt har idag är exakt två: anropa Ants officiella API eller självhosta MIT-vikterna. Routningsaspekten är vad som händer härnäst. När väl en modell som denna når tredjepartsserving är pass-through-routerns ekonomi anledningen att föredra den vid utvärdering: leverantörens listpris förs vidare med 0 % påslag, så en prissänkning från leverantören (eller ett free-tier-experiment som Fin- och Sante-lanseringarna) är live samma dag som den offentliggörs, och automatisk failover låter dig rikta en verklig arbetsbelastning mot en öppen modell som bara är dagar gammal, utan att satsa hela din stack på en leverantörs drifttid eller en checkpoints beteende. För en familj som har justerat sina priser en gång och splittrats i fyra varianter på sex veckor är det inte en hypotetisk fråga – det är skillnaden mellan att omtesta för hand varje gång Ant ändrar något och att omtesta en gång genom ett API.
Vad du ska titta på
Den här releasen är så pass ny att de användbara signalerna mestadels är kontroller som vem som helst kan köra. För det första: huruvida Artificial Analysis (eller ett annat oberoende labb) listar Ling-3.0-flash-VL och bekräftar eller korrigerar 42 – denna enda datapunkt skiljer "familjens bästa modell" från "ännu ett leverantörsnummer". För det andra: huruvida -rc1, identifieraren på det officiella API:et, motsvarar de öppna vikterna från den 4 september; om den inte gör det, är API:et och den självhostade sökvägen olika modeller, och varje jämförelse du läser måste ange vilken av dem som användes. För det tredje: prissättning – en publicerad VL-taxa på Ling-plattformen, och huruvida den följer textmodellens betalda nivå eller Fin/Santes gratis-API-upplägg. För det fjärde: huruvida FP8-checkpointen håller kortets träffsäkerhet i verklig drift – visionstornet som hålls i bf16 är ett gott tecken, men påståenden om kvantiserad vision kräver en körning, inte en konfiguration. Och för det femte: frågan om produktkartan – med vision nu inuti den snabba Ling-linjen, håll utkik efter om Ant behåller Ming som ett separat multimodalt varumärke eller låter de två konvergera.
För en utvecklare är det kortsiktiga svaret kort. Om du vill bygga vidare på detta idag är det officiella API:et den infrastrukturfria vägen och FP8-vikterna är vägen för självhostning, och båda är verkliga från och med den här veckan. Om du vill bygga vidare på siffran 42, vänta tills någon utanför Ant har reproducerat det. Allt som är genuint användbart med Ling-3.0-flash-VL — MIT-vikter, en rimlig arkitektur, en aggressiv pris-till-aktiveringsdesign och en leverantörspoäng värd att ta på allvar — finns på plats; allt som skulle göra den till ett säkert standardval är fortfarande utestående.
