
Ling-3.0-flash-VL vs Ling 3.0 Flash: En hjärna på 124B, nu med ögon
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
Ling-3.0-flash-VL och Ling 3.0 Flash är inte rivaler, och att betrakta denna kombination som en modelljämförelse skulle leda dig till fel slutsats. Ling-3.0-flash-VL är den vision-språk-checkpoint som Ant Group:s labb inclusionAI släppte den här veckan – vikterna ligger på Hugging Face under en MIT-licens sedan den 4 september 2026 – och den bygger direkt på Ling 3.0 Flash, labbets öppna textmodell med 124 miljarder parametrar som har utgjort dess snabba nivå sedan slutet av juli. De två delar samma hybridlinjära MoE-design, samma ekonomi för gles aktivering, samma recept för 256K-kontextservering och samma MIT-licens. Det VL-checkpointen tillför är det enda textmodellen aldrig haft: inbyggd bild- och videoinmatning, förmedlad genom en ViT-encoder, en tvålagers MLP-projektor och VideoRoPE:s tidsmässiga kodning. Så jämförelsen reduceras till en enda praktisk fråga – om din arbetsbelastning aldrig tittar på en bild, förtjänar modellen med ögon då bytet?
Anledningen till att frågan överhuvudtaget är värd att ställa är att inclusionAI inte presenterar Ling-3.0-flash-VL som en separat produktlinje. Dess modellkort kallar den "vår nästa generations inbyggda multimodala modell", byggd på Ling-3.0-flash, som ärver modellens språk-, resonemangs- och långkontextförmåga och utökar dem med syn som deltar i hela loopen av förståelse, resonemang, agerande och verifiering – inte syn som en påkopplad input. För en modellfamilj vars tidigare flaggskeppsrelease uttryckligen var textbaserad är detta en verklig förändring, och den påverkar vilken checkpoint ett text-och-verktygsteam bör standardisera på.
Två kontrollpunkter, en ryggrad
Ling 3.0 Flash, motståndaren i denna jämförelse, är den mogna av de två. Den tillkännagavs i slutet av juli 2026 och släpptes med öppen källkod under MIT den 7 augusti. Det är en hybrid-linjär mixture-of-experts-modell med totalt 124B parametrar och ungefär 5,1B aktiva per token — 35 KDA-lager och 7 Gated MLA-lager staplade i förhållandet 5:1, 512 routade experter med 8 aktiverade, ett inbyggt sammanhang på 256K som hanteras vid 262 144 token. Den är textbaserad, med stöd för verktygsanrop, tänkande aktiverat som standard via chatmallen, och en ovanligt låg kostnadsprofil för sin storlek. Den är också den dokumenterade hälften av paret: Artificial Analysis listar den på sin live-lista, där den rankas först bland de 63 modellerna i sin klass, och har uppmätt utdata till ungefär 313 token per sekund på leverantörens API.
Ling-3.0-flash-VL behåller den arkitekturen och lägger till en visuell stack ovanpå. Kortet beskriver en ViT-bildkodare vars features är anpassade till textutrymmet via en tvålagers MLP-projektor, med VideoRoPE som kodar både rumslig position och tidsordning så att modellen kan lokalisera händelser och resonera kring långa videor. Stommen är samma 5:1 KDA-till-MLA-hybrid, denna gång på totalt 124B / 5,5B aktiva per token, med en 42-lager trunk. Indata är text, bild och video; utdata är text. Kontexten annonseras upp till 1M tokens, med det rekommenderade SGLang-receptet som serverar 256K via YaRN-skalning. Precis som sitt textsyskon levereras den med tänkande på som standard (inaktivera per begäran med chat_template_kwargs), och den körs under antingen SGLang eller en anpassad inclusionAI vLLM-fork. BF16-utgåvan är cirka 250 GB på disk över 64 safetensor-delar – samma kvartterabyte-klass som textmodellens vikter.
Hur aktuellt är det? Vid skrivande stund har VL-repositoriet ett nedladdningsantal i dussintal, dess modellkort höll fortfarande på att uppdateras, och Artificial Analysis har inte listat det. Allt nedan som inte uttryckligen tillskrivs Artificial Analysis är inclusionAIs egen rapportering.

Resultattavlan
Asymmetrin här är inte kvalitet — det är modalitet. Sex dimensioner fångar beslutet:
• Intelligens (leverantörskort, AA Index v4.1.1) — Ling-3.0-flash-VL: 42, enligt leverantören. Ling 3.0 Flash: 38, den tidigare indexsiffran som kortet anger.
• AA live board idag (v4.3) — Ling-3.0-flash-VL: ännu inte listad. Ling 3.0 Flash: beräknad 25, rankad #1 av 63 i sin klass.
• Indata — Ling-3.0-flash-VL: text, bild och video. Ling 3.0 Flash: endast text.
• Kontext — båda hävdar stöd för upp till 1M tokens; båda serveras i praktiken med 256K (262 144) idag.
• Pris — Ling-3.0-flash-VL: inget listpris ännu; endast öppna vikter med MIT-licens. Ling 3.0 Flash: cirka 0,07 USD per 1M inmatning och 0,22 USD per 1M utdata via leverantörens eget API.
• Välj den för — Ling-3.0-flash-VL: dokument, skärmbilder, diagram, video och GUI-agenter. Ling 3.0 Flash: texttungt verktygsanrop och agentiska pipelines med lång tidshorisont.

Poängtavlan som textmodellen inte kan komma in på.
Det är här de två faktiskt går isär, och skillnaden är strukturell snarare än konkurrensmässig: på bild- och videobenchmarks har den textbaserade Ling 3.0 Flash ingen notering alls, eftersom den inte kan ta emot indata. Ling-3.0-flash-VL:s egen tabell — inclusionAIs utvärdering, som inte har reproducerats oberoende och som delvis har genomförts internt och delvis mot konkurrenternas API:er under officiella testinställningar — redovisar siffror inom de tre kategorierna som modellkortet framhåller. När det gäller förståelse av komplexa bilder visar den 79,0 på MMMU-Pro och 84,87 på MathVision, med en betydligt lägre siffra på 19,88 på Humanity's Last Exam-Multimodal, vilket speglar hur svårt det testet är för alla. Inom dokument- och diagramarbete är den stark: OmniDocBench1.5 på 91,35 och CharXiv_RQ på 81,30. Och på de agentiska multimodala sviterna som gör den här releasen intressant — ClawEval-MM på 59,9, WebVoyager på 90,83, Vision2Web på 57,69 — ombeds den att läsa av ett gränssnitt och agera på det, vilket är precis den GUI-agentuppgift som textmodellen inte klarar av.
Läser man dessa i sitt sammanhang framträder en sammanhängande bild: detta är inte en modell som finjusterats för att vinna bildtrivia, utan en modell som finjusterats för att omvandla pixlar till handling — läsa layouten, följa diagrammet, manövrera sidan. På leverantörens eget diagram leder den trevägsjämförelsen (Qwen3.8-27B med hög resonemangsansträngning, Gemini 3.5 Flash-Lite och Kimi-K2.6) på OmniDocBench, WebVoyager och ClawEval-MM, och ligger efter på svåra kunskaps- och resonemangsdataset som MathVision och HLE-MM. Behandla vart och ett av dessa siffror som inclusionAIs påstående tills ett neutralt labb bekräftar dem — men riktningen på finjusteringen är tydlig och konsekvent.
Det enda talet värt att argumentera om: 42 mot 38
Det påstående som mest sannolikt får ett text-only-team att byta är rubrikpåståendet: inclusionAI rapporterar att Ling-3.0-flash-VL får 42 på Artificial Analysis Intelligence Index (v4.1.1), fyra poäng över de 38 som företaget tillskriver Ling 3.0 Flash på samma indexversion. Notera vad det indexet mäter: dess sammansatta v4.1.1-mått bygger på text- och agentbaserade sviter – GDPval, Terminal-Bench, SciCode, GPQA Diamond, Humanity's Last Exam och liknande – och ingen av dem är bilduppgifter. Leverantören hävdar alltså att tillägget av visuell träning till den gemensamma ryggraden förbättrade modellens intelligens på textsidan med fyra poäng, inte bara att den nu kan beskriva bilder. Det är ett slående och fullt rimligt påstående – multimodal instruktionsjustering höjer vanligtvis textförmågan.
Två källförbehåll håller den siffran i proportion. För det första är 38 en siffra från en äldre indexgeneration: Artificial Analysis har sedan dess flyttat sin live-board till en nyare indexversion (v4.3), där Ling 3.0 Flash för närvarande listas på uppskattningsvis 25 samtidigt som den fortfarande rankas som etta bland de 63 modellerna i sin klass. Leverantörens par, 42 mot 38, ligger på den äldre skalan, så det bör inte läsas som ”fyra poäng över det värde AA ger textmodellen i dag”. För det andra är 42 inclusionAI:s egen siffra för en modell som Artificial Analysis ännu inte har listat, och inclusionAI har inte publicerat VL-checkpointens resultat på de enskilda textsviterna (SWE-Bench, Terminal-Bench) som dess egen textmodellstabell särredovisar. Fyra poäng är exakt så stor förbättring som du skulle vilja kunna reproducera innan du migrerar en ren text-pipeline på grundval av den.

Pris: den ena har ett listpris, den andra inte
Kostnadsjämförelsen innehåller för närvarande endast ett pris. Ling 3.0 Flash är anropsbar idag via leverantörens eget API till cirka 0,07 USD per 1M inmatning och 0,22 USD per 1M utmatning — leverantörsfastställd prissättning, bekräftad på Artificial Analysis lista — med billigare cachad inmatning, och lanseringsperiodens rabatter har upphört. Ling-3.0-flash-VL har inget publicerat API-pris någonstans; du kan inte betala per token för den ännu. Om du vill ha den den här veckan får du driva den själv: MIT-vikter på ungefär 250 GB i BF16, på samma hårdvaruklass som textmodellen redan kräver — 4× 141GB GPU:er (H20-3e eller H200) eller en 4-GPU Blackwell-nod med tensor-parallel 4, eller 8× 80GB H100/H800 med TP8.
Det sätter ekonomin i ett nytt ljus för ett team som bara arbetar med text. Om du köper tokens är textmodellen till $0,07/$0,22 billig och beprövad. Om du redan self-hostar 124B-textmodellen är VL-checkpointen inte en andra infrastrukturinvestering — det är ytterligare ~250 GB vikter på samma maskinklass, motiverad endast av arbetsbelastningar som faktiskt konsumerar pixlar. Modellen med ögon är bara värd sitt pris när ögonen är med i loopen.
Vem ska välja vilken
• Endast text och hög volym — stanna kvar på Ling 3.0 Flash. Du får en beprövad, AA-listad modell, ett verkligt pris per token och moget verktygsanrop. VL-modellens indexförbättring på fyra poäng har inte reproducerats och dess textgenomströmning har inte uppmätts; det finns ännu inga bevis för att den är den bättre textmodellen, bara ett påstående om att den är det.
• Vision kommer in i loopen — dokument, skärmbilder, diagram, foton, videobilder eller ett UI som din agent måste läsa och klicka på — Ling-3.0-flash-VL är det självklara valet, eftersom det är samma resoneringsmotor som du redan känner till med vision-stacken tillagd, snarare än en separat multimodal modell som du måste utvärdera från grunden.
• Blandad trafik, oavgjort — den lågriskåtgärden är att hålla båda nåbara och dirigera per begäran snarare än att omarkitektera kring en. Det är den egenskap en model gateway finns för att ge dig: ett API över 200+ modeller, leverantörens listpriser som skickas vidare med 0 % påslag, och automatisk redundans när en leverantör försämras. Ingen av Ling-kontrollpunkterna ligger bakom en OrcaRouter-endpoint ännu — textmodellens pris är leverantörens eget och VL-modellen har inget värdpris alls — men när VL-modellen får ett pris, är att flytta en del av trafiken till den och mäta en konfigurationsändring, inte ett integrationsprojekt.
Vad saknas fortfarande
• En oberoende körning av Ling-3.0-flash-VL på ett aktuellt Artificial Analysis Intelligence Index — 42:an är inclusionAIs uppgift om en tidigare indexversion.
• Priset på värdbaserade API:er för VL-modellen, vilket är det enskilt största hindret för att modellen ska få en vardaglig användning.
Publicerade textbaserade delmängder (SWE-Bench Pro, Terminal-Bench 2.1) för VL-checkpointen, så att ett texttungt team kan verifiera att vision-stacken inte kostade någonting i prestanda.
• En total latens- eller genomströmningssiffra för {{1}}VL{{/1}} under bildbelastning — {{2}}textmodellens{{/2}} hastighet mäts; {{3}}visionmodellens{{/3}} gör det inte.
• Neutral bekräftelse av vision-benchmark-diagrammet, där delar av körningarna utfördes på inclusionAI:s egen testmiljö och minst ett internt benchmark är planerat att släppas senare.
Domen
Detta är inte en modellkvalitetstävling; det är ett modalitetsbeslut med ett tillhörande fyrapunktsanspråk. Om dina indata är text, behåll Ling 3.0 Flash – den är billigare, AA-listad och uppmätt, och VL-modellens fördel gentemot den är för närvarande en leverantörssiffra på en äldre indexskala. Om din arbetsbelastning utgår från en skärm – en dokumentsida, en skärmdump, ett diagram, en bildruta, ett GUI som din agent måste hantera – så är Ling-3.0-flash-VL samma 124B-hjärna som du redan känner till, nu med förmågan att se, och det är ett genuint nytt alternativ som inte fanns i Ling-snabbnivån för en vecka sedan. Använd den där verklig bildinmatning finns, validera 42:an innan du migrerar något på grundval av den, och håll valet reversibelt i routinglagret tills en oberoende poäng och ett listpris har anlänt.
