
Ling-3.0-flash: Vad vi nu vet om Ant Groups open-weight MoE i snabbtier
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ant Groups InclusionAI-labb har officiellt släppt Ling-3.0-flash — tillkännagavs den 24 juli 2026 och släpptes som öppen källkod under MIT-licensen den 7 augusti — och bilden har förändrats en hel del sedan förhandsvisningen vi publicerade här i juli. Det är en inbyggd hybridresonerande mixture-of-experts-modell med totalt 124 miljarder parametrar och bara 5,1 miljarder aktiva per token, byggd som den snabba, billiga nivån i Ling-familjen. De två siffrorna som förändrade allt: Artificial Analysis ger den nu 38 poäng på Intelligence Index (upp 24 poäng från den tidigare generationen i snabbnivån, Ling-2.6-flash) och placerar den på Pareto-fronten för öppna vikter när det gäller intelligens jämfört med totala parametrar. Vikterna är live på Hugging Face och ModelScope.
När vi först rapporterade om den här modellen den 24 juli var den ärliga sammanfattningen: endast API, inga vikter, inget licensmeddelande, inget oberoende benchmark. Alla fyra av dessa påståenden är nu inaktuella. Ant släppte vikterna som öppen källkod under MIT den 7 augusti, och Artificial Analysis har sedan dess publicerat en fullständig oberoende utvärdering. Den här uppdateringen reviderar den ursprungliga sammanfattningen i enlighet med detta — etiketterna ”overifierade” som dominerade juliinlägget gäller nu en mycket snävare uppsättning påståenden, främst Ants topphastighetssiffror, snarare än modellen som helhet.
TL;DR.Ling-3.0-flash är Ant Groups öppenvikts-MoE i snabbnivån: 124B totalt / 5,1B aktiva, MIT-licens, 256K nativ kontext (262K som serveras). Artificial Analysis ger den ett intelligensindex på 38 — 24 poäng högre än föregående generations Ling-2.6-flash och på Paretofronten för öppna vikter när det gäller intelligens kontra totala parametrar — med uppmätt utdata runt 368 tokens/sek. Vikterna finns på Hugging Face och ModelScope under MIT. Fortfarande endast leverantörsrapporterat: påståendet om 1 100+ tokens/sek i toppgenomströmning, siffran för tid till första token på under 100 ms och benchmark-tabellen i modellkortet. Prissättningen för förstaparts-API:et är 0,075 USD in / 0,22 USD ut per 1M tokens (80 % rabatt vid cacheträffar); gratisnivån vid lanseringen avslutades den 3 augusti.
Viktiga slutsatser
• Det är den snabba/billiga nivån, inte flaggskeppsmodellen. Den tidigare generationens flaggskepp med 1T parametrar är fortfarande InclusionAIs största modell; Ling-3.0-flash är det mindre, snabbare syskonet avsett för högvolymtext och verktygsanrop.
• Vikterna är nu öppna under MIT. Vikterna släpptes på Hugging Face (inclusionAI/Ling-3.0-flash) och ModelScope den 7 augusti under MIT-licens — en vändning från juliläget med ”enbart API”.
• Det har äntligen en oberoende poäng. Artificial Analysis mäter ett intelligensindex på 38, upp 24 från Ling-2.6-flash, och placerar modellen på open-weights Pareto-fronten för intelligens jämfört med totala parametrar.
• Hastigheten mäts delvis nu. AA presterar ungefär 368 tokens/sek i utmatning och en ~1,98 s tid till första token; Ant:s annonserade toppsiffra på 1 100+ tokens/sek är fortfarande bara leverantörens egen uppgift.
• Prissättningen är fastställd och gratislanseringen är över. Förstaparts-API:et listar $0.075 in / $0.22 ut per 1M tokens med 80 % rabatt vid cacheträffar; gratisnivån vid lanseringen slutade den 3 augusti.
• Det är en del av en familj med tre modeller. InclusionAI delar upp sitt utbud i Ling (allmän text- och verktygs-MoE, den här modellen), Ring (resonemang) och Ming (multimodal).
En notering om hur du läser den här uppdateringen: detta är en revidering av förhandsvisningen från den 24 juli, skriven efter att vikterna blev öppna och de första oberoende resultaten publicerades. Varje specifikation, riktmärke och pris nedan är märkt med källa. Där Ant Group är den enda källan — påståendena om topphastighet och modellkortets riktmärkestabell — säger vi det tydligt. Där Artificial Analysis har mätt något oberoende, citerar vi det.
Vad vi faktiskt vet
Arkitekturen är nu fullständigt dokumenterad på modellkortet. Ling-3.0-flash använder en inbyggd hybrid-linjär uppmärksamhetsstack — Kimi Delta Attention (KDA) och Gated MLA-lager som alternerar i förhållandet 5:1 (35 KDA + 7 MLA), med KDA finkornig diagonal gating — ovanpå en 1/64-sparsam MoE (512 dirigerade experter, 8 aktiverade per token). Det är så den når 124B totala parametrar med endast 5,1B aktiva. Kontextfönstret är 256K inbyggt, serverat med 262 144 tokens i inferensrecepten, och Ant hävdar att arkitekturen skalar till 1M. Maximal utdatalängd avslöjas inte. Modellen är textbaserad med stöd för verktygsanrop; multimodal input finns i den separata Ming-linjen.
Två viktformat publiceras av labbet — BF16 (cirka 255 GB) och FP8 (cirka 128 GB) — och communityns kvantiserade varianter är redan länkade från modellkortet. Labbets egna deploymentsrecept riktar sig mot SGLang och vLLM.
Tillgänglighet: öppna vikter under MIT
Den 7 augusti publicerade Ant Groups InclusionAI-team vikterna som öppen källkod under MIT-licensen på Hugging Face (inclusionAI/Ling-3.0-flash) och ModelScope. Det är en tillåtande, kommersiellt användbar licens – samma som Ling 2.0 och Ling 2.6 släpptes under – och det innebär att du kan självhosta, finjustera och driftsätta Ling-3.0-flash själv istället för att hyra den via ett API. Modellen är också anropbar via Ants eget utvecklar-API och flera tredjepartsplattformar. För en snabb modell i denna prisklass är den mer intressanta frågan om man ska självhosta (FP8 körs på ungefär 128 GB) eller stanna kvar på ett API.

Oberoende poäng: ett AA Intelligence Index på 38
Den enskilt största förändringen jämfört med inlägget från juli är att oberoende siffror nu finns. Artificial Analysis har en sida för {{1}}Ling-3.0-flash{{/1}} och mäter den till 38 på Intelligence Index — 24 poäng över den tidigare snabbgenerationen, {{2}}Ling-2.6-flash{{/2}} (14), och i nivå med MiMo-V2.5 och Qwen 3.6 27B samtidigt som den aktiverar en bråkdel av deras parametrar. Artificial Analysis placerar också modellen på open-weights-Paretofronten för intelligens kontra totala parametrar: ingen open-weights-modell med färre totala parametrar får högre poäng. Open-weights-ledaren i flash-nivån på AA, DeepSeek V4 Flash, får fortfarande högre poäng (Index 52 vid maximal resonemangsansträngning).
De agentiska och långkontextresultaten är också riktningsmässigt starka. På {{1}}AA:s τ3-Bench Banking-svit{{/1}} får {{2}}Ling-3.0-flash{{/2}} 27 %, tvåa bland flash-tier-modeller med öppna vikter, bakom {{3}}DeepSeek V4 Flash{{/3}} (39 %). På {{4}}GDPval-AA v2{{/4}} når den en Elo på 1108, upp från 545 för {{5}}Ling-2.6-flash{{/5}}. {{6}}Ant{{/6}} tränade modellen i över 10 000 interaktiva miljöer (leverantörsrapporterat) och marknadsför den som en exekveringsnod för agentiska arbetsflöden – snabb, billig och utbytbar, med den tunga resoneringen överlåten till en större flaggskeppsmodell.
En varning gällande källorna: benchmarktabellen på Ant’s modellkort — SWE-Bench Pro 56.6, SWE-bench Multilingual 72.4, MathArena AIME 2026 93.2, HLE 22.7 — är leverantörsrapporterad och har ännu inte oberoende reproducerats. Betrakta den som labbets egna påståenden, i samma kategori som topphastighetssiffrorna nedan.
Hastighet: mätt, sedan påstått.
Hastighetshistorien är nu två olika historier. Oberoende mäter {{1}}Artificial Analysis ungefär 368 tokens/sekund i utdata och en tid till första token på ~1,98 s på det förstaparts-API{{/1}} — genuint snabbt för en 5,1B-aktiv MoE, och tillräckligt för att ranka modellen nära toppen av sin klass när det gäller hastighet. Separat hävdar {{2}}Ant Group en genomsnittlig utdatahastighet på över 1 100 tokens/sekund på specificerade GPU-konfigurationer och en tid till första token på under 100 ms med ett hierarkiskt cachelager på klusternivå byggt på SGLang HiCache och Mooncake{{/2}}. Den andra uppsättningen siffror kommer enbart från leverantören — uppmätt på hårdvara och batchkonfigurationer som Ant kontrollerar, utan någon oberoende omkörning publicerad. För planering, använd AA-siffran; behandla 1 100+ tok/s som ett marknadsföringstak att verifiera på din egen arbetsbelastning.

Pris: billigt, och kampanjen är över
Artificial Analysis listar förstaparts-API:et till 0,075 USD per 1M inmatningstokens och 0,22 USD per 1M utmatning, med cacheträffar på 0,015 USD (−80%) — allt är prissättning som satts av leverantören. Den kostnadsfria lanseringsnivån (500k gratis tokens/dag, gratis API-åtkomst) upphörde den 3 augusti, och Ant genomförde en tillfällig period med 75% rabatt på sin Ling Studio till och med den 31 augusti 2026, varefter listpriserna gäller. Även till fullt listpris hamnar Ling-3.0-flash med 0,075/0,22 USD definitivt i den billiga klassen för en modell med ett Index på 38.
Vid så låga priser spelar bytekostnaden större roll än priset per token. OrcaRouter finns för att göra bytet billigt: ett API för 200+ modeller, leverantörernas listpriser förs vidare utan påslag, och automatisk failover mellan leverantörer — så att när en nyöppnad modell som denna ser bra ut på pappret kan du testa den mot din verkliga arbetsbelastning utan ett andra avtal, och falla tillbaka på en annan modell bakom samma nyckel om den underpresterar på en specifik uppgift.
Familjen Ling / Ring / Ming
Ling-3.0-flash existerar inte i isolering — InclusionAI organiserar sina releaser i tre namngivna familjer, som vardera är avsedd för en annan uppgift. Ling är den generella MoE-linjen för vardaglig textgenerering och verktygsanrop, och Ling-3.0-flash ligger i dess snabba/billiga ände, ett steg under förra generationens flaggskepp med 1T-parametrar. Ring är den resonemangsinriktade linjen, byggd för kedjetänkande i flera steg. Ming är den multimodala linjen. Om din uppgift kräver tyngre resonemang eller bildinmatning är rätt InclusionAI-modell förmodligen inte Ling-3.0-flash — den är byggd för volym och hastighet inom text-och-verktygsspåret.
Vem det är till för: tre scenarier
1. Högvolym-, latenskänsliga text- eller verktygsanrops-pipelines
Det här är modellens hemmaplan. Med ett oberoende Index på 38, en MIT-licens och cirka 368 uppmätta tok/s är satsningen på den snabba nivån nu testbar snarare än hypotetisk — du kan köra ditt eget utvärderingsset genom den, eller hämta vikterna och self-hosta. Bygg bara inte runt leverantörens tak på 1 100+ tok/s innan du har mätt det på din arbetsbelastning.
2. Team som vill ha lång kontext med en begränsad budget
En nativ kontext på 256K (262K levererad) med en angiven väg till 1M, för $0,075/$0,22, är en attraktiv kombination för hämtningsintensivt eller dokumentbearbetande arbete. Modellkortets uppgifter om lång kontext är rapporterade av leverantören, så jämför modellen mot etablerade alternativ med lång kontext och verifiera mot din egen korpus innan du förbinder dig.
3. Bevakare som följer Kinas MoE-landskap och InclusionAI:s färdplan.
Frågan i juli — skulle InclusionAI förbli öppen? — har nu ett svar: ja, MIT, och snabbt. Att Ling-3.0-flash landar på AA Pareto-fronten med 5,1B aktiva är en datapunkt för alla som följer hur kinesiska labb konkurrerar med effektivitet snarare än rå parametervolym.
Vad är fortfarande overifierat?
En kort lista, nu när de stora luckorna är tillslutna. Leverantörens topphastighetsanspråk (1 100+ tok/s, under 100 ms TTFT) har inte oberoende mätts på nytt. Modellkortets benchmarktabell är leverantörsrapporterad. FP4/INT4-varianterna och den enda DGX-Spark-distributionsvägen är leverantörsangivna. Och när det gäller kunskap visar AA:s Omniscience Index att förbättringen jämfört med föregående generation till stor del kom genom avhållsamhet – hallucinationer minskade (97 % → 44 %) medan träffsäkerheten bara ökade något (16 % → 18 %) – så missta inte det stora Index-hoppet för ett genomgripande kunskapssprång.
När du inte ska använda det
Hoppa över Ling-3.0-flash för multimodalt arbete — det är Ming-linjen. Hoppa över den om du behöver ett tungt resonemangsflaggskepp snarare än en snabb utförare — det är Rings område. Om du planerar att self-hosta, budgetera för den verkliga hårdvaran: BF16 är ungefär 255 GB, FP8 ungefär 128 GB. Och om ett påstående är viktigt för dig, verifiera det — topphastighets- och långkontextsiffrorna är Ants tills ett oberoende labb kör om dem.
FAQ
Är Ling-3.0-flash öppen vikt?
Ja. Vikterna släpptes som öppen källkod den 7 augusti under MIT-licensen, på Hugging Face (inclusionAI/Ling-3.0-flash) och ModelScope. Det är en tillåtande, kommersiellt användbar licens — samma som Ling 2.0 och Ling 2.6 släpptes under.
Hur presterar Ling-3.0-flash på benchmark?
Artificial Analysis mäter ett intelligensindex på 38, upp 24 poäng från Ling-2.6-flash, och placerar modellen på Pareto-fronten för öppna vikter när det gäller intelligens kontra totala parametrar. Benchmark-tabellen på Ants modellkort (till exempel SWE-Bench Pro 56.6) är leverantörsrapporterad och har inte oberoende reproducerats.
Hur snabbt är det egentligen?
Artificial Analysis mäter ungefär 368 tokens/sek i utdata med en tid till första token på ~1,98 s på förstaparts-API:t. Ant hävdar en toppgenomströmning på 1 100+ tokens/sek och under 100 ms TTFT på angivna GPU-konfigurationer – det är leverantörssiffror utan oberoende omätning.
Vad kostar Ling-3.0-flash?
AA listar det första parts-API:et till $0.075 per 1M inmatningstokens och $0.22 per 1M utmatning, med 80 % rabatt vid cacheträff. Den kostnadsfria startnivån avslutades den 3 augusti, och en tillfällig 75%-rabattperiod på Ling Studio pågår till och med den 31 augusti 2026.
Hur stor är kontextfönstret?
256K nativt, tillhandahållet med 262 144 tokens; Ant hävdar att arkitekturen skalar till 1M. Maximal utdatalängd är inte offentliggjord.
Vad är skillnaden mellan Ling, Ring och Ming?
Ling är InclusionAIs allmänna text- och verktygsanrops-MoE-linje, och Ling-3.0-flash ligger i dess snabba/billiga ände. Ring är den resonemangsfokuserade linjen. Ming hanterar multimodala uppgifter. De är separata familjer för olika uppgifter, inte nivåer av en modell.
Är Ling-3.0-flash samma som det tidigare 1T-flaggskeppet?
Nej. Ling-3.0-flash är den nyare, mindre snabbtier-utgåvan (124B totalt / 5,1B aktiva). Den tidigare generationens flaggskepp med 1T parametrar förblir den större modellen.
Bör jag använda Ling-3.0-flash i produktion idag?
Mer försvarbart än det var i juli, nu när det finns ett oberoende resultat och en MIT-licens. Kör ditt eget utvärderingsset först, verifiera leverantörens hastighetspåståenden mot din arbetsbelastning och välj mellan API:t och egen hosting (FP8 körs i cirka 128 GB). De återstående leverantörsspecifika siffrorna är tillräckligt begränsade för att man ska kunna planera kring dem.
Slutsats
Ling-3.0-flash gick från “specifikationsblad och leverantörspåståenden” till “öppna vikter och oberoende utvärderade” på två veckor. Ett AA Intelligence Index på 38 med 5.1B aktiva parametrar — på den öppna vikt-Pareto-fronten, MIT-licensierad, till $0.075/$0.22 — gör den till en av de mest effektiva öppna viktmodellerna du kan peka på just nu, och en som du faktiskt kan köra själv. Förbehållen är snävare än de var: topphastighets- och modellkortssiffrorna är fortfarande Ants tills ett oberoende labb återskapar dem. För stora volymer text och verktygsanrop till detta pris har den förtjänat en riktig utvärdering.

