
Ling-3.0-flash: Vad vi faktiskt vet om Ant Groups nya Fast-Tier MoE (och vad vi inte vet)
- qwenNYQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 per 1M tokens · 56 tok/s
- deepseekNYDeepSeek: DeepSeek V4 Flash 07312026-07-3150Intelligens69Kodning
- qwenNYQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens · 199 tok/s
- orcaNYOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNYAnthropic: Claude Opus 52026-07-2461Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2150Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1651Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1557Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligens77Kodning
- grokxAI: Grok 4.52026-07-0854Intelligens72Kodning
- tencentTencent: Hy32026-07-0641Intelligens59Kodning
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligens42Kodning
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligens39Kodning
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligens72Kodning
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligens52Kodning57Matematik
- z-aiZ.ai: GLM 5.22026-06-1651Intelligens69Kodning60Matematik
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligens61Kodning61Matematik
Ant Groups InclusionAI-labb släppte Ling-3.0-flash omkring den 23 juli 2026 – vilket innebär att den bara är ett par dagar gammal när denna notis skrivs. Det är en mixture-of-experts (MoE)-språkmodell med totalt 124B parametrar och cirka 5,1B aktiva per token (cirka 24:1 sparsitetsförhållande), byggd för textgenerering och verktygsanrop. Den positioneras som den snabba, billiga nivån i Ling-familjen; flaggskeppet är fortfarande den mycket större Ling-2.6-1T (1T totalt / 63B aktiva). Tillgången är i dag endast via API – via Ants egen utvecklarportal, via OpenRouter som inclusionai/ling-3.0-flash och via ZenMux.
Det är den fullständiga bekräftade bilden, och det är värt att vara öppen med varför denna sammanfattning läses mer försiktigt än en typisk modellgenomgång. Det finns inga Hugging Face-vikter, inget GitHub-repository för Ling-V3 och ingen tydlig licensangivelse – en verklig förändring från Ling 2.0 och Ling 2.6, som båda levererades som öppna vikter under MIT. Det finns inte heller några oberoende riktmärkesdata av något slag: Artificial Analysis, den mest citerade tredjepartsutvärderaren för denna modellklass, har ännu ingen sida för den. Alla prestanda- och hastighetssiffror som cirkulerar just nu härrör från Ant Group själva.
TL;DR. Ling-3.0-flash är en 124B/5.1B-aktiv MoE-modell från Ant Groups InclusionAI, som släpptes inom de senaste dagarna, endast API utan Hugging Face-vikter och med en obekräftad licens. Leverantörens påståenden — 1000 tokens/sek toppgenomströmning, under 100 ms tid-till-första-token — har ännu inte oberoende verifierats, och det finns inget Artificial Analysis-poäng för denna specifika modell. Föregående generation Ling-2.6-flash fick ett Artificial Analysis Intelligence Index på endast 14 (Ling-2.6-1T fick 26), vilket är användbar kontext men inte en ersättning för 3.0-flashs verkliga kapacitet. Prissättning (¥0,40 in / ¥1,20 ut per 1M tokens, för närvarande gratis under lanseringsveckan med 500k gratis tokens/dag) är uttryckligen reklam och kommer sannolikt att ändras. Behandla allt här som en förhandsvisning, inte ett slutgiltigt omdöme.
Viktiga slutsatser
• Det är den snabba/billiga nivån, inte flaggskeppet. Ling-2.6-1T förblir InclusionAI:s största modell; Ling-3.0-flash är ett mindre, billigare, snabbare syskon som är avsedd för högvolymanvändning.
• Det finns ännu inget oberoende benchmark.Artificial Analysis har ingen sida för Ling-3.0-flash. De enda offentliga siffrorna är Ant Groups egna, och Ants dokument visar för närvarande ingen benchmarktabell för denna modell överhuvudtaget.
• Hastighetspåståenden kommer endast från leverantören. Topp på 1000 tokens/sekund och under 100 ms tid-till-första-token kommer från Ant Group, utan något tredjepartstest för att bekräfta någon av siffrorna.
• Inga öppna vikter, licensen obekräftad. Det finns inget Hugging Face-repo och inget GitHub Ling-V3-projekt. Tidigare Ling-generationer var MIT-licensierade; om 3.0-flash kommer att följa är okänt.
• Prissättningen är en kampanj under lanseringsveckan. Avgiften på ¥0.40/¥1.20 per 1M tokens på Ants plattform är för närvarande efterskänkt, med 500k gratis tokens per dag och en gratis OpenRouter-notering — inget av detta bör antas fortsätta gälla efter att kampanjen avslutas.
• Det är en del av en familj med tre modeller. InclusionAI delar upp sitt sortiment i Ling (allmänt MoE, denna modell), Ring (resonemangsfokuserad) och Ming (multimodal).
En anmärkning om hur denna kortfattade text ska läsas: varje specifikation, riktmärke och pris nedan är märkt med källa. Där Ant Group är den enda källan, anger vi det tydligt och reserverar oss därefter. Där tidigare generationers Ling-modeller har oberoende poäng, citerar vi dem för kontext — inte som en ersättning för data om Ling-3.0-flash själv, som ännu inte finns. Detta kommer troligen att behöva en uppföljning när oberoende tester hinner ikapp.
Vad vi faktiskt vet
Arkitekturmässigt är Ling-3.0-flash en gles MoE-modell: totalt 124B parametrar, med ungefär 5,1B aktiva på en given token, vilket gör den billig och snabb att köra i förhållande till sin totala storlek. Kontextfönstret är 256K tokens enligt Ants egen dokumentation, med en leverantörsuppgift om att det går att utöka till 1M; OpenRouters lista visar 262 144 tokens, vilket stämmer överens med siffran 256K. Maximal utdatalängd är inte offentliggjord någonstans vi kunde hitta. Modellen stöder standardtextgenerering och anrop av verktyg, men ingen multimodal in- eller utmatning har nämnts – den funktionen finns i den separata Ming-linjen.
När det gäller tillgänglighet är bilden endast API och konsekvent över de tre rutter vi hittade: Ant Groups egen utvecklarplattform, OpenRouter (listad som inclusionai/ling-3.0-flash) och ZenMux. Ingen av dessa exponerar nedladdningsbara vikter. Det finns ingen GitHub-organisationssida för ett "Ling-V3"-projekt, och Ants dokumentation anger ingen licens för denna specifika modell – en betydande lucka, eftersom Ling 2.0 och Ling 2.6 båda släpptes som öppna vikter under MIT. Tills InclusionAI förtydligar detta, anta inte att Ling-3.0-flash kommer att bli öppen, och anta inte att den inte kommer det.

Luckorna: det som inte är verifierat
Den största luckan är benchmarks. I skrivande stund har Artificial Analysis — den oberoende utvärderaren som oftast citeras just för denna typ av modell — ingen sida för Ling-3.0-flash; URL-mönstret som normalt skulle visa den returnerar en 404. Det innebär att det för närvarande inte finns något tredjepartsresultat för resonemang, kodning eller matematik för denna modell, från Artificial Analysis eller någon annan oberoende utvärderare vi kunde hitta. Ants egen dokumentation förvärrar detta: den publicerar ingen benchmarktabell för 3.0-flash överhuvudtaget, vare sig från leverantör eller annan, vilket är ovanligt för en modellrelease och värt att påpeka i sig.
För en grov kontext: tidigare generationers Ling-modeller har oberoende poäng. Ling-2.6-flash hade ett Artificial Analysis Intelligence Index på 14, och den större Ling-2.6-1T fick 26 — båda långt efter de ledande öppna viktmodellerna som Artificial Analysis följde vid den tiden. Ants egna leverantörssiffror för Ling-2.6-flash påstod 61,2% på SWE-bench Verified och 73,85% på AIME2026. Inget av dessa siffror bör direkt överföras på Ling-3.0-flash; en ny generation med en ny arkitektur kan röra sig i båda riktningarna, och tills en oberoende utvärderare faktiskt kör den, är varje förmågepåstående för 3.0-flash en gissning klädd som ett faktum.
Leverantörers hastighetsanspråk: snabba på pappret, overifierade i praktiken.
Ant Groups marknadsföringspitch för Ling-3.0-flash handlar inte om resonemangskvalitet — det är rå hastighet. Leverantören hävdar en toppgenomströmning på 1000 tokens per sekund och en tid-till-första-token under 100 millisekunder, vilket båda skulle vara genuint snabba om det bekräftades. Men "om det bekräftades" gör verkligt arbete i den meningen: dessa siffror kommer uteslutande från Ant Groups egna material, uppmätta under förhållanden som Ant kontrollerar och inte fullt ut har redovisat (hårdvara, batchstorlek, promptlängd och belastning påverkar alla genomströmningstal avsevärt). Ingen oberoende labb har publicerat en omätning. Förrän någon utanför Ant kör ett jämförbart test, behandla 1000 tok/s och sub-100ms TTFT som marknadsföringssiffror värda att kontrollera mot din egen arbetsbelastning, inte som fastställda fakta.

Prissättning, och varför det är ett rörligt mål
På Ant Groups egen plattform är listpriset för Ling-3.0-flash ¥0,40 per 1M inmatningstokens och ¥1,20 per 1M utmatningstokens – billigt av design, i linje med dess positionering som den snabba/billiga nivån. Men det listpriset är inte vad någon faktiskt betalar just nu: Ant kör en gratis lanseringsveckokampanj och erbjuder separat 500k gratis tokens per dag på sin plattform. OpenRouters lista visar en ling-3.0-flash:free-variant till $0/$0. Inget av detta bör misstas för ett stabilt pris. Lanseringskampanjer löper ut, gratissnivåer får tak, och själva siffrorna ¥0,40/¥1,20 kan ändras när verklig användningsdata kommer in. Om du planerar produktionsutgifter kring denna modell, budgetera mot listpriset, inte kampanjpriset, och dubbelkolla innan du förbinder dig.
Familjen Ling / Ring / Ming
Ling-3.0-flash existerar inte i ett vakuum – InclusionAI organiserar sina releaser i tre namngivna familjer, var och en inriktad på olika uppgifter. Ling är den allmänna MoE-linjen, som hanterar vardaglig textgenerering och verktygsanrop; Ling-3.0-flash ligger i den snabba/billiga änden av den, medan Ling-2.6-1T fortfarande är den större flaggskeppsmodellen. Ring är InclusionAI:s resonemangsinriktade linje, byggd för uppgifter som förlitar sig på flerstegs chain-of-thought snarare än rå genomströmning. Ming är den multimodala linjen, som hanterar bilder och andra icke-textuella modaliteter som Ling själv inte rör. Om din uppgift kräver tyngre resonemang eller multimodal input, är rätt InclusionAI-modell troligen inte Ling-3.0-flash – den är byggd för volym och hastighet inom text-och-verktygsfältet, inte för att sträcka sig in i de andra två familjernas territorium.
Vem det är för: tre scenarier
1. Högvolymiga, latenskänsliga text- eller verktygsanropande pipelines — som en pilot, inte ett åtagande.
Om din arbetsbelastning domineras av genomströmningskänslig textgenerering eller verktygsanrop – chatt, lätta agenter, högfrekventa API-anrop – gör Ling-3.0-flashs positionering (litet antal aktiva parametrar, påstådd sub-100ms TTFT, nästan gratis lanseringspris) det värt att prova. Haken är att "värt att prova" skiljer sig från "värt att byta produktionstrafik till." Utan oberoende riktmärkesdata är du själv riktmärket just nu: kör din egen utvärderingsuppsättning genom den innan du litar på den med något kundvändande, och bygg inte kostnadsmodeller kring det nuvarande kampanjpriset.
2. Team som behöver lång kontext på en budget
Ett 256K kontextfönster (med en leverantörs påstående om utökbarhet till 1M) till ett genuint lågt listpris är en attraktiv kombination för sökintensiva eller dokumentbearbetande användningsfall, förutsatt att modellens faktiska resonemangskvalitet håller över den kontextlängden — vilket, återigen, ingen oberoende källa har testat. Detta är en rimlig kandidat att shortlista tillsammans med etablerade billiga långkontextalternativ, men den bör utvärderas sida vid sida med dem snarare än antas enbart på grundval av Ants specifikationsblad.
3. Bevakare som följer Kinas MoE-landskap och InclusionAI-färdplanen.
För team som följer det konkurrensutsatta landskapet av kinesiska öppna och halvöppna modellabb, snarare än att distribuera en enskild modell i produktion, är Ling-3.0-flash en användbar datapunkt: det signalerar att InclusionAI itererar snabbt på sin snabba nivå, potentiellt tar ett steg tillbaka från öppna vikter (åtminstone för nu), och fortsätter att satsa på en trefamiljsstruktur (Ling/Ring/Ming) snarare än en allmän modell. Värt att bokmärka och återkomma till när riktmärke och licenstydlighet kommer.
När du inte ska använda det
Hoppa över Ling-3.0-flash för allt där du behöver citera en verifierad kapacitetspåstående — det finns inget oberoende riktmärke att hänvisa till, så varje påstående om dess resonemang, kodning eller matematiska förmåga är för närvarande ofalsifierbart. Hoppa över det om du behöver öppna vikter för egen hosting, finjustering eller efterlevnadsskäl; det finns inga tillgängliga, och licensen för denna specifika modell har inte ens angetts, än mindre bekräftats som tillåtande. Hoppa över det för multimodala uppgifter — det är Ming-linjens uppgift, inte Lings. Och var försiktig med att bygga en kostnadsmodell kring dagens prissättning: den kostnadsfria lanseringsveckan, de 500 000 kostnadsfria dagliga tokenen och den kostnadsfria OpenRouter-nivån är alla marknadsföringsåtgärder, och listpriset på ¥0,40/¥1,20 som det sannolikt kommer att återgå till har inte heller testats mot verkliga användningsmönster.
FAQ
Är Ling-3.0-flash öppen vikt?
Inte för närvarande. Det finns inget Hugging Face-repo och inget GitHub Ling-V3-projekt i skrivande stund. Tidigare Ling-generationer (2.0 och 2.6) släpptes under MIT som öppna vikter, men inget bekräftar att Ling-3.0-flash kommer att följa det mönstret — eller att det inte kommer att göra det.
Hur presterar Ling-3.0-flash på benchmark?
Det finns inget oberoende riktmärke för det än — Artificial Analysis har ingen sida för denna modell. Ant Groups egen dokumentation publicerar inte heller någon riktmärkestabell för den. Som grov historisk kontext, den tidigare generationen Ling-2.6-flash fick ett Artificial Analysis Intelligence Index på 14, och Ling-2.6-1T fick 26, men inget av dessa siffror bör antas gälla för denna nya generation.
Hur snabbt är det egentligen?
Ant Group påstår en toppgenomströmning på 1000 tokens/sekund och en tid-till-första-token på under 100 ms. Båda är leverantörsspecifika siffror utan oberoende omätning publicerad hittills. Behandla dem som påståenden att verifiera med din egen arbetsbelastning, inte bekräftad prestanda.
Vad kostar Ling-3.0-flash?
Listpriset på Ants plattform är ¥0,40 per 1M inmatningstoken och ¥1,20 per 1M utmatningstoken, men det är för närvarande gratis under en lanseringsveckas kampanj, med 500k gratistoken/dag också tillgängligt. OpenRouter listar också en gratis variant. Förvänta dig att dessa kampanjvillkor ändras.
Hur stor är kontextfönstret?
256K tokens enligt Ants dokumentation, med ett leverantörspåstående om att den kan utökas till 1M. OpenRouters lista visar 262 144 tokens, vilket överensstämmer med siffran 256K. Maximal utdatalängd är inte angiven.
Vad är skillnaden mellan Ling, Ring och Ming?
Ling är InclusionAIs allmänna text- och verktygsanrops-MoE-serie, och Ling-3.0-flash är dess snabba/billiga ände. Ring är den resoneringsfokuserade serien. Ming hanterar multimodala uppgifter. De är separata modellfamiljer byggda för olika jobb, inte nivåer av samma modell.
Är Ling-3.0-flash samma som Ling-2.6-1T?
Nej. Ling-2.6-1T är InclusionAIs större flaggskepp (1T totalt / 63B aktiva parametrar) och förblir en separat, större modell. Ling-3.0-flash (124B totalt / ~5.1B aktiva) är den nyare, mindre, snabbare versionen.
Bör jag använda Ling-3.0-flash i produktion idag?
Endast efter att du har utfört din egen utvärdering. Utan något oberoende riktmärke, en obekräftad licens och prissättning som för närvarande är kampanj, är det rimligt att testa men för tidigt att lägga produktionskritiska eller regelefterlevnadskänsliga arbetsbelastningar på det utan egen testning och en plan för vad som händer när kampanjvillkoren upphör.
Slutsats
Ling-3.0-flash är en genuint ny utgåva värd att följa — en 124B/5.1B-aktiv MoE-modell som riktar sig direkt mot snabb, billig text- och verktygsanropsarbete i hög volym, från ett labb som tidigare har levererat trovärdiga modeller. Men just nu är det en specifikationsblad och en uppsättning leverantörspåståenden, inte en verifierad produkt: inget oberoende riktmärke, inga öppna vikter, ingen bekräftad licens, och kampanjprissättning som är uttryckligen sådan. Det är inte en anledning att avfärda det — det är en anledning att testa det försiktigt, verifiera de påståenden som är viktiga för dig direkt, och återkomma till denna korta text när Artificial Analysis eller en annan oberoende utvärderare publicerar verkliga siffror.

