Genererat redaktionellt hero-kort med rubriken "Ling-3.1-flash vs Ling-3.0-flash" och underrubriken "Den ena går att ladda ner i dag. Den andra är en mening i ett pressinlägg." Två jämförelsekolumner: "Ling-3.1-flash (annonserad)" listar "~560B totalt / ~25B aktiva", "kontext på upp till 1M tokens" och "inga vikter, ingen licens"; "Ling-3.0-flash (släppt)" listar "124B totalt / 5,1B aktiva", "serverad kontext på 262 144 tokens" och "MIT-vikter på Hugging Face".
Guides & Insights

Ling-3.1-flash vs Ling-3.0-flash: Vad ett fönster på 1 miljon tokens och 4,5 gånger så många parametrar faktiskt förändrar

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Ant Groups Ling-familj har en ny snabb nivå, och den här gången är den bara en mening gammal. Ling-3.1-flash tillkännagavs den 30 september 2026 – ungefär 560 miljarder parametrar totalt, omkring 25 miljarder aktiva per token, ett kontextfönster som anges till upp till 1 miljon tokens, och en standardfras bifogad: "Vi planerar att snart göra modellen till öppen källkod." Modellen den ersätter i toppen av den snabba linjen, Ling-3.0-flash, är ett helt annat djur i alla avseenden: 124 miljarder parametrar totalt, 5,1 miljarder aktiva per token, ett serverat kontextfönster på 262 144 tokens, MIT-licensierade vikter på Hugging Face sedan 7 augusti, och ett oberoende Artificial Analysis Intelligence Index på 20. En av dessa modeller kan du ladda ner idag. Den andra kan du läsa om. Att jämföra dem är verkligen användbart, men bara om jämförelsen börjar där.

Rubrikaritmetiken är enkel och lite missvisande. Ling-3.1-flash har ungefär 4,5× det totala antalet parametrar som Ling-3.0-flash och ungefär 4,9× antalet aktiva parametrar — 25B mot 5,1B per token. En slarvig läsning säger "mycket större modell, alltså mycket smartare modell." Den mer noggranna läsningen är att Ant ungefär har bevarat sparsitetsförhållandet medan man skalade upp kroppen, och vad det ger dig är kapacitet, inte nödvändigtvis resonemangsdjup per token: en modell som routar 25B av sina 560B genom varje token utför mer arbete per token än en som routar 5,1B, men den betalar också ungefär fem gånger beräkningskraften per token för att göra det. Var den avvägningen landar beror helt och hållet på om Ants arkitektur hanterar de extra parametrarna effektivt — och det är en fråga som tillkännagivandet inte besvarar.

De två modellerna, sida vid sida

Ställ de publicerade fakta bredvid varandra, så skiljs generationerna tydligt åt. Varje rad nedan anger vad Ant eller en oberoende utvärderare faktiskt har publicerat; där en siffra saknas, saknas den eftersom ingen har publicerat den.

• Totalt antal parametrar — Ling-3.1-flash: ~560B (leverantör). Ling-3.0-flash: 124B (modellkort).

• Aktiva parametrar per token – Ling-3.1-flash: ca 25B (leverantör). Ling-3.0-flash: 5,1B (modellkort).

• Kontextfönster — Ling-3.1-flash: upp till 1M tokens (leverantör). Ling-3.0-flash: 256K inbyggt, serveras vid 262 144 (modellkort och inferensrecept).

• Vikter och licens — Ling-3.1-flash: inte publicerade; inget arkiv, ingen licens (kontrollerat 30 september och igen 1 oktober 2026). Ling-3.0-flash: MIT, på Hugging Face som inclusionAI/Ling-3.0-flash och på ModelScope sedan 7 augusti 2026.

• Viktformat — Ling-3.1-flash: inga tillgängliga. Ling-3.0-flash: BF16 (~255GB) och FP8 (~128GB) från labbet, plus kvantiseringar från communityn.

• Benchmark-härkomst — Ling-3.1-flash: helt och hållet leverantörsrapporterad, ingen offentlig testrigg, inga vikter att köra om. Ling-3.0-flash: oberoende poängsatt av Artificial Analysis med ett Intelligence Index på 20, med uppmätt utdatahastighet och token-genereringsvolym publicerade vid sidan om.

• Tillgänglighet — Ling-3.1-flash: endast Ants egen produkt Ling Studio. Ling-3.0-flash: kan egenhostas, samt anropas via Ants utvecklar-API.

Headless capture of the Artificial Analysis model page for Ling 3.0 Flash. The page shows the model's stat strip with text input and text output, a 262k-token context window, 5.1B active parameters, and a written summary stating that Ling 3.0 Flash scores 20 on the Artificial Analysis Intelligence Index against a median of 8, generated 260M tokens during evaluation, is priced at $0.07 per 1M input tokens and $0.22 per 1M output tokens, and runs at 325 tokens per second.

Vad den extra kapaciteten förmodligen är till för

Ants egen enradsbeskrivning av Ling-3.1-flash är det mest informativa i släppet. Ling Studio-appen positionerar den mot "generella agenter, sökning, rutinmässigt kontorsarbete och mjukvaru-/kodutveckling" — en inramning kring kontorsarbete och agentiska användningsfall, inte en inramning kring resonemangsbenchmark. Det är förenligt med hur familjen är organiserad: Ling är den generella text- och verktygslinjen, Ring är resonemangslinjen och Ming hanterar multimodalt. Ling-3.0-flash innehade samma plats en generation tidigare, och den var uttryckligen den snabba, billiga nivån snarare än flaggskeppet.

Läs uppskalningen i det ljuset, så är den logisk. Agentiska och verktygsanropande arbetsbelastningar är långa, repetitiva och kontexthungriga: en enda agentloop kan bränna tiotusentals tokens med ackumulerad verktygsutdata innan den vidtar en åtgärd, så ett fönster på 1M tokens är ett funktionellt krav snarare än en prydnad i specifikationsbladet. Att skala upp det totala antalet parametrar samtidigt som man behåller en stor aktiv andel är hur man lägger till världskunskap och djup i instruktionsföljning till en modell som fortfarande måste vara tillräckligt snabb för att sitta inuti en loop. Ant bygger inte ett långsammare, smartare flaggskepp här; de bygger en större snabbnivå.

Motargumentet är kostnaden, och det är samma aritmetik som kommer från andra hållet. Den extra kapaciteten är inte gratis vid inferens – den betalas för varje token, och Ant har inte publicerat något pris för Ling-3.1-flash över huvud taget: ingen API-prislista, ingen cachediskon, inget jämförbart med de $0.075/$0.22 per miljon token som den föregående generationen listar. Det är den saknade siffran som skulle avgöra denna jämförelse, och den saknas.

Prestandatester, och vem som körde dem

Ling-3.1-flash kommer med tre resultat som ser starka ut var för sig: 1 673 Elo på GDPVal-AA v2.1, 75,16 på FrontierSWE och 65,35 på HealthBench Professional. Alla tre är Ants egna, hämtade från tillkännagivandet, och ingen av dem har reproducerats av ett externt laboratorium. Den praktiska konsekvensen är att de kan jämföras med andra leverantörers siffror men inte med oberoende sådana — och Artificial Analysiss 20-punkts Intelligence Index för Ling-3.0-flash är ett oberoende tal på en annan skala, så att ställa de två sida vid sida vore att jämföra en mätning med ett påstående. Det finns ingen sida för Ling-3.1-flash på Artificial Analysis när detta skrivs.

En fotnot i Ants eget diagram är värd att uppmärksamma i sig. Kortet anger att resultatet för HealthBench Professional utvärderades i "AQ-miljön" och att Ling-3.1-flashs sjukvårdsförmågor för närvarande endast kan upplevas i AQ. Ingen offentlig dokumentation förklarar vad AQ är. Ett rubrikresultat som åtföljs av en kvalificering om en icke namngiven miljö är inte något som ett utomstående team kan reproducera, ens när vikterna finns.

Vilken ska man egentligen använda den här veckan?

Generationsfrågan får olika svar beroende på vad du behöver idag, och för nästan alla är svaret just nu inte den nyare modellen.

Om du behöver köra något den här veckan är Ling-3.0-flash den enda av de två som finns i en användbar form: MIT-vikter som du kan hosta själv, FP8 om du vill ha det mindre utrymmesbehovet, publicerad prissättning för förstaparts-API och ett oberoende betyg som talar om vad du får. Det är en verkligt bra modell i sin klass — den oberoende utvärderingen placerade den på Paretofronten för öppna vikter när det gäller intelligens mot totalt antal parametrar, och betygsatte dess hastighet högt, med förbehållet att den är ovanligt ordrik och genererade omkring 260M tokens under utvärderingens gång, jämfört med en median på nära 100M.

Om du planerar för de kommande sex månaderna är Ling-3.1-flash färdriktningen och ännu inte en komponent. De specifika sakerna att hålla ögonen på innan den blir en sådan: huruvida vikterna faktiskt öppnas och under vilken licens, huruvida det serverade fönstret verkligen är 1M eller en förlängning av en kortare inbyggd kontext, vad det kostar per miljon tokens, och huruvida ett oberoende labb reproducerar 75.16 på FrontierSWE. Om något av detta blir verklighet vore det ett skäl att köra om jämförelsen. Inget har blivit verklighet.

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Bar-chart panels cover GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge, with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash as the comparison set. A footnote states HealthBench Professional was evaluated in the AQ environment.

Var detta passar in i en routingstack

Ingen av Ling-modellerna finns i vår katalog i dag – Ling-3.0-flash, Ling-3.0-flash-VL och Ling-3.1-flash returnerar alla not-found mot OrcaRouter-modellens API, så det ärliga svaret på "kan jag anropa den via er" är nej, för tillfället. Vad ett routinglager faktiskt är bra för en vecka som den här är den andra halvan av problemet: de modeller du skulle benchmarka en kandidat mot. Claude Opus 5, GPT-5.6 Sol och DeepSeek-V4.1-Flash är alla aktiva rutter till leverantörens listpris utan påslag, och en router som håller dem bakom en enda nyckel med automatisk failover är hur du håller ett utvärderingsramverk riktat mot ett rörligt mål utan att underhålla fyra integrationer. När Ling-3.1-flashs vikter landar och licensen är läsbar är det också formen på beslutet: lägg till en slutpunkt, inte bygg om stacken.

Generationsöversikten är kort. Ling-3.0-flash är en levererad, oberoende poängsatt modell med tillåtande licens som kan self-hostas idag. Ling-3.1-flash är ett större löfte med längre kontext och dyrare drift som Ant ännu inte har levererat i någon form som en utvecklare kan använda. Att behandla den andra som en uppgradering av den första är det misstag som den här utgåvan bjuder in till, och siffrorna stöder det ännu inte.

Generated two-lane information card. Top lane headed "Independently measured" holds "Ling-3.0-flash — AA Intelligence Index 20 (v4.3)" and "Ling-3.0-flash — 325 tokens/sec, 260M tokens generated". Bottom lane headed "Vendor-reported only" holds "Ling-3.1-flash — 1,673 Elo GDPval-AA v2.1", "Ling-3.1-flash — 75.16 FrontierSWE" and "Ling-3.1-flash — 65.35 HealthBench Professional (AQ environment, undefined)".