
Ling-3.1-flash når 41 på Artificial Analysis Intelligence Index: 560B-MoE:n fördubblar sin föregångare
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Ling-3.1-flash, Ant Groups mixture-of-experts-modell med 560 miljarder parametrar, bär nu en siffra som dess eget labb inte skrev: 41 i Artificial Analysis Intelligence Index. Indexet drivs av den oberoende utvärderaren, på hårdvara som utvärderaren kontrollerar, mot en fast testsvit – och det placerar modellen 21 poäng över dess egen direkta föregångare, Ling-3.0-flash, som fortfarande ligger på 20 i samma index. Ant meddelade Ling-3.1-flash i slutet av september 2026, Artificial Analysis daterar lanseringen till den 1 oktober, och den är tre månader yngre än den modell vars poäng den fördubblar.
Det gapet är själva historien. En rörelse på 21 punkter i ett sammanvägt index som tio olika utvärderingar matar in i är inte den sorts sak som ett leverantörsdiagram kan fejka, och det är inte den sorts sak som den här bloggen skulle ha kunnat skriva om för två veckor sedan, när det enda befintliga måttet på Ling-3.1-flash var Ants eget benchmark-kort: 1 673 Elo på GDPval-AA v2.1, 75,16 på FrontierSWE, 65,35 på HealthBench Professional. De siffrorna var verkliga påståenden från ett verkligt labb, men oreproducerade. 41:an är av ett annat slag. Det är den första siffran i den här utgåvan som en tredje part kan hållas till svars för.
Vad 41:an faktiskt mäter
The Artificial Analysis Intelligence Index v4.3.2 är ett viktat sammansatt mått av tio utvärderingar: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience och AA-LCR v1.1. Att läsa ett sammansatt mått isolerat är ett misstag, så raderna per utvärdering väger tyngre än rubriken:
• GDPval-AA — 1 621,75 för Ling-3.1-flash mot 948,35 för Ling-3.0-flash. Detta är det största enskilda hoppet i uppsättningen och det som större delen av indexrörelsen vilar på.
• GDP.pdf — 0,100 all-pass, upp från 0,054. Fortfarande lågt i absoluta tal, men nästan en fördubbling.
• AA-LCR v1.1 långkontextresonemang — 0,83 mot 0,73 för föregångaren, och i nivå med DeepSeek V4.1 Flash (Max) på 0,84.
• SciCode — 0,541 mot 0,420. En vinst inom kodvetenskap, inte en vinst i chattkvalitet.
• CritPt fysikresonemang — 0,180, mot 0,017 tidigare. Tio gånger föregångaren på en liten bas.
• AA-Omniscience — +2.22, mot −17.88 för Ling-3.0-flash. Den här diskuteras nedan, eftersom den talar emot rubriken.
Ling-3.0-flash förlorade inte bara mot Ling-3.1-flash på dessa rader; den kollapsade på två av dem. Den fick 0,032 på AutomationBench-AA och exakt 0,000 på Terminal-Bench 4.0. Det är kontexten i vilken 41:an bör läsas — föregångaren var en effektiv, billig modell med öppna vikter som i stort sett inte hade någon agentisk terminalkapacitet alls.

Varifrån vinsten kom: agentiskt arbete, inte konversation
Jämför Ling-3.1-flashs indexbidrag med de två modeller på Flash-nivå som den oftast ställs bredvid, och ett mönster framträder som aggregatet döljer. DeepSeek V4.1 Flash (Max) får 39 på samma index och GLM 5.3 Flash får 42, så alla tre hamnar inom ett spann på tre punkter. Men de kommer dit från olika håll.
• Agentiskt terminalarbete — Ling-3.1-flash 0,333 på Terminal-Bench 4.0, DeepSeek V4.1 Flash (Max) 0,268, GLM 5.3 Flash 0,328.
• Agentiskt arbete i verkligheten — Ling-3.1-flash 1 621,75 Elo på GDPval-AA, DeepSeek V4.1 Flash (Max) 1 600, GLM 5.3 Flash 1 646,86.
• AutomationBench-AA — Ling-3.1-flash 0.617, DeepSeek V4.1 Flash (Max) 0.689, GLM 5.3 Flash 0.604.
• Kodningsvetenskap — Ling-3.1-flash 0.541 på SciCode, DeepSeek V4.1 Flash (Max) 0.519, GLM 5.3 Flash 0.516.
Den snäva läsningen är att Ling-3.1-flash är konkurrenskraftig på agentiska benchmarks och något före på SciCode. Den användbara läsningen är att den är starkast av de tre på de två agentiska terminalmåtten som de flesta menar när de säger ”kan den driva en verktygsloop” – och att den ligger efter båda de andra på kunskapstillförlitlighetsmåttet. Det är en specifik profil, inte en generell vinst, och det är värt att sätta ord på innan någon köper en arbetsbelastning enbart utifrån indexsiffran.
Räkningen som kommer med en större modell
Ling-3.0-flash prissattes till $0,07 per miljon indatatokens och $0,22 per miljon utdatatokens på Ants eget API, och den hade öppna vikter under MIT. Ling-3.1-flash är ännu inte något av detta. Artificial Analysis anger dess löpande kostnad till $0,30 per miljon indata och $0,90 per miljon utdata – med ett cacheträffspris på $0,06, en rabatt på 80 % på indata – mätt mot InclusionAIs eget API som tjänsteleverantör. Det är ungefär en fyrdubbling av indatapriset jämfört med modellen den ersätter, för en indexökning på 21 punkter.
Om den avvägningen är bra beror helt och hållet på arbetsbelastningen, och indexet självt kan prissätta den: att köra alla tio Intelligence Index-utvärderingar mot Ling-3.1-flash kostar omkring $960 vid dessa taxor, mot ungefär $477 för DeepSeek V4.1 Flash (Max) och $280 för GLM 5.3 Flash. Anledningen är inte bara prislistan. Ling-3.1-flash är en mycket pratsam resonerare – den brände 220 miljoner output-tokens när den arbetade sig igenom indexet, långt över medianen för sin prisklass, och dess utvärderingskörningar tar i genomsnitt cirka 357 sekunder per uppgift mot 285 sekunder för DeepSeek V4.1 Flash (Max) och 979 sekunder för GLM 5.3 Flash. Per uppgift kostar Ling-3.1-flash cirka $0.99 mot DeepSeeks $0.27 och GLM 5.3 Flashs $0.25.
Inget av detta syns från 41:an, och allt landar på fakturan. En modell kan vinna ett index och förlora en budget.
De två siffrorna som talar emot rubriken
Det första är kunskapstillförlitlighet. Ling-3.1-flash får +2,22 på AA-Omniscience, som mäter huruvida en modell vet vad den vet: korrekta svar ger poäng, hallucinationer kostar poäng och vägran kostar inget. Dess träffsäkerhet är 29,1 % och hallucineringsfrekvensen 37,9 %. Jämfört med sina modellsyskon är detta den svagaste profilen i gruppen – GLM 5.3 Flash får +7,47 med en hallucineringsfrekvens på 27,6 %, och DeepSeek V4.1 Flash (Max) får −5,30 med en häpnadsväckande hallucineringsfrekvens på 96,5 % bland besvarade frågor. Kompositmåttet belönar Ling-3.1-flash för den förmåga den uppvisar, inte för den tillförlitlighet med vilken den uppvisar den, och en modell som hittar på en tredjedel av det den påstår behöver retrieval runt sig i produktion.
Det andra är kontext. Artificial Analysis listar Ling-3.1-flash med ett kontextfönster på 1 000 000 token. Ants eget lanseringsmaterial anger också 1M som målet. Men Ants utvecklardokumentation, som räknar upp familjens fönster modell för modell, ger Ling-3.0-flash ett inbyggt 256K som kan utökas till 1M och har ännu inte någon post för Ling-3.1-flash över huvud taget. Den utmärkande långkontextraden som faktiskt mättes – AA-LCR på 0,83 – är en poäng för resonemang över lång kontext, inte en mätning av det serverade fönstret. Betrakta 1M som det deklarerade taket och validera det levererade fönstret med din egen långkontextbegäran innan du designar runt det.
Hur det står sig på specifikationsbladet
Bilden dimension för dimension, subjektet först, för var och en:
• Totalt antal parametrar — Ling-3.1-flash 560B vs DeepSeek V4.1 Flash (Max) 552B vs GLM 5.3 Flash 320B.
• Aktiva parametrar per token – Ling-3.1-flash 25B vs DeepSeek V4.1 Flash (Max) 16B vs GLM 5.3 Flash 18B. Ling-3.1-flash aktiverar flest, vilket är en anledning till att dess serveringskostnad ligger där den ligger.
• Vikter och licens — Ling-3.1-flash inte publicerad (proprietär, ingen licenstext) vs DeepSeek V4.1 Flash (Max) öppen under MIT vs GLM 5.3 Flash öppen under MIT.
• Angivet kontextfönster — Ling-3.1-flash 1M vs DeepSeek V4.1 Flash (Max) 1M vs GLM 5.3 Flash 1M. Alla tre hävdar samma övre gräns; bara två av dem har en nedladdningsbar checkpoint att verifiera det mot.
• Modalitet — Ling-3.1-flash text in, text ut vs DeepSeek V4.1 Flash (Max) text och bild in vs GLM 5.3 Flash text, bild och video in. Detta är den enda axeln där Ling-3.1-flash helt enkelt ligger efter, och ingen benchmark-rad kompenserar för det.
• Pris för leverantörens API — Ling-3.1-flash $0.30 / $0.90 per miljon indata / utdata vs DeepSeek V4.1 Flash (Max) $0.30 / $1.20 vs GLM 5.3 Flash $0.15 / $0.50.
• Indexpoäng — 41 mot 39 mot 42. En spridning på tre poäng i en jämförelse mellan tre är inte en rangordning; det är ett oavgjort resultat som avgörs av vilken utvärdering läsarens arbetsbelastning råkar likna.
Där du kan ringa det
Ling-3.1-flash finns inte i OrcaRouters katalog idag — en sökning mot vårt publika modell-API för modellen under InclusionAI returnerar not-found, och vi kommer inte att antyda något annat. Den körs för närvarande på Ants eget API och på tredjepartsplattformar som tillhandahåller utgåvan, vilket är den ärliga omfattningen av dess tillgänglighet. Det som är värt att notera för den som jämför de tre modellerna ovan är att de andra två går att dirigera just nu: DeepSeek V4.1 Flash och GLM 5.3 Flash finns båda i OrcaRouters katalog till sina leverantörers listpriser med noll påslag, bakom en enda API-nyckel, med automatisk failover mellan dem. Om jämförelsen ovan säger att din arbetsbelastning bryr sig mer om kunskapstillförlitlighet än om agentiskt terminalarbete, är GLM 5.3 Flash den att prova — och du kan prova den mot DeepSeek V4.1 Flash med samma nyckel utan ett andra avtal eller en rad ny klientkod.
Vad 41 ändrar, och vad det inte gör
Det som förändras är släppets status. Ling-3.1-flash är inte längre en specifikation med ett leverantörsdiagram bifogat; det är en modell med en oberoende uppmätt position, och den positionen är ett äkta generationskliv i agentisk förmåga jämfört med Ling-3.0-flash – den sorts hopp som kommer från en designändring snarare än mer beräkningskraft enligt samma recept. Det som inte förändras är något när det gäller upphandling. Vikterna är fortfarande stängda, licensen är fortfarande oskriven, modaliteten är fortfarande endast text, och priset är ungefär fyra gånger så högt som föregångarens för en förbättring som är koncentrerad till agent- och terminaluppgifter.
Om ditt arbete handlar om agentloopar, verktygsdrivning och långa verktygskedjor är 41 det mest betydelsefulla nummer som hittills släppts om den här modellen, och det förtjänar en seriös titt medan tillgängligheten fortfarande utökas. Om ditt arbete är multimodalt, eller kunskapskritiskt frågebesvarande, eller budgetkänslig högvolymsinferens, når 41 inte fram till ditt problem – och GLM 5.3 Flash, som redan kan routas och redan är öppen under MIT till halva utdatapriset, är den bättre positionerade modellen av de tre. Indexet berättar var Ling-3.1-flash står. Det berättar inte om du bör bry dig, och den frågan besvaras av vad du bygger.


Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
