Genererat redaktionellt hero-kort med rubriken "Ling-3.1-flash är live och gratis i två veckor" och undertiteln "Vad 560B MoE faktiskt levererar idag". Fyra rundade kort visar "Parametrar: 560B totalt / ~25B aktiva", "Kontext: 262 144 tokens", "Gräns för utdata: 32 768 tokens" och "Vikter: ej publicerade", ovanför en sidfotsrad som lyder "Specifikationer enligt leverantören; inget publicerat pris efter provperioden."
Guides & Insights

Ling-3.1-flash är live och gratis i två veckor: Vad 560B MoE faktiskt levererar

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Ling-3.1-flash, den ungefär 560 miljarder parametrar stora mixture-of-experts-modellen som Ant Groups inclusionAI-lab meddelade den 29–30 september 2026, slutade vara ett pressmeddelande den här veckan: nu svarar den på förfrågningar via ett skarpt kommersiellt API. Modellen körs som en gratis provperiod på två veckor på en inferensgateway från tredje part, och den finns också i Ants egen produkt Ling Studio — vilket flyttar frågan från ”finns den?” till ”vad levererar den faktiskt?”. Svaret är snävare än rubriksiffrorna antyder. Ling-3.1-flash är text in, text ut; den erbjuder en kontext på 262 144 token (256K) trots att tillkännagivandet anger 1M som det slutliga målet; dess utdata är begränsad till 32 768 token; och ingen har publicerat priset du kommer att betala på dag femton, när det kostnadsfria fönstret stängs och vikterna förväntas följa efter.

Det gapet mellan annonseringskortet och live-endpointen är det användbara att hålla fast vid, eftersom det mesta av bevakningen av den här lanseringen läser specifikationerna som om modellen levererade dem i dag. Det gör den inte. Ling-3.1-flash är den andra modellen från det här labbet på tre månader som kommer som det som den oberoende trackern LLM Releases rakt ut placerar under ”vikter inte släppta”, och skillnaden mellan vad Ant säger att modellen är och vad en utvecklare kan anropa just nu är där en budget eller ett pilotprojekt i tysthet kan gå fel.

Vad har förändrats mellan tillkännagivandet och idag?

Själva tillkännagivandet var ett specifikationsinlägg: ~560B parametrar totalt, ~25B aktiva per token, upp till 1M tokens kontext, tre centrala utvärderingssiffror och ett löfte – "vi planerar att göra modellen till öppen källkod snart." Inget av det har förändrats. Det som har förändrats är tillgängligheten. Inom ett dygn efter tillkännagivandet gick modellen att nå på en kommersiell edge, och den kostnadsfria provperioden exponerar samma verkliga slutpunkt som en betald skulle göra: samma API-yta, samma enbart textbaserade modalitet, samma växel för tänkandeläge för långsiktigt agentarbete.

För alla som funderar på att lägga utvecklingstid på det är provperioden hela historien den här veckan, och den slår åt båda hållen. Gratis inferens i två veckor är ett genuint billigt sätt att se hur modellen beter sig med dina egna promptar – en sällsynthet för en modell av den här storleken. Men gratis är ett kampanjläge, inte ett pris. Det finns ännu ingen publicerad prislista för Ling-3.1-flash efter provperioden någonstans, så varje kostnadsmodell du bygger på gratisnivån är en platshållare tills Ant och dess värdar sätter siffror på den.

Specifikationsbladet och de tre siffrorna som fortfarande är löften

• Parametrar — 560B totalt, ~25B aktiva per token. Enligt leverantören, och ungefär fyra gånger föregående generations 124B totalt / 5,1B aktiva. Gleshetskvoten ligger kvar nära 1 på 22, så aktiveringen är inte dramatiskt snålare — modellen är helt enkelt mycket större än den den efterträder.

• Kontext — tillhandahålls med 262 144 token i dag. "Upp till 1M" är målet när fönstret har aktiverats; det är inte vad trial-endpointen ger dig, och det är den enskilt vanligaste felläsningen av den här utgåvan.

• Utdata — högst 32 768 tokens. Rimligt för agentloopar, snävt om du tänker generera långa dokument i en enda omgång.

• Modalitet — text in, text ut. Detta är en textmodell. Vision, ljud och filinmatning ingår inte i lanseringen, och inget datum har angetts för dem.

• Resonemang – en hybridstack med en explicit växel för tankeläge, samma mönster som den föregående generationen använde, inriktad på arbete med flerstegsagenter och verktygsanrop snarare än enkelvändig chatt.

• Vikter och licens — inte publicerade. Det här är den siffra som betyder mest och den som ännu inte har något värde alls: i dagsläget finns varken något Hugging Face-repositorium, någon licenstext eller någon nedladdningsbar checkpoint.

Ant Group's own Ling-3.1-flash benchmark chart, published 30 September 2026. Twelve bar-chart panels cover GDPval-AA v2.1 (1,673 for Ling-3.1-flash), tau-squared Banking (47.60), SkillsBench (69.70), Automationbench public (52.50), Terminal-Bench 4.0 (40.40), CyberGym (87.90), FrontierSWE (75.16), SWE Atlas Codebase QnA (55.92), Finance Agent v2 (57.87), HealthBench Professional (65.35), DRACO (85.49) and MultiChallenge (69.78), with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 flash and DeepSeek-V4.1-Flash as the comparison set. A footnote states HealthBench Professional was evaluated in the AQ environment and that Ling-3.1-flash's healthcare capabilities can currently be experienced only in AQ.

Benchmark-kortet, läst med den rabatt det behöver

Ants egen rapportering placerar Ling-3.1-flash på ett aggregerat värde på 81,0 över fem agentbenchmarks, med 40,4 % på Terminal-Bench 4.0, 55,9 % på SWE-Atlas och 65,35 % på HealthBench Professional; företagets egen redogörelse lägger till 1 673 Elo på GDPVal-AA v2.1 och 75,16 på FrontierSWE. Vart och ett av dessa tal är förstapartsdata. Det finns ingen testrigg, ingen promptuppsättning och inga vikter för någon annan att köra om sviten, vilket är standardförbehållet för en modell i detta skede — och här är det värt att säga rakt ut: ett icke reproducerat leverantörsresultat är ett påstående om en modell, inte en mätning av den.

Kortet är också informativt på ett sätt som dess upphovspersoner kanske inte avsåg. Resultatet 40,4 % på Terminal-Bench 4.0 ligger klart efter frontier-nivån; Claude Sonnet 5.5, en mellanklassmodell snarare än ett flaggskepp, får 70,6 % på samma version av det benchmarktestet. Den ärliga tolkningen är inte att Ling-3.1-flash är svag – 40,4 % är ett respektabelt agentiskt terminalresultat för en modell som positioneras på kostnad – utan att inramningen "nära frontlinjen på viktiga benchmarks" som cirkulerade i sociala medier på tillkännagivandedagen inte överlever kontakten med de specifika raderna. Det benchmarktest där modellen ser starkast ut, HealthBench Professional på 65,35, är också det som bär den besvärande fotnoten: Ant uppger att den utvärderades i en miljö som företaget kallar AQ och att modellens sjukvårdsförmåga "för närvarande endast kan upplevas i AQ", utan att definiera vad AQ är någonstans offentligt. Ett rubrikresultat med en namnlös miljö kopplad till sig är en demo, inte ett reproducerbart resultat.

Varför en stor modell som kommer som en testversion är den egentliga nyheten

Det mer intressanta draget här är sekvensen, inte parametrarna. Ling-3.0-flash gick rakt på öppna vikter. Den här landar med provperiod först, där vikter, licens och officiell prissättning alla hålls tillbaka och ett offentligt åtagande om öppen källkod görs först efter att den kostnadsfria perioden tar slut. Det är en spelbok för kommersiell lansering iklädd ett tillkännagivande av öppen modell, och det är en verklig förändring värd att följa: om vikterna kommer under en tillåtande licens får communityn en 560B basmodell att finjustera och destillera; om de kommer med kommersiella villkor kopplade var tvåveckorsprovperioden produkten och raden om "öppen källkod" marknadsföring. Hur som helst landar valet inom provperiodens fönster, och det är det man bör hålla koll på snarare än någon enskild benchmark-rad.

Var det körs, och den ärliga bilden av routningen

För närvarande går Ling-3.1-flash att nå via leverantörens egen produktyta och via tredjepartsinferensplattformar som kör testversionen — och det är hela omfattningen. Den finns inte i OrcaRouters katalog i dag; en uppslagning mot vårt publika modell-API för Ling-3.1-flash, Ling-3.0-flash och Ling-3.0 vision variant returnerar alla not-found, och vi tänker inte låtsas något annat. När en Ant-endpoint väl når allmän tillgänglighet med ett publicerat listpris är den pass-through-modell som OrcaRouter bygger på — leverantörens listpris vidarebefordrat med noll påslag, så att en leverantörsprissänkning är aktiv hos oss samma dag — precis det upplägg som passar en modell vars prissättning fortfarande är oskriven.

Det du kan göra i dag, utan att vänta på licensbeslutet, är att köra den jämförelse som faktiskt spelar roll för en obeprövad modell: mäta den mot de Flash-nivåmodeller du kan anropa just nu. Gemini 3.8 Flash och DeepSeek-V4.1-Flash finns båda i vår katalog till leverantörernas listpriser, bakom en enda API-nyckel, med automatisk failover mellan dem. För en modell i en gratis provperiod vars vikter och prislista båda är okända är det ett vettigt sätt att hålla den — ytterligare en kandidat du kan routa till så länge provperioden varar, och en produktionsväg som inte beror på vad som händer på dag femton.

Headless capture of Ant's Ling Studio interface with Ling-3.1-flash selected in the model picker. The centre panel shows the model-experience card headed "Ling-3.1-flash Model Experience", describing the model as strong at general-purpose agents, search, routine office work and software/code development, above three starter tasks (Hot Spot Scout, Interaction Design Master, Product Assistant). The Model Settings panel on the right shows Max Length 262144, temperature 0.6, top_k 20, top_p 0.95 and Thinking enabled.

Vad du ska göra den här veckan

Om modellen är relevant för ditt arbete är provperioden skälet att agera nu i stället för att vänta på att frågan om öppna vikter ska lösas — två veckor av gratis inferens på en 560B MoE är den billigaste utvärdering du kommer att få, och svaret på ”håller den för mina prompts” är tillgängligt i dag även om svaret på ”kan jag självhosta den” inte är det. Tre saker att kontrollera medan fönstret är öppet, i tur och ordning:

• Kör din egen arbetsbelastning, inte benchmark-kortet. Siffrorna som publicerats är Ants urval av uppgifter; det är dina prompter som avgör din stack.

• Testa den kontext du faktiskt kommer att använda. Slutpunkten tillhandahåller 262 144 token, inte 1 M. Om din design är beroende av det större fönstret, utgår du från ett löfte.

• Bygg inte en kostnadsmodell på ”gratis”. Gratis är ett tillstånd som varar i två veckor. Tills en prislista har publicerats, planera för återgången till en prissatt Flash-tier-modell som standard och behandla Ling-3.1-flash som extra kapacitet.

Tillkännagivandet är verkligt och modellen körs, vilket är mer än vad som kunde sägas för en vecka sedan. Men att vara släppt och öppen och att köras på prov är olika tillstånd, och det här är definitivt det andra — en specifikation på 560B, en 256K-slutpunkt, ett benchmarkkort endast från leverantören, och en tvåveckorsklocka som är den enda fasta tidsfristen i hela lanseringen.

Generated editorial card titled "Ling-3.1-flash on trial - what to verify this week" listing six rounded rows: "Your workload: run it, not the card"; "Context: 262,144 served, not 1M"; "Cost model: free is a two-week state"; "Weights: none published, promise only"; "Fallback: keep a priced Flash-tier route"; "Deadline: the trial window is the only firm date", above a footer reading "Vendor-stated specs; no published post-trial rate card."

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen