Genererat redaktionellt hero-kort med titeln "Ling-3.1-flash vs Qwen3.8-Flash" med underrubriken "Två svar på samma fråga: hur bygger man en snabb nivå?" Vänsterpanel med rubriken "Skala upp och annonsera" har bildtexten "~560B totalt · ~25B aktiva · 1M kontext" och en tagg med texten "vikter: kommer snart". Högerpanel med rubriken "Krymp ner och leverera" har "125B totalt · 6B aktiva · förhandsvisar Qwen4" och en tagg med texten "vikter: på Hugging Face".
Engineering & Research

Ling-3.1-flash vs Qwen3.8-Flash: Två sätt att bygga en snabb nivå, och bara ett av dem levereras

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Två kinesiska labb tittade på samma problem denna höst – hur bygger man en billig, snabb modell som är tillräckligt bra för att sitta inuti en agentloop – och kom fram till motsatta svar. Ling-3.1-flash, som tillkännagavs av Ant Group den 30 september 2026, är en mixture-of-experts-modell med ungefär 560 miljarder parametrar som aktiverar omkring 25 miljarder parametrar per token, med ett kontextfönster som uppges vara upp till 1 miljon token och en uttalad avsikt att öppna källkoden "snart". Qwen3.8-Flash, som släpptes av Aliba​s Qwe​n-teamet den 26 augusti 2026, är en multimodal mixture-of-experts-modell med 125 miljarder parametrar som aktiverar omkring 6 miljarder parametrar per token, med vikter redan på Hugging Face under namnet Qwen3.8-Flash-Next, en produktionsmodell som är live på QwenCloud API för 0,15 USD per miljon indata-token och 0,47 USD per miljon utdata-token, och day-0-stöd i SGLang. Ett labb skalade upp och tillkännagav. Det andra skalade ned och levererade. Den skillnaden är mer lärorik än något benchmark som något av labben publicerade.

Det är också anledningen till att den här jämförelsen måste läsas noggrant. Ling-3.1-flash har inga vikter, ingen licens, inget modellkort, inget API-pris och ingen oberoende utvärdering; hela det publicerade underlaget är ett tillkännagivandeinlägg, ett benchmarkdiagram från leverantören och en plats i Ants egen Ling Studio-produkt. Qwen3.8-Flash har allt detta och ett fyra veckor långt försprång när det gäller att köras av personer som inte arbetar för Alibaba. Att jämföra ett arkitekturval är rimligt. Att jämföra förmågor är det inte, ännu.

De två designbesluten, och varför de skiljer sig åt

Qwens satsning är att den snabba nivån bör vara strukturellt annorlunda än flaggskeppet, inte bara mindre än det. Qwen3.8-Flash aktiverar 6 miljarder av sina 125 miljarder parametrar – ungefär 95 % gleshet – och hämtar sin kapacitet från var beräkningskraften dirigeras snarare än från rå bredd. Alibaba har varit tydliga med att arkitekturen under, som kombinerar Gated DeltaNet med Qwen Sparse Attention och en N-gram-inbäddningstabell, är en tidig förhandsvisning av Qwen4-generationen, publicerad tidigt med avsikt så att inferensmotorer, kvantiseringsverktyg och driftsättningsmönster kan mogna kring den innan de dyra modellerna byggs ovanpå. Resultatet är en modell som är billig per token till sin konstruktion: omkring 6 miljarder parametrars arbete per token, till ett pris som Alibaba satt till 0,15 USD in och 0,47 USD ut per miljon.

Ants satsning, så långt utannonseringen avslöjar den, ligger närmare konventionell skalning med en mycket lång kontext. Ling-3.1-flash behåller en stor aktiv andel – ungefär 25 miljarder parametrar per token av 560 miljarder, alltså ungefär en av tjugotvå – och anger ett fönster på upp till 1 miljon tokens, fyra gånger vad den tidigare Ling-generationen erbjuder. Appen Ling Studio beskriver den som byggd för "allmänna agenter, sökning, rutinmässigt kontorsarbete och mjukvaru-/kodutveckling", vilket är en positionering i snabbklassen, men parameterekonomin är den för en mycket tyngre modell. Vid identisk indata kostar en token som passerar genom 25B aktiva parametrar ungefär fyra gånger så mycket beräkningskraft som en som passerar genom 6B, innan något prissättningsbeslut ens kommer in i bilden.

Ingen av metoderna är fel, och båda är försvarbara svar på "vad som begränsar en billig modell." Qwen satsar på att gleshet och en ny attention-stack är taket. Ant satsar på att taket är kontext och världskunskap, och att de har råd med beräkningskraften. Det som skiljer dem åt för en läsare är inte designfilosofin utan leveransen: en design du kan ladda ner och mäta mot en design du bara kan läsa om.

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Panels compare Ling-3.1-flash with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash across GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge. A footnote states HealthBench Professional was evaluated in the AQ environment.

Vad var och en kostar dig, och vad det innebär i praktiken

Prisgapet är inte subtilt och det är inte litet. Qwen3.8-Flash är publicerad till $0.15 per miljon input-tokens, $0.47 per miljon output, och $0.018 per miljon för cache-läsningar — samma siffror i Alibabas tillkännagivande, på leverantörens produktionsmodellkort och på den routade modellsida vi tillhandahåller, vilket är vad en genomströmning med 0 % påslag ser ut som när man kontrollerar den mot tre källor. Ant har inte publicerat någon taxa för Ling-3.1-flash överhuvudtaget — inget API-pris, ingen cache-rabatt, inget jämförbart. Den enda publicerade siffran för Ling-serien är den föregående generationens, som listas till $0.075 in och $0.22 ut per miljon, ungefär hälften av Qwens input-taxa och mindre än hälften av dess output-taxa. Om den nya Ling-nivån prissätts nära där den gamla låg, skulle den underbjuda Qwen3.8-Flash på papperet; om den prissätts i närheten av den beräkningskraft som dess 25B aktiva parametrar antyder, kommer den inte att göra det. Det är en gissning hur som helst, eftersom siffran inte existerar.

Det är i kontexten som Lings anspråk verkligen är större. Ant uppger upp till 1 miljon tokens för Ling-3.1-flash; Qwen3.8-Flash levereras med en standardkontext på 1M token i produktions-API:et och ett inbyggt fönster på 262 144 token i de öppna vikterna, utökningsbart. Två förbehåll hänger över Lings siffra, och inget av dem är avklarat. För det första är "upp till 1M" en specifikation, inte en mätning – ingen har publicerat beteendet vid långkontextsökning för en modell som ingen utanför Ant kan anropa. För det andra hade den föregående Ling-generationen exakt samma glapp mellan det annonserade fönstret och den arkitektoniska berättelsen bakom det, och svaret kom först när vikterna, formatet och kontextgränserna äntligen publicerades. Rubrikens 1M är ett löfte. 1M i Qwen3.8-Flash är en serverad standard som du kan ställa Ants påstående mot.

Varför "förhandsvisning" är det ärliga ordet på ena sidan av detta

Alibabas egen beskrivning av Qwen3.8-Flash är att det är en arkitekturförhandsvisning som släpps under ett produktionsnamn – de öppna vikterna bär suffixet "Next" just för att ingen ska förväxla prototypen med den trimmade serveringsmodellen. Den beskrivningen har bekräftats av händelser snarare än av marknadsföring: SGLang släppte dag-0-stöd för Qwen3.8-Flash-Next på releasedagen, och modellen konfigurerades även för Transformers, vLLM och TokenSpeed, och vikterna har sedan dess plockats upp inom kvantiseringscommunityn. Versioner blev snabbt vanliga, vilket är precis hur en släppt modell ser ut.

Ants tillkännagivande har samma form ett steg tidigare: ett specifikationssläpp före lanseringen, med det uttryckliga uttalandet att modellen snart släpps som öppen källkod. Detta är ett legitimt sätt att lansera — Ling-3.0-flash följde exakt den vägen i juli, och vikterna publicerades under MIT den 7 augusti, ungefär två veckor senare. Men läget för de två projekten i dag är inte jämförbart, och ingen mängd diagramläsning sluter gapet. Det är värt att vara konkret om vad en utomstående kan tillföra vart och ett av dem.

Vad som är oberoende verifierbart för Ling-3.1-flash i dag: att tillkännagivandet finns och är daterat den 30 september; att siffrorna för parameter, aktiva parametrar och kontext är Ants egna; att modellen förekommer i Ants produkt Ling Studio; och att inga vikter, ingen licens och inget modellkort har publicerats. Vad som är oberoende verifierbart för Qwen3.8-Flash: att vikterna kan laddas ner i BF16 och FP8; att licensvillkoren är läsbara; att API-priset är publicerat; och att Alibabas benchmarkpåståenden har varit öppna för reproduktion sedan slutet av augusti. Den andra listan är längre, och det är hela jämförelsen i miniatyr.

Headless capture of the OrcaRouter model page for Qwen3.8 Flash, showing the routed model ID qwen/qwen3.8-flash, a 1M-token context window, 131K maximum output, text, image and video input with text output, capability badges for Vision, Tools, JSON and Reasoning, a production date of 2026-08-26, a pricing block reading $0.15 per 1M input tokens, $0.47 per 1M output tokens, $0.018 cache read and $0.230 cache write, and a performance panel with a 4.47 s p50 time-to-first-token, 10.00 s p95, 105 tok/s output and a 2.9% error rate over the last seven days.

Hur de två faktiskt skulle utvärderas

Ant publicerade ett benchmarkkort med Ling-3.1-flash som ställer det mot GPT-5.6 Sol, Claude Opus 5, Kimi K3, två GLM-varianter och DeepSeek-V4.1-Flash, med rubriksiffror på 1 673 Elo på GDPVal-AA v2.1, 75,16 på FrontierSWE och 65,35 på HealthBench Professional. Två problem finns på det kortet innan någon argumenterar om siffrorna. Det första är jämförelseuppsättningen: båda frontier-modellerna som Ant valde är en generation efter, eftersom Claude Opus 5.5 och GPT-6 Sol släpptes den 22 september 2026 och kan routas nu, vilket innebär att kortet benchmarkar en oktobermodell mot julins frontier i stället för den nuvarande. Det andra är en fotnot på själva kortet, som anger att HealthBench Professional-resultatet kom från "AQ-miljön" och att modellens vårdkapaciteter för närvarande endast kan upplevas i AQ — en miljö som ingen offentlig dokumentation definierar. En rubriksiffra vars utvärderingsmiljö är onämnd går inte att reproducera ens i princip.

Qwen3.8-Flashs jämförbara påståenden gjordes däremot när vikterna redan var ute, och Alibaba satsade sin positionering på ett påstående som vem som helst kan testa: att det är sparsitetsförhållandet, inte parameterantalet, som förmågan härrör från. Fyra veckors användning är inte en dom, men det är tillräckligt länge för att påståendena har slutat vara obestridda — vilket är det användbara tillståndet för en modell.

Vad man faktiskt ska göra med det här, idag

För utvecklare är den praktiska uppdelningen enkel. Ling-3.1-flash är inte en komponent du kan ta i bruk den här veckan: det finns ingen endpoint att anropa, inga vikter att hosta, ingen licens att kontrollera och inget pris att budgetera mot. Vad den slutliga modellen än visar sig bli, är det användbara draget just nu att sätta en utlösare – vikter publicerade, tillåtande licens, en oberoende poäng på FrontierSWE som ligger någonstans nära 75.16 – och återkomma. Den tidigare generationens egen historia visar att vikterna kan komma två veckor efter tillkännagivandet, så den utlösaren kan slå till snabbt.

Qwen3.8-Flash är redan en komponent. Den är tillgänglig i vår katalog som en routad modell till leverantörens listpris utan påslag — det routade kortet anger $0,15 in, $0,47 ut och $0,018 per miljon cacheläsningar, samma siffror som Alibaba publicerar, vilket är vad en policy med 0 % påslag innebär i praktiken snarare än på en slide. Bakom en enda nyckel står den bredvid Claude Opus 5, GPT-5.6 Sol och DeepSeek-V4.1-Flash, så jämförelsen som Ant bjuder in till — en kandidat mot den nuvarande frontlinjen — kan köras genom att peka en config mot två rutter i stället för att underhålla två integrationer, med automatisk failover som hanterar helgen då en leverantör strular. Det är skillnaden mellan en arkitekturdiskussion och ett experiment.

Domen, i den mån en sådan kan ges: Qwen gjorde den djärvare arkitektoniska satsningen och hade självförtroendet att publicera den tidigt och låta folk plocka isär den. Ant gjorde den tyngre satsningen – fler parametrar, mer aktiv beräkningskraft per token, mer kontext – och har hittills publicerat ett diagram i stället för en modell. Diagrammet ser bra ut. Diagrammet är också det enda någon har.

Generated three-lane information card. Lane one, "Shipped, priced, licensed", holds "Qwen3.8-Flash — weights on Hugging Face as Qwen3.8-Flash-Next" and "$0.15 in / $0.47 out per 1M tokens, cache $0.018". Lane two, "Announced, unpriced, unlicensed", holds "Ling-3.1-flash — no repository, no licence", "no published API price" and "no independent evaluation". Lane three, "What a reader should do", holds "test the shipped model this week" and "set a trigger for the announced one".

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen