
Ling-3.1-flash vs Gemini 3.8 Flash: En 256K-testmodell mot en aktiv 1M-token-modell
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 219 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Ställ Ling-3.1-flash och Gemini 3.8 Flash sida vid sida och skillnaden handlar inte om intelligens – den handlar om tillstånd. Ling-3.1-flash, Ant Groups mixture-of-experts med omkring 560B parametrar som tillkännagavs den 29–30 september 2026, är en gratis tvåveckorsprovperiod med ett serverat kontextfönster på 256K, en utdatagräns på 32 768 token, enbart textinmatning och inga publicerade vikter, licenser eller priser. Gemini 3.8 Flash, Googles resonemangsmodell i Flash-klassen som släpptes den 2 september 2026, är ett API med allmän tillgänglighet och ett fullt fönster på 1 048 576 token, 65 536 token utdata, multimodalinmatning och en offentlig prislista. På papperet är det en jämförelse av två modeller; i praktiken är det en jämförelse av en modell du kan bygga på idag mot en som du bara kan testa den här månaden.
Det är inte ett skäl att avfärda Ling-3.1-flash. En gratis 560B MoE med agentisk inriktning är värd två veckor av allas utvärderingstid. Men det förändrar vad en direkt jämförelse är till för: inte "vilken ska jag standardisera på", utan "är testmodellen tillräckligt bra för att jag ska hedga kring svaret om femton dagar". Det är olika frågor, och de har olika svar på varje axel nedan.
De tre sakerna som avgör det innan någon benchmark gör det
De flesta jämförelser börjar med betyg. Den här borde börja med tillgänglighet, eftersom klyftan där inte handlar om gradskillnad.
• Prissättning — Ling-3.1-flash är gratis under sin provperiod och har ingen publicerad prislista efter provperioden alls. Gemini 3.8 Flash listas till $0,75 per miljon indatatoken och $3,75 per miljon utdatatoken under sin kampanjperiod, och återgår till $1,50 / $7,50 den 1 januari 2027. Listpriser enligt leverantören; båda kan komma att ändras.
• Kontext – Ling-3.1-flash erbjuder 262 144 tokens i testversionen, med 1 000 000 angivet som det slutliga målet. Gemini 3.8 Flash erbjuder hela 1 048 576 tokens i dag. Om din arbetsbelastning är beroende av fönstret på en miljon tokens har bara en av dessa två det nu.
• Vikter — Ling-3.1-flash har inga publicerade sådana: inget kodförråd, ingen licens, ingen checkpoint, bara en uttalad avsikt att öppna källkoden efter testperioden. Gemini 3.8 Flash är sluten och kommer alltid att vara det, men det är ett hanterat API som du kan anropa utan tvetydighet idag.
Lästa tillsammans driver de tre en och samma poäng: Ling-modellens främsta fördelar är antingen marknadsföringsmässiga (gratis) eller prospektiva (1M kontext, öppna vikter), medan Gemini-modellens fördelar är avtalsmässiga. Den asymmetrin genomsyrar allt som följer.
Där Ling-modellen verkligen vinner
Två platser, och båda är verkliga.
Det första är kostnaden vid utvärdering. En gratis provperiod på två veckor för en modell av den här storleken är inte ett marknadsföringstrick att avfärda – det är det billigaste sättet att ta reda på om en 560B mixture-of-experts klarar dina prompter. Gemini 3.8 Flash, oavsett pris, är inte gratis, och en seriös utvärdering över några tusen anrop kostar riktiga pengar.
Den andra är öppenhetsbanan. Ling-3.1-flash är efterföljaren till en modell som faktiskt släpptes med MIT-licensierade vikter, och Ant har offentligt sagt att man avser att även öppna källkoden för denna. Om det landar med en tillåtande licens får du något som Gemini 3.8 Flash aldrig kan erbjuda: möjligheten att självhosta, finjustera eller destillera en basmodell på 560B. Haken är den som spelar störst roll – du satsar på ett löfte, och förra generationens löfte infriades med två veckors fördröjning, inte som en garanti.
Där Gemini 3.8 Flash inte är i närheten av att förlora
Bortser man från rättegången och öppenhetsfrågan är den operativa jämförelsen ojämn till Googles fördel.
• Indata — Gemini 3.8 Flash tar text, bild, video, fil och ljud. Ling-3.1-flash tar text och returnerar text. För arbetsflöden med dokument, skärmbilder eller video är detta inte en preferens, det är en kapacitetsgräns.
• Utdatatak — 65 536 tokens mot 32 768. Relevant så snart du genererar rapporter, kodfiler eller lång strukturerad utdata i en enda omgång.
• Genomströmning — oberoende tester visar att Gemini 3.8 Flash har en medianhastighet för utdata på nära 249 tokens per sekund, medan OrcaRouters egen sjudagars-telemetri mäter 552 tokens per sekund vid ett p50 på 4,95 sekunder till första token. Ling-3.1-flash:s provdrift har rapporterats ligga på omkring 63 tokens per sekund. Gemini-modellen tillhör en annan hastighetsklass.
• Referensdjup — Gemini 3.8 Flash har en mängd oberoende mätningar bakom sig; Ling-3.1-flash-siffrorna är alla förstapartsdata, på en helt ny endpoint, utan att någon tredje part ännu har återkört dem.
• Multimodala agenter – allt som måste läsa en skärmbild, en PDF eller ett inspelat samtal är en Gemini-uppgift till sin konstruktion, inte på grund av kvalitet.

Benchmarks, och varför de två uppsättningarna egentligen inte går att jämföra
Det leverantörsrapporterade underlaget för Ling-3.1-flash är ett aggregerat resultat på 81,0 över fem agentbenchmarkar, med 40,4 % på Terminal-Bench 4.0, 55,9 % på SWE-Atlas och 65,35 % på HealthBench Professional; i Ants egen redovisning tillkommer 1 673 Elo på GDPVal-AA v2.1 och 75,16 på FrontierSWE. Vart och ett av dessa är Ants egen mätning. Det finns inget publicerat utvärderingsramverk och, än viktigare, inga vikter som någon kan köra om testsviten på.
Bilden av Gemini 3.8 Flash är av ett annat slag. I den nuvarande versionen av Intelligence Index från Artificial Analysis (v4.3.2) får den 40,9 vid hög resonemangsansträngning, 39,8 vid medel och 33,5 vid låg – och det är värt att framhålla att indexet nyligen har reviderats, så siffror som publicerades om den här modellen tidigare i höst beräknades på en annan version och är inte direkt jämförbara med dessa. Googles egna uppgifter om modellen inkluderar 54,9 på HLE-Verified och starka resultat på Terminal-Bench 2.1 i det högre 80-spannet. Oberoende siffror och leverantörssiffror, sida vid sida, båda legitima, ingen av dem utbytbar mot den andra.
Det finns en ren korsjämförelse som är värd att göra, eftersom båda tillhör samma benchmarkfamilj. På Terminal-Bench 4.0 är Ling-3.1-flashs leverantörssiffra 40,4 %. Claude Sonnet 5.5 – en mellanklassmodell, inte ett flaggskepp – får 70,6 % på samma version. Den där enda raden är det starkaste argumentet mot att tolka Ants kort som "frontier-nära": modellen är konkurrenskraftig på de agentiska mått som Ant valde att lyfta fram och klart efter på terminalkodningsmåttet där en extern siffra finns.

Valets praktiska form
Om du behöver bygga något inom de närmaste två veckorna är svaret inte i närheten, och det är inte en pik mot Ling-3.1-flash. Gemini 3.8 Flash är den enda av de två som ger dig en stabil endpoint, ett publicerat pris, ett fullt fönster på en miljon tokens, multimodala indata och en licens du kan läsa. Det är en produktionsmodell på Flash-nivå.
Ling-3.1-flash är ett utvärderingsobjekt. Dess värde just nu är att utvärderingen är gratis och modellen är intressant: en 560B MoE med endast ~25B aktiva per token är en satsning på sparsitet, och Ant positionerade den för precis de agent-, sök- och kontorsautomatiseringsarbetsbelastningar som modeller i Flash-klassen konkurrerar om. Att köra dina egna prompter genom den under provperioden är värt det just för att ingen utanför Ant har gjort det ännu — du skulle vara bland de första som har en åsikt som inte kommer från leverantören.
Beslutsträdet som är rimligt den här månaden: dirigera produktionen till Gemini 3.8 Flash, använd den kostnadsfria provperioden till att köra Ling-3.1-flash mot dina svåraste prompter, och håll frågan om öppna vikter som den egentliga förgreningen. Om vikterna kommer med tillåtande licens och ett pris landar nära Flash-nivån, blir Ling-3.1-flash ett genuint andraalternativ – ett du kan self-hosta, vilket Gemini aldrig kommer att bli. Om de kommer med villkor tar provperioden slut, och det gör jämförelsen också.
Köra båda från en enda nyckel, och vara ärlig om vad som saknas
Gemini 3.8 Flash finns i OrcaRouter-katalogen idag under modell-ID:t google/gemini-3.8-flash, till Googles eget listpris utan påslag — så när kampanjpriset återgår i januari följer priset du betalar här det automatiskt i stället för att du behöver ett nytt avtal. DeepSeek-V4.1-Flash, den andra billiga modellen i Flash-klassen som är värd att mäta i samma experiment, finns i samma katalog till sin leverantörs listpris, så ett trevägstest av testmodellen mot etablerade alternativ i Flash-klassen körs bakom en enda API-nyckel med automatisk failover mellan dem.
Ling-3.1-flash finns inte i vår katalog, och en sökning mot vårt publika modell-API returnerar not-found för den och för den föregående generationen – så den ärliga formuleringen är att provperioden körs där den körs, via leverantörens egen yta och tredjepartsplattformar för inferens, och vi gör inget anspråk på att vara värd för den. Det är den del av den här jämförelsen som snabbast kan förändras: en modell i en kostnadsfri provperiod med ett oannonserat pris är precis den typ av sak som hamnar i ett routinglager i samma stund som Ant och dess värdar publicerar en prislista, och vidarebefordran utan påslag innebär att samma dag som det sker är priset här priset där.
Så domen är snävare än vad parameterantalet antyder. Ling-3.1-flash är den mer ambitiösa modellen och det mer intressanta forskningsresultatet; Gemini 3.8 Flash är den man kan skeppa med. Tills en licens och ett pris finns är det hela skillnaden – och det är inte en sådan som en benchmarkrad kommer att avgöra.

Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
