
Gemini 3.5 Flash-Lite vs Qwen 3.8: Billig arbetshäst mot 2,4T-flaggskepp
- qwenNYQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 per 1M tokens · 56 tok/s
- deepseekNYDeepSeek: DeepSeek V4 Flash 07312026-07-3150Intelligens69Kodning
- qwenNYQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens · 200 tok/s
- orcaNYOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNYAnthropic: Claude Opus 52026-07-2461Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2150Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1651Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1557Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligens77Kodning
- grokxAI: Grok 4.52026-07-0854Intelligens72Kodning
- tencentTencent: Hy32026-07-0641Intelligens59Kodning
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligens42Kodning
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligens39Kodning
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligens72Kodning
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligens52Kodning57Matematik
- z-aiZ.ai: GLM 5.22026-06-1651Intelligens69Kodning60Matematik
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligens61Kodning61Matematik
När denna jämförelse först skrevs, var den skev på ett ovanligt sätt: Gemini 3.5 Flash-Lite var en riktig, köpbar produkt och Qwen 3.8 var en begränsad förhandsvisning utan pris, utan riktmärke och utan vikter. Det fanns väldigt lite att jämföra.
Det är inte längre fallet. Qwen3.8-Max blev allmänt tillgänglig den 3 augusti 2026 med en publicerad prislista på $2 / $6 per miljon tokens, en OpenAI- och DashScope-kompatibel slutpunkt och en fullständig benchmark-tabell. Den är självbetjänad, budgeterbar och live — inklusive på OrcaRouter. Så den här artikeln har skrivits om från grunden, eftersom den ärliga jämförelsen idag inte är "levererad modell mot ånga." Det är en äkta nivå jämförelse: Googles billigaste arbetshäst för hög genomströmning mot Alibabas största flaggskepp.
En notis för byggare — dessa två ligger i motsatta ändar av kostnadskurvan, så den rätta frågan är vilken nivå din arbetsbelastning tillhör. OrcaRouter frontar 200+ modeller bakom en OpenAI-kompatibel slutpunkt, så du kan testa båda på samma uppgift utan att koppla in två SDK:er.
TL;DR-slutsats. Dessa modeller konkurrerar egentligen inte — de svarar på olika frågor. Flash-Lite är en effektivitetsmodell: Artificial Analysis Index 36, $0,30 / $2,50 per 1M, ungefär 490 tokens/sek, allmänt tillgänglig. Den är byggd för att köras på varje förfrågan till en försumbar kostnad. Qwen3.8-Max är en flaggskeppsmodell: ~2,4 biljoner parametrar, en 1M-tokenkontext med fast pris, inbyggd bild- och videoinmatning samt självrapporterade frontier-liknande poäng (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6) — till $2 / $6, vilket är 6,7× Flash-Lites inmatningspris. Flash-Lite är rätt standardval för storskalig klassificering, routing och extraktion. Qwen3.8-Max är vad du eskalerar till när en uppgift verkligen kräver frontier-resonemang, en miljon tokens kontext eller icke-textinmatning. Det enda förbehållet som inte har ändrats: Qwen har fortfarande inga oberoende benchmarkpoäng.
Viktiga slutsatser
• Qwen 3.8 är nu allmänt tillgänglig — från och med 3 augusti 2026 har den publicerad prissättning, självbetjäningsåtkomst och en benchmark-tabell. Den tidigare framställningen av en begränsad, obudgeterbar förhandsversion är föråldrad.
• Flash-Lite är dramatiskt billigare: $0.30 / $2.50 per 1M jämfört med Qwens $2 / $6 — cirka 6.7× på input och 2.4× på output.
• Flash-Lite är mycket snabbare: ungefär 490 tokens/sek, byggd för hög genomströmning. Qwen3.8-Max visar en p50-tid till första token på 1,64 s i OrcaRouters 7-dagars-telemetri men är en stor, genomarbetad modell.
• Flash-Lite har det enda granskade resultatet: Artificial Analysis Index 36. Qwen3.8-Max förblir utan poängsättning av alla oberoende utvärderare, även om Alibaba nu publicerar sina egna siffror.
• Qwen vinner avgjort när det gäller kapacitet: en 1M-token kontext till fast pris utan tillägg för långa prompter, plus text/bild/video-inmatning och OmniDocBench 1.5 92.1 för dokumenttolkning. Flash-Lite är en liten effektivitetsmodell.
• Öppna vikter: Qwen's utlovas inom veckan (ingen licens ännu), plus en Qwen3.8-27B som rapporteras köra på ~17GB VRAM. Flash-Lite är permanent stängd.
Noggrannhetsanteckning: alla kvalitetssiffror för Qwen3.8-Max är rapporterade av Alibaba och inte verifierade av tredje part. Siffrorna för Gemini 3.5 Flash-Lite kommer från Artificial Analysis. Qwens prissättning är GA-prislistan från Alibaba Model Studio och ersätter preview-åtkomsten som beskrivs i tidigare versioner av denna artikel.
Specarna och priset, sida vid sida
• Tillverkare / status — Flash-Lite: Google; allmänt tillgänglig; Qwen3.8-Max: Alibaba; GA (3 augusti 2026)
• Positionering — Flash-Lite: billig effektivitetsnivå med hög genomströmning; Qwen3.8-Max: flaggskepp / spjutspetsambition
• AA Intelligence Index — Flash-Lite: 36 (Artificial Analysis); Qwen3.8-Max: Ännu ej poängsatt
• Leverantörsrapporterade poäng — Flash-Lite: ställning mäts av tredje part; Qwen3.8-Max: GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (alla rapporterade av Alibaba)
• Pris (per 1M, in / ut) — Flash-Lite: $0.30 / $2.50; Qwen3.8-Max: $2.00 / $6.00, fast över 1M kontext; cachad inmatning $0.25
• Hastighet — Flash-Lite: ~490 tok/sek (Artificial Analysis); Qwen3.8-Max: p50 TTFT 1.64s (OrcaRouter 7-dagars telemetri)
• Kontext — Flash-Lite: effektivitetsnivåkontext; Qwen3.8-Max: 1M token (983 616 med tänkande; max utdata 131 072)
• Modalitet — Flash-Lite: textfokuserad effektivitetsmodell; Qwen3.8-Max: text, bild, video in → text ut
• Vikter — Flash-Lite: stängd, endast API; Qwen3.8-Max: lovat inom veckan, ingen licens ännu
• Tillgång idag — Flash-Lite: standard API, självbetjäning; Qwen3.8-Max: standard API, självbetjäning (Model Studio, DashScope, OrcaRouter)
Presenterat på detta sätt är resultatet helt annorlunda än vad det brukade vara. Qwens kolumn är inte längre tom — den är full, och på flera rader är den den starkare posten. Det som ersätter den gamla "känd kvantitet kontra löfte"-inramningen är ett tydligt nivågap: Flash-Lite är ungefär 6,7× billigare på input och cirka 13× snabbare i genomströmning, medan Qwen erbjuder en multimodal kontext på en miljon token och en påstådd resonemangsförmåga i framkant. De är båda legitima produkter; de tjänar bara olika syften.
Den enda raden där den gamla varningen fortfarande gäller är benchmarkraden. Flash-Lites Index 36 mättes av Artificial Analysis på en offentlig topplista. Varje Qwen-siffra — GPQA Diamond 92,6, Terminal-Bench 86,6 och resten — togs fram av Alibaba i en egen testmiljö. Det är en verklig förbättring jämfört med att inte publicera något alls, men det är inte tredjepartsverifiering, och labb publicerar de benchmarks de vinner.

Index 36 vs ett obetygsatt flaggskepp: att läsa detta ärligt
Det är frestande att ställa Flash-Lites Index 36 mot Qwens GPQA Diamond 92.6 och utropa en utklassning. Det vore ett kategorifel två gånger om.
För det första är Artificial Analysis Intelligence Index ett sammansatt mått över många uppgifter; GPQA Diamond är ett enda forskarutbildningstest. De ligger inte på samma skala och kan inte subtraheras från varandra.
För det andra, och viktigare, Flash-Lite var aldrig utformad för att ge höga poäng. Ett index på 36 är typiskt för en effektivitetsmodell. Googles tekniska mål var en modell tillräckligt billig och snabb för att placeras framför varje inkommande förfrågan — ärendedirigering, klassificering, extrahering, sammanfattning i stor skala — där en modell i framkant skulle vara ekonomiskt orimlig. Att bedöma den mot en 2.4T flaggskeppsmodell på resonemangstak missar vad den är till för.
Vad vi kan säga är snävare och mer användbart. Qwen3.8-Max är mycket troligt den avsevärt mer kapabla modellen — dess självrapporterade siffror ligger långt över vad en Index-36-modell skulle producera, och FrontierSWE-hoppet till 73,5 från en föregångares 40,7 tyder på verkliga framsteg. Men "mycket troligt" förblir en inferens, eftersom ingen oberoende utvärderare har bedömt den. För kontexten: föregångaren Qwen3.7-Max fick 46 på AA Index — högre än Flash-Lites 36, men långt ifrån frontier — så Alibabas underförstådda generationshopp är stort och overifierat.
Den praktiska konsekvensen: om din uppgift är en som Flash-Lite redan utför korrekt, är Qwens högre tak ingenting värt för dig och du skulle betala 6,7× för det. Taket spelar bara roll när Flash-Lite faktiskt misslyckas.
Kostnad i praktiken: nivåklyftan i siffror
Ta ett klassificeringsjobb med hög volym: 2 000 tokens i indata, 200 tokens i utdata, kört 500 000 gånger om dagen — en realistisk form för supporttriage eller innehållsdirigering.
• Flash-Lite: per anrop, 0.002M × $0.30 = $0.0006, plus 0.0002M × $2.50 = $0.0005. ≈ $0.0011 per anrop → ~$550/dag.
• Qwen3.8-Max: per anrop, 0,002M × $2 = $0,004, plus 0,0002M × $6 = $0,0012. ≈ $0,0052 per anrop → ~$2 600/dag.
• Månadsvis: Flash-Lite ≈ $16,500; Qwen ≈ $78,000 — en skillnad på $61,500 för samma uppgiftsvolym.
På den skalan är nivåvalet den enskilt största posten i systemet, och det är mycket svårt att motivera en flaggskeppsmodell för arbete som en effektivitetsmodell hanterar. Detta är exakt det scenario Flash-Lite finns till för.
Invertera nu det. Ta en långdokumentsuppgift: 600 000 tokens kontext, 5 000 tokens utdata, 200 gånger om dagen.
• Qwen3.8-Max: 0,6M × $2 = $1,20, plus 0,005M × $6 = $0,03. ≈ $1,23 per anrop, utan tillägg för långa prompts — och ungefär $0,18 om kontexten cachelagras till $0,25/1M.
• Flash-Lite kan inte prissättas för den här formen alls, eftersom en kontext på 600 000 token för ett enda anrop inte är vad en modell i effektivitetsklassen är byggd för att hantera.
Så svaret vänder helt med arbetslastens form, vilket är den verkliga lärdomen. Flash-Lite vinner högvolymarbete med kort kontext med en enorm marginal. Qwen vinner allt som kräver en miljon tokens eller icke-textinmatning, där Flash-Lite inte är ett billigare alternativ utan helt enkelt inte ett alternativ.

Scenarier: vilken nivå passar
Supporttriage och routing i stor volym. Flash-Lite, helt klart. Index 36 räcker för klassificering, och till cirka $0.0011 per anrop kan du köra det på varje ärende. Eskalera bara den tvetydiga minoriteten till en större modell.
Heldokumentanalys av avtal eller inlagor. Qwen3.8-Max. Kontexten på 1M till fast pris innebär att ett 400-sidigt dokument går igenom i ett enda anrop utan tilläggsavgift och utan uppdelning, och dess självrapporterade OmniDocBench 1.5 92.1 riktar sig exakt mot detta arbete.
Skärmbilds-, diagram- eller videopipelines. Qwen3.8-Max, som standard — den accepterar bild- och videoindata och rapporterar OSWorld-Verified 86.1 på att styra ett riktigt GUI. Flash-Lite är inte en kandidat för icke-textindata.
Agentisk kodning.Qwen3.8-Max på de påstådda siffrorna (Terminal-Bench 2.1 86.6, FrontierSWE 73.5), med förbehållet att ingen av dem är oberoende verifierad och att dess svagaste självrapporterade resultat är IFBench 82.8 på instruktionsföljning — en verklig risk för pipelines som tolkar utdata från varje steg.
En tvåskiktsarkitektur. Ofta är det korrekta svaret både och: Flash-Lite som det billiga första steget för varje begäran, Qwen3.8-Max som eskaleringsvägen för den lilla andel som behöver en miljon tokens, en bild, eller äkta resonemang. Det mönstret fångar större delen av Flash-Lites kostnadsfördel samtidigt som det håller ett frontier-alternativ tillgängligt.
Självhosting och öppenhet
Flash-Lite är stängd och enbart API, permanent — det finns ingen självhosting-väg.
Qwen3.8-Max:s vikter utlovas inom veckan, men flaggskeppet är inte ett realistiskt mål: ungefär 1.2TB vid 4-bit mot cirka 141GB per H200 innebär åtta eller fler toppacceleratorer, och Alibaba har fortfarande inte avslöjat antalet aktiva parametrar, så det genomflöde som den utgiften skulle köpa är omöjligt att modellera. Det finns inte heller någon licenstext ännu, vilket innebär att kommersiell användbarhet formellt sett är obestämd.
Den samtidigt tillkännagivna Qwen3.8-27B är den version som faktiskt spelar roll för lokala installationer. Den blir också open-weight och rapporteras köra i cirka 17GB VRAM, vilket gör den till ett genuint självhostningsalternativ — och dessutom en betydligt närmare konkurrent till Flash-Lites effektivitetsnisch än flaggskeppet på 2.4T.
FAQ
Kan jag använda Qwen 3.8 idag?
Ja. Qwen3.8-Max nådde allmän tillgänglighet den 3 augusti 2026 med publicerad prissättning på $2 / $6 per 1M tokens och en OpenAI- och DashScope-kompatibel slutpunkt. Den är självbetjänad via Alibaba Model Studio, DashScope och OrcaRouter. Tidigare versioner av denna artikel beskrev en behörighetskontrollerad förhandsvisning; det är inaktuellt.
Vilket är billigare?
Gemini 3.5 Flash-Lite, med bred marginal: 0,30 $ / 2,50 $ per 1M mot Qwen3.8-Max:s 2 $ / 6 $ — ungefär 6,7× billigare på inmatning och 2,4× på utdata. Vid höga volymer av arbete med kort kontext dominerar den skillnaden alla andra överväganden.
Vilken är bättre?
De tillhör olika nivåer. Flash-Lite har det enda granskade resultatet (AA Index 36) men byggdes för billig genomströmning, inte för resonemang. Qwen3.8-Max är mycket troligt långt mer kapabel – dess självrapporterade GPQA Diamond 92.6 och Terminal-Bench 2.1 86.6 är i framkant – men den har inget oberoende riktmärke, så det förblir en slutsats snarare än ett uppmätt resultat.
Vilken är snabbare?
Flash-Lite, avsevärt. Artificial Analysis mäter ungefär 490 tokens/sekund, vilket är vad dess effektivitetsklassdesign är till för. Qwen3.8-Max visar en p50-tid-till-första-token på 1,64 sekunder i OrcaRouters 7-dagars-telemetri, men det är en stor, genomarbetad modell och förhandsgranskningsrecensenter tyckte att den var långsam på långa agentiska byggen.
Har Qwen 3.8 öppna vikter nu?
Inte ännu. Alibaba säger att flaggskeppsmodellens vikter anländer inom veckan, men det finns fortfarande ingen licens, modellkort eller repository. Även när den väl har släppts kräver en 2,4T-modell åtta eller fler H200-klassade GPU:er. Den samtidigt tillkännagivna Qwen3.8-27B, som enligt uppgift kräver ~17 GB VRAM, är det praktiska alternativet för självhosting.
Ska jag använda båda?
Oftast ja. Ett tvåstegsupplägg — Flash-Lite som det billiga första steget för varje förfrågan, Qwen3.8-Max som eskaleringsvägen för långa kontexter, multimodala eller verkligt svåra uppgifter — behåller det mesta av Flash-Lites kostnadsfördel samtidigt som du får ett alternativ i framkant som är värt sitt pris.
Vilken ska jag välja för produktion idag?
Flash-Lite för arbete med hög volym, kort kontext och enbart text där Index 36 är tillräckligt — den är billig, snabb, granskad och beprövad. Qwen3.8-Max när arbetsbelastningen kräver en kontext på en miljon tokens, bild- eller videoinmatning, eller resonemang som Flash-Lite tydligt misslyckas med. Båda är nu genuint möjliga att driftsätta, vilket inte var sant när denna jämförelse först skrevs.
Slutsats
Gemini 3.5 Flash-Lite vs Qwen 3.8 brukade vara en jämförelse mellan en produkt och ett tillkännagivande. Det är det inte längre. Sedan den 3 augusti 2026 är Qwen3.8-Max allmänt tillgänglig, prissatt, självbetjäning och dokumenterad — så den ärliga ramen är ett nivåbeslut snarare än ett beredskapsbeslut.
Flash-Lite förblir det korrekta standardvalet för det arbete det byggdes för: till $0,30 / $2,50 och ~490 tokens/sekund körs det på varje förfrågan för en spottstyver, och dess granskade Index 36 är fullt tillräckligt för klassificering, routing och extraktion. Qwen3.8-Max är eskalationsnivån — en miljon tokens till fast pris, inbyggd bild- och videoinmatning och påstådd banbrytande resonemangsförmåga — till ungefär 6,7 gånger inmatningskostnaden. Dess enda kvarstående svaghet är densamma som tidigare: ingen oberoende utvärderare har betygsatt den, så dess kvalitetsfall vilar på Alibabas egen tabell. Håll utkik efter det första oberoende Intelligence Index-betyget och Qwen3.8-27B-vikterna, som kommer att konkurrera mycket mer direkt med Flash-Lites nisch. Under tiden, välj utifrån arbetslastens form — och överväg att köra båda.

Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
