Ett hjälte-titelkort för jämförelsen ”Qwen3.8-Omni-Flash vs Qwen 3.8” med överraden ”Huvud mot huvud – samma familj, motsatta uppdrag”, underrubriken ”En specialist byggd för timmar av media mot den öppna kärnan med 2,4 biljoner parametrar som är byggd för djup per token”, och tre statistikchips med texten ”Pris per miljon tokens: 13x skillnad”, ”Kontext: 1M på båda” och ”Öppna vikter: endast ena sidan”.
Guides & Insights

Qwen3.8-Omni-Flash vs Qwen 3.8: En specialistversion mot en flaggskeppsversion

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Om du vill ha den korta versionen: Qwen3.8-Omni-Flash är ungefär tretton gånger billigare per token än Qwen 3.8 och är den enda av de två som är byggd för att klara en timmes ljud och video utan att kvävas — medan Qwen 3.8, den öppna kärnan med 2,4 biljoner parametrar i toppen av Qwen3.8-serien, är den du använder när svaret måste vara rätt snarare än billigt, och den enda av de två vars vikter du kan ladda ner. De delar en kontextlängd, ett familjenamn och ett lanseringsfönster från augusti till september. De är inte substitut för varandra, och hela värdet av den här jämförelsen ligger i att veta vilken fråga du faktiskt ställer.

För att vara exakt när det gäller namnen, eftersom familjen är stor. Qwen 3.8 betyder här den öppna kärnan 2.4T-A95B av mixture-of-experts-typ – modellen bakom Qwen3.8-Max-slutpunkten, som Alibaba presenterade den 3 augusti 2026 och publicerade vikter för den 12 augusti, och som Artificial Analysis indexerar till 40 på sitt Intelligence Index. Qwen3.8-Omni-Flash är den nativa omnimodala modellen som Alibaba gjorde tillgänglig som API-tjänst den 18 september 2026, byggd på arkitekturlinjen Qwen3.8-Flash, som tar in text, bild, ljud och video och returnerar text. Allt om flaggskeppet är leverantörsrapporterat eller oberoende indexerat, som nämnt; allt om omnimodellen är enbart leverantörsrapporterat, eftersom den är några timmar gammal och ingen utanför Alibaba har mätt den.

Två modeller, en familj, motsatta designbriefar

Frestelsen är att läsa detta som en stor modell och en liten modell från samma generation, på samma sätt som man skulle läsa Qwen3.8-Max mot Qwen3.8-Flash. Den läsningen är fel på ett sätt som kostar pengar. Qwen 3.8 kärna är en resonemangsmotor som råkar acceptera bilder och video; dess genomströmning mäts i tokens per sekund på svåra problem, dess pris är satt för att återspegla den beräkningskraft som en framåtpassning med 95 miljarder aktiva parametrar kostar, och dess utvärderingsblad är en lista över leaderboards för resonemang och kodning. Qwen3.8-Omni-Flash är en perceptions- och handlingsmotor som råkar resonera; dess pris är satt i förhållande till kostnaden för att läsa in timmar av media, och dess utvärderingsblad är en lista över leaderboards för ljud, video och verktygsanrop. Den ena är optimerad för djup per token. Den andra är optimerad för tokens per timme innehåll.

Den skillnaden framträder som tydligast på en plats som marknadsföringen inte nämner. Båda modellerna tar emot ungefär en miljon tokens och båda tar emot video. Men Qwen3.8-Omni-Flash är uttryckligen konstruerad kring varaktighetsproblemet – upp till en timmes kontinuerligt ljud- och videomaterial i ett enda anrop, med ett Agentic Understanding-läge där modellen själv väljer vad den ska sampla i stället för att bearbeta varje bildruta, vilket minskar antalet tokens per fråga från 145 736 till 79 117 samtidigt som noggrannheten på OmniVideoBench ökar från 63,4 till 67,8. Qwen 3.8 har ingen motsvarande publicerad mekanism. Att mata den med två timmars video är möjligt på papper; att göra det till ett pris som överlever kontakt med en ekonomiavdelning är en annan fråga, och det är frågan som omnimodellen byggdes för att besvara.

Dimensionerna som faktiskt avgör det

• Pris — Qwen3.8-Omni-Flash $0,15 per miljon indata och $0,47 per miljon utdata, jämfört med Qwen 3.8 på $2,00 och $6,00. Cacheläsning: $0,016 jämfört med $0,25.

• Öppna vikter – Qwen 3.8 publicerade vikter den 12 augusti 2026 under en anpassad licens; Qwen3.8-Omni-Flash finns endast via API och Alibaba har inte meddelat att den kommer att släppas.

• Kontext – en miljon tokens på båda sidor; 991K maximal indata på omni-modellen, med 131K maximal utdata och en resonemangsbudget på 262K.

• Medialängd – upp till en timmes kontinuerlig ljud- och video i ett enda omni-anrop; flaggskeppet är dokumenterat för videoinmatning utan att någon timkostnad nämns.

• Utdatamodalitet – text på båda sidor. Ingen av dem genererar tal, trots omnimodellens härkomst.

• Oberoende poäng — Qwen 3.8 ligger på 40 i Artificial Analysis Intelligence Index. Qwen3.8-Omni-Flash har ännu ingen oberoende poäng av något slag.

A two-column scoreboard, 'Qwen3.8-Omni-Flash vs Qwen 3.8 - the scoreboard'. Left column Qwen3.8-Omni-Flash: Price per M $0.15 in / $0.47 out, Context 1M tokens, Media per call 1 hour continuous A/V, Output text only, Open weights not released, Independent score none yet. Right column Qwen 3.8: Price per M $2.00 in / $6.00 out, Context 1M tokens, Media per call video input with no per-hour price, Output text only, Open weights published 12 Aug 2026, Independent score AA Index 40. The footer reads 'Qwen 3.8 pricing and Index score per Artificial Analysis and Alibaba; Qwen3.8-Omni-Flash figures vendor-reported and unreproduced.'

Varför benchmark-tabellerna inte kan avgöra detta

Det finns ingen direkt jämförelsetabell, och det kommer inte att finnas en sådan inom kort. Alibabas lanseringsmaterial för Qwen3.8-Omni-Flash benchmarkar den uteslutande mot Qwen3.5-Omni-Plus, dess direkta föregångare, och mot Gemini 3.8 Flash; flaggskeppets siffror kommer från en helt annan uppsättning resonemangs- och kodningsutvärderingar. De två tabellerna delar inte en enda rad. Den som publicerar en tabell som ställer dem sida vid sida på en och samma axel har byggt den axeln själv.

Det som ärligt kan sägas är riktningsgivande. Enligt tillverkarens egna siffror är omni-modellen ett stort steg framåt jämfört med den omni-serie den ersätter – en genomsnittlig förbättring på över 26 % i omkring trettio utvärderingar, med WildClawBench-MM på 71,0, UniClawBench på 69,6 och LongAudioSpan på 82,7 – och ett äkta men partiellt sådant gentemot Gemini 3.8 Flash, där den ligger före i ljudcentrerade mätningar som SpotSoundBench (67,2 mot 39,7) och MMAU (81,8 mot 76,9) och ligger efter i det renodlade videoresonemangstestet AgenticVBench (36,8 mot 45,0). På flaggskeppssidan är Qwen 3.8:s Index-poäng på 40 en oberoende mätning och värd mer än något av ovanstående. Det är olika typer av bevis och bör inte slås samman till ett medelvärde.

A screenshot of the Qwen3.8-Omni-Flash launch post on qwen.ai (captured 18 September 2026, English UI), showing the 'Conducting Deep Research with Audio and Video' section with an embedded demo video, a MODEL WORKFLOW panel listing steps including Write report, Grab key frames, Dispatch Web research and Screenshot check, and a TIMELINE panel with chapter timestamps such as 0:00 Intro + a 5-minute composite and 10:02 Arrangement & Matching.

En genomräknad kostnadsjämförelse, med antagandet angivet

Ta ett analysjobb för långa dokument och video: 300 000 indatatokens och 20 000 utdatatokens, en rimlig omfattning för ett inspelat möte på nittio minuter med bilder. På Qwen3.8-Omni-Flash är det 300 000 × $0,15 per miljon = $0,045 för indata och 20 000 × $0,47 per miljon = $0,0094 för utdata, så ungefär 5,4 cent. På Qwen 3.8 är samma anrop 300 000 × $2,00 per miljon = $0,60 och 20 000 × $6,00 per miljon = $0,12, eller ungefär 72 cent. Drygt tretton gånger kostnaden för samma antal tokens.

Det tal som ändrar beslutet är inte förhållandet utan volymen. Vid hundra sådana jobb om dagen är det ungefär $5 om dagen mot ungefär $72 om dagen – skillnaden mellan en funktion du levererar och en funktion du minskar omfattningen på. Men om uppgiften är en svår extrahering från ett kontrakt på 300 000 tokens där ett felaktigt svar kostar en timme mänsklig granskning, är 13x-premien irrelevant och den starkare resonemangsmodellen vinner på det första misstag den inte gör. Sätt antagandet innan du tittar på prisraden, inte efter.

Där var och en faktiskt vinner

Qwen3.8-Omni-Flash vinner på allt som mäts i timmar. Mötestranskribering med diarisering och extrahering av uppföljningsuppgifter, sammanfattning av långa videor, audiovisuella forskningsrapporter, undertextningspipelines och alla agenter som själva måste avgöra vilken minut av en inspelning som spelar roll. Den leverantörsrapporterade förbättringen av diarisering – talarfelkvoten för AliMeeting sjunker från 88,11 till 3,35 – är den typen av skillnad som förvandlar en manuellt granskad pipeline till en automatiserad, även om en kinesisk teknisk analys av lanseringen hävdar att en stor del av vinsten kommer från front-end- och diariseringskonstruktion byggd runt modellen snarare än från modellen själv, så benchmarka den på ditt eget ljud innan du pensionerar det mänskliga granskningssteget. Omni-modellen vinner också enkelt på pris för alla textarbetsbelastningar med hög volym där textkvaliteten är tillräcklig, vilket Alibaba hävdar är jämförbar med enbart textmodeller av samma storlek – ett icke reproducerat påstående, och värt att testa i stället för att anta.

Qwen 3.8 vinner där resultatet bedöms snarare än räknas: krävande resonemang, agentiskt arbete med lång horisont, storskaligt kodarbete, dokumentanalys med miljontals token där syntesen är produkten. Den vinner också på en dimension som inte har något med benchmarks att göra – den har öppna vikter. Om din begränsning är datalokalisering, lokal driftsättning, finjustering eller helt enkelt att inte vilja ha en leverantör i inferensvägen, är omni-modellen inte ens en kandidat, och ingen prisfördel stänger det gapet. Den enda begränsningen avgör fler verkliga driftsättningar än alla siffror ovan.

Kör dem utan två kontrakt

Den praktiska friktionen i en jämförelse som den här är sällan valet av modell; det är att man till slut tvingas integrera två leverantörer, två faktureringsrelationer och två uppsättningar klientkod för att ta reda på vilken man egentligen ville ha. Qwen3.8-Max — slutpunkten som bär den öppna kärnan med 2,4 biljoner parametrar — är live på OrcaRouter under modell-id qwen/qwen3.8-max, till 2,00 USD per miljon indatatokens och 6,00 USD per miljon utdatatokens, med en kontext på en miljon tokens och indata i form av text, bild och video, tillsammans med över 200 andra modeller på en enda nyckel till leverantörens listpris utan påslag och med automatisk failover mellan leverantörer om en slutpunkt försämras. Qwen3.8-Omni-Flash finns inte i den katalogen — den körs på Alibabas egna plattformar — så den ärliga konfigurationen i dag är flaggskeppet via vår rutt och omni-modellen som anropas direkt, där routningslagret ger dig en plats att placera testets förlorare när du väl har kört det.

A screenshot of the OrcaRouter model page for Qwen3.8 Max at www.orcarouter.ai/models/qwen/qwen3.8-max (captured 18 September 2026, English UI), showing the model id qwen/qwen3.8-max with a FEATURED badge and a byline date of 2026-08-03, a spec panel reading ctx 1M tokens, Input text + image + video, Output text, p50 TTFT 10.00s, and a metrics row reading INPUT $2.00 / 1M tokens, OUTPUT $6.00 / 1M tokens, TRAFFIC 84.0M tokens / 7d, above OpenAI- and Anthropic-compatible SDK code samples.

Domen

Välj Qwen3.8-Omni-Flash när indata är långt, utdata är kort, och volymen gör styckpriset till den bindande begränsningen. Välj Qwen 3.8 när indata är tätt, utdata är produkten, och antingen korrekthet eller kontroll över driftsättningen är inte förhandlingsbar. Överlappningszonen — videoförståelse — är den enda platsen där en genuin direkt jämförelse finns, och i den zonen har omnimodellen argumentet för kostnad och varaktighet medan flaggskeppet har argumentet för resonemang och öppna vikter. Kör båda på dina egna data innan du bestämmer dig; omnimodellen har ingen oberoende utvärdering ännu, och ett prisövertag på lanseringsdagen är precis den typ av sak som är värd att bekräfta mot en faktura snarare än ett tillkännagivande.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen