Ett hero-titelkort för Qwen3.8-Omni-Flash med överrubriken "Alibaba – Qwen – 18 september 2026", underrubriken "Qwens nativa omnimodala modell – text, bild, ljud och video som indata, en miljon tokens i kontext, upp till en timme kontinuerlig ljud och video per anrop", och tre statistikchips med texten "Pris per miljon tokens: $0,15 in / $0,47 ut", "Ljudkostnad jämfört med tidigare generation: 98 % lägre" och "Utdatamodalitet: endast text".
Guides & Insights

Qwen3.8-Omni-Flash är här: 1M-tokenkontext, 98 % billigare ljud, endast text ut

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Lanseringen öppnade Qwen3.8-Omni-Flash för API-kunder i dag, den 18 september 2026, och siffran som den inledde med är en nota snarare än en poäng. För varje timme ljudinmatning säger Qwen att den nya modellen kostar 98 % mindre än sin föregångare Qwen3.5-Omni-Plus; för varje timme med kombinerat ljud och video, 93 % mindre. Allt annat i tillkännagivandet följer av den inramningen. Qwen3.8-Omni-Flash är en nativ omnimodal modell – text, bild, ljud och video som indata, en miljon tokens i kontext, upp till en hel timme kontinuerlig ljudvideo i ett enda anrop – och Alibaba säljer den inte som en bättre beskrivare av media utan som den första Qwen-modellen byggd för att agera på innehållet. Sloganen är "Omni Sinnen. Agentisk leverans." Haken, som sägs rakt ut i samma material, är att modellen bara svarar i text: den hör och ser, den talar inte.

Inget av det nedan har oberoende reproducerats. Modellen är bara några timmar gammal, ingen tredjepartsutvärdering av den finns ännu, och varje benchmark- och prissiffra i lanseringsmaterialet är Alibabas egen. Där en siffra är leverantörsrapporterad säger den här artikeln det i meningen som innehåller den; där en tolkning kommer från en kritiker snarare än leverantören, tillskrivs den. Det enda som är oberoende kontrollerbart i dag — att modellen är live på Alibabas plattformar och inte i någon annans katalog — är det som lanseringen är minst intresserad av att tala om.

Vad som faktiskt levererades

Specifikationsbladet är ovanligt rent för en omnimodal lansering, vilket i sig är själva historien: den tidigare generationen av omnimodeller i den här familjen sattes samman av separata perceptionskodare som skruvades fast på en text-LLM, och den här är byggd direkt på Qwen3.8-Flash arkitekturlinje, med modaliteter hanterade nativt snarare än ympade på.

• Indata – text, bild, ljud och video, där stereo och fyrakanaligt rumsligt ljud accepteras; utdata är endast text.

• Kontext — en miljon tokens, med maximal indata på ungefär 991K (cirka 983K i tänkarläge), maximal utdata på 131K, och en resonemangsbudget som når 262K.

• Längd – upp till en timmes kontinuerlig ljud- eller ljud- och video per samtal, vilket är siffran som gör mötes- och långvideoanvändningsfallen möjliga utan chunkning.

• Taltäckning – igenkänning på 74 språk och talgenerering på 29 i de kringliggande verktygen; en kinesiskspråkig redogörelse för lanseringen uppger 113 språk och dialekter för ljudinmatning.

• Tillgänglighet — Qianwen AI-plattformen och Alibaba Cloud Model Studio (Bailian), under API-id qwen3-8-omni-flash. Vikterna släpps inte. En Realtime-variant beskrivs som den första omnimodala modellen med lokalisering av ljudkälla.

A single-model scoreboard for Qwen3.8-Omni-Flash with six rows: Released 18 Sep 2026, Context 1M tokens, Media per call 1 hour continuous A/V, Price $0.15 in / $0.47 out per M, Output text only, and Independent score none yet. A footer reads 'All figures vendor-reported from Alibaba's launch materials, 18 Sep 2026. No independent evaluation of this model exists at the time of writing.'

De 98 procenten är ett kostnadspåstående, och aritmetiken bakom den är värd att se

En minskning med 98 % av kostnaden för en timme ljud är en mycket större siffra än en minskning med 98 % av priset för en token, och gapet mellan dessa två saker är där tillkännagivandet gör sitt arbete. Siffran per timme härleds genom att prissätta ett tvåminutersprov och multiplicera med trettio, med video samplad vid 720p och en bildruta per sekund. Det är ett legitimt sätt att ange en produktionsarbetsbelastning, och det är också en beskrivning av vad modellen ombeds titta på: en bildruta per sekund räcker för att veta vad som sades och ungefär vad som hände på skärmen, och är långt ifrån tillräckligt för att granska operationer på bildrutenivå, bedöma redigeringskvalitet eller upptäcka en artefakt i en enskild bildruta. Två förändringar multipliceras med varandra – en genuin sänkning av styckpriset och en mycket mer aggressiv samplingspolicy – och bara den första är en modellförbättring.

Själva enhetspriserna är konkreta. Internationell prissättning anges till $0,15 per miljon indatatokens, $0,016 per miljon cachade indatatokens och $0,47 per miljon utdatatokens. Inhemsk prissättning för Bailian anges till ¥0,8 per miljon för multimodalt indata, ned från cirka ¥18. Observera att de internationella och fastlandets faktureringssystem är separata och att siffrorna inte är utbytbara; den som jämför dem direkt får ett felaktigt svar.

Det här är den del av lanseringen där routing betyder mer än vanligt. OrcaRouter för vidare leverantörens listpris med 0 % påslag, så en prissänkning av det här slaget når våra kunder samma dag som den landar, i stället för först vid nästa avtalsförnyelse. En jämförelse som verkligen går att verifiera finns redan i vår egen katalog: Qwen3.8-Flash, den multimodala modell som den här är byggd vid sidan av, går att routa redan i dag för 0,15 USD per miljon indatatokens och 0,47 USD per miljon output – samma listpris som Alibaba anger för den nya omni-modellen – och den hanterade 2,47 miljarder tokens trafik genom vårt API under de sju dagar som föregick skrivandet av detta, vilket är ett rimligt mått på hur stor aptiten på den här nivån redan är. Själva omni-modellen finns ännu inte i vår katalog, och tills den gör det körs den på Alibabas egna plattformar och ingen annanstans. Vi tänker inte låtsas något annat.

Varje benchmark i lanseringen jämför en enda sak

Rubriken är en genomsnittlig förbättring på mer än 26 % över ungefär 30 utvärderingar – och var och en av dessa utvärderingar är mot Qwen3.5-Omni-Plus. Det är den rätta baslinjen för en lansering, och en snäv sådan: den säger att familjen har rört sig, inte var den landade i förhållande till något du kanske redan betalar för.

De enskilda siffrorna, alla leverantörsrapporterade: WildClawBench-MM 71,0, upp 36,5 poäng och den enskilt största förändringen i uppsättningen; UniClawBench 69,6; AgenticVBench upp 22,3 poäng till 36,8; LongAudioSpan 82,7, upp 8,3; OmniVideoBench 63,4, upp 9,6; OmniCap-IF 28,2. Det mest slående paret är talardiarisering på AliMeeting, där felfrekvensen sjunker från 88,11 till 3,35 och cpWER från 89,61 till 17,18 — ett hopp så stort att det förtjänar granskning snarare än applåder. En kinesisk teknisk analys av lanseringen hävdar just detta och tillskriver förbättringen i betydande utsträckning front-end- och diariseringsarbete runt modellen snarare än modellens egen resonemangsförmåga, och varnar för att systemet framstår som hörselspecialiserat med jämförelsevis svagare djupgående videoresonemang. Det är en kritikers tolkning, inte en uppmätt replikering, men deltats storlek är anledningen att ha det i åtanke.

A screenshot of the Qwen3.8-Omni-Flash launch post on qwen.ai (captured 18 September 2026, English UI), showing the 'Conducting Deep Research with Audio and Video' section with an embedded demo video, a MODEL WORKFLOW panel listing steps including Write report, Grab key frames, Dispatch Web research and Screenshot check, and a TIMELINE panel with chapter timestamps such as 0:00 Intro + a 5-minute composite and 10:02 Arrangement & Matching.

Det andra talet som är värt att hålla fast vid är inte alls någon poäng. I det som Alibaba kallar Agentic Understanding-läget bestämmer modellen själv vad den ska titta på och lyssna på i stället för att bearbeta varje bildruta, och samlar bevis i omgångar från grovt till fint. På OmniVideoBench höjer det läget noggrannheten från 63,4 till 67,8 samtidigt som det minskar tokens per fråga från 145 736 till 79 117 — en minskning med 45,7 %. Noggrannhet upp och kostnad ner samtidigt är det starkaste påståendet i lanseringen, och det är det som mest direkt stöder den agentiska pitchen.

Gemini-jämförelsen är snävare än vad täckningen antyder.

Alibabas positionering är att ljud- och videoförmågan ”närmar sig” Gemini 3.8 Flash samtidigt som den övergripande ljudprestandan överträffar den. Utan inramning ser de leverantörsrapporterade jämförelserna ut så här. WildClawBench-MM: 71,0 mot 58,9. SpotSoundBench: 67,2 mot 39,7. MMAU: 81,8 mot 76,9. DailyOmni: 85,1 mot 84,0.Det är verkliga skillnader i ljud och ljudcentrerad verktygsanvändning. De är också selektiva. På AgenticVBench, den renodlade videoresonemangstavlan, vänds ordningen om — Gemini på 45,0 mot Qwens 36,8 — och Alibabas egen redogörelse medger att Gemini fortfarande leder flera videoförståelsetester. En rimlig sammanfattning är att Qwen har tagit ljudhalvan av omni och fortfarande ligger efter på videohalvan, vilket är ett annat påstående än det som rubrikerna förde fram.

"Qwens första omnimodala modell" behöver en närmare bestämning.

Uppfattningen att Qwen3.8-Omni-Flash är Qwens första omnimodala modell spreds brett idag och är värd att vara noggrann med, eftersom familjen har en tidigare medlem med ett rimligt anspråk på titeln. Qwen2.5-Omni, en 7B-modell med öppna vikter som släpptes i mars 2025 under en Thinker-Talker-arkitektur, tog också text, bild, ljud och video som indata – och den genererade tal såväl som text. Det som verkligen är först här är inbyggd omnimodalitet: en modell byggd på Qwen3.8-Flash som grund snarare än en text-LLM med påkopplade perceptionskodare, plus en agent-först-designbrief. Båda påståendena är sanna; bara ett av dem är det som upprepades. Om du utvärderar modellen utifrån antagandet att ingen Qwen-omni-modell fanns före den här veckan, kommer du att felprissätta uppgraderingsvägen från Qwen2.5-Omni, vilket är en jämförelse vi har sammanställt separat.

Det är i verktygen som det agentiska anspråket faktiskt bor.

Två saker levererades tillsammans med modellen, och de är viktigare än modellkortet antyder, eftersom de är det som förvandlar perception till leverans. Qwen-MM-Plugins är en multimodalt plugin-svit för agentramverk som ger en extern agent förståelse för bild, ljud, video och dokument samt minne för långa videor och videoredigering; den uppges stödja Codex, Claude Code, Qwen Code, Gemini CLI och flera andra, och levereras med namngivna verktyg inklusive Video2Note, som omvandlar timmar av video till illustrerade PDF-anteckningar. Qwen-Live Harness är en runtime med öppen källkod för kontinuerlig realtidsinteraktion mellan alla modaliteter, och fungerar som ett schemaläggningslager där en användare samtalar live och delegerar tyngre arbete till bakgrundsagenter. En varning från bevakningen på lanseringsdagen: Qwen-Live Harness GitHub-sida returnerade 404 när Gigazine kontrollerade den, så betrakta verktygen som aviserade snarare än verifierade tills arkiven är tillgängliga.

Meningen som lanseringen begraver: den talar inte

För en modell vars föregångare genererade tal är det faktum att Qwen3.8-Omni-Flash är multimodal in och text ut den rad i specifikationen som får störst konsekvenser, och den förekommer i materialet till stor del som en fotnot. Det betyder att modellen inte kan sättas in i en tal-till-tal-produkt på egen hand. All dubbning, röstagent eller realtidskonversation som bygger på den behöver ett externt text-till-tal-steg och, för video, en extern renderare — vilket är precis varför plugin-sviten och live-harnessen finns. Den praktiska konsekvensen är en pipeline med fler rörliga delar än ”en enda omni-modell”, och en latens som måste budgeteras över alla dem.

Det finns en fin demonstration av klyftan, och av vad modellen är bra för, begravd i releasen. I ett experiment med "modell som optimerar modell" förbättrade Qwen3.8-Omni-Flash autonomt igenkänningen av Sichuan-dialekt hos Qwen2.5-Omni-3B, vilket sänkte teckenfelkvoten från 25,79 % till 15,30 % inom tolv timmar och byggde 3 413 träningsexempel över fyra omgångar. En modell som kan diagnostisera och reparera en mindre syskonmodells dialekthantering gör något som ett transkriberings-API inte kan. Det, snarare än benchmark-tabellen, är det tydligaste argumentet för vad "agentisk" ska betyda här.

A screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models (captured 18 September 2026), headed '199 models - 15 providers - one API key, one bill', with modality tabs reading Text 164, Image 10, Embeddings 5, Video 10 and TTS 10, a 'How to call any model' panel showing the OpenAI-compatible endpoint, and model cards including Qwen3.8 Max (0902) and DeepSeek V4.1 Flash.

Vad skulle förändra vår tolkning?

Det ärliga läget är att detta är en välspecificerad lansering med en övertygande prisberättelse, ingen oberoende utvärdering och åtminstone en strukturell begränsning som tillkännagivandet tonar ned. Tre saker skulle avgöra saken. En post i Artificial Analysis eller LMArena skulle göra leverantörens siffror jämförbara, och ingen sådan finns ännu. Ett tredjepartstest av den 45,7-procentiga tokenminskningen – påståendet att noggrannheten ökar medan kostnaden sjunker – skulle bekräfta det mest användbara och minst glamorösa resultatet i pressmeddelandet. Och en oberoende mätning av AliMeeting-diarisering skulle visa om tappet på 88 punkter beror på modellen eller på pipelinen runt den.

Fram till dess är det rimliga förhållningssättet det som gäller för vilken modell som helst på dess första dag: värd att testa, inte värd att satsa en produktionsväg på. Om du redan dirigerar trafik genom OrcaRouter är det praktiska draget att behålla arbetsbelastningen på de modeller du har mätt, och behandla Qwen3.8-Omni-Flash som en kandidat att utvärdera mot dem på ditt eget ljud och video i stället för på någon av leverantörernas benchmarktabeller. Om ditt användningsfall är långformat mötes- eller medieanalys på kinesiska och engelska, är tokenekonomin här tillräckligt stark för att motivera testet nu.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen