
Qwen3.8-Omni-Flash fem dagar in: En dörr, inga vikter och de första poängen som inte är Alibabas
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Fem dagar efter att leverantören öppnade Qwen3.8-Omni-Flash för API-kunder, har modellen fortfarande exakt ett hem. Den körs på leverantörens egen Qianwen-plattform och på dess Bailian-molntjänst; tredjepartslistningarna som har dykt upp sedan lanseringen är proxyservrar framför samma slutpunkter, inte en andra plats där modellen finns. Inga vikter har släppts. Siffrorna från lanseringsdagen – en minskning med 98 % av kostnaden för en timme ljud, en genomsnittlig förbättring med 26 % jämfört med Qwen3.5-Omni-Plus, en miljon tokens i kontext, endast textutdata – är fortfarande leverantörens egna och har inte reproducerats. Det som faktiskt har förändrats på fem dagar är inte modellen utan marken runt omkring den: ett tunt lager av tredjepartspoäng har dykt upp, ramverksstöd kom på plats dag noll, och jämförelsen som alla griper efter är mot Gemini 3.8 Flash snarare än den Qwen3.8-Flash som den här modellen byggdes vid sidan av. Var och en av dessa förtjänar en närmare titt än vad lanseringsbevakningen gav dem.
Dörren är en bra dörr, och den är den enda.
Tillgängligheten har breddats utan att bli plural. Modellen svarar oförändrat på en OpenAI-formad begäran, vilket innebär att befintlig klientkod till största delen fungerar; det som går sönder är slutpunkten, eftersom de internationella och fastlandsbaserade värdarna är separata tjänster med separat fakturering. Kod som pekar mot standarden kommer antingen att misslyckas eller faktureras i fel valuta, och berättelsen om priset per timme gäller bara på den internationella sidan. Klientbibliotek med öppen källkod levererade stöd för modellen från dag ett, vilket är genuint användbart och inte heller innebär en andra leverantör: ett bibliotek som talar med Bailian är ett bekvämlighetshölje runt samma enda utbudskälla.
Det är den strukturella risken som är värd att namnge. En modell med en enda källa har ingen failover-väg. Om slutpunkten begränsar hastigheten, försämras eller en region blir otillgänglig, finns det ingenstans att ta vägen, och hur mycket stöd för klientbibliotek det än finns ändrar det inte saken. Det är också därför vi säger vår egen hållning rakt ut i stället för att antyda något annat: Qwen3.8-Omni-Flash finns inte i vår katalog. Vi hostar den inte, och en läsare som registrerar sig med förväntan att kunna routa den skulle bli vilseledd. Det som går att routa är resten av familjen – Qwen3.8-Flash och Qwen3.8-Max är båda live på vårt API – och OrcaRouter för vidare leverantörens listpris med 0 % påslag, så när Alibabas omni-prissättning ändras, eller den dag omni-modellen blir tillgänglig att routa, når ändringen kunderna samma dag i stället för vid nästa avtalsförnyelse.

De första poängen som inte är Alibabas är magra, och de är inte smickrande.
Ingenting finns på Artificial Analysis för den här modellen, och den frånvaron är den ärliga rubriken fem dagar in: topplistorna som alla citerar för närliggande modeller har ännu inte en rad för omni-modellen. Luckan har fyllts av något annat. En tredjepartsplattform för utvärdering har börjat publicera körningar mot modellen, och dess sammanfattning är värd att läsa just för hur mycket den inte säger. Den rapporterar e-postklassificering med 99,0 % noggrannhet (86:e percentilen), etik med 95,0 % (23:e percentilen) och resonemang med 56,0 %, vilket den placerar i 28:e percentilen och kallar en anmärkningsvärd svaghet; hastighet hamnar i 21:a percentilen, kostnad i 58:e, med en total framgångsgrad på 89 %.
Behandla dem med stor försiktighet, och inte bara för att urvalet är litet. Samma sida daterar modellens lansering till den 20 september, två dagar efter att Alibaba släppte den, anger inga körningsdatum för något av resultaten och visar en tom benchmarktabell under en sammanfattning som beskriver siffror som tabellen inte innehåller. Det är profilen för en tidig, lätt övervakad testrigg snarare än en uppmätt utvärdering, och den ärliga tolkningen är att detta är de första datapunkterna från andra än leverantören snarare än de första tillförlitliga. De är en anledning att testa modellen själv, inte en anledning att dra några slutsatser. Riktningen är dock förenlig med vad leverantörens egna material antyder genom utelämnande: detta är en modell för perception och långmedia, och de resonemangstunga resultattavlorna är inte vad den siktade på.
Det finns också en fälla i sökresultaten som kommer att fånga folk under de kommande veckorna. Qwen 3.8, textmodellen, har ett Artificial Analysis Intelligence Index i fyrtiointervallet, och den siffran har citerats i mer än en sammanfattning som om den beskrev omni-modellen. Det gör den inte. De är olika modeller med olika uppgifter, och omni-modellen har inget index alls ännu.

Benchmark-tabellen är fortfarande en leverantör som jämför sig med sig själv.
Lanseringssiffran – en genomsnittlig förbättring på över 26 % i ungefär trettio utvärderingar – mäts helt och hållet mot Qwen3.5-Omni-Plus. Det säger att familjen har rört sig. Det säger inte var modellen står i förhållande till något du redan kan tänkas betala för, och de selektiva jämförelser som cirkulerade vid sidan av den sluter inte heller gapet. Den leverantörsrapporterade bilden mot Gemini 3.8 Flash är en riktig vinst på ljudresultattavlorna och en förlust på de som mäter agentiskt videoarbete: WildClawBench-MM 71,0 mot 58,9 och SpotSoundBench 67,2 mot 39,7 på ena sidan, AgenticVBench 36,8 mot 45,0 och OmniGAIA 74,0 mot 78,6 på den andra. Alibabas eget sammanfattande språkbruk – ljud- och videoprestanda som "närmar sig" Gemini, övergripande ljudprestanda som överträffar den – är mer försiktigt än de rubriker Alibaba gav upphov till, och den försiktiga versionen är den korrekta.
• Kontext — 1M tokens, med ungefär 991K maximal indata (cirka 983K i tänkläge) och 131K maximal utdata.
• Modalitet — text, bild, ljud och video in; endast text ut. Ingen talgenerering i basmodellen.
• Varaktighet — upp till en timmes kontinuerligt ljud eller ljud/video per samtal, vilket är det som gör mötes- och långmediaarbete möjligt utan chunkning.
• Språktäckning – igenkänning på 74 språk plus 39 kinesiska dialekter i lanseringsmaterialet, med bredare siffror (113 språk och dialekter) som anges på annat håll för ljudinmatning.
• Indatadetalj — stereo och fyrkanaligt rumsligt ljud accepteras, där Realtime-varianten beskrivs som den första omnimodala modellen som kan lokalisera ett mål via ljudet.
• Pris — $0,15 per miljon indata-tokens, $0,016 cachade, $0,47 utdata på den internationella sidan, samt en separat prislista för fastlandet som inte är jämförbar.
98 % är verkligt, och det är inte din räkning.
Enligt Alibabas egen metod – ett tvåminutersprov multiplicerat med trettio, video samplad i 720p och en bildruta per sekund – sjunker en timme ljudinmatning från 0,28 USD till under 0,01 USD, och en timme kombinerad ljud och video från 3,27 USD till 0,20 USD. Det är stora, specifika, leverantörsrapporterade minskningar, och de gäller en enskild post. Det räkneverk som spelar roll är hur stor andel av din arbetsbelastning den posten utgör. En pipeline som spenderar större delen av sina tokens på utdata, på cachad kontext eller på videobildrutor som samplas tätare än en per sekund kommer att se en mycket mindre procentuell förändring på fakturan än rubriken lovar, och rubriken handlar om ljudinmatning, inte om totalsumman. Lägg till enbart textutdata och gapet vidgas igen: allt som måste tala tillbaka behöver en andra modell, och den modellen faktureras separat.
Det här är delen av bilden där routing gör nytta. Värdet av en pass-through-router är inte en rabatt – utan att du betalar enligt leverantörens egen prislista, och att en arbetsbelastning kan spridas över flera modeller så att en modell från en enda källa är en komponent snarare än ett beroende. En omnimodell som är det enda du kan anropa är en enda felpunkt på både tillgänglighets- och prissättningsnivå.

Vad fem dagars produktion faktiskt skulle berätta för dig
Tre saker skulle avgöra de öppna frågorna. En oberoende mätning av AliMeeting-diariseringsresultatet – en felfrekvens som sjunker från 88,11 till 3,35 och cpWER från 89,61 till 17,18 – skulle visa om det tillhör modellen eller den diarisering och front-end-teknik som omger den, vilket är vad åtminstone en kinesisk teknisk analys tillskriver merparten av förbättringen. Ett reproducerat test av det agentiska lägets tokenminskning, där noggrannheten steg från 63,4 till 67,8 på OmniVideoBench medan tokens per fråga sjönk från 145 736 till 79 117, skulle bekräfta det enskilt mest användbara påståendet i släppet: att modellen kan bli både bättre och billigare samtidigt. Och en rad i Artificial Analysis eller i en arena skulle göra varje leverantörssiffra ovan jämförbar, vilket är förutsättningen för att modellen ska väljas snarare än testas.
Fram till dess är den hållning som är rimlig den som gäller för vilken fem dagar gammal modell som helst med en värd och ingen oberoende utvärdering: värd att mäta på ditt eget ljud och din egen video, inte värd att göra till den enda vägen genom din pipeline. Om din arbetsbelastning är långformsmötes- eller medieanalys på kinesiska eller engelska och dina kostnader domineras av indata-timmar snarare än utdata-tokens, är ekonomin här tillräckligt stark för att motivera ett test den här veckan. Om din arbetsbelastning behöver få tillbaka tal, eller behöver en reservlösning när en leverantör försämras, kan modellen som den ser ut i dag inte vara hela svaret – och ingen mängd day-zero-ramverksstöd ändrar på det.
Jämförda i den här artikeln2
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
