Een hero-titelkaart voor Qwen3.8-Omni-Flash met de bovenkop 'Alibaba - Qwen - 18 september 2026', de ondertitel 'Qwens native omni-modale model - tekst, afbeelding, audio en video in, één miljoen tokens context, tot een uur continue audio-video per aanroep', en drie statchips met de tekst 'Prijs per M tokens: $0,15 in / $0,47 out', 'Audiokosten t.o.v. vorige generatie: 98% lager', en 'Uitvoermodaliteit: alleen tekst'.
Guides & Insights

Qwen3.8-Omni-Flash is hier: 1M-tokencontext, 98% goedkopere audio, alleen tekstuitvoer

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De lancering opende Qwen3.8-Omni-Flash vandaag, 18 september 2026, voor API-klanten, en het getal waarmee het uitpakt is een rekening in plaats van een score. Per uur audio-invoer zegt Qwen dat het nieuwe model 98% minder dan zijn voorganger Qwen3.5-Omni-Plus; per uur gecombineerde audio en video, 93% minder. Al het overige in de aankondiging volgt uit die inkadering. Qwen3.8-Omni-Flash is een native omni-modaal model — tekst, afbeelding, audio en video als invoer, een miljoen tokens context, tot een volledig uur aaneengesloten audio en video binnen één enkele aanroep — en Alibaba verkoopt het niet als een betere beschrijver van media, maar als het eerste Qwen-model dat gebouwd is om erop te handelen. De tagline is "Omni Senses. Agentic Delivery." De keerzijde, ronduit vermeld in hetzelfde materiaal, is dat het model alleen in tekst antwoordt: het hoort en kijkt, maar spreekt niet.

Niets hieronder is onafhankelijk gereproduceerd. Het model is pas een paar uur oud, er bestaat nog geen enkele evaluatie door derden van, en elke benchmark- en prijsopgave in het lanceringsmateriaal is afkomstig van Alibaba zelf. Waar een cijfer van de leverancier afkomstig is, zegt dit stuk dat in de zin die het cijfer bevat; waar een lezing van een criticus komt en niet van de leverancier, wordt die toegeschreven. Het enige dat vandaag onafhankelijk te controleren is — dat het model live staat op de platforms van Alibaba en niet in de catalogus van iemand anders — is precies het punt waarover de lancering het minst graag praat.

Wat er daadwerkelijk is uitgebracht

De specificatielijst is ongewoon overzichtelijk voor een omni-modale lancering, en dat is op zich al het verhaal: de vorige generatie omni-modellen in deze familie werd samengesteld uit afzonderlijke perceptie-encoders die op een tekst-LLM waren vastgeschroefd, en deze is direct gebouwd op de Qwen3.8-Flash architectuurlijn, waarbij modaliteiten native worden afgehandeld in plaats van erop geënt.

• Invoer — tekst, afbeelding, audio en video, waarbij stereo en vierkanaals ruimtelijke audio worden geaccepteerd; uitvoer is alleen tekst.

• Context — één miljoen tokens, met een maximale invoer van ongeveer 991K (ongeveer 983K in denkmodus), een maximale uitvoer van 131K en een redeneerbudget dat 262K bereikt.

• Duur — tot een uur continue audio of audio-video per gesprek, het aantal dat de gebruiksscenario's voor vergaderingen en lange video's mogelijk maakt zonder opsplitsing.

• Spraakdekking — herkenning van 74 talen en spraaksynthese voor 29 in de bijbehorende tooling; één Chinese beschrijving van de release vermeldt 113 talen en dialecten voor audio-invoer.

• Beschikbaarheid — het Qianwen AI-platform en Alibaba Cloud Model Studio (Bailian), onder de API-id qwen3-8-omni-flash. Gewichten worden niet vrijgegeven. Een Realtime-variant wordt beschreven als het eerste omni-modale model met geluidsbronlokalisatie.

A single-model scoreboard for Qwen3.8-Omni-Flash with six rows: Released 18 Sep 2026, Context 1M tokens, Media per call 1 hour continuous A/V, Price $0.15 in / $0.47 out per M, Output text only, and Independent score none yet. A footer reads 'All figures vendor-reported from Alibaba's launch materials, 18 Sep 2026. No independent evaluation of this model exists at the time of writing.'

De 98% is een kostenclaim, en het rekenwerk erachter is het bekijken waard

Een verlaging van 98% in de kosten van een uur audio is een veel groter getal dan een verlaging van 98% in de prijs van een token, en het gat tussen die twee dingen is waar de aankondiging zijn werk doet. Het bedrag per uur wordt afgeleid door een sample van twee minuten te prijzen en met dertig te vermenigvuldigen, waarbij video wordt gesampled op 720p en één frame per seconde. Dat is een legitieme manier om een productieworkload te citeren, en het is tegelijk een beschrijving van waar het model naar wordt gevraagd te kijken: één frame per seconde is genoeg om te weten wat er gezegd werd en ruwweg wat er op het scherm gebeurde, en lang niet genoeg om bewerkingen op frameniveau te inspecteren, de montagekwaliteit te beoordelen of een artefact van één enkel frame op te vangen. Er worden twee veranderingen met elkaar vermenigvuldigd — een echte verlaging van de stukprijs, en een veel agressiever samplingbeleid — en alleen de eerste is een verbetering van het model.

De eenheidsprijzen zelf zijn concreet. Voor internationale prijzen wordt gerekend met $0,15 per miljoen inputtokens, $0,016 per miljoen gecachte inputtokens, en $0,47 per miljoen outputtokens. Voor binnenlandse Bailian-prijzen wordt gerekend met ¥0,8 per miljoen voor multimodale input, een daling ten opzichte van ongeveer ¥18. Let op: de internationale facturatiesystemen en die van het vasteland zijn gescheiden en de cijfers zijn niet onderling uitwisselbaar; wie ze rechtstreeks met elkaar vergelijkt, krijgt een verkeerd antwoord.

Dit is het deel van de release waarin routering meer dan gewoonlijk van belang is. OrcaRouter geeft de listprijs van de provider door tegen 0% opslag, zodat een dergelijke leveranciersprijsverlaging onze klanten bereikt op de dag dat die ingaat, in plaats van pas bij de volgende contractverlenging. Eén daadwerkelijk verifieerbare vergelijking staat al in onze eigen catalogus: Qwen3.8-Flash, het multimodale model waarmee dit model samen wordt ontwikkeld, is vandaag routeerbaar voor $0,15 per miljoen inputtokens en $0,47 per miljoen outputtokens — dezelfde listprijs die Alibaba voor het nieuwe omni-model opgeeft — en het verwerkte 2,47 miljard tokens aan verkeer via onze API in de zeven dagen voordat dit werd geschreven, wat een goede maatstaf is voor hoeveel vraag deze prijsklasse al heeft. Het omni-model zelf staat nog niet in onze catalogus, en totdat het er wel in staat, draait het op Alibaba's eigen platforms en nergens anders. We gaan niet doen alsof het anders is.

Elke benchmark bij de lancering vergelijkt één ding.

De kop is een gemiddelde verbetering van meer dan 26% over ongeveer 30 evaluaties — en elk van die evaluaties is afgezet tegen Qwen3.5-Omni-Plus. Dat is de juiste baseline voor een lancering, en een smalle: het vertelt je dat de familie is opgeschoven, niet waar die is geland ten opzichte van alles waarvoor je mogelijk al betaalt.

De afzonderlijke cijfers, allemaal door de leverancier gerapporteerd: WildClawBench-MM 71.0, een stijging van 36.5 punten en de grootste enkele verschuiving in de reeks; UniClawBench 69.6; AgenticVBench met 22.3 punten omhoog naar 36.8; LongAudioSpan 82.7, 8.3 punten hoger; OmniVideoBench 63.4, 9.6 punten hoger; OmniCap-IF 28.2. Het opvallendste paar is sprekerdiarisatie op AliMeeting, waar het foutpercentage daalt van 88.11 naar 3.35 en de cpWER van 89.61 naar 17.18 — een sprong die zo groot is dat ze kritisch bekeken moet worden in plaats van toegejuicht. Een Chinese technische analyse van de lancering betoogt precies dat: ze schrijft de verbetering grotendeels toe aan front-end- en diarisatietechniek rond het model in plaats van aan het redeneervermogen van het model zelf, en waarschuwt dat het systeem overkomt als gespecialiseerd in horen, met een relatief zwakkere diepe videoredenering. Dat is de lezing van een criticus, geen gemeten replicatie, maar de omvang van het verschil is de reden om het in gedachten te houden.

A screenshot of the Qwen3.8-Omni-Flash launch post on qwen.ai (captured 18 September 2026, English UI), showing the 'Conducting Deep Research with Audio and Video' section with an embedded demo video, a MODEL WORKFLOW panel listing steps including Write report, Grab key frames, Dispatch Web research and Screenshot check, and a TIMELINE panel with chapter timestamps such as 0:00 Intro + a 5-minute composite and 10:02 Arrangement & Matching.

Het andere getal dat de moeite waard is om te onthouden, is helemaal geen score. In wat Alibaba de Agentic Understanding-modus noemt, bepaalt het model zelf waar het naar kijkt en luistert in plaats van elk frame te verwerken, en verzamelt het bewijs in rondes van grof naar fijn. Op OmniVideoBench verhoogt die modus de nauwkeurigheid van 63,4 naar 67,8, terwijl het aantal tokens per query daalt van 145.736 naar 79.117 — een vermindering van 45,7%. Nauwkeurigheid omhoog en kosten omlaag tegelijk is de sterkste claim in deze release, en het is degene die de agentische propositie het meest direct ondersteunt.

De Gemini-vergelijking is beperkter dan de berichtgeving suggereert

Alibaba's positionering is dat de audio-videocapaciteit "Gemini 3.8 Flash benadert", terwijl de algehele audioprestatie die overtreft. Zonder de inkleding zien de door de leverancier gerapporteerde vergelijkingen er zo uit. WildClawBench-MM: 71,0 tegen 58,9. SpotSoundBench: 67,2 tegen 39,7. MMAU: 81,8 tegen 76,9. DailyOmni: 85,1 tegen 84,0. Dat zijn echte verschillen op het gebied van audio en audiogericht toolgebruik. Ze zijn ook selectief. Op AgenticVBench, het leaderboard voor puur videoredeneren, keert de volgorde om — Gemini op 45,0 tegen Qwen's 36,8 — en Alibaba's eigen verslag geeft toe dat Gemini nog altijd meerdere tests voor videobegrip aanvoert. Een redelijke samenvatting is dat Qwen de audiohelft van omni heeft overgenomen en nog achterloopt op de videohelft, wat een andere bewering is dan waarmee de krantenkoppen uitpakten.

"Het eerste omni-modale model van Qwen" heeft een nuancering nodig.

De framing dat Qwen3.8-Omni-Flash Qwens eerste omni-modale model is, deed vandaag breed de ronde en verdient precisie, want de familie heeft een eerdere telg die met recht aanspraak kan maken op de titel. Qwen2.5-Omni, een open-weight 7B-model dat in maart 2025 werd uitgebracht onder een Thinker-Talker-architectuur, nam ook tekst, beeld, audio en video als input — en het genereerde zowel spraak als tekst. Wat hier werkelijk een primeur is, is native omni-modaliteit: één model gebouwd op de Qwen3.8-Flash basis in plaats van een tekst-LLM met perceptie-encoders eraan vast, plus een agent-first ontwerpopdracht. Beide uitspraken zijn waar; slechts één ervan is degene die werd herhaald. Als je het model beoordeelt in de veronderstelling dat er vóór deze week geen Qwen omni-model bestond, zul je het upgradepad vanaf Qwen2.5-Omni verkeerd prijzen, een vergelijking die we apart hebben uitgewerkt.

De tooling is waar de agentische claim daadwerkelijk zit

Er zijn twee dingen samen met het model uitgebracht, en ze zijn belangrijker dan de modelkaart suggereert, omdat zij het zijn die waarneming omzetten in daadwerkelijke oplevering. Qwen-MM-Plugins is een multimodale plug-insuite voor agent-harnassen die een externe agent beeld-, audio-, video- en documentbegrip geeft, plus geheugen voor lange video's en videobewerking; er wordt geadverteerd met ondersteuning voor Codex, Claude Code, Qwen Code, Gemini CLI en diverse andere, en bevat benoemde tools waaronder Video2Note, dat uren video omzet in geïllustreerde pdf-notities. Qwen-Live Harness is een open-source runtime voor continue realtime omnimodale interactie, die fungeert als een planningslaag waarin een gebruiker live converseert en zwaarder werk delegeert aan achtergrondagenten. Eén voorbehoud uit de berichtgeving op de dag van de lancering: de GitHub-pagina van Qwen-Live Harness gaf een 404 toen Gigazine deze controleerde, dus beschouw de tooling als aangekondigd in plaats van geverifieerd totdat de repositories beschikbaar zijn.

De zin die de lancering begraaft: hij spreekt niet.

Voor een model waarvan de voorganger spraak genereerde, is het feit dat Qwen3.8-Omni-Flash multimodaal-in en tekst-uit is de meest ingrijpende regel in de specificatie, en die staat in de materialen grotendeels als voetnoot. Het betekent dat het model niet op zichzelf in een spraak-naar-spraakproduct kan worden ingezet. Elke nasynchronisatie, voice-agent of realtimegesprek die daarop is gebouwd, heeft een externe tekst-naar-spraakfase nodig en, voor video, een externe renderer — precies waarom de plugin-suite en de live-harness bestaan. De praktische consequentie is een pijplijn met meer bewegende delen dan "één omni-model", en een latentie die over alle onderdelen moet worden begroot.

Er zit een fraaie demonstratie van de kloof, en van waar het model goed voor is, verstopt in de release. In een "model-optimaliseert-model"-experiment verbeterde Qwen3.8-Omni-Flash autonoom de Sichuan-dialectherkenning van Qwen2.5-Omni-3B, waardoor het karakterfoutpercentage daalde van 25,79% naar 15,30% binnen twaalf uur, en in vier rondes werden 3.413 trainingsvoorbeelden opgebouwd. Een model dat de dialectverwerking van een kleinere broer of zus kan diagnosticeren en repareren, doet iets wat een transcriptie-API niet kan. Dat, en niet de benchmarktabel, is het duidelijkste argument voor wat "agentic" hier zou moeten betekenen.

A screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models (captured 18 September 2026), headed '199 models - 15 providers - one API key, one bill', with modality tabs reading Text 164, Image 10, Embeddings 5, Video 10 and TTS 10, a 'How to call any model' panel showing the OpenAI-compatible endpoint, and model cards including Qwen3.8 Max (0902) and DeepSeek V4.1 Flash.

Wat zou onze inschatting veranderen?

De eerlijke stand van zaken is dat dit een goed uitgespecificeerde lancering is met een overtuigend prijsverhaal, geen onafhankelijke evaluatie, en minstens één structurele beperking die de aankondiging afzwakt. Drie dingen zouden het beslechten. Een vermelding in Artificial Analysis of LMArena zou leverancierscijfers omzetten in vergelijkbare cijfers, en die bestaat nog niet. Een test door een derde partij van de tokenreductie van 45,7% — de bewering dat de nauwkeurigheid stijgt terwijl de kosten dalen — zou het nuttigste en minst glamoureuze resultaat in de release bevestigen. En een onafhankelijke meting van AliMeeting-diarisatie zou laten zien of de daling van 88 punten aan het model toe te schrijven is of aan de pijplijn eromheen.

Tot dan is de verstandige houding dezelfde als die voor elk model op zijn eerste dag geldt: het testen waard, maar niet iets om een productiepad op te wedden. Als u al via OrcaRouter routeert, is de praktische zet: houd de workload op de modellen die u hebt gemeten, en beschouw Qwen3.8-Omni-Flash als een kandidaat om die tegen hen te testen op uw eigen audio en video in plaats van op de benchmarktabel van een van beide leveranciers. Als uw gebruiksscenario het analyseren van longform-vergaderingen of -media in het Chinees en Engels is, is de token-economie hier sterk genoeg om de test nu te rechtvaardigen.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt