Een hero-titelkaart voor de vergelijking 'Qwen3.8-Omni-Flash vs Qwen 3.8', met de bovenkop 'Kop aan kop - dezelfde familie, tegenovergestelde opdrachten', de ondertitel 'Een specialist gebouwd voor uren media tegenover de open kern met 2,4 biljoen parameters, gebouwd voor diepgang per token', en drie stat-chips met de tekst 'Prijs per M tokens: 13x uit elkaar', 'Context: 1M bij beide' en 'Open gewichten: slechts aan één kant'.
Guides & Insights

Qwen3.8-Omni-Flash vs Qwen 3.8: Een gespecialiseerde build versus een flagship-exemplaar

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Als je de korte versie wilt: Qwen3.8-Omni-Flash is ruwweg dertien keer goedkoper per token dan Qwen 3.8 en is van de twee de enige die gebouwd is om een uur audio-video te doorstaan zonder eraan onderdoor te gaan — terwijl Qwen 3.8, de open kern met 2,4 biljoen parameters aan de top van de Qwen3.8-lijn, degene is die je gebruikt wanneer het antwoord juist moet zijn in plaats van goedkoop, en van de twee de enige waarvan je de gewichten kunt downloaden. Ze delen een contextlengte, een familienaam en een lanceervenster van augustus tot september. Ze zijn geen vervangers van elkaar, en de volledige waarde van deze vergelijking zit erin dat je weet welke vraag je eigenlijk stelt.

Om precies te zijn over de namen, want de familie is nogal drukbevolkt. Qwen 3.8verwijst hier naar de 2.4T-A95B mixture-of-experts open core — het model achter het Qwen3.8-Max-endpoint, dat Alibaba op 3 augustus 2026 onthulde en waarvoor het op 12 augustus de gewichten publiceerde, en dat Artificial Analysis op 40 in zijn Intelligence Index plaatst. Qwen3.8-Omni-Flashis het native omni-modale model dat Alibaba op 18 september 2026 in API-dienst nam, gebouwd op de Qwen3.8-Flash-architectuurlijn, dat tekst, beeld, audio en video aanneemt en tekst teruggeeft. Alles over het vlaggenschip is door de leverancier gerapporteerd of onafhankelijk geïndexeerd, zoals opgemerkt; alles over het omni-model is uitsluitend door de leverancier gerapporteerd, want het is pas enkele uren oud en niemand buiten Alibaba heeft het gemeten.

Twee modellen, één familie, tegenovergestelde ontwerpopdrachten

De verleiding is om dit te interpreteren als een groot model en een klein model uit dezelfde generatie, zoals je Qwen3.8-Max tegenover Qwen3.8-Flash zou interpreteren. Die interpretatie is onjuist op een manier die geld kost. De Qwen 3.8-kern is een redeneermotor die toevallig afbeeldingen en video accepteert; de doorvoer wordt gemeten in tokens per seconde bij moeilijke problemen, de prijs weerspiegelt de rekenkracht die een forward pass met 95 miljard actieve parameters kost, en het evaluatieblad is een lijst met redeneer- en coding-boards. Qwen3.8-Omni-Flash is een perceptie- en actiemotor die toevallig redeneert; de prijs is afgestemd op de kosten van het verwerken van uren media, en het evaluatieblad is een lijst met audio-, video- en tool-calling-boards. De ene is geoptimaliseerd voor diepgang per token. De andere is geoptimaliseerd voor tokens per uur aan content.

Dat verschil komt het scherpst naar voren op een plek die de marketing niet noemt. Beide modellen accepteren ongeveer een miljoen tokens en beide accepteren video. Maar Qwen3.8-Omni-Flash is expliciet ontworpen rond het probleem van de lange duur — tot wel één uur continue audio-video in één enkele aanroep, met een Agentic Understanding-modus waarin het model kiest welke delen het bemonstert in plaats van elk frame te verwerken, waardoor het aantal tokens per query daalt van 145.736 naar 79.117, terwijl de nauwkeurigheid op OmniVideoBench stijgt van 63,4 naar 67,8. Qwen 3.8 heeft geen gelijkwaardig gepubliceerd mechanisme. Twee uur video erin stoppen is op papier mogelijk; dat doen tegen een prijs die de goedkeuring van een finance-team kan doorstaan, is een andere vraag, en het is de vraag die het omni-model is gebouwd om te beantwoorden.

De dimensies die het daadwerkelijk bepalen

• Prijs — Qwen3.8-Omni-Flash $0,15 per miljoen input en $0,47 per miljoen output, tegenover Qwen 3.8 tegen $2,00 en $6,00. Cache-lezen: $0,016 tegenover $0,25.

Open gewichten — Qwen 3.8 publiceerde op 12 augustus 2026 gewichten onder een aangepaste licentie; Qwen3.8-Omni-Flash is alleen via API beschikbaar en Alibaba heeft niet gezegd dat het zal worden uitgebracht.

• Context — één miljoen tokens aan beide zijden; 991K maximale invoer op het omni-model, met 131K maximale uitvoer en een redeneerbudget van 262K.

• Mediaduur — tot één uur ononderbroken audio-video in één enkele omni-oproep; het vlaggenschip is gedocumenteerd voor video-invoer, zonder dat daar een kostenverhaal per uur aan vastzit.

• Uitvoermodaliteit — tekst aan beide kanten. Geen van beide genereert spraak, ondanks de herkomst van het omni-model.

• Onafhankelijke score — Qwen 3.8 staat op 40 in de Artificial Analysis Intelligence Index. Qwen3.8-Omni-Flash heeft nog helemaal geen onafhankelijke score.

A two-column scoreboard, 'Qwen3.8-Omni-Flash vs Qwen 3.8 - the scoreboard'. Left column Qwen3.8-Omni-Flash: Price per M $0.15 in / $0.47 out, Context 1M tokens, Media per call 1 hour continuous A/V, Output text only, Open weights not released, Independent score none yet. Right column Qwen 3.8: Price per M $2.00 in / $6.00 out, Context 1M tokens, Media per call video input with no per-hour price, Output text only, Open weights published 12 Aug 2026, Independent score AA Index 40. The footer reads 'Qwen 3.8 pricing and Index score per Artificial Analysis and Alibaba; Qwen3.8-Omni-Flash figures vendor-reported and unreproduced.'

Waarom de benchmarktabellen dit niet kunnen beslechten

Er is geen head-to-head-overzicht, en dat komt er voorlopig niet. De lanceringsmaterialen van Alibaba voor Qwen3.8-Omni-Flash benchmarken het uitsluitend tegen Qwen3.5-Omni-Plus, zijn directe voorganger, en tegen Gemini 3.8 Flash; de cijfers van het vlaggenschip komen uit een volledig andere set redeneer- en codeerevaluaties. De twee tabellen delen geen enkele rij. Iedereen die een tabel publiceert die ze naast elkaar op één as zet, heeft die as zelf gebouwd.

Wat men eerlijk kan zeggen, is richtinggevend. Volgens de eigen cijfers van de leverancier is het omni-model een grote stap vooruit ten opzichte van de omni-lijn die het vervangt — een gemiddelde winst van meer dan 26% over ongeveer dertig evaluaties, met WildClawBench-MM op 71,0, UniClawBench op 69,6 en LongAudioSpan op 82,7 — en een echte, zij het gedeeltelijke, stap vooruit ten opzichte van Gemini 3.8 Flash, waar het vooroploopt op audiocentrische benchmarks zoals SpotSoundBench (67,2 tegen 39,7) en MMAU (81,8 tegen 76,9) en achterblijft op de zuiver op videoredenering gerichte AgenticVBench (36,8 tegen 45,0). Aan de flagshipzijde is Qwen 3.8's Index-score van 40 een onafhankelijke meting en meer waard dan elk van de bovenstaande. Dat zijn verschillende soorten bewijs en die mogen niet bij elkaar worden gemiddeld.

A screenshot of the Qwen3.8-Omni-Flash launch post on qwen.ai (captured 18 September 2026, English UI), showing the 'Conducting Deep Research with Audio and Video' section with an embedded demo video, a MODEL WORKFLOW panel listing steps including Write report, Grab key frames, Dispatch Web research and Screenshot check, and a TIMELINE panel with chapter timestamps such as 0:00 Intro + a 5-minute composite and 10:02 Arrangement & Matching.

Een uitgewerkte kostenvergelijking, met de aanname vermeld

Neem een analysetaak voor lange documenten en video's: 300.000 invoertokens en 20.000 uitvoertokens, een aannemelijke omvang voor een opgenomen vergadering van negentig minuten met dia's. Op Qwen3.8-Omni-Flash is dat 300.000 × $0,15 per miljoen = $0,045 aan invoer en 20.000 × $0,47 per miljoen = $0,0094 aan uitvoer, dus ongeveer 5,4 cent. Op Qwen 3.8 is dezelfde aanroep 300.000 × $2,00 per miljoen = $0,60 en 20.000 × $6,00 per miljoen = $0,12, of ongeveer 72 cent. Iets meer dan dertien keer de kosten voor hetzelfde aantal tokens.

Het getal dat de beslissing verandert, is niet de ratio maar het volume. Bij honderd zulke klussen per dag is dat ongeveer $5 per dag tegenover ongeveer $72 per dag — het verschil tussen een functionaliteit die je uitbrengt en een functionaliteit die je in omvang terugbrengt. Maar als de taak één moeilijke extractie uit een contract van 300K tokens is, waarbij een fout antwoord een uur menselijke beoordeling kost, is de premie van 13x irrelevant en wint het sterkere redeneermodel op de eerste fout die het niet maakt. Stel de aanname vast voordat je naar de prijsregel kijkt, niet erna.

Waar elk van hen daadwerkelijk wint

Qwen3.8-Omni-Flash wint op alles wat in uren wordt gemeten. Vergadertranscriptie met diarisatie en het extraheren van vervolgtaken, het samenvatten van lange video's, audiovisuele onderzoeksrapporten, ondertitelingspijplijnen, en elke agent die zelf moet beslissen welke minuut van een opname ertoe doet. De door de leverancier gerapporteerde verbetering op het gebied van diarisatie — het sprekerfoutpercentage bij AliMeeting daalt van 88,11 naar 3,35 — is het soort delta dat een handmatig beoordeelde pijplijn verandert in een geautomatiseerde, hoewel een Chinese technische analyse van de lancering stelt dat veel van die winst komt van front-end- en diarisatietechniek rond het model in plaats van van het model zelf, dus benchmark het op je eigen audio voordat je de menselijke beoordelingsstap laat varen. Het omni-model wint ook zonder meer op prijs voor elke hoogvolume-tekstworkload waar de tekstkwaliteit toereikend is, waarvan Alibaba beweert dat die vergelijkbaar is met alleen-tekstmodellen van dezelfde grootte — een niet-gereproduceerde bewering, en het is de moeite waard om die te testen in plaats van aan te nemen.

Qwen 3.8 wint overal waar de output wordt beoordeeld in plaats van geteld: moeilijk redeneren, agentisch werk over een lange horizon, grootschalig codewerk, analyse van documenten van een miljoen tokens waarbij de synthese het product is. Het wint ook op een dimensie die niets met benchmarks te maken heeft — het is open-weight. Als je beperking dataresidentie is, on-premise-implementatie, fine-tuning, of simpelweg geen leverancier in het inferentiepad willen hebben, dan is het omni-model helemaal geen kandidaat, en geen enkel prijsvoordeel dicht die kloof. Die ene beperking bepaalt meer echte implementaties dan elk cijfer hierboven.

Ze zonder twee contracten te runnen

De praktische wrijving bij een vergelijking als deze is zelden de modelkeuze; het is dat je uiteindelijk twee leveranciers, twee facturatieverhoudingen en twee sets clientcode moet integreren om erachter te komen welke je wilde. Qwen3.8-Max — het endpoint met de open kern van 2,4 biljoen parameters — is live op OrcaRouteronder de model-id qwen/qwen3.8-max, voor $2,00 per miljoen inputtokens en $6,00 per miljoen output, met een context van een miljoen tokens en tekst-, afbeeldings- en video-invoer, naast meer dan 200 andere modellen op één sleutel tegen de lijstprijs van de provider met 0% opslag en automatische failover tussen providers als een endpoint verslechtert. Qwen3.8-Omni-Flash staat niet in die catalogus — het draait op Alibaba's eigen platformen — dus de eerlijke configuratie vandaag is het vlaggenschip op onze route en het omni-model dat direct wordt aangeroepen, waarbij de routeringslaag je een plek geeft om de verliezer van de test onder te brengen zodra je die hebt uitgevoerd.

A screenshot of the OrcaRouter model page for Qwen3.8 Max at www.orcarouter.ai/models/qwen/qwen3.8-max (captured 18 September 2026, English UI), showing the model id qwen/qwen3.8-max with a FEATURED badge and a byline date of 2026-08-03, a spec panel reading ctx 1M tokens, Input text + image + video, Output text, p50 TTFT 10.00s, and a metrics row reading INPUT $2.00 / 1M tokens, OUTPUT $6.00 / 1M tokens, TRAFFIC 84.0M tokens / 7d, above OpenAI- and Anthropic-compatible SDK code samples.

Het vonnis

Kies Qwen3.8-Omni-Flash wanneer de invoer lang is, de uitvoer kort is en het volume de eenheidsprijs tot de bindende beperking maakt. Kies Qwen 3.8 wanneer de invoer informatiedicht is, de uitvoer het product is en ofwel correctheid ofwel controle over deployment niet onderhandelbaar is. De overlapzone — videobegrip — is de enige plek waar een echte rechtstreekse vergelijking plaatsvindt, en in die zone houdt het omni-model het kosten- en duurargument overeind, terwijl het vlaggenschipmodel het argument voor redeneervermogen en open weights overeind houdt. Draai beide op uw eigen data voordat u zich vastlegt; het omni-model heeft nog geen onafhankelijke evaluatie, en een prijsvoordeel op de lanceerdag is precies iets dat de moeite waard is om aan de hand van een factuur te bevestigen in plaats van via een aankondiging.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt