
Qwen3.8-Omni-Flash vs Qwen 3.8: Een gespecialiseerde build versus een flagship-exemplaar
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 984 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 196 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
Als je de korte versie wilt: Qwen3.8-Omni-Flash is ruwweg dertien keer goedkoper per token dan Qwen 3.8 en is van de twee de enige die gebouwd is om een uur audio-video te doorstaan zonder eraan onderdoor te gaan — terwijl Qwen 3.8, de open kern met 2,4 biljoen parameters aan de top van de Qwen3.8-lijn, degene is die je gebruikt wanneer het antwoord juist moet zijn in plaats van goedkoop, en van de twee de enige waarvan je de gewichten kunt downloaden. Ze delen een contextlengte, een familienaam en een lanceervenster van augustus tot september. Ze zijn geen vervangers van elkaar, en de volledige waarde van deze vergelijking zit erin dat je weet welke vraag je eigenlijk stelt.
Om precies te zijn over de namen, want de familie is nogal drukbevolkt. Qwen 3.8verwijst hier naar de 2.4T-A95B mixture-of-experts open core — het model achter het Qwen3.8-Max-endpoint, dat Alibaba op 3 augustus 2026 onthulde en waarvoor het op 12 augustus de gewichten publiceerde, en dat Artificial Analysis op 40 in zijn Intelligence Index plaatst. Qwen3.8-Omni-Flashis het native omni-modale model dat Alibaba op 18 september 2026 in API-dienst nam, gebouwd op de Qwen3.8-Flash-architectuurlijn, dat tekst, beeld, audio en video aanneemt en tekst teruggeeft. Alles over het vlaggenschip is door de leverancier gerapporteerd of onafhankelijk geïndexeerd, zoals opgemerkt; alles over het omni-model is uitsluitend door de leverancier gerapporteerd, want het is pas enkele uren oud en niemand buiten Alibaba heeft het gemeten.
Twee modellen, één familie, tegenovergestelde ontwerpopdrachten
De verleiding is om dit te interpreteren als een groot model en een klein model uit dezelfde generatie, zoals je Qwen3.8-Max tegenover Qwen3.8-Flash zou interpreteren. Die interpretatie is onjuist op een manier die geld kost. De Qwen 3.8-kern is een redeneermotor die toevallig afbeeldingen en video accepteert; de doorvoer wordt gemeten in tokens per seconde bij moeilijke problemen, de prijs weerspiegelt de rekenkracht die een forward pass met 95 miljard actieve parameters kost, en het evaluatieblad is een lijst met redeneer- en coding-boards. Qwen3.8-Omni-Flash is een perceptie- en actiemotor die toevallig redeneert; de prijs is afgestemd op de kosten van het verwerken van uren media, en het evaluatieblad is een lijst met audio-, video- en tool-calling-boards. De ene is geoptimaliseerd voor diepgang per token. De andere is geoptimaliseerd voor tokens per uur aan content.
Dat verschil komt het scherpst naar voren op een plek die de marketing niet noemt. Beide modellen accepteren ongeveer een miljoen tokens en beide accepteren video. Maar Qwen3.8-Omni-Flash is expliciet ontworpen rond het probleem van de lange duur — tot wel één uur continue audio-video in één enkele aanroep, met een Agentic Understanding-modus waarin het model kiest welke delen het bemonstert in plaats van elk frame te verwerken, waardoor het aantal tokens per query daalt van 145.736 naar 79.117, terwijl de nauwkeurigheid op OmniVideoBench stijgt van 63,4 naar 67,8. Qwen 3.8 heeft geen gelijkwaardig gepubliceerd mechanisme. Twee uur video erin stoppen is op papier mogelijk; dat doen tegen een prijs die de goedkeuring van een finance-team kan doorstaan, is een andere vraag, en het is de vraag die het omni-model is gebouwd om te beantwoorden.
De dimensies die het daadwerkelijk bepalen
• Prijs — Qwen3.8-Omni-Flash $0,15 per miljoen input en $0,47 per miljoen output, tegenover Qwen 3.8 tegen $2,00 en $6,00. Cache-lezen: $0,016 tegenover $0,25.
Open gewichten — Qwen 3.8 publiceerde op 12 augustus 2026 gewichten onder een aangepaste licentie; Qwen3.8-Omni-Flash is alleen via API beschikbaar en Alibaba heeft niet gezegd dat het zal worden uitgebracht.
• Context — één miljoen tokens aan beide zijden; 991K maximale invoer op het omni-model, met 131K maximale uitvoer en een redeneerbudget van 262K.
• Mediaduur — tot één uur ononderbroken audio-video in één enkele omni-oproep; het vlaggenschip is gedocumenteerd voor video-invoer, zonder dat daar een kostenverhaal per uur aan vastzit.
• Uitvoermodaliteit — tekst aan beide kanten. Geen van beide genereert spraak, ondanks de herkomst van het omni-model.
• Onafhankelijke score — Qwen 3.8 staat op 40 in de Artificial Analysis Intelligence Index. Qwen3.8-Omni-Flash heeft nog helemaal geen onafhankelijke score.

Waarom de benchmarktabellen dit niet kunnen beslechten
Er is geen head-to-head-overzicht, en dat komt er voorlopig niet. De lanceringsmaterialen van Alibaba voor Qwen3.8-Omni-Flash benchmarken het uitsluitend tegen Qwen3.5-Omni-Plus, zijn directe voorganger, en tegen Gemini 3.8 Flash; de cijfers van het vlaggenschip komen uit een volledig andere set redeneer- en codeerevaluaties. De twee tabellen delen geen enkele rij. Iedereen die een tabel publiceert die ze naast elkaar op één as zet, heeft die as zelf gebouwd.
Wat men eerlijk kan zeggen, is richtinggevend. Volgens de eigen cijfers van de leverancier is het omni-model een grote stap vooruit ten opzichte van de omni-lijn die het vervangt — een gemiddelde winst van meer dan 26% over ongeveer dertig evaluaties, met WildClawBench-MM op 71,0, UniClawBench op 69,6 en LongAudioSpan op 82,7 — en een echte, zij het gedeeltelijke, stap vooruit ten opzichte van Gemini 3.8 Flash, waar het vooroploopt op audiocentrische benchmarks zoals SpotSoundBench (67,2 tegen 39,7) en MMAU (81,8 tegen 76,9) en achterblijft op de zuiver op videoredenering gerichte AgenticVBench (36,8 tegen 45,0). Aan de flagshipzijde is Qwen 3.8's Index-score van 40 een onafhankelijke meting en meer waard dan elk van de bovenstaande. Dat zijn verschillende soorten bewijs en die mogen niet bij elkaar worden gemiddeld.

Een uitgewerkte kostenvergelijking, met de aanname vermeld
Neem een analysetaak voor lange documenten en video's: 300.000 invoertokens en 20.000 uitvoertokens, een aannemelijke omvang voor een opgenomen vergadering van negentig minuten met dia's. Op Qwen3.8-Omni-Flash is dat 300.000 × $0,15 per miljoen = $0,045 aan invoer en 20.000 × $0,47 per miljoen = $0,0094 aan uitvoer, dus ongeveer 5,4 cent. Op Qwen 3.8 is dezelfde aanroep 300.000 × $2,00 per miljoen = $0,60 en 20.000 × $6,00 per miljoen = $0,12, of ongeveer 72 cent. Iets meer dan dertien keer de kosten voor hetzelfde aantal tokens.
Het getal dat de beslissing verandert, is niet de ratio maar het volume. Bij honderd zulke klussen per dag is dat ongeveer $5 per dag tegenover ongeveer $72 per dag — het verschil tussen een functionaliteit die je uitbrengt en een functionaliteit die je in omvang terugbrengt. Maar als de taak één moeilijke extractie uit een contract van 300K tokens is, waarbij een fout antwoord een uur menselijke beoordeling kost, is de premie van 13x irrelevant en wint het sterkere redeneermodel op de eerste fout die het niet maakt. Stel de aanname vast voordat je naar de prijsregel kijkt, niet erna.
Waar elk van hen daadwerkelijk wint
Qwen3.8-Omni-Flash wint op alles wat in uren wordt gemeten. Vergadertranscriptie met diarisatie en het extraheren van vervolgtaken, het samenvatten van lange video's, audiovisuele onderzoeksrapporten, ondertitelingspijplijnen, en elke agent die zelf moet beslissen welke minuut van een opname ertoe doet. De door de leverancier gerapporteerde verbetering op het gebied van diarisatie — het sprekerfoutpercentage bij AliMeeting daalt van 88,11 naar 3,35 — is het soort delta dat een handmatig beoordeelde pijplijn verandert in een geautomatiseerde, hoewel een Chinese technische analyse van de lancering stelt dat veel van die winst komt van front-end- en diarisatietechniek rond het model in plaats van van het model zelf, dus benchmark het op je eigen audio voordat je de menselijke beoordelingsstap laat varen. Het omni-model wint ook zonder meer op prijs voor elke hoogvolume-tekstworkload waar de tekstkwaliteit toereikend is, waarvan Alibaba beweert dat die vergelijkbaar is met alleen-tekstmodellen van dezelfde grootte — een niet-gereproduceerde bewering, en het is de moeite waard om die te testen in plaats van aan te nemen.
Qwen 3.8 wint overal waar de output wordt beoordeeld in plaats van geteld: moeilijk redeneren, agentisch werk over een lange horizon, grootschalig codewerk, analyse van documenten van een miljoen tokens waarbij de synthese het product is. Het wint ook op een dimensie die niets met benchmarks te maken heeft — het is open-weight. Als je beperking dataresidentie is, on-premise-implementatie, fine-tuning, of simpelweg geen leverancier in het inferentiepad willen hebben, dan is het omni-model helemaal geen kandidaat, en geen enkel prijsvoordeel dicht die kloof. Die ene beperking bepaalt meer echte implementaties dan elk cijfer hierboven.
Ze zonder twee contracten te runnen
De praktische wrijving bij een vergelijking als deze is zelden de modelkeuze; het is dat je uiteindelijk twee leveranciers, twee facturatieverhoudingen en twee sets clientcode moet integreren om erachter te komen welke je wilde. Qwen3.8-Max — het endpoint met de open kern van 2,4 biljoen parameters — is live op OrcaRouteronder de model-id qwen/qwen3.8-max, voor $2,00 per miljoen inputtokens en $6,00 per miljoen output, met een context van een miljoen tokens en tekst-, afbeeldings- en video-invoer, naast meer dan 200 andere modellen op één sleutel tegen de lijstprijs van de provider met 0% opslag en automatische failover tussen providers als een endpoint verslechtert. Qwen3.8-Omni-Flash staat niet in die catalogus — het draait op Alibaba's eigen platformen — dus de eerlijke configuratie vandaag is het vlaggenschip op onze route en het omni-model dat direct wordt aangeroepen, waarbij de routeringslaag je een plek geeft om de verliezer van de test onder te brengen zodra je die hebt uitgevoerd.

Het vonnis
Kies Qwen3.8-Omni-Flash wanneer de invoer lang is, de uitvoer kort is en het volume de eenheidsprijs tot de bindende beperking maakt. Kies Qwen 3.8 wanneer de invoer informatiedicht is, de uitvoer het product is en ofwel correctheid ofwel controle over deployment niet onderhandelbaar is. De overlapzone — videobegrip — is de enige plek waar een echte rechtstreekse vergelijking plaatsvindt, en in die zone houdt het omni-model het kosten- en duurargument overeind, terwijl het vlaggenschipmodel het argument voor redeneervermogen en open weights overeind houdt. Draai beide op uw eigen data voordat u zich vastlegt; het omni-model heeft nog geen onafhankelijke evaluatie, en een prijsvoordeel op de lanceerdag is precies iets dat de moeite waard is om aan de hand van een factuur te bevestigen in plaats van via een aankondiging.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
