
Qwen3.8-Omni-Flash vs Qwen2.5-Omni: 18 maanden later, de upgrade is zijn stem kwijt
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Dit is het feit dat deze vergelijking interessanter maakt dan een generatievernieuwing. Het oudere model kan praten en het nieuwere niet. Qwen2.5-Omni, uitgebracht in maart 2025, nam tekst, afbeeldingen, audio en video als invoer en antwoordde in tekst of in streamende natuurlijke spraak, in één end-to-endmodel dat je kon downloaden. Qwen3.8-Omni-Flash, uitgebracht op 18 september 2026, verwerkt dezelfde vier modaliteiten over een contextvenster dat dertig keer groter is, verwerkt een uur aan doorlopende audio-video waar zijn voorouder seconden aankon, en retourneert alleen tekst. Achttien maanden werk leverden een enorm bredere invoer op en gaven het uitvoerkanaal op. Of dat vooruitgang is of een ruil, hangt volledig af van waarvoor je het oude model gebruikte — en het antwoord valt duidelijk in tweeën uiteen.
De cijfers voor Qwen2.5-Omni zijn die van de leverancier, uit het releasedocumentatiemateriaal van maart 2025, en achttien maanden van breed gebruik hebben ze gedeeltelijk bevestigd. De cijfers voor Qwen3.8-Omni-Flash zijn ook van Alibaba, uit lanceermateriaal dat enkele uren voordat dit werd geschreven is gepubliceerd, en niets daarin is onafhankelijk gereproduceerd. Wanneer een bewering van een criticus afkomstig is en niet van de leverancier, wordt dat als zodanig vermeld. Het enige structurele feit dat geen verificatie behoeft, is tevens het meest ingrijpende: Qwen2.5-Omni is open-weight en downloadbaar, en Qwen3.8-Omni-Flash niet.
Wat Qwen2.5-Omni was, en waarom het belangrijk was
Toen het op 26 maart 2025 werd gelanceerd, Qwen2.5-Omni was het eerste end-to-end omni-modale model in de familie — de release positioneerde het als het antwoord op het probleem van de "dierentuin van specialisten", waarbij transcriptie, beeld en spraak elk een apart model en een aparte lijmlaag nodig hadden. Het 7B-model verwerkte alle vier invoermodaliteiten en zowel tekst- als spraakuitvoer, claimde state-of-the-art resultaten op de OmniBench-fusiebenchmark, vóór Gemini-1.5-Pro, en rapporteerde een kwaliteitsscore voor spraakgeneratie van 4,51 die Alibaba als menselijk niveau omschreef. Een 3B-variant gebruikte dezelfde architectuur.
De engineering die het liet werken, is het vermelden waard, want het nieuwe model gebruikt die niet. Thinker-Talkersplitste de taak in tweeën: een Thinker-transformer versmolt de audio- en beeldencoders en produceerde semantiek en tekst, terwijl een Talker spraaktokens streamde vanuit de verborgen toestanden van de Thinker, met volledige gespreksgeschiedenis gedeeld. Tijd-uitgelijnde multimodale RoPE (TMRoPE) verweefde video- en audioposities zodat de twee streams synchroon bleven. Blokgewijs streamen liet encoders waarnemen terwijl het taalmodel lange sequenties verwerkte, wat gesproken antwoorden met lage latentie mogelijk maakte. Twee vaste stemmen werden meegeleverd, Chelsie en Ethan.
De beperkingen waren net zo reëel. De context was 32.768 tokens. Het geheugen was in veel sterkere mate de beperkende factor dan de rekenkracht: in de eigen tabellen van Alibaba staat BF16-inferentie met FlashAttention-2 op ongeveer 31GB GPU-geheugen voor een video van 15 seconden, 42GB voor 30 seconden en 60GB voor een volledige minuut. Een minuut video, op een 7B-model, op een van de grootste single GPU's die je kon huren. Dat getal is het getal om in het oog te houden, want het is het getal dat het 2026-model moest vernietigen.
Wat Qwen3.8-Omni-Flash is
Het nieuwe model is native omnimodaal in plaats van samengesteld — rechtstreeks gebouwd op de Qwen3.8-Flash-architectuurlijn in plaats van als een tekst-LLM met daarop vastgeschroefde perceptie-encoders, wat een structureel verschil is en niet slechts een generatielabel. Het accepteert tekst, beeld, audio en video, inclusief stereo en ruimtelijke audio met vier kanalen, en retourneert tekst binnen een context van één miljoen tokens met een maximale invoer van ongeveer 991K, een maximale uitvoer van 131K en een redeneerbudget van 262K. Het verwerkt tot één uur continue audio-video per aanroep. Spraakherkenning bestrijkt 74 talen, waarbij spraakgeneratie voor 29 talen in de omliggende tooling wordt afgehandeld en niet door het model. Het is beschikbaar op het Qianwen AI-platform en Alibaba Cloud Model Studio onder de id qwen3-8-omni-flash, voor $0,15 per miljoen invoertokens en $0,47 per miljoen uitvoertokens, met gecachte invoer tegen $0,016.

Achttien maanden, dimensie voor dimensie
• Context — Qwen2.5-Omni 32.768 tokens tegenover Qwen3.8-Omni-Flash op één miljoen, ruwweg een dertigvoudige toename.
• Mediaduur — seconden video, begrensd door GPU-geheugen, tegenover één uur onafgebroken audio-video in één enkele gehoste oproep.
• Output — tekst plus streaming natuurlijke spraak op het oude model; alleen tekst op het nieuwe.
• Implementatie — Qwen2.5-Omni is open-weight onder Apache-2.0, te downloaden van Hugging Face en ModelScope; Qwen3.8-Omni-Flash is alleen via API beschikbaar, zonder aangekondigde release van gewichten.
• Hardware — 7B-parameters die tot ~60GB GPU-geheugen nodig hebben voor een minuut video, tegenover een gehost endpoint dat je helemaal niet zelf provisioneert.
• Prijs — het oude model kost je een GPU; het nieuwe kost $0,15 per miljoen invoertokens, en Alibaba beweert dat audio-invoer per uur 98% goedkoper is dan de Qwen3.5-Omni-Plus-generatie die het vervangt.
• Spraakgeneratie — twee vaste stemmen in 2025, tegenover 29 talen voor spraakgeneratie in tooling van 2026, waarvan niets door het model zelf is geproduceerd.
De transactie waar niemand reclame voor maakte
Lees de twee specificatiebladen samen en de vorm van de afgelopen achttien maanden wordt duidelijk. Alibaba heeft de tussenliggende periode besteed aan het oplossen van invoer — hoeveel media een model kan opnemen, hoe goedkoop, en hoeveel van het beslissen het zelf kan doen. Qwen3.8-Omni-Flash is een triomf op die as. De Agentic Understanding-modus, waarin het model kiest wat het bemonstert in plaats van elk frame te verwerken, verlaagt het aantal tokens per query van 145.736 naar 79.117 terwijl de nauwkeurigheid van OmniVideoBench stijgt van 63,4 naar 67,8, en de leverancier meldt dat de sprekerdiarisatiefout op AliMeeting daalt van 88,11 naar 3,35.
Wat het interval niet prioriteerde, is output. De bepalende truc van het model uit 2025 — één model dat jou hoort en hardop antwoordt, van begin tot eind, zonder aparte spraaksynthesizer — heeft hier geen opvolger. Als je een spraakagent, een dubbingpipeline of een toegankelijkheidstool op de Talker van Qwen2.5-Omni hebt gebouwd, is het model uit 2026 geen upgrade daarvan; het is een component waar je een nieuwe tekst-naar-spraakfase op zou moeten monteren, waardoor je latentie en een leverancier toevoegt aan een pipeline die voorheen geen van beide had. Het lanceringsmateriaal is hier eerlijk over als je de modaliteitsregel goed leest, maar het is niet de hoofdboodschap, en iedereen die migreert in de veronderstelling dat "omni" in beide releases hetzelfde betekent, zal het verschil in productie ontdekken.

Waarom het 2025-model nog steeds een baan heeft
Drie redenen, en geen enkele ervan is nostalgie. De eerste is de stem, zoals hierboven. De tweede is open weights: 32K context en een voetafdruk van 7B draaien op hardware die je zelf beheert, offline, zonder dat er data het gebouw verlaat en zonder meter per token — de enige optie als je audio onder een vestigingsregel valt of je latencybudget een round trip verbiedt. De derde is de kosten bij zeer laag volume. Een GPU die je al bezit is marginaal gratis; de $0,15 per miljoen tokens van het gehoste model is goedkoop maar niet nul, en de vaste kosten van provisioning daartegenover zijn reëel voor een workload die twee keer per week draait.
Het tegenargument is dat de beperkingen van het oude model elk jaar harder knellen. Een minuut video, 32K context en geen tool calling of gestructureerde output in een wereld waarin agents de standaardvorm van deployment zijn, is een nauwe enveloppe. Voor een pipeline die opgenomen vergaderingen moet verwerken, Qwen3.8-Omni-Flash is niet slechts beter — het is het verschil tussen mogelijk en onmogelijk, omdat het model uit 2025 de input fysiek niet aankan.
Het is de moeite waard om concreet te zijn over hoeveel leven er nog in de oude gewichten zit, want "legacy" doet ze tekort. De Qwen2.5-Omni-7B repository registreerde 343.676 downloads in de afgelopen maand toen we het op 18 september 2026 bekeken, met ongeveer honderd community Spaces en tientallen fine-tunes, adapters en kwantisaties die erop zijn gebouwd. Wat het vlaggenschip ook doet, een grote groep mensen brengt nog steeds uit op het 2025-model — en opmerkelijk genoeg vermeldde Hugging Face geen enkele inference provider die het inzet, wat betekent dat bijna al dat gebruik self-hosted is.
Het nieuwe model verbetert het oude.
Het vreemdste en meest overtuigende detail in de lancering ligt bijna aan het einde van de materialen begraven. In een experiment dat Alibaba beschrijft als een model dat een model optimaliseert, Qwen3.8-Omni-Flash verbeterde autonoom de spraakherkenning in het Sichuan-dialect van Qwen2.5-Omni-3B — het kleine broertje van het model dat het in naam vervangt — en bracht het karakterfoutpercentage terug van 25,79% naar 15,30% binnen twaalf uur en bouwde in vier rondes 3.413 trainingsvoorbeelden op.
Dat is een beter argument voor het nieuwere model dan welke benchmark in de release dan ook, en het plaatst de relatie tussen de twee in een nieuw kader. Het model uit 2026 is niet alleen een vervanging voor dat uit 2025; het is een hulpmiddel dat de gewichten van 2025 beter maakt. Als je Qwen2.5-Omni in productie draait voor een taal of dialect die het slecht aankan, is de praktische route misschien om de implementatie te behouden en het nieuwe model te gebruiken om de trainingsdata te bouwen, in plaats van de werkbelasting te migreren. Merk echter op dat dit een door de leverancier gerapporteerde demonstratie is zonder gepubliceerde methodologie, en dat het moet worden behandeld als een bemoedigende anekdote in plaats van een reproduceerbaar recept.

Als u migreert
De beslissing komt zelden neer op één model. Een team dat een zelfgehost omni-model verlaat, kiest tussen drie vormen: op open weights blijven en provisioning blijven doen, naar een leveranciers-API overstappen en controle opgeven, of de workload opsplitsen zodat alleen het deel dat een miljoen-token-intake nodig heeft naar het gehoste model gaat. Die derde optie is meestal de juiste en is ook degene die mensen overslaan, omdat het klinkt als meer werk dan het is — de dialect fine-tune waar je een maand aan hebt besteed, hoeft niet weggegooid te worden omdat de fase voor het samenvatten van vergaderingen is verplaatst.
Waar routering helpt, is op de naden. OrcaRouter geeft je één sleutel voor meer dan 200 modellen met 0% opslag op de lijstprijs van de provider en automatische failover als een endpoint verslechtert, wat betekent dat het gehoste deel van een gesplitste pipeline geen eigen contract, eigen clientcode en eigen monitoring nodig heeft voordat je weet of de workload dat allemaal rechtvaardigt. Om duidelijk te zijn over wat we niet doen: geen van beide omni-modellen zit in onze catalogus — beide draaien op Alibaba's platforms of op je eigen hardware — dus dit is een routeringsbeslissing die je rond de modellen neemt, niet via ons.
Wie zou moeten verhuizen, en wie niet
Stap over als je werklast bestaat uit langdurige audio of video, als 32K context het ontbrekende stuk is dat verhindert dat een pijplijn bestaat, als je agentisch gedrag op media nodig hebt, of als sprekerdiarisatie op schaal het probleem is waar je mee zit. Blijf als je wilt dat het model spreekt, als je audio je infrastructuur niet kan verlaten, als je afhankelijk bent van de specifieke Qwen2.5-Omni-gewichten die je al hebt getuned, of als je callvolume laag genoeg is dat een eigen GPU voordeliger is dan betalen per gebruik.
De ongemakkelijke samenvatting is dat dit minder een vervanging is dan een vertakking in de productlijn. Alibaba heeft achttien maanden besteed aan het bouwen van het beste intake-model dat het kan en heeft geen opvolger gebouwd voor de outputhelft. Als jouw werk aan de intakekant zit, is de upgrade nagenoeg verplicht. Als het aan de outputkant zit, is het model van 2025 nog steeds het nieuwste dat doet wat je nodig hebt — en dat is goed om te weten voordat je een migratie plant die stilletjes een functionaliteit zou verwijderen waarvan je afhankelijk bent.
