
Qwen3.8-Omni-Flash, vijf dagen verder: één deur, geen gewichten, en de eerste scores die niet van Alibaba zijn
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Vijf dagen nadat de leverancier Qwen3.8-Omni-Flash voor API-klanten opende, heeft het model nog steeds precies één thuisbasis. Het draait op het eigen Qianwen-platform van de leverancier en op zijn Bailian-clouddienst; de vermeldingen van derden die sinds de lancering zijn verschenen, zijn proxies vóór diezelfde endpoints, niet een tweede plek waar het model huist. Er zijn geen gewichten vrijgegeven. De cijfers van de lanceerdag — een verlaging van 98% op de kosten van een uur audio, een gemiddelde winst van 26% ten opzichte van Qwen3.5-Omni-Plus, één miljoen tokens context, uitvoer van alleen tekst — blijven die van de leverancier zelf en zijn niet gereproduceerd. Wat er in vijf dagen werkelijk is veranderd, is niet het model maar de grond eromheen: een dunne laag scores van derden is verschenen, frameworkondersteuning kwam op dag nul, en de vergelijking waar iedereen naar grijpt, is met Gemini 3.8 Flash in plaats van de Qwen3.8-Flash waarmee dit model is gebouwd. Elk daarvan verdient een nadere blik dan de verslaggeving over de lancering eraan heeft gegeven.
De deur is een goede deur, en hij is de enige.
Beschikbaarheid is verruimd zonder meervoudig te worden. Het model beantwoordt een OpenAI-vormig verzoek ongewijzigd, wat betekent dat bestaande clientcode grotendeels werkt; wat breekt is de endpoint, omdat de internationale en vastelandse hosts afzonderlijke diensten zijn met afzonderlijke facturering. Code die op de standaard is gericht, zal ofwel falen ofwel in de verkeerde valuta factureren, en het verhaal over de prijs per uur geldt alleen aan de internationale kant. Open-source clientbibliotheken leverden vanaf dag één ondersteuning voor het model, wat oprecht nuttig is en ook geen tweede provider: een bibliotheek die met Bailian spreekt, is een gemakswrapper rond dezelfde enige leveringsbron.
Dat is het structurele risico dat het benoemen waard is. Een model met één bron heeft geen failover-pad. Als het endpoint rate-limits oplegt, degradeert, of een regio uitvalt, is er nergens om naartoe te gaan, en geen enkele mate van ondersteuning in de clientbibliotheek verandert dat. Het is ook waarom we ons eigen standpunt ronduit uitspreken in plaats van iets anders te suggereren: Qwen3.8-Omni-Flash staat niet in onze catalogus. We hosten het niet, en een lezer die zich aanmeldt in de verwachting het te kunnen routeren, zou misleid worden. Wat wel routeerbaar is, is de rest van de familie — Qwen3.8-Flash en Qwen3.8-Max zijn beide live op onze API — en OrcaRouter geeft de lijstprijs van de provider door met 0% markup, dus wanneer Alibaba's omni-prijzen veranderen, of op de dag dat het omni-model routeerbaar wordt, bereikt de wijziging klanten dezelfde dag in plaats van bij de volgende contractverlenging.

De eerste scores die niet van Alibaba zijn, zijn mager, en ze zijn niet flatteus.
Voor dit model bestaat er niets op Artificial Analysis, en dat ontbreken is vijf dagen later de eerlijke kop: de ranglijsten die iedereen voor aangrenzende modellen citeert, hebben nog geen rij voor het omni-model. Het gat is opgevuld door iets anders. Een evaluatieplatform van een derde partij is testruns tegen het model gaan publiceren, en de samenvatting ervan is juist de moeite waard vanwege hoeveel die niet zegt. Het rapporteert e-mailclassificatie met 99,0% nauwkeurigheid (86e percentiel), ethiek met 95,0% (23e percentiel) en redeneervermogen met 56,0%, wat het in het 28e percentiel plaatst en een opvallende zwakte noemt; snelheid komt uit in het 21e percentiel, kosten in het 58e, met een algemeen succespercentage van 89%.
Behandel die met grote voorzichtigheid, en niet alleen omdat de steekproef klein is. Dezelfde pagina dateert de release van het model op 20 september, twee dagen nadat Alibaba het uitbracht, geeft voor geen van de resultaten een uitvoeringsdatum en toont een lege benchmarktabel onder een samenvatting die cijfers beschrijft die de tabel niet bevat. Dat is het profiel van een vroeg, licht gesuperviseerd testharnas in plaats van een gemeten evaluatie, en de eerlijke lezing is dat dit de eerste datapunten van niet-leveranciers zijn in plaats van de eerste betrouwbare datapunten. Ze zijn een reden om het model zelf te testen, niet een reden om iets te concluderen. De richting is echter consistent met wat de eigen materialen van de leverancier door weglating impliceren: dit is een perceptie- en long-mediamodel, en de redeneerintensieve boards zijn niet waarop het was gericht.
Er zit ook een valkuil in de zoekresultaten die de komende weken mensen zal doen struikelen. Qwen 3.8, het tekstmodel, heeft een Artificial Analysis Intelligence Index in de veertig, en dat cijfer is in meer dan één samenvatting aangehaald alsof het het omni-model beschreef. Dat is niet zo. Het zijn verschillende modellen met verschillende taken, en het omni-model heeft nog helemaal geen index.

De benchmarktabel is nog steeds één leverancier die zichzelf met zichzelf vergelijkt.
Het lanceercijfer — een gemiddelde verbetering van meer dan 26% over ongeveer dertig evaluaties — wordt volledig afgezet tegen Qwen3.5-Omni-Plus. Dat vertelt je dat de familie vooruit is gegaan. Het vertelt je niet waar het model staat naast iets waarvoor je mogelijk al betaalt, en de selectieve vergelijkingen die eromheen circuleerden dichten die kloof ook niet. Het door de leverancier gerapporteerde beeld tegenover Gemini 3.8 Flash is een echte overwinning op de audiobenchmarks en een verlies op de benchmarks die agentisch videowerk meten: WildClawBench-MM 71,0 tegen 58,9 en SpotSoundBench 67,2 tegen 39,7 aan de ene kant, AgenticVBench 36,8 tegen 45,0 en OmniGAIA 74,0 tegen 78,6 aan de andere kant. Alibaba's eigen samenvattende taal — audio-videoprestaties die Gemini "naderen", algehele audioprestaties die het overtreffen — is voorzichtiger dan de krantenkoppen die eruit voortkwamen, en de voorzichtige versie is de juiste.
• Context — 1M tokens, met ongeveer 991K maximale invoer (ongeveer 983K in denkmodus) en 131K maximale uitvoer.
• Modaliteit — tekst, afbeelding, audio en video erin; alleen tekst eruit. Geen spraakgeneratie in het basismodel.
• Duur — tot één uur onafgebroken audio of audio-video per gesprek, wat vergaderen en langdurig mediawerk mogelijk maakt zonder chunking.
• Taaldekking — herkenning in 74 talen plus 39 Chinese dialecten in de lanceringsmaterialen, met ruimere cijfers (113 talen en dialecten) die elders worden aangehaald voor audio-invoer.
• Invoerdetail — stereo- en vierkanaals ruimtelijke audio worden geaccepteerd, waarbij de Realtime-variant wordt beschreven als het eerste omni-modale model dat een doelwit op basis van zijn geluid kan lokaliseren.
• Prijs — $0,15 per miljoen inputtokens, $0,016 gecachet, $0,47 output aan de internationale kant, en een aparte prijslijst voor het vasteland die niet vergelijkbaar is.
De 98% is echt, en het is niet jouw rekening.
Volgens de eigen methodologie van Alibaba — een steekproef van twee minuten vermenigvuldigd met dertig, video gesampled op 720p en één frame per seconde — daalt een uur audio-invoer van $0.28 naar minder dan $0.01, en een uur gecombineerde audio en video van $3.27 naar $0.20. Dat zijn grote, specifieke, door de leverancier gerapporteerde verlagingen, en het zijn verlagingen op één kostenpost. De rekensom die ertoe doet, is welk aandeel van je werkbelasting die kostenpost vormt. Een pipeline die het grootste deel van zijn tokens besteedt aan output, aan gecachte context of aan videoframes die dichter dan één per seconde worden gesampled, zal een veel kleinere procentuele verandering op de factuur zien dan de kop belooft, en die kop gaat over audio-invoer, niet over het totaal. Voeg de output met alleen tekst toe en het gat wordt weer groter: alles wat iets terug moet zeggen, heeft een tweede model nodig, en dat model wordt apart gefactureerd.
Dit is het deel van het plaatje waar routing zijn waarde bewijst. De waarde van een pass-through-router is niet een korting — het is dat je de eigen prijslijst van de leverancier betaalt, en dat een workload over meerdere modellen kan worden verdeeld, zodat een model met één bron een component is in plaats van een afhankelijkheid. Een omni-model dat het enige is dat je kunt aanroepen, is een single point of failure op zowel de beschikbaarheids- als de prijslaag.

Wat vijf dagen productie je eigenlijk zouden vertellen
Drie dingen zouden de open vragen beslechten. Een onafhankelijke meting van het AliMeeting-diarisatieresultaat — een foutpercentage dat daalt van 88,11 naar 3,35 en cpWER van 89,61 naar 17,18 — zou laten zien of dat aan het model toekomt of aan de diarisatie- en front-end-engineering eromheen, waaraan ten minste één Chinese technische analyse het grootste deel van de winst toeschrijft. Een gereproduceerde test van de tokenreductie van de agentische modus, waarbij de nauwkeurigheid steeg van 63,4 naar 67,8 op OmniVideoBench terwijl het aantal tokens per query daalde van 145.736 naar 79.117, zou de meest nuttige afzonderlijke claim in de release bevestigen: dat het model tegelijkertijd beter en goedkoper kan worden. En een rij in Artificial Analysis of in een arena zou elk leverancierscijfer hierboven omzetten in iets vergelijkbaars, wat de voorwaarde is voor het model om te worden gekozen in plaats van uitgeprobeerd.
Tot dan is de houding die zinvol is dezelfde als bij elk vijf dagen oud model met één host en geen onafhankelijke evaluatie: de moeite waard om op je eigen audio en video te meten, niet de moeite waard om er de enige route door je pipeline van te maken. Als je workload bestaat uit langdurige vergader- of media-analyse in het Chinees of Engels en je kosten vooral worden bepaald door invoeruren in plaats van uitvoertokens, is de rekensom hier sterk genoeg om deze week een test te rechtvaardigen. Als je workload spraak terug nodig heeft, of een fallback nodig heeft wanneer een provider verslechtert, kan het model zoals het er vandaag uitziet niet het volledige antwoord zijn — en geen enkele hoeveelheid day-zero frameworkondersteuning verandert dat.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
