
Qwen 4.5 en Qwen 5 mikken op 5 tot 10 biljoen parameters: wat Alibaba wel en niet zei
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Op zijn Apsara Conference in Hangzhou op 22 september 2026 voorzag het bedrijf de generatie daarna van een omvang. De Qwen 4.5 en Qwen 5-serie zullen “naar verwachting opschalen tot 5 tot 10 biljoen parameters”, in de bewoording van het eigen Engelstalige persbericht van het bedrijf — een roadmapregel, geen specificatie. Geen van beide modellen heeft een releasedatum, een modelkaart, een API-identifier, een prijs of een gepubliceerde benchmarkscore, wat betekent dat geen van beide vandaag aanroepbaar is. Het vlaggenschip dat je daadwerkelijk kunt kopen is Qwen3.8-Max, algemeen beschikbaar sinds 3 augustus 2026, met 2,4 biljoen parameters. In de dagen sinds de conferentie is die roadmapzin in veel berichtgeving platgeslagen tot de bewering dat er een model met 10 biljoen parameters aankomt — een sterkere, eenvoudigere bewering dan die het bedrijf deed. De afstand tussen die twee zinnen is ongeveer een jaar aan planning.
De bewering, en de versie ervan die zich verspreidde
Er werden twee dingen op het podium gezegd, en het is de moeite waard ze te scheiden omdat ze heel verschillende hoeveelheden informatie bevatten. Het eerste is een statusupdate: Qwen 4 wordt getraind, op een nieuwe architectuur. Het tweede is een roadmap: de Qwen 4.5- en Qwen 5-series zullen naar verwachting een parameterband van 5 tot 10 biljoen bereiken.
Het Engelstalige persbericht van Alibaba schrijft beide toe aan het bedrijf in plaats van aan een met naam genoemde leidinggevende. De conferentieverslaggeving die verder gaat, schrijft de roadmap toe aan Liu Da Yiheng, die het Qwen-project voor grote taalmodellen leidt bij Alibaba Token Hub, en meldt zijn framing dat opschaling een belangrijk pad naar kunstmatige superintelligentie is. Die framing is de context waarin het parameteraantal werd gepresenteerd, en verklaart waarom het aantal een bandbreedte is en geen doel.
Wat er vervolgens rondging, was de bovenkant van de band. De Engelstalige koppen die daarop volgden, bevatten er ten minste één die een model met 10 biljoen parameters beschreef waarvan slechts een voorproefje was gegeven, en verscheidene die een plan beschreven voor een model van 5 tot 10 biljoen parameters. Beide zijn verdedigbare interpretaties van een slide. Geen van beide is een specificatie, en het verschil is van belang voor iedereen die op basis daarvan moet plannen.
5 biljoen is de doelstelling van de ene generatie en 10 biljoen die van een andere.
Het allerbelangrijkste om goed te begrijpen aan deze aankondiging is dat 5 tot 10 biljoen een bandbreedte is die twee generaties omvat, niet één model met een ruime tolerantie. Alibaba's eigen zin koppelt die bandbreedte aan "de aankomende Qwen 4.5 en Qwen 5 modelseries" — de series, meervoud, samen genomen.
Chineestalige berichtgeving van dezelfde conferentie is opnieuw precies in een andere richting, met koppen die modellen na Qwen 4.5 beschrijven die zich uitbreiden naar het bereik van 5 tot 10 biljoen. Die lezing plaatst het uiteinde van 10 biljoen eveneens voorbij Qwen 4.5. De enige uitspraak waarover elke bron het eens is, is dat de band het bereik van Qwen 4.5 tot Qwen 5 omvat. Het toeschrijven van 10 biljoen specifiek aan Qwen 5 is een gevolgtrekking die een kop is geworden, geen citaat.
Om de schaal aan te geven, en dit zijn de enige cijfers in dit verhaal die gepubliceerd zijn in plaats van geprojecteerd:
• 5 tot 10 biljoen — het parameterbereik dat het persbericht van Alibaba aan de Qwen 4.5- en Qwen 5-serie koppelt
• 2,4 biljoen — totale parameters van Qwen3.8-Max, het huidige vlaggenschip, volgens de officiële modelkaart
• 95 miljard — het aantal actieve parameters per token van Qwen3.8-Max, het getal dat bepaalt wat het kost om een token te serveren
• 10 biljoen — de bovenkant van de band, en het enige deel ervan dat de meeste Engelse krantenkoppen haalde
• 0 — het aantal gepubliceerde specificaties, releasedata, prijzen, contextvensters of benchmarkscores voor Qwen 4.5 of Qwen 5

Het parameternummer dat ertoe doet, is het nummer dat niemand heeft gepubliceerd.
Totale parameters zijn het aantal dat een lab ervoor kiest te noemen. Actieve parameters zijn het aantal dat een koper nodig heeft, en op de roadmap staat er geen.
Qwen3.8-Max is een mixture-of-experts-model met in totaal 2,4 biljoen parameters en 95 miljard actieve parameters per token. Dat is een activeringsratio van ongeveer 4 procent: het model bevat een schat aan kennis in gewichten die het bij geen enkel gegeven token leest, en betaalt rekentijd voor een klein deel ervan. Het totale aantal parameters vertelt je hoeveel geheugen het ding inneemt en hoe grote doos je nodig hebt. Actieve parameters vertellen je wat je betaalt telkens wanneer het antwoordt.
Trek die verhouding door en de vorm van het probleem wordt zichtbaar. Een model met 10 biljoen parameters dat met dezelfde 4 procent activatie wordt gebouwd, zou in de orde van 400 miljard parameters per token activeren — meer dan vier keer zoveel als Qwen3.8-Max nu activeert. Dat is rekenwerk op basis van een gestelde aanname, geen bewering over Qwen 5: verhoog de sparsity en het actieve aantal daalt, verlaag die en het stijgt. Maar het is het rekenwerk dat bepaalt of een model met 10 biljoen parameters een geserveerd product of een onderzoeksartefact is, en het is de berekening die de kop van 5 tot 10 biljoen uitnodigt en vervolgens onafgemaakt laat.
Dit is ook waar de routeringseconomie ophoudt abstract te zijn. Op OrcaRouter wordt de lijstprijs van de provider doorberekend met 0% opslag, zodat een prijsverlaging van een leverancier op een Qwen-tier dezelfde dag live staat op jouw key in plaats van pas bij een verlenging. Een generatie waarvan de kosten om te serveren echt onzeker zijn, is precies het geval waarin die doorberekening meer waard is dan een korting die vooraf wordt bedongen tegen een getal dat niemand heeft gepubliceerd.
De chipaankondiging is de daadwerkelijke tijdlijn
Alibaba kondigde in hetzelfde persbericht de modelroadmap en een nieuwe accelerator aan, en de twee zijn nauwer met elkaar verbonden dan het persbericht doet vermoeden.
T-Head's Zhenwu V900 is een trainings- en inferentieprocessor met 216 GB geheugen en 1.200 GB/s bandbreedte tussen chips, native ondersteuning voor FP8 en FP4, en naar verluidt drie keer de prestaties van zijn voorganger, de Zhenwu M890, die in mei werd uitgebracht. Massaproductie en commerciële release zijn gepland voor het eerste kwartaal van 2027. Een bijbehorende supernode-server ondersteunt clusters van maximaal 500.000 kaarten, en T-Head zegt dat de Zhenwu-lijn meer dan 650 klanten heeft bediend.
Lees de twee aankondigingen samen en de opeenvolging is goed te volgen. Het trainen en serveren van een mixture-of-experts-model op een schaal van 10 biljoen is eerder een interconnectprobleem dan een rekenprobleem, want expert-parallelisme betekent dat activaties voortdurend tussen chips worden verplaatst, en 1.200 GB/s aan bandbreedte tussen chips is het getal dat bepaalt of dat haalbaar is. Silicon volgens dat schema duwt het vroegst denkbare venster voor een dergelijke run op frontier-schaal tot ruim in 2027 — en zelfs dan zegt het uitkomen van een chip niets over het afronden van een trainingsrun. Alibaba verbond de twee onderwerpen door ze in één release onder te brengen; het verband zelf is onze lezing, en die is als zodanig aangeduid.
De eigen tijdshorizon van het bedrijf komt daarmee overeen. Topman Eddie Wu stelde een doel van meer dan 20 gigawatt aan wereldwijde datacentercapaciteit van Alibaba Cloud tegen 2032 — een capaciteitsdoel, niet operationele capaciteit, en een horizon van meer dan vijf jaar in plaats van die van het volgende kwartaal.
De zelfverbeteringsclaims die de roadmap ophouden
De reden dat een plan van 5 tot 10 biljoen überhaupt verdedigbaar is in plaats van louter duur, is recursieve zelfverbetering: als de trainingspijplijn zichzelf verbetert, daalt de rekenkracht die per generatie nodig is, en komt de frontier dichter bij betaalbaar. Dat is de dragende claim onder de roadmap, en het is ook het minst verifieerbare wat Alibaba heeft gezegd.
Wat het bedrijf meldde: Qwen3.8-Max doorliep 33 iteratieve cycli gedurende ongeveer een maand volledig geautomatiseerd werk, variërend van pijplijnontwerp, datavalidatie en foutdiagnose, en verhoogde zijn Artificial Analysis-score van 40 naar 45. In een experiment op het gebied van chipontwerp besteedde het model meer dan 60 uur aan zelfverbetering gedurende een ontwerpcyclus, deed het meer dan 10.000 aanroepen van tools voor elektronische ontwerpautomatisering en verkleinde het het chipoppervlak met 42 procent zonder prestatieverlies. Eén rapport van de conferentie meldt ook een verbetering van de inferentiedoorvoer met 96 procent door het autonoom tunen van een nieuwe T-Head GPU.
Deze zijn door leveranciers gerapporteerd en niet onafhankelijk gerepliceerd. Dat is geen technisch detail — een autonome lus die zijn eigen experimenten beoordeelt, meet zichzelf af tegen zijn eigen beoordelaar, en de buitenwereld heeft geen enkele manier om het beoordelingskader te controleren. De verslaggeving over de conferentie heeft dat over het algemeen ook gezegd, en lezers moeten daarvan uitgaan.
Er zit een tweede valkuil in dezelfde bewering, en die gaat over labels in plaats van eerlijkheid. Alibaba heeft niet gezegd tegen welke revisie van de Artificial Analysis Intelligence Index de beweging van 40 naar 45 wordt afgezet, en die index is sinds de lancering van dit model opnieuw opgebouwd. De huidige Artificial Analysis-pagina voor Qwen3.8 Max (0902) vermeldt 45 — een onafhankelijk cijfer, op de revisie die vandaag van kracht is. De waarde die medio augustus voor hetzelfde model werd geregistreerd, onder de toen geldende revisie, was 56. Een 45 en een 56 zijn niet dezelfde meting in dezelfde eenheden, en het ene van het andere aftrekken levert een getal op dat niets betekent. Wat de pagina niet vermeldt, is de 40 waar het model volgens Alibaba vandaan is verbeterd: het startpunt van die delta is dat van het bedrijf zelf, en alleen het eindpunt valt toevallig samen met waar de onafhankelijke waarde nu staat. Lees de beweging als een richting, niet als een meting.

Wat heeft Alibaba op dezelfde conferentie uitgebracht?
Haal de roadmap eruit en de conferentie bevatte nog steeds echte releases, allemaal multimodaal:
• Qwen3.8-LiveTranslate — simultaanvertolking, waarbij de latentie (LAAL) met bijna 20 procent is teruggebracht, van 2,8 seconden naar 2,3 seconden
• Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-TTS en Qwen-Audio-3.1-Realtime — een vernieuwde spraaksuite
• Qwen-Audio-3.1-TTS-Next — cinematische soundscapes die dialoog en ambiance uit een tekstscript combineren, gericht op audioboeken, film en televisie, podcasts en games
• Qwen-Image 3.1 — beeldgeneratie afgestemd op creatief design en e-commercemarketing, later dit jaar verwacht, met native generatie van transparante achtergronden
• Qwen Intelligence — een full-stack agentisch platform gericht op smartphonemakers
Elk item op die lijst is een product met een leveringsvenster. De claim op frontier-schaal is het enige agendapunt zonder datum, en dat contrast is geen toeval: het uitleveren van de multimodale tier is wat een roadmapjaar financiert, en de roadmap is wat van de volgende financieringsronde of het volgende cloudcontract een verhaal maakt in plaats van een spreadsheet. Beide dingen zijn echt. Slechts één ervan is iets wat je kunt aanroepen.
Wat is er vandaag aanroepbaar, en wat moet er veranderen om dat te laten veranderen?
De Qwen 3.8-generatie vormt nog steeds de volledige verkoopbare lijn. Qwen3.8-Max is algemeen beschikbaar sinds 3 augustus 2026 voor $2,00 per miljoen inputtokens en $6,00 per miljoen outputtokens, gelijk over de volledige context van 1.000.000 tokens, zonder toeslag voor lange prompts. De gewichten werden op 12 augustus 2026 gepubliceerd als Qwen3.8-2.4T-A95B in BF16 en FP8 onder een aangepaste Qwen-licentie. De benchmarktabel van de leverancier is sterk en ongecontroleerd — Terminal-Bench 2.1 op 86,6, GPQA Diamond op 92,6, OSWorld-Verified op 86,1, allemaal cijfers van Alibaba zelf — Het onafhankelijke beeld is minder flatteus dan dat van de leverancier: Artificial Analysis plaatst Qwen3.8 Max (0902) op een Intelligence Index van 45, de 24e van 212 modellen, met $5,41 gemeten kosten per Intelligence Index-taak en 39,2 outputtokens per seconde — de 159e van 212, bij de traagste van het veld. Dezelfde pagina vermeldt het contextvenster als 984k tegenover de 1.000.000 op onze eigen modelpagina, een verschil dat je moet kennen voordat je een taak met lange context dimensioneert. Een score van frontierklasse, een snelheid in de middenmoot: dat is de eerlijke samenvatting van het momenteel leverbare vlaggenschip, en het is de maatstaf die elke Qwen 4.5 op beide assen tegelijk moet verslaan.

OrcaRouter bevat de Qwen 3.8-familie — qwen/qwen3.8-max, qwen3.8-flash en qwen3.8-27b — op één OpenAI-compatibel endpoint naast meer dan 200 andere modellen, wat betekent dat een Qwen 4.5-tier een wijziging van model-id op een bestaande sleutel zou zijn in plaats van een nieuw leverancierscontract, een nieuwe factuur en een nieuwe SDK. Wanneer die uitkomt, is die catalogus de plek waar hij zou verschijnen. Vandaag staat noch Qwen 4.5 noch Qwen 5 erop, omdat geen van beide is uitgebracht — en geen enkele hoeveelheid roadmap-persberichten verandert dat.
Het praktische nut van een roadmap zoals deze is het tegenovergestelde van een migratieplan. Als een Qwen 4.5-tier op den duur plausibel lijkt voor je workload, is de goedkope manier om daarachter te komen een deel van het echte verkeer ernaartoe te routeren achter een automatische fallback, zodat een model dat traag, duur of slechter dan de incumbent blijkt te zijn, je een percentage van één workload kost in plaats van een kwart. Daar is failover voor bedoeld, en een onbewezen frontier-model van een paar dagen oud is het duidelijkste geval om het in te zetten.
Wat om in de gaten te houden, en wat nog niet te geloven
Een regel op de roadmap wordt een release wanneer een kleine set concrete dingen opduikt. Een modelkaart met een totaal aantal parameters, een aantal actieve parameters en een contextvenster. Een API-identifier die je in een request kunt meegeven. Gewichten op een modelhub. Een vermelding op een onafhankelijke leaderboard met een datum eraan gekoppeld. Een prijs. Elk van die dingen is een signaal; de meeste ervan samen zijn een lancering.
Dingen die geen release zijn, hoe technisch ze er ook uitzien: een vermelding tijdens een conferentie; een pull request van een servingframework waarin een architectuurtak voor een experimentele Qwen-build wordt toegevoegd, wat enginewerk is aan iemands inference-stack in plaats van een model dat je kunt aanroepen; een gedateerde snapshot-id voor een generatie die al is uitgebracht; en een socialmediapost die een opmerking vanaf het podium parafraseert. Het signaal dat dit artikel opleverde, was het laatste daarvan, en de reden dat het de moeite waard was om erover te schrijven, is dat de onderliggende bewering te controleren is aan de hand van Alibaba's eigen persbericht — waar de band van 5 tot 10 biljoen, de Qwen 4-status en de RSI-cijfers allemaal vandaan komen. Het signaal wees naar het verhaal; het is niet het verhaal.
De vraag op korte termijn is nauwer dan de koppen doen vermoeden. Alibaba heeft gezegd dat Qwen 4 in training is, waardoor Qwen 4 in de reeks vóór zowel 4.5 als 5 staat — dus het volgende dat de moeite waard is om in de gaten te houden, is niet een model met 10 biljoen parameters, maar of Qwen 4 met een modelkaart, een prijs en een endpoint komt, en wanneer. Totdat er iets in die keten concreet wordt, is de eerlijke positie ten aanzien van de band van 5 tot 10 biljoen dat het een koers is, publiekelijk bekendgemaakt, zonder dat er een specificatie aan hangt en zonder datum. Plan voor Qwen3.8-Max, beschouw de band van 4.5 en 5 als een schaalthese in plaats van een product, en behandel elk parameteraantal dat je voor een model zonder modelkaart ziet als een voorspelling.
