Eine generierte Titelkarte mit dem Titel „Qwen 4.5 und Qwen 5: 5 bis 10 Billionen Parameter“ und dem Untertitel „Ein Roadmap-Band, keine Spezifikation“ sowie drei Karten mit der Aufschrift „Roadmap-Ziel / 5–10 Billionen Parameter“, „Ausgeliefertes Flaggschiff / Qwen3.8-Max 2,4 T“ und „Veröffentlichungsdatum / nicht angekündigt“. Eine Fußzeile lautet: „Laut Alibabas Pressemitteilung vom 22. September 2026; keine Modellkarte veröffentlicht.“ Flacher redaktioneller Vektorstil auf weißem Hintergrund mit einem Blau-zu-Cyan-Farbverlauf und dem OrcaRouter-Logo, unten rechts eingefügt.
Guides & Insights

Qwen 4.5 und Qwen 5 peilen 5 bis 10 Billionen Parameter an: Was Alibaba sagte – und was nicht

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Auf seiner Apsara Conference in Hangzhou am 22. September 2026 bezifferte das Unternehmen die übernächste Generation. Die Serien Qwen 4.5 und Qwen 5 sollen laut dem Wortlaut der unternehmenseigenen englischsprachigen Pressemitteilung „voraussichtlich auf 5 bis 10 Billionen Parameter skaliert werden“ — eine Roadmap-Zeile, keine Spezifikation. Keines der beiden Modelle hat ein Veröffentlichungsdatum, eine Modellkarte, eine API-Kennung, einen Preis oder einen veröffentlichten Benchmark-Wert, was bedeutet, dass heute nichts von beiden aufrufbar ist. Das Flaggschiff, das Sie tatsächlich kaufen können, ist Qwen3.8-Max, allgemein verfügbar seit dem 3. August 2026, mit 2,4 Billionen Parametern. In den Tagen seit der Konferenz wurde dieser Roadmap-Satz in vielen Berichten zu der Behauptung verkürzt, dass ein Modell mit 10 Billionen Parametern kommt — eine stärkere, einfachere Behauptung als die, die das Unternehmen aufgestellt hat. Der Abstand zwischen diesen beiden Sätzen beträgt ungefähr ein Jahr Planung.

Die Behauptung und die Version davon, die sich verbreitet hat

Zwei Dinge wurden auf der Bühne gesagt, und es lohnt sich, sie zu trennen, weil sie sehr unterschiedlich viel Information tragen. Das erste ist ein Statusupdate: Qwen 4 wird trainiert, auf einer neuen Architektur. Das zweite ist eine Roadmap: Die Qwen-4.5- und Qwen-5-Serie sollen voraussichtlich einen Parameterbereich von 5 bis 10 Billionen erreichen.

In Alibabas englischer Pressemitteilung werden beide dem Unternehmen zugeschrieben und nicht einer namentlich genannten Führungskraft. Die weitergehende Konferenzberichterstattung schreibt die Roadmap Liu Da Yiheng zu, der das Qwen-Projekt für große Sprachmodelle bei Alibaba Token Hub leitet, und berichtet von seiner Einordnung, dass Scaling ein Schlüsselweg hin zur künstlichen Superintelligenz sei. Diese Einordnung ist der Kontext, in dem die Parameterzahl genannt wurde, und sie erklärt, warum die Zahl eine Bandbreite und kein Zielwert ist.

Was dann die Runde machte, war die Obergrenze der Spanne. Die darauf folgenden englischsprachigen Schlagzeilen umfassen mindestens eine, die ein in Aussicht gestelltes Modell mit 10 Billionen Parametern beschreibt, und mehrere, die einen Plan für ein Modell mit 5 bis 10 Billionen Parametern beschreiben. Beides sind vertretbare Lesarten einer Folie. Keines von beiden ist eine Spezifikation, und der Unterschied ist für jeden von Bedeutung, der damit planen muss.

5 Billionen sind das Ziel der einen Generation und 10 Billionen das Ziel einer anderen.

Das einzig wirklich Nützliche, das man bei dieser Ankündigung richtig verstehen muss, ist, dass 5 bis 10 Billionen eine Spanne sind, die zwei Generationen umfasst, und nicht ein einzelnes Modell mit einer breiten Toleranz. Alibabas eigener Satz knüpft die Spanne an „die kommenden Qwen 4.5- und Qwen 5-Modellreihen“ – die Reihen, im Plural, zusammengenommen.

Die chinesischsprachige Berichterstattung von derselben Konferenz ist wieder in eine andere Richtung präzise, mit Schlagzeilen, die Modelle nach Qwen 4.5 beschreiben, die sich in den 5-bis-10-Billionen-Bereich ausweiten. Diese Lesart setzt auch das 10-Billionen-Ende jenseits von Qwen 4.5 an. Die einzige Aussage, auf die sich alle Quellen einigen, ist, dass die Bandbreite die Spanne von Qwen 4.5 bis Qwen 5 abdeckt. Die gezielte Zuordnung von 10 Billionen zu Qwen 5 ist eine Schlussfolgerung, die zu einer Schlagzeile wurde, kein Zitat.

Zum Vergleich, und dies sind die einzigen Zahlen in dieser Geschichte, die veröffentlicht und nicht prognostiziert sind:

• 5 bis 10 Billionen — der Parameterbereich, den Alibabas Pressemitteilung den Qwen-4.5- und Qwen-5-Serien zuordnet

• 2,4 Billionen — Gesamtparameterzahl von Qwen3.8-Max, dem aktuell ausgelieferten Flaggschiff, laut seiner offiziellen Modellkarte

• 95 Milliarden — die aktiven Parameter von Qwen3.8-Max pro Token, die Zahl, die bestimmt, was die Bereitstellung eines Tokens kostet

• 10 Billionen — das obere Ende des Bereichs und der einzige Teil davon, der es in die meisten englischsprachigen Schlagzeilen schaffte

• 0 — die Anzahl der veröffentlichten Spezifikationen, Veröffentlichungstermine, Preise, Kontextfenster oder Benchmark-Ergebnisse für Qwen 4.5 oder Qwen 5

A generated scoreboard titled 'Shipped vs projected - the scoreboard'. Left column 'Qwen3.8-Max (shipping)' reads GA August 3, 2026; 2.4 trillion total parameters; 95 billion active parameters; 1,000,000-token context window; $2.00 in / $6.00 out; benchmarks vendor table plus AA Index 45. Right column 'Qwen 4.5 / Qwen 5 (roadmap)' reads release none given; 5 to 10 trillion series; active parameters not published; context window not published; price not published; benchmarks none published. Footer reads 'Qwen3.8-Max specs per its model card; AA Index per Artificial Analysis; Qwen 4.5 and Qwen 5 per Alibaba's September 22, 2026 roadmap.'

Die entscheidende Parameternummer ist die, die niemand veröffentlicht hat.

Gesamtparameter sind die Zahl, die ein Labor zu nennen wählt. Aktive Parameter sind die Zahl, die ein Käufer benötigt, und die Roadmap enthält keine.

Qwen3.8-Max ist ein Mixture-of-Experts-Modell mit insgesamt 2,4 Billionen Parametern und 95 Milliarden aktiven pro Token. Das ist ein Aktivierungsverhältnis von ungefähr 4 Prozent: Das Modell hält eine große Menge Wissen in Gewichten, die es bei einem gegebenen Token nicht liest, und bezahlt Rechenleistung für einen kleinen Teil davon. Die Gesamtparameterzahl sagt dir, wie viel Speicher das Ding belegt und wie groß eine Box sein muss. Die aktive Parameterzahl sagt dir, was du jedes Mal bezahlst, wenn es antwortet.

Rechnet man dieses Verhältnis weiter, wird die Form des Problems sichtbar. Ein Modell mit 10 Billionen Parametern, das mit derselben 4-Prozent-Aktivierung gebaut würde, würde pro Token in der Größenordnung von 400 Milliarden Parametern aktivieren – mehr als viermal so viele, wie Qwen3.8-Max derzeit aktiviert. Das ist Arithmetik auf Basis einer genannten Annahme, keine Aussage über Qwen 5: Treibt man die Sparsität nach oben, sinkt die Zahl der aktiven Parameter; treibt man sie nach unten, steigt sie. Doch genau diese Arithmetik entscheidet, ob ein Modell mit 10 Billionen Parametern ein einsatzfähiges Produkt oder ein Forschungsartefakt ist, und genau diese Rechnung lädt die Schlagzeile von 5 bis 10 Billionen ein und lässt sie dann unerledigt.

Hier hört die Routing-Ökonomie ebenfalls auf, abstrakt zu sein. Bei OrcaRouter wird der Listenpreis des Anbieters mit 0 % Aufschlag durchgereicht, sodass eine Preissenkung eines Anbieters für eine Qwen-Stufe am selben Tag auf Ihrem Schlüssel aktiv ist und nicht erst bei einer Verlängerung. Eine Generation, deren Bereitstellungskosten wirklich unsicher sind, ist genau der Fall, in dem diese Weitergabe mehr wert ist als ein im Voraus ausgehandelter Rabatt auf eine Zahl, die niemand veröffentlicht hat.

Die Chip-Ankündigung ist der tatsächliche Zeitplan.

Alibaba kündigte die Modell-Roadmap und einen neuen Accelerator in derselben Pressemitteilung an, und die beiden hängen enger zusammen, als es die Mitteilung sagt.

Der Zhenwu V900 von T-Head ist ein Trainings- und Inferenzprozessor mit 216 GB Speicher und 1.200 GB/s Inter-Chip-Bandbreite, nativer Unterstützung für FP8 und FP4 sowie einer laut Hersteller dreifachen Leistung seines Vorgängers Zhenwu M890, der im Mai erschienen ist. Serienproduktion und kommerzielle Einführung sind für das erste Quartal 2027 geplant. Ein begleitender Supernode-Server unterstützt Cluster mit bis zu 500.000 Karten, und T-Head gibt an, dass die Zhenwu-Reihe mehr als 650 Kunden bedient hat.

Liest man die beiden Ankündigungen zusammen, wird die Abfolge lesbar. Das Training und der Betrieb eines Mixture-of-Experts-Modells im 10-Billionen-Maßstab ist ein Interconnect-Problem, bevor es ein Rechenproblem ist, denn Experten-Parallelität bedeutet, ständig Aktivierungen zwischen Chips zu verschieben, und 1.200 GB/s Inter-Chip-Bandbreite sind die Zahl, die darüber entscheidet, ob das machbar ist. Silizium nach diesem Zeitplan legt das früheste plausible Zeitfenster für einen Run dieser Art im Frontier-Maßstab weit in das Jahr 2027 – und selbst dann sagt ein ausgelieferter Chip nichts darüber aus, ob ein Trainingslauf zu Ende geführt wird. Alibaba hat die beiden Themen miteinander verbunden, indem es sie in einer einzigen Veröffentlichung zusammengebracht hat; die Verbindung selbst ist unsere Lesart, und sie ist als solche gekennzeichnet.

Der eigene Zeithorizont des Unternehmens steht damit im Einklang. CEO Eddie Wu setzte ein Ziel von mehr als 20 Gigawatt globaler Rechenzentrumskapazität von Alibaba Cloud bis 2032 – ein Kapazitätsziel, nicht die eingesetzte Kapazität, und ein Horizont von mehr als fünf Jahren statt eines auf das nächste Quartal ausgelegten.

Die Selbstverbesserungs-Behauptungen, die die Roadmap stützen

Der Grund, warum ein 5- bis 10-Billionen-Plan überhaupt diskutabel und nicht bloß teuer ist, ist die rekursive Selbstverbesserung: Wenn die Trainingspipeline sich selbst verbessert, sinkt der pro Generation erforderliche Rechenaufwand, und die Frontier rückt näher an das Bezahlbare heran. Das ist die tragende Behauptung unter der Roadmap, und zugleich das am wenigsten überprüfbare, was Alibaba gesagt hat.

Was das Unternehmen berichtete: Qwen3.8-Max absolvierte 33 iterative Zyklen über etwa einen Monat vollständig automatisierter Arbeit, die Pipelinedesign, Datenvalidierung und Fehlerdiagnose umfasste, und steigerte seinen Score bei Artificial Analysis von 40 auf 45. In einem Chipdesign-Experiment verbrachte das Modell mehr als 60 Stunden mit Selbstverbesserung über einen Design-Lebenszyklus, führte mehr als 10.000 Aufrufe von Elektronikdesign-Automatisierungswerkzeugen durch und reduzierte die Chipfläche um 42 Prozent ohne Leistungsverlust. Ein Bericht von der Konferenz enthält außerdem eine Verbesserung des Inferenzdurchsatzes um 96 Prozent durch die autonome Optimierung einer neuen T-Head-GPU.

Dies sind Herstellerangaben und wurden nicht unabhängig repliziert. Das ist keine Spitzfindigkeit – eine autonome Schleife, die ihre eigenen Experimente bewertet, misst sich an ihrem eigenen Bewertungssystem, und die Außenwelt hat keine Möglichkeit, die Bewertungskriterien zu überprüfen. Die Berichterstattung über die Konferenz hat das im Allgemeinen so dargestellt, und Leserinnen und Leser sollten davon ausgehen.

In derselben Behauptung steckt eine zweite Falle, und es geht dabei um Etiketten, nicht um Ehrlichkeit. Alibaba hat nicht gesagt, gegen welche Revision des Artificial Analysis Intelligence Index die Bewegung von 40 auf 45 gemessen wird, und dieser Index wurde seit dem Start dieses Modells neu aufgebaut. Die aktuelle Seite von Artificial Analysis für Qwen3.8 Max (0902) zeigt 45 — ein unabhängiger Wert, auf der heute gültigen Revision. Der für dasselbe Modell Mitte August unter der damals gültigen Revision verzeichnete Wert lag bei 56. Eine 45 und eine 56 sind nicht dieselbe Messung in denselben Einheiten, und die Subtraktion der einen von der anderen ergibt eine Zahl, die nichts bedeutet. Was auf der Seite nicht steht, ist die 40, von der aus es laut Alibaba verbessert wurde: Der Ausgangspunkt dieses Deltas ist der des Unternehmens selbst, und nur der Endpunkt liegt zufällig dort, wo der unabhängige Wert jetzt liegt. Lesen Sie die Bewegung als Richtung, nicht als Messung.

A screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), captured September 23 2026, showing an Artificial Analysis Intelligence Index of 45 (ranked 24 of 212, badge 'Updated'), speed of 39.2 output tokens per second (159 of 212), $2.00 per 1M input and $6.00 per 1M output tokens with an 88% cache discount and $5.41 cost per Intelligence Index task (90 of 212), verbosity of 190M output tokens (88 of 212), and a technical specification listing a 984k context window with reasoning enabled.

Was Alibaba auf derselben Konferenz tatsächlich auslieferte

Wenn man die Roadmap herausrechnet, enthielt die Konferenz immer noch echte Releases – alle multimodal:

• Qwen3.8-LiveTranslate — Simultandolmetschen, mit um fast 20 Prozent gesenkter Latenz (LAAL), von 2,8 Sekunden auf 2,3 Sekunden

• Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-TTS und Qwen-Audio-3.1-Realtime — eine aufgefrischte Sprachsuite

• Qwen-Audio-3.1-TTS-Next — filmreife Klanglandschaften, die Dialog und Atmosphäre aus einem Textskript verbinden, gedacht für Hörbücher, Film und Fernsehen, Podcasts und Spiele

• Qwen-Image 3.1 — Bildgenerierung, optimiert für kreatives Design und E-Commerce-Marketing, voraussichtlich später in diesem Jahr, mit nativer Generierung transparenter Hintergründe

Qwen Intelligence — eine agentische Full-Stack-Plattform, die sich an Smartphone-Hersteller richtet

Jeder Eintrag auf dieser Liste ist ein Produkt mit einem Lieferfenster. Die Behauptung im Frontier-Maßstab ist der einzige Punkt auf der Agenda, dem kein Datum beigefügt ist, und der Kontrast ist kein Zufall: Die Auslieferung der multimodalen Stufe ist das, was ein Roadmap-Jahr finanziert, und die Roadmap ist das, was aus der nächsten Finanzierungsrunde oder dem nächsten Cloud-Vertrag eine Geschichte statt einer Tabellenkalkulation macht. Beide Dinge sind real. Nur eines davon ist etwas, das man anrufen kann.

Was ist heute kündbar, und was muss sich ändern, damit sich das ändert?

Die Qwen-3.8-Generation bildet weiterhin die gesamte käufliche Produktlinie. Qwen3.8-Max ist seit dem 3. August 2026 allgemein verfügbar, zu 2,00 $ pro Million Input-Tokens und 6,00 $ pro Million Output-Tokens, pauschal über den gesamten Kontext von 1.000.000 Tokens hinweg, ohne Aufschlag für lange Prompts. Seine Gewichte wurden am 12. August 2026 als Qwen3.8-2.4T-A95B in BF16 und FP8 unter einer eigenen Qwen-Lizenz veröffentlicht. Die Benchmark-Tabelle des Anbieters ist stark und ungeprüft — Terminal-Bench 2.1 bei 86,6, GPQA Diamond bei 92,6, OSWorld-Verified bei 86,1, alles eigene Zahlen von Alibaba — Das unabhängige Bild ist weniger schmeichelhaft als das des Anbieters: Artificial Analysis verortet Qwen3.8 Max (0902) bei einem Intelligence Index von 45, auf Rang 24 von 212 Modellen, bei 5,41 $ gemessenen Kosten pro Intelligence-Index-Aufgabe und 39,2 Output-Tokens pro Sekunde — Rang 159 von 212, nahe dem langsamen Ende des Feldes. Dieselbe Seite gibt das Kontextfenster mit 984k an, gegenüber 1.000.000 auf unserer eigenen Modellseite — eine Diskrepanz, die man kennen sollte, bevor man einen Long-Context-Job dimensioniert. Frontier-Klasse-Score, Mittelmaß beim Tempo: Das ist die ehrliche Zusammenfassung des aktuell ausgelieferten Flaggschiffs, und es ist die Messlatte, die jedes Qwen 4.5 gleichzeitig auf beiden Achsen schlagen muss.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), captured September 23 2026, showing the model id, 1M-token context, text image and video input with text output, vision tools JSON and reasoning badges, a dated snapshot label of 2026-08-03, input at $2.00 and output at $6.00 per 1M tokens, p50 TTFT 3.09s and p95 TTFT 10.00s, trailing-7-day traffic of 29.4M tokens, and a Python code sample posting to the OpenAI-compatible base_url https://api.orcarouter.ai/v1.

OrcaRouter bietet die Qwen-3.8-Familie — qwen/qwen3.8-max, qwen3.8-flash und qwen3.8-27b — auf einem einzigen OpenAI-kompatiblen Endpunkt an, zusammen mit mehr als 200 weiteren Modellen, was bedeutet, dass eine Qwen-4.5-Stufe eine Änderung der Modell-ID auf einem bestehenden Schlüssel wäre und nicht ein neuer Anbietervertrag, eine neue Rechnung und ein neues SDK. Wenn eine erscheint, wäre dieser Katalog der Ort, an dem sie auftauchen würde. Heute steht weder Qwen 4.5 noch Qwen 5 darin, weil keines von beiden veröffentlicht wurde — und daran ändert auch noch so viel Roadmap-PR nichts.

Der praktische Nutzen eines Fahrplans wie diesem ist das Gegenteil eines Migrationsplans. Wenn eine Qwen 4.5-Stufe für Ihre Workload irgendwann plausibel erscheint, ist der günstigste Weg, das herauszufinden, einen Teil des echten Traffics hinter einem automatischen Fallback darauf zu leiten, sodass ein Modell, das sich als langsam, teuer oder schlechter als das etablierte Modell erweist, Sie einen Prozentsatz einer Workload statt ein Viertel kostet. Dafür ist Failover da, und ein unbewiesenes, erst wenige Tage altes Frontier-Modell ist der klarste Fall für seinen Einsatz.

Worauf man achten sollte – und was man noch nicht glauben sollte

Eine Roadmap-Zeile wird erst dann zu einem Release, wenn ein paar konkrete Dinge auftauchen. Eine Model Card mit einer Gesamtparameterzahl, einer Anzahl aktiver Parameter und einem Kontextfenster. Eine API-Kennung, die man in einer Anfrage übergeben kann. Gewichte auf einem Modell-Hub. Ein Eintrag in einem unabhängigen Leaderboard mit angehängtem Datum. Ein Preis. Jedes einzelne davon ist ein Signal; die meisten zusammen sind ein Launch.

Dinge, die kein Release sind, so technisch sie auch aussehen mögen: eine Erwähnung auf einer Konferenz; der Pull Request eines Serving-Frameworks, der einen Architekturzweig für einen experimentellen Qwen-Build hinzufügt – also Engine-Arbeit an jemandes Inferenz-Stack und kein Modell, das man aufrufen kann; eine datierte Snapshot-ID für eine Generation, die bereits ausgeliefert wurde; und ein Social-Media-Post, der eine Bühnenbemerkung paraphrasiert. Das Signal, aus dem dieser Artikel entstand, war das letzte davon, und der Grund, warum es sich lohnte, darüber zu schreiben, ist, dass die zugrunde liegende Behauptung gegen Alibabas eigene Pressemitteilung prüfbar ist – woher auch der 5-bis-10-Billionen-Bereich, der Qwen-4-Status und die RSI-Zahlen stammen. Das Signal wies auf die Story hin; es ist nicht die Story.

Die kurzfristige Frage ist enger gefasst, als die Schlagzeilen nahelegen. Alibaba hat gesagt, dass Qwen 4 trainiert wird, was Qwen 4 in der Abfolge vor sowohl 4.5 als auch 5 setzt – die nächste Sache, die es zu beobachten lohnt, ist also nicht ein Modell mit 10 Billionen Parametern, sondern ob Qwen 4 mit einer Modellkarte, einem Preis und einem Endpunkt erscheint und wann. Bis etwas in dieser Kette eintritt, ist die ehrliche Position zum Bereich von 5 bis 10 Billionen, dass es sich um eine Entwicklungsrichtung handelt, die öffentlich zu Protokoll gegeben wurde, ohne beigefügte Spezifikation und ohne Datum. Planen Sie mit Qwen3.8-Max, betrachten Sie den 4.5- und 5-Bereich als Skalierungsthese statt als Produkt, und behandeln Sie jede Parameterzahl, die Sie für ein Modell ohne Modellkarte sehen, als Prognose.