Hero-Titelkarte für Qwen3.8 Max Prime, Alibabas Serving-Tier mit 1,5- bis 2-fachem Durchsatz für das Flaggschiff Qwen3.8-Max, mit Spezifikations-Chips, die dieselben 2,4T gesamt und ~95B aktiv anzeigen, Prime bei $3,301/$9,902, Standard bei $1,65/$4,951.
Guides & Insights

Qwen3.8 Max Prime: Alibaba stellt eine zweitrangige Preisliste neben sein Flaggschiff

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Am 22. September 2026 kündigte der MaaS-Geschäftsbereich von Alibaba auf der Yunqi Conference in Hangzhou eine Serving-Stufe an, die er Prime mode — 优速模式 — nennt, und nahm eine neue Modell-ID in die Preisliste dafür auf: qwen3.8-max-prime. Diese ID ist kein neues Modell. Sie ist Qwen3.8-Max, das 2,4-Billionen-Parameter-Flaggschiff als Sparse-Mixture-of-Experts, das am 3. August 2026 allgemein verfügbar wurde und über einen schnelleren Pfad bereitgestellt wird. Qwen3.8 Max Prime hat dieselben Gewichte, dasselbe Kontextfenster, dieselben Tools und dieselben Nutzungslimits wie das Basismodell. Was sich unterscheidet, sind Durchsatz und Preis, und der Preis ist ungefähr doppelt so hoch.

Dies ist das zweite Mal in sieben Wochen, dass Alibaba geändert hat, wie Qwen3.8-Max verkauft wird, ohne zu ändern, was es ist. Am 2. September brachte das Unternehmen eine nachtrainierte Aktualisierung heraus, die als Qwen3.8-Max-0902 firmiert, mit Fokus auf Coding und agentische Arbeit, ausschließlich per API. Am 22. September kam die Speed-Stufe hinzu. Weder das eine noch das andere war ein Launch, und wer eines davon als einen liest, wird dafür bezahlen.

Scoreboard infographic for Qwen3.8 Max Prime: underlying model Qwen3.8-Max GA August 3 2026, 2.4T total and ~95B active parameters, throughput 1.5-2x standard, Prime price $3.301/$9.902, standard price $1.65/$4.951, no independent Prime score yet.

Was Prime mode tatsächlich ist

Alibabas eigene Dokumentation beschreibt den Prime-Modus als einen Kanal für Szenarien, bei denen es auf die Ausgabegeschwindigkeit ankommt – KI-Coding-Assistenten, mehrstufiges Agent-Reasoning, Echtzeit-Konversation – und nennt den Vorteil unverblümt: Die TPS werden auf das 1,5- bis 2-Fache der Standard-API erhöht. Es gibt keinen neuen Parameter einzustellen. Sie ändern den Wert von model auf die Prime-ID, und schon sind Sie auf der Überholspur.

Die Dokumentation ist ebenso explizit darüber, was sich nicht ändert: „Die vom Modell unterstützten Fähigkeiten und Nutzungsbeschränkungen sind dieselben wie beim Originalmodell.“ Es gibt also keinen größeren Kontext, keinen besseren Reasoning-Modus, keine zusätzliche Tool-Oberfläche. Es ist derselbe Serving-Stack mit mehr Leistungsreserven dahinter.

The endpoint shape is worth noting because it tells you who this is for. Prime requests go to a workspace-scoped Beijing address of the form https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, on the OpenAI-compatible path. This is a production traffic decision, not an experiment.

Die Preisliste, sorgfältig lesen

Alibabas internationale Preisseite listet die beiden IDs nebeneinander auf, was den Vergleich ungewöhnlich sauber macht. Pro Million Token:

• Eingabe — qwen3.8-max-prime 3,301 $ vs. qwen3.8-max 1,65 $

• Ausgabe — qwen3.8-max-prime 9,902 $ vs. qwen3.8-max 4,951 $

• Cache-Treffer — qwen3.8-max-prime 0,413 $ gegenüber einem Cache-Lese-Tarif auf der Standard-ID, den dieselbe Seite als Rabattzeile führt

• Verhältnis — 2,0× sowohl bei Eingabe als auch Ausgabe, keine gerundete Näherung, sondern die wörtliche Arithmetik der veröffentlichten Zahlen

Auf der China-Preisliste gilt in Yuan derselbe Faktor 2: ¥24 für Eingaben und ¥72 für Ausgaben pro Million für die Prime ID gegenüber ¥12 und ¥36 für die Standard-Version, wobei Cache-Treffer bei ¥3 liegen.

Die weithin zitierte Startzahl für Qwen3.8-Max liegt bei $2 für Eingabe und $6 für Ausgabe pro Million. Das ist die Schlagzeile, mit der die Berichterstattung im August lief, und es ist nicht die Zahl auf der internationalen Tarifkarte von heute. Wenn Sie Ausgaben modellieren, verwenden Sie die Tarifkarte für Ihre Region statt der Start-Schlagzeile, und prüfen Sie sie erneut, bevor Sie sich festlegen — Aliba​ba hat diese Seite seit dem 2. September zweimal überarbeitet.

Screenshot of Alibaba Cloud's international Model Studio pricing page listing the qwen3.8-max-prime and qwen3.8-max model IDs side by side, with Prime at $3.301 per million input tokens and $9.902 per million output tokens against $1.65 and $4.951 for the standard ID.

Die Drosselungsregel ist das eigentliche Feature

Die Zeile, die die meisten überfliegen, ist diejenige, die für die Produktion am wichtigsten ist. Die Prime-Dokumentation von Alibaba besagt, dass Sie, wenn Ihre Nutzung das Ratenlimit erreicht, sofern die Plattform noch freie Ressourcen hat, nicht gedrosselt werden, sodass der Durchsatz, der Ihnen tatsächlich zur Verfügung steht, nicht unter das angegebene Limit fällt.

Das ist eine weiche Obergrenze mit einer harten Untergrenze, was eine andere Form als ein Standard-Tariflimit ist. Das bedeutet, dass die 1,5–2×-Angabe ein Versprechen zur Untergrenze ist, keine Deckelung der Obergrenze: Bei Konkurrenz erhalten Sie das Limit, und bei Leerlaufkapazität können Sie mehr bekommen. Für eine Agentenschleife, die Dutzende sequenzielle Aufrufe auslöst, ist diese Asymmetrie mehr wert als der reine TPS-Multiplikator, denn die Tail-Latenz beim langsamsten Aufruf bestimmt, ob Ihr Workflow abgeschlossen wird.

Die dynamischen TPM-Limits für Standardmodelle sind nach den monatlichen Model-Studio-Ausgaben gestaffelt – dieselbe Dokumentationsfamilie zeigt die Basis-ID qwen3.8-max mit 5.000.000, 10.000.000 und 20.000.000 TPM über die einzelnen Stufen hinweg, monatlich aktualisiert. Prime beseitigt diese Struktur nicht; es ändert, wie sie greift.

Screenshot of the Artificial Analysis model page for Qwen3.8-Max on the 0902 build, showing an Intelligence Index of 45 and a measured cost per task of $5.41 on the standard ID.

Was noch niemand gemessen hat

Hier ist die ehrliche Lücke. Die 1,5–2×-Zahl ist vom Anbieter angegeben. Es gibt keine unabhängige Prime-Modus-Durchsatzmessung, die wir finden können, und das ist wichtig, weil die eigenen unabhängigen Zahlen des Standard-Builds bei der Geschwindigkeit nicht schmeichelhaft sind.

Artificial Analysis, das Modelle mit seiner eigenen Testumgebung bewertet, vergibt Qwen3.8-Max im Build 0902 derzeit einen Intelligence Index von 45, mit GPQA Diamond bei 92,8 %, Terminal-Bench Hard bei 38,9 % und Humanity's Last Exam bei 43,1 % — und beziffert die gemessenen Kosten pro Aufgabe auf 5,41 $. Das sind unabhängige Zahlen für die Standard-SKU, erfasst am 24.09.2026. Sie sind zudem eine Erinnerung daran, dass der Index seit der Berichterstattung zum August-Start überarbeitet wurde; stellen Sie also nicht einen älteren Indexwert neben einen aktuellen und nennen es einen Trend.

Was AA nicht hat, ist eine Prime-Zeile. Bis jemand es misst, ist die Geschwindigkeitsbehauptung allein Alibabas, und die richtige Herangehensweise ist, sie mit der eigenen Arbeitslast zu testen, statt vom oberen Ende des Spektrums auszugehen.

Was dies für die Routing-Entscheidung bedeutet

Prime ist ein Tarif, den Aliba​ba über seine eigene API verkauft, und das ist der einzige Ort, um ihn zu bekommen. Wir hosten qwen3.8-max-prime hier nicht. Was OrcaRouter weiterleitet, ist das Standard-Qwen3.8-Max und sein datierter Pin Qwen3.8-Max-0902, beide auf demselben Schlüssel wie der Rest der Qwen3.8-Familie — Qwen3.8, Qwen3.8-Flash, Qwen3.8-27B — zusammen mit über 200 anderen Modellen, wobei der Listenpreis des Anbieters mit 0 % Aufschlag weitergegeben wird. Der letzte Teil ist der Grund, warum die Aktualisierung vom 2. September und jede zukünftige Änderung der Max-Rate bei uns am selben Tag ankommen, an dem sie bei Aliba​ba ankommen.

Die praktische Aufteilung sieht so aus. Lassen Sie Ihren Standard-Traffic auf der Standard-ID durch einen Router laufen, wo Failover Sie schützt, falls ein einzelner Provider-Pfad degradiert. Verschieben Sie die spezifischen Calls, bei denen die Wall-Clock-Latenz das Produkt ist – die interaktive Completion, der eng getaktete Agent-Schritt –, auf Prime, und kalkulieren Sie diese Entscheidung gegen den 2×-Faktor statt gegen den 1,5×-Faktor.

Wer sollte wechseln, und wer sollte warten

Wechseln Sie, wenn Ihre Nutzer auf Tokens warten: eine Autovervollständigung, ein Chat-Turn, eine Code-Bearbeitungsschleife, bei der ein Mensch zusieht. Am oberen Ende des Geschwindigkeitsbereichs ist Prime kostenneutral pro eingesparter Sekunde Latenz – Sie zahlen genau das Doppelte für genau die Hälfte der Zeit. Am unteren Ende des Bereichs zahlen Sie 2× für 1,5×, was einem Aufpreis von 33 % pro eingesparter Sekunde entspricht. Wenn Ihre Arbeitslast ein Batch-Job ist, der über Nacht läuft, bringt Ihnen dieser Aufpreis nichts, was Sie gebraucht hätten.

Warte, wenn dein Kostenmodell auf der $2/$6-Launch-Schlagzeile basiert oder wenn deine Anfragen input-lastig sind. Die Geschwindigkeitsaussage des Anbieters bezieht sich auf TPS – Output-Tokens pro Sekunde – und Prefill ist eine andere Pipeline-Stufe. Eine Long-Context-Anfrage zahlt doppelt bei den Input-Tokens, unabhängig davon, ob die Ausgabe schneller eintrifft. Miss diesen Fall, bevor du ihn migrierst.

Und prüfe das Datum auf deiner Preiskarte. Qwen3.8-Max ist seit dem 3. August auf dem Markt, wurde einmal aktualisiert und einmal neu verpackt, und es ist immer noch sieben Wochen alt. Die Stufe ist die Neuigkeit; das Modell nicht.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert