
Qwen3.8 Max Prime: Alibaba stellt eine zweitrangige Preisliste neben sein Flaggschiff
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 584 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 187 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Am 22. September 2026 kündigte der MaaS-Geschäftsbereich von Alibaba auf der Yunqi Conference in Hangzhou eine Serving-Stufe an, die er Prime mode — 优速模式 — nennt, und nahm eine neue Modell-ID in die Preisliste dafür auf: qwen3.8-max-prime. Diese ID ist kein neues Modell. Sie ist Qwen3.8-Max, das 2,4-Billionen-Parameter-Flaggschiff als Sparse-Mixture-of-Experts, das am 3. August 2026 allgemein verfügbar wurde und über einen schnelleren Pfad bereitgestellt wird. Qwen3.8 Max Prime hat dieselben Gewichte, dasselbe Kontextfenster, dieselben Tools und dieselben Nutzungslimits wie das Basismodell. Was sich unterscheidet, sind Durchsatz und Preis, und der Preis ist ungefähr doppelt so hoch.
Dies ist das zweite Mal in sieben Wochen, dass Alibaba geändert hat, wie Qwen3.8-Max verkauft wird, ohne zu ändern, was es ist. Am 2. September brachte das Unternehmen eine nachtrainierte Aktualisierung heraus, die als Qwen3.8-Max-0902 firmiert, mit Fokus auf Coding und agentische Arbeit, ausschließlich per API. Am 22. September kam die Speed-Stufe hinzu. Weder das eine noch das andere war ein Launch, und wer eines davon als einen liest, wird dafür bezahlen.

Was Prime mode tatsächlich ist
Alibabas eigene Dokumentation beschreibt den Prime-Modus als einen Kanal für Szenarien, bei denen es auf die Ausgabegeschwindigkeit ankommt – KI-Coding-Assistenten, mehrstufiges Agent-Reasoning, Echtzeit-Konversation – und nennt den Vorteil unverblümt: Die TPS werden auf das 1,5- bis 2-Fache der Standard-API erhöht. Es gibt keinen neuen Parameter einzustellen. Sie ändern den Wert von model auf die Prime-ID, und schon sind Sie auf der Überholspur.
Die Dokumentation ist ebenso explizit darüber, was sich nicht ändert: „Die vom Modell unterstützten Fähigkeiten und Nutzungsbeschränkungen sind dieselben wie beim Originalmodell.“ Es gibt also keinen größeren Kontext, keinen besseren Reasoning-Modus, keine zusätzliche Tool-Oberfläche. Es ist derselbe Serving-Stack mit mehr Leistungsreserven dahinter.
The endpoint shape is worth noting because it tells you who this is for. Prime requests go to a workspace-scoped Beijing address of the form https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, on the OpenAI-compatible path. This is a production traffic decision, not an experiment.
Die Preisliste, sorgfältig lesen
Alibabas internationale Preisseite listet die beiden IDs nebeneinander auf, was den Vergleich ungewöhnlich sauber macht. Pro Million Token:
• Eingabe — qwen3.8-max-prime 3,301 $ vs. qwen3.8-max 1,65 $
• Ausgabe — qwen3.8-max-prime 9,902 $ vs. qwen3.8-max 4,951 $
• Cache-Treffer — qwen3.8-max-prime 0,413 $ gegenüber einem Cache-Lese-Tarif auf der Standard-ID, den dieselbe Seite als Rabattzeile führt
• Verhältnis — 2,0× sowohl bei Eingabe als auch Ausgabe, keine gerundete Näherung, sondern die wörtliche Arithmetik der veröffentlichten Zahlen
Auf der China-Preisliste gilt in Yuan derselbe Faktor 2: ¥24 für Eingaben und ¥72 für Ausgaben pro Million für die Prime ID gegenüber ¥12 und ¥36 für die Standard-Version, wobei Cache-Treffer bei ¥3 liegen.
Die weithin zitierte Startzahl für Qwen3.8-Max liegt bei $2 für Eingabe und $6 für Ausgabe pro Million. Das ist die Schlagzeile, mit der die Berichterstattung im August lief, und es ist nicht die Zahl auf der internationalen Tarifkarte von heute. Wenn Sie Ausgaben modellieren, verwenden Sie die Tarifkarte für Ihre Region statt der Start-Schlagzeile, und prüfen Sie sie erneut, bevor Sie sich festlegen — Alibaba hat diese Seite seit dem 2. September zweimal überarbeitet.

Die Drosselungsregel ist das eigentliche Feature
Die Zeile, die die meisten überfliegen, ist diejenige, die für die Produktion am wichtigsten ist. Die Prime-Dokumentation von Alibaba besagt, dass Sie, wenn Ihre Nutzung das Ratenlimit erreicht, sofern die Plattform noch freie Ressourcen hat, nicht gedrosselt werden, sodass der Durchsatz, der Ihnen tatsächlich zur Verfügung steht, nicht unter das angegebene Limit fällt.
Das ist eine weiche Obergrenze mit einer harten Untergrenze, was eine andere Form als ein Standard-Tariflimit ist. Das bedeutet, dass die 1,5–2×-Angabe ein Versprechen zur Untergrenze ist, keine Deckelung der Obergrenze: Bei Konkurrenz erhalten Sie das Limit, und bei Leerlaufkapazität können Sie mehr bekommen. Für eine Agentenschleife, die Dutzende sequenzielle Aufrufe auslöst, ist diese Asymmetrie mehr wert als der reine TPS-Multiplikator, denn die Tail-Latenz beim langsamsten Aufruf bestimmt, ob Ihr Workflow abgeschlossen wird.
Die dynamischen TPM-Limits für Standardmodelle sind nach den monatlichen Model-Studio-Ausgaben gestaffelt – dieselbe Dokumentationsfamilie zeigt die Basis-ID qwen3.8-max mit 5.000.000, 10.000.000 und 20.000.000 TPM über die einzelnen Stufen hinweg, monatlich aktualisiert. Prime beseitigt diese Struktur nicht; es ändert, wie sie greift.

Was noch niemand gemessen hat
Hier ist die ehrliche Lücke. Die 1,5–2×-Zahl ist vom Anbieter angegeben. Es gibt keine unabhängige Prime-Modus-Durchsatzmessung, die wir finden können, und das ist wichtig, weil die eigenen unabhängigen Zahlen des Standard-Builds bei der Geschwindigkeit nicht schmeichelhaft sind.
Artificial Analysis, das Modelle mit seiner eigenen Testumgebung bewertet, vergibt Qwen3.8-Max im Build 0902 derzeit einen Intelligence Index von 45, mit GPQA Diamond bei 92,8 %, Terminal-Bench Hard bei 38,9 % und Humanity's Last Exam bei 43,1 % — und beziffert die gemessenen Kosten pro Aufgabe auf 5,41 $. Das sind unabhängige Zahlen für die Standard-SKU, erfasst am 24.09.2026. Sie sind zudem eine Erinnerung daran, dass der Index seit der Berichterstattung zum August-Start überarbeitet wurde; stellen Sie also nicht einen älteren Indexwert neben einen aktuellen und nennen es einen Trend.
Was AA nicht hat, ist eine Prime-Zeile. Bis jemand es misst, ist die Geschwindigkeitsbehauptung allein Alibabas, und die richtige Herangehensweise ist, sie mit der eigenen Arbeitslast zu testen, statt vom oberen Ende des Spektrums auszugehen.
Was dies für die Routing-Entscheidung bedeutet
Prime ist ein Tarif, den Alibaba über seine eigene API verkauft, und das ist der einzige Ort, um ihn zu bekommen. Wir hosten qwen3.8-max-prime hier nicht. Was OrcaRouter weiterleitet, ist das Standard-Qwen3.8-Max und sein datierter Pin Qwen3.8-Max-0902, beide auf demselben Schlüssel wie der Rest der Qwen3.8-Familie — Qwen3.8, Qwen3.8-Flash, Qwen3.8-27B — zusammen mit über 200 anderen Modellen, wobei der Listenpreis des Anbieters mit 0 % Aufschlag weitergegeben wird. Der letzte Teil ist der Grund, warum die Aktualisierung vom 2. September und jede zukünftige Änderung der Max-Rate bei uns am selben Tag ankommen, an dem sie bei Alibaba ankommen.
Die praktische Aufteilung sieht so aus. Lassen Sie Ihren Standard-Traffic auf der Standard-ID durch einen Router laufen, wo Failover Sie schützt, falls ein einzelner Provider-Pfad degradiert. Verschieben Sie die spezifischen Calls, bei denen die Wall-Clock-Latenz das Produkt ist – die interaktive Completion, der eng getaktete Agent-Schritt –, auf Prime, und kalkulieren Sie diese Entscheidung gegen den 2×-Faktor statt gegen den 1,5×-Faktor.
Wer sollte wechseln, und wer sollte warten
Wechseln Sie, wenn Ihre Nutzer auf Tokens warten: eine Autovervollständigung, ein Chat-Turn, eine Code-Bearbeitungsschleife, bei der ein Mensch zusieht. Am oberen Ende des Geschwindigkeitsbereichs ist Prime kostenneutral pro eingesparter Sekunde Latenz – Sie zahlen genau das Doppelte für genau die Hälfte der Zeit. Am unteren Ende des Bereichs zahlen Sie 2× für 1,5×, was einem Aufpreis von 33 % pro eingesparter Sekunde entspricht. Wenn Ihre Arbeitslast ein Batch-Job ist, der über Nacht läuft, bringt Ihnen dieser Aufpreis nichts, was Sie gebraucht hätten.
Warte, wenn dein Kostenmodell auf der $2/$6-Launch-Schlagzeile basiert oder wenn deine Anfragen input-lastig sind. Die Geschwindigkeitsaussage des Anbieters bezieht sich auf TPS – Output-Tokens pro Sekunde – und Prefill ist eine andere Pipeline-Stufe. Eine Long-Context-Anfrage zahlt doppelt bei den Input-Tokens, unabhängig davon, ob die Ausgabe schneller eintrifft. Miss diesen Fall, bevor du ihn migrierst.
Und prüfe das Datum auf deiner Preiskarte. Qwen3.8-Max ist seit dem 3. August auf dem Markt, wurde einmal aktualisiert und einmal neu verpackt, und es ist immer noch sieben Wochen alt. Die Stufe ist die Neuigkeit; das Modell nicht.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
