
Step 5 Preview vs. Qwen 3.8 Max Prime: Ein Indexpunkt, vier Dollar und achtunddreißig Cent
- OrcaNEUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 pro 1 Mio. Tokens
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
Fangen wir mit dem an, was Ihnen eine Suchmaske nicht verrät. Qwen 3.8 Max Prime ist kein Modell. Es ist eine Bereitstellungsschiene – dieselben Qwen3.8-Max-Gewichte, die der Anbieter am 3. August 2026 in die allgemeine Verfügbarkeit überführte und unter einer zweiten Modell-ID zu exakt dem Doppelten des internationalen Listenpreises verkauft. Step 5 Preview, das geschlossene Flaggschiff von StepFun, öffnete seine API am 20. September 2026 und ist ein Modell im gewöhnlichen Sinn: ein Endpunkt, ein Preis, ein Satz Gewichte, den man nicht in Händen halten kann. Die ehrliche Version dieses Duells stellt also ein vermessenes Modell gegen eine unvermessene Stufe, und die Rechnung, die dabei herauskommt, ist unverblümter, als es einer der Anbieter auf eine Folie setzen würde. Im unabhängigen Artificial Analysis Intelligence Index liegen die beiden einen Punkt auseinander, 44 gegen 45, und bei den Kosten pro abgeschlossener Aufgabe trennen sie 1,03 $ von 5,41 $. Ein Punkt, vier Dollar und achtunddreißig Cent pro Aufgabe – und das, bevor Sie überhaupt die Geschwindigkeit bezahlt haben, für die Prime tatsächlich Geld verlangt.
Im Folgenden wird diese Zahl auseinandergenommen: woher sie stammt, warum die Standard-Qwen-ID bereits die teurere Hälfte des Vergleichs ist, bevor Prime überhaupt etwas verdoppelt, und was die zusätzlichen vier Dollar pro Aufgabe kaufen – und was nicht.
Der Name leistet die Arbeit, die das Produkt nicht leistet.
Alibaba kündigte Prime — 优速模式, den Schnellmodus — auf der Yunqi-Konferenz am 22. September 2026 an und veröffentlichte es als Zeile in der Preisliste von Model Studio. Alibabas eigene Dokumentation ist eindeutig, was sich ändert: Die Ausgabegeschwindigkeit steigt auf das 1,5- bis 2-Fache der Standard-API, und mit den Worten des Anbieters sind die Funktionen und Nutzungsbeschränkungen identisch mit denen des Originalmodells. Keine neue Parameteranzahl, kein neuer Endpunktvertrag, keine Fähigkeit, die der Standard-ID fehlt. Sie ändern den Modellnamen im Request-Body, und schon sind Sie auf der Überholspur.

Das macht den Suchbegriff zu einer Falle. Wer nach einem Qwen-Flaggschiff sucht, das neuer als Qwen3.8-Max ist, stößt auf „Prime“ und liest es als Versionsnummer. Es ist ein Preis. Alles, was der Name an Leistungsfähigkeit impliziert, kommt von Qwen3.8-Max selbst: einem Sparse-Mixture-of-Experts-Modell mit 2,4 Billionen Parametern, von denen pro Token rund 95 Milliarden aktiv sind, 512 Experten pro Schicht und einem Kontext von 983.616 Token in der Konfiguration, die das unabhängige Gremium getestet hat.
Step 5 Preview weist keine vergleichbare Mehrdeutigkeit auf und hat das umgekehrte Problem. StepFun führt es mit etwa 600 Milliarden Gesamtparametern, davon 27 Milliarden aktive, Text-, Bild- und Videoeingabe, einem Kontextfenster von 1 Mio. Token und einer dokumentierten Obergrenze für die Ausgabe von 64.000 Token auf, wobei der Reasoning-Aufwand auf niedrig, mittel oder hoch eingestellt werden kann. Es ist proprietär. Ein BF16-Checkpoint wurde für den 15. Oktober 2026 versprochen und ist bislang nicht ausgeliefert worden; Community-Mirrors eines BF16-Builds sind seit dem Tag, an dem die API geöffnet wurde, auf Hugging Face im Umlauf, aber Re-Uploads sind keine Veröffentlichung, und StepFun hat keine Ankündigung zu offenen Gewichten veröffentlicht.
Die Gegenüberstellung ist also schon wirklich ungleich, bevor auch nur ein einziger Benchmark vorliegt: ein als Vorschau gezeigtes Modell, das vielleicht einmal zum Download wird, gegen eine neu bepreiste Serving-Stufe eines Modells, bei dem das nicht passieren wird.
Was ein Indexpunkt kostet
Beide Modelle wurden vom selben unabhängigen Evaluator getestet, und hier wird der Vergleich für die Erzählung vom günstigeren Preis pro Token unangenehm. Weiterlesen am 10. Oktober 2026:
• Index — Step 5 Preview 44, deutlich über einem Median vergleichbarer Modelle von 26. Qwen3.8-Max im 0902-Build, 45. Ein Punkt.
• Kosten pro abgeschlossener Indexierungsaufgabe — 1,03 $ gegenüber 5,41 $. Mehr als fünfmal besser.
• Ausgabepreis — 2,70 $ gegenüber 6,00 $ pro Million Tokens beim Standard-ID, was sich auf 9,902 $ erhöht, sobald Sie zu Prime wechseln. Step 5 Preview ist 2,2-mal günstiger als Standard und 3,7-mal günstiger als Prime.
• Eingabepreis — 1,00 $ gegenüber 2,00 $ Standard und 3,301 $ bei Prime. Das Spiegelbild der Ausgabespalte – und der Preis, der mehr zählt, sobald Sie die Kostenaufschlüsselung unten lesen.
• Cache-Treffer — 0,10 $ pro Million Token bei Step 5 Preview, ein Rabatt von 90 Prozent; 0,25 $ bei Qwen3.8-Max, ein Rabatt von 87,5 Prozent, den die Seite des Anbieters selbst auf 88 Prozent rundet.
• Ausgabe-Tokens pro Sekunde — 87 gegenüber 35,4. Hier ist Qwen der Langsame, und zwar um etwa den Faktor zweieinhalb.
Die Spalten pro Token und die Spalte pro Aufgabe widersprechen sich, und der Spalte pro Aufgabe ist zu glauben – aus einem Grund, der sich erst zeigt, wenn man die Kostenaufschlüsselung öffnet. Beim Index-Lauf von Step 5 Preview entfallen 0,85 $ der 1,03 $ auf die Eingangsseite und 0,17 $ auf die Ausgangsseite. Bei dem von Qwen3.8-Max entfallen 4,76 $ der 5,41 $ auf die Eingangsseite und 0,65 $ auf die Ausgangsseite. Die ausgezeichneten Preise liegen ungefähr um den Faktor zwei auseinander; die Abrechnungen pro Aufgabe liegen um den Faktor fünf auseinander, weil der Qwen-Lauf etwa 9,9 Milliarden Eingabe-Token durch die Testumgebung schickte, gegenüber 5,5 Milliarden bei Step 5 Preview, und weil der größte Teil dieses Volumens Cache-Verkehr ist, der zu dem Rabatt, den der Anbieter auch immer gewährt, erneut gelesen wird, statt zum Listenpreis.
Step 5 Preview wird vom Board als sehr wortreich beschrieben, mit ungefähr 160 Millionen Ausgabe-Tokens über die Suite hinweg gegenüber einem Median von 82 Millionen — und Qwen3.8-Max wird mit exakt denselben Worten beschrieben, mit ungefähr 190 Millionen gegenüber demselben Median. Keines davon ist ein Modell, das kurz antwortet. Wenn die Ausgabelänge das ist, worauf Sie optimieren wollten, hilft Ihnen keine der beiden Spalten.

Der Vergleich hat ein Loch, und es ist Prime-förmig.
Jede Zahl im vorherigen Abschnitt wurde auf der standardmäßigen Qwen3.8-Max ID gemessen. Nichts davon wurde auf Prime gemessen.
Das ist keine Spitzfindigkeit. Das gesamte Versprechen von Prime besteht darin, dass Tokens schneller ankommen, und die einzige Geschwindigkeitszahl des Boards für diese Familie ist die der Standard-ID mit 35,4 Ausgabe-Tokens pro Sekunde – mit großem Abstand die langsamste der drei hier besprochenen IDs und die eine Zeile, in der Qwen3.8-Max nicht nur teuer, sondern sichtbar leistungsschwach ist. Wenn Prime das obere Ende der von Alibaba angegebenen Spanne liefert, werden aus diesen 35,4 so etwas wie 70 – immer noch unter den 87 von Step 5 Preview, während es pro Ausgabe-Token 3,7-mal so viel kostet. Liefert es das untere Ende der Spanne, werden daraus ungefähr 53.
Das sind Schätzungen, die auf einem vom Anbieter angegebenen Multiplikator beruhen, keine Messungen, und sie sollten als solche gekennzeichnet werden. Niemand, den wir finden konnten, hat einen unabhängigen Durchsatztest für Prime mode veröffentlicht. Die Angabe von 1,5 bis 2× stammt von Alibaba selbst und ist die einzige tragende Behauptung, auf der die gesamte Stufe beruht.
Das eine strukturelle Detail, das für Prime spricht, ist die Drosselungsregel, und es ist leicht, es zu übersehen. Alibabas Dokumentation besagt, dass unter Prime, wenn das Aufrufvolumen das Ratenlimit erreicht, die Anfrage nicht gedrosselt wird, sofern die Plattform noch freie Ressourcen hat – der Ihnen zur Verfügung stehende Durchsatz fällt also nicht unter das angegebene Limit. Das ist eine weiche Obergrenze mit einer harten Untergrenze: Bei Konkurrenz bekommen Sie das Limit, bei ungenutzter Kapazität können Sie mehr bekommen. Für eine Agentenschleife, die Dutzende sequenzieller Aufrufe abfeuert, ist das wichtiger als der Median, weil der langsamste Aufruf bestimmt, wann die Schleife endet. Es ist auch die klarste Erklärung dafür, warum Prime überhaupt als Produkt existiert. Alibaba verkauft Warteschlangenposition aus Kapazität, die es bereits aufgebaut hat, und verlangt das Doppelte für das Recht, zuerst daraus bedient zu werden.
Was die beiden Preislisten sagen, wenn man sie nebeneinanderlegt
Alibaba veröffentlicht seine Qwen-Zeilen direkt nebeneinander, was die Arithmetik dieser Tarifstufe ungewöhnlich sauber macht. Auf der internationalen Seite liest sich die Prime-Zeile als 3,301 $ Eingabe und 9,902 $ Ausgabe pro Million Token, gegenüber 1,65 $ und 4,951 $ für die Standard-ID und für deren 0902-Pin. Das ist exakt 2,0 in beiden Spalten – keine gerundete Näherung, sondern das wörtliche Verhältnis der veröffentlichten Zahlen. StepFuns englischsprachige Preisliste führt Step 5 Preview mit 1,00 $ Eingabe, 0,10 $ bei einem Cache-Treffer und 2,70 $ Ausgabe auf, wobei die Eingabe bei Cache-Fehlschlag die Kosten für das Schreiben neuer Inhalte in den Cache einschließt. Die vom Anbieter veröffentlichte Cache-Treffer-Zahl ist ein Rabatt von 90 Prozent; das unabhängige Gremium verzeichnet 95 Prozent aus denselben Materialien, und es lohnt sich zu wissen, gegen welche der beiden man modelliert.
Setze die drei Karten in eine Spalte, dann ist das Muster klar. Prime-Output, $9.902. Standard Qwen-Output, $6.00 im Board-Eintrag und $4.951 auf Alibabas eigener internationaler Seite. Step 5 Preview Output, $2.70. Und auf der billigen Spur, für die niemand wirbt, liegt der Cache-Lesevorgang von Step 5 Preview bei $0.10 gegenüber Qwens $0.25 — was für jede Workload, die ihr Präfix wiederholt, mehr zählt als die Output-Spalte.
Eine Warnung zu veralteten Zahlen, denn diese Familie wurde innerhalb von sieben Wochen mehr als einmal neu bepreist. Die viel zitierten $2 Input und $6 Output für Qwen3.8-Max sind die Schlagzeile zum Marktstart im August, und genau das zeigt Alibabas Singapur-Tab noch immer. In den Zeilen für international und global stehen jetzt $1.65 und $4.951. Wenn Sie Ausgaben modellieren, verwenden Sie die Preisliste für Ihre Region und lesen Sie sie am Tag Ihrer Festlegung erneut.
Zwei Arten, 2× zu lesen
Da Prime dasselbe Modell zum doppelten Preis der Standard-ID ist, ist der Aufpreis leicht zu beziffern und schwer zu rechtfertigen. Am oberen Ende von Alibabas Angebot zahlt man 2× für 2× die Geschwindigkeit, was pro eingesparter Sekunde Latenz kostenneutral ist. Am unteren Ende zahlt man 2× für 1,5×, einen Aufpreis von 33 Prozent pro eingesparter Sekunde. Kein Ende ist für interaktive Arbeit unvernünftig; keines ist für einen nächtlichen Batch vertretbar. Deshalb ist der übliche Rat zur Stufe – latenzempfindliche Aufrufe auf Prime, alles andere auf der Standard-ID – auch der richtige Rat.
Der Vergleich mit Step 5 Preview ist der Punkt, an dem die Argumentation ihre Form ändert, und das ist der Teil, den die „vs“-Darstellung sichtbar macht. Prime konkurriert mit Step 5 Preview überhaupt nicht über den Preis. Die Standard-ID ist bereits teurer pro Ausgabe-Token als Step 5 Preview, fünfmal teurer pro abgeschlossener Aufgabe, und sie erzielt einen Punkt mehr. Prime multipliziert die Kostenseite einer Gleichung, die bereits verlor, und kauft Geschwindigkeit zurück, die Step 5 Preview in größerem Umfang kostenlos bietet. Wenn Geschwindigkeit das ist, was Sie von dieser Familie brauchen, dann ist die ehrliche Aussage, dass das Modell auf der anderen Seite dieser Seite Ihnen 87 Token pro Sekunde bei $2,70 pro Million Ausgabe-Token bietet, und die schnelle Spur Ihnen einen Bereich bietet, der nach Alibabas eigenen Zahlen bei etwa 70 bei $9,902 gipfelt.
Das ist kein Argument dafür, dass Step 5 Preview gewinnt. Es ist ein Argument dafür, dass der Wert von Prime vollständig innerhalb von Alibabas eigener Produktlinie liegt und dass die Begründung dafür auf Workloads beruht, bei denen der Ein-Punkt-Vorsprung von Qwen3.8-Max im Index, sein 983.616-Token-Kontext oder sein anderes Aufgabenprofil Arbeit leisten, die ein 1M-Token-Kontext von Step 5 Preview nicht leistet. Und das ist der Vergleich, den noch niemand durchführen kann, weil die Prime-Zeile auf keinem unabhängigen Leaderboard existiert.

Was das für einen Käufer bedeutet
Keines dieser beiden ist auf OrcaRouter. Step 5 Preview ist über StepFuns eigene API und eine Handvoll Drittanbieter-Plattformen erreichbar; Prime ist eine Tarifstufe von Alibaba Cloud Model Studio, die über einen workspace-bezogenen Endpunkt bereitgestellt wird; und Sie können beide Behauptungen in derselben Minute, in der Sie sie lesen, an unserem Katalog überprüfen, was ein besserer Test ist, als uns einfach zu glauben.
Was wir tatsächlich routen, ist ein anderes Produkt in derselben Familie, und es ist ausgerechnet das, worauf die Arithmetik dieses Artikels immer wieder zurückkommt. Das Standard-Qwen3.8-Max und sein datierter Pin Qwen3.8-Max-0902 stehen im Katalog unter demselben Schlüssel wie ihre Geschwister Qwen3.8-Max-Preview, Qwen3.8-Flash und Qwen3.8-27B, zusammen mit mehr als 200 weiteren Modellen, wobei der Anbieter-Listenpreis mit 0 Prozent Aufschlag durchgereicht wird. Daraus folgen zwei Dinge, und beide sind für die obige Entscheidung relevant. Das erste ist, dass eine Änderung der Preisliste bei Alibaba auf unserer Seite am selben Tag erscheint, an dem Alibaba sie veröffentlicht — genau die Eigenschaft, die Sie von einem Anbieter wollen, der diese Familie bereits zweimal in sieben Wochen neu bepreist hat. Das zweite ist, dass Ihre Baseline aufhört, eine Single-Vendor-Wette zu sein: Die Standard-ID ist die Stufe, die Sie höchstwahrscheinlich auf Ihrem Standardpfad behalten werden, und sie hinter einer Routing-Schicht statt einer direkten Integration zu halten, ist das, was die Prime-Entscheidung pro Endpunkt statt pro Vertrag umkehrbar macht.
Wenn Sie sich zwischen den beiden Namen im Titel dieses Artikels entscheiden, ist die Unterscheidung eindeutig. Greifen Sie zu Step 5 Preview, wenn Sie den Score, die Video- und Bildeingabe und den 90-Prozent-Cache-Rabatt wollen, und akzeptieren Sie, dass Sie eine Vorschau mieten, deren Checkpoint ein Versprechen für den 15. Oktober statt einer Lizenz ist. Greifen Sie nur dann zu Qwen 3.8 Max Prime, wenn Sie sich bereits auf Qwen3.8-Max festgelegt haben und anhand Ihrer eigenen Prompts gemessen haben, dass die 35 Tokens pro Sekunde der Standard-ID das sind, was Sie Geld kostet — und kalkulieren Sie diese Entscheidung gegen die 2× statt gegen die 1,5×, denn die Spitze der Produktpalette eines Anbieters ist nicht die Zahl, die Sie in der Produktion sehen werden.
Die Messung, die das klären würde, existiert nicht, und es lohnt sich, das schlicht zu sagen, statt es auszuschmücken. Jemand müsste Prime durch einen Testaufbau laufen lassen, der auch Step 5 Preview laufen lässt, eine Durchsatzverteilung veröffentlichen statt eines Multiplikators und eine Kosten-pro-Aufgabe-Zahl neben den Indexpunkt stellen, den sie erkauft. Bis dahin sind die einzigen Zahlen, die beide Seiten gemeinsam haben, die beiden Preislisten, und sie sagen dasselbe aus entgegengesetzten Richtungen: Der schnelle Weg ist die teuerste Art, ein Qwen3.8-Max-Token zu kaufen, und die langsamste Art, eine Sekunde Wanduhrzeit zu kaufen, gemessen daran, was die Alternative für dieselbe Sekunde verlangt.
