
Step 5 Preview vs GPT-6 Astra: Zehnfacher Eingabepreis für neun Indexpunkte
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Diese beiden Modelle wurden im Abstand von siebzehn Tagen angekündigt und sind für unterschiedliche Planeten bepreist. Step 5 Preview, StepFuns spärliches Mixture-of-Experts-Modell mit 600B Parametern, angekündigt am 20. September 2026, berechnet $1,00 pro Million Input-Tokens und $2,70 pro Million Output-Tokens. GPT-6 Astra, das Flaggschiff des Anbieters, veröffentlicht am 3. September 2026, berechnet $10,00 und $50,00 für dieselben Einheiten unterhalb einer Input-Schwelle von 272K Tokens — und $20,00 und $75,00 oberhalb davon. Das ist der zehnfache Input-Preis und rund der achtzehnfache Output-Preis für ein Modell, das auf dem unabhängigen Intelligence Index neun Punkte mehr erreicht, 53 gegenüber 44. Ob Astra besser ist, steht außer Frage. Ob die Lücke dreißig Dollar mehr pro Million Output-Tokens für Ihre Workload wert ist, schon — und die Antwort verschiebt sich zweimal im Verlauf dieses Textes.
Wofür jedes Modell gedacht ist
Step 5 Preview ist für agentische Arbeit gebaut und wird dafür vertrieben: KI-Coding, Software-Engineering, professionelle Wissensarbeit, Finanzen. Die Architektur ist darauf abgestimmt – 600B Gesamtparameter mit rund 27B aktiven pro Token, ein 1M-Token-Kontext, Text- und Bildeingabe sowie Reasoning mit erweitertem Denken. StepFun hat die gesamte Step 4.x-Reihe übersprungen, um hierher zu gelangen, und ist direkt von Step-3.7-Flash zu Step 5 übergegangen.
GPT-6 Astra ist OpenAIs Allzweck-Flaggschiff: ein Kontextfenster von 1 Mio. Tokens, bis zu 128K Ausgabe-Tokens, Eingabe als Text, Bilder und Dateien, Ausgabe als Text, ein Wissensstand vom 30. April 2026 sowie Unterstützung für Reasoning, Coding und agentische Workflows. Es ist das Modell, zu dem ein Unternehmen greift, wenn die Antwort stimmen muss und die Token-Rechnung nicht die limitierende Einschränkung ist.
• Intelligenzindex — Step 5 Preview 44 vs. GPT-6 Astra 53
• Parameter — Step 5 Preview 600B gesamt / 27B aktiv vs. GPT-6 Astra nicht angegeben
• Kontext- und Ausgabeobergrenze — beide 1M-Token-Kontext; Astra gibt ein 1.050.000-Token-Fenster und eine 128K-Ausgabegrenze an, StepFun hat keine Ausgabeobergrenze veröffentlicht
• Eingabemodalität — Text und Bilder vs. Text, Bilder und Dateien
• Ausgabegeschwindigkeit — Step 5 Preview 99,8 Token/Sek. vs. GPT-6 Astra 59,3 Token/Sek.
• Preis pro 1 Mio. Tokens — 1,00 $ Eingabe / 2,70 $ Ausgabe vs. 10,00 $ Eingabe / 50,00 $ Ausgabe unter 272K Eingabe, steigend auf 20,00 $ / 75,00 $ darüber.
• Cache — Step 5 Preview 95 % Rabatt gegenüber GPT-6 Astra mit 90 % Rabatt auf Lesezugriffe und einer Cache-Schreibrate von 12,50 $ pro Million
• Kosten pro Intelligence-Index-Aufgabe — Step 5 Preview 0,71 $ vs. GPT-6 Astra 3,26 $

Die Rechnung, Zeile für Zeile
Die Preisgestaltung von Step 5 Preview ist pauschal und günstig: 1,00 $ Eingabe, 2,70 $ Ausgabe, mit einem Cache-Rabatt von 95 %, der zwischengespeicherte Eingabe auf nahe 0,05 $ pro Million Tokens bringt. Bei einem 7:2:1-Mix aus Cache-Treffern, Eingabe und Ausgabe – der Konvention, die dieser Blog für Agenten-Traffic verwendet – liegt der Mischpreis bei etwa 0,51 $ pro Million Tokens, und die Kosten pro Aufgabe im Intelligence Index belaufen sich auf 0,71 $, Platz 27 von 200. Der Haken ist die Ausführlichkeit: Das Modell erzeugte in diesem Index 160 Mio. Ausgabe-Tokens gegenüber einem Median von 92 Mio., sodass die rohen Token-Zahlen über dem liegen, was der angegebene Preis vermuten lässt.
Die Preisgestaltung von GPT-6 Astra ist gestaffelt, und die Staffel ist der Teil, den man genau lesen sollte. Unter 272K Eingabe-Tokens pro Anfrage liegen die Preise bei $10.00 und $50.00; darüber bei $20.00 und $75.00. Die Staffel wird anhand der jeweiligen Eingabe-Token-Anzahl jeder Anfrage ausgewählt, was bei einem Modell, das mit 1M-Token-Kontext beworben wird, mehr ausmacht, als es klingt – ein einzelner Aufruf mit großem Kontext überschreitet die Grenze und verdoppelt den Satz für die gesamte Anfrage. Cache-Lesevorgänge kosten $1.00 pro Million, ein Rabatt von 90 %, und Cache-Schreibvorgänge kosten $12.50 pro Million. Bei derselben 7:2:1-Mischung liegt der gemischte Satz bei nahezu $7.70 pro Million Tokens, und die Kosten pro Index-Aufgabe betragen $3.26, Platz 71 von 200.
Astra schlägt bei der Ausführlichkeit in die andere Richtung aus und ist hier das knappe Modell: 60 Mio. Ausgabe-Tokens im Index gegenüber 160 Mio. bei Step 5 Preview, bei dieser Kennzahl Platz 27 von 200. Weniger Tokens zu einem höheren Satz verringern die Lücke in einem Maße, das der rohe Multiplikator überzeichnet. Das schließt sie nicht – die Kosten-pro-Aufgabe-Kennzahl rechnet Ausführlichkeit, Cache-Verhalten und Preisgestaltung bereits zusammen heraus, und 3,26 $ gegenüber 0,71 $ ist immer noch ein 4,6-facher Unterschied.
Was man für die neun Indexpunkte kaufen kann
Astras Schlagzeilenzahlen sind OpenAIs eigene und nicht reproduziert: 96,1 auf GPQA Diamond, 72,6 % auf OSWorld 2.0, 97,6 % auf FrontierMath Tier 4, 57,2 % auf Humanity's Last Exam mit Tools und rund 57,9 % auf Terminal-Bench 4.0. Die ARC-AGI-3-Zahl ist diejenige, die man sorgfältig behandeln muss – OpenAI berichtet 99,9 % unter seinem eigenen Provider-Adapter-Harness und 62,7 % auf dem Standard-Harness, und eine Schwankung von 37 Punkten zwischen Harnesses ist mindestens ebenso sehr eine Aussage über den Harness wie über das Modell.
Die veröffentlichten Zahlen von Step 5 Preview bewegen sich bei den agentischen Aufgaben, für die es entwickelt wurde, im selben Bereich und tragen denselben Vorbehalt: 33,3 % bei Terminal-Bench 4.0, 80,5 bei ProgramBench, 67,7 bei DeepSWE v1.1 und 49,0 bei StepCodeBench – alle von StepFun, und keine davon unabhängig reproduziert. Verschiedene Anbieter, verschiedene Harnesses, kein gemeinsamer Lauf – genau deshalb ist die unabhängig gemessene Lücke von neun Punkten die nützlichere Zahl als jede dieser.
Diese Lücke ist real, und sie ist nicht klein. In einem Ranking mit 200 Modellen liegen 53 und 44 auf dem dritten und dem vierundzwanzigsten Platz, und der Abstand zeigt sich als eine andere Klasse von Aufgabe und nicht als ein anderer Punktwert bei derselben Aufgabe: Astras veröffentlichte Siege konzentrieren sich auf Reasoning über lange Horizonte und Computer Use – genau dort setzt sich die Spitze des Rankings ab. Wenn Ihre Workload dort angesiedelt ist, wiegen die neun Punkte mehr als die Rechnung.
Ein Vorbehalt zu Astras Punktzahl. Artificial Analysis überarbeitet den Intelligence Index, und die Zahlen für dasselbe Modell schwanken zwischen Momentaufnahmen, die Wochen auseinanderliegen – 52,8, 53 und 54,7 tauchen alle in Material auf, das innerhalb desselben Monats über dieses Modell veröffentlicht wurde. Die 53 auf der aktuellen Modellseite ist die Zahl, die verwendet werden sollte, und jeder Vergleich, der eine ältere Astra-Momentaufnahme neben einen aktuellen Step 5 Preview-Wert stellt, misst mit zwei verschiedenen Maßstäben.

Geschwindigkeit und Latenz sind zwei verschiedene Fragen
Bei der Generierungsgeschwindigkeit ist das unabhängige Board eindeutig: 99,8 Ausgabe-Token pro Sekunde für Step 5 Preview gegenüber 59,3 für GPT-6 Astra, das zudem langsamer ist als der Durchschnitt von 70 Token pro Sekunde über die gemessenen Modelle hinweg. In einem interaktiven Coding-Loop ist das der Unterschied zwischen einem Vorschlag und einer Pause, und es summiert sich über eine Sitzung hinweg, so wie sich ein Cache-Rabatt summiert.
Die Latenz ist die kompliziertere Geschichte, und eine einzelne Zahl führt dabei in die Irre. Astra leitet das Reasoning vor der Ausgabe, daher sind die Zeit bis zum ersten Token und die Zeit bis zu einer nutzbaren Antwort nicht dieselbe Messung, und veröffentlichte Werte dafür streuen stark, je nachdem, ob das Reasoning mitgezählt wird. In unserem eigenen Datenverkehr der letzten sieben Tage liegt die mediane Zeit bis zum ersten Token für GPT-6 Astra bei 6,72 Sekunden mit einem 95. Perzentil von 10,00 Sekunden — die Zahl, die ein Aufrufer über unseren Endpunkt tatsächlich erlebt. Artificial Analysis gibt die Zeit bis zum ersten Token für Step 5 Preview mit 2,96 Sekunden in seinem eigenen Testaufbau an, und diese beiden Werte werden nicht auf dieselbe Weise gemessen, daher sollten sie nicht voneinander subtrahiert werden.
Wo sich die Cache-Asymmetrie tatsächlich auswirkt
Beide Modelle gewähren hohe Rabatte auf wiederholte Präfixe und beide berechnen deren Schreiben, und der Unterschied zwischen ihnen beträgt beim Lesen das 20-Fache. Der Cache-Rabatt von 95 % bei Step 5 Preview senkt zwischengespeicherte Eingabe auf nahezu 0,05 $ pro Million Token. GPT-6 Astra liest Cache zu 1,00 $ pro Million – ein Rabatt von 90 % auf einen zehnmal höheren Basispreis – und schreibt ihn zu 12,50 $ pro Million.
Bei einem Agenten-Loop, der bei jedem Durchgang denselben System-Prompt und Repository-Kontext erneut sendet, ist die Leserate das, was sich kumuliert, und der höhere Rabatt beim günstigeren Modell ist mehr wert als der niedrigere Rabatt beim teuren. Astras Mischung landet weiterhin bei knapp 7,70 $ pro Million Tokens gegenüber 0,51 $ bei Step 5 Preview bei derselben 7:2:1-Mischung – ein fünfzehnfacher Unterschied, den eine lange Sitzung nicht schließt, sondern vergrößert.
Beide von einer Taste aus ausführen
GPT-6 Astra ist live auf OrcaRouter unter openai/gpt-6-astra zu OpenAIs Listenpreisen — 10,00 $ und 50,00 $ pro Million unterhalb der 272K-Schwelle, 20,00 $ und 75,00 $ oberhalb davon — ohne Aufschlag durchgereicht, sodass eine Preisänderung eines Anbieters bei uns noch am selben Tag live ist und nicht erst zum nächsten Abrechnungszyklus. Unsere eigene Sieben-Tage-Telemetrie zu diesem Endpunkt zeigt den oben genannten Median von 6,72 Sekunden und die 95.-Perzentil-Zeit bis zum ersten Token von 10,00 Sekunden, zusammen mit 277,9 Mio. Tokens Traffic über ihn in der vergangenen Woche.
Step 5 Preview ist nicht in unserem Katalog und wir routen es nicht. Es läuft über StepFuns eigene API und Studio, und das ist der einzige Ort, an dem es läuft, bis der Checkpoint vom 15. Oktober erscheint. Diese Asymmetrie ist kein Mangel des Vergleichs; sie ist der Vergleich. Die günstige Hälfte dieses Duells ist die Hälfte, die man woanders aufrufen muss, und die Hälfte, die man heute in Produktion nehmen kann, liegt hinter einer einzigen API für mehr als 200 Modelle: GPT-6 Astra zu den obigen Sätzen, GLM-5.3 zu $1.26 und $3.96, DeepSeek V4 Pro, Claude Opus 5 und der Rest – mit automatischem Failover über Anbieter hinweg, das einen Pfad stabil hält, wenn sich die Kapazität eines Anbieters verschiebt, und mit der Routing-DSL, die eine Aufgabe günstig starten und nur dann hochskalieren lässt, wenn es sein muss. Diese Eskalationsregel ist die eigentliche Antwort auf eine zehnfache Preisdifferenz: Der größte Teil einer Workload braucht nicht die Spitze des Leaderboards, und eine Routing-Schicht ist der Weg, aufzuhören, für den Teil zu zahlen, der sie nicht braucht.

Wer sollte welche auswählen?
Wenn Ihre Workload ein Long-Horizon-Agent ist, der eine schwierige Aufgabe richtig erledigen muss — Computer-Nutzung, mehrstufige Recherche, Arbeit, bei der eine falsche Antwort mehr kostet als die Tokens —, dann ist der Neun-Punkte-Vorsprung von GPT-6 Astra der günstigste Teil der Entscheidung, und die Rechnung zeigt, was die Fähigkeit kostet. Betreiben Sie es als Eskalationsziel, nicht als Standard, und achten Sie auf die 272K-Schwelle: Eine einzige überdimensionierte Anfrage verdoppelt den Preis für alles darin.
Wenn Ihre Arbeitslast aus hochvolumigem agentischem Text besteht – Codegenerierung, Refactorings, strukturierte Extraktion, die innere Schleife eines Coding-Assistenten –, liegt Step 5 Preview bei allem vorn, worauf die Rechnung und die Uhr achten, und neun Indexpunkte werden den Kontakt mit einer Aufgabenverteilung, die nicht an der Spitze des Leaderboards steht, wahrscheinlich nicht überleben. Der Haken ist nicht die Leistung: Das Modell ist proprietär, es gibt keine veröffentlichte Lizenz, keine Erlaubnis zur kommerziellen Nutzung und bis zum 15. Oktober keinen Checkpoint. Sie können es aufrufen; Sie können es weder besitzen noch feinabstimmen noch eine Ableitung davon ausliefern.
Wenn die Antwort nicht offensichtlich ist, ist das Muster eine Tier-Aufteilung statt einer Wahl. Leiten Sie allgemeinen Traffic an ein Mid-Tier-Modell und reservieren Sie Astra für die Anfragen, die die Spitze des Feldes brauchen — beide Enden dieser Regel liegen bei uns hinter einem einzigen Schlüssel, sodass die Aufteilung eine Routing-Regel kostet statt eines zweiten Vertrags. Flaggschiff-Preise für Arbeit zu zahlen, die ein Mid-Tier-Modell korrekt erledigt, ist der Fehler, um den es in diesem Vergleich tatsächlich geht.
