Generierte Titelkarte mit dem Titel „Step 5 Preview vs. GPT-6 Astra – zum zehnfachen Preis“ mit zwei Spalten: Step 5 Preview bei AA Index 44, 600B gesamt / 27B aktiv, Preis $1,00 / $2,70, Mischpreis $0,51 und 99,8 Tokens/Sek.; GPT-6 Astra bei AA Index 53, Preis $10,00 / $50,00, Mischpreis $7,70 und 59,3 Tokens/Sek. Eine Fußzeile lautet: „Beide Werte nach dem Artificial Analysis Intelligence Index; der Astra-Preis steigt oberhalb von 272K Eingabe-Tokens auf $20 / $75.“
Guides & Insights

Step 5 Preview vs GPT-6 Astra: Zehnfacher Eingabepreis für neun Indexpunkte

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Diese beiden Modelle wurden im Abstand von siebzehn Tagen angekündigt und sind für unterschiedliche Planeten bepreist. Step 5 Preview, StepFuns spärliches Mixture-of-Experts-Modell mit 600B Parametern, angekündigt am 20. September 2026, berechnet $1,00 pro Million Input-Tokens und $2,70 pro Million Output-Tokens. GPT-6 Astra, das Flaggschiff des Anbieters, veröffentlicht am 3. September 2026, berechnet $10,00 und $50,00 für dieselben Einheiten unterhalb einer Input-Schwelle von 272K Tokens — und $20,00 und $75,00 oberhalb davon. Das ist der zehnfache Input-Preis und rund der achtzehnfache Output-Preis für ein Modell, das auf dem unabhängigen Intelligence Index neun Punkte mehr erreicht, 53 gegenüber 44. Ob Astra besser ist, steht außer Frage. Ob die Lücke dreißig Dollar mehr pro Million Output-Tokens für Ihre Workload wert ist, schon — und die Antwort verschiebt sich zweimal im Verlauf dieses Textes.

Wofür jedes Modell gedacht ist

Step 5 Preview ist für agentische Arbeit gebaut und wird dafür vertrieben: KI-Coding, Software-Engineering, professionelle Wissensarbeit, Finanzen. Die Architektur ist darauf abgestimmt – 600B Gesamtparameter mit rund 27B aktiven pro Token, ein 1M-Token-Kontext, Text- und Bildeingabe sowie Reasoning mit erweitertem Denken. StepFun hat die gesamte Step 4.x-Reihe übersprungen, um hierher zu gelangen, und ist direkt von Step-3.7-Flash zu Step 5 übergegangen.

GPT-6 Astra ist OpenAIs Allzweck-Flaggschiff: ein Kontextfenster von 1 Mio. Tokens, bis zu 128K Ausgabe-Tokens, Eingabe als Text, Bilder und Dateien, Ausgabe als Text, ein Wissensstand vom 30. April 2026 sowie Unterstützung für Reasoning, Coding und agentische Workflows. Es ist das Modell, zu dem ein Unternehmen greift, wenn die Antwort stimmen muss und die Token-Rechnung nicht die limitierende Einschränkung ist.

• Intelligenzindex — Step 5 Preview 44 vs. GPT-6 Astra 53

• Parameter — Step 5 Preview 600B gesamt / 27B aktiv vs. GPT-6 Astra nicht angegeben

• Kontext- und Ausgabeobergrenze — beide 1M-Token-Kontext; Astra gibt ein 1.050.000-Token-Fenster und eine 128K-Ausgabegrenze an, StepFun hat keine Ausgabeobergrenze veröffentlicht

• Eingabemodalität — Text und Bilder vs. Text, Bilder und Dateien

• Ausgabegeschwindigkeit — Step 5 Preview 99,8 Token/Sek. vs. GPT-6 Astra 59,3 Token/Sek.

• Preis pro 1 Mio. Tokens — 1,00 $ Eingabe / 2,70 $ Ausgabe vs. 10,00 $ Eingabe / 50,00 $ Ausgabe unter 272K Eingabe, steigend auf 20,00 $ / 75,00 $ darüber.

• Cache — Step 5 Preview 95 % Rabatt gegenüber GPT-6 Astra mit 90 % Rabatt auf Lesezugriffe und einer Cache-Schreibrate von 12,50 $ pro Million

• Kosten pro Intelligence-Index-Aufgabe — Step 5 Preview 0,71 $ vs. GPT-6 Astra 3,26 $

Generated two-column comparison scoreboard titled 'Step 5 Preview vs GPT-6 Astra — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, parameters 600B total / 27B active, price $1.00 / $2.70, cache discount 95%, cost per index task $0.71 and output speed 99.8 tokens/sec. The right column gives GPT-6 Astra the rows AA Index 53, parameters undisclosed, price $10.00 / $50.00, cache discount 90%, cost per index task $3.26 and output speed 59.3 tokens/sec. A footer reads 'Both figures per Artificial Analysis Intelligence Index; Astra pricing rises to $20 / $75 above 272K input tokens.'

Die Rechnung, Zeile für Zeile

Die Preisgestaltung von Step 5 Preview ist pauschal und günstig: 1,00 $ Eingabe, 2,70 $ Ausgabe, mit einem Cache-Rabatt von 95 %, der zwischengespeicherte Eingabe auf nahe 0,05 $ pro Million Tokens bringt. Bei einem 7:2:1-Mix aus Cache-Treffern, Eingabe und Ausgabe – der Konvention, die dieser Blog für Agenten-Traffic verwendet – liegt der Mischpreis bei etwa 0,51 $ pro Million Tokens, und die Kosten pro Aufgabe im Intelligence Index belaufen sich auf 0,71 $, Platz 27 von 200. Der Haken ist die Ausführlichkeit: Das Modell erzeugte in diesem Index 160 Mio. Ausgabe-Tokens gegenüber einem Median von 92 Mio., sodass die rohen Token-Zahlen über dem liegen, was der angegebene Preis vermuten lässt.

Die Preisgestaltung von GPT-6 Astra ist gestaffelt, und die Staffel ist der Teil, den man genau lesen sollte. Unter 272K Eingabe-Tokens pro Anfrage liegen die Preise bei $10.00 und $50.00; darüber bei $20.00 und $75.00. Die Staffel wird anhand der jeweiligen Eingabe-Token-Anzahl jeder Anfrage ausgewählt, was bei einem Modell, das mit 1M-Token-Kontext beworben wird, mehr ausmacht, als es klingt – ein einzelner Aufruf mit großem Kontext überschreitet die Grenze und verdoppelt den Satz für die gesamte Anfrage. Cache-Lesevorgänge kosten $1.00 pro Million, ein Rabatt von 90 %, und Cache-Schreibvorgänge kosten $12.50 pro Million. Bei derselben 7:2:1-Mischung liegt der gemischte Satz bei nahezu $7.70 pro Million Tokens, und die Kosten pro Index-Aufgabe betragen $3.26, Platz 71 von 200.

Astra schlägt bei der Ausführlichkeit in die andere Richtung aus und ist hier das knappe Modell: 60 Mio. Ausgabe-Tokens im Index gegenüber 160 Mio. bei Step 5 Preview, bei dieser Kennzahl Platz 27 von 200. Weniger Tokens zu einem höheren Satz verringern die Lücke in einem Maße, das der rohe Multiplikator überzeichnet. Das schließt sie nicht – die Kosten-pro-Aufgabe-Kennzahl rechnet Ausführlichkeit, Cache-Verhalten und Preisgestaltung bereits zusammen heraus, und 3,26 $ gegenüber 0,71 $ ist immer noch ein 4,6-facher Unterschied.

Was man für die neun Indexpunkte kaufen kann

Astras Schlagzeilenzahlen sind OpenAIs eigene und nicht reproduziert: 96,1 auf GPQA Diamond, 72,6 % auf OSWorld 2.0, 97,6 % auf FrontierMath Tier 4, 57,2 % auf Humanity's Last Exam mit Tools und rund 57,9 % auf Terminal-Bench 4.0. Die ARC-AGI-3-Zahl ist diejenige, die man sorgfältig behandeln muss – OpenAI berichtet 99,9 % unter seinem eigenen Provider-Adapter-Harness und 62,7 % auf dem Standard-Harness, und eine Schwankung von 37 Punkten zwischen Harnesses ist mindestens ebenso sehr eine Aussage über den Harness wie über das Modell.

Die veröffentlichten Zahlen von Step 5 Preview bewegen sich bei den agentischen Aufgaben, für die es entwickelt wurde, im selben Bereich und tragen denselben Vorbehalt: 33,3 % bei Terminal-Bench 4.0, 80,5 bei ProgramBench, 67,7 bei DeepSWE v1.1 und 49,0 bei StepCodeBench – alle von StepFun, und keine davon unabhängig reproduziert. Verschiedene Anbieter, verschiedene Harnesses, kein gemeinsamer Lauf – genau deshalb ist die unabhängig gemessene Lücke von neun Punkten die nützlichere Zahl als jede dieser.

Diese Lücke ist real, und sie ist nicht klein. In einem Ranking mit 200 Modellen liegen 53 und 44 auf dem dritten und dem vierundzwanzigsten Platz, und der Abstand zeigt sich als eine andere Klasse von Aufgabe und nicht als ein anderer Punktwert bei derselben Aufgabe: Astras veröffentlichte Siege konzentrieren sich auf Reasoning über lange Horizonte und Computer Use – genau dort setzt sich die Spitze des Rankings ab. Wenn Ihre Workload dort angesiedelt ist, wiegen die neun Punkte mehr als die Rechnung.

Ein Vorbehalt zu Astras Punktzahl. Artificial Analysis überarbeitet den Intelligence Index, und die Zahlen für dasselbe Modell schwanken zwischen Momentaufnahmen, die Wochen auseinanderliegen – 52,8, 53 und 54,7 tauchen alle in Material auf, das innerhalb desselben Monats über dieses Modell veröffentlicht wurde. Die 53 auf der aktuellen Modellseite ist die Zahl, die verwendet werden sollte, und jeder Vergleich, der eine ältere Astra-Momentaufnahme neben einen aktuellen Step 5 Preview-Wert stellt, misst mit zwei verschiedenen Maßstäben.

Screenshot of the Artificial Analysis model page for GPT-6 Astra, showing OpenAI as the creator with a September 2026 release date, an Intelligence Index of 53 at rank 3 of 200, output speed 59.3 tokens per second at rank 101 of 200, cost per Intelligence Index task $3.26 at rank 71 of 200, verbosity 60M output tokens at rank 27 of 200, pricing of $10.00 per million input tokens and $50.00 per million output tokens with a 90% cache discount, and technical specifications listing reasoning, text and image input, a 1M-token context window and an April 30, 2026 knowledge cutoff.

Geschwindigkeit und Latenz sind zwei verschiedene Fragen

Bei der Generierungsgeschwindigkeit ist das unabhängige Board eindeutig: 99,8 Ausgabe-Token pro Sekunde für Step 5 Preview gegenüber 59,3 für GPT-6 Astra, das zudem langsamer ist als der Durchschnitt von 70 Token pro Sekunde über die gemessenen Modelle hinweg. In einem interaktiven Coding-Loop ist das der Unterschied zwischen einem Vorschlag und einer Pause, und es summiert sich über eine Sitzung hinweg, so wie sich ein Cache-Rabatt summiert.

Die Latenz ist die kompliziertere Geschichte, und eine einzelne Zahl führt dabei in die Irre. Astra leitet das Reasoning vor der Ausgabe, daher sind die Zeit bis zum ersten Token und die Zeit bis zu einer nutzbaren Antwort nicht dieselbe Messung, und veröffentlichte Werte dafür streuen stark, je nachdem, ob das Reasoning mitgezählt wird. In unserem eigenen Datenverkehr der letzten sieben Tage liegt die mediane Zeit bis zum ersten Token für GPT-6 Astra bei 6,72 Sekunden mit einem 95. Perzentil von 10,00 Sekunden — die Zahl, die ein Aufrufer über unseren Endpunkt tatsächlich erlebt. Artificial Analysis gibt die Zeit bis zum ersten Token für Step 5 Preview mit 2,96 Sekunden in seinem eigenen Testaufbau an, und diese beiden Werte werden nicht auf dieselbe Weise gemessen, daher sollten sie nicht voneinander subtrahiert werden.

Wo sich die Cache-Asymmetrie tatsächlich auswirkt

Beide Modelle gewähren hohe Rabatte auf wiederholte Präfixe und beide berechnen deren Schreiben, und der Unterschied zwischen ihnen beträgt beim Lesen das 20-Fache. Der Cache-Rabatt von 95 % bei Step 5 Preview senkt zwischengespeicherte Eingabe auf nahezu 0,05 $ pro Million Token. GPT-6 Astra liest Cache zu 1,00 $ pro Million – ein Rabatt von 90 % auf einen zehnmal höheren Basispreis – und schreibt ihn zu 12,50 $ pro Million.

Bei einem Agenten-Loop, der bei jedem Durchgang denselben System-Prompt und Repository-Kontext erneut sendet, ist die Leserate das, was sich kumuliert, und der höhere Rabatt beim günstigeren Modell ist mehr wert als der niedrigere Rabatt beim teuren. Astras Mischung landet weiterhin bei knapp 7,70 $ pro Million Tokens gegenüber 0,51 $ bei Step 5 Preview bei derselben 7:2:1-Mischung – ein fünfzehnfacher Unterschied, den eine lange Sitzung nicht schließt, sondern vergrößert.

Beide von einer Taste aus ausführen

GPT-6 Astra ist live auf OrcaRouter unter openai/gpt-6-astra zu OpenAIs Listenpreisen — 10,00 $ und 50,00 $ pro Million unterhalb der 272K-Schwelle, 20,00 $ und 75,00 $ oberhalb davon — ohne Aufschlag durchgereicht, sodass eine Preisänderung eines Anbieters bei uns noch am selben Tag live ist und nicht erst zum nächsten Abrechnungszyklus. Unsere eigene Sieben-Tage-Telemetrie zu diesem Endpunkt zeigt den oben genannten Median von 6,72 Sekunden und die 95.-Perzentil-Zeit bis zum ersten Token von 10,00 Sekunden, zusammen mit 277,9 Mio. Tokens Traffic über ihn in der vergangenen Woche.

Step 5 Preview ist nicht in unserem Katalog und wir routen es nicht. Es läuft über StepFuns eigene API und Studio, und das ist der einzige Ort, an dem es läuft, bis der Checkpoint vom 15. Oktober erscheint. Diese Asymmetrie ist kein Mangel des Vergleichs; sie ist der Vergleich. Die günstige Hälfte dieses Duells ist die Hälfte, die man woanders aufrufen muss, und die Hälfte, die man heute in Produktion nehmen kann, liegt hinter einer einzigen API für mehr als 200 Modelle: GPT-6 Astra zu den obigen Sätzen, GLM-5.3 zu $1.26 und $3.96, DeepSeek V4 Pro, Claude Opus 5 und der Rest – mit automatischem Failover über Anbieter hinweg, das einen Pfad stabil hält, wenn sich die Kapazität eines Anbieters verschiebt, und mit der Routing-DSL, die eine Aufgabe günstig starten und nur dann hochskalieren lässt, wenn es sein muss. Diese Eskalationsregel ist die eigentliche Antwort auf eine zehnfache Preisdifferenz: Der größte Teil einer Workload braucht nicht die Spitze des Leaderboards, und eine Routing-Schicht ist der Weg, aufzuhören, für den Teil zu zahlen, der sie nicht braucht.

Screenshot of the OrcaRouter model page for GPT-6 Astra at www.orcarouter.ai/models/openai/gpt-6-astra, showing the model id openai/gpt-6-astra with NEW, FLAGSHIP and FEATURED badges, a 1M-token context and 128K max output, text, image and file input with text output, best-for tags for reasoning, coding and agentic work, input pricing of $10.00 and output pricing of $50.00 per million tokens, a seven-day median time to first token of 6.72 seconds and a 95th percentile of 10.00 seconds, 277.9M tokens of seven-day traffic, and the chat-completions and responses endpoints behind the OrcaRouter API.

Wer sollte welche auswählen?

Wenn Ihre Workload ein Long-Horizon-Agent ist, der eine schwierige Aufgabe richtig erledigen muss — Computer-Nutzung, mehrstufige Recherche, Arbeit, bei der eine falsche Antwort mehr kostet als die Tokens —, dann ist der Neun-Punkte-Vorsprung von GPT-6 Astra der günstigste Teil der Entscheidung, und die Rechnung zeigt, was die Fähigkeit kostet. Betreiben Sie es als Eskalationsziel, nicht als Standard, und achten Sie auf die 272K-Schwelle: Eine einzige überdimensionierte Anfrage verdoppelt den Preis für alles darin.

Wenn Ihre Arbeitslast aus hochvolumigem agentischem Text besteht – Codegenerierung, Refactorings, strukturierte Extraktion, die innere Schleife eines Coding-Assistenten –, liegt Step 5 Preview bei allem vorn, worauf die Rechnung und die Uhr achten, und neun Indexpunkte werden den Kontakt mit einer Aufgabenverteilung, die nicht an der Spitze des Leaderboards steht, wahrscheinlich nicht überleben. Der Haken ist nicht die Leistung: Das Modell ist proprietär, es gibt keine veröffentlichte Lizenz, keine Erlaubnis zur kommerziellen Nutzung und bis zum 15. Oktober keinen Checkpoint. Sie können es aufrufen; Sie können es weder besitzen noch feinabstimmen noch eine Ableitung davon ausliefern.

Wenn die Antwort nicht offensichtlich ist, ist das Muster eine Tier-Aufteilung statt einer Wahl. Leiten Sie allgemeinen Traffic an ein Mid-Tier-Modell und reservieren Sie Astra für die Anfragen, die die Spitze des Feldes brauchen — beide Enden dieser Regel liegen bei uns hinter einem einzigen Schlüssel, sodass die Aufteilung eine Routing-Regel kostet statt eines zweiten Vertrags. Flaggschiff-Preise für Arbeit zu zahlen, die ein Mid-Tier-Modell korrekt erledigt, ist der Fehler, um den es in diesem Vergleich tatsächlich geht.