
Step 5 Preview: StepFuns unangekündigtes 600B-Flaggschiff ist bereits auf der Bestenliste
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Step 5 Preview hat einen Leaderboard-Rang, einen veröffentlichten Preis, eine gemessene Ausgabegeschwindigkeit und einen Wert von 44 im Intelligence Index – denselben Wert wie Kimi K3, ein Modell, das ungefähr fünfmal so groß ist wie es. Was es nicht hat, ist ein Launch. StepFun hat es nicht angekündigt, die eigene Plattformdokumentation von StepFun führt es nicht auf, und es gibt keine Gewichte zum Herunterladen. Jede Zahl unten stammt von einem Dritten, der Zugriff erhielt, bevor der Anbieter öffentlich etwas sagte, was dies zu einem Was-wir-bisher-wissen-Beitrag statt zu einer Rezension macht. Lies die Zahlen als Beleg dafür, was kommt, nicht als Datenblatt.
Das Leck ist die Story
Die erste öffentliche Spur von Step 5 Preview ist ein Evaluierungslauf. Artificial Analysis hat eine Live-Modellseite dafür, bewertet über StepFuns eigene API unter dem Test-Tag step-5-preview-b, wobei die Plattform das Modell auf den 18. September 2026 datiert. Von dieser Seite stammen die 44, die Preisgestaltung, die Geschwindigkeitsmessung und die Benchmark-Zeilen in diesem Artikel.
Demgegenüber ist die Anbieterseite leer. Die Entwicklerdokumentation von StepFun listet Modelle bis Step 3.7 Flash und Step 3.5 Flash auf und endet dort – kein step-5, kein Preview-Eintrag. Die Hugging-Face-Organisation stepfun-ai hat kein Step-5-Repository, was eher zu einem Flaggschiff mit geschlossenen Gewichten passt als zu einem Versehen. Berichte aus der Community in chinesischen Entwicklerforen deuten auf eine mögliche Vorstellung beim AGI Frontier Event in Shanghai am 19. September hin, was ungefähr einen Tag nach dem Auftauchen der Evaluierungen wäre. Zum Zeitpunkt des Schreibens hat niemand außerhalb von StepFun eine offizielle Spezifikation, einen offiziellen Preis oder einen offiziellen Namen für die ausgelieferte Version.
Schon die Namensgebung selbst ist der erste Hinweis darauf, dass dies eine Vorschau und kein Launch ist. StepFun hat die Step-4.x-Reihe vollständig übersprungen und ging direkt zu Step 5 über. Ein Modell, das unter einem Preview-Suffix veröffentlicht und benchmarkt wurde, bevor es eine Produktseite gibt, ist ein Modell, das der Anbieter noch kalibriert – Preisgestaltung, Routing und Limits können sich vor der allgemeinen Verfügbarkeit alle noch ändern.
Wie die Spezifikation aussieht, soweit man das überhaupt beurteilen kann
Das sind die kursierenden Zahlen, und sie sind die am häufigsten wiederholten Behauptungen des Leaks – was nicht dasselbe ist wie die am besten bestätigten:
• Parameter insgesamt — etwa 600 Mrd., gegenüber rund 2,8 Billionen bei Kimi K3
• Pro Inferenz aktiviert — etwa 27B, rund 4,5 % des Gesamtumfangs, ein ungewöhnlich niedriges Mixture-of-Experts-Verhältnis
• Eingabemodalitäten — Text und Bilder; Ausgabe ist nur Text
• Schlussfolgern — ja, mit erweitertem Denken
• Kontextfenster — 1 Mio. Token bei Artificial Analysis; eine separate Drittanbieter-Konfiguration, die in Entwickler-Tools kursiert, gibt 350.000 mit einer maximalen Ausgabe von 64.000 an
• Gewichtsverfügbarkeit — geschlossen, kein Repository
Dieser Widerspruch beim Kontextfenster sollte klar benannt werden, denn er wurde von niemandem aufgelöst. Ein 1M-Token-Fenster und ein 350k-Token-Fenster sind unterschiedliche Produkte mit unterschiedlichen Speicherkosten, und die zweite Zahl geht mit einer 64k-Ausgabebegrenzung einher, über die die erste nichts aussagt. Wenn Sie eine Long-Document-Pipeline im Vertrauen auf die 1M-Zahl planen, ist die 350k-Konfiguration der Grund, auf eine Anbieterseite zu warten. Die Parameterzahlen haben eine ähnliche Unschärfe: Der Tracker von DataLearner führt MoE-Architektur und Parameterzahlen für Step 5 Preview weiterhin als nicht verfügbar, was bedeutet, dass das Paar 600B/27B – die am häufigsten zitierte Tatsache über dieses Modell – zugleich eine der am wenigsten offiziell bestätigten ist.
Die interessante Zahl ist 27 Mrd., nicht 600 Mrd.
Sparse-Mixture-of-Experts-Modelle investieren Rechenleistung nur in die Experten, an die ein Token tatsächlich geroutet wird, daher ist die Zahl der aktivierten Parameter diejenige, die bestimmt, wie sich das Modell im Produktivbetrieb verhält. Mit rund 27B aktiven Parametern erbringt Step 5 Preview Pro-Token-Arbeit im selben Bereich wie Modelle, die nur einen Bruchteil seiner Größe haben, während die 600B Gesamtparameter weitgehend eine Frage des Speicherbedarfs sind.
Zwei Konsequenzen ergeben sich daraus, und beide zeigen sich in den Messungen von Drittanbietern. Die Serving-Kosten richten sich nach den aktivierten Parametern, was mit ein Grund dafür ist, warum der Preis so ist, wie er ist. Und auch die Geschwindigkeit pro Token profitiert: Artificial Analysis misst 99,8 Ausgabe-Token pro Sekunde, Rang 42 von 200 Modellen, gegenüber einem Median von 64,6. Die Zeit bis zum ersten Token liegt bei 2,96 Sekunden gegenüber einem Median von etwa 3,57 Sekunden. Wenn die Aufteilung 600B/27B korrekt ist, handelt es sich um ein Modell, das darauf ausgelegt ist, günstig im Serving statt günstig im Hosting zu sein – eine wichtige Unterscheidung, wenn Sie derjenige sind, der für die GPUs statt für die Token zahlt.
Wo es auf dem Intelligence Index landet
Artificial Analysis bewertet Step 5 Preview mit 44 auf dem Intelligence Index v4.3, der zehn Evaluierungen umfasst. Das ist Platz 25 von 200 Modellen auf dem Board und deutlich über dem Medianmodell, das der Index bewertet, das bei 25 liegt.
• Intelligenz-Index — Step 5 Preview 44 vs. Kimi K3 44
• Direkt darüber — GLM-5.3 und Claude Opus 5, beide bei 45
• Direkt darunter — DeepSeek V4.1 Flash mit 40 und DeepSeek V4 Pro mit 36
• Terminal-Bench 4.0 — Step 5 Preview 33,3 % vs. Kimi K3 bei ungefähr 12,6 % und vs. DeepSeek V4.1 Flash bei 26,8 %
• SciCode — 59 % für Step 5 Preview, gleichauf mit Kimi K3
• Ausgabegeschwindigkeit — 99,8 Token pro Sekunde gegenüber einem Feldmedian von 64,6
Die Schlagzeile ist der Gleichstand mit Kimi K3, und die ehrliche Lesart ist enger, als die Schlagzeilen nahelegen. Ein 2,8-T-Parameter-Modell auf einem aggregierten Index bei insgesamt 600B zu erreichen, ist ein echtes Effizienzergebnis, doch die Aggregation verbirgt, wie es sich zusammensetzt: Der Abstand bei Terminal-Bench 4.0 zugunsten von Step 5 Preview ist dramatisch, während das SciCode-Ergebnis ein Kopf-an-Kopf-Rennen ist. Aggregierte Parität auf einem Index bedeutet nicht Parität überall, und ein Preview-Build ist der unzuverlässigste Moment, um anzunehmen, dass die Unterschiede bestehen bleiben.
Eine weitere Diskrepanz, die es wert ist, genannt zu werden: Artificial Analysis meldet 44, während der unabhängige Tracker von DataLearner denselben Durchlauf mit 43,6 verzeichnet. Das ist eher ein Rundungsunterschied als eine Uneinigkeit über die Leistungsfähigkeit, aber es ist die Art von Sache, die den Punkt zu den Zahlen dieses Modells ganz allgemein verdeutlicht – es sind Drittanbieter-Messwerte eines nicht angekündigten Modells, zu leicht unterschiedlichen Zeitpunkten erhoben, und keiner davon wurde von StepFun bestätigt. Keiner dieser Benchmarks wird vom Anbieter gemeldet, was sich in beide Richtungen auswirkt: Niemand bei StepFun hat hier eine Zahl reklamiert, und auch niemand bei StepFun hat sich hinter eine gestellt.

Der Preis und die Weitschweifigkeit, die daran nagt
Die Preisgestaltung ist der Teil dieses Leaks, der sich am frühesten auf ein Budget auswirken wird. Über die API von StepFun hält Artificial Analysis Folgendes fest:
• Input — 1,00 $ pro Million Token, gegenüber einem Median von 1,88 $ für vergleichbare Modelle
• Ausgabe — 2,70 $ pro Million Token, verglichen mit einem Median von 10,00 $
• Cache — ein Cache-Rabatt von 95 %, wodurch Cache-Treffer bei ungefähr 0,05 $ pro Million Token liegen
• Gemischt — etwa 0,51 $ pro Million Token bei einem Verhältnis von 7:2:1 aus Cache-Treffern, Eingabe und Ausgabe
• Kosten pro Intelligence-Index-Aufgabe — 0,71 $
• Kosten eines vollständigen Indexlaufs — insgesamt 918,34 $
Der Output zu 2,70 $ ist die Zeile, auf die es am meisten ankommt, denn er liegt unter einem Fünftel dessen, was Kimi K3 für dieselbe Million Token bei 15,00 $ verlangt. Doch es gibt einen Haken, den ein Vergleich pro Token verbirgt, und Artificial Analysis misst ihn direkt: die Ausführlichkeit. Step 5 Preview generierte 160 Mio. Output-Token, um den Intelligence Index abzuschließen, gegenüber einem Median von 90 Mio. im Feld und Rang 65 von 200 bei dieser Kennzahl.
Rechnen Sie das einmal durch. Bei 2,70 $ pro Million sind 160 Mio. Output-Tokens etwa 432 $ – ungefähr die Hälfte der Gesamtkosten von 918,34 $ für den gesamten Index-Lauf, ausgegeben für die eigene Geschwätzigkeit des Modells statt für die Aufgaben. Schickt man dieselben 160 Mio. Tokens durch den Output-Tarif von Kimi K3 von 15,00 $, ist man bei 2.400 $, und daher rührt der Preisvorteil. Doch die praktische Warnung richtet sich an alle, die Kosten schätzen, indem sie eine Tokenzahl von einem anderen Modell übernehmen: Step 5 Preview schreibt etwa das 1,8-Fache des Medians, sodass eine output-lastige Workload gleichzeitig den günstigeren Tarif und mehr Tokens erwirbt. Der Rabatt bleibt bestehen, aber er ist kleiner, als es der Vergleich von 1,00 $/2,70 $ gegen 3,00 $/15,00 $ erscheinen lässt, und seine Höhe hängt ganz davon ab, wie geschwätzig Ihre Prompts das Modell machen.
Der 95-%-Cache-Rabatt ist der andere Hebel, und er ist ungewöhnlich aggressiv. Eine Workload mit starker Prompt-Wiederverwendung – ein langer System-Prompt, ein festes Dokument, eine gemeinsam genutzte Codebasis – landet viel näher am gemischten Preis von 0,51 $ als am Eingabetarif von 1,00 $. Diese gemischte Zahl geht von einem Verhältnis von 7:2:1 aus, was eine Modellierungsannahme und keine Garantie ist, aber es ist die richtige Art von Rechnung, die man gegen den eigenen Traffic aufstellen kann.

Worauf frühe Tester stoßen
Dies sind einzelne Berichte aus Entwicklerforen und Social-Media-Beiträgen in den Tagen rund um das Leck, keine Messungen, und sie sollten entsprechend gewichtet werden:
• Tool-Calling ist die häufigste Beschwerde – falsche Tool-Namen werden ausgewählt und Bearbeitungen versucht, ohne zuerst die Zieldatei zu lesen.
• Fehler, die jenseits von ungefähr 340.000 Kontext-Tokens gemeldet wurden – der Fehlermodus, den man im Auge behalten muss, falls sich das 1M-Fenster als die tatsächliche Zahl erweist
• Inhaltsfilterung schneidet Ausgaben bei einigen Prompts ab
• Die Eindrücke zur Leistungsfähigkeit gehen auseinander: Einige Tester ordnen es über GLM-5.3 Flash ein, andere platzieren es unter DeepSeek V4.1 Flash.
Ein unveröffentlichter Preview-Build, der bei der Tool-Nutzung versagt, ist kein Skandal – dafür ist das Preview-Label da. Aber es bedeutet, dass die 44 nicht als Versprechen für agentische Zuverlässigkeit gelesen werden sollte, denn der Intelligence Index testet nicht das, worüber sich die frühen Tester am meisten beschweren.
Wie man es tatsächlich nennen würde – und was man in der Zwischenzeit verwenden sollte
OrcaRouter routet Step 5 Preview nicht. Es gibt keinen öffentlichen Endpunkt und keine Gewichte, also gibt es nichts zu routen, und keine Drittplattform kann derzeit ehrlich etwas anderes behaupten. Wer Ihnen heute sagt, wo Sie es aufrufen können, beschreibt einen Evaluierungsendpunkt, nicht ein Produkt.
Die Modelle, an denen es gemessen wird, sind eine andere Sache. Kimi K3, GLM-5.3 und DeepSeek V4.1 Flash sind alle über OrcaRouter verfügbar, zusammen mit 199 Modellen von 15 Anbietern hinter einem einzigen API-Schlüssel und einer einzigen Rechnung. Die Preisgestaltung wird zum Listenpreis des Anbieters mit 0 % Aufschlag durchgereicht, was bei einem Modell wie diesem mehr als sonst zählt: Wenn die 1,00 $/2,70 $ von Step 5 Preview beim Launch Bestand haben und sich dann ändern, bewegt sich eine Durchreichroute noch am selben Tag – statt nach dem Preisänderungsplan von jemand anderem.
Wenn es dann aufrufbar wird, ist die vernünftige Art, ein einem unveröffentlichten Modell nahestehendes Modell zu betreiben, die Art, wie man jedes Modell betreiben würde, dem man noch nicht vertraut – hinter einer Route mit automatischem Failover, sodass ein Tool-Aufruf-Fehler oder ein Long-Context-Fehler auf ein funktionierendes Modell ausweicht, anstatt Ihre Anwendung mit in den Abgrund zu reißen. Genau für dieses Muster sprechen sich die frühen Berichte hier speziell aus: Ein Preview-Build mit gemeldeten Problemen bei Tool-Aufrufen und Long-Context-Fehlern ist genau das Modell, hinter dem man ein Fallback haben möchte, nicht eines, das man allein auf einem Produktionspfad haben möchte.

Was würde daraus statt eines Leaks eine Veröffentlichung machen?
Drei Dinge, auf die man achten sollte, in der Reihenfolge, in der sie Klarheit bringen würden. Erstens: eine Modellseite und Preisgestaltung auf StepFuns eigener Entwicklerplattform — sobald step-5 in der Modellliste erscheint, ersetzt das Hersteller-Datenblatt jede Drittanbieter-Angabe in diesem Artikel, einschließlich des 600B/27B-Paares und der 1M-Kontext-Behauptung. Zweitens: die Auflösung des Widerspruchs zwischen 1M und 350k Kontext; eine 64k-Ausgabegrenze unter einem 1M-Fenster ist ein bedeutender Unterschied für jeden, der lange Dokumente oder agentische Pipelines baut, und sie ist derzeit ungeklärt. Drittens: ob die Preisgestaltung eine Einführungsposition oder eine dauerhafte Linie ist — Vorschau-Preise bei chinesischen Flaggschiffmodellen haben eine Geschichte, sich zu bewegen, sobald die Kapazität knapp wird, und 2,70 $ pro Million Ausgabe-Tokens ist aggressiv genug, um diese Frage aufzuwerfen.
Bis mindestens das Erste davon eintrifft, lautet die ehrliche Zusammenfassung, dass Step 5 Preview wie ein wirklich effizientes Modell aussieht – 600B insgesamt, die aggregierte Arbeit der 2,8T-Klasse leisten, zu einem Preis, der das Feld um ein Mehrfaches unterbietet – mit einer nicht verifizierten Spezifikation, einer echten Ausführlichkeitssteuer und einem Ruf beim Tool-Calling, der noch nicht verdient wurde. Es lohnt sich, damit zu planen. Es lohnt sich noch nicht, einen Produktionspfad darauf zu wetten.
In diesem Artikel verglichen4
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
