
Schritt 5 Vorschau ist angekündigt: Was StepFuns 600B-Flaggschiff tatsächlich liefert und was noch fehlt
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
StepFun kündigte Step 5 Preview am 20. September 2026 an — ein Flaggschiff auf Basis eines sparse Mixture-of-Experts mit 600 Milliarden Parametern, von denen pro Token 27 Mrd. aktiv sind, einem Kontextfenster von 1 Mio. Token, nativer Bildeingabe und einem Score von 44 im Artificial Analysis Intelligence Index. Die API ging am selben Tag an den Start. Was nicht geöffnet wurde, ist das Modell selbst: Das Hugging-Face-Repository stepfun-ai/Step-5-Preview-BF16 existierte am Nachmittag der Ankündigung und enthält genau eine Datei, .gitattributes, ohne Gewichte, ohne Lizenz, ohne Model Card und ohne Konfiguration. StepFuns eigene Unterlagen datieren die Open-Weights-Veröffentlichung auf den 15. Oktober 2026. Die ehrliche Ein-Satz-Zusammenfassung dieses Launches lautet also, dass das Modell heute aufrufbar und in etwa dreieinhalb Wochen herunterladbar ist — und das sind zwei verschiedene Dinge. Es ist zudem dasselbe Modell, das dieser Blog heute früher als unangekündigtes Leck behandelt hat, benchmarkiert unter einem Test-Tag, bevor StepFun eine Produktseite veröffentlicht hatte — eine nützliche Erinnerung daran, dass eine Preview vom Leck zum Launch werden kann, ohne dass sich auch nur eine einzige Zahl ändert.
Das Repo ist ein Platzhalter, und das ist die Geschichte.
Wenn ein Anbieter Gewichte veröffentlicht, ist das Repository der Beweis. Es enthält eine Lizenzdatei, eine Konfiguration mit einer Parameteranzahl darin, eine README mit dem vorgesehenen Verwendungszweck und der Evaluierungstabelle sowie Safetensors-Shards, deren Gesamtgröße verrät, ob die Parameterangabe echt ist. stepfun-ai/Step-5-Preview-BF16 hat nichts davon. Der Hugging-Face-API-Eintrag dafür zeigt einen Erstellungszeitstempel von 2026-09-20T03:52Z, null Downloads, zwei Likes, ein leeres Konfigurationsobjekt, kein pipeline_tag, keine Lizenz und eine einzige gleichgeordnete Datei. Die StepFun-Organisationsseite führt es auf und führt kein anderes Step-5-Repository auf — kein FP8-Build, kein NVFP4-Build, kein GGUF, keine der Quantisierungsvarianten, die Step-3.7-Flash im Juni begleiteten.
Lies das als Zeitplanung, nicht als Rätsel. Das BF16-Suffix im Repo-Namen ist der entscheidende Hinweis: ein Labor, das beabsichtigt, zuerst einen bfloat16-Checkpoint zu veröffentlichen — das Format, aus dem man feinjustiert und quantisiert, bevor die FP8- und NVFP4-Serving-Builds eintreffen — benennt das Repository bei der Erstellung so und füllt es später. StepFun hat in seinen eigenen Ankündigungsmaterialien den 15. Oktober genannt. Bis dahin ist das Repository eine Behauptung über eine Absicht, und das Einzige, was es beweist, ist, dass StepFun den Namespace reserviert hat.
Das ist aus einem praktischen Grund wichtig. Das Preview-Suffix und die fehlenden Gewichte sind dasselbe Signal, das in dieselbe Richtung zeigt: Das Modell ist aufrufbar, die Preisgestaltung steht fest, und das Artefakt, das Sie auf Ihrer eigenen Hardware ausführen würden, existiert noch nicht. Jeder Plan, der von einem selbst gehosteten Step 5 Preview vor Mitte Oktober ausgeht, ist ein Plan, hinter dem kein Artefakt steht.
Was tatsächlich angekündigt wurde
StepFuns Positionierung ist eng und spezifisch: Step 5 Preview ist ein Basismodell für agentische Arbeit in der realen Welt – KI-Coding, Softwareentwicklung, professionelle Wissensarbeit und Finanzwesen – mit Schwerpunkt auf langem Kontext, Multi-Turn-Tool-Aufrufen und anhaltender Ausführung statt auf Chat-Qualität. Das Unternehmen übersprang die Step-4.x-Reihe vollständig und ging von Step-3.7-Flash direkt zu Step 5, was selbst eine Aussage darüber ist, für wie groß es diesen Schritt hält.
Ein Datierungsdetail lohnt einen Hinweis, denn es ist genau die Art von Sache, die einen Beschaffungskalender ins Stolpern bringt: Artificial Analysis datiert dieses Modell auf den 18. September 2026, zwei Tage vor StepFuns eigener Ankündigung. Das Board bewertet ein Modell, sobald es darauf zugreifen kann, und diese zwei Tage sind die übliche Verzögerung zwischen der Aufrufbarkeit eines Modells und dem Zeitpunkt, an dem ein Anbieter darüber schreibt. StepFuns Ankündigung – der 20. September, wobei API und Studio am selben Tag öffnen – ist das Datum, das zitiert werden sollte, und der 15. Oktober als Datum der Gewichte stammt aus denselben Unterlagen.
Die Spezifikation wie veröffentlicht:
• Gesamtparameter — 600B, dünnbesetztes Mixture-of-Experts
• Aktiv pro Token — 27B, etwa 4,5 % des Gesamtwerts, ein ungewöhnlich geringes Verhältnis
• Kontextfenster — 1 Mio. Token
• Eingabe — Text und Bilder nativ; Ausgabe nur Text
• Schlussfolgern — ja, mit erweitertem Denken
• Preis — 1,00 $ pro Million Input-Tokens, 2,70 $ pro Million Output-Tokens, mit 95 % Cache-Rabatt
• Verfügbarkeit — API und Studio ab 20. September geöffnet; Gewichte für den 15. Oktober geplant
Die Effizienzbehauptung, mit der StepFun vorangeht, ist, dass die 600B/27B-Aufteilung das Modell an die Pareto-Grenze bringt – Leistungsfähigkeit pro Recheneinheit –, und das Unternehmen rahmt es als drei Generationen desselben Strebens, von Step-3.5-Flash über Step-3.7-Flash bis zu diesem. Es ist eine kohärente Geschichte, und das Sparse-Verhältnis ist der Mechanismus: Bei 27B aktiven Parametern liegt der Serving-Kostenanteil pro Token im Bereich eines viel kleineren Modells, während die 600B Gesamtsumme hauptsächlich eine Frage des Speicherbedarfs ist.
Herstellerangaben und die danebenstehenden Zahlen von Drittanbietern
In den Launch-Materialien kommen zwei Klassen von Zahlen vor, und sie sollten nicht auf dieselbe Weise gelesen werden. Die erste Klasse sind StepFuns eigene Evaluierungen: eine Kostenbehauptung für eine einzelne Aufgabe in Höhe eines Achtels der Kosten von Claude Opus 5; zweiter Platz hinter entweder GPT-6 Astra oder Claude Opus 5 bei ALE-CLI, FrontierFinance und DRACO; ein 24-stündiger GPU-Kernel-Optimierungslauf, der die Spitzenleistung des MLA-Kernels auf 508 TFLOPS hob – gegenüber 493 bei Claude Opus 5; ein automatisiertes Post-Training-Experiment, das Qwen3-30B-A3B bei AIME24 von 53,3 % auf 60 % steigerte; DeepSWE v1.1 bei 67,7 % und das hauseigene StepCodeBench bei 49,0 %. StepFun hat StepCodeBench selbst entwickelt – 553 Code-Repositories, neun Aufgabentypen, 33 Programmiersprachen –, was es zu einem sinnvollen Instrument für die Messung des eigenen Modells macht und nicht zu einem unabhängigen.
Die zweite Kategorie wird von jemand anderem gemessen, und sie ist der Teil, gegen den man planen muss. Artificial Analysis bewertet Step 5 Preview mit 44 auf dem Intelligence Index v4.3.2 und platziert es damit auf Rang 24 von 200 Modellen – gleichauf mit Kimi K3, einen Punkt hinter GLM-5.3 und gleichauf mit der mittleren Reasoning-Effort-Einstellung von Claude Opus 5. Auf Terminal-Bench 4.0 verzeichnet dieselbe Tabelle 33,3 %, vor DeepSeek V4.1 Flash mit 26,8 % und deutlich vor Kimi K3 mit ungefähr 12,6 %. Die Ausgabegeschwindigkeit liegt bei 99,8 Tokens pro Sekunde und die Zeit bis zum ersten Token bei 2,96 Sekunden – beides aus demselben unabhängigen Durchlauf und beides die Art von Wert, die darüber entscheidet, ob sich ein Agent-Loop interaktiv anfühlt.
Eine Drittanbieter-Kennzahl wirkt in die Gegenrichtung und verdient es, direkt neben dem Preis zu stehen. Derselbe Index-Durchlauf verbrauchte 160 Mio. Ausgabe-Tokens für Step 5 Preview, verglichen mit einem Median von 92 Mio. über die bewerteten Modelle hinweg – das Modell ist ausführlich. Bei 2,70 $ pro Million Ausgabe-Tokens ist diese Ausführlichkeit nicht kostenlos: 160 Mio. Ausgabe-Tokens entsprechen ungefähr 432 $ von den 922,84 $, die der Durchlauf insgesamt gekostet hat, und bei einem Modell, das dreimal so viel berechnet, wäre es der dominierende Posten auf der Rechnung. Ein niedriger Nennpreis und eine hohe Token-Anzahl pro Aufgabe sind zwei Hälften einer Zahl, und die Kosten pro Index-Aufgabe – 0,71 $ – sind genau die Zahl, die bereits beides enthält.

Womit der Leak recht hatte, und die eine Sache, die er nicht klärte
Die frühere Berichterstattung dieses Blogs stammte aus einem Evaluierungslauf, der vor jeglicher Ankündigung aufgetaucht war, und sie kennzeichnete die Behauptungen, die sie nicht bestätigen konnte. Die Ankündigung löste die meisten davon auf. Das Paar 600B/27B ist jetzt vom Anbieter angegeben statt nur abgeleitet. Das Kontextfenster von 1M Token steht jetzt in StepFuns eigener Spezifikation statt nur auf einem Drittanbieter-Board. Der Preis von 1,00 $ und 2,70 $ ist der Preis. Der Name ist Step 5 Preview, nicht eine gerüchteweise genannte Alternative.
Was die Ankündigung nicht getan hat, ist, den Widerspruch beim Kontextfenster aufzulösen, den die Leak-Berichterstattung aufgeworfen hat. Eine separate Drittanbieter-Konfiguration, die in Entwickler-Tooling kursierte, listete das Modell mit 350.000 Token Kontext und einer maximalen Ausgabe von 64.000 Token. Ein 1M-Fenster und ein 350k-Fenster sind unterschiedliche Produkte mit unterschiedlichen Speicherkosten, und eine 64k-Ausgabeobergrenze ist eine harte Einschränkung genau für die langfristige agentische Arbeit, für die dieses Modell verkauft wird. StepFuns Ankündigung sagt 1M und erwähnt keine Ausgabengrenze. Es lohnt sich zu wissen, auf welcher Variante Ihr Routing landet, bevor Sie eine Pipeline bauen, die von der Antwort abhängt, und das ist eine Frage für die Dokumentation des Anbieters statt für ein Leaderboard.
Das andere, was der Launch nicht geändert hat, ist die unabhängige Reproduktion. Jede Benchmark-Zeile oben, die nicht von Artificial Analysis stammt, ist StepFuns eigene, ausgeführt auf StepFuns eigenen Test-Harnessen, und kein Dritter hat die agentischen Ergebnisse reproduziert. Das Muster bei den Flaggschiffen der chinesischen Labore in diesem Jahr ist, dass der aggregierte Index stabil bleibt und die prominenten Zeilen des Anbieters driften; behandeln Sie das Aggregat als die Planungsgröße.
Was Sie heute anrufen können und was Sie in der Zwischenzeit weiterleiten können
Step 5 Preview ist nicht in unserem Katalog, und OrcaRouter routet es nicht — es gibt eine öffentliche API und ein Studio auf der Seite von StepFun, und dort läuft es. Was wir haben, ist die Gruppe von Modellen, gegen die es gemessen wird, hinter einem Schlüssel: DeepSeek V4.1 Flash zu 0,15 $ Eingang und 0,60 $ Ausgang pro Million, GLM-5.3 zu 1,26 $ und 3,96 $ gegenüber den 1,40 $ und 4,40 $, die Z.ai listet, Claude Opus 5 zu 5,00 $ und 25,00 $, und Kimi K3 daneben. Das ist die praktische Form der nächsten drei Wochen: eine Vorschau, gegen die Sie benchmarken können, und eine Reihe von Produktionsmodellen, auf die Sie sich tatsächlich verlassen können, erreichbar über eine API für mehr als 200 Modelle, wobei der Listenpreis des Anbieters mit 0 % Aufschlag durchgereicht wird — wenn sich also die Preisgestaltung von StepFun vor Oktober ändert, ändert sich die Zahl, die Sie zahlen würden, am selben Tag mit, nicht bei der Verlängerung.
Automatisches Failover ist in diesem Zeitfenster mehr wert als sonst, denn der Ausfallmodus einer Preview ist nicht, dass sie schlecht ist – sondern dass sie kapazitätsbeschränkt ist. Ein Modell, das seine API am Ankündigungstag geöffnet hat und noch keine Gewichte besitzt, ist ein Modell, dessen Serving-Flotte noch aufgebaut wird, und ein Preview-Endpunkt, der um 2 Uhr nachts an Leistung verliert, nimmt Ihren Agent-Loop mit. Setzen Sie die Preview hinter einen Router mit einem bewährten Modell als Fallback, und Sie erhalten ein Qualitätssignal für Ihre eigene Workload, ohne einen Produktionspfad auf eine unerprobte Flotte zu setzen.

Das Datum, das zählt, ist der 15. Oktober
Alles oben Genannte ist in einer ganz bestimmten Hinsicht vorläufig: Die Gewichte sind das, was ein Modell dauerhaft macht. Eine geschlossene Vorschau zu 1,00 $ und 2,70 $ ist ein guter Preis von einem einzelnen Anbieter, und ein BF16-Checkpoint unter einer veröffentlichten Lizenz ist ein Preis, den kein einzelner Anbieter mehr kontrolliert. StepFun hat sich für den 15. Oktober auf Letzteres festgelegt, und der Repository-Name, den es bereits reserviert hat, nennt bfloat16 zuerst.
Was man in der Zwischenzeit beobachten muss, ist eng umgrenzt und überprüfbar. Füllt sich das Repository – und unter welcher Lizenz? Bestätigt eine Konfigurationsdatei 600B insgesamt und 27B aktiv? Veröffentlicht StepFun die Ausgabengrenze zusammen mit dem Kontextfenster und klärt damit die 350k/64k-Frage? Hält der Preis, sobald die Preview ihr Suffix verliert? Diese vier Antworten entscheiden, ob Step 5 Preview ein Modell wird, das man selbst hostet, ein Modell, das man mietet, oder ein Modell, das man einmal benchmarkt und dann hinter sich lässt. Solange das Repository nicht mehr als eine .gitattributes enthält, ist die Ankündigung der Anfang der Geschichte und nicht ihr Ende.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
