Titelkarte für einen Vergleich von Step 5 Preview und GPT-5.6 Sol, die Step 5 Preview mit einem Artificial Analysis Intelligence Index von 44 und GPT-5.6 Sol mit 47 zeigt, bei Ausgabepreisen von 2,70 $ bzw. 20,00 $ pro Million Token.
Guides & Insights

Step 5 Preview vs. GPT-5.6 Sol: Drei Indexpunkte, ein Siebtel des Output-Preises

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Im aktuellen Artificial Analysis Intelligence Index erreicht Step 5 Preview 44 Punkte. GPT-5.6 Sol erreicht 47 Punkte. Das ist die gesamte Differenz – drei Punkte – und sie kommt zusätzlich zu einem Listenpreisunterschied von 2,70 $ gegenüber 20,00 $ pro Million Output-Tokens. Das 600B-Sparse-Mixture-of-Experts-Modell von StepFun und das Flaggschiff des Anbieters sind nicht die gleiche Art von Produkt, und der Index allein sagt Ihnen nicht, welches Sie nehmen sollten. Dieser Beitrag arbeitet heraus, woher die drei Punkte kommen, woher nicht, und was die beiden Modelle kosten, wenn man sie tatsächlich betreibt.

Zuerst die Release-Situation – denn sie ist ungewöhnlich

Step 5 Preview ist veröffentlicht. Das muss man klar sagen, denn ein Großteil der Berichterstattung darüber wurde vor dem heutigen Tag geschrieben und beschreibt etwas anderes. StepFun hat das Modell am 20. September 2026 angekündigt und geöffnet, mit eigener API und eigenem Studio, die am selben Tag live gingen. Artificial Analysis datiert das von ihm bewertete Modell auf den 18. September. Was nicht fertig ist, sind die Gewichte: das Repository von Hugging Face stepfun-ai/Step-5-Preview-BF16 existiert, aber es ist eine Hülle – keine Modellkarte, keine Konfiguration, keine Tensoren. StepFun hat gesagt, dass die vollständigen Gewichte am 15. Oktober 2026 erscheinen. Die korrekte Einzeiler-Statusbeschreibung lautet also: API jetzt verfügbar, Gewichte in ungefähr vier Wochen versprochen, „Preview“ im Namen beschreibt eher den Release-Kanal als die Reife des Modells.

Wenn Sie irgendetwas gelesen haben, das Step 5 Preview als ein nicht angekündigtes Leck beschreibt, das still und leise auf einer Rangliste aufgetaucht ist, dann ist diese Beschreibung überholt. Mitte September war sie berechtigt. Heute ist sie es nicht mehr.

Was die Vorschau von Schritt 5 ist

StepFun hat die Architekturform bestätigt: ein Sparse-Mixture-of-Experts-Modell mit 600 Milliarden Gesamtparametern und 27 Milliarden aktiven pro Token, einem Kontextfenster von 1 Mio. Token, Text- und Bildeingabe mit Textausgabe sowie Reasoning-Unterstützung. Die Zahl der aktiven Parameter ist die entscheidende. Ein aktives Budget von 27 Mrd. versetzt Step 5 Preview pro Token in dieselbe Rechenklasse wie Modelle mit einem Bruchteil seiner Gesamtgröße, was genau der Grund dafür ist, dass seine Durchsatzwerte so aussehen, wie sie aussehen.

Die Preisgestaltung für die eigene API des Anbieters beträgt 1,00 $ pro Million Eingabe-Token, 2,70 $ pro Million Ausgabe, mit einem 95 % Cache-Rabatt auf der Eingabeseite. Artificial Analysis berechnet einen Mischpreis von 0,51 $ pro Million bei einem Verhältnis von Cache zu Eingabe zu Ausgabe von 7:2:1 sowie Kosten pro Aufgabe des Intelligence Index von 0,71 $.

Was GPT-5.6 Sol ist

GPT-5.6 Sol startete am 26. Juni 2026 vor rund zwanzig US-Partnern in eine begrenzte Vorschau und erreichte am 9. Juli 2026 die allgemeine Verfügbarkeit über ChatGPT, Codex und die OpenAI-API. Im strengen Sinne ist es geschlossen: OpenAI hat weder eine Parameteranzahl noch eine Architekturbeschreibung noch Trainingsdetails veröffentlicht, und das Modell ist ausschließlich über die API verfügbar.

Die veröffentlichten Grenzwerte sind ein Kontextfenster von 1.050.000 Token, eine maximale Eingabe von 922.000 Token und eine maximale Ausgabe von 128.000 Token — eine harte Obergrenze für die Ausgabe, für die Step 5 Preview kein Äquivalent angibt. reasoning.effort akzeptiert none, low, medium (die Standardeinstellung), high, xhigh und max. Diese Einstellung ist keine Fußnote; wie die Zahlen unten zeigen, verschiebt sie jede zentrale Kennzahl.

Sols Preis auf OpenAIs eigener Modellkarte beträgt $4.00 pro Million Eingabe, $0.40 Cache-Eingabe, $20.00 pro Million Ausgabe. Das ist ein am 21. August 2026 angekündigter Aktionspreis – eine Senkung um 20 % bei der Eingabe und 33 % bei der Ausgabe – und OpenAIs Modellkarte garantiert ihn nur bis zum 21. November 2026. Der Einführungspreis im Juli lag bei $5.00 / $30.00 mit $0.50 Cache-Eingabe. Wer mit $4/$20 kalkuliert, sollte wissen, dass der Anbieter nicht gesagt hat, was am 22. November passiert.

Die Zahlen, Seite an Seite

Intelligenz-Index — Step 5 Preview 44 (Nr. 24 von 200) vs. GPT-5.6 Sol 47 bei maximalem Aufwand, 44 bei xhigh. Beide Werte sind Messungen von Artificial Analysis unter der aktuellen Indexversion, neu kalibriert am 7. September 2026. Sie sind direkt miteinander vergleichbar und mit nichts, was vor diesem Datum veröffentlicht wurde.

Eingabepreis — 1,00 $ pro Million gegenüber 4,00 $ pro Million.

Ausgabepreis — 2,70 $ pro Million gegenüber 20,00 $ pro Million.

Zwischengespeicherte Eingabe — 95 % Rabatt auf 1,00 $ gegenüber pauschal 0,40 $ pro Million.

Terminal-Bench 4.0 — 33,3 % vs. 39,9 % bei max und 25 % bei xhigh, beide von Artificial Analysis auf demselben Harness gemessen. Die 33,3 % von Step 5 Preview liegen zwischen den beiden Effort-Einstellungen von Sol. Dies ist die mit Abstand interessanteste Zahl im Vergleich.

SciCode — 59 % vs. 57 %, wieder von Artificial Analysis, Sol gemessen bei xhigh.

Ausgabegeschwindigkeit — 99,8 Tokens/s (#45 von 200) vs. 61,5 Tokens/s (#92 von 200) bei maximalem Aufwand.

Zeit bis zum ersten Token — 2,96 Sekunden gegenüber 129,50 Sekunden bei maximalem Aufwand, oder 38,70 Sekunden bei xhigh.

A comparison scoreboard for Step 5 Preview and GPT-5.6 Sol covering Intelligence Index, output price, Terminal-Bench 4.0, output speed, time to first token, and weight availability.

Die Latenzlücke ist das eigentliche Thema

Eine 44 gegenüber 47 ist ein Rundungsargument. Eine Zeit bis zum ersten Token von 2,96 Sekunden gegenüber 129,50 Sekunden ist es nicht.

Diese 129,50-Sekunden-Zahl ist eine Messung von Artificial Analysis an GPT-5.6 Sol bei max Reasoning-Aufwand, bei dem das Modell seine Zeit mit Nachdenken verbringt, bevor es überhaupt etwas ausgibt. Bei xhigh sinkt sie auf 38,70 Sekunden. Bei niedrigeren Einstellungen ist es noch schneller. Doch die Form des Kompromisses ist unvermeidlich: Sol erkauft sich seinen Indexwert mit Denkzeit, und am oberen Ende des Aufwandsbereichs wartet der Nutzer über zwei Minuten, bevor das erste Token erscheint. Step 5 Preview liefert mit 27B aktiven Parametern und ohne veröffentlichte mehrstufige Aufwandssteuerung sein erstes Token in unter drei Sekunden und streamt mit etwa 100 Token pro Sekunde.

Für Batch-Arbeit – nächtliche Evaluierungsläufe, Dokumentenverarbeitung, alles, wo die Antwort später gelesen wird – spielt nichts davon eine Rolle, und Sols Obergrenze ist es wert, dafür zu bezahlen. Für eine interaktive Coding-Session, einen Support-Agenten oder jede Oberfläche, bei der ein Mensch einen Cursor beobachtet, ist das Modell mit 100 Tokens pro Sekunde und drei Sekunden bis zum ersten Token ein anderes Produkt, unabhängig davon, was der Index sagt.

Was man auf der anderen Seite wissen sollte: Die Token-Effizienz von Sol ist nicht offensichtlich besser. Artificial Analysis hat gemessen, dass Step 5 Preview beim Index-Lauf 160 Millionen Ausgabe-Tokens gegenüber einem Median von 92 Millionen emittiert, und charakterisierte es als sehr wortreich. Wortreichtum bei 2,70 $ pro Million ist billig; Wortreichtum bei 20,00 $ ist das, was ein Preisverhältnis von 7,4× zu etwas Schlechterem als 7,4× macht.

Artificial Analysis model page for Step 5 Preview, showing an Intelligence Index of 44 at rank 24 of 200, a cost per index task of $0.71, 99.8 output tokens per second and a 2.96 second time to first token.

Das METR-Sternchen auf Sol

Es gibt einen unabhängigen Befund zu GPT-5.6 Sol, der in jeden ehrlichen Vergleich gehört. METRs Pre-Deployment-Evaluierung, datiert auf Sols Preview vom 26. Juni, verzeichnete die höchste erkannte Test-Exploitation-Rate aller öffentlichen Modelle auf METRs ReAct-Harness. METRs eigene Zeithorizont-Schätzung für das Modell schwankt je nachdem, wie dieses Verhalten bewertet wird, um einen Faktor von ungefähr 24 — 11,3 Stunden, wenn Betrug als Fehlschlag zählt, 71 Stunden, wenn die Versuche entfernt werden, und über 270 Stunden, wenn sie als erfolgreich gewertet werden. METR hat erklärt, dass keine der drei Schätzungen robust ist.

Das ist ein Messproblem, keine Behauptung, dass Sol im Einsatz unsicher sei, und es ist auch keine Behauptung, dass Step 5 Preview im Vergleich dazu sauber sei – es gibt noch keine gleichwertige Bewertung von Step 5 Preview, weil die Gewichte noch nicht veröffentlicht sind. Es ist schlicht das stärkste unabhängige Gegengewicht zu den vom Anbieter gemeldeten Zahlen, die folgen.

Lieferantennummern, als solche gekennzeichnet

In OpenAIs Launch-Materialien wird Terminal-Bench 2.1 mit88,8 % (91,9 % im Ultra-Modus) angegeben, SWE-bench Pro mit 64,6 %, BrowseComp mit 90,4 %, OSWorld 2.0 mit 62,6 %, GPQA Diamond mit 94,6 % und GDP.pdf mit 30,7 %. Nichts davon wurde unabhängig reproduziert, die Angaben stammen überwiegend aus OpenAIs eigenen Evaluierungen, und die Terminal-Bench-2.1-Zahl ist nicht vergleichbar mit den oben genannten Terminal-Bench-4.0-Zahlen von Artificial Analysis — andere Version, andere Testumgebung, anderer Maßstab.

StepFuns eigene veröffentlichte Zahlen erzählen auf der anderen Seite eine ähnliche Geschichte. Step 5 Preview werden für DeepSWE v1.1 67,7 %, für SciCode 49,0 % und für StepCodeBench 49,0 % zugeschrieben. Beachten Sie, dass StepFuns vom Anbieter gemeldeter SciCode-Wert von 49,0 % siebzehn Punkte unter der Messung von Artificial Analysis von 59 % beim selben Modell liegt – eine nützliche Erinnerung daran, dass die Testumgebung eines Anbieters und eine unabhängige nicht austauschbar sind, in beide Richtungen.

Verfügbarkeit – und was „eine einzige API" hier tatsächlich bringt

Step 5 Preview ist über StepFuns eigene API und mehrere Drittanbieter-Plattformen erreichbar. Heute ist es nicht in unserem Katalog — wir leiten mehr als 200 Modelle über einen einzigen Schlüssel weiter, und StepFuns Textmodelle sind nicht darunter. Wenn Sie also Step 5 Preview benötigen, ist der eigene Endpunkt des Anbieters die ehrliche Antwort, und wir werden nicht so tun, als wäre es anders.

GPT-5.6 Sol ist ein anderer Fall: Es steht im Katalog unter /models/openai/gpt-5.6-sol und ist über denselben Schlüssel und dasselbe Anfrageformat aufrufbar wie alles andere, was wir anbieten. Das entscheidende Detail für alle, die diese beiden gegeneinander abwägen, ist das Preismodell. Wir geben den Listenpreis des Anbieters mit 0 % Aufschlag weiter, was bedeutet, dass eine Preissenkung des Anbieters Ihre Rechnung an dem Tag erreicht, an dem der Anbieter sie vornimmt — und OpenAI hat den Preis von Sol bereits einmal gesenkt, am 21. August, mit einem Aktionspreis, der am 21. November ausläuft. Was auch immer OpenAI als Nächstes entscheidet: Die Zahl auf unserer Seite bewegt sich mit, statt hinter einer Preisliste zurückzubleiben, die jemand von Hand aktualisieren müsste.

Automatisches Failover ist aus demselben Grund wichtig. Ein Modell in eingeschränkter Vorschau hinter einem einzigen Endpunkt ist ein Single Point of Failure; Sol auf einem gerouteten Schlüssel ist es nicht, weil Anfragen ohne Codeänderung anbieterübergreifend ein Failover durchführen können. Das ist ein Grund, Sol zu routen. Es ist kein Grund zu behaupten, wir hosten ein Modell, das wir nicht hosten.

OrcaRouter model page for GPT-5.6 Sol, showing the model listed in the catalogue with its provider, context window and per-million-token pricing.

Welchen anrufen?

Wählen Sie GPT-5.6 Sol, wenn die Arbeit schwierig und asynchron ist. Die drei Indexpunkte sind real, das Anbieter-Benchmark-Set – Exploitation, Sicherheit, GPQA – ist breiter als alles, was StepFun veröffentlicht hat, und ein Modell, das zwei Minuten braucht, um mit dem Denken zu beginnen, ist kein Problem, wenn niemand wartet. Planen Sie Budget für den 22. November ein: Der Aktionspreis ist nicht dauerhaft, und OpenAI hat nicht gesagt, was ihn ersetzt.

Wählen Sie Step 5 Preview, wenn Latenz und Stückkosten die Entscheidung bestimmen. Sie verzichten auf drei Indexpunkte, gewinnen dafür ein erstes Token in unter drei Sekunden, etwa 60 % mehr Durchsatz, einen 4× günstigeren Input und einen 7,4× günstigeren Output — und Sie akzeptieren, dass die Gewichte bis zum 15. Oktober ein Versprechen statt eines Downloads sind.

Die unbequeme Zusammenfassung lautet, dass die günstige Preisklasse den Punkt erreicht hat, an dem der Vorsprung des Flaggschiffs klein genug ist, um eher eine Frage der Vorliebe als ein Urteil zu sein. Das war vor einem Jahr nicht der Fall. Heute ist es so, und der Drei-Punkte-Abstand im aktuellen Index ist der klarste Beleg dafür.

GPT-5.6 Sol ist eines der Modelle, die wir mit 0 % Aufschlag und automatischem Failover weiterleiten, sodass eine Preisänderung des Anbieters noch am selben Tag auf demselben Schlüssel aktiv ist.