Generierte Titelkarte mit dem Titel „Step 5 Preview vs. DeepSeek V4 Pro – was Sie herunterladen können“ mit zwei Spalten: Step 5 Preview bei AA Index 44, 600B gesamt / 27B aktiv, Gewichte für den 15. Oktober zugesagt und ein Repository, das eine .gitattributes-Datei enthält; DeepSeek V4 Pro bei AA Index 36, 1,6T gesamt / 49B aktiv, Gewichte unter MIT und jetzt herunterladbar sowie ein vollständiger Checkpoint auf Hugging Face. Eine Fußzeile besagt: „Beide Indexwerte gemäß Artificial Analysis Intelligence Index v4.3.2 bei maximalem Reasoning-Aufwand.“
Guides & Insights

Step 5 Preview vs. DeepSeek V4 Pro: Das eine ist ein Versprechen, das andere ist eine MIT-Lizenz

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

In diesem Vergleich dreht sich alles um eine Frage, die nichts mit Benchmarks zu tun hat: Was kann man tatsächlich herunterladen? DeepSeek V4 Pro — die Version, die der Anbieter am 13. August 2026 als DeepSeek-V4-Pro-0813 veröffentlicht hat — ist ein Mixture-of-Experts-Modell mit 1,6 Billionen Parametern unter MIT-Lizenz, dessen Gewichte derzeit auf Hugging Face liegen. Step 5 Preview, das StepFun am 20. September 2026 angekündigt hat, ist ein spärliches MoE mit 600 Milliarden Parametern, das auf derselben unabhängigen Rangliste acht Punkte mehr erzielt und ein Hugging-Face-Repository besitzt, das genau eine Datei enthält, .gitattributes. StepFun zufolge erscheint der BF16-Checkpoint am 15. Oktober. Die ehrliche Form dieses Vergleichs ist also nicht „welches Modell besser ist", sondern „auf welchem der beiden kann man in diesem Quartal aufbauen, und auf welches wartet man".

Diese Darstellung ist weniger spannend als ein Benchmark-Shootout und deutlich nützlicher, denn die Acht-Punkte-Differenz und die fünfundzwanzigtägige Wartezeit sind nicht dieselbe Art von Tatsache. Eines von beiden kann man heute schon in die Planung einbeziehen.

Acht Punkte und die vier, die zählen

Artificial Analysis lässt beide Modelle durch den Intelligence Index v4.3.2 laufen — zehn Evaluierungen —, der den einzigen Ort darstellt, an dem diese beiden aus derselben Hand gemessen wurden.

• Intelligenz-Index — Step 5 Preview 44 vs. DeepSeek V4 Pro 36

• Rang auf dieser Rangliste — Step 5 Preview 24. von 200 vs. DeepSeek V4 Pro 7. von 113 in seiner Klasse

• Terminal-Bench 4.0 — Step 5 Preview 33,3 %; DeepSeek V4 Pro ist nicht auf derselben Bestenliste aufgeführt, daher gibt es keine eins zu eins vergleichbare agentische Zeile zum Zitieren

Ausgabegeschwindigkeit — Step 5 Preview 99,8 Tokens/Sek. vs. DeepSeek V4 Pro 88,8 Tokens/Sek.

• Zeit bis zum ersten Token — Step 5 Preview 2,96 s vs. DeepSeek V4 Pro 1,69 s

• Preis pro 1 Mio. Tokens — Step 5 Preview 1,00 $ Eingabe / 2,70 $ Ausgabe vs. DeepSeek V4 Pro 1,32 $ Eingabe / 3,96 $ Ausgabe zum Spitzenpreis von DeepSeek, außerhalb der Spitzenzeiten halbiert auf 0,66 $ / 1,98 $

• Cache-Rabatt — Step 5 Preview 95 % vs. DeepSeek V4 Pro 97 %

• Kontext — beide 1 Mio. Tokens; DeepSeek veröffentlicht eine Ausgabe-Obergrenze von 384.000 Tokens, StepFun hat keine veröffentlicht

• Gewichte — Step 5 Preview geschlossen, BF16-Checkpoint für den 15. Oktober geplant; DeepSeek V4 Pro MIT, jetzt herunterladbar

Zwei Zeilen laufen der Schlagzeile zuwider. DeepSeek V4 Pro antwortet sein erstes Token in 1,69 Sekunden gegenüber 2,96 bei Step 5 Preview – ein Vorsprung von 43 % bei jedem Aufruf, der sich in einer langen Agent-Schleife zu realer Wall-Clock-Zeit aufsummiert. Und sein Cache-Rabatt ist zwei Punkte besser, was genau für die Arbeitslast am wichtigsten ist, für die beide Modelle verkauft werden: Ein Agent, der bei jedem Turn denselben System-Prompt und Repository-Kontext erneut sendet, lebt fast vollständig innerhalb dieses Rabatts.

Die aggregierte Lücke von acht Punkten ist real, und sie ist auch schmaler, als acht Punkte vermuten lassen. Ein Index ist eine Zusammensetzung aus zehn Bewertungen, und die Zusammensetzung ist der Punkt, an dem sich die beiden Modelle unterscheiden. Die 33,3 % von Step 5 Preview auf Terminal-Bench 4.0 sind ein echtes agentisches Ergebnis; die eigene Hauptstärke von DeepSeek V4 Pro ist Langhorizont-Reasoning zu einem Preis, den nichts anderes in der Open-Weights-Kategorie erreicht. Keine der beiden Ranglisten veröffentlicht eine Zeile, in der die beiden direkt gegenübergestellt werden, was der ehrliche Grund dafür ist, dass dieser Vergleich nicht durch eine einzige Zahl entschieden werden kann.

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second, cost per Intelligence Index task $0.71, verbosity 160M output tokens, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

Was „offen“ dir bringt, wenn der Anbieter seine Meinung ändert

Hier ist der Teil dieses Matchups, den ein Datenblatt nicht wiedergeben kann, und es lohnt sich, ihn mit den tatsächlichen Daten zu nennen, denn es geschah elf Tage vor der Ankündigung von Step 5 Preview.

DeepSeek teilte den Nutzern mit, dass V4 Pro eingestellt werde. Am 9. September erklärte das Unternehmen, Anfragen würden an das neuere DeepSeek V4.1 Flash weitergeleitet; am 10. September legte es das Datum auf den 14. September, 12:00 Uhr Pekinger Zeit, fest. Am 11. September machte es das rückgängig – der V4 Pro API-Dienst läuft über den 14. September hinaus weiter, die Abrechnung bleibt unverändert, um es mit DeepSeeks eigenen Worten zu sagen. Der Modell-String, der Kontext von 1 Mio. Token und die Obergrenze von 500 gleichzeitigen Anfragen sind alle noch unverändert, und DeepSeeks Seite „Models & Pricing" führt die Rücknahme als Fußnote in der deepseek-v4-pro Zeile.

Lies das als Demonstration dessen, wovor offene Gewichte dich tatsächlich schützen, und dessen, wovor sie dich nicht schützen. Die API wurde beinahe durch eine Planungsentscheidung weggenommen. Die Gewichte konnten nicht weggenommen werden. Ein MIT-lizenzierter Checkpoint auf deiner eigenen Hardware hat keinen Anbieter, der seine Stilllegung ankündigen kann, und das ist eine andere Art von Garantie als ein Preisversprechen – es ist überhaupt kein Versprechen.

Das ist genau die Lücke, in der Step 5 Preview sitzt. StepFun hat den 15. Oktober für den BF16-Checkpoint zugesagt, und der Repository-Name, den es bereits reserviert hat – stepfun-ai/Step-5-Preview-BF16 – ist das Format, aus dem du fine-tunest und quantisierst, bei der Erstellung benannt und später befüllt. Das ist ein Planungssignal, kein Artefakt. Solange das Repository nichts anderes als eine .gitattributes enthält, ist Step 5 Preview ein Modell, das du mietest, zu den Bedingungen eines einzigen Anbieters, ohne Lizenz zum Lesen und ohne Ausweichmöglichkeit, falls sich die Bedingungen ändern.

Die zwei Wege, die billige Option zu sein

Beide dieser Modelle unterbieten die geschlossene Frontier deutlich, und die Mechanismen sind nicht dieselben, was dafür relevant ist, wie nachhaltig der Preis ist.

DeepSeek V4 Pro ist günstig, weil ein Labor die Gewichte veröffentlicht hat und ein wettbewerbsintensiver Serving-Markt die Marge herausgetrieben hat. Das ist eine strukturelle Untergrenze: Jeder kann den Checkpoint serven, also wird der Preis durch die Kosten einer GPU-Stunde festgelegt und nicht durch die Preisstrategie eines Unternehmens. DeepSeeks eigene API bepreist es in zwei Fenstern – 1,32 $ und 3,96 $ während der Spitzenzeiten, außerhalb davon die Hälfte –, und die Spitzenzeit ist schmal, ein paar Stunden an Wochentagen vormittags in UTC, sodass der meiste Traffic auf den günstigeren Satz fällt und Wochenenden nie den höheren sehen.

Step 5 Preview ist günstig, weil StepFun sich entschieden hat, es so zu bepreisen. Es gibt einen Endpunkt, eine Preisliste und keine zweite Quelle. Das ist keine Anschuldigung – ein 600B/27B-Sparse-Modell kostet für die Bereitstellung wirklich weniger, als seine Parameterzahl vermuten lässt, und das Verhältnis der aktivierten Parameter ist der Grund dafür. Es ist einfach eine andere Art von Preis, und der Unterschied zeigt sich an dem Tag, an dem StepFun entscheidet, dass die Preview ihren Zweck erfüllt hat.

Der Preisunterschied zwischen den beiden ist klein genug, dass er nichts entscheiden sollte: 1,00 $ und 2,70 $ gegenüber 1,32 $ und 3,96 $ sind ein Unterschied von 24 % beim Input und 32 % beim Output – deutlich innerhalb der Spanne, die ein Cache-Rabatt, ein Unterschied bei der Output-Länge oder eine Retry-Rate zunichtemachen kann. In der Frage der Ausführlichkeit liegen die beiden nah beieinander – Step 5 Preview erzeugte im Index-Durchlauf 160 Mio. Output-Tokens gegenüber einem Median von 92 Mio., und der eigene Durchlauf von DeepSeek V4 Pro liegt im selben Bereich. Keines von beiden ist ein sparsames Modell, und beide werden damit verkauft, pro Token günstig zu sein statt pro Aufgabe.

Generated two-column comparison scoreboard titled 'Step 5 Preview vs DeepSeek V4 Pro — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, parameters 600B total / 27B active, price $1.00 / $2.70, cache discount 95%, TTFT 2.96s, and weights due October 15. The right column gives DeepSeek V4 Pro the rows AA Index 36, parameters 1.6T total / 49B active, price $1.32 / $3.96, cache discount 97%, TTFT 1.69s, and weights MIT-licensed and downloadable now. A footer reads 'Both per Artificial Analysis Intelligence Index v4.3.2 at maximum reasoning effort.'

Wo jede einzelne in einem echten Stack hingehört

Wenn Sie ein Modell brauchen, das Sie feinabstimmen, quantisieren, in Ihrer eigenen VPC hosten oder einer Rechtsabteilung mit einer Lizenzdatei, die sie lesen kann, übergeben können, ist das keine knappe Entscheidung, und es geht dabei nicht um Benchmarks. DeepSeek V4 Pro ist heute unter MIT verfügbar. Step 5 Preview hat keine Lizenz, keine Konfiguration und keine Parameterdatei, und der früheste Zeitpunkt, mit dem Sie planen können, ist Mitte Oktober. Die Acht-Punkte-Lücke im Index ändert nichts an dieser Rechnung, denn ein Modell, das Sie nicht herunterladen können, lässt sich nicht bereitstellen.

Wenn Sie das stärkste agentische Ergebnis wollen, das es für einen Dollar pro Million Input-Tokens gibt, liegt Step 5 Preview auf dem einzigen Board, das beide gemessen hat, vorn, und es ist die bessere Standardwahl für die Trial-and-Error-Arbeit, die den größten Teil einer Agentenschleife ausmacht – Extraktion, Klassifizierung, Test-Gerüste, die Routineaufrufe zwischen den beiden, auf die es ankommt. Seine 99,8 Tokens pro Sekunde beenden die Ausgabe zudem schneller als die 88,8 von DeepSeek V4 Pro, was die Schleife selbst verkürzt und nicht nur die Rechnung.

Der unangenehme Fall ist der, in dem die meisten Teams tatsächlich stecken: Man möchte die Zahl aus Step 5 Preview, aber man kann keinen Preview-Endpunkt, der am Launch-Tag live ging und für den keine Output-Obergrenze veröffentlicht ist, in einen Produktionspfad einbinden. Das ist ein Routing-Problem, und damit endet dieser Vergleich. DeepSeek V4 Pro ist über OrcaRouter für $0.66 und $1.98 pro Million Tokens erreichbar, die Off-Peak-Hälfte der Preisliste von DeepSeek mit $1.32 und $3.96, und daneben die umgebenden Textmodelle — hinter einem Schlüssel für mehr als 200 Modelle ohne Aufschlag, sodass eine Preisänderung bei DeepSeek noch am selben Tag auf Ihrer Rechnung landet und nicht erst bei der Verlängerung. Richten Sie den explorativen Teil des Traffics auf die Preview und halten Sie den Produktionspfad auf dem Modell mit einer Lizenz dahinter, wobei automatisches Failover über Anbieter hinweg die Arbeit übernimmt, die die Kapazitätskurve eines Preview-Endpunkts erforderlich macht.

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro at www.orcarouter.ai/models/deepseek/deepseek-v4-pro, showing the model id deepseek/deepseek-v4-pro, a 1M-token context and 384K max output, input pricing of $0.66 and output pricing of $1.98 per million tokens, a p50 time to first token of 4.01 seconds, 3,730M tokens of traffic over seven days, and the endpoints and SDK snippets behind the OrcaRouter API.

Was würde es klären

Drei Dinge, und alle drei sind überprüfbar statt diskutierbar.

Das erste ist die Lizenz. Wenn der BF16-Checkpoint verfügbar ist, was sagt das Repository dazu, was ein Unternehmen damit tun darf? Eine permissive Lizenz schließt diese Lücke größtenteils von selbst, weil sie den Acht-Punkte-Vorsprung zu etwas macht, das man besitzen statt mieten kann. Eine restriktive hinterlässt DeepSeek V4 Pro als das einzige Modell des Paares, auf dem man tatsächlich ein Produkt aufbauen kann.

Das Zweite ist die Obergrenze für die Ausgabe. DeepSeek gibt 384.000 Token an. StepFuns Ankündigung nennt 1 Mio. Kontext und erwähnt keine Obergrenze für die Ausgabe, und eine separate Drittanbieter-Konfiguration, die während des Leaks kursierte, führte 350.000 Kontext bei einer maximalen Ausgabe von 64.000 auf. Für die langfristige agentische Arbeit, für die beide Modelle verkauft werden, ist diese Zahl keine Fußnote.

Der dritte Punkt ist, ob der Preis hält, sobald das Vorschau-Suffix wegfällt. Ein Vorschau-Preis ist eine Kundengewinnungszahl; ein Auslieferungspreis ist ein Geschäftsmodell. Der Mindestpreis von DeepSeek V4 Pro wird durch einen wettbewerbsintensiven Serving-Markt bestimmt und kann sich nicht stark bewegen. Der von Step 5 Preview kann sich an einem Dienstag ändern.

Bis die ersten beiden beantwortet sind, ist die praktische Einschätzung, dass DeepSeek V4 Pro das Modell ist, das man einsetzt, und Step 5 Preview das Modell, gegen das man benchmarkt – mit der Einschränkung, dass ein erst wenige Tage alter Preview-Endpunkt, der acht Punkte über einem ausgereiften, MIT-lizenzierten Flaggschiff liegt, ein echtes Ergebnis ist und der Grund, warum der 15. Oktober einen Kalendereintrag statt eines Schulterzuckens wert ist.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert