
Step 5 Preview vs Nemotron 3 Ultra: Einundzwanzig Indexpunkte für zwanzig Cent
- OrcaNEUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 pro 1 Mio. Tokens
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
Eines dieser Modelle können Sie heute Nachmittag herunterladen, und es ist dasjenige, das um 21 Punkte verliert. Step 5 Preview, StepFuns geschlossenes Flaggschiff, hat seine API am 20. September 2026 geöffnet und hat keine Lizenzdatei, die Sie in der Hand halten können; NVIDIA Nemotron 3 Ultra 550B A55B ist seit dem 4. Juni 2026 auf Hugging Face unter einer permissiven Lizenz mit beigefügten Trainingsrezepten verfügbar. Im Artificial Analysis Intelligence Index steht das Paar bei 44 gegen 23. Beim Ausgabepreis sind es 2,70 $ gegenüber 2,50 $ pro Million Tokens. 21 Punkte für 20 Cent sind kein Vergleich, der sich in die eine oder andere Richtung sauber auflösen lässt, weshalb es sich lohnt, die Sache richtig anzugehen, statt die beiden prominenten Spalten zu überfliegen und sich für eine Seite zu entscheiden.
Weder das eine noch das andere ist diese Woche eine Markteinführung, und das ist wichtig dafür, wie man die folgenden Zahlen liest. Beide sind seit Monaten aufrufbar, beide wurden durch denselben unabhängigen Prüfstand geschickt, und bei keinem gab es im Zeitfenster eine Änderung der Preisliste. Was sich geändert hat, ist kleiner und interessanter: Der Index, anhand dessen sie bewertet werden, wurde im September neu aufgebaut, und die beiden werden jetzt an zwei unterschiedlichen Medianen gemessen, die aus zwei unterschiedlichen Grundgesamtheiten stammen. Genau dort entscheidet sich dieser Vergleich tatsächlich.
Zwei sehr unterschiedliche Arten von Produkt
Lesen Sie die Datenblätter Seite an Seite, und das Erste, was auffällt, ist, dass sie kaum zur selben Kategorie von Dingen gehören.
• Parameter — Step 5 Preview umfasst laut StepFuns eigener Dokumentation insgesamt etwa 600 Milliarden, mit 27 Milliarden aktiven Parametern pro Token; Nemotron 3 Ultra umfasst insgesamt 550 Milliarden, mit 55 Milliarden aktiven Parametern, laut der Zahl, die das unabhängige Gremium für seine Konfiguration erfasst.
• Architektur — StepFun veröffentlicht keine Beschreibung der Interna für Step 5 Preview. NVIDIAs Model Card dokumentiert einen Hybridansatz: verschachtelte Mamba-2-Schichten, ausgewählte Attention-Schichten, eine LatentMoE-Anordnung und Multi-Token-Prediction-Heads.
• Kontextfenster — 1 Mio. Tokens in der Spezifikationstabelle von Step 5 Preview, mit einer maximalen Ausgabe von 64.000 Tokens, ebenfalls von StepFun dokumentiert. Nemotron 3 Ultra wird von dem Evaluator, der es ausgeführt hat, mit 262.144 Tokens verzeichnet; die Anbieterkarte bewirbt bis zu 1 Mio., erreichbar über eine Serving-Konfiguration statt standardmäßig.
• Eingabe — Text, Bilder und Video in Step 5 Preview, bis zu 60 Bilder pro Anfrage und MP4-Dateien unter 128 MB. Nur Text bei Nemotron 3 Ultra.
• Reasoning-Steuerung — eine dokumentierte Einstellung für niedrigen, mittleren und hohen Aufwand auf der StepFun-Seite; ein Chat-Template-Flag auf der NVIDIA-Seite, das die Denkspur ein- oder ausschaltet.
• Gewichte — für Step 5 Preview wurden keine veröffentlicht; es ist proprietär und nur über API verfügbar, wobei ein BF16-Checkpoint laut StepFun am 15. Oktober 2026 folgen soll. Nemotron 3 Ultra wird mit BF16- und NVFP4-Builds sowie einem GenRM-Reward-Modell auf Hugging Face unter OpenMDW-1.1 ausgeliefert.
• Bereitstellungsuntergrenze — nicht anwendbar für das API-Modell; acht GPUs der B200-Klasse oder GB200-Klasse bzw. sechzehn H100s bei der offenen Variante, gemäß der Mindestvorgabe des Anbieters.
Preisliste — 1,00 $ Eingabe, 0,10 $ bei einem Cache-Treffer und 2,70 $ Ausgabe für Step 5 Preview, von StepFuns englischer Preisseite. Etwa 0,60 $ Eingabe, 0,16 $ bei einem Cache-Treffer und 2,50 $ Ausgabe für Nemotron 3 Ultra, und beachten Sie genau, woher dieses Paar stammt: NVIDIA veröffentlicht keine Preisliste, daher handelt es sich um die beobachteten Anbieterpreise, die das unabhängige Gremium erfasst, nicht um eine Zahl des Herstellers.
Die Zeile, die die meisten Leute als entscheidend ansehen, ist die erste, und sie ist die am wenigsten aussagekräftige der acht. Die beiden Summen liegen innerhalb von neun Prozent voneinander, während sich die aktiven Parameter um den Faktor zwei unterscheiden, und die aktiven Parameter sind es, die die Rechenkosten jedes generierten Tokens bestimmen. Keine der beiden Zahlen lässt eine 21-Punkte-Lücke vorhersagen.

Der Median ist eine Wahl, die man trifft, bevor man das Ergebnis kennt
Das unabhängige Gremium bewertet Modelle nicht anhand eines einzigen Feldes. Es teilt sie in Kategorien ein – und die Kategorie, in die ein Modell fällt, verändert den unter seiner Punktzahl ausgegebenen Satz, ohne die Punktzahl zu ändern.
Step 5 Preview wird in die allgemeine Reasoning-Klasse eingeordnet, die das Board mit 227 Modellen zählt, und sein Median vergleichbarer Modelle liegt bei 26. Nemotron 3 Ultra wird in die Open-Weights-Klasse eingeordnet, die mit 117 Modellen gezählt wird, wo der Median bei 18 liegt. So beschreibt dasselbe Board 44 als „weit über dem Durchschnitt“ und 23 als „über dem Durchschnitt“, und beide Beschreibungen sind wahr, denn 44 liegt achtzehn Punkte über seinem Median und 23 fünf Punkte über seinem eigenen.
Das ist kein Trick, und es ist nicht so, dass das Board unfair ist. Es ist die korrekte Art, ein offenes Modell zu präsentieren – man vergleicht einen herunterladbaren Checkpoint mit anderen herunterladbaren Checkpoints, denn ein Team, das nur einen Download annehmen kann, wählt nicht aus den 227. Aber es bedeutet, dass jeder, der „überdurchschnittlich“ über Nemotron 3 Ultra und „überdurchschnittlich“ über eine 44 zitiert, zwei verschiedene Sätze miteinander vergleicht. Wenn Sie eine einzige Zahl für das Paar wollen, verwenden Sie den Rohindex und akzeptieren Sie den Abstand von einundzwanzig Punkten; wenn Sie die Entscheidung wollen, verwenden Sie die Klasse und geben Sie zu, dass Sie Ihr Feld bereits gewählt haben.

Was ein Harness auf beiden gemessen hat
Herstellertabellen lassen sich nicht voneinander subtrahieren, weil StepFun und NVIDIA an unterschiedlichen Tagen unterschiedliche Suiten laufen ließen und NVIDIAs Materialien nicht jeden Benchmark enthalten, den StepFun berichtet. Die ehrliche Grundlage ist die Schnittmenge: das, was ein einzelner Evaluator gegen beide laufen ließ.
Im Artificial Analysis Intelligence Index liegt dieser Schnittpunkt bei 44 gegenüber 23. Bei den Kosten pro abgeschlossener Index-Aufgabe sind es 1,03 $ gegenüber 0,60 $. Bei der Ausgabegeschwindigkeit kehrt sich das um, und zwar deutlich: 87 Token pro Sekunde für Step 5 Preview gegenüber 135,6 für Nemotron 3 Ultra, sodass das Modell, das fast doppelt so hoch punktet, dasjenige ist, das pro Token etwa eine halbe Sekunde langsamer generiert.
Die auffälligste einzelne Zeile ist Terminal-Bench 4.0. Step 5 Preview erzielt dort 33,3 Prozent. Nemotron 3 Ultra erzielt 0,5 Prozent. Das ist auf keiner der beiden Seiten ein Rundungsartefakt, und es ist keine subtile Lücke – in dieser speziellen Agentic-Terminal-Suite taucht das Open-Weight-Flaggschiff praktisch nicht auf. Die Falle ist, dass dieselbe Rangliste dasselbe Modell auch mit 53,9 Prozent auf Terminal-Bench 2.1 aufführt. Zwei Benchmarks mit nahezu demselben Namen, zwei verschiedene Generationen derselben Aufgabenfamilie, und ein Modell, das bei der älteren bei 53,9 und bei der neueren bei 0,5 steht. Wenn Ihnen eine Nemotron-Zahl im Fünfzigerbereich genannt wurde, stammt sie von dort – und das ist nicht die aktuelle Suite.
Eine Übereinstimmung verdient gerade deshalb eine Erwähnung, weil sie selten ist. NVIDIAs eigene Modellkarte gibt für GPQA ohne Werkzeuge 87,0 Prozent an; der unabhängige Durchlauf maß 86,7 Prozent. Dass eine Zahl vom Hersteller und eine externe Zahl nur drei Zehntelpunkte auseinanderliegen, ist genau das, wie eine vertrauenswürdige Evaluationstabelle aussieht, und es macht die 0,5 Prozent bei Terminal-Bench 4.0 leichter als real statt als Auswertungsfehler zu akzeptieren.
Wohin das Geld bei einem Indexlauf tatsächlich fließt
Preise pro Token sagen sehr wenig darüber aus, was ein Workload kostet, und dieses Paar veranschaulicht den Punkt besser als die meisten. Das Board veröffentlicht die Kostenaufschlüsselung für den vollständigen Indexlauf jedes Modells, und bei beiden ist der dominierende Posten nicht die Generierung.
Die 1,03 $ pro Aufgabe von Step 5 Preview teilen sich auf in 0,85 $ für die Eingabe und 0,17 $ für die Ausgabe. Innerhalb des Eingabe-Betrags entfallen 0,62 $ auf Cache-Lesevorgänge, 0,22 $ auf Cache-Schreibvorgänge und nur 0,014 $ auf neue, nicht gecachte Eingabe. Innerhalb des Ausgabe-Betrags entfallen 0,12 $ auf den Reasoning-Trace und 0,06 $ auf die finale Antwort.
Die 0,60 $ pro Aufgabe bei Nemotron 3 Ultra teilen sich in 0,53 $ Input und 0,07 $ Output auf, und die Zusammensetzung innerhalb der Input-Position ist nahezu das Spiegelbild – 0,48 $ an Cache-Schreibvorgängen gegenüber nur 0,04 $ an Cache-Lesevorgängen.
Daraus ergeben sich zwei Schlussfolgerungen. Die erste ist, dass bei einer Long-Horizon-Bewertung mit starker Prefix-Wiederverwendung rund achtzig Prozent dessen, was Sie zahlen, auf der Eingangsseite der Abrechnung steht, weshalb Ihre Cache-Trefferrate und Ihre Kontextdisziplin die Zahlen sind, die optimiert werden müssen, und nicht Ihre Ausgabelänge. Die zweite ist, dass die beiden Modelle auf unterschiedliche Weise zu ihren Abrechnungen gelangen: Step 5 Preview zahlt dafür, ein großes gemeinsam genutztes Präfix erneut zu lesen, während Nemotron 3 Ultra dafür zahlt, verschiedene Inhalte überhaupt erst zu schreiben. Ähnliche Schlagzeile, zwei unterschiedliche — und wenn Ihr Workload eher einem dieser Muster als dem anderen ähnelt, kann die Reihenfolge bei $1.03 und $0.03 kippen.
Die Ausführlichkeitszahlen erklären den Rest der Ausgabezeile. Step 5 Preview erzeugte über die Index-Suite hinweg etwa 160 Millionen Ausgabe-Tokens gegenüber einem Median von 82 Millionen, was das Board schlicht als sehr ausführlich bezeichnet. Nemotron 3 Ultra erzeugte 110 Millionen gegenüber einem Median von 140 Millionen, was es als ziemlich prägnant bezeichnet. Das günstigere Modell ist das knappe, und es ist knapp in der Richtung, die für eine Abrechnung zählt.

Was der Download bringt und was es kostet, ihn zu behalten
Der Preis von Nemotron 3 Ultra beträgt nicht 2,50 $ pro Million Ausgabe-Token, wenn man den Checkpoint nimmt. Das ist der Preis dafür, die Bereitstellung davon bei jemand anderem zu mieten. Nimmst du den Download, hast du einen anderen Satz an Kosten und einen anderen Satz an Rechten erworben.
Die Rechte sind konkret, und sie sind der Teil, mit dem ein reines API-Modell zu keinem Preis mithalten kann. OpenMDW-1.1 wird mit den Gewichten geliefert, und NVIDIA veröffentlicht dazu die Datensammlungen für das Pre-Training und das Post-Training sowie die Trainingsrezepte. Es gibt einen NVFP4-Build, der beim selben Modell etwa halb so groß ist, und die Ultra-Gewichte wurden mit einem NVFP4-Rezept vorab trainiert statt nachträglich quantisiert – weshalb der kleine Build auf der Karte ein erstklassiges Artefakt ist und nicht ein Community-Experiment. Die kommerzielle Position wird klar benannt: bereit für kommerzielle und nicht-kommerzielle Nutzung.
Die Kosten sind ebenso konkret. Das minimale Deployment sind acht GPUs der B200-Klasse oder sechzehn H100s, und das ist die Untergrenze, die die Karte nennt, und kein bloßer Vorschlag. Das Kontextfenster, das Sie tatsächlich erhalten, hängt davon ab, wie Sie das Serving konfigurieren, wobei 256K der Standard sind und 1M hinter einer expliziten Einstellung liegt. Ein Team, das sich nicht auf ein Rack festlegen kann, wählt nicht zwischen diesen beiden Modellen bei 1,00 $ und 0,60 $ Input; es wählt zwischen einem Modell und einer Bestellung.
Es gibt eine Version dieses Vergleichs, in der das offene Modell auf der Achse gewinnt, die den Leuten angeblich wichtig ist und die sie selten bepreisen — Abhängigkeit. Step 5 Preview ist ein Endpunkt, den Sie aufrufen, und ein Anbieter, dem Sie vertrauen, mit einem Checkpoint, der eher versprochen als ausgeliefert wird. Wenn StepFun seine Preisliste überarbeitet, seine Limits verschärft, die ID abkündigt oder eine schlechte Woche hat, ist Ihre eigene Fehlerbehandlung der einzige Hebel. Die Gewichte von Nemotron 3 Ultra liegen bereits auf der Festplatte in irgendeinem Cluster, und das ist etwas Reales wert, selbst während dasselbe Modell mit einundzwanzig Indexpunkten zurückliegt.
Es lohnt sich, genau zu sein, was „versprochen“ auf der anderen Seite bedeutet, denn das Bild ist unordentlicher, als es eines der beiden Lager zugibt. Am 20. September, dem Tag, an dem die API geöffnet wurde, erschienen mehrere Drittanbieter-Mirrors eines BF16-Builds auf Hugging Face, einige davon weit über ein Terabyte an safetensors. Das sind Community-Re-Uploads, keine Veröffentlichung eines Anbieters, und StepFun hat daneben keine Open-Weights-Ankündigung veröffentlicht. Was sie belegen, ist, dass die Gewichte zirkulieren und dass der versprochene Checkpoint vom 15. Oktober eher eine Formalisierung als eine Offenlegung wäre.
Eine Zahl, die sich bewegte, während wir sie lasen.
Eine Zahl in diesem Beitrag änderte sich zwischen zwei Lesevorgängen derselben Seite, und es lohnt sich, sie zu benennen, denn genau so veraltet ein Vergleich still und leise.
Das unabhängige Gremium wies für Step 5 Preview in der Berichterstattung vom 9. Oktober 2026 Kosten von 0,71 $ pro Index-Aufgabe aus. Liest man am 10. Oktober erneut nach, nennt dieselbe Seite 1,03 $. Am Modell hat sich in diesem Zeitraum nichts geändert, denn an den Gewichten eines reinen API-Modells kann sich über Nacht nichts ändern. Geändert hat sich die Bewertungsabrechnung: Wenn sich der Cache-Preis eines Anbieters verschiebt, wenn der Bewerter seine Annahmen zum Cache-Lesen überarbeitet oder wenn ein Durchlauf gegen einen anderen Token-Mix neu berechnet wird, verschiebt sich der Wert pro Aufgabe, während der Index-Score unverändert bleibt.
Betrachten Sie die Kosten pro Aufgabe also als eine Live-Zahl mit einem Datumsstempel und nicht als eine Eigenschaft des Modells. Jede Pro-Aufgabe-Zahl in diesem Artikel ist der Stand vom 10. Oktober und ist als solche gekennzeichnet. Wenn Sie anhand dieser Seite ein Budget erstellen, erstellen Sie es auf Basis einer Zahl, die Sie selbst an dem Tag abrufen, an dem Sie sich festlegen – und wenn Sie zwei Berichte aus verschiedenen Wochen vergleichen, prüfen Sie die Erfassungsdaten, bevor Sie zu dem Schluss kommen, dass ein Modell günstiger geworden ist.
Welche du tatsächlich nennen würdest
Sagen Sie zuerst das Unangenehme: OrcaRouter routet keines dieser beiden Modelle. Step 5 Preview ist über StepFuns eigene API und eine Handvoll Drittanbieter-Plattformen erreichbar, und Nemotron 3 Ultra wird über NVIDIAs eigene Endpunkte und von mehreren Anbietern bereitgestellt, und Sie können beide Aussagen in derselben Minute, in der Sie sie lesen, anhand unseres Katalogs überprüfen.
Was übrig bleibt, ist die Form der Abhängigkeit und nicht die Wahl des Modells, und es ist die eine Stelle, an der sich eine Routing-Schicht hier bezahlt macht. Eine reine API-Vorschau auf einem einzigen Anbieterpfad ist genau die Konstellation, in der ein schlechter Nachmittag beim Anbieter zu Ihrem Ausfall wird, und die günstige Versicherung ist eine Control Plane, die eine Anfrage in dem Moment auf einen qualifizierten Fallback umleiten kann, in dem ein Anbieterpfad schlechter wird. Dafür ist automatisches Failover da: nicht als Ersatz für Step 5 Preview, sondern als das, was Sie vor die Modelle setzen, die Sie tatsächlich aufrufen können, damit ein anbieterspezifischer Endpunkt nie der einzige Weg in die Produktion ist. Derselbe Katalog, der das leistet, führt über 200 Modelle hinter einem Schlüssel und einer Rechnung, wobei die Listenpreise der Anbieter mit 0 Prozent Aufschlag durchgereicht werden – was die andere Hälfte des Arguments ist, denn eine Änderung der Preisliste irgendwo vorgelagert ist bei uns noch am selben Tag live und nicht erst bei der nächsten Vertragsverlängerung.
Wenn keines der beiden Modelle das ist, das Sie aufrufen werden, geht die Kurzfassung so. Nehmen Sie Step 5 Preview, wenn Sie den Score, die Video- und Bildeingabe und den 90-prozentigen Cache-Rabatt wollen, und akzeptieren Sie, dass Sie eine Vorschau mieten, ohne Lizenz für die Gewichte und mit einem Oktober-Checkpoint, den Sie noch nicht gesehen haben. Nehmen Sie Nemotron 3 Ultra, wenn die Gewichte mehr zählen als der Score — für On-Premise-Vorgaben, für Fine-Tuning, für eine Lizenz, die Sie lesen können —, und kalkulieren Sie das Rack, bevor Sie die Tokens kalkulieren, denn bei 0,60 $ pro Million Eingabe-Tokens ist ein Deployment mit 550 Milliarden Parametern nur dann günstig, wenn schon jemand anderes für die GPUs bezahlt.
Der entscheidende Punkt ist der 15. Oktober. Wenn StepFun den zugesagten BF16-Checkpoint veröffentlicht, trifft die zentrale Asymmetrie dieses Artikels – dass nur eines dieser beiden ein Download ist – nicht mehr zu, und die einundzwanzig Indexpunkte lassen sich erheblich schwerer wegargumentieren. Wenn sich das Datum verschiebt, stärkt sich das Argument für das Open-Weight-Modell von selbst, was eine seltsame Art ist, eine Fähigkeitslücke zu schließen – und eine sehr verbreitete.
