
Step 5 Preview vs Intern-S2 Mobius: Brauchen Sie ein 600B-Flaggschiff oder einen schnellen 35B-Reasoner?
- OrcaNEUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 pro 1 Mio. Tokens
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
Der ehrliche Grund für den Vergleich von Step 5 Preview mit Intern-S2 Mobius ist nicht, dass sie ähnlich sind. Es ist, dass sie Antworten auf zwei verschiedene Fragen desselben Käufers sind – das Team, das eine Reasoning-Workload ausführen muss und keine Lust hat, einen Cluster zu kaufen. StepFuns Step 5 Preview, angekündigt am 20. September 2026, ist die große Antwort: etwa 600 Milliarden Gesamtparameter mit 27 Milliarden aktiven, ein 1M-Token-Kontext, ein unabhängig gemessener Artificial Analysis Intelligence Index Score von 44 und ein veröffentlichter Preis von $1,00 pro Million Eingabe-Token und $2,70 pro Million Ausgabe-Token. InternLMs Intern-S2 Mobius, veröffentlicht am 29. Juli 2026, ist die kleine Antwort: ein Open-Weight-Modell mit 35 Milliarden Parametern, das auf der Mobius-v0-Architektur basiert und aus Qwen3.5-35B kontinuierlich vortrainiert wurde. Sein zentrales Versprechen ist nicht die Leistungsfähigkeit, sondern die Geschwindigkeit – etwa eine 4-fache End-to-End-Beschleunigung bei Reasoning-Benchmarks gegenüber der Baseline, aus der es trainiert wurde, ohne einen unabhängigen Benchmark-Score jeglicher Art. Eines ist ein Flaggschiff, das man mietet; das andere ist ein kleines Modell, das man selbst betreibt. Der Vergleich dreht sich eigentlich darum, ob die vor Ihnen liegende Workload das Flaggschiff überhaupt rechtfertigt.
Eine kurze Vorbemerkung vor den Zahlen, denn sie kostet Menschen echte Zeit: InternLM hat mehrere Modelle unter dem Banner Intern-S2 veröffentlicht, und sie sind nicht dasselbe. Intern-S2-397B ist das wissenschaftliche multimodale Flaggschiff; Intern-S2 Mobius ist der hier besprochene effiziente 35B-Reasoner; eine frühere Intern-S2-Version ist wiederum ein eigenes Modell. Wenn Sie nach „Intern-S2“ suchen und bei Benchmark-Tabellen für ein 397B-Modell landen, lesen Sie über einen anderen Checkpoint.
Was jedes Modell tatsächlich behauptet
Die Angaben von Step 5 Preview sind die üblichen für ein Flaggschiff aus 2026, und eine davon wird unabhängig überprüft. StepFun nennt etwa 600 Mrd. Gesamtparameter bei 27 Mrd. aktiven, Text- und Bildeingabe, ein Kontextfenster von 1 Mio. Tokens sowie einen Preis von 1,00 $/2,70 $ pro Million Eingabe- und Ausgabe-Tokens. Artificial Analysis misst es mit 44 auf seinem Intelligence Index, über einem Median vergleichbarer Modelle von 26, bei einer Ausgabe von 87 Tokens pro Sekunde gegenüber einem Durchschnitt von 78 und etwa 160 Millionen generierten Ausgabe-Tokens über die Aufgabensuite des Index hinweg gegenüber einem Median von 82 Millionen – ungefähr das Doppelte des typischen ausführlichen Umfangs, was bei einem nach Ausgabe abgerechneten Modell von Bedeutung ist.
Die Behauptung von Intern-S2 Mobius ist architektonisch und enger gefasst. Sein Design trennt Wissen von Berechnung: Ein global geteilter Memory hält Wissensvektoren, und mehrere Reasoner fragen ihn iterativ ab und verfeinern verborgene Zustände daran, statt Speicherung und Berechnung Schicht für Schicht zu binden, wie es ein herkömmlicher Transformer tut. Der von InternLM angegebene Nutzen ist eine ungefähr 4-fache End-to-End-Beschleunigung bei Reasoning-Benchmarks gegenüber dem Qwen3.5-35B, von dem es abstammt, bei vergleichbaren oder stärkeren Reasoning-Werten, plus kürzere sichtbare Gedankenketten. Das Modell ist Apache 2.0, Text- und Bildeingabe, und es ist ein Download.
• Skalierung — Step 5 Preview: insgesamt etwa 600B, 27B aktiv laut StepFun vs. Intern-S2 Mobius: insgesamt 35B.
• Unabhängige Punktzahl — Step 5 Preview: 44 im Artificial Analysis Intelligence Index vs. Intern-S2 Mobius: keine von Dritten veröffentlicht.
• Geschwindigkeit — Step 5 Preview: 87 Ausgabe-Token pro Sekunde gegenüber einem Durchschnitt von 78, gemessen vom Index Board vs. Intern-S2 Mobius: „fast 4x“ gegenüber der eigenen Qwen3.5-35B-Basislinie, vom Anbieter gemeldet und nicht reproduziert.
• Kontextfenster — Step 5 Preview: 1 Mio. Token pro StepFun vs. Intern-S2 Mobius: keine unabhängige Angabe zum Kontext veröffentlicht.
• Preis — Step 5 Preview: 1,00 $ Eingabe / 2,70 $ Ausgabe pro Million Token vs. Intern-S2 Mobius: kein API-Preis; Sie zahlen für die Hardware.
• Lizenz und Zugang — Step 5 Preview: geschlossene Preview über die API des Anbieters, BF16-Gewichte für den 15. Oktober 2026 zugesagt vs. Intern-S2 Mobius: Apache-2.0-Gewichte jetzt verfügbar.
• Ausführlichkeit — Step 5 Preview: etwa 160 Mio. Ausgabe-Tokens über die Index-Suite hinweg gegenüber einem Median von 82 Mio., laut dem Index-Board vs. Intern-S2 Mobius: kürzere sichtbare Reasoning-Traces, beansprucht von InternLM, von niemandem sonst gemessen.
Die 4x-Behauptung und warum sie hier die interessante Zahl ist
Lesen Sie die Zahlen der beiden Anbieter nebeneinander, und die Diskrepanz ist offensichtlich: StepFuns Schlagzeile ist ein Fähigkeitswert, die von InternLM ein Durchsatzmultiplikator. Das ist kein Zufall, und es ist das Nützlichste an diesem Vergleich. Eine 4-fache End-to-End-Beschleunigung bei Reasoning-Aufgaben ist, wenn sie den Kontakt mit dem Harness eines anderen übersteht, für ein Deployment mit hohem Volumen mehr wert als ein paar Punkte auf einem Index – sie verändert die Rechnung dafür, die Workload überhaupt auszuführen. Intern-S2 Mobius zielt auf Teams, deren Engpass Tokens pro Sekunde pro Dollar sind, nicht die Spitzenfähigkeit.
Der Vorbehalt ist, dass der Multiplikator gegen Qwen3.5-35B gemessen wird, das Modell, von dem aus Intern-S2 Mobius kontinuierlich vortrainiert wurde und das nie das Mobius-Training durchlaufen hat. Das ist ein Vergleich mit seinem eigenen Ausgangspunkt und nicht mit einem Konkurrenten. Es gibt keine unabhängige Reproduktion der Durchsatzbehauptung, keinen Indexwert von Drittanbietern und kein veröffentlichtes Kontextfenster von irgendjemandem außer dem Anbieter. Betrachten Sie „fast 4x“ als ein interessantes architektonisches Signal und als eine Hypothese, die Sie auf Ihrem eigenen Harness testen sollten, nicht als Spezifikation.
Step 5 Preview hat das entgegengesetzte Evidenzprofil. Seine Fähigkeitskennzahl ist unabhängig gemessen; seine Effizienz-Story ist der schwache Teil. Der Ausführlichkeitswert des Index-Boards – etwa 160 Millionen Ausgabe-Token, während das Medianmodell etwa 82 Millionen ausgibt – ist das ehrliche Gegengewicht zu einem Ausgabepreis von 2,70 US-Dollar, und er bedeutet, dass eine Arbeitslast, die auf lange strukturierte Generierungen setzt, deutlich mehr kosten wird, als das Preisschild vermuten lässt. Was es – anders als Intern-S2 Mobius – hat, ist überhaupt ein veröffentlichter API-Preis, der es überhaupt erst vergleichbar macht.
Das Hugging-Face-Repository für den versprochenen Vendor-Build erzählt die andere Hälfte der Geschichte: So sieht ein Open-Weight-Release aus, wenn es angekündigt, aber noch nicht ausgeliefert wurde.

Wo die Frage nach dem Fußabdruck tatsächlich zum Tragen kommt
Der eigentliche Vorteil von Intern-S2 Mobius ist nicht seine Punktzahl, die niemand gemessen hat, sondern was es kostet, sich darin zu irren. Fünfunddreißig Milliarden Parameter sind eine Größe, die ein Team auf Hardware betreiben kann, die es bereits besitzt, ohne Bestellung evaluieren und aufgeben kann, ohne etwas abschreiben zu müssen. Das ist ein struktureller Vorteil, den das Flaggschiff nicht erreichen kann, egal wie viele Punkte es erzielt, und es ist der Grund, warum dieser Vergleich lohnenswert ist, statt ihn als ungleichen Vergleich abzutun.

Der Vorteil des Flaggschiffs ist das Spiegelbild. Der 1M-Token-Kontext, die Bildeingabe und die gemessene allgemeine Schlussfolgerungsfähigkeit von Step 5 Preview decken Arbeit ab, die ein 35B-Modell wahrscheinlich nicht gut abdecken kann, und es kostet nichts, es für die Dauer eines kostenlosen Fensters auszuprobieren — das Modell war im Oktober in drei separaten Entwickleroberflächen kostenlos. Keine dieser Tatsachen ist für ein selbst gehostetes Modell verfügbar: Es gibt keine kostenlose Woche, um eigene GPUs zu betreiben, und es gibt keine Preisliste, die die Entscheidung in eine einzelne Kostenposition umwandelt.
Wenn der Vergleich auch nach dem Aktionszeitraum Bestand haben soll, sollten Sie statt einer Präferenz einen Test-Harness aufbauen. OrcaRouter leitet mehr als 200 Modelle hinter einem API-Schlüssel und einer Rechnung mit 0 % Aufschlag weiter, wobei der Listenpreis des Anbieters durchgereicht wird, mit automatischem Failover und einer Routing-DSL, mit der sich Traffic nach Kosten, Latenz oder Leistungsfähigkeit steuern lässt. Weder Step 5 Preview noch Intern-S2 Mobius ist in diesem Katalog enthalten – das Flaggschiff von StepFun wird von uns nicht geroutet, und Intern-S2 Mobius ist ein Self-Host-Download – der Nutzen liegt hier also nicht im Zugriff auf eines von beiden. Er besteht darin, dass die Modelle, an denen Sie sie benchmarken werden, nur einen Schlüssel entfernt sind, und eine auf Messung basierende Entscheidung bewegt sich mit der Beweislage statt mit einem Launch-Blogbeitrag.

Wie man entscheidet
Wenn Ihr Workload agentisch, multimodal, Long-Context oder ergebnisoffen ist – die Art, bei der Sie die Aufgaben nicht im Voraus auflisten können –, ist das Flaggschiff die Antwort, und Step 5 Preview ist eine vernünftige Ausprägung davon: messbar, bepreist, günstig für einen Pilotversuch und tokenweise reversibel. Kalkulieren Sie einfach mit der Ausführlichkeit statt mit dem beworbenen Preis.
Wenn Ihre Arbeitslast aus eng gefasstem, repetitivem Reasoning mit hohem Volumen auf Daten besteht, die innerhalb Ihres Perimeters bleiben müssen, dann ist das kleine Modell die Antwort, und Intern-S2 Mobius ist genau deshalb ein echter Kandidat, weil es klein ist: Es läuft auf Hardware, die Sie haben, es ist Apache 2.0, und die Geschwindigkeitsbehauptung ist, falls sie zutrifft, genau das, was über eine Frage der Unit Economics entscheidet. Gehen Sie mit dem Wissen hinein, dass Sie die Behauptung des Anbieters testen, anstatt das Urteil eines anderen zu übernehmen.
Der Fehler besteht darin, die Entscheidung als endgültig zu betrachten. Kaufe zuerst die Evaluierung des kleinen Modells, denn das ist das kostengünstige Experiment; miete das Flaggschiff für die Aufgaben, an denen das kleine Modell scheitert, denn das ist die kostengünstige Reparatur. Teams, die beide Optionen mit demselben Schlüssel und derselben Harness weiter am Leben halten, treffen diese Entscheidung am Ende mit ihren eigenen Daten, und das ist die einzige Version davon, die Bestand hat, wenn einer der Anbieter einen Nachfolger auf den Markt bringt.
