
Step 5 Preview vs. Gemini 3.1 Pro: Zwei Modelle namens Preview, sieben Monate auseinander
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Sowohl Step 5 Preview als auch Gemini 3.1 Pro tragen das Wort preview, und das Wort bedeutet bei keinem von beiden dasselbe. StepFun kündigte Step 5 Preview am 20. September 2026 an, mit offener API, für den 15. Oktober geplanten Gewichten und einem BF16-Repository auf Hugging Face, das nichts außer einer .gitattributes-Datei enthält. Das andere wird seit dem 19. Februar 2026 als gemini-3.1-pro-preview in der API und als „Gemini 3.1 Pro Preview" auf jeder Rangliste ausgeliefert, verarbeitet seit sieben Monaten Produktionsverkehr, ohne dass das Label je abgenommen wurde. Das eine ist eine echte Vorschau auf etwas Unfertiges. Das andere ist eine Namenskonvention, die an ein fertiges Produkt gehängt wurde. Vergleicht man sie auf derselben Achse, bedeutet das zu entscheiden, welches dieser beiden Dinge man tatsächlich kauft, und die Antwort zweiter Ordnung – dass das Modell nach sieben Monaten noch immer als Vorschau bezeichnet wird, das berechenbarere der beiden ist – ist der Teil, den man in eine Beschaffungsentscheidung mitnehmen sollte.
Was dasselbe Board sagt
Artificial Analysis bewertet beide auf dem Intelligence Index v4.3.2, zehn Evaluierungen. Es ist der einzige Ort, an dem diese beiden von derselben Hand gemessen wurden, und das Ergebnis liegt weiter auseinander, als die Anbietermaterialien auf beiden Seiten vermuten lassen würden.
• Intelligenz-Index — Step 5 Preview 44 vs Gemini 3.1 Pro Preview 30
• Rang — Step 5 Preview 24. von 200 Modellen vs. Gemini 3.1 Pro Preview 69. von 200
• Preis pro 1 Mio. Token — Step 5 Preview $1,00 Eingabe / $2,70 Ausgabe vs. Gemini 3.1 Pro $2,00 Eingabe / $12,00 Ausgabe
• Cache-Rabatt — Step 5 Preview 95 % vs. Gemini 3.1 Pro 90 %
• Ausgabegeschwindigkeit — Step 5 Preview 99,8 Token/Sek. vs. Gemini 3.1 Pro 118,9 Token/Sek.
• Zeit bis zum ersten Token — Step 5 Preview 2,96 s vs. Gemini 3.1 Pro 35,72 s
• Kontext — beide 1M Token; unser Katalog führt Gemini 3.1 Pro mit einer Ausgabegrenze von 65K auf, StepFun hat keine veröffentlicht
• Eingabemodalitäten – Step 5 Preview: Text und Bild. Gemini 3.1 Pro: Text, Bild, Audio, Video und Datei. Beide geben nur Text aus
• Gewichte — Step 5 Preview wurde heute geschlossen, BF16-Checkpoint für den 15. Oktober geplant; Gemini 3.1 Pro durchgängig proprietär
Ein Abstand von 14 Punkten auf einer Skala, bei der der Höchstwert bei 53 liegt, ist groß, und er sollte direkt neben dem genannt werden, was ihn seltsam macht: Googles eigene veröffentlichte Evaluationszahlen für dieses Modell sind ausgezeichnet. Der Anbieter meldet 77,1 % bei ARC-AGI-2, 82,8 % in seiner multimodalen Suite, 94,1 bei GPQA Diamond und 47,0 bei Humanity's Last Exam. Das sind keine schwachen Zahlen. Sie sind zudem Googles eigene, auf Googles Testumgebungen ausgeführt, und sie messen spezifische Fähigkeiten statt des Aggregats, das der Index bewertet. Beide Zahlenreihen können gleichzeitig korrekt sein. Wenn die zentrale Evaluation eines Anbieters und ein unabhängiger zusammengesetzter Index derart stark voneinander abweichen, ist der zusammengesetzte Index derjenige, an dem man eine Produktionslast ausrichten sollte, denn er ist derjenige, der das Modell für die Dinge bestraft, die der Anbieter nicht zu messen gewählt hat.
Die beiden Geschwindigkeitszeilen sollte man zusammen statt getrennt lesen. Gemini 3.1 Pro generiert Token 19 % schneller, sobald es loslegt – 118,9 gegenüber 99,8 – und braucht 35,72 Sekunden bis zum Start, gegenüber 2,96 bei Step 5 Preview. Das ist das Profil eines Modells, das erst abwägt, bevor es ausgibt. Bei einem Batch-Job, bei dem kein Mensch wartet, gewinnt der schnellere Generator beim Durchsatz. Für eine Agentenschleife mit Dutzenden abhängiger Aufrufe ist ein zwölffacher Unterschied bei der Zeit bis zum ersten Token der Unterschied zwischen einem interaktiven Tool und einer Warteschlange.

Die eine Achse, auf der Gemini eindeutig gewinnt
Modalität ist in diesem Vergleich keine Fußnote. Gemini 3.1 Pro akzeptiert Text, Bilder, Audio, Video und beliebige Dateien, und Step 5 Preview akzeptiert Text und Bilder. Wenn Ihre Pipeline eine Bildschirmaufnahme, eine Anrufaufnahme, ein PDF-Bündel oder einen Video-Feed umfasst, kann nur eines dieser beiden Modelle die Eingabe überhaupt entgegennehmen, und der 14-Punkte-Abstand im Index ist irrelevant, weil das andere Modell die Frage nicht beantworten kann.
Diese Asymmetrie entscheidet über mehr reale Workloads als die Benchmark-Tabellen. Video-Review, Meeting-Analyse, Audiotranskription plus Reasoning und Dokumenten-Workflows auf Basis gescannter Dateien sind alles Fälle, in denen die Breite von Gemini 3.1 Pro es zum einzigen Kandidaten auf dieser Seite macht. Das ist auch der Grund, warum das Modell sieben Monate lang unter einem Preview-Label in Produktion geblieben ist: Die Workloads, die es abdeckt, sind diejenigen, bei denen ein neueres Text-und-Bild-Modell es nicht verdrängen kann.
Bei der Arbeit mit Text und Bildern kehrt sich die Rechnung um. Step 5 Preview liegt in der Gesamtwertung 14 Punkte vorne, ist beim Eingabepreis etwa doppelt so schnell und beim Output 4,4-mal günstiger und antwortet in einem Zwölftel der Zeit. Bei einem Workload zur Dokumentenextraktion oder zum Chat über Screenshots gibt es keinen Grund, den Aufpreis zu zahlen und die zusätzlichen elf Sekunden Bedenkzeit abzuwarten.
Wo die Preisgestaltung weniger pauschal ist, als es aussieht
Die ausgewiesenen Preise unterschätzen den Unterschied, und der Grund dafür ist eine Tarifgrenze und nicht ein Tarif.
Die 2,00 $ und 12,00 $ von Gemini 3.1 Pro gelten bis zu 200.000 Eingabe-Tokens. Darüber hinaus steigen beide Sätze auf 4,00 $ und 18,00 $ – eine Erhöhung um 50 % bei der Ausgabe, die für die gesamte Anfrage gilt, nicht nur für den Teil jenseits der Grenze. Die 1,00 $ und 2,70 $ von Step 5 Preview haben keine veröffentlichte Preisstufe; der Preis ist der Preis bei jeder Länge, die das Kontextfenster zulässt.
Beide Modelle werben mit einem Kontext von 1 Mio. Token, also laden beide dazu ein, Long-Context-Pipelines zu bauen. Bei einem von ihnen kostet eine Anfrage mit 300.000 Token doppelt so viel, wie die Preisliste vermuten lässt; beim anderen nicht. Das ist ein struktureller Vorteil für Step 5 Preview – genau in der Kategorie, für die StepFun es entwickelt hat: langfristige agentische Arbeit mit einem großen, wiederholt referenzierten Kontext – und er wird durch den Cache-Rabatt noch verstärkt, wo die 95 % von Step 5 Preview gegenüber den 90 % von Gemini 3.1 Pro die Lücke beim Muster wiederholter Präfixe, das eine Agentenschleife erzeugt, weiter vergrößern.
Grob überschlagen und als Rechnung statt als zitierte Zahl ausgewiesen: Eine Agentenschleife, die bei jedem von vierzig Durchgängen einen Kontext mit 250.000 Token sendet, sind zehn Millionen Eingabe-Token. Beim Über-200K-Tarif von Gemini 3.1 Pro – wobei der Cache das wiederholte Präfix absorbiert – ist das ein deutlicher Anstieg gegenüber dem, was der Listenpreis von 2,00 $ nahelegt. Bei Step 5 Preview mit pauschal 1,00 $ und einem tieferen Cache-Rabatt kostet dieselbe Schleife weniger und – was wichtiger ist – kostet etwas, das man aus der Preisliste ableiten kann, ohne zuerst die Stufentabelle zu lesen.

Verfügbarkeit ist der leise Unterschied
Gemini 3.1 Pro ist seit sieben Monaten über Googles API aufrufbar und, was für die Planung nützlicher ist, über mehrere unabhängige Anbieter – was einen p50-Latenzwert aussagekräftig statt anekdotisch macht. Step 5 Preview hat seine API am 20. September geöffnet und hat genau eine Quelle. Ein Endpunkt mit nur einer Quelle, der erst wenige Tage alt ist, ist die am wenigsten vorhersehbare Komponente, die man in einen Produktionspfad setzen könnte – nicht weil das Modell schlecht wäre, sondern weil noch niemand seine Kapazitätskurve kennt.
Das ist das Argument für Routing statt für eine Auswahlentscheidung. Gemini 3.1 Pro Preview ist in unserem Katalog zu $2.00 und $12.00 – die Tarifstufe wird unverändert durchgereicht – und die Modelle, an denen es gemessen wird, stehen daneben, hinter einem einzigen Schlüssel für mehr als 200 Modelle, wobei der Listenpreis des Anbieters mit 0 % Aufschlag durchgereicht wird. Step 5 Preview steht nicht auf dieser Liste – es läuft über StepFuns eigene API, und bis die Gewichte erscheinen, ist das der einzige Ort, an dem es läuft. Automatisches Failover macht eine erst wenige Tage alte Preview sicher zum Testen statt zu einer Wette: Belassen Sie den Produktionspfad auf einem Modell mit nachgewiesener Erfolgsbilanz, schicken Sie die Text-und-Bild-Massenlast an Step 5 Preview, während Sie es mit Ihrem eigenen Traffic evaluieren, und lassen Sie das Fallback einspringen, wenn der Preview-Endpunkt schwächelt. Für die Modelle, die wir tatsächlich routen, gibt es keinen zweiten Vertrag und kein separates SDK, sodass eine Preisänderung von Google auf Ihrer Rechnung als aktueller Betrag erscheint und nicht erst bei der Verlängerung.

Welches du tatsächlich kaufst
Wenn Ihre Arbeit als Video, Audio oder Dateien eingeht, ist Gemini 3.1 Pro das einzige Modell auf dieser Seite, das sie annehmen kann, und die Indexlücke fließt nicht in die Entscheidung ein. Sieben Monate im Produktivbetrieb, während es weiterhin das Preview-Label trägt, sind ein Stabilitätssignal, keine Warnung: Die Namenskonvention bleibt bestehen, weil Google sie nie ändern musste, und das Modell verhält sich wie das Arbeitspferd im Produktivbetrieb, das es ist.
Wenn Ihre Arbeit in großem Umfang aus Text und Bildern mit einem großen, wiederholten Kontext besteht, liegt Step 5 Preview bei jeder wichtigen Kennzahl vorn – 14 Indexpunkte, der halbe Eingabepreis, eine 4,4-mal günstigere Ausgaberate, keine Tarifklippe, ein tieferer Cache-Rabatt und eine Zeit bis zum ersten Token, die in Sekunden statt in einer halben Minute gemessen wird. Was Sie dort kaufen, ist ein tagealter Single-Source-Endpunkt ohne veröffentlichte Lizenz und ohne veröffentlichte Ausgabengrenze, was ein reales Risiko und ein begrenztes ist.
Worauf man achten muss, ist nicht der Index. Es ist die Frage, ob StepFun zusammen mit dem 1M-Token-Kontextfenster eine Ausgabeobergrenze veröffentlicht, denn die Ankündigung des Anbieters schweigt dazu, und eine separate Drittanbieter-Konfiguration, die während des Leaks kursierte, nannte 350.000 Kontext bei einer Ausgabeobergrenze von 64.000 — ein wesentlich anderes Produkt als das auf der Preisliste. Die 65K-Obergrenze von Gemini 3.1 Pro, wie unser Katalog sie aufführt, ist ebenfalls nicht großzügig, aber sie ist angegeben, und eine angegebene Grenze ist eine, um die man herum planen kann.
