
Step 5 Preview vs Gemini 3.1 Pro: Twee modellen die Preview heten, zeven maanden na elkaar
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Zowel Step 5 Preview als Gemini 3.1 Pro bevatten het woord preview, en het woord betekent bij beide niet hetzelfde. StepFun kondigde Step 5 Preview aan op 20 september 2026, met de API open, de gewichten gepland voor 15 oktober, en een BF16-repository op Hugging Face die niets anders bevat dan een .gitattributes. De andere wordt al geleverd als gemini-3.1-pro-preview in de API en als "Gemini 3.1 Pro Preview" op elk leaderboard sinds 19 februari 2026, terwijl die al zeven maanden productieverkeer verwerkt zonder dat het label ooit verdwijnt. De ene is een echte preview van iets dat nog niet af is. De andere is een naamgevingsconventie die aan een afgerond product hangt. Ze op dezelfde as vergelijken betekent beslissen welke van die twee dingen je feitelijk koopt, en het antwoord in tweede orde — dat het model na zeven maanden nog steeds een preview wordt genoemd, het voorspelbaardere van de twee is — is het deel dat het waard is om mee te nemen in een inkoopbeslissing.
Wat hetzelfde bord zegt
Artificial Analysis scoort beide op Intelligence Index v4.3.2, tien evaluaties. Het is de enige plek waar deze twee door dezelfde hand zijn gemeten, en het resultaat ligt verder uiteen dan de leveranciersmaterialen aan weerszijden zouden doen vermoeden.
• Intelligentie-index — Step 5 Preview 44 vs Gemini 3.1 Pro Preview 30
• Rang — Step 5 Preview 24e van 200 modellen vs Gemini 3.1 Pro Preview 69e van 200
• Prijs per 1 miljoen tokens — Step 5 Preview $1,00 in / $2,70 uit vs Gemini 3.1 Pro $2,00 in / $12,00 uit
• Cachekorting — Step 5 Preview 95% vs Gemini 3.1 Pro 90%
• Uitvoersnelheid — Step 5 Preview 99,8 tokens/sec vs Gemini 3.1 Pro 118,9 tokens/sec
• Tijd tot eerste token — Step 5 Preview 2,96 s vs Gemini 3.1 Pro 35,72 s
• Context — beide 1M tokens; onze catalogus vermeldt Gemini 3.1 Pro met een uitvoerplafond van 65K, StepFun heeft er geen gepubliceerd
• Invoermodaliteiten — Step 5 Preview: tekst en afbeelding. Gemini 3.1 Pro: tekst, afbeelding, audio, video en bestand. Beide geven alleen tekst als uitvoer
• Gewichten — Step 5 Preview vandaag gesloten, BF16-checkpoint gepland voor 15 oktober; Gemini 3.1 Pro volledig propriëtair
Een verschil van 14 punten op een schaal waarop de hoogste score 53 is, is groot, en het moet worden vermeld naast het gegeven dat het zo vreemd maakt: de eigen gepubliceerde evaluatiecijfers van Google voor dit model zijn uitstekend. De leverancier rapporteert 77,1% op ARC-AGI-2, 82,8% op zijn multimodale suite, 94,1 op GPQA Diamond en 47,0 op Humanity's Last Exam. Dat zijn geen zwakke cijfers. Ze zijn ook van Google zelf, uitgevoerd op de eigen testomgevingen van Google, en ze meten specifieke capaciteiten in plaats van het geheel dat de index beoordeelt. Beide reeksen cijfers kunnen tegelijkertijd juist zijn. Wanneer de hoofdevaluatie van een leverancier en een onafhankelijke samengestelde maatstaf zo sterk van elkaar afwijken, is de samengestelde maatstaf degene waarmee je een productieworkload moet plannen, omdat die het model straft voor de dingen die de leverancier niet heeft gekozen te meten.
De twee snelheidsrijen zijn het waard om samen te lezen in plaats van apart. Gemini 3.1 Pro genereert tokens 19% sneller zodra het begint — 118,9 tegen 99,8 — en doet er 35,72 seconden over om te starten, tegen de 2,96 van Step 5 Preview. Dat is het profiel van een model dat nadenkt voordat het uitvoer produceert. Voor een batchtaak waarbij geen mens wacht, wint de snellere generator op doorvoer. Voor een agentlus die tientallen afhankelijke aanroepen doet, is een twaalfvoudig verschil in tijd tot het eerste token het verschil tussen een interactieve tool en een wachtrij.

De enige as waarop Gemini zonder meer wint
Modaliteit is geen voetnoot in deze vergelijking. Gemini 3.1 Pro accepteert tekst, afbeeldingen, audio, video en willekeurige bestanden, en Step 5 Preview accepteert tekst en afbeeldingen. Als je pijplijn een schermopname, een gespreksopname, een PDF-bundel of een videofeed omvat, kan slechts één van deze twee modellen de invoer überhaupt verwerken, en is het verschil van 14 punten in de index irrelevant, omdat het andere model de vraag niet kan beantwoorden.
Die asymmetrie bepaalt meer echte workloads dan de benchmarktabellen doen. Videoreview, vergaderanalyse, audiotranscriptie plus redenering, en documentworkflows op basis van gescande bestanden zijn allemaal gevallen waarin de breedte van Gemini 3.1 Pro het de enige kandidaat op deze pagina maakt. Het is ook waarom het model zeven maanden in productie is gebleven onder een previewlabel: de workloads die het aankan, zijn de gevallen waarin een nieuwer tekst-en-beeldmodel het niet kan verdringen.
Voor werk met tekst en afbeeldingen keert de afweging zich om. Step 5 Preview staat 14 punten voor op het totaal, is ongeveer twee keer zo snel op inputprijs en 4,4 keer goedkoper op output, en antwoordt in een twaalfde van de tijd. Bij een werklast voor documentextractie of chatten over screenshots is er geen reden om de meerprijs te betalen en te wachten op de extra elf seconden beraad.
Waar de prijsstelling minder vlak wordt dan het lijkt
De koprijzen onderschatten het verschil, en de oorzaak is een schijfgrens, niet een tarief.
De $2,00 en $12,00 van Gemini 3.1 Pro gelden tot 200.000 invoertokens. Daarboven stijgen beide tarieven naar $4,00 en $18,00 — een stijging van 50% op de output die voor het hele verzoek geldt, niet alleen voor het deel voorbij de grens. De $1,00 en $2,70 van Step 5 Preview hebben geen gepubliceerde staffel; de prijs is de prijs bij elke lengte die het contextvenster toestaat.
Beide modellen adverteren met een context van 1M tokens, dus beide nodigen je uit om long-contextpijplijnen te bouwen. Bij een van de twee kost een verzoek van 300.000 tokens twee keer zoveel als de prijslijst suggereert; bij de andere is dat niet het geval. Dat is een structureel voordeel voor Step 5 Preview in precies de categorie waarvoor StepFun het heeft gebouwd — langdurig agentisch werk met een grote context waarnaar herhaaldelijk wordt verwezen — en dat wordt versterkt door de cachediscount, waarbij de 95% van Step 5 Preview tegenover de 90% van Gemini 3.1 Pro de kloof verder vergroot bij het patroon van herhaalde prefixen dat een agentloop produceert.
Grofweg berekend, en aangeduid als rekenwerk in plaats van een geciteerd cijfer: een agentlus die bij elk van de veertig beurten een context van 250.000 tokens verstuurt, is tien miljoen invoertokens. Bij het boven-200K-tarief van Gemini 3.1 Pro, met de cache die de herhaalde prefix absorbeert, is dat een flinke sprong omhoog ten opzichte van wat het lijsttarief van $2,00 impliceert. Bij het vaste tarief van $1,00 van Step 5 Preview met een diepere cachekorting kost dezelfde lus minder en, belangrijker nog, kost hij iets wat je kunt voorspellen op basis van de prijslijst zonder eerst de staffeltabel te lezen.

Beschikbaarheid is het stille verschil
Gemini 3.1 Pro is al zeven maanden aanroepbaar via de API van Google en, nuttiger voor planning, via meerdere onafhankelijke providers — waardoor een p50-latentiecijfer betekenisvol wordt in plaats van anekdotisch. Step 5 Preview opende zijn API op 20 september en heeft precies één bron. Een endpoint met één bron dat enkele dagen oud is, is de minst voorspelbare component die je op een productiepad kunt zetten, niet omdat het model slecht is, maar omdat niemand de capaciteitscurve ervan nog kent.
Dat is het argument voor routeren in plaats van kiezen. Gemini 3.1 Pro Preview staat in onze catalogus voor $2,00 en $12,00 met de tierstap ongewijzigd doorgegeven, en de modellen waarmee het wordt vergeleken staan ernaast, achter één sleutel voor meer dan 200 modellen met de lijstprijs van de provider doorgegeven tegen 0% opslag. Step 5 Preview staat niet op die lijst — het draait op de eigen API van StepFun, en totdat de gewichten er zijn is dat de enige plek waar het draait. Automatische failover maakt een preview van enkele dagen oud veilig om uit te proberen in plaats van een gok: houd het productiepad op een model met een bewezen staat van dienst, stuur de bulk aan tekst en beeld naar Step 5 Preview terwijl je het op je eigen verkeer evalueert, en laat de fallback standhouden wanneer het preview-endpoint verslechtert. Er is geen tweede contract en geen aparte SDK voor de modellen die we wel routeren, dus een herprijzing door Google verschijnt op je factuur als het huidige tarief in plaats van bij verlenging.

Welke je eigenlijk koopt
Als je werk als video, audio of bestanden binnenkomt, is Gemini 3.1 Pro het enige model op deze pagina dat het kan accepteren, en de indexkloof speelt geen rol in de beslissing. Zeven maanden in productie terwijl het preview-label nog steeds is aangehecht, is een stabiliteitssignaal, geen waarschuwing: de naamgevingsconventie blijft bestaan omdat Google die nooit heeft hoeven wijzigen, en het model gedraagt zich als het productiewerkpaard dat het is.
Als je werk bestaat uit tekst en afbeeldingen op grote schaal met een grote, herhaalde context, dan loopt Step 5 Preview voorop op elke maatstaf die ertoe doet — 14 indexpunten, de helft van de inputprijs, een 4,4x goedkoper outputtarief, geen tier-cliff, een diepere cachekorting, en een tijd tot het eerste token gemeten in seconden in plaats van een halve minuut. Wat je daar koopt, is een endpoint uit één bron dat pas enkele dagen oud is, zonder gepubliceerde licentie en zonder gepubliceerd outputplafond, wat een reëel risico is en een begrensd risico.
Waar je op moet letten is niet de index. Het is of StepFun een outputplafond publiceert naast het contextvenster van 1M tokens, want de aankondiging van de leverancier zwijgt erover en een aparte configuratie van derden die tijdens het lek circuleerde, vermeldde 350.000 context met een outputlimiet van 64.000 — een wezenlijk ander product dan dat op de prijslijst. Het plafond van 65K van Gemini 3.1 Pro, zoals onze catalogus het vermeldt, is ook niet royaal, maar het staat wel vermeld, en met een vermelde limiet kun je rekening houden in je ontwerp.
