
Step 5 Preview vs Gemini 3.1 Pro: Två modeller som kallas Preview, med sju månaders mellanrum
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Både Step 5 Preview och Gemini 3.1 Pro bär ordet preview, och ordet betyder inte samma sak i något av fallen. StepFun annonserade Step 5 Preview den 20 september 2026, med API:et öppet, vikterna schemalagda till den 15 oktober, och ett BF16-repository på Hugging Face som inte innehåller något annat än en .gitattributes. Den andra har levererats som gemini-3.1-pro-preview i API:et och som "Gemini 3.1 Pro Preview" på varje leaderboard sedan den 19 februari 2026, och hanterat produktionstrafik i sju månader utan att etiketten någonsin tagits bort. Den ena är en äkta förhandsvisning av något som inte är färdigt. Den andra är en namnkonvention knuten till en färdig produkt. Att jämföra dem på samma axel innebär att avgöra vilken av dessa två saker du faktiskt köper, och svaret av andra ordningen — att modellen fortfarande kallas en preview efter sju månader är det mer förutsägbara av de två — är den del som är värd att ta med in i ett upphandlingsbeslut.
Vad samma styrelse säger
Artificial Analysis betygsätter båda på Intelligence Index v4.3.2, tio utvärderingar. Det är den enda platsen där dessa två har mätts av samma hand, och resultatet ligger längre ifrån varandra än vad leverantörsmaterialen från endera sidan skulle antyda.
• Intelligensindex — Step 5 Preview 44 mot Gemini 3.1 Pro Preview 30
• Rang — Step 5 Preview 24:e av 200 modeller mot Gemini 3.1 Pro Preview 69:e av 200
• Pris per 1M tokens — Step 5 Preview $1,00 in / $2,70 ut vs Gemini 3.1 Pro $2,00 in / $12,00 ut
• Cache-rabatt — Step 5 Preview 95 % mot Gemini 3.1 Pro 90 %
• Utdatningshastighet — Step 5 Preview 99,8 tokens/sek vs Gemini 3.1 Pro 118,9 tokens/sek
• Tid till första token — Step 5 Preview 2,96 s vs Gemini 3.1 Pro 35,72 s
• Kontext – båda 1M tokens; vår katalog listar Gemini 3.1 Pro med ett utdatatak på 65K, StepFun har inte publicerat något.
• Indatamodaliteter – Step 5 Preview: text och bild. Gemini 3.1 Pro: text, bild, ljud, video och fil. Båda matar endast ut text
• Vikter — Step 5 Preview stängde idag, BF16-checkpoint planerad till 15 oktober; Gemini 3.1 Pro proprietär rakt igenom
Ett gap på 14 punkter på en skala där toppen av resultattavlan ligger på 53 är stort, och det bör rapporteras tillsammans med det som gör det märkligt: Googles egna publicerade utvärderingssiffror för den här modellen är utmärkta. Leverantören rapporterar 77,1 % på ARC-AGI-2, 82,8 % på sin multimodala svit, 94,1 på GPQA Diamond och 47,0 på Humanity's Last Exam. Det är inte svaga siffror. De är dessutom Googles egna, körda i Googles testramverk, och de mäter specifika förmågor snarare än det aggregerade mått som indexet poängsätter. Båda uppsättningarna siffror kan vara korrekta samtidigt. När en leverantörs huvudutvärdering och ett oberoende sammansatt mått går så kraftigt isär, är det det sammansatta måttet man bör planera en produktionsarbetsbelastning utifrån, eftersom det är det som straffar modellen för de aspekter som leverantören inte valde att mäta.
De två hastighetsraderna är värda att läsas tillsammans snarare än var för sig. Gemini 3.1 Pro genererar tokens 19 % snabbare när den väl har startat – 118,9 mot 99,8 – och tar 35,72 sekunder att starta, mot Step 5 Previews 2,96. Det är profilen för en modell som överlägger innan den ger ifrån sig. För ett batchjobb där en människa inte väntar vinner den snabbare genereraren på genomströmning. För en agentloop som gör dussintals beroende anrop är en tolvfaldig skillnad i tid till första token skillnaden mellan ett interaktivt verktyg och en kö.

Den enda axeln där Gemini vinner ohotat
Modalitet är inte en fotnot i den här jämförelsen. Gemini 3.1 Pro tar emot text, bilder, ljud, video och godtyckliga filer, och Step 5 Preview tar emot text och bilder. Om din pipeline involverar en skärminspelning, en samtalsinspelning, ett PDF-paket eller en videoström, är det bara en av dessa två modeller som överhuvudtaget kan ta emot indata, och indexgapet på 14 punkter är irrelevant eftersom den andra modellen inte kan besvara frågan.
Den asymmetrin avgör fler verkliga arbetsbelastningar än vad benchmark-tabellerna gör. Videogranskning, mötesanalys, ljudtranskription plus resonemang, och dokumentarbetsflöden byggda på skannade filer är alla fall där Gemini 3.1 Pros bredd gör den till den enda kandidaten på den här sidan. Det är också anledningen till att modellen har stannat i produktion i sju månader under en förhandsgranskningsetikett: de arbetsbelastningar den hanterar är de där en nyare text- och bildmodell inte kan ersätta den.
För text- och bildarbete inverteras kalkylen. Step 5 Preview ligger 14 punkter före i sammanvägningen, ungefär dubbelt så snabb på indatapris och 4,4 gånger billigare på utdata, och svarar på en tolftedel av tiden. Vid en arbetsbelastning med dokumentutvinning eller chatt över skärmbilder finns det ingen anledning att betala merpriset och vänta de extra elva sekunderna av betänketid.
Där prissättningen blir mindre platt än den verkar
De utannonserade priserna underskattar skillnaden, och orsaken är en nivågräns snarare än en taxa.
Gemini 3.1 Pros $2,00 och $12,00 gäller upp till 200 000 indatatokens. Däröver höjs båda priserna till $4,00 och $18,00 – en ökning med 50 % för utdata som gäller hela förfrågan, inte bara den del som ligger över gränsen. Step 5 Previews $1,00 och $2,70 har ingen publicerad prisnivå; priset är priset oavsett vilken längd kontextfönstret tillåter.
Båda modellerna utlovar en kontext på 1M token, så båda inbjuder dig att bygga pipelines för lång kontext. Hos en av dem kostar en begäran på 300 000 token dubbelt så mycket som prislistan antyder; hos den andra gör den inte det. Det är en strukturell fördel för Step 5 Preview i exakt den kategori som StepFun byggde den för – agentiskt arbete med lång horisont och en stor, upprepade gånger refererad kontext – och den förstärks av cacherabatten, där Step 5 Previews 95 % mot Gemini 3.1 Pros 90 % vidgar gapet ytterligare när det gäller det upprepade prefixmönstret som en agentloop producerar.
Grovt räknat, och markerat som aritmetik snarare än en angiven siffra: en agentloop som skickar en kontext på 250 000 token vid var och en av fyrtio turer är tio miljoner indatatoken. Med Gemini 3.1 Pro:s taxa för över 200K, med cachen som absorberar det upprepade prefixet, är det ett betydande steg upp från vad listpriset på 2,00 $ antyder. Med Step 5 Previews enhetliga taxa på 1,00 $ och en djupare cacherabatt kostar samma loop mindre och, ännu viktigare, kostar något som du kan förutsäga utifrån prislistan utan att först läsa nivåtabellen.

Tillgänglighet är den tysta skillnaden
Gemini 3.1 Pro har varit anropbar i sju månader via Googles API och, mer användbart för planering, via flera oberoende leverantörer – vilket är det som gör en p50-latenssiffra meningsfull i stället för anekdotisk. Step 5 Preview öppnade sitt API den 20 september och har exakt en källa. En endpoint med en enda källa som är några dagar gammal är den minst förutsägbara komponenten du kan lägga på en produktionsväg, inte för att modellen är dålig utan för att ingen känner till dess kapacitetskurva ännu.
Det är argumentet för routning i stället för att välja. Gemini 3.1 Pro Preview finns i vår katalog till $2.00 och $12.00 med nivåsteget vidarebefordrat oförändrat, och modellerna som den mäts mot finns bredvid den, bakom en enda nyckel för fler än 200 modeller med leverantörens listpris vidarebefordrat med 0 % påslag. Step 5 Preview finns inte på den listan – den körs på StepFuns eget API, och tills vikterna landar är det den enda platsen den körs på. Automatisk failover är det som gör en dagar gammal förhandsversion säker att testa i stället för en chansning: behåll produktionsvägen på en modell med dokumenterad historik, skicka text- och bildvolymen till Step 5 Preview medan du utvärderar den på din egen trafik, och låt reserven hålla när förhandsvisningens slutpunkt försämras. Det finns inget annat avtal och inget separat SDK för de modeller vi faktiskt routar, så en prisändring från Google dyker upp på din faktura som den aktuella siffran i stället för vid förnyelse.

Vilken du faktiskt köper
Om ditt arbete kommer in som video, ljud eller filer är Gemini 3.1 Pro den enda modellen på den här sidan som kan ta emot det, och indexgapet påverkar inte beslutet. Sju månader i produktion med förhandsversionsetiketten fortfarande på är en stabilitetssignal, inte en varning: namnkonventionen kvarstår eftersom Google aldrig har behövt ändra den, och modellen beter sig som den produktionshäst den är.
Om ditt arbete är text och bilder i volym med en stor upprepad kontext ligger Step 5 Preview före på varje mätvärde som spelar roll – 14 indexpoäng, halva indatapriset, en 4,4 gånger billigare utdatakostnad, ingen tröskeleffekt mellan nivåer, en djupare cacherabatt och en tid till första token mätt i sekunder snarare än i en halv minut. Det du köper där är en några dagar gammal endpoint med en enda källa, utan publicerad licens och utan publicerat utdatatak, vilket är en verklig risk och en avgränsad sådan.
Det man ska hålla ögonen på är inte indexet, utan huruvida StepFun publicerar ett tak för utdata tillsammans med kontextfönstret på 1M tokens, eftersom leverantörens tillkännagivande tiger om det, och en separat tredjepartskonfiguration som cirkulerade under läckan angav 350 000 i kontext med ett utdatatak på 64 000 – en väsentligt annan produkt än den på prislistan. Gemini 3.1 Pros tak på 65K, så som vår katalog listar det, är inte heller generöst, men det är angivet, och en angiven gräns är en sådan man kan designa runt.
