
Step 5 Preview vs Gemini 3.1 Pro: Due modelli chiamati Preview, a sette mesi di distanza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Sia Step 5 Preview che Gemini 3.1 Pro portano la parola preview, e la parola non significa la stessa cosa in nessuno dei due. StepFun ha annunciato Step 5 Preview il 20 settembre 2026, con l'API aperta, i pesi previsti per il 15 ottobre e un repository BF16 su Hugging Face che non contiene altro che un .gitattributes. L'altro viene distribuito come gemini-3.1-pro-preview nell'API e come "Gemini 3.1 Pro Preview" su ogni classifica dal 19 febbraio 2026, gestendo traffico di produzione per sette mesi senza che l'etichetta sia mai stata rimossa. Uno è una vera anteprima di qualcosa di non finito. L'altro è una convenzione di denominazione applicata a un prodotto finito. Confrontarli sullo stesso asse significa decidere quale di queste due cose si stia effettivamente acquistando, e la risposta di secondo livello — che il modello ancora chiamato anteprima dopo sette mesi sia il più prevedibile dei due — è la parte che vale la pena portare in una decisione di approvvigionamento.
Quello che dice lo stesso consiglio
Artificial Analysis li valuta entrambi sull'Intelligence Index v4.3.2, dieci valutazioni. È l'unico posto in cui questi due sono stati misurati dalla stessa mano, e il risultato è più distante di quanto i materiali dei vendor di entrambe le parti lascerebbero supporre.
• Indice di intelligenza — Step 5 Preview 44 vs Gemini 3.1 Pro Preview 30
Posizione — Step 5 Preview 24º su 200 modelli vs Gemini 3.1 Pro Preview 69º su 200
• Prezzo per 1M di token — Step 5 Preview $1,00 in ingresso / $2,70 in uscita contro Gemini 3.1 Pro $2,00 in ingresso / $12,00 in uscita
• Sconto cache — Step 5 Preview 95% vs Gemini 3.1 Pro 90%
• Velocità di output — Step 5 Preview 99.8 tokens/sec vs Gemini 3.1 Pro 118.9 tokens/sec
• Tempo al primo token — Step 5 Preview 2,96 s vs Gemini 3.1 Pro 35,72 s
• Contesto — entrambi 1M token; il nostro catalogo elenca Gemini 3.1 Pro con un tetto di output di 65K, StepFun non ne ha pubblicato alcuno
• Modalità di input — Step 5 Preview: testo e immagine. Gemini 3.1 Pro: testo, immagine, audio, video e file. Entrambi generano solo testo.
• Pesi — Step 5 Preview chiude oggi, checkpoint BF16 previsto per il 15 ottobre; Gemini 3.1 Pro proprietario per tutta la durata
Un divario di 14 punti su una scala in cui il vertice della classifica si attesta a 53 è considerevole, e va segnalato accanto a ciò che lo rende strano: i numeri di valutazione pubblicati da Google stesso per questo modello sono eccellenti. Il fornitore dichiara 77,1% su ARC-AGI-2, 82,8% sulla sua suite multimodale, 94,1 su GPQA Diamond e 47,0 su Humanity's Last Exam. Non sono cifre deboli. Sono anche numeri di Google, eseguiti sugli harness di Google, e misurano capacità specifiche anziché l'aggregato che l'indice valuta. Entrambe le serie di numeri possono essere accurate contemporaneamente. Quando la valutazione di punta di un fornitore e un composito indipendente divergono in modo così netto, è sul composito che conviene pianificare un carico di lavoro in produzione, perché è quello che penalizza il modello per le cose che il fornitore non ha scelto di misurare.
Le due righe sulla velocità meritano di essere lette insieme anziché separatamente. Gemini 3.1 Pro genera token il 19% più velocemente una volta avviato — 118,9 contro 99,8 — e impiega 35,72 secondi per avviarsi, contro i 2,96 di Step 5 Preview. È il profilo di un modello che delibera prima di emettere. Per un processo batch in cui nessun umano è in attesa, il generatore più veloce vince in termini di throughput. Per un ciclo di agente che effettua decine di chiamate dipendenti, una differenza di dodici volte nel tempo al primo token è la differenza tra uno strumento interattivo e una coda.

L'unico asse su cui Gemini vince nettamente
La modalità non è una nota a piè di pagina in questo confronto. Gemini 3.1 Pro accetta testo, immagini, audio, video e file arbitrari, mentre Step 5 Preview accetta testo e immagini. Se la tua pipeline prevede una registrazione dello schermo, una registrazione di una chiamata, un pacchetto PDF o un feed video, solo uno di questi due modelli può accettare l'input, e il divario di 14 punti nell'indice è irrilevante perché l'altro modello non può rispondere alla domanda.
Quell'asimmetria determina più carichi di lavoro reali di quanto facciano le tabelle di benchmark. La revisione video, l'analisi delle riunioni, la trascrizione audio più il ragionamento e i flussi di lavoro documentali basati su file scansionati sono tutti casi in cui l'ampiezza di Gemini 3.1 Pro lo rende l'unico candidato su questa pagina. È anche il motivo per cui il modello è rimasto in produzione per sette mesi con l'etichetta di anteprima: i carichi di lavoro che gestisce sono quelli in cui un modello più recente testo-e-immagine non può sostituirlo.
Per le attività su testo e immagini, il calcolo si inverte. Step 5 Preview è avanti di 14 punti sull'aggregato, è circa due volte più veloce sul prezzo di input e 4,4 volte più economico sull'output, e risponde in un dodicesimo del tempo. Su un carico di lavoro di estrazione da documenti o di chat su screenshot, non c'è motivo di pagare il sovrapprezzo e aspettare gli undici secondi in più di riflessione.
Dove il prezzo diventa meno piatto di quanto sembri
I prezzi in evidenza sottostimano la differenza, e la ragione è un confine di fascia piuttosto che una tariffa.
Le tariffe di $2,00 e $12,00 di Gemini 3.1 Pro valgono fino a 200.000 token di input. Oltre tale soglia, entrambe le tariffe passano a $4,00 e $18,00 — un aumento del 50% sull'output che si applica all'intera richiesta, non solo alla porzione oltre il limite. I $1,00 e $2,70 di Step 5 Preview non hanno una fascia pubblicata; il prezzo è quello a qualsiasi lunghezza consenta la finestra di contesto.
Entrambi i modelli pubblicizzano un contesto da 1M di token, quindi entrambi invitano a costruire pipeline a contesto lungo. Su uno dei due, una richiesta da 300.000 token costa il doppio di quanto suggerisca il listino prezzi; sull'altro no. Questo è un vantaggio strutturale per Step 5 Preview esattamente nella categoria per cui StepFun l'ha costruito — lavoro agentico a lungo orizzonte con un contesto ampio e referenziato ripetutamente — ed è amplificato dallo sconto cache, dove il 95% di Step 5 Preview contro il 90% di Gemini 3.1 Pro amplia ulteriormente il divario sul pattern di prefisso ripetuto che un ciclo dell'agente produce.
Calcolato all'incirca, e segnalato come aritmetica anziché come cifra citata: un ciclo di agente che invia un contesto di 250.000 token a ognuno dei quaranta turni equivale a dieci milioni di token di input. Alla tariffa oltre 200K di Gemini 3.1 Pro, con la cache che assorbe il prefisso ripetuto, si tratta di un aumento significativo rispetto a quanto implica la tariffa di listino di $2.00. Alla tariffa fissa di $1.00 di Step 5 Preview, con uno sconto cache più profondo, lo stesso ciclo costa meno e, cosa più importante, costa qualcosa che puoi prevedere dal listino prezzi senza leggere prima la tabella dei livelli.

La disponibilità è la differenza silenziosa
Gemini 3.1 Pro è richiamabile da sette mesi tramite l'API di Google e, cosa più utile per la pianificazione, tramite più provider indipendenti — ed è questo che rende significativa una cifra di latenza p50 anziché aneddotica. Step 5 Preview ha aperto la sua API il 20 settembre e ha esattamente una fonte. Un endpoint a fonte singola che ha pochi giorni è il componente meno prevedibile che si possa mettere su un percorso di produzione, non perché il modello sia scarso, ma perché nessuno conosce ancora la sua curva di capacità.
Questo è l'argomento a favore dell'instradamento invece della scelta. Gemini 3.1 Pro Preview è nel nostro catalogo a $2.00 e $12.00 con lo scatto di fascia riportato invariato, e i modelli con cui viene messo a confronto gli stanno accanto, dietro un'unica chiave per più di 200 modelli, con il prezzo di listino del fornitore riportato a ricarico 0%. Step 5 Preview non è in quell'elenco — gira sull'API di StepFun stessa e, finché i pesi non saranno disponibili, quello è l'unico posto in cui gira. Il failover automatico è ciò che rende una preview di pochi giorni sicura da provare anziché una scommessa: mantieni il percorso di produzione su un modello con un track record consolidato, invia il grosso di testo e immagini a Step 5 Preview mentre lo valuti sul tuo traffico reale, e lascia che il fallback regga quando l'endpoint della preview peggiora. Non c'è un secondo contratto né un SDK separato per i modelli che instradiamo, quindi un rincaro di Google compare sulla tua fattura come il numero corrente, non al rinnovo.

Quale stai acquistando davvero
Se il tuo lavoro arriva sotto forma di video, audio o file, Gemini 3.1 Pro è l'unico modello in questa pagina in grado di accettarlo, e il divario nell'indice non entra nella decisione. Sette mesi in produzione con l'etichetta di anteprima ancora attaccata sono un segnale di stabilità, non un avvertimento: la convenzione di denominazione persiste perché Google non ha mai avuto bisogno di cambiarla, e il modello si comporta come il cavallo di battaglia produttivo che è.
Se il tuo lavoro consiste in testo e immagini in grandi volumi con un ampio contesto ripetuto, Step 5 Preview è in vantaggio su ogni metrica che conta — 14 punti indice, metà del prezzo di input, una tariffa di output inferiore di 4,4 volte, nessun salto di fascia, uno sconto sulla cache più profondo e un tempo al primo token misurato in secondi anziché in mezzo minuto. Quello che acquisti lì è un endpoint a singola fonte vecchio di pochi giorni, senza licenza pubblicata e senza un tetto di output pubblicato, il che è un rischio reale e circoscritto.
La cosa da tenere d'occhio non è l'indice. È se StepFun pubblichi un tetto di output insieme alla finestra di contesto da 1M token, perché l'annuncio del fornitore tace al riguardo e una configurazione separata di terze parti che ha circolato durante la fuga di notizie elencava 350.000 di contesto con un limite di output di 64.000 — un prodotto sostanzialmente diverso da quello nel listino prezzi. Il tetto di 65K di Gemini 3.1 Pro, come lo elenca il nostro catalogo, non è nemmeno generoso, ma è dichiarato, e un limite dichiarato è un limite attorno al quale si può progettare.
