Scheda del titolo generata intitolata "Step 5 Preview vs Gemini 3.1 Pro — due anteprime, a sette mesi di distanza", con una cronologia che segna Gemini 3.1 Pro Preview al 19 febbraio 2026, ancora in anteprima, e Step 5 Preview al 20 settembre 2026, pesi previsti per il 15 ottobre. Sotto, due schede: Step 5 Preview con AA Index 44, input testo e immagine, e tempo al primo token 2,96 s; Gemini 3.1 Pro Preview con AA Index 30, input testo, immagine, audio, video e file, e tempo al primo token 35,72 s. Un piè di pagina recita "Entrambi secondo Artificial Analysis Intelligence Index v4.3.2."
Guides & Insights

Step 5 Preview vs Gemini 3.1 Pro: Due modelli chiamati Preview, a sette mesi di distanza

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Sia Step 5 Preview che Gemini 3.1 Pro portano la parola preview, e la parola non significa la stessa cosa in nessuno dei due. StepFun ha annunciato Step 5 Preview il 20 settembre 2026, con l'API aperta, i pesi previsti per il 15 ottobre e un repository BF16 su Hugging Face che non contiene altro che un .gitattributes. L'altro viene distribuito come gemini-3.1-pro-preview nell'API e come "Gemini 3.1 Pro Preview" su ogni classifica dal 19 febbraio 2026, gestendo traffico di produzione per sette mesi senza che l'etichetta sia mai stata rimossa. Uno è una vera anteprima di qualcosa di non finito. L'altro è una convenzione di denominazione applicata a un prodotto finito. Confrontarli sullo stesso asse significa decidere quale di queste due cose si stia effettivamente acquistando, e la risposta di secondo livello — che il modello ancora chiamato anteprima dopo sette mesi sia il più prevedibile dei due — è la parte che vale la pena portare in una decisione di approvvigionamento.

Quello che dice lo stesso consiglio

Artificial Analysis li valuta entrambi sull'Intelligence Index v4.3.2, dieci valutazioni. È l'unico posto in cui questi due sono stati misurati dalla stessa mano, e il risultato è più distante di quanto i materiali dei vendor di entrambe le parti lascerebbero supporre.

• Indice di intelligenza — Step 5 Preview 44 vs Gemini 3.1 Pro Preview 30

Posizione — Step 5 Preview 24º su 200 modelli vs Gemini 3.1 Pro Preview 69º su 200

• Prezzo per 1M di token — Step 5 Preview $1,00 in ingresso / $2,70 in uscita contro Gemini 3.1 Pro $2,00 in ingresso / $12,00 in uscita

• Sconto cache — Step 5 Preview 95% vs Gemini 3.1 Pro 90%

• Velocità di output — Step 5 Preview 99.8 tokens/sec vs Gemini 3.1 Pro 118.9 tokens/sec

• Tempo al primo token — Step 5 Preview 2,96 s vs Gemini 3.1 Pro 35,72 s

• Contesto — entrambi 1M token; il nostro catalogo elenca Gemini 3.1 Pro con un tetto di output di 65K, StepFun non ne ha pubblicato alcuno

• Modalità di input — Step 5 Preview: testo e immagine. Gemini 3.1 Pro: testo, immagine, audio, video e file. Entrambi generano solo testo.

• Pesi — Step 5 Preview chiude oggi, checkpoint BF16 previsto per il 15 ottobre; Gemini 3.1 Pro proprietario per tutta la durata

Un divario di 14 punti su una scala in cui il vertice della classifica si attesta a 53 è considerevole, e va segnalato accanto a ciò che lo rende strano: i numeri di valutazione pubblicati da Google stesso per questo modello sono eccellenti. Il fornitore dichiara 77,1% su ARC-AGI-2, 82,8% sulla sua suite multimodale, 94,1 su GPQA Diamond e 47,0 su Humanity's Last Exam. Non sono cifre deboli. Sono anche numeri di Google, eseguiti sugli harness di Google, e misurano capacità specifiche anziché l'aggregato che l'indice valuta. Entrambe le serie di numeri possono essere accurate contemporaneamente. Quando la valutazione di punta di un fornitore e un composito indipendente divergono in modo così netto, è sul composito che conviene pianificare un carico di lavoro in produzione, perché è quello che penalizza il modello per le cose che il fornitore non ha scelto di misurare.

Le due righe sulla velocità meritano di essere lette insieme anziché separatamente. Gemini 3.1 Pro genera token il 19% più velocemente una volta avviato — 118,9 contro 99,8 — e impiega 35,72 secondi per avviarsi, contro i 2,96 di Step 5 Preview. È il profilo di un modello che delibera prima di emettere. Per un processo batch in cui nessun umano è in attesa, il generatore più veloce vince in termini di throughput. Per un ciclo di agente che effettua decine di chiamate dipendenti, una differenza di dodici volte nel tempo al primo token è la differenza tra uno strumento interattivo e una coda.

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second, cost per Intelligence Index task $0.71, verbosity 160M output tokens, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

L'unico asse su cui Gemini vince nettamente

La modalità non è una nota a piè di pagina in questo confronto. Gemini 3.1 Pro accetta testo, immagini, audio, video e file arbitrari, mentre Step 5 Preview accetta testo e immagini. Se la tua pipeline prevede una registrazione dello schermo, una registrazione di una chiamata, un pacchetto PDF o un feed video, solo uno di questi due modelli può accettare l'input, e il divario di 14 punti nell'indice è irrilevante perché l'altro modello non può rispondere alla domanda.

Quell'asimmetria determina più carichi di lavoro reali di quanto facciano le tabelle di benchmark. La revisione video, l'analisi delle riunioni, la trascrizione audio più il ragionamento e i flussi di lavoro documentali basati su file scansionati sono tutti casi in cui l'ampiezza di Gemini 3.1 Pro lo rende l'unico candidato su questa pagina. È anche il motivo per cui il modello è rimasto in produzione per sette mesi con l'etichetta di anteprima: i carichi di lavoro che gestisce sono quelli in cui un modello più recente testo-e-immagine non può sostituirlo.

Per le attività su testo e immagini, il calcolo si inverte. Step 5 Preview è avanti di 14 punti sull'aggregato, è circa due volte più veloce sul prezzo di input e 4,4 volte più economico sull'output, e risponde in un dodicesimo del tempo. Su un carico di lavoro di estrazione da documenti o di chat su screenshot, non c'è motivo di pagare il sovrapprezzo e aspettare gli undici secondi in più di riflessione.

Dove il prezzo diventa meno piatto di quanto sembri

I prezzi in evidenza sottostimano la differenza, e la ragione è un confine di fascia piuttosto che una tariffa.

Le tariffe di $2,00 e $12,00 di Gemini 3.1 Pro valgono fino a 200.000 token di input. Oltre tale soglia, entrambe le tariffe passano a $4,00 e $18,00 — un aumento del 50% sull'output che si applica all'intera richiesta, non solo alla porzione oltre il limite. I $1,00 e $2,70 di Step 5 Preview non hanno una fascia pubblicata; il prezzo è quello a qualsiasi lunghezza consenta la finestra di contesto.

Entrambi i modelli pubblicizzano un contesto da 1M di token, quindi entrambi invitano a costruire pipeline a contesto lungo. Su uno dei due, una richiesta da 300.000 token costa il doppio di quanto suggerisca il listino prezzi; sull'altro no. Questo è un vantaggio strutturale per Step 5 Preview esattamente nella categoria per cui StepFun l'ha costruito — lavoro agentico a lungo orizzonte con un contesto ampio e referenziato ripetutamente — ed è amplificato dallo sconto cache, dove il 95% di Step 5 Preview contro il 90% di Gemini 3.1 Pro amplia ulteriormente il divario sul pattern di prefisso ripetuto che un ciclo dell'agente produce.

Calcolato all'incirca, e segnalato come aritmetica anziché come cifra citata: un ciclo di agente che invia un contesto di 250.000 token a ognuno dei quaranta turni equivale a dieci milioni di token di input. Alla tariffa oltre 200K di Gemini 3.1 Pro, con la cache che assorbe il prefisso ripetuto, si tratta di un aumento significativo rispetto a quanto implica la tariffa di listino di $2.00. Alla tariffa fissa di $1.00 di Step 5 Preview, con uno sconto cache più profondo, lo stesso ciclo costa meno e, cosa più importante, costa qualcosa che puoi prevedere dal listino prezzi senza leggere prima la tabella dei livelli.

Generated two-column comparison scoreboard titled 'Step 5 Preview vs Gemini 3.1 Pro — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, price $1.00 / $2.70, cache discount 95%, time to first token 2.96s, context 1M tokens with no published output cap, and input text and image. The right column gives Gemini 3.1 Pro Preview the rows AA Index 30, price $2.00 / $12.00, $4.00 / $18.00 above 200K input, cache discount 90%, time to first token 35.72s, context 1M tokens with a max output of 65K, and input text, image, audio, video and file. A footer reads 'Both per Artificial Analysis Intelligence Index v4.3.2; Gemini ARC-AGI-2 and multimodal figures are vendor-reported.'

La disponibilità è la differenza silenziosa

Gemini 3.1 Pro è richiamabile da sette mesi tramite l'API di Google e, cosa più utile per la pianificazione, tramite più provider indipendenti — ed è questo che rende significativa una cifra di latenza p50 anziché aneddotica. Step 5 Preview ha aperto la sua API il 20 settembre e ha esattamente una fonte. Un endpoint a fonte singola che ha pochi giorni è il componente meno prevedibile che si possa mettere su un percorso di produzione, non perché il modello sia scarso, ma perché nessuno conosce ancora la sua curva di capacità.

Questo è l'argomento a favore dell'instradamento invece della scelta. Gemini 3.1 Pro Preview è nel nostro catalogo a $2.00 e $12.00 con lo scatto di fascia riportato invariato, e i modelli con cui viene messo a confronto gli stanno accanto, dietro un'unica chiave per più di 200 modelli, con il prezzo di listino del fornitore riportato a ricarico 0%. Step 5 Preview non è in quell'elenco — gira sull'API di StepFun stessa e, finché i pesi non saranno disponibili, quello è l'unico posto in cui gira. Il failover automatico è ciò che rende una preview di pochi giorni sicura da provare anziché una scommessa: mantieni il percorso di produzione su un modello con un track record consolidato, invia il grosso di testo e immagini a Step 5 Preview mentre lo valuti sul tuo traffico reale, e lascia che il fallback regga quando l'endpoint della preview peggiora. Non c'è un secondo contratto né un SDK separato per i modelli che instradiamo, quindi un rincaro di Google compare sulla tua fattura come il numero corrente, non al rinnovo.

Screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview at www.orcarouter.ai/models/google/gemini-3.1-pro-preview, showing the model id google/gemini-3.1-pro-preview with Vision, Audio, Tools, JSON and Reasoning tags, a 1M-token context, a 65K max output and text output, input pricing of $2.00 and output pricing of $12.00 per million tokens, a p50 time to first token of 10.00 seconds, 109.7M tokens of traffic over seven days, and the endpoints and SDK snippets behind the OrcaRouter API.

Quale stai acquistando davvero

Se il tuo lavoro arriva sotto forma di video, audio o file, Gemini 3.1 Pro è l'unico modello in questa pagina in grado di accettarlo, e il divario nell'indice non entra nella decisione. Sette mesi in produzione con l'etichetta di anteprima ancora attaccata sono un segnale di stabilità, non un avvertimento: la convenzione di denominazione persiste perché Google non ha mai avuto bisogno di cambiarla, e il modello si comporta come il cavallo di battaglia produttivo che è.

Se il tuo lavoro consiste in testo e immagini in grandi volumi con un ampio contesto ripetuto, Step 5 Preview è in vantaggio su ogni metrica che conta — 14 punti indice, metà del prezzo di input, una tariffa di output inferiore di 4,4 volte, nessun salto di fascia, uno sconto sulla cache più profondo e un tempo al primo token misurato in secondi anziché in mezzo minuto. Quello che acquisti lì è un endpoint a singola fonte vecchio di pochi giorni, senza licenza pubblicata e senza un tetto di output pubblicato, il che è un rischio reale e circoscritto.

La cosa da tenere d'occhio non è l'indice. È se StepFun pubblichi un tetto di output insieme alla finestra di contesto da 1M token, perché l'annuncio del fornitore tace al riguardo e una configurazione separata di terze parti che ha circolato durante la fuga di notizie elencava 350.000 di contesto con un limite di output di 64.000 — un prodotto sostanzialmente diverso da quello nel listino prezzi. Il tetto di 65K di Gemini 3.1 Pro, come lo elenca il nostro catalogo, non è nemmeno generoso, ma è dichiarato, e un limite dichiarato è un limite attorno al quale si può progettare.