
Step 5 Preview vs DeepSeek V4 Pro: Uno è una promessa, l'altro è una licenza MIT
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Tutto in questo confronto ruota attorno a una domanda che non ha nulla a che vedere con i benchmark: cosa puoi effettivamente scaricare? DeepSeek V4 Pro — la versione che il fornitore ha distribuito come DeepSeek-V4-Pro-0813 il 13 agosto 2026 — è un modello mixture-of-experts da 1.600 miliardi di parametri con licenza MIT, con i pesi già disponibili su Hugging Face in questo momento. Step 5 Preview, che StepFun ha annunciato il 20 settembre 2026, è un MoE sparso da 600 miliardi di parametri che ottiene otto punti in più sulla stessa classifica indipendente e ha un repository Hugging Face contenente esattamente un file, .gitattributes. StepFun dice che il checkpoint BF16 arriverà il 15 ottobre. Quindi la forma onesta di questo confronto non è "quale modello è migliore". È "su quale dei due puoi costruire in questo trimestre, e quale stai aspettando".
Quella impostazione è meno entusiasmante di una gara di benchmark e considerevolmente più utile, perché il divario di otto punti e l’attesa di venticinque giorni non sono lo stesso tipo di fatto. Su uno dei due puoi già basare i tuoi piani oggi.
Otto punti, e i quattro che contano
Artificial Analysis sottopone entrambi i modelli a Intelligence Index v4.3.2 — dieci valutazioni — che è l'unico posto in cui questi due sono stati misurati dalla stessa mano.
• Indice di intelligenza — Step 5 Preview 44 vs DeepSeek V4 Pro 36
• Posizione in quella classifica — Step 5 Preview 24° su 200 vs DeepSeek V4 Pro 7° su 113 nella sua categoria
• Terminal-Bench 4.0 — Step 5 Preview 33,3%; DeepSeek V4 Pro non è presente nella stessa classifica, quindi non esiste una riga agentica confrontabile da citare
• Velocità di output — Step 5 Preview 99,8 token/sec vs DeepSeek V4 Pro 88,8 token/sec
• Tempo al primo token — Step 5 Preview 2,96 s vs DeepSeek V4 Pro 1,69 s
• Prezzo per 1M di token — Step 5 Preview $1,00 in / $2,70 out rispetto a DeepSeek V4 Pro $1,32 in / $3,96 out alla tariffa di punta di DeepSeek, che si dimezza a $0,66 / $1,98 off-peak
Sconto sulla cache — Step 5 Preview 95% vs DeepSeek V4 Pro 97%
• Contesto — entrambi 1M token; DeepSeek pubblica un limite di output di 384.000 token, StepFun non ne ha pubblicato uno
• Pesi — Step 5 Preview chiuso, checkpoint BF16 programmato per il 15 ottobre; DeepSeek V4 Pro MIT, scaricabile ora
Due righe contrastano con il titolo. DeepSeek V4 Pro risponde con il suo primo token in 1,69 secondi contro i 2,96 di Step 5 Preview — un vantaggio del 43% a ogni chiamata, che su un lungo ciclo di un agente si accumula fino a diventare tempo effettivo di orologio. E il suo sconto sulla cache è migliore di due punti, il che conta soprattutto per esattamente il carico di lavoro per cui entrambi questi modelli sono venduti: un agente che rispedisce lo stesso prompt di sistema e lo stesso contesto del repository a ogni turno vive quasi interamente all'interno di quello sconto.
Il divario aggregato di otto punti è reale, ed è anche più stretto di quanto otto punti lascino intendere. Un indice è un composito di dieci valutazioni, ed è nella composizione che i due modelli si separano. Il 33,3% di Step 5 Preview su Terminal-Bench 4.0 è un autentico risultato agentico; il punto di forza principale di DeepSeek V4 Pro è il ragionamento a lungo orizzonte a un prezzo che nessun altro nel segmento open-weights riesce a eguagliare. Nessuna delle due classifiche pubblica una riga in cui i due siano direttamente contrapposti, ed è questa la ragione onesta per cui questo confronto non può essere risolto con un singolo numero.

Cosa ti garantisce l'"open" quando il fornitore cambia idea
Ecco la parte di questo confronto che una scheda tecnica non può trasmettere, e vale la pena dichiararla con le date precise, perché è accaduto undici giorni prima che Step 5 Preview fosse annunciato.
DeepSeek ha comunicato agli utenti che avrebbe ritirato V4 Pro. Il 9 settembre l'azienda ha annunciato che le richieste sarebbero state indirizzate al più recente DeepSeek V4.1 Flash; il 10 settembre ha confermato la data fissandola alle 12:00 ora di Pechino del 14 settembre. L'11 settembre ha fatto marcia indietro: il servizio API di V4 Pro continua oltre il 14 settembre, con fatturazione invariata, stando alle parole di DeepSeek stessa. La stringa del modello, la finestra di contesto da 1M token e il limite di concorrenza di 500 richieste sono rimasti tutti invariati, e la pagina Models & Pricing di DeepSeek riporta la marcia indietro come nota a piè di pagina sulla riga deepseek-v4-pro.
Leggete questo come una dimostrazione di ciò da cui i pesi aperti vi proteggono davvero, e di ciò da cui non vi proteggono. L'API è stata quasi portata via da una decisione di pianificazione. I pesi non potevano esserlo. Un checkpoint con licenza MIT sul vostro hardware non ha un fornitore che possa annunciarne la dismissione, e questa è una garanzia di tipo diverso rispetto a una promessa di prezzo — non è affatto una promessa.
Che è esattamente la lacuna in cui si trova Step 5 Preview. StepFun si è impegnata a rilasciare il 15 ottobre il checkpoint BF16, e il nome del repository che ha già riservato — stepfun-ai/Step-5-Preview-BF16 — è il formato da cui si esegue il fine-tuning e la quantizzazione, nominato al momento della creazione e riempito in seguito. Questo è un segnale di pianificazione, non un artefatto. Finché il repository non contiene qualcosa di diverso da un .gitattributes, Step 5 Preview è un modello che si affitta, secondo i termini di un unico fornitore, senza licenza di lettura e senza alcun fallback se i termini cambiano.
I due modi per essere l'opzione economica
Entrambi questi modelli offrono prezzi ampiamente inferiori a quelli della frontiera chiusa, e i meccanismi non sono gli stessi, il che è rilevante per quanto il prezzo possa durare.
DeepSeek V4 Pro è economico perché un laboratorio ha pubblicato i pesi e un mercato di serving competitivo ne ha eliminato il margine. Questo è un limite strutturale: chiunque può servire il checkpoint, quindi il prezzo è determinato dal costo di un'ora-GPU anziché dalla strategia di prezzo di un'azienda. L'API di DeepSeek stessa lo prezza in due fasce — 1,32 $ e 3,96 $ durante le ore di punta, la metà fuori da esse — e la fascia di punta è ristretta, poche ore al mattino nei giorni feriali in UTC, quindi la maggior parte del traffico ricade sulla tariffa più economica e i weekend non vedono mai quella più alta.
Step 5 Preview è economico perché StepFun ha deciso di prezzarlo in quel modo. C'è un solo endpoint, un solo listino prezzi e nessuna seconda fonte. Non è un'accusa — un modello sparse 600B/27B costa davvero meno da servire di quanto il suo numero di parametri suggerisca, e il rapporto dei parametri attivati è il motivo. È semplicemente un tipo diverso di prezzo, e la differenza si manifesta il giorno in cui StepFun decide che l'anteprima ha fatto il suo lavoro.
Il divario di prezzo tra i due è abbastanza piccolo da non dover decidere nulla: $1,00 e $2,70 contro $1,32 e $3,96 è una differenza del 24% sull'input e del 32% sull'output, ben all'interno dell'intervallo che uno sconto sulla cache, una differenza di lunghezza dell'output o un tasso di retry possono cancellare. Sulla questione della verbosità i due sono vicini — Step 5 Preview ha generato 160M di token di output nell'esecuzione dell'indice contro una mediana di 92M, e la run di DeepSeek V4 Pro è nella stessa fascia. Nessuno dei due è un modello parsimonioso, ed entrambi vengono venduti come economici per token anziché per attività.

Dove ognuno trova il suo posto in uno stack reale
Se hai bisogno di un modello che puoi mettere a punto, quantizzare, ospitare nel tuo VPC, o consegnare a un team legale con un file di licenza che possa leggere, questa non è una decisione da prendere alla leggera e non riguarda i benchmark. DeepSeek V4 Pro è disponibile con licenza MIT oggi. Step 5 Preview non ha licenza, né configurazione, né file di parametri, e la prima data su cui puoi pianificare è metà ottobre. Il divario di otto punti nell'indice non cambia questa aritmetica, perché un modello che non puoi scaricare non può essere distribuito.
Se quello che vuoi è il risultato agentico più potente disponibile a un dollaro per milione di token di input, Step 5 Preview è in vantaggio sull'unica classifica che li ha misurati entrambi, ed è la scelta predefinita migliore per il lavoro per tentativi ed errori che riempie gran parte di un ciclo agentico — estrazione, classificazione, scaffolding dei test, le chiamate di routine tra i due che contano. I suoi 99,8 token al secondo completano inoltre l'output più velocemente degli 88,8 di DeepSeek V4 Pro, il che accorcia il ciclo stesso e non solo la bolletta.
Il caso scomodo è quello in cui si trovano realmente la maggior parte dei team: vuoi il numero di Step 5 Preview, ma non puoi mettere su un percorso di produzione un endpoint di preview aperto il giorno del lancio, senza alcun limite di output pubblicato. È un problema di routing, ed è quello su cui si chiude questo confronto. DeepSeek V4 Pro è raggiungibile tramite OrcaRouter a $0,66 e $1,98 per milione di token, la metà off-peak della tariffa di DeepSeek di $1,32 e $3,96, insieme ai modelli di testo che lo circondano — dietro un'unica chiave per oltre 200 modelli con 0% di markup, così una revisione dei prezzi di DeepSeek arriva sulla tua fattura lo stesso giorno anziché al rinnovo. Indirizza la fetta esplorativa del traffico verso la preview e mantieni il percorso di produzione sul modello che ha una licenza alle spalle, con il failover automatico tra provider che svolge il lavoro reso necessario dalla curva di capacità di un endpoint di preview.

Cosa lo risolverebbe
Tre cose, e tutte e tre sono verificabili anziché opinabili.
Il primo è la licenza. Quando arriva il checkpoint BF16, cosa dice il repository che un'azienda è autorizzata a farne? Una licenza permissiva colma da sola gran parte di questo divario, perché rende il vantaggio di otto punti qualcosa che puoi possedere invece che affittare. Una restrittiva lascia DeepSeek V4 Pro come l'unico modello della coppia su cui puoi davvero costruire un prodotto.
Il secondo è il tetto di output. DeepSeek dichiara 384.000 token. L'annuncio di StepFun parla di 1M di contesto e non menziona un limite di output, e una configurazione separata di terze parti che ha circolato durante la fuga di notizie indicava 350.000 di contesto con un massimo di output di 64.000. Per il lavoro agentico a lungo orizzonte per cui entrambi i modelli vengono venduti, quel numero non è una nota a piè di pagina.
Il terzo è se il prezzo regge una volta rimosso il suffisso Preview. Un prezzo di anteprima è un numero di acquisizione clienti; un prezzo di rilascio è un modello di business. Il floor di DeepSeek V4 Pro è fissato da un mercato competitivo di serving e non può muoversi molto. Quello di Step 5 Preview può muoversi di martedì.
Finché non si è risposto alle prime due, la lettura pratica è che DeepSeek V4 Pro è il modello da mettere in produzione e Step 5 Preview è il modello su cui fare benchmark — con l'avvertenza che un endpoint di anteprima vecchio di appena qualche giorno, posizionato otto punti sopra un flagship maturo con licenza MIT, è un risultato reale, ed è il motivo per cui il 15 ottobre merita una nota in calendario anziché un'alzata di spalle.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
