
Step 5 Preview vs Claude Opus 5: sette punti indice per sette volte il conto
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Il materiale di lancio di StepFun per Step 5 Preview si apre con un'unica affermazione comparativa: un singolo task su di esso costa un ottavo dello stesso task su Claude Opus 5. Entrambi i modelli ora si trovano sulla stessa classifica indipendente, quindi quell'affermazione può essere verificata invece che dibattuta. Artificial Analysis li ha sottoposti entrambi a Intelligence Index v4.3.2 — dieci valutazioni — e ha pubblicato quanto è costata ciascuna esecuzione, con Claude Opus 5 valutato alla propria impostazione di massimo sforzo di ragionamento. Step 5 Preview: 44 sull'indice, $922,84 per completare l'esecuzione. Claude Opus 5: 51 sull'indice, $7.274,74. Sono 7,9 volte il denaro per 7 punti di punteggio, e il rapporto citato da StepFun risulta essere quello accurato. Ciò che il rapporto nasconde è la parte interessante, perché il divario non è principalmente un divario di prezzo. È un divario di verbosità che indossa gli abiti di un divario di prezzo, e separare i due cambia quale modello dovresti mettere davanti a quale carico di lavoro.
Due costi di esecuzione, una scheda e cosa c'è davvero al loro interno
Il costo totale di esecuzione è il confronto singolo più pulito disponibile qui, perché entrambi i modelli hanno risposto alle stesse domande con lo stesso harness, e nessuno dei due fornitori ha prodotto il dato. È anche il dato che più facilmente può essere frainteso, quindi vale la pena approfondirlo.
• Punteggio dell'indice — Step 5 Preview 44 vs Claude Opus 5 51, Claude Opus 5 ha ottenuto il punteggio con la sua impostazione di massimo sforzo di ragionamento
• Costo totale per completare l'indice — Step 5 Preview $922,84 vs Claude Opus 5 $7.274,74
• Prezzo misto con un mix 7:2:1 di cache-hit / input / output — Step 5 Preview 0,51 $ per 1M di token rispetto a Claude Opus 5 3,85 $
• Token di output generati durante l'esecuzione dell'indice — Step 5 Preview 160M vs Claude Opus 5 140M
Prezzo di listino — Step 5 Preview 1,00 $ in input / 2,70 $ in output vs Claude Opus 5 5,00 $ in input / 25,00 $ in output
Osserva insieme le righe tre e cinque e l'aritmetica smette di essere un semplice confronto di prezzi. La tariffa mista di Step 5 Preview è 7,5 volte più economica, e la tariffa di listino è 5 volte più economica sull'input e 9,3 volte più economica sull'output — quindi la combinazione mista fa un lavoro che il prezzo dell'input non fa. Questo perché la combinazione è ponderata verso l'output, ed è sull'output che i due modelli divergono di più. Claude Opus 5 costa 9,3 volte la tariffa di output di Step 5 Preview, ed entrambi i modelli scrivono moltissimo: 140M token di output per Claude Opus 5 contro una mediana di 92M tra i modelli che l'indice valuta, e 160M per Step 5 Preview contro la stessa mediana di 92M.
Quindi la lettura onesta è più ristretta di «il modello economico è un affare». Step 5 Preview costa meno su ogni fronte, e non è un modello parsimonioso: scrive il 74% di output in più rispetto al modello mediano con cui viene confrontato, che è esattamente il comportamento che il prezzo dovrebbe punire. Claude Opus 5 scrive il 52% in più rispetto alla mediana e fa pagare 9,3 volte tanto per ciascuno di quei token. Chi limita la lunghezza dell'output ottiene un rapporto diverso da chi non lo fa.
La domanda non è quale sia migliore. È dove si trova il punto di crossover.
Supponiamo che l'indice sia un proxy ragionevole per il lavoro che effettivamente inviate — attività agentiche a lungo orizzonte, codice, uso di strumenti in più passaggi. Allora il crossover è semplice da enunciare: Claude Opus 5 deve essere almeno 7,9 volte più utile per attività prima che valga il suo costo, e sull'indice è migliore di 7 punti su una scala di 100. Questi due fatti non devono necessariamente puntare nella stessa direzione, perché un divario di 7 punti sull'indice non equivale a essere migliori del 16% in tutto. È l'aggregato di dieci valutazioni, e la composizione conta più del totale.
Questo è l'argomento a favore dell'attenzione alla forma dei due punteggi piuttosto che al titolo. La lettura di Terminal-Bench 4.0 di Step 5 Preview è del 33,3% — un risultato agentico reale, superiore a DeepSeek V4.1 Flash al 26,8% — ma nulla nel registro pubblicato mostra ancora che eguagli Claude Opus 5 nelle valutazioni a lungo orizzonte, quelle in cui il modello di Anthropic è più forte. I materiali di StepFun stessi lo ammettono nella formulazione: su ALE-CLI, FrontierFinance e DRACO, l'azienda colloca Step 5 Preview al secondo posto, dietro a GPT-6 Astra o a Claude Opus 5, e davanti agli altri modelli aperti del confronto. Il secondo posto a un quinto del prezzo è un risultato davvero buono. Inoltre non è il primo posto, e i compiti in cui un modello arriva secondo sono di solito quelli che avrebbero avuto bisogno del primo.
L'altra asimmetria è ciò che accade in caso di chiamata errata. Una risposta sbagliata di un modello economico che ha impiegato quattro secondi e 2.000 token ti costa il nuovo tentativo; la stessa risposta sbagliata di Claude Opus 5 a 25 dollari per milione di token in output ti costa il nuovo tentativo più la riflessione. Se la tua pipeline riprova in caso di errore — la maggior parte dei cicli agentici lo fa — il costo effettivo per attività riuscita è il numero che conta, e non ha lo stesso rapporto del prezzo di listino, perché i due modelli non falliranno allo stesso tasso. Nessuno ha ancora pubblicato quel numero per Step 5 Preview.

Il contrasto tra le specifiche, dimensione per dimensione
• Punteggio dell'indice — Step 5 Preview 44 vs Claude Opus 5 51, entrambi su Intelligence Index v4.3.2, Claude Opus 5 alla sua impostazione massima di sforzo di ragionamento
Prezzo per 1M di token — Step 5 Preview 1,00 $ input / 2,70 $ output vs Claude Opus 5 5,00 $ input / 25,00 $ output
• Sconto cache — Step 5 Preview 95% vs Claude Opus 5 90%
• Contesto — entrambi 1M token; StepFun non ha pubblicato un tetto di output e quello di Anthropic è 128K
• Input — entrambi accettano testo e immagini; entrambi restituiscono solo testo
• Velocità di output — Step 5 Preview 99,8 token/sec vs Claude Opus 5 55,3 token/sec
• Superficie di controllo — Step 5 Preview espone il pensiero esteso; Claude Opus 5 sostituisce temperature e top_p con un selettore adattivo dello sforzo di ragionamento
• Pesi — Step 5 Preview chiuso oggi, checkpoint BF16 previsto per il 15 ottobre; Claude Opus 5 interamente proprietario.
• Evidenza indipendente — entrambi valutati da Artificial Analysis; le righe del benchmark agentico di StepFun sono eseguite dal fornitore e non riprodotte
Due righe meritano una nota. Il divario di velocità è reale e, in pratica, più ampio di quanto suggerisca la tabella: 99,8 token al secondo contro 55,3 è un modello che termina all’incirca due volte più in fretta lo stesso output, e il tempo al primo token di Step 5 Preview, 2,96 secondi, contro i 56,84 secondi di Claude Opus 5 sulla stessa board è una cosa di ordine diverso — anche se quella seconda cifra misura la configurazione di ragionamento a sforzo massimo, in cui il modello delibera prima di emettere qualsiasi cosa. Non è la latenza che vede una chiamata in produzione. Rispetto all’endpoint standard, il nostro catalogo riporta un tempo al primo token p50 di 6,73 secondi per Claude Opus 5, che è il numero su cui pianificare se non stai deliberatamente chiedendo la massima deliberazione.
La riga dello sconto cache è quella che decide silenziosamente i carichi di lavoro ripetuti, e favorisce Step 5 Preview, dal 95% al 90%. Un loop di agente che rinvia lo stesso prompt di sistema e lo stesso contesto del repository a ogni chiamata vive quasi interamente in quello sconto, quindi una differenza di cinque punti si accumula nel corso di una lunga sessione.

Dove Claude Opus 5 è ancora l'unica risposta
Nulla di quanto sopra depone contro il modello di Anthropic. Costa quanto costa perché fa ciò che l'indice cerca di misurare, e lo fa vicino alla vetta della classifica — 51 su Intelligence Index v4.3.2, sette punti di vantaggio su Step 5 Preview e a portata dei leader della generazione attuale. I carichi di lavoro in cui un divario aggregato di 7 punti sottostima la differenza sono quelli che non tollerano una risposta di seconda scelta: un refactoring di più ore in cui la modalità di errore è un sottile cambiamento di comportamento, un modello finanziario in cui la catena di ragionamento deve essere verificabile, una migrazione in cui una decisione sbagliata viene scoperta una settimana dopo. In questi casi, il nuovo tentativo non è economico e la ponderazione è il prodotto.
I carichi di lavoro in cui il divario è irrilevante sono quelli costruiti su molte piccole decisioni: passaggi di classificazione e instradamento, estrazione, sintesi, scaffolding di test, le mille chiamate che un agente effettua tra le due chiamate che contano davvero. Su quelli, un modello a 44 che risponde in metà del tempo a un quinto del prezzo dell'input non è un compromesso. È il default corretto, con il modello costoso riservato al passaggio che deve essere giusto.
Eseguire lo split senza eseguire due integrazioni
La versione pratica di questo confronto è una pipeline a livelli, e il motivo per cui i team non ne costruiscono una è l'approvvigionamento più che l'ingegneria — due fornitori, due contratti, due SDK, due chiavi da ruotare. Claude Opus 5 è nel nostro catalogo a 5,00 $ e 25,00 $, e i modelli testuali più economici che mettereste davanti a esso sono nello stesso catalogo, tutti dietro un'unica chiave per più di 200 modelli, con il prezzo di listino del fornitore passato tal quale a 0% di ricarico. Step 5 Preview non è in quell'elenco — gira sull'API proprietaria di StepFun e, finché i pesi non saranno disponibili, è l'unico posto in cui gira. Comporre la struttura a livelli tra i modelli che instradiamo davvero è un'espressione in un DSL di routing anziché una modifica al codice — inviare le chiamate di routine al modello piccolo, escalare a quello costoso in base a una condizione di confidenza o complessità, e mantenere entrambe le diramazioni dietro lo stesso endpoint.
Il failover automatico qui conta per un motivo specifico, non come funzionalità generica. Step 5 Preview ha aperto la sua API il giorno dell'annuncio senza pesi pubblicati e senza una flotta di serving divulgata; è un endpoint di anteprima vecchio di pochi giorni, e gli endpoint di anteprima hanno vincoli di capacità che quelli maturi non hanno. Claude Opus 5 è servito da molti provider indipendenti, ovvero la ridondanza che un'anteprima non può offrire. Mantenere un modello collaudato come gamba di fallback — dalla nostra parte questo significa un modello di produzione del catalogo, non l'anteprima — è il modo per ottenere un segnale di qualità reale sul proprio workload senza rendere il percorso di produzione dipendente da una flotta ancora in fase di dimensionamento.

La regola di decisione
Se il tuo carico di lavoro è composto da un piccolo numero di attività molto difficili, Claude Opus 5 non è l'opzione costosa — è quella economica, perché la seconda risposta migliore costa più della differenza. Se il tuo carico di lavoro è composto da un gran numero di attività ordinarie con, al suo interno, un piccolo numero di attività difficili, Step 5 Preview a $1.00 e $2.70 con uno sconto del 95% sulla cache è la scelta predefinita migliore, e il divario di 7 punti è per lo più un errore di arrotondamento su un lavoro che non ne aveva bisogno.
Ciò che cambierebbe quel calcolo sono prove indipendenti sui tassi di fallimento e sulle righe agentiche a lungo orizzonte. I numeri di StepFun collocano il modello al secondo posto nelle valutazioni su cui ha costruito il lancio, e nessuna terza parte li ha riprodotti. Tieni d'occhio il checkpoint del 15 ottobre per due cose: se la licenza consente il fine-tuning che ti permetterebbe di colmare un divario di 7 punti sui tuoi dati, e se la verbosità regge una volta che il suffisso preview viene rimosso. Il primo cambierebbe il rapporto; il secondo l'ha già spostato una volta.
