Scheda del titolo generata per Step 5 Preview vs NVIDIA Nemotron 3 Ultra 550B A55B con la scritta "ventuno punti indice per venti centesimi", con tre chip statistici: Artificial Analysis Intelligence Index 44 contro 23, prezzo di output $2,70 contro $2,50 per milione di token, e costo per attività indice $1,03 contro $0,60. Il logo OrcaRouter si trova in una striscia bianca in basso a destra.
Guides & Insights

Step 5 Preview vs Nemotron 3 Ultra: ventuno punti indice per venti centesimi

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Uno di questi modelli lo puoi scaricare oggi pomeriggio, ed è quello che perde di ventuno punti. Step 5 Preview, l'ammiraglia closed di StepFun, ha aperto la sua API il 20 settembre 2026 e non ha alcun file di licenza che tu possa tenere in mano; NVIDIA Nemotron 3 Ultra 550B A55Bè su Hugging Face dal 4 giugno 2026 con una licenza permissiva e le sue ricette di addestramento allegate. Sull'Artificial Analysis Intelligence Index la coppia riporta 44 contro 23. Sul prezzo di output riporta 2,70 $ contro 2,50 $ per milione di token. Ventuno punti per venti centesimi non è un confronto che si risolva in modo netto in una direzione o nell'altra, ed è per questo che vale la pena farlo come si deve invece di scorrere le due colonne di titoli e schierarsi.

Nessuno dei due è un lancio questa settimana, e questo conta per come leggi i numeri qui sotto. Entrambi sono richiamabili da mesi, entrambi sono passati attraverso lo stesso harness indipendente, e nessuno dei due ha una variazione di listino nella finestra. Ciò che è cambiato è più piccolo e più interessante: l'indice su cui vengono valutati è stato ricostruito a settembre, e adesso i due vengono giudicati rispetto a due mediane diverse, tratte da due popolazioni diverse. È qui che questo confronto viene effettivamente deciso.

Due tipi molto diversi di prodotto

Leggi le schede tecniche una accanto all'altra e la prima cosa che si nota è che appartengono a malapena alla stessa categoria di cose.

• Parametri — Step 5 Preview è di circa 600 miliardi in totale con 27 miliardi attivi per token secondo la documentazione di StepFun stessa; Nemotron 3 Ultra è di 550 miliardi in totale con 55 miliardi attivi, secondo la cifra che il comitato indipendente registra in relazione alla sua configurazione.

• Architettura — StepFun non pubblica una descrizione della struttura interna di Step 5 Preview. La scheda di NVIDIA documenta un approccio ibrido: livelli Mamba-2 intercalati, livelli di attenzione selezionati, un'organizzazione LatentMoE e teste Multi-Token Prediction.

• Finestra di contesto — 1M token nella tabella delle specifiche di Step 5 Preview, con un output massimo di 64.000 token, anch'esso documentato da StepFun. Nemotron 3 Ultra è registrato a 262.144 token dal valutatore che lo ha eseguito; la scheda del fornitore pubblicizza fino a 1M, raggiungibile tramite una configurazione di serving anziché per impostazione predefinita.

• Input — testo, immagini e video su Step 5 Preview, fino a 60 immagini per richiesta e file MP4 inferiori a 128MB. Solo testo su Nemotron 3 Ultra.

• Controllo del ragionamento — un'impostazione documentata dello sforzo basso, medio e alto sul lato StepFun; un flag del template di chat sul lato NVIDIA che attiva o disattiva la traccia di pensiero.

• Pesi — nessuno pubblicato per Step 5 Preview, che è proprietario e solo API, con un checkpoint BF16 che StepFun ha detto che seguirà il 15 ottobre 2026. Nemotron 3 Ultra viene distribuito con build BF16 e NVFP4 e un modello di ricompensa GenRM su Hugging Face sotto OpenMDW-1.1.

• Soglia minima di deployment — non applicabile per il modello API; otto GPU di classe B200 o GB200, oppure sedici H100, sul modello aperto, secondo la linea minima del fornitore.

• Tariffario — $1,00 di input, $0,10 in caso di cache hit e $2,70 di output per Step 5 Preview, dalla pagina dei prezzi in inglese di StepFun. Circa $0,60 di input, $0,16 in caso di cache hit e $2,50 di output per Nemotron 3 Ultra, e nota attentamente da dove proviene questa coppia: NVIDIA non pubblica alcun tariffario, quindi si tratta del prezzo osservato del provider che il comitato indipendente registra, non un dato del fornitore.

La riga che la maggior parte delle persone considera decisiva è la prima, ed è la meno informativa delle otto. I due totali si collocano entro il nove per cento l'uno dall'altro, mentre i parametri attivi differiscono di un fattore due, e sono i parametri attivi a determinare il costo computazionale di ogni token generato. Nessuno dei due valori lascia prevedere un divario di ventuno punti.

Generated two-column comparison scoreboard for Step 5 Preview and NVIDIA Nemotron 3 Ultra 550B A55B across six shared rows: Artificial Analysis Intelligence Index 44 against 23; output price $2.70 against $2.50 per million tokens; cost per index task $1.03 against $0.60; output speed 87 against 135.6 tokens per second; weights, 'none, BF16 checkpoint promised 15 October' against 'BF16 and NVFP4 on Hugging Face today'; and input, 'text, image and video' against 'text only'. A footer reads that index, speed and cost-per-task figures are per Artificial Analysis and that the Nemotron rate is the recorded provider listing rather than a vendor rate card. The OrcaRouter logo sits in a white strip at the bottom right.

La mediana è una scelta fatta prima di leggere il punteggio

Il consiglio indipendente non valuta i modelli secondo un unico campo. Li suddivide in categorie — e la categoria in cui ricade un modello cambia la frase stampata sotto il suo punteggio, senza modificare il punteggio.

Step 5 Preview è inserito nella classe di ragionamento generale, che la classifica conteggia in 227 modelli, e la sua mediana dei modelli comparabili è 26. Nemotron 3 Ultra è inserito nella classe open-weights, conteggiata in 117 modelli, dove la mediana è 18. Quindi la stessa classifica descrive 44 come "ben al di sopra della media" e 23 come "al di sopra della media", ed entrambe le descrizioni sono vere, perché 44 è diciotto punti al di sopra della sua mediana e 23 è cinque punti al di sopra della propria.

Non è un trucco e non è la classifica a essere ingiusta. È il modo corretto di presentare un modello aperto — si confronta un checkpoint scaricabile con altri checkpoint scaricabili, perché un team che può solo fare un download non sta scegliendo tra i 227. Ma significa che chiunque citi "sopra la media" riguardo a Nemotron 3 Ultra e "sopra la media" riguardo a un 44 sta confrontando tra loro due frasi diverse. Se vuoi un solo numero per la coppia, usa l'indice grezzo e accetta il divario di ventuno punti; se vuoi la decisione, usa la classe e ammetti di aver già scelto il tuo campo.

Screenshot of the Artificial Analysis model page for Nemotron 3 Ultra 550B A55B (Reasoning), showing an Intelligence Index of 23 in a class of 117 open-weights models with a comparable-model median of 18, pricing of $0.60 per million input tokens and $2.50 per million output tokens with a 73 percent cache discount, an average cost of $0.60 per index task, 110 million output tokens generated during the run against a 140 million median, 135.6 output tokens per second, and a 262,144-token context window.

Che cosa ha misurato un unico harness su entrambi

Le tabelle dei fornitori non possono essere sottratte l'una dall'altra, perché StepFun e NVIDIA hanno eseguito suite diverse in giorni diversi e i materiali di NVIDIA non contengono ogni benchmark riportato da StepFun. Il terreno onesto è l'intersezione: ciò che un singolo valutatore ha eseguito su entrambi.

Sull'Artificial Analysis Intelligence Index quell'intersezione è 44 contro 23. Sul costo per attività completata dell'indice è 1,03 $ contro 0,60 $. Sulla velocità di output si inverte, e nettamente: 87 token al secondo per Step 5 Preview contro 135,6 per Nemotron 3 Ultra, quindi il modello che ottiene un punteggio quasi doppio è quello che risponde con circa mezzo secondo di generazione in più per token.

La riga singola più netta è Terminal-Bench 4.0. Su quella prova, Step 5 Preview ottiene il 33,3 per cento. Nemotron 3 Ultra ottiene lo 0,5 per cento. Non è un artefatto di arrotondamento da nessuna delle due parti e non è un divario sottile — su quella specifica suite agentica per terminale, il modello di punta open-weight di fatto non compare. La trappola è che la stessa classifica riporta anche lo stesso modello al 53,9 per cento su Terminal-Bench 2.1. Due benchmark con un nome quasi identico, due generazioni diverse della stessa famiglia di attività, e un modello che si attesta al 53,9 su quello più vecchio e allo 0,5 su quello più nuovo. Se vi è stato citato un numero di Nemotron intorno ai cinquanta, è da lì che proviene, e non è la suite attuale.

Un accordo merita una menzione proprio perché è raro. La scheda di NVIDIA stessa dichiara 87,0 per cento su GPQA senza strumenti; l'esecuzione indipendente ha misurato 86,7 per cento. Che un numero del fornitore e un numero esterno si attestino a tre decimi di punto di distanza è ciò che contraddistingue una tabella di valutazione affidabile, e rende lo 0,5 per cento su Terminal-Bench 4.0 più facile da accettare come reale anziché come errore del valutatore.

Dove vanno davvero i soldi in una corsa all'indice

I prezzi per token predicono molto poco su quanto costa un carico di lavoro, e questa coppia lo dimostra meglio di molte altre. La classifica pubblica la scomposizione dei costi per l'intera esecuzione dell'indice di ciascun modello, e per entrambi la voce dominante non è la generazione.

Il costo per attività di Step 5 Preview, pari a $1,03, si suddivide in $0,85 di input e $0,17 di output. All'interno della cifra relativa all'input, $0,62 sono letture dalla cache, $0,22 sono scritture nella cache e solo $0,014 è input nuovo, non memorizzato nella cache. All'interno della cifra relativa all'output, $0,12 è la traccia di ragionamento e $0,06 è la risposta finale.

I $0,60 per task di Nemotron 3 Ultra si dividono in $0,53 di input e $0,07 di output, e la composizione all'interno della voce di input è quasi l'immagine speculare: $0,48 di scritture in cache contro appena $0,04 di letture in cache.

Ne derivano due conclusioni. La prima è che, in una valutazione a lungo orizzonte con forte riutilizzo del prefisso, circa l'ottanta percento di ciò che paghi si trova sul lato input del bilancio, il che rende il tasso di hit della cache e la disciplina del contesto i numeri da ottimizzare, anziché la lunghezza dell'output. La seconda è che i due modelli arrivano ai loro costi in modo diverso: Step 5 Preview paga per rileggere un ampio prefisso condiviso, mentre Nemotron 3 Ultra paga per scrivere contenuto distinto nella cache fin dall'inizio. Costo nominale simile, due fatture diverse — e se il tuo carico di lavoro assomiglia più a uno di questi schemi che all'altro, l'ordine a $1.03 e $0.60 può invertirsi.

Le cifre sulla verbosità spiegano il resto della riga di output. Step 5 Preview ha generato circa 160 milioni di token di output attraverso la suite di indici, rispetto a una mediana di 82 milioni, che la scheda descrive senza mezzi termini come molto prolisso. Nemotron 3 Ultra ha generato 110 milioni rispetto a una mediana di 140 milioni, che definisce piuttosto conciso. Il modello più economico è quello conciso, ed è conciso nella direzione che conta per una fattura.

Screenshot of StepFun's English documentation page for Step 5 Preview showing the specification table - model ID step-5-preview, a 1M-token context window, text, image and video input with text output, a 1M maximum input and a 64k maximum output - together with the input and video format notes listing JPG, JPEG, PNG, WebP and static GIF at up to 60 images per request and MP4, QuickTime and Matroska video under 128MB per file.

Cosa si ottiene con il download, e quanto costa mantenerlo

Il prezzo di Nemotron 3 Ultra non è 2,50 $ per milione di token di output se prendi il checkpoint. Quello è il prezzo per affittare il deployment di qualcun altro. Se scegli il download, hai acquistato un diverso insieme di costi e un diverso insieme di diritti.

I diritti sono concreti e sono la parte che un modello solo API non può eguagliare a nessun prezzo. OpenMDW-1.1 viene fornito con i pesi, e NVIDIA pubblica le raccolte di dati di pre-training e post-training e le ricette di addestramento insieme ad essi. Esiste una build NVFP4 che, per lo stesso modello, è all'incirca metà della dimensione, e i pesi Ultra sono stati pre-addestrati con una ricetta NVFP4 anziché quantizzati successivamente — ed è per questo che la build piccola è un artefatto di prim'ordine sulla scheda anziché un esperimento della community. La posizione commerciale è dichiarata chiaramente: pronta per l'uso commerciale e non commerciale.

I costi sono altrettanto concreti. Il deployment minimo è di otto GPU di classe B200 o sedici H100, e quella è la soglia minima indicata dalla scheda, non un suggerimento. La finestra di contesto che si ottiene effettivamente dipende da come si configura il serving, con 256K come impostazione predefinita e 1M dietro un'impostazione esplicita. Un team che non può impegnare un rack non sta scegliendo tra questi due modelli a $1,00 e $0,60 di input; sta scegliendo tra un modello e un ordine di acquisto.

Esiste una versione di questo confronto in cui il modello aperto vince sull'asse di cui le persone dicono di preoccuparsi e che raramente quantificano — la dipendenza. Step 5 Preview è un endpoint che chiami e un fornitore di cui ti fidi, con un checkpoint promesso anziché rilasciato. Se StepFun rivede il suo listino, stringe i suoi limiti, depreca l'ID o passa una brutta settimana, la tua unica leva è la tua gestione degli errori. I pesi di Nemotron 3 Ultra sono già su disco nel cluster di qualcuno, e questo vale qualcosa di reale anche mentre lo stesso modello perde di ventuno punti indice.

Vale la pena essere precisi su cosa significhi "promesso" dall'altra parte, perché il quadro è più confuso di quanto ammetta l'uno o l'altro schieramento. Diversi mirror di terze parti di una build BF16 sono comparsi su Hugging Face il 20 settembre, il giorno in cui è stata aperta l'API; alcuni superavano abbondantemente il terabyte di safetensors. Si tratta di ricaricamenti della community, non di un rilascio del fornitore, e StepFun non ha pubblicato alcun annuncio sugli open-weights insieme a essi. Ciò che stabiliscono è che i pesi stanno circolando e che il checkpoint promesso per il 15 ottobre sarebbe una formalizzazione più che una divulgazione.

Un numero che si è spostato mentre lo stavamo leggendo

Una cifra in questo pezzo è cambiata tra due letture della stessa pagina, e vale la pena segnalarlo perché è esattamente così che un confronto invecchia in sordina.

Il consiglio indipendente ha mostrato un costo di 0,71 $ per attività dell'indice per Step 5 Preview in una copertura datata 9 ottobre 2026. Riletta il 10 ottobre, la stessa pagina indica 1,03 $. Nulla è cambiato nel modello in quella finestra, perché nulla può cambiare nei pesi di un modello disponibile solo tramite API nel giro di una notte. Ciò che è cambiato è la contabilità della valutazione: quando il prezzo della cache di un fornitore si muove, quando il valutatore rivede le proprie ipotesi di lettura della cache, o quando un'esecuzione viene ricalcolata rispetto a una diversa composizione di token, la cifra per attività si muove e il punteggio dell'indice no.

Quindi considera il costo per attività come un numero vivo, con una data impressa sopra, piuttosto che come una proprietà del modello. Ogni cifra per attività in questo articolo è la lettura del 10 ottobre ed è etichettata come tale. Se stai costruendo un budget da questa pagina, costruiscilo a partire da una cifra che ricavi tu stesso il giorno in cui ti impegni — e se stai confrontando due resoconti di settimane diverse, controlla le date di rilevazione prima di concludere che un modello è diventato più economico.

Quale chiameresti davvero?

Diciamo prima la parte scomoda: OrcaRouter non instrada nessuno di questi due modelli. Step 5 Preview è raggiungibile tramite l'API proprietaria di StepFun e una manciata di piattaforme di terze parti, mentre Nemotron 3 Ultra viene servito dagli endpoint proprietari di NVIDIA e da diversi provider, e puoi verificare entrambe le affermazioni sul nostro catalogo nello stesso minuto in cui le leggi.

Ciò che rimane è la forma della dipendenza anziché la scelta del modello, ed è l'unico punto in cui un livello di routing qui si ripaga. Un'anteprima solo API su un percorso di un singolo fornitore è esattamente la situazione in cui un pomeriggio storto presso il provider diventa un'interruzione del tuo servizio, e l'assicurazione a basso costo è un piano di controllo che può eseguire il failover di una richiesta verso un fallback qualificato nel momento in cui un percorso del provider peggiora. È a questo che il failover automaticoserve: non come sostituto di Step 5 Preview, ma come ciò che metti davanti ai modelli che puoi effettivamente chiamare, così che un endpoint specifico del fornitore non sia mai l'unica strada verso la produzione. Lo stesso catalogo che fa questo contiene oltre 200 modelli dietro una sola chiave e una sola fattura, con il prezzo di listino del provider trasferito con markup pari a zero — che è l'altra metà dell'argomento, perché una modifica del listino ovunque a monte è attiva dalla nostra parte lo stesso giorno anziché al prossimo rinnovo contrattuale.

Se nessuno dei due modelli è quello che chiamerai, la versione breve funziona così. Scegli Step 5 Preview quando vuoi il punteggio, l'input video e immagini e lo sconto del 90 percento sulla cache, e accetta che stai noleggiando un'anteprima senza licenza sui pesi e con un checkpoint di ottobre che non hai ancora visto. Scegli Nemotron 3 Ultra quando i pesi contano più del punteggio — per vincoli on-premise, per il fine-tuning, per una licenza che puoi leggere — e fai il budget per il rack prima di farlo per i token, perché a 0,60 $ per milione di token di input un deployment da 550 miliardi di parametri è economico solo se qualcun altro sta già pagando per le GPU.

Il punto da tenere d'occhio è il 15 ottobre. Se StepFun pubblica il checkpoint BF16 che ha promesso, l'asimmetria centrale di questo articolo — cioè che solo uno dei due è scaricabile — smette di essere vera, e i ventuno punti dell'indice diventano notevolmente più difficili da smontare. Se la data slitta, la tesi a favore del modello a pesi aperti si rafforza per default, il che è un modo strano per colmare un divario di capacità, e anche molto comune.