
Anteprima di Step 5: il flagship da 600B non annunciato di StepFun è già in classifica
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Anteprima di Step 5 ha una posizione in classifica, un prezzo pubblicato, una velocità di output misurata e un punteggio Intelligence Index di 44 — lo stesso punteggio di Kimi K3, un modello all'incirca cinque volte più grande. Ciò che non ha è un lancio. StepFun non l'ha annunciato, la documentazione della piattaforma di StepFun non lo elenca e non ci sono pesi da scaricare. Ogni cifra riportata di seguito proviene da una terza parte che ha ottenuto l'accesso prima che il fornitore dicesse qualcosa pubblicamente, il che rende questo un pezzo su ciò che sappiamo finora anziché una recensione. Leggi i numeri come prova di ciò che sta arrivando, non come una scheda tecnica.
La fuga di notizie è la storia
La prima traccia pubblica di Step 5 Preview è un'esecuzione di valutazione. Artificial Analysis ha una pagina modello live per esso, valutata tramite l'API di StepFun sotto il tag di test step-5-preview-b, con la piattaforma che data il modello al 18 settembre 2026. Quella pagina è la fonte del 44, del prezzo, della misurazione della velocità e delle righe di benchmark in questo articolo.
Di contro, il lato fornitore è vuoto. La documentazione per sviluppatori di StepFun elenca modelli fino a Step 3.7 Flash e Step 3.5 Flash e si ferma lì — nessun step-5, nessuna voce di anteprima. L'organizzazione stepfun-ai su Hugging Face non ha alcun repository Step 5, il che è coerente con un flagship a pesi chiusi piuttosto che con una svista. Le segnalazioni della comunità sui forum di sviluppatori cinesi indicano una possibile presentazione all'evento AGI Frontier di Shanghai il 19 settembre, vale a dire circa un giorno dopo la comparsa delle valutazioni. Al momento in cui scriviamo, nessuno al di fuori di StepFun dispone di una specifica ufficiale, di un prezzo ufficiale o di un nome ufficiale per la versione in distribuzione.
Il nome stesso è il primo indizio del fatto che questa è un'anteprima e non un lancio. StepFun ha saltato completamente la linea Step 4.x ed è passata a Step 5. Un modello rilasciato con un suffisso Preview e sottoposto a benchmark prima di avere una pagina prodotto è un modello che il fornitore sta ancora calibrando: prezzi, routing e limiti possono tutti cambiare prima della disponibilità generale.
Come appare la specifica, per quanto si possa dire
Questi sono i numeri che circolano, e sono le affermazioni più ripetute della fuga di notizie — il che non è la stessa cosa delle sue più confermate:
• Parametri totali — circa 600B, rispetto a circa 2,8T per Kimi K3
• Attivati per inferenza — circa 27B, all'incirca il 4,5% del totale, un rapporto mixture-of-experts insolitamente sparso
• Modalità di input — testo e immagini; l'output è solo testo
• Ragionamento — sì, con pensiero esteso
• Finestra di contesto — 1M token su Artificial Analysis; una configurazione separata di terze parti che circola negli strumenti per sviluppatori riporta 350.000 con un output massimo di 64.000
• Disponibilità del peso — chiuso, nessun repository
Vale la pena segnalare apertamente questa contraddizione sulla finestra di contesto, poiché nessuno l'ha ancora risolta. Una finestra da 1M token e una finestra da 350k token sono prodotti diversi con costi di memoria diversi, e la seconda cifra comporta un limite di output di 64k di cui la prima non dice nulla. Se stai pianificando una pipeline per documenti lunghi sulla base del numero 1M, la configurazione da 350k è il motivo per cui conviene aspettare una pagina del fornitore. Anche i conteggi dei parametri presentano una simile vaghezza: il tracker di DataLearner registra ancora l'architettura MoE e i conteggi dei parametri per Step 5 Preview come non disponibili, il che significa che la coppia 600B/27B — il fatto più citato in assoluto su questo modello — è anche uno dei meno confermati ufficialmente.
Il numero interessante è 27B, non 600B
I modelli sparse mixture-of-experts spendono capacità di calcolo solo sugli esperti a cui un token viene effettivamente instradato, quindi è la cifra degli attivati a determinare come il modello si comporta in produzione. Con circa 27B attivi, Step 5 Preview svolge un lavoro per token nella stessa fascia di modelli di una frazione della sua dimensione, mentre i 600B totali sono in gran parte una questione di ingombro di memoria.
Ne derivano due conseguenze, ed entrambe emergono dalle misurazioni di terze parti. Il costo di servizio è legato ai parametri attivati, il che è in parte il motivo per cui il prezzo è quello che è. E anche la velocità per token ne trae beneficio: Artificial Analysis misura 99,8 token di output al secondo, classificandosi 42º su 200 modelli, rispetto a una mediana di 64,6. Il tempo al primo token si attesta a 2,96 secondi rispetto a una mediana di circa 3,57 secondi. Se la suddivisione 600B/27B è accurata, questo è un modello progettato per essere economico da servire anziché da ospitare — una distinzione importante se sei tu a pagare per le GPU anziché per i token.
Dove si posiziona sull'Intelligence Index
Artificial Analysis assegna a Step 5 Preview un punteggio di 44 sull'Intelligence Index v4.3, che comprende dieci valutazioni. È al 25º posto su 200 modelli nella classifica e ben al di sopra del modello mediano valutato dall'indice, che si attesta a 25.
• Intelligence Index — Step 5 Preview 44 vs Kimi K3 44
• Direttamente sopra — GLM-5.3 e Claude Opus 5, entrambi a 45
• Direttamente sotto — DeepSeek V4.1 Flash a 40 e DeepSeek V4 Pro a 36
• Terminal-Bench 4.0 — Step 5 Preview 33,3% rispetto a Kimi K3 a circa il 12,6%, e rispetto a DeepSeek V4.1 Flash al 26,8%
• SciCode — 59% per Step 5 Preview, alla pari con Kimi K3
• Velocità di output — 99,8 token al secondo rispetto a una mediana del settore di 64,6
Il titolo è il pareggio con Kimi K3, e la lettura onesta è più limitata di quanto i titoli suggeriscano. Eguagliare un modello da 2,8T di parametri su un indice aggregato a 600B totali è un vero risultato di efficienza, ma l'aggregato ne nasconde la forma: il divario su Terminal-Bench 4.0 a favore di Step 5 Preview è drammatico, mentre il risultato su SciCode è un perfetto equilibrio. La parità aggregata su un indice non è parità ovunque, e una build di anteprima è il momento meno affidabile per presumere che i divari si manterranno.
Un'altra discrepanza che vale la pena menzionare: Artificial Analysis riporta 44, mentre il tracker indipendente di DataLearner registra la stessa esecuzione come 43,6. Si tratta di una differenza di arrotondamento più che di un disaccordo sulla capacità, ma è il tipo di cosa che rende il punto sui numeri di questo modello in generale — sono letture di terze parti di un modello non annunciato, prese in momenti leggermente diversi, e nessuna di esse è stata confermata da StepFun. Nessuno di questi benchmark è riportato dal fornitore, il che ha un doppio taglio: nessuno in StepFun ha rivendicato un numero qui, e nessuno in StepFun si è nemmeno fatto garante di uno.

Il prezzo, e la verbosità che lo intacca
Il prezzo è la parte di questa fuga di informazioni che avrà l’impatto più rapido su un budget. Tramite l’API di StepFun, Artificial Analysis registra quanto segue:
• Input — 1,00 $ per milione di token, rispetto a una mediana di 1,88 $ per modelli comparabili
• Output — 2,70 $ per milione di token, rispetto a una mediana di 10,00 $
• Cache — uno sconto del 95% sulla cache, portando i cache hit a circa 0,05 $ per milione di token
• Combinato — circa 0,51 $ per milione di token con un rapporto 7:2:1 tra hit della cache, input e output
• Costo per attività dell'Intelligence Index — $0,71
• Costo di un'esecuzione completa dell'indice — $918,34 in totale
L'output a 2,70 $ è la voce che conta di più, perché è meno di un quinto di quanto Kimi K3 faccia pagare per lo stesso milione di token a 15,00 $. Ma c'è un inghippo che un confronto per token nasconde, e Artificial Analysis lo misura direttamente: la verbosità. Step 5 Preview ha generato 160M token di output per completare l'Intelligence Index, contro una mediana di 90M per il settore e un posizionamento al 65º posto su 200 per quella misura.
Fate il calcolo. A $2,70 per milione, 160M token in output equivalgono a circa $432 — più o meno la metà del costo totale di $918,34 dell'intera esecuzione dell'indice, spesi per la verbosità del modello stesso anziché per i task. Se fate passare gli stessi 160M token attraverso la tariffa di output di $15,00 di Kimi K3, arrivate a $2.400, ed è da qui che nasce il vantaggio di prezzo. Ma l'avvertimento pratico è per chiunque stimi i costi prendendo un conteggio di token da un altro modello: Step 5 Preview scrive circa 1,8 volte la mediana, quindi un carico di lavoro con molto output ottiene allo stesso tempo la tariffa più economica e più token. Lo sconto resta, ma è più piccolo di quanto sembri confrontando $1,00/$2,70 con $3,00/$15,00, e la sua entità dipende interamente da quanto i vostri prompt rendono loquace il modello.
Lo sconto del 95% sulla cache è l'altra leva, ed è insolitamente aggressiva. Un carico di lavoro con un forte riutilizzo del prompt — un lungo prompt di sistema, un documento fisso, una base di codice condivisa — si colloca molto più vicino alla tariffa mista di $0.51 che a quella di input di $1.00. Quel valore misto presuppone un rapporto 7:2:1, che è un'assunzione di modellazione più che una garanzia, ma è la forma di aritmetica giusta da applicare al proprio traffico.

Cosa stanno riscontrando i primi tester
Questi sono resoconti individuali provenienti da forum di sviluppatori e post sui social nei giorni attorno alla fuga di notizie, non misurazioni, e dovrebbero essere ponderati di conseguenza:
• La chiamata agli strumenti è la lamentela più comune — nomi di strumenti errati selezionati e modifiche tentate senza aver prima letto il file di destinazione
• Errori segnalati oltre circa 340.000 token di contesto, che è la modalità di errore da tenere d'occhio se la finestra da 1M si rivela essere il numero reale
• Il filtro dei contenuti tronca gli output su alcuni prompt
• Impressioni sulle capacità discordanti: alcuni tester lo collocano sopra GLM-5.3 Flash, altri lo collocano sotto DeepSeek V4.1 Flash
Una build di anteprima non rilasciata che fallisce nell'uso degli strumenti non è uno scandalo — è esattamente a questo che serve l'etichetta di anteprima. Ma significa che il 44 non dovrebbe essere letto come una promessa sull'affidabilità agentica, perché l'Intelligence Index non testa la cosa di cui i primi tester si lamentano di più.
Come lo chiameresti davvero — e cosa usare nel frattempo
OrcaRouter non instrada Step 5 Preview. Non esiste un endpoint pubblico né dei pesi, quindi non c'è nulla da instradare, e nessuna piattaforma di terze parti può onestamente sostenere il contrario, per ora. Chiunque ti dica dove chiamarlo oggi sta descrivendo un endpoint di valutazione, non un prodotto.
I modelli con cui viene confrontato sono un'altra questione. Kimi K3, GLM-5.3 e DeepSeek V4.1 Flash sono tutti disponibili tramite OrcaRouter, insieme ad altri 199 modelli di 15 fornitori, dietro un'unica chiave API e un'unica fattura. Il prezzo viene passato al prezzo di listino del fornitore con uno 0% di ricarico, il che conta più del solito su un modello come questo: se il prezzo di $1,00/$2,70 di Step 5 Preview regge al lancio e poi si muove, un percorso pass-through si aggiorna lo stesso giorno, non secondo il calendario di riprezzamento di qualcun altro.
Quando diventa effettivamente richiamabile, il modo sensato di eseguire un modello vicino a un rilascio non pubblicato è lo stesso con cui eseguiresti qualsiasi modello di cui non ti fidi ancora — dietro una rotta con failover automatico, così che un errore di chiamata a uno strumento o un errore di contesto lungo ricada su un modello che funziona, invece di trascinare giù con sé la tua applicazione. È il pattern che le prime segnalazioni sostengono proprio in questo caso: una build di anteprima con problemi segnalati di chiamata a strumenti ed errori di contesto lungo è esattamente il modello dietro cui vuoi un fallback, non uno che vuoi su un percorso di produzione da solo.

Cosa lo trasformerebbe da una fuga in un rilascio?
Tre cose da tenere d'occhio, in ordine di quanto sarebbero risolutive. Primo, una pagina del modello e i prezzi sulla piattaforma per sviluppatori di StepFun stessa: nel momento in step-5compare nell'elenco dei modelli, la scheda tecnica del fornitore sostituisce ogni lettura di terze parti presente in questo articolo, inclusa la binomio 600B/27B e l'affermazione del contesto da 1M. Secondo, la risoluzione della contraddizione tra il contesto da 1M e quello da 350k; un limite di output di 64k sotto una finestra da 1M è una differenza significativa per chiunque costruisca pipeline per documenti lunghi o di tipo agentico, e al momento non è risolta. Terzo, se il prezzo sia una posizione di lancio o una linea permanente: i prezzi di anteprima sui modelli di punta cinesi hanno l'abitudine di cambiare quando la capacità si fa stretta, e 2,70 $ per milione di token di output è abbastanza aggressivo da invitare a porsi questa domanda.
Finché almeno il primo di questi non si concretizza, la sintesi onesta è che Step 5 Preview sembra un modello davvero efficiente — 600B totali che svolgono un lavoro aggregato di classe 2.8T, a un prezzo che batte il settore di diverse volte — con una specifica non verificata, una vera tassa di verbosità e una reputazione nelle chiamate di strumenti che non è ancora stata guadagnata. Vale la pena pianificarci intorno. Non vale ancora la pena puntarci un percorso di produzione.
Confrontati in questo articolo4
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
