Scheda del titolo generata intitolata 'Step 5 Preview — cosa dice il repository' che elenca sei righe: parametri totali 600B, attivati per token 27B, finestra di contesto 1M token, input testo e immagine, AA Intelligence Index 44 e prezzo $1,00 in / $2,70 out. Un piè di pagina recita: 'StepFun annunciata il 20 settembre 2026; pesi previsti per il 15 ottobre 2026. Dato dell'indice secondo Artificial Analysis.'
Engineering & Research

Annunciato Step 5 Preview: cosa rilascia davvero il modello di punta 600B di StepFun e cosa manca ancora

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

StepFun ha annunciato Step 5 Preview il 20 settembre 2026 — un modello di punta sparse mixture-of-experts da 600 miliardi di parametri con 27B parametri attivi per token, una finestra di contesto da 1M di token, input immagini nativo e un punteggio di 44 sull'Artificial Analysis Intelligence Index. L'API è stata aperta lo stesso giorno. Ciò che non è stato aperto è il modello stesso: il repository Hugging Face stepfun-ai/Step-5-Preview-BF16 esisteva già dal pomeriggio dell'annuncio e contiene esattamente un file, .gitattributes, senza pesi, senza licenza, senza model card e senza configurazione. I materiali di StepFun indicano il rilascio dei pesi aperti al 15 ottobre 2026. Quindi l'onesto riassunto in una riga di questo lancio è che il modello è richiamabile oggi e scaricabile in circa tre settimane e mezza, e queste sono due cose diverse. Questo è anche lo stesso modello che questo blog ha trattato oggi stesso come una fuga di notizie non annunciata, sottoposto a benchmark con un tag di test prima che StepFun pubblicasse una pagina di prodotto — un utile promemoria che un'anteprima può passare da fuga di notizie a lancio senza che cambi un singolo numero.

Il repo è un segnaposto, e questa è la storia

Quando un vendor pubblica dei pesi, il repository è la prova. Contiene un file di licenza, una config con un conteggio dei parametri al suo interno, un README con l'uso previsto e la tabella di valutazione, e shard safetensors la cui dimensione totale ti dice se la dichiarazione sui parametri è reale. stepfun-ai/Step-5-Preview-BF16 non ha nulla di tutto questo. Il record dell'API di Hugging Face a esso relativo mostra un timestamp di creazione del 2026-09-20T03:52Z, zero download, due like, un oggetto config vuoto, nessun pipeline_tag, nessuna licenza e un unico file sibling. La pagina dell'organizzazione StepFun lo elenca e non elenca nessun altro repository Step 5 — nessuna build FP8, nessuna build NVFP4, nessun GGUF, nessuna delle varianti di quantizzazione che avevano accompagnato Step-3.7-Flash a giugno.

Leggilo come una questione di pianificazione, non come un mistero. Il suffisso BF16 nel nome del repository è l'indizio rivelatore: un laboratorio che intende pubblicare prima un checkpoint bfloat16 — il formato da cui si fa fine-tuning e quantizzazione, prima che arrivino le build di serving FP8 e NVFP4 — nomina il repository in quel modo al momento della creazione e lo riempie in seguito. StepFun ha indicato il 15 ottobre nei propri materiali di annuncio. Fino ad allora il repository è una dichiarazione d'intenzione, e l'unica cosa che dimostra è che StepFun ha riservato il namespace.

Questo conta per una ragione pratica. Il Preview suffisso e i pesi mancanti sono lo stesso segnale che punta nella stessa direzione: il modello è invocabile, il prezzo è definito, e l'artefatto che eseguiresti sul tuo hardware non esiste ancora. Qualsiasi piano che presupponga un Step 5 Preview self-hosted prima di metà ottobre è un piano senza alcun artefatto alle spalle.

Cosa è stato effettivamente annunciato

L'impostazione di StepFun è ristretta e specifica: Step 5 Preview è un modello di base per il lavoro agentico nel mondo reale — coding AI, ingegneria del software, lavoro intellettuale professionale e finanza — con l'enfasi su contesto lungo, chiamate a strumenti multi-turno ed esecuzione sostenuta piuttosto che sulla qualità della chat. L'azienda ha saltato del tutto la linea Step 4.x, passando da Step-3.7-Flash direttamente a Step 5, il che è di per sé una dichiarazione di quanto grande consideri questo passo.

Un dettaglio sulle date merita di essere segnalato, perché è il tipo di cosa che fa inciampare un calendario di approvvigionamento: Artificial Analysis colloca questo modello al 18 settembre 2026, due giorni prima dell'annuncio di StepFun stesso. La board assegna un punteggio a un modello quando riesce a raggiungerlo, e quel divario di due giorni è il normale ritardo tra il momento in cui un modello diventa richiamabile e quello in cui un fornitore ne scrive. L'annuncio di StepFun — 20 settembre, con l'apertura dell'API e di Studio lo stesso giorno — è la data da citare, e la data del 15 ottobre per i pesi proviene dagli stessi materiali.

La specifica come pubblicata:

• Parametri totali — 600 miliardi, mixture-of-experts sparsa

• Attivi per token — 27B, circa il 4,5% del totale, un rapporto insolitamente basso

• Finestra di contesto — 1M token

• Input — testo e immagini in modo nativo; l'output è solo testo

• Ragionamento — sì, con pensiero esteso

• Prezzo — 1,00 $ per milione di token di input, 2,70 $ per milione di token di output, con uno sconto del 95% sulla cache

• Disponibilità — API e Studio disponibili dal 20 settembre; pesi previsti per il 15 ottobre

L'affermazione di efficienza su cui StepFun sta puntando è che la suddivisione 600B/27B colloca il modello sulla frontiera di Pareto — capacità per unità di calcolo — e l'azienda la presenta come tre generazioni dello stesso obiettivo, da Step-3.5-Flash passando per Step-3.7-Flash fino a questo. È una storia coerente, e il rapporto di sparsità è il meccanismo: con 27B attivi, il costo di servizio per token si colloca nella fascia di un modello molto più piccolo, mentre il totale di 600B è per lo più una questione di impronta di memoria.

Le dichiarazioni dei fornitori e i numeri di terze parti accanto a esse

Due classi di numeri compaiono nei materiali di lancio, e non dovrebbero essere interpretate allo stesso modo. Le valutazioni di StepFun stessa sono la prima classe: un'affermazione di costo per singolo task pari a un ottavo di Claude Opus 5; il secondo posto dietro a GPT-6 Astra o Claude Opus 5 su ALE-CLI, FrontierFinance e DRACO; un'esecuzione di ottimizzazione del kernel GPU di 24 ore che ha portato le prestazioni di picco del kernel MLA a 508 TFLOPS contro i 493 di Claude Opus 5; un esperimento automatizzato di post-training che ha portato Qwen3-30B-A3B dal 53,3% al 60% su AIME24; DeepSWE v1.1 al 67,7% e il suo StepCodeBench interno al 49,0%. StepFun ha costruito StepCodeBench in proprio — 553 repository di codice, nove tipi di task, 33 linguaggi di programmazione — il che lo rende uno strumento ragionevole per misurare il proprio modello e non uno indipendente.

La seconda classe è misurata da qualcun altro, ed è la parte su cui pianificare. Artificial Analysis assegna a Step 5 Preview un punteggio di 44 su Intelligence Index v4.3.2, collocandolo al 24º posto su 200 modelli — allo stesso livello di Kimi K3, un punto dietro GLM-5.3 e allo stesso livello dell'impostazione di sforzo di ragionamento medio di Claude Opus 5. Su Terminal-Bench 4.0 la stessa graduatoria registra il 33,3%, davanti a DeepSeek V4.1 Flash al 26,8% e ben davanti a Kimi K3 a circa il 12,6%. La velocità di output misura 99,8 token al secondo e il tempo al primo token 2,96 secondi — entrambi dalla stessa esecuzione indipendente, ed entrambi il tipo di dato che decide se un loop di agente risulta interattivo.

Un dato di terze parti va nella direzione opposta e merita di stare accanto al prezzo. La stessa esecuzione dell'indice ha usato 160M token di output per Step 5 Preview rispetto a una mediana di 92M tra i modelli valutati: il modello è verboso. A $2,70 per milione di token di output, quella verbosità non è gratuita: 160M token di output equivalgono a circa $432 dei $922,84 che l'esecuzione è costata in totale, e su un modello che costa tre volte tanto sarebbe la voce dominante della fattura. Un prezzo di facciata basso e un alto numero di token per attività sono due metà di un unico numero, e il costo per attività dell'indice — $0,71 — è quello che li contiene già entrambi.

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second at rank 45 of 200, cost per Intelligence Index task $0.71 at rank 27 of 200, verbosity 160M output tokens at rank 64 of 200, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

Cosa ha azzeccato il leak, e l'unica cosa che non ha chiarito

La precedente copertura di questo blog è stata scritta a partire da un'esecuzione di valutazione emersa prima di qualsiasi annuncio, e ha segnalato le affermazioni che non poteva confermare. L'annuncio ha risolto la maggior parte di esse. La coppia 600B/27B ora è dichiarata dal fornitore anziché dedotta. La finestra di contesto da 1M token ora è nelle specifiche di StepFun stesso anziché solo su un forum di terze parti. Il prezzo è di $1.00 e $2.70. Il nome è Step 5 Preview, non un'alternativa vociferata.

Ciò che l'annuncio non ha fatto è risolvere la contraddizione sulla finestra di contesto sollevata dalle indiscrezioni. Una configurazione separata di terze parti, in circolazione negli strumenti per sviluppatori, elencava il modello a 350.000 token di contesto con un output massimo di 64.000 token. Una finestra da 1M e una da 350k sono prodotti diversi con costi di memoria diversi, e un tetto di output di 64k è un vincolo rigido proprio sul lavoro agentico a lungo orizzonte per cui questo modello viene venduto. L'annuncio di StepFun dice 1M e non menziona alcun limite di output. Vale la pena sapere su quale delle due finirà il vostro routing prima di costruire una pipeline che dipende dalla risposta, e questa è una domanda per la documentazione del fornitore, non per una classifica.

L'altra cosa che il lancio non ha cambiato è la riproduzione indipendente. Ogni riga di benchmark sopra riportata che non provenga da Artificial Analysis è di StepFun stessa, eseguita sugli harness di StepFun, e nessuna terza parte ha riprodotto i risultati agentici. Il pattern dei flagship dei laboratori cinesi di quest'anno è che l'indice aggregato tiene e le righe di punta del fornitore si discostano; considera l'aggregato come il numero da usare per la pianificazione.

Cosa puoi chiamare oggi, e cosa instradare nel frattempo

Step 5 Preview non è nel nostro catalogo e OrcaRouter non lo instrada: c'è un'API pubblica e uno Studio sul lato di StepFun, ed è lì che viene eseguito. Quello che abbiamo è l'insieme di modelli rispetto ai quali viene misurato, dietro un'unica chiave: DeepSeek V4.1 Flash a $0,15 in input e $0,60 in output per milione, GLM-5.3 a $1,26 e $3,96 rispetto ai listini Z.ai di $1,40 e $4,40, Claude Opus 5 a $5,00 e $25,00, e Kimi K3 accanto a loro. Questa è la forma concreta delle prossime tre settimane: un'anteprima su cui puoi fare benchmark, e un insieme di modelli di produzione su cui puoi davvero contare, accessibili tramite un'unica API per più di 200 modelli, con il prezzo di listino del fornitore applicato con 0% di ricarico — quindi se il prezzo di StepFun cambia prima di ottobre, l'importo che pagheresti cambia con esso lo stesso giorno, non al rinnovo.

Il failover automatico vale più del solito in questa finestra, perché la modalità di guasto di un'anteprima non è che sia scadente — è che è vincolata dalla capacità. Un modello che ha aperto la propria API il giorno dell'annuncio e non ha ancora i pesi è un modello la cui flotta di serving è ancora in costruzione, e un endpoint di anteprima che si degrada alle 2 del mattino si porta dietro il tuo loop dell'agente. Metti l'anteprima dietro un router con un modello comprovato come fallback e ottieni un segnale di qualità sul tuo carico di lavoro senza scommettere un percorso di produzione su una flotta non comprovata.

Screenshot of the Hugging Face repository page for stepfun-ai/Step-5-Preview-BF16, showing the repository created on September 20, 2026 with one contributor, a single initial commit and a single file listed, .gitattributes at 1.52 kB, with no model card, no license and no configuration.

La data che conta è il 15 ottobre

Tutto quanto sopra è provvisorio in un modo ben preciso: i pesi sono ciò che rende permanente un modello. Un'anteprima chiusa a 1,00 $ e 2,70 $ è un buon prezzo da un singolo fornitore, e un checkpoint BF16 con una licenza pubblicata è un prezzo che nessun singolo fornitore controlla più. StepFun si è impegnata a scegliere la seconda per il 15 ottobre, e il nome del repository che ha già riservato dice bfloat16 first.

Ciò che c'è da tenere d'occhio nel frattempo è limitato e verificabile. Il repository si popolerà — e con quale licenza? Un file di configurazione conferma 600B totali e 27B attivi? StepFun pubblicherà il tetto massimo di output insieme alla finestra di contesto, risolvendo la questione 350k/64k? Il prezzo reggerà una volta che l'anteprima perde il suffisso? Queste quattro risposte decidono se Step 5 Preview diventerà un modello da ospitare in autonomia, un modello da noleggiare o un modello da testare una volta e poi lasciarsi alle spalle. Finché nel repository non c'è più di un .gitattributes, l'annuncio è l'inizio della storia, non la sua fine.

Generated two-column infographic titled 'Step 5 Preview — live today vs promised October 15'. The left card 'Callable now' lists rows: API and Studio open September 20, price $1.00 in / $2.70 out, AA Intelligence Index 44, 1M-token context, output speed 99.8 tokens/sec. The right card 'Promised October 15' lists rows: BF16 weights, licence terms, config with parameter counts, output ceiling. A footer reads 'The announcement covers the left card; the right card is unconfirmed until the repository is filled.'

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno