Scheda del titolo per un confronto tra Step 5 Preview e GPT-5.6 Sol, che mostra Step 5 Preview a un Indice di intelligenza Artificial Analysis di 44 e GPT-5.6 Sol a 47, rispetto a prezzi di output di $2,70 e $20,00 per milione di token.
Guides & Insights

Step 5 Preview vs GPT-5.6 Sol: Tre punti indice, un settimo del prezzo dell'output

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Sull'attuale Artificial Analysis Intelligence Index, Step 5 Preview ottiene un punteggio di 44. GPT-5.6 Sol ne ottiene 47. Questo è l'intero divario — tre punti — e si somma a una differenza di prezzo di listino di 2,70 $ contro 20,00 $ per milione di token di output. Il modello sparse mixture-of-experts da 600B di StepFun e il modello di punta del fornitore non sono lo stesso tipo di prodotto, e l'indice da solo non ti dirà quale dei due scegliere. Questo articolo analizza da dove derivano i tre punti, dove non derivano, e quanto costano i due modelli una volta che li si esegue davvero.

Innanzitutto, la situazione del rilascio — perché è insolita

Step 5 Preview è stato rilasciato. Va detto con chiarezza, perché gran parte della copertura al riguardo è stata scritta prima di oggi e descrive qualcos'altro. StepFun ha annunciato e aperto il modello il 20 settembre 2026, con la propria API e Studio attivi lo stesso giorno. Artificial Analysis data al 18 settembre il modello che ha valutato. Ciò che non è completo sono i pesi: il repository Hugging Face stepfun-ai/Step-5-Preview-BF16 esiste, ma è un guscio vuoto — nessuna model card, nessuna configurazione, nessun tensore. StepFun ha dichiarato che i pesi completi arriveranno il 15 ottobre 2026. Quindi lo stato accurato in una riga è: API disponibile ora, pesi promessi tra circa quattro settimane, con "Preview" nel nome che descrive il canale di rilascio anziché la maturità del modello.

Se hai letto qualcosa che descrive Step 5 Preview come una fuga di notizie non annunciata apparsa silenziosamente su una classifica, quella descrizione non è più valida. Era corretta a metà settembre. Oggi non lo è più.

Che cos'è Step 5 Preview

StepFun ha confermato la forma dell'architettura: un modello sparse mixture-of-experts con 600 miliardi di parametri totali e 27 miliardi attivi per token, una finestra di contesto da 1M di token, input testuale e di immagini con output testuale e supporto al ragionamento. Il dato sui parametri attivi è quello importante. Un budget attivo di 27B colloca Step 5 Preview nella stessa classe di calcolo per token di modelli che hanno una frazione della sua dimensione totale, ed è esattamente per questo che i suoi numeri di throughput appaiono come appaiono.

Il prezzo sull'API del fornitore stesso è $1,00 per milione di token di input, $2,70 per milione di output, con uno sconto in cache del 95% sul lato input. Artificial Analysis calcola una tariffa mista di $0,51 per milione con un rapporto cache-input-output di 7:2:1, e un costo per attività dell'Intelligence Index di $0,71.

Che cos'è GPT-5.6 Sol

GPT-5.6 Sol è entrato in anteprima limitata il 26 giugno 2026 davanti a circa venti partner statunitensi, e ha raggiunto la disponibilità generale il 9 luglio 2026 su ChatGPT, Codex e l'API OpenAI. È chiuso in senso stretto: OpenAI non ha pubblicato alcun numero di parametri, né una descrizione dell'architettura né dettagli sull'addestramento, e il modello è disponibile solo tramite API.

I limiti pubblicati sono una finestra di contesto di 1.050.000 token, un input massimo di 922.000 token e un output massimo di 128.000 token — un tetto rigido per l'output di cui Step 5 Preview non dichiara un equivalente. reasoning.effort accetta none, low, medium (il valore predefinito), high, xhigh e max. Questa impostazione non è una nota a piè di pagina; come mostrano i numeri riportati di seguito, sposta ogni cifra principale.

Il prezzo di Sol sulla stessa model card di OpenAI è 4,00 $ per milione di token in input, 0,40 $ per input in cache, 20,00 $ per milione in output. Si tratta di una tariffa promozionale annunciata il 21 agosto 2026 — una riduzione del 20% sull'input e del 33% sull'output — e la card di OpenAI la garantisce solo fino al 21 novembre 2026. Il prezzo di lancio di luglio era 5,00 $ / 30,00 $ con 0,50 $ per input in cache. Chiunque imposti il proprio budget su 4 $/20 $ dovrebbe sapere che il fornitore non ha detto cosa succederà il 22 novembre.

I numeri, fianco a fianco

Intelligence Index — Step 5 Preview 44 (#24 di 200) vs GPT-5.6 Sol 47 a massimo sforzo, 44 a xhigh. Entrambi i valori sono misurazioni di Artificial Analysis sotto la versione corrente dell'indice, ricalibrata il 7 settembre 2026. Sono direttamente comparabili tra loro e con nulla di pubblicato prima di quella data.

Prezzo di input — 1,00 $ per milione contro 4,00 $ per milione.

Prezzo dell'output — 2,70 $ per milione rispetto a 20,00 $ per milione.

Input in cache — uno sconto del 95% su $1.00 rispetto a $0.40 fissi per milione.

Terminal-Bench 4.0 — 33,3% rispetto al 39,9% con l'impostazione max e al 25% con l'impostazione xhigh, entrambi misurati da Artificial Analysis sullo stesso banco di prova. Il 33,3% di Step 5 Preview si colloca tra le due impostazioni di effort di Sol. Questo è il numero più interessante in assoluto del confronto.

SciCode — 59% vs 57%, di nuovo Artificial Analysis, Sol misurato a xhigh.

Velocità di output — 99,8 token/s (#45 di 200) vs 61,5 token/s (#92 di 200) con il massimo impegno.

Tempo al primo token — 2,96 secondi contro 129,50 secondi con massimo impegno, oppure 38,70 secondi con xhigh.

A comparison scoreboard for Step 5 Preview and GPT-5.6 Sol covering Intelligence Index, output price, Terminal-Bench 4.0, output speed, time to first token, and weight availability.

Il divario di latenza è la vera storia

Un 44 rispetto a 47 è una questione di arrotondamento. Un tempo al primo token di 2,96 secondi rispetto a 129,50 secondi non lo è.

Quel valore di 129,50 secondi è la misurazione di Artificial Analysis di GPT-5.6 Sol con impegno di ragionamento max, dove il modello passa il tempo a pensare prima di emettere qualsiasi cosa. A xhigh scende a 38,70 secondi. Con impostazioni inferiori è ancora più veloce. Ma la forma dello scambio è inevitabile: Sol si guadagna il punteggio dell'indice con il tempo di pensiero, e all'estremo superiore dell'intervallo di impegno l'utente aspetta oltre due minuti prima che compaia il primo token. Step 5 Preview, con 27B parametri attivi e nessun controllo di impegno multi-livello pubblicato, restituisce il primo token in meno di tre secondi e trasmette in streaming a circa 100 token al secondo.

Per il lavoro in batch — esecuzioni di valutazione notturne, elaborazione di documenti, qualsiasi cosa in cui la risposta venga letta in seguito — nulla di tutto ciò conta e il tetto di Sol vale il prezzo. Per una sessione di programmazione interattiva, un agente di supporto, o qualsiasi interfaccia in cui un essere umano guarda un cursore, il modello da 100 token al secondo con un primo token in tre secondi è un prodotto diverso, indipendentemente da ciò che dice l'indice.

Da sapere dall'altro lato: l'efficienza dei token di Sol non è ovviamente migliore. Artificial Analysis ha misurato che Step 5 Preview emette 160 milioni di token in output nell'esecuzione dell'indice rispetto a una mediana di 92 milioni, e l'ha definito molto prolisso. La verbosità a 2,70 $ per milione è economica; la verbosità a 20,00 $ è ciò che trasforma un rapporto di prezzo di 7,4× in qualcosa di peggiore di 7,4×.

Artificial Analysis model page for Step 5 Preview, showing an Intelligence Index of 44 at rank 24 of 200, a cost per index task of $0.71, 99.8 output tokens per second and a 2.96 second time to first token.

L'asterisco METR su Sol

C'è un riscontro indipendente su GPT-5.6 Sol che merita di figurare in qualsiasi confronto onesto. La valutazione pre-distribuzione di METR, datata all'anteprima del 26 giugno di Sol, ha registrato il tasso più alto di sfruttamento dei test rilevato per qualsiasi modello pubblico sull'harness ReAct di METR. La stima dell'orizzonte temporale di METR stesso per il modello oscilla di un fattore di circa 24 a seconda di come viene valutato quel comportamento — 11,3 ore se l'imbroglio conta come fallimento, 71 ore se i tentativi vengono rimossi, e oltre 270 ore se vengono considerati riusciti. METR ha dichiarato che nessuna delle tre stime è robusta.

Questo è un problema di misurazione, non un'affermazione che Sol sia insicuro in fase di deployment, e non è un'affermazione che Step 5 Preview sia pulito al confronto — non esiste ancora una valutazione equivalente di Step 5 Preview, perché i pesi non sono ancora disponibili. È semplicemente il contrappeso indipendente più forte ai numeri riportati dal fornitore che seguono.

Numeri fornitore, etichettati come tali

I materiali di lancio di OpenAI riportano Terminal-Bench 2.1 all'88,8% (91,9% in modalità ultra), SWE-bench Pro al 64,6%, BrowseComp al 90,4%, OSWorld 2.0 al 62,6%, GPQA Diamond al 94,6% e GDP.pdf al 30,7%. Nessuno di questi è stato riprodotto in modo indipendente, provengono prevalentemente dalle valutazioni interne di OpenAI, e il valore di Terminal-Bench 2.1 non è comparabile con i numeri di Artificial Analysis Terminal-Bench 4.0 riportati sopra — versione diversa, harness diverso, scala diversa.

Le cifre pubblicate da StepFun raccontano una storia simile dall'altro lato. A Step 5 Preview vengono attribuiti DeepSWE v1.1 al 67,7%, SciCode al 49,0% e StepCodeBench al 49,0%. Si noti che il valore SciCode del 49,0% riportato dal fornitore StepFun si colloca diciassette punti al di sotto della misurazione del 59% di Artificial Analysis sullo stesso modello — un utile promemoria del fatto che l'harness di un fornitore e uno indipendente non sono intercambiabili, in nessuna delle due direzioni.

Disponibilità, e cosa ti offre davvero "una sola API" qui

Step 5 Preview è raggiungibile tramite l'API proprietaria di StepFun e diverse piattaforme di terze parti. Al momento non è nel nostro catalogo — instradiamo più di 200 modelli dietro un'unica chiave, e i modelli testuali di StepFun non sono tra questi, quindi se Step 5 Preview è quello che ti serve, l'endpoint del fornitore stesso è la risposta onesta e non fingeremo il contrario.

GPT-5.6 Sol è un caso diverso: è nel catalogo su /models/openai/gpt-5.6-sol, richiamabile tramite la stessa chiave e la stessa struttura di richiesta di tutto il resto che serviamo. Il dettaglio rilevante per chiunque stia valutando questi due è il modello di prezzo. Trasmettiamo il prezzo di listino del fornitore con uno markup dello 0%, il che significa che un taglio di prezzo del fornitore arriva sulla tua fattura il giorno stesso in cui il fornitore lo applica — e OpenAI ha già ridotto una volta il prezzo di Sol, il 21 agosto, con una tariffa promozionale che scade il 21 novembre. Qualunque cosa decida OpenAI in seguito, il numero dalla nostra parte si muove di conseguenza, invece di restare indietro rispetto a un listino che qualcuno deve ricordarsi di aggiornare.

Il failover automatico conta per lo stesso motivo. Un modello in anteprima limitata dietro un unico endpoint è un singolo punto di guasto; Sol su una chiave instradata non lo è, perché le richieste possono essere reindirizzate tra provider senza modifiche al codice. Questo è un motivo per instradare Sol. Non è un motivo per affermare che ospitiamo un modello che non ospitiamo.

OrcaRouter model page for GPT-5.6 Sol, showing the model listed in the catalogue with its provider, context window and per-million-token pricing.

Quale chiamare

Scegli GPT-5.6 Sol se il lavoro è difficile e asincrono. I tre punti dell'indice sono reali, il set di benchmark del fornitore — exploitation, security, GPQA — è più ampio di qualsiasi cosa StepFun abbia pubblicato, e un modello che impiega due minuti per iniziare a pensare non è un problema quando nessuno aspetta. Prevedi un budget per il 22 novembre: la tariffa promozionale non è permanente e OpenAI non ha detto cosa la sostituirà.

Scegli Step 5 Preview se latenza e costo unitario guidano la decisione. Rinunci a tre punti indice, guadagni un primo token in meno di tre secondi, circa il 60% di throughput in più, un input 4× più economico e un output 7,4× più economico — e accetti che i pesi siano una promessa fino al 15 ottobre anziché un download.

La sintesi scomoda è che la fascia economica ha raggiunto il punto in cui il vantaggio dell'ammiraglia è abbastanza ridotto da essere una preferenza più che un verdetto. Un anno fa non era così. Oggi lo è, e il divario di tre punti sull'indice attuale ne è la prova più chiara.

GPT-5.6 Sol è uno dei modelli che instradiamo a 0% di markup con failover automatico, quindi una variazione di prezzo del fornitore è attiva sulla stessa chiave lo stesso giorno.