Scheda del titolo generata intitolata 'Step 5 Preview vs GPT-6 Astra — dieci volte il prezzo' con due colonne: Step 5 Preview con AA Index 44, 600B totali / 27B attivi, prezzo $1,00 / $2,70, combinato $0,51 e 99,8 token/sec; GPT-6 Astra con AA Index 53, prezzo $10,00 / $50,00, combinato $7,70 e 59,3 token/sec. Un piè di pagina recita 'Entrambi i valori secondo l'Artificial Analysis Intelligence Index; il prezzo di Astra sale a $20 / $75 oltre 272K token di input.'
Guides & Insights

Step 5 Preview vs GPT-6 Astra: dieci volte il prezzo dell'input per nove punti di indice

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Questi due modelli sono stati annunciati a diciassette giorni di distanza l'uno dall'altro e con prezzi pensati per pianeti diversi. Step 5 Preview, il modello sparse mixture-of-experts da 600 miliardi di parametri di StepFun annunciato il 20 settembre 2026, costa 1,00 $ per milione di token di input e 2,70 $ per milione di token di output. GPT-6 Astra, il modello di punta del fornitore rilasciato il 3 settembre 2026, costa 10,00 $ e 50,00 $ per le stesse unità al di sotto di una soglia di input di 272K token — e 20,00 $ e 75,00 $ al di sopra. Si tratta di dieci volte il prezzo di input e di circa diciotto volte il prezzo di output per un modello che ottiene nove punti in più sull'indipendente Intelligence Index, 53 contro 44. Che Astra sia migliore non è in discussione. Se il divario valga trenta dollari in più per milione di token di output sul vostro carico di lavoro è invece la vera domanda, e la risposta cambia due volte nel corso di questo articolo.

A cosa serve ogni modello

Step 5 Preview è costruito e venduto per il lavoro agentico: programmazione AI, ingegneria del software, lavoro professionale basato sulla conoscenza, finanza. L'architettura è ottimizzata per questo — 600 miliardi di parametri totali con circa 27 miliardi attivi per token, un contesto da 1M token, input di testo e immagini e ragionamento con pensiero esteso. StepFun ha saltato l'intera linea Step 4.x per arrivare qui, passando direttamente da Step-3.7-Flash a Step 5.

GPT-6 Astra è il flagship general-purpose di OpenAI: una finestra di contesto da 1 milione di token, fino a 128K token di output, input in testo, immagini e file, output in testo, un knowledge cutoff al 30 aprile 2026 e supporto per ragionamento, coding e workflow agentici. È il modello a cui ricorre un'enterprise quando la risposta deve essere corretta e il costo dei token non è il vincolo determinante.

Indice di Intelligenza — Step 5 Preview 44 vs GPT-6 Astra 53

• Parametri — Step 5 Preview 600B totali / 27B attivi vs GPT-6 Astra non divulgati

• Contesto e limite di output — entrambi con contesto da 1M token; Astra elenca una finestra di 1.050.000 token e un limite di output di 128K, mentre StepFun non ha pubblicato alcun limite di output

• Modalità di input — testo e immagini vs testo, immagini e file

• Velocità di output — Step 5 Preview 99,8 token/sec vs GPT-6 Astra 59,3 token/sec

• Prezzo per 1M di token — 1,00 $ in input / 2,70 $ in output rispetto a 10,00 $ in input / 50,00 $ in output per input inferiore a 272K, che sale a 20,00 $ / 75,00 $ al di sopra di tale soglia

• Cache — Step 5 Preview sconto del 95% vs GPT-6 Astra uno sconto del 90% sulla lettura con una tariffa di 12,50 $ per milione per la scrittura in cache

• Costo per attività dell'Indice di Intelligenza — Step 5 Preview $0,71 vs GPT-6 Astra $3,26

Generated two-column comparison scoreboard titled 'Step 5 Preview vs GPT-6 Astra — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, parameters 600B total / 27B active, price $1.00 / $2.70, cache discount 95%, cost per index task $0.71 and output speed 99.8 tokens/sec. The right column gives GPT-6 Astra the rows AA Index 53, parameters undisclosed, price $10.00 / $50.00, cache discount 90%, cost per index task $3.26 and output speed 59.3 tokens/sec. A footer reads 'Both figures per Artificial Analysis Intelligence Index; Astra pricing rises to $20 / $75 above 272K input tokens.'

La fattura, riga per riga

Il prezzo di Step 5 Preview è fisso ed economico: $1,00 in input, $2,70 in output, con uno sconto del 95% sulla cache che porta l'input in cache vicino a $0,05 per milione di token. Con un mix di cache-hit, input e output pari a 7:2:1 — la convenzione usata da questo blog per il traffico degli agenti — la tariffa combinata si aggira intorno a $0,51 per milione di token, e il costo per attività dell'Intelligence Index è di $0,71, 27° su 200. Il caveat è la verbosità: il modello ha prodotto 160 milioni di token in output su quell'Indice rispetto a una mediana di 92 milioni, quindi i conteggi grezzi dei token risultano superiori a quanto suggerisca il prezzo indicato.

Il prezzo di GPT-6 Astra è a livelli, e il livello è la parte che vale la pena leggere attentamente. Sotto i 272K token di input per richiesta è $10,00 e $50,00; al di sopra, $20,00 e $75,00. Il livello è selezionato dal conteggio dei token di input di ogni richiesta, il che conta più di quanto sembri per un modello pubblicizzato per il suo contesto da 1M di token — una singola chiamata con contesto ampio supera la soglia e raddoppia la tariffa per l'intera richiesta. Le letture dalla cache sono $1,00 per milione, uno sconto del 90%, e le scritture in cache sono $12,50 per milione. Con lo stesso mix 7:2:1 la tariffa mista si attesta intorno a $7,70 per milione di token, e il costo per attività Index è $3,26, 71° su 200.

Astra va nella direzione opposta per quanto riguarda la verbosità, ed è il modello conciso in questo caso: 60M token di output sull'Index contro i 160M di Step 5 Preview, 27° su 200 per quella misura. Un minor numero di token a un tasso più alto riduce il divario in un modo che il multiplo grezzo sovrastima. Non lo colma — il valore del costo per attività già compensa verbosità, comportamento della cache e prezzi insieme, e $3,26 contro $0,71 è ancora una differenza di 4,6 volte.

Cosa acquistano i nove punti indice

I numeri di punta di Astra sono quelli di OpenAI e non replicati: 96,1 su GPQA Diamond, 72,6% su OSWorld 2.0, 97,6% su FrontierMath Tier 4, 57,2% su Humanity's Last Exam con strumenti, e circa 57,9% su Terminal-Bench 4.0. Il dato di ARC-AGI-3 è quello da maneggiare con cautela — OpenAI riporta 99,9% sotto il proprio harness con adattatore di provider e 62,7% sull'harness standard, e uno scarto di 37 punti tra harness è un'affermazione sull'harness almeno autantо quanto sul modello.

I numeri pubblicati di Step 5 Preview si collocano nella stessa fascia sui compiti agentici per cui è stato costruito, e presentano la stessa avvertenza: 33,3% su Terminal-Bench 4.0, 80,5 su ProgramBench, 67,7 su DeepSWE v1.1 e 49,0 su StepCodeBench, tutti da StepFun e nessuno riprodotto in modo indipendente. Fornitori diversi, harness diversi, nessuna esecuzione condivisa — ed è proprio per questo che il divario di nove punti misurato in modo indipendente è il numero più utile di ognuno di questi.

Quel divario è reale e non è piccolo. Su una classifica di 200 modelli, 53 e 44 occupano la terza e la ventiquattresima posizione, e la separazione si manifesta come una diversa classe di attività anziché come un punteggio diverso sulla stessa attività: le vittorie pubblicate di Astra si concentrano sul ragionamento a lungo orizzonte e sull'uso del computer, ed è lì che la parte alta della classifica prende il largo. Se il tuo carico di lavoro vive lì, i nove punti valgono più della fattura.

Un'avvertenza sul punteggio di Astra. Artificial Analysis rivede l'Intelligence Index, e i valori per lo stesso modello variano tra istantanee rilevate a settimane di distanza — 52,8; 53 e 54,7 compaiono tutti in materiale pubblicato su questo modello nello stesso mese. Il 53 sulla pagina attuale del modello è il numero da usare, e qualsiasi confronto che metta un'istantanea più vecchia di Astra accanto a un valore attuale di Step 5 Preview sta misurando con due righelli diversi.

Screenshot of the Artificial Analysis model page for GPT-6 Astra, showing OpenAI as the creator with a September 2026 release date, an Intelligence Index of 53 at rank 3 of 200, output speed 59.3 tokens per second at rank 101 of 200, cost per Intelligence Index task $3.26 at rank 71 of 200, verbosity 60M output tokens at rank 27 of 200, pricing of $10.00 per million input tokens and $50.00 per million output tokens with a 90% cache discount, and technical specifications listing reasoning, text and image input, a 1M-token context window and an April 30, 2026 knowledge cutoff.

Velocità e latenza sono due questioni diverse

Sulla velocità di generazione, la classifica indipendente è inequivocabile: 99,8 token di output al secondo per Step 5 Preview contro 59,3 per GPT-6 Astra, che è anche più lento della media di 70 token al secondo tra i modelli misurati. In un ciclo di coding interattivo, questa è la differenza tra un suggerimento e una pausa, e si accumula nel corso di una sessione come fa uno sconto sulla cache.

La latenza è il capitolo più complicato, e un singolo numero è fuorviante al riguardo. Astra instrada il ragionamento prima di produrre l'output, quindi il tempo al primo token e il tempo a una risposta utilizzabile non sono la stessa misura, e le cifre pubblicate al riguardo variano ampiamente a seconda che il ragionamento venga conteggiato. Sul nostro traffico negli ultimi sette giorni, il tempo mediano al primo token di GPT-6 Astra è di 6,72 secondi con un 95° percentile di 10,00 secondi — il numero che un chiamante sperimenta effettivamente attraverso il nostro endpoint. Artificial Analysis stima il tempo al primo token di Step 5 Preview a 2,96 secondi sul proprio banco di prova, e queste due cifre non sono misurate allo stesso modo, quindi non dovrebbero essere sottratte l'una dall'altra.

Dove si ripercuote effettivamente l'asimmetria della cache

Entrambi i modelli scontano pesantemente i prefissi ripetuti ed entrambi fanno pagare la loro scrittura, e la differenza tra loro è di 20 volte in lettura. Lo sconto del 95% sulla cache di Step 5 Preview porta l'input in cache vicino a $0,05 per milione di token. GPT-6 Astra legge la cache a $1,00 per milione — uno sconto del 90% su una tariffa base dieci volte superiore — e la scrive a $12,50 per milione.

Per un ciclo di agente che rinvia lo stesso prompt di sistema e contesto del repository a ogni turno, è la tariffa di lettura a fare la differenza nel tempo, e lo sconto più profondo sul modello più economico vale più dello sconto più superficiale su quello costoso. Il blend di Astra si attesta ancora intorno ai 7,70 $ per milione di token contro gli 0,51 $ di Step 5 Preview con lo stesso mix 7:2:1 — una differenza di quindici volte che una sessione lunga non colma ma allarga.

Eseguire entrambi con un unico tasto.

GPT-6 Astra è ora disponibile su OrcaRouter sotto openai/gpt-6-astra ai prezzi di listino di OpenAI — 10,00 $ e 50,00 $ per milione al di sotto della soglia di 272K, 20,00 $ e 75,00 $ al di sopra — trasferiti senza alcun ricarico, così una variazione di prezzo del fornitore è attiva dalla nostra parte lo stesso giorno anziché al ciclo di fatturazione successivo. La nostra telemetria a sette giorni su quell'endpoint mostra il tempo al primo token mediano di 6,72 secondi e il 95° percentile di 10,00 secondi citati sopra, insieme a 277,9 milioni di token di traffico transitati attraverso di esso nell'ultima settimana.

Step 5 Preview non è nel nostro catalogo e non lo instradiamo. Funziona sull'API e sullo Studio proprietari di StepFun, e quello è l'unico posto in cui funziona finché non arriva il checkpoint del 15 ottobre. Questa asimmetria non è un difetto del confronto; è il confronto stesso. La metà economica di questa sfida è quella che devi chiamare altrove, e la metà che puoi mettere in produzione oggi si trova dietro un'unica API per oltre 200 modelli: GPT-6 Astra alle tariffe sopra indicate, GLM-5.3 a $1,26 e $3,96, DeepSeek V4 Pro, Claude Opus 5 e il resto, con il failover automatico tra provider che mantiene stabile un percorso quando la capacità di un provider si sposta e il DSL di routing che consente a un'attività di partire a basso costo e aumentare solo quando è necessario. Quella regola di escalation è la vera risposta a un divario di prezzo di dieci volte: la maggior parte di un carico di lavoro non ha bisogno della vetta della classifica, e un livello di routing è il modo per smettere di pagare per la parte che non ne ha bisogno.

Screenshot of the OrcaRouter model page for GPT-6 Astra at www.orcarouter.ai/models/openai/gpt-6-astra, showing the model id openai/gpt-6-astra with NEW, FLAGSHIP and FEATURED badges, a 1M-token context and 128K max output, text, image and file input with text output, best-for tags for reasoning, coding and agentic work, input pricing of $10.00 and output pricing of $50.00 per million tokens, a seven-day median time to first token of 6.72 seconds and a 95th percentile of 10.00 seconds, 277.9M tokens of seven-day traffic, and the chat-completions and responses endpoints behind the OrcaRouter API.

Chi dovrebbe scegliere cosa

Se il tuo carico di lavoro è un agente a orizzonte lungo che deve portare a termine correttamente un compito difficile — uso del computer, ricerca in più passaggi, lavoro in cui una risposta sbagliata costa più dei token — il vantaggio di nove punti di GPT-6 Astra è la parte più economica della decisione, e la fattura è ciò che costa la capacità. Eseguiilo come obiettivo di escalation, non come impostazione predefinita, e fai attenzione alla soglia di 272K: una singola richiesta sovradimensionata raddoppia la tariffa per tutto ciò che contiene.

Se il tuo carico di lavoro è testo agentico ad alto volume — generazione di codice, refactoring, estrazione strutturata, il ciclo interno di un assistente alla programmazione — Step 5 Preview è in vantaggio su tutto ciò che conta per la fattura e per l'orologio, e nove punti d'indice difficilmente sopravviveranno al contatto con una distribuzione di compiti che non siede in cima alla classifica. Il problema non è la prestazione: il modello è proprietario, senza licenza pubblicata, senza concessione per l'uso commerciale e senza checkpoint fino al 15 ottobre. Puoi chiamarlo; non puoi possederlo, metterlo a punto (fine-tuning) né distribuirne un derivato.

Se la risposta non è ovvia, lo schema è una separazione per livelli anziché una scelta. Instrada il traffico generale verso un modello di fascia media e riserva Astra alle richieste che richiedono il vertice della classifica — entrambe le estremità di quella regola stanno dietro un'unica chiave dalla nostra parte, quindi la separazione costa una regola di instradamento anziché un secondo contratto. Pagare tariffe di punta per un lavoro che un modello di fascia media completa correttamente è l'errore di cui questo confronto parla davvero.