
Grok 4.5 vs GPT-6 Astra: sei volte il prezzo di listino, tre volte la fattura
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Mettete Grok 4.5 e GPT-6 Astra fianco a fianco sui loro listini e il divario sembra assurdo: $2,00 contro $10,00 per milione di token di input, $6,00 contro $50,00 per milione in output. Passate gli stessi due attraverso l'Intelligence Index di Artificial Analysis e il divario si restringe a qualcosa su cui un team può davvero discutere: $1,04 per attività completata contro $3,26. Il moltiplicatore nominale è 5x in input e 8,3x in output. Il moltiplicatore della bolletta, misurato su conteggi reali di token, è poco più di 3x. E la dimensione in cui questi due modelli differiscono di più non è nessuna delle due. È quanto si aspetta per il primo token, dove la misurazione indipendente è 10,94 secondi contro 342,30.
Questo è l'intero confronto in un paragrafo, ed è il motivo per cui questa pagina non è un'incoronazione in nessuna delle due direzioni. GPT-6 Astra è il modello più intelligente di un margine chiaro e riproducibile. Grok 4.5 è quello meno costoso di un margine che è reale ma considerevolmente inferiore a quanto suggerisca il suo listino prezzi. Tutto il resto — velocità, efficienza dei token, contesto, i benchmark di coding — o si divide, o è in parità, o si rivela misurato con due metri diversi.
Nessuno di questi è un nuovo modello
Vale la pena dirlo chiaramente, perché molte pagine di confronto danno l'impressione che entrambi siano arrivati la settimana scorsa.
xAI ha rilasciato Grok 4.5 l'8 luglio 2026. È costruito sulla base V9 da 1,5 trilioni di parametri ed è stato co-addestrato con Cursor su dati di sessioni di sviluppatori anziché solo su codice statico, ed è da qui che deriva la sua reputazione nel coding agentico. Ha una finestra di contesto di 500.000 token. La sua stessa lista di modelli del fornitore lo riporta ancora oggi, insieme a due successori — xAI ha nel frattempo rilasciato Grok 4.6 e Grok 4.7 — quindi considera Grok 4.5 come il livello da $2/$6 della linea Grok, non come il suo vertice.
OpenAI ha annunciato GPT-6 Astra il 3 settembre 2026, con un rilascio graduale nei giorni successivi, e resta il modello di punta di OpenAI: una finestra di contesto da 1 milione di token (il catalogo di OrcaRouter indica 1.050.000 in input e 128.000 di output massimo), una data di aggiornamento delle conoscenze al 30 aprile 2026 e un posizionamento deciso sul lavoro agentico a lungo termine — uso del computer, ricerca, compiti scientifici e di cybersicurezza. Secondo la stessa OpenAI, è il primo modello a superare la sua soglia di cybersicurezza "Critical", motivo per cui l'accesso enterprise è disattivato per impostazione predefinita finché un amministratore non lo abilita.
Entrambi sono generalmente disponibili sulle API dei rispettivi fornitori. Nessuno dei due sta per essere lanciato. L'unica cosa che si è mossa questa settimana è la famiglia attorno a uno di essi, e questo arriva alla fine di questo articolo perché cambia la raccomandazione piuttosto che il confronto.
I tariffari, compresa la fascia che nessuno quota
• Input, contesto breve — Grok 4.5 $2.00 per 1M vs GPT-6 Astra $10.00 per 1M
Output, contesto breve — Grok 4.5 $6,00 per 1M vs GPT-6 Astra $50,00 per 1M
• Input in cache — Grok 4.5 $0,30 per 1M vs GPT-6 Astra $1,00 per 1M
• Input a contesto lungo — Grok 4.5 $4.00 per 1M vs GPT-6 Astra $20.00 per 1M
• Output a contesto lungo — Grok 4.5 12,00 $ per 1M vs GPT-6 Astra 75,00 $ per 1M
• Finestra di contesto — Grok 4.5 500.000 token vs GPT-6 Astra 1.000.000 di token
La clausola che conta è quella che quasi nessuna pagina di confronto riporta. Su Grok 4.5, una volta che il prompt di una richiesta raggiunge i 200.000 token, l'intera richiesta viene ritariffata al livello superiore: la documentazione di xAI specifica esplicitamente che viene «fatturata alla tariffa più alta per tutti i token della richiesta», non solo per i token oltre la soglia. Quindi la finestra da 500.000 token è reale, ma circa il 60% superiore di essa viene fatturato al doppio. La pagina dei prezzi di OpenAI per Astra presenta la stessa struttura a due colonne breve/lungo senza indicare dove si colloca il punto di passaggio, quindi considera la colonna del contesto lungo come quella applicabile quando lavori su larga scala e verifica il limite rispetto alla tua fattura.

Due moltiplicatori a livello di servizio si applicano sopra i numeri di Astra: Batch e Flex funzionano a metà della tariffa standard, mentre la modalità Fast funziona al doppio — 20,00 $ di input e 100,00 $ di output con contesto breve. Grok 4.5 non ha un livello batch nel listino di xAI; le sue leve sono lo sconto della cache e l'elaborazione prioritaria a 2x.
La nostra posizione su tutto questo è volutamente noiosa: OrcaRouter trasferisce il prezzo di listino del provider con un ricarico dello 0%, quindi entrambi i listini sopra sono attivi dalla nostra parte lo stesso giorno in cui l'uno o l'altro fornitore li modifica, e i token in cache vengono fatturati alla tariffa di cache del provider anziché a prezzo pieno. Non c'è un secondo numero da riconciliare.
Quanto costa davvero un carico di lavoro
I prezzi di listino sono una guida poco affidabile in questo caso, perché i due modelli non consumano lo stesso numero di token per completare lo stesso lavoro. Prendiamo un'attività da agente di coding con un contesto di repository da 120.000 token e una risposta da 25.000 token. Su Grok 4.5 sono $0,24 di input e $0,15 di output, quindi $0,39. Su GPT-6 Astra sono $1,20 e $1,25, quindi $2,45. Un divario di 6,3x.
Ora porta il prompt oltre la soglia del contesto lungo: 300.000 token in input, 20.000 in output. Grok 4.5 fattura $1,20 più $0,24, ovvero $1,44. GPT-6 Astra fattura $6,00 più $1,50, ovvero $7,50. Il divario si comprime a 5,2x, perché entrambi i fornitori raddoppiano la tariffa di input e il moltiplicatore di output di Astra si restringe al livello più alto.
Nessuno dei due è ciò che misura Artificial Analysis, e il loro numero è quello più utile. Eseguendo l'intero Intelligence Index, il costo medio per attività completata è di $1,04 per Grok 4.5 a sforzo alto e $3,26 per GPT-6 Astra a sforzo massimo. Il motivo per cui il multiplo scende a 3,1x quando il prezzo di input è 5 volte più alto è l'efficienza dei token: in tutto l'indice, Grok 4.5 ha generato 77M di token di output e Astra ne ha generati 60M. Astra è il modello più conciso, quindi colma parte del divario che ha aperto sul prezzo. Se hai citato "cinque volte più economico" in un documento di budget, 3x è il numero che apparirà in fattura.
La velocità è alla pari. La latenza no.
Questa è la scoperta che ci ha sorpresi, e va contro l'intuizione secondo cui il modello economico sia quello veloce.
Artificial Analysis misura Grok 4.5 a 55 token di output al secondo e GPT-6 Astra a 58. È una differenza del 5% sulla stessa revisione dell'indice, e il riepilogo di AA stesso li descrive entrambi come più lenti della media — la mediana del confronto è di 74 token al secondo. Se il throughput è il tuo criterio di selezione, questi due modelli non si distinguono. Dillo chiaramente invece di creare artificialmente un vincitore: sull'unico dato di velocità misurato allo stesso modo per entrambi, sono alla pari.
La latenza li separa in modo violento. AA colloca il tempo al primo token di risposta di Grok 4.5 a 10,94 secondi con 20,01 secondi end-to-end; GPT-6 Astra a 342,30 secondi con 350,91 secondi end-to-end. Si tratta di circa 31 volte, e su una richiesta sincrona è la differenza tra uno spinner e una pausa caffè.
Due avvertenze oneste prima che qualcuno ci basi un budget. Primo, quelle sono cifre che includono il ragionamento — il "tempo al primo token di risposta" di AA conta deliberatamente il tempo di pensiero del modello — quindi descrivono un compito difficile, non un turno di chat. Secondo, non sono a sforzo equivalente: la voce pubblicata di Astra è a sforzo massimo, quella di Grok 4.5 a sforzo alto, e l'impostazione dello sforzo è esattamente la manopola che sposta questo numero. La scheda di OrcaRouter stesso per GPT-6 Astra mostra un tempo al primo token p50 di 8,31 secondi e un p95 di 10,00 secondi sul traffico live, che è un punto di misurazione completamente diverso — primo token su chiamate di produzione reali, non primo token di risposta su un compito di benchmark. Le due cose non sono comparabili e non andrebbero messe nella stessa frase in un confronto.

Benchmark di programmazione: controlla la versione prima di citarlo.
Cerca questo confronto e troverai l'83,3% di Grok 4.5 su Terminal-Bench 2.1 contrapposto al 57,9% di GPT-6 Astra su Terminal-Bench 4.0. Sono benchmark diversi che portano lo stesso nome. Non possono essere confrontati, e le pagine di confronto che li mettono uno accanto all'altro non ti stanno dicendo nulla.
La maggior parte dei numeri di coding pubblicati da entrambi i vendor ha questo problema. Il foglio di xAI per Grok 4.5 riporta SWE-bench Pro 64,7%, Terminal-Bench 2.1 83,3%, DeepSWE 1.0 62,0% e DeepSWE 1.1 53%. Il foglio di OpenAI per Astra riporta Terminal-Bench 4.0 57,9%, OSWorld 2.0 72,6%, FrontierMath Tier 4 97,6% e ARC-AGI-3 99,9%. Tutti riportati dai vendor, e quasi nessuno di essi si sovrappone.
C'è un unico punto in cui i due si incontrano davvero sullo stesso harness: DeepSWE v1.1 di Datacurve, che esegue ogni modello attraverso lo stesso scaffold mini-swe-agent su 113 attività originali e prive di contaminazione. Lì, GPT-6 Astra ottiene il 74,1% a circa 6,52 $ per attività, mentre Grok 4.5 si ferma al 53%. È il singolo risultato più pulito su questa pagina, e favorisce Astra in modo decisivo. Un'ulteriore avvertenza specifica per Grok 4.5: il dato CursorBench di xAI è stato escluso dal confronto pubblico dopo che si è scoperto che una precedente base di codice era trapelata nell'addestramento, quindi considera inutilizzabile qualsiasi valore CursorBench per questo modello.
Comportamento agentico e chiamata di strumenti
I due prendono strade diverse verso la stessa destinazione, e la differenza è architetturale più che di punteggio.
Le funzionalità di GPT-6 Astra rivolte agli sviluppatori presuppongono che tu stia costruendo un orchestratore. Supporta la chiamata asincrona degli strumenti, quindi l'attesa di uno strumento non blocca il modello dal portare avanti altro lavoro; la guida in corso d'opera tramite WebSocket, così un'esecuzione in corso può essere reindirizzata senza riavviarla; e uno sforzo di ragionamento regolabile nel bel mezzo di una conversazione. In Codex aggiunge un meccanismo di conservazione del contesto che mantiene le note attraverso le finestre di contesto mentre il contesto precedente resta ricercabile. La scheda di sistema di OpenAI stessa riporta che il modello è più difficile da monitorare rispetto al suo predecessore, il che è un motivo per trattare i log delle chiamate agli strumenti e lo stato del sistema — non la narrazione del modello — come prova di controllo.
La storia agentica di Grok 4.5 riguarda meno le nuove primitive e più il contesto in cui è stato addestrato. L'addestramento congiunto con Cursor su sessioni reali di modifica e debug multi-file è ciò a cui xAI attribuisce l'efficienza dei token sui task software, ed è il motivo per cui il modello compare come predefinito negli ambienti di coding anziché come flagship generalista. Function calling, output strutturato, streaming e prompt caching sono tutti supportati; il tool calling segue il formato compatibile con OpenAI, motivo per cui inserirlo in un client esistente richiede solo un cambio dell'URL di base.
Non esiste un benchmark agentico indipendente condiviso in cui entrambi compaiano a parità di sforzo, quindi qui non inventeremo un vincitore. Quel che si può dire è che la superficie di tool calling di Astra è la più espressiva delle due per il lavoro a lungo orizzonte, mentre l'economia di token per attività di Grok 4.5 è la più interessante per il lavoro ad alto volume.
Scegli Grok 4.5 se
• Stai eseguendo lavori ad alto volume o ad alta frequenza in cui il costo per singola attività domina la decisione, e un 39 sull'AA Intelligence Index supera la tua soglia di qualità.
• I tuoi prompt restano sotto i 200.000 token. È qui che il vantaggio di prezzo di Grok 4.5 è massimo e la rimodulazione dei prezzi per il contesto lungo non si attiva mai.
• Vuoi uno sconto sulla cache che faccia davvero il suo lavoro. A 0,30 $ per milione di token di input in cache rispetto a 1,00 $ di Astra, i carichi di lavoro con prefisso ripetuto — lunghi prompt di sistema, contesto di repository condiviso — diventano economici in fretta.
• Hai bisogno di una latenza del primo token inferiore al minuto su attività difficili e non puoi sopportare un'attesa di più minuti.
Scegli GPT-6 Astra se
• Il compito è il prodotto, e il conto è un errore di arrotondamento di fronte a una risposta sbagliata. Quattordici punti indice a questo estremo della curva rappresentano una differenza reale di capacità, non una trovata di marketing.
• Stai lavorando davvero oltre i 500.000 token. La finestra di Astra è circa il doppio di quella di Grok 4.5, ed è l'unica delle due a raggiungere tale soglia senza una clausola di riprezzamento.
• Hai bisogno dell'uso del computer, della ricerca approfondita o della postura di cybersicurezza — inclusi i controlli enterprise disattivati per impostazione predefinita che accompagnano la soglia Critical di OpenAI.
• Stai scrivendo codice di orchestrazione che richiede chiamate asincrone agli strumenti e una guida in corso d'esecuzione anziché una semplice chiamata di richiesta-risposta.
Cosa si è mosso questa settimana e perché cambia la raccomandazione
Il 22 settembre 2026, OpenAI ha rilasciato GPT-6 Sol e GPT-6 Luna a $2.00/$10.00 e $0.10/$0.50 per milione di token, descrivendo le tariffe come permanenti anziché promozionali. Sol è il modello di fascia media per la programmazione e l'analisi, a circa un quinto del prezzo di input di Astra.
Questo è importante per questa precisa decisione. Se il motivo per cui stavi confrontando Grok 4.5 con GPT-6 Astra era il prezzo, il confronto onesto da parte di OpenAI non è più con Astra — Astra è il modello di punta, e Sol ora occupa la fascia in cui Grok 4.5 compete effettivamente. Grok 4.5 è ancora più economico di Sol sull'output ($6,00 contro $10,00) e lo eguaglia sull'input ($2,00 ciascuno), quindi non è soppiantato; ma un confronto scritto prima di questa settimana confrontava un modello conveniente con un modello di punta e definiva il risultato una questione di prezzo.
Lo stesso vale dal lato di xAI: l'elenco dei modelli di xAI include grok-4.6 e grok-4.7 insieme a grok-4.5, quindi Grok 4.5 è un'opzione all'interno di una famiglia, non la frontiera attuale.

Qual è il vero argomento a favore del routing invece della selezione. Lo stack a due modelli che continua a comparire nei resoconti dei professionisti — invia la maggior parte al modello economico, escala la coda difficile a quello costoso — è una decisione di routing, e puoi esprimerla come configurazione invece che come riscrittura. OrcaRouter mette entrambi i modelli dietro un'unica API e un'unica chiave, con il prezzo di listino del fornitore passato a markup 0%, failover automatico tra fornitori, e un DSL di routing che ti consente di inviare il lavoro al di sotto di una soglia a grok/grok-4.5 ed escalare a openai/gpt-6-astra quando un'attività fallisce o supera una soglia dimensionale. Puoi provare il percorso costoso su una fetta ristretta di traffico senza rischiare una pipeline di produzione.
La versione breve
GPT-6 Astra è il modello migliore. Non c'è partita, e questa pagina sarebbe senza valore se fingesse il contrario — 53 contro 39 sulla stessa revisione dell'indice, 74,1% contro 53% sull'unico benchmark di coding che entrambi hanno affrontato.
Grok 4.5 è il modello più economico, ma di 3,1 volte per attività completata, anziché del 5x-8,3x che il suo listino prezzi lascerebbe intendere, perché Astra spende meno token per arrivarci. E sull'unico dato di velocità misurato in modo identico per entrambi, sono alla pari.
La decisione non è quale modello vince. È se un divario di 14 punti in un indice valga circa il triplo della spesa sul tuo specifico carico di lavoro — e se la risposta è la stessa per ogni richiesta che invii.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
