
Claude Opus 5.5 vs GPT-6 Astra: il divario di 6 $, e il secondo prezzo che Astra applica oltre 272K
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 177 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1323 tok/s
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
Due fornitori hanno pubblicato questo mese le tabelle di benchmark dei loro modelli di punta, ciascuna delle quali mostra il proprio modello vincitore, e nessuna delle due tabelle contiene una sola riga in cui i due modelli siano stati messi a confronto diretto. Claude Opus 5.5, uscito il 22 settembre 2026 a 4 $ per milione di token di input, e GPT-6 Astra, uscito il 3 settembre 2026 a 10 $ per milione di token di input, hanno in comune esattamente due benchmark sovrapposti — e se li dividono, con Opus 5.5 che si aggiudica il lavoro affine ad AutomationBench nella tabella di Anthropic e Astra che se lo aggiudica in quella di OpenAI, mentre Astra è nettamente in vantaggio sul ragionamento scientifico in entrambe. Questo è ciò che il materiale dei fornitori può dirvi. Il quadro indipendente è meno ambiguo e indica la direzione opposta, e il quadro dei prezzi è più sbilanciato di entrambi.
Cosa ha pubblicato ciascuna parte
La tabella di Anthropic per Opus 5.5 usa il proprio harness e le proprie impostazioni di effort e, dove elenca Astra, le cifre sono di Anthropic, non una nuova esecuzione. Considera l'intero set come dichiarato dal fornitore:
• Terminal-Bench 4.0 — Claude Opus 5.5 66,4% contro GPT-6 Astra 57,9% (Anthropic osserva che l'esecuzione di Opus ha utilizzato impegno xhigh)
• FrontierCode v1.1 — Claude Opus 5.5 54,4% contro GPT-6 Astra 53,3%
• GDPval-AA v2.1, lavoro intellettuale — Claude Opus 5.5 1.846 Elo vs GPT-6 Astra 1.542
• AutomationBench — Claude Opus 5.5 40,0% vs GPT-6 Astra 41,4% (Astra in vantaggio)
• Terminal-Bench-Science 0.1 — Claude Opus 5.5 58,7% vs GPT-6 Astra 64,6% (Astra in vantaggio)
• Humanity's Last Exam, con strumenti — Claude Opus 5.5 67,7% vs GPT-6 Astra 57,2%
La parte di OpenAI è più difficile da allineare, perché OpenAI ha pubblicato Astra contro il proprio predecessore anziché contro il modello di punta di Anthropic, e i benchmark scelti — uso del computer, ingegneria front-end, conoscenza generale — per la maggior parte non compaiono affatto nella tabella di Anthropic. Non è disonestà, è un normale comportamento di lancio, ed è esattamente il motivo per cui un confronto costruito da due tabelle di fornitori è un confronto tra due selezioni anziché tra due modelli. L'unica cosa su cui entrambe le tabelle concordano è che Astra è forte nella scienza agentica e nell'uso del computer, e che i due modelli sono sufficientemente vicini nella programmazione che la scelta dell'harness potrebbe spostare il risultato.
La lettura indipendente, che nessuno dei due fornitori ha scelto

Artificial Analysis esegue ogni modello in un'unica configurazione pubblicata, quindi i suoi numeri sono gli unici qui che sono stati prodotti dallo stesso valutatore nelle stesse condizioni:
• Indice di intelligenza — Claude Opus 5.5 58, classificato #1 su 210 vs GPT-6 Astra 53, classificato #6
• Etichetta di configurazione — Claude Opus 5.5 "Ragionamento adattivo, Sforzo massimo, Fallback predefinito", GPT-6 Astra "max"
• Velocità di output — GPT-6 Astra 52,5 token/sec, all'estremità inferiore della sua fascia di prezzo rispetto a Claude Opus 5.5 non ancora pubblicato
• Tempo al primo token — GPT-6 Astra 352,15 s rispetto a una mediana della board di 3,83 s; Claude Opus 5.5 non ancora pubblicato
• Prezzo — Claude Opus 5.5 $4,00 in ingresso / $20,00 in uscita per milione rispetto a GPT-6 Astra $10,00 / $50,00
• Contesto e output — GPT-6 Astra 1M di contesto e 128K di output massimo vs Claude Opus 5.5 1M e 128K
Un divario di cinque punti nell'indice non è decisivo di per sé, e non dovrebbe essere interpretato come tale — entrambi i modelli si collocano nella stessa fascia di capacità, che è ciò che "frontier" significa questo trimestre. Ciò che le righe di Astra stabiliscono è che il premium non sta acquistando un vantaggio di capacità nell'unica classifica in cui compaiono entrambi i modelli. La riga della latenza è la complicazione onesta: 352 secondi al primo token è il valore più alto di questo gruppo con largo margine, anche se è misurato al massimo sforzo e un modello di ragionamento che pensa prima di emettere apparirà sempre lento secondo questa metrica. Il valore di 52,5 token/sec è quello più trasferibile, ed è piuttosto basso per un modello a $10/$50.
Il secondo prezzo di Astra, superiore a 272.000 token

La tabella tariffaria è il punto in cui questi due smettono del tutto di essere comparabili, perché il prezzo di Astra presenta uno scatto. Le tariffe standard sono $10.00 per l'input, $1.00 per l'input in cache, $12.50 per la scrittura in cache e $50.00 per l'output per milione di token. Supera però i 272.000 token di input e l'intera richiesta viene ritariffata — non l'eccedenza, l'intera chiamata — a tariffe di input e cache doppie (2x) e output a 1,5x. Il che porta il lavoro su contesti lunghi a circa $20 di input e $75 di output per milione di token.
Claude Opus 5.5 non fa questo. Anthropic fattura $4,00 e $20,00 con l'intera finestra da 1M token al prezzo standard, e dichiara esplicitamente che una richiesta da 900K token viene fatturata alla stessa tariffa per token di una da 9K token. Quindi il rapporto di riferimento tra questi due — Astra costa 2,5 volte Opus 5.5 in entrambe le direzioni — non è il rapporto che si applica ai carichi di lavoro per cui entrambi i modelli sono effettivamente venduti. Su un agente a lungo orizzonte che porta con sé un ampio contesto di lavoro, il confronto è $20/$75 contro $4/$20, che è un fattore di cinque sull'input e quasi quattro sull'output. Il prezzo batch lo amplifica invece di risolverlo: Opus 5.5 si dimezza a $2,00/$10,00, mentre il tier flex di Astra si dimezza a $5,00/$25,00 su una base che è già cinque volte più alta nel caso di contesto lungo.
Questa è la singola asimmetria più rilevante per le decisioni nel confronto, ed è invisibile in ogni tabella di lancio di entrambe le aziende, perché entrambi i fornitori citano la tariffa principale. Se i tuoi prompt sono inferiori a 272K token, ignorala. Se stai costruendo un agente che legge un repository o un insieme di documenti, prezzalo a $20/$75 prima di confrontare qualsiasi cosa.
L'accesso fa parte della specifica
Astra è il primo modello OpenAI a superare la soglia di capacità di cybersecurity Critical secondo il Preparedness Framework della stessa azienda, e il rilascio riflette tale classificazione anziché la capacità. L'accesso è stato aperto inizialmente a un insieme limitato di organizzazioni, l'accesso enterprise richiede che un amministratore lo attivi prima che gli utenti lo vedano, e il modello distribuito rifiuta categoricamente alcune categorie di lavoro. Claude Opus 5.5 arriva con una versione dello stesso problema dalla direzione opposta: viene distribuito con il livello di salvaguardia che Anthropic riservava in precedenza a Claude Fable 5.1, il che significa che la maggior parte delle richieste di cybersecurity viene reindirizzata a Claude Opus 4.8 e il lavoro di biologia ricade su Claude Opus 5 a meno che l'account non sia verificato.
Entrambi i comportamenti si manifestano nello stesso punto, ovvero nella tua valutazione. Artificial Analysis etichetta la configurazione di Opus 5.5 come "Default Fallback" proprio perché le richieste possono finire su un modello diverso da quello che hai indicato, e sui prompt di sicurezza o di scienze della vita questo accade regolarmente. Se il tuo carico di lavoro rientra in quei domini, la stringa del modello nella tua richiesta non è una garanzia riguardo al modello che ha risposto, e i tuoi numeri di qualità includeranno un modello più piccolo su una frazione sconosciuta di chiamate. Nessuno dei due fornitori lo nasconde — entrambi lo documentano — ma nessuno dei due lo menziona nel titolo.
Scegliere tra loro
La decisione che questo confronto pone davvero è se un carico di lavoro a contesto lungo giustifichi il prezzo a scaglioni di Astra, e per la maggior parte dei team la risposta sarà no: Opus 5.5 costa meno su ogni fascia sotto i 272K, drasticamente meno al di sopra, ottiene punteggi più alti sull'unica classifica indipendente e raggiunge 1M di token di contesto senza sovrapprezzo. Il caso di Astra è più ristretto ma concreto — ragionamento scientifico, uso del computer e gli strumenti dell'ecosistema OpenAI — e se le vostre valutazioni lo collocano in vantaggio su questi fronti, il sovrapprezzo è una voce di spesa, non un errore.
Dove questo diventa pratico è nel modo in cui li metti a confronto diretto, perché un confronto equo richiede entrambi i modelli sulla stessa chiave e sulla stessa fattura. Entrambi sono instradabili tramite OrcaRouter al prezzo di listino del provider con 0% di ricarico — Claude Opus 5.5 a $4,00/$20,00 di Anthropic e GPT-6 Astra a $10,00/$50,00 — il che significa che la decisione sui 272K può essere testata sul tuo traffico reale invece che discussa sulla base di due comunicati stampa. Fissare Astra alle classi di attività in cui vince e lasciare che il failover automatico gestisca il resto è una regola di routing, e una richiesta che supera la soglia dei 272K può essere indirizzata verso un percorso più economico senza modificare il codice, perché la regola risiede nel router e non nella tua applicazione.

Cosa cambierebbe la risposta
Una cosa lo risolverebbe: un confronto diretto controllato a pari sforzo su benchmark condivisi. Nessuno dei due fornitori ne ha pubblicato uno, e nessuno dei due ha un incentivo a farlo, il che lascia l'indice indipendente come l'unico confronto a parità di condizioni disponibile — e quell'indice colloca Opus 5.5 cinque punti e cinque posizioni sopra Astra a meno della metà del prezzo per token. La controargomentazione che merita attenzione è che entrambi i modelli sono stati valutati al massimo sforzo, mentre Opus 5.5 viene distribuito con l'impostazione predefinita su medio; se il vantaggio di Astra sul lavoro scientifico a lungo orizzonte sopravvive a una prova a pari sforzo, la tesi a favore del sovrapprezzo ne esce rafforzata anziché indebolita. Finché qualcuno non la esegue, la posizione difendibile è che Astra è uno specialista prezzato come un generalista, e Opus 5.5 è il generalista che, per l'appunto, ottiene un punteggio più alto.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
