Una card del titolo generata per Claude Opus 5.5 vs GPT-6 Astra, con il sottotitolo "Un divario di sei dollari e un sovrapprezzo oltre i 272.000 token", con un'icona piatta di una bilancia a due piatti e una riga a piè di pagina che recita "Indice secondo Artificial Analysis con il massimo impegno; prezzi secondo i fornitori." Il logo reale di OrcaRouter è composto in basso a destra.
Guides & Insights

Claude Opus 5.5 vs GPT-6 Astra: il divario di 6 $, e il secondo prezzo che Astra applica oltre 272K

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Due fornitori hanno pubblicato questo mese le tabelle di benchmark dei loro modelli di punta, ciascuna delle quali mostra il proprio modello vincitore, e nessuna delle due tabelle contiene una sola riga in cui i due modelli siano stati messi a confronto diretto. Claude Opus 5.5, uscito il 22 settembre 2026 a 4 $ per milione di token di input, e GPT-6 Astra, uscito il 3 settembre 2026 a 10 $ per milione di token di input, hanno in comune esattamente due benchmark sovrapposti — e se li dividono, con Opus 5.5 che si aggiudica il lavoro affine ad AutomationBench nella tabella di Anthropic e Astra che se lo aggiudica in quella di OpenAI, mentre Astra è nettamente in vantaggio sul ragionamento scientifico in entrambe. Questo è ciò che il materiale dei fornitori può dirvi. Il quadro indipendente è meno ambiguo e indica la direzione opposta, e il quadro dei prezzi è più sbilanciato di entrambi.

Cosa ha pubblicato ciascuna parte

La tabella di Anthropic per Opus 5.5 usa il proprio harness e le proprie impostazioni di effort e, dove elenca Astra, le cifre sono di Anthropic, non una nuova esecuzione. Considera l'intero set come dichiarato dal fornitore:

• Terminal-Bench 4.0 — Claude Opus 5.5 66,4% contro GPT-6 Astra 57,9% (Anthropic osserva che l'esecuzione di Opus ha utilizzato impegno xhigh)

• FrontierCode v1.1 — Claude Opus 5.5 54,4% contro GPT-6 Astra 53,3%

• GDPval-AA v2.1, lavoro intellettuale — Claude Opus 5.5 1.846 Elo vs GPT-6 Astra 1.542

• AutomationBench — Claude Opus 5.5 40,0% vs GPT-6 Astra 41,4% (Astra in vantaggio)

• Terminal-Bench-Science 0.1 — Claude Opus 5.5 58,7% vs GPT-6 Astra 64,6% (Astra in vantaggio)

• Humanity's Last Exam, con strumenti — Claude Opus 5.5 67,7% vs GPT-6 Astra 57,2%

La parte di OpenAI è più difficile da allineare, perché OpenAI ha pubblicato Astra contro il proprio predecessore anziché contro il modello di punta di Anthropic, e i benchmark scelti — uso del computer, ingegneria front-end, conoscenza generale — per la maggior parte non compaiono affatto nella tabella di Anthropic. Non è disonestà, è un normale comportamento di lancio, ed è esattamente il motivo per cui un confronto costruito da due tabelle di fornitori è un confronto tra due selezioni anziché tra due modelli. L'unica cosa su cui entrambe le tabelle concordano è che Astra è forte nella scienza agentica e nell'uso del computer, e che i due modelli sono sufficientemente vicini nella programmazione che la scelta dell'harness potrebbe spostare il risultato.

La lettura indipendente, che nessuno dei due fornitori ha scelto

A two-column scoreboard comparing Claude Opus 5.5 and GPT-6 Astra across six shared rows: Intelligence Index (58, ranked #1 of 210, against 53, ranked #6), price in and out ($4.00 / $20.00 per million against $10.00 / $50.00), long-context surcharge (none against 2x input and 1.5x output above 272K), context window (1M tokens on both), output speed (not yet published against 52.5 tokens per second) and time to first token (not yet published against 352.15s). The footer reads 'Index, speed and latency figures per Artificial Analysis; prices and the 272K step per the vendors.'

Artificial Analysis esegue ogni modello in un'unica configurazione pubblicata, quindi i suoi numeri sono gli unici qui che sono stati prodotti dallo stesso valutatore nelle stesse condizioni:

• Indice di intelligenza — Claude Opus 5.5 58, classificato #1 su 210 vs GPT-6 Astra 53, classificato #6

• Etichetta di configurazione — Claude Opus 5.5 "Ragionamento adattivo, Sforzo massimo, Fallback predefinito", GPT-6 Astra "max"

• Velocità di output — GPT-6 Astra 52,5 token/sec, all'estremità inferiore della sua fascia di prezzo rispetto a Claude Opus 5.5 non ancora pubblicato

• Tempo al primo token — GPT-6 Astra 352,15 s rispetto a una mediana della board di 3,83 s; Claude Opus 5.5 non ancora pubblicato

• Prezzo — Claude Opus 5.5 $4,00 in ingresso / $20,00 in uscita per milione rispetto a GPT-6 Astra $10,00 / $50,00

• Contesto e output — GPT-6 Astra 1M di contesto e 128K di output massimo vs Claude Opus 5.5 1M e 128K

Un divario di cinque punti nell'indice non è decisivo di per sé, e non dovrebbe essere interpretato come tale — entrambi i modelli si collocano nella stessa fascia di capacità, che è ciò che "frontier" significa questo trimestre. Ciò che le righe di Astra stabiliscono è che il premium non sta acquistando un vantaggio di capacità nell'unica classifica in cui compaiono entrambi i modelli. La riga della latenza è la complicazione onesta: 352 secondi al primo token è il valore più alto di questo gruppo con largo margine, anche se è misurato al massimo sforzo e un modello di ragionamento che pensa prima di emettere apparirà sempre lento secondo questa metrica. Il valore di 52,5 token/sec è quello più trasferibile, ed è piuttosto basso per un modello a $10/$50.

Il secondo prezzo di Astra, superiore a 272.000 token

A generated graphic titled 'Where GPT-6 Astra's price steps', with a subtitle reading 'Crossing 272,000 input tokens reprices the whole call, not the excess.' Two panels compare per-million-token rates: below 272,000 input tokens Claude Opus 5.5 is $4.00 / $20.00 against GPT-6 Astra at $10.00 / $50.00, and above 272,000 input tokens Claude Opus 5.5 stays at $4.00 / $20.00 while GPT-6 Astra moves to approximately $20.00 / $75.00. The footer reads 'Per-million-token rates. Astra's step per OpenAI; Opus 5.5 bills its full 1M window at one rate per Anthropic.'

La tabella tariffaria è il punto in cui questi due smettono del tutto di essere comparabili, perché il prezzo di Astra presenta uno scatto. Le tariffe standard sono $10.00 per l'input, $1.00 per l'input in cache, $12.50 per la scrittura in cache e $50.00 per l'output per milione di token. Supera però i 272.000 token di input e l'intera richiesta viene ritariffata — non l'eccedenza, l'intera chiamata — a tariffe di input e cache doppie (2x) e output a 1,5x. Il che porta il lavoro su contesti lunghi a circa $20 di input e $75 di output per milione di token.

Claude Opus 5.5 non fa questo. Anthropic fattura $4,00 e $20,00 con l'intera finestra da 1M token al prezzo standard, e dichiara esplicitamente che una richiesta da 900K token viene fatturata alla stessa tariffa per token di una da 9K token. Quindi il rapporto di riferimento tra questi due — Astra costa 2,5 volte Opus 5.5 in entrambe le direzioni — non è il rapporto che si applica ai carichi di lavoro per cui entrambi i modelli sono effettivamente venduti. Su un agente a lungo orizzonte che porta con sé un ampio contesto di lavoro, il confronto è $20/$75 contro $4/$20, che è un fattore di cinque sull'input e quasi quattro sull'output. Il prezzo batch lo amplifica invece di risolverlo: Opus 5.5 si dimezza a $2,00/$10,00, mentre il tier flex di Astra si dimezza a $5,00/$25,00 su una base che è già cinque volte più alta nel caso di contesto lungo.

Questa è la singola asimmetria più rilevante per le decisioni nel confronto, ed è invisibile in ogni tabella di lancio di entrambe le aziende, perché entrambi i fornitori citano la tariffa principale. Se i tuoi prompt sono inferiori a 272K token, ignorala. Se stai costruendo un agente che legge un repository o un insieme di documenti, prezzalo a $20/$75 prima di confrontare qualsiasi cosa.

L'accesso fa parte della specifica

Astra è il primo modello OpenAI a superare la soglia di capacità di cybersecurity Critical secondo il Preparedness Framework della stessa azienda, e il rilascio riflette tale classificazione anziché la capacità. L'accesso è stato aperto inizialmente a un insieme limitato di organizzazioni, l'accesso enterprise richiede che un amministratore lo attivi prima che gli utenti lo vedano, e il modello distribuito rifiuta categoricamente alcune categorie di lavoro. Claude Opus 5.5 arriva con una versione dello stesso problema dalla direzione opposta: viene distribuito con il livello di salvaguardia che Anthropic riservava in precedenza a Claude Fable 5.1, il che significa che la maggior parte delle richieste di cybersecurity viene reindirizzata a Claude Opus 4.8 e il lavoro di biologia ricade su Claude Opus 5 a meno che l'account non sia verificato.

Entrambi i comportamenti si manifestano nello stesso punto, ovvero nella tua valutazione. Artificial Analysis etichetta la configurazione di Opus 5.5 come "Default Fallback" proprio perché le richieste possono finire su un modello diverso da quello che hai indicato, e sui prompt di sicurezza o di scienze della vita questo accade regolarmente. Se il tuo carico di lavoro rientra in quei domini, la stringa del modello nella tua richiesta non è una garanzia riguardo al modello che ha risposto, e i tuoi numeri di qualità includeranno un modello più piccolo su una frazione sconosciuta di chiamate. Nessuno dei due fornitori lo nasconde — entrambi lo documentano — ma nessuno dei due lo menziona nel titolo.

Scegliere tra loro

La decisione che questo confronto pone davvero è se un carico di lavoro a contesto lungo giustifichi il prezzo a scaglioni di Astra, e per la maggior parte dei team la risposta sarà no: Opus 5.5 costa meno su ogni fascia sotto i 272K, drasticamente meno al di sopra, ottiene punteggi più alti sull'unica classifica indipendente e raggiunge 1M di token di contesto senza sovrapprezzo. Il caso di Astra è più ristretto ma concreto — ragionamento scientifico, uso del computer e gli strumenti dell'ecosistema OpenAI — e se le vostre valutazioni lo collocano in vantaggio su questi fronti, il sovrapprezzo è una voce di spesa, non un errore.

Dove questo diventa pratico è nel modo in cui li metti a confronto diretto, perché un confronto equo richiede entrambi i modelli sulla stessa chiave e sulla stessa fattura. Entrambi sono instradabili tramite OrcaRouter al prezzo di listino del provider con 0% di ricarico — Claude Opus 5.5 a $4,00/$20,00 di Anthropic e GPT-6 Astra a $10,00/$50,00 — il che significa che la decisione sui 272K può essere testata sul tuo traffico reale invece che discussa sulla base di due comunicati stampa. Fissare Astra alle classi di attività in cui vince e lasciare che il failover automatico gestisca il resto è una regola di routing, e una richiesta che supera la soglia dei 272K può essere indirizzata verso un percorso più economico senza modificare il codice, perché la regola risiede nel router e non nella tua applicazione.

A screenshot of OrcaRouter's own model page for openai/gpt-6-astra, headed 'GPT-6 Astra' and credited to OpenAI, showing a 1M-token context, 128K max output, a text, image and file input modality, and a stat strip reading INPUT $10.00 and OUTPUT $50.00 per 1M tokens with a 10.00s p50 time to first token and 298.0M tokens of traffic over 7 days.

Cosa cambierebbe la risposta

Una cosa lo risolverebbe: un confronto diretto controllato a pari sforzo su benchmark condivisi. Nessuno dei due fornitori ne ha pubblicato uno, e nessuno dei due ha un incentivo a farlo, il che lascia l'indice indipendente come l'unico confronto a parità di condizioni disponibile — e quell'indice colloca Opus 5.5 cinque punti e cinque posizioni sopra Astra a meno della metà del prezzo per token. La controargomentazione che merita attenzione è che entrambi i modelli sono stati valutati al massimo sforzo, mentre Opus 5.5 viene distribuito con l'impostazione predefinita su medio; se il vantaggio di Astra sul lavoro scientifico a lungo orizzonte sopravvive a una prova a pari sforzo, la tesi a favore del sovrapprezzo ne esce rafforzata anziché indebolita. Finché qualcuno non la esegue, la posizione difendibile è che Astra è uno specialista prezzato come un generalista, e Opus 5.5 è il generalista che, per l'appunto, ottiene un punteggio più alto.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno