
Claude Opus 5.5 vs GPT-6 Astra: un test di assaggio che ha superato i benchmark
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qualcuno ha chiesto a Claude Opus 5.5 di realizzare un breve video su un laboratorio rivale che risolve Navier-Stokes, ha pubblicato il risultato e poi ha scritto la frase che rende questo confronto degno di essere fatto: il modello è "molto gentile", ha "ottimo gusto", ed è il primo Claude da Opus 4.7 che vogliano davvero usare intensamente — ma continuano comunque a tenere GPT-6 Astra e GPT-5.6 Sol come driver principali, perché il loro lavoro è molto orientato alla ricerca. Sono tre affermazioni in un unico post, e tirano in direzioni diverse. Un modello può essere la cosa più piacevole con cui lavorare e non essere comunque quello a cui instradare il traffico di produzione. La domanda interessante non è quale modello sia migliore. È quale di questi due verdetti sopravvive al contatto con i numeri, e quale si rivela un'affermazione sul gusto.
Il post è il resoconto di un professionista, non un'esecuzione di benchmark — trattalo come un segnale su come il modello si sente in lavori creativi e aperti, non come prova delle sue capacità. Tutto ciò che è numerico di seguito è etichettato con chi lo ha prodotto.
Cosa può e cosa non può dirti un test di assaggio
Qui è l’artefatto a contare. Realizzare un video su un risultato matematico non è un compito di programmazione con un esito pass/fail. Non c’è alcuna fase di compilazione, nessuna suite di test, nessun harness Terminal-Bench che assegni un punteggio per stabilire se il risultato sia valido. Il modello doveva scegliere un’angolazione, decidere cosa mostrare, mantenere la coerenza e fermarsi. Quando un professionista dice che un modello ha “ottimo gusto”, sta descrivendo proprio questo: capacità di giudizio su portata ed enfasi che emerge in lavori in cui le specifiche sono deliberatamente vaghe.
Quella è una vera capacità, ed è quella che le suite di benchmark misurano peggio. È anche il motivo per cui la stessa persona può elogiare un modello e non passare ad esso. Il gusto è ciò che vuoi quando stai esplorando. Non è ciò che vuoi quando hai 200.000 righe di codice da verificare e una fattura da giustificare.
La presentazione di lancio di Anthropic indica la stessa facoltà, in prosa anziché in video: Claude Opus 5.5 viene presentato come una scrittura meno "Claudish" — meno preamboli, meno cautele, maggiore propensione a mettere subito in primo piano il punto. Punteggi indipendenti di leggibilità sostengono la direzione di quell'affermazione anche là dove dissentono sull'entità. Il fornitore riporta inoltre che un test interno di verifica dei fatti supera 16 tentativi su 18, contro zero su 18 sia per Claude Fable 5.1 sia per Claude Opus 5; quel numero è di Anthropic, non replicato, e va letto come un'affermazione più che come un risultato.
Due tabelloni, un disaccordo che conta

Sui benchmark grezzi pubblicati, Claude Opus 5.5 supera GPT-6 Astra più spesso che no. Il problema è che le due fonti più citate non concordano su quanto.
La tabella di lancio di Anthropic colloca Claude Opus 5.5 al 66,4% su Terminal-Bench 4.0, con GPT-6 Astra al 57,9% e Claude Fable 5.1 al 55,8%. Si tratta di un vantaggio di 8,5 punti dichiarato dal fornitore sul coding agentico — il tipo di margine che chiude una discussione in una presentazione di marketing. Artificial Analysis, eseguendo il proprio harness, ha misurato Claude Opus 5.5 al 59,6% sullo stesso benchmark: allo stesso livello di GPT-6 Astra con xhigh effort, e circa 11 punti sopra Claude Opus 5. Il vantaggio è reale in entrambe le letture. La sua entità no.
Dove i due modelli si scambiano di posto è più utile di dove non lo fanno:
• Terminal-Bench 4.0 (codifica agentica) — Claude Opus 5.5 66,4% secondo la tabella di Anthropic stessa, 59,6% secondo Artificial Analysis; GPT-6 Astra 57,9%.
• Humanity's Last Exam, con strumenti — Claude Opus 5.5 67,7% dichiarato dal fornitore, misurato in modo indipendente al 61,4%; GPT-6 Astra 57,2%.
• GDPval-AA v2.1 (lavoro di knowledge work nel mondo reale in 44 occupazioni) — Claude Opus 5.5 1.846 Elo; GPT-6 Astra 1.542 Elo. Entrambi i dati provengono dalla classifica indipendente di Artificial Analysis, non dal fornitore.
• Terminal-Bench-Science 0.1 — GPT-6 Astra 64,6% vs Claude Opus 5.5 58,7%. Questa è una netta vittoria di Astra, ed è il benchmark agentico dal taglio scientifico.
• AutomationBench — GPT-6 Astra 41,4% contro Claude Opus 5.5 40,0%. Di misura, ma ancora Astra.
• FrontierCode v1.1 — Claude Opus 5.5 54,4% contro GPT-6 Astra 53,3%. A un punto di distanza.
Leggi quell'elenco con gli occhi di chi lo usa sul campo. I carichi di lavoro a forte intensità di ricerca — quelli con una componente scientifica o letteraria, quelli che eseguono un lungo ciclo di utilizzo di strumenti e hanno bisogno che il modello mantenga l'equilibrio — sono esattamente il terreno in cui GPT-6 Astra non cede. Le classifiche di knowledge work e coding in cui Claude Opus 5.5 stravince sono quelle che indicheresti se il tuo lavoro fosse rilasciare software. Entrambe le persone in questa conversazione stanno leggendo correttamente il proprio benchmark. Stanno solo leggendo benchmark diversi.
L'impostazione dello sforzo sta facendo più lavoro di quanto ne faccia il modello
C'è una seconda ragione, meno lusinghiera, per cui i margini principali sono deboli. I confronti tra fornitori non vengono eseguiti con la stessa impostazione.
Le cifre pubblicate di Claude Opus 5.5 derivano da una configurazione di sforzo di ragionamento extra-alto (xhigh), a fronte di GPT-6 Astra su high. Le esecuzioni indipendenti di Artificial Analysis collocano entrambi i modelli a xhigh e il divario nella programmazione scompare — il vantaggio di 8,5 punti del fornitore si trasforma in un pareggio. Non è un'accusa di cattiva condotta; è ciò che accade quando un fornitore sceglie la configurazione che mostra al meglio il proprio modello e un laboratorio indipendente sceglie la configurazione che corrisponde a quella della concorrenza. Prima di spostare un carico di lavoro sulla base di una tabella di benchmark, controlla con quale impostazione di sforzo è stato eseguito, perché la risposta è spesso «quella lusinghiera».
La bolletta dei token racconta la stessa storia da un'altra angolazione. Nel materiale di lancio della stessa Anthropic, Claude Opus 5.5 spende nell'ordine di 119.000 token per problema, con circa 84.000 di questi destinati al thinking, mentre GPT-6 Astra risolve problemi paragonabili in circa 27.000 token. I token di thinking vengono fatturati come token di output. Un modello che usa quattro volte i token a un quinto del prezzo di output è quasi un pareggio — e questo prima di tenere conto del fatto che il modello più economico è spesso quello che saresti stato comunque disposto a far girare con un'impostazione di sforzo più elevata.
Un'ulteriore avvertenza riguarda specificamente il lato Claude Opus 5.5: l'instradamento delle salvaguardie di Anthropic può indirizzare alcune richieste attinenti agli ambiti cyber e bio verso un percorso più restrittivo, il che fa scendere i punteggi pubblicati su quelle valutazioni rispetto a ciò che produrrebbe il modello sottostante. Se il vostro lavoro tocca quei domini, il divario tra il benchmark e la vostra esperienza sarà reale, e andrà nella direzione di un benchmark ottimistico.
Quanto costa un compito reale su ciascuno

Claude Opus 5.5 è il modello più economico sul listino prezzi, e non c'è paragone:
• Claude Opus 5.5 — 4,00 $ per milione di token di input, 20,00 $ per milione di token di output, 0,20 $ per milione di token di input in cache, 5,00 $ per milione di scritture in cache. Contesto di 1M di token, output massimo di 128k.
• GPT-6 Astra — 10,00 $ per milione di token di input, 50,00 $ per milione di output, 1,00 $ per milione di input in cache, 12,50 $ per milione di scritture in cache. Oltre 272.000 token di input in una singola richiesta, l'intera richiesta viene riprezzata a 20,00 $ per l'input e 100,00 $ per l'output; il livello batch è 5,00 $/25,00 $.
Quindi Claude Opus 5.5 è 2,5 volte più economico in input e 2,5 volte più economico in output, con l'input in cache cinque volte più economico. Se i tuoi task sono simili in termini di token, questa è tutta la decisione e la questione del gusto è decorazione.
L'avvertenza sull'utilizzo dei token di cui sopra è ciò che impedisce che sia così semplice, e la rimodulazione dei prezzi per il contesto lungo di GPT-6 Astra è l'altra trappola. Supera i 272.000 token di input in una singola richiesta e l'intera richiesta — non solo l'eccedenza — passa alla tariffa per il contesto lungo. Un carico di lavoro di ricerca che stipa un grande corpus in un'unica chiamata è esattamente la forma che lo attiva. Il batch a metà prezzo è la via di fuga legittima, ed è sulla coda più lenta.
Il riassunto onesto è che il quadro dei costi si inverte a seconda di ciò che si sta facendo. Per un'attività in cui entrambi i modelli usano un numero comparabile di token, Claude Opus 5.5 vince sul prezzo con un ampio margine. Per un lungo ciclo di ricerca agentico in cui i conteggi dei token divergono come mostrano i materiali di lancio di Anthropic, i due convergono — il che è un titolo molto meno entusiasmante di un taglio dei costi del 40%, e più vicino a ciò che riportava il professionista.
Perché l'utente che fa molte ricerche non ha effettuato il passaggio
Metti insieme i pezzi e la frase "preferisco ancora Astra" smette di essere in contraddizione con la frase "ottimo gusto". È la stessa osservazione da un'altra prospettiva.
I carichi di lavoro indicati dall'utente sono lunghi, aperti, fanno uso di strumenti e costosi per esecuzione. Su quelli, GPT-6 Astra detiene i primati in scienza e automazione, usa una frazione dei token di pensiero e — secondo misurazioni indipendenti — è alla pari nella programmazione quando entrambi i modelli operano con lo stesso impegno. I vantaggi di Claude Opus 5.5 si concentrano nel lavoro in cui puoi vedere l'output e giudicarlo: prosa, scelte di design, definizione dell'ambito di un brief ambiguo, decidere cosa dovrebbe mostrare davvero un video su Navier-Stokes. Questo è gusto, e il gusto è esattamente la parte che non compare su un asse di benchmark.
Se speravi in un verdetto in cui un modello vince, le prove non lo supportano. La versione difendibile è più ristretta: Claude Opus 5.5 è il modello migliore per il lavoro in cui il giudizio è il collo di bottiglia, GPT-6 Astra è il modello migliore per il lavoro in cui lo sforzo prolungato su contesti lunghi è il collo di bottiglia, e il divario di prezzo tra loro si riduce quasi a zero sul secondo tipo di lavoro. Questa è una decisione di routing, non una conversione.
Eseguire entrambi senza una migrazione

Questa è la parte in cui i due modelli smettono di essere un aut aut. GPT-6 Astra è su OrcaRouter oggi al prezzo di listino di OpenAI stesso — 10,00 $ input, 50,00 $ output, 1,00 $ lettura dalla cache, 12,50 $ scrittura cache — con 0% di markup, prezzo di listino del fornitore passato direttamente. Questo significa che una variazione delle tariffe del fornitore arriva dalla nostra parte lo stesso giorno, invece di quando un rivenditore si sincronizza.
Claude Opus 5.5 è raggiungibile tramite l'API di Anthropic stessa e diverse piattaforme di terze parti; non lo elenchiamo tra le cose che offriamo, e dovreste essere scettici nei confronti di chiunque sostenga il contrario prima che il modello si sia diffuso. Quello che potete fare oggi è mettere entrambi i modelli dietro un'unica chiave e un'unica struttura di endpoint, e instradare in base al carico di lavoro anziché alle preferenze: inviare la richiesta aperta e ad alto contenuto di giudizio a Claude Opus 5.5 e il lungo ciclo di ricerca a GPT-6 Astra senza mantenere due contratti o due integrazioni client.
Il failover automatico è ciò che rende sicuro testarlo. Un nuovo modello non è ancora un percorso di produzione, e instradare attraverso un unico endpoint significa che un incidente del provider o un limite di frequenza sposta la richiesta anziché farla fallire. Se volete scoprire se il divario di gusto è reale sul vostro lavoro, questo è il modo economico per farlo — eseguitelo accanto a ciò che avete già invece di sostituirlo, e lasciate che sia la vostra suite a decidere invece delle tabelle di lancio.
La domanda a cui i benchmark non possono rispondere
Due cose meritano attenzione, e nessuna delle due è un altro punto di benchmark.
Il primo è se l'asimmetria nell'impostazione dell'effort venga risolta. Al momento, una tabella del fornitore a xhigh contro un concorrente a high produce un vantaggio di 8,5 punti che i test indipendenti a impostazioni equivalenti trasformano in un pareggio. Man mano che i laboratori indipendenti pubblicano esecuzioni a impostazioni equivalenti nelle classifiche di scienza e automazione dove GPT-6 Astra è attualmente in testa, quel quadro può muoversi in entrambe le direzioni — e si muoverà in base alle prove, non alla rappresentazione di qualcuno.
Il secondo è il problema dell'efficienza dei token. Se l'overhead di ragionamento di Claude Opus 5.5 scende in un rilascio puntuale, il suo vantaggio di 2,5x sul listino smette di essere compensato e l'argomento del prezzo vince nettamente. In caso contrario, il professionista che ha mantenuto GPT-6 Astra come driver principale non è in ritardo sul ciclo delle notizie. Ha letto correttamente il proprio carico di lavoro, e la tabella di lancio semplicemente non lo stava misurando.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
