Scheda del titolo principale con la scritta "GPT-6 vs Claude Opus 5.5", con un chip che riporta "GPT-6 rilasciato in ChatGPT 2026-10-07", due righe di prezzo che recitano "GPT-6 Sol $2 / $10" e "Claude Opus 5.5 $4 / $20", e una riga a piè di pagina che recita "I dati di GPT-6 includono voci dichiarate dal fornitore; i valori dell'indice secondo Artificial Analysis." Il logo OrcaRouter è sovrapposto nell'angolo in basso a destra.
Guides & Insights

GPT-6 vs Claude Opus 5.5: il modello che tutti hanno appena ricevuto, contro quello che è ancora in testa

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il 7 ottobre 2026 GPT-6 è diventato il modello con cui parlano più di 1,2 miliardi di utenti settimanali di ChatGPT, e non è ancora il modello con il punteggio più alto nella classifica indipendente. GPT-6 Sol — il tier che OpenAI ha attivato per ChatGPT Plus, Pro, Business ed Enterprise — ottiene 47,6 sull'Intelligence Index v4.3.2 di Artificial Analysis. Claude Opus 5.5, che Anthropic ha rilasciato il 22 settembre 2026 a 4,00 $ per milione di token di input e 20,00 $ per milione di output, ottiene 57,6 sulla stessa revisione. Dieci punti, sull'unica misura sulla quale i team di marketing di entrambi i fornitori accettano di essere valutati.

Quel divario è reale e non ho intenzione di minimizzarlo. Ma è anche il fatto meno interessante di questo abbinamento a ottobre, perché ciò che è cambiato questa settimana non è un benchmark. GPT-6 è arrivato in ChatGPT per tutti con una capacità che OpenAI chiama Intelligent UI, e il modello che alimenta i livelli a pagamento di quel lancio è GPT-6 Sol. Quindi il confronto utile non è più «quale API è migliore» — è «che cosa hanno effettivamente ottenuto gli 1,2 miliardi di persone che hanno appena ricevuto GPT-6, ed è abbastanza perché uno sviluppatore o un team debba smettere di pagare per Claude Opus 5.5». Le due risposte differiscono, e la differenza non sono i dieci punti.

Che cosa è cambiato davvero il 7 ottobre

Per essere precisi sulla data, perché questo non è un lancio: GPT-6 Sol e GPT-6 Luna sono stati distribuiti il 22 settembre 2026 come modelli API. GPT-6 Astra, il modello di punta, li precede — OpenAI lo ha rilasciato il 3 settembre 2026. Quello che è successo il 7 ottobre è che GPT-6 è arrivato a livello globale nella scheda Chat di ChatGPT per Plus, Pro, Business ed Enterprise, con i livelli Free e Go a seguire dall'8 ottobre; l'accesso per le aziende dipende ancora dalle impostazioni di un amministratore aziendale. È un evento di distribuzione, non un rilascio, e la distinzione conta per chiunque legga la copertura precedente.

La capacità che vi è collegata è la parte davvero nuova. Intelligent UI consente a GPT-6 di comporre una risposta con testo, elementi grafici, pulsanti toccabili, moduli e grafici, scelti in base alla domanda, e di trasmettere in streaming l'interfaccia mentre il modello la genera. Secondo la stessa impostazione di OpenAI, un confronto può arrivare affiancato, una spiegazione sotto forma di diagramma interattivo e una risposta in testo semplice quando il testo è la risposta giusta. A corredo arrivano due risultati interni riportati dal fornitore: sui compiti agentici quotidiani di alto valore, GPT-6 impostato su Extra High inizia a rispondere nello stesso tempo di GPT-5.6 impostato su Medium, ottenendo però un punteggio complessivamente migliore di GPT-5.6 su Extra High, e sulle domande che richiedono una ricerca web, GPT-6 Instant inizia a rispondere in media il 44% prima rispetto a GPT-5.6 Instant. Entrambi sono numeri di OpenAI, riprodotti dal suo stesso annuncio, e nessuno dei due ha ancora una riproduzione indipendente.

Due tariffe, e dove vengono acquistati i dieci punti

Nessuno dei due modelli ha cambiato il proprio prezzo questa settimana. Claude Opus 5.5 è a $4,00 in input e $20,00 in output dal 22 settembre. GPT-6 Sol è a $2,00 e $10,00 dallo stesso giorno. Una riga per dimensione, entrambi i lati su ciascuna:

• Input principale — GPT-6 Sol $2,00 per 1M vs Claude Opus 5.5 $4,00; Sol costa la metà
• Output principale — GPT-6 Sol $10,00 per 1M vs Claude Opus 5.5 $20,00; di nuovo la metà
• Clausola sul contesto lungo — GPT-6 Sol rimodula il prezzo dell'intera richiesta a $4,00 in input e $15,00 in output oltre 272.000 token di input; Claude Opus 5.5 non ha un passaggio comparabile nella sua finestra da 1M
• Input in cache — GPT-6 Sol $0,20 per 1M vs Claude Opus 5.5 $0,20; pari livello
• Costo per eseguire l'intera suite Intelligence Index — Claude Opus 5.5 $5,98 per attività vs GPT-6 Sol $1,04, un divario di 5,7× pagato per quei dieci punti
• Finestra di contesto — GPT-6 Sol 1.050.000 token vs Claude Opus 5.5 1.000.000, con un tetto di output di 128.000 token su entrambi

A two-column comparison scoreboard for GPT-6 Sol and Claude Opus 5.5, showing GPT-6 Sol at an Intelligence Index of 47.6 and $1.04 per index task against Claude Opus 5.5 at 57.6 and $5.98, plus input and output prices of $2.00/$10.00 against $4.00/$20.00 and 1,050,000 against 1,000,000-token context windows. A footer reads "Index figures per Artificial Analysis v4.3.2; GPT-6 vendor-reported items labelled in text."

La quarta riga è quella che decide la maggior parte delle implementazioni reali, e non è quella che compare sulla pagina di marketing. Il sovrapprezzo per il contesto lungo di GPT-6 Sol è aggressivo rispetto al suo stesso prezzo di richiamo: se si superano i 272.000 token di input, l'intera richiesta viene fatturata a $4.00 e $15.00, non solo l'eccedenza. Per un agente che mantiene una sessione lunga con un documento di grandi dimensioni nel contesto, questo elimina silenziosamente gran parte del vantaggio del prezzo dimezzato. Claude Opus 5.5 non prevede un passaggio equivalente, quindi una richiesta da 400.000 token gli costa la stessa tariffa per token di una da 4.000.

Dove si trovano i dieci punti, perché non sono distribuiti in modo uniforme

Un indice composito nasconde i propri componenti, e questo nasconde un profilo insolitamente irregolare. Estrai le valutazioni individuali rispetto alle quali si possono leggere i numeri di entrambi i fornitori:

• Humanity's Last Exam — Claude Opus 5.5 61,4% contro GPT-6 Sol 47,9%, un divario di 13,5 punti sul ragionamento astratto
• SciCode — Claude Opus 5.5 66,9% contro GPT-6 Sol 57,6%, un divario di 9,3 punti sul codice di livello research
• Terminal-Bench 4.0 — Claude Opus 5.5 59,6% contro GPT-6 Sol 43,9%
• Richiamo su contesto lungo — Claude Opus 5.5 84,7% contro GPT-6 Sol 83,7%, un divario di 1,0 punto, il più stretto di questa pagina
• Uso agentico di strumenti multi-turn — i due modelli si collocano a pochi punti di distanza sulla famiglia τ²-Bench, dove entrambi sono forti

A screenshot of the top of the Artificial Analysis leaderboard table, under the Model, Context Window, Creator, Intelligence Index, Cost per Task, Tokens/s, First Chunk and Response column headings, showing Claude Opus 5.5 (max with fallback) at 58 and $5.98 per index task, Claude Sonnet 5.5 at 56, Claude Opus 5.5 (xhigh) at 56 and (high) at 54, Claude Fable 5.1 at 53, GPT-6 Astra (max) at 53 and $3.26, Gemini 4 Argon (high) at 53 and $1.99, GPT-6 Astra (xhigh) at 52 and GPT-6.1 Sol (max) at 52 and $0.72.

La distribuzione è tutto. Sul ragionamento in astratto — una domanda d'esame difficile, un problema di ricerca senza risposta esistente da copiare — Claude Opus 5.5 è decisamente in vantaggio, e il divario è troppo ampio per essere rumore. Nell'estrarre un fatto da un input molto lungo, i due sono di fatto alla pari, e GPT-6 Sol ha la finestra marginalmente più ampia. Se il tuo carico di lavoro consiste in recupero di documenti lunghi e lavoro con agenti su sessioni lunghe, i dieci punti sono in gran parte un problema di qualcun altro. Se si tratta di ragionamento nuovo, sono un tuo problema, e ti costano 5,7× per attività per evitarli.

Cosa ti dice e cosa non ti dice il rollout di ChatGPT

C'è la tentazione di leggere «1,2 miliardi di utenti settimanali ora hanno GPT-6» come una prova di capacità. Non lo è. È una prova di distribuzione, e OpenAI è esplicita nel dire che il rollout di ChatGPT è alimentato da GPT-6 Sol per i piani a pagamento e da GPT-6 Luna per Free e Go, entrambi «ottimizzati per la conversazione quotidiana» — un'ottimizzazione diversa da quella del prodotto API. I modelli dietro Work e Codex non sono cambiati con questo rilascio, che è il segnale più chiaro nell'annuncio del fatto che si tratta di un evento di superficie consumer piuttosto che di un rilascio di capacità. Chiunque valuti «il GPT-6 che usano 1,2 miliardi di persone» dovrebbe sapere che sta misurando un deployment ottimizzato per la chat, non l'endpoint API.

Ciò che il rollout cambia è l'impostazione predefinita. Un modello semplicemente disponibile per tutti finisce in molti più prototipi, strumenti interni e progetti collaterali a metà rispetto a un modello che devi scegliere deliberatamente. Se stai scegliendo un'API per qualcosa di duraturo, quella familiarità diffusa vale qualcosa — ma non vale dieci punti indice, e non vale 5,7× il costo per attività su una pipeline ad alto contenuto di ragionamento.

Eseguire entrambi senza scegliere

La risposta onesta a "dovrei cambiare" qui è che i due modelli vogliono lavori diversi, e la domanda se cambiare è soprattutto una questione di routing. Entrambi sono nel catalogo di OrcaRouter — GPT-6 Sol al prezzo del fornitore di $2,00/$10,00 con il livello long-context da $4,00/$15,00 riportato invariato, e Claude Opus 5.5 a $4,00/$20,00 — dietro una sola chiave e un unico endpoint compatibile con OpenAI, con 0% di ricarico rispetto al prezzo di listino del provider. Questo conta più del solito in una settimana in cui un fornitore cambia un rilascio per i consumatori, perché la nostra linea di prezzo è quella del provider, non la nostra.

Il pattern che si adatta a questo abbinamento è una separazione: inviare il traffico dei documenti lunghi e delle sessioni lunghe a quello dei due che costa meno a quel numero di token — che, oltre i 272.000 token, non è più GPT-6 Sol — e inviare il traffico di ragionamento inedito a Claude Opus 5.5, tenendo GPT-6 Sol come failover automatico, così che un limite di frequenza su una rotta non diventi un'interruzione dalla tua parte. Non devi risolvere la discussione in dieci punti per andare in produzione; devi sapere quali delle tue richieste si trovano nella parte della distribuzione in cui si applica.

A screenshot of the OrcaRouter model page for anthropic/claude-opus-5.5, showing the Anthropic vendor label, a 2026-09-22 release date, a 1M-token context window, a 128K-token maximum output, text, image and file input with vision, tool calling, JSON output and reasoning modes, and pricing of $4.00 per million input tokens and $20.00 per million output tokens with a $0.20 cached-input rate.

Il verdetto, per quello che è

Claude Opus 5.5 è il modello migliore secondo la metrica su cui entrambi i laboratori pubblicano i propri risultati, e non c'è partita nelle due valutazioni che contano di più per il ragionamento complesso. GPT-6 Sol costa la metà al prezzo di listino, un quinto del costo per attività sulla suite indipendente, ed è ormai il modello predefinito nell'app che la maggior parte dei tuoi colleghi ha già aperta. Nessuno di questi fatti è cambiato questa settimana; ciò che è cambiato è che GPT-6 ha smesso di essere qualcosa che dovevi scegliere ed è diventato qualcosa che hai.

La cosa da tenere d'occhio è se la prossima mossa di OpenAI sarà un passo sul fronte delle capacità o un altro passo sul fronte della distribuzione. Il suo stesso annuncio fissa esplicitamente questa aspettativa — l'azienda dice di volere che ChatGPT costruisca nel tempo sempre più interfacce di cui le persone hanno bisogno — e quella è una roadmap che riguarda le superfici, non i punti dell'indice. Se la tua decisione dipende dall'indice, è ancora Claude Opus 5.5 a vincerlo. Se invece dipende dal costo su volumi elevati e dal fatto che il modello sia uno che tutti già conoscono, GPT-6 Sol è oggi la scelta predefinita più sicura, con la clausola sul contesto lungo come l'unica riga del suo listino tariffe di cui devi tenere conto nel budget.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno