Una hero card generata per GPT-6.1 Sol vs Claude Opus 5.5, con il titolo "Un divario reale, distribuito in modo disomogeneo", due info card che recitano "GPT-6.1 Sol: Intelligence Index 51.8, $0,72 per attività indice, richiamo su contesto lungo 83,0%" e "Claude Opus 5.5: Intelligence Index 57.6, $5,98 per attività indice, richiamo su contesto lungo 84,7%", un footer che recita "Dati secondo Artificial Analysis, Intelligence Index v4.3.2, entrambi i modelli rappresentati con l'impostazione di massimo sforzo.", e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

GPT-6.1 Sol vs Claude Opus 5.5: un divario reale, distribuito in modo disomogeneo

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il divario di 5,8 punti tra Claude Opus 5.5 e GPT-6.1 Sol sull'Artificial Analysis Intelligence Index è il più ampio di qualsiasi altra coppia in questo insieme e, a differenza della maggior parte di esse, non si colmerà con un cambio di impostazione. Claude Opus 5.5, rilasciato il 22 settembre 2026 e proposto a 4,00 $ per milione di token di input e 20,00 $ per milione di token di output, ottiene 57,6. GPT-6.1 Sol, rilasciato il 29 settembre 2026 a 2,00 $ e 10,00 $, ottiene 51,8. Claude Opus 5.5 è il modello con il punteggio più alto, con un margine più ampio di quello che separa la maggior parte dei modelli di frontiera gli uni dagli altri, e costa 8,3 volte di più per attività per arrivarci: 5,98 $ contro 0,72 $. Finora il modello costoso sta semplicemente vincendo, che è la versione meno interessante di questo confronto. Ciò che lo rende degno di essere letto è che i 5,8 punti non sono distribuiti uniformemente su tutta la suite: sull'unico asse che decide la maggior parte del lavoro su documenti lunghi e sessioni lunghe, i due modelli sono entro due punti l'uno dall'altro.

Entrambi sono modelli di punta nello stesso segmento di mercato: finestre di contesto di classe 1M, tetti di output di 128K, input testuale, immagini e file, pensiero esteso da un lato e una scala di impegno a cinque livelli dall'altro. Claude Opus 5.5 succede a Claude Opus 5 ed è posizionato per ragionamento impegnativo, programmazione e lavoro agentico a lungo orizzonte; GPT-6.1 Sol si colloca un livello sotto GPT-6 Astra ed è posizionato sulla programmazione agentica, sull'uso del computer e sul lavoro professionale a forte componente documentale. Sono destinati agli stessi compiti. La misurazione dice che non sono ugualmente bravi in tutti.

Dove si trovano realmente i 5.8 punti

Un indice composito nasconde le sue componenti. Estrai le valutazioni individuali e il divario smette di sembrare un divario e inizia a sembrare un profilo.

• Humanity's Last Exam — Claude Opus 5.5 61,4% vs GPT-6.1 Sol 52,9%, un divario di 8,5 punti sul ragionamento astratto

• SciCode — Claude Opus 5.5 66,9% vs GPT-6.1 Sol 54,2%, un divario di 12,7 punti sul codice di livello di ricerca

• Richiamo su contesto lungo — Claude Opus 5.5 84,7% vs GPT-6.1 Sol 83,0%, uno scarto di 1,7 punti nel recupero di informazioni da un input lungo

• Terminal-Bench 4.0 — Claude Opus 5.5 59,6% rispetto a un dato di Sol non pubblicato alla stessa revisione

• Finestra di contesto — GPT-6.1 Sol 1.050.000 token rispetto a Claude Opus 5.5 1.000.000 token, con un tetto di output di 128.000 token su entrambi

• Costo per attività di indicizzazione — Claude Opus 5.5 $5.98 vs GPT-6.1 Sol $0.72

La distribuzione è il racconto. Dove il compito è il ragionamento in astratto — una domanda d'esame difficile, un problema di programmazione di livello ricerca senza una risposta esistente da copiare — Claude Opus 5.5 è decisamente avanti, e un divario di 12,7 punti su SciCode non è rumore. Dove il compito è trovare il passaggio giusto in un input molto lungo e usarlo, i due modelli sono di fatto alla pari, e GPT-6.1 Sol mantiene quella posizione con 50.000 token di capacità in più. Una gran parte del lavoro produttivo sui LLM è del secondo tipo: risposta aumentata da retrieval, revisione di contratti e documenti depositati, analisi di log e trascrizioni, revisione di codice su un grande repository. Quel lavoro è misurato dal terzo punto, non dai primi due, e su quel punto il premium compra 1,7 punti.

Leggere onestamente le righe dell'indice

Due avvertenze vanno accanto a quei numeri piuttosto che in fondo alla pagina.

Le configurazioni differiscono. Artificial Analysis riporta nei grafici Claude Opus 5.5 in una configurazione "Max, Default Fallback" e GPT-6.1 Sol al massimo sforzo. Entrambe sono le impostazioni più potenti con cui ciascun modello viene pubblicato, il che rende il confronto equo, ma è un confronto tra due tetti massimi anziché tra due impostazioni predefinite di produzione. Le impostazioni predefinite di Claude Opus 5.5 in un'API ospitata possono differire dall'esecuzione riportata nel grafico, e lo sforzo predefinito di GPT-6.1 Sol è medio.

La riga Terminal-Bench è deliberatamente vuota su un lato. Il 59,6% di Claude Opus 5.5 proviene dalla revisione di Artificial Analysis in cui è stato pubblicato; il valore equivalente di GPT-6.1 Sol non è disponibile in una revisione corrispondente. Citare un numero tratto da un'esecuzione diversa dello stesso benchmark sarebbe un confronto falsato, e la mossa onesta è lasciare la cella vuota anziché riempirla con qualcosa di approssimativamente corretto.

La verbosità va nella stessa direzione qui come è andata contro i fratelli più economici: Claude Opus 5.5 emette 260 milioni di token di output sulla suite di indici contro i 67 milioni di GPT-6.1 Sol, una differenza di 3,9× a una tariffa che è già due volte più alta. È da lì che nasce un rapporto di 8,3× per task quando il listino prezzi indica 2× in input e 2× in output. Il sovrapprezzo non è di 8,3× perché il modello costa 8,3× — è di 8,3× perché costa 2× e pensa 3,9 volte più a lungo.

Le ragioni per pagarlo

Se il tuo lavoro assomiglia ai primi due punti dell'elenco, il calcolo è semplice e favorisce Claude Opus 5.5. Un divario di 12,7 punti su codice scientifico di livello della ricerca, o di 8,5 punti su ragionamento astratto complesso, è la differenza tra un agente che chiude un ticket senza supervisione e uno che richiede un umano ogni tre passaggi. La programmazione agentica su una grande base di codice è il carico di lavoro che entrambi i fornitori citano per primo, ed è il carico di lavoro in cui il divario è più ampio. Pagare 5,98 $ invece di 0,72 $ per attività per evitare un'esecuzione fallita che costa a un ingegnere venti minuti non è una scelta difficile.

C'è un secondo argomento che non riguarda affatto i punteggi. Claude Opus 5.5 ha quindici giorni e ha generato un insieme di esperienze di valutazione, revisione e deployment da parte di terzi che un modello di otto giorni non possiede. Per un percorso di produzione, la maturità delle conoscenze circostanti vale qualcosa che l'indice non prezza.

La tesi contraria, e il numero che la decide

Il controargomento è la riga del contesto lungo. Se la forma dominante del vostro traffico è «input grande, risposta breve» — e per moltissimi team è così — allora l'asse per cui vi viene addebitato il costo non è l'asse che consumate. Sul richiamo in contesto lungo i due modelli distano 1,7 punti con un rapporto di prezzo di 8,3×, e il modello più economico ha la finestra più ampia. È il caso in cui il sovrapprezzo è reale, misurato e speso per una capacità che il carico di lavoro non esercita mai.

Il numero decisivo, quindi, non è l'indice. È la quota dei tuoi compiti che assomigliano a SciCode anziché a recall. I team che possono rispondere a quella domanda dai propri log dovrebbero farlo dai propri log; una suite di benchmark è un proxy per un mix di lavori, e il mix è la variabile.

Entrambi su un unico tasto, ed è proprio questo che rende la domanda a cui si può rispondere.

A screenshot of the OrcaRouter model page for anthropic/claude-opus-5.5, credited to Anthropic and dated 2026-09-22, showing text, image and file input with text output, a 1,000,000-token context window reading 1M tokens with a 128K maximum output, and a rate row reading $4.00 input and $20.00 output per million tokens alongside a 3.68 s median time to first token and a 36.5M seven-day traffic figure.A screenshot of OpenAI's developer model page for GPT-6.1 Sol, headed 'GPT-6.1 Sol' with the tagline 'Near-Astra performance for complex work at a lower cost', showing a 1,050,000-token context window with 128,000 max output tokens and an Apr 30, 2026 knowledge cutoff, a price row reading $2 input and $10 output per million tokens, and the note that reasoning.effort supports low, medium (default), high, xhigh and max while none and minimal are not supported.

Claude Opus 5.5 è su OrcaRouter al suo prezzo di $4,00 / $20,00 con letture dalla cache a $0,20. GPT-6.1 Sol è su OrcaRouter a $2,00 / $10,00, passando a $4,00 / $15,00 oltre i 272.000 token di prompt, con letture dalla cache a $0,10. Entrambi al prezzo di listino del provider, senza alcun ricarico, su un'unica chiave e un'unica fattura.

Questo conta più del solito per questo abbinamento, perché i due modelli non sono sostituti — sono una decisione di instradamento. Invia il lavoro su documenti lunghi e ad alto volume a GPT-6.1 Sol, mantieni il lavoro di ragionamento complesso e di modifica del codice su Claude Opus 5.5, ed entrambi risiedono dietro lo stesso endpoint con le stesse credenziali. Se una rotta si degrada, il failover automatico sposta la chiamata invece di farla fallire, e poiché l'instradamento è dichiarativo può essere espresso per classe di attività invece che per applicazione. Testare la suddivisione è una modifica di configurazione, non una migrazione.

L'ultima cosa che vale la pena dire riguarda la durata di validità di questo confronto. Entrambi i modelli hanno pochi giorni o poche settimane. GPT-6.1 Sol ha una configurazione indipendente pubblicata; Claude Opus 5.5 ne ha una. Una singola esecuzione per modello è un'istantanea, e la modalità di errore interessante non è che uno di questi numeri sia sbagliato — è che una configurazione a impegno medio, o un secondo valutatore, ridisegni il profilo. Fino ad allora, la lettura difendibile è quella che danno i componenti: un divario decisivo sul ragionamento complesso e sul codice di ricerca, uno piccolo sul lavoro a contesto lungo, e una spesa di 8,3× che deve essere giustificata dalla parte del vostro carico di lavoro che assomiglia alla prima.

A generated scoreboard titled 'GPT-6.1 Sol vs Claude Opus 5.5 — the scoreboard' showing two columns on six shared rows: Intelligence Index 51.8 against 57.6; cost per index task $0.72 against $5.98; Humanity's Last Exam 52.9% against 61.4%; SciCode 54.2% against 66.9%; long-context recall 83.0% against 84.7%; context window 1,050,000 against 1,000,000 tokens. A footer reads 'Index, per-task cost and evaluation figures per Artificial Analysis, Intelligence Index v4.3.2.'

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno