Scheda del titolo hero con il testo "Gemini 4 Argon vs Claude Opus 5.5 — la divisione del benchmark", con una striscia delle date con il testo "Argon annunciato il 2026-09-30" e "Opus 5.5 rilasciato il 2026-09-22", un badge con il testo "Argon: programma pilota definito, non disponibilità generale", e una riga a piè di pagina con il testo "Cifre di Argon dichiarate dal fornitore; cifre dell'indice di entrambi i modelli secondo Artificial Analysis."
Guides & Insights

Gemini 4 Argon vs Claude Opus 5.5: Il divario nei benchmark che nessuno si aspettava

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Gemini 4 Argon e Claude Opus 5.5 non concordano su chi sia migliore, e il disaccordo non è rumore. Sull'Intelligence Index di Artificial Analysis i due sono distanziati di cinque punti a favore di Opus 5.5. Sul Vals Index — la classifica dell'impatto economico ponderata per il PIL — Gemini 4 Argon è al primo posto e Claude Opus 5.5 è al terzo, dietro sia ad Argon sia a Claude Sonnet 5.5. Entrambe le classifiche hanno misurato gli stessi due modelli nella stessa settimana. Questo è tutto l'articolo: quale dei due dovresti scegliere dipende dal fatto che il tuo lavoro assomigli di più a una domanda d'esame o a un martedì in uno studio legale, e dal fatto che tu abbia o meno accesso API ad Argon, cosa che a oggi quasi nessuno ha.

Google ha annunciato Gemini 4 Argon il 30 settembre 2026 in un post di DeepMind attribuito a Koray Kavukcuoglu, SVP per Google DeepMind e Chief AI Architect. Anthropic ha rilasciato Claude Opus 5.5 otto giorni prima, il 22 settembre 2026. Uno dei due è un rilascio GA che puoi chiamare questo pomeriggio. L'altro è un'implementazione graduale per una coorte designata di difensori informatici più gli stessi ingegneri di Google, con l'intento dichiarato di raggiungere "clienti dell'API a pagamento e abbonati a Google AI Ultra" non appena le salvaguardie saranno pronte e senza alcuna data associata.

La risposta in una riga, prima del dettaglio

Se ti serve il miglior ragionamento generale misurato oggi e ti serve su una chiave di produzione, Claude Opus 5.5 è disponibile su OrcaRouter proprio ora e Gemini 4 Argon non è su alcuna API pubblica. Se stai sviluppando per agenti finanziari, legali, fiscali o di coding valutati sull'output economico per dollaro, i numeri di Argon sono migliori e il suo prezzo è un quinto di quello di Opus 5.5 per attività sull'unico benchmark che misura esattamente questo. Se lavori nella difesa informatica per infrastrutture critiche, Argon ha un programma a cui puoi candidarti e la risposta potrebbe essere sì.

Da dove proviene realmente ogni numero

Due comitati sugli indici, due metodologie, e vale la pena essere precisi su quale sia quale, perché i due schieramenti si citeranno a vicenda per mesi.

• Artificial Analysis Intelligence Index v4.3 — Claude Opus 5.5 a 57,6 e Gemini 4 Argon a 52,6, entrambi rilevati da Artificial Analysis il 2026-09-30. È un composito di dieci valutazioni, volutamente generalista rispetto ai task, ed è la classifica che la maggior parte delle persone cita come "la" classifica.

• Vals Index, aggiornato al 29/09/2026 — Gemini 4 Argon primo con il 68,90% (±0,97), Claude Sonnet 5.5 secondo con il 67,04% (±0,92), Claude Opus 5.5 terzo con il 66,97% (±0,89). Vals pondera le attività finanziarie, di programmazione, legali e fiscali in base alla quota di ciascun settore sul PIL degli Stati Uniti, quindi un modello mediocre nei puzzle ma eccellente nella revisione dei contratti e nel lavoro con i fogli di calcolo ottiene un buon punteggio qui.

Un divario di cinque punti in AA è reale e non è piccolo. Anche un divario di due punti in Vals è reale, e con gli intervalli di confidenza stampati sulla classifica il 68,90 ±0,97 di Argon contro il 66,97 ±0,89 di Opus 5.5 rappresenta una separazione di circa 1,5 errori standard — meglio di un lancio di moneta, ma non schiacciante. Nessuna delle due classifiche è sbagliata. Stanno misurando lavori diversi.

A two-column scoreboard comparing Gemini 4 Argon and Claude Opus 5.5 on six dimensions. Gemini 4 Argon reads: AA Intelligence Index 52.6, Vals Index 68.90% (rank 1), price $2 / $10 per million tokens, cost per index task $1.99, output ceiling 1M tokens, throughput 48.9 tok/s. Claude Opus 5.5 reads: AA Intelligence Index 57.6, Vals Index 66.97% (rank 3), price $4 / $20, cost per index task $5.98, output ceiling 128K tokens, throughput 92.2 tok/s. A footer line reads that Argon figures are vendor-reported and both models' index and cost figures are per Artificial Analysis on 2026-09-30.

Un'avvertenza sulla configurazione, che va contro l'interpretazione del divario AA come puro confronto tra modelli. Artificial Analysis colloca Gemini 4 Argon al suo alto livello di sforzo e Claude Opus 5.5 a «Ragionamento adattivo, Sforzo massimo, Fallback predefinito». Non sono lo stesso punto sulle due scale di sforzo, quindi il dato principale 57,6 contro 52,6 non è un confronto omogeneo a budget di ragionamento equivalenti. È il numero che entrambe le pagine pubblicano, ed è il numero da citare se si vuole essere equi nei confronti di Anthropic, ma non è un esperimento controllato.

Il costo per attività è il punto in cui il divario diventa scomodo.

Artificial Analysis pubblica anche una rendicontazione di quanto è costato eseguire la sua suite di indici, e qui i due modelli non sono affatto vicini.

• Costo per attività di indicizzazione — Gemini 4 Argon 1,99 $ contro Claude Opus 5.5 5,98 $.

• Costo per eseguire l'intera suite di indici — Gemini 4 Argon 2.407 $ contro Claude Opus 5.5 8.708 $.

• Prezzo di listino per milione di token — Gemini 4 Argon $2 in input / $10 in output (tariffa introduttiva dichiarata da Google, con input in cache scontato del 95%, quindi $0.10) contro Claude Opus 5.5 $4 in input / $20 in output.

• Throughput — Gemini 4 Argon 48,9 token di output al secondo, primo token dopo 2,79 secondi; Claude Opus 5.5 92,2 token di output al secondo ma una latenza del primo token di 702 secondi sullo stesso harness, ovvero la tassa del pensiero esteso che si manifesta apertamente.

• Costo per esecuzione di Vals — Gemini 4 Argon $15,68 contro Claude Opus 5.5 $32,14 sullo stesso set di attività ponderato per il PIL.

C'è un dettaglio che vale la pena segnalare invece che minimizzare: la classifica di Vals elenca le tariffe di Argon come $4 in ingresso / $20 in uscita, mentre l'annuncio di Google indica $2 in ingresso / $10 in uscita per il periodo introduttivo. L'interpretazione più probabile è che Vals mostri una tariffa di listino standard e Google ne mostri una promozionale, ma questa è un'inferenza e non una dichiarazione pubblicata da nessuna delle due parti. Se il tuo budget dipende da quel numero, chiedi a Google.

Ciò che Argon sostiene e ciò che è stato verificato

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated Sep 30 2026, credited to Koray Kavukcuoglu, SVP Google DeepMind and Chief AI Architect, with the standfirst reading that Gemini 4 Argon delivers frontier performance in complex workflows across real-world software engineering, enterprise knowledge work like legal and finance, and cybersecurity defense.

Il post di Google è denso di cifre e ognuna di esse è dichiarata dal fornitore. Nessuna, per quanto mi risulti, è stata riprodotta in modo indipendente, e le classifiche indipendenti sopra riportate misurano cose diverse da quelle che Google ha scelto di mettere in primo piano. Espresse come affermazioni di Google stesso:

• DeepSWE v1.1 — 77,9%, descritto come un nuovo stato dell'arte nell'ingegneria del software a lungo orizzonte in contesti reali.

• Comprensione di video lunghi LVBench — 91,7%, descritta come all'avanguardia.

• AutomationBench (il benchmark di Zapier per attività aziendali end-to-end) — 1° posto con il 51,3%.

• Remediazione delle vulnerabilità di CWE-bench v1 — a pari merito al primo posto al 68%, sulla scia del risultato di Gemini 3.8 Flash Cyber sulla classifica v0.

• Gray Swan Indirect Prompt Injection — descritto come leader, senza cifre pubblicate nel post.

• Vals Finance Agent v2 e Harvey's Legal Agent Benchmark — descritti come leader, parimenti senza un numero stampato nell'annuncio.

Le due famiglie di affermazioni che hanno davvero un supporto indipendente sono quelle di cui vale la pena fidarsi di più: Vals conferma la posizione nell'indice con una cifra e un intervallo, e Artificial Analysis conferma un indice di 52,6 e il prezzo. Gli aneddoti sulla produttività interna — un miglioramento del 40% rispetto a una baseline pubblicata su una subroutine quantistica, più di 300 TiB di memoria liberati in tutta la flotta di Google dagli agenti Argon — sono risultati interni all'azienda senza alcun test esterno e vanno letti come tali.

Cos'è Opus 5.5, se hai vissuto sotto un sasso

Claude Opus 5.5 è il modello di punta di Anthropic: contesto da 1M di token, output massimo di 128K, input multimodale su testo, immagini e file, ragionamento esteso, uso di tool e output strutturati. È succeduto a Claude Opus 5 il 22 settembre 2026 e il pezzo forte del suo lancio è stato probabilmente il taglio del prezzo — il tier è sceso anziché salire, a $4/$20 con letture dalla cache a $0.20. Oggi è instradabile su OrcaRouter esattamente a quella tariffa, con il prezzo di listino del provider passato così com'è, con ricarico zero, e una variazione di prezzo del fornitore arriva dalla nostra parte lo stesso giorno in cui arriva dalla loro.

Sui punteggi a livello di attività che entrambi i modelli hanno, il quadro è una vera e propria altalena, piuttosto che un dominio incontrastato:

• Terminal-Bench 4.0 — Claude Opus 5.5 59,6% contro Gemini 4 Argon 57,1%.

• SciCode — Claude Opus 5.5 66,9% contro Gemini 4 Argon 61,8%.

• Humanity's Last Exam — Claude Opus 5.5 61,4% contro Gemini 4 Argon 57,1%.

• Ragionamento su contesti lunghi — Claude Opus 5.5 84,7% contro Gemini 4 Argon 79,7%.

• CritPt — Claude Opus 5.5 31,7% contro Gemini 4 Argon 27,1%.

• Onniscienza — Claude Opus 5.5 46.4 contro Gemini 4 Argon 42.4.

• GDPval — Opus 5.5 1.846 contro Gemini 4 Argon 1.611.

• AutomationBench-AA — Gemini 4 Argon 77,5% contro Claude Opus 5.5 69,5%. Questo è l'unico punteggio di attività testa a testa in cui Argon vince chiaramente, ed è anche la famiglia di attività più vicina a ciò che premia il Vals Index.

Quindi il pattern è coerente: Opus 5.5 è in vantaggio nella scala di ragionamento di stampo accademico, e Argon è in vantaggio nell'esecuzione end-to-end dei task. Non è più una contraddizione tra le due classifiche. È lo stesso risultato espresso due volte.

La capacità che nessuno sta confrontando

Il tetto di output di Gemini 4 Argon è di 1.000.000 di token in una singola traiettoria, in aumento rispetto ai 64K della generazione precedente. Claude Opus 5.5 limita l'output a 128K. Entrambi dispongono di una finestra di contesto da 1 milione di token, ma contesto e output sono budget diversi, e questo è il più grande salto di specifica singolo dell'annuncio.

Se ciò sia importante dipende interamente da ciò che esegui. Un tetto di output di 128K è generoso per chat, revisione del codice, estrazione strutturata e passaggi degli agenti. È un muro invalicabile per generare un intero set di patch di migrazione, un rapporto di audit completo o un documento di ampio respiro in un'unica passata — i flussi di lavoro con cui Google ha scelto di illustrare il lancio. Se la tua pipeline concatena venti chiamate per rimanere sotto un limite, il tetto di Argon ti farà risparmiare latenza e codice di orchestrazione. Se non lo fa, stai pagando per un margine che non utilizzerai.

La disponibilità è la variabile decisiva, non la qualità

Questa è la parte del confronto che non ha alcun benchmark associato e che conta più di tutti loro.

Gemini 4 Argon non è generalmente disponibile. Il post di Google afferma che verrà distribuito ai difensori informatici di fiducia tramite il Fairwind Program, che l'azienda è coinvolta nel processo volontario di accesso ai modelli in pre-release del governo statunitense, e che un accesso più ampio per sviluppatori, imprese e consumatori arriverà "il prima possibile", a partire dai clienti API a pagamento e dagli abbonati a Google AI Ultra. Non esiste un identificatore di modello, nessun endpoint, nessuna quota pubblicata e nessuna data. Non è nel nostro catalogo e non è nemmeno nell'API pubblica di nessun altro, quindi una pagina dei prezzi per Argon non esiste ancora.

Claude Opus 5.5 è disponibile da oggi. Su OrcaRouter è anthropic/claude-opus-5.5, raggiungibile attraverso lo stesso endpoint compatibile con OpenAI degli altri oltre 200 modelli del catalogo, con failover automatico tra provider quando una rotta si degrada, e un DSL di routing per i casi in cui vuoi inviare parte del traffico a Opus 5.5 e il resto altrove con la stessa chiave. Nessun secondo contratto, nessun secondo SDK.

A capture of the OrcaRouter model page for Anthropic: Claude Opus 5.5, showing the Anthropic provider, a release date of 2026-09-22, a 1,000,000-token context window, a 128,000-token maximum output, text, image and file input, and pricing of $4.00 input / $20.00 output per million tokens with cache reads at $0.20 and cache writes at $5.00.

La raccomandazione pratica per il prossimo mese è poco appariscente: costruire su Opus 5.5, mantenere il nome del modello in un valore di configurazione anziché in una stringa letterale, e mettere un modello economico dietro il percorso di retry, così che un picco di latenza su un'esecuzione con primo token a 702 secondi non trascini giù con sé anche il tuo prodotto. Quest'ultimo punto non è teorico — la latenza del primo token di Opus 5.5 sull'harness di AA è di undici minuti, e che si tratti di un artefatto dell'harness o del fatto che il modello pensi davvero più a lungo di qualsiasi cosa prima, il tuo budget di timeout dovrebbe essere stabilito dal numero, non dal marketing.

Che cosa cambierebbe questo verdetto?

Tre cose, in ordine di probabilità. La disponibilità generale di Argon con un prezzo pubblicato, che renderebbe immediatamente azionabile l'argomentazione sui costi e metterebbe alla prova se $2/$10 sopravvive al contatto con il traffico reale. Un'esecuzione indipendente e riproducibile di DeepSWE v1.1 e CWE-bench v1 al di fuori di Google, che confermerebbe le affermazioni del fornitore o le smentirebbe. Oppure una configurazione di Argon di Artificial Analysis alla sua impostazione di impegno massimo, che stabilirebbe se il divario di cinque punti nell'indice è una differenza di capacità o un artefatto delle impostazioni di impegno.

Finché uno di questi non si concretizza, la sintesi onesta è che Opus 5.5 è il modello meglio verificato e Argon è la pretesa dal prezzo migliore. Quale dei due si possa effettivamente usare oggi non è una questione incerta.

Claude Opus 5.5 è attivo su OrcaRouter alla tariffa di listino del fornitore, senza ricarichi, insieme al resto del catalogo — se vuoi confrontarlo con il tuo carico di lavoro reale invece che con una classifica, anthropic/claude-opus-5.5 è l'id da chiamare, e passare in seguito a un modello diverso è una modifica di una sola riga sulla stessa chiave.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno