
Gemini 4 Argon vs GPT-6 Sol: un quinto del prezzo, quattro volte la fattura
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 219 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Esegui la suite di indici Artificial Analysis su Gemini 4 Argon e il costo addebitato è di $2,407. Esegui la stessa suite su GPT-6 Sol e il costo addebitato è di $1,546. Stesso indice, stessi compiti, stessa settimana. I due modelli hanno listini identici — $2.00 per milione di token di input e $10.00 per milione di token di output, Argon come tariffa introduttiva dichiarata da Google e Sol come tariffa standard di OpenAI — eppure il costo finale per svolgere un lavoro identico differisce del 56%, a favore del modello che totalizza cinque punti in meno. Questo divario è l'intera ragione per cui vale la pena scrivere questo confronto, e non ha nulla a che fare con il listino prezzi.
Google ha annunciato Gemini 4 Argon il 2026-09-30, definendolo la nuova era dell'intelligenza di frontiera, al prezzo di $2 in input e $10 in output con input in cache scontato del 95%, in distribuzione ai difensori informatici fidati tramite il Fairwind Program. GPT-6 Sol è disponibile a livello generale dal 2026-09-22, quando OpenAI ha rilasciato il livello intermedio della linea GPT-6 a $2 in input e $10 in output con uno sconto cache del 90%. Uno è acquistabile oggi su un endpoint compatibile con OpenAI e l'altro non è acquistabile da nessuno al di fuori di una coorte designata, che è il bivio pratico in questo articolo. Ma l'inversione dei costi di cui sopra sopravvive anche se si mette completamente da parte la disponibilità, e capire perché è la parte utile.
L'inversione, in termini semplici
Artificial Analysis pubblica sia un Intelligence Index sia un resoconto di quanto è costato eseguirlo. Letti insieme, dicono questo:
• Intelligence Index — Gemini 4 Argon 52,6 contro GPT-6 Sol 47,5. Un divario di cinque punti, misurato con Argon alla sua alta impostazione di effort e Sol a max, quindi il confronto è generoso verso Sol anziché verso Argon.
• Prezzo di listino per milione di token — identico. $2,00 in ingresso / $10,00 in uscita su entrambi. Le letture dalla cache sono l'unica differenza: $0,10 su Argon, $0,20 su Sol.
• Costo per attività di indicizzazione — Gemini 4 Argon $1,99 contro GPT-6 Sol $1,05. Argon costa circa il doppio per attività nonostante costi lo stesso per token.
• Costo per eseguire la suite completa — Gemini 4 Argon $2,407 contro GPT-6 Sol $1,546.
• Velocità di output misurata — GPT-6 Sol 77,0 token al secondo rispetto a Gemini 4 Argon 48,9, una differenza di 1,6× che si manifesta sia in latenza sia in spesa.
C'è una riga in quell'elenco che spiega tutte le altre, e non è il prezzo. È il conteggio dei token. Sui compiti dell'indice stesso, Gemini 4 Argon ha generato circa 561.000 token di output per compito; GPT-6 Sol ne ha generati circa 282.000. Argon pensa per il doppio del tempo per rispondere alla stessa domanda e, a una tariffa per token identica, è esattamente il doppio della fattura.

Perché i token sono il prezzo
Questa è la correzione che vale la pena interiorizzare prima che qualcuno stanzi un budget per una migrazione, perché l'intuizione va nella direzione sbagliata. Quando un modello ha lo stesso prezzo del suo concorrente e consuma il doppio dei token di output per completare, il prezzo per token non è il prezzo. Il prezzo è il prezzo per token moltiplicato per il numero di token che il modello decide di spendere, e quel secondo fattore è una proprietà del modello, non del listino.
Il margine varia enormemente da un'attività all'altra, il che peggiora le cose — non puoi applicare un moltiplicatore unico e andare avanti:
• Terminal-Bench 4.0 — Argon 165.330 token di output per attività rispetto ai 97.372 di Sol. Qui Argon costa $6,78 per attività rispetto ai $4,00 di Sol, anche se Argon ottiene il 57,1% contro il 43,9% di Sol.
• CritPt — Argon 109.533 token contro i 31.848 di Sol. Un rapporto di token di 3,4× su un'attività in cui Sol ottiene in realtà un punteggio superiore, 30,9% contro 27,1%.
• GDPval — Argon 74.571 token contro i 41.567 di Sol, a 1,82 $ per task contro 1,32 $.
• Onniscienza — un rapporto di token di 938 contro 2.662 in favore di Argon, a $0,010 per attività contro $0,027 di Sol. L'unica famiglia di attività in cui la direzione si inverte.
• Ragionamento su contesto lungo — Argon 2.197 token contro i 954 di Sol, e l'unico compito della suite in cui Sol vince chiaramente sul punteggio, 83,7% contro 79,7%.
CritPt è quello istruttivo. Un modello che consuma tre volte e mezzo i token per produrre una risposta leggermente peggiore alla stessa domanda non è una storia di capacità; è una storia di abitudini di spesa. Il ragionamento di Argon si dilunga, e su alcune forme di compito quella lunghezza si traduce in punteggio e su altre si traduce semplicemente in dollari. Il 52,6 dell'indice e il 47,5 di Sol sono l'aggregato, e gli aggregati nascondono esattamente questo.
Da dove vengono davvero i cinque punti
Poiché il divario dell'indice e il divario dei costi puntano in direzioni opposte, vale la pena sapere quali attività determinano ciascuno.
• Terminal-Bench 4.0 — Gemini 4 Argon 57,1% contro GPT-6 Sol 43,9%. La più grande vittoria singola di Argon, e la famiglia di task più vicina al coding agentico a lungo orizzonte.
• Onniscienza — Gemini 4 Argon 42.4 contro GPT-6 Sol 27.1. Un divario di quindici punti nella copertura fattuale, il divario proporzionale più ampio della suite.
• AutomationBench-AA — Gemini 4 Argon 77,5% contro GPT-6 Sol 61,6%.
• SciCode — Gemini 4 Argon 61,8% contro GPT-6 Sol 57,6%.
• Humanity's Last Exam — Gemini 4 Argon 57,1% contro GPT-6 Sol 47,9%.
• GDPval — Gemini 4 Argon 1.611 contro GPT-6 Sol 1.487.
• ApexAgents / AA-Briefcase — GPT-6 Sol 1.482,78 Elo contro i 1.493,84 di Argon, un divario di 11 punti che rientra negli intervalli di confidenza pubblicati e dovrebbe essere considerato un pareggio.
• Ragionamento a contesto lungo — GPT-6 Sol 83,7% contro Gemini 4 Argon 79,7%. L'unica netta vittoria di Sol.
• CritPt — GPT-6 Sol 30,9% contro Gemini 4 Argon 27,1%. Sol vince ancora, di stretta misura.
Quindi il quadro non è "Argon è migliore". È che Argon è migliore nelle due cose con cui i suoi materiali di lancio hanno esordito — esecuzione end-to-end di attività aziendali e ingegneria del software su orizzonti lunghi — e Sol è alla pari o in vantaggio nella scala di ragionamento di stampo accademico e nel mantenere coerenza su un contesto lungo. Per un lettore il cui carico di lavoro è una pipeline di retrieval con un prompt da 400K token, Sol è allo stesso tempo il modello migliore e quello più economico, il che è una posizione insolita e confortevole in cui trovarsi.
Le differenze di specifica che sopravvivono alla discussione sul benchmark
• Output massimo — Gemini 4 Argon 1.000.000 di token in una singola traiettoria, che Google descrive come il più grande del settore e un aumento rispetto al limite di 64K della generazione precedente. GPT-6 Sol 128.000 token.
• Finestra di contesto — la scheda del fornitore di GPT-6 Sol dichiara circa 1.050.000 token; quella di Argon è 1.000.000. Artificial Analysis ha misurato Sol a 872.000 token tramite il suo harness, che è una misurazione dell'harness e non un dato di scheda — considera la scheda come la specifica e il numero dell'harness come ciò che il valutatore ha effettivamente messo alla prova.
• Modalità di input — entrambe accettano testo, immagini e file. Il materiale di lancio di Argon fa leva anche sulla comprensione di video lunghi, dove Google dichiara il 91,7% su LVBench e la descrive come stato dell'arte; si tratta di un dato dichiarato dal fornitore e nessun organismo indipendente lo ha ancora riprodotto.
• Input video — Debole. Artificial Analysis inserisce Argon nei grafici con l'input video disattivato e cita esplicitamente il video al lancio, mentre la scheda di Sol non elenca affatto il video. Se il video è determinante nella tua pipeline, nessuna delle due schede lo chiarisce e dovresti fare dei test prima di progettare l'architettura.
• Sforzo di ragionamento — Sol espone uno sforzo configurabile (da none a max, medium predefinito) nell'API ed è stato inserito nel grafico a max. Argon è stato inserito nel grafico a high; nessuno ha pubblicato la stessa suite alla sua impostazione più alta.
Il tetto di output di 1M token è quello che potrebbe cambiare davvero un'architettura invece che un budget. Tutto ciò che attualmente suddividi in una dozzina di chiamate concatenate per restare sotto il limite di 128K — un set di patch su più file, un report di audit completo, un documento lungo in un'unica passata — diventa una sola chiamata, con meno punti in cui un loop di agente può perdere lo stato. Se questo valga il doppio del costo per attività dipende interamente dal fatto che tu abbia quel carico di lavoro. Se ce l'hai, probabilmente ne vale la pena. Se le tue chiamate si limitano a classificare e restituire, sono soldi spesi per un margine di capacità che nessuno occuperà.
L'impostazione dello sforzo che nessuno ha eguagliato, e perché è importante
Un'avvertenza merita un paragrafo a sé, perché va contro la lettura del divario di cinque punti nell'indice come una pura differenza di capacità. Artificial Analysis posiziona Gemini 4 Argon alla sua impostazione di impegno di ragionamento alta e GPT-6 Sol a max. Non sono lo stesso gradino sulle due scale, e la direzione della discrepanza è interessante: Sol è stato eseguito alla sua impostazione più costosa e Argon a una intermedia.
Seguono due letture e i dati non riescono a distinguerle. O Argon al massimo otterrebbe un punteggio superiore a 52,6 — ma consumerebbe anche più di 561.000 token per attività e costerebbe più di 1,99 $ — oppure otterrebbe più o meno lo stesso punteggio, il che significherebbe che la manopola dello sforzo non incide granché su questa suite. Non esiste alcuna esecuzione pubblicata che risolva la questione. Chiunque citi 52,6 come limite massimo di Argon sta citando una configurazione, non un modello, e la configurazione è quella che il fornitore di Argon ha scelto di pubblicare per prima.
La stessa logica si applica al 47.5 di Sol, ma nella direzione opposta: max è il vertice della sua scala, quindi la cifra è più vicina a un massimo che a un minimo. Una sfida ad armi pari, a parità di sforzo, potrebbe ridurre il divario, e potrebbe anche ribaltare il confronto dei costi, poiché i token che max consuma sono i token che costano 10 dollari per milione.
La biforcazione della disponibilità, che determina la risposta effettiva
Gemini 4 Argon non è disponibile in via generale. L'annuncio di Google afferma che verrà distribuito a una serie di difensori informatici fidati tramite il Fairwind Program, che l'azienda partecipa al processo volontario di accesso al modello in fase di pre-rilascio del governo degli Stati Uniti e che l'accesso generale per sviluppatori, aziende e consumatori arriverà «il prima possibile», a cominciare dai clienti paganti dell'API e dagli abbonati a Google AI Ultra. Non esiste alcun identificatore di modello, no, alcuna quota e alcuna data. Non è presente su alcuna API pubblica, compresa la nostra — controlla il catalogo e restituisce 404, perché lì non esiste ancora.
GPT-6 Sol è un prodotto richiamabile. Su OrcaRouter è openai/gpt-6-sol, sullo stesso endpoint compatibile con OpenAI degli altri oltre 200 modelli del catalogo, al prezzo di listino di OpenAI passato con zero ricarico, quindi i $2/$10 sopra indicati e il passaggio di contesto lungo da 272.000 token a $4/$15 sono ciò che paghi effettivamente, non ciò che dichiara un tariffario. Il failover automatico tra provider copre il caso in cui la rotta si degrada durante l'esecuzione, e il DSL di routing consente a una singola applicazione di inviare il suo traffico economico di classificazione a un modello più piccolo e il suo traffico di ragionamento complesso a Sol senza un secondo SDK.

Quell'ultima soluzione è la risposta onesta a questo confronto per la maggior parte dei team. L'argomento sul costo a favore di Argon è reale, ma subordinato a un carico di lavoro in cui domina il lavoro degli agenti a lungo orizzonte; l'argomento sul costo contrario è reale su ogni altro carico di lavoro; e comunque questo mese non puoi comprarlo. La mossa che costa poco è costruire ora l'infrastruttura di valutazione — i tuoi prompt, il tuo sistema di punteggio, eseguiti su Sol con qualche impostazione di effort — così che, quando Argon arriverà ai clienti paganti delle API, avrai una risposta misurata a una domanda a cui tutti gli altri risponderanno basandosi su una classifica.
Cosa lo risolverebbe
Tre cose, in ordine di quanto sposterebbero il verdetto. Disponibilità generale di Argon a un prezzo reale, non introduttivo — la parola "introduttivo" significa che i $2/$10 possono cambiare, e la sequenza di Google stessa mette prima i clienti API a pagamento, quindi la prima tariffa pubblicata dopo il lancio è quella da tenere d'occhio. Un'esecuzione pubblicata di Artificial Analysis di Argon alla sua impostazione di sforzo massima, che direbbe se 52.6 è un tetto o ci manca un pelo. E una riproduzione indipendente del dato DeepSWE v1.1 — Google dichiara 77.9% e lo definisce un nuovo stato dell'arte; è riportato dal fornitore e non riprodotto al di fuori di Google a oggi.
Fino ad allora la divisione è netta e leggermente ironica. GPT-6 Sol è il modello meglio verificato, quello più veloce, quello meno costoso per attività completata, e quello che puoi chiamare questo pomeriggio. Gemini 4 Argon è il modello con il punteggio più alto nella classifica che il suo fornitore ha scelto di pubblicare, circa due volte più costoso da usare davvero, e non ancora in vendita. Scegliere tra i due non è un giudizio sulla capacità. È un giudizio su quale delle due frasi descrive il tuo mese.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
