
Gemini 4 Argon vs GPT-6 Astra: un testa a testa sull'indice, e un calo di prezzo di due terzi
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 144 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Due modelli di frontiera, a 0,11 punti di distanza sull'Intelligence Index di Artificial Analysis. Gemini 4 Argon ottiene 52,56. GPT-6 Astra ottiene 52,67. Se doveste scegliere tra loro in base alla capacità generale misurata, potreste tirare una monetina, e la differenza tra i due punteggi è inferiore all'intervallo di confidenza di entrambi. È una situazione davvero rara in un mercato in cui i primi dieci modelli coprono in tutto circa quindici punti, e questo rende il confronto di Gemini 4 Argon il più facile da ragionare tra quelli affrontati, perché l'argomentazione sulla capacità è già finita prima di iniziare e tutto ciò che resta sono l'economia e l'accesso.
I due, però, non sono gemelli. Argon è stato annunciato il 2026-09-30 da Google DeepMind e viene distribuito per fasi, a cominciare dai difensori informatici fidati nel Fairwind Program. GPT-6 Astra è stato rilasciato all'inizio di settembre — la nostra scheda di catalogo lo data 2026-09-04, Artificial Analysis lo elenca 2026-09-03 — ed è una rotta live che puoi chiamare questo pomeriggio a $10 in input e $50 in output per milione di token, con una finestra di contesto di 1.050.000 token e un tetto di output di 128.000 token. Uno di questi modelli ha un prezzo sul quale puoi essere fatturato oggi.
Dove un divario di 0,11 punti è reale e dove è rumore
Un indice è un composito, quindi due modelli che sono in parità sul composito possono differire in modo significativo nelle sue parti. Qui le parti concordano per lo più, con tre eccezioni degne di essere menzionate.
• Terminal-Bench 4.0 — GPT-6 Astra 59,1% contro Gemini 4 Argon 57,1%. Astra è in testa, di stretta misura.
• Ragionamento a contesto lungo — GPT-6 Astra 80,7% contro Gemini 4 Argon 79,7%.
• GPQA Diamond — GPT-6 Astra 96,1%. Argon non pubblica alcun dato su questa classifica.
• CritPt — GPT-6 Astra 31,7% contro Gemini 4 Argon 27,1%.
• SciCode — Gemini 4 Argon 61,8% contro GPT-6 Astra 56,5%.
• Humanity's Last Exam — Gemini 4 Argon 57,1% contro GPT-6 Astra 54,7%.
• AutomationBench-AA — Gemini 4 Argon 77,5% contro GPT-6 Astra 68,5%.
• GDPval — Gemini 4 Argon 1.611 contro GPT-6 Astra 1.542.
• Onniscienza — GPT-6 Astra 43,4 contro Gemini 4 Argon 42,4.
• ITBench-SRE — GPT-6 Astra 48,6% contro nessun dato pubblicato di Argon.
• Velocità di output — GPT-6 Astra 51,2 token al secondo contro Gemini 4 Argon 48,9. Praticamente allo stesso livello.
• Latenza del primo token sull'index harness — Gemini 4 Argon 2,8 secondi contro GPT-6 Astra 320,2 secondi.
Astra presenta vantaggi nel ragionamento scientifico a scelta multipla, sui problemi di fisica dei punti critici e sul benchmark SRE. Argon presenta vantaggi nella programmazione scientifica, sul set di attività end-to-end più arduo e sul lavoro valutato in termini di PIL. Nessuno dei due vantaggi è abbastanza ampio da costituire da solo la base per una migrazione.

La questione della latenza è diversa. 320 secondi al primo token sono cinque minuti e mezzo di silenzio prima che venga emesso qualcosa, contro meno di tre secondi per Argon. Entrambi misurano la stessa cosa — il tempo al primo chunk nelle esecuzioni dell'indice di Artificial Analysis — quindi sono comparabili. Il reasoning di Astra è sempre attivo e configurabile da sforzo basso fino a massimo; un'esecuzione a sforzo massimo su un compito difficile ragiona davvero per minuti prima di parlare. Se questo sia un difetto dipende interamente dalla tua interfaccia. Per un job in batch non costa nulla. Per qualsiasi cosa con un utente che guarda uno spinner, è la differenza più visibile all'utente tra questi due modelli, maggiore di qualsiasi divario di benchmark nella pagina.
Lo step di prezzo, che è il vero soggetto
È qui che il pareggio si risolve, e si risolve in un modo che è facile modellare male, perché il listino tariffe di Astra ha tre fasce che si somigliano.
• Standard, fino a 272.000 token di input — GPT-6 Astra 10,00 $ in input / 50,00 $ in output, letture dalla cache a 1,00 $, scritture nella cache a 12,50 $.
• Contesto lungo, oltre 272.000 token di input — GPT-6 Astra $20.00 in / $75.00 out, letture dalla cache a $2.00. L'intera richiesta viene ritariffata al livello superiore, non solo l'eccedenza: input 2× e output 1,5×.
• Modalità veloce — 2× la tariffa standard applicabile, quindi $20.00 in ingresso / $100.00 in uscita. È questa la cifra di $100 che viene citata come se fosse la tariffa per contesto lungo; non lo è.
• Gemini 4 Argon — 2,00 $ in input / 10,00 $ in output, tariffa fissa su base introduttiva, input in cache a 0,10 $, senza alcuno step pubblicato né alcuna fascia fast pubblicata.
Quindi Argon costa cinque volte meno in input e cinque volte meno in output rispetto al livello standard di Astra, e dieci volte meno in input sopra 272K. Due misurazioni indipendenti dei costi dicono la stessa cosa da una prospettiva diversa: Artificial Analysis colloca Argon a $1,99 per attività dell'indice contro i $3,26 di Astra, e $2.407 per eseguire l'intero indice contro i $5.324 di Astra. Il rapporto per attività è più piccolo del rapporto per token per lo stesso motivo per cui lo era rispetto a DeepSeek — Argon usa meno token per completare — ma è comunque 1,6×.
La classifica di Vals ponderata per il PIL racconta una terza versione della stessa storia: Argon al primo posto con il 68,90% e 15,68 $ per esecuzione, Astra al sesto posto con il 63,13% e 18,46 $. Astra costa di più e ottiene un punteggio inferiore lì. Il materiale di Google è esplicito sul fatto che il prezzo è una tariffa introduttiva, una parola che significa che può cambiare, e la lettura onesta è che il vantaggio di prezzo di Argon è reale e la sua permanenza non è garantita.
Due fatti architetturali che contano più dei benchmark

Prima il tetto di output. Gemini 4 Argon genera fino a 1.000.000 di token in una singola traiettoria — l'annuncio di Google lo segnala come un'espansione da 64K rispetto alla generazione precedente. GPT-6 Astra si ferma a 128.000. Entrambi hanno una finestra di contesto di circa un milione di token, quindi si tratta puramente di quanto il modello può scrivere in una sola volta. Per la generazione di testi lunghi, modifiche al codice con patch complete o la stesura di documenti in un'unica passata, è una differenza di otto volte in ciò che una singola chiamata può produrre. Per chat, estrazione e brevi passaggi agentici, entrambi i tetti sono di fatto infiniti e la differenza non ti costa nulla.
Modalità al secondo posto, e qui il vantaggio si inverte sotto un aspetto. GPT-6 Astra accetta testo, immagini e file. Gemini 4 Argon accetta testo, immagini, video e file, e il materiale di lancio di Google punta specificamente sulla comprensione di video lunghi — un dato LVBench del 91,7% riportato dal fornitore. Se la tua pipeline acquisisce video, Astra non è un sostituto. L'audio non è menzionato nemmeno nell'elenco delle modalità pubblicato di Argon, quindi non dare per scontato che l'aggiornamento lo includa.
Cosa fare concretamente
Astra è disponibile e Argon no, e questo risolve la maggior parte delle decisioni per il prossimo mese. Il percorso concreto che non spreca lavoro: punta su GPT-6 Astra se il tuo carico di lavoro richiede un modello di ragionamento sempre attivo, con una solida accuratezza scientifica e un comprovato track record agentico, mantieni il nome del modello nella configurazione e imposta i timeout del client in base al comportamento misurato di Astra anziché all'ottimismo — una generazione del primo token da cinque minuti farà scattare un timeout predefinito di 60 secondi, e uno stream che muore a 300 secondi sembra un'interruzione. Se sei sensibile ai costi al di sopra dei 272K token di input, modella esplicitamente la nuova tariffazione prima di impegnarti, perché lo scatto raddoppia l'input e aumenta l'output della metà su un unico confine.

La via di mezzo interessante è che non devi scegliere un unico default. Astra e Argon — quando Argon sarà disponibile — sono lo stesso tipo di modello rivolto alla stessa classe di lavoro, il che li rende partner naturali di failover anziché concorrenti per lo stesso slot. Su OrcaRouter, openai/gpt-6-astra è attivo al prezzo di listino del provider con markup zero, sullo stesso endpoint compatibile con OpenAI di oltre 200 altri modelli, con failover automatico tra provider e un DSL di routing per esprimere una configurazione primario-e-backup su un'unica chiave. Quando Argon entrerà nel catalogo con qualunque id pubblichi Google, il passaggio è una stringa — nessun secondo contratto, nessun lavoro di integrazione e nessuna ricostruzione di qualunque cosa tu abbia costruito attorno ad Astra nel frattempo.
Cosa romperebbe definitivamente la parità?
Un prezzo di Argon pubblicato dopo il periodo introduttivo, e una riproduzione indipendente delle dichiarazioni di Google sulle capacità agentiche — il dato del 77,9% di DeepSWE v1.1 e il risultato del 68% di CWE-bench v1 sono entrambi riportati dal fornitore e nessuno dei due ha alle spalle un'esecuzione esterna. L'uno o l'altro potrebbe spostare Argon al rialzo o al ribasso in modo sostanziale, perché un vantaggio di 0,11 punti nell'indice non è un cuscinetto contro uno svantaggio di costo di 1,6× se il vantaggio di costo si rivela temporaneo, e non è un deficit se Google mantiene la tariffa introduttiva e il tier long-context di Astra incide più del previsto in produzione.
Per ora: sulla capacità generale misurata questi due sono lo stesso modello in due wrapper. Astra è quella con una route attiva, uno step di prezzo noto e una pausa di riflessione di cinque minuti. Argon è quella con una card più economica e nessun endpoint. Il pareggio è reale, e uno dei suoi lati è acquistabile.
