
Gemini 4 Argon su FrontierSWE: Esclama "Eureka!", poi valuta i propri compiti.
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 261 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 216 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- xAISpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
Gemini 4 Argon ha un problema di personalità, ed è la cosa più interessante che chiunque abbia detto sul modello da quando Google lo ha annunciato il 2026-09-30. Sul benchmark FrontierSWE a orizzonte ultra-lungo, il modello che si è classificato terzo — dietro a GPT-6 Astra e Claude Opus 5.5 — ha lasciato ai suoi valutatori un'impressione memorabile: la sua parola preferita è "Eureka!", e impiega gran parte del budget di venti ore del compito a essere estremamente duro con se stesso. Questa è un'osservazione di un operatore di benchmark, contigua a una fuga di notizie e proveniente da un'unica fonte, non una dichiarazione di un fornitore né una nota di rilascio, e vale la pena essere precisi su ciò che ti dice e ciò che non ti dice. Nessuno dei tre modelli sopra menzionati ha una data di GA per Argon ad esso associata; l'osservazione riguarda il comportamento all'interno di un harness, e i numeri che la accompagnano sono la prima misurazione indipendente di Argon su un benchmark che Google non esegue direttamente.
Che cos'è davvero l'esclamazione «Eureka!»
La fonte è un post di @nrehiew_, un ingegnere che si occupa di valutazione dei modelli, pubblicato il 30 settembre 2026, che cita l'annuncio di Gemini 4 Argon di Sundar Pichai. La sostanza è costituita da tre affermazioni: Argon è il modello più divertente che abbiano valutato su FrontierSWE; la sua parola preferita è «Eureka!»; ed è estremamente autocritico. L'autore del post lo descrive come un grande miglioramento rispetto ai Gemini precedenti, pur conservando quella personalità, e lo definisce impressionante.
Leggilo con attenzione, perché è facile sovrainterpretarlo. È l’impressione di un singolo valutatore ottenuta osservando le tracce degli agenti, non un risultato con punteggio, non una metrica pubblicata e non qualcosa che Proximal Labs — che costruisce e gestisce FrontierSWE — abbia sottoscritto come risultato. Non esiste una colonna "autocritica" nella classifica. Ciò che rende l’osservazione degna di essere scritta non è che sia autorevole; è che rappresenta l’unica lettura qualitativa che qualcuno al di fuori di Google abbia offerto su Argon, e poiché il modello non è disponibile al pubblico, tracce come queste sono attualmente l’unico modo per vedere la cosa comportarsi.
Approda anche a una domanda reale per chiunque intenda far girare Argon come agente. Le sessioni di coding a lungo orizzonte sono per lo più un problema di gestione del budget: un modello che si interrompe per riconsiderare, che valuta il proprio lavoro intermedio e che annuncia svolte è un modello che spende token in processo. Che sia un punto di forza o una tassa dipende interamente dal fatto che l'autocritica converga o entri in loop. Un singolo valutatore che dice "impressionante" è un dato, non una risposta.
FrontierSWE v2, e perché il piazzamento al terzo posto è la vera storia
FrontierSWE non è il tipo di benchmark da cui si può ricavare un numero da titolo. È sviluppato da Proximal Labs e descritto nel loro repository come un benchmark per agenti di coding a orizzonte ultra lungo che mette alla prova implementazione, ingegneria delle prestazioni e ricerca ML. La versione 2 è stata pubblicata a settembre 2026 con 21 nuovi task oltre al set originale, per un totale di 34, e prevede che un agente continui a lavorare fino a venti ore. Tutto viene eseguito tramite l'harness proprietario di Proximal, proximus, che è costruito su mini-swe-agent e aggiunge compattazione del contesto, visione e uno strumento di submit esplicito. Il punteggio è mean@5 — la media di cinque tentativi per task — con la fascia di incertezza riportata che spazia dalla media della peggior esecuzione di ciascun task alla media della sua migliore esecuzione.
Quella metodologia è importante per leggere onestamente la riga di Argon:
• Punteggio — Gemini 4 Argon 55,0% media@5, ±9,9, rispetto a GPT-6 Astra 65,5% e Claude Opus 5.5 62,3%
• Dispersione — le esecuzioni di Argon vanno da 44,5% (peggiore@5) a 64,3% (migliore@5), un intervallo che nella parte alta si sovrappone a quello di Opus 5.5 (52,0%–71,5%) e non si sovrappone affatto a quello di Astra (55,1%–73,0%)
• Costo per prova — Argon $129,36, Opus 5.5 $98,87, Astra $1.029,65
• Tempo reale per prova — Argon 10,6 ore, Opus 5.5 14,2 ore, Astra 12,1 ore
La prima cosa che noti è che Argon è terzo e non è vicino al secondo per punteggio. La seconda cosa — quella che dovrebbe decidere se ti interessa — è che su questo benchmark Argon è strettamente dominato da Claude Opus 5.5. Opus 5.5 ha ottenuto un punteggio più alto (62,3% vs 55,0%) ed è costato meno per prova ($98,87 vs $129,36). Non c'è alcun asse qui in cui Argon vinca. Il suo unico vantaggio è il tempo: 10,6 ore contro le 14,2 di Opus 5.5, il che è reale se paghi per il tempo effettivo e non per i token, e irrilevante se paghi per un budget per prova.
La classifica di Proximal stessa riporta una nota a piè di pagina in corrispondenza della riga di Argon, che chiunque citi questo numero dovrebbe ripetere: «Gemini 4 Argon: il tasso di hit della cache è molto più basso a causa di un'impostazione non di produzione». Si tratta dei valutatori che segnalano di aver eseguito Argon al di fuori della configurazione che userebbe un deployment di produzione, il che gonfia il suo costo e, plausibilmente, la sua latenza. È un'avvertenza specificamente sulla cifra di costo, ed è il motivo per cui i 129,36 $ dovrebbero essere letti come un limite superiore anziché come un listino prezzi.
Il numero che il grafico di Google stesso non mostra
È qui che la questione delle fonti diventa davvero interessante, ed è qui che la maggior parte dei resoconti di questo risultato sbaglierà. Il post di annuncio di Google include un grafico di benchmark con una riga FrontierSWE v2. Quella riga riporta GPT-6 Astra 65,5%, Claude Fable 5.1 56,3%, Claude Opus 5.5 62,3%. Gemini 4 Argon non è presente. La classifica in tempo reale di Proximal ha Astra al 65,5% e Opus 5.5 al 62,3% — gli stessi dati — ma colloca Claude Fable 5.1 al 56,5%, non al 56,3%, e indica Gemini 4 Argon al 55,0%.
Il motivo dell'omissione non è misterioso, e Google stessa lo dice: le note metodologiche che accompagnano la sua suite di valutazione affermano che i risultati di FrontierSWE sono riportati dalla classifica pubblica ufficiale di Proximal. Google non ha calcolato autonomamente questo benchmark. Stanno citando lo stesso terzo che citiamo noi, e l'unico dato di Argon che quel terzo pubblica è il 55,0%. Quindi la lettura onesta è che il punteggio FrontierSWE di Argon è una misura genuinamente indipendente — Proximal l'ha eseguito, sul proprio harness, sui propri task — e che colloca Argon dietro due concorrenti.
Tutto il resto nel grafico di Google è riportato dal fornitore e dovrebbe essere etichettato come tale nella tua testa: Argon 63,1% su Vals Index contro il 67,0% di Opus 5.5, 41,4% su AutomationBench contro il 42,5% di Opus 5.5, 89,6% su Vibe Code Bench contro il 90,3% sia di Astra sia di Opus 5.5, 87,5% su LVBench contro l'83,7%, 68,0% su CWE-bench v1 contro il 67,0% di Opus 5.5. Quelle sono le esecuzioni di Google delle valutazioni scelte da Google. La riga FrontierSWE è l'unica in quel quadro che un lettore può verificare in modo indipendente, ed è esattamente per questo che il piazzamento al terzo posto pesa di più del pattern di pareggi o vittorie di misura che lo circonda.
Ciò che dice Artificial Analysis, in modo indipendente
FrontierSWE è una lente. Artificial Analysis è l'altra, e concorda con la forma della vicenda. Sul loro Intelligence Index v4.3.2, Gemini 4 Argon nella sua configurazione ad alto ragionamento ottiene 52,56 — misurato in modo indipendente sul loro hardware, non riportato da Google — a un prezzo di listino di 2,00 $ per milione di token in input e 10,00 $ per milione di token in output, con uno sconto del 95% sull'input in cache. La loro strumentazione fissa il costo di una singola attività dell'indice a 1,99 $.
Il confronto che conta è lo stesso prodotto da FrontierSWE. Claude Opus 5.5 nella sua configurazione high ottiene un punteggio più alto sull'indice, 53,58, a un costo per attività inferiore, 1,82 $. Due valutatori indipendenti, utilizzando attività e harness diversi, collocano Argon dietro Opus 5.5 sia per qualità sia per costo. Questo è un segnale coerente, non un singolo artefatto di benchmarking, ed è la cosa più forte che si possa attualmente dire sull'economia di Gemini 4 Argon.

Annunciato, non rilasciato — e perché questa formulazione non è pedanteria
Non esiste alcun ID del modello Gemini 4 Argon. L'accesso viene distribuito gradualmente tramite il Fairwind Program a difensori informatici verificati, insieme a un'apertura per fasi ai clienti API a pagamento e agli abbonati a Google AI Ultra, senza che sia stata pubblicata una data di disponibilità generale. Il post di Google è l'annuncio di un modello e di una serie di valutazioni, non il lancio di un endpoint che puoi chiamare. Se hai letto articoli che lo descrivevano come un rilascio, quegli articoli sono in anticipo sui fatti.
Quella distinzione ha conseguenze pratiche per chiunque legga il dato di FrontierSWE. La valutazione è stata eseguita su un modello a cui Proximal aveva accesso in base a una qualche intesa; ti dice cosa il modello può fare, non ciò che puoi avere. Significa anche che le cifre delle prestazioni hanno un'emivita più breve del solito. Un modello che non è ancora GA può comunque cambiare — le impostazioni di decodifica, i prompt di sistema, i valori predefiniti per l'uso degli strumenti e l'impalcatura di sicurezza sono tutti ancora in fase di messa a punto, e la ragione dichiarata per cui il tasso di hit della cache di Argon era scarso è precisamente che i valutatori non stavano usando una configurazione di produzione. Aspettati che il 55,0% e i 129,36 $ cambino.
Cosa cambierebbe questo quadro: un ID di modello pubblicato con una rate card, una data GA, un rerun di FrontierSWE con impostazioni di produzione, e un secondo valutatore indipendente che riproduca il risultato del terzo posto. Finché non esisteranno almeno i primi due di questi, considera ogni numero di Argon — compresi quelli buoni nel grafico di Google stesso — come provvisorio.

La lettura della personalità è la parte che invecchierà meglio
I punteggi di benchmark di un modello pre-GA hanno una durata di conservazione misurata in settimane. L'osservazione comportamentale no. Il lavoro agentico a lungo orizzonte è dove il carattere di un modello si manifesta davvero, perché un budget di venti ore con 34 attività è abbastanza corda perché le tendenze di un modello si compongano: come si riprende da un approccio fallito, se si ferma a ripianificare, se sa distinguere tra un problema difficile e una svolta sbagliata. Un valutatore che osserva molte di queste tracce e descrive un modello come autocritico e incline a esclamare quando qualcosa funziona sta descrivendo un modello che esternalizza il proprio ragionamento sui propri progressi. Questa è un'ipotesi sul perché le esecuzioni di Argon si distribuiscono dal 44,5% al 64,3% — una fascia più ampia di quella di Opus 5.5 — ed è verificabile una volta che il modello è invocabile.
L'altra metà del commento è quella su cui bisogna essere scettici. "Un grande miglioramento rispetto ai precedenti Geminis" è un confronto con modelli che non sono mai stati valutati su questo benchmark con questo harness, quindi non può essere verificato in alcun modo rispetto alla classifica. È un'impressione, e come tale dovrebbe essere trattata, per quanto sia credibile la persona che la propone.

Dove ti lascia questo se oggi hai davvero bisogno di un agente a lungo orizzonte
Non puoi chiamarlo Gemini 4 Argon, quindi la domanda pratica non è Argon contro qualcos'altro — è quale modello dovresti usare per il lavoro su cui Argon è stato sottoposto a benchmark. L'ordinamento di FrontierSWE stesso risponde a questo: GPT-6 Astra è in cima alla classifica con il 65,5%, ma a $1.029,65 per prova, circa dieci volte il costo dei due modelli sottostanti, mentre Claude Opus 5.5 offre il 62,3% per $98,87. La scelta di valore su questo benchmark è Opus 5.5, ed è anche il modello che ha battuto Argon su Artificial Analysis a un costo per attività inferiore.
Entrambi questi modelli, e gran parte dei primi dieci della classifica — tra cui GLM-5.3, Grok 4.7, Kimi K3, Qwen3.8-Max, DeepSeek V4 Flash Vision Exp e Muse Spark 1.2 — sono instradabili attraverso l'unica API di OrcaRouter insieme ad altri oltre 200 — una sola chiave, 0% di ricarico, quindi il prezzo di listino del fornitore è quello che paghi e un taglio dei prezzi da parte del fornitore arriva dalla nostra parte lo stesso giorno. Quest'ultima proprietà vale più del solito su un modello pre-GA: se il prezzo di Argon cambia da qui alla GA, cosa che la nota a piè di pagina sulla cache non di produzione suggerisce possa accadere, nulla della tua integrazione cambia quando accade. Il failover automatico è l'altro elemento che si adatta a questo caso specifico — un modello poco familiare i cui modi di guasto nessuno ha ancora mappato è esattamente ciò che non vuoi su un unico percorso di produzione codificato in modo fisso.
Per essere espliciti su una cosa: Gemini 4 Argon non è nel nostro catalogo. Una ricerca nella nostra API pubblica dei modelli per google/gemini-4-argon restituisce "model not found", e non lo ospita nessun altro: è accessibile solo tramite il Fairwind Program di Google, senza alcun ID modello pubblicato. Quando sarà richiamabile, lo instraderemo, e i dati FrontierSWE sopra sono il motivo per tenere d'occhio quel giorno invece di aspettare che arrivi. I modelli contro cui ha perso sono già lì.
Cosa guardare
I segnali che trasformerebbero questo da un "quello che sappiamo finora" in una decisione sono specifici. Un ID di modello pubblicato e il relativo listino prezzi. Una data di disponibilità generale. Una ripetizione di FrontierSWE con impostazioni di produzione, che risolverebbe la questione se il costo di $129,36 per prova sia una tariffa reale o un artefatto della configurazione della cache segnalata da Proximal. E, idealmente, un secondo valutatore che pubblichi le tracce di Argon, così che l'osservazione "Eureka!" smetta di essere un campione di uno.
Fino ad allora, il riassunto onesto è circoscritto e vale la pena tenerselo stretto: Gemini 4 Argon è stato annunciato, è insolitamente espressivo nelle tracce di agenti a lungo orizzonte secondo un valutatore, e sull'unico benchmark indipendente che possiamo verificare si è classificato terzo dietro due modelli — uno dei quali lo ha superato sia nel punteggio sia nel costo allo stesso tempo.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
