
Il gradino di Argon nella scala Gemini 4 — e perché non esiste un G4 Ultra
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 221 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 110 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
La risposta breve alla domanda che ha dato origine a questo articolo è che Gemini 4 Argon è il modello di punta di Google, non il suo livello più alto, perché il livello superiore non esiste ancora — e forse non nella forma che chiunque si aspetta. Google ha pubblicato esattamente un modello Gemini 4, Argon, e l'unica pagina first-party sul suo dominio sotto il percorso /models/gemini/ultra/non è affatto una pagina di modello: reindirizza ai piani di abbonamento a Google AI. Quel reindirizzamento è il fatto più utile di questo articolo, e si può verificare con una sola riga da un terminale. Tutto il resto qui riguarda dove si colloca davvero Argon una volta che si smette di leggere il suo prezzo come un'etichetta di livello e si comincia a leggerlo come un numero.
Due cose sono vere allo stesso tempo ed è facile confonderle. Argon è il Gemini più capace che esista, e Argon non è un modello di livello frontier. Supera ogni modello Google mai rilasciato, con un margine così ampio che il confronto non è davvero un confronto, e si colloca nell’Intelligence Index di Artificial Analysis a una frazione di punto da due flagship concorrenti che sono a loro volta cinque punti pieni dietro l’attuale leader. Google gli ha assegnato un prezzo come se si trovasse un gradino sotto la frontiera, e la misurazione indipendente concorda. Quindi il prezzo non è una decisione di marketing che sottovaluta il modello. È un’affermazione accurata sul modello.
Questo è un articolo su ciò che sappiamo finora. Gemini 4 Argon è stato annunciato il 30 settembre 2026 in un post di Google DeepMind attribuito a Koray Kavukcuoglu, e viene distribuito inizialmente a una coorte esplicitamente indicata di cyber defender attraverso il Fairwind Program di Google — non agli sviluppatori, non alle imprese, non ai consumatori e non a chiunque possieda una carta di credito. Non ha alcun ID di modello nell'API Gemini, nessun endpoint e nessun prezzo pubblicato per token rispetto al quale poter essere fatturati. Per esso non esistono identificatori di modello, né throughput e affidabilità misurati su traffico reale, il che significa che la misurazione riportata di seguito è l'esecuzione di benchmark di un solo laboratorio e nulla più. Quando un dato proviene da Google, è etichettato come di Google; quando proviene da Artificial Analysis, è etichettato come loro. Nulla di quanto qui riportato deve essere interpretato come un'affermazione che Argon sia un prodotto acquistabile.
La scala che Google ha effettivamente rilasciato, desunta dalle sue stesse pagine
Il modo più rapido per rispondere a “dove si colloca Argon nella gamma Gemini 4” è smettere di chiedere della gamma e iniziare a elencare i modelli per cui Google pubblica pagine. Una gamma è un concetto di marketing; una pagina è un fatto. Ecco a cosa si risolvono i percorsi first-party al 1° ottobre 2026.
• deepmind.google/models/gemini/pro/restituisce 200 e il suo titolo è "Gemini 3.1 Pro — Google DeepMind". Lo slot Pro sul sito di Google stesso è ancora un modello della generazione 3.1.
• deepmind.google/models/gemini/flash/ restituisce 200 e il suo titolo è “Gemini 3.8 Flash — Google DeepMind”. Lo slot Flash si è spostato tre volte — 3.5, 3.6, 3.7, 3.8 — mentre lo slot Pro non si è spostato affatto.
• deepmind.google/models/gemini/argon/ restituisce 404. Argon non ha un percorso per singolo modello. La sua sede è la pagina della famiglia su deepmind.google/models/gemini/, che è dove Google mette il modello con cui attualmente è in testa.
• deepmind.google/models/gemini/ultra/ restituisce 302 e reindirizza a one.google.com/about/google-ai-plans/, la pagina di abbonamento per i consumatori. Lo stesso vale per il percorso più vecchio deepmind.google/technologies/gemini/ultra/. Un “Ultra” nel percorso dei modelli di Google è un livello di fatturazione, non un checkpoint.
• deepmind.google/models/gemini/nano/ restituisce 301 alla pagina della famiglia Gemini. Inoltre, non esiste nemmeno uno slot Nano come pagina di modello autonoma.
• deepmind.google/models/gemini/model-cards/ — l'indice che Google mantiene di ogni model card che ha pubblicato — non contiene alcuna voce per Argon e nessuna voce con "Gemini 4" nel nome. Le sue righe Gemini più recenti sono 3.8 Flash, 3.8 Audio, 3.7 Flash, 3.6 Flash, 3.5 Flash, 3.5 Flash-Lite e 3.1 Pro. L'indice delle card è il documento che si muove più lentamente in questo insieme, quindi il suo silenzio non è prova che Argon non avrà mai una card; è prova che le scartoffie non hanno ancora raggiunto l'annuncio.
• deepmind.google/models/, l'indice dei modelli, elenca “Gemini 4 Argon” come scheda di punta con lo slogan “La nostra prossima era di intelligenza di frontiera”, direttamente sopra “Gemini 3.8 Flash — Il migliore per affrontare attività agentiche complesse su larga scala”. Due schede Gemini, una generazione di distanza, in quest'ordine.
Mettendo insieme questi elementi, la forma della scala non è ambigua. La superficie pubblica dei modelli di Google attualmente presenta una voce al gradino Gemini 4, una voce al gradino Gemini 3.8, un gradino Pro ormai obsoleto risalente a tre generazioni e mezzo fa, e nulla al di sopra di alcuno di essi. La parola “Ultra” sul dominio di Google rimanda a un abbonamento. Non esiste una pagina Gemini 4 Pro, né una pagina Gemini 4 Flash, né una pagina Gemini 4 Ultra, né una model card di Gemini 4. Google ha annunciato un modello, non una famiglia.
Esiste un Gemini 4 Ultra? Le prove, e cosa lo falsificherebbe
Questo merita una sezione a parte perché è la parte della domanda che più probabilmente riceverà una risposta diversa tra una settimana, e perché la risposta onesta ha una data di scadenza.
Le prove negative sono specifiche, non vaghe. Un 302 sul percorso Ultra verso la pagina dei piani di abbonamento non è un segnale debole; è un reindirizzamento configurato dal team web di Google stesso. Diversi pattern di URL blog.google per un post su Gemini 4 Ultra restituiscono 404 — il percorso products, il percorso innovation-and-ai models-and-research e il semplice percorso dell'annuncio. La denominazione Ultra qui ha una forma, e la forma depone contro un Gemini 4 Ultra. L'annuncio originale di Gemini di Google ha introdotto Gemini 1.0 "ottimizzato per tre dimensioni diverse: Ultra, Pro e Nano", con Gemini Ultra descritto come "il nostro modello più grande e più capace". Un post di lancio che nomina tre dimensioni è ciò che sembra l'annuncio di una famiglia. Il post di Argon nomina un solo modello e nessun fratello. Google in seguito ha ritirato il nome del modello Ultra in favore di livelli numerici e ha spostato la parola sul lato abbonamenti del business, dove ora denomina il piano consumer di punta. Una pagina di modello che reindirizza a una pagina di piani è ciò che sembra un nome di modello ritirato quando il sito di marketing è stato ripulito intorno ad esso.
Inoltre, nell'annuncio non c'è nulla che prometta un fratello maggiore. Il post di lancio di Argon descrive Argon come “il nostro nuovo modello di frontiera” e descrive il rilascio graduale, il lavoro sulle salvaguardie e le distribuzioni interne, poi si ferma. Non dice “primo della famiglia Gemini 4”, non anticipa un Pro o un Ultra e non nomina un successore. La stessa impostazione di Google tratta Argon come il modello principale, non come quello piccolo.
Ciò che falsificherebbe la conclusione è facile da enunciare e vale la pena tenere d'occhio, perché uno qualsiasi di questi la ribalterebbe nel giro di un giorno.
• Un 200 su deepmind.google/models/gemini/ultra/ che restituisce una pagina di modello anziché la pagina dei piani, oppure un nuovo percorso figlio models/gemini/ che compare accanto a pro e flash.
• Una riga di Gemini 4 Ultra che compare nell'indice delle model card, il modo in cui Google conferma storicamente che un modello esiste come artefatto documentato.
• Un secondo ID modello nell'API Gemini nel namespace gemini-4-*. Attualmente Argon non ne ha nessuno, quindi un ID Pro o Ultra sarebbe la prima prova che la famiglia è reale.
• Una voce nell'elenco dei modelli di Artificial Analysis, o una tabella di benchmark nella pagina della famiglia con una quarta colonna. Entrambe monitorano i rilasci di Google con sufficiente attenzione da essere tempestive.
• Un post di annuncio di Google I/O, Cloud Next o DeepMind che usa la parola “family” riguardo a Gemini 4. Il post di Argon no.
Finché non accade almeno una di quelle cose, un articolo che sostiene che stia per arrivare un Gemini 4 Ultra è una previsione travestita da resoconto. Trattalo di conseguenza, anche quando arriva da noi.

Leggere la scala dei prezzi come una dichiarazione di fascia
Il prezzo è l’unica parte di tutto questo che Google ha pubblicato di proposito, con una nota a piè di pagina, ed è la dichiarazione più chiara dell’intento relativo ai livelli in tutto il lancio. Il prezzo introduttivo di Argon è di 2 $ per milione di token di input e 10 $ per milione di token di output, con l’input in cache scontato del 95%, e la nota a piè di pagina numero uno di Google stessa dice che, dopo un periodo introduttivo che non era in grado di definire, “si applicherà il prezzo di 4 $ per 1M di token di input e 20 $ per 1M di token di output”.
Leggi quelle due coppie rispetto al campo e il claim di livello si scrive da sé.
• $4 / $20 è il prezzo di listino di Claude Opus 5.5. La tariffa post-introduttiva di Google per Argon cade esattamente sul tariffario dell'attuale leader di frontiera, per un modello che misura cinque punti dietro di esso.
• $2 / $10 è la fascia promozionale occupata sia da GPT-6 Sol sia da Claude Sonnet 5.5. La tariffa introduttiva di Argon è la stessa $2 / $10, il che colloca il prezzo di lancio di Argon nella stessa fascia di un Sol di fascia media anziché in quella di frontiera.
• $10 / $10 è il valore a cui si collocano sia Claude Fable 5.1 sia GPT-6 Astra. Argon costa un quinto del prezzo di input di Fable 5.1 e un quinto del suo prezzo di output, e ottiene un punteggio entro 0,0 da esso.
• $0.75 / $3.75 è Gemini 3.8 Flash. Argon è 2,7× quello in input e 2,7× in output — un netto passo avanti, non un precipizio.
Quindi Google ha posizionato Argon, quanto a prezzo, come un modello che si colloca sotto $10/$50 e sopra $0.75/$3.75, con un punto di assestamento finale a $4/$20. Niente in quella scala dice “frontier”. Dice “vertice della fascia media, con un prezzo di richiamo che si assesterà sulla stessa tariffa che il leader applica oggi, per meno capacità”. È una scelta commerciale difendibile. Non è il prezzo di un modello posizionato due livelli avanti rispetto a qualsiasi cosa.
Un punto strutturale che vale la pena tenere presente: lo scalino di prezzo di Argon è un vero e proprio scalino, definito in una nota a piè di pagina e senza data. Le famiglie Sonnet 5.5 e GPT-6 fanno qualcosa di simile con le fasce per i contesti lunghi, e Sol passa a $4/$15 oltre i 272K. Lo scalino di Argon è legato al tempo, non alla lunghezza del contesto: gli stessi $2/$10 si applicano all'intera finestra da 1M e solo il calendario cambia la tariffa. È una forma insolita, e rende qualsiasi confronto dei costi con Argon un esercizio a due colonne: quale periodo, e quale utilizzo.
Dove si colloca Argon rispetto ai rivali, sui numeri che esistono
Artificial Analysis ha pubblicato una misurazione di Gemini 4 Argon abbastanza rapidamente da renderla l'unica lettura indipendente disponibile. Nella revisione corrente al 1° ottobre — v4.3.2 — Argon ottiene 52,56 sull'Intelligence Index, configurato con sforzo di ragionamento elevato. I modelli che lo circondano non sono un campione casuale del campo.
• Claude Opus 5.5 si attesta a 57,62, misurato al massimo sforzo con fallback. Sono cinque punti e rotti sopra Argon, ed è l'attuale vertice della classifica.
• Claude Fable 5.1 si attesta a 53.35, misurato al massimo sforzo con fallback. Argon è indietro di 0.79.
• GPT-6 Astra si attesta a 52,67, misurato al massimo. Argon è indietro di 0,11.
• Claude Sonnet 5.5 si attesta a 55,98, anche il massimo con fallback. È un modello di fascia media che supera Argon di 3,4 punti, ed è il numero che dovrebbe preoccupare chiunque si aggrappi a «Gemini 4 Argon è il secondo miglior modello al mondo».
• GPT-6 Sol si attesta a 47,63, misurato al massimo, su una finestra di contesto di 872K. Argon è avanti di 4,9 rispetto a esso.
• Gemini 3.8 Flash si attesta a 40,93 con sforzo elevato. Argon è avanti di 11,6.
• Gemini 3.1 Pro Preview si attesta a 29,72. Argon è avanti di 22,8, il che è la dichiarazione più chiara in assoluto di quanto il livello Pro che Google sta distribuendo sia rimasto indietro rispetto alla propria ricerca.
Tre cose emergono da quell’elenco. Primo, Argon è alla pari con i due sfidanti, Fable 5.1 e Astra, e chiaramente indietro rispetto a due modelli Anthropic — Opus 5.5 e, cosa ancora più scomoda, Sonnet 5.5. Secondo, il divario tra Argon e il miglior modello mai rilasciato da Google è il più grande salto generazionale nell’attuale gamma, di gran lunga. Terzo, l’inquadramento del segnale secondo cui «la frontiera è avanti di almeno due livelli» è corretto nella sostanza ma leggermente impreciso nella geometria: c’è un livello di modello chiaramente davanti ad Argon (Opus 5.5 a 57.6) e un secondo modello in un livello più economico che è anch’esso davanti ad Argon (Sonnet 5.5 a 56.0), il che è un problema più serio che trovarsi due pioli più in basso su una scala sulla quale Argon in realtà si trova.
L’impostazione basata sul confronto dei prezzi nella domanda originale — “i prezzi suggeriscono che questo sia il loro equivalente di Sol/Sonnet” — si rivela all’incirca corretta sul prezzo di lancio e sbagliata su quello finale. Argon debutta allo stesso prezzo di Sol e Sonnet 5.5 e si assesta su quello di Opus 5.5. È prezzato come un modello di fascia media che intende diventare un modello dal prezzo di frontiera, pur non collocandosi, quanto a prestazioni, in nessuna delle due categorie.
Il quadro del costo per attività è dove Argon è più forte e dove il discorso sui livelli acquisisce una seconda dimensione. Sull'attività Index, Argon costa 1,99 $ ed emette 142.374 token di output. Opus 5.5 costa 5,98 $ ed emette 338.099. Sonnet 5.5 costa 7,62 $ per 599.849. Fable 5.1 costa 7,63 $ per 187.455. Astra costa 3,26 $ per 68.691. Gemini 3.8 Flash costa 1,24 $ per 154.230. Argon è il modo più economico per acquistare un punteggio vicino alla frontiera, ed è più economico, di meno di un dollaro per attività, rispetto al modello Flash che lo supera nel punteggio.
Le impostazioni di effort sono l'asterisco su tutto quanto sopra, e il campo non le riporta in modo uniforme. Argon è misurato a high; Opus 5.5, Fable 5.1 e Sonnet 5.5 a max con fallback; Astra e Sol a max. Una run a effort alto e una run a effort max non sono la stessa misurazione, e la scala di effort di Anthropic sposta un modello di diversi punti tra un'impostazione e l'altra. Se Argon misurato a effort max ottiene un punteggio sensibilmente superiore a 52,6, il discorso sui tier cambia. Nessuno ha ancora pubblicato quella run.
Ciò che afferma la tabella di Google stessa, e in che modo differisce da quella indipendente
La pagina della famiglia Gemini contiene una tabella delle prestazioni redatta da Google con quattro colonne — Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1, Claude Opus 5.5 — e diciannove righe di benchmark. È l'insieme di dichiarazioni più dettagliato che Google abbia pubblicato per questo modello, ed è interamente riferito dal fornitore. Leggerla confrontandola con l'Indice indipendente è istruttivo proprio perché i due non concordano sulla configurazione del settore.
Nella tabella di Google Argon vince tredici delle diciannove righe in modo netto o pareggia al primo posto, inclusi Vals Index Knowledge work a 68,9, AutomationBench a 51,3, Harvey’s Legal Agent Benchmark a 19,6, DeepSWE v1.1 a 77,9, LABBench 2 a 88,8, GraphWalks a 99,7 per la fascia ≤128K e 84,2 per la fascia 256K–1M, Agent’s Last Exam a 39,5, LVBench a 91,7 e Chartography a 71,6.
• Claude Opus 5.5 vince nelle righe che sanno di ingegneria continuativa: FrontierSWE v2 a 62,3 contro il 55,0 di Argon, Terminal-bench 4.0 a 66,4 contro 57,4, Terminal-Bench Science 0.1 a 63,3 contro 57,6 e PostTrainBench a 49,3 contro 45,3.
• GPT-6 Astra ottiene 68,1 su Terminal-Bench Science 0.1 e 72,6 sul sottoinsieme offline di OSWorld-2.0, e pareggia con Argon su CWE-bench v1 a 68,0. Claude Fable 5.1 perde in ogni riga, tranne che per un pareggio condiviso su Vibe Code Bench.
• Sull'Index indipendente, l'ordine è Opus 5.5 al primo posto, poi Sonnet 5.5, poi Fable 5.1, poi Argon e Astra praticamente alla pari. La tabella di Google non ha affatto una colonna per Sonnet 5.5, che è l'omissione più significativa che contenga: le quattro colonne della tabella sono scelte, e il modello che si posiziona sopra Argon nell'Index a un prezzo inferiore non è tra esse.
Niente di tutto ciò rende disonesta la tabella di Google. Le tabelle di benchmark dei fornitori sono selezionate, non campionate, e quelle di ogni laboratorio lo sono. Questo la rende un’affermazione più che una misurazione, e significa che la questione del tier non può essere risolta basandosi su di essa. L’unico punto in cui la tabella è davvero portante per questo articolo è il negativo: diciannove righe, quattro colonne e nessuna quinta colonna per un Ultra.

L'unica cosa riguardo ad Argon che non è affatto una questione di tier
Ogni argomentazione sui livelli di cui sopra presuppone che Argon sia un modello che prima o poi potrai chiamare. Vale la pena tenere distinta questa cosa dalla questione di posizionamento, perché le due hanno risposte diverse e solo una delle due riguarda le capacità.
Il limite di token di output di Argon è di 1 milione di token, in aumento rispetto a 64K, e Google lo afferma direttamente. Si tratta di un tetto di output, non di una finestra di contesto. La distinzione è importante perché i due concetti vengono costantemente confusi nella trattazione di questo lancio, e perché un limite di output di 1M è un'affermazione ingegneristica diversa da una finestra di contesto di 1M: il primo riguarda quanto può durare una singola traiettoria, il secondo quanto puoi fornire al modello in una volta sola. Google è stata esplicita sul limite di output e silenziosa sulla finestra di contesto. Artificial Analysis registra 1.000.000 di token anche per il contesto di Argon, ma quello è un campo del tracker e non una dichiarazione di Google, quindi considera le due cifre come provenienti da stanze diverse anche se si leggono allo stesso modo.
Ciò che non è disponibile in modo inequivocabile è l’accesso. Argon non è disponibile a livello generale, non è nella Gemini API sotto alcun identificatore e non è in alcun catalogo di terze parti. È disponibile per difensori informatici verificati tramite il Fairwind Program e per gli ingegneri di Google stessi, e la fase successiva che Google indica — “a partire dai clienti API a pagamento e dagli abbonati a Google AI Ultra” — non ha una data associata. Non puoi sottoporlo a benchmark sul tuo carico di lavoro. Ogni numero in questo articolo è quindi la misurazione di qualcun altro di un modello che non puoi usare.
Cosa farebbe salire Argon di un gradino?
Un giudizio di livello è un'istantanea, e ci sono circa cinque cose che cambierebbero questo, in ordine approssimativo di quanto conterebbero.
• Un'esecuzione a sforzo massimo misurata in modo indipendente. Argon è attualmente una misurazione ad alto sforzo a 52,56. Le stesse scale di sforzo di Anthropic spostano un modello di diversi punti tra le varie impostazioni, e se il modello di Google si comporta in modo simile al massimo, la posizione reale di Argon rispetto a Fable 5.1 e Astra è migliore di quanto dica questo articolo. Questo è il singolo cambiamento più probabile.
• Una seconda fonte di misurazione. Un tracker equivale a una misurazione. Un secondo laboratorio indipendente che assegna un punteggio ad Argon sul proprio banco di prova farebbe di più per la rivendicazione del tier di qualsiasi riga di benchmark aggiuntiva proveniente da Google.
• Un Gemini 4 Pro. Se Google apre il livello Pro della generazione 4 sotto Argon, la gamma diventa una famiglia con una forma, la posizione di Argon smette di essere “l’unica” e comincia a essere “il vertice di tre”, e ogni argomentazione di questo pezzo riguardo a una famiglia mancante va riscritta. Da tenere d’occhio, e più vicino della questione Ultra.
• Un prezzo che non aumenta a scatti. Se il periodo introduttivo semplicemente non scade mai — Google non ha definito quando termina — il prezzo effettivo a regime di Argon è $2/$10 anziché $4/$20, e il suo vantaggio in termini di costo per attività rispetto a Opus 5.5 si amplia da circa 3× a circa 6×. Questo è un evento commerciale, non di capacità, ma cambia il modo in cui si presenta una decisione di approvvigionamento.
• Una scheda modello, una scheda di sistema o una pagina di metodologia di valutazione di Argon. La tabella delle prestazioni rimanda a una pagina di metodologia sul dominio di Google; una scheda modello completa documenterebbe ufficialmente la finestra di contesto, la configurazione di deployment e il perimetro di sicurezza, e sarebbe il primo artefatto che consente a qualcuno esterno alla coorte Fairwind di verificare i numeri di Google invece di leggerli soltanto.
Al contrario, la cosa che con ogni probabilità farebbe scendere Argon non è affatto un benchmark. È il reportage di Bloomberg del 30 settembre, che citava dipendenti Google con accesso al modello secondo cui esso se la cava meno bene nel lavoro reale di quanto suggeriscano i suoi punteggi. Quell’affermazione non è verificata da nessuno al di fuori di Google e non è una misurazione, ma è il tipo di affermazione che un secondo benchmark indipendente confermerebbe o ucciderebbe. Fino ad allora resta agli atti come un’accusa con una testata giornalistica nominata e fonti anonime, e appartiene alla discussione sui tier perché un modello il cui divario tra benchmark e campo è contestato non può essere promosso sulla sola base dei benchmark.
Cosa significa se stai scegliendo un modello questo mese
Messa da parte la questione del posizionamento, il quadro pratico è abbastanza lineare che basta un paragrafo per descriverlo. Gemini 4 Argon è il miglior Gemini che Google abbia costruito e non è disponibile per te, quindi i modelli Google tra cui puoi effettivamente scegliere oggi sono quelli già rilasciati: Gemini 3.8 Flash, che misura 40,93 sull'Index a $0,75/$3,75, e Gemini 3.1 Pro Preview, che misura 29,72 a $2/$12. Se ti serve un Gemini adesso, questa è la vera scelta, e Argon non ne fa parte.
Se stai scegliendo tra fornitori diversi anziché all'interno di Google, nulla nell'annuncio di Argon cambia la decisione di oggi. In cima all'Index c'è Claude Opus 5.5 a 57,62, con Claude Sonnet 5.5 a 55,98 subito dietro, a un quinto della tariffa sull'input e la metà sull'output. Gemini 4 Argon a 52,56 non ha modo di raggiungere la tua applicazione, quindi non è un candidato, per quanto buono possa rivelarsi alla fine il punteggio.

OrcaRouter è un'unica API davanti a oltre 200 modelli, con i prezzi di listino dei provider passati senza alcun markup e failover automatico tra provider: questo significa che la decisione di cambiare modello non richiede di riconfigurare nulla, perché l'id nel corpo della richiesta è l'intera modifica. I modelli Google presenti oggi nel nostro catalogo sono quelli che Google ha effettivamente rilasciato — google/gemini-3.8-flash, google/gemini-3.6-flash, google/gemini-3.5-flash e google/gemini-3.1-pro-preview. Gemini 4 Argon non è tra questi e non lo sarà finché non avrà un identificatore di modello pubblico e un listino prezzi pubblicato, quindi nessuno dovrebbe leggere una qualche affermazione sul routing in quanto sopra. Quando Google metterà Argon su un'API con un ID, diventerà una questione di routing. Fino ad allora, la versione onesta della risposta di OrcaRouter è che non si applica ancora, e la cosa utile che il catalogo fa per questa specifica decisione è permetterti di confrontare i modelli che sono effettivamente richiamabili fianco a fianco senza aprire quattro account per scoprirlo.
La conclusione
Gemini 4 Argon è il prodotto di punta di Google, non la sua frontiera. Totalizza 52,56 sull'Indice v4.3.2 di Artificial Analysis a sforzo elevato — allo stesso livello di Claude Fable 5.1 e GPT-6 Astra, cinque punti dietro Claude Opus 5.5, e dietro Claude Sonnet 5.5, un modello più economico di un laboratorio rivale. Google lo ha prezzato a $2/$10 in via introduttiva, per passare poi a $4/$20, il che colloca la sua tariffa finale esattamente su quella di Claude Opus 5.5 per una capacità misurabilmente inferiore. Il suo vantaggio di 11,6 punti su Gemini 3.8 Flash è il divario generazionale più ampio nella stessa lineup di Google ed è la prova più forte che la generazione Gemini 4 sia un vero salto di livello e non un semplice rebadge.
Sulla domanda che ha dato origine a tutto questo: non esiste un Gemini 4 Ultra. Il percorso Ultra di Google sul suo stesso dominio reindirizza a una pagina dei piani di abbonamento, l'indice delle schede dei modelli non contiene affatto alcuna voce Gemini 4, ogni schema di URL di annuncio per un post su Gemini 4 Ultra restituisce 404, e il post di lancio annuncia un solo modello senza promettere una famiglia. Questa è una scoperta reale ed è una prova di prima parte, non un'inferenza, ma è anche un fatto dalla breve emivita: un singolo 200 su un percorso lo ribalta, e il livello Pro della generazione Gemini 4 è quello che più probabilmente comparirà per primo.
Due avvertenze da trarre da questo pezzo. Ogni numero di Argon qui è la misurazione fatta da qualcun altro di un modello che nessuno al di fuori di una coorte verificata di cyber-difensori può chiamare, e la tabella a diciannove righe di Google è un'affermazione, non una misurazione — utile per ciò che è, e non sostituisce l'Index indipendente. E il verdetto equo sulla questione del tier è provvisorio: Argon è misurato con effort alto, non max, e un'esecuzione con effort massimo è il modo più economico possibile per far sì che questo articolo sia sbagliato.
Confrontati in questo articolo4
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
