Card del titolo hero per l'articolo 'Gemini 4 Carbon — RAPPORTO SULLA FUGA DI NOTIZIE' con un badge 'NON VERIFICATO', il sottotitolo 'Un checkpoint interno di Google che il pubblico non può chiamare — cosa dice il rapporto', tre chip con scritto 'Fonte: Business Insider via TestingCatalog', '9–10 ottobre 2026' e 'Testato su Jetski, la piattaforma interna di Google', una card a sinistra con scritto 'L'affermazione: i primi feedback interni rendono Carbon paragonabile a Claude Opus 5.5 per il coding', e una card a destra con scritto 'Il contesto: Barium-B è il checkpoint scelto per il rilascio pubblico di Gemini 4 Argon'. Il logo OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

Fuga di Gemini 4 Carbon: il checkpoint interno di Google che, secondo i dipendenti, scrive codice come Claude Opus 5.5.

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

C'è una versione di questa storia che è notizia e una versione che è rumore, e la differenza sta interamente in ciò a cui sono legati i nomi. Il 9 e 10 ottobre 2026, Business Insider ha riferito — e il sito di monitoraggio delle fughe di notizie TestingCatalog ha rilanciato — che il personale del gigante della ricerca sta testando internamente un checkpoint aggiuntivo di Gemini 4 chiamato Carbon, che le prime impressioni interne collocano Carbon come paragonabile a Claude Opus 5.5 per la programmazione, che Barium-B è il checkpoint selezionato per il rilascio pubblico di Gemini 4 Argon, e che Carbon, testato attraverso la piattaforma interna Jetski dell'azienda, è un'iterazione separata e possibilmente più forte. Ciò che lo rende meritevole di una lettura anziché di una scorsa è l'ultima frase: se Carbon verrà distribuito come aggiornamento di Gemini 4 Argon o come rilascio a sé stante è, secondo le parole stesse del rapporto, non confermato. E questo è tutto lo stato delle prove — nessun annuncio, nessun identificatore di modello, nessun endpoint, nessun prezzo, nessuna scheda del modello e nessun commento dal fornitore. Tutto ciò che di concreto c'è in questa pagina è una fuga di notizie, un'inferenza tratta da una fuga di notizie, o un fatto riguardante un modello diverso ed effettivamente distribuibile rispetto al quale la fuga viene misurata.

Ciò che il rapporto sostiene effettivamente

Il segnale è tenue, ed è abbastanza specifico da essere falsificabile, che è l'unica ragione per cui trova posto su una pagina come questa. Spogliate dell'inquadratura, le affermazioni sono queste:

• I dipendenti Google stanno testando internamente un checkpoint di Gemini 4 chiamato Carbon. Non è un modello pubblico e non può essere chiamato da alcuna API.

• Secondo quanto riferito, un primo feedback interno indica che Carbon è percepito come paragonabile a Claude Opus 5.5 per la programmazione — un'impressione emersa da test del personale, non un risultato di benchmark, e non un numero che chiunque al di fuori di Google possa riprodurre.

• Il checkpoint dietro il modello di cui il pubblico ha effettivamente sentito parlare — Gemini 4 Argon — si chiama Barium-B, e Carbon è descritto come un'iterazione separata e potenzialmente più capace, piuttosto che come la stessa build sotto due etichette.

• Secondo quanto riportato, Carbon verrebbe utilizzato tramite Jetski, che lo stesso resoconto descrive come il nome interno di Google associato ad Antigravity, il suo ambiente di coding agentico.

• Non si sa se Carbon diventerà un futuro aggiornamento di Gemini 4 Argon o una release distinta di Gemini 4. Google non ha commentato nulla al riguardo.

Questa è la fuga di notizie. Contiene un confronto, una relazione tra nomi in codice e una questione davvero aperta, e nessuna sua parte è un rilascio.

A two-column infographic titled 'Gemini 4 Carbon — what the report says / what it does not'. Left column 'What the report says': '9–10 Oct 2026 — Business Insider, relayed by TestingCatalog', 'Google staff testing a Gemini 4 checkpoint named Carbon', 'Early internal feedback: feels comparable to Claude Opus 5.5 for coding', 'Barium-B is the checkpoint chosen for the public Gemini 4 Argon release', 'Tested via Jetski, tied to Antigravity'. Right column 'What it does not say': 'Whether Carbon ships as an Argon update or a separate Gemini 4 release', 'No model ID, endpoint or price of any kind', 'No model card, context window or parameter count', 'No benchmark number behind the Opus 5.5 comparison', 'No date, and no comment from Google'. Footer: 'All leak claims unverified; Google has not commented.'

La scala dei nomi in codice, e quale piolo conta

Il motivo per cui questo rapporto ha bisogno di un anello decifratore è che l'abitudine di Google di usare la tavola periodica mette tre nomi in un unico paragrafo che sembrano paralleli e non lo sono. Ordinati in base a ciò che un lettore può effettivamente fare con ciascuno:

• Gemini 4 Argon — annunciato. Un vero nome di modello con un post di annuncio ufficiale e una pagina della famiglia, un prezzo introduttivo pubblicato di 2 $ per milione di token di input e 10 $ per milione di token di output, un limite di output pubblicato di 1 milione di token, e un rilascio con accesso controllato che è iniziato con difensori informatici verificati ed è stato descritto come in espansione ai clienti API a pagamento in seguito. Non ha ancora alcun identificatore di modello che si possa inserire in una richiesta, che è la linea di demarcazione tra un modello annunciato e uno richiamabile.

• Barium-B — un nome di checkpoint, non un prodotto. Secondo la stessa segnalazione, è la build scelta per la release pubblica di Argon. Ecco l'utilità dell'etichetta: ti dice che il nome Argon è una decisione di rilascio costruita attorno a una build interna, non una build in sé.

• Carbon — un checkpoint interno con le impressioni dello staff allegate e nient'altro. Nessun ID, nessun prezzo, nessuna finestra, nessuna data. È una voce con un nome in codice, e i nomi in codice costano poco.

Letta così, la storia non è «un nuovo Gemini trapelato». È che Google sembra stia facendo girare più di un checkpoint di frontiera in parallelo, che quello su cui ha messo il proprio nome pubblico non è quello per cui i suoi ingegneri sono più entusiasti, e che nessuno fuori dall’azienda sa quale di questi due fatti si rivelerà importante.

Perché "sembra Claude Opus 5.5" è la frase portante

Di tutto ciò che compare nel report, il confronto è l'elemento che fa più lavoro ed è il meno verificabile, quindi vale la pena essere precisi su ciò con cui viene confrontato. Claude Opus 5.5 è il modello di punta di Anthropic e, secondo misurazioni indipendenti, il modello di coding più forte e ampiamente accessibile della generazione attuale — il punto di riferimento a cui ricorre un ingegnere Google quando vuole dire "questo è quello buono" senza citare un benchmark. Al prezzo di listino pubblicato, costa 4,00 $ per milione di token in input e 20,00 $ per milione di token in output, con le letture dalla cache a 0,20 $ per milione, e offre una finestra di input da 1M di token e un output massimo di 128K token.

Messo a confronto con ciò, il confronto dice due cose allo stesso tempo, e la seconda è quella che la gente salta. La prima è competitiva: un checkpoint interno di Google viene descritto nello stesso respiro dell'ammiraglia del principale rivale, il che è un complimento che Google non metterebbe in un post sul blog. La seconda è di posizionamento: il confronto è un'impressione dello staff su come ci si sente a programmare, che è esattamente il tipo di affermazione che sopravvive al contatto con una finestra di chat e muore al contatto con una classifica. Nessuno ha pubblicato un benchmark per Carbon. Non esiste una voce di Artificial Analysis, nessuna tabella di benchmark del fornitore, nessun PDF di metodologia di valutazione — quelli esistono per Gemini 4 Argon e non esistono per questo. Una sensazione non è un punteggio, e questa pagina non ha intenzione di spacciare una sensazione per un punteggio.

C'è anche una conseguenza sul prezzo che vale la pena menzionare, senza pretendere di conoscere la risposta. Se un checkpoint che «sembra Claude Opus 5 per il coding» è presente internamente e il modello che Google ha effettivamente annunciato si trova cinque punti sotto di esso sull'indice indipendente, allora la domanda interessante non è se Carbon sia valido — è a quanto Google lo prezzerebbe, e se verrebbe mai venduto alle tariffe da modello tuttofare a cui è stato rilasciato il resto della linea Gemini.

Cosa manca e perché l'elenco è più lungo delle notizie

L'inventario onesto di ciò che non esiste è l'intero articolo, quindi eccolo:

• Un identificatore di modello — Carbon non ne ha alcuno, e nemmeno Gemini 4 Argon. Nessuno dei due nomi compare in un punto a cui si possa indirizzare una richiesta.

• Un prezzo — nulla di pubblicato per Carbon a nessun livello, nemmeno una tariffa introduttiva.

• Una scheda del modello o scheda di sistema — nessuna, e nessuna metodologia di valutazione pubblicata a supportarla.

• Una finestra di contesto, un limite di output o un conteggio dei parametri — nessuno pubblicato, e Google non ha pubblicato un conteggio dei parametri per nessun Gemini.

• Un risultato di benchmark — il confronto con Opus 5.5 è un'impressione dello staff, il che significa nessun numero, nessun test e nessuna riproducibilità.

Una data — nessun annuncio, nessun rilascio graduale, nessuna finestra e nessun commento da parte di Google sulla possibilità che un rilascio di Carbon sia mai previsto.

• Una relazione — se Carbon è il prossimo aggiornamento di Argon o un modello Gemini 4 a sé stante. Questa è l'incognita più significativa del report ed è esplicitamente non confermata nel report stesso.

Tutto ciò che non figura in quell'elenco è un'inferenza, compresa gran parte di ciò che verrà scritto al riguardo nelle prossime due settimane.

Cosa può fare oggi uno sviluppatore con questo

La risposta utile è che quasi nulla cambia, e vale la pena dire esattamente perché. Né Gemini 4 Argon né Carbon sono su OrcaRouter — interrogare il nostro stesso catalogo per l'uno o l'altro non restituisce nulla, e continuerà a non restituire nulla finché Google non rende uno dei due invocabile. Il nome Gemini 4 non è qualcosa verso cui puoi instradare; è un nome associato a un rilascio controllato. Qualsiasi account che offre accesso a "Gemini 4 Carbon" in questo momento sta vendendo un'etichetta.

Ciò che è reale è il modello rispetto al quale viene misurato il leak. Claude Opus 5.5 è attivo su OrcaRouter al prezzo di listino di Anthropic — 4,00 $ in ingresso e 20,00 $ in uscita per milione di token, letture dalla cache a 0,20 $ per milione, trasferiti senza alcun ricarico — quindi il modello specifico a cui si dice che Carbon sia comparabile è un modello che puoi chiamare oggi, con la stessa chiave API di tutto il resto. Questo è un fatto più utile del leak, perché è la metà del confronto che può essere testata.

L'impostazione che sopravvive a una diceria è quella che non ha bisogno che la diceria sia vera. Metti Claude Opus 5.5 dietro i tuoi carichi di lavoro di coding più ardui e mantieni una regola di failover verso un livello più economico per il traffico che non ne ha bisogno; il giorno in cui un identificatore reale di Gemini 4 compare in un catalogo di un provider, i nostri prezzi di listino si aggiornano lo stesso giorno in cui Google li stabilisce, perché non c'è alcun passaggio di rinegoziazione tra un fornitore che pubblica un prezzo e il nostro trasmetterlo così com'è. Una sola API per oltre 200 modelli trasforma il "dovremmo migrare?" in una modifica al routing-DSL e un A/B sul traffico live anziché una riscrittura. Instrada verso risultati che puoi misurare, non verso nomi di cui leggi.

A screenshot of Google's own Gemini API models documentation page, listing the Gemini 3.8 family and earlier models with their model codes and pricing, and containing no entry for Gemini 4 Argon or Gemini 4 Carbon.A screenshot of the OrcaRouter model page for anthropic/claude-opus-5.5, showing the model id, its capability chips, a 1M-token context window, a 128K maximum output, and pricing of .00 per 1M input tokens and 0.00 per 1M output tokens with cache reads at /bin/bash.20 per 1M.

Cosa stiamo guardando

• Se Google dirà qualcosa, anche solo una parola. Un commento, una modifica alla pagina della famiglia o una riga in un post di lancio sposterebbe tutto questo fuori dalla colonna delle indiscrezioni in un colpo solo. Il silenzio lo lascia dov'è.

• La seconda fase del rollout di Argon. L'annuncio ha descritto i clienti API a pagamento e gli abbonati Ultra come la coorte successiva dopo i difensori verificati, e l'arrivo di un identificatore Gemini 4 è l'evento che trasforma «annunciato» in «chiamabile». Se viene reso disponibile un endpoint eseguibile, la questione se il suo checkpoint sia Barium-B o qualcosa di più recente diventa concreta.

• Qualsiasi misurazione indipendente di Carbon. Nel momento in cui un checkpoint come questo compare su una classifica neutrale anziché in un'impressione dello staff, la frase su Opus 5.5 smette di essere una sensazione e inizia a essere un dato — o smette di essere vera.

• Il listino prezzi. Dove Google colloca un checkpoint di frontiera che i suoi stessi ingegneri preferiscono è l’indizio che rivela se Carbon è un aggiornamento di Argon o un tier a sé stante.

• Se il rapporto tra i nomi in codice sopravvive al contatto con un lancio. Barium-B dietro Argon e Carbon al suo fianco oggi è una storia lineare; i post di lancio hanno l'abitudine di far collassare storie lineari in un unico modello con un unico ID.

Il riassunto che non sopravvaluta questa cosa è breve. Stando a quanto si riporta, i dipendenti Google starebbero testando un checkpoint interno di Gemini 4 chiamato Carbon, la loro prima impressione è che programmi come Claude Opus 5.5, il checkpoint dietro la release pubblica di Gemini 4 Argon è un altro, chiamato Barium-B, e se Carbon diventerà mai un prodotto — un aggiornamento, un modello separato o niente — non è confermato. La metà di quella frase su cui puoi agire è la metà che nomina Claude Opus 5.5, perché è l'unico modello nel paragrafo con un identificatore di modello, un prezzo e un endpoint. Continua a chiamare ciò che puoi chiamare, e tieni pronta una regola di failover per il giorno in cui l'altro nome diventerà tale.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno