Una card del titolo hero generata con la scritta 'Deep Think Mathematica' e il sottotitolo 'Il modello matematico trapelato di Google, spiegato', sopra quattro chip di stato arrotondati con la scritta 'Non rilasciato', 'Build di test interna', '~1M di contesto, secondo quanto riportato' e 'Nessun benchmark pubblicato', e una riga a piè di pagina con la scritta 'Fuga di notizie, non un lancio. Google non ha confermato che questo modello esista.'
Guides & Insights

Deep Think Mathematica: Dentro il modello matematico trapelato di Google, e l'urlo nella sua traccia di ragionamento

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

La cosa più rivelatrice di Deep Think Mathematica — il modello matematico di Goo​gle emerso questa settimana nei test interni — è che sembra urlare. Un account X che pubblica con il nome "Lyra" ha messo online gli screenshot dei log di ragionamento interni il 16 settembre 2026, e le tracce si leggono meno come un assistente di dimostrazione che come una persona che ha un'illuminazione alla lavagna: "Aspetta." "Oh mio Dio." E, dopo aver semplificato con successo un'equazione, la stringa SANTISSIMA MADRE DELLA MATEMATICA!!!!!!!!!!!!!!!!!!!!!!!! La reazione è stata immediata e affettuosa — Goo​gle aveva apparentemente costruito un'IA che ama sinceramente la matematica. Quella reazione è anche la cosa meno utile da trarre dalla fuga di notizie. Nulla qui è stato confermato da Goo​gle. Non esiste una model card, nessun ID del modello in nessuna lista pubblicata, nessun prezzo e nessuna data di rilascio. Ciò che esiste è una stringa di build, due etichette interne, un budget di token, una serie di screenshot e il miglior punto di confronto disponibile nella stessa famiglia, Gem​ini 3.1 Deep Think — un modello che puoi effettivamente usare oggi, e il metro di giudizio con cui questa fuga di notizie verrà eventualmente confrontata.

Quindi tratta tutto quanto segue per ciò che è: un elenco di affermazioni con una fonte allegata a ciascuna voce, ordinato in base a quanto peso dovrà sopportare.

Ciò che il segnale dice davvero — e l'indizio rivelatore che gli sta sopra

Il segnale stesso è arrivato da @testingcatalog, un account con un buon curriculum proprio su Goo​gle: ha portato alla luce i piani di utilizzo del computer desktop di Gem​ini e ha individuato la scheda di anteprima iniziale di Nano Banana 2 con il nome interno "GEMPIX2" prima che Goo​gle dicesse qualcosa. Il suo post del 16 settembre contiene due affermazioni di qualità molto diversa.

La seconda affermazione riguarda il modello. Un nuovo "Deep Think Mathematica" è stato individuato nei test interni, descritto come un successore nello spirito del modello Deep Think IMO che Goo​gle ha distribuito a istituzioni selezionate lo scorso anno.

La prima affermazione è l'indizio rivelatore, ed è quella che vale la pena capire: "Quando Gemini sta per cambiare il suo sfondo, qualcosa di grosso bolle in pentola." Questo non è un fatto su un modello. È un'euristica della comunità sulla coreografia di rilascio di Google — l'osservazione che un rinnovamento visibile della superficie dell'app Gemini ha preceduto diversi degli annunci più importanti di Google. Euristiche come questa hanno un vero track record e zero forza predittiva. Un rinnovamento dell'interfaccia non è un modello.

Entrambe le affermazioni risultano non verificate. Nessuna delle due è una release, e questo articolo non la tratta come tale.

Decodificando la stringa di build, perché è l'artefatto più concreto qui

Il singolo elemento di prova più difficile in circolazione è un identificatore di build attribuito ai log trapelati:

Percorso di build — models/deepthink-mathematica-tf-raw-thoughts, segnalato da AI Sight il 16 settembre 2026, insieme agli screenshot.

Quella stringa premia una lettura attenta, ed è qui che la maggior parte della trattazione si ferma. Tre sue parti contengono informazioni.

"deepthink" — colloca il modello nella linea Deep Think anziché nella linea principale Gem​ini. La cosa è importante perché Deep Think è una modalità dei prodotti Goo​gle già sul mercato, non una famiglia a sé: è il percorso di ragionamento parallelo che esegue più soluzioni candidate contemporaneamente.

"tf" —nel contesto, un'abbreviazione di "Teamfood", la seconda delle due etichette interne riportate insieme alla build. Nel vocabolario interno di Google, è una designazione precoce della fase di dogfooding: a usarlo sono i dipendenti, non i clienti.

"raw-thoughts" — la parte più interessante, e la chiave delle urla. Questo denota la configurazione non filtrata della catena di pensiero — il ragionamento del modello emesso senza regolazione della cortesia, vincoli di stile o filtraggio dell'output. Una build "raw thoughts" non è il prodotto. È ciò che gli ingegneri osservano quando vogliono vedere cosa sta facendo il modello prima che qualcuno lo renda presentabile.

La seconda etichetta segnalata è UNSTABLE_EXPERIMENTAL, che è quasi autoesplicativa e punta nella stessa direzione di "Teamfood": precoce, interno, non per i clienti.

Altre due cifre sono attribuite agli stessi log e provengono da un'unica fonte, quindi prendile con cautela:

Finestra di contesto — circa 1.000.000 di token, in linea con la finestra da 1M che Google già offre sui suoi modelli Gemini di frontiera.

Limite di output — 65.536 token, che per un modello di ragionamento significa una lunghissima deliberazione prima di una risposta.

Questa è l'intera superficie tecnica della fuga. Un percorso di build, due etichette di fase, una finestra di contesto e un limite di output. È sufficiente dire che qualcosa esiste in un test harness. Non è sufficiente dire quale punteggio ottiene.

A generated two-column scoreboard titled 'Deep Think Mathematica vs Gemini 3.1 Deep Think — the scoreboard'. Left column 'Deep Think Mathematica (leaked)' reads Status: internal test build; Base model: Gemini 3.1 Pro, reported; Context window: ~1M tokens, reported; Output limit: 65,536 tokens, reported; Benchmarks: none published; Access: no endpoint. Right column 'Gemini 3.1 Deep Think' reads Status: shipping now; Base model: Gemini 3.1 Pro; Context window: 1M tokens; Output limit: not published; Benchmarks: ARC-AGI-2 84.6%, vendor; Access: top tier plus invited API. Footer reads 'Mathematica figures are single-source and unconfirmed; Google has not acknowledged the model. Gemini 3.1 Deep Think figures are Google's own, unreproduced.'

Perché una traccia di ragionamento che urla è una prova più debole di quanto sembri

I punti esclamativi sono il motivo per cui questa fuga di notizie si è diffusa, e sono il motivo per cui bisogna fare attenzione a essa.

La spiegazione riportata è banale e corrisponde esattamente alla stringa di build: una configurazione di ragionamento non filtrata, eseguita ad alta temperatura di generazione, con gli strati di cortesia e formattazione rimossi. Quando si rimuove la messa a punto che fa sembrare calmo un modello, non se ne rivela l'anima — se ne rivela il sampler. Un output pieno di punti esclamativi è ciò che appare campionando ad alta temperatura una continuazione eccitata. La lettura emotiva è un artefatto della configurazione, non un risultato sul modello.

Il punto più profondo riguarda ciò che una catena di pensiero è. Una traccia di ragionamento è testo generato che risulta utile per risolvere problemi. Leggere una sua trascrizione e inferire uno stato interno — entusiasmo, frustrazione, gioia — è lo stesso errore di categoria di inferire che una calcolatrice sia contenta quando produce un numero intero esatto. Vale la pena dirlo chiaramente perché la copertura in lingua cinese di questa fuga di notizie ha cavalcato lo scherzo ("等等", "我的天") e parte della copertura in inglese ha lasciato che lo scherzo si consolidasse in una descrizione del carattere del modello.

Niente di tutto ciò rende la traccia priva di valore. Esporre una build con pensieri grezzi è una prova autentica di una pratica ingegneristica reale — si registra il ragionamento non filtrato solo quando si sta eseguendo il debug del ragionamento stesso, ed è ciò che si fa con un modello la cui intera proposta di valore risiede in quanto bene ragiona su problemi difficili. E non è verificato se le tracce provengano da un debug deliberato o da una registrazione involontaria.

Il riassunto onesto: le esclamazioni ti dicono che esiste una configurazione di ragionamento grezza. Non ti dicono nulla sulle capacità matematiche.

Millennium Bench non è la stessa cosa dei Millennium Prize Problems

Diversi resoconti di questa fuga di notizie, incluse le sintesi degli aggregatori che circolano il 16 settembre, descrivono il modello come "che punta a Millennium Bench" e si fermano lì. Il nome sta facendo un lavoro accidentale, perché si trova a una parola di distanza da qualcosa di molto più famoso e molto più carico — i sette Problemi del Millennio del Clay Mathematics Institute, ciascuno con un premio di 1 milione di dollari, e oggetto di un'affermazione separata e del tutto non confermata questo mese su Ope​nAI e una dimostrazione di Navier–Stokes. Un resoconto da quel thread dice che Goo​gle ha costruito un'IA che ha "risolto" il problema in 88 ore. Clay lo elenca ancora come aperto.

Queste sono cose diverse, ed equipararle gonfia considerevolmente questa fuga di notizie.

MILLENNIUM-BENCH, come introdotto nel paper ICLR 2026 "Dove la deduzione si rompe: diagnosticare i fallimenti di ragionamento nella matematica a livello di ricerca," è un benchmark di problemi a livello di ricerca curati da esperti che coprono nove domini, tra cui fisica matematica, topologia e probabilità in teoria della misura. È stato creato per richiedere una deduzione sostenuta a più passaggi ben oltre la matematica delle competizioni.

Il suo risultato principale è la parte che conta per leggere questa fuga di notizie. Su cinque modelli di frontiera, eseguiti 100 volte per problema, il più forte ha raggiunto al massimo il 24% di pass@1 e il 39% di pass@3. La diagnosi che il paper offre su come i modelli falliscono è più utile dei punteggi: allucinazione di framework, in cui un modello inventa una teoria inapplicabile e poi ragiona in modo coerente al suo interno, e teoremi fabbricati, in cui cita risultati che non esistono, completi di nomi di autori e numeri di teorema inventati.

Tieni a mente entrambe queste cose insieme. Un benchmark in cui il miglior modello arriva al massimo a circa un quarto dei problemi, il cui fallimento caratteristico è l'invenzione sicura di sé, è esattamente il benchmark in cui gli screenshot trapelati sono meno in grado di dimostrare qualsiasi cosa. Un modello che urla mentre lavora è un modello il cui output vorresti che fosse valutato da qualcun altro che non sia il suo autore.

Cosa ha effettivamente rilasciato Google in questa linea

Il leak è comprensibile solo se confrontato con il resoconto pubblicato, perché la storia matematica di Google è una progressione documentata e il nome trapelato ne sta prendendo in prestito la credibilità.

Luglio 2025 —una versione avanzata di Gem​ini Deep Think ha raggiunto lo standard della medaglia d'oro all'Olimpiade Internazionale di Matematica, risolvendo cinque dei sei problemi con 35 punti su 42, valutati dai funzionari dell'IMO secondo gli stessi criteri applicati agli studenti. Demis Hassabis ha osservato che ha lavorato end-to-end in linguaggio naturale, senza traduzione in sintassi formale.

1 agosto 2025 — Goo​gle ha rilasciato Gem​ini 2.5 Deep Think pubblicamente, ma non il modello gold. La versione rilasciata è stata descritta da Goo​gle come una variante più rapida e più ottimizzata, che raggiunge prestazioni di livello Bronze sul benchmark IMO 2025 secondo la valutazione interna di Goo​gle. Era limitata al tier consumer più alto. Contemporaneamente Goo​gle ha consegnato il modello gold completo a un gruppo selezionato di matematici e accademici — le "istituzioni selezionate" a cui il segnale trapelato si riferisce.

Dicembre 2025 — Gem​ini 3 Deep Think, con un grande salto generazionale Goo​gle ha riportato un 45,1% su ARC-AGI-2 con esecuzione di codice e un 41,0% su Humanity's Last Exam senza strumenti.

Ora — Gem​ini 3.1 Deep Think, basato su Gemini 3.1 Pro, venduto attraverso il livello di abbonamento consumer più alto e un programma API su invito. Le cifre pubblicate da Goo​gle stesso, che sono riportate dal fornitore e non sono state riprodotte in modo indipendente, lo collocano all'84,6% su ARC-AGI-2, al 48,4% su Humanity's Last Exam senza strumenti e al 53,4% con ricerca e codice, all'81,5% su IMO 2025 e a un Elo di 3455 su Codeforces.

Contano anche due sforzi affini. Aletheia, un agente di ricerca matematica basato su Gemini Deep Think, è riportato da terze parti a circa il 95,1% su IMO-ProofBench Advanced — ed è notevole meno per il numero che per il fatto di essere progettato per dire "nessuna soluzione trovata" anziché inventarne una; sulla sfida FirstProof di febbraio 2026 ha risolto 6 casi su 10 e ha declinato gli altri. E una configurazione AI Co-Mathematician eseguita su Gemini 3.1 Pro avrebbe aumentato le prestazioni di FrontierMath Tier 4 dal 19% al 47,9%.

A screenshot of Google DeepMind's official Gemini 3.1 Deep Think model page at deepmind.google/models/gemini/deep-think, captured September 16 2026 in English, showing the title 'Gemini 3.1 Deep Think', the subtitle 'Best for modern challenges across science, research and engineering', a 'Try in Gemini' button, the blue DeepMind model illustration, and the opening line 'Our most specialized reasoning mode is built on top of Gemini 3.1 Pro'.

Quell'ultimo dato merita una pausa di riflessione, perché è l'argomento più forte contro una lettura di questa fuga di notizie nel modo in cui è stata presentata. Un salto dal 19% al 47,9% nella matematica a livello di ricerca, ottenuto da uno scaffold costruito attorno a un modello Gemini generale anziché da un nuovo checkpoint, suggerisce che i maggiori progressi recenti nelle prestazioni matematiche di Google siano venuti dall'infrastruttura che circonda il modello, non da un modello specialistico sottostante. Non significa che Mathematica sia uno scaffold. Significa invece che l'onere della prova per "questo è un nuovo modello matematico dedicato" è più alto di quanto presupponesse la copertura.

Un ulteriore elemento di contesto sovrasta tutto il resto: DeepMind si è riorganizzata nell'agosto 2026, con Demis Hassabis che passa a un ruolo di presidente. Le fughe di notizie dall'interno di un laboratorio in riorganizzazione non sono più affidabili di quelle provenienti da un laboratorio stabile, e la copertura non ha considerato la tempistica come rilevante. Potrebbe esserlo.

Modello o scaffold? La questione che questa fuga non risolve.

Nelle cronache c'è un dibattito aperto sul fatto che Mathematica sia davvero un nuovo modello. Una parte punta al prefisso "deepthink" della stringa di build e lo interpreta come un checkpoint separato. Un'altra parte — quella in cui è finito anche il nostro precedente articolo sul rumor di Deep Think V3 — sostiene che i risultati matematici specialistici di Goo​gle derivino da agent scaffold costruiti attorno a modelli Gem​ini generalisti, e che non serva un modello matematico separato perché quei numeri siano reali.

La stringa di build è un modesto argomento a favore del primo campo: models/deepthink-mathematica-tf-raw-thoughts indica un modello, e "raw-thoughts" descrive una configurazione del modello più che un livello di harness. Uno scaffold non avrebbe bisogno che il suo ragionamento fosse lasciato non filtrato per poter essere sottoposto a debug; un modello il cui pensiero è il prodotto lo sarebbe. Questo è un segnale reale.

Non è una prova decisiva. Anche gli harness hanno una configurazione, e una stringa di percorso interna è scritta da chi ha impostato il logging, non da uno schema. Ciò che lo risolverebbe è la cosa che nessuno ha: una model card, o un endpoint, o un benchmark eseguito da qualcuno senza un interesse in gioco nella risposta.

Cosa puoi effettivamente chiamare oggi

Nulla di tutto questo cambia ciò che puoi mettere in produzione questa settimana, e vale la pena essere schietti sul divario. Deep Think mathematica non è disponibile su nessuna API. Anche Gem​ini 3.1 Deep Think non viene venduto per token: è accessibile solo con il livello di abbonamento consumer più alto, con un prezzo compreso tra $99,99 e $199,99 al mese a seconda del livello, oltre a un programma API accessibile solo su invito. Non esiste un prezzo pubblicato per milione di token.

Il modello di base su cui, secondo quanto riportato, si basa è tutta un'altra storia. Gemini 3.1 Pro ha prezzi di $2,00 per milione di token di input, $0,20 in cache e $12,00 per milione di token di output per contesti sotto i 200.000 token, che salgono a $4,00 / $0,40 / $18,00 oltre tale soglia — le tariffe pubblicate da Google stessa.

Quel dettaglio di prezzo è il punto in cui si concretizza la decisione pratica, perché il divario di costo tra le modalità di ragionamento non è piccolo. Su ARC-AGI-2, Deep Think viene riportato a circa l'85% per circa 13,62 $ per attività, contro Gemini 3.1 Pro al 77% per circa 0,96 $ per attività. Stai pagando circa quattordici volte tanto per otto punti. È uno scambio difendibile per un problema di ricerca difficile e indefendibile per un percorso di produzione che gestisce principalmente lavoro ordinario — e la risposta corretta di solito è che vuoi entrambi raggiungibili dallo stesso posto, piuttosto che una decisione di abbonamento presa in anticipo.

A screenshot of the OrcaRouter models catalogue at www.orcarouter.ai/models, captured September 16 2026 in English, showing the header 'Models — 198 models · 15 providers · one API key, one bill', a 'How to call any model' card with an OpenAI-compatible curl example, and model cards including Google: Gemini 3.8 Flash at $0.750 per million input tokens, $0.075 cache read and $3.75 output, alongside Qwen3.8 Max, GPT-6 Astra and Claude Fable 5.1.

Questo è l'argomento a favore del routing su una singola chiave. I modelli Gem​ini chiamabili oggi — Gemini 3.1 Pro Preview, Gemini 3.8 Flash a 0,750 $ per milione di token di input con 0,075 $ per la lettura dalla cache, e il resto della famiglia — si trovano su il catalogo di OrcaRouter con 198 modelli su 15 provider, dietro un unico endpoint compatibile con OpenAI. Non c'è alcun ricarico sui prezzi di listino dei provider, quindi un cambiamento di prezzo di Goo​gle è attivo dalla nostra parte lo stesso giorno, invece di aspettare una rinegoziazione del contratto. Il failover automatico significa che un modello non collaudato o in anteprima può stare in una route senza reggere da solo un percorso di produzione, che è esattamente la posizione che merita un modello trapelato: provalo, mantieni un fallback, non cambiare nient'altro. Il DSL di routing compone più modelli in un'unica chiamata, e la fusione dei modelli esegue un panel e combina le risposte — entrambe utili quando la domanda è difficile e la posizione onesta è che si desidera il parere di più di un modello.

Per essere espliciti sul confine: OrcaRouter non ospita Deep Think mathematica e non ospita Gem​ini 3.1 Deep Think. Questi non sono nel nostro catalogo e nulla qui dovrebbe suggerire il contrario. Ciò che è nel catalogo è il livello Gem​ini sottostante.

Cosa trasformerebbe questo da una fuga di notizie in una vera notizia?

Quattro cose, all'incirca in ordine di quanto farebbero progredire la storia.

Una scheda del modello.Le uscite di Deep Think di Goo​gle sono arrivate con valutazioni pubblicate. Una scheda del modello con numeri su MILLENNIUM-BENCH o IMO-ProofBench Advanced, ottenuti in condizioni dichiarate, convertirebbe questo da una stringa di build in un modello.

Un endpoint. Il segnale più chiaro sarebbe la comparsa di Mathematica nell'API Gem​ini o nella lista dei modelli di Goo​gle sotto qualsiasi nome. Finché ciò non accade, nessuno può chiamarlo e non esiste alcun prezzo da confrontare.

La via istituzionale. Il pattern di Goo​gle nel 2025 è stato quello di fornire il modello matematico più potente prima a matematici selezionati e al pubblico una variante più rapida in un secondo momento. Un rilascio silenzioso rivolto ai ricercatori si inserirebbe in quel precedente e, con ogni probabilità, emergerebbe prima di qualsiasi annuncio di prodotto.

Un'esecuzione di terze parti. Dato che il benchmark in questione si ferma intorno al 24% di pass@1 per i migliori modelli disponibili, e che il suo tipico modo di fallire è la fabbricazione sicura di sé, una valutazione indipendente è l'unica prova che reggerà. Ogni cifra in questo articolo che riporta un numero è o di Google stesso, o riportata da terze parti, o esplicitamente segnalata come non verificata — e nessuna di esse proviene da un modello che qualcuno al di fuori di DeepMind abbia eseguito.

L'unica cosa che vale la pena fare adesso è non aspettare. Il divario tra la modalità matematica di Goo​gle e il suo modello base è di quattordici volte in termini di costo e di otto punti in accuratezza, e questo compromesso è già realtà; puoi farlo oggi con Gemini 3.1 Pro Preview su una chiave e un fallback alle spalle. Quando Mathematica otterrà una model card, vorrai aver già deciso come instradare i problemi difficili — e la risposta a questo non dipenderà da cosa si rivelerà essere il modello trapelato.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno