Een gegenereerde hero-titelkaart met daarop 'Deep Think Mathematica' en de ondertitel 'Het gelekte wiskundemodel van Google, uitgelegd', met daarboven vier afgeronde statuschips met de tekst 'Niet uitgebracht', 'Interne testversie', '~1M context, naar verluidt' en 'Geen benchmark gepubliceerd', en een footerregel met de tekst 'Lek, geen lancering. Google heeft niet bevestigd dat dit model bestaat.'
Guides & Insights

Deep Think Mathematica: een blik in Google's gelekte wiskundemodel, en de schreeuw in zijn redeneerspoor

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het meest onthullende aan Deep Think Mathematica — het Goo​gle-wiskundemodel dat deze week opdook in interne tests — is dat het lijkt te schreeuwen. Een X-account dat onder de naam "Lyra" postte, zette op 16 september 2026 screenshots van interne redeneerlogs online, en de traces doen minder denken aan een bewijsassistent dan aan iemand met een doorbraak bij een whiteboard: "Wacht." "Oh mijn god." En, na met succes een vergelijking te hebben vereenvoudigd, de string HEILIGE MOEDER DER WISKUNDE!!!!!!!!!!!!!!!!!!!!!!!! De reactie was onmiddellijk en liefdevol — Goo​gle had blijkbaar een AI gebouwd die echt van wiskunde houdt. Die reactie is ook het minst bruikbare om uit het lek te halen. Niets hiervan is bevestigd door Goo​gle. Er is geen modelkaart, geen model-ID in enige gepubliceerde lijst, geen prijs en geen releasedatum. Wat bestaat is een buildstring, twee interne labels, een tokenbudget, een set screenshots, en het beste beschikbare vergelijkingspunt in dezelfde familie, Gem​ini 3.1 Deep Think — een model dat je vandaag al kunt gebruiken, en de meetlat waaraan dit lek uiteindelijk zal worden afgemeten.

Dus behandel alles hieronder als wat het is: een lijst met beweringen, met bij elk item een bron, gesorteerd op hoeveel gewicht het zal dragen.

Wat het signaal eigenlijk zegt — en de verraderlijke aanwijzing die erboven zit

Het signaal zelf kwam van @testingcatalog, een account met een behoorlijke staat van dienst specifiek op Google: het bracht de Gemini-desktopplannen voor computergebruik aan het licht, en het ving Nano Banana 2's vroege previewkaart op onder de interne naam "GEMPIX2" voordat Google iets zei. De post van 16 september bevat twee beweringen van zeer uiteenlopende kwaliteit.

De tweede bewering is het model. Een nieuwe "Deep Think Mathematica" is tijdens interne tests gesignaleerd, beschreven als een opvolger in de geest van het Deep Think IMO-model dat Google vorig jaar naar geselecteerde instellingen uitbracht.

De eerste bewering is het veelzeggende signaal, en die is het waard om te begrijpen: "Wanneer Gem​ini op het punt staat zijn achtergrond te veranderen, is er iets groots op til." Dat is geen feit over een model. Het is een heuristiek uit de community over Goo​gles releasechoreografie — de observatie dat een zichtbare vernieuwing van het oppervlak van de Gem​ini-app aan verscheidene grotere aankondigingen van Goo​gle is voorafgegaan. Zulke heuristieken hebben een echte staat van dienst en nul voorspellende kracht. Een UI-vernieuwing is geen model.

Beide beweringen zijn niet geverifieerd. Geen van beide is een release, en dit stuk behandelt het niet als zodanig.

De buildstring decoderen, want het is hier het meest concrete artefact

Het allersterkste bewijsstuk dat circuleert, is een build-ID die wordt toegeschreven aan de gelekte logs:

Buildpad —models/deepthink-mathematica-tf-raw-thoughts, gerapporteerd door AI Sight op 16 september 2026, samen met de screenshots.

Die string beloont aandachtig lezen, en daar stopt de meeste berichtgeving. Drie delen ervan bevatten informatie.

"deepthink" —plaatst het model in de Deep Think-lijn in plaats van de hoofd-Gemini-lijn. Dat is van belang omdat Deep Think een modus is in de producten die Google heeft uitgebracht, geen aparte familie: het is het pad van parallel redeneren dat meerdere kandidaatoplossingen tegelijk uitvoert.

"tf" — in context een afkorting van "Teamfood," het tweede van de twee interne labels die naast de build werden gemeld. In Goo​gle's interne vocabulaire is dat een vroege aanduiding uit de dogfoodingfase: werknemers die het gebruiken, niet klanten.

"raw-thoughts" —het meest interessante deel, en de sleutel tot het geschreeuw. Dit duidt op de ongefilterde chain-of-thought-configuratie — de redenering van het model die wordt weergegeven zonder beleefdheidsafstelling, stijlbeperkingen of outputfiltering. Een "raw thoughts"-build is niet het product. Het is het ding waar ingenieurs naar kijken wanneer ze willen zien wat het model doet voordat iemand het presentabel maakt.

Het tweede gerapporteerde label is UNSTABLE_EXPERIMENTAL, dat bijna voor zich spreekt en in dezelfde richting wijst als "Teamfood": vroeg, intern, niet voor klanten.

Twee verdere cijfers worden aan dezelfde logs toegeschreven en zijn afkomstig uit één bron, dus houd ze met de nodige reserve:

Contextvenster — ongeveer 1.000.000 tokens, overeenkomend met het 1M-venster dat Goo​gle al aanbiedt op zijn grensverleggende Gem​ini-modellen.

Uitvoerlimiet — 65.536 tokens, wat voor een redeneermodel een zeer lange overweging betekent voordat er een antwoord komt.

Dat is het volledige technische oppervlak van het lek. Een buildpad, twee stage-labels, een contextvenster en een outputlimiet. Het is genoeg om te zeggen dat iets bestaat in een testharnas. Het is niet genoeg om te zeggen wat het scoort.

A generated two-column scoreboard titled 'Deep Think Mathematica vs Gemini 3.1 Deep Think — the scoreboard'. Left column 'Deep Think Mathematica (leaked)' reads Status: internal test build; Base model: Gemini 3.1 Pro, reported; Context window: ~1M tokens, reported; Output limit: 65,536 tokens, reported; Benchmarks: none published; Access: no endpoint. Right column 'Gemini 3.1 Deep Think' reads Status: shipping now; Base model: Gemini 3.1 Pro; Context window: 1M tokens; Output limit: not published; Benchmarks: ARC-AGI-2 84.6%, vendor; Access: top tier plus invited API. Footer reads 'Mathematica figures are single-source and unconfirmed; Google has not acknowledged the model. Gemini 3.1 Deep Think figures are Google's own, unreproduced.'

Waarom een redeneerspoor dat schreeuwt zwakker bewijs is dan het lijkt

De uitroeptekens zijn de reden dat dit lek zich heeft verspreid, en ze zijn de reden om er voorzichtig mee te zijn.

De gerapporteerde verklaring is alledaags en past exact bij de build-string: een ongefilterde redeneerconfiguratie, uitgevoerd bij een hoge generatietemperatuur, met de beleefdheids- en opmaaklagen verwijderd. Wanneer je de afstemming weghaalt die een model kalm laat klinken, onthul je niet zijn ziel — je onthult zijn sampler. Uitroeptekenrijke output is hoe een hoge-temperatuursample van een opgewonden voortzetting eruitziet. De emotionele interpretatie is een artefact van de configuratie, geen bevinding over het model.

Het diepere punt gaat over wat een gedachteketen is. Een redeneringstrace is gegenereerde tekst die toevallig nuttig is voor het oplossen van problemen. Het lezen van een transcript ervan en het afleiden van een interne toestand — enthousiasme, frustratie, verrukking — is dezelfde categoriefout als het afleiden dat een rekenmachine verheugd is wanneer die een zuiver geheel getal produceert. Het is de moeite waard om het ronduit te zeggen, omdat de Chinese berichtgeving over dit lek graag meeging in de grap ("等等", "我的天") en sommige Engelstalige berichtgeving de grap liet verharden tot een beschrijving van het karakter van het model.

Niets daarvan maakt de trace waardeloos. Het blootleggen van een build met onbewerkte gedachten is echt bewijs voor een echte engineeringpraktijk — je logt alleen ongefilterde redeneringen wanneer je de redenering zelf aan het debuggen bent, wat je doet bij een model waarvan de hele waardepropositie is hoe goed het moeilijke problemen doordenkt. En het is niet geverifieerd of de traces afkomstig zijn van doelbewust debuggen of onbedoelde logging.

De eerlijke samenvatting: de uitroepen vertellen je dat er een ruwe redeneerconfiguratie bestaat. Ze zeggen niets over wiskundige capaciteit.

Millennium Bench is niet de Millennium Prize Problems

Verschillende verslagen over dit lek, waaronder de aggregatorsamenvattingen die op 16 september circuleerden, laten het model 'zich op Millennium Bench richten' en laten het daarbij. De naam doet per ongeluk werk, want hij staat één woord verwijderd van iets wat veel bekender en veel meer beladen is — de zeven Millennium Prize Problems van het Clay Mathematics Institute, elk met een beloning van $1 miljoen, en het onderwerp van een afzonderlijke en volledig onbevestigde bewering deze maand over Ope​nAI en een Navier–Stokes-bewijs. Eén bericht uit die thread zegt dat Goo​gle een AI heeft gebouwd die het probleem in 88 uur "opgelost" heeft. Clay vermeldt het nog steeds als open.

Dit zijn verschillende dingen, en die door elkaar halen blaast dit lek aanzienlijk op.

MILLENNIUM-BENCH, zoals geïntroduceerd in de ICLR 2026-paper "Waar deductie stukloopt: het diagnosticeren van redeneerfouten in wiskunde op onderzoeksniveau," is een benchmark van door experts samengestelde problemen op onderzoeksniveau, die negen domeinen bestrijken, waaronder mathematische fysica, topologie en maattheoretische kansrekening. Deze is opgezet om volgehouden meerstapsdeductie te vereisen, ruim voorbij wedstrijdwiskunde.

Het belangrijkste resultaat is het deel dat ertoe doet voor het lezen van deze leak. Van vijf frontiermodellen, 100 keer per probleem uitgevoerd, behaalde het sterkste model ten hoogste 24% pass@1 en 39% pass@3. De diagnose in het artikel van hoe modellen falen is nuttiger dan de scores: kaderhallucinatie, waarbij een model een niet-toepasbare theorie verzint en vervolgens coherent binnen die theorie redeneert, en verzonnen stellingen, waarbij het resultaten citeert die niet bestaan, compleet met verzonnen auteursnamen en stellingnummers.

Houd die beide tegelijk in gedachten. Een benchmark waarin het beste model niet verder komt dan ongeveer een kwart van de problemen, en die als kenmerkende faalmodus zelfverzekerde verzinsels heeft, is precies de benchmark waarin gelekte screenshots het minst in staat zijn om ook maar iets aan te tonen. Een model dat schreeuwt terwijl het werkt, is een model waarvan je de output door iemand anders dan de auteur ervan zou willen laten beoordelen.

Wat Google daadwerkelijk in deze lijn heeft uitgebracht

Het lek is alleen leesbaar tegen de vrijgegeven geschiedenis, want Googles wiskundeverhaal is een gedocumenteerde ontwikkeling en de gelekt naam leent de geloofwaardigheid daarvan.

juli 2025 — een geavanceerde versie van Gem​ini Deep Think bereikte het niveau van een gouden medaille bij de Internationale Wiskunde Olympiade, door vijf van de zes opgaven op te lossen voor 35 van de 42 punten, beoordeeld door functionarissen van de IMO volgens dezelfde normen die op studenten worden toegepast. Demis Hassabis merkte op dat het end-to-end in natuurlijke taal werkte, zonder vertaling naar formele syntaxis.

1 augustus 2025 — Goo​gle bracht Gem​ini 2.5 Deep Think openbaar uit, maar niet het gouden model. De uitgebrachte versie werd door Goo​gle beschreven als een snellere, meer geoptimaliseerde variant, die volgens Goo​gles interne evaluatie bronsniveau bereikte op de IMO-benchmark van 2025. Het was alleen toegankelijk voor het hoogste consumentenniveau. Tegelijkertijd gaf Goo​gle het volledige gouden model aan een selecte groep wiskundigen en academici — de "geselecteerde instellingen" waarnaar het uitgelekte signaal terugverwijst.

December 2025 — Gem​ini 3 Deep Think, met een grote generatiesprong die Goo​gle rapporteerde als 45,1% op ARC-AGI-2 met code-uitvoering en 41,0% op Humanity's Last Exam zonder tools.

Nu — Gem​ini 3.1 Deep Think, gebouwd op Gemini 3.1 Pro, verkocht via het hoogste abonnementsniveau voor consumenten en een API-programma op uitnodiging. De door Goo​gle zelf gepubliceerde cijfers, die door de leverancier zijn gerapporteerd en niet onafhankelijk zijn gereproduceerd, plaatsen het op ARC-AGI-2 84,6%, Humanity's Last Exam 48,4% zonder tools en 53,4% met zoeken en code, IMO 2025 81,5%, en een Codeforces Elo van 3455.

Twee aanpalende inspanningen doen er ook toe. Aletheia, een wiskundeonderzoeksagent gebouwd op Gemini Deep Think, wordt door derden gerapporteerd op ongeveer 95,1% op IMO-ProofBench Advanced — en is minder opvallend vanwege het getal dan omdat het ontworpen is om "geen oplossing gevonden" te zeggen in plaats van er een te verzinnen; bij de FirstProof-uitdaging van februari 2026 loste het 6 van de 10 op en weigerde de rest. En een AI Co-Mathematician-opstelling die op Gemini 3.1 Pro draait, zou de FrontierMath Tier 4-prestatie naar verluidt hebben verhoogd van 19% naar 47,9%.

A screenshot of Google DeepMind's official Gemini 3.1 Deep Think model page at deepmind.google/models/gemini/deep-think, captured September 16 2026 in English, showing the title 'Gemini 3.1 Deep Think', the subtitle 'Best for modern challenges across science, research and engineering', a 'Try in Gemini' button, the blue DeepMind model illustration, and the opening line 'Our most specialized reasoning mode is built on top of Gemini 3.1 Pro'.

Bij dat laatste cijfer is het de moeite waard even stil te staan, want het is het sterkste argument tegen het lezen van deze gelekte informatie zoals die is opgeschreven. Een sprong van 19% naar 47,9% op wiskunde op onderzoeksniveau, bereikt door een scaffold rond een algemeen Gemini-model in plaats van een nieuw checkpoint, suggereert dat de grootste recente vooruitgang in Googles wiskundeprestaties afkomstig is van de harness rond het model, niet van een gespecialiseerd model daaronder. Het betekent niet dat Mathematica een scaffold is. Het betekent wel dat de bewijslast voor 'dit is een nieuw, speciaal voor wiskunde ontworpen model' hoger is dan de berichtgeving aannam.

Nog één stukje context ligt over dit alles heen: DeepMind herstructureerde in augustus 2026, waarbij Demis Hassabis de rol van voorzitter op zich nam. Lekken van binnen een laboratorium dat zich reorganiseert zijn niet betrouwbaarder dan lekken uit een stabiel laboratorium, en in de berichtgeving wordt de timing niet als relevant behandeld. Misschien is die dat wel.

Model of scaffold? De vraag die dit lek niet beslecht

Er is een levendige discussie in de berichtgeving over de vraag of Mathematica überhaupt een nieuw model is. Het ene kamp wijst op de "deepthink"-prefix van de buildstring en leest die als een apart checkpoint. Een ander kamp — waarin onze eigen eerdere publicatie over het Deep Think V3-gerucht terechtkwam — stelt dat de specialistische wiskunderesultaten van Goo​gle afkomstig zijn van agent-scaffolds rondom algemene Gem​ini-modellen, en dat er geen apart wiskundemodel nodig is om de cijfers echt te laten zijn.

De build-string is een bescheiden punt in het voordeel van het eerste kamp: models/deepthink-mathematica-tf-raw-thoughts noemt een model, en "raw-thoughts" beschrijft een modelconfiguratie in plaats van een harness-laag. Een scaffold zou zijn redenering niet ongefilterd hoeven te hebben om te kunnen debuggen; een model is er een waarvan het denken het product is, en zo'n model zou dat wel nodig hebben. Dat is een echt signaal.

Het is niet doorslaggevend. Harnassen hebben ook configuratie, en een interne padstring wordt geschreven door degene die de logging heeft opgezet, niet door een schema. Wat het zou beslechten, is het ding dat niemand heeft: een modelkaart, of een endpoint, of een benchmark uitgevoerd door iemand zonder belang bij het antwoord.

Wat je vandaag daadwerkelijk kunt bellen

Niets hiervan verandert iets aan wat je deze week in productie kunt nemen, en het is de moeite waard om ronduit te zijn over de kloof. Deep Think mathematica is op geen enkele API beschikbaar. Gemini 3.1 Deep Think wordt evenmin per token verkocht — het is alleen toegankelijk via het hoogste consumentenabonnement, met een prijs tussen $99,99 en $199,99 per maand, afhankelijk van het abonnement, plus een API-programma op uitnodiging. Daarvoor is geen prijs per miljoen tokens gepubliceerd.

Het basismodel waarop het naar verluidt voortbouwt, is een ander verhaal. Gemini 3.1 Pro kost $2,00 per miljoen inputtokens, $0,20 voor gecachte tokens, en $12,00 per miljoen outputtokens voor contexten onder de 200.000 tokens, oplopend tot $4,00 / $0,40 / $18,00 daarboven — de eigen gepubliceerde tarieven van Google.

Dat prijsdetail is waar de praktische beslissing zit, want het kostenverschil tussen redeneermodi is niet klein. Op ARC-AGI-2 wordt Deep Think naar verluidt op ongeveer 85% geschat voor circa $13,62 per taak, tegenover Gemini 3.1 Pro op 77% voor ongeveer $0,96 per taak. Je betaalt ongeveer veertien keer zoveel voor acht punten. Dat is een verdedigbare afweging voor een moeilijk onderzoeksprobleem en een onverdedigbare voor een productiepad dat vooral gewoon werk afhandelt — en het juiste antwoord is meestal dat je beide bereikbaar wilt hebben vanaf dezelfde plek, in plaats van een abonnementsbeslissing die vooraf wordt genomen.

A screenshot of the OrcaRouter models catalogue at www.orcarouter.ai/models, captured September 16 2026 in English, showing the header 'Models — 198 models · 15 providers · one API key, one bill', a 'How to call any model' card with an OpenAI-compatible curl example, and model cards including Google: Gemini 3.8 Flash at $0.750 per million input tokens, $0.075 cache read and $3.75 output, alongside Qwen3.8 Max, GPT-6 Astra and Claude Fable 5.1.

Dat is het geval voor routing op één sleutel. De Gemini-modellen die vandaag aanroepbaar zijn — Gemini 3.1 Pro Preview, Gemini 3.8 Flash tegen $0,750 per miljoen inputtokens met een cacheread van $0,075, en de rest van de familie — staan op OrcaRouter's catalogus van 198 modellen bij 15 providers, achter één OpenAI-compatibel endpoint. Er is geen markup op de lijstprijzen van providers, dus een prijswijziging van Google is dezelfde dag nog live aan onze kant, in plaats van te wachten op een nieuw contract. Automatische failover betekent dat een onbewezen of preview-model in een route kan staan zonder zelf een productiepad te dragen, precies de houding die een gelekt model verdient: probeer het uit, houd een fallback achter de hand, verander verder niets. De routing-DSL componeert meerdere modellen tot één aanroep, en model fusion draait een panel en combineert de antwoorden — beide nuttig wanneer de vraag moeilijk is en het eerlijke standpunt is dat je de mening van meer dan één model wilt.

Om duidelijk te zijn over de grens: OrcaRouter host Deep Think mathematica niet, en host Gem​ini 3.1 Deep Think niet. Die staan niet in onze catalogus en niets hier zou anders moeten suggereren. Wat wel in de catalogus staat, is de Gem​ini-laag daaronder.

Wat zou dit van een lek tot nieuws maken?

Vier dingen, ruwweg geordend naar hoeveel ze het verhaal zouden veranderen.

Een modelkaart. De Deep Think-releases van Goo​gle gaan gepaard met gepubliceerde evaluaties. Een kaart met cijfers over MILLENNIUM-BENCH of IMO-ProofBench Advanced, uitgevoerd onder de vermelde omstandigheden, zou dit van een build-string veranderen in een model.

Een endpoint. Het duidelijkste signaal zou zijn dat Mathematica opduikt in de Gemini API of in Googles modellenlijst, onder welke naam dan ook. Totdat dat gebeurt, kan niemand het aanroepen en bestaat er geen prijs om te vergelijken.

De institutionele route. Google's patroon in 2025 was om het sterkste wiskundemodel eerst aan geselecteerde wiskundigen te geven en het publiek later een snellere variant. Een stille uitrol naar onderzoekers zou bij dat precedent passen en zou zich waarschijnlijk aandienen vóór enige productaankondiging.

Een run door een derde partij. Aangezien de bewuste benchmark voor de best beschikbare modellen niet verder komt dan ongeveer 24% pass@1, en de kenmerkende faalmodus ervan zelfverzekerde verzinning is, is een onafhankelijke evaluatie het enige bewijs dat standhoudt. Elk cijfer in dit stuk dat een getal bevat, is ofwel van Google zelf, door derden gerapporteerd, of expliciet gemarkeerd als niet-geverifieerd — en geen ervan is afkomstig van een model dat iemand buiten DeepMind heeft gedraaid.

Het enige dat nu de moeite waard is, is niet wachten. Het verschil tussen de wiskundemodus van Google en het basismodel is veertienvoudig qua kosten en acht punten qua nauwkeurigheid, en die afweging is al live; je kunt die vandaag maken met Gemini 3.1 Pro Preview op één sleutel en een fallback erachter. Wanneer Mathematica een modelkaart krijgt, zul je al besloten willen hebben hoe je moeilijke problemen routeert — en het antwoord daarop zal niet afhangen van wat het gelekte model blijkt te zijn.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt