
Deep Think Mathematica: Inuti Googles läckta matematikmodell, och skriket i dess resonemangsspår
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
Det mest avslöjande med Deep Think Mathematica — Googles matematikmodell som dök upp i intern testning den här veckan — är att den verkar skrika. Ett X-konto som publicerar under namnet "Lyra" la ut skärmbilder av interna resonemangsloggar online den 16 september 2026, och spåren framstår mindre som en bevisassistent än som en person som får ett genombrott vid en whiteboard: "Vänta." "Herregud." Och efter att framgångsrikt ha förenklat en ekvation, strängen HELIGA MODER AV MATEMATIK!!!!!!!!!!!!!!!!!!!!!!!! Reaktionen var omedelbar och kärleksfull — Google hade tydligen byggt en AI som verkligen älskar matematik. Den reaktionen är också det minst användbara att ta med sig från läckan. Inget här har bekräftats av Google. Det finns inget modellkort, inget modell-ID i någon publicerad lista, inget pris och inget releasedatum. Det som finns är en build-sträng, två interna etiketter, en tokenbudget, en uppsättning skärmbilder och den bästa jämförelsepunkten för en lanserad modell i samma familj, Gemini 3.1 Deep Think — en modell du faktiskt kan använda idag, och måttstocken som den här läckan så småningom kommer att bedömas mot.
Så behandla allt nedan för vad det är: en påståendelista med en källa kopplad till varje post, sorterad efter hur mycket vikt den kommer att bära.
Vad signalen egentligen säger — och avslöjandet som sitter ovanför den
Själva signalen kom från @testingcatalog, ett konto med ett hyfsat track record specifikt när det gäller Google: det avslöjade Geminis planer för datoranvändning på skrivbordet, och det fångade Nano Banana 2:s tidiga förhandsvisningskort under det interna namnet "GEMPIX2" innan Google hade sagt något. Dess inlägg den 16 september innehåller två påståenden av mycket olika kvalitet.
Det andra påståendet är modellen. En ny "Deep Think Mathematica" har upptäckts i interna tester och beskrivs som en andlig efterföljare till Deep Think IMO-modellen som Google levererade till utvalda institutioner förra året.
Det första påståendet är avslöjandet, och det är det som är värt att förstå: "När Gemini är på väg att byta bakgrund är något stort på gång." Det är inte ett faktum om en modell. Det är en heuristik från communityn om Googles lanseringskoreografi — observationen att en synlig uppdatering av Gemini-appens gränssnitt har föregått flera av Googles större tillkännagivanden. Heuristiker som denna har en verklig historik och noll prediktiv kraft. En UI-uppdatering är inte en modell.
Båda påståendena är obekräftade. Inget av dem är en release, och den här texten behandlar det inte som en.
Att avkoda build-strängen, eftersom den är den mest konkreta artefakten här
Det enskilt svåraste beviset som cirkulerar är en build-identifierare som tillskrivs de läckta loggarna:
• Byggsökväg — models/deepthink-mathematica-tf-raw-thoughts, enligt AI Sight den 16 september 2026, tillsammans med skärmbilderna.
Den strängen belönar en noggrann läsning, och det är där de flesta genomgångar stannar. Tre delar av den bär information.
• "deepthink" — placerar modellen i Deep Think-linjen snarare än i huvudlinjen Gemini. Det spelar roll eftersom Deep Think är ett läge i Googles lanserade produkter, inte en separat familj: det är den parallella resonemangsvägen som kör flera kandidatlösningar samtidigt.
• "tf" — i sammanhanget en förkortning för "Teamfood", den andra av de två interna beteckningar som rapporterades tillsammans med bygget. I Googles interna vokabulär är det en tidig beteckning i dogfooding-stadiet: anställda som använder det, inte kunder.
• "raw-thoughts" — den mest intressanta delen, och nyckeln till skrikandet. Detta betecknar den ofiltrerade tankekedjekonfigurationen – modellens resonemang som avges utan artighetsjustering, stilbegränsningar eller utdatafiltrering. En "raw thoughts"-byggversion är inte produkten. Det är det som ingenjörer tittar på när de vill se vad modellen gör innan någon gör den presentabel.
Den andra rapporterade etiketten är UNSTABLE_EXPERIMENTAL, vilket är nära nog självförklarande och pekar i samma riktning som "Teamfood": tidig, intern, inte för kunder.
Ytterligare två siffror tillskrivs samma loggar och kommer från en enda källa, så fäst inte alltför stor vikt vid dem:
• Kontextfönster — ungefär 1 000 000 token, vilket motsvarar det 1M-fönster som Google redan erbjuder på sina främsta Gemini-modeller.
• Utmatningsgräns — 65 536 token, vilket för en resonemangsmodell innebär en mycket lång överläggning innan ett svar.
Det är hela den tekniska ytan av läckan. En byggsökväg, två stegbeteckningar, ett kontextfönster och ett utdatatak. Det räcker att säga att en sak finns i en testrigg. Det räcker inte att säga vad den får för poäng.

Varför ett resonemangsspår som skriker är svagare bevis än det verkar
Utropstecknen är anledningen till att den här läckan spreds, och de är anledningen till att vara försiktig med den.
Den rapporterade förklaringen är alldaglig och passar build-strängen exakt: en ofiltrerad resonemangskonfiguration, körd vid hög genereringstemperatur, med artighets- och formateringslagren borttagna. När du tar bort den trimning som får en modell att låta lugn, avslöjar du inte dess själ — du avslöjar dess sampler. Utropstung utdata är vad ett prov vid hög temperatur av en upphetsad fortsättning ser ut som. Den känslomässiga tolkningen är en artefakt av konfigurationen, inte ett fynd om modellen.
Den djupare poängen handlar om vad en tankekedja är. Ett resonemangsspår är genererad text som råkar vara användbar för att lösa problem. Att läsa en avskrift av det och sluta sig till ett inre tillstånd – entusiasm, frustration, förtjusning – är samma kategorimisstag som att sluta sig till att en miniräknare är nöjd när den producerar ett rent heltal. Det är värt att säga rakt ut, eftersom den kinesiskspråkiga bevakningen av den här läckan omfamnade skämtet ("等等", "我的天") och viss engelskspråkig bevakning lät skämtet stelna till en beskrivning av modellens karaktär.
Inget av detta gör spåret värdelöst. Att exponera en build med råa tankar är ett genuint bevis på en verklig ingenjörspraktik — du loggar bara ofiltrerat resonemang när du felsöker själva resonemanget, vilket är vad du gör med en modell vars hela värdeerbjudande är hur väl den tänker igenom svåra problem. Och det är inte verifierat huruvida spåren kom från avsiktlig felsökning eller oavsiktlig loggning.
Den ärliga sammanfattningen: utropen säger att en rå resonemangskonfiguration finns. De säger ingenting om matematisk förmåga.
Millennium Bench är inte Millenniumprisproblemen
Flera artiklar om den här läckan, inklusive de aggregatorsammanfattningar som cirkulerade den 16 september, beskriver modellen som ”siktar på Millennium Bench” och lämnar det där. Namnet gör ett oavsiktligt jobb, eftersom det ligger ett ord bort från något mycket mer känt och mycket mer laddat – Clay Mathematics Institutes sju Millennium Prize Problems, var och en med en prissumma på 1 miljon dollar, och som denna månad är föremål för ett separat och helt obekräftat påstående om OpenAI och ett Navier–Stokes-bevis. En rapport från den tråden säger att Google byggde en AI som ”löste” problemet på 88 timmar. Clay listar det fortfarande som öppet.
Dessa är olika saker, och att sammanblanda dem blåser upp den här läckan avsevärt.
MILLENNIUM-BENCH, såsom det introducerades i ICLR 2026-artikeln "Där deduktion bryter samman: Att diagnostisera resonemangsfel inom matematik på forskningsnivå," är ett benchmark av expertkuraterade problem på forskningsnivå som omfattar nio domäner, inklusive matematisk fysik, topologi och måtteoretisk sannolikhet. Det byggdes för att kräva ihållande flerstegsdeduktion långt bortom tävlingsmatematik.
Dess huvudresultat är den del som spelar roll för att läsa den här läckan. Bland fem frontier-modeller, som kördes 100 gånger per problem, uppnådde den starkaste som mest 24 % pass@1 och 39 % pass@3. Papprets diagnos av hur modeller misslyckas är mer användbar än poängen: ramverkshallucination, där en modell hittar på en otillämplig teori och sedan resonerar sammanhängande inom den, och fabricerade teorem, där den citerar resultat som inte finns, inklusive påhittade författarnamn och teoremnummer.
Håll båda dessa saker i minnet samtidigt. En benchmark där den bästa modellen som mest klarar nära en fjärdedel av problemen, och vars signaturfel är självsäker fabulering, är precis den benchmark där läckta skärmdumpar minst av allt kan bevisa någonting. En modell som skriker medan den arbetar är en modell vars output man skulle vilja få bedömd av någon annan än dess skapare.
Vad Google faktiskt har levererat i den här serien
Läckan är bara begriplig mot den publicerade dokumentationen, eftersom Googles matematikberättelse är en dokumenterad utveckling och det läckta namnet lånar sin trovärdighet från den.
• Juli 2025 — en avancerad version av Gemini Deep Think uppnådde guldmedaljstandard vid Internationella matematikolympiaden och löste fem av sex problem för 35 av 42 poäng, bedömd av IMO-tjänstemän enligt samma standarder som tillämpas på elever. Demis Hassabis noterade att den arbetade från början till slut i naturligt språk utan översättning till formell syntax.
• 1 augusti 2025 — Google släppte Gemini 2.5 Deep Think offentligt, men inte guldmodellen. Den släppta versionen beskrevs av Google som en snabbare, mer optimerad variant, med prestanda på bronsnivå i 2025 års IMO-benchmark enligt Googles interna utvärdering. Den var begränsad till den högsta konsumentnivån. Samtidigt gav Google den fullständiga guldmodellen till en utvald grupp matematiker och akademiker – de "utvalda institutionerna" som den läckta signalen refererar tillbaka till.
• december 2025 — Gemini 3 Deep Think, med ett stort generationssprång som Google rapporterade som 45,1 % på ARC-AGI-2 med kodkörning och 41,0 % på Humanity's Last Exam utan verktyg.
• Nu — Gemini 3.1 Deep Think, byggd på Gemini 3.1 Pro, säljs via den högsta konsumentprenumerationsnivån och ett API-program endast på inbjudan. Googles egna publicerade siffror, som är leverantörsrapporterade och inte har reproducerats oberoende, anger den till ARC-AGI-2 84,6 %, Humanity's Last Exam 48,4 % utan verktyg och 53,4 % med sökning och kod, IMO 2025 81,5 % och en Codeforces-Elo på 3455.
Två närliggande satsningar spelar också roll. Aletheia, en matematikforskningsagent byggd på Gemini Deep Think, rapporteras av tredje part ligga på ungefär 95,1 % på IMO-ProofBench Advanced – och är mindre anmärkningsvärd för siffran än för att vara utformad att säga "ingen lösning hittad" i stället för att hitta på en; i FirstProof-utmaningen i februari 2026 löste den 6 av 10 och avböjde resten. Och en AI Co-Mathematician-konfiguration som körs på Gemini 3.1 Pro ska enligt uppgift ha lyft FrontierMath Tier 4-prestandan från 19 % till 47,9 %.

Den sista siffran är värd att stanna upp vid, eftersom den är det starkaste argumentet mot att läsa den här läckan så som den framställdes. Ett hopp från 19 % till 47,9 % inom matematik på forskningsnivå, uppnått med en stödstruktur lindad runt en allmän Gemini-modell i stället för en ny checkpoint, tyder på att de största senaste vinsterna i Googles matematikprestanda har kommit från ramverket runt modellen, inte från en specialistmodell under den. Det betyder inte att Mathematica är en stödstruktur. Det betyder däremot att bevisbördan för ”detta är en ny dedikerad matematikmodell” är högre än vad bevakningen antog.
Ytterligare en kontextuell detalj ligger över allt detta: DeepMind omstrukturerades i augusti 2026, då Demis Hassabis gick över till en ordföranderoll. Läckor inifrån ett labb som omorganiseras är inte mer tillförlitliga än läckor från ett stabilt sådant, och bevakningen har inte behandlat tidpunkten som relevant. Det kanske den är.
Modell eller stödstruktur? Frågan som detta läckage inte avgör
Det pågår en livlig debatt i bevakningen om huruvida Mathematica överhuvudtaget är en ny modell. Ett läger pekar på byggsträngens "deepthink"-prefix och tolkar det som en separat checkpoint. Ett annat läger – som vår egen tidigare text om ryktet om Deep Think V3 landade i – hävdar att Google:s specialiserade matematikresultat kommer från agent-scaffolds som lindas runt allmänna Gemini-modeller, och att ingen separat matematikmodell behöver existera för att siffrorna ska vara verkliga.
Byggsträngen är en blygsam poäng till det första lägrets fördel: models/deepthink-mathematica-tf-raw-thoughts namnger en modell, och "raw-thoughts" beskriver en modellkonfiguration snarare än ett harneslager. En stomme skulle inte behöva sitt resonemang ofiltrerat för att felsökas; en modell vars tänkande är produkten skulle behöva det. Det är en verklig signal.
Det är inte avgörande. Även testriggar har konfiguration, och en intern sökvägssträng skrivs av den som satte upp loggningen, inte av ett schema. Det som skulle avgöra saken är det ingen har: ett modellkort, eller en slutpunkt, eller en benchmarkkörning av någon som inte har något att vinna på svaret.
Vad du faktiskt kan ringa idag
Inget av detta förändrar vad du kan sätta i produktion den här veckan, och det är värt att vara krass om gapet. Deep Think-matematik finns inte i något API. Gemini 3.1 Deep Think säljs inte per token heller – det är låst bakom den högsta nivån för konsumentabonnemang, listad mellan $99.99 och $199.99 i månaden beroende på nivå, plus ett inbjudningsbaserat API-program. Det finns inget offentliggjort pris per miljon tokens för det.
Den basmodell som den enligt uppgift bygger på är en annan historia. Gemini 3.1 Pro kostar $2,00 per miljon indatatokens, $0,20 för cachade och $12,00 per miljon utdatatokens för kontexter under 200 000 tokens, och stiger till $4,00 / $0,40 / $18,00 över det – Googles egna publicerade priser.
Den prisdetaljen är där det praktiska beslutet ligger, eftersom kostnadsklyftan mellan resonemangslägena inte är liten. På ARC-AGI-2 uppges Deep Think ligga på ungefär 85 % för cirka 13,62 $ per uppgift, mot Gemini 3.1 Pro på 77 % för cirka 0,96 $ per uppgift. Du betalar ungefär fjorton gånger mer för åtta punkter. Det är en försvarbar avvägning för ett svårt forskningsproblem och en oförsvarbar sådan för en produktionsväg som mest hanterar vanligt arbete – och det korrekta svaret är vanligtvis att du vill ha båda nåbara från samma ställe i stället för ett prenumerationsbeslut som fattas i förväg.

Det är argumentet för att routa på en nyckel. Gemini-modellerna som går att anropa i dag – Gemini 3.1 Pro Preview, Gemini 3.8 Flash till $0.750 per miljon indatatoken med $0.075 för cacheläsning, och resten av familjen – ligger på OrcaRouters katalog med 198 modeller från 15 leverantörer, bakom en OpenAI-kompatibel endpoint. Det finns inget påslag på leverantörernas listpriser, så en prisändring från Google slår igenom hos oss samma dag i stället för att vänta på ett nytt avtal. Automatisk failover innebär att en obeprövad eller förhandsvisad modell kan ligga i en rutt utan att själv bära en produktionsväg, vilket är precis den hållning en läckt modell förtjänar: prova den, behåll en fallback, ändra inget annat. Routnings-DSL:en komponerar flera modeller till ett anrop, och modellfusion kör en panel och kombinerar svaren – båda är användbara när frågan är svår och den ärliga hållningen är att du vill ha åsikter från mer än en modell.
För att vara tydlig med gränsdragningen: OrcaRouter hostar inte Deep Think mathematica, och hostar inte Gemini 3.1 Deep Think. De finns inte i vår katalog och inget här bör antyda något annat. Det som finns i katalogen är Gemini-lagret under dem.
Vad skulle förvandla detta från ett läck till en nyhet?
Fyra saker, i grov ordning efter hur mycket de skulle driva berättelsen framåt.
• Ett modellkort.Googles lanseringar av Deep Think har kommit med publicerade utvärderingar. Ett kort med siffror för MILLENNIUM-BENCH eller IMO-ProofBench Advanced, körda under angivna förhållanden, skulle förvandla detta från en byggsträng till en modell.
• En slutpunkt. Den tydligaste signalen skulle vara att Mathematica dyker upp i Gemini API eller i Googles modellista under vilket namn som helst. Tills det händer kan ingen anropa den och det finns inget pris att jämföra med.
• Institutionsvägen. Googles mönster under 2025 var att först ge den starkaste matematikmodellen till utvalda matematiker och senare ge allmänheten en snabbare variant. En tyst utrullning till forskare skulle passa in i det prejudikatet och skulle sannolikt dyka upp före något produkttillkännagivande.
• En tredjepartskörning.Med tanke på att det aktuella riktmärket toppar nära 24 % pass@1 för de bästa tillgängliga modellerna, och att dess kännetecknande felmod är självsäker fabricering, är en oberoende utvärdering det enda beviset som håller. Varje sifferuppgift i den här artikeln är antingen Googles egen, rapporterad av tredje part eller uttryckligen flaggad som overifierad — och ingen av dem kom från en modell som någon utanför DeepMind har kört.
Det enda som är värt att göra nu är att inte vänta. Klyftan mellan Googles matematikläge och dess basmodell är fjorton gånger så stor i kostnad och åtta punkter i noggrannhet, och den avvägningen är redan i bruk; du kan göra det idag med Gemini 3.1 Pro Preview på en enda nyckel och en fallback bakom den. När Mathematica får ett modellkort vill du redan ha bestämt hur du routar svåra problem – och svaret på det kommer inte att bero på vad den läckta modellen visar sig vara.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
