一張生成的 hero 標題卡,寫著「Deep Think Mathematica」,副標題為「Google 外流的數學模型,完整解析」,其下方是四個圓角狀態標籤,分別寫著「未發布」、「內部測試版本」、「據稱約 100 萬上下文」和「未公布任何基準測試」,頁尾一行則寫著「這是外流,不是發布。Google 尚未確認此模型存在。」
Guides & Insights

Deep Think Mathematica:深入 Google 外洩的數學模型,以及其推理軌跡中的吶喊

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

最引人注目的是Deep Think Mathematica — 這個本週在內部測試中浮現的 Goo​gle 數學模型 — 它似乎會大喊。一個名為「Lyra」的 X 帳號於 2026 年 9 月 16 日把內部推理日誌的螢幕截圖放上網,而那些紀錄讀起來不太像證明助理,反倒像一個人在白板前靈光乍現:「等等。」「我的天。」而且,在成功簡化一個方程式之後,字串是數學聖母啊!!!!!!!!!!!!!!!!!!!!!!!! 反應立刻湧現且滿是喜愛 — Goo​gle 顯然打造出一個真心熱愛數學的 AI。這個反應也是從這次外洩中最沒用的收穫。這裡沒有任何內容已獲 Goo​gle 證實。沒有模型卡、沒有任何已公布清單中的模型 ID、沒有價格,也沒有發布日期。存在的是一個建置字串、兩個內部標籤、一個 token 預算、一組螢幕截圖,以及同一家族中最佳的已推出比較基準,Gem​ini 3.1 Deep Think — 一個你今天實際就能使用的模型,也是這次外洩最終將被拿來評判的尺規。

所以,把下面的一切當作它本來的樣子:一份主張清單,每一項都附有來源,並依它能承受多少分量來排序。

訊號實際上透露了什麼——以及位於它上方的破綻

這則消息本身來自@testingcatalog,這個帳號在 Google 相關消息上尤其有相當可靠的紀錄:它曾揭露 Gemini 桌面版電腦操作(computer-use)的計畫,也在 Google 發表任何說法前,就捕捉到 Nano Banana 2 以內部名稱「GEMPIX2」出現的早期預覽卡。它 9 月 16 日的貼文包含兩項可信度天差地遠的說法。

第二個說法就是這個模型。一款新的「Deep Think Mathematica」已在內部測試中現身,被形容為去年 Goo​gle 提供給特定機構的 Deep Think IMO 模型的精神繼承者。

第一個說法就是關鍵破綻,而且正是值得理解的那一個:「當 Gemini 即將更換背景時,大事正在醞釀。」這不是關於模型的事實。它是關於 Google 發表節奏的社群經驗法則——觀察到 Gemini 應用程式介面的明顯更新,曾多次先於 Google 較大規模的發布登場。這類經驗法則確實有實際紀錄可循,卻毫無預測力。介面更新不是模型。

這兩項說法均未經證實。兩者皆非正式發布,本文亦不將之視為正式發布。

解碼建置字串,因為它是這裡最具體的產物

目前在流傳的資料中,最難以撼動的一項證據,是一個被歸因於外洩日誌的組建識別碼:

建置路徑 — models/deepthink-mathematica-tf-raw-thoughts,由 AI Sight 於 2026 年 9 月 16 日報導,並附有螢幕截圖。

那串文字值得細讀,而大多數報導就停在這裡。它有三個部分帶有資訊。

「deepthink」——會將模型歸入 Deep Think 系列,而非主線的 Gem​ini 系列。這點很重要,因為 Deep Think 是一種模式,存在於 Goo​gle 已推出的產品中,而非獨立系列:它是平行推理路徑,會同時執行多個候選解法。

「tf」——在此語境下,是「Teamfood」的縮寫,也就是隨該建置版本一併回報的兩個內部標籤中的第二個。在 Google 的內部用語中,那屬於早期、dogfooding 階段的代號:由員工使用,而非客戶。

「raw-thoughts」——最有趣的部分,也是理解那些吶喊的關鍵。這指的是未經過濾的思維鏈設定——模型的推理在輸出時,不經過禮貌調校、風格限制或輸出篩選。「raw thoughts」版本並不是產品本身。它是工程師在任何人把模型弄得體面之前,用來觀察模型究竟在做什麼的東西。

第二個回報的標籤是 UNSTABLE_EXPERIMENTAL,這幾乎不言自明,且指向與「Teamfood」相同的方向:早期、內部、非供客戶使用。

另外兩個數字源自同一批日誌,且屬單一來源,因此請寬鬆看待:

上下文視窗——約 1,000,000 個詞元,與 Goo​gle 已在其前沿 Gem​ini 模型上提供的 100 萬詞元視窗相符。

輸出上限 — 65,536 個 token,對推理模型而言,這意味著在給出答案前得經過十分漫長的思量。

這就是這起外洩事件全部的技術表層。一條建置路徑、兩個階段標籤、一個上下文視窗,以及一個輸出上限。這足以說明某個東西存在於測試框架中,卻不足以說明它的得分是多少。

A generated two-column scoreboard titled 'Deep Think Mathematica vs Gemini 3.1 Deep Think — the scoreboard'. Left column 'Deep Think Mathematica (leaked)' reads Status: internal test build; Base model: Gemini 3.1 Pro, reported; Context window: ~1M tokens, reported; Output limit: 65,536 tokens, reported; Benchmarks: none published; Access: no endpoint. Right column 'Gemini 3.1 Deep Think' reads Status: shipping now; Base model: Gemini 3.1 Pro; Context window: 1M tokens; Output limit: not published; Benchmarks: ARC-AGI-2 84.6%, vendor; Access: top tier plus invited API. Footer reads 'Mathematica figures are single-source and unconfirmed; Google has not acknowledged the model. Gemini 3.1 Deep Think figures are Google's own, unreproduced.'

為什麼咆哮的推理軌跡,其證據力比表面上看起來更弱

這些驚嘆號是這則外洩之所以流傳開來的原因,也是必須謹慎對待它的原因。

所回報的解釋平淡無奇,而且完全符合該建置字串:一個未經過濾的推理配置,以高生成溫度運行,且禮貌與格式層遭到剝除。當你移除讓模型聽起來冷靜的調校時,你揭露的不是它的靈魂——而是它的取樣器。驚嘆號密集的輸出,就是高溫取樣一段興奮續寫會呈現的樣子。這種情緒化解讀是配置造成的產物,而非關於模型的發現。

更深層的重點在於,思維鏈究竟什麼。推理軌跡是一種生成出來的文字,只是恰好有助於解決問題。閱讀它的逐字記錄,並從中推斷出某種內部狀態——熱忱、挫折、欣喜——就跟推斷計算器在算出乾淨整數時感到高興一樣,屬於同一種範疇錯誤。這點值得直說,因為中文圈對這次外洩的報導順著這個梗大做文章(「等等」、「我的天」),而某些英文報導則讓這個玩笑凝固成了對模型性格的描述。

這一切都不會讓這份軌跡變得毫無價值。揭露一個原始思考版本,是關於真實工程實務的真確證據——你只會在除錯推理本身時,才記錄未經過濾的推理;而對於一個整體價值主張就在於它能把難題思考得多好的模型,你正是會這麼做。而且,這些軌跡究竟是來自刻意的除錯,還是非預期的記錄,仍未經證實。

誠實的總結:那些驚嘆號告訴你,存在某種原始的推理組態。它們對數學能力則毫無透露。

Millennium Bench 不是千禧年大獎難題

關於這起外洩事件的數篇報導,包括 9 月 16 日流傳的聚合摘要,都稱該模型「以 Millennium Bench 為目標」,然後就點到為止。這個名稱正無意間發揮作用,因為它與某個名氣大得多、意涵也沉重得多的東西只差一個字——克萊數學研究所的七道千禧年大獎難題,每道懸賞 100 萬美元,而且也是本月另一項完全未經證實、關於 OpenAI 與納維–斯托克斯證明的說法所涉及的主題。該討論串中有一篇報導說,Google 打造出一款 AI,在 88 小時內「解決」了這個問題。克萊仍將其列為未解。

這些是不同的東西,將它們混為一談會大幅誇大這起外洩。

MILLENNIUM-BENCH,如 ICLR 2026 論文「演繹失效之處:診斷研究級數學中的推理失敗」,所介紹,是一套由專家策劃的研究級問題基準測試,涵蓋九個領域,包括數學物理、拓撲學與測度論機率。其設計旨在要求遠超競賽數學的持續多步驟演繹。

其最受矚目的結果,正是理解這份外洩資料的關鍵所在。在五個前沿模型上,每個問題執行 100 次,最強者至多達到 24% 的 pass@1 與 39% 的 pass@3。該論文對模型如何失敗的診斷,比這些分數更有價值:框架幻覺,即模型發明一套不適用的理論,然後在其中進行連貫的推理;以及虛構定理,即引用根本不存在的結果,甚至附上捏造的作者姓名與定理編號。

請把這兩件事一起放在心上。一個最好的模型也只能在接近四分之一的題目上封頂,而且其標誌性失敗模式是自信地憑空捏造——這樣的基準,正是外洩螢幕截圖最無法證明任何事情的基準。一個工作時會大聲嚷嚷的模型,就是那種你會希望由作者以外的人來評分的模型。

Goo​gle 在這條產品線上實際推出了什麼

這份外洩內容唯有對照已發布的紀錄才讀得懂,因為 Google 的數學故事是有文獻記載的逐步演進,而外洩的名稱正借用它的可信度。

2025 年 7 月 —Gem​ini Deep Think 的進階版本在國際數學奧林匹亞競賽達到金牌水準,六題中解出五題,42 分中拿下 35 分,並由 IMO 官方人員以適用於學生的相同標準評分。Demis Hassabis 指出,它能以自然語言端到端運作,無須轉譯成形式語法。

2025 年 8 月 1 日 — Goo​gle 公開發佈了 Gem​ini 2.5 Deep Think,但並非黃金模型。Goo​gle 形容所發佈的版本是更快、更最佳化的變體,根據 Goo​gle 的內部評估,在 2025 IMO 基準測試中達到銅牌水準。它僅限最高階消費者方案使用。同時,Goo​gle 將完整的黃金模型交給一群精選的數學家與學者——也就是洩漏訊號所指回的「特定機構」。

2025年12月 — Gem​ini 3 Deep Think,出現大幅的跨代躍進,Goo​gle 回報在 ARC-AGI-2 搭配程式碼執行時達到 45.1%,而在不使用工具的情況下,於 Humanity's Last Exam 達到 41.0%。

現在—— Gem​ini 3.1 Deep Think,以 Gemini 3.1 Pro 為基礎打造,透過最高階的消費者訂閱方案與僅限受邀的 API 計畫販售。Goo​gle 自家公布的數據(由廠商提供,尚未經獨立重現)顯示其表現為 ARC-AGI-2 84.6%、Humanity's Last Exam 在無工具下 48.4%、搭配搜尋與程式碼時 53.4%、IMO 2025 81.5%,以及 Codeforces Elo 3455。

還有兩項相鄰的工作同樣重要。Aletheia,一個建構於 Gemini Deep Think 之上的數學研究代理,據第三方報導,在 IMO-ProofBench Advanced 上約為 95.1%——而其值得注意之處與其說是這個數字,不如說在於它的設計是要說「找不到解」,而不是憑空發明一個;在 2026 年 2 月的 FirstProof 挑戰中,它解出了 10 題中的 6 題,其餘則拒絕作答。而一個在 Gemini 3.1 Pro 上運行的 AI Co-Mathematician 設置,據報導將 FrontierMath Tier 4 的表現從 19% 提升至 47.9%。

A screenshot of Google DeepMind's official Gemini 3.1 Deep Think model page at deepmind.google/models/gemini/deep-think, captured September 16 2026 in English, showing the title 'Gemini 3.1 Deep Think', the subtitle 'Best for modern challenges across science, research and engineering', a 'Try in Gemini' button, the blue DeepMind model illustration, and the opening line 'Our most specialized reasoning mode is built on top of Gemini 3.1 Pro'.

最後那個數字值得停下來想一想,因為它是最強力的論據,反對照著這份外洩資料當初被報導的方式來解讀它。在研究級數學上,從 19% 躍升到 47.9%,而這是由包在通用 Gemini 模型外的一層鷹架所達成,而非新的檢查點;這顯示 Google 近期在數學表現上的最大進展,來自模型外圍的框架,而不是模型底下的專門模型。這不代表 Mathematica 是一層鷹架。這確實代表,若要主張「這是一個全新的專用數學模型」,舉證責任比相關報導所假設的更高。

還有一層背景籠罩在這一切之上:DeepMind 在 2026 年 8 月進行重組,Demis Hassabis 轉任董事長一職。來自正在重組的實驗室內部的洩密,並不比來自穩定實驗室的洩密更可靠,而相關報導並未把這個時機視為相關。但它可能確實相關。

模型還是鷹架?這次外洩未能解答的問題

相關報導中有一場仍在延燒的爭論:Mathematica 究竟是不是一個新模型。有一派指向建置字串中的「deepthink」前綴,並將其解讀為獨立的檢查點。另一方——我們自己先前關於 Deep Think V3 傳聞的報導正是落在這一派——則主張,Goo​gle 的專業數學成果來自包覆通用 Gem​ini 模型的代理支架,且這些數字不必靠一個獨立的數學模型才能為真。

建置字串對第一個陣營來說是個小小的有利論點:models/deepthink-mathematica-tf-raw-thoughts 命名了一個模型,而 "raw-thoughts" 描述的是模型組態,而非測試框架層。鷹架不需要讓其推理未經過濾就能除錯;而一個思考就是產品的模型才會如此。這是個真實的訊號。

這並不是決定性的。測試框架也有設定,而內部路徑字串是由設定日誌記錄的人所寫,不是由結構定義所寫。能真正定論的,是沒有人擁有的東西:一份模型卡、一個端點,或是由對答案沒有利害關係的人所跑的基準測試。

你今天實際可以撥打的電話

這一切都不會改變你本週能投入生產的任何內容,而這個落差值得直言。Deep Think mathematica 並未在任何 API 上提供。Gem​ini 3.1 Deep Think 也不是按 token 計費販售——它被限制在最高階的消費者訂閱方案之後,依方案不同,月費標示為 $99.99 至 $199.99,另外還有僅限邀請的 API 計畫。它沒有公開的每百萬 token 價格。

據報導,它所依據的基礎模型則是另一回事。Gemini 3.1 Pro 的定價為:在上下文低於 200,000 個詞元時,每百萬個輸入詞元 $2.00、快取 $0.20,每百萬個輸出詞元 $12.00;超過此數則升至 $4.00 / $0.40 / $18.00——這些是 Google 自己公布的費率。

那個定價細節正是實際決策的關鍵所在,因為不同推理模式之間的成本差距並不小。在 ARC-AGI-2 上,據稱 Deep Think 約為 85%,每項任務約 $13.62;而 Gemini 3.1 Pro 則是 77%,每項任務約 $0.96。你為八個百分點多付了大約十四倍的費用。對於困難的研究問題來說,這是站得住腳的交換;但對於主要處理日常工作的正式環境路徑而言,則完全站不住腳——而正確答案通常是,你會希望兩者都能從同一個地方取用,而不是事先就做成訂閱制的決定。

A screenshot of the OrcaRouter models catalogue at www.orcarouter.ai/models, captured September 16 2026 in English, showing the header 'Models — 198 models · 15 providers · one API key, one bill', a 'How to call any model' card with an OpenAI-compatible curl example, and model cards including Google: Gemini 3.8 Flash at $0.750 per million input tokens, $0.075 cache read and $3.75 output, alongside Qwen3.8 Max, GPT-6 Astra and Claude Fable 5.1.

這就是在單一金鑰上做路由的理由。目前可呼叫的 Gemini 模型——Gemini 3.1 Pro PreviewGemini 3.8 Flash,每百萬輸入詞元 $0.750、快取讀取 $0.075,以及這個家族的其他成員——都位於OrcaRouter 涵蓋 15 家供應商、共 198 個模型的目錄之中,藏在單一 OpenAI 相容端點之後。供應商定價並沒有加成,因此 Google 的價格若有變動,我們這邊當天就會生效,不必等待重新簽約。自動容錯移轉意味著,一個未經驗證或預覽版的模型可以放在路由中,而不必獨自承擔正式環境路徑——這正是外洩模型應有的姿態:試用它、保留備援、其他一切不變。路由 DSL 會把多個模型組合成一次呼叫,而模型融合則會運行一個評審小組並整合各項答案——當問題很棘手,而誠實的立場是你想要不只一個模型的意見時,這兩者都很有用。

明確劃清界線:OrcaRouter 並不託管 Deep Think mathematica,也不託管 Gemini 3.1 Deep Think。那些都不在我們的目錄上,本頁任何內容都不應暗示相反。目錄上有的是它們底下的 Gemini 層。

是什麼讓這從洩漏變成新聞?

四件事,大致依照它們能推動故事的程度排序。

一份模型卡。Goo​gle 的 Deep Think 發布都隨附公開的評估結果。一份載明在指定條件下於 MILLENNIUM-BENCH 或 IMO-ProofBench Advanced 上跑出數據的模型卡,將能讓這東西從一串建置字串,變成一個真正的模型。

一個端點。最明確的訊號,會是 Mathematica 以任何名稱出現在 Gemini API 或 Google 的模型清單中。在那之前,沒有人能呼叫它,也沒有任何價格可供比較。

機構路線。 Google 在 2025 年的模式,是先將最強大的數學模型提供給精選數學家,之後再向大眾推出更快的版本。低調地向研究人員推出,會符合這項先例,而且很可能在任何產品發布之前就曝光。

由第三方執行的測試。有鑑於所討論的這項基準測試中,目前可取得的最佳模型在 pass@1 上最高也只接近 24%,而其最具代表性的失效模式正是自信滿滿地憑空編造,因此唯有獨立評估才是站得住腳的證據。本文中每一個帶有數字的數據,不是 Goo​gle 自家的、由第三方報導的,就是明確標示為未經查證——而這些數據,沒有一項來自 DeepMind 以外任何人所跑過的模型。

現在唯一值得做的事,就是別再等。Google 的數學模式與其基礎模型之間的差距,是成本十四倍、準確度八個百分點,而這筆取捨已經上線;你今天就能用一把金鑰跑 Gemini 3.1 Pro Preview,並在其後掛上一個備援來做這件事。等 Mathematica 有了模型卡,你會希望自己早已決定好難題要怎麼分流——而那個答案不會取決於外洩的那個模型最後是什麼。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新