一张生成的主视觉标题卡,标题为“Deep Think Mathematica”,副标题为“谷歌泄露的数学模型,解读”,上方有四个圆角状态标签,分别写着“未发布”、“内部测试版本”、“据报道约 100 万上下文”和“未发布基准测试”,底部一行写着“是泄露,而非发布。谷歌尚未确认该模型存在。”
Guides & Insights

Deep Think Mathematica:揭秘 Google 泄露的数学模型,及其推理轨迹中的尖叫

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

最引人注目的一点是,关于Deep Think Mathematica——本周在内部测试中浮出水面的 Goo​gle 数学模型——它似乎会大喊大叫。一个以“Lyra”为名发帖的 X 账号于2026年9月16日将内部推理日志的截图发到网上,而这些推理轨迹读起来不太像证明助手,倒更像是有人在白板前灵光乍现:“等等。”“我的天啊。”而且,在成功化简一个方程后,这个字符串数学的圣母啊!!!!!!!!!!!!!!!!!!!!!!!!反响立刻涌现,而且饱含喜爱——Goo​gle 显然造出了一个真正热爱数学的 AI。不过,这种反应也是这次泄露中最没有参考价值的部分。Goo​gle 尚未确认这里的任何内容。没有模型卡,没有出现在任何已发布列表中的模型 ID,没有价格,也没有发布日期。存在的只是一个构建字符串、两个内部标签、一个 token 预算、一组截图,以及同一系列中最好的已发布对比对象,Gem​ini 3.1 Deep Think——一个你现在就能实际使用的模型,也是这次泄露最终将被拿来衡量的标尺。

所以,把下面这一切都当作它本来的样子:一份主张清单,每一项都附有一个来源,并按它将承受的分量大小排序。

信号究竟在说什么——以及悬于其上的端倪

这条线索本身来自@testingcatalog,这个账号在 Goo​gle 相关消息上有相当不错的过往记录:它曝出了 Gem​ini 桌面端 computer-use 计划,还在 Goo​gle 尚未发声之前,以内部名称“GEMPIX2”捕捉到了 Nano Banana 2 的早期预览卡片。它9月16日的帖子包含两条可信度截然不同的说法。

第二个说法与这款模型有关。内部测试中发现了一款新的“Deep Think Mathematica”,它被描述为 Google 去年向部分机构交付的 Deep Think IMO 模型的精神继任者。

第一个说法就是线索,也是最值得理解的一条:“当 Gemini 即将更换背景时,大事正在酝酿。” 这并不是关于某个模型的事实。它是关于 Google 发布编排的社区经验法则——即 Gemini 应用界面的可见更新,曾出现在 Google 几次更大规模发布之前这一观察。此类经验法则确有实际记录,却毫无预测力。UI 更新并不等于模型。

这两项说法均未得到证实。二者皆非正式发布,本文也不将其视为正式发布。

解码构建字符串,因为它是这里最具体的产物

目前流传的、最难以反驳的一条证据,是一个据称出自泄露日志的构建标识符:

构建路径 —models/deepthink-mathematica-tf-raw-thoughts,由 AI Sight 于 2026 年 9 月 16 日连同截图一并报告。

那个字符串值得仔细阅读,而大多数解读也到此为止。它有三个部分承载着信息。

"deepthink" —将模型归入 Deep Think 产品线,而非主线 Gem​ini 产品线。这一点很重要,因为 Deep Think 是一种模式,存在于 Goo​gle 已发布的产品中,而不是一个独立系列:它是并行推理路径,会同时运行多个候选解决方案。

"tf" ——在上下文中,是"Teamfood"的缩写,即与构建版本一同报告的两种内部标签中的第二个。在 Google 的内部术语中,这是一个早期的"吃自家狗粮"阶段代号:使用者是员工,而非客户。

"raw-thoughts" —最有趣的部分,也是理解这种“喊叫”的关键。它指的是未经过滤的思维链配置——模型的推理在输出时没有经过礼貌性调优、风格约束或输出过滤。“raw thoughts”构建并不是产品。它是工程师在任何人将其变得体面之前,用来查看模型在做什么的东西。

第二个被报告的标签是UNSTABLE_EXPERIMENTAL,它几乎不言自明,并且与"Teamfood"指向同一方向:早期的、内部的、不面向客户的。

另外还有两个数字来自同一批日志,且为单一来源,所以对它们持保留态度:

上下文窗口——约 1,000,000 个 token,与 Goo​gle 已在其前沿 Gem​ini 模型上提供的 100 万窗口相当。

输出上限 — 65,536 个 token,对于推理模型而言,这意味着在给出答案之前要进行极其漫长的思考。

这就是这次泄露的全部技术表面。一个构建路径、两个阶段标签、一个上下文窗口和一个输出上限。这足以说明某个东西存在于测试装置中,却不足以说明它得了多少分。

A generated two-column scoreboard titled 'Deep Think Mathematica vs Gemini 3.1 Deep Think — the scoreboard'. Left column 'Deep Think Mathematica (leaked)' reads Status: internal test build; Base model: Gemini 3.1 Pro, reported; Context window: ~1M tokens, reported; Output limit: 65,536 tokens, reported; Benchmarks: none published; Access: no endpoint. Right column 'Gemini 3.1 Deep Think' reads Status: shipping now; Base model: Gemini 3.1 Pro; Context window: 1M tokens; Output limit: not published; Benchmarks: ARC-AGI-2 84.6%, vendor; Access: top tier plus invited API. Footer reads 'Mathematica figures are single-source and unconfirmed; Google has not acknowledged the model. Gemini 3.1 Deep Think figures are Google's own, unreproduced.'

为什么大声疾呼的推理轨迹比表面看起来更缺乏说服力

感叹号正是这次泄露传开的原因,也正是因此才要对它多加小心。

所报告的解释平淡无奇,并且与构建字符串完全吻合:一个未经过滤的推理配置,在高生成温度下运行,同时礼貌层和格式层都被剥离。当你移除让模型听起来冷静的调校时,你揭示的不是它的灵魂——而是它的采样器。大量感叹号的输出,正是对兴奋续写进行高温采样时会出现的样子。这种情绪化解读是配置的副产物,而不是关于模型的发现。

更深层的要点在于思维链什么。推理轨迹是一种生成出来的文本,恰好对解决问题有用。读它的记录并推断出某种内部状态——热情、沮丧、欣喜——与推断计算器在算出一个整数时感到高兴,属于同一类范畴错误。这一点值得直白地说出来,因为围绕这次泄露的中文报道一味迎合这个玩笑("等等""我的天"),而一些英文报道则让这个玩笑固化成了对模型性格的描述。

这些都不能说明这份轨迹毫无价值。公开一个原始思考版本,本身就是关于一项真实工程实践的确凿证据——你只有在调试推理本身时,才会记录未经筛选的推理,而这正是你面对一个其全部价值就在于能否出色地思考难题的模型时会做的事。而且,这些轨迹究竟出自刻意的调试,还是无意的日志记录,目前尚无定论。

诚实地说:那些感叹号表明存在一种原始的推理配置。它们对数学能力没有任何说明。

Millennium Bench 并非千禧年大奖难题

关于这次泄露的若干文章,包括9月16日流传的聚合摘要,都称该模型“瞄准 Millennium Bench”,然后便到此为止。这个名字在无意中发挥了作用,因为它与某个更有名、也承载着更多意味的东西只差一个词——克莱数学研究所的七个千禧年大奖难题,每项悬赏100万美元,而且也是本月一项独立且完全未经证实的、关于 OpenAI 和纳维–斯托克斯证明的说法的主题。来自该讨论串的一篇报道称,谷歌造出了一个 AI,在88小时内“解决”了该问题。克莱数学研究所仍将其列为未解。

这是两回事,把它们混为一谈会大大夸大这次泄露。

MILLENNIUM-BENCH,正如 ICLR 2026 论文“演绎何处失效:诊断研究级数学中的推理失败”中所介绍的,是一个由专家精选的、涵盖九个领域的研究级问题基准,包括数学物理、拓扑学和测度论概率。它的构建旨在要求持续的多步演绎,远超竞赛数学。

其头条结果才是解读这份泄露材料时最要紧的部分。在五个前沿模型上、每个问题各运行 100 次,表现最强的模型至多达到 24% 的 pass@1 和 39% 的 pass@3。论文对模型失败方式的诊断比这些分数更有价值:框架幻觉,即模型凭空发明一个并不适用的理论,然后在其内部进行连贯推理;以及捏造定理,即引用根本不存在的结果,还附上编造的作者姓名和定理编号。

把这两点放在一起考虑。一个最佳模型也只能在接近四分之一的问题上达到上限、其标志性失败是自信地虚构的基准测试,恰恰就是那种泄露截图最无法说明任何问题的基准测试。一个工作时会大声嚷嚷的模型,正是一个你会希望其输出由作者以外的人来评分的模型。

Google 在这条产品线上实际交付了什么

这次泄露只有对照已发布的记录才读得通,因为 Goo​gle 的数学叙事是一个有据可查的演进过程,而泄露的名称正是在借用它的可信度。

2025年7月——Gemini Deep Think 的一个高级版本在国际数学奥林匹克竞赛中达到金牌水平,在六道题中解出五道,获得42分中的35分,并由 IMO 官员按照适用于学生的同一标准进行评分。Demis Hassabis 指出,它以自然语言端到端运行,无需转换为形式化语法。

2025年8月1日 — Goo​gle 公开发布了 Gem​ini 2.5 Deep Think,但不是金牌模型。Goo​gle 称发布版本是一个更快、更优化的变体,根据 Goo​gle 的内部评估,在 2025 IMO 基准测试上达到铜牌级表现。它仅限最高消费者层级使用。与此同时,Goo​gle 将完整的金牌模型提供给了一组精选的数学家和学者——即泄露信号所回溯提及的“选定机构”。

2025年12月 — Gem​ini 3 Deep Think,Goo​gle 报告称,其实现了巨大的代际跃升:在代码执行条件下 ARC-AGI-2 达到 45.1%,在无工具条件下 Humanity's Last Exam 达到 41.0%。

现在 — Gem​ini 3.1 Deep Think,基于 Gemini 3.1 Pro 构建,通过最高档消费者订阅层级和仅限邀请的 API 计划发售。Google 自行公布的数据(由厂商报告,尚未被独立复现)显示:ARC-AGI-2 为 84.6%,Humanity's Last Exam 在不使用工具时为 48.4%,使用搜索和代码时为 53.4%,IMO 2025 为 81.5%,Codeforces Elo 为 3455。

还有两项与之密切相关的工作同样重要。Aletheia是一个基于 Gem​ini Deep Think 构建的数学研究智能体,第三方报告称其在 IMO-ProofBench Advanced 上约为 95.1%——而它引人注目之处与其说是这个数字,不如说在于它被设计为宁可说“未找到解”,也不愿凭空编造一个;在 2026 年 2 月的 FirstProof 挑战中,它解出了 10 道中的 6 道,并对其余题目拒绝作答。此外,一个运行在 Gemini 3.1 Pro 上的 AI Co-Mathematician 配置据称将 FrontierMath Tier 4 的表现从 19% 提升到了 47.9%。

A screenshot of Google DeepMind's official Gemini 3.1 Deep Think model page at deepmind.google/models/gemini/deep-think, captured September 16 2026 in English, showing the title 'Gemini 3.1 Deep Think', the subtitle 'Best for modern challenges across science, research and engineering', a 'Try in Gemini' button, the blue DeepMind model illustration, and the opening line 'Our most specialized reasoning mode is built on top of Gemini 3.1 Pro'.

最后一个数字值得停下来想想,因为它是反对按那篇报道的写法来解读这次泄露的最有力论据。在研究级数学上从19%跃升至47.9%,而这是通过一个包裹在通用 Gemini 模型外面的脚手架实现的,并非来自新的检查点,这表明谷歌数学表现近期最大的提升来自模型外围的框架,而不是其底层的专用模型。这并不意味着 Mathematica 是一个脚手架。它确实意味着,对于“这是一个新的专用数学模型”这一说法,举证责任比相关报道所假设的更高。

还有一层背景笼罩在这一切之上:DeepMind 于 2026 年 8 月进行重组,Demis Hassabis 转任董事长一职。来自一个正在重组的实验室的泄密,并不比来自一个稳定实验室的泄密更可靠,而相关报道并未把这一时机视为相关因素。它也许是相关的。

模型,还是脚手架?这次泄露未能回答的问题

关于 Mathematica 究竟是不是一个全新模型,报道中正有一场实时进行的争论。一派指向构建字符串中的“deepthink”前缀,将其解读为一个独立的检查点。另一派——我们此前那篇关于 Deep Think V3 传闻的报道正属于这一派——则认为,Goo​gle 的专业数学成果源自包裹在通用 Gem​ini 模型之外的智能体脚手架,而这些数字即便没有独立的数学模型也照样成立。

构建字符串是支持第一阵营的一个小论据:models/deepthink-mathematica-tf-raw-thoughts 命名的是一个模型,而“raw-thoughts”描述的是模型配置,而不是测试框架层。脚手架在调试时并不需要其推理未经过滤;而一个其思考 就是产品的模型则会如此。这是一个真实的信号。

这不是决定性的证据。评测框架本身也有配置,而内部路径字符串是由搭建日志记录的那个人写下的,不是由什么 schema 决定的。真正能一锤定音的,是没有人拥有的那样东西:一份模型卡,一个端点,或者由与答案没有利害关系的人跑出的一次基准测试。

你今天实际可以调用什么

这一切都不会改变你本周能投入生产的任何东西,而关于这个差距,值得直截了当地说明。Deep Think mathematica 不在任何 API 上。Gem​ini 3.1 Deep Think 也不按 token 出售——它被限制在最高档消费者订阅层级之后,根据层级不同,月费标价在 99.99 美元到 199.99 美元之间,外加一个仅限邀请的 API 项目。它没有公布每百万 token 的价格。

据称它所基于的基础模型则另当别论。Gemini 3.1 Pro 的定价为:在上下文低于 20 万 token 时,每百万输入 token 2.00 美元、缓存 0.20 美元、每百万输出 token 12.00 美元;超过该规模后则上涨至 4.00 / 0.40 / 18.00 美元——这是 Google 自己公布的价格。

这个定价细节正是实际决策的关键所在,因为不同推理模式之间的成本差距并不小。在 ARC-AGI-2 上,据报道,Deep Think 的成绩约为 85%,每项任务成本约 13.62 美元;相比之下,Gemini 3.1 Pro 为 77%,每项任务约 0.96 美元。为了多出的八个百分点,你要支付大约十四倍的费用。对于困难的研究问题,这是站得住脚的取舍;对于主要处理普通工作的生产路径,则是站不住脚的——而正确的答案通常是,你希望两者都能从同一个地方调用,而不是提前做出订阅决定。

A screenshot of the OrcaRouter models catalogue at www.orcarouter.ai/models, captured September 16 2026 in English, showing the header 'Models — 198 models · 15 providers · one API key, one bill', a 'How to call any model' card with an OpenAI-compatible curl example, and model cards including Google: Gemini 3.8 Flash at $0.750 per million input tokens, $0.075 cache read and $3.75 output, alongside Qwen3.8 Max, GPT-6 Astra and Claude Fable 5.1.

这就是用一个密钥进行路由的理由。如今可调用的 Gemini 模型——Gemini 3.1 Pro PreviewGemini 3.8 Flash(每百万输入 token 0.750 美元,缓存读取 0.075 美元),以及该系列的其他成员——都位于OrcaRouter 覆盖 15 家提供商、198 个模型的目录之中,藏在一个兼容 OpenAI 的端点之后。提供商标价没有任何加价,因此 Google 一旦调价,我们这边当天就会生效,而不必等待重新签约。自动故障转移意味着,一个未经检验或预览版模型可以置于某条路由之中,而无需独自承载生产路径——这正是泄露模型应得的姿态:试用它、保留一个回退方案,其他什么都不改。路由 DSL 能把多个模型组合成一次调用,模型融合则会运行一个专家小组并综合各方的回答——当问题很棘手、而诚实的立场是你想听取不止一个模型的意见时,这两者都很有用。

明确说明边界:OrcaRouter 不托管 Deep Think mathematica,也不托管 Gem​ini 3.1 Deep Think。它们不在我们的产品目录中,本文中的任何内容都不应暗示相反。产品目录中收录的是它们底层的 Gem​ini 层。

什么能将此事从泄密变成新闻?

四件事,大致按它们对故事的推动程度排序。

一份模型卡。谷歌的 Deep Think 发布都附带了公开的评测结果。一份标明在 MILLENNIUM-BENCH 或 IMO-ProofBench Advanced 上、并在所述条件下运行所得分数的模型卡,就能把这件事从一串构建版本号变成一款真正的模型。

一个端点。 最明确的信号将是 Mathematica 以任何名称出现在 Gemini API 或 Google 的模型列表中。在那之前,没有人能调用它,也不存在可供比较的价格。

机构路线。谷歌在 2025 年的做法是,先把最强的数学大模型提供给经过挑选的数学家,之后再向公众推出更快的版本。悄悄向研究人员先行推送,符合这一先例,而且很可能在任何产品发布之前就会先露端倪。

第三方独立运行。鉴于该基准测试中,现有最佳模型的 pass@1 最高也仅接近 24%,而其标志性的失败模式正是言之凿凿地编造内容,因此独立评估才是唯一站得住脚的证据。本文中每一个带有具体数字的数据,要么来自 Google 自身,要么由第三方报告,要么被明确标注为未经核实——而这些数字无一来自 DeepMind 以外任何人运行过的模型。

现在唯一值得做的事不是等待。Goo​gle 的数学模式与其基础模型之间的差距,在成本上是十四倍,在准确率上是八个点,而这种取舍已经上线;你今天就可以在一个密钥上用 Gemini 3.1 Pro Preview,并在其后配一个后备方案来实现它。等 Mathematica 拿到模型卡时,你会希望自己早已决定好如何路由难题——而这个答案不会取决于那个泄露的模型最终是什么。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新