主视觉标题卡上写着“OpenAI 的 722 份数学手稿”,副标题为“其背后的模型没有名称、没有价格,也没有 API”,一枚琥珀色徽章上写着“未发布模型 - 仅结果”,还有三张卡片:“已发布:722 份手稿,372 个族”“未发布:没有模型卡、没有标识符、没有日期”和“OpenAI 表示:正在努力发布该模型”。
Guides & Insights

OpenAI 的 722 份数学手稿:其背后的模型没有名称、没有价格,也没有 API

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026 年 10 月 6 日 UTC 21:47,一个名为 openai/math 的代码仓库出现在 GitHub 上,没有描述,只有一个初始提交。十四分钟后,OpenAI 将其发布到 X,并上线了一个配套页面:“分享 AI 在数学领域的进展。”这两件事共同描述了一个史无前例的事件:722 份数学手稿,分为 372 个族,由 OpenAI 的一个内部前沿模型生成;该模型尚未命名、尚未定价,也无法从任何 API 调用。它位居其上的那些模型,才是你今天真正能够触及的——GPT-6 Astra,每百万 token 10 美元 / 50 美元,以及 GPT-6.1 Sol,每百万 token 2 美元 / 10 美元——而这两者都没有撰写这些论文。OpenAI 表示,写出这些论文的模型仍在训练中,并且正在着手“负责任地发布”它。以下是目前已核实的内容、尚未核实的内容,以及读者应从中带走的一个问题。

先从这次发布不是什么说起。这不是一次模型发布:没有模型卡,没有标识符,没有上下文窗口,没有基准测试表,没有日期。这也不是一篇论文:这里没有任何内容经过同行评审,而且 OpenAI 明确表示,没有 Lean 形式化的结果“可能有问题”。这也不是一次泄密——这篇文章之所以采用“目前我们所知”的框架来写,不是因为材料是秘密的,而是因为主题本身,也就是那个模型,尚未发布。下面其余的一切都可以对照仓库、OpenAI 自己的文章,以及 OpenAI 称其咨询过的顾问小组进行核实。

10月6日实际落地的到底是什么

该仓库公开,采用 Apache-2.0 许可,并以 Lean 编写。其 README 指出,该目录“包含 722 份手稿,分为 372 个族”,其中一个族将一项主要结果与配套论证、推论或替代证明归为一组。该手稿图谱详细到足以审计:372 个族各自对应一项主要结果,并列出了组成它们的论文,以及在可获得时提供 Lean 形式化链接。

OpenAI 的帖子补充了来源数据,这些数据是它自己的,未经独立审计:

• 提出的问题——约4,000道,已发布的题族即从中选出

• 每个结果的计算量——平均而言,大约相当于 ChatGPT Pro 思考三个小时

• 推理摘要——已发布 10 篇,涵盖的族包括 π 的无理性指数、对称 Mahler 猜想与一般 Mahler 猜想、特征 2 中 Kaplansky 的直有限性猜想、稀释自旋玻璃的 Mézard–Parisi 公式,以及三维相对论 Vlasov–Maxwell 系统

• 修订政策——为更正内容发布新版本,早期版本仍可访问

主题横跨整个版图:数论、代数几何与复几何、组合学、理论计算机科学、算子代数、概率论与数学物理。有些系列标题表面上是非常宏大的断言——Ryser 覆盖猜想的反例、低于 n log n 的整数乘法、指数至多为 9/4 的矩阵乘法、Mahler 猜想、Baum–Connes 与 Kadison–Kaplansky 的反例。其中某一个是否成立,恰恰是本次发布不会替你解答的问题。

Screenshot of the GitHub repository page for openai/math, created October 6, 2026, showing the README statement that the repository contains mathematical manuscripts and supporting proof artifacts produced by an internal OpenAI model, the description of 722 manuscripts organized into 372 families, and the list of ten released reasoning summaries.

这款模型尚未命名,尚未发布,OpenAI 表示它即将推出

README 对作者的说明毫不含糊:“由 OpenAI 内部模型生成的数学手稿及配套的证明产物”,其中绝大多数是“使用一个未发布的 OpenAI 内部模型”获得的。没有名字,没有代号,没有规模。其他报道中流传的名字并未得到 OpenAI 的确认,我们也不会提供一个。

可以确定日期的是围绕此事的时间线。2026年8月28日,根据OpenAI数学咨询小组页面,该公司“开始训练一个新的内部模型”,该模型此后解决了纳维–斯托克斯千禧年大奖难题,并且按OpenAI自己的统计,还解决了100多个长期悬而未决的开放问题。纳维–斯托克斯的结果于2026年9月8日另行公布,OpenAI当时将背后的模型描述为“能力显著强于GPT-6 Astra”,并表示训练仍在进行中。本周合集中的两篇手稿打破了标准流程,这值得注意,因为它意味着这次发布并非一条统一的流水线:关于黎曼ζ函数无零点区域的工作,以及CM阿贝尔簇霍奇猜想的证明,处理方式有所不同,OpenAI表示,关于ζ函数的文稿为提升可读性经过了人工编辑。

然后,对于任何围绕此事做规划的人来说,真正重要的一句话是:OpenAI写道,它正在“努力以负责任的方式发布产生了这些结果的模型”。这是一种意图声明,而不是一个日期。在该模型发布之前,开发者唯一能调用的OpenAI模型,就是价目表上已有的那些。

“验证”在这里意味着什么——以及它的界限在哪里

这正是大多数关于该版本发布的报道会压缩成一句话的部分,而也正是这一部分决定了该给任何单篇论文多大的分量。

OpenAI 明确表示,“该合集包含处于不同验证阶段的结果。”这份资料包中最有力的证据形式是 Lean 形式化,它让计算机而非人工来检查证明。该仓库自有的形式化清单——即已形式化主要结果的论文目录——列出了 162 个条目,因此在 722 篇手稿中,大约每五篇就有一篇在公开代码树中有可机器检验的证明作为支撑。OpenAI 表示,随着“我们获得更多”,还会有更多内容被添加进来。

其余占绝大多数的部分并未按那种意义得到验证,而 OpenAI 对整份合集也没有假装并非如此:"一些未经形式化的结果可能存在问题。我们会努力迅速修复任何此类问题。"两个结构性细节进一步印证了这是一次受管控的发布,而非开放发布——该仓库的 issue 功能被禁用,拉取请求也仅限协作者提交。目前并不存在公开途径可以就地挑战某项证明。

所以,诚实的解读比标题数字所暗示的要更狭窄:

• 机器校验——162 篇手稿在公开 Lean 树中具有形式化的主要结果

• 非机器检查 —— 其余部分,OpenAI 自己也标记为可能包含错误

• 人类责任——无人被点名;OpenAI 自己的说法是,没有人理解所产出的大部分内容背后的论证

• 独立评估——无已发表内容;哪些结果“显著”到足以纳入,这一筛选由 OpenAI 做出。

这一切都不意味着这项工作有错。它意味着,就目前而言,“OpenAI 发布了 722 个证明”和“722 个证明已被核验”是两种不同的陈述,而今天只有第一种是成立的。

Three-column infographic titled "How much of the 722 is actually checked", contrasting "Machine-checked: 162 manuscripts, formalized main result, in the public Lean tree", "Not machine-checked: the remaining majority, no Lean formalization, OpenAI says could contain issues", and "Human or independent review: none named, none published, selection made by OpenAI", with a footer reading "Figures per OpenAI's repository and post, October 6 2026".

咨询小组附加了一个条件,而且这事已记录在案

OpenAI 的帖子称,它咨询了高等研究院的数学与人工智能独立咨询小组,并借鉴了“他们的建议和公开推荐”。这些建议于 2026 年 9 月 29 日发布,此前该小组收到了数学界 600 多份回复,值得直接阅读,因为该小组并非橡皮图章。

同一份文件开篇指出,该组织完全不认可这种做法:“一些前沿人工智能实验室正在专有模型上测试高等数学问题,而这些模型仍无法为更广泛的科学界所获取……我们不认可这种做法,并要求他们停止。”该组织还称自己独立运作,成员不领取报酬,对 OpenAI 没有决策权——OpenAI 自己的帖子也呼应了对这一关系的描述。

该小组的建议与此次发布一致的地方在于流程:一份彻底梳理的文献综述,并引用提出这些想法的工作;以标准风格撰写的证明文档,而非模型的原始输出;以及保留早期版本的版本管理。它们不一致的地方,在于该小组称为核心的那一点——一个发布无人能理解的结果的实验室,应当资助随后必须进行的人类理解工作,通过研讨会、会议和项目,并且这项工作应保持由社区主导,而非由实验室主导。OpenAI 已承诺资助“围绕理解 AI 产生的重大成果的一系列研讨会、会议和特别项目”,并表示细节将随后公布。这就是尚待落实的事项,也是应当督促他们兑现的那一项。

今天你可以调用什么,以及路由在这里究竟是做什么用的

没有任何办法向生成这些手稿的模型发送请求,也没有任何第三方平台能将其路由——任何声称并非如此的条目,描述的都是一个不存在于任何人产品目录中的模型。已投入生产的 OpenAI 模型是现役的 GPT-6 系列,它们的数字在价目表上,而不是靠推断得出:

• GPT-6 Astra — 每百万 token $10 / $50,缓存读取 $1;超过 272K 提示 token 的长上下文层级为 $20 / $75;1.05M token 上下文,128K 最大输出

• GPT.1 Sol — 每百万 token $2 / $10,缓存读取 $0.10;长上下文分级同样为 $4 / $15;1.05M token 上下文,最大输出 128K

两者都收录在 OrcaRouter 目录中,对于任何把这次发布当作能力信号来解读的人来说,这才是真正的关键所在:你今天获准使用的模型,也正是你的提示词早已围绕其成形的那些模型,而它们与内部模型之间的差距,恰恰就是 OpenAI 请数学家们帮忙缩小的那道差距。

这个差距也是把实验开销与生产路径分开的一个理由。当 OpenAI 真的为这个模型定名定价时,第一周将会充斥着未经核实的基准测试说法,以及大量手忙脚乱的重新集成工作——对像我们这样的平台来说,路由层面的理由在于:那时尝试一个未经证实的模型,代价只是一个模型字符串,而不是一次迁移。GPT-6 Astra 每百万 token 为 $10 / $50,GPT-6.1 Sol 为 $2 / $10,按标价原样透传,0% 加价,因此供应商一改价,当天即生效。自动故障转移意味着一个新模型可以只承载一小部分流量,被弃用时也不会连带拖垮请求路径,而路由 DSL 让你能把多个模型组合进一次调用,如果你希望对一段冗长的推导得到第二种意见,而不是只拿到一个答案。这些都不适用于一个尚未发布的模型——但这恰恰是你希望在下一个模型发布之前就已就位的基础设施。

Screenshot of the OrcaRouter model page for OpenAI GPT-6.1 Sol, showing a 1.05M-token context window, 128K max output, a base pricing tier of $2.00 per million input tokens and $10.00 per million output tokens with a $0.100 cache read and $2.50 cache write, a long-context tier above 272K prompt tokens at $4.00 / $15.00 with $0.200 cache read and $5.00 cache write, plus live performance and benchmark panels.

接下来看什么

四件事,按它们可能重要的先后顺序列出。形式化计数,因为这是本次发布中唯一一个能从“OpenAI 说”变成“机器验证过”的数字,而且它是公开的。对某个具名结果的首次真正独立评估——一位 OpenAI 之外的数学家在公开场合逐篇研读某篇具体论文,而不是对整套论文集的总结。OpenAI 表示仍在探索的社区托管仓库,这会把该成果从 OpenAI 自己的账户中移出,交到该领域手中。以及模型本身的发布,OpenAI 已承诺但尚未排期。

722 份手稿是否意味着 AI 已经解决了这些问题?

对于其中一部分而言,如果数学上站得住脚:该合集声称在多个著名未解决问题上给出了反例和证明,且有 162 篇论文的主要结果背后有可机器检查的形式化。至于其余部分,其说法是某个模型就该问题生成了一份手稿,这比经过验证的解答要弱,而且 OpenAI 自己也警告说,未形式化的结果可能包含错误。“产出了一个证明”和“拥有一个证明”之间的区别,正是这次发布的全部关键所在。

这里面有没有什么今天就能用在产品里的?

不。那些手稿是 PDF、Lean 源码和推理摘要——是研究产物,不是一项服务。没有模型 ID,没有端点,没有价格,也没有访问申请表单。对开发者而言,这次发布真正有用的部分在于确认 OpenAI 正在训练一个明显超越 GPT-6 Astra 的模型,这是未来十二个月的规划信号,而不是你本周就能调用的东西。

为什么OpenAI发布的是结果而不是模型?

因为二者的风险状况不同。发表论文是可逆的——OpenAI 会保留更早的版本,并表示会修复问题——而发布模型则不是。OpenAI 表示正在以负责任的方式推进其发布,而该公司称其所借鉴的顾问小组建议,正是围绕这一顺序构建的:先通过引用和版本管理把成果交到该领域手中,再资助必须随之而来的人的理解。

给匆匆浏览者的一句话版本:10月6日,一批真正前所未有的AI产出的数学成果公之于众,其中大约五分之一经过机器核验,没有一项经过同行评审,而所有这些都依附于一个你无法使用的模型。有意思的问题不在于这个模型是否有能力——每个结果三小时的前沿思维算力、横跨4000个问题,已经回答了这一点,而且OpenAI称该模型的能力显著强于GPT-6 Astra——而在于验证和人类理解能否在下一次发布让这一代过时之前赶上。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新