
OpenAI 的 722 份数学手稿:其背后的模型没有名称、没有价格,也没有 API
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
2026 年 10 月 6 日 UTC 21:47,一个名为 openai/math 的代码仓库出现在 GitHub 上,没有描述,只有一个初始提交。十四分钟后,OpenAI 将其发布到 X,并上线了一个配套页面:“分享 AI 在数学领域的进展。”这两件事共同描述了一个史无前例的事件:722 份数学手稿,分为 372 个族,由 OpenAI 的一个内部前沿模型生成;该模型尚未命名、尚未定价,也无法从任何 API 调用。它位居其上的那些模型,才是你今天真正能够触及的——GPT-6 Astra,每百万 token 10 美元 / 50 美元,以及 GPT-6.1 Sol,每百万 token 2 美元 / 10 美元——而这两者都没有撰写这些论文。OpenAI 表示,写出这些论文的模型仍在训练中,并且正在着手“负责任地发布”它。以下是目前已核实的内容、尚未核实的内容,以及读者应从中带走的一个问题。
先从这次发布不是什么说起。这不是一次模型发布:没有模型卡,没有标识符,没有上下文窗口,没有基准测试表,没有日期。这也不是一篇论文:这里没有任何内容经过同行评审,而且 OpenAI 明确表示,没有 Lean 形式化的结果“可能有问题”。这也不是一次泄密——这篇文章之所以采用“目前我们所知”的框架来写,不是因为材料是秘密的,而是因为主题本身,也就是那个模型,尚未发布。下面其余的一切都可以对照仓库、OpenAI 自己的文章,以及 OpenAI 称其咨询过的顾问小组进行核实。
10月6日实际落地的到底是什么
该仓库公开,采用 Apache-2.0 许可,并以 Lean 编写。其 README 指出,该目录“包含 722 份手稿,分为 372 个族”,其中一个族将一项主要结果与配套论证、推论或替代证明归为一组。该手稿图谱详细到足以审计:372 个族各自对应一项主要结果,并列出了组成它们的论文,以及在可获得时提供 Lean 形式化链接。
OpenAI 的帖子补充了来源数据,这些数据是它自己的,未经独立审计:
• 提出的问题——约4,000道,已发布的题族即从中选出
• 每个结果的计算量——平均而言,大约相当于 ChatGPT Pro 思考三个小时
• 推理摘要——已发布 10 篇,涵盖的族包括 π 的无理性指数、对称 Mahler 猜想与一般 Mahler 猜想、特征 2 中 Kaplansky 的直有限性猜想、稀释自旋玻璃的 Mézard–Parisi 公式,以及三维相对论 Vlasov–Maxwell 系统
• 修订政策——为更正内容发布新版本,早期版本仍可访问
主题横跨整个版图:数论、代数几何与复几何、组合学、理论计算机科学、算子代数、概率论与数学物理。有些系列标题表面上是非常宏大的断言——Ryser 覆盖猜想的反例、低于 n log n 的整数乘法、指数至多为 9/4 的矩阵乘法、Mahler 猜想、Baum–Connes 与 Kadison–Kaplansky 的反例。其中某一个是否成立,恰恰是本次发布不会替你解答的问题。

这款模型尚未命名,尚未发布,OpenAI 表示它即将推出
README 对作者的说明毫不含糊:“由 OpenAI 内部模型生成的数学手稿及配套的证明产物”,其中绝大多数是“使用一个未发布的 OpenAI 内部模型”获得的。没有名字,没有代号,没有规模。其他报道中流传的名字并未得到 OpenAI 的确认,我们也不会提供一个。
可以确定日期的是围绕此事的时间线。2026年8月28日,根据OpenAI数学咨询小组页面,该公司“开始训练一个新的内部模型”,该模型此后解决了纳维–斯托克斯千禧年大奖难题,并且按OpenAI自己的统计,还解决了100多个长期悬而未决的开放问题。纳维–斯托克斯的结果于2026年9月8日另行公布,OpenAI当时将背后的模型描述为“能力显著强于GPT-6 Astra”,并表示训练仍在进行中。本周合集中的两篇手稿打破了标准流程,这值得注意,因为它意味着这次发布并非一条统一的流水线:关于黎曼ζ函数无零点区域的工作,以及CM阿贝尔簇霍奇猜想的证明,处理方式有所不同,OpenAI表示,关于ζ函数的文稿为提升可读性经过了人工编辑。
然后,对于任何围绕此事做规划的人来说,真正重要的一句话是:OpenAI写道,它正在“努力以负责任的方式发布产生了这些结果的模型”。这是一种意图声明,而不是一个日期。在该模型发布之前,开发者唯一能调用的OpenAI模型,就是价目表上已有的那些。
“验证”在这里意味着什么——以及它的界限在哪里
这正是大多数关于该版本发布的报道会压缩成一句话的部分,而也正是这一部分决定了该给任何单篇论文多大的分量。
OpenAI 明确表示,“该合集包含处于不同验证阶段的结果。”这份资料包中最有力的证据形式是 Lean 形式化,它让计算机而非人工来检查证明。该仓库自有的形式化清单——即已形式化主要结果的论文目录——列出了 162 个条目,因此在 722 篇手稿中,大约每五篇就有一篇在公开代码树中有可机器检验的证明作为支撑。OpenAI 表示,随着“我们获得更多”,还会有更多内容被添加进来。
其余占绝大多数的部分并未按那种意义得到验证,而 OpenAI 对整份合集也没有假装并非如此:"一些未经形式化的结果可能存在问题。我们会努力迅速修复任何此类问题。"两个结构性细节进一步印证了这是一次受管控的发布,而非开放发布——该仓库的 issue 功能被禁用,拉取请求也仅限协作者提交。目前并不存在公开途径可以就地挑战某项证明。
所以,诚实的解读比标题数字所暗示的要更狭窄:
• 机器校验——162 篇手稿在公开 Lean 树中具有形式化的主要结果
• 非机器检查 —— 其余部分,OpenAI 自己也标记为可能包含错误
• 人类责任——无人被点名;OpenAI 自己的说法是,没有人理解所产出的大部分内容背后的论证
• 独立评估——无已发表内容;哪些结果“显著”到足以纳入,这一筛选由 OpenAI 做出。
这一切都不意味着这项工作有错。它意味着,就目前而言,“OpenAI 发布了 722 个证明”和“722 个证明已被核验”是两种不同的陈述,而今天只有第一种是成立的。

咨询小组附加了一个条件,而且这事已记录在案
OpenAI 的帖子称,它咨询了高等研究院的数学与人工智能独立咨询小组,并借鉴了“他们的建议和公开推荐”。这些建议于 2026 年 9 月 29 日发布,此前该小组收到了数学界 600 多份回复,值得直接阅读,因为该小组并非橡皮图章。
同一份文件开篇指出,该组织完全不认可这种做法:“一些前沿人工智能实验室正在专有模型上测试高等数学问题,而这些模型仍无法为更广泛的科学界所获取……我们不认可这种做法,并要求他们停止。”该组织还称自己独立运作,成员不领取报酬,对 OpenAI 没有决策权——OpenAI 自己的帖子也呼应了对这一关系的描述。
该小组的建议与此次发布一致的地方在于流程:一份彻底梳理的文献综述,并引用提出这些想法的工作;以标准风格撰写的证明文档,而非模型的原始输出;以及保留早期版本的版本管理。它们不一致的地方,在于该小组称为核心的那一点——一个发布无人能理解的结果的实验室,应当资助随后必须进行的人类理解工作,通过研讨会、会议和项目,并且这项工作应保持由社区主导,而非由实验室主导。OpenAI 已承诺资助“围绕理解 AI 产生的重大成果的一系列研讨会、会议和特别项目”,并表示细节将随后公布。这就是尚待落实的事项,也是应当督促他们兑现的那一项。
今天你可以调用什么,以及路由在这里究竟是做什么用的
没有任何办法向生成这些手稿的模型发送请求,也没有任何第三方平台能将其路由——任何声称并非如此的条目,描述的都是一个不存在于任何人产品目录中的模型。已投入生产的 OpenAI 模型是现役的 GPT-6 系列,它们的数字在价目表上,而不是靠推断得出:
• GPT-6 Astra — 每百万 token $10 / $50,缓存读取 $1;超过 272K 提示 token 的长上下文层级为 $20 / $75;1.05M token 上下文,128K 最大输出
• GPT.1 Sol — 每百万 token $2 / $10,缓存读取 $0.10;长上下文分级同样为 $4 / $15;1.05M token 上下文,最大输出 128K
两者都收录在 OrcaRouter 目录中,对于任何把这次发布当作能力信号来解读的人来说,这才是真正的关键所在:你今天获准使用的模型,也正是你的提示词早已围绕其成形的那些模型,而它们与内部模型之间的差距,恰恰就是 OpenAI 请数学家们帮忙缩小的那道差距。
这个差距也是把实验开销与生产路径分开的一个理由。当 OpenAI 真的为这个模型定名定价时,第一周将会充斥着未经核实的基准测试说法,以及大量手忙脚乱的重新集成工作——对像我们这样的平台来说,路由层面的理由在于:那时尝试一个未经证实的模型,代价只是一个模型字符串,而不是一次迁移。GPT-6 Astra 每百万 token 为 $10 / $50,GPT-6.1 Sol 为 $2 / $10,按标价原样透传,0% 加价,因此供应商一改价,当天即生效。自动故障转移意味着一个新模型可以只承载一小部分流量,被弃用时也不会连带拖垮请求路径,而路由 DSL 让你能把多个模型组合进一次调用,如果你希望对一段冗长的推导得到第二种意见,而不是只拿到一个答案。这些都不适用于一个尚未发布的模型——但这恰恰是你希望在下一个模型发布之前就已就位的基础设施。

接下来看什么
四件事,按它们可能重要的先后顺序列出。形式化计数,因为这是本次发布中唯一一个能从“OpenAI 说”变成“机器验证过”的数字,而且它是公开的。对某个具名结果的首次真正独立评估——一位 OpenAI 之外的数学家在公开场合逐篇研读某篇具体论文,而不是对整套论文集的总结。OpenAI 表示仍在探索的社区托管仓库,这会把该成果从 OpenAI 自己的账户中移出,交到该领域手中。以及模型本身的发布,OpenAI 已承诺但尚未排期。
722 份手稿是否意味着 AI 已经解决了这些问题?
对于其中一部分而言,如果数学上站得住脚:该合集声称在多个著名未解决问题上给出了反例和证明,且有 162 篇论文的主要结果背后有可机器检查的形式化。至于其余部分,其说法是某个模型就该问题生成了一份手稿,这比经过验证的解答要弱,而且 OpenAI 自己也警告说,未形式化的结果可能包含错误。“产出了一个证明”和“拥有一个证明”之间的区别,正是这次发布的全部关键所在。
这里面有没有什么今天就能用在产品里的?
不。那些手稿是 PDF、Lean 源码和推理摘要——是研究产物,不是一项服务。没有模型 ID,没有端点,没有价格,也没有访问申请表单。对开发者而言,这次发布真正有用的部分在于确认 OpenAI 正在训练一个明显超越 GPT-6 Astra 的模型,这是未来十二个月的规划信号,而不是你本周就能调用的东西。
为什么OpenAI发布的是结果而不是模型?
因为二者的风险状况不同。发表论文是可逆的——OpenAI 会保留更早的版本,并表示会修复问题——而发布模型则不是。OpenAI 表示正在以负责任的方式推进其发布,而该公司称其所借鉴的顾问小组建议,正是围绕这一顺序构建的:先通过引用和版本管理把成果交到该领域手中,再资助必须随之而来的人的理解。
给匆匆浏览者的一句话版本:10月6日,一批真正前所未有的AI产出的数学成果公之于众,其中大约五分之一经过机器核验,没有一项经过同行评审,而所有这些都依附于一个你无法使用的模型。有意思的问题不在于这个模型是否有能力——每个结果三小时的前沿思维算力、横跨4000个问题,已经回答了这一点,而且OpenAI称该模型的能力显著强于GPT-6 Astra——而在于验证和人类理解能否在下一次发布让这一代过时之前赶上。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
