主視覺標題卡寫著「OpenAI 的 722 份數學手稿」,副標題為「這些手稿背後的模型沒有名稱、沒有價格,也沒有 API」,一個琥珀色徽章寫著「未發布的模型 - 僅供結果」,以及三張卡片:「已發布:722 份手稿、372 個家族」、「未發布:沒有模型卡、沒有識別碼、沒有日期」,以及「OpenAI 表示:正努力發布該模型」。
Guides & Insights

OpenAI 的 722 份數學手稿:其背後的模型沒有名稱、沒有價格,也沒有 API

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

2026年10月6日協調世界時21:47,一個名為 openai/math 的儲存庫出現在 GitHub 上,沒有任何說明,只有一次初始提交。十四分鐘後,OpenAI 將它發布到 X,並架設了一個配套頁面「分享數學領域的 AI 進展」。這兩件事合起來,描述了一個前所未有的事件:722 篇數學手稿,分成 372 個家族,由一個 OpenAI 尚未命名、尚未定價、也無法從任何 API 呼叫的內部前沿模型所產出。它所位居其上的那些模型,才是你今天真正能觸及的——每百萬個符元 $10 / $50 的 GPT-6 Astra,以及每百萬個符元 $2 / $10 的 GPT-6.1 Sol——而這兩者都沒有寫出這些論文。OpenAI 表示,真正寫出這些論文的模型仍在訓練中,而他們正著手「負責任地發布」它。以下是目前已獲證實的內容、尚未獲證實的部分,以及讀者應該從中帶走的一個問題。

先從這份發布不是什麼開始。它不是模型發布:沒有模型卡、沒有識別碼、沒有上下文視窗、沒有基準測試表、沒有日期。它不是論文:這裡沒有任何內容經過同儕審查,而 OpenAI 明言,未經 Lean 形式化的結果「可能會有問題」。而且它不是外洩——這篇文章會以「目前所知」的框架來寫,原因不是這些材料是祕密的,而是其主體本身,也就是那個模型,尚未發布。以下其餘所有內容都可以對照該儲存庫、OpenAI 自己的貼文,以及 OpenAI 表示曾諮詢過的諮詢小組來查核。

10月6日實際著陸的究竟是什麼?

該儲存庫是公開的,採用 Apache-2.0 授權,並以 Lean 撰寫。其 README 指出,該目錄「收錄 722 篇手稿,分為 372 個家族」,其中一個家族會將一項主要結果與伴隨論證、推論或替代證明歸為一組。這份手稿圖譜詳細到足以稽核:372 個家族各自都有一項主要結果,並列出其組成論文,且在可取得時附上 Lean 形式化連結。

OpenAI 的貼文補充了溯源數據,而這些數據是它自家提供、未經獨立審計的:

• 提出的題目 — 約 4,000 道,已發布的題組即從中選出

• 每項結果的運算量——平均相當於約三小時的 ChatGPT Pro 思考

• 推理摘要 — 已發布 10 份,涵蓋多個問題族,包括 π 的無理性指數、對稱與一般 Mahler 猜想、特徵二中的 Kaplansky 直接有限性猜想、稀釋自旋玻璃的 Mézard–Parisi 公式,以及三維相對論性 Vlasov–Maxwell 系統

• 修訂政策——修正內容會發布新版本,並保留先前版本供查閱

主題橫跨整個版圖:數論、代數幾何與複幾何、組合學、理論計算機科學、算子代數、機率與數學物理。這一系列中的某些標題表面上是非常宏大的主張——Ryser 覆蓋猜想的反例、整數乘法低於 n log n、指數至多為 9/4 的矩陣乘法、Mahler 猜想、Baum–Connes 與 Kadison–Kaplansky 的反例。某個特定主張是否成立,正是本次發布未替你解決的問題。

Screenshot of the GitHub repository page for openai/math, created October 6, 2026, showing the README statement that the repository contains mathematical manuscripts and supporting proof artifacts produced by an internal OpenAI model, the description of 722 manuscripts organized into 372 families, and the list of ten released reasoning summaries.

該模型尚未命名、尚未發布,而 OpenAI 表示它即將推出。

README 對作者的身分毫不含糊:「由 OpenAI 內部模型產出的數學手稿與輔助證明產物」,其中絕大多數是「使用一個尚未發布的 OpenAI 內部模型」取得。沒有名稱,沒有代號,也沒有規模。其他報導中流傳的名稱尚未獲得 OpenAI 確認,我們也不會提供任何名稱。

可確定日期的是圍繞這件事的時間線。2026年8月28日,根據OpenAI在其數學諮詢小組頁面上的說法,該公司「開始訓練一個新的內部模型」,該模型此後解決了納維–斯托克斯千禧年大獎難題,而且依OpenAI自己的統計,還解決了超過100個長期懸而未決的開放問題。納維–斯托克斯的結果於2026年9月8日另行公布,OpenAI在該處將背後的模型描述為「能力明顯強於GPT-6 Astra」,並表示訓練仍在進行中。本週文集中的兩篇手稿打破了標準程序,這值得注意,因為這意味著此次發布並非單一統一的流程:關於黎曼ζ函數無零區域的研究,以及CM阿貝爾簇的霍奇猜想證明,處理方式有所不同,而OpenAI表示,ζ函數那篇文稿為了可讀性而經人工編輯。

那麼,對任何以此為規劃依據的人來說,真正重要的一句話是:OpenAI 寫道,它正「努力以負責任的方式發布產出這些結果的模型」。那是意圖的表達,而非日期。在它正式推出之前,開發者能呼叫的 OpenAI 模型,就只有已經列在價目表上的那些。

「驗證」在這裡是什麼意思——以及它的界線在哪裡

這是大多數關於該發表的報導會濃縮成一句話的部分,而正是這個部分決定了該給任何單篇論文多大的權重。

OpenAI 明確表示,「這個合集包含處於不同驗證階段的結果。」這批資料中最強有力的證據形式是 Lean 形式化,它讓電腦而非人來檢查證明。該儲存庫自身的形式化清單——列出主要結果已形式化的論文目錄——共有 162 筆條目,因此 722 份手稿中約每五份就有一份,在公開樹狀目錄中有可由機器檢查的證明作為依據。OpenAI 表示,更多內容會「在我們取得後」陸續加入。

剩下的大多數並未以那種意義受到驗證,而 OpenAI 對於整份集合也不假裝不是如此:「有些未形式化的結果可能會有問題。我們會努力迅速修正任何這類問題。」兩個結構性細節強化了這是受控發布、而非開放發布——該儲存庫的 issues 功能已停用,而提取要求僅限協作者提出。沒有任何公開途徑可以就地挑戰某項證明。

所以,忠實的解讀比標題數字所暗示的更狹隘:

機器檢查 — 162 篇手稿,其主要結果已在公開的 Lean 樹中形式化

• 未經機器檢查——其餘部分,OpenAI 本身標示為可能包含錯誤

• 人類責任——未點名任何人;OpenAI 自身的說法是,沒有人理解所產出的大部分內容背後的論證

• 獨立評估——未發表任何此類評估;哪些結果「足夠顯著」而值得納入的選擇,是由 OpenAI 做出的

這一切都不代表這項工作是錯的。這代表的是,就目前而言,「OpenAI 發布了 722 個證明」和「722 個證明已被檢查」是不同的陳述,而今天只有第一項是真的。

Three-column infographic titled "How much of the 722 is actually checked", contrasting "Machine-checked: 162 manuscripts, formalized main result, in the public Lean tree", "Not machine-checked: the remaining majority, no Lean formalization, OpenAI says could contain issues", and "Human or independent review: none named, none published, selection made by OpenAI", with a footer reading "Figures per OpenAI's repository and post, October 6 2026".

顧問小組附加了一項條件,而且這已記錄在案。

OpenAI 的文章表示,它諮詢了高等研究院(Institute for Advanced Study)獨立的數學與人工智慧諮詢小組,並參考了「他們的建議與公開建議」。這些建議於 2026 年 9 月 29 日發布,此前該小組收到數學界超過 600 份回覆;這些建議值得直接閱讀,因為該小組並非橡皮圖章。

同一份文件開頭指出,該團體完全不認同這種做法:「一些前沿 AI 實驗室正在專有模型上測試高等數學問題,而這些模型仍不對更廣泛的科學社群開放……我們不認同這種做法,並要求他們停止。」該團體也自稱獨立運作,成員無償參與,且對 OpenAI 沒有決策權——OpenAI 自己的貼文也呼應了這種關係描述。

該小組的建議與本次發布相符之處在於流程:一份徹底爬梳的文獻回顧,並引用最初提出這些構想的研究;以標準格式撰寫的證明報告,而非模型原始輸出;以及能保留先前發布版本的版本管理。兩者不相符之處,在於該小組稱為核心的那個部分——一個發布了沒有人能理解之成果的實驗室,應該資助隨之而來的人類理解工作,透過工作坊、會議與計畫來進行,而且這項工作應由社群主導,而非由實驗室指揮。OpenAI 已承諾資助「一系列工作坊、會議與特別計畫,以理解 AI 產出的重大成果」,並表示細節將隨後公布。這就是尚未解決的項目,也是應該要求他們兌現的一項。

你今天可以呼叫什麼,以及路由在這裡實際上是做什麼用的

沒有辦法向產出這些手稿的模型送出請求,也沒有任何第三方平台能進行路由——任何聲稱並非如此的刊登內容,所描述的都是一個不存在於任何人型錄中的模型。正式上線的 OpenAI 模型是實際運作中的 GPT-6 系列,而其數字是列在價目表上,而不是推測出來的:

• GPT-6 Astra — 每百萬 token $10 / $50,快取讀取 $1;超過 272K 提示 token 的長上下文層級為 $20 / $75;1.05M token 上下文,128K 最大輸出

• GPT-6.1 Sol — 每百萬個 token 為 $2 / $10,快取讀取為 $0.10;相同的長上下文分層定價為 $4 / $15;1.05M 個 token 上下文,128K 最大輸出

兩者都在 OrcaRouter 目錄中,而對於任何將這份發布視為能力訊號的人來說,這正是實際重點:你今天獲准使用的模型,也正是你的提示詞早已圍繞著形塑的模型,而它們與內部模型之間的落差,正是 OpenAI 請求數學家協助它縮小的落差。

這個落差也正是把實驗支出與正式生產路徑分開計算的理由。當 OpenAI 真的為這個模型定名並定價時,第一週將會湧入大量未經證實的基準測試說法,以及許多驚慌失措的重新整合工作——對我們這類平台而言,路由這套論點在於:屆時想試用一個未經考驗的模型,代價只是一串模型字串,而不是一次遷移。GPT-6 Astra 的價格是每百萬個 token 10 美元/50 美元,GPT-6.1 Sol 則是 2 美元/10 美元,以定價原價轉嫁、0% 加成,因此供應商一調價,當天就即時生效。自動容錯移轉意味著新模型可以只承載一小部分流量,也能被撤下,而不會連帶拖垮整條請求路徑;而且路由 DSL 讓你能把多個模型組合成同一次呼叫,如果你想要的是一段冗長推導的第二個意見,而不是單一答案的話。這些都不適用於一個還沒推出的模型——但這正是你會希望在下一款模型推出之前就先備妥的東西。

Screenshot of the OrcaRouter model page for OpenAI GPT-6.1 Sol, showing a 1.05M-token context window, 128K max output, a base pricing tier of $2.00 per million input tokens and $10.00 per million output tokens with a $0.100 cache read and $2.50 cache write, a long-context tier above 272K prompt tokens at $4.00 / $15.00 with $0.200 cache read and $5.00 cache write, plus live performance and benchmark panels.

接下來要看什麼

四件事,按其可能重要的順序排列。形式化數量,因為它是這次發布中唯一能從「OpenAI 說」變成「機器檢查過了」的數字,而且它是公開的。針對某個具名結果的第一份真正獨立評估——一位 OpenAI 以外的數學家在公開場合鑽研某篇特定論文,而不是對整個合集的摘要。OpenAI 表示仍在探索的社群託管儲存庫,這會把該產物從 OpenAI 自己名下移出,交到該領域手中。以及模型本身的發布,OpenAI 已承諾會做,但尚未排定時程。

722 份手稿是否意味著 AI 已經解決了這些問題?

對於其中一部分而言,如果數學成立:這批合集宣稱在諸多知名未解問題上提出了反例與證明,而其中 162 篇論文的主要結果背後有可供機器檢查的形式化。至於其餘部分,其說法是某個模型針對該問題產出了一份文稿,這比已驗證的解答是較弱的陳述,而 OpenAI 自己也警告,未形式化的結果可能含有錯誤。「產出了證明」與「擁有證明」之間的區別,就是這次發布的全部重點。

這些當中有任何部分今天能用於產品中嗎?

不。那些文稿是 PDF、Lean 原始碼與推理摘要——是研究產物,不是服務。沒有模型 ID、沒有端點、沒有價格,也沒有存取申請表單。這次發布對開發者而言,實際有用的部分是確認 OpenAI 有一個正在訓練中、大幅超越 GPT-6 Astra 的模型;這是未來十二個月的規劃訊號,而不是你這週就能呼叫使用的東西。

為什麼 OpenAI 發布的是結果,而不是模型?

因為這兩者的風險概況不同。發表手稿是可逆的——OpenAI 會保留較早的版本,並表示會修正問題——但推出模型則不是。OpenAI 表示正努力以負責任的方式發布該模型,而該公司稱其借鑒的諮詢小組建議,正是圍繞著這個順序所建立:先透過引用與版本控管,把研究成果交到該領域人士手中,再為後續必須具備的人類理解提供資金。

給只是快速瀏覽的人的一行版總結:一批真正前所未見、由 AI 產出的數學成果在 10 月 6 日公開,其中約五分之一經過機器驗證,沒有任何一部分經過同儕審查,而且全都附屬於一個你無法使用的模型。真正有趣的問題不是這個模型有沒有能力——橫跨 4,000 道問題、每項結果耗費三小時的前沿思考運算,已經回答了這點,而 OpenAI 也表示這個模型的能力明顯強過 GPT-6 Astra——而是驗證與人類理解能否在下一版發布、讓這個模型過時之前追上。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新