
OpenAI 的 722 份數學手稿:其背後的模型沒有名稱、沒有價格,也沒有 API
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
2026年10月6日協調世界時21:47,一個名為 openai/math 的儲存庫出現在 GitHub 上,沒有任何說明,只有一次初始提交。十四分鐘後,OpenAI 將它發布到 X,並架設了一個配套頁面「分享數學領域的 AI 進展」。這兩件事合起來,描述了一個前所未有的事件:722 篇數學手稿,分成 372 個家族,由一個 OpenAI 尚未命名、尚未定價、也無法從任何 API 呼叫的內部前沿模型所產出。它所位居其上的那些模型,才是你今天真正能觸及的——每百萬個符元 $10 / $50 的 GPT-6 Astra,以及每百萬個符元 $2 / $10 的 GPT-6.1 Sol——而這兩者都沒有寫出這些論文。OpenAI 表示,真正寫出這些論文的模型仍在訓練中,而他們正著手「負責任地發布」它。以下是目前已獲證實的內容、尚未獲證實的部分,以及讀者應該從中帶走的一個問題。
先從這份發布不是什麼開始。它不是模型發布:沒有模型卡、沒有識別碼、沒有上下文視窗、沒有基準測試表、沒有日期。它不是論文:這裡沒有任何內容經過同儕審查,而 OpenAI 明言,未經 Lean 形式化的結果「可能會有問題」。而且它不是外洩——這篇文章會以「目前所知」的框架來寫,原因不是這些材料是祕密的,而是其主體本身,也就是那個模型,尚未發布。以下其餘所有內容都可以對照該儲存庫、OpenAI 自己的貼文,以及 OpenAI 表示曾諮詢過的諮詢小組來查核。
10月6日實際著陸的究竟是什麼?
該儲存庫是公開的,採用 Apache-2.0 授權,並以 Lean 撰寫。其 README 指出,該目錄「收錄 722 篇手稿,分為 372 個家族」,其中一個家族會將一項主要結果與伴隨論證、推論或替代證明歸為一組。這份手稿圖譜詳細到足以稽核:372 個家族各自都有一項主要結果,並列出其組成論文,且在可取得時附上 Lean 形式化連結。
OpenAI 的貼文補充了溯源數據,而這些數據是它自家提供、未經獨立審計的:
• 提出的題目 — 約 4,000 道,已發布的題組即從中選出
• 每項結果的運算量——平均相當於約三小時的 ChatGPT Pro 思考
• 推理摘要 — 已發布 10 份,涵蓋多個問題族,包括 π 的無理性指數、對稱與一般 Mahler 猜想、特徵二中的 Kaplansky 直接有限性猜想、稀釋自旋玻璃的 Mézard–Parisi 公式,以及三維相對論性 Vlasov–Maxwell 系統
• 修訂政策——修正內容會發布新版本,並保留先前版本供查閱
主題橫跨整個版圖:數論、代數幾何與複幾何、組合學、理論計算機科學、算子代數、機率與數學物理。這一系列中的某些標題表面上是非常宏大的主張——Ryser 覆蓋猜想的反例、整數乘法低於 n log n、指數至多為 9/4 的矩陣乘法、Mahler 猜想、Baum–Connes 與 Kadison–Kaplansky 的反例。某個特定主張是否成立,正是本次發布未替你解決的問題。

該模型尚未命名、尚未發布,而 OpenAI 表示它即將推出。
README 對作者的身分毫不含糊:「由 OpenAI 內部模型產出的數學手稿與輔助證明產物」,其中絕大多數是「使用一個尚未發布的 OpenAI 內部模型」取得。沒有名稱,沒有代號,也沒有規模。其他報導中流傳的名稱尚未獲得 OpenAI 確認,我們也不會提供任何名稱。
可確定日期的是圍繞這件事的時間線。2026年8月28日,根據OpenAI在其數學諮詢小組頁面上的說法,該公司「開始訓練一個新的內部模型」,該模型此後解決了納維–斯托克斯千禧年大獎難題,而且依OpenAI自己的統計,還解決了超過100個長期懸而未決的開放問題。納維–斯托克斯的結果於2026年9月8日另行公布,OpenAI在該處將背後的模型描述為「能力明顯強於GPT-6 Astra」,並表示訓練仍在進行中。本週文集中的兩篇手稿打破了標準程序,這值得注意,因為這意味著此次發布並非單一統一的流程:關於黎曼ζ函數無零區域的研究,以及CM阿貝爾簇的霍奇猜想證明,處理方式有所不同,而OpenAI表示,ζ函數那篇文稿為了可讀性而經人工編輯。
那麼,對任何以此為規劃依據的人來說,真正重要的一句話是:OpenAI 寫道,它正「努力以負責任的方式發布產出這些結果的模型」。那是意圖的表達,而非日期。在它正式推出之前,開發者能呼叫的 OpenAI 模型,就只有已經列在價目表上的那些。
「驗證」在這裡是什麼意思——以及它的界線在哪裡
這是大多數關於該發表的報導會濃縮成一句話的部分,而正是這個部分決定了該給任何單篇論文多大的權重。
OpenAI 明確表示,「這個合集包含處於不同驗證階段的結果。」這批資料中最強有力的證據形式是 Lean 形式化,它讓電腦而非人來檢查證明。該儲存庫自身的形式化清單——列出主要結果已形式化的論文目錄——共有 162 筆條目,因此 722 份手稿中約每五份就有一份,在公開樹狀目錄中有可由機器檢查的證明作為依據。OpenAI 表示,更多內容會「在我們取得後」陸續加入。
剩下的大多數並未以那種意義受到驗證,而 OpenAI 對於整份集合也不假裝不是如此:「有些未形式化的結果可能會有問題。我們會努力迅速修正任何這類問題。」兩個結構性細節強化了這是受控發布、而非開放發布——該儲存庫的 issues 功能已停用,而提取要求僅限協作者提出。沒有任何公開途徑可以就地挑戰某項證明。
所以,忠實的解讀比標題數字所暗示的更狹隘:
機器檢查 — 162 篇手稿,其主要結果已在公開的 Lean 樹中形式化
• 未經機器檢查——其餘部分,OpenAI 本身標示為可能包含錯誤
• 人類責任——未點名任何人;OpenAI 自身的說法是,沒有人理解所產出的大部分內容背後的論證
• 獨立評估——未發表任何此類評估;哪些結果「足夠顯著」而值得納入的選擇,是由 OpenAI 做出的
這一切都不代表這項工作是錯的。這代表的是,就目前而言,「OpenAI 發布了 722 個證明」和「722 個證明已被檢查」是不同的陳述,而今天只有第一項是真的。

顧問小組附加了一項條件,而且這已記錄在案。
OpenAI 的文章表示,它諮詢了高等研究院(Institute for Advanced Study)獨立的數學與人工智慧諮詢小組,並參考了「他們的建議與公開建議」。這些建議於 2026 年 9 月 29 日發布,此前該小組收到數學界超過 600 份回覆;這些建議值得直接閱讀,因為該小組並非橡皮圖章。
同一份文件開頭指出,該團體完全不認同這種做法:「一些前沿 AI 實驗室正在專有模型上測試高等數學問題,而這些模型仍不對更廣泛的科學社群開放……我們不認同這種做法,並要求他們停止。」該團體也自稱獨立運作,成員無償參與,且對 OpenAI 沒有決策權——OpenAI 自己的貼文也呼應了這種關係描述。
該小組的建議與本次發布相符之處在於流程:一份徹底爬梳的文獻回顧,並引用最初提出這些構想的研究;以標準格式撰寫的證明報告,而非模型原始輸出;以及能保留先前發布版本的版本管理。兩者不相符之處,在於該小組稱為核心的那個部分——一個發布了沒有人能理解之成果的實驗室,應該資助隨之而來的人類理解工作,透過工作坊、會議與計畫來進行,而且這項工作應由社群主導,而非由實驗室指揮。OpenAI 已承諾資助「一系列工作坊、會議與特別計畫,以理解 AI 產出的重大成果」,並表示細節將隨後公布。這就是尚未解決的項目,也是應該要求他們兌現的一項。
你今天可以呼叫什麼,以及路由在這裡實際上是做什麼用的
沒有辦法向產出這些手稿的模型送出請求,也沒有任何第三方平台能進行路由——任何聲稱並非如此的刊登內容,所描述的都是一個不存在於任何人型錄中的模型。正式上線的 OpenAI 模型是實際運作中的 GPT-6 系列,而其數字是列在價目表上,而不是推測出來的:
• GPT-6 Astra — 每百萬 token $10 / $50,快取讀取 $1;超過 272K 提示 token 的長上下文層級為 $20 / $75;1.05M token 上下文,128K 最大輸出
• GPT-6.1 Sol — 每百萬個 token 為 $2 / $10,快取讀取為 $0.10;相同的長上下文分層定價為 $4 / $15;1.05M 個 token 上下文,128K 最大輸出
兩者都在 OrcaRouter 目錄中,而對於任何將這份發布視為能力訊號的人來說,這正是實際重點:你今天獲准使用的模型,也正是你的提示詞早已圍繞著形塑的模型,而它們與內部模型之間的落差,正是 OpenAI 請求數學家協助它縮小的落差。
這個落差也正是把實驗支出與正式生產路徑分開計算的理由。當 OpenAI 真的為這個模型定名並定價時,第一週將會湧入大量未經證實的基準測試說法,以及許多驚慌失措的重新整合工作——對我們這類平台而言,路由這套論點在於:屆時想試用一個未經考驗的模型,代價只是一串模型字串,而不是一次遷移。GPT-6 Astra 的價格是每百萬個 token 10 美元/50 美元,GPT-6.1 Sol 則是 2 美元/10 美元,以定價原價轉嫁、0% 加成,因此供應商一調價,當天就即時生效。自動容錯移轉意味著新模型可以只承載一小部分流量,也能被撤下,而不會連帶拖垮整條請求路徑;而且路由 DSL 讓你能把多個模型組合成同一次呼叫,如果你想要的是一段冗長推導的第二個意見,而不是單一答案的話。這些都不適用於一個還沒推出的模型——但這正是你會希望在下一款模型推出之前就先備妥的東西。

接下來要看什麼
四件事,按其可能重要的順序排列。形式化數量,因為它是這次發布中唯一能從「OpenAI 說」變成「機器檢查過了」的數字,而且它是公開的。針對某個具名結果的第一份真正獨立評估——一位 OpenAI 以外的數學家在公開場合鑽研某篇特定論文,而不是對整個合集的摘要。OpenAI 表示仍在探索的社群託管儲存庫,這會把該產物從 OpenAI 自己名下移出,交到該領域手中。以及模型本身的發布,OpenAI 已承諾會做,但尚未排定時程。
722 份手稿是否意味著 AI 已經解決了這些問題?
對於其中一部分而言,如果數學成立:這批合集宣稱在諸多知名未解問題上提出了反例與證明,而其中 162 篇論文的主要結果背後有可供機器檢查的形式化。至於其餘部分,其說法是某個模型針對該問題產出了一份文稿,這比已驗證的解答是較弱的陳述,而 OpenAI 自己也警告,未形式化的結果可能含有錯誤。「產出了證明」與「擁有證明」之間的區別,就是這次發布的全部重點。
這些當中有任何部分今天能用於產品中嗎?
不。那些文稿是 PDF、Lean 原始碼與推理摘要——是研究產物,不是服務。沒有模型 ID、沒有端點、沒有價格,也沒有存取申請表單。這次發布對開發者而言,實際有用的部分是確認 OpenAI 有一個正在訓練中、大幅超越 GPT-6 Astra 的模型;這是未來十二個月的規劃訊號,而不是你這週就能呼叫使用的東西。
為什麼 OpenAI 發布的是結果,而不是模型?
因為這兩者的風險概況不同。發表手稿是可逆的——OpenAI 會保留較早的版本,並表示會修正問題——但推出模型則不是。OpenAI 表示正努力以負責任的方式發布該模型,而該公司稱其借鑒的諮詢小組建議,正是圍繞著這個順序所建立:先透過引用與版本控管,把研究成果交到該領域人士手中,再為後續必須具備的人類理解提供資金。
給只是快速瀏覽的人的一行版總結:一批真正前所未見、由 AI 產出的數學成果在 10 月 6 日公開,其中約五分之一經過機器驗證,沒有任何一部分經過同儕審查,而且全都附屬於一個你無法使用的模型。真正有趣的問題不是這個模型有沒有能力——橫跨 4,000 道問題、每項結果耗費三小時的前沿思考運算,已經回答了這點,而 OpenAI 也表示這個模型的能力明顯強過 GPT-6 Astra——而是驗證與人類理解能否在下一版發布、讓這個模型過時之前追上。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
