
OpenAI Astra:關於這個非GPT-6模型我們所知的一切
- qwen新Qwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 每百萬 tokens · 56 tok/s
- deepseek新DeepSeek: DeepSeek V4 Flash 07312026-07-3150智能69程式
- qwen新Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens · 200 tok/s
- orca新OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropic新Anthropic: Claude Opus 52026-07-2461智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2150智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1651智能71程式
- kimiMoonshotAI: Kimi K32026-07-1557智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0951智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0955智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0959智能77程式
- grokxAI: Grok 4.52026-07-0854智能72程式
- tencentTencent: Hy32026-07-0641智能59程式
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42程式
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39程式
- anthropicAnthropic: Claude Sonnet 52026-06-3053智能72程式
- klingKling: Kling 3.0 Turbo2026-06-1757智能52程式57數學
- z-aiZ.ai: GLM 5.22026-06-1651智能69程式60數學
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242智能61程式61數學
你今天可以下載的東西不是一個模型。它是十個Lean代碼檔案。2026年8月1日,OpenAI發布了一篇關於數學的研究文章,其中埋藏著對其下一個前沿系統名稱的首次確認:Astra。沒有模型卡片、沒有定價頁面、沒有API端點,也沒有日期。你目前實際可以呼叫的旗艦模型仍然是GPT-5.6 Sol,每百萬輸入代幣5美元,每百萬輸出代幣30美元,自7月9日以來一直如此。
如果你搜尋過 GPT-6,以下是簡短版本:OpenAI 從未宣布過以此名稱命名的模型,且截至目前,它尚未決定 Astra 將以何種形式推出——是作為 GPT-6、作為 GPT-5 的小版本(如 GPT-5.7),還是作為與 Sol、Terra 和 Luna 並列的第四層級。這種命名模糊並非對媒體有所保留,而是一個內部尚未定論的問題,由 The Information 於 7 月 31 日報導,此後一直懸而未決。
以下將多數報導中混為一談的三件事區分開來:OpenAI 本身的聲明、可信報導所補充的內容,以及沒有任何來源便四處流傳的說法。那些證明是真實的、可以自行編譯的成品。10 兆參數這個數字,只是某個人在網路上打出來的一個數字。兩者理應受到截然不同的重視。
OpenAI 實際上說了什麼——以及它沒說的更長清單
這項公告並非以產品發佈的形式出現,而是以論文的形式出現。OpenAI 的貼文描述了由「Astra 的內部版本,我們的下一個主要模型」所產生的成果,這些成果涵蓋了在其框架下、主要結果至少十年未有進展的問題。Astra 被描述為一個為長期工作而建的系統:多個代理會長時間協調處理一個大型問題的不同部分,而非在一次執行中給出答案。
這幾乎就是完整的官方技術描述。與之對照,缺失清單令人矚目:
• 經 OpenAI 確認 — 名稱 Astra;它是「下一代主要模型」;內部版本產生十項結果;多智慧體、長期視野的設計意圖;一份 249 頁的手稿;公開儲存庫上的 Lean 4 憑證;以 GPT-5.6 Sol 費率估算的 token 成本。
• OpenAI 未說明 — 發布日期;價格;上下文視窗;參數量;任何基準評測分數;模型卡;是否已登上 ChatGPT 或僅限 API;有多少個代理程式運行、運行多久、使用什麼硬體;提示詞;成功率;最終產品名稱。
可靠報導補充了一些細節。The Information報導稱,山姆·奧特曼(Sam Altman)七月下旬在華盛頓向政策制定者展示了Astra——根據該報導,出席這場簡報的人包括參議員拉斐爾·沃諾克(Raphael Warnock)、伯尼·莫雷諾(Bernie Moreno)和馬克·華納(Mark Warner),財政部長斯科特·貝森特(Scott Bessent)與商務部長霍華德·盧特尼克(Howard Lutnick)也在場。該模型系列據稱已在測試中,而「Astra」本身仍只是暫定名稱。
OpenAI 以外沒有任何人在任何事物上運行過這個模型。所有流傳中的能力宣稱,皆可追溯至已發表的十份證明,或是一場公眾未曾目睹的示範。
十個證明:異常可檢驗,卻仍未定案

這就是這項公告確實比一般的基準測試發布更勝一籌的地方,而且值得精確說明原因。OpenAI 並非發布一個分數然後要求大家相信。它在 openai/ten-proofs 儲存庫中發布了可在機器上驗證的產物,採用 Apache 2.0 授權——每個結果對應一個 Lean 檔案,固定在 Lean 4.32.0 版本並依賴 mathlib,同時附有 ComparatorChallenges 目錄供獨立驗證。該儲存庫於 8 月 1 日以單一 commit 上線,至今已獲得數百顆星及數十個 fork。
這十個結果,正如儲存庫所命名的,涵蓋了異常廣泛的領域:
• 群論 — 非 sofic 群的構造,以否定方式回答了自 1999 年以來懸而未決的問題。sofic 性質是數學家研究的幾乎每個群都滿足的性質;是否每個可數離散群都必定滿足它,這個問題已懸置了 27 年。
• 算子代數 — 一個涉及康尼斯剛性猜想(由菲爾茲獎得主阿蘭·康尼斯於1980年提出)的反例。
• 高維幾何——對球體堆積方法的一項改進,據報是自1978年以來同類方法中的首例——以及Ehrhart體積不等式的一個精確形式。
• 編碼理論——二進制碼和球面碼的新界限。
• 複雜度 — 積和式的算術電路下界,以及糾纏遊戲的指數平行重複結果。
• 格密碼學 — 最近向量問題的固定多項式困難度。
• 極值組合學——多色三角形拉姆齊數的增長尺度,以及極值圖論中的反例,包括對若干已編錄的埃爾德什問題的研究。
數學家的反應是感興趣,而非不以為然。維護 Erdős 問題資料庫的 Thomas Bloom 稱這些結果為重大新聞,並將其評價高於五月提出的單位距離猜想反例。OpenAI 的 Noam Brown 從內部提供了有用的降溫:「可惜,還沒有千禧年大獎難題(目前為止)。」
Lean 證書解決了什麼,又留下什麼懸而未決
一個通過型別檢查的 Lean 證明,其有效性由構造本身保證。你不需要信任 OpenAI 的評測方法、其基線的選擇,或它對自身結果的詮釋——你可以直接編譯那些檔案。對於一個以「我們達到了 94.1% 的分數」作為標準證據單位的產業來說,這在可證偽性上是一次有意義的升級。
它也遠比標題所暗示的更為狹窄,具體體現在四個方面。Lean 檢查形式化陳述的證明是否健全有效。它不檢查形式化陳述是否就是文章所宣稱的定理。它不檢查編碼後的定義是否與學界對這些詞語的理解相符。它不檢查連接形式化端點與標題結果之間的非正式化約。而且它對新穎性——即某個結果是新的,還是已經以不同名稱為人所知——不置一詞。
這四者皆屬人為判斷的問題,截至公告發布時,沒有一項經過同儕審查。手稿承認曾諮詢專家;但致謝並不代表對每一項主張的背書。該儲存庫已發布的部分建置編譯了 9,007 個任務中的 8,820 個,這正是一項大型真實形式化工作在驗證中途的樣貌,而非完成審計的結果。今日誠實的現況是:十項嚴肅且經形式編碼的研究主張——而非十條已定案的數學經典條目。
還有第二個、較不顯眼的限制:發現過程無法由OpenAI以外的任何人重現。證明是公開的;搜尋系統、提示、檢查點與執行環境則不公開。你可以驗證目的地,卻無法重新走過這趟旅程。
2,000美元這個數字,以及為何它能買到的東西比聽起來少

流傳最廣的數字是成本。OpenAI 將十個解決方案背後的 token 花費定為約 2,000 美元,按 GPT-5.6 Sol 費率計算——按照其措辭最常見的解讀,大約每個十年未解難題 200 美元。有些報導將同一句話解讀為低於 2,000 美元每個問題,相差十倍;OpenAI 的貼文極其簡短,以致兩種解讀都見諸出版物,而我們尚未看到該公司澄清此事。
把整體數值拿來算一下。Sol 的收費是每百萬輸入 token 5 美元、每百萬輸出 token 30 美元,推理 token 則按輸出計費。假設花費全部用於輸出,2,000 美元最多可買約 6,700 萬個輸出 token——平均每個問題約 670 萬個。這是相當多的思考量,但還不到離譜的程度。這種預算規模,一個經費充足的研究團隊本就可以花在單一困難問題上。
三個注意事項比標題更重要:
• 這是一個反事實的價格,而非實際價格。Astra 尚未發布,也未定價。$2,000 描述的是那些代幣會以另一種模型的費率計算時的成本。一個為數小時多代理運行而建的前沿系統,沒有明顯理由要像 Sol 那樣定價,反而有充分理由定價高於它。
• 它只計算成功的案例。 官方並未公布成功率。我們無從得知Astra曾被指派多少問題而未能破解,也不知道這些嘗試耗費了多少成本。在未公布成功率的情況下,所謂的「每次成功成本」並不能視為「每次成果成本」,而兩者之間的差距,可能高達一個數量級,無論是偏高或偏低皆然。
• Token 是最便宜的部分。人類界定了問題、準備了手稿,並推動了形式化。這些勞動並不包含在那 2,000 美元之中。
這其中唯一能今天就定價的是基準部分。由於 OrcaRouter 以 0% 加成直接轉嫁供應商列表價格,GPT-5.6 Sol 在我們的 API 上的費用與在 OpenAI 上一樣是 $5/$30——所以如果你想針對自己的工作負載驗算這筆數字,公告中的費率就是你實際會支付的費率。目前還沒有人能為 Astra 本身定價,任何告訴你相反的供應商都只是在猜測。
發布日期是由30天的倒數計時器所決定,而不是由洩漏所決定。

大多數關於「GPT-6 何時發布」的報導都是謠言算術。有一個更具體的約束條件就明擺在眼前,但它幾乎沒有被聯繫到這個問題上。
2026年6月2日簽署的一項行政命令指示聯邦機構建立一個自願審查程序,前沿開發者須在公開發布前最多30天提交模型供政府審查。該框架原定於8月1日正式生效——也就是Astra貼文發布的同一天。報導指出,Astra預計將成為第一個通過該程序的模型。
「自願」這個詞在該句中承擔了一些分量。實際上,政府先前就曾在發布時機上施加壓力,而 OpenAI 自身的近期行為看起來像是一場預演:GPT-5.6 從 6 月 26 日起僅限約二十個經審查的組織使用,直到 7 月 9 日才開放廣泛存取——一場約兩週的分階段發布。
把這兩個事實疊加起來,你得到的是粗略的下限,而不是預測。如果Astra經歷30天的發布前審查,然後重複GPT-5.6的模式,那麼廣泛可用性大約在提交後六週落地。而提交日期正是我們所不知道的。這就是為什麼對八月日期的自信應被打折扣:門檻步驟是一個有公佈時長的過程,而時鐘尚未明顯開始計時。
預測市場已經完全朝那個方向偏移。截至2026年8月5日,Polymarket 的「GPT-6 released by」階梯顯示:8月7日為1%、8月14日為3%、8月21日為13%、8月31日為25%、9月30日為68%、12月31日為89%,交易量接近一百萬美元。請將此視為群眾的綜合猜測,而非來源——但請注意,群眾已將重心轉移至Q4。
這也有助於記住過去的紀錄。過去十二個月來,每一個「GPT-6 下週推出」的說法都是錯的。一個未經證實的洩漏消息將 2026 年 4 月 14 日定為發布日;實際上,九天之後發布的是 GPT-5.5。
謠言分級
按各項實際承載的重量排序:
• 命名尚未決定(GPT-6 / GPT-5.7 / 另一個獨立類別)。 消息來源為 The Information。這是本報導中最可靠的非 OpenAI 說法,也是應該藉以重新校準預期的關鍵——透過數學論文發表的系統,很可能根本不會被冠上世代躍進的名號。
• 代號「Zinc」和「Magnesium」在 Design Arena 現蹤。社群目擊,據報條目已停用,OpenAI 未證實。可解讀為:GPT-5.x 點版本的到來很可能早於 Astra,這滿足不了任何人對 GPT-6 的期待,同時也會佔據新聞週期。
• 規模約為 GPT-5.6 Sol 的 2 倍;定價接近 GPT-5.6 的範圍。 流傳中的傳聞。背後的爆料者承認並未實際測試過該模型。聽起來似乎合理,但完全沒有根據。
• 150 萬個 token 的上下文窗口。出現在洩漏彙整中,但沒有具名來源。值得注意的是,Sol 已經提供 105 萬個 token,因此這會是增量而非飛躍——這正是不該把它當作頭條「洩漏」來看待的原因。
• 大約10兆個參數。在我們能追查到的任何地方都找不到出處。這是整個故事中被引用最頻繁、卻最缺乏根據的數字。
• 記憶與個人化作為核心發展方向。依據奧特曼在2025年8月訪談中的公開發言——真實存在,但已是一年前的內容,且談的是GPT-5之後的整體方向,並非專門針對Astra。
從現在到它發布之間,實際上該做什麼
錯誤的作法,是為了一個連模型卡都沒有的模型而重新架構。正確的作法,是去注意長時程、多代理系統會改變你的哪些問題,因為那些正是你技術堆疊中目前建置不足的部分——無論 OpenAI 未來推出什麼都一樣。
其中三個現在值得針對 GPT-5.6 Sol 來打造:
• 每個任務的成本上限,而非每次調用。 如果單一作業可以運行數小時並花費六七百萬個輸出token,每次請求的限制就無法保護你。你需要的是整個任務繼承的預算,以及一個硬性停止。
• 檢查點與可恢復性。一次性呼叫要麼回傳,要麼失敗。一個執行數小時的代理程式執行序在90分鐘時中斷,卻沒有任何持久化寫入,這是大多數程式碼庫從未需要處理的高成本失敗類別。
• 在沒有參考答案的問題上,值得你信賴的評估。 這十個證明之所以有趣,部分原因是 Lean 提供了一個預言機。在實際生產環境中,幾乎沒有什麼能做到這一點。如果你無法區分一次良好的六小時運行和一次看似合理但實際上很糟的運行,更多的算力也幫不了你。
關於切換的問題:{{1}}Astra 並未在 OrcaRouter 上提供,因為它在任何地方都不可用。{{/1}}我們可以說的是,{{2}}版本更迭(version-churn)問題在我們這邊已大致解決。{{/2}}一個金鑰就能涵蓋 200 多個模型,因此{{3}}無論最終是以 GPT-6、GPT-5.7 或第四個 GPT-5.6 等級推出,採用它只是模型字串(model-string)的變更,而非遷移{{/3}}——不需要第二份合約,也不需要新的 SDK。而且,{{4}}具體而言,對於尚未經過驗證的前沿模型,自動容錯移轉(automatic failover)決定了你是在真實工作負載中評估它,還是把生產路徑押注在一個實驗室外無人做過壓力測試的系統上。{{/4}}你可以將一部分流量導向它,底層保留 Sol 作為備援,然後看看結果。
值得回答的問題
Astra 和 GPT-6 是一樣的東西嗎?
未必如此,而這正是這個故事中最關鍵的未知數。OpenAI 已確認 Astra 為其下一個主要模型,但尚未決定發布名稱;報導指出,GPT-6、GPT-5.7 以及一個獨立類別,與 Sol、Terra 和 Luna 一同被列入考量。完全有可能名為 GPT-6 的模型永遠不會出現,而眾人期待已久的能力躍進,將以一個沒有人在追蹤的名字到來。
我今天能以任何形式使用 Astra 嗎?
不——不在 ChatGPT 裡,也不透過 API、任何路由器或轉售商。公開存在的只有論文、推理逐步解說和 Lean 儲存庫。若某項服務聲稱提供 Astra 存取,那不是轉售其他東西,就是在說謊。這次發布目前真正有用的唯一做法,就是自己編譯那些證明。
Astra 真的解決了人類數學家無法解決的問題嗎?
它產出了對至少十年懸而未決之命題的形式化驗證證明,這是一項真實且非比尋常的成果——而且其驗證水準高於業界常態。但「經 Lean 檢查」並不等同於「經同儕審查」,而每個形式化陳述是否確實對應了標題所述問題,這個框架性問題恰恰是 Lean 無法回答的部分。閱讀過手稿的專家反應正面;但其中沒有任何一項經過審稿流程。預期在未來數月內,評估會逐步明朗,可能朝任一方向發展。
這2,000美元的金額是否意味著前沿研究現在變得很便宜了?
這意味著獲勝的 token 運行之所以便宜,是因為使用了另一種模型的價格,而且排除了失敗案例,也排除了人力成本。這三項排除每一項都可能影響巨大。誠實的解讀是:成功自動化證明搜尋的邊際成本已下降到足以令人關注的程度,而不是說十個開放性問題現在只需一台筆記型電腦的價格。
什麼才能真正解決這件事
三件具體的事情,沒有一件是謠言,而且發生時都可以查證。
一張模型卡和一個定價頁面。那是 Astra 不再是研究產物、而成為你可以據以規劃之物的時刻——也是命名問題自行化解的時刻。
由專家對 Lean 儲存庫進行獨立重建,這些專家會審查定義與非正式歸約,而不只是型別檢查。ComparatorChallenges 目錄暗示 OpenAI 預期如此。如果形式化陳述經得起這種審查,結果就很難被推翻;如果十個之中哪怕只有一個出現不一致,整個集合中的每一項主張都會被重新檢視。
聯邦審查時鐘已開始計時的證據。在 30 天的發行前窗口期內,該提交是發布日期最早且最可靠的訊號——遠比競技場排行榜中禁用條目的下一張截圖更具資訊價值。
在那之前,準確的陳述是狹窄且值得堅持的:OpenAI 的下一代旗艦只有一個名稱、十個可機器驗證的證明、一場華盛頓示範,如此而已。任何給你一個日期的人都是在猜測,任何給你一個參數數量的人都是在編造。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
