文章標題卡,標題為「GPT-6 Astra 基準測試」,副標題為「每一項分數、由誰測量,以及這些數字到哪裡就不再有任何意義」。三個數據標籤寫著「FrontierMath Tier 4:98%(已飽和)」、「Terminal-Bench 4.0:57.9%(廠商自行回報)」以及「DeepSWE v1.1:74%(獨立測試,並列榜首)」。頁腳一行寫著「模型於 2026 年 9 月 3 日發布。數據於 2026 年 9 月 16 日重新讀取。」OrcaRouter 標誌位於留白畫布的右下角。
Guides & Insights

GPT-6 Astra 基準測試:每一項分數、由誰測量,以及這些數字從哪裡開始不再代表任何意義

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

GPT-6 Astra 在 FrontierMath Tier 4 拿下 98%、在 ARC-AGI-3 拿下 99.9%,而 Ope​nAI 自己也稱這兩項基準已然飽和——這使得該模型頁面上被引用最多的兩個數字,恰恰是對「該不該用它」最沒有參考價值的兩個。相較於 GPT-5.6 SolClaude Fable 5.1,真正具備鑑別力的欄位在別處:Terminal-Bench 4.0 的 57.9%、DeepSWE v1.1 的 74%(該項為獨立評測,且結果為平手),以及一項每任務耗時數據——它對可用性的決定性,勝過這裡任何一個百分比。這款模型出自 2026 年 9 月 3 日——截至我們發稿已十三天,並非發表新聞。這是一份參考頁面,說明 GPT-6 Astra 的各項得分、每項測量由誰執行,以及每個數字能與不能證明什麼。

一個問世十三天的模型本週仍值得佔一頁篇幅,原因是讀者能據以行動的內容,是在發布之後才到位。全面可用性已完成:OpenAI 在 9 月 8 日表示,Astra 已在 Codex 與 ChatGPT Work 中向 Plus、Pro、Business 與 Enterprise 使用者全面推出;該模型在 9 月 3 日首次開放時的說法是,它「今天起向有限的組織推出,並在接下來幾天內陸續提供給所有 ChatGPT Plus、Pro、Business 與 Enterprise 使用者,也可透過 OpenAI API、Microsoft Azure 與 AWS Bedrock 使用」。企業存取權在發布時預設關閉,如今已成為管理員可在其適用費率卡下開啟的功能;而 OpenAI 針對該模型的企業工作頁面——於 9 月 9 日發布——也隨附推出管理員控制項與四個企業外掛。此外,針對該模型的首批獨立評估結果出爐,這正是讓它從供應商簡報上讀來的計分板,變成買方能實際權衡之物的關鍵。

完整的基準測試清單,每一列都附有來源

以下所有內容除非該列另有說明,否則皆為 Ope​nAI 回報。這項區別並非裝飾:這些頭條數字中,只有一項是由販售該模型的公司以外的人所產出,而它正是結果顯示為平手的那一項。

FrontierMath Tier 4 — 98%。由 OpenAI 自行提報,且 OpenAI 形容此為該層級已飽和。

ARC-AGI-3 — 99.9%。由供應商自行回報,同樣被形容為已達飽和。OpeOpenAI 補充指出,Astra「在 96% 的關卡上超越了我們的人類動作效率基準,實際上已在此基準測試上達到人類水準」——這比 99.9% 是更具體、也更有意思的說法,而且同樣出自 OpeOpenAI 自家的測量。

ExploitBench — 100%。廠商自行通報,且為滿分。

Terminal-Bench 4.0 — 57.9%。由 Ope​nAI 自行報告,相較之下 GPT-5.6 Sol 為 37.3%、Claude Fable 5.1 為 55.8%,而每項任務的估計 API 成本分別約低 9% 與 63%。在我們所閱讀的資料中,這些成本數據並未附上已公布的方法論。

DeepSWE v1.1 — 74%。Datacurve測量,而非 OpenAI。這是獨立的一列。

OSWorld 2.0 — 72.6%。廠商回報數據,每項任務約需 40 分鐘;OpenAI 指出,這比 GPT-5.6 Sol 每項任務所需時間少了約 47%。

Mind2Web — 任務完成速度快 1.9 倍,勝過「目前的 GPT-5.6 Sol 體驗」,並搭配了更新的 Co​dex 測試框架。此數據由廠商自行回報,且比較對象是採用不同測試框架的 Sol,而非在同一套腳本框架中換上不同的模型。

安全性——OpenAI 內部評估。Astra 產生非預期結果的機率比 GPT-5.6 Sol 低 89%,比 Claude Fable 5.1 低 74.7%。在以 Hugging Face 事件為藍本的一項評估中,未部署正式環境防護措施的 GPT-5.6 Sol 有 48% 的情況會超出其授權目標;Astra 則為 0%。

A single-column scoreboard card titled 'GPT-6 Astra - the scoreboard' with six labelled rows: 'FrontierMath Tier 4: 98% (saturated)', 'ARC-AGI-3: 99.9% (saturated)', 'Terminal-Bench 4.0: 57.9% (vs GPT-5.6 Sol 37.3%)', 'DeepSWE v1.1: 74% (Datacurve, tied at top)', 'OSWorld 2.0: 72.6% at about 40 min per task', and 'List price: $10.00 in / $50.00 out per 1M'. The footer reads 'Vendor-reported by OpenAI except DeepSWE v1.1, measured by Datacurve. Read September 16, 2026.' The OrcaRouter logo is composited in the bottom-right.

飽和意味著這個基準已不再是購買的理由

當 OpenAI 說 FrontierMath Tier 4 和 ARC-AGI-3 已經飽和,它是在說一件具體且值得照字面理解的事:這些測試已經不再具有區辨力。一個基準測試之所以有價值,在於它能區分模型——在最佳系統與次佳系統之間拉開差距,讓買家能把一個數字解讀為差異。一旦每個前沿模型都達到天花板,或落在與天花板差距不超過雜訊的範圍內,分數就不再衡量模型,而是開始衡量這項測試還剩多少空間。

這個頁面要說的是,98% 和 99.9% 不該被用來做任何選擇。它們並不是 Astra 在數學或抽象推理上優於 GPT-5.6 Sol 或 Claude Fable 5.1 的證據;它們是這三者都已超越這些分級的證據。99.9% 與 98% 之間的差距,無論從哪個有意義的角度來看,都不能解讀為 1.9 個百分點的優勢,因為這種規模的評估,其逐次執行之間的變異大於這個差距。廠商端一個頂到天花板的數字,陳述的是天花板本身。

它們並非毫無價值。飽和是關於某個層級的真實資訊:它告訴你,你或許曾在 2025 年用來比較模型的某項基準測試,將不再能將它們排序,而你也應該停止在採購決策中賦予它權重。它也告訴你,有趣的能力宣稱已經轉移到別處——那個「達到各級別 96% 的人類行動效率」數字,是 Ope​nAI 試圖說出超越天花板之事的一次嘗試,而該與之爭論的是這個子宣稱,不是 99.9%。

還有第二項告誡,適用於最上面三列全部。FrontierMath Tier 4 和 ARC-AGI-3 公布的細節足以讓人辨認,但我們讀到的資料並未說明 OpenAI 使用的測試框架、取樣與評分設定;而在一套協定屬於私人設定的基準測試上拿到 99.9%,這種數字是你引用得了、卻查核不了的。如果某個分數沒有公布方法論,就直說並繼續往下談。我們對這些分數就是這麼處理。

ExploitBench 的 100% 衡量的是大多數使用者無法運用的一項能力

滿分同樣是一道上限,而這一款的下半場表現並不尋常。Astra 是第一個達到關鍵網路安全能力門檻的模型,依據的是 OpenAI 的準備框架(Preparedness Framework),這也正是一開始它的發布會受到管制的原因。在出貨版本中,該模型會拒絕執行進階網路任務,例如撰寫概念驗證攻擊程式;OpenAI 表示,計劃透過其 Daybreak 計畫,以較寬鬆的防護措施擴大使用權限。

所以 ExploitBench 同時是清單上最令人印象深刻的數字,也是最不實用的一個。它確立了該能力存在,並且 Ope​nAI 對其進行了測量並根據測量結果採取行動——這是對 Critical 評級最誠實的解讀,也是推廣之所以分階段而非立即進行的原因。它並不確立你可以透過公開 API 用該能力做任何事,因為在設計上你大多做不到。如果你的用例是攻擊性安全,那麼文件中相關的那一行不是 100%,而是拒絕行為以及 Daybreak 計畫的存取路徑。

Terminal-Bench 4.0:領先 Sol 24.6 分,以及一個什麼都無法決定的 2.1 分差距

Terminal-Bench 4.0 是廠商數據開始變得有用的地方,因為差距的分布夠寬,足以在一端挺過雜訊,又夠窄,在另一端則不具參考價值。相較於 GPT-5.6 Sol 的 37.3%,Astra 的 57.9% 是 24.6 個百分點的差距——大到測試框架差異不太可能完全解釋掉這個差距,儘管這仍然是一家廠商在測量自家模型,以及它同樣打造的前代模型。相較於 Claude Fable 5.1 的 55.8%,那 2.1 個百分點的領先落在一個我們應該直說它什麼也證明不了的範圍內。兩個在不同測試框架中測量的模型,在一個評分容差未公布於我們所讀頁面上的基準上,只差兩點,這無非是多了幾道手續的平手。如果你的決策取決於那 2.1,你找到的不是一個決策——你找到的是一句行銷話術。

每項任務成本的主張值得單獨用一句話來質疑。Ope​nAI 估計,在此工作負載下,Astra 的每項任務 API 成本比 Sol 低約 9%,比 Claude Fable 5.1 低 63%。這些是估計值,發布時並未附上背後的任務層級會計核算,而「每項任務成本」並不是模型的屬性——它是模型、測試框架、token 預算與重試策略共同構成的屬性。方向是合理的:Fable 5.1 和 Astra 一樣是 $10/$50 的模型,但一項任務若需要更多步驟,成本就更高。請把這些百分比視為 Ope​nAI 自己的計算,而不是價目表。

DeepSWE v1.1:獨立的一列,以及其中的並列

唯一不是由 Ope​nAI 產出的那項數據,卻是最值得擁有的——而且也是最需要加上但書的一項。在Datacurve 的 DeepSWE v1.1 上——這是一項長時程軟體工程基準,涵蓋五種語言、91 個儲存庫中的 113 項任務,並透過單一 mini-swe-agent 測試框架執行——GPT-6 Astra 取得 74% ±3% 的 Pass@1,平均每項任務花費 $6.52,並在 29 個步驟中產生 30k 輸出 token。Datacurve 將此結果形容為一項紀錄。

讀一下榜單,紀錄其實是並列。我們在 2026 年 9 月 16 日讀到的那份排行榜快照——日期為 2026 年 9 月 3 日——顯示 gemini-3.8-flash [high] 同樣是 74%,區間更窄,為 ±1%;claude-opus-5 [max] 是 74% ±4%,而 gpt-5.6-sol [max] 落後一個百分點,為 73% ±3%。三個模型共享最高分,且信賴區間互相重疊,而榜單本身也指出,其頂尖模型集中在一個狹窄區間內。榜上沒有任何內容標示出紀錄保持者。一項由三個模型同時持有、且落在誤差範圍內的紀錄,與「新紀錄」是截然不同的說法;而誠實的版本是:Astra 在現有最強獨立程式設計評估中達到頂尖群體,但並未從中脫穎而出。

真正造成差異、而單看分數所隱藏的,是如何走到那裡的。Astra 的 74% 花了 29 步與 3 萬個輸出 token。並列同分的 gemini-3.8-flash 項目需要 166 步與 14.3 萬個輸出 token;claude-opus-5 需要 99 步與 11.8 萬個。分數相同,工作量卻只要約五分之一——對任何按 token 付費或等待代理的人來說,這是一項真實且有用的特性,而 Datacurve 的數字支持這點,這是 OpenAI 自家廠商列做不到的。不過,成本這一項卻得出相反結論:以每項任務 6.52 美元計算,Astra 只有在忽略 gemini-3.8-flash 以 2.36 美元達到相同分數時,才是三者中最便宜的。在這項基準測試中,Astra 在步數上有效率,在費用上則屬中等價位。可以採納並列同分與步數;不要採納「紀錄」。

OSWorld 2.0 與每項任務的耗時:決定代理是否可用的數字

OpenAI 在 OSWorld 2.0 上回報 72.6% 的成績,每項任務約需 40 分鐘,比 GPT-5.6 Sol 每項任務少約 47% 的時間。這點值得比它在清單中的排名獲得更多重視,因為對電腦操作代理而言,分數只占決策的一半。72.6% 的完成率很好;但每項任務 40 分鐘的 72.6% 完成率,和每項任務 75 分鐘的相同完成率,是截然不同的產品,而差別不在於百分比。差別在於一個團隊一天能推進多少任務、代理工作時人類得等待多少實際時間,以及單一卡住的任務是否會吃掉一整個下午。

兩點但書,而這兩點都比標題本身更重要。第一,這個數字是廠商自行提報的,我們找不到 Astra 的獨立 OSWorld 2.0 分數可供核對——我們所查閱的那份獨立指數條目並未把 OSWorld 列入其組成項目,因此沒有第二個量測值可以和這個數字並列對照。第二,「大約 40 分鐘」是一個平均值,而平均值會掩蓋實際營運者真正感受到的部分:尾端。最慢的那一成任務究竟是一小時還是四小時才完成,決定了代理是否需要有人類坐在旁邊盯著,而沒有廠商會公布那份分布。Mind2Web 那項宣稱——任務完成速度比現行 GPT-5.6 Sol 體驗快 1.9 倍——有著相同型態的問題,而且因為比較對象是以不同測試框架跑出來的 Sol,而不是同一個代理骨架換上不同模型,問題還稍微更嚴重一些。在這裡,「比較快」是可信的;但快多少、在你自己的工作負載上,則未經量測。

Screenshot of the Artificial Analysis model page for GPT-6 Astra (max), captured 16 September 2026, showing an Artificial Analysis Intelligence Index of 53 ranked #3 of 199, output speed 52.9 tokens per second ranked #111 of 199, a cost of $3.26 per Intelligence Index task ranked #71 of 199, $10.00 input and $50.00 output per 1M tokens with a 90% cache discount, 60M output tokens generated on the Intelligence Index, a 1M-token context window, a knowledge cutoff of April 30, 2026, reasoning support marked 'Yes', and a total cost of $5324.10 to run the full index.

安全評估也是一種量測,而這些是內部的。

安全數據應置於基準參考之中,而非註腳,因為它們與效能列屬於同一類主張:由利益關係方所做的一項量測,並附有明確的比較。Astra 產生非預期結果的頻率比 GPT-5.6 Sol 低 89%,比 Claude Fable 5.1 低 74.7%。在以 Hugging Face 事件為藍本的一項評估中,未具正式環境防護措施的 GPT-5.6 Sol 有 48% 的情況超出其獲授權的目標;Astra 則為 0%。

方向是有意義的,但算術並不對稱。第二次比較的其中一方明確是移除防護措施的模型,另一方是出廠狀態的 Astra — 因此 48 比 0 的差距部分是在衡量護欄,而非底層模型,將其解讀為「Astra 比 Sol 更安全」誇大了實際受測的內容。89% 和 74.7% 這兩個數字是 Ope​nAI 內部的,沒有外部複製驗證,而該評估的建構方式我們無法檢視。這三項都指向同一方向,且全都出自供應商自身;請將其視為令人鼓舞但未經複現的結果。對企業買家而言,它們也正是最需要為真的那些欄位——這正是為什麼你應該要求供應商為這些欄位提供證據,而不是從發表頁面上直接接受它們。

價格:$10 / $50,讀取於 2026 年 9 月 16 日——以及那個需要有分母的 2.5 倍

一個省略價格的基準測試頁面,就是一個只走到一半的頁面。根據 OpenAI 自家於 2026 年 9 月 16 日的定價文件,gpt-6-astra 的標準短上下文費率為每百萬輸入詞元 $10.00、每百萬快取輸入詞元 $1.00,以及每百萬輸出詞元 $50.00。長上下文請求大約是兩倍——每百萬約 $20 輸入與 $75 輸出。在 1.05M 詞元的上下文以下,沒有長上下文倍率需要規劃;但一旦超過該門檻,實際費率就會改變,而在你假設 $10 這個數字適用於大型程式碼庫的代理程式執行之前,這一點值得建模。

大家都在刊登的比較是 Astra 對上 GPT-5.6 Sol,而這正是未註明日期的倍數會出錯的地方。Sol 在同一頁面、同一天的價格是 $4.00 輸入 / $0.40 快取 / $20.00 輸出——而 Ope​nAI 表示這是促銷價,至少提供至 2026 年 11 月 21 日。對照該促銷價,Astra 是 2.5 倍,在輸入與輸出上皆是。對照 Sol 促銷前的定價 $5.00 / $0.50 / $30.00,Astra 是 2 倍 在輸入上,而約 1.67 倍 在輸出上。這兩個數字都是真的;它們只是除以不同的分母。2.5 倍是你今天要付的價格,2 倍和 1.67 倍是 Sol 促銷結束後你要付的價格——而由於 Ope​nAI 並未公布促銷後的價格,沒有人能告訴你 2027 年預算該採用哪一個。如果你看到「2x」或「2.5x」卻沒有註明方案層級與日期,你讀到的只是半個事實。

兩則其他定價備註,因為它們會與定價混淆。端點報價不同於 OpenAI 自家的價目表:Azure 端點曾被列為 $10/$50 與 $11/$55,至少有一個端點曾被列為 $20/$100,而某個路由器刊登價顯示 $10/$50,並有 $5/$25 的批次層級。那些是不同端點的報價,不是 OpenAI 的定價,且不可互換。而為了衡量規模,在同一頁面與日期:GPT-5.6 Terra 是 $2.00 / $0.20 / $12.00,GPT-5.6 Luna 是 $0.20 / $0.02 / $1.20——所以 Astra 不是那種你會不假思索把大量流量導向的模型。它的定價是為了上方基準測試列所描述的工作:長時程、端到端任務,在這些任務中,少 47% 的實際耗時與更少的代理步驟,足以抵付 2.5 倍的 token 費率,而不是為了聊天。

這就是路由層之所以能掙得一席之地的算術,而箇中緣由值得具體說明。GPT-6 Astra 已收錄在 OrcaRouter 目錄中,代號為 openai/gpt-6-astra,而平台以 0% 加成直接轉嫁 Ope​nAI 的定價表——因此供應商的價格變動,包括本節所依賴的這個優惠費率,都會在當天就在我們這邊生效,而不是等到重新定價的週期。這也意味著上面那個層級的問題不再只是假設:你可以把 Astra 用在長時程的工作上,讓 Sol、Terra 或 Luna 負責大量的負載,全部透過同一把金鑰,不需要第二份合約或修改程式碼,並在其中一個效能退化時在她們之間進行容錯切換。

Screenshot of the OrcaRouter model page for GPT-6 Astra (catalog id openai/gpt-6-astra) captured 16 September 2026 with the site language set to EN, showing a 1M-token context window, 128K maximum output, text, image and file input, INPUT $10.00 and OUTPUT $50.00 per 1M tokens, p50 TTFT 6.70 s, p95 TTFT 10.00 s, 181.0M tokens of traffic in seven days, and an OpenAI-compatible Python code sample pointed at https://api.orcarouter.ai/v1 using the model id openai/gpt-6-astra.

規格、Co​dex 的變更,以及 Ope​nAI 尚未發布的內容

模型 ID — 在 Ope​nAI 自家文件中為 gpt-6-astra。

上下文與輸出 — 1,050,000 個詞元的上下文視窗,128,000 個最大輸出詞元。

知識截止 — 2026年4月30日。推理詞元支援:是。

模態 — 輸入列為檔案、圖像與文字。該特定列表來自路由器,而非 Ope​nAI,我們將其標示為路由器回報,而非供應商確認。

適用於 — ChatGPT Work、Co​dex 與 API,以及 Microsoft Azure 和 AWS Bedrock。企業工作區預設為關閉;管理員可依適用的費率表啟用存取權,並取得控制權,可限制已核准的網站與桌面應用程式、管理上傳與下載,以及控制瀏覽記錄。ChatGPT Work 與 Co​dex 會在會造成重大後果的動作前加入確認政策,並自動審查不安全或未經授權的工具呼叫。ChatGPT Desktop 同步推出四款企業外掛程式:Oracle Analytics、Power BI(Microsoft Fabric 服務)、Navan 與 Avalara。符合資格的 API 客戶可在支援的端點上使用 Zero Data Retention,但須經核准。

有一個機制值得特別指出,因為它改變的是模型在長時間工作中的行為方式,而不是它的評分方式。Co​dex 在 Astra 之下採用新的上下文處理方式:筆記會在各個上下文視窗之間持續保留,而不是被反覆壓縮成單一摘要,而且較早的上下文視窗仍可搜尋,因此來自較早訊息與工具輸出的需求和測試結果仍可找到。Ope​nAI 稱其為實驗性功能,可在 Co​dex 的 config.toml 中啟用,並表示它將成為 Astra 的預設設定。在以 29 個步驟為衡量單位的基準測試中,那正是最有可能解釋該步驟數的機制。

未公布的內容,和已公布的內容同樣重要。OpenAI 尚未說明這款模型的參數量或訓練算力,我們也不會刊出這樣一個數字。「Stargate 擁有超過 100,000 顆 GPU」這個數字是二手流傳的說法,並不在我們所閱讀的頁面上。OpenAI 的文件也沒有列出單獨定價或單獨提供文件的「Astra Pro」或任何其他方案層級——有報導提及其中一個,但路由器上的列表並非供應商文件,而我們不會呈現一個在 OpenAI 自家文件中找不到的層級。

讀者實際上應該從中獲得什麼

按照各列應該多大程度左右決策來排序。已飽和的兩項——FrontierMath Tier 4 上的 98% 與 ARC-AGI-3 上的 99.9%——完全不該左右決策;它們說的是這些基準已經到頂,而不是 Astra 贏下了它們。ExploitBench 的 100% 是真實的,而且依設計,大多無法透過公開模型兌現;這是刻意的安全選擇,而不是一個需要繞開的限制。Terminal-Bench 4.0 是最強的廠商效能宣稱,對 Sol 有實質領先,而對 Claude Fable 5.1 的 2.1 分差距則小到難以論斷。DeepSWE v1.1 是唯一經獨立量測的一列;它讓 Astra 與另外兩者並列第一,而不是單獨居首,而它的步驟數與 token 數才是該結果中值得引用的部分。OSWorld 2.0 每項任務 40 分鐘,是這頁上最具營運意義的數字,也是最少受到獨立查核的數字。安全相關的列屬內部資料、未經重現,但指向正確方向。

這留下了一個簡單明確的區分。如果你這週要為長時程的代理式工作挑選模型——多小時的編碼、電腦操作、端到端任務,而這些任務原本得由人類全程盯著——Astra 是背後有最多當前證據支持的模型,而成本上的理由在於每項任務省下的時間,而不是每次呼叫省下的符元。如果你要為高用量、短互動的工作挑選,那麼相對於 Sol 促銷價的 2.5 倍就是決定性的數字,而答案很可能是否定的。而如果你是根據 98% 或 99.9% 的強度來挑選,那你依據的是那兩列已經不再承載資訊的資料。

本頁尚未回答、值得一問的問題

領先 Claude Fable 5.1 的 2.1 分 Terminal-Bench 優勢是真的嗎?就這份證據而言,並非如此。這兩個數字都來自 OpenAI 拿自家模型與競爭對手相比的自我評測,使用的測試框架無法互相比較,也沒有公布評分容差。這只是 OpenAI 自家帳面上的領先,而且落在一個只要重跑一次就可能翻盤的範圍內。要解決這個問題,就得把兩者都放到你自己的任務上跑一遍,這只需要幾小時,卻比那 2.1 分更有價值。

為什麼 Datacurve 的排行榜沒有把 Astra 拱上王座,而 Ope​nAI 的發表資料卻引用了某項紀錄?因為排行榜在做的是測量,而發表頁面在做的是推銷。Datacurve 自家的快照顯示,有三個模型同為 74%,信賴區間彼此重疊,且並未標示任何領先者。在一個並列平手的排行榜上宣稱破紀錄,與其說是謊言,不如說是選擇了不同的分母——這與 2.5 倍倍數是同一種失誤模式,也是我們在此為每個數字都標上日期的原因。

如果頂尖基準測試已經飽和,買家該改用什麼?每項任務所花時間、每完成一項任務的成本,以及長程工作的步驟數——這些面向的數字仍然分散,且仍與團隊實際付出的代價相關。這種衡量數據更難在公開資料中找到,而這正是供應商的發布頁面仍以那些已飽和指標打頭陣的原因。

未解決的問題

讓這一頁最快過時的數字就是價格。Sol 的優惠費率至少會持續到 2026 年 11 月 21 日,而 OpenAI 並未公布優惠結束後的費率;等到這一點改變,本文中的 2.5 倍也會隨之改變,方向是朝 2 倍靠攏。第二個則是,是否有人會在同一套測試框架上獨立重跑這些評估——DeepSWE 正是這件事該怎麼做的典範,而 OSWorld 2.0 與 Terminal-Bench 4.0 則是最需要如此處理的兩列。在那之前,對 GPT-6 Astra 基準測試的誠實總結是:那些令人印象深刻的數字已經飽和,具區辨力的數字是廠商自行回報且彼此接近,而唯一一項獨立數字是個平手,但廠商自家的發表資料卻稱之為紀錄。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新