
Claude Opus 5.5 對決 GPT-6 Astra:6 美元的差距,以及 Astra 在 272K 以上加收的第二筆價格
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1323 tok/s
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
兩家廠商本月都為自家的旗艦機型發布了基準測試表,每一份都顯示自家模型勝出,而兩份表格中都沒有任何一列是讓兩個模型同場較勁的。Claude Opus 5.5於 2026 年 9 月 22 日推出,每百萬輸入 token 收費 4 美元,而GPT-6 Astra於 2026 年 9 月 3 日推出,每百萬輸入 token 收費 10 美元,兩者之間恰好只有兩項基準測試重疊——而且各勝一項,在 Anthropic 的表格中由 Opus 5.5 拿下 AutomationBench 類的工作項目,在 OpenAI 的表格中則由 Astra 拿下,而 Astra 在科學推理方面於兩份表格中都明顯領先。這就是廠商資料所能告訴你的事。獨立評測的結果則不那麼模稜兩可,而且指向相反的方向,至於價格方面的落差,比這兩者都更加懸殊。
各方發表了什麼
Anthropic 針對 Opus 5.5 的表格採用其自家測試框架與自家的 effort 設定,而其中列出 Astra 的數字是 Anthropic 的數據,並非重新執行所得。請將整組資料視為廠商自行提報:
• Terminal-Bench 4.0 — Claude Opus 5.5 66.4% 對上 GPT-6 Astra 57.9%(Anthropic 指出 Opus 那次的執行使用了 xhigh 努力程度)
• FrontierCode v1.1 — Claude Opus 5.5 54.4% 對比 GPT-6 Astra 53.3%
• GDPval-AA v2.1,知識工作 — Claude Opus 5.5 1,846 Elo 對 GPT-6 Astra 1,542
• AutomationBench — Claude Opus 5.5 40.0% 對 GPT-6 Astra 41.4%(Astra 領先)
• Terminal-Bench-Science 0.1 — Claude Opus 5.5 58.7% 對比 GPT-6 Astra 64.6%(Astra 領先)
• 人類最後的考試,使用工具 — Claude Opus 5.5 67.7% 對上 GPT-6 Astra 57.2%
OpenAI 這一邊較難對齊,因為 OpenAI 發表 Astra 時,拿來對比的是自家前代模型,而不是 Anthropic 的旗艦模型;而且它選擇的基準測試——電腦操作、前端工程、一般知識——大多根本沒出現在 Anthropic 的表格中。這並非不誠實,而是正常的發表做法,也正因如此,用兩份廠商表格拼出來的比較,是兩種挑選結果的比較,而不是兩個模型的比較。兩份表格唯一一致的點是:Astra 在代理式科學與電腦操作上很強,而且兩個模型在程式設計上足夠接近,接近到測試框架的選擇就可能改變結果。
獨立解讀,兩家供應商皆未選擇

Artificial Analysis 以同一套公開配置執行每一個模型,因此其數字是這裡唯一由相同評估者在相同條件下所產生的:
• 智慧指數 — Claude Opus 5.5 58,於 210 個中排名第 1,對比 GPT-6 Astra 53,排名第 6
• 設定標籤 — Claude Opus 5.5「自適應推理、最高投入、預設後備」,GPT-6 Astra「max」
• 輸出速度 — GPT-6 Astra 每秒 52.5 個 token,在其價格帶中處於偏低水準;相較於尚未發布的 Claude Opus 5.5
• 首個 Token 時間 — GPT-6 Astra 352.15 秒,對比排行榜中位數 3.83 秒;Claude Opus 5.5 尚未公布
• 價格 — Claude Opus 5.5 每百萬 $4.00 輸入 / $20.00 輸出,對比 GPT-6 Astra $10.00 / $50.00
• 上下文與輸出 — GPT-6 Astra 的 1M 上下文與 128K 最大輸出,對比 Claude Opus 5.5 的 1M 與 128K
五分的指數差距本身並不具決定性,也不該被解讀為決定性——兩個模型落在同一個能力區間,而這正是本季「前沿」的定義。Astra 那幾列真正確立的是:這個較高價位並沒有在兩個模型都出現的那個榜單上買到能力領先。延遲那一列則是坦白存在的難題:首個 token 要 352 秒,大幅高於這組中的其他項目,不過這是在最大努力設定下測得的,而一個先思考再輸出的推理模型,用這項指標來衡量永遠會顯得慢。52.5 tokens/秒 這個數字則更具通用性,而對一個定價 $10/$50 的模型而言,這屬於偏低的一側。
Astra 的第二個價格,高於 272,000 枚代幣

價目表是這兩者完全無法相比的地方,因為 Astra 的定價有一個級距。標準費率為每百萬個 token:輸入 $10.00、快取輸入 $1.00、快取寫入 $12.50、輸出 $50.00。然而,一旦超過 272,000 個輸入 token,整個請求就會重新計價——不是只有超出部分,而是整通呼叫——輸入與快取費率變成 2 倍,輸出變成 1.5 倍。這使得長上下文工作的價格大約落在每百萬個 token:輸入 $20、輸出 $75。
Claude Opus 5.5 並不會這麼做。Anthropic 以標準定價收取 $4.00 和 $20.00,並提供完整的 1M token 視窗,且明確表示 900K token 的請求,其每 token 計費費率與 9K token 的請求相同。因此,這兩者之間最顯眼的比率——Astra 在雙向成本上都是 Opus 5.5 的 2.5 倍——並非適用於這兩款模型實際銷售所對應工作負載的比率。在承載龐大工作上下文的長時程代理上,比較是 $20/$75 對上 $4/$20,也就是輸入相差五倍、輸出相差近四倍。批次定價只會加劇而非解決這個問題:Opus 5.5 減半至 $2.00/$10.00,而 Astra 的彈性層級則在長情境情況下、原本就已高出五倍的基準上,減半至 $5.00/$25.00。
這是這場對決中唯一與決策最相關的不對稱,而且在兩家公司各自的發布表格中都看不出來,因為兩家供應商都只報主打費率。如果你的提示低於 272K token,可以忽略這點。如果你正在打造一個會讀取儲存庫或文件集的代理,在你比較任何東西之前,先以 $20/$75 來計價。
存取是規格的一部分
Astra 是 OpenAI 首個在公司自家 Preparedness Framework 下跨越「關鍵網路安全能力」門檻的模型,而這次的發布反映的是該分級,而非產能。存取權一開始只開放給少數組織,企業存取需要管理員先開啟,使用者才看得到,而出貨的模型會直接拒絕某些類別的工作。Claude Opus 5.5 則從另一個方向帶著同一問題的某種版本登場:它出貨時搭載的是 Anthropic 先前保留給 Claude Fable 5.1 的防護層級,這意味著大多數網路安全請求會被重新導向至 Claude Opus 4.8,而生物學相關工作則會退回由 Claude Opus 5 處理,除非帳號已通過驗證。
這兩種行為都會出現在同一個地方,也就是你的評估。Artificial Analysis 將 Opus 5.5 的設定標記為「Default Fallback」,正是因為請求可能會落在與你指定不同的模型上,而在安全性或生命科學的提示中,這種情況經常發生。如果你的工作負載屬於這些領域,請求中的模型字串並不保證實際回答的模型,而你的品質數據將會在未知比例的呼叫中包含較小的模型。兩家供應商都沒有隱瞞這一點——兩者都有記載——但兩者的標題也都沒有提及。
在它們之間做選擇
這場對決真正拋出的抉擇是:長上下文工作負載是否值得 Astra 的階梯式定價;而對多數團隊來說,答案會是否定的:Opus 5.5 在 272K 以下的每一項都更便宜,超過之後更是便宜得多,在唯一一個獨立榜單上得分更高,而且能達到 100 萬個 token 的上下文,不必額外付費。Astra 的立論更狹窄但真實——科學推理、電腦操作,以及 OpenAI 生態系的工具——如果你的評估顯示它在這些方面勝出,那筆溢價就只是一項支出明細,而不是錯誤。
這件事真正變得實用的地方,在於你要如何讓這兩個模型互相對照,因為公平的比較需要兩個模型使用同一把金鑰、同一份帳單。兩者都能透過 OrcaRouter,以供應商定價、零加成的方式進行路由——Claude Opus 5.5 依 Anthropic 的 $4.00/$20.00 計價,GPT-6 Astra 則是 $10.00/$50.00——這意味著 272K 的抉擇可以直接在你的實際流量上測試,而不是靠兩份新聞稿來爭論。把 Astra 固定在它勝出的任務類別,並讓automatic failover接手其餘的部分,這是一條路由規則;而跨越 272K 這條線的請求,可以在不需修改程式碼的情況下改走更便宜的路徑,因為規則存在於路由器中,而不是你的應用程式裡。

什麼會改變答案?
有一件事可以辦到:在共同基準上、以相稱投入程度進行的受控正面對決。兩家廠商都沒有發表過這樣的結果,也都沒有動機這麼做,這使得獨立指數成為唯一可取得的同條件比較——而該指數顯示,Opus 5.5 領先 Astra 五分、五個名次,token 價格卻不到一半。值得留意的反駁論點是:兩個模型都是在最高投入程度下評分,而 Opus 5.5 出貨時預設為中等。若 Astra 在長程科學工作上的優勢能在相同投入的測試中依然成立,那麼支持其較高定價的理由只會更強,而非更弱。在有人實際跑過之前,站得住腳的立場是:Astra 是依通才價格定價的專才,而 Opus 5.5 則是恰好得分較高的通才。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
