一張為 Claude Opus 5.5 對決 GPT-6 Astra 生成的標題卡,副標題為「六美元的差距,以及超過 272,000 個符元後的附加費」,搭配扁平的的天秤圖示,頁腳文字寫著「指數依 Artificial Analysis 於最大努力下的數據;價格依各供應商公布。」真正的 OrcaRouter 標誌合成於右下角。
Guides & Insights

Claude Opus 5.5 對決 GPT-6 Astra:6 美元的差距,以及 Astra 在 272K 以上加收的第二筆價格

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

兩家廠商本月都為自家的旗艦機型發布了基準測試表,每一份都顯示自家模型勝出,而兩份表格中都沒有任何一列是讓兩個模型同場較勁的。Claude Opus 5.5於 2026 年 9 月 22 日推出,每百萬輸入 token 收費 4 美元,而GPT-6 Astra於 2026 年 9 月 3 日推出,每百萬輸入 token 收費 10 美元,兩者之間恰好只有兩項基準測試重疊——而且各勝一項,在 Ant​hropic 的表格中由 Opus 5.5 拿下 AutomationBench 類的工作項目,在 Open​AI 的表格中則由 Astra 拿下,而 Astra 在科學推理方面於兩份表格中都明顯領先。這就是廠商資料所能告訴你的事。獨立評測的結果則不那麼模稜兩可,而且指向相反的方向,至於價格方面的落差,比這兩者都更加懸殊。

各方發表了什麼

Anthropic 針對 Opus 5.5 的表格採用其自家測試框架與自家的 effort 設定,而其中列出 Astra 的數字是 Anthropic 的數據,並非重新執行所得。請將整組資料視為廠商自行提報:

• Terminal-Bench 4.0 — Claude Opus 5.5 66.4% 對上 GPT-6 Astra 57.9%(Anthropic 指出 Opus 那次的執行使用了 xhigh 努力程度)

• FrontierCode v1.1 — Claude Opus 5.5 54.4% 對比 GPT-6 Astra 53.3%

• GDPval-AA v2.1,知識工作 — Claude Opus 5.5 1,846 Elo 對 GPT-6 Astra 1,542

• AutomationBench — Claude Opus 5.5 40.0% 對 GPT-6 Astra 41.4%(Astra 領先)

• Terminal-Bench-Science 0.1 — Claude Opus 5.5 58.7% 對比 GPT-6 Astra 64.6%(Astra 領先)

• 人類最後的考試,使用工具 — Claude Opus 5.5 67.7% 對上 GPT-6 Astra 57.2%

OpenAI 這一邊較難對齊,因為 OpenAI 發表 Astra 時,拿來對比的是自家前代模型,而不是 Anthropic 的旗艦模型;而且它選擇的基準測試——電腦操作、前端工程、一般知識——大多根本沒出現在 Anthropic 的表格中。這並非不誠實,而是正常的發表做法,也正因如此,用兩份廠商表格拼出來的比較,是兩種挑選結果的比較,而不是兩個模型的比較。兩份表格唯一一致的點是:Astra 在代理式科學與電腦操作上很強,而且兩個模型在程式設計上足夠接近,接近到測試框架的選擇就可能改變結果。

獨立解讀,兩家供應商皆未選擇

A two-column scoreboard comparing Claude Opus 5.5 and GPT-6 Astra across six shared rows: Intelligence Index (58, ranked #1 of 210, against 53, ranked #6), price in and out ($4.00 / $20.00 per million against $10.00 / $50.00), long-context surcharge (none against 2x input and 1.5x output above 272K), context window (1M tokens on both), output speed (not yet published against 52.5 tokens per second) and time to first token (not yet published against 352.15s). The footer reads 'Index, speed and latency figures per Artificial Analysis; prices and the 272K step per the vendors.'

Artificial Analysis 以同一套公開配置執行每一個模型,因此其數字是這裡唯一由相同評估者在相同條件下所產生的:

• 智慧指數 — Claude Opus 5.5 58,於 210 個中排名第 1,對比 GPT-6 Astra 53,排名第 6

• 設定標籤 — Claude Opus 5.5「自適應推理、最高投入、預設後備」,GPT-6 Astra「max」

• 輸出速度 — GPT-6 Astra 每秒 52.5 個 token,在其價格帶中處於偏低水準;相較於尚未發布的 Claude Opus 5.5

• 首個 Token 時間 — GPT-6 Astra 352.15 秒,對比排行榜中位數 3.83 秒;Claude Opus 5.5 尚未公布

• 價格 — Claude Opus 5.5 每百萬 $4.00 輸入 / $20.00 輸出,對比 GPT-6 Astra $10.00 / $50.00

• 上下文與輸出 — GPT-6 Astra 的 1M 上下文與 128K 最大輸出,對比 Claude Opus 5.5 的 1M 與 128K

五分的指數差距本身並不具決定性,也不該被解讀為決定性——兩個模型落在同一個能力區間,而這正是本季「前沿」的定義。Astra 那幾列真正確立的是:這個較高價位並沒有在兩個模型都出現的那個榜單上買到能力領先。延遲那一列則是坦白存在的難題:首個 token 要 352 秒,大幅高於這組中的其他項目,不過這是在最大努力設定下測得的,而一個先思考再輸出的推理模型,用這項指標來衡量永遠會顯得慢。52.5 tokens/秒 這個數字則更具通用性,而對一個定價 $10/$50 的模型而言,這屬於偏低的一側。

Astra 的第二個價格,高於 272,000 枚代幣

A generated graphic titled 'Where GPT-6 Astra's price steps', with a subtitle reading 'Crossing 272,000 input tokens reprices the whole call, not the excess.' Two panels compare per-million-token rates: below 272,000 input tokens Claude Opus 5.5 is $4.00 / $20.00 against GPT-6 Astra at $10.00 / $50.00, and above 272,000 input tokens Claude Opus 5.5 stays at $4.00 / $20.00 while GPT-6 Astra moves to approximately $20.00 / $75.00. The footer reads 'Per-million-token rates. Astra's step per OpenAI; Opus 5.5 bills its full 1M window at one rate per Anthropic.'

價目表是這兩者完全無法相比的地方,因為 Astra 的定價有一個級距。標準費率為每百萬個 token:輸入 $10.00、快取輸入 $1.00、快取寫入 $12.50、輸出 $50.00。然而,一旦超過 272,000 個輸入 token,整個請求就會重新計價——不是只有超出部分,而是整通呼叫——輸入與快取費率變成 2 倍,輸出變成 1.5 倍。這使得長上下文工作的價格大約落在每百萬個 token:輸入 $20、輸出 $75。

Claude Opus 5.5 並不會這麼做。Anthropic 以標準定價收取 $4.00 和 $20.00,並提供完整的 1M token 視窗,且明確表示 900K token 的請求,其每 token 計費費率與 9K token 的請求相同。因此,這兩者之間最顯眼的比率——Astra 在雙向成本上都是 Opus 5.5 的 2.5 倍——並非適用於這兩款模型實際銷售所對應工作負載的比率。在承載龐大工作上下文的長時程代理上,比較是 $20/$75 對上 $4/$20,也就是輸入相差五倍、輸出相差近四倍。批次定價只會加劇而非解決這個問題:Opus 5.5 減半至 $2.00/$10.00,而 Astra 的彈性層級則在長情境情況下、原本就已高出五倍的基準上,減半至 $5.00/$25.00。

這是這場對決中唯一與決策最相關的不對稱,而且在兩家公司各自的發布表格中都看不出來,因為兩家供應商都只報主打費率。如果你的提示低於 272K token,可以忽略這點。如果你正在打造一個會讀取儲存庫或文件集的代理,在你比較任何東西之前,先以 $20/$75 來計價。

存取是規格的一部分

Astra 是 OpenAI 首個在公司自家 Preparedness Framework 下跨越「關鍵網路安全能力」門檻的模型,而這次的發布反映的是該分級,而非產能。存取權一開始只開放給少數組織,企業存取需要管理員先開啟,使用者才看得到,而出貨的模型會直接拒絕某些類別的工作。Claude Opus 5.5 則從另一個方向帶著同一問題的某種版本登場:它出貨時搭載的是 Anthropic 先前保留給 Claude Fable 5.1 的防護層級,這意味著大多數網路安全請求會被重新導向至 Claude Opus 4.8,而生物學相關工作則會退回由 Claude Opus 5 處理,除非帳號已通過驗證。

這兩種行為都會出現在同一個地方,也就是你的評估。Artificial Analysis 將 Opus 5.5 的設定標記為「Default Fallback」,正是因為請求可能會落在與你指定不同的模型上,而在安全性或生命科學的提示中,這種情況經常發生。如果你的工作負載屬於這些領域,請求中的模型字串並不保證實際回答的模型,而你的品質數據將會在未知比例的呼叫中包含較小的模型。兩家供應商都沒有隱瞞這一點——兩者都有記載——但兩者的標題也都沒有提及。

在它們之間做選擇

這場對決真正拋出的抉擇是:長上下文工作負載是否值得 Astra 的階梯式定價;而對多數團隊來說,答案會是否定的:Opus 5.5 在 272K 以下的每一項都更便宜,超過之後更是便宜得多,在唯一一個獨立榜單上得分更高,而且能達到 100 萬個 token 的上下文,不必額外付費。Astra 的立論更狹窄但真實——科學推理、電腦操作,以及 OpenAI 生態系的工具——如果你的評估顯示它在這些方面勝出,那筆溢價就只是一項支出明細,而不是錯誤。

這件事真正變得實用的地方,在於你要如何讓這兩個模型互相對照,因為公平的比較需要兩個模型使用同一把金鑰、同一份帳單。兩者都能透過 OrcaRouter,以供應商定價、零加成的方式進行路由——Claude Opus 5.5 依 Anthropic 的 $4.00/$20.00 計價,GPT-6 Astra 則是 $10.00/$50.00——這意味著 272K 的抉擇可以直接在你的實際流量上測試,而不是靠兩份新聞稿來爭論。把 Astra 固定在它勝出的任務類別,並讓automatic failover接手其餘的部分,這是一條路由規則;而跨越 272K 這條線的請求,可以在不需修改程式碼的情況下改走更便宜的路徑,因為規則存在於路由器中,而不是你的應用程式裡。

A screenshot of OrcaRouter's own model page for openai/gpt-6-astra, headed 'GPT-6 Astra' and credited to OpenAI, showing a 1M-token context, 128K max output, a text, image and file input modality, and a stat strip reading INPUT $10.00 and OUTPUT $50.00 per 1M tokens with a 10.00s p50 time to first token and 298.0M tokens of traffic over 7 days.

什麼會改變答案?

有一件事可以辦到:在共同基準上、以相稱投入程度進行的受控正面對決。兩家廠商都沒有發表過這樣的結果,也都沒有動機這麼做,這使得獨立指數成為唯一可取得的同條件比較——而該指數顯示,Opus 5.5 領先 Astra 五分、五個名次,token 價格卻不到一半。值得留意的反駁論點是:兩個模型都是在最高投入程度下評分,而 Opus 5.5 出貨時預設為中等。若 Astra 在長程科學工作上的優勢能在相同投入的測試中依然成立,那麼支持其較高定價的理由只會更強,而非更弱。在有人實際跑過之前,站得住腳的立場是:Astra 是依通才價格定價的專才,而 Opus 5.5 則是恰好得分較高的通才。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新