
Claude Opus 5.5 對決 GPT-6 Astra:一場跑贏基準測試的嘗鮮實測
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
有人請 Claude Opus 5.5製作一支短片,主題是某個競爭實驗室解決了納維-斯托克斯方程,接著發布結果,然後寫下那句讓這個比較值得做的話:這個模型「非常討喜」,有「絕佳品味」,而且是自 Opus 4.7 以來第一個他們真正想大量使用的 Claude——但他們仍然保留 GPT-6 Astra 和 GPT-5.6 Sol 作為他們的主力,因為他們的工作偏重研究。一篇貼文裡有三個主張,而它們指向不同方向。一個模型可以是合作起來最愉快的,卻仍然不是你會把生產流量導向的那一個。有趣的問題不是哪個模型更好。而是那兩個判斷之中,哪一個經得起數字檢驗,哪一個最後其實只是關於品味的陳述。
這篇文章是一位實務工作者的報告,不是一次基準測試——請把它當作模型在創意與開放式工作中用起來感覺如何的訊號,而不是關於其能力的證據。以下所有數值都標明了是由誰產出的。
味覺測試能告訴你什麼、不能告訴你什麼
這裡,成品本身才是重點。製作一支關於數學成果的影片,並不是帶有及格/不及格關卡的程式設計任務。沒有編譯步驟、沒有測試套件,也沒有 Terminal-Bench 測試框架來為這東西到底好不好打分數。模型必須選擇一個切入角度、決定要呈現什麼、維持內容連貫,並知道何時停下來。當實務工作者說一個模型有「絕佳品味」時,他們所描述的就是這件事:對範圍與重點的判斷力,而這種判斷力會展現在規格刻意模糊的作品中。
那是一項真實的能力,而這正是基準測試套件最不擅長衡量的一項。這也是為什麼同一個人可以盛讚某個模型,卻不轉用它的原因。探索時,你要的是品味。但當你有 20 萬行程式碼要稽核、還有一筆帳單要證明其合理性時,你要的就不是品味。
Anthropic 自家在發布時的說法,以文字而非影片,指向了同一種能力:Claude Opus 5.5 被宣傳為寫作時較不那麼「Claude 腔」——較少清喉嚨式的開場,較少模稜兩可,更願意把重點放在最前面。獨立可讀性評分支持這項說法的方向,即使它對幅度大小並不認同。該廠商也報告,一項內部事實查核測試在 18 次嘗試中通過了 16 次,而 Claude Fable 5.1 和 Claude Opus 5 都是 18 次中零次;這個數字是 Anthropic 自家的、未經重現,應被視為一項主張,而不是一項結果。
兩個計分板,一個重要的分歧

在已公布的原始基準測試中,Claude Opus 5.5 領先 GPT-6 Astra 的情況往往多於未領先。問題在於,最常被引用的兩個來源對於領先幅度有多大並不一致。
Anthropic 的發布資料表將 Claude Opus 5.5 在 Terminal-Bench 4.0 上列為 66.4%,GPT-6 Astra 為 57.9%,Claude Fable 5.1 為 55.8%。這是廠商自報在代理式編碼上領先 8.5 個百分點——那種在行銷簡報中足以終結爭論的差距。Artificial Analysis 以自家測試框架實測,在同一基準上測得 Claude Opus 5.5 為 59.6%:與 xhigh effort 的 GPT-6 Astra 持平,並比 Claude Opus 5 高出約 11 個百分點。兩種讀數下,領先都是真的。領先的幅度則不然。
兩個模型互換位置的地方,比它們沒有互換位置的地方更有用:
• Terminal-Bench 4.0(代理式編碼)——根據 Anthropic 自家表格,Claude Opus 5.5 為 66.4%;根據 Artificial Analysis,則為 59.6%;GPT-6 Astra 為 57.9%。
• Humanity's Last Exam,使用工具 — Claude Opus 5.5 為 67.7%(廠商回報),獨立測得為 61.4%;GPT-6 Astra 為 57.2%。
• GDPval-AA v2.1(涵蓋 44 種職業的真實世界知識工作)— Claude Opus 5.5 1,846 Elo;GPT-6 Astra 1,542 Elo。這兩項數據均來自 Artificial Analysis 的獨立排行榜,而非廠商本身。
• Terminal-Bench-Science 0.1 — GPT-6 Astra 64.6% 對上 Claude Opus 5.5 的 58.7%。這是 Astra 一場乾淨俐落的勝利,而這是一項帶有科學色彩的代理式基準測試。
• AutomationBench — GPT-6 Astra 41.4% 對 Claude Opus 5.5 40.0%。差距不大,但又是 Astra。
• FrontierCode v1.1 — Claude Opus 5.5 的 54.4% 對上 GPT-6 Astra 的 53.3%。差距不到一個百分點。
用實務工作者的方式來讀那份清單。研究密集型的工作負載——那些帶有科學或文獻成分的、那些會執行長時間工具使用迴圈且需要模型站穩腳步的——正是 GPT-6 Astra 守住陣地的地方。而 Claude Opus 5.5 遙遙領先的知識工作與程式開發榜單,則是你如果職責是交付軟體時會指出的那些。這段對話裡的兩個人都正確地解讀了自己那套基準測試。他們只是讀的是不同的基準測試罷了。
這個 effort 設定做的工作比模型還多
頭條利潤率之所以偏軟,還有第二個較不光彩的原因。廠商之間的比較並非在相同設定下進行。
Claude Opus 5.5 公布的分數來自超高(xhigh)推理強度設定,而 GPT-6 Astra 則是採用 high。Artificial Analysis 的獨立測試把兩個模型都設在 xhigh,程式編寫能力的差距就消失了——廠商宣稱的 8.5 分領先變成平手。這並不是在指控不當行為;而是當廠商挑選最能突顯自家模型的設定,獨立實驗室則挑選與競爭對手相符的設定時,自然會出現的結果。在你因為一張效能比較表就決定遷移工作負載之前,先確認它是在哪個強度設定下跑出來的,因為答案往往是「那個好看一點的設定」。
Token 帳單從另一個角度講述了同一個故事。Anthropic 自家的發布資料顯示,Claude Opus 5.5 每個問題花費大約 119,000 個 token,其中約 84,000 個用於思考,而 GPT-6 Astra 解決類似問題只需大約 27,000 個 token。思考 token 會以輸出 token 計費。一個使用四倍 token、但輸出價格只有其五分之一的模型,幾乎只是打平——而且這還沒把以下事實算進去:那個較便宜的模型,往往正是你本來就願意以更高推理強度設定去執行的模型。
還有一點需要特別補充,而且僅適用於 Claude Opus 5.5 這一邊:Anthropic 的防護機制分流,可能會把某些與網路安全及生物領域相關的請求導向限制更嚴格的處理路徑,這會使那些評估項目上公布的成績,低於底層模型實際上會產出的水準。如果你的工作會觸及這些領域,那麼基準測試與你的實際體驗之間的落差將確實存在,而且方向會是基準測試偏於樂觀。
一個真正的任務在每一項上的花費是多少

Claude Opus 5.5 是價目表上較便宜的模型,而且差距還不小:
• Claude Opus 5.5 — 每百萬輸入 $4.00、每百萬輸出 $20.00、每百萬快取輸入 $0.20、每百萬快取寫入 $5.00。100 萬 token 上下文,最大輸出 128k。
• GPT-6 Astra — 每百萬輸入權杖 $10.00、每百萬輸出權杖 $50.00、每百萬快取輸入 $1.00、每百萬快取寫入 $12.50。單次要求中的輸入權杖超過 272,000 後,整筆要求將重新計價為輸入 $20.00、輸出 $100.00;批次層級為 $5.00/$25.00。
所以 Claude Opus 5.5 的輸入便宜 2.5 倍,輸出也便宜 2.5 倍,而快取輸入則便宜五倍。如果你的任務在 token 用量上相近,這就是決策的全部,品味問題只是裝飾。
上面那個 token 用量的但書,正是讓事情沒那麼單純的原因,而 GPT-6 Astra 的長上下文重新定價則是另一個陷阱。只要單一請求的輸入超過 272,000 個 token,整筆請求——不只是超出的部分——就會改用長上下文費率計價。把大批語料塞進單一次呼叫的研究工作負載,正是會觸發這條規則的典型形態。半價的批次處理是正當的變通出口,只不過它排在較慢的佇列上。
誠實的總結是,成本情況會視你在做什麼而反轉。對於兩個模型使用相當 token 數量的任務,Claude Opus 5.5 在價格上以大幅優勢勝出。對於長時間的代理式研究迴圈,其中 token 數量如 Anthropic 自家發布資料所示那樣出現分歧,兩者則會趨於一致——這比起成本降低 40% 是沒那麼振奮人心的標題,卻更接近那位實務工作者所回報的情況。
為什麼重度研究型使用者沒有切換
把這些片段拼湊起來,「還是偏好 Astra」這句話就不再與「絕佳風味」的說法互相矛盾。那是從不同座位看到的同一個觀察。
使用者點名的那些工作負載漫長、開放式、需要動用工具,而且每次執行的成本高昂。在這些工作上,GPT-6 Astra 稱霸科學與自動化排行榜,只耗用一小部分的思考符元,而且——根據獨立量測——當兩個模型以同等投入運行時,在程式設計方面旗鼓相當。Claude Opus 5.5 的優勢則集中在你能看見產出並加以評判的工作上:散文、設計取捨、釐清含糊簡報的範圍、決定一支關於納維-斯托克斯方程的影片實際上該呈現什麼。那就是品味,而品味恰恰是不會出現在基準軸線上的那一部分。
如果你原本希望得到一個某個模型勝出的結論,證據並不支持。站得住腳的說法比較狹隘:Claude Opus 5.5 是更適合判斷力為瓶頸的工作的模型,GPT-6 Astra 則是更適合持續投入長上下文為瓶頸的工作的模型,而在第二類工作上,兩者之間的價格差距會縮小到幾乎不存在。那是路由決策,不是轉換。
在沒有遷移的情況下同時執行兩者

這就是那兩個模型不再是非此即彼的環節。GPT-6 Astra 現已在 OrcaRouter 上線,採用 OpenAI 自家的定價——輸入 $10.00、輸出 $50.00、快取讀取 $1.00、快取寫入 $12.50——並具0% 加價,供應商定價直接原樣傳遞。這意味著供應商的價格變動當天就會反映在我們這邊,而不是等轉售商同步時才更新。
Claude Opus 5.5 可透過 Anthropic 自家的 API 及數個第三方平台存取;我們並未將其列為我們所提供的服務,而在該模型尚未全面擴散之前,若有人聲稱並非如此,你都應該保持懷疑。你現在能做的,就是把這兩個模型都放在同一組金鑰與同一種端點形式之後,並依工作負載而非個人偏好來路由:把開放式、需要大量判斷的請求交給 Claude Opus 5.5,把漫長的研究迴圈交給 GPT-6 Astra,而不必維護兩份合約或兩套用戶端整合。
自動容錯移轉正是讓這類測試得以安全進行的關鍵。新模型還算不上正式的生產路徑,而只透過單一端點來路由,意味著供應商一出狀況或觸及速率限制,請求只是被轉往別處,而不是直接失敗。如果你想弄清楚所謂的品味落差在你自己的工作上是否真實存在,那正是最省成本的驗證方式——把它跟你現有的東西並行運行,而不是取代它,並讓你自己的測試套件來定奪,而不是依賴發布時的評測表。
基準測試無法回答的問題
有兩件事值得關注,而這兩者都不是另一個基準測試分數。
首先,是 effort 設定的不對稱是否會獲得解決。目前,廠商在 xhigh 設定下對上在 high 設定下的競爭對手,會產生 8.5 分的領先;而獨立測試在相同設定下,則會把這個領先化為平手。隨著獨立實驗室在 GPT-6 Astra 目前領先的科學與自動化榜單上,公布採用相同設定的測試結果,這個局面可能朝任一方向發展——而它會因證據而變,而不是因任何人的框架而變。
第二個是 token 效率的問題。如果 Claude Opus 5.5 的思考開銷在某個點版本中下降,其 2.5 倍的費率優勢就不再被抵銷,價格論點便會徹底勝出。如果沒有下降,那麼繼續以 GPT-6 Astra 作為主要工具的實務工作者,並不是落後於新聞週期。他們正確解讀了自己的工作負載,而上市比較表根本沒有衡量到這一點。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
