
Gemini 4 Argon 對決 Claude Opus 5.5:誰都沒預料到的基準測試分歧
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 223 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Gemini 4 Argon 和 Claude Opus 5.5 對於誰更優秀意見分歧,而這種分歧並非雜訊。在 Artificial Analysis 的 Intelligence Index 上,兩者相差五點,Opus 5.5 佔優。在 Vals Index——以 GDP 加權的經濟影響力排行榜——上,Gemini 4 Argon 位居第一,Claude Opus 5.5 位居第三,落後於 Argon 和 Claude Sonnet 5.5 兩者。這兩個排行榜在同一週衡量了同樣這兩個模型。這就是整篇文章的重點:你該選哪一個,取決於你的工作看起來更像一道考試題,還是律師事務所的一個星期二;也取決於你到底有沒有 Argon 的 API 存取權限——而截至今日,幾乎沒有人有。
Google 於 2026 年 9 月 30 日在 DeepMind 的一篇文章中宣布 Gemini 4 Argon,該文署名為 Google DeepMind 資深副總裁暨首席 AI 架構師 Koray Kavukcuoglu。Anthropic 則早了八天,於 2026 年 9 月 22 日發布 Claude Opus 5.5。這兩者之中,有一個是你今天下午就能呼叫的 GA 版本。另一個則是分階段推出,對象是一群具名的網路防禦人員,外加 Google 自家的工程師,並表明打算在防護機制準備就緒後,盡快開放給「付費 API 客戶與 Google AI Ultra 訂閱者」,但未附上任何日期。
先給一句話答案,再談細節
如果你今天需要最佳實測的通用推理能力,而且需要在正式環境金鑰上使用,Claude Opus 5.5 現在已在 OrcaRouter 上提供,而 Gemini 4 Argon 則尚未在任何公開 API 上架。如果你正在為金融、法律、稅務或程式編寫代理(agents)打造應用,且這些代理會以每美元經濟產出接受評分,那麼 Argon 的數據更好,而且在唯一精確衡量此指標的排行榜上,其每項任務價格是 Opus 5.5 的五分之一。如果你從事關鍵基礎設施的網路安全防禦,Argon 有一個你可以申請的計畫,而答案可能是肯定的。
每個數字實際上來自哪裡
兩個指數委員會,兩套方法論,而值得精確分辨哪個是哪個,因為這兩個陣營接下來幾個月會互相引用對方過去的說法。
• Artificial Analysis Intelligence Index v4.3 — Claude Opus 5.5 為 57.6,Gemini 4 Argon 為 52.6,兩者皆於 2026-09-30 從 Artificial Analysis 讀取。這是十項評估的綜合結果,刻意設計為任務通用型,也是大多數人引用為「the」排行榜的榜單。
• Vals Index,更新於 2026-09-29 —— Gemini 4 Argon 以 68.90%(±0.97)居首,Claude Sonnet 5.5 以 67.04%(±0.92)位居第二,Claude Opus 5.5 則以 66.97%(±0.89)排名第三。Vals 會依各產業占美國 GDP 的比重,對金融、程式開發、法律與稅務任務加權,因此一個在解謎上表現平庸、卻擅長合約審閱與試算表工作的模型,在這裡能拿到不錯的分數。
AA 的五分差距確實存在,而且不算小。Vals 的兩分差距也真實存在,而從排行榜上列出的信賴區間來看,Argon 的 68.90 ±0.97 對上 Opus 5.5 的 66.97 ±0.89,大約是 1.5 個標準誤的差距——比擲硬幣好,但還不到壓倒性的程度。兩個排行榜都沒有錯,它們衡量的是不同的任務。

有一點設定上的但書,而且這點不利於把 AA 差距解讀為純粹的模型比較。Artificial Analysis 將 Gemini 4 Argon 標示為其high努力設定,而 Claude Opus 5.5 則標示為「自適應推理、最高努力、預設回退」。這兩者並不是兩個努力階梯上的同一點,因此 57.6 對 52.6 的頭條數字並非在推理預算相符下的同類比較。這是兩個頁面都發布的數字,若你對 Anthropic 公平,就該引用這個數字,但這不是受控實驗。
每項任務成本正是差距開始令人不安的地方
Artificial Analysis 也公布了運行其索引套件的成本明細,而在這一點上,這兩個模型的差距相當懸殊。
• 每個索引任務的成本 — Gemini 4 Argon 1.99 美元,相較於 Claude Opus 5.5 的 5.98 美元。
• 執行整套索引套件的成本 — Gemini 4 Argon 為 2,407 美元,對比 Claude Opus 5.5 的 8,708 美元。
• 每百萬詞元定價——Gemini 4 Argon 輸入 $2/輸出 $10(Google 公布的優惠價,快取輸入可享 95% 折扣,即 $0.10),對比 Claude Opus 5.5 輸入 $4/輸出 $20。
• 輸送量——Gemini 4 Argon 每秒輸出 48.9 個 token,首個 token 在 2.79 秒後出現;Claude Opus 5.5 每秒輸出 92.2 個 token,但在同一測試框架下首個 token 延遲達 702 秒,這正是延伸思考稅攤在陽光下的展現。
• Vals 每次執行成本 — 在同一組以 GDP 加權的任務集上,Gemini 4 Argon 為 $15.68,而 Claude Opus 5.5 為 $32.14。
有個值得提出、而不是粉飾帶過的出入:Vals 的排行榜把 Argon 的費率列為 $4 輸入 / $20 輸出,而 Google 的公告則表示推廣期間為 $2 輸入 / $10 輸出。最可能的解讀是,Vals 顯示的是標準牌價,而 Google 顯示的是促銷價,但這只是推論,並非雙方任一方的公開聲明。如果你的預算取決於這個數字,請向 Google 確認。
Argon 聲稱的內容與已查核的內容

Google 的文章充斥著數字,而每一項數字都是廠商自行回報的。據我所知,沒有任何一項曾被獨立重現;而且上述獨立評測平台所衡量的項目,也不同於 Google 選擇拿來當作頭條宣傳的那些。以下以 Google 自己的說法表述:
• DeepSWE v1.1 — 77.9%,被譽為真實世界長時程軟體工程的新標竿。
• LVBench 長影片理解 — 91.7%,被譽為最先進。
• AutomationBench(Zapier 的端到端業務任務基準測試)——以 51.3% 排名第一。
• CWE-bench v1 弱點修復 —— 以 68% 並列第一,奠基於 Gemini 3.8 Flash Cyber 在 v0 排行榜上的成果。
• Gray Swan 間接提示注入 — 被形容為領先,但該貼文未公布任何數字。
• Vals Finance Agent v2 與 Harvey's Legal Agent Benchmark — 被描述為領先,同樣地,公告中也沒有印出數字。
真正擁有獨立佐證的這兩類說法,最值得信賴:Vals 用一個數值與一個區間確認了該指數位置,而 Artificial Analysis 則確認了 52.6 的指數與價格。內部生產力軼事——在量子子程序上相較已發表基準提升 40%、Argon 代理在 Google 整體機群中釋放出超過 300 TiB 記憶體——屬於公司內部成果,未經外部測試,應該以這樣的角度來看待。
如果你一直與世隔絕,Opus 5.5 到底是什麼
Claude Opus 5.5 是 Anthropic 的旗艦級模型:100 萬個 token 的上下文、最高 128K 的輸出、涵蓋文字、圖像與檔案的多模態輸入、延伸思考、工具使用與結構化輸出。它於 2026 年 9 月 22 日接棒 Claude Opus 5,而發表時最受矚目的焦點可以說是價格下調——這個層級是降價而非漲價,來到 $4/$20,快取讀取為 $0.20。它今天已在 OrcaRouter 上以完全相同的費率提供路由,供應商定價原封不動轉嫁,零加成,而廠商價格若有變動,會在同一天反映到我們這一側,就和反映到他們那一側一樣快。
在兩個模型皆有的任務層級分數上,情況是真正的拉鋸,而非一面倒:
• Terminal-Bench 4.0 — Claude Opus 5.5 59.6% 對上 Gemini 4 Argon 57.1%。
• SciCode — Claude Opus 5.5 66.9% 對比 Gemini 4 Argon 61.8%。
• 人類最後的考試 —— Claude Opus 5.5 為 61.4%,對上 Gemini 4 Argon 的 57.1%。
• 長上下文推理 — Claude Opus 5.5 84.7% 對比 Gemini 4 Argon 79.7%。
• CritPt — Claude Opus 5.5 31.7% 對比 Gemini 4 Argon 27.1%。
• 全知 — Claude Opus 5.5 46.4 對 Gemini 4 Argon 42.4。
• GDPval — Claude Opus 5.5 為 1,846,對比 Gemini 4 Argon 的 1,611。
• AutomationBench-AA — Gemini 4 Argon 77.5% 對上 Claude Opus 5.5 69.5%。這是 Argon 明顯勝出的唯一一項正面對決任務分數,而且它也是最貼近 Vals Index 所獎勵的任務類型。
所以這個模式是一致的:Opus 5.5 在偏學術風格的推理階梯上領先,而 Argon 在端到端任務執行上領先。這不再是兩份排行榜之間的矛盾。這是同一項發現的兩次表述。
沒有人拿來比較的能力
Gemini 4 Argon 的輸出上限是單一軌跡中 1,000,000 個 token,相較前一代的 64K 大幅提升。Claude Opus 5.5 的輸出上限為 128K。兩者都保有 1M token 的上下文視窗,但上下文與輸出是不同的預算,而這是公告中單一規格最大的躍升。
這是否重要,完全取決於你執行的是什麼。對聊天、程式碼審查、結構化擷取與代理步驟來說,128K 的輸出上限相當寬裕。但對一次生成整套遷移修補程式集、完整稽核報告或長篇文件而言,這卻是一道難以突破的高牆——也就是 Google 選擇用來展示這次發布的工作流程。如果你的管線需要串接二十次呼叫才能維持在上限之內,Argon 的上限將為你省下延遲與編排程式碼。如果不是,你就是在為用不到的餘裕付費。
可用性才是決定性變數,而非品質
這是比較中沒有附帶基準,卻比所有基準都更重要的部分。
Gemini 4 Argon 尚未正式推出。Google 的公告指出,它正透過 Fairwind Program 向受信任的網路防禦人員逐步開放,該公司也參與美國政府的自願性發布前模型存取流程,而對開發者、企業與消費者的更廣泛開放則會「盡快」到來,首先從付費 API 客戶與 Google AI Ultra 訂閱者開始。目前沒有模型識別碼、沒有端點、沒有公布配額,也沒有日期。它不在我們的目錄中,也不在其他任何人的公開 API 中,因此 Argon 的定價頁面還不存在。
Claude Opus 5.5 今日正式推出。在 OrcaRouter 上,它的型號代碼是 anthropic/claude-opus-5.5,可透過與目錄中其他 200 多個模型相同的 OpenAI 相容端點存取,並具備跨供應商的自動容錯移轉機制,能在某條路由效能下降時自動切換;此外還有一套路由 DSL,讓你在想把部分流量導向 Opus 5.5、其餘流量以同一組金鑰送往其他位置時使用。無須第二份合約,也不用第二套 SDK。

下個月務實的建議並不光鮮亮麗:以 Opus 5.5 為基礎繼續發展,把你的模型名稱放在設定值裡,而不是寫死在字串常式中,並且在重試路徑後面放一個便宜的模型,這樣一來,某次首字元輸出耗時 702 秒所引發的延遲尖峰,就不會連帶把你的產品拖垮。最後這點並非理論空談——Opus 5.5 在 AA 測試框架上的首字元延遲是十一分鐘,而無論那是測試框架造成的假象,還是這個模型真的比過去任何模型思考得更久,你的逾時預算都該由這個數字來決定,而不是由行銷話術來決定。
什麼會改變這個判決?
三件事,按可能性排序。Argon 正式全面推出並公布定價,這會讓成本論點立刻變得可行,也能測試 $2/$10 是否經得起真實流量的考驗。在 Google 之外對 DeepSWE v1.1 與 CWE-bench v1 進行獨立且可重現的執行,這要麼證實供應商的說法,要麼戳破它們。又或者是由 Artificial Analysis 以 Argon 的最高推理強度設定進行配置,這將釐清那五分的指數差距究竟是能力差異,還是設定造成的人為產物。
在其中一項真正落地之前,誠實的總結是:Opus 5.5 是驗證得更充分的模型,而 Argon 是價格更划算的那項說法。至於今天你實際上能用哪一個,這根本不是難以取捨的問題。
Claude Opus 5.5 已在 OrcaRouter 上線,採用廠商定價、不加收費用,並與目錄中其餘模型一同提供——如果你想用自己的工作負載來實測,而不是對照排行榜,anthropic/claude-opus-5.5就是你要呼叫的 ID,之後要換成其他模型,也只需在同一把金鑰上改一行。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
