主視覺標題卡寫著「Gemini 4 Argon 對上 Claude Opus 5.5——基準測試的分歧」,日期列寫著「Argon 於 2026-09-30 宣布」與「Opus 5.5 於 2026-09-22 發布」,標章寫著「Argon:限定先導計畫,並非正式全面推出」,頁尾一行寫著「Argon 數據由廠商提供;兩款模型的指數數據均依據 Artificial Analysis。」
Guides & Insights

Gemini 4 Argon 對決 Claude Opus 5.5:誰都沒預料到的基準測試分歧

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Gemini 4 Argon 和 Claude Opus 5.5 對於誰更優秀意見分歧,而這種分歧並非雜訊。在 Artificial Analysis 的 Intelligence Index 上,兩者相差五點,Opus 5.5 佔優。在 Vals Index——以 GDP 加權的經濟影響力排行榜——上,Gemini 4 Argon 位居第一,Claude Opus 5.5 位居第三,落後於 Argon 和 Claude Sonnet 5.5 兩者。這兩個排行榜在同一週衡量了同樣這兩個模型。這就是整篇文章的重點:你該選哪一個,取決於你的工作看起來更像一道考試題,還是律師事務所的一個星期二;也取決於你到底有沒有 Argon 的 API 存取權限——而截至今日,幾乎沒有人有。

Google 於 2026 年 9 月 30 日在 DeepMind 的一篇文章中宣布 Gemini 4 Argon,該文署名為 Google DeepMind 資深副總裁暨首席 AI 架構師 Koray Kavukcuoglu。Anthropic 則早了八天,於 2026 年 9 月 22 日發布 Claude Opus 5.5。這兩者之中,有一個是你今天下午就能呼叫的 GA 版本。另一個則是分階段推出,對象是一群具名的網路防禦人員,外加 Google 自家的工程師,並表明打算在防護機制準備就緒後,盡快開放給「付費 API 客戶與 Google AI Ultra 訂閱者」,但未附上任何日期。

先給一句話答案,再談細節

如果你今天需要最佳實測的通用推理能力,而且需要在正式環境金鑰上使用,Claude Opus 5.5 現在已在 OrcaRouter 上提供,而 Gemini 4 Argon 則尚未在任何公開 API 上架。如果你正在為金融、法律、稅務或程式編寫代理(agents)打造應用,且這些代理會以每美元經濟產出接受評分,那麼 Argon 的數據更好,而且在唯一精確衡量此指標的排行榜上,其每項任務價格是 Opus 5.5 的五分之一。如果你從事關鍵基礎設施的網路安全防禦,Argon 有一個你可以申請的計畫,而答案可能是肯定的。

每個數字實際上來自哪裡

兩個指數委員會,兩套方法論,而值得精確分辨哪個是哪個,因為這兩個陣營接下來幾個月會互相引用對方過去的說法。

• Artificial Analysis Intelligence Index v4.3 — Claude Opus 5.5 為 57.6,Gemini 4 Argon 為 52.6,兩者皆於 2026-09-30 從 Artificial Analysis 讀取。這是十項評估的綜合結果,刻意設計為任務通用型,也是大多數人引用為「the」排行榜的榜單。

• Vals Index,更新於 2026-09-29 —— Gemini 4 Argon 以 68.90%(±0.97)居首,Claude Sonnet 5.5 以 67.04%(±0.92)位居第二,Claude Opus 5.5 則以 66.97%(±0.89)排名第三。Vals 會依各產業占美國 GDP 的比重,對金融、程式開發、法律與稅務任務加權,因此一個在解謎上表現平庸、卻擅長合約審閱與試算表工作的模型,在這裡能拿到不錯的分數。

AA 的五分差距確實存在,而且不算小。Vals 的兩分差距也真實存在,而從排行榜上列出的信賴區間來看,Argon 的 68.90 ±0.97 對上 Opus 5.5 的 66.97 ±0.89,大約是 1.5 個標準誤的差距——比擲硬幣好,但還不到壓倒性的程度。兩個排行榜都沒有錯,它們衡量的是不同的任務。

A two-column scoreboard comparing Gemini 4 Argon and Claude Opus 5.5 on six dimensions. Gemini 4 Argon reads: AA Intelligence Index 52.6, Vals Index 68.90% (rank 1), price $2 / $10 per million tokens, cost per index task $1.99, output ceiling 1M tokens, throughput 48.9 tok/s. Claude Opus 5.5 reads: AA Intelligence Index 57.6, Vals Index 66.97% (rank 3), price $4 / $20, cost per index task $5.98, output ceiling 128K tokens, throughput 92.2 tok/s. A footer line reads that Argon figures are vendor-reported and both models' index and cost figures are per Artificial Analysis on 2026-09-30.

有一點設定上的但書,而且這點不利於把 AA 差距解讀為純粹的模型比較。Artificial Analysis 將 Gemini 4 Argon 標示為其high努力設定,而 Claude Opus 5.5 則標示為「自適應推理、最高努力、預設回退」。這兩者並不是兩個努力階梯上的同一點,因此 57.6 對 52.6 的頭條數字並非在推理預算相符下的同類比較。這是兩個頁面都發布的數字,若你對 Anthropic 公平,就該引用這個數字,但這不是受控實驗。

每項任務成本正是差距開始令人不安的地方

Artificial Analysis 也公布了運行其索引套件的成本明細,而在這一點上,這兩個模型的差距相當懸殊。

• 每個索引任務的成本 — Gemini 4 Argon 1.99 美元,相較於 Claude Opus 5.5 的 5.98 美元。

• 執行整套索引套件的成本 — Gemini 4 Argon 為 2,407 美元,對比 Claude Opus 5.5 的 8,708 美元。

• 每百萬詞元定價——Gemini 4 Argon 輸入 $2/輸出 $10(Google 公布的優惠價,快取輸入可享 95% 折扣,即 $0.10),對比 Claude Opus 5.5 輸入 $4/輸出 $20。

• 輸送量——Gemini 4 Argon 每秒輸出 48.9 個 token,首個 token 在 2.79 秒後出現;Claude Opus 5.5 每秒輸出 92.2 個 token,但在同一測試框架下首個 token 延遲達 702 秒,這正是延伸思考稅攤在陽光下的展現。

• Vals 每次執行成本 — 在同一組以 GDP 加權的任務集上,Gemini 4 Argon 為 $15.68,而 Claude Opus 5.5 為 $32.14。

有個值得提出、而不是粉飾帶過的出入:Vals 的排行榜把 Argon 的費率列為 $4 輸入 / $20 輸出,而 Google 的公告則表示推廣期間為 $2 輸入 / $10 輸出。最可能的解讀是,Vals 顯示的是標準牌價,而 Google 顯示的是促銷價,但這只是推論,並非雙方任一方的公開聲明。如果你的預算取決於這個數字,請向 Google 確認。

Argon 聲稱的內容與已查核的內容

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated Sep 30 2026, credited to Koray Kavukcuoglu, SVP Google DeepMind and Chief AI Architect, with the standfirst reading that Gemini 4 Argon delivers frontier performance in complex workflows across real-world software engineering, enterprise knowledge work like legal and finance, and cybersecurity defense.

Google 的文章充斥著數字,而每一項數字都是廠商自行回報的。據我所知,沒有任何一項曾被獨立重現;而且上述獨立評測平台所衡量的項目,也不同於 Google 選擇拿來當作頭條宣傳的那些。以下以 Google 自己的說法表述:

• DeepSWE v1.1 — 77.9%,被譽為真實世界長時程軟體工程的新標竿。

• LVBench 長影片理解 — 91.7%,被譽為最先進。

• AutomationBench(Zapier 的端到端業務任務基準測試)——以 51.3% 排名第一。

• CWE-bench v1 弱點修復 —— 以 68% 並列第一,奠基於 Gemini 3.8 Flash Cyber 在 v0 排行榜上的成果。

• Gray Swan 間接提示注入 — 被形容為領先,但該貼文未公布任何數字。

• Vals Finance Agent v2 與 Harvey's Legal Agent Benchmark — 被描述為領先,同樣地,公告中也沒有印出數字。

真正擁有獨立佐證的這兩類說法,最值得信賴:Vals 用一個數值與一個區間確認了該指數位置,而 Artificial Analysis 則確認了 52.6 的指數與價格。內部生產力軼事——在量子子程序上相較已發表基準提升 40%、Argon 代理在 Google 整體機群中釋放出超過 300 TiB 記憶體——屬於公司內部成果,未經外部測試,應該以這樣的角度來看待。

如果你一直與世隔絕,Opus 5.5 到底是什麼

Claude Opus 5.5 是 Anthropic 的旗艦級模型:100 萬個 token 的上下文、最高 128K 的輸出、涵蓋文字、圖像與檔案的多模態輸入、延伸思考、工具使用與結構化輸出。它於 2026 年 9 月 22 日接棒 Claude Opus 5,而發表時最受矚目的焦點可以說是價格下調——這個層級是降價而非漲價,來到 $4/$20,快取讀取為 $0.20。它今天已在 OrcaRouter 上以完全相同的費率提供路由,供應商定價原封不動轉嫁,零加成,而廠商價格若有變動,會在同一天反映到我們這一側,就和反映到他們那一側一樣快。

在兩個模型皆有的任務層級分數上,情況是真正的拉鋸,而非一面倒:

• Terminal-Bench 4.0 — Claude Opus 5.5 59.6% 對上 Gemini 4 Argon 57.1%。

• SciCode — Claude Opus 5.5 66.9% 對比 Gemini 4 Argon 61.8%。

• 人類最後的考試 —— Claude Opus 5.5 為 61.4%,對上 Gemini 4 Argon 的 57.1%。

• 長上下文推理 — Claude Opus 5.5 84.7% 對比 Gemini 4 Argon 79.7%。

• CritPt — Claude Opus 5.5 31.7% 對比 Gemini 4 Argon 27.1%。

• 全知 — Claude Opus 5.5 46.4 對 Gemini 4 Argon 42.4。

• GDPval — Claude Opus 5.5 為 1,846,對比 Gemini 4 Argon 的 1,611。

• AutomationBench-AA — Gemini 4 Argon 77.5% 對上 Claude Opus 5.5 69.5%。這是 Argon 明顯勝出的唯一一項正面對決任務分數,而且它也是最貼近 Vals Index 所獎勵的任務類型。

所以這個模式是一致的:Opus 5.5 在偏學術風格的推理階梯上領先,而 Argon 在端到端任務執行上領先。這不再是兩份排行榜之間的矛盾。這是同一項發現的兩次表述。

沒有人拿來比較的能力

Gemini 4 Argon 的輸出上限是單一軌跡中 1,000,000 個 token,相較前一代的 64K 大幅提升。Claude Opus 5.5 的輸出上限為 128K。兩者都保有 1M token 的上下文視窗,但上下文與輸出是不同的預算,而這是公告中單一規格最大的躍升。

這是否重要,完全取決於你執行的是什麼。對聊天、程式碼審查、結構化擷取與代理步驟來說,128K 的輸出上限相當寬裕。但對一次生成整套遷移修補程式集、完整稽核報告或長篇文件而言,這卻是一道難以突破的高牆——也就是 Google 選擇用來展示這次發布的工作流程。如果你的管線需要串接二十次呼叫才能維持在上限之內,Argon 的上限將為你省下延遲與編排程式碼。如果不是,你就是在為用不到的餘裕付費。

可用性才是決定性變數,而非品質

這是比較中沒有附帶基準,卻比所有基準都更重要的部分。

Gemini 4 Argon 尚未正式推出。Google 的公告指出,它正透過 Fairwind Program 向受信任的網路防禦人員逐步開放,該公司也參與美國政府的自願性發布前模型存取流程,而對開發者、企業與消費者的更廣泛開放則會「盡快」到來,首先從付費 API 客戶與 Google AI Ultra 訂閱者開始。目前沒有模型識別碼、沒有端點、沒有公布配額,也沒有日期。它不在我們的目錄中,也不在其他任何人的公開 API 中,因此 Argon 的定價頁面還不存在。

Claude Opus 5.5 今日正式推出。在 OrcaRouter 上,它的型號代碼是 anthropic/claude-opus-5.5,可透過與目錄中其他 200 多個模型相同的 OpenAI 相容端點存取,並具備跨供應商的自動容錯移轉機制,能在某條路由效能下降時自動切換;此外還有一套路由 DSL,讓你在想把部分流量導向 Opus 5.5、其餘流量以同一組金鑰送往其他位置時使用。無須第二份合約,也不用第二套 SDK。

A capture of the OrcaRouter model page for Anthropic: Claude Opus 5.5, showing the Anthropic provider, a release date of 2026-09-22, a 1,000,000-token context window, a 128,000-token maximum output, text, image and file input, and pricing of $4.00 input / $20.00 output per million tokens with cache reads at $0.20 and cache writes at $5.00.

下個月務實的建議並不光鮮亮麗:以 Opus 5.5 為基礎繼續發展,把你的模型名稱放在設定值裡,而不是寫死在字串常式中,並且在重試路徑後面放一個便宜的模型,這樣一來,某次首字元輸出耗時 702 秒所引發的延遲尖峰,就不會連帶把你的產品拖垮。最後這點並非理論空談——Opus 5.5 在 AA 測試框架上的首字元延遲是十一分鐘,而無論那是測試框架造成的假象,還是這個模型真的比過去任何模型思考得更久,你的逾時預算都該由這個數字來決定,而不是由行銷話術來決定。

什麼會改變這個判決?

三件事,按可能性排序。Argon 正式全面推出並公布定價,這會讓成本論點立刻變得可行,也能測試 $2/$10 是否經得起真實流量的考驗。在 Google 之外對 DeepSWE v1.1 與 CWE-bench v1 進行獨立且可重現的執行,這要麼證實供應商的說法,要麼戳破它們。又或者是由 Artificial Analysis 以 Argon 的最高推理強度設定進行配置,這將釐清那五分的指數差距究竟是能力差異,還是設定造成的人為產物。

在其中一項真正落地之前,誠實的總結是:Opus 5.5 是驗證得更充分的模型,而 Argon 是價格更划算的那項說法。至於今天你實際上能用哪一個,這根本不是難以取捨的問題。

Claude Opus 5.5 已在 OrcaRouter 上線,採用廠商定價、不加收費用,並與目錄中其餘模型一同提供——如果你想用自己的工作負載來實測,而不是對照排行榜,anthropic/claude-opus-5.5就是你要呼叫的 ID,之後要換成其他模型,也只需在同一把金鑰上改一行。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新