為 Claude Sonnet 5.5 對上 Gemini 3.1 Pro 生成的 hero 主視覺標題卡,副標題為「每 token 更便宜,每項任務貴十一倍」,顯示每百萬 token 為 $2.00 與 $10.00,對比 $2.00 與 $12.00,右側註明 65,536-token 的輸出上限,並在右下角合成 OrcaRouter 標誌。
Guides & Insights

Claude Sonnet 5.5 對比 Gemini 3.1 Pro:每 Token 更便宜,每項任務卻貴上十一倍

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

在價目表上,Claude Sonnet 5.5 是較便宜的模型,而且在能力上根本不是同一個量級。它於 2026 年 9 月 28 日正式全面推出,價格為每百萬輸入 token 2.00 美元、每百萬輸出 token 10.00 美元;Gemini 3.1 Pro 於 2026 年 2 月 19 日發布,至今仍由預覽端點提供服務,價格為 2.00 與 12.00 美元。Sonnet 5.5 在 Artificial Analysis 的 Intelligence Index v4.3 上也拿下 56 分,而 Gemini 3.1 Pro Preview 僅有 30 分——在同一套測試框架下相差二十六分。Gemini 那 1,048,576 token 的上下文長度,是它唯一徹底勝出的招牌數字。然而同一位評測者也指出,完成一項開放式任務在 Google 模型上花費 0.67 美元,在 Anthropic 模型上則要 7.60 美元,相差十一倍,方向恰好相反。兩個數字都是正確的,而它們之所以能夠並存——一邊是 65,536 token 的輸出上限,另一邊是冗長度問題——這正是這整篇比較的全部要旨。

每個端點實際上是什麼

先釐清身分,再來做算術。這裡的主體是 anthropic/claude-sonnet-5.5,於 2026 年 9 月 28 日發布,支援文字、圖像與檔案輸入,1,000,000 個 token 的上下文,最大輸出為 128,000 個 token,具備自適應思考,且在 Claude Platform 上,其 effort 參數預設為 high。對手是 google/gemini-3.1-pro-preview,於 2026 年 2 月 19 日發布,支援文字、圖像、影片、音訊與檔案輸入,1,048,576 個 token 的上下文,最大輸出為 65,536 個 token。這兩個名稱中,其中一個帶有另一個所沒有的詞,而那並不是裝飾。

這個 preview 後綴已經掛了七個月。在這段期間,Google 推出了好幾個 Flash 版本,卻沒有為 Pro 層級推出後繼者;3.1 Pro 所取代的那個模型已被列為終止服務。這些都不是該模型的缺陷——它一直以來都上線運作、維持穩定,定價也正確無誤——但這確實意味著,你正在整合的那個端點並不受一般可用性(GA)生命週期承諾的保障,而這個系列已經汰除過一個 Pro 模型。請把這件事當成一項常設的固定項目,而不是一則註腳,因為一旦判斷錯誤,它會改變一項多年期架構決策的代價。

兩個指向相反方向的數

先說逐 token 的比較,因為這是人人都會跑的,而且它偏袒較新的模型。

• 輸入 — 兩者皆為每百萬 $2.00;在公告費率上完全打成平手

• 輸出 — Claude Sonnet 5.5 為 $10.00,而 Gemini 3.1 Pro 為 $12.00;Anthropic 模型便宜 17%

• 快取讀取 — 兩者在分層界線以下皆為每百萬 $0.20

• 快取寫入——Claude Sonnet 5.5 的五分鐘視窗為每百萬 $2.50,相較於 Gemini 3.1 Pro 的 $0.375;使用 Google 寫入一筆快取項目大約便宜七倍

• 背景 — 1,000,000 對比 1,048,576;一個沒有實際影響的差異

• 最大輸出 — 128,000 個 token,相較於 65,536 個;Anthropic 模型的上限幾乎是後者的兩倍

• 輸入模態 — 文字、圖像與檔案,對比文字、圖像、影片、音訊與檔案

接著是逐項任務的比較,來自同一位評估者、在同一週內、雙方皆採用最高投入配置:Claude Sonnet 5.5 為 7.60 美元,對上 Gemini 3.1 Pro 的 0.67 美元。十一倍。其機制是記載於同一頁上,而非推論而來——Sonnet 5.5 在整個索引測試套件中產生了 4.1 億個 token,而該領域的中位數為 8,800 萬個,評估者形容這極為冗長,而 Gemini 3.1 Pro 則被形容為相當簡潔。當一個模型的產出量是另一個的數倍時,輸出費率上 17% 的優勢一碰到帳單就站不住腳。

這個教訓的適用範圍超越了這兩個模型:費率卡為詞元定價,而你付費購買的是完成的工作。任何只停留在價目表上的比較,衡量的是錯誤的量。

200,000 個 token 的分級界線

Gemini 3.1 Pro 的定價並非均一,而且級距幅度大到足以逆轉上述部分比較。在提示低於 200,000 個 token 時,費率為輸入 $2.00、輸出 $12.00,快取讀取為 $0.20。超過這條界線後,整次呼叫會重新計價為輸入 $4.00、輸出 $18.00、快取讀取 $0.40——輸入費率翻倍,正好是 Claude Sonnet 5.5 的兩倍;輸出則從 Anthropic 這邊便宜 17%,變成 Google 這邊貴 80%。

這個分界點並不罕見。一個 20 萬 token 的提示詞,可能是一份小型程式碼庫、一整套冗長的合約、幾小時的逐字稿,或是一個已經運作了一段時間的代理。長上下文工作正是 100 萬 token 視窗主打的賣點,因此最能從這個視窗獲益的級距,也正是價格優勢消失的級距。如果你的提示詞經常超過 20 萬 token,請以 $4.00 和 $18.00 的價格評估 Gemini 3.1 Pro,而不是用登陸頁面上的費率。

快取寫入值得單獨用一句話說明,因為它們朝相反方向反轉,並且不受分層變更影響。以每百萬 $0.375 對比 $2.50,用 Gemini 填充快取要便宜得多,而且當你跨越邊界時,這個費率並不會變動。對於每回合都重建龐大前綴、而非重複使用同一個前綴的 agent 來說,這一行的結構性優勢可能比輸入費率更大——而它也是這項比較中唯一不受任何分層邊界影響的一行。

65,536 個 Token 的上限,以及它為何決定架構

最能改變你能打造什麼的數字是最大輸出量:Gemini 3.1 Pro 的 65,536 個 token,對比 Claude Sonnet 5.5 的 128,000 個。上限不是一項效能指標;它是任務能否在一次呼叫中塞得下的限制條件。

任何會產出大型成品的作業——一份完整的原始碼檔案、一份冗長的報告、一份完整的文件、一個結構化資料集——以 Gemini 的情況來說,只要超過 65,536 個 token,就必須拆解成一連串的呼叫,並在呼叫之間傳遞狀態。拆解會在每一步耗費更多輸入 token、更多調度程式碼,並在一個區塊結束、下一個區塊開始的接縫處帶來新的失效模式。第二項限制讓問題雪上加霜:Anthropic 自家的資料指出,Sonnet 5.5 在可靠處理長篇工作上的實務門檻明顯更高,而 Gemini 的上限是兩者中較嚴格的那一個,且差距達兩倍。如果你最長的成品是 40,000 個 token,本節與你無關,你應該改以每項任務的成本來比較。如果是 100,000 個,那麼這道上限早已替你做出了決定。

模態,Gemini 徹底獨占鰲頭的唯一軸線

Gemini 3.1 Pro 接受影片與音訊;Claude Sonnet 5.5 接受文字、圖像與檔案,且影片與音訊兩者皆無法接受。對於圍繞媒體打造的工作負載——通話錄音、螢幕擷取、產品影片、會議音訊——在這組搭配中沒有可用替代方案,而且價格比較也失去意義,因為這兩個端點中只有一個根本能接受該輸入。對於文字與圖像工作負載,能力集合有所重疊,前述的價格計算便具決定性。

Gemini 的另一項營運數字值得說明,因為在以智慧能力為主打項目的頁面上,這個數字很容易被忽略:我們的型錄測得首字延遲中位數在 p50 為 10,000 毫秒,輸出速率接近每秒 1,283 個 token,七日錯誤率為 56.8%。這是一個速度極快的模型,卻有著極高的實測失敗率——這樣的組合非常適合搭配充裕重試預算的批次作業,遠比適合任何使用者正在等待的即時工作來得恰當。相較之下,Claude Sonnet 5.5 則是較慢、較穩定的類型。錯誤率並不會出現在任何一家供應商的著陸頁上;這種數字只有在候選模型都置於同一個會對它們進行量測的端點之後才會浮現,這也是為什麼要從同一個地方、而非兩個儀表板來評估兩者的原因之一。

將什麼路由到哪裡

當工作是文字或圖像時,把它交給 Claude Sonnet 5.5;當品質門檻高到二十六點的指標差距會造成影響時;當輸出成品長到需要 128,000 token 的上限時;或當工作負載具互動性,而 56.8% 的錯誤率令人無法接受時。在結構化、有界的工作上,產生 7.60 美元這個數字的冗長懲罰大致會消失,而每 token 的優勢就會變成實質的金錢。

當輸入包含影片或音訊時,把它交給 Gemini 3.1 Pro;當提示維持在 200,000 個 token 以下且用量很大時;當你頻繁寫入大型快取,而 $0.375 的快取寫入成本會不斷累積時;或者當任務是批次型的,而每項任務成本是唯一重要的欄位時——每項任務 $0.67 對比 $7.60,你可以負擔大量的重試。

這兩者目前都能在 OrcaRouter 上進行路由。google/gemini-3.1-pro-preview 與 anthropic/claude-sonnet-5 都是同一組憑證下已上線的目錄項目,依供應商定價計費,0% 加價,這表示上述拆分可以用一條路由規則來表示,而不是兩個整合——將媒體形式的請求送往一個端點,文字與圖片請求送往另一個端點,並在任一端點開始發生錯誤時進行容錯移轉。Claude Sonnet 5.5 尚未在我們平台上成為路由;當它上架時,同一條規則即可涵蓋,無需新的金鑰。

這場對決的誠實結論:Claude Sonnet 5.5 是明顯更好的模型,而且每 token 更便宜;Gemini 3.1 Pro 在開放式工作上,每完成一項任務大約便宜十一倍,寫入快取便宜六倍,而且是兩者中唯一能看影片的。任何拿價目表向你報價的人,描述的是一種不存在的比較;真正存在的比較,是關於你能界定哪些請求。

A two-column scoreboard for Claude Sonnet 5.5 and Gemini 3.1 Pro Preview across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output, input modality text, image and file, AA Intelligence Index v4.3 score 56, $7.60 per task on the index run. Right column Gemini 3.1 Pro Preview: input $2.00 rising to $4.00 over 200K tokens, output $12.00 rising to $18.00, cache read $0.20, cache write $0.375, 1,048,576-token context with a 65,536-token max output, input modality text, image, video, audio and file, AA Intelligence Index v4.3 score 30, $0.67 per task on the index run. The card heading reads "Cheaper per token, eleven times dearer per finished task", and a footer line notes that Gemini 3.1 Pro remains a preview endpoint seven months after its February 19, 2026 announcement.Screenshot of the OrcaRouter model page for Google Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview), showing the model header, the 1,048,576-token context window, the 65,536-token maximum output, audio, file, image, text and video input, the Vision, Audio, Tools, JSON and Reasoning capability tags, a 10.00-second p50 time to first token, a "Public benchmarks by Google · 2026-02-19" line, and the $2.00 input and $12.00 output prices per million tokens.Screenshot of Artificial Analysis's model page for Gemini 3.1 Pro Preview, marked a proprietary model and released February 2026, showing In $2.00 and Out $12.00 with a 90% cache discount, the Intelligence Index score of 30, an output rate of 114 tokens per second, the $0.67 average cost per task, and 67M output tokens described as fairly concise against a median of 88M.

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新