Claude Opus 4.6 vs Gemini 3.1 Pro Preview Custom Tools 比較:基準測試、價格與速度(2026年7月)

在 OrcaRouter 上對 Claude Opus 4.6(anthropic)與 Gemini 3.1 Pro Preview Custom Tools(google)進行正面對比——定價、脈絡窗口、延遲、吞吐與 benchmark 品質並排呈現,助你為工作負載挑選合適的模型。

實測:Claude Opus 4.6 vs Gemini 3.1 Pro Preview Custom Tools 競技模式

對戰模式 — 並排試用兩個模型直播中
在操練場中開啟
Anthropic: Claude Opus 4.6
$5.00 /M · p50 7084ms
Google: Gemini 3.1 Pro Preview Custom Tools
$4.00 /M · p50 5000ms

模型比較

Claude Opus 4.6 與 Gemini 3.1 Pro Preview Custom Tools 的定價、脈絡、延遲、吞吐與品質。
指標Claude Opus 4.6Gemini 3.1 Pro Preview Custom Tools結論
輸入 $/百萬$5.00$4.00在輸入 tokens 上,Gemini 3.1 Pro Preview Custom Tools 比 Claude Opus 4.6 便宜 20%。
輸出 $/百萬$25.00$18.00在輸出 tokens 上,Gemini 3.1 Pro Preview Custom Tools 比 Claude Opus 4.6 便宜 28%。
上下文1M1MGemini 3.1 Pro Preview Custom Tools 支援的脈絡窗口比 Claude Opus 4.6 大 5%。
p50 延遲7084 ms5000 ms在中位數下,Gemini 3.1 Pro Preview Custom Tools 的回應比 Claude Opus 4.6 快 29%。
吞吐55 tok/s217 tok/sGemini 3.1 Pro Preview Custom Tools 的 tokens 串流輸出比 Claude Opus 4.6 快 75%。
品質9.010.0在綜合品質指數上,Gemini 3.1 Pro Preview Custom Tools 比 Claude Opus 4.6 高 10%。

在價格上,Gemini 3.1 Pro Preview Custom Tools 更便宜——在輸入 tokens 上約比 Claude Opus 4.6 低 20%。 對於延遲敏感的工作負載,Gemini 3.1 Pro Preview Custom Tools 能更快回傳第一個 token。 在 benchmark 品質上,Gemini 3.1 Pro Preview Custom Tools 在綜合指數上領先。 選 Gemini 3.1 Pro Preview Custom Tools 可將成本降到最低,或在最重視回應速度時選 Gemini 3.1 Pro Preview Custom Tools。

Claude Opus 4.6 和 Gemini 3.1 Pro Preview Custom Tools 都透過同一個 OrcaRouter 端點提供,依供應商成本計費、零 token 加價,因此在兩者之間切換只需改一行程式碼,下面的數字就是你實際支付的費用。本對比擷取了即時定價、官方公布的上下文視窗,以及 OrcaRouter 自己測得的延遲和吞吐資料,讓你能針對自己的具體工作負載權衡成本與效能,而不是依賴廠商標榜的 benchmark。正確的選擇幾乎總是取決於你流量的形狀——提示長度、你生成多少文字、你的使用者對延遲有多敏感,以及推理有多難——因此下面的章節會逐個維度拆解這個決策,並以一條具體建議收尾。凡是兩個模型中有一方缺少某項指標,該列會直接省略而不是猜測,所以這裡的每一條論斷都有真實數字支撐。

定價與成本分析

在輸入 token 上,Claude Opus 4.6 每 100 萬收費 $5.00,而 Gemini 3.1 Pro Preview Custom Tools 為 $4.00;在輸出上則為 $25.00 對 $18.00(每 100 萬)。帳單通常由輸出 token 決定:生成長回覆的對話或 agent 工作負載主要受輸出費率支配,因此在輸入上看起來更便宜的模型,端到端算下來仍可能是更貴的選擇。只憑價格選型前,先估算你真實的輸入/輸出比例——一個檢索密集、答案很短的提示,與一個提示很短、生成很長的情境,會落在這張表的兩個極端。一個實用的估算方法是:取一份有代表性的提示樣本,數出平均輸入和輸出 token,再分別乘以兩個模型各自的費率;在你真實流量組合下 blended(混合)成本更低的那個模型,就是要被超越的基準。請記住這裡的兩個價格都是原始的供應商費率——OrcaRouter 不加任何價——所以對比是同口徑的,你算出來省下的就是淨省下的。

Claude Opus 4.6 最多接受 1M 個 token 的上下文,Gemini 3.1 Pro Preview Custom Tools 接受 1M。上下文視窗決定了單次請求中你能傳送多少源材料——文件、程式碼、先前的對話。更大的視窗讓你在處理長輸入時可以省去分塊和檢索的工程管線,但你傳送的所有內容仍按輸入 token 費率計費,所以更大的視窗是一種能力,而不是折扣。請讓視窗符合你的工作負載實際會產生的最長單次請求,而不是頁面上最大的那個數字。還要記住,在任何模型上,當上下文非常長時,末尾部分的質量都可能下降,因此大視窗最好被當作應對偶爾出現的長輸入的餘量,而不是把每個請求都塞到上限的許可證。

速度與延遲

延遲和吞吐決定了模型在生產環境中的實際體感。中位數(p50)回應延遲是典型請求在第一個 token 出現前的等待時長;吞吐(每秒 token 數)決定回答開始後的串流速度。對於互動式對話和 agent 迴圈,低 p50 延遲最重要,因為使用者在等待第一個 token;對於批次生成和長文本輸出,吞吐主導整體耗時,因為回答很長。上方的 7 天趨勢圖顯示了每個模型的延遲是穩定還是漂移,這是單一標榜數字所掩蓋的——一個均值很好但尾部抖動的模型,仍可能達不到嚴格的 p95 SLA。如果你的產品有延遲預算,就要同時看中位數和曲線的形狀,並記住端到端延遲還包含你的網路跳轉,以及你圍繞模型所做的任何檢索或工具呼叫。

Claude Opus 4.6
Gemini 3.1 Pro Preview Custom Tools

在過去 7 天裡,Gemini 3.1 Pro Preview Custom Tools 維持較低的中位回應延遲。

基準測試與品質

Benchmark 分數近似地反映能力,但不能取代在你自己的提示上進行測試。此處顯示的綜合質量指數彙整了多項公開評測,百分位則標出每個模型在目錄中所有可比模型裡的位置——這是一個有用的入圍訊號,而不是對你任務效果的保證。在通用智慧指數上領先的模型,在你的領域(編碼、抽取、多語言、長上下文推理)上仍可能落後,因此請用這些 benchmark 縮小範圍,再讓兩個模型在你流量的代表性切片上實際跑一跑。請關注與你用例相匹配的那個具體指數,而不是總榜數字:編碼密集的產品應看重編碼指數,研究助手則看重推理指數。Benchmark 也會隨著模型更新而過時,因此請把它們當作一個起始假設,再用你自己的評測集去確認。

Claude Opus 4.6
47.6
AA Coding
優於所參與比較模型中的 55%
第 55 / 共 123
37.8
AA Intelligence
優於所參與比較模型中的 58%
第 53 / 共 125
Gemini 3.1 Pro Preview Custom Tools
68.8
AA Coding
優於所參與比較模型中的 84%
第 18 / 共 123
46.5
AA Intelligence
優於所參與比較模型中的 79%
第 25 / 共 125

該選哪一個?

如果成本是硬性約束,先按你真實的輸入/輸出比例選用更便宜的模型,只有在質量不達標時才升級。如果回應速度是優先項——面向使用者的對話、agent、任何有人在等待的情境——就把 p50 延遲和吞吐看得比小幅價差更重。如果你要做最吃力的推理、編碼或長上下文工作,就讓 benchmark 和上下文視窗的贏家領頭,並在物有所值處接受更高的費率。由於兩個模型都在同一套 API 之後,低風險的做法是把一小部分真實流量分別路由給兩者,在你自己的提示上對比成本、延遲和回答質量,再做最終決定。一種常見做法是分層(tier):把大量簡單、高頻的請求發給更便宜或更快的模型,把更強的模型留給真正需要它的請求,這樣能以一小部分成本拿到大部分的質量收益。無論選哪個,都要讓切換保持可逆——只需一行模型名稱的改動,一旦數字或你的需求發生變化,你就能立刻把流量切回去。

Claude Opus 4.6 vs Gemini 3.1 Pro Preview Custom Tools 常見問題

Claude Opus 4.6 和 Gemini 3.1 Pro Preview Custom Tools 哪個更便宜?
在輸入 tokens 上 Gemini 3.1 Pro Preview Custom Tools 更便宜,每 100 萬 $4.00,而另一方每 100 萬 $5.00。
Claude Opus 4.6 和 Gemini 3.1 Pro Preview Custom Tools 哪個脈絡窗口更大?
Gemini 3.1 Pro Preview Custom Tools 支援更大的脈絡窗口,因此單次請求可容納更長的文件與對話。
在輸出 token 上,Claude Opus 4.6 和 Gemini 3.1 Pro Preview Custom Tools 哪個更便宜?
Gemini 3.1 Pro Preview Custom Tools 的輸出價格更低,每 100 萬為 $18.00,而另一方為每 100 萬 $25.00。對生成密集型工作負載而言,輸出定價通常比輸入更重要,請據此加以權衡。
Claude Opus 4.6 和 Gemini 3.1 Pro Preview Custom Tools 哪個更快?
在 OrcaRouter 的即時測量中,Gemini 3.1 Pro Preview Custom Tools 的中位(p50)回應延遲更低。
Claude Opus 4.6 和 Gemini 3.1 Pro Preview Custom Tools 哪個串流輸出更快?
Gemini 3.1 Pro Preview Custom Tools 測得的吞吐(每秒 token 數)更高,因此生成一旦開始,長回覆會更快完成。
在 benchmark 上,Claude Opus 4.6 和 Gemini 3.1 Pro Preview Custom Tools 哪個得分更高?
Gemini 3.1 Pro Preview Custom Tools 在上方的綜合質量指數上領先,但 benchmark 的領先並不總能遷移到特定領域——在標準化之前,請在你自己的提示上驗證。
我該用 Claude Opus 4.6 還是 Gemini 3.1 Pro Preview Custom Tools?
根據你的優先順序在 Claude Opus 4.6 和 Gemini 3.1 Pro Preview Custom Tools 之間選擇:成本、脈絡窗口、延遲或 benchmark 品質。上表顯示每個維度上勝出的模型,請將勝者對應到對你工作負載最重要的維度。
Claude Opus 4.6 和 Gemini 3.1 Pro Preview Custom Tools 在 OrcaRouter 上如何計費?
兩者都按上游供應商的費率計費、零 token 加價——你支付的每 token 價格與直接向供應商支付的完全相同,只是透過一個 OrcaRouter API 金鑰和端點。
我能用同一套程式碼呼叫 Claude Opus 4.6 和 Gemini 3.1 Pro Preview Custom Tools 嗎?
可以。兩者都透過 OrcaRouter 的 OpenAI-compatible API 提供,所以你只需更改模型名稱即可在兩者之間路由——無需更換 SDK,也無需另外的憑證。

了解更多