
Gemini 3.7 Flash 對決 Claude Opus 5:以六分之一的價格,實幹型模型能給你什麼
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 221 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
這裡有個數字,讓這個比較值得一看:Anthropic 的旗艦產品 Claude Opus 5 在 Artificial Analysis Intelligence Index 上獲得 61 分,而 Google 於 2026 年 8 月 13 日推出的主力產品 Gemini 3.7 Flash 獲得 56 分。差 5 分。而在 Google 年底前的促銷價下,Gemini 3.7 Flash 每百萬輸入 tokens 收費 0.75 美元,每百萬輸出 tokens 收費 3.75 美元——約為 Claude Opus 5 的 5.00 / 25.00 美元的六分之一。過去區隔「主力」與「旗艦」的差距,已經縮小到誠實的問題不再是便宜的模型好不好,而是貴的模型還有什麼是便宜模型做不到的。
比較框架至關重要,因為這不是一場對等的較量,假裝兩者可以相提並論只會誤導你。Claude Opus 5 於 2026 年 7 月 24 日發布,是 Anthropic 目前最強大且正式推出的模型:一款具備 100 萬 token 上下文、128K 輸出上限的推理模型,專為最艱鉅的工程、研究與電腦操作任務而設計。Gemini 3.7 Flash 是 Google 的高吞吐量主力模型:100 萬上下文、64K 輸出、文字/圖片/音訊/影片輸入,其設計宗旨與 Opus 恰恰相反——以盡可能低的成本輸出盡可能多的 token,處理那 95% 的例行流量。用單一指標比較兩者,最終只會得到錯誤答案;根據你實際執行的工作形態來比較,才能得出有用的結論。

五點,深入解析
{{1}}智能指數並非線性刻度,56 與 61 之間的差距在某些任務上比在其他任務上更具意義。{{/1}}{{2}}Opus 5 的 61 分來自於在綜合指標中最困難項目的領先地位——它在 ARC-AGI-3 上的 30.2、FrontierBench 上的 43.3 以及 SWE-bench Pro 上的 79.2 雖然均為廠商報告數據,但這些都是 Flash 級模型無法觸及的前沿推理結果。{{/2}}{{3}}Gemini 3.7 Flash 的 56 分則是以不同方式獲得的:{{/3}}{{4}}Google 對其報告的數據(DeepSWE v1.1 上的 65.3、WebDev Arena 上的 1588 Elo、AutomationBench 上的 30.4)顯示,這是一款擅長有限範圍、高吞吐量工程與代理任務的模型,而非擅長新穎開放式推理。{{/4}}{{5}}因此,五分指數差距描述的是真實的能力斷崖,儘管表面上的距離看起來很小。{{/5}}
• Intelligence Index:Gemini 3.7 Flash 為 56,而 Claude Opus 5(max effort)為 61,根據 Artificial Analysis。
• 輸出速度 — Gemini 3.7 Flash 約為每秒 340 tokens,而 Claude Opus 5 約為每秒 53 tokens,兩者數據均來自 Artificial Analysis,差距達 6.4 倍。
• 上下文窗口 — 兩者皆為 1M tokens,但 Claude Opus 5 的輸出上限為 128K,而 Gemini 3.7 Flash 則為 64K。
• 輸入價格 — 0.75美元(促銷價,至2026年)對比5.00美元 — 相差6.7倍。
• 輸出價格 — $3.75(促銷價)對比 $25.00 — 相差 6.7 倍。
• 多模態輸入 — Gemini 3.7 Flash 支援文字、圖片、音訊與視訊;Claude Opus 5 僅支援文字與圖片。

Claude Opus 5 仍然物有所值之處
旗艦機型的定位並非懷舊,而是任務分佈的尾部。長時程自主工程——讓模型獨自面對程式碼庫一小時,進行規劃、編輯、測試與迭代——是 Opus 5 據報領先幅度最大的領域,而其電腦操作表現(OSWorld 上 71 分,廠商回報)使其躋身 Gemini 3.7 Flash 無法進入的級別。從 Claude Opus 4.8 遷移過來的團隊也應知道,Opus 5 預設啟用適應性思考,並重新校準了努力等級,且停用思考的上限設定為高努力——這些行為變更可能破壞現有管線。這些都不使它成為處理艱鉅任務的錯誤選擇;而是使它成為比其價格所暗示的更狹窄工作範圍內的正確選擇。
Opus 5 銷售的另一個重點是 Anthropic 的平台經濟學。其提示快取在快取命中時可將有效輸入成本降低最多 90%,而其批次方案則將非同步流量的價格減半——因此,在 Opus 5 上高快取、高批次的工作負載,其帳單金額會比標題所示的每 5 / 25 美元更接近標價的影子。旗艦產品的實際價格取決於工作負載;而主力產品則不然。
Gemini 3.7 Flash 在哪些情況下是更明智的選擇
對於任何涉及串流、批次處理或依賴長上下文的工作,這個主力模型不僅更便宜,而且在結構上更具優勢。6.4 倍輸出速度的優勢改變了你能建構的東西:互動式程式碼補全、整個儲存庫的即時摘要、每分鐘需要多次呼叫的代理迴圈——所有這些在 53-token/s 的模型上,早在觸及品質瓶頸之前就會撞上吞吐量瓶頸。Gemini 3.7 Flash 還接受音訊和視訊輸入,這開闢了 Claude 模型在該輸入軸上無法實現的使用案例(會議轉錄、視訊幀理解)。此外,其可調節的思考等級意味著你可以用低強度執行廉價的日常工作,並用高強度處理較困難的子集,只為你使用的推理付費。
配對手冊
第一線實務工作者大致上已不再將此視為二選一的問題,反覆浮現的模式是分而治之的循環:Claude Opus 5 負責規劃與設計,Gemini 3.7 Flash 負責大量實作,Opus 5 負責審查。每個模型都被用在品質成本比最有利的位置,組合後的管線無論在成本或速度上都勝過單獨運行任一模型。路由層讓這種模式從架構設計變成實際可行的做法:Claude Opus 5 已上線於 OrcaRouter,以 Anthropic 官網定價零加成提供,而路由 DSL 讓你能組合出單一呼叫,把規劃工作送往 Opus 5、把執行工作送往 Flash 級模型群,背後由單一 OpenAI 相容端點統一承接——下一步則是模型融合,讓兩個模型回答同一個問題,再由一個裁判模型協調兩者的結論。

法案並排
用實際數字來算。一天1000萬輸入token和100萬輸出token——一個負荷沉重但普通的代理型管線——在Claude Opus 5的標準費率下帳單是$75 + $375 = $450。同樣的流量在Gemini 3.7 Flash的促銷費率下帳單是$7.50 + $37.50 = $45,正好是十分之一。即使把Opus在輸入端的快取折扣算進去,差距仍達一個數量級;這正是「大宗用flash、高難度尾段用opus」成為預設生產形態、而非特殊做法的原因。促銷結束後,Gemini 3.7 Flash的輸入費率會翻倍到$1.50——仍只有Opus的三分之一,而且依然便宜到足以讓這個搭配的算術繼續成立。
誠實的解讀
五分的差距是真實存在的,而且它恰好落在你所預期的位置:最困難、時間跨度最長的工作上。如果你的工作負載以那條長尾為主——前沿研究、長達數小時的自動化工程、電腦使用——Claude Opus 5 對得起它的定價,你不必過度糾結。如果你的工作負載以處理量、延遲或長上下文為主,那麼以促銷價計算的 Gemini 3.7 Flash 是勝出一個數量級的更划算選擇,它與旗艦款之間的差距只是一個評測等級,而非鴻溝。這些模型正在趨同,對大多數團隊而言,實際問題已不再是「該選哪一個」,而是「工作的哪些部分該交給哪一個」。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
