
Gemini 3.7 Flash 对比 Claude Opus 5:仅需六分之一的价格,这匹"工作马"能给你带来什么
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 221 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
这里有一个数字,让这场比较变得有意义:Anthropic 的旗舰产品 Claude Opus 5 在 Artificial Analysis Intelligence Index 上得分 61,而 Google 于 2026 年 8 月 13 日发布的主力产品 Gemini 3.7 Flash 得分 56。相差五分。而且按照 Google 截至年底的促销价,Gemini 3.7 Flash 每百万输入 token 收费 0.75 美元,每百万输出 token 收费 3.75 美元——约为 Claude Opus 5(5.00 美元/25.00 美元)的六分之一。曾经区分“主力”与“旗舰”的差距已经缩小到这样的程度:真正的问题不再是廉价模型是否够好,而是昂贵的模型究竟还能做哪些廉价模型做不到的事。
表述方式很重要,因为这不是一场对等较量,假装是对等只会误导你。Claude Opus 5 于2026年7月24日发布,是 Anthropic 最强大的通用模型:一个拥有100万token上下文、输出上限为12.8万token的推理模型,专为最艰巨的工程、研究和计算机使用任务而设计。Gemini 3.7 Flash 是 Google 的高吞吐量主力模型:100万上下文、6.4万输出、文本/图像/音频/视频输入,其设计理念与 Opus 截然相反——以尽可能低的成本流式输出尽可能多的token,服务于95%的常规流量。用单一数字来比较它们,最终只会得到错误的答案;根据你实际运行的工作形态来比较,才能得到有用的答案。

五点,详解
智能指数并非线性标度,56 与 61 之间的差距在某些任务上比其他任务更有分量。Opus 5 的 61 分来自其在综合指数中最难项目上的领先——它在 ARC-AGI-3 上的 30.2、FrontierBench 上的 43.3 以及 SWE-bench Pro 上的 79.2 均为厂商报告的数据,但这些是任何 Flash 级模型都无法触及的前沿推理结果。Gemini 3.7 Flash 的 56 分则以不同方式取得:谷歌报告的该模型数据(DeepSWE v1.1 上 65.3、WebDev Arena 上 1588 Elo、AutomationBench 上 30.4)表明,它擅长有边界的、高吞吐量的工程和智能体任务,而非新颖的开放式推理。因此,五个指数点的差距描述了一个真实的能力悬崖,尽管表面上的数字距离看起来很小。
• 智能指数——Gemini 3.7 Flash 为 56,而 Claude Opus 5(最大努力)为 61,据 Artificial Analysis。
• 输出速度 — 根据 Artificial Analysis 的数据,Gemini 3.7 Flash 约为 340 tokens/s,而 Claude Opus 5 约为 53 tokens/s,差距达 6.4 倍。
• 上下文窗口:两者均为1M tokens,但Claude Opus 5的输出上限为128K,而Gemini 3.7 Flash为64K。
• 输入价格 — $0.75(促销价,截至2026年)对比 $5.00 — 相差6.7倍。
• 输出价格 — $3.75(促销)与 $25.00 相比 — 6.7倍的差距。
• 多模态输入 — Gemini 3.7 Flash 支持文本、图像、音频和视频;Claude Opus 5 仅支持文本和图像。

Claude Opus 5 仍然物有所值之处
旗舰机型的外壳并非怀旧,而是任务分布的尾部。长周期自主工程——让模型独自面对代码库一个小时,进行规划、编辑、测试和迭代——正是Opus 5所报告领先优势最大的领域,而其在计算机使用方面的成绩(OSWorld上71分,供应商报告)使其进入了Gemini 3.7 Flash无法企及的级别。从Claude Opus 4.8迁移的团队还应了解,Opus 5默认开启自适应思考,并重新校准了努力等级,且禁用思考的上限被锁定在高努力档——这些行为变化可能会破坏现有流水线。这些都不意味着它不是艰巨工作的正确选择;而是意味着它适合的工作范围比其价格所暗示的要更窄。
Opus 5 的另一个卖点是 Anthropic 的平台经济学。其提示缓存在缓存命中时可将有效输入成本降低最高 90%,其批量档位可将异步流量的价格减半——因此,在 Opus 5 上,高缓存、高批量的工作负载的账单金额,远比标题 $5 / $25 所暗示的更接近其标价的影子价格。旗舰型号的真实价格取决于工作负载;而主力型号则不然。
在哪些情况下,Gemini 3.7 Flash 是更明智的选择
对于任何涉及流式传输、批处理或依赖长上下文的任务,主力模型不仅更便宜,而且在结构上更具优势。6.4倍的输出速度优势改变了你能构建的东西:交互式代码补全、整个代码仓库的实时摘要、每分钟需要多次调用的智能体循环——所有这些在53 token/s的模型上,早在触及质量瓶颈之前就会先撞上吞吐量瓶颈。Gemini 3.7 Flash还支持音频和视频输入,这开辟了Claude模型在该输入维度上无法实现的使用场景(会议转录、视频帧理解)。而且其可调节的思考级别意味着,你可以在低投入模式下运行它处理廉价的日常事务,在高投入模式下处理更困难的子集,只为实际使用的推理付费。
配对指南
一线的实践者们已经基本不再把这当作二选一的问题,反复出现的模式是一个分而治之的循环:{{1}}Claude Opus 5 负责规划和设计,Gemini 3.7 Flash 负责大批量实现,Opus 5 负责审查{{/1}}。每个模型都被用在质量与成本之比最优的地方,而组合起来的流水线比单独运行任何一种模型都更便宜、更快。{{2}}一个路由层让这种模式变得切实可行,而非停留在架构层面:{{/2}}Claude Opus 5 已在 OrcaRouter 上以 Anthropic 的官方列表价格上线,0% 加价,{{3}}路由 DSL 让你能够组合出一次调用:把规划任务发给 Opus 5,把执行任务发给 Flash 级模型,统一由一个兼容 OpenAI 的端点承接{{/3}}——{{4}}模型融合则是更进一步,两个模型回答同一个问题,由裁判模型协调两份结论{{/4}}。

账单,并排显示
给它配上真实数字。一天1000万输入token和100万输出token——一个繁重但普通的智能体管道——按Claude Opus 5的标准费率计费为75美元+375美元=450美元。同样的流量按Gemini 3.7 Flash的促销费率计费为7.50美元+37.50美元=45美元,正好是十分之一。即使考虑到Opus在输入端口的缓存折扣,差距仍然是一个数量级,这正是“批量用flash,难点用opus”成为默认生产形态而非例外形态的原因。当促销结束时,Gemini 3.7 Flash的输入费率翻倍至1.50美元——仍然是Opus的三分之一,仍然足够便宜以保持这种配对计算不变。
诚实的解读
五分的差距是真实存在的,而且它恰好落在你预期的地方:在最困难、时间跨度最长的工作上。如果你的工作负载由那条长尾主导——前沿研究、长达数小时的自主工程、计算机使用——那么Claude Opus 5物有所值,你不必过度纠结。如果你的工作负载主要由吞吐量、延迟或长上下文驱动,那么按促销价计算,Gemini 3.7 Flash的性价比高出一个数量级,它与旗舰版之间的差距只是一个基准档次,而非天堑。模型正在趋同,对大多数团队而言,实际的答案不再是“选哪一款”,而是“工作的哪些部分分别交给哪一款”。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
