
Claude Haiku 5.5 与 Gemini 3.7 Flash 对比:这两者之一已经退役
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
今天写下的任何 Claude Haiku 5.5与 Gemini 3.7 Flash对比之下,都藏着一个尴尬的事实:Gemini 3.7 Flash 已被弃用。厂商于 2026 年 8 月 13 日发布它,9 月 2 日便以 Gemini 3.8 Flash 取而代之,Artificial Analysis 如今已在 3.7 的页面上标注弃用标记。相比之下,Claude Haiku 5.5 于 2026 年 10 月 7 日发布,并承诺其退役时间不早于 2027 年 10 月。
这并不会让这个对比变得毫无意义。它改变了问题本身。这不再是一个“这两个我该调用哪一个”的问题——对大多数团队来说,答案是两个都不选,因为 3.7 这一代在自己的家族里就已经被取代了。它真正的价值在于一件更微妙、也可以说更有用的事:清晰地看出 Google 的 flash 档位在三周内推进得有多快,以及 flash 档位模型的规格表中,究竟是哪些部分真正决定了它会不会被用起来。
你还能测量什么
两个模型都已在同一个独立榜单上运行,而这是唯一能把二者直接并列比较的地方。在 Artificial Analysis Intelligence Index v4.3.2 上,Claude Haiku 5.5 在其 Max 配置下得分为 43.40,而 Gemini 3.7 Flash 在其 High 配置下得分为 39.06——相差 4.33 分。
两家厂商也都发布自己的评估集,而它们的重叠方式并不足以进行直接比较。共享的独立行项是 Artificial Analysis 在二者上运行的那四项:
• Terminal Bench 4.0 — Claude Haiku 5.5 为 0.3283,而 Gemini 3.7 Flash 为 0.1364。19 个百分点的绝对差距,也是该组中最大的不对称性。
• SciCode — 0.5498 对 0.5718。Gemini 3.7 Flash 以 2.2 分的优势略胜一筹。
• Humanity's Last Exam — 0.4439 对 0.4787。Gemini 3.7 Flash 领先 3.5 分。
• AutomationBench,部分得分 — 0.3541 对 0.6203。Gemini 3.7 Flash 相差 27 分。
仔细看看那组结果,因为其中包含着真正有意思的发现。Gemini 3.7 Flash 在四个共有基准中赢下三个,却仍在综合指数上以 4.3 分之差落败。指数是一种加权混合,而权重设置把终端与代码那几行——在这些项上,差距朝着相反方向、且幅度大得多——置于其他各项汇总之前。与其说这是评分上的假象,不如说它道出了这个指数的用意:它想预测的是一个模型能否把活儿干完,而在这个问题上,3.7 这一代表现疲弱,其还算体面的科学基准分数并未掩盖这一点。

3.7 系列实际上究竟不擅长什么
两行比索引更能说明问题。
Terminal Bench 4.0 上的 0.1364 是个很低的数字,而它旁边是同一模型在上一代 Terminal Bench 上取得的 0.8577。这并不是模型变差了,而是基准改变了它所衡量的内容,而 Gemini 3.7 Flash 没能完成这一转变。在同样经过修订的基准上,Claude Haiku 5.5 得分为 0.3283——从绝对值看并不惊艳,但几乎是 3.7 Flash 那个数字的两倍半,而且是在最能直接预测智能体编程性能的那一行上。
第二行是 Tau-Bench Banking,Gemini 3.7 Flash 在此的得分为 0.3278。在结构化领域中,工具调用的可靠性恰恰是廉价模型被部署去承担的职责,而低于 0.33 的分数正是那种会悄无声息地扼杀一个试点项目的数字。Claude Haiku 5.5 在同一张表里没有公布的 Tau-Bench 数据,因此那里无从进行对比——诚实的做法是如实说明,而不是凭空推断出一个数字。
Gemini 3.7 Flash 经受住考验的地方,正是它一贯经受住考验的地方:GPQA 达到 0.9455,MMMU-Pro 达到 0.8549,这两项都是实打实的强项,而其多模态输入从来不成问题。失败之处在于规格表中决定 agent loop 能否奏效的那一部分,而不是在排行榜上赢得名次的那一部分。
在它之后的三周里发生了什么变化?
Gemini 3.8 Flash 于 2026 年 9 月 2 日发布,而对于任何正在规划 2027 年管线的人来说,Google 自家 Flash 层级内部的动向是更有用的比较。
在同一指数上,Gemini 3.8 Flash 测得 40.93,而 3.7 系列为 39.06——三周内提升 1.87 分。Terminal Bench 4.0 从 0.1364 升至 0.1970。Tau-Bench Banking 从 0.3278 升至 0.4495。这些正是 3.7 模型表现最差的那些行,这表明继任者瞄准的正是这一弱点,而不是一次笼统的能力提升。
价格完全没有变化。Gemini 3.7 Flash 的标价是每百万 token 输入 $0.75、输出 $3.75,而 Gemini 3.8 Flash 以同样的 $0.75 和 $3.75 发布——一模一样的价目表,却挂在一个在对智能体至关重要的那些指标行上高出两个指数点的模型上。

费率卡才是这项对比真正发生转折的地方
与 Claude 5.5 相比,谷歌的价格既是全部,又不是全部。
• 输入 — Claude Haiku 5.5 每百万 tokens $0.10,最高 100,000,超出后 $0.50;Gemini 3.7 Flash 统一 $0.75,即第一档内为 Anthropic 价格的七点五倍。
• 输出 —— 第一档内 Claude Haiku 5.5 为 $0.50,超出该档为 $2.50;Gemini 3.7 Flash 为 $3.75。
• 缓存输入 — Claude Haiku 5.5 为 $0.01 和 $0.125;Gemini 3.7 Flash 读取为 $0.075,写入为 $0.75。
• 上下文 — 两者均为 100 万 token。最大输出 — Claude Haiku 5.5 为 128,000 token,而 Gemini 3.7 Flash 为 65,536 token。
• 输入模态——Claude Haiku 5.5 支持文本和图像;Gemini 3.7 Flash 支持文本、图像、语音和视频。这依然是 Google 的规格严格说来更长的那一项,并且在迭代到 3.8 后仍原封不动地保留了下来。
• 每个已完成 Index 任务的独立成本——Claude Haiku 5.5 为 0.21 美元,而 Gemini 3.7 Flash 为 0.93 美元。4.4 倍的差距比 7.5:1 的输入比例所暗示的还要大,因为 Anthropic 的模型在这里才是更啰嗦的那个:每个 Index 任务 162,164 个输出 token,而 Gemini 3.7 Flash 为 58,387 个。Anthropic 还记录了一个与 Claude 4.7 及更高版本共享的分词器,对相同文本会多计约 30% 的 token,这也会朝同一方向推高差距。
• 速度 — 在 Index 任务上,Gemini 3.7 Flash 每项任务耗时 212.3 秒,而 Claude Haiku 5.5 为 424.6 秒。谷歌的模型是两者中更快的那个,速度达到两倍;这是本节中唯一一行更便宜的模型并非同时也是更好的模型。
如果你今天做选择,这意味着什么
实际的解读是,这两者都不是正确答案,原因各有不同。
Gemini 3.7 Flash 已被弃用,定价却与其继任者相同,而且恰恰在廉价生产模型所需的那几项指标上还逊于继任者。推荐它,就等于推荐一份附在已被取代的模型上的价目表——继任者价格相同,做得更多。2026 年 10 月在两者之间做选择的人,都不该落到 3.7 这一代上,而它的价目表毫无变化,正是这一点一锤定音。
Claude Haiku 5.5 是当前线上模型,在文本输入、文本输出的任务中,无论从哪个方面衡量都更便宜,综合得分更高,并且在两项预测智能体成功的指标上表现远胜一筹。它也是两者中较慢的一个,并且无法接受语音或视频输入。这是否重要,取决于你的流水线,而不是模型本身。
第三种可能——3.8 与 3.7 之间的指数点差距让这一点显而易见——是 Google 的 flash 层级更新速度太快,以至于一份三周前的对比早已成为历史。任何 flash 层级的正面交锋,其保质期都应以周来衡量,而不是以季度来衡量。
落在哪边就跑哪边
Gemini 3.8 Flash——是继任版本,而非已弃用的 3.7——已上架 OrcaRouter 目录,按 Google 的标价提供,零加价,因此 Google 公布的价格就是最终计入你账单的价格,他们那边一有变动,我们这边当天即生效。Claude Sonnet 5.5 和 Claude Opus 5.5 也已上架目录,这让双供应商路由测试成为一项配置,而非一个项目:一个 API 对接 200 多个模型,一个密钥,自动故障转移在底层支撑,而当你更愿意把升级处理放在路由里、而不是放在代码中时,还有路由 DSL 可用。
Gemini 3.7 Flash 本身并不在我们的目录中,Claude Haiku 5.5 也不在其中。两者仍可通过各自供应商的 API 访问,而对 Google 的产品来说,还可通过若干第三方平台访问。这一点值得明确说明,而不是让读者自己去发现。

要减去的数
问题不在于 4.33 点的指数差距。而在于 Gemini 3.7 Flash 在四项共同基准中赢了三项,却仍以四分只差输掉综合评分,因为该指数权重最高的那项基准,正是它只拿到 0.1364 分的那项。一款 Flash 级模型的科学类分数可能看起来没问题,但它却在廉价模型被购买来完成的那个任务上失败了。
其推论是:继任模型在三周内便精准修复了那些行,且价格未变。基于这一证据,这一档位的竞争压力并不在于价格,而在于模型能否完成多步骤任务——而这一点如今的变化速度已快于价目表。
