
{{1}}Claude Haiku 5.5{{/1}}与{{2}}Gemini 3.8 Flash{{/2}}:指数高两分,单任务成本却高达六倍
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Claude Haiku 5.5与Gemini 3.8 Flash在这一价位区间内,二者在实测能力上比任何其他组合都更为接近——在 Artificial Analysis Intelligence Index v4.3.2 上分别为 43.40 对 40.93,二者都跻身一个包含 225 个模型的榜单前五十名。真正拉开二者差距的,是这些指数分中每一分的成本。在同一项独立测量中,在 Claude Haiku 5.5 上完成一个 Intelligence Index 任务的成本为 $0.21,而在 Gemini 3.8 Flash 上为 $1.24。
分数上仅差 2.5 分,却形成了六倍的差距,而这个数字才应该决定这次比较。其他一切——标价、模态列表、Google 定价所附带的截止日期——都只是在细枝末节上争论。
两款模型,在关键数据上
每百万个token,以美元计价,来源于Anthropic和Google各自的定价文档,独立测量结果归因于Artificial Analysis。缓存于2026-10-08。

• 输入 — Claude Haiku 5.5 为 $0.10(最高 100,000 个 token),超出后为 $0.50;Gemini 3.8 Flash 统一 $0.75,2027 年 1 月 1 日起上涨至 $1.50。
• 输出 — Claude Haiku 5.5 在 100,000 个词元以内为 $0.50,超出部分为 $2.50;Gemini 3.8 Flash 统一为 $3.75,并于同一天涨至 $7.50。
• 缓存输入 — Claude Haiku 5.5 $0.01 和 $0.05;Gemini 3.8 Flash $0.075,另加每小时每百万 token $0.50 的存储费用。
• 上下文 — 两者均为 1M tokens。最大输出 — Claude Haiku 5.5 为 128,000 tokens,而 Gemini 3.8 Flash 为 65,536。
• 输入模态——对{{1}}Claude Haiku 5.5{{/1}}而言是文本和图像;对{{2}}Gemini 3.8 Flash{{/2}}而言是文本、图像、语音和视频。这是谷歌的清单严格更长的那一行。
• 独立评分 — Claude Haiku 5.5(Max)为 43.40,Gemini 3.8 Flash(High)为 40.93,基于 Intelligence Index v4.3.2。
• 每项任务的独立成本 — 同一块主板上,0.21 美元对 1.24 美元。
• 速度 — 每秒输出 241.9 个 token,对比 125.2 个,两者均由 Artificial Analysis 测得。
六倍数字从何而来
每任务成本的差距比标价差距更大,而这才是有意思的地方,因为这意味着单凭费率卡无法解释这一差距。
标价算术再简单不过:输入上 $0.10 对 $0.75,便宜 7.5 倍;输出上 $0.50 对 $3.75,也是同样的比例。如果两个模型为相同的工作生成了相同数量的 token,那么这个比例就会直接体现在账单上。
这并不能延续下去,而且两种效应都对谷歌有利。Claude Haiku 5.5 的冗长程度,连其自家厂商都予以承认:Artificial Analysis 在运行该 Index 时记录到 4.4 亿输出 token,而中位数为 1 亿,并称该模型非常冗长。Gemini 3.8 Flash 生成了 1.7 亿,而中位数为 8100 万——同样被标记为冗长,但 token 数只有三分之一。Anthropic 自己的文档补充了第二种效应:Claude Haiku 5.5 使用了与 Claude 4.7 及更高版本共享的较新分词器,因此同一段文本所计的 token 数比它所取代的模型大约多 30%。
综合起来,对定价主张的诚实表述是这样的:输入费率有十比一的优势,输出费率有七点五比一的优势,其中一部分被一个每次作答写入更多词元的模型消耗掉,最终在按整个任务计费的衡量口径上落到六比一的优势。这仍然是一场碾压,只是比费率表所显示的幅度要小一些。
谷歌的价格上标有日期
谷歌定价页面上最有用的一点,是一句大多数对比表格都会略去的话。
Gemini 3.8 Flash 的标价为输入 $0.75、输出 $3.75,“截至 2026 年 12 月 31 日”,以及输入 $1.50、输出 $7.50,“自 2027 年 1 月 1 日起”。缓存输入将在同一天从 $0.075 涨至 $0.15。这是一个带有到期日的优惠价,就印在价格旁边,距本文撰写时大约还有十一周。
Anthropic 的卡片上没有任何内容是那样写的。Claude Haiku 5.5 的费率就是按费率本身标明的,采用与提示长度而非日历日期挂钩的两档结构,并承诺不早于 2027 年 10 月 7 日退役。如果你正在为一个延续到明年的流程建模,Google 一月份的调价是一次翻倍,理应纳入模型;而 Anthropic 并没有可与之对应的、需要提前规划的事件。
这话对双方都成立,而公正的解读并不是“一家供应商诚实,另一家不诚实”。促销价在其有效期内就是真实价格,谷歌有权以这种方式为发布定价。这只是比较中的一个事实:1月数据里看上去更便宜的那一方,恰恰是有截止期限的一方。

指数的哪两个点是值得的?
在一个满分到六十多的指数上,2.47分的差距既不是舍入误差,也不是天壤之别。两个模型处在同一工作区间内,而实际问题在于:这一差距是否会在你真正运行的任务上显现出来。
根据厂商自己公布的数据,这两者并非在同一测试框架上测量,因此无法直接对比——Anthropic 发布了 Claude Haiku 5.5 的 GDPval-AA v2.1、OSWorld 2.1、Terminal-Bench 4.0 和 FrontierCode 结果,Google 则发布了 Gemini 3.8 Flash 自己的一套结果,而且两家厂商都没有运行对方的测试套件。唯一可获得的同类比较是独立榜单,而在那里,答案是 Anthropic 领先,但优势可测量却很小。
对某些团队来说更要紧的能力差异在模态这一项上。Gemini 3.8 Flash 接受语音和视频输入;Claude Haiku 5.5 接受文本和图像。一条原生接入通话录音或屏幕录制的流水线,根本不会在价格上于这两个模型之间做选择——因为其中一个若不在前面加一道转录或抽帧步骤就干不了这活,而这道步骤自有其开销,也自有其失效模式。
运行这对中较便宜的一侧
Gemini 3.8 Flash 已按 Google 的列表价上架 OrcaRouter 目录,加价 0%,这一点在这里比平时更重要:该提供商的费率是直接透传的,而不是混合计算的,所以如果你想看看一月份的调价究竟会对账单产生什么影响,Google 那边一变,这个数字就会跟着动。Claude Sonnet 5.5 和 Claude Opus 5.5 也都在目录中,这就使三方路由测试——Google 的 Flash 一路、Anthropic 的中端一档,稍后再加一个 Anthropic 的小型一档——成为一种配置,而不是一个项目。一个密钥、一个 SDK,底层自动故障转移,以及路由 DSL(如果你更愿意在路由中而不是在应用代码中表达这种升级)。
Claude Haiku 5.5 本身尚未收录进目录,与其含糊带过,不如把这一点讲清楚。本次对比中 Anthropic 这一方目前只能在 Anthropic 处获取,而 Google 这一方今天就可以按上方所示的价格通过我们调用。

哪一个,给谁的
如果你的工作是文本输入、文本输出,提示词低于 100,000 个 token,并且你为真实用量按 token 付费,那么 Claude Haiku 5.5 在本文的每一项衡量标准下都是更便宜的模型,也是在唯一共享榜单上得分更高的那个——但要注意,其优势是每任务成本降到六分之一,而不是标价所暗示的十分之一。
如果你需要输入音频或视频,或者需要 65K 以上的响应,或者你的提示词经常很长,那么考量就变了:Gemini 3.8 Flash 能接受 Anthropic 小档位无法接受的输入,而在超过 100,000 token 后,Anthropic 自己的第二档定价远高于 Google 的统一费率。
唯一要牢牢盯住的是日期。Google 的费率在年底前有效,之后翻倍。Anthropic 的费率则报为固定价,并带有一个按长度变化的阶梯。无论你最终落在哪一边,都要先把日历做进电子表格,再搭建管道。
