一张为“多花六倍成本,换来两点指数”生成的主视觉卡片,徽标为“每任务成本”,引题是“两款 Flash 级模型,同一张榜单”,副标题为“Claude Haiku 5.5 为 43.40,Gemini 3.8 Flash 为 40.93,基于 Intelligence Index v4.3.2。”四枚标签分别写着“43.40 对比 40.93”、“$0.21 对比 $1.24”、“$0.10 对比 $0.75”和“2027 年 1 月 1 日起上涨”。下方两张卡片分别标注为“ANTHROPIC 的优势”(“在同一张榜单上排名更高,且每完成一项任务的成本仅为其六分之一”)和“GOOGLE 的优势”(“支持语音和视频输入,且在整个窗口期内费率固定”)。页脚写着“来自 Artificial Analysis 的独立测量结果;标价读取于 2026 年 10 月 8 日。”OrcaRouter 徽标合成在右下角。
Guides & Insights

{{1}}Claude Haiku 5.5{{/1}}与{{2}}Gemini 3.8 Flash{{/2}}:指数高两分,单任务成本却高达六倍

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Claude Haiku 5.5与Gemini 3.8 Flash在这一价位区间内,二者在实测能力上比任何其他组合都更为接近——在 Artificial Analysis Intelligence Index v4.3.2 上分别为 43.40 对 40.93,二者都跻身一个包含 225 个模型的榜单前五十名。真正拉开二者差距的,是这些指数分中每一分的成本。在同一项独立测量中,在 Claude Haiku 5.5 上完成一个 Intelligence Index 任务的成本为 $0.21,而在 Gemini 3.8 Flash 上为 $1.24。

分数上仅差 2.5 分,却形成了六倍的差距,而这个数字才应该决定这次比较。其他一切——标价、模态列表、Google 定价所附带的截止日期——都只是在细枝末节上争论。

两款模型,在关键数据上

每百万个token,以美元计价,来源于Anthropic和Google各自的定价文档,独立测量结果归因于Artificial Analysis。缓存于2026-10-08。

A generated scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.8 Flash - on the numbers that matter'. Claude Haiku 5.5 reads input $0.10 under 100K and $0.50 above, output $0.50 and $2.50, cached input $0.01 and $0.05, maximum output 128,000 tokens, input modality text and images, Intelligence Index v4.3.2 43.40, cost per task $0.21. Gemini 3.8 Flash reads input $0.75 now and $1.50 after January 1 2027, output $3.75 and $7.50, cached input $0.075 plus storage, maximum output 65,536 tokens, input modality text images speech and video, Intelligence Index v4.3.2 40.93, cost per task $1.24. A footer reads 'Vendors' published list rates; Google's lower rate runs through December 31, 2026; independent scores from Artificial Analysis.'

• 输入 — Claude Haiku 5.5 为 $0.10(最高 100,000 个 token),超出后为 $0.50;Gemini 3.8 Flash 统一 $0.75,2027 年 1 月 1 日起上涨至 $1.50。

• 输出 — Claude Haiku 5.5 在 100,000 个词元以内为 $0.50,超出部分为 $2.50;Gemini 3.8 Flash 统一为 $3.75,并于同一天涨至 $7.50。

• 缓存输入 — Claude Haiku 5.5 $0.01 和 $0.05;Gemini 3.8 Flash $0.075,另加每小时每百万 token $0.50 的存储费用。

• 上下文 — 两者均为 1M tokens。最大输出 — Claude Haiku 5.5 为 128,000 tokens,而 Gemini 3.8 Flash 为 65,536。

• 输入模态——对{{1}}Claude Haiku 5.5{{/1}}而言是文本和图像;对{{2}}Gemini 3.8 Flash{{/2}}而言是文本、图像、语音和视频。这是谷歌的清单严格更长的那一行。

• 独立评分 — Claude Haiku 5.5(Max)为 43.40,Gemini 3.8 Flash(High)为 40.93,基于 Intelligence Index v4.3.2。

• 每项任务的独立成本 — 同一块主板上,0.21 美元对 1.24 美元。

• 速度 — 每秒输出 241.9 个 token,对比 125.2 个,两者均由 Artificial Analysis 测得。

六倍数字从何而来

每任务成本的差距比标价差距更大,而这才是有意思的地方,因为这意味着单凭费率卡无法解释这一差距。

标价算术再简单不过:输入上 $0.10 对 $0.75,便宜 7.5 倍;输出上 $0.50 对 $3.75,也是同样的比例。如果两个模型为相同的工作生成了相同数量的 token,那么这个比例就会直接体现在账单上。

这并不能延续下去,而且两种效应都对谷歌有利。Claude Haiku 5.5 的冗长程度,连其自家厂商都予以承认:Artificial Analysis 在运行该 Index 时记录到 4.4 亿输出 token,而中位数为 1 亿,并称该模型非常冗长。Gemini 3.8 Flash 生成了 1.7 亿,而中位数为 8100 万——同样被标记为冗长,但 token 数只有三分之一。Ant​hropic 自己的文档补充了第二种效应:Claude Haiku 5.5 使用了与 Claude 4.7 及更高版本共享的较新分词器,因此同一段文本所计的 token 数比它所取代的模型大约多 30%。

综合起来,对定价主张的诚实表述是这样的:输入费率有十比一的优势,输出费率有七点五比一的优势,其中一部分被一个每次作答写入更多词元的模型消耗掉,最终在按整个任务计费的衡量口径上落到六比一的优势。这仍然是一场碾压,只是比费率表所显示的幅度要小一些。

谷歌的价格上标有日期

谷歌定价页面上最有用的一点,是一句大多数对比表格都会略去的话。

Gemini 3.8 Flash 的标价为输入 $0.75、输出 $3.75,“截至 2026 年 12 月 31 日”,以及输入 $1.50、输出 $7.50,“自 2027 年 1 月 1 日起”。缓存输入将在同一天从 $0.075 涨至 $0.15。这是一个带有到期日的优惠价,就印在价格旁边,距本文撰写时大约还有十一周。

Anthropic 的卡片上没有任何内容是那样写的。Claude Haiku 5.5 的费率就是按费率本身标明的,采用与提示长度而非日历日期挂钩的两档结构,并承诺不早于 2027 年 10 月 7 日退役。如果你正在为一个延续到明年的流程建模,Google 一月份的调价是一次翻倍,理应纳入模型;而 Anthropic 并没有可与之对应的、需要提前规划的事件。

这话对双方都成立,而公正的解读并不是“一家供应商诚实,另一家不诚实”。促销价在其有效期内就是真实价格,谷歌有权以这种方式为发布定价。这只是比较中的一个事实:1月数据里看上去更便宜的那一方,恰恰是有截止期限的一方。

A screenshot of Anthropic's model documentation showing the Claude Haiku 5.5 specifications row and the published pricing table beneath it, with the per-million-token input, output and cache rates and the prompt-length threshold at which the second tier begins.

指数的哪两个点是值得的?

在一个满分到六十多的指数上,2.47分的差距既不是舍入误差,也不是天壤之别。两个模型处在同一工作区间内,而实际问题在于:这一差距是否会在你真正运行的任务上显现出来。

根据厂商自己公布的数据,这两者并非在同一测试框架上测量,因此无法直接对比——Ant​hropic 发布了 Claude Haiku 5.5 的 GDPval-AA v2.1、OSWorld 2.1、Terminal-Bench 4.0 和 FrontierCode 结果,Google 则发布了 Gemini 3.8 Flash 自己的一套结果,而且两家厂商都没有运行对方的测试套件。唯一可获得的同类比较是独立榜单,而在那里,答案是 Ant​hropic 领先,但优势可测量却很小。

对某些团队来说更要紧的能力差异在模态这一项上。Gemini 3.8 Flash 接受语音和视频输入;Claude Haiku 5.5 接受文本和图像。一条原生接入通话录音或屏幕录制的流水线,根本不会在价格上于这两个模型之间做选择——因为其中一个若不在前面加一道转录或抽帧步骤就干不了这活,而这道步骤自有其开销,也自有其失效模式。

运行这对中较便宜的一侧

Gemini 3.8 Flash 已按 Google 的列表价上架 OrcaRouter 目录,加价 0%,这一点在这里比平时更重要:该提供商的费率是直接透传的,而不是混合计算的,所以如果你想看看一月份的调价究竟会对账单产生什么影响,Google 那边一变,这个数字就会跟着动。Claude Sonnet 5.5 和 Claude Opus 5.5 也都在目录中,这就使三方路由测试——Google 的 Flash 一路、Anthropic 的中端一档,稍后再加一个 Anthropic 的小型一档——成为一种配置,而不是一个项目。一个密钥、一个 SDK,底层自动故障转移,以及路由 DSL(如果你更愿意在路由中而不是在应用代码中表达这种升级)。

Claude Haiku 5.5 本身尚未收录进目录,与其含糊带过,不如把这一点讲清楚。本次对比中 Anthropic 这一方目前只能在 Anthropic 处获取,而 Google 这一方今天就可以按上方所示的价格通过我们调用。

A screenshot of the OrcaRouter catalogue page for Gemini 3.8 Flash, showing the model identifier in provider-slash-model form, the provider Google, the model description and a stat strip carrying the per-million-token input and output rates alongside the context window and maximum output.

哪一个,给谁的

如果你的工作是文本输入、文本输出,提示词低于 100,000 个 token,并且你为真实用量按 token 付费,那么 Claude Haiku 5.5 在本文的每一项衡量标准下都是更便宜的模型,也是在唯一共享榜单上得分更高的那个——但要注意,其优势是每任务成本降到六分之一,而不是标价所暗示的十分之一。

如果你需要输入音频或视频,或者需要 65K 以上的响应,或者你的提示词经常很长,那么考量就变了:Gemini 3.8 Flash 能接受 Ant​hropic 小档位无法接受的输入,而在超过 100,000 token 后,Ant​hropic 自己的第二档定价远高于 Google 的统一费率。

唯一要牢牢盯住的是日期。Google 的费率在年底前有效,之后翻倍。Anthropic 的费率则报为固定价,并带有一个按长度变化的阶梯。无论你最终落在哪一边,都要先把日历做进电子表格,再搭建管道。