一张生成的主视觉卡片,标题为“Claude Haiku 5.5 vs Gemini 3.6 Flash”,肩题为“每个答案的成本高出 7.5 倍”,展示 Claude Haiku 5.5 的输入 $0.10、输出 $0.50、指数 43.40,对比 Gemini 3.6 Flash 的输入 $0.75、输出 $3.75、指数 33.98,下方横条写着“每个已完成任务的成本 $0.21 vs $1.60”。
Engineering & Research

Claude Haiku 5.5 对比 Gemini 3.6 Flash:每次回答的成本高出 7.5 倍,模型得分低九个百分点

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Claude Haiku 5.5和Gemini 3.6 Flash分别处于各自产品线中的同一层级——小巧、快速、便宜的那一档——而相似之处也仅止于此。在 Artificial Analysis Intelligence Index v4.3.2 上,Claude Haiku 5.5 在其 Max 配置下得分为 43.40,而 Gemini 3.6 Flash 在其 High 配置下为 33.98。在同一次运行中,Claude Haiku 5.5 完成一个 Index 任务花费 0.21 美元,而 Gemini 3.6 Flash 花费 1.60 美元。

要把这一对放在一起看,因为单看其中任何一个都会产生误导。更便宜的模型并非只是略便宜一点;它每完成一个任务的成本要低 7.5 倍。而它所击败的模型也并非只是稍弱一点;它的指数低了 9.42 个点,在 182 个模型的榜单上,这相当于上四分位数与中位数之间的差距。

这两个事实都来自同一次独立运行,这一点很重要,因为这里的厂商卡片并未告诉你其中任何一项。Anthropic 于 2026 年 10 月 7 日发布了 Claude Haiku 5.5;Google 于 2026 年 7 月 21 日推出了 Gemini 3.6 Flash。二者之间相隔的三个月才是有意思的部分。

两张卡片并排。

每百万个 token 以美元计。Anthropic 和 Google 的费率来自它们各自的定价文档;共享行来自 Artificial Analysis Intelligence Index v4.3.2。缓存于 2026-10-08。

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.6 Flash — the scoreboard' with rows Index v4.3.2 43.40 against 33.98, cost per task $0.21 against $1.60, input price $0.10 against $0.75, output tokens per task 162,164 against 41,606, Terminal Bench 4.0 0.3283 against 0.0707 and input modality 'text, image' against 'text, image, video, audio', footed 'All figures per Artificial Analysis Intelligence Index v4.3.2; Gemini 3.6 Flash is flagged deprecated on the board.'

• 输入 — Claude Haiku 5.5:100,000 个 token 以内 $0.10,超出后 $0.50;Gemini 3.6 Flash:今日统一价 $0.75,将于 2027 年 1 月 1 日上涨至 $1.50。

• 输出 — Claude Haiku 5.5:100,000 个 token 以内为 0.50 美元,超出部分为 2.50 美元;Gemini 3.6 Flash:目前统一为 3.75 美元,将于同一日期上涨至 7.50 美元。

• 缓存输入 — Claude Haiku 5.5 为 $0.01 和 $0.05;Gemini 3.6 Flash 为 $0.075,另加每百万 token 每小时 $0.50 的存储费用。

• 上下文与输出上限——两者均为 100 万 tokens。Claude Haiku 5.5 将单次响应上限设为 128,000 tokens;Gemini 3.6 Flash 则为 65,536。

• 模态——Claude Haiku 5.5 支持文本和图像。Gemini 3.6 Flash 支持文本、图像、视频、音频和文件。这是谷歌一方毫无争议领先的唯一一行,而对于媒体理解流水线来说,这一项就能决定整个问题的答案。

• 独立评分——Claude Haiku 5.5(Max)为 43.40,而 Gemini 3.6 Flash(High)为 33.98。

• 每项已完成任务的成本——在同一次评估运行中,0.21 美元对 1.60 美元。

A capture of Anthropic's Claude Platform models documentation showing the Claude model comparison table — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 'This model', the latter reading 1M context, 128K max output, 'From $0.10/$0.50', latency 'Fastest', default effort medium — above the Claude Haiku 5.5 specifications block with model ids claude-haiku-5-5, the pricing lines $0.10/$0.50 up to 100,000 tokens and $0.50/$2.50 over it, and the release line 'Released October 7, 2026'.

为什么该用的是按任务而非按 token 的数值

费率卡倍数在输入上看起来已经是 7.5,在输出上也是 7.5,所以这里的每任务数字并不令人意外——但值得说明的是,为什么这两个模型在一个指标上落在同一位置,而在另一个指标上却相差如此之大,因为同样的算术在这批其他对比中会得出相反的结果。

Gemini 3.6 Flash 是较不啰嗦的那一个。它在每项 Intelligence Index 任务中输出 41,606 个 token——其中 20,061 个用于推理,21,545 个用于作答;而 Claude Haiku 5.5 为 162,164 个,分为 129,047 个推理 token 和 33,118 个作答 token。Anthropic 的模型完成同样的工作却要消耗近四倍的 token,而且它的输出速率只有 Google 的七分之一,因此 token 差距与速率差距是相乘的,而非相互抵消。

这种组合——低廉的计价乘以高频使用——才是对 Claude Haiku 5.5 经济账的诚实描述,而 Anthropic 自己的发布文章也承认了它的另一面:该模型“在用于提示词最多 100,000 个 token 的任务时尤其物有所值,这类请求约占我们上一代 Haiku 模型请求量的 90%。”一旦超过 100,000 个 token,输入计价就变为 $0.50,输出计价变为 $2.50,此时相对 Gemini 3.6 Flash 的倍数就缩小到约 1.5 倍。

当这项对比停滞不前时,Google 自家的层级做了什么

正是在这里,这篇文章不再只是两个模型的对比,而变成了一个警告:提醒你实际比较的究竟是哪一个 Gemini。

谷歌已让 Flash 的价格在三代产品之间保持不变。在谷歌自家的定价文档中,Gemini 3.6 Flash、Gemini 3.7 Flash 和 Gemini 3.8 Flash 的标价均为输入 $0.75、输出 $3.75,缓存费率同为 $0.075,并且同样会在 2027 年 1 月 1 日上调至 $1.50 和 $7.50。谷歌为 3.6 系列提供的说明卡片将其描述为“我们的上一代 Flash 模型”,这是厂商自己对它的说法。

变的是分数,不是价格。在独立评测榜上,Gemini 3.6 Flash 得分 33.98,Gemini 3.7 Flash 为 39.06,Gemini 3.8 Flash 为 40.93——均为各自公开的最高强度配置。六周之内,Google 的 Flash 档位提升了九个指数点,而价格分文未变。

对于任何正处于评估过程中的人来说,后果是具体的:如果你在三周前用 Gemini 3.7 Flash 对这场对决进行了基准测试,那么你的结果已经过时;而如果你用 Gemini 3.8 Flash 来测试,它与 Claude Haiku 5.5 的差距会缩小到 2.47 分。Gemini 3.6 Flash 是这一对比中最抬举 Anthropic 的版本,同时也是 Google 离真正销售最远的版本。

Artificial Analysis 将 3.6 条目标记为已弃用。谷歌的定价文档仍公布该费率,其模型列表也仍指向 3.6 章节,因此诚实的解读不是“已消失”,而是“在十周内于自己的系列内部被取代了两次”——这是关于这一档位变化有多快的事实,而不是跳过比较的理由。

这实际上是为谁做决定

Gemini 3.6 Flash 确实有充分的理由值得关注,而这个理由并非跑分。

如果你需要在提示中使用音频或视频,Claude Haiku 5.5 完全做不到——它只能读取文本和图像,除此之外什么也不行。Gemini 3.6 Flash 能读取文本、图像、视频、音频和文件,而我们自己的目录记录显示,在过去一周里,它以实测每秒 582 个输出 token 的速度运行,首个 token 的中位时间为 4.1 秒,即便以 Flash 的标准来看,这也是一款很快的模型。对于媒体理解流水线来说,模态清单就是全部决策依据,而索引差距不过是脚注。

如果你的工作内容是文本和图片,这笔账的差距大到根本没什么可争的。在 7:2:1 的输入为主配比下——也就是大多数生产流量的形态——Claude Haiku 5.5 为每 token 0.077 美元,而 Gemini 3.6 Flash 为 0.63 美元。按每天超过一百万 token 计算,就是 77 美分对 6.30 美元;而且到 2027 年 1 月 1 日,第二个数字还会变得更难看,第一个却纹丝不动。

10 万 token 这道临界悬崖,是唯一能扭转结论的条件。一条检索或长文档流水线如果经常拼装出 15 万 token 的提示词,就要为整个请求按 Anthropic 的 $0.50/$2.50 档位付费,而到了那个量级,两个模型的价格差距已经缩到 1.5 倍以内,同时 Gemini 3.6 Flash 在多模态上仍然占优,在 Google 公布的、平均 128k 长度下多针检索 91.8% 这一数据上也仍然占优。这是厂商自报且未经复现的数据,就应该原样放在这样的限定框架里来说。

A capture of the OrcaRouter model page for Gemini 3.6 Flash under google/gemini-3.6-flash, showing a 65K maximum output, text, image, video, file and audio input, public benchmarks published by Google dated 2026-07-21, a p50 time to first token of 4.1 seconds, and the page's own description of the model as Google's fast, cost-efficient multimodal model in the Gemini 3 family with a 1M-token context window.

调用两者,或调用一个

Gemini 3.6 Flash 今天已上架 OrcaRouter 目录,模型标识为 google/gemini-3.6-flash,按 Google 官方标价、0% 加价提供——输入 $0.75、输出 $3.75,缓存读取 $0.075,完全按提供商的收费原样传递。这对这个特定模型尤为重要,因为 Google 1 月 1 日的调价是一次费率变更,而直通式目录会在变更发生当天就同步,不必等到下一次合同续签。一个 API 密钥、一次 SDK 调用,即可使用该模型或目录中 200 多个其他模型中的任意一个,因此要在 Google 这一路与 Anthropic 那一路之间做 A/B 测试,只需改一个模型字符串,底层还有自动故障转移,而无需再接入第二套集成。

Claude Haiku 5.5 已收录在目录中。Anthropic 的模型可通过 Anthropic 自己的 API 以及 AWS、Google 和 Microsoft Azure 访问,这就是诚实答案的全部内容。我们从该系列中确实提供的是Claude Sonnet 5.5 和 Claude Opus 5.5——这正是为何从廉价的分类调用升级到中端智能体调用的路径不过是一项路由决策,而不是一个项目。

这让结论简单到可以直接明说。在较短提示词下的文本与图像任务中,除响应上限之外,Claude Haiku 5.5 在所有维度上都胜出。而对于任何涉及音频或视频的内容,两者之中只有 Gemini 3.6 Flash 能作答——如果你打算为这项能力支付谷歌的价格,那就得问清楚你付的是哪一个 Gemini,因为在这一档位上,花同样的钱,你可以从更新一代的同门型号那里多拿到九个指数分。

一个 API 接入 200 多个模型、一个密钥,自动故障转移在底层完成,因此 Google 线路与 Anthropic 线路之间的 A/B 测试只需更改模型字符串,而无需再做一次集成。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新