为“每个 token 更便宜,每个回答更贵”生成的 hero 卡片,徽标为“每次回答成本”,引题为“两个廉价档位,一块共享榜单”,副标题为“在 Intelligence Index v4.3.2 上,Claude Haiku 5.5 为 43.40,对比 Gemini 3.5 Flash-Lite 的 22.2。”四个信息标签写着“43.40 vs 22.2”、“$0.21 vs $0.12”、“$0.10 vs $0.30”和“$0.50 vs $2.50”。下方两张卡片分别标为“Anthropic 的优势”(“在共享榜单上高出二十一分,且两项计量都更便宜”)和“Google 的优势”(“完成同一任务更便宜,而且支持视频和音频”)。页脚写着“来自 Artificial Analysis 的独立评分与每任务成本;目录价格读取于 2026 年 10 月 8 日。”OrcaRouter 标志合成在右下角。
Guides & Insights

Claude Haiku 5.5 与 Gemini 3.5 Flash-Lite:每 Token 更便宜,每答案更昂贵

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Claude Haiku 5.5的输入价格为每百万个token 0.10美元,输出价格为每百万个token 0.50美元。Gemini 3.5 Flash-Lite在这两项计费指标上则分别为0.30美元和2.50美元。Anthropic模型的输入价格只有其三分之一,输出价格只有其五分之一,而在Artificial Analysis Intelligence Index v4.3.2上,它的得分为43.40,对手仅为22.2——在这个十分之差便意味着代际跃升的领域里,二十多分的差距尤为悬殊。无论是从价目表来看,还是从能力来看,这都不是一场势均力敌的较量。

在发票上,这是一次接近的比较,但结果却相反。把两个模型放在同一个独立测试平台上,并按完成的任务而非token计费,Gemini 3.5 Flash-Lite的单次回答成本更低。Artificial Analysis将Claude Haiku 5.5的每项智能指数任务成本定为0.21美元,而Gemini 3.5 Flash-Lite为0.1235美元——对于每输出一个token就要多付五倍费用的模型来说,这带来了1.7比1的优势。

这种反转正是整个对比的核心。Claude Haiku 5.5 取代了 Ant​hropic 有史以来推出的最廉价档位,并在共享榜单上击败了同区间的所有对手。Gemini 3.5 Flash-Lite 于 2026 年 7 月 21 日发布,自今年夏天以来一直是这一价位区间里的性价比之选。买家真正的问题并不是哪一个更好,因为这个问题已有定论。真正的问题是:面对一个必须低成本返回的请求,该把哪一个放到前面。

以下所有内容均以美元计,按每百万 token 计算。标价是各供应商自行公布的价格。归属于 Artificial Analysis 的独立评分、每任务成本数据和速度测量值均来自该评估方。Gemini 3.5 Flash-Lite 的延迟数据来自我们自己的计量流量。如果某个数字记录在我们保存的模型记录中,而不是当天从评估方页面上读取的,我们就将该评估方而非我们自己视为来源。

标签和发票不一致

每项任务成本的差距无法用价目表来解释,而弄清这一差距存在的原因,对于两个模型在投入生产环境之前都很有价值。

Claude Haiku 5.5 很啰嗦,评测方也明确这么说。在运行 Intelligence Index 时,Artificial Analysis 记录到该模型输出了 4.4 亿个输出 token,而所有模型的输出中位数为 1 亿个,并将其标记为非常冗长。思考按输出计费,思考默认开启,努力程度调节从 medium 起步,而对于账单主要来自输出的工作负载来说,低廉的输入费率帮不上忙。

Gemini 3.5 Flash-Lite 也并不简洁,但按任务计,它的成本明显更低。同一个榜单记录其每完成一个索引任务有 17,507 个输出 token——其中 10,405 个用于推理,7,102 个用于回答。把这个数字与 Ant​hropic 模型的 token 量放在一起,算术结果就清楚了:输出费率上五比一的优势,被一个会生成更大响应的模型部分抵消,而最终在任务层面剩下的,是小幅劣势,而不是大幅优势。

还有第二种更隐蔽的效应,也在以同样的方式起作用。Anthropic 的文档称,Claude Haiku 5.5 使用的是与 Claude 4.7 及后续版本相同的分词器,因此同一段文本的 token 数比它所取代的模型上大约多出 30%。相比 Google 的档位,费率降至三分之一。token 数并没有下降,而且在同一段文本上反而上升了。

两款模型,在关键数据上

缓存费率与目录价格来自 Anth​ropic 和 Goo​gle 各自的官方文档;独立数据引自 Artificial Analysis;实时延迟数据来自我们自身为期七天的流量窗口。缓存于 2026-10-08。

A generated scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.5 Flash-Lite - on the numbers that matter'. Claude Haiku 5.5 reads input $0.10 under 100K and $0.50 above, output $0.50 and $2.50, cached input $0.01 and $0.05, maximum output 128,000 tokens, input modality text and images, Intelligence Index v4.3.2 43.40, cost per task $0.21. Gemini 3.5 Flash-Lite reads input $0.30, output $2.50, cached input $0.03, maximum output 65,536 tokens, input modality text images video audio and files, Intelligence Index v4.3.2 22.2, cost per task $0.12. A footer reads 'Vendors' published list rates; independent scores and cost per task from Artificial Analysis.'

• 输入 — Claude Haiku 5.5:100,000 个 token 以内 $0.10,超出后 $0.50;Gemini 3.5 Flash-Lite:1,048,576 个 token 的窗口内统一 $0.30。

• 输出 — Claude Haiku 5.5 $0.50 最高 100,000 tokens,超出后 $2.50;Gemini 3.5 Flash-Lite $2.50 固定。

• 缓存输入 — Claude Haiku 5.5 最高 100,000 个 token 为 $0.01,超出部分为 $0.05;Gemini 3.5 Flash-Lite 为 $0.03。对于 Claude Haiku 5.5,缓存写入为每百万 token $0.125 和 $0.625。

• 上下文与输出——各一百万 token。Claude Haiku 5.5 的最大输出为 128,000 token,而 Gemini 3.5 Flash-Lite 为 65,536 token,因此 Ant​hropic 的上限大约翻倍。

• 输入模态——Claude Haiku 5.5 支持文本和图像;Gemini 3.5 Flash-Lite 支持文本、图像、视频、音频和文件。两者均返回文本。

• 独立评分——Claude Haiku 5.5 (Max) 为 43.40,在 Intelligence Index v4.3.2 的 182 个模型中排名第二;相比之下 Gemini 3.5 Flash-Lite 为 22.2,在 147 个中排名第九十六,处于该榜单的第 34 百分位。

• 独立单任务成本——$0.21,而同一块板卡上为 $0.1235。

• 吞吐量 — Artificial Analysis 为 Claude Haiku 5.5 测得每秒 241.9 个输出 token,相比之下,Gemini 3.5 Flash-Lite 在过去七天里于我们自己的 playground 上测得为 280.0。这是两套测试装置,而非同一套,所以应把它们看作数量级参考,而不是一场竞赛。

二十一个点,以及它们是由什么构成的

在一个能跑到六十多分的指数上,二十一分之差算不上什么差距。它意味着的,是一个模型究竟能撑起智能体循环,还是只配被交付一次规格明确的调用。

这两家厂商并不互相测试对方的评测框架,因此它们各自的测试套件无法对齐比较。Anthropic 公布了 Claude Haiku 5.5 在 GDPval-AA v2.1、OSWorld 2.1、Terminal-Bench 4.0 和 FrontierCode 上的结果;Google 公布了自己针对 Flash-Lite 层级的一套结果;双方都没有运行对方的评测。唯一可得的真正同类对比来自独立榜单,而在那里,Anthropic 的模型领先,且差距并不小。

评估方给 Gemini 3.5 Flash-Lite 的各项子分数,把这一档位的形态记录在案。它在 GPQA Diamond 上得 83.8%,在 SWE-Bench Pro 上得 54.2%,在 Terminal-bench 2.1 上得 54%,在 SciCode 上得 41.3%,在 MLE-Bench 上得 39.2%,在 Humanity's Last Exam 上得 18.8%。这些数字属于一个称职、廉价、通用型的档位——在知识类问题上很强,但在最难的推理与研究类评测上明显落后。综合得分 43.40 的 Claude Haiku 5.5 则完全处在另一个区间,而务实的解读是:需要在长周期内做多步规划的工作,根本不是 Goo​ogle 这一档位能干的活。

一百万个词元的窗口,六万五千五百三十六的回答

这两个上下文窗口大小相同,但它们不是同一款产品。

Gemini 3.5 Flash-Lite 上的长上下文会随着距离的增加而衰减,这种衰减在赢得信任之前值得先付出代价去评估。在 GDM-MRCR v2 这一八针检索评测中,当针位于 128,000 个 token 以内时,它平均达到 72.2%;而在百万 token 的逐点变体上则只有 21.3%。其 Long-Context Recall 指标为 76%,CharXiv Reasoning 在无工具时为 74.5%,有工具时为 76.5%。百万 token 的窗口是一项真实的能力;而能可靠地从其远端检索出信息,则是一项更小的能力,上述两个数字之间的差距正是二者之别。Claude 模型窗口尚未在同一评测板上以相同方式被测量,因此没有可供其参照的对应数字,本文也不会凭空捏造一个。

输出上限是更直接有用的差异。Claude Haiku 5.5 单次响应可输出 128,000 个令牌,而 Gemini 3.5 Flash-Lite 则止步于 65,536 个。如果你想要拿回的产物是一个长文件、一次完整迁移、一套生成的测试套件或转录级别的重写,那么这两个模型中有一个能通过单次调用完成,另一个则不能——而把任务拆成两次调用的成本超过单次调用的两倍,因为共享前缀会被发送两次。

A screenshot of the Artificial Analysis model page for Gemini 3.5 Flash-Lite, showing the model name over the provider Google, the release month July 2026, a one-million-token context window, the input modality list covering text, image, video, audio and PDF, an Intelligence Index v4.3.2 score of 22, the per-million-token input and output rates with the cached-input discount, and the measured output speed, total response time and cost per task.

音频和视频不是价格问题

Gemini 3.5 Flash-Lite 接受视频、音频和文件,费率与文本相同。Claude Haiku 5.5 接受文本和图像。

对于一条用于摄取录制通话、屏幕录制或监控视频的流水线,真正重要的能力差异并不在那二十一个指数点上。而在于:这些模型中的一个可以直接接收输入,另一个则需要在它前面加一个转录或抽帧阶段——第二个模型、第二笔账单,以及横亘在来源与答案之间的新故障模式。处于这种境地的团队并不是在两个便宜的档位之间做选择。他们是在一个模型和一条流水线之间做选择。

图像和文档则恰恰相反。两个模型都能原生读取图像,而 Claude Haiku 5.5 在综合评分上做到了 43.40,因此,对于不含音频的页面图像提取或图表理解类工作负载,应当依据这些数字、而不是模态论据,把它归到 Ant​hropic 这边。

从这里运行两者中的一个

Gemini 3.5 Flash-Lite 已上架 OrcaRouter 目录,按 Google 的标价提供,加价 0%,这意味着服务商的价格是原样透传而非混合计价,Google 价目表一变,你的账单会在他们收到变更的当天同步体现。面向 Google 这一层级,一个密钥加一个 SDK 就够了,与同样在目录中的 Claude Sonnet 5.5 和 Claude Opus 5.5 并列——因此拿一条 Google Flash-Lite 链路和一条 Anthropic 链路做 A/B 测试,已经只是一项配置,而非一个集成项目。底层还有自动故障转移,所以任何一条链路都不是单点故障,如果升级逻辑就该放在路由里,路由 DSL 也能在路由中表达该升级。

那段链路的延迟表现来自我们自己的测量,而非供应商的数据。在过去七天的实时流量中,Gemini 3.5 Flash-Lite 在每秒 280 个输出 token 的条件下,p50 一直保持在 2,426 毫秒,p95 为 8,600 毫秒,错误率为 0.313%。请把它当作一个滚动窗口,而不是一份承诺来理解:它会随流量和供应商状况的变化而变化,而对某条具体流水线来说,真正可信的数字是你自己计量一周后得到的那个。

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing the Anthropic model name and an October 2026 release, Intelligence Index v4.3.2 of 43 ranking second of 182, speed ninth of 182 at 241.9 output tokens per second, a $0.21 cost per task, input $0.10 and output $0.50 per million tokens, and a one-million-token context window.

Claude Haiku 5.5 不在目录中。它于 2026 年 10 月 7 日发布——就在本文撰写的前一天——而今天它在我们这里还无法路由调用,因此本次对比中 Anthropic 这一侧目前只能从 Anthropic 自身获取。把这一点直说出来,总好过留给读者去揣测。模型发布与模型能通过我们调用之间存在时间差是正常的,这并不构成关于何时弥合的承诺;正在规划迁移的读者,应当围绕自己能看到的日程来安排,而不是自己更希望的那个日程。

哪一个,给谁的

如果工作是文本输入、文本输出,如果提示词在100,000个token以内,并且任务需要多步规划或长时程智能体,那么Claude Haiku 5.5是更强的模型,高出二十一个百分点,而且每token更便宜,便宜三到五倍。应按每项任务的成本来预算,而不是按价目表,对于独立评审委员会衡量的那类工作,预计大约$0.21,并且在预测任何东西之前重新统计你的提示词,因为仅分词器的变化就会使计数变动约百分之三十。

如果任务简短、量大且以答案形态呈现——一个标签、一个类别、一次抽取、一个护栏决策——那么这笔账是偏向 Gemini 3.5 Flash-Lite 的,而且理由并不光鲜。一次输出极少的调用,账单主要由输入决定:两档输入价格分别是 $0.30 和 $0.10,而 Google 模型的任务足迹短得多,这意味着尽管它在标价上落了下风,更便宜的那档费率仍能在完成整项工作上胜出。一旦加入视频、音频或文件输入,这个选择就完全与价格无关了。

这组对比真正说明的,比“新的 Haiku 很便宜”要窄。它只说明:便宜档位上的标价费率,并不能很好地反映该档位实际会让你花多少钱;而在定价页上看起来贵三倍的模型,反而可能给你更小的账单。无论你最终选哪边,都要衡量你输出的 token,而不是你发送的 token,因为在这两个模型上,账单真正依据的计量器就是它。