
Claude Haiku 5.5 与 Gemini 3.5 Flash-Lite:每 Token 更便宜,每答案更昂贵
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Claude Haiku 5.5的输入价格为每百万个token 0.10美元,输出价格为每百万个token 0.50美元。Gemini 3.5 Flash-Lite在这两项计费指标上则分别为0.30美元和2.50美元。Anthropic模型的输入价格只有其三分之一,输出价格只有其五分之一,而在Artificial Analysis Intelligence Index v4.3.2上,它的得分为43.40,对手仅为22.2——在这个十分之差便意味着代际跃升的领域里,二十多分的差距尤为悬殊。无论是从价目表来看,还是从能力来看,这都不是一场势均力敌的较量。
在发票上,这是一次接近的比较,但结果却相反。把两个模型放在同一个独立测试平台上,并按完成的任务而非token计费,Gemini 3.5 Flash-Lite的单次回答成本更低。Artificial Analysis将Claude Haiku 5.5的每项智能指数任务成本定为0.21美元,而Gemini 3.5 Flash-Lite为0.1235美元——对于每输出一个token就要多付五倍费用的模型来说,这带来了1.7比1的优势。
这种反转正是整个对比的核心。Claude Haiku 5.5 取代了 Anthropic 有史以来推出的最廉价档位,并在共享榜单上击败了同区间的所有对手。Gemini 3.5 Flash-Lite 于 2026 年 7 月 21 日发布,自今年夏天以来一直是这一价位区间里的性价比之选。买家真正的问题并不是哪一个更好,因为这个问题已有定论。真正的问题是:面对一个必须低成本返回的请求,该把哪一个放到前面。
以下所有内容均以美元计,按每百万 token 计算。标价是各供应商自行公布的价格。归属于 Artificial Analysis 的独立评分、每任务成本数据和速度测量值均来自该评估方。Gemini 3.5 Flash-Lite 的延迟数据来自我们自己的计量流量。如果某个数字记录在我们保存的模型记录中,而不是当天从评估方页面上读取的,我们就将该评估方而非我们自己视为来源。
标签和发票不一致
每项任务成本的差距无法用价目表来解释,而弄清这一差距存在的原因,对于两个模型在投入生产环境之前都很有价值。
Claude Haiku 5.5 很啰嗦,评测方也明确这么说。在运行 Intelligence Index 时,Artificial Analysis 记录到该模型输出了 4.4 亿个输出 token,而所有模型的输出中位数为 1 亿个,并将其标记为非常冗长。思考按输出计费,思考默认开启,努力程度调节从 medium 起步,而对于账单主要来自输出的工作负载来说,低廉的输入费率帮不上忙。
Gemini 3.5 Flash-Lite 也并不简洁,但按任务计,它的成本明显更低。同一个榜单记录其每完成一个索引任务有 17,507 个输出 token——其中 10,405 个用于推理,7,102 个用于回答。把这个数字与 Anthropic 模型的 token 量放在一起,算术结果就清楚了:输出费率上五比一的优势,被一个会生成更大响应的模型部分抵消,而最终在任务层面剩下的,是小幅劣势,而不是大幅优势。
还有第二种更隐蔽的效应,也在以同样的方式起作用。Anthropic 的文档称,Claude Haiku 5.5 使用的是与 Claude 4.7 及后续版本相同的分词器,因此同一段文本的 token 数比它所取代的模型上大约多出 30%。相比 Google 的档位,费率降至三分之一。token 数并没有下降,而且在同一段文本上反而上升了。
两款模型,在关键数据上
缓存费率与目录价格来自 Anthropic 和 Google 各自的官方文档;独立数据引自 Artificial Analysis;实时延迟数据来自我们自身为期七天的流量窗口。缓存于 2026-10-08。

• 输入 — Claude Haiku 5.5:100,000 个 token 以内 $0.10,超出后 $0.50;Gemini 3.5 Flash-Lite:1,048,576 个 token 的窗口内统一 $0.30。
• 输出 — Claude Haiku 5.5 $0.50 最高 100,000 tokens,超出后 $2.50;Gemini 3.5 Flash-Lite $2.50 固定。
• 缓存输入 — Claude Haiku 5.5 最高 100,000 个 token 为 $0.01,超出部分为 $0.05;Gemini 3.5 Flash-Lite 为 $0.03。对于 Claude Haiku 5.5,缓存写入为每百万 token $0.125 和 $0.625。
• 上下文与输出——各一百万 token。Claude Haiku 5.5 的最大输出为 128,000 token,而 Gemini 3.5 Flash-Lite 为 65,536 token,因此 Anthropic 的上限大约翻倍。
• 输入模态——Claude Haiku 5.5 支持文本和图像;Gemini 3.5 Flash-Lite 支持文本、图像、视频、音频和文件。两者均返回文本。
• 独立评分——Claude Haiku 5.5 (Max) 为 43.40,在 Intelligence Index v4.3.2 的 182 个模型中排名第二;相比之下 Gemini 3.5 Flash-Lite 为 22.2,在 147 个中排名第九十六,处于该榜单的第 34 百分位。
• 独立单任务成本——$0.21,而同一块板卡上为 $0.1235。
• 吞吐量 — Artificial Analysis 为 Claude Haiku 5.5 测得每秒 241.9 个输出 token,相比之下,Gemini 3.5 Flash-Lite 在过去七天里于我们自己的 playground 上测得为 280.0。这是两套测试装置,而非同一套,所以应把它们看作数量级参考,而不是一场竞赛。
二十一个点,以及它们是由什么构成的
在一个能跑到六十多分的指数上,二十一分之差算不上什么差距。它意味着的,是一个模型究竟能撑起智能体循环,还是只配被交付一次规格明确的调用。
这两家厂商并不互相测试对方的评测框架,因此它们各自的测试套件无法对齐比较。Anthropic 公布了 Claude Haiku 5.5 在 GDPval-AA v2.1、OSWorld 2.1、Terminal-Bench 4.0 和 FrontierCode 上的结果;Google 公布了自己针对 Flash-Lite 层级的一套结果;双方都没有运行对方的评测。唯一可得的真正同类对比来自独立榜单,而在那里,Anthropic 的模型领先,且差距并不小。
评估方给 Gemini 3.5 Flash-Lite 的各项子分数,把这一档位的形态记录在案。它在 GPQA Diamond 上得 83.8%,在 SWE-Bench Pro 上得 54.2%,在 Terminal-bench 2.1 上得 54%,在 SciCode 上得 41.3%,在 MLE-Bench 上得 39.2%,在 Humanity's Last Exam 上得 18.8%。这些数字属于一个称职、廉价、通用型的档位——在知识类问题上很强,但在最难的推理与研究类评测上明显落后。综合得分 43.40 的 Claude Haiku 5.5 则完全处在另一个区间,而务实的解读是:需要在长周期内做多步规划的工作,根本不是 Gooogle 这一档位能干的活。
一百万个词元的窗口,六万五千五百三十六的回答
这两个上下文窗口大小相同,但它们不是同一款产品。
Gemini 3.5 Flash-Lite 上的长上下文会随着距离的增加而衰减,这种衰减在赢得信任之前值得先付出代价去评估。在 GDM-MRCR v2 这一八针检索评测中,当针位于 128,000 个 token 以内时,它平均达到 72.2%;而在百万 token 的逐点变体上则只有 21.3%。其 Long-Context Recall 指标为 76%,CharXiv Reasoning 在无工具时为 74.5%,有工具时为 76.5%。百万 token 的窗口是一项真实的能力;而能可靠地从其远端检索出信息,则是一项更小的能力,上述两个数字之间的差距正是二者之别。Claude 模型窗口尚未在同一评测板上以相同方式被测量,因此没有可供其参照的对应数字,本文也不会凭空捏造一个。
输出上限是更直接有用的差异。Claude Haiku 5.5 单次响应可输出 128,000 个令牌,而 Gemini 3.5 Flash-Lite 则止步于 65,536 个。如果你想要拿回的产物是一个长文件、一次完整迁移、一套生成的测试套件或转录级别的重写,那么这两个模型中有一个能通过单次调用完成,另一个则不能——而把任务拆成两次调用的成本超过单次调用的两倍,因为共享前缀会被发送两次。

音频和视频不是价格问题
Gemini 3.5 Flash-Lite 接受视频、音频和文件,费率与文本相同。Claude Haiku 5.5 接受文本和图像。
对于一条用于摄取录制通话、屏幕录制或监控视频的流水线,真正重要的能力差异并不在那二十一个指数点上。而在于:这些模型中的一个可以直接接收输入,另一个则需要在它前面加一个转录或抽帧阶段——第二个模型、第二笔账单,以及横亘在来源与答案之间的新故障模式。处于这种境地的团队并不是在两个便宜的档位之间做选择。他们是在一个模型和一条流水线之间做选择。
图像和文档则恰恰相反。两个模型都能原生读取图像,而 Claude Haiku 5.5 在综合评分上做到了 43.40,因此,对于不含音频的页面图像提取或图表理解类工作负载,应当依据这些数字、而不是模态论据,把它归到 Anthropic 这边。
从这里运行两者中的一个
Gemini 3.5 Flash-Lite 已上架 OrcaRouter 目录,按 Google 的标价提供,加价 0%,这意味着服务商的价格是原样透传而非混合计价,Google 价目表一变,你的账单会在他们收到变更的当天同步体现。面向 Google 这一层级,一个密钥加一个 SDK 就够了,与同样在目录中的 Claude Sonnet 5.5 和 Claude Opus 5.5 并列——因此拿一条 Google Flash-Lite 链路和一条 Anthropic 链路做 A/B 测试,已经只是一项配置,而非一个集成项目。底层还有自动故障转移,所以任何一条链路都不是单点故障,如果升级逻辑就该放在路由里,路由 DSL 也能在路由中表达该升级。
那段链路的延迟表现来自我们自己的测量,而非供应商的数据。在过去七天的实时流量中,Gemini 3.5 Flash-Lite 在每秒 280 个输出 token 的条件下,p50 一直保持在 2,426 毫秒,p95 为 8,600 毫秒,错误率为 0.313%。请把它当作一个滚动窗口,而不是一份承诺来理解:它会随流量和供应商状况的变化而变化,而对某条具体流水线来说,真正可信的数字是你自己计量一周后得到的那个。

Claude Haiku 5.5 不在目录中。它于 2026 年 10 月 7 日发布——就在本文撰写的前一天——而今天它在我们这里还无法路由调用,因此本次对比中 Anthropic 这一侧目前只能从 Anthropic 自身获取。把这一点直说出来,总好过留给读者去揣测。模型发布与模型能通过我们调用之间存在时间差是正常的,这并不构成关于何时弥合的承诺;正在规划迁移的读者,应当围绕自己能看到的日程来安排,而不是自己更希望的那个日程。
哪一个,给谁的
如果工作是文本输入、文本输出,如果提示词在100,000个token以内,并且任务需要多步规划或长时程智能体,那么Claude Haiku 5.5是更强的模型,高出二十一个百分点,而且每token更便宜,便宜三到五倍。应按每项任务的成本来预算,而不是按价目表,对于独立评审委员会衡量的那类工作,预计大约$0.21,并且在预测任何东西之前重新统计你的提示词,因为仅分词器的变化就会使计数变动约百分之三十。
如果任务简短、量大且以答案形态呈现——一个标签、一个类别、一次抽取、一个护栏决策——那么这笔账是偏向 Gemini 3.5 Flash-Lite 的,而且理由并不光鲜。一次输出极少的调用,账单主要由输入决定:两档输入价格分别是 $0.30 和 $0.10,而 Google 模型的任务足迹短得多,这意味着尽管它在标价上落了下风,更便宜的那档费率仍能在完成整项工作上胜出。一旦加入视频、音频或文件输入,这个选择就完全与价格无关了。
这组对比真正说明的,比“新的 Haiku 很便宜”要窄。它只说明:便宜档位上的标价费率,并不能很好地反映该档位实际会让你花多少钱;而在定价页上看起来贵三倍的模型,反而可能给你更小的账单。无论你最终选哪边,都要衡量你输出的 token,而不是你发送的 token,因为在这两个模型上,账单真正依据的计量器就是它。
