一张为“Claude Haiku 5.5 vs Gemma 4 12B”生成的主视觉卡片,由一条细分隔线划分为两个面板:左侧标注为“Claude Haiku 5.5”,带有“Index 43”和“专有 API”;右侧标注为“Gemma 4 12B”,带有“Index 14”和“Apache 2.0 权重”。页脚一行文字写着“分数依据 Artificial Analysis。”OrcaRouter 标志合成于右下角。
Guides & Insights

Claude Haiku 5.5 对比 Gemma 4 12B:可亲手掌握的权重模型对决供应商 API

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Claude Haiku 5.5 和 G​emma 4 12B 实际上并不是在争夺同一个位置,而看清这一点最快的方法只用一句话:其中一个是 Apache-2.0 权重,你可以下载、量化并在自己的硬件上运行,另一个则只存在于 API 之后。Claude Haiku 5.5 于 2026 年 10 月 7 日发布,并立刻重新划定了小型层级能取得怎样的分数——在独立的 Artificial Analysis Intelligence Index 上得到 43 分。G​emma 4 12B 在同一榜单上为 14 分。这个差距极其巨大,但它并不是大多数团队最终要在两者之间做选择的原因。

通常,在任何基准测试被参考之前,选择就已经被迫确定了:一条受监管的流水线无法把 token 发送给供应商,一台没有可靠出站网络的边缘设备,以毫秒计的延迟预算,或者封闭 API 永远无法满足的微调要求。如果这些情况没有一条适用于你,那么答案毫无悬念。如果有一条适用,分数差距就不再重要,部署约束会决定一切。

董事会衡量了什么,以及何时衡量的

下方的独立数据来自 Artificial Analysis,而供应商费率来自 Anthropic 和 Google 自己的文档。它们是两类不同的数字,并且全文都如此标注。

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Gemma 4 12B - the scoreboard'. The Claude Haiku 5.5 column reads independent score 43 (AA, #2 of 182), weights Proprietary API, context 1,000,000 tokens, input price $0.10 / 1M, output price $0.50 / 1M and throughput 240.4 tok/s. The Gemma 4 12B column reads independent score 14 (AA, #21 of 142), weights Apache 2.0 12B dense, context 262,000 tokens, input price $0.10 / 1M, output price $0.30 / 1M and throughput 113.1 tok/s. A footer line reads 'Both columns per Artificial Analysis; pricing per each vendor.'

• 独立评分——Claude Haiku 5.5 在智能指数上得分 43,在 182 个模型中排名第二。G​emma 4 12B(推理版)得分 14,在同类别 142 个模型中排名第 21。相差 29 分。

• 每百万 tokens 的输入价格 — Claude Haiku 5.5 在 100,000 tokens 以内为 $0.10,超出部分为 $0.50;Gemma 4 12B 为 $0.10。

• 每百万 token 的输出价格 —— Claude Haiku 5.5 为 0.50 美元(不超过 100,000 token),超出部分为 2.50 美元;G​emma 4 12B 为 0.30 美元。

• 上下文窗口 — Claude Haiku 5.5 为 1,000,000 个 token;Gemma 4 12B 为 262,000 个。

• 吞吐量 — Claude Haiku 5.5 为每秒 240.4 个输出 token;G​emma 4 12B 为 113.1,首 token 延迟 2.48 秒。

• 每个已完成 Index 任务的成本——Claude Haiku 5.5 为 0.21 美元。Gemma 4 12B 的每 token 成本足够低,使董事会的综合数字落在每百万 token 0.12 美元,但推导出的单任务成本并不是决定这一比较的应有依据。

• 权重 — Gemma 4 12B 采用 Apache 2.0 许可,可下载,约 120 亿参数的稠密模型。Claude Haiku 5.5 是专有模型;没有权重发布,也没有发布计划。

• 年龄 — G​emma 4 12B 自 2026 年 6 月起就已发布。写作本文时,Claude Haiku 5.5 才问世两天。

差距是29分,而价格差距几乎为零。

再看这两行价格:输入都是 $0.10,输出则是 $0.30 对 $0.50。G​emma 4 12B 更便宜,而且差距小到很容易被 token 数量淹没——Claude Haiku 5.5 更新的分词器意味着同样的文本会多出大约 30% 的 token,所以 G​emma 这边输出单价 40% 的原始优势,落到真实账单上基本就被抹平了。

所以,你为落后 29 个 Index 点的模型支付几乎相同的价格,或者为领先 29 个 Index 点的模型支付几乎相同的价格,这取决于你先读哪一列。这是实话,而且应当明说:在两者都能完成的任务上,按标价购买,Claude Haiku 5 是更划算的选择,而且它领先的优势,无论对较小的模型做多少提示工程都无法弥合。

因此,有趣的问题不是“哪个更好”,而是“我的队列中的哪些任务会让 G​emma 4 12B 失败”,而对这个问题的回答才是决定这场比较的唯一因素。

权重能带来什么 API 无法提供的东西

A screenshot of the Artificial Analysis page for Gemma 4 12B (Reasoning), showing an Intelligence Index of 14 at rank 21 of 142, speed rank 19 of 142, input $0.10 and output $0.30, 113.1 output tokens per second, a summary noting text, image, speech and video input with text output and a 262k-token context window, and the note that the score places it well above the median of 8 for comparable models.

下载的模型是另一种资产,其优势是结构性的,而非渐进式的。

• 数据边界——使用 G​emma 4 12B 时,完全不涉及任何供应商。对于医疗、法律、国防或金融工作负载,这往往就是唯一重要的要求,而评分再高也无法让 API 变得可接受。

• 固定成本而非可变成本——一个量化为 4 比特的 12B 稠密模型可以轻松适配单个现代加速器。到那时,每个 token 的边际成本就是电力,而工作负载可以根据一台机器来规划规模,而不是依据一个计量表。

• 无出口流量,无网络延迟——本地部署的 12B 模型能在毫秒内作答,因为没有任何数据离开本机。供应商 API 需要付出一次往返和冷启动尾部延迟,而边缘部署根本没有这些。

• 微调与蒸馏——你可以用自己的数据对 G​emma 4 12B 进行适配,交付适配器并将其冻结。至于 A​nthropic 是否有一天会允许你微调 Haiku 级别的模型,这不是能围绕其制定路线图的事情。

• 为你的路线图托底——权重不会在你脚下被弃用。A​nthropic 承诺在 2027 年 10 月 7 日之前不会停用 Claude Haiku 5.5,这很大方,但带日期的承诺终究还是带日期的承诺。

• 说也奇怪,在模态方面——榜单记录显示 Gemma 4 12B 可接收文本、图像、语音和视频输入并输出文本,其输入面比 Claude Haiku 5.5 的文本加图像更宽。对于一条无需单独转写服务即可摄入音频的本地流水线来说,这是 API 一侧并不具备的实打实的能力。

A screenshot of the Hugging Face model card for gemma-4-12B, showing the Google uploader, the 'Any-to-Any' and 'Transformers / Safetensors' tags, the gemma4_unified_image-text-to-text identifier, 'Eval Results', 'Model card', 'Files and versions' and 'Community' tabs, a licence line reading 'License: Apache 2.0, Authors: Google DeepMind', and the opening of the card describing the Gemma 4 12B Unified model as sharing the multimodal functionality of Gemma 4 E2B and E4B with native audio and vision understanding and no separate encoders.

12B 无法在接触中幸存的地方

同一个衡量那 29 分差距的榜单,也记录了小型稠密模型做不好的事情,而跳过它们会是不诚实的:

• 长上下文——262,000 个 token 对 1,000,000 个。把整个代码库或一整年的记录塞进单个提示词的流水线,在 Gemma 4 12B 上根本行不通;而将其切分成检索循环,又会额外引入更大的上下文窗口本可省去的工程工作。

• 智能体与计算机使用类工作——在这类任务中,小模型的失败悄无声息且代价高昂。Anthropic 自己公布的 Claude Haiku 5.5 厂商数据显示,OSWorld 2.1 的得分为 72.4%,而上一代 Haiku 仅为 15.7%;一个 Index 为 14 的 12B 模型并不是胜任这项工作的工具,而且即便考虑到尚无独立运行复现过这些数字,这里的厂商数据仍是有用的信号。

• 共享集群上的每美元吞吐量——托管实例上每秒 113 个 token 固然不错,但自托管的理由并不是速度,而单 GPU 部署还会更慢。

• 没有后备方案——如果你在生产环境中运行 Gemma 4 12B,那么你自己硬件的故障就是你的故障,除非你自己搭建一个,否则没有第二个供应商可供故障转移。

通过一个端点运行它们中的任意一个

OrcaRouter 今日已在目录中上架 Gemma 4 31B 和 Gemma 4 26B-A4B,按 Google 标价、0% 加价,但并未上架 12B——这一点值得明说,而不是含糊其辞地暗示相反。12B 可通过供应商自家的分发渠道以及多个第三方平台获取。Claude Haiku 5.5 同样尚未进入目录;它可从 A​nthropic 的 API 及各大云平台获取。

路由器真正提供的,正是这种对比所要求的形态。把一个便宜的本地模型和一个昂贵的 API 模型做合理部署,并不是分叉——而是一条路由:由 G​emma 4 12B 或托管的 G​emma 4 变体来应对简单的多数请求,而触发质量或长度条件的请求则升级到 A​nthropic 那条支路。Claude Haiku 4.5、Claude Sonnet 5.5 和 Claude Opus 5.5 现已上架目录,因此即使小模型层级的支路尚未可用,也能先搭建升级路径并进行负载测试。在 OrcaRouter 上,这种组合是一条路由 DSL 表达式和自动故障转移,而不是一项需要你维护的服务;再加上提供商标价以 0% 加价透传,任何一条支路的价格变动都会在发生当天实时生效。

该规则

选择 Claude Haiku 5.5,除非有某种限制条件把它排除在外。在标价几乎相同的情况下,它在 Index 上领先 Gemma 4 12B 29 分;它支持一百万 token 的上下文;而且在两者都能尝试的每一项任务上,它都是更强的模型。这场比较无论怎么进行,12B 都不可能凭实力胜出。

当约束本身才是重点时,选择 Gemma 4 12B——当 token 不能离开你的场所时,当预算是一台机器而不是一个计价器时,当你需要微调时,或者当你需要把权重握在手里,而不是一张费率卡和一个退役日期时。这些不是偏好,而是要求,而面对一项要求,29 分的差距根本不是决定性的数字。