
Claude Haiku 5.5 对比 Gemma 4 12B:可亲手掌握的权重模型对决供应商 API
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Claude Haiku 5.5 和 Gemma 4 12B 实际上并不是在争夺同一个位置,而看清这一点最快的方法只用一句话:其中一个是 Apache-2.0 权重,你可以下载、量化并在自己的硬件上运行,另一个则只存在于 API 之后。Claude Haiku 5.5 于 2026 年 10 月 7 日发布,并立刻重新划定了小型层级能取得怎样的分数——在独立的 Artificial Analysis Intelligence Index 上得到 43 分。Gemma 4 12B 在同一榜单上为 14 分。这个差距极其巨大,但它并不是大多数团队最终要在两者之间做选择的原因。
通常,在任何基准测试被参考之前,选择就已经被迫确定了:一条受监管的流水线无法把 token 发送给供应商,一台没有可靠出站网络的边缘设备,以毫秒计的延迟预算,或者封闭 API 永远无法满足的微调要求。如果这些情况没有一条适用于你,那么答案毫无悬念。如果有一条适用,分数差距就不再重要,部署约束会决定一切。
董事会衡量了什么,以及何时衡量的
下方的独立数据来自 Artificial Analysis,而供应商费率来自 Anthropic 和 Google 自己的文档。它们是两类不同的数字,并且全文都如此标注。

• 独立评分——Claude Haiku 5.5 在智能指数上得分 43,在 182 个模型中排名第二。Gemma 4 12B(推理版)得分 14,在同类别 142 个模型中排名第 21。相差 29 分。
• 每百万 tokens 的输入价格 — Claude Haiku 5.5 在 100,000 tokens 以内为 $0.10,超出部分为 $0.50;Gemma 4 12B 为 $0.10。
• 每百万 token 的输出价格 —— Claude Haiku 5.5 为 0.50 美元(不超过 100,000 token),超出部分为 2.50 美元;Gemma 4 12B 为 0.30 美元。
• 上下文窗口 — Claude Haiku 5.5 为 1,000,000 个 token;Gemma 4 12B 为 262,000 个。
• 吞吐量 — Claude Haiku 5.5 为每秒 240.4 个输出 token;Gemma 4 12B 为 113.1,首 token 延迟 2.48 秒。
• 每个已完成 Index 任务的成本——Claude Haiku 5.5 为 0.21 美元。Gemma 4 12B 的每 token 成本足够低,使董事会的综合数字落在每百万 token 0.12 美元,但推导出的单任务成本并不是决定这一比较的应有依据。
• 权重 — Gemma 4 12B 采用 Apache 2.0 许可,可下载,约 120 亿参数的稠密模型。Claude Haiku 5.5 是专有模型;没有权重发布,也没有发布计划。
• 年龄 — Gemma 4 12B 自 2026 年 6 月起就已发布。写作本文时,Claude Haiku 5.5 才问世两天。
差距是29分,而价格差距几乎为零。
再看这两行价格:输入都是 $0.10,输出则是 $0.30 对 $0.50。Gemma 4 12B 更便宜,而且差距小到很容易被 token 数量淹没——Claude Haiku 5.5 更新的分词器意味着同样的文本会多出大约 30% 的 token,所以 Gemma 这边输出单价 40% 的原始优势,落到真实账单上基本就被抹平了。
所以,你为落后 29 个 Index 点的模型支付几乎相同的价格,或者为领先 29 个 Index 点的模型支付几乎相同的价格,这取决于你先读哪一列。这是实话,而且应当明说:在两者都能完成的任务上,按标价购买,Claude Haiku 5 是更划算的选择,而且它领先的优势,无论对较小的模型做多少提示工程都无法弥合。
因此,有趣的问题不是“哪个更好”,而是“我的队列中的哪些任务会让 Gemma 4 12B 失败”,而对这个问题的回答才是决定这场比较的唯一因素。
权重能带来什么 API 无法提供的东西

下载的模型是另一种资产,其优势是结构性的,而非渐进式的。
• 数据边界——使用 Gemma 4 12B 时,完全不涉及任何供应商。对于医疗、法律、国防或金融工作负载,这往往就是唯一重要的要求,而评分再高也无法让 API 变得可接受。
• 固定成本而非可变成本——一个量化为 4 比特的 12B 稠密模型可以轻松适配单个现代加速器。到那时,每个 token 的边际成本就是电力,而工作负载可以根据一台机器来规划规模,而不是依据一个计量表。
• 无出口流量,无网络延迟——本地部署的 12B 模型能在毫秒内作答,因为没有任何数据离开本机。供应商 API 需要付出一次往返和冷启动尾部延迟,而边缘部署根本没有这些。
• 微调与蒸馏——你可以用自己的数据对 Gemma 4 12B 进行适配,交付适配器并将其冻结。至于 Anthropic 是否有一天会允许你微调 Haiku 级别的模型,这不是能围绕其制定路线图的事情。
• 为你的路线图托底——权重不会在你脚下被弃用。Anthropic 承诺在 2027 年 10 月 7 日之前不会停用 Claude Haiku 5.5,这很大方,但带日期的承诺终究还是带日期的承诺。
• 说也奇怪,在模态方面——榜单记录显示 Gemma 4 12B 可接收文本、图像、语音和视频输入并输出文本,其输入面比 Claude Haiku 5.5 的文本加图像更宽。对于一条无需单独转写服务即可摄入音频的本地流水线来说,这是 API 一侧并不具备的实打实的能力。

12B 无法在接触中幸存的地方
同一个衡量那 29 分差距的榜单,也记录了小型稠密模型做不好的事情,而跳过它们会是不诚实的:
• 长上下文——262,000 个 token 对 1,000,000 个。把整个代码库或一整年的记录塞进单个提示词的流水线,在 Gemma 4 12B 上根本行不通;而将其切分成检索循环,又会额外引入更大的上下文窗口本可省去的工程工作。
• 智能体与计算机使用类工作——在这类任务中,小模型的失败悄无声息且代价高昂。Anthropic 自己公布的 Claude Haiku 5.5 厂商数据显示,OSWorld 2.1 的得分为 72.4%,而上一代 Haiku 仅为 15.7%;一个 Index 为 14 的 12B 模型并不是胜任这项工作的工具,而且即便考虑到尚无独立运行复现过这些数字,这里的厂商数据仍是有用的信号。
• 共享集群上的每美元吞吐量——托管实例上每秒 113 个 token 固然不错,但自托管的理由并不是速度,而单 GPU 部署还会更慢。
• 没有后备方案——如果你在生产环境中运行 Gemma 4 12B,那么你自己硬件的故障就是你的故障,除非你自己搭建一个,否则没有第二个供应商可供故障转移。
通过一个端点运行它们中的任意一个
OrcaRouter 今日已在目录中上架 Gemma 4 31B 和 Gemma 4 26B-A4B,按 Google 标价、0% 加价,但并未上架 12B——这一点值得明说,而不是含糊其辞地暗示相反。12B 可通过供应商自家的分发渠道以及多个第三方平台获取。Claude Haiku 5.5 同样尚未进入目录;它可从 Anthropic 的 API 及各大云平台获取。
路由器真正提供的,正是这种对比所要求的形态。把一个便宜的本地模型和一个昂贵的 API 模型做合理部署,并不是分叉——而是一条路由:由 Gemma 4 12B 或托管的 Gemma 4 变体来应对简单的多数请求,而触发质量或长度条件的请求则升级到 Anthropic 那条支路。Claude Haiku 4.5、Claude Sonnet 5.5 和 Claude Opus 5.5 现已上架目录,因此即使小模型层级的支路尚未可用,也能先搭建升级路径并进行负载测试。在 OrcaRouter 上,这种组合是一条路由 DSL 表达式和自动故障转移,而不是一项需要你维护的服务;再加上提供商标价以 0% 加价透传,任何一条支路的价格变动都会在发生当天实时生效。
该规则
选择 Claude Haiku 5.5,除非有某种限制条件把它排除在外。在标价几乎相同的情况下,它在 Index 上领先 Gemma 4 12B 29 分;它支持一百万 token 的上下文;而且在两者都能尝试的每一项任务上,它都是更强的模型。这场比较无论怎么进行,12B 都不可能凭实力胜出。
当约束本身才是重点时,选择 Gemma 4 12B——当 token 不能离开你的场所时,当预算是一台机器而不是一个计价器时,当你需要微调时,或者当你需要把权重握在手里,而不是一张费率卡和一个退役日期时。这些不是偏好,而是要求,而面对一项要求,29 分的差距根本不是决定性的数字。
