一张生成的 hero 卡片,标题为“Claude Haiku 5.5 vs Sakana Namazu”,包含两个并排面板。左侧面板 Claude Haiku 5.5 列出“通用型”、“$0.10 / $0.50 每 1M”和“指数 43”。右侧面板 Sakana Namazu 列出“日语专精”、“$0.95 / $4.00 每 1M”和“仅厂商基准测试”。其下方一条通栏横条写着“同样是快而便宜的路子,专长却相反。”页脚写着“指数数据来自 Artificial Analysis;Namazu 数据来自 Sakana AI,未经审计。”OrcaRouter 标志合成在右下角。
Guides & Insights

Claude Haiku 5.5 与 Sakana Namazu:都便宜,都快,除此之外几乎毫无共同点

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

表面上看,这两个模型像是同类。Claude Haiku 5.5是该厂商的小型快速层级,于2026年10月7日发布,每百万输入令牌0.10美元,每百万输出0.50美元,拥有一百万令牌的窗口,专为分类、提取、路由和子代理工作而打造。Sakana Namazu是Sakana AI的日语专用API模型,于2026年8月3日推出,每百万输入令牌收费0.95美元,每百万输出4.00美元,缓存输入费率为0.15美元,在开源Kimi K2.6基础之上用Sakana自己的后训练进行精调,并可通过兼容OpenAI的端点使用。

它们都被定位为各自产品线中的平价选择,而相似之处也仅止于此。Claude Haiku 5.5 是一个通用型西方模型,你会用它来路由流量;Sakana Namazu 则是一个面向特定国家的专用模型,当任务涉及日语,而替代方案是一个做得很差的通用模型时,你会求助于它。有趣的问题不是哪个更好,而是专精能为你带来什么,这种专精的边界究竟在哪里,以及离开它需要付出什么代价。

Sakana AI 实际构建了什么

Sakana Namazu 值得在任何比较之前先被了解,因为它的构建方式不同寻常。它不是从零开始训练的。它是对现有开放权重模型——Kimi K2.6——的改进,Sakana 对其进行了进一步后训练,并将它作为闭源 API 提供服务。其渊源很重要:基础模型的通用推理和编码能力是继承而来的,而 Sakana 添加的是日本专属层。

这一层是有文档记录的,而大多数本地化声明都做不到这一点。Sakana 报告称,Namazu 在通用评估——AIME26、MMLU-Pro、LiveCodeBench v6——上保留了基础模型的性能,同时在日语及日本特定评估集上超越了它,其中 FairPoliticsQA 从 34.10% 升至 56.30%。它还运行自有的内部日语翻译基准 JFBench,并报告在该基准上也全面有所提升。另一项独立案例研究——一个面向医生的证据查找工具——报告称其在第119届全国医师资格考试中达到 96.8%,在第120届中达到 96.4%。

那些是 Sakana 在 Sakana 自家基准上的数字,而 JFBench 并不是任何其他人都能复现的公共标准。经得起这一限定条件的说法虽然范围有限,但确实成立:该模型是一个有名称的基础模型加上一个有文档记录的后训练步骤,而且报告的提升幅度是相对于它自己的基础模型,而不是相对于整个领域。

API 和商业条款是决定大多数商业案例的部分。Namazu 兼容 OpenAI——根据 Sakana 自己的文档,只需更改端点以及 sakana-namazu 模型名称,这是唯一需要修改的代码。它以美元计费,并在 Enterprise 方案上提供日元支付。它还带有按 token 比较永远无法显现的工具成本:每千次网络搜索调用 7.00 美元,以及每小时代码执行 0.12 美元,Sakana 将这些打包进了产品中。

有两条约束比价目表上的任何数字都更重要。根据 Sakana 自己的页面,由于有待完成的 GDPR 相关合规工作,Namazu 目前在欧盟、欧洲经济区、英国和瑞士均不可用。而默认数据处理政策规定,输入内容可能会被用于训练和改进 Sakana 的模型,并可在 Console 设置中选择退出;该公司表示,目前无法保证处理完全留在日本境内。对欧洲或英国团队而言,第一条就直接构成排除条件,第二条则是在第一次通话前就必须回答的问题。

坦率陈述的边界

这一节正是规格表对比会误导你的地方,所以下面才是真正可比较的内容:

• 价格 — Claude Haiku 5.5 每百万 token 输入 $0.10、输出 $0.50,提示词最多 100,000 token,超出后为 $0.50 和 $2.50。Sakana Namazu 为 $0.95 和 $4.00,缓存输入费率为 $0.15。在第一档价格下,Namazu 的输入成本约为其九倍半,输出成本为八倍。

• 缓存 — Claude Haiku 5.5 的缓存读取价格视档位而定,每百万次分别为 0.01 美元和 0.05 美元;Sakana Namazu 的则是固定 0.15 美元。在最高档位,绝对数字很接近;在最低档位,则相差 29 倍。

• 工具——两者都不是纯文本模型,计费方式也不相同。Claude Haiku 5.5 自带自适应思考,提供从 Low 到 Max 的努力程度调节旋钮,并支持服务端工具;Sakana Namazu 以每千次调用 7.00 美元打包提供网络搜索,代码执行则为每小时 0.12 美元。

• 上下文 — Claude Haiku 5.5 为一百万个 token。Sakana 未公布 Namazu 的上下文窗口,任何你看到的为其引用的数字,都是关于 Kimi K2.6 基座的假设,而非规格。

• 独立评分——Claude Haiku 5.5 在 Artificial Analysis 智能指数上的得分为 43,在该榜单同类模型中位列 182 个之中的第二,每个智能指数任务的成本为 0.21 美元。Sakana Namazu 没有 Artificial Analysis 的收录条目,我也找不到任何形式的第三方评测。其公布的数据均出自其自身。

• 可用性——Claude Haiku 5.5 已在 Claude API、Amazon Bedrock、Vertex AI、Microsoft Foundry 和 Claude Platform on AWS 上提供,并已公布退役承诺:不早于 2027 年 10 月 7 日。Sakana Namazu 可在 Sakana 自有 API、Sakana Chat 和 Sakana Translate 产品上使用,但在欧盟、欧洲经济区、英国和瑞士不可用。

• 数据处理 — 供应商的条款符合企业级标准,且模型的思考块作用域限定在生成它们的账户内。Sakana Namazu 的默认设置是输入可能被用于训练,并提供退出选项。

• 模态 — Claude Haiku 5.5 支持文本和图像;除其文本优先的定位外,Sakana Namazu 的模态覆盖范围并未公布。

• 许可与源流——Claude Haiku 5.5 是专有模型,且仅通过 API 提供。Sakana Namazu 虽为专有模型,却构建于开放的 Kimi K2.6 权重之上,这意味着其基座模型可供审查,而经过调优的模型则不然。

诚实的评分问题

读一读那份清单,注意其中缺了什么:没有任何一行说明哪个模型的日语输出更好。这不是疏忽。它们之间并不存在一个能定论此事的共同基准。Claude Haiku 5.5 出色的日语表现并非厂商作为主打卖点来宣传的,而 Sakana 的 JFBench 数据用的也是它自家的评测工具。一个是来自具备强大多语言能力厂商的通用前沿级小模型,另一个是基于 Kimi、专门针对日语做过后训练的模型,把二者放在一起比较,这样的对比从来没有人真正做过并公开发表过。

可以说,这是结构性的,而不是经验性的。Namazu 的整个商业定位都基于一个主张:通用模型不足以胜任日语工作——国别特定的语言、文化推断和本土语境是一种独特能力,足以证明以九倍价格溢价提供专用模型是合理的。如果你相信这一主张,Namazu 就是答案,而价格就是答案的代价。如果你不相信,那么每百万 token 0.10 美元的通用模型就是你的选择,问题在于你能否在自己的流量上衡量出差异。

这一说法可度量的版本,是 Sakana 提供的那一个:FairPoliticsQA 相对于其微调所基于的基础模型,从 34.10% 提升到 56.30%。这在一个真实基准上是真实的改进,但它是与 Kimi K2.6 的比较,而不是与 Claude Haiku 5.5 的比较——它告诉你,针对日本特定政治背景的后训练在该任务上带来了提升,这是一个比“更擅长日语”更狭窄、也更站得住脚的说法。

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Sakana Namazu - the scoreboard', with six rows carrying both sides. Input price: $0.10 / 1M against $0.95 / 1M. Output price: $0.50 / 1M against $4.00 / 1M. Cached input: $0.01 to $0.05 / 1M against $0.15 / 1M. Focus: general purpose against Japanese language and context. Lineage: proprietary against Kimi K2.6 post-trained. Independent index: 43 against no entry. The footer reads 'Claude Haiku 5.5 index per Artificial Analysis; Namazu figures per vendor.' The OrcaRouter logo is composited in the bottom-right corner.

在规模化情况下,成本差距是什么样的

以每天 1000 万输入 token 和 200 万输出 token 的规模,让两者各跑一条中等规模的流水线。

• 每日输入成本 — Claude Haiku 5.5 为 1.00 美元,Sakana Namazu 为 9.50 美元。

• 输出成本,每日 — Claude Haiku 5.5 上为 $1.00,Sakana Namazu 上为 $8.00。

• 每日总计 — 2.00 美元对 17.50 美元,大约每月 60 美元对 525 美元。

这525美元还不包含任何一次网络搜索调用或一小时的代码执行。每天再加上500次搜索调用,Namazu每天还要多花3.50美元,总计达到21.00美元,而对方只要2.00美元——超过十比一的差距,再高的token效率也无法弥合。

这算不算多,完全取决于替代方案是什么。如果你选的是 Namazu,或是一个产出的日语质量平平、需要审核员手动修正的通用模型,那么这 525 美元换回的是审核员的时间,比较就不是 token 对 token,而是 token 对薪资。如果你的日语流量很常规,而且通用模型已经足够好,那这笔溢价就买不到任何可衡量的回报,而同样的钱花在别处能买到十倍的用量。

第三种选择对一款日语产品来说才是有意思的:在专业模型所宣称的优势确实成立的地方使用它——翻译、本土语境、监管与政治文本——而在其周边的大量工作上使用通用模型。这并不是一种妥协。这正是定价实际上所暗示的架构,因为 Namazu 的溢价是按 token 支付的,而没有任何理由在分类任务上支付它。

A headless capture of Anthropic's Claude Platform model documentation showing the Models overview comparison table with the Claude Haiku 5.5 column alongside Claude Fable 5.1, Claude Opus 5.5 and Claude Sonnet 5.5, including the 'From $0.10 / input MTok' and 'From $0.50 / output MTok' pricing rows, the 1M-token context window entry and the 'Fastest' comparative latency listing for Claude Haiku 5.5.

这两款型号都不在我们的产品目录中。

我们应该把这一点说清楚,因为在这类比较中,很容易偷偷塞进一段关于可用性的说明:OrcaRouter 既不提供 Claude Haiku 5.5,也不提供 Sakana Namazu。Namazu 可通过 Sakana 自己的 API 获取,而 Claude Haiku 5.5 则可通过其供应商及各大云平台获取。这两个事实都不会改变这项比较,因为它依据的是已公布的费率、已公布的能力和已公布的限制。

在这种情形里,单个端点所扮演的角色比“插件”更窄,也更坦诚。它是混合方案中通用模型的那一条腿——那些不需要专用模型、与日语无关的分类和提取流量,你会路由到这里,而不必为此再建立第二家供应商关系。一个 API 接入 200 多个模型,供应商标价按 0% 加价原样透传,跨供应商自动故障转移,以及当应由请求的语言而非应用来决定路由时所用的路由 DSL。如果你同时跑着日语产品和英语产品,那正是你否则只能手工搭建的接缝。

哪一个,给谁

当日语本身就是产品而非区域设置时,当你的审校人员正在纠正输出时,当领域是国内法、医学、政治或客户服务时,当九倍的 token 溢价小于它所能消除的纠正成本时,并且当你的用户位于欧盟、欧洲经济区、英国和瑞士之外,或者你的法律顾问已批准数据处理相关事项时,请选择 Sakana Namazu。

当工作属于通用型、处理量很大,并且你想要的不是厂商基准而是独立测得的评分时,就选择 Claude Haiku 5.5——当每百万 token 0.10 美元和 0.50 美元正在替你算这笔账时,当你需要在长文档上使用一百万 token 的窗口时,或者当“哪个更擅长日语”的答案需要出自你自己的评估,而不是任何一家厂商的评估时。

这两者并不是真正的竞争对手。一个是通用模型,其定价是为了让人们持续使用;另一个是专用模型,其定价是为了让人们有目的地使用。错误在于,为通用模型已经做得很好的工作去买专用模型;而相反的错误——以为通用模型能像专门针对某个国家训练出来的模型那样,处理好该国的语言和语境——正是 Sakana 整个业务所依赖的、人们会犯的那种错误。

A headless capture of the OrcaRouter models catalogue page reading '207 models, 16 providers, one API key, one bill', with the filter sidebar showing input-modality counts, a pricing filter and a populated model list, and the panel that reads 'How to call any model' with an OpenAI-compatible curl sample pointing at https://api.orcarouter.ai/v1/chat/completions.