
Claude Haiku 5.5 与 Sakana Namazu:都便宜,都快,除此之外几乎毫无共同点
- Orca新Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 每百万 tokens · 72 tok/s
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 382 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
表面上看,这两个模型像是同类。Claude Haiku 5.5是该厂商的小型快速层级,于2026年10月7日发布,每百万输入令牌0.10美元,每百万输出0.50美元,拥有一百万令牌的窗口,专为分类、提取、路由和子代理工作而打造。Sakana Namazu是Sakana AI的日语专用API模型,于2026年8月3日推出,每百万输入令牌收费0.95美元,每百万输出4.00美元,缓存输入费率为0.15美元,在开源Kimi K2.6基础之上用Sakana自己的后训练进行精调,并可通过兼容OpenAI的端点使用。
它们都被定位为各自产品线中的平价选择,而相似之处也仅止于此。Claude Haiku 5.5 是一个通用型西方模型,你会用它来路由流量;Sakana Namazu 则是一个面向特定国家的专用模型,当任务涉及日语,而替代方案是一个做得很差的通用模型时,你会求助于它。有趣的问题不是哪个更好,而是专精能为你带来什么,这种专精的边界究竟在哪里,以及离开它需要付出什么代价。
Sakana AI 实际构建了什么
Sakana Namazu 值得在任何比较之前先被了解,因为它的构建方式不同寻常。它不是从零开始训练的。它是对现有开放权重模型——Kimi K2.6——的改进,Sakana 对其进行了进一步后训练,并将它作为闭源 API 提供服务。其渊源很重要:基础模型的通用推理和编码能力是继承而来的,而 Sakana 添加的是日本专属层。
这一层是有文档记录的,而大多数本地化声明都做不到这一点。Sakana 报告称,Namazu 在通用评估——AIME26、MMLU-Pro、LiveCodeBench v6——上保留了基础模型的性能,同时在日语及日本特定评估集上超越了它,其中 FairPoliticsQA 从 34.10% 升至 56.30%。它还运行自有的内部日语翻译基准 JFBench,并报告在该基准上也全面有所提升。另一项独立案例研究——一个面向医生的证据查找工具——报告称其在第119届全国医师资格考试中达到 96.8%,在第120届中达到 96.4%。
那些是 Sakana 在 Sakana 自家基准上的数字,而 JFBench 并不是任何其他人都能复现的公共标准。经得起这一限定条件的说法虽然范围有限,但确实成立:该模型是一个有名称的基础模型加上一个有文档记录的后训练步骤,而且报告的提升幅度是相对于它自己的基础模型,而不是相对于整个领域。
API 和商业条款是决定大多数商业案例的部分。Namazu 兼容 OpenAI——根据 Sakana 自己的文档,只需更改端点以及 sakana-namazu 模型名称,这是唯一需要修改的代码。它以美元计费,并在 Enterprise 方案上提供日元支付。它还带有按 token 比较永远无法显现的工具成本:每千次网络搜索调用 7.00 美元,以及每小时代码执行 0.12 美元,Sakana 将这些打包进了产品中。
有两条约束比价目表上的任何数字都更重要。根据 Sakana 自己的页面,由于有待完成的 GDPR 相关合规工作,Namazu 目前在欧盟、欧洲经济区、英国和瑞士均不可用。而默认数据处理政策规定,输入内容可能会被用于训练和改进 Sakana 的模型,并可在 Console 设置中选择退出;该公司表示,目前无法保证处理完全留在日本境内。对欧洲或英国团队而言,第一条就直接构成排除条件,第二条则是在第一次通话前就必须回答的问题。
坦率陈述的边界
这一节正是规格表对比会误导你的地方,所以下面才是真正可比较的内容:
• 价格 — Claude Haiku 5.5 每百万 token 输入 $0.10、输出 $0.50,提示词最多 100,000 token,超出后为 $0.50 和 $2.50。Sakana Namazu 为 $0.95 和 $4.00,缓存输入费率为 $0.15。在第一档价格下,Namazu 的输入成本约为其九倍半,输出成本为八倍。
• 缓存 — Claude Haiku 5.5 的缓存读取价格视档位而定,每百万次分别为 0.01 美元和 0.05 美元;Sakana Namazu 的则是固定 0.15 美元。在最高档位,绝对数字很接近;在最低档位,则相差 29 倍。
• 工具——两者都不是纯文本模型,计费方式也不相同。Claude Haiku 5.5 自带自适应思考,提供从 Low 到 Max 的努力程度调节旋钮,并支持服务端工具;Sakana Namazu 以每千次调用 7.00 美元打包提供网络搜索,代码执行则为每小时 0.12 美元。
• 上下文 — Claude Haiku 5.5 为一百万个 token。Sakana 未公布 Namazu 的上下文窗口,任何你看到的为其引用的数字,都是关于 Kimi K2.6 基座的假设,而非规格。
• 独立评分——Claude Haiku 5.5 在 Artificial Analysis 智能指数上的得分为 43,在该榜单同类模型中位列 182 个之中的第二,每个智能指数任务的成本为 0.21 美元。Sakana Namazu 没有 Artificial Analysis 的收录条目,我也找不到任何形式的第三方评测。其公布的数据均出自其自身。
• 可用性——Claude Haiku 5.5 已在 Claude API、Amazon Bedrock、Vertex AI、Microsoft Foundry 和 Claude Platform on AWS 上提供,并已公布退役承诺:不早于 2027 年 10 月 7 日。Sakana Namazu 可在 Sakana 自有 API、Sakana Chat 和 Sakana Translate 产品上使用,但在欧盟、欧洲经济区、英国和瑞士不可用。
• 数据处理 — 供应商的条款符合企业级标准,且模型的思考块作用域限定在生成它们的账户内。Sakana Namazu 的默认设置是输入可能被用于训练,并提供退出选项。
• 模态 — Claude Haiku 5.5 支持文本和图像;除其文本优先的定位外,Sakana Namazu 的模态覆盖范围并未公布。
• 许可与源流——Claude Haiku 5.5 是专有模型,且仅通过 API 提供。Sakana Namazu 虽为专有模型,却构建于开放的 Kimi K2.6 权重之上,这意味着其基座模型可供审查,而经过调优的模型则不然。
诚实的评分问题
读一读那份清单,注意其中缺了什么:没有任何一行说明哪个模型的日语输出更好。这不是疏忽。它们之间并不存在一个能定论此事的共同基准。Claude Haiku 5.5 出色的日语表现并非厂商作为主打卖点来宣传的,而 Sakana 的 JFBench 数据用的也是它自家的评测工具。一个是来自具备强大多语言能力厂商的通用前沿级小模型,另一个是基于 Kimi、专门针对日语做过后训练的模型,把二者放在一起比较,这样的对比从来没有人真正做过并公开发表过。
可以说,这是结构性的,而不是经验性的。Namazu 的整个商业定位都基于一个主张:通用模型不足以胜任日语工作——国别特定的语言、文化推断和本土语境是一种独特能力,足以证明以九倍价格溢价提供专用模型是合理的。如果你相信这一主张,Namazu 就是答案,而价格就是答案的代价。如果你不相信,那么每百万 token 0.10 美元的通用模型就是你的选择,问题在于你能否在自己的流量上衡量出差异。
这一说法可度量的版本,是 Sakana 提供的那一个:FairPoliticsQA 相对于其微调所基于的基础模型,从 34.10% 提升到 56.30%。这在一个真实基准上是真实的改进,但它是与 Kimi K2.6 的比较,而不是与 Claude Haiku 5.5 的比较——它告诉你,针对日本特定政治背景的后训练在该任务上带来了提升,这是一个比“更擅长日语”更狭窄、也更站得住脚的说法。

在规模化情况下,成本差距是什么样的
以每天 1000 万输入 token 和 200 万输出 token 的规模,让两者各跑一条中等规模的流水线。
• 每日输入成本 — Claude Haiku 5.5 为 1.00 美元,Sakana Namazu 为 9.50 美元。
• 输出成本,每日 — Claude Haiku 5.5 上为 $1.00,Sakana Namazu 上为 $8.00。
• 每日总计 — 2.00 美元对 17.50 美元,大约每月 60 美元对 525 美元。
这525美元还不包含任何一次网络搜索调用或一小时的代码执行。每天再加上500次搜索调用,Namazu每天还要多花3.50美元,总计达到21.00美元,而对方只要2.00美元——超过十比一的差距,再高的token效率也无法弥合。
这算不算多,完全取决于替代方案是什么。如果你选的是 Namazu,或是一个产出的日语质量平平、需要审核员手动修正的通用模型,那么这 525 美元换回的是审核员的时间,比较就不是 token 对 token,而是 token 对薪资。如果你的日语流量很常规,而且通用模型已经足够好,那这笔溢价就买不到任何可衡量的回报,而同样的钱花在别处能买到十倍的用量。
第三种选择对一款日语产品来说才是有意思的:在专业模型所宣称的优势确实成立的地方使用它——翻译、本土语境、监管与政治文本——而在其周边的大量工作上使用通用模型。这并不是一种妥协。这正是定价实际上所暗示的架构,因为 Namazu 的溢价是按 token 支付的,而没有任何理由在分类任务上支付它。

这两款型号都不在我们的产品目录中。
我们应该把这一点说清楚,因为在这类比较中,很容易偷偷塞进一段关于可用性的说明:OrcaRouter 既不提供 Claude Haiku 5.5,也不提供 Sakana Namazu。Namazu 可通过 Sakana 自己的 API 获取,而 Claude Haiku 5.5 则可通过其供应商及各大云平台获取。这两个事实都不会改变这项比较,因为它依据的是已公布的费率、已公布的能力和已公布的限制。
在这种情形里,单个端点所扮演的角色比“插件”更窄,也更坦诚。它是混合方案中通用模型的那一条腿——那些不需要专用模型、与日语无关的分类和提取流量,你会路由到这里,而不必为此再建立第二家供应商关系。一个 API 接入 200 多个模型,供应商标价按 0% 加价原样透传,跨供应商自动故障转移,以及当应由请求的语言而非应用来决定路由时所用的路由 DSL。如果你同时跑着日语产品和英语产品,那正是你否则只能手工搭建的接缝。
哪一个,给谁
当日语本身就是产品而非区域设置时,当你的审校人员正在纠正输出时,当领域是国内法、医学、政治或客户服务时,当九倍的 token 溢价小于它所能消除的纠正成本时,并且当你的用户位于欧盟、欧洲经济区、英国和瑞士之外,或者你的法律顾问已批准数据处理相关事项时,请选择 Sakana Namazu。
当工作属于通用型、处理量很大,并且你想要的不是厂商基准而是独立测得的评分时,就选择 Claude Haiku 5.5——当每百万 token 0.10 美元和 0.50 美元正在替你算这笔账时,当你需要在长文档上使用一百万 token 的窗口时,或者当“哪个更擅长日语”的答案需要出自你自己的评估,而不是任何一家厂商的评估时。
这两者并不是真正的竞争对手。一个是通用模型,其定价是为了让人们持续使用;另一个是专用模型,其定价是为了让人们有目的地使用。错误在于,为通用模型已经做得很好的工作去买专用模型;而相反的错误——以为通用模型能像专门针对某个国家训练出来的模型那样,处理好该国的语言和语境——正是 Sakana 整个业务所依赖的、人们会犯的那种错误。

