
Claude Haiku 5.5 与 Xiaomi MiMo-V2.6-Flash:当费率表与实测账单不一致时
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 57 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 345 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
把两张价目表按面值来看,Claude Haiku 5.5 对 Xiaomi MiMo-V2.6-Flash 简直像是小米模型的碾压:每百万 token 要价 $0.14 和 $0.28,对着 $0.10 和 $0.50,在输出上以 1.8 倍的优势胜出,而且是固定费率,不会在超过 100,000 token 后跳档。可再看独立任务实测下来的真实花费,排序就翻了过来——MiMo-V2.6-Flash 用 $0.06231 完成一个任务,Haiku 要花 $0.2128,然而 Haiku 在同一榜单上得分高出百分之十五,完成任务的墙上时钟时间还只有三分之一。这四句话没有一句是错的;它们量的是不同的东西。这篇文章要谈的是:其中哪一个能预测你的账单,以及每一个在什么地方就不再有用。
这两张费率卡
先从每个厂商公布的数字开始,因为它们正是会被拿来比较的那些,而它们大多并不是真正重要的那些:
• 价格 — Claude Haiku 5.5 在 10 万 token 以下为每百万 $0.10 / $0.50,超过则为 $0.50 / $2.50(Anthropic 官方标价);Xiaomi MiMo-V2.6-Flash 统一为 $0.14 / $0.28(厂商标价)
• 上下文窗口 — Claude Haiku 5.5 为 1,000,000 个 token,MiMo-V2.6-Flash 为 1,000,000 个,两者均由厂商公布
• 最大输出——在 Haiku 上为 128,000 个 token(Batch 上为 300,000);未作为 MiMo-V2.6-Flash 的单独上限进行宣传
• 架构 — Haiku 未披露;MiMo-V2.6-Flash 为 309B 总参数、15B 激活参数,混合专家(Mixture-of-Experts)架构(厂商公布)
• 许可证 — Haiku 为闭源且仅提供 API;MiMo-V2.6-Flash 为 MIT(厂商发布)
• 独立指数——Claude Haiku 5.5 为 43.395,而 MiMo-V2.6-Flash 为 37.884(Artificial Analysis)
这些条目中的三项决定了大多数实际购买,而且它们指向三个不同方向。在输出价格上,Xiaomi 模型更便宜——在短上下文下为 0.28 美元对 0.50 美元。在输入价格上,Haiku 在低于 100,000 个 token 时更便宜,高于此值时则贵得多。在上下文窗口上,Xiaomi 模型声称有两倍的空间。这三项中只有一项——最后一项——才真正算得上是能力主张,而 Haiku 在 100,000 个 token 处的固定费率台阶意味着,这种价格比较里有一道接缝,而一对数字会把这道接缝掩盖起来。

计量账单
费率表为 token 定价。干活要花钱。Artificial Analysis 让两个模型跑同一套任务,并公布实际完成每项任务花了多少钱,这与每 token 价格是不同的量,而且往往对应不同的排名:
• 每项任务成本 — MiMo-V2.6-Flash $0.06231,对比 Claude Haiku 5.5 $0.2128
• 每任务输出 token — MiMo-V2.6-Flash 77,792 对比 Claude Haiku 5.5 162,164
• 每个任务的挂钟时间 — MiMo-V2.6-Flash 1,320.08 秒 对比 Claude Haiku 5.5 426.26 秒
• 智能指数 — Claude Haiku 5.5 43.395 对比 MiMo-V2.6-Flash 37.884
• Terminal-Bench Hard — Claude Haiku 5.5 0.329 对比 MiMo-V2.6-Flash 0.227
所有五个数据均来自 {{1}}Artificial Analysis{{/1}},取自该榜单自身在 2026 年 10 月初的模型页面,当一项决策需要经得起他人核查时,这些就是要采用的数字。
每任务成本差距比价目表所显示的要大,而原因就在第二行。Claude Haiku 5.5 为完成一项 MiMo-V2.6-Flash 仅用 77,792 个输出 token 就能完成的任务,花费了 162,164 个输出 token——大约是后者的 2.1 倍,主要因为它默认会进行长篇推理。一个每输出 token 便宜 1.8 倍、且每项任务输出的 token 数量不到一半的模型,最终并不会只便宜 1.8 倍;在这套特定测试集上,它最终便宜了接近一个数量级。这是本页面上最重要的一点,而任何地方的价目表都没有公布这一点。
墙钟时间这条线则走向相反,这一点值得如实说明。MiMo-V2.6-Flash 每个任务耗时 1,320 秒,而 Haiku 为 426 秒——前者耗时是后者的三倍,实测输出速度却更高,达到每秒 56.69 个 token,因为在这套测试集上,Haiku 的推理并不像原始 token 速率所预测的那样成为瓶颈。如果一项工作负载受延迟约束而非受成本约束,那么便宜的模型并不自动就是合适的选择,而独立榜单是这两个数字中任何一个唯一存在的地方。

十五个要点实际上在哪里
43.395 对 37.884,在 Intelligence Index 上是百分之十五的差距,这也是这场对比中支持 Haiku 的最有力论据。这是否重要,完全取决于任务。在 Terminal-Bench Hard 上,两者分别为 0.329 和 0.227——相对差距更大,而且这一差距落在评测中偏智能体、多步骤的一侧,在那里,百分之十五的指数差异往往会累积成任务完成率上大得多的差异。在通用推理与知识子基准上,两者的差距比那个头条指数所暗示的要小,而且 MiMo-V2.6-Flash 在其中若干项上领先。
实际解读是:在难度曲线的底部,这两个模型可以互换,成本差异应当起决定作用。在顶部——长时程智能体、代码库,以及任何任务失败后必须重跑的场景——Haiku 的那十五个百分点,决定了一项任务是一次完成,还是同一笔钱要花两次;而廉价模型的单任务成本优势可能会发生反转,这种反转是排行榜的平均值无法向你展示的。在这种情况下,你必须运行自己的评测,而不是去看别人发布的指数,因为没有任何已公布的平均值能解决这个问题。
MIT 许可证有什么价值
MiMo-V2.6-Flash 以 MIT 协议发布——这是最宽松的开源许可之一,既没有商业使用上限,也没有相同方式共享条款。这比 Qwen 社区许可证授予的权利更强,也意味着任何人只要愿意,都可以自行托管、微调并再分发这组 309B/15B MoE 权重。对于一个受制于“推理必须跑在自己的硬件上”的团队,或者一个调用量高到自购 GPU 比租用 token 更划算的团队来说,这绝不是一条脚注——它是这场对比中唯一真正要紧的一条,因为 Claude Haiku 5.5 你根本就无法自行运行。
它也改变了故障特征。由单一供应商及其云合作伙伴提供的闭源模型,会在它们宕机时一并宕机;而一个由多个独立托管方提供服务的 MIT 许可模型,则可以在它们之间进行故障转移——前提是有东西负责执行故障转移。对于一个只想要一个 API、别无所求的团队来说,这两点都不是选择 MiMo-V2.6-Flash 的理由。而对一个并非如此的团队来说,两点都是决定性的。
供应商的说法值得自己核实
MiMo 系列是 Xiaomi 的,而 Xiaomi 在发布材料中报告了自家的速度和质量数据。那些是厂商数据,在撰写本文时尚未被复现,而独立榜单目前测得该模型的成绩低于厂商宣传口径所指向的位置——在指数上为 37.884,在 Terminal-Bench Hard 上为 0.227,而 Haiku 为 0.329。这并不是对任何事情的指控;这只是厂商自家测试框架与第三方测试框架之间的正常差距,也正是每次重复某个数字时都要标明它来自哪一方的理由。
值得在自己流量上做的那项检查只需花一个下午,却能比任何排行榜都更好地了结这个问题。用你自己的提示词把同样的二十个任务在两个模型上各跑一遍,记录每个模型每项任务的输入 token、输出 token 和实际耗时,再乘以上面的费率。起决定作用的四个数字都是你能测出来的:输入 token、输出 token、秒数,以及任务是否成功。独立排行榜上的每任务成本数字,反映的是通用测试集的情况;你的情况会不同,而两者之间的差异通常就是冗长程度,而这恰恰是费率卡所掩盖的东西。如果 Haiku 默认开启的推理为你换来的是那些否则你得花钱重试才能完成的任务,那么即便每任务价格是 3.4 倍也算便宜。如果不是,那你就是在为那些没有改变答案的 token 付费。
通过一个端点同时获取两者
Claude Haiku 5.5 和 Xiaomi MiMo-V2.6-Flash 都不由 OrcaRouter 提供——这两者需要通过厂商自己的 API 以及若干第三方平台来获取。我们真正提供的是周边阵容:qwen/qwen3.8-flash每百万 token 0.15 美元和 0.47 美元,z-ai/glm-5.3-flash为 0.15 美元和 0.50 美元,两者均按厂商标价,并与一个收录 200 多个模型、采用直通定价和自动故障转移的目录共用同一个密钥、同一份账单。
这对这场对比有着特定的意义:当你正在两者之间取舍的那两个模型,恰恰是你无法做路由的那两个时,打破僵局通常要靠让它们在真实流量中并排运行——这意味着要让它们与你确实在做路由的模型并存可用,而无须为其中任何一个再签一份合同或再引入一套 SDK。把候选模型放到生产路径上,让它身后有一个可用的模型作为回退,让请求发往路由层所选的任意一方,再让你自己的 token 日志算出那些价目表不肯给你的每任务成本数字。独立评测榜单的测试套件只是一个代理指标;你的工作负载才是真正的度量。

呼叫
如果工作负载是高吞吐量、短输出,并且能容忍偶尔重试,那么 Xiaomi MiMo-V2.6-Flash 是更便宜的模型,而且比其价目表所宣传的便宜幅度更大——每项任务 $0.06231,而另一款是 $0.2128——MIT 许可证还为你提供了 Haiku 所没有的退出通道。如果工作负载是长周期且具有智能体特性的,那么 Claude Haiku 5.5 的十五个指数点和快三倍的任务完成速度值得付出这些倍数成本,而且一旦把重试计算在内,成本差距就会缩小甚至逆转。
最不该做的一件事,就是只根据价目表来选择。这里的两个模型,按 token 计价相差不超过两倍,但按每完成一项任务来算,最终却相差一个数量级;而这两个数字中,只有一个会出现在供应商展示给你的页面上。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
