
MiMo-V2.6-Pro 对比 Kimi K3:同为两万亿参数开放权重,单任务成本却相差十四倍
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
两者都是来自中国实验室的开放权重专家混合模型,拥有 100 万 token 的上下文窗口。两者均可下载。在 2026 年 9 月 22 日读取的 Artificial Analysis Intelligence Index v4.3.2 上,MoonshotAI 的 Kimi K3 得分为 44,小米的 MiMo-V2.6-Pro 得分为 46。两分之差。对两者运行同一套评估套件的实测成本为:Kimi K3 为 3,658.07 美元,MiMo-V2.6-Pro 为 206.66 美元——相差十七倍。如果你已经决定想要这一级别的开放权重,那么该做决定依据的是这个比率,而不是那两分。
Kimi K3 是这对模型中的成熟之作:2026 年 7 月 16 日发布,7 月 27 日跟进放出完整权重,并已有数月的独立评测积累。小米 MiMo-V2.6-Pro 于 2026 年 9 月 22 日正式开放使用,其强化学习检查点仓库在前一天出现。因此,这一比较是在一个定价高昂、久经考验的开放模型与一个以商品化定价推出的全新模型之间展开的,而有趣之处在于,实测的能力差距竟然如此之小。
每个模型到底是什么
Kimi K3 是一个 2.8 万亿参数的开放权重多模态推理模型,发布时被称为三万亿级别的首个开放模型。它每个 token 激活 896 个专家中的 16 个——约 1040 亿活跃参数——并使用 Kimi Delta Attention 和 Attention Residuals 高效维持 100 万 token 的上下文,每次请求最多可输出 100 万 token。它是始终开启推理,具备原生视觉能力。Moonshot 的第一方 API 收费为每百万输入 token 3.00 美元、每百万缓存输入 0.30 美元、每百万输出 15.00 美元,统一计价,不按上下文长度分级;Artificial Analysis 报告称其缓存折扣为 90%,混合费率为 2.31 美元。它测得每秒输出 42.8 个 token——相比同等规模模型 77.9 的中位数明显偏慢——以及 3.93 秒的首 token 时间。
小米 MiMo-V2.6-Pro 是一款稀疏混合专家模型,总参数量达1.02万亿,每个 token 激活420亿参数,具备100万 token 上下文窗口,并原生支持文本、图像、视频和音频多模态。其权重带有 MIT 许可证标签。小米沿用了上一代的定价,而没有将新检查点的价格上调,因此其标价为每百万输入 token 0.43美元、每百万输出 token 0.87美元,缓存折扣为99%,混合价格为0.18美元。其测得每秒输出134.3个 token——在114个模型的速度中排名第11——首 token 用时2.15秒。
• 活跃参数 — MiMo-V2.6-Pro 每 token 42B;Kimi K3 约 104B,激活 896 个专家中的 16 个
• 总参数 — MiMo-V2.6-Pro 1.02T;Kimi K3 2.8T
• 指数得分 —— MiMo-V2.6-Pro 46;Kimi K3 44,两者均出自 Artificial Analysis v4.3.2
• 标价 — MiMo-V2.6-Pro 每 100 万条 $0.43 / $0.87;Kimi K3 $3.00 / $15.00,缓存输入 $0.30
• 综合费率 —— MiMo-V2.6-Pro 每 1M $0.18;Kimi K3 $2.31
• 运行该索引的成本 — MiMo-V2.6-Pro $206.66;Kimi K3 $3,658.07
• 速度 — MiMo-V2.6-Pro 输出 134.3 token/秒;Kimi K3 为 42.8,而同规模类别的中位数为 77.9
• 首个令牌时间 — MiMo-V2.6-Pro 2.15 秒;Kimi K3 3.93 秒
• 上下文 — 两者均为 100 万 tokens;Kimi K3 每次请求最多可输出 100 万 tokens
• 权重 — 两者均可下载;MiMo-V2.6-Pro 带有 MIT 标签

速度是指数所隐藏的差异
综合得分上 2 个百分点的差距是这里最乏味的数字,而每秒 134.3 个 token 对 42.8 个 token 才最有看头。生成速度快三倍的模型并不等于好三倍,但它决定了一类应用能跑通、另一类跑不通——而 Kimi K3 自己在 Artificial Analysis 上的页面也指出,就其所处规模级别而言,它明显偏慢。对于要进行数十次顺序调用的长时程智能体循环来说,吞吐量会像延迟一样产生累积效应:单次调用三倍的差距并不等于端到端三倍的差距,但它决定了一场会话是用户会等下去,还是会被放弃。
Kimi K3 的优势体现在账本的输入一侧。它 3.93 秒的首 token 时间慢于 MiMo-V2.6-Pro 的 2.15 秒,但两者的差距并没有达到将其中任何一个与全力以赴的前沿推理模型区分开来的数量级。K3 为自身规模付出代价的地方在于生成,而生成正是你被计费的部分。
供应商编号,以及那个容易被误读的
两家实验室都发布了自己测试框架下的 DeepSWE v1.1 数据,而这两组数据在流传中却被当作可以相互比较。它们其实并不可比,而正是这一对数据,因为数字看起来如此接近,使这种错误造成的危害最大。
小米报告称,MiMo-V2.6-Pro 在其强化学习训练过程中于 DeepSWE v1.1 上从 58.4 提升至 72.57,评测使用 mini-swe-agent、取三次平均值,并在小米自家的评分器上运行。该训练过程被记录为 30 个步骤、每个模型约 750,000 条轨迹,在不到六天内完成,公布的花费约为 Pro 模型 262 万美元、较小的 Flash 模型 854,044 美元。对这一训练过程的一种广泛流传的解读认为,Kimi K3 在同一基准上为 68.51,这将使小米的模型以四分的优势胜出。那个数字是社区数据,而非 Moonshot 的数字,而且这两次测量使用的是不同的指标——三次平均值对比通过率——因此将它们相减是在不匹配的尺度上做算术。两家厂商都没有为这些模型向 Datacurve 的公开榜单提交配置。
真正具有可比性的是那个指数,因为这两次评测都是 Artificial Analysis 自己跑的:在 v4.3.2 上,MiMo-V2.6-Pro 为 46,Kimi K3 为 44,而两者的逐项评测明细均未公布。两分的差距小到足以落在由十项评测构成的综合评分的噪声范围内,因此诚实的结论是:就实测能力而言,这两个模型实际上不相上下。
Kimi K3 的付费版能买到什么
把成本差距解读为纯粹的利润空间是错误的。Kimi K3 是一个 2.8 万亿参数的模型,而小米的模型为 1.02 万亿,并且它每个 token 激活的参数约为后者的两倍半。它是其规模级别中首个开放模型,并拥有一组 MiMo-V2.6-Pro 根本还没来得及积累的独立结果:根据 Artificial Analysis 自己的报告,它在发布时于智能指数(Intelligence Index)上位列第三,仅次于 Claude Fable 5 和 GPT-5.6 Sol,GDPval-AA v2 达到 Elo 1668,在 AutomationBench-AA 上以 53% 位居第一,在 AA-Briefcase 上以 Elo 1547 位居第二,在 Frontend Code Arena 上以 1679 位居第一。这些是独立测量结果,而非发布时的宣传说法,它们所描述的模型广度,是两分的综合分差所无法体现的。
这背后还有一个容量问题。据报道,Kimi K3 上线时需求压垮了服务承载能力,导致 API 订阅临时暂停,以及部分网关的上游容量限制。一个难以获取的模型,就是一个难以在其上构建应用的模型;这是可用性问题,而非质量问题。

一个端点,以及关于我们路由什么的直接答案
Kimi K3 已上线 OrcaRouter,地址为 kimi/kimi-k3——一把兼容 OpenAI 的密钥,按供应商原价透传、0% 加价,因此 Moonshot 一旦调价,我们这边当天就同步生效;跨供应商的自动故障转移也覆盖了这款模型自发布以来一直困扰它的容量限制。小米 MiMo-V2.6-Pro 并未上线 OrcaRouter。小米的任何模型都没有上线,目前接入它的途径是小米自家平台,或收录它的某个第三方模型目录。这一点值得明说,而不是让某个模型页面暗示相反的情况。
这让这对组合成为路由层用途的绝佳范例。两个开放模型,在两者唯一共同跑过的独立指标上打成平手,而在实测的每任务成本上相差十七倍——这不是一道选择题,而是一种双车道配置。把大部分流量放在便宜的车道上,再用你定义的条件把长尾路由到另一条,或者在某个路由性能下降时故障转移。当这些模型都通过同一个密钥接入时,判断各自该承接多少份额的实验,就是对你自己的提示词做一次配置变更,而不是一场采购谈判——而且,如果 Xiaomi 在发布窗口关闭后调整 MiMo-V2.6-Pro 的价格,或者 Moonshot 为应对竞争而下调 K3 的费率,这两项动作当天就会落到我们这边,而不是等到下一个计费周期。

该选哪一个
当你需要这一规模、且经过独立实测的模型所带来的广度时——视觉能力、跨大型代码仓库的长周期编码、智能体工具调用——或者当你已经在运行它、迁移成本实实在在时,就选 Kimi K3。它是两者中被刻画得更透彻的模型,其 100 万 token 的输出上限也非比寻常。要为生成速度留出预算:按每秒 42.8 token 计算,从交互体验而言它就是一款批处理和离线工作负载的模型,无论其推理质量给人怎样的印象。
当约束条件是吞吐量和单位经济性时,当循环上下文繁重且重复时,当首 token 延迟很重要时,或者当你想在宽松许可下把权重放在自己的硬件上时,就选 MiMo-V2.6-Pro。它是廉价模型同时也是快模型这种罕见情况,而在两款模型共有的唯一一项独立评分上,它领先的幅度小到堪称平局。
如果你有路由器,就两个都选。需要避免的失败模式,是因为一个作为噱头的比例就固定采用其中任何一个:为一个 46-index 模型能以完全相同效果完成的摘要任务,支付 Kimi K3 的费率;或者在你已将所有工作迁至廉价通道之后,才发现一个仓库级编码任务需要 2.8T 模型。这两者都不是模型问题,而都是配置问题。
OrcaRouter 将200 多个模型整合到一个兼容 OpenAI 的端点之后,按提供商标价提供,0% 加价,因此供应商一旦调价,当天即可生效。
