
MiMo-V2.6-Pro 与 Grok 4.6:两家厂商均公布了 DeepSWE 数据,但两者都未上榜
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
两家厂商,同一个基准,两个无法相减的数字。SpaceXAI 为 Grok 4.6 发布的材料报告称,在 DeepSWE v1.1 上达到 65.9%。Xiaomi 为 MiMo-V2.6-Pro 发布的材料报告称,在 DeepSWE v1.1 上达到 72.57。放在一起读,它们暗示更便宜的开放权重模型以近七个百分点击败了专有前沿模型。仔细读,它们几乎说明不了什么,因为一个是厂商自有测试框架上的发布演示文稿百分比,另一个是在 Xiaomi 自有评分器上进行的一次强化学习运行所得的三次平均,而且两者都没有提交到公开的 DeepSWE 榜单。经得起审视的 MiMo-V2.6-Pro 与 Grok 4.6 之间的比较是在独立指数上,而在那里,答案与厂商数字相反:46 对 44,Xiaomi 领先两分。
Grok 4.6 由 SpaceXAI 于 2026 年 8 月 12 日发布,是这里的在位者——一款已交付、被广泛服务的前沿模型,背后有公开的价目表和数月的独立评测。小米 MiMo-V2.6-Pro 于 2026 年 9 月 22 日正式开放使用,其强化学习检查点仓库在前一天出现,它是新来者。两者都具备推理能力,都是为长时间运行的智能体任务而构建的,而它们之间的价格差距足够大,以至于新来者缺乏经验成了唯一拖累这场比较的因素。
每个模型到底是什么
Grok 4.6 是专有模型,接受文本和图像输入并返回文本,知识截止日期为 2026 年 2 月 1 日。其上下文窗口为 500,000 个 token,仅为其主要竞争对手的一半,也是其规格表上影响最为重大的一项参数。其标价费率为:在提示词低于 200,000 个 token 时,每百万输入 token 收费 2.00 美元、每百万缓存输入 token 收费 0.50 美元、每百万输出 token 收费 6.00 美元;而在这条边界处存在一道断崖:达到或超过 20 万 token 时,费率分别变为 4.00 美元、1.00 美元和 12.00 美元,且较高档位会对整个请求计费,而非只对超出该线的部分计费。优先处理会使标准费率翻倍。Artificial Analysis 测得,在最高投入下每秒输出 63.0 个 token、首个 token 用时 42.79 秒,运行完整索引的成本为 2,351.83 美元。
小米 MiMo-V2.6-Pro 是一款稀疏混合专家模型,总参数达 1.02 万亿,每 token 激活 420 亿参数,拥有 100 万 token 的上下文窗口,并原生支持文本、图像、视频和音频多模态。它采用 MIT 许可,权重可下载,且小米沿用了上一代的定价,而未将新检查点的价格上调——每百万输入 token 0.43 美元、每百万输出 0.87 美元,缓存折扣 99%,在 7:2:1 的缓存命中/输入/输出比例下混合价格为 0.18 美元。Artificial Analysis 实测其输出速度为每秒 134.3 个 token,首 token 延迟 2.15 秒,运行该指数的成本为 206.66 美元——每项任务 0.13 美元。
• 权重 — MiMo-V2.6-Pro 采用 MIT 许可,可下载;Grok 4.6 为专有模型,仅提供 API
• 参数 —— MiMo-V2.6-Pro 总计 1.02T / 激活 42B;Grok 4.6 未公开
• 上下文——MiMo-V2.6-Pro 1M tokens;Grok 4.6 500K,输入达到 200K 时存在价格断崖
• 模态 — MiMo-V2.6-Pro 支持文本、图像、视频和音频;Grok 4.6 已公布的输入面为文本和图像
• 指数得分 — MiMo-V2.6-Pro 46;Grok 4.6 44,两者均为 Artificial Analysis v4.3.2
• 标价 — MiMo-V2.6-Pro 每 100 万 $0.43 / $0.87;Grok 4.6 $2.00 / $6.00,输入超过 200K 后翻倍
• 混合费率 — MiMo-V2.6-Pro 每 1M $0.18;Grok 4.6 $1.35
• 运行该指数的成本 — MiMo-V2.6-Pro $206.66;Grok 4.6 $2,351.83
• 速度 — MiMo-V2.6-Pro 134.3 输出 token/秒;Grok 4.6 63.0
• 首 token 时间 — MiMo-V2.6-Pro 2.15 秒;Grok 4.6 42.79 秒
• 知识截止日期 — MiMo-V2.6-Pro 尚未发布;Grok 4.6 2026年2月1日

两家厂商都运行的基准测试,以及为何它不具可比性
DeepSWE v1.1 是由 Datacurve 运行的一项真实、公开的第三方编码智能体评测,而它正是两家公司都选择公布成绩的那一个任务族。这使其颇具诱惑力。但它不应被用作正面对比,原因并非哪家厂商在撒谎——而是这两个数字描述的是对同一任务名称的不同测量方式。
Xiaomi 的 72.57 是在其自有评测框架上、使用 mini-swe-agent 得到的三次平均值,产生于一次强化学习运行期间,而非来自冻结的发布候选版本,并且与 58.4 这一起始分数一同报告。该运行记录为 30 步、每个模型约 750,000 条轨迹,在不到六天内完成,公布的 Pro 模型花费约为 262 万美元。它尚未提交到 Datacurve 的排行榜。SpaceXAI 为 Grok 4.6 给出的 65.9% 是来自厂商自己评估集的发布会幻灯片数字,与同一基准上相较 Grok 4.5 提升 11.9 个百分点的成绩一同报告——而公开排行榜上有一个已提交的 Grok 4.6 配置,成绩约为 67%,这与厂商数字足够接近,表明其评测框架至少大致对齐。Xiaomi 的数字则并非如此,它完全没有公开的对应结果。
所以诚实的说法是这样的:在公开排行榜上,Grok 4.6 在列,而 MiMo-V2.6-Pro 缺席。在独立综合评测中,两者实际上都由同一位评估者进行了测试,小米的模型领先两分。这两个事实并不矛盾。它们只是衡量不同的东西,而第二个才是应该引用的。
500K 上下文才是决定真实工作负载的规格
五十万 token 按任何常规标准衡量都算大上下文窗口,但放到 2026 年就显得小了。与 MiMo-V2.6-Pro 归为一类的模型都达到了 1M,而这一点的实际影响恰恰体现在 Grok 4.6 所主打的那类工作负载上。一个长时间运行的编码智能体,若持有代码仓库、工具调用记录和不断累积的计划,在一次会话中提示就会突破 200,000 token——而一到这条线,Grok 4.6 的费率就会翻倍,并且回溯适用于整个请求。同样的会话放在 MiMo-V2.6-Pro 上,跑到一百万 token 也不会触发档位变化。
这既是规格差异,也是定价结构差异,而在比较标称费率时,后者很容易被忽略。Grok 4.6 的混合价格为 1.35 美元,而 MiMo-V2.6-Pro 为 0.18 美元,相差 7.5 倍。对于超过 200K 的提示词,差距会扩大到接近 15 倍,因为 Grok 的费率翻倍,而 Xiaomi 的费率保持不变。
反方论点同样被记录在案,而且理应如此。Grok 4.6 的发布主张是回合效率,而非原始上下文:在相同任务上让它与 Claude Opus 5 对比的智能体评测中,它大约用了 53 个回合、约 5 亿输入 token 就完成了任务,而另一款模型则约为 103 个回合、20 亿 token,每项任务估计成本为 0.84 美元——是该对比中前沿模型中最低的数字。一个循环次数只有一半的模型,不需要那么大的上下文,也不会消耗那么多 token。这是一种真正的架构优势,也是 Grok 4.6 相对于任何每 token 更便宜的替代方案(包括这一方案)最有力的论据。

到达每一个
Grok 4.6 已在 OrcaRouter 上线,模型名为 grok/grok-4.6,可通过一个与 OpenAI 兼容的端点按提供商标价访问,且 0% 加价——因此,如果 SpaceXAI 调整价格,包括调整那个 200K 断崖,当天就会在我们这边生效。Xiaomi MiMo-V2.6-Pro 不在 OrcaRouter 上。也没有任何小米模型在上面,如今接入它的途径是小米自家平台,或某个收录它的第三方目录。把这一点直说,比让模型页面暗示并非如此更有用。
这种不对称性在实践中价值几何,是一个成本低廉的实验。Grok 4.6 是你可能已经在付费使用的模型。MiMo-V2.6-Pro 以极低的费率实现了两个点的指数提升,本周刚刚发布,背后只有一条服务路由。值得回答的问题不是抽象层面哪个更好,而是小米的模型能在你自己的提示词上承接多少 Grok 流量——而通过开通第二份合同、第二个密钥和第二种计费关系来回答这个问题,正是阻碍测试发生的摩擦。借助单一端点和跨提供商自动故障转移,这种比较只是一次配置变更,而且这里的故障转移这一半比通常更重要:一个本周才发布、在 Artificial Analysis 采集数据时仅被一家 API 提供商收录的模型,不应在没有回退通道的情况下被放入生产路径。

该选哪一个
当你要优化的核心是轮次效率时,请选择 Grok 4.6——在长智能体循环中,模型能够以一半步骤完成任务的能力,比其每 token 费率更有价值——或者当你想要一个背后有数月独立测评、而不是仅一周的模型时。其每秒 63 个 token 和 42.79 秒的首 token 时间,从交互角度看,使它成为一款批处理和离线工作负载模型;而其 500K 上下文伴随 200K 价格断崖,则说明应保持提示词简短。
当你运行上下文密集、重复性的循环任务,而这些任务会越过 Grok 的 200K 断崖时;当你需要首 token 延迟低到人类愿意等待时;当你希望把权重放在自己的基础设施中时;或者当规模让 7.5 倍的混合费率差距成为决定性数字时,就选择 MiMo-V2.6-Pro。它在指数上的两点领先优势小到本身不足以成为理由;运行同一套评估套件的成本是 $206.66 对 $2,351.83,这才是更好的理由。
能解决这个悬而未决问题的,是为 MiMo-V2.6-Pro 提交一份 DeepSWE 配置。Grok 4.6 已经有了。一旦小米的模型带着明确说明的测试框架、置信区间和每任务成本出现在公开榜单上,72.57 就不再是一个厂商数字,上面的比较也会变成真正的比较——而且鉴于指数上的两分差距,结果可能朝任一方向倾斜。
OrcaRouter 将200 多个模型整合到一个兼容 OpenAI 的端点之后,按提供商标价提供,0% 加价,因此供应商一旦调价,当天即可生效。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
