OrcaRouter 模型雷达主卡片,标题为“MiMo-V2.6-Flash 对决 Qwen 3.8”,副标题为“一边是可下载,一边是计量收费,而只有一方拥有第三方评分”;左侧面板为 MiMo-V2.6-Flash,显示 309B 总量 / 15B 激活、MIT 许可证、无门槛且无独立评分;右侧面板为 Qwen3.8-Max,显示 2.4T 总量 / 95B 激活、每 1M 输入 $2.00 / 输出 $6.00,以及 AA Index 45,当前规模;下方三个徽章分别显示:Flash:发布于 2026 年 9 月 21 日,Qwen:自 2026 年 8 月 3 日起计量收费,Routable:仅 Qwen3.8-Max。
Guides & Insights

MiMo-V2.6-Flash vs Qwen3.8-Max:下载量对阵计量表,而只有其中一个有分数

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

有一个数字决定了这类对比通常怎么写,而它并不是一项基准测试。Qwen3.8-Max是一个由 Artificial Analysis 持续测量的托管模型,因此在重新校准的 v4.3 量表上,它的当前智能指数为 45,输出速度为每秒 39.2 个 token,标价为每百万输入 token 2.00 美元、每百万输出 token 6.00 美元。MiMo-V2.6-Flash则完全不具备这些:没有服务商价目表,没有小米公布的模型标识符,也根本没有 Artificial Analysis 页面。关于 MiMo-V2.6-Flash 能力的全部公开信息,都来自小米在其模型卡中自行发布的评测表格。没有任何一个数字被非小米员工的人重新跑过。

这种不对称并不是对该模型的不利之处。它关乎的是它们各自究竟属于哪种购买,而这会改变你从正面比较中实际能得出的结论。本文余下部分将讨论你真正可以比较的三件事——主张的形态、一个 token 的成本,以及许可证——再加上一个真实、经过独立测量,且不属于标题中任何一款模型的数字。

首先,是哪个 Qwen 3.8,又是哪个 MiMo

那个标题里的两个名称都是伪装成检查点的家族,而这些替换并非无害。

• Qwen3.8-Max——阿里巴巴的托管旗舰模型,于2026年8月3日发布。这是一个拥有2.4万亿参数的稀疏混合专家模型,每个token约激活950亿参数,支持100万token上下文,并可接受文本、图像和视频输入。本文余下部分将把该模型视为对手。

• Qwen3.8-Max (0902) —— 同一模型标注为 9 月 2 日的快照版本,作为独立条目提供,价格同为 $2.00 和 $6.00,输出上限为 131,072 个 token。当前 Artificial Analysis 页面所对应的是这一构建版本,这一点在你引用指数得分时很重要。

Qwen3.8-2.4T-A95B —— 同一核心的开放权重检查点,自 2026 年 8 月 12 日起可依据 Qwen3.8-Max 许可证下载。它仅支持文本,思考模式始终开启,其原生上下文为 262K 而非一百万。它并非标题中所指的那个模型。

• MiMo-V2.6-Flash —— 小米推出的总参数量 309B、激活参数 15B 的稀疏专家混合(MoE)检查点,在 Hugging Face 上以 MIT 许可证无门槛开放,原生全模态,并宣称支持 100 万 token 上下文。它是双检查点发布中的高效型号,该发布的旗舰是总参数量 1.02T、激活参数 42B 的 MiMo-V2.6-Pro。

• MiMo-V2-Flash——2025 年 12 月的模型。同样是 309B 总参数,同样是 15B 激活参数,同样是 128 token 的滑动窗口。不同的训练批次,不同的基准测试表,以及 256K 的上下文窗口。任何把“MiMo-V2-Flash”与 Qwen 模型放在一起排名的页面,比较的都是错误的一代产品,而仅凭规格表本身并不会告诉你这一点。

MiMo 的冲突是两个陷阱中更尖锐的那个,因为用来标识该模型的数字,恰好也是 2025 与 2026 检查点之间完全相同的数字。Qwen 的冲突较为温和,但附带着代价:开放的 2.4T 权重与托管的 API 是附带不同条款的不同产物,而将它们弄混的比较,会在能力和许可两方面都弄错。

索引已重建,而大多数页面仍会打印的那个数字却不见了。

在任何分数出现之前,以下是需要注意的失败模式。

Artificial Analysis 于 2026 年 9 月 7 日将其 Intelligence Index 重新校准至 v4.3。该日期之前的分数与此后的分数不具可比性,而 Qwen3.8-Max 的实时页面带有一个已更新徽章,标示该结果已被重新表述。广泛流传的 Qwen3.8-Max 得分 58 属于旧量表。当前的 Qwen3.8-Max(0902)读数为45,在 Artificial Analysis 归入该等级的 202 个模型中位列第 19 位。

这不是吹毛求疵。58 放在 46 旁边,读起来就是十二分的差距。同样的两个模型在同一个当前量表上只相差一分——而 46 甚至都不是本文要讨论的模型:

• Qwen3.8-Max(0902),经独立测评——在 v4.3 上的 Intelligence Index 得分为 45。输出速度为每秒 39.2 个 token,在 202 个模型中排名第 151 位,该页面本身也指出这一速度偏慢。每完成一项 Intelligence Index 任务的成本为 5.41 美元。为完成该指数所生成的输出 token 数为 1.9 亿。

• MiMo-V2.6-Pro,经独立测评——智能指数 46,在开放权重类别的 114 个模型中排名第一。输出速度每秒 134.3 个 token。每个智能指数任务的成本为 0.13 美元。完成该指数评测所需的输出 token 数:1.4 亿。

• MiMo-V2.6-Flash,真正的讨论对象——不存在 Artificial Analysis 页面。没有可引用的内容。

把这三份东西放在一起读,一个诚实的总结会让两家厂商都不舒服。所有人都想要的那个对比点——在统一尺度上让 Flash 对阵 Qwen3.8-Max——并不存在,也无法从厂商的表格里搭出来,因为两家厂商在不同时间、不同检查点上跑了不同的测试框架,然后又拿自己去和其他公司、同样由它们自己跑的模型相比。真正存在的是旗舰 Qwen 与小米那个更大检查点之间一个点的差距,而每个索引任务的成本大约只有前者的四十分之一。这才是这场对垒中最有意思的真实数字,而它涉及的是一个标题两边都没点名的模型。

Scoreboard card headed 'MiMo-V2.6-Flash vs Qwen3.8-Max', with paired rows for parameters (309B total / 15B active against 2.4T total / 95B active), licence (MIT, ungated, no revenue trigger, against a hosted API whose open 2.4T sibling uses the Qwen3.8-Max License), price per 1M (no vendor rate card against $2.00 in and $6.00 out with an 88% cache discount), independent score (None published, no Artificial Analysis page, against AA Index 45 on the v4.3 scale, 19th of 202 in class), DeepSWE v1.1 (67.9 on Xiaomi's own harness against Not published) and routability (No - nowhere, including OrcaRouter, against Yes - on OrcaRouter, base tier and the 0902 snapshot).

供应商表格能告诉你什么,又不能告诉你什么

两家厂商都会公布数字。它们并不是同一类数字,把它们逐列对齐,得到的是一张图表,而不是一个发现——但这些说法的形态仍然值得一读,因为它能告诉你每个实验室各自针对什么做了优化。

• 代码智能体——小米报告 MiMo-V2.6-Flash 在 DeepSWE v1.1 上为 67.9,Terminal Bench 2.1 为 87.6,ProgramBench 为 26.0,MiMo Code Bench 为 61.2。阿里巴巴报告 Qwen3.8-Max 在 SWE-bench Pro 上为 67.7,Terminal-Bench 2.1 为 86.6。Terminal-Bench 的数值如此接近,以至于决定排序的似乎更有可能是测试框架,而非模型本身。

• 通用智能体——小米为 Flash 报告了 AutomationBench v1.0.6 的 52.3、Toolathlon-Verified 的 73.6、OSWorld-Verified 的 80.8 以及 Agents' Last Exam 的 27.6。阿里巴巴为 Qwen3.8-Max 报告了 OSWorld-Verified 的 86.1、WideSearch 的 81.9 以及 Agent's Last Exam 的 52.4。在两家实验室都运行的这两项基准测试上,Qwen 报告的数据领先——而且是在阿里巴巴自家的测试框架上。

• 知识与安全 — Xiaomi 运行 CyberGym(Flash 95.1)、MiMo Cyber Bench(77.2)、ExploitGym(6.0)、ExploitBench(25.3)和 SEC Bench Pro(47.5)。Alibaba 运行 GPQA Diamond(92.6)、Humanity's Last Exam(43.6)和 PaperBench(93.0)。两者几乎没有重叠,因此几乎无从比较。

厂商表格能展示的一件真正有用的事情,就是内部不一致,而 Xiaomi 的表格就有这么一处。其公开的 RL 仪表盘直播了截至九月的训练过程,公布 MiMo-V2.6-Flash 的成绩为 65.68,在 DeepSWE v1.1 上使用 mini-swe-agent 测试框架、按三次取平均。完成的模型卡显示 67.9,对应已发布的权重。这两者分别描述的是训练快照和已发布产物,而这两分的差距与 Xiaomi 两个检查点之间的差距一样大。如果你从上周起一直在引用仪表盘上的数字,那它已经过时了。

账单,正是这两款模型不再具有可比性的地方

这是决定部署的部分,而且差距并不接近。

• Qwen3.8-Max 按量计费。按阿里巴巴国际价目表,每百万输入 token 2.00 美元,每百万输出 6.00 美元;Artificial Analysis 测得的缓存折扣为 88%,每项 Intelligence Index 任务成本为 5.41 美元。阿里巴巴中国区文档对同样的这一对价格(输入和输出)标为每百万 12 元人民币和 36 元人民币。你今天下午就可以调用它,并拿到账单。

• MiMo-V2.6-Flash 只能通过下载获取。小米在其官网上并未公布 MiMo-V2.6 这一代的按 token 计费价格,也没有为这两个检查点公布任何可调用的标识符,因此根本没有什么可计量的。取而代之的是分布在 65 个分片中的 172.9 GB FP8 权重数据——这还不包括 100 万 token 上下文所需的 KV 缓存——以及一个部署章节,其中推荐使用张量并行度为 16、数据并行因子为 2 的 SGLang,或张量并行度为 8 的 vLLM 方案:这是一项多节点服务任务。

• 第三方列表并非价目表。目录页面上确实列有 MiMo-V2.6 系列的价格数字,而 Artificial Analysis 统计到仅有一家 API 提供商以每百万 $0.435 和 $0.87 的价格提供 MiMo-V2.6-Pro。那是提供商针对更大规模检查点的挂牌价,并非小米的定价,而且 Flash 根本不存在这样的价格。

所以,这笔算术是按量计费的一项支出,对应的是一个资本决策。每月几亿个 token 时,Qwen3.8-Max 是一笔你可以预测的账单,而 Flash 则是你为了服务一个小米之外无人测量过的模型而要购买的节点。每月数十亿个 token 时,开放路线开始在成本上胜出,而这时许可证就不再是法律脚注,而成为采购的一项输入。

这些许可证并非相同的权限。

MIT 许可证几乎是开放权重中最宽松的了。Qwen3.8-Max 许可证并非 MIT,而这一差别是有实际分量的。

MiMo-V2.6-Flash 以 MIT 协议发布,没有收入门槛,没有用户数量触发条件,没有单独的商用协议,也没有研究条款。商业部署、修改、再分发以及进一步训练均被允许,且代码仓库无需申请即可访问。

Qwen3.8-Max 许可证授予使用、修改、分发、再许可、销售、部署、托管和微调的权利,但须满足两项条件。月活跃用户超过 1 亿月收入超过 2000 万美元的产品或服务,必须在其界面中显著展示模型名称。而模型即服务或 AI 工作助手业务,若在任意连续十二个月内的总收入超过 5000 万美元,则需在商业使用前获得 Alibaba 的单独许可。内部使用不在限制范围内,前提是模型或其能力不向第三方暴露。

对大多数团队而言,这两个条件都不构成约束。而对于一个取得成功的平台型企业,其中一个条件会成立——并且它恰好在模型已成为关键支撑的那一刻开始生效。另请注意,这些条件约束的是可下载的 2.4T 权重,而非托管 API;后者适用的是提供商自身的条款。这两条路径承担的义务各不相同,这也进一步说明,不应把开放检查点与托管版本相提并论,仿佛它们是同一款产品。

OrcaRouter 适合用在何处,又不适合用在何处

Qwen3.8-Max 可在 OrcaRouter 上路由,基础条目与 0902 快照版本均可使用,通过一个 API 密钥,按供应商标价计费,0% 加价直接透传。这一点在此处尤为重要,原因有二。首先,0902 构建是一个独立条目,而非静默替换,因此路由 DSL 可以将对可复现性敏感的流量固定到该日期快照上,而其他一切流量则走基础层级——无需第二套集成,也无需改动代码。其次,由于标价是透传而非加价,阿里云费率卡的变动当天就会落到你这边,而不是等到下一次合同续签,这正是价格变动时上方“按量计费与按节点计费”的算术仍然成立的原因。缓存密集型工作负载也能保留供应商的缓存折扣,而不会让其中一部分被经销商的利润吃掉。

Screenshot of the OrcaRouter model page for Qwen3.8 Max, marked FEATURED, giving the model id qwen/qwen3.8-max, a 1M-token context, text, image and video input with text output, an input price of $2.00 and output price of $6.00 per 1M tokens, a p50 time to first token of 3.33 seconds, and seven-day traffic of 30.8M tokens.

MiMo-V2.6-Flash 在任何地方都不可路由,包括我们这边。我们不路由任何小米模型,而小米自家卡片中的可用性一行指向小米自己的渠道:MiMo API 平台、AI Studio、MiMo Code 和桌面应用。如果你想要这个检查点,你得下载 172.9 GB,还得自己找一个节点。

Screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), showing an Intelligence Index of 45 on the updated v4.3 scale ranked 19th of 202, output speed of 39.2 tokens per second ranked 151st of 202, a price of $2.00 per million input tokens and $6.00 per million output with an 88% cache discount and a $5.41 cost per Intelligence Index task, 190M output tokens generated on the index, and a 984k-token context window.

哪一个,什么时候

如果你想要无需硬件就能获得的能力、如果你的用量不确定,或者如果你想在做出承诺前先拿到一个独立数字,那就选 Qwen3.8-Max。要接受:在当前指数上,45 分是前沿阵营里的中游位置,而非顶尖位置;每秒 39.2 个 token 慢到足以在智能体循环中产生影响;而跑完 Intelligence Index 需要 1.9 亿输出 token,约是中位数的两倍——在计费表按输出计价的那一侧,啰嗦是要花钱的。

如果约束条件是许可证、数据路径,或是你可以摊销的长期账单——而且你手上有节点——那就选 MiMo-V2.6-Flash。没有营收门槛的 MIT 条款,与带有 MAU 阈值和收入分成触发条件的许可证相比,确实是一种不同的许可;对于一家预期会做大的公司来说,这正是选择它的理由。要为多节点服务编列预算,依据已发布的权重数据(而不是仓库页面)来确定规模,并且把小米卡片上的每一个数字都当作厂商自报数据,直到实验室之外有人重新跑通为止。

如果你现在就要做决定,而不是等到下个季度,那就先选按量计费的方案。一个月的 Qwen3.8-Max 会告诉你,你的工作负载真正需要什么。而一台节点,只会告诉你你希望听到的答案。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新