
MiMo-V2.6-Flash vs Qwen3.8-Max:下载量对阵计量表,而只有其中一个有分数
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
有一个数字决定了这类对比通常怎么写,而它并不是一项基准测试。Qwen3.8-Max是一个由 Artificial Analysis 持续测量的托管模型,因此在重新校准的 v4.3 量表上,它的当前智能指数为 45,输出速度为每秒 39.2 个 token,标价为每百万输入 token 2.00 美元、每百万输出 token 6.00 美元。MiMo-V2.6-Flash则完全不具备这些:没有服务商价目表,没有小米公布的模型标识符,也根本没有 Artificial Analysis 页面。关于 MiMo-V2.6-Flash 能力的全部公开信息,都来自小米在其模型卡中自行发布的评测表格。没有任何一个数字被非小米员工的人重新跑过。
这种不对称并不是对该模型的不利之处。它关乎的是它们各自究竟属于哪种购买,而这会改变你从正面比较中实际能得出的结论。本文余下部分将讨论你真正可以比较的三件事——主张的形态、一个 token 的成本,以及许可证——再加上一个真实、经过独立测量,且不属于标题中任何一款模型的数字。
首先,是哪个 Qwen 3.8,又是哪个 MiMo
那个标题里的两个名称都是伪装成检查点的家族,而这些替换并非无害。
• Qwen3.8-Max——阿里巴巴的托管旗舰模型,于2026年8月3日发布。这是一个拥有2.4万亿参数的稀疏混合专家模型,每个token约激活950亿参数,支持100万token上下文,并可接受文本、图像和视频输入。本文余下部分将把该模型视为对手。
• Qwen3.8-Max (0902) —— 同一模型标注为 9 月 2 日的快照版本,作为独立条目提供,价格同为 $2.00 和 $6.00,输出上限为 131,072 个 token。当前 Artificial Analysis 页面所对应的是这一构建版本,这一点在你引用指数得分时很重要。
Qwen3.8-2.4T-A95B —— 同一核心的开放权重检查点,自 2026 年 8 月 12 日起可依据 Qwen3.8-Max 许可证下载。它仅支持文本,思考模式始终开启,其原生上下文为 262K 而非一百万。它并非标题中所指的那个模型。
• MiMo-V2.6-Flash —— 小米推出的总参数量 309B、激活参数 15B 的稀疏专家混合(MoE)检查点,在 Hugging Face 上以 MIT 许可证无门槛开放,原生全模态,并宣称支持 100 万 token 上下文。它是双检查点发布中的高效型号,该发布的旗舰是总参数量 1.02T、激活参数 42B 的 MiMo-V2.6-Pro。
• MiMo-V2-Flash——2025 年 12 月的模型。同样是 309B 总参数,同样是 15B 激活参数,同样是 128 token 的滑动窗口。不同的训练批次,不同的基准测试表,以及 256K 的上下文窗口。任何把“MiMo-V2-Flash”与 Qwen 模型放在一起排名的页面,比较的都是错误的一代产品,而仅凭规格表本身并不会告诉你这一点。
MiMo 的冲突是两个陷阱中更尖锐的那个,因为用来标识该模型的数字,恰好也是 2025 与 2026 检查点之间完全相同的数字。Qwen 的冲突较为温和,但附带着代价:开放的 2.4T 权重与托管的 API 是附带不同条款的不同产物,而将它们弄混的比较,会在能力和许可两方面都弄错。
索引已重建,而大多数页面仍会打印的那个数字却不见了。
在任何分数出现之前,以下是需要注意的失败模式。
Artificial Analysis 于 2026 年 9 月 7 日将其 Intelligence Index 重新校准至 v4.3。该日期之前的分数与此后的分数不具可比性,而 Qwen3.8-Max 的实时页面带有一个已更新徽章,标示该结果已被重新表述。广泛流传的 Qwen3.8-Max 得分 58 属于旧量表。当前的 Qwen3.8-Max(0902)读数为45,在 Artificial Analysis 归入该等级的 202 个模型中位列第 19 位。
这不是吹毛求疵。58 放在 46 旁边,读起来就是十二分的差距。同样的两个模型在同一个当前量表上只相差一分——而 46 甚至都不是本文要讨论的模型:
• Qwen3.8-Max(0902),经独立测评——在 v4.3 上的 Intelligence Index 得分为 45。输出速度为每秒 39.2 个 token,在 202 个模型中排名第 151 位,该页面本身也指出这一速度偏慢。每完成一项 Intelligence Index 任务的成本为 5.41 美元。为完成该指数所生成的输出 token 数为 1.9 亿。
• MiMo-V2.6-Pro,经独立测评——智能指数 46,在开放权重类别的 114 个模型中排名第一。输出速度每秒 134.3 个 token。每个智能指数任务的成本为 0.13 美元。完成该指数评测所需的输出 token 数:1.4 亿。
• MiMo-V2.6-Flash,真正的讨论对象——不存在 Artificial Analysis 页面。没有可引用的内容。
把这三份东西放在一起读,一个诚实的总结会让两家厂商都不舒服。所有人都想要的那个对比点——在统一尺度上让 Flash 对阵 Qwen3.8-Max——并不存在,也无法从厂商的表格里搭出来,因为两家厂商在不同时间、不同检查点上跑了不同的测试框架,然后又拿自己去和其他公司、同样由它们自己跑的模型相比。真正存在的是旗舰 Qwen 与小米那个更大检查点之间一个点的差距,而每个索引任务的成本大约只有前者的四十分之一。这才是这场对垒中最有意思的真实数字,而它涉及的是一个标题两边都没点名的模型。

供应商表格能告诉你什么,又不能告诉你什么
两家厂商都会公布数字。它们并不是同一类数字,把它们逐列对齐,得到的是一张图表,而不是一个发现——但这些说法的形态仍然值得一读,因为它能告诉你每个实验室各自针对什么做了优化。
• 代码智能体——小米报告 MiMo-V2.6-Flash 在 DeepSWE v1.1 上为 67.9,Terminal Bench 2.1 为 87.6,ProgramBench 为 26.0,MiMo Code Bench 为 61.2。阿里巴巴报告 Qwen3.8-Max 在 SWE-bench Pro 上为 67.7,Terminal-Bench 2.1 为 86.6。Terminal-Bench 的数值如此接近,以至于决定排序的似乎更有可能是测试框架,而非模型本身。
• 通用智能体——小米为 Flash 报告了 AutomationBench v1.0.6 的 52.3、Toolathlon-Verified 的 73.6、OSWorld-Verified 的 80.8 以及 Agents' Last Exam 的 27.6。阿里巴巴为 Qwen3.8-Max 报告了 OSWorld-Verified 的 86.1、WideSearch 的 81.9 以及 Agent's Last Exam 的 52.4。在两家实验室都运行的这两项基准测试上,Qwen 报告的数据领先——而且是在阿里巴巴自家的测试框架上。
• 知识与安全 — Xiaomi 运行 CyberGym(Flash 95.1)、MiMo Cyber Bench(77.2)、ExploitGym(6.0)、ExploitBench(25.3)和 SEC Bench Pro(47.5)。Alibaba 运行 GPQA Diamond(92.6)、Humanity's Last Exam(43.6)和 PaperBench(93.0)。两者几乎没有重叠,因此几乎无从比较。
厂商表格能展示的一件真正有用的事情,就是内部不一致,而 Xiaomi 的表格就有这么一处。其公开的 RL 仪表盘直播了截至九月的训练过程,公布 MiMo-V2.6-Flash 的成绩为 65.68,在 DeepSWE v1.1 上使用 mini-swe-agent 测试框架、按三次取平均。完成的模型卡显示 67.9,对应已发布的权重。这两者分别描述的是训练快照和已发布产物,而这两分的差距与 Xiaomi 两个检查点之间的差距一样大。如果你从上周起一直在引用仪表盘上的数字,那它已经过时了。
账单,正是这两款模型不再具有可比性的地方
这是决定部署的部分,而且差距并不接近。
• Qwen3.8-Max 按量计费。按阿里巴巴国际价目表,每百万输入 token 2.00 美元,每百万输出 6.00 美元;Artificial Analysis 测得的缓存折扣为 88%,每项 Intelligence Index 任务成本为 5.41 美元。阿里巴巴中国区文档对同样的这一对价格(输入和输出)标为每百万 12 元人民币和 36 元人民币。你今天下午就可以调用它,并拿到账单。
• MiMo-V2.6-Flash 只能通过下载获取。小米在其官网上并未公布 MiMo-V2.6 这一代的按 token 计费价格,也没有为这两个检查点公布任何可调用的标识符,因此根本没有什么可计量的。取而代之的是分布在 65 个分片中的 172.9 GB FP8 权重数据——这还不包括 100 万 token 上下文所需的 KV 缓存——以及一个部署章节,其中推荐使用张量并行度为 16、数据并行因子为 2 的 SGLang,或张量并行度为 8 的 vLLM 方案:这是一项多节点服务任务。
• 第三方列表并非价目表。目录页面上确实列有 MiMo-V2.6 系列的价格数字,而 Artificial Analysis 统计到仅有一家 API 提供商以每百万 $0.435 和 $0.87 的价格提供 MiMo-V2.6-Pro。那是提供商针对更大规模检查点的挂牌价,并非小米的定价,而且 Flash 根本不存在这样的价格。
所以,这笔算术是按量计费的一项支出,对应的是一个资本决策。每月几亿个 token 时,Qwen3.8-Max 是一笔你可以预测的账单,而 Flash 则是你为了服务一个小米之外无人测量过的模型而要购买的节点。每月数十亿个 token 时,开放路线开始在成本上胜出,而这时许可证就不再是法律脚注,而成为采购的一项输入。
这些许可证并非相同的权限。
MIT 许可证几乎是开放权重中最宽松的了。Qwen3.8-Max 许可证并非 MIT,而这一差别是有实际分量的。
MiMo-V2.6-Flash 以 MIT 协议发布,没有收入门槛,没有用户数量触发条件,没有单独的商用协议,也没有研究条款。商业部署、修改、再分发以及进一步训练均被允许,且代码仓库无需申请即可访问。
Qwen3.8-Max 许可证授予使用、修改、分发、再许可、销售、部署、托管和微调的权利,但须满足两项条件。月活跃用户超过 1 亿或月收入超过 2000 万美元的产品或服务,必须在其界面中显著展示模型名称。而模型即服务或 AI 工作助手业务,若在任意连续十二个月内的总收入超过 5000 万美元,则需在商业使用前获得 Alibaba 的单独许可。内部使用不在限制范围内,前提是模型或其能力不向第三方暴露。
对大多数团队而言,这两个条件都不构成约束。而对于一个取得成功的平台型企业,其中一个条件会成立——并且它恰好在模型已成为关键支撑的那一刻开始生效。另请注意,这些条件约束的是可下载的 2.4T 权重,而非托管 API;后者适用的是提供商自身的条款。这两条路径承担的义务各不相同,这也进一步说明,不应把开放检查点与托管版本相提并论,仿佛它们是同一款产品。
OrcaRouter 适合用在何处,又不适合用在何处
Qwen3.8-Max 可在 OrcaRouter 上路由,基础条目与 0902 快照版本均可使用,通过一个 API 密钥,按供应商标价计费,0% 加价直接透传。这一点在此处尤为重要,原因有二。首先,0902 构建是一个独立条目,而非静默替换,因此路由 DSL 可以将对可复现性敏感的流量固定到该日期快照上,而其他一切流量则走基础层级——无需第二套集成,也无需改动代码。其次,由于标价是透传而非加价,阿里云费率卡的变动当天就会落到你这边,而不是等到下一次合同续签,这正是价格变动时上方“按量计费与按节点计费”的算术仍然成立的原因。缓存密集型工作负载也能保留供应商的缓存折扣,而不会让其中一部分被经销商的利润吃掉。

MiMo-V2.6-Flash 在任何地方都不可路由,包括我们这边。我们不路由任何小米模型,而小米自家卡片中的可用性一行指向小米自己的渠道:MiMo API 平台、AI Studio、MiMo Code 和桌面应用。如果你想要这个检查点,你得下载 172.9 GB,还得自己找一个节点。

哪一个,什么时候
如果你想要无需硬件就能获得的能力、如果你的用量不确定,或者如果你想在做出承诺前先拿到一个独立数字,那就选 Qwen3.8-Max。要接受:在当前指数上,45 分是前沿阵营里的中游位置,而非顶尖位置;每秒 39.2 个 token 慢到足以在智能体循环中产生影响;而跑完 Intelligence Index 需要 1.9 亿输出 token,约是中位数的两倍——在计费表按输出计价的那一侧,啰嗦是要花钱的。
如果约束条件是许可证、数据路径,或是你可以摊销的长期账单——而且你手上有节点——那就选 MiMo-V2.6-Flash。没有营收门槛的 MIT 条款,与带有 MAU 阈值和收入分成触发条件的许可证相比,确实是一种不同的许可;对于一家预期会做大的公司来说,这正是选择它的理由。要为多节点服务编列预算,依据已发布的权重数据(而不是仓库页面)来确定规模,并且把小米卡片上的每一个数字都当作厂商自报数据,直到实验室之外有人重新跑通为止。
如果你现在就要做决定,而不是等到下个季度,那就先选按量计费的方案。一个月的 Qwen3.8-Max 会告诉你,你的工作负载真正需要什么。而一台节点,只会告诉你你希望听到的答案。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
