
Dots 对决 MiniMax M3:租用工人还是下载阅读器
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 349 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 210 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- xAISpaceXAI: Grok 4.62026-08-1244智能77代码
本批次中最便宜的模型,也是你获准保留的那一个,而这一组合就是整个对比。MiniMax M3 于 2026 年 5 月 31 日发布,被描述为 MiniMax 的旗舰级开放权重基础模型:文本、图像和视频输入,文本输出,1,048,576 个 token 的上下文窗口,单次响应最多输出 512,000 个 token,标价为每百万输入 token 0.30 美元、每百万输出 token 1.20 美元,缓存读取为 0.06 美元——大约是同量 token 下前沿模型收费的十三分之一。Dots 是该公司始终在线的代理,于 2026 年 9 月 29 日在 DevDay 上宣布:它拥有自己的云计算机和浏览器,可在 4,000 多个已连接应用中工作,运行在 GPT-6 Astra 上,并随 Pro 和 Business Premium 提供,但未在任何地方公布额度数字。一个是你能握在手中的组件。另一个是只能订阅的服务。
价格并不是那个有趣的数字
每百万输入token三十美分是宣传重点,但真正有意思的是另外两个数字,它们决定了你能提出什么样的请求。第一个是512,000 token的最大输出——是GPT-5.6 Sol单次响应输出量的六倍,也是这组对比中所有模型里最高的输出上限。第二个是长上下文召回率83分,这个分数足够高,说明这个上下文窗口是一块可用的工作台面,而不只是规格表上的一个数字。
把这些放在一起,一类特定的任务就变得成本低廉:从长长的源内容生成长长的产物。一本为不同受众重写的 400 页技术手册。一份根据整个代码仓库生成的迁移指南。一份本身就有一篇报告那么长的研究综述。在每百万 $0.30 和 $1.20 的价格下,一项在前沿模型上会是四位数账单的工作,在这里只是舍入误差——而输出上限以数十万 token 而非数万 token 来衡量,正是这一点让它成为一次请求,而不是二十次。
关于测量,有一点值得说明。我们目录的延迟面板报告称,在同一七天窗口内,M3 的首个 token 中位时间为 10.00 秒,而该窗口显示的流量为 1835 万个 token,这一数字恰好位于面板显示范围的上限。应将其视为窗口造成的假象,而不是对模型本身的刻画。流量数字才说明人们确实在使用它。

视频是没人会提前规划的输入
视觉如今已是基本门槛,因此仍能形成差异的模态是视频。M3 原生支持视频,与文本和图像并列,而这改变的是流水线的形态,而不只是在一份能力清单上多添一项。一批屏幕录制构成的支持归档、一组行车记录仪片段、一个学期的课程录像——这些以前都是预处理难题,你得用一个工具抽帧,再用另一个工具进行描述。能直接读取视频的模型把两个阶段压缩为一次调用。
这也让成本计算变得更难预测,因为让模型“看”视频的成本很高,而文本并非如此,并且账单上最大的数字通常是没人做过预算的那部分输入。低廉的每 token 费率正是让这种实验变得安全的原因:按每百万输入 token 0.30 美元计算,偶尔进行一次五小时的摄取,其成本低到足以直接做原型验证,而不必在规划会上争论。
开放权重实际上改变了什么
MiniMax 将 M3 描述为一个开放权重模型,这意味着权重是公开发布的,而不只是通过服务提供,而这与订阅是性质不同的保证。如果 MiniMax 明天停止提供服务、调整价格,或弃用该标识符,这个模型也不会消失——它会在你已经购置的硬件上继续运行,采用任何适合的量化方式。在一般情况下,这并不会让自托管变得更便宜;自己服务一个大型稀疏专家混合模型是一项真正的工程。它让这种依赖变得可存续,这是一个不同的说法,而当你决定要基于什么来构建时,重要的正是这一说法。
一个点提供的保证恰好相反。OpenAI 掌握着计算机、浏览器、连接器和额度,而一旦其中任何一项发生变化,你唯一的补救办法就是不再使用它。这是一种公平的安排——租赁正是大多数团队应当起步的方式——但这并非同一种安排,而两者的差异只有在真正要紧的那一天才会显现出来。

改变决策的六个差异
• 保障 —— 一边是可以随时更改条款的服务,另一边是你能一直保有的权重(MiniMax M3 被描述为开放权重;而一个点在任何意义上都无法下载)
• 每单位工作的成本——以点表示未公布,相较于每百万 token $0.30 和 $1.20,缓存读取为 $0.06,是本对比集中最低的费率
单请求上限——{{1}}一个点{{/1}}都未见文档记录,却对应 1,048,576 个输入 token 和 512,000 个输出 token
• 输入模态 —— Dot 使用消息和已连接应用数据,而模型则使用文本、图像和视频
• 输出模态——其他软件内部的更改,针对文本且仅针对文本
• 独立地位——没有任何基准测试存在,哪怕是一个点;M3 的 Artificial Analysis 智能指数为 29.2,在 145 个被测模型中位列第六十,处于中游水平,在你以为低价就能换来前沿推理能力之前,这一点值得了解。事实并非如此。
每一项如何为自己在发票上赢得一行
对 M3 已公布的能力概况,最诚实的解读是:它是一个走量型模型,而非前沿模型:GPQA Diamond 上 92.9 分具有竞争力,SWE Bench Pro 上 59 分也算体面,而处于中游的 Intelligence Index 才是关键所在。它真正胜出的地方依次是单位工作量的成本、输出上限、视频和可部署性。这是一个适合放在流水线中昂贵层之下的模型——也就是摘要、抽取、转写、生成长文本和大量并行尝试这些步骤——而不适合放在流水线的最上层。
OrcaRouter 将其以minimax/minimax-m3的形式提供,按 MiniMax 的供应商标价、零加价,与200 多个模型同处一个只需一把密钥的目录,并具备跨上游供应商的自动故障转移以及一套路由 DSL,可将单个请求发送给最该处理它的模型。正是这种安排,让两层分离从理论变为可行:同一把密钥既能触达用于大批量处理的廉价模型,也能触达那些必须准确的调用所需的前沿模型,而不会有任何东西以「点」的形式出现——因为「点」根本不在目录之中:没有端点,没有标识符,也没有替代性的智能。
周一做什么
如果你有一批音频或视频语料,却没有便宜的办法去查看它,那就从那里开始:M3 是这一组里唯一能以这个价格原生读取视频的模型,而且这个实验几乎不花什么钱。如果你有一类工作总是因为没人跟进而被搁置,dot 就是为此打造的产品,而按量计费的模型不会假装自己是它。
只有当你假定其中一方必须胜出时,这两者才会冲突。订阅负责追逐;下载下来的阅读器负责阅读。拥有后者,租用前者,并让二者之间的边界足够明确,明确到你可以替换其中任何一个,而不必重写另一个。

