
Dots 对比 Kimi K3:一个通读整个书库,另一个主动去查找
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 349 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 210 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- xAISpaceXAI: Grok 4.62026-08-1244智能77代码
有一种特定的工作,只有这两者中的一个才能胜任,而且值得在说其他事情之前先把它点明。Kimi K3 由 Moonshot AI 于 2026 年 7 月 15 日发布,是一个 2.8 万亿参数的混合专家模型,具备 1,048,576 token 的上下文窗口,可接受文本和图像并返回文本,定价为每百万输入 token 3.00 美元、每百万输出 token 15.00 美元,缓存读取为 0.30 美元。Dots 是该公司的始终在线智能体,于 2026 年 9 月 29 日在 DevDay 上宣布,拥有自己的云电脑和浏览器,可连接 4,000 多个应用,并在 ChatGPT、Slack 和 Teams 中占有一席之地,运行在 GPT-6 Astra 上,随 Pro 和 Business Premium 提供。K3 能在一次请求中装下整个档案库,并回答关于它的问题。一个 dot 则能去取回你尚未想到的下一份文档。阅读和检索是不同的工作,选错那一个就是代价高昂的错误。
Kimi K3 独占的数字
长上下文召回率是区分营销与真实能力的衡量指标,因为大上下文窗口宣称起来轻而易举,用起来却很难。K3 在此项上得分 88.7——是我们列出的所有模型中最高的数字,高于 GPT-5.6 Sol 的 84、MiniMax M3 的 83 和 Gemini 3.1 Pro 的 82。它在 GPQA Diamond 上取得 93.5,在 SciCode 上取得 59.5,并拥有 76.2 的 Artificial Analysis 编程指数,在 138 个被测模型中位列第九,以及 43.6 的智能指数,在 145 个中排名第十九。这些都是第三方数据,收录在我们的目录中并附有来源,而非照搬自发布稿。
这带来的是一类根本无法拆分的任务:先通读整个代码库再回答关于它的问题、把一年的合同与新模板逐一比对,或者维持一场长时间的智能体会话,而不让其中间部分从记忆中丢失。K3 正是为此而构建——Moonshot 将其定位用于编程智能体和长周期知识工作——而它罕见地完全拒绝采样参数。没有 temperature,没有 top_p,没有 seed;推理深度只是一个旋钮,名为 reasoning_effort。这是一种有意为之的取舍:更少的旋钮,更长的会话中更高的一致性。

点是干什么用的,不带营销地说明
dot 是一个配有日历的工作者。它的输入平淡无奇——你的消息、你的应用数据、你用一句话描述的任务——而它的输出则是别处的某个变化:一个文件被移动、一张工单被更新、一条消息起草并在你批准后发出、一个页面在它自己的浏览器中打开。OpenAI 的发布材料把它描述成能同时推进多个项目并从反馈中学习的样子,而坦率的解读是:你买到的是结缔组织,而非智能。
构建连接组织才是昂贵的那部分。一个举止像人的浏览器、由应用供应商维护的连接器、活动视图、审批关卡、与你自己的机器隔离——这些在原则上都不难,在实践中却全都繁琐乏味。订阅费买的就是这些。它买不到的,是可衡量性。
• 成本 — 包含在 Pro 或 Business Premium 中,配额未公布 (Dots),对比每百万输入 $3.00 和每百万输出 $15.00,缓存读取 $0.30 (Kimi K3)
• 单次请求的上限 —— 连一丁点文档说明都没有,而它对应的是 1,048,576 tokens 的上下文,以及长上下文召回上对移动端友好的 88.7 分(Kimi K3)
• 输入与输出——收进消息和已连接应用的数据,送出其他软件内部的更改(Dots);相比之下,收进文本和图像、送出文本(Kimi K3)
• 采样控制 — 未公布(Dots),对比不设 temperature、不设 top_p、不设 seed,推理深度由 reasoning_effort 单独设定(Kimi K3)
• 你应该预期的速度——圆点项未有记录,相比之下,在我们自己为期七天的测量中,首 token 中位时间为 8.82 秒,输出速度约为每秒 39 个 token(Kimi K3)
• 独立证据——供应商演示与能力声明,无基准测试(Dots)与 AA Coding Index 76.2 对比,在 138 个中排名第九,GPQA Diamond 93.5,长上下文召回率 88.7(Kimi K3)
关于购买智能体,没人会提到的那件事
未公布额度的订阅制有一种费率卡不具备的特性:你无法分辨一项任务是便宜还是昂贵。每项工作的成本都一样——没有边际差异——直到某个时刻不再如此,而这时得到的答案是限制而非账单。对于工作具有探索性的团队来说,这是一种优势。对于必须将成本归因到具体项目的团队而言,这是账目上的一个漏洞。
还有一个二阶效应。当一次调用的边际成本变得不可见时,你就不再追问这次调用是否必要,而任何流水线中最廉价的优化——干脆不发出这个请求——也就对你不可用了。而按量计费的模型会在每一次有人看价目表时,逼出这个问题。

将它们组合起来,而不假装它们是替代方案
奏效的形态是:一个会察觉的点,加一个会阅读的长上下文模型。工作来了——共享驱动器里的一份文档、一个线程里的一条消息——这个点判断它是否重要。如果重要,文档就会连同它可能需要的其他所有内容,一次性发给 Kimi K3,而返回的答案完全基于源文档,而不是基于对源文档的摘要。这个点负责跟进和无聊的物流事务;模型负责阅读,其阅读量是任何由小请求组成的循环都无法正确拼合出来的。
Kimi K3 在 OrcaRouter 上以 kimi/kimi-k3按 Moonshot 的标价路由,不额外加价,并置身于与 200 多个其他模型相同的目录中,共用一把密钥,当某个上游提供商性能下降时会自动故障转移,还提供一种路由 DSL,可将多个模型组合成单次调用。这只是整条流水线中按量计费的那一半,仅此而已:目录里没有 dots,没有为它准备的端点,也不存在可用于指向请求的标识符。如果读取层才是你需要掌控的部分——对于任何你打算运行一年的东西来说,通常都是如此——那这一层就该由你自己拥有。
哪项购买浪费钱
为了阅读大型语料库而买一个 dot 是浪费,因为 dot 会去获取和总结,而不是容纳全部内容,而总结正是你需要的细节葬身的地方。为了在五个应用之间跟进一个项目而买 Kimi K3 是浪费,原因正好相反:一个召之即答的模型不会主动来叫你。
如果任务是检索和物流,就租用工人。如果任务是大规模理解,就买下计量器,并一次性把一切都交给它。这两者的重叠远少于“agentic”这个词所暗示的,而且重叠之处并不是它们各自擅长的地方。

本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
