
Dots 对决 Grok 4.6:能自行安排会议的智能体,对阵只负责回答的模型
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 349 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 210 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- xAISpaceXAI: Grok 4.62026-08-1244智能77代码
试着给一个 dot 写一个电话号码,你会失败,而这种失败正是这对组合最有用的地方。Dots 是该公司全天候在线的智能体,于 2026 年 9 月 29 日在 DevDay 上发布:每个 dot 都拥有自己的云端计算机和浏览器,可连接 4,000 多个应用,并能在 ChatGPT、Slack 和 Teams 内直接联系到,运行于 GPT-6 Astra 之上,Pro 和 Business Premium 用户无需额外付费即可使用。Grok 4.6 是 SpaceXAI 的前沿模型,于 2026 年 8 月 12 日发布,它完全是另一种东西:50 万 token 的上下文窗口,支持文本、图像和文件输入并以文本输出,可配置的推理强度,原生工具调用和结构化输出,定价为每百万输入 token 2.00 美元、每百万输出 token 6.00 美元(提示低于 20 万 token 时),超过该长度则价格翻倍。这两者中,一个是有着日程安排的同事,另一个是你调用的一个函数。
两者在智能体工作上确实都很强,这也正是这种混淆如此常见的原因。Grok 4.6 在 Terminal-Bench 2.1 上取得 88.4 分,在 τ-banking 工具使用切片上取得 50.7 分——这类数字会让一个模型被冠以“智能体”之名。但它并不是智能体。它是你会用来构建智能体的那种推理引擎。
每一个到底是什么
• 身份标识——一边是一个托管产品,没有你可寻址的模型标识符(Dots);另一边是一个具名、可路由的模型,带有可放入配置文件的稳定字符串(Grok 4.6)
• 执行发生在哪里 —— 在 OpenAI 的云计算机上,自带浏览器,与你的机器相互隔离,除非你将它们与你运行调用的位置关联起来(Dots):你掌控的容器、队列工作进程、定时任务(Grok 4.6)
• 触达范围 — 通过 OpenAI 的连接器(Dots)可触达 4,000+ 款应用,相比之下,你自己接入多少工具就只能触达多少,因为工具调用是一种协议,而不是一份目录(Grok 4.6)
• 任务的记忆——由产品跨天、跨应用、跨新线程(Dots)承载,面对 500,000 token 的窗口,以及你自己持久保存的一切(Grok 4.6)
• 成本 — 包含在订阅中,配额未公布(Dots),相比之下每百万 token 为 2.00 美元和 6.00 美元,超过 200,000 输入 token 后翻倍,缓存读取为 0.50 美元(Grok 4.6)
• 证据——厂商演示和能力声明,没有独立基准(Dots)可与 Artificial Analysis Coding Index 的 76.8 对标,在所测 138 个模型中排名第五,并在 GPQA Diamond 上达到 94.9(Grok 4.6)
决定大多数问题的数字:额度
OpenAI 为 dots 公布了一个价格,而它并不是以任何可用于衡量工作的单位表示的价格。第一个 dot 包含在 Pro 或 Business Premium 中;与它对话不会消耗 ChatGPT 使用限额;首月适用扩展限额。这就是公布的全部成本结构。没有额度数字,没有第二个 dot 的价格,没有按任务计的费率,也没有针对据报道正在内部测试的专家型 dots 的企业价格。CNBC 对主题演讲的报道称,首席财务官 Sarah Friar 将每月 500 美元的 Pro 500 档定价为使用额度加上新的 Ultrafast 模式,而不是按 dot 计的费率,这意味着 OpenAI 价目表上最贵的方案仍然无法得出每单位智能体工作的成本。
Grok 4.6 则反其道而行之,把所有内容都公开,包括那些会带来不利影响的部分。200,000 个输入 token 处的档位分界线是一道断崖:199,000 个 token 的请求,计费只有 201,000 个 token 请求的一半。这不是隐藏陷阱,而是价目表上的一个数字,并且会改变你设计长上下文任务的方式。你要么在分界处进行分块,要么明知地接受第二档。

当这对产品还在被比较时,后继产品已经发布。
Grok 4.7 于 2026 年 9 月 21 日发布,如今是 Grok 系列的旗舰,拥有同样的 500,000 token 上下文、相同的输入界面、相同的基础定价,以及大得多的 450,000 token 最大输出。Grok 4.6 仍可使用,也仍被列为当前模型——版本号提升并不意味着退役——但今天任何选择 Grok 模型的人,都应在 4.6 和 4.7 之间做选择,而不是想当然地认为 4.6 就是前沿。之所以要把这一点直白地说出来,是因为你正在读的这篇文章所讨论的是一种能够跨越这次更替而依然成立的比较:无论下个季度 Grok 系列的顶端被称作什么,它仍然是一个按量计费、有价目表的模型,而 dot 仍然是一种订阅,附带着未公开的额度。
这也是为什么应通过抽象层来路由模型调用,而不是硬编码到某个供应商。当继任者落地时,更换模型只是改一行代码,而不是做一次迁移。

构建镜像而不是租用镜像
这种组合带来的有趣结果是,Grok 4.6 让你能构建 Dots 所售卖的东西——先做得糟糕,然后再做得更好。一个读取队列、调用附带工具的模型、写入结果并在失败时重试的循环并不难;难的是那些 dot 免费提供给你的部分——一个像真人一样行事的浏览器、由应用厂商编写的连接器、审批流程和活动日志。它们之所以值得订阅,恰恰是因为它们很繁琐。
计量侧真正胜出的时刻,是工作不再千篇一律的那一刻。当你需要同一个调用在下一季度对接另一家供应商、需要从日志中重放、需要精确到分地计费,或者在上游供应商波动时中途故障转移到更便宜的同类服务。在 OrcaRouter 上,Grok 4.6 以 grok/grok-4.6 的形式,按 SpaceXAI 的标价提供服务,在此基础上 0% 加价——即供应商自己的费率,原样透传,因此供应商降价当天就会落到你的账单上——并与200 多个其他模型共处同一目录、共用一把密钥,还具备自动故障转移和一套路由 DSL,可将多个模型组合进单次调用。而一个点号没有对等物:没有端点,没有标识符,没有任何可供故障转移的东西。
要应用的{{1}}测试{{/1}}
问一问:如果没有人看,这项工作还会存在吗?如果答案是肯定的——它必须按时间表在多个工具之间运行,无需有人打开聊天窗口——那么 dot 就是为此而生的产品,而按量计费的模型只是你所构建的任何东西内部的一个组件。如果答案是否定的——如果有个人在等待输出,而输出有格式和截止时间——那么按量计费的模型才是正确的购买选择,而智能体则是一条昂贵的弯路。
值得避免的错误,是为了得到更好的答案而去购买一个 dot。dot 并不是更聪明的模型;它只是给模型套上的一条更长的牵引绳。而第二个错误,是为了获得一项能力而付费订阅,而这项能力早已被一张按 token 计价的费率表卖给你,且这笔账事先就明明白白。

本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
