
Grok 4.6 发布日期:它于8月12日发布,价格仍为$2/$6
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
2026年8月12日星期三,这个页面所围绕的问题不再成为问题:Grok 4.6发布了。SpaceXAI——这家公司自2026年2月收购该初创公司并于7月更名以来一直运营Grok——以与Grok 4.5相同的$2/$6价格、相同的V9基础、相同的50万token上下文窗口发布了它,马斯克在X上称之为“神作”。这次发布解决了该页面上一版本跟踪的两个问题:模型确实存在,而且它是同规模的后训练刷新,而非规模扩展。唯一没有解决的是参数数量,官方仍未披露。
一周前,诚实的标题是{{1}}模型尚未发布{{/1}}:马斯克在7月27日设定的"大约8月7日"目标已经延期,{{2}}同规模读数仍只是预测{{/2}}。本页认为,该模型最好被视为规模不变的刷新,而且{{3}}规模不变的刷新通常会在不涨价的情况下发布{{/3}}。发布日恰好证实了该判断的商业部分——每百万token $2/$6/$0.50,{{4}}与Grok 4.5完全相同{{/4}}——而且{{5}}首批独立测量结果已经出炉{{/5}}。以下是已发布的内容、{{6}}目前数据所说明的情况{{/6}},以及{{7}}仍属供应商单方面声称的部分{{/7}}。
8月12日发运了什么?
Grok 4.6 已通过 SpaceXAI API 上线,模型 ID 为 grok-4.6,同时上线于 Grok Build、Cursor 和 Grok Bot 应用;在首周,Cursor 和 Grok Build 用户可获得双倍的包含使用额度。这是一款具有扩展思维链(chain-of-thought)的推理模型,接受文本和图像输入并生成文本,还在默认设置之上新增了 xhigh 推理努力级别。
该 API 保留 OpenAI 兼容端点,并在服务端新增了三个工具:网络搜索、X 搜索和代码执行。对于任何已经在通过 OpenAI 兼容端点与 Grok 4.5 对话的用户来说,这意味着切换只需更改模型字符串,而无需重写客户端。
这个页面预测了什么 — 以及哪些应验了
上一版本的观点是,马斯克的"{{1}}SFT与RL显著改进的1.5T模型{{/1}}"指向同规模刷新,且价格将保持不变。发布证实了该商业判断的两个方面:
• 价格:每百万 tokens 为 $2 / $6 / $0.50(缓存命中)——与 Grok 4.5 相同。“价格不变”的预测得到了验证。
• 上下文: 500K tokens,与 Grok 4.5 相同。
• 规模:仍未官方公开。模型卡中未出现参数数量,因此马斯克的1.5T数字仍是现有最佳说法,而非经过验证的规格。早期报道中流传的2T数字,实为对Grok 4.7的2.1T的错误引用。

独立分数 — Artificial Analysis 智能指数上的 61
首个第三方评测结果已经出炉,而且是个好消息。Artificial Analysis 在智能指数上对 Grok 4.6 的评分为 61,与 GPT-5.6 Sol 的最高推理配置持平,落后于 Claude Fable 5(62)一分,落后于 Claude Opus 5(63)两分,领先于 Kimi K3(60)。相比 Grok 4.5 的 56 分,这是一个五分的大幅跃升,作为一次训练后的更新,算是相当大的提升了。
这个数字有两个需要注意的地方。该指数是一个综合指标,各个维度的表现则更为参差不齐。而 Grok 4.6 启动缓慢:首次输出 token 耗时 42 秒,而相同价格档次的中位数约为 2.9 秒;每秒输出约 68 个 token,也慢于同类平均水平。对于长时间运行的智能体来说,这只是噪音;但对于交互式聊天来说,这决定了整体体验。
在智能与成本的帕累托前沿上,情况相当亮眼:每个任务约0.84美元,完成典型的AA-Briefcase工作负载大约需要53轮对话和约0.5B输入token,而Claude Opus 5 Max则需要约103轮和约2B token。这使它成为真正的前沿性价比之选,而不仅仅是便宜。
什么仍然是供应商所述的?
SpaceXAI的发布声明——称其“智能水平可与GPT-5.6 Sol和Claude Fable 5相当”,在所列出的各项评估中均优于Grok 4.5,并将此归因于“更长时间的补充训练、更强的工程数据以及扩展的强化学习”——这些均来自厂商自述,尚未经过独立验证。{{1}}发布基准测试表(包括CursorBench、FrontierCode、APEX-Agents、Terminal-Bench,以及被重点宣传的GDPval-AA v2上1,753 Elo的成绩){{/1}}均为xAI自行报告的数据;{{2}}这些数字迄今尚未被任何不出售该模型的实验室复现。{{/2}}
第一份第三方读数已经出来了(初步)
目前唯一的独立竞技场结果是初步的,但真实。LMArena 将 Grok 4.6(以 grok-4.6-high 为名)列为第43位,位于其 Text 总排行榜上,并拥有基于 2,448 票的 1,464 Elo——被标记为初步结果,比 Grok 4.5 首秀的 1,468 分低 4 分。这个样本对于 LMArena 追踪的前沿榜单来说太小了,该榜单需要持续两周的分数。
实时会话的 Agent 排行榜尚未发布。一旦发布,它将成为首个无法提前针对性优化的指标。

价格计算
在 $2/$6 的价格下,Grok 4.6 是当前代数中最便宜的前沿 API,且遥遥领先。与定价 $5/$30 的 GPT-5.6 Sol 相比,输入便宜 60%,输出便宜 80%——而且由于输出端差距更大,“半价”的营销说法低估了在输出密集型编码工作负载上的节省。
细则:超过20万输入令牌的请求会升级到4美元/12美元/1美元的档位,而更快的变体价格翻倍。就切换而言,计算几乎没有变化——Grok 4.5和Grok 4.6共享价格与上下文,因此在它们之间切换只是配置变更,而非预算决策。
由于OrcaRouter以0%加价直接传递提供商的标价,grok-4.6端点上的$2/$6是SpaceXAI自己的价格,而非转售价——供应商降价会在当天就体现在这里,故障转移到第二提供商是一种路由规则,而非采购流程。
Grok 4.7 和 Grok 5 仍然领先
Grok 4.7 是下一步,马斯克的描述没有改变:“2.1T 模型”,比 Grok 4.6“在各方面都更好,只是服务速度稍慢一些”。8 月 5 日,他表示还需三到四周,也就是八月下旬或九月初。这个时间线是马斯克自己说的,而且每次提及都会往后推迟,所以只能当作大致方向来看。
Grok 5 定于年底,据8月4日的财报电话会议称,其训练基于"基本上是SpaceX有史以来生成的所有数据"。
接下来检查什么
有四件事将使情况进一步明朗,而目前每一件都尚无定论:
• LMArena Agent 排行榜,截至8月13日尚未发布。
• 第三方对编码与智能体基准数据的复现 — DeepSWE、CursorBench、APEX-Agents,出自不销售该模型的人士。
更快的变体一旦广泛可用时的真实价格和延迟。
• 鉴于迄今为止每个具体日期都已推迟了几天,Grok 4.7 的八月底时间表是否还能保持不变?
而真正对决策而言重要的是:你自己的工作量。排行榜上的位置只是对你任务的一种假设,而非其结果。
常见问题
Grok 4.6 到底什么时候发布的?2026年8月12日,在 SpaceXAI API、Grok Build、Cursor 和 Grok Bot 应用中上线。马斯克7月27日提出的“大约8月7日”的目标推迟了五天;8月4日财报电话会议中“下周”的说法才是准确的时间窗口。
Grok 4.6 的价格是多少?每百万 token $2 / $6 / $0.50 —— 与 Grok 4.5 相同,远低于 GPT-5.6 Sol 的 $5/$30。超过 200K 输入 token 后,价格升至 $4 / $12 / $1,更快的变体则价格翻倍。
Grok 4.6 是 2T 模型吗? 尚未公布参数数量。马斯克所说的 1.5T 仍然是目前最可信(未经证实)的说法;流传的 2T 数字其实是 Grok 4.7 的 2.1T 被误归到了 4.6 上。
Grok 4.6 和 GPT-5.6 Sol 一样好吗? 在 Artificial Analysis Intelligence Index 上,两者以 61 分并列(最大推理配置)。供应商声称其可与 GPT-5.6 Sol 和 Claude Fable 5 相媲美。它在首 token 时间上明显更慢,但价格便宜得多;智能体能力的提升尚待独立验证。
这让你何去何从
实际的应对措施与本页发布前的版本并无不同。如果你的代码已经通过兼容 OpenAI 的端点与 Grok 4.5 对接,那么 Grok 4.6 只是一次同价位的配置变更——切换模型字符串,保持预算不变,然后重新运行你的评测,因为这是一个全新的构建版本。如果尚未对接,一个采用透传定价的单一端点即可轻松切换新的前沿模型,而无需把生产路径押注在其首周的基准数据上——那些初步的竞技场数据恰恰就是这类基准。

本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
