一张用于“GPT-5.6 vs Grok 4.6”的主视觉标题卡片,眉题写着“指数并列61——价格与上下文出现分化”;左侧为圆角卡片“GPT-5.6 Sol”(OpenAI——发布于2026年7月9日;每100万token收费$4.00/$20.00;约105万上下文 · 128K输出;最大努力 = 4个子代理),右侧为圆角卡片“Grok 4.6”(SpaceXAI——发布于2026年8月12日;每100万token收费$2.00/$6.00;50万上下文 · 无输出上限;努力档位从低到超高);页脚为“独立AA指数:61 = 61。”,OrcaRouter徽标位于右下角。
Guides & Insights

GPT-5.6 对比 Grok 4.6:指数持平,上下文与价格分化

作者

Rowan Sterling

发布日期

返回全部文章

在截至2026年9月初两者共同参照的Artificial Analysis Intelligence Index量表上,OpenAIGPT-5.6——其旗舰层级GPT-5.6 Sol正是gpt-5.6 API名称所路由到的模型——与SpaceXAI的Grok 4.6取得了相同的分数:61。一家独立指数将两款竞争对手的旗舰模型拉平,这是前沿模型对比中最罕见的结果,而这正是这场较量的有趣之处,而非终点。打成平手的两款模型在销售方式上却截然不同。GPT-5.6 Sol是OpenAI于7月9日发布的旗舰模型,在9月3日GPT-6 Astra推出后被重新定位为其价值档位。经过8月24日的降价,其标价为每百万输入token 4.00美元、每百万输出token 20.00美元,可读取约105万token的上下文。xAI于8月12日发布的Grok 4.6标价为2.00美元/6.00美元,上限为50万token。在同一独立榜单上得分相同,但两款模型在单次请求能推进到多远——以及推进的代价上,开始分道扬镳。

这个页面现在之所以存在,是出于一个非常具体的原因:那两张价目表和那两个价格上限在数周之内相继发生了变动。Grok 4.6 于8月12日发布,最初两周仅限在 Grok Build 和 API 中使用,8月28日起才在网页端和移动端的普通 Grok 对话中开放。GPT-5.6 Sol 的促销降价于8月24日落地;十天后,GPT-6 Astra 的发布又悄悄把 Sol 从旗舰降为性价比旗舰。下面这两款模型,正是如今你想要接近前沿的推理能力、又不想付 Astra 级别价格时会去选择的对象——也正因如此,61:61 的平局才成了真正需要面对的决策点,而不只是冷知识问答。

“61平”意味着什么,又不意味着什么

分数需要有日期和标尺。在截至9月初使用的指数标尺上,Artificial Analysis测得GPT-5.6 Sol约为61、Grok 4.6为61——本博客其他GPT-5.6对比所引用的正是这一标尺——Grok在AA追踪的202个模型中排名第11,Sol在相同分数下与它仅相差几个名次。AA随后于9月7日重新校准了指数的v4.3版本,该版本压缩了分数:GPT-5.6 Sol在新标尺上测得47,GPT-6 Astra和Claude Fable 5.1测得53,而Grok 4.6在新标尺上的总体分数尚未公布。因此,下面的并列关系是对9月重新校准前标尺的描述,最好将其理解为相对位置:在最近一个同时为两者打分的指数中,二者水平相当,且都紧随Claude Opus 5级别之后。

关于这次平局,还有一点需要注意,而它会影响你如何使用这一结果。这两个分数是在不同的努力设置下产生的——GPT-5.6 Sol 采用的是最大推理(max reasoning)设置,即 OpenAI 拨盘上的最高档位(在处理困难请求时会运行四个并行子代理);而 Grok 4.6 采用的是高(high)设置,即 xAI 从低到超高拨盘上的默认档位。两者都是“全力以赴”的配置,但并非同一种配置;这次平局是在这两个特定设置之间产生的,而不是在模型所提供的一切设置之间。同等分数真正能够说明的是:无论哪一方,都无法指着一项独立的综合评测,声称自己的模型拥有通用智能上的优势——因此,在两者之间做选择的买家,必须把目光越过指数本身,去关注实际使用场景、价格,以及每一方真正能拿得出的证据。

两张费率卡,两个悬崖

两家供应商都把长提示词作为溢价事件计费,并且一旦越过阈值,整个请求就会按更高档位计费——正是这一共同机制让价格对比一目了然。OpenAI 对 GPT-5.6 Sol 的定价为每百万 token $4.00 / $20.00,缓存读取为 $0.40;一旦请求的输入 token 超过约 272K,整个请求就会改按 $8.00 / $30.00 计费——这是 Epoch AI 于 9 月 8 日记录的长上下文结构。xAI 对 Grok 4.6 的定价为每百万 token $2.00 / $6.00,缓存读取为 $0.50;一旦提示词超过 200K token,整个请求就会改为 $4.00 / $12.00。

发布 — GPT-5.6:2026年7月9日(公开API;gpt-5.6别名达到Sol层级)。Grok 4.6:2026年8月12日。

每 1M(输入/输出)的标价 — GPT-5.6 Sol:$4.00 / $20.00,缓存读取 $0.40(促销价至少持续至 2026 年 11 月 21 日)。Grok 4.6:$2.00 / $6.00,缓存读取 $0.50。

长提示词档位——GPT-5.6 Sol:输入超过约 272K 时,整个请求为 $8.00 / $30.00。Grok 4.6:输入为 200K 时,整个请求为 $4.00 / $12.00。

上下文 / 输出上限 — GPT-5.6 Sol:约1.05M输入,128K输出。Grok 4.6:500K输入,未公布输出上限。

指数(独立)——GPT-5.6 Sol(最大)约61,Grok 4.6(高)为61,按重新校准前的九月标度计算。

模态——两者都接受文本和图像输入并生成文本。

算一下这些算出来的数字,规律显而易见:在 Grok 4.6 可以服务的每一种提示长度下,它都是更便宜的选择,因为其重新定价后的上限仍落在 GPT-5.6 Sol 的标准费率或更低。

100K 输入 / 8K 输出 — GPT-5.6 Sol:0.10 × $4 + 0.008 × $20 = $0.56。Grok 4.6:0.10 × $2 + 0.008 × $6 = $0.25。在该请求上,Grok 大约便宜 55%。

400K 输入 / 30K 输出(两者均重新定价)——GPT-5.6 Sol:0.40 × $8 + 0.03 × $30 = $4.10。Grok 4.6:0.40 × $4 + 0.03 × $12 = $1.96。即使在其自身提价之后,Grok 的价格仍大约为前者的一半。

600K 输入 / 30K 输出——GPT-5.6 Sol:0.60 × $8 + 0.03 × $30 = $5.70。Grok 4.6:无法处理——600K 超出其 500K 上下文窗口。在这一区间,Sol 是唯一选择,其价格也不再显得溢价。

A two-column scoreboard titled 'GPT-5.6 vs Grok 4.6 — the scoreboard'. Left column 'GPT-5.6 Sol': Released Jul 9 2026; Price $4.00 / $20.00 per 1M, cache $0.40; Over 272K input whole request $8.00 / $30.00; Context / output ~1.05M / 128K; AA Intelligence Index ~61 (max); SWE-bench Verified ~96% (reported). Right column 'Grok 4.6': Released Aug 12 2026; Price $2.00 / $6.00 per 1M, cache $0.50; At 200K input whole request $4.00 / $12.00; Context / output 500K / no published cap; AA Intelligence Index 61 (high); GPQA Diamond 94.9% (reported). Footer: 'Independent index: tied at 61 — AA scale, pre-Sept-7 2026 recalibration.'; OrcaRouter logo bottom-right.

这种悬崖几何在一个方面对 GPT-5.6 Sol 有利:它的阈值(272K)高于 Grok 的(200K),因此存在一个区间——约 200K 到 272K 的输入——在这个区间里 Grok 已经重新定价,而 Sol 还没有。即便在这一区间,Grok 在花费上通常仍然胜出,因为它重新定价后的输出价格 $12 仍比 Sol 的标准价格 $20 低 40%。经济性只有在超过 500K token 后才会反转、转而有利于 Sol,而这恰恰是 Grok 的上下文窗口无法进入的区域。如果你的提示长度保持在 200K 以下——大多数聊天、RAG 和代码辅助流量都符合这一点——Grok 4.6 在综合成本上的规模成本接近减半;而整请求断崖意味着你应当把 200K 视为规划边界,而不是一个软性建议。

Sol额外那五十万枚代币到底是用在什么地方的

Grok 4.6 的 500K 上下文窗口能适配的真实工作负载比规格表所示的更多——全代码库读取、长篇幅智能体转录、大型检索上下文——而且由于没有公布输出上限,生成端也更从容:当单次调用需要输出极长工件时,Grok 没有文档化的上限,而 GPT-5.6 Sol 在 128K 输出 token 处止步。GPT-5.6 Sol 的优势集中在 500K 到 1.05M 这一区间,而真正需要这一区间的负载比营销宣传的要狭窄:那些需要将整个代码仓库加长任务历史同时保持在上下文中的智能体、需要一次性分析的超长会议或研究记录、以及针对大到无法切分成 Grok 尺寸窗口的语料库检索任务。如果你的任何流水线都不触及该区间,那么 Sol 多出来的上下文容量,就是你花着 $4.00 输入费却用不上的余量。

这两种模型在推理方式上也有不同。GPT-5.6 Sol 提供了一个低 / 中 / 高 / 最大努力档位,其中“最大”会运行四个并行子代理,协同处理困难任务——实际上相当于每个困难请求都有一小群智能体,能力强但输出 token 消耗高昂,这也是成就约 61 分指数得分的配置。Grok 4.6 则运行单一模型,配有一个从低到超高的档位(默认高),并带有服务端工具用于搜索和执行代码,这让它的行为在预算上更可预测:一个请求、一个模型,成本可按费率卡估算。对于希望支出确定性的开发者来说,Grok 的单模型设计在运维上更简单;而对于最困难的长跨度任务,Sol 的“最大努力”智能体群是能力更强的配置——这也是它最好的分数和最贵的账单出自同一设置的原因。

双方实际能够出示的证据

两个模型都没有独立的编码评分优势,因此可引用的证据按厂商分列。OpenAI 报告 GPT-5.6 Sol 在 SWE-bench Verified 上约为 96%——这是两个模型能拿出的最强编码引用,但属于尚无独立审计发表的自报评测——而 Sol 的现实世界优势还包括它内置于 Codex 和 ChatGPT 工具链之中。xAI 报告 Grok 4.6 在 GPQA Diamond 上达到 94.9%,并声称这是该基准测试中录得的最高分,同时引用了代理式评测,每项综合任务平均约消耗 0.84 美元的 API 成本;两者都是厂商数字。在速度上,两者比价格差距所暗示的更接近:AA 测得 Grok 4.6 在标准服务下每秒输出 64.9 个 token,GPT-5.6 Sol 也在同一 60 余每秒的区间内,而 OpenAI 单独基于 Cerebras 的“Ultrafast”预览版(最高约每秒 750 个 token)仍有限制且未定价。把整张证据表读作:索引打平,双方都有编码成绩但均无独立审计,也没有能改变决策的速度差距。

哪种默认设置在2026年9月是理性的?

当你的流量低于 200K token 的输入量时,选择 Grok 4.6——在其服务的每种长度下,价格都接近一半;独立指数表明两者模型水平相当;单一模型的档位搭配服务端工具,可让账单保持可预测。当你确实需要 500K 到 1.05M 的上下文区间,当你的技术栈已经以 Codex 或 ChatGPT 为原生基础,并且报告中的约 96% SWE-bench 分数能向采购部门提供一份编码能力凭证;或者当你希望拥有四个子代理的最大努力配置选项,以应对最困难的长周期任务时,选择 GPT-5.6 Sol。还要留意两个日期:GPT-5.6 Sol 的 $4/$20 促销价至少保证持续到 2026 年 11 月 21 日,此后这一对比将发生变化;而 xAI 已经预告了 Grok 4.7——无论哪件事发生,都可能重新定价你即将作为标准的这场对决。

无需重新架构即可同时运行两者

由于该指数上两者打平,这意味着这是一项基于上限和价格的决策,而非基于质量的决策,所以大多数团队的实际模式是路由而非二选一。GPT-5.6 Sol 和 Grok 4.6 都已接入 OrcaRouter,按各自提供商的标价零加价透传——列表上就是 OpenAI 的 $4/$20 和 xAI 的 $2/$6,任一供应商调整费率后,新价格会在同一天通过同一密钥生效。只需一个兼容 OpenAI 的端点,你就可以将 200K 以下的流量发送到 Grok 4.6对需要 Sol 更长上下文或其最大努力配置的提示词进行升级,并使用自动故障转移,使某个提供商路径上的速率限制成为路由事件而非宕机。

A screenshot of the OrcaRouter model page for GPT-5.6 Sol (model id openai/gpt-5.6-sol), showing the header price of $4.00 in / $20.00 out per 1M tokens, tags including Vision, Tools, JSON and Reasoning, 'by OpenAI — 2026-07-09', a description of GPT-5.6 Sol as the flagship model in OpenAI's GPT-5.6 series covering deep multi-step reasoning, large-scale software engineering and long-horizon agentic work over a 1.05M-token context window with up to 128K output tokens, and the site's latest-model navigation.

这个对比中价格的一半是变动部分——OpenAI的Sol促销仅保证持续到11月21日,而xAI在路线图上写着4.7——因此本博客持续更新的参考是其GPT-5.6 Sol定价页面,每次费率卡变更时都会标注日期并重新验证。

A screenshot of OrcaRouter's '$4 / $20 per 1M Tokens — After the Price Cut' pricing article on the GPT-5.6 Sol promotional rate, bylined Gideon Frost, shown alongside the site's LATEST MODELS rail.

两行字的答案

如果你的提示词在50万令牌以下——大多数情况正是如此——Grok 4.6 在其可服务的每一种长度下,都以接近半价提供与 GPT-5.6 Sol 相同的独立指数评分,且没有公布的输出上限,并拥有可预测的单模型调节选项。GPT-5.6 Sol 的溢价在 Grok 无法触及的区间中得到体现:超过50万令牌的上下文,以及在 OpenAI 工具生态内,其报告的约96% SWE-bench Verified 成绩,加上其下的 Terra 和 Luna 层级,为你提供的是一个模型家族而非单一模型。指数评分打平意味着,这个决定关乎上限与成本,而非能力——所以在投入之前,先测量你最长的真实提示词,因为这一个数字就能决定赢家。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新