用于对比 GPT-6 和 Grok 4.7 的主视觉标题卡。标题为“GPT-6 对决 Grok 4.7”。一个信息标签显示“GPT-6 Sol:1.05M 上下文,128K 输出,$2.00 / $10.00”。一个信息标签显示“Grok 4.7:500K 上下文,450K 输出,$2.00 / $6.00”。页脚写道:“输入价格持平;输出价格和输出上限则不然。”
Guides & Insights

GPT-6 vs Grok 4.7:输出列决定一切

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

GPT-6 Sol 和 Grok 4.7对输入 token 收取相同费用——均为每百万 2.00 美元——这使得输入这一列在两者之间做选择时毫无用处。决策取决于右边那一列。GPT-6 Sol 对每百万输出 token 收费 10.00 美元;Grok 4.7 收费 6.00 美元。而且,这两个模型在单次调用中允许生成的输出量上相差三倍半:GPT-6 Sol 上限为 128,000 token,而 Grok 4.7——SpaceXAI 的旗舰模型,于 2026 年 9 月 21 日作为 Grok 4.6 的继任者发布——可达 450,000。

这场对比中的其他一切,都源自那两个事实,再加上一点:GPT-6 Sol 拥有更大的上下文窗口,达 1,050,000 个 token,而 Grok 4.7 为 500,000 个。因此,这并不是一个关于某个模型更好的故事。这是一个关于两个形态不同的模型的故事,也是关于你的工作负载属于哪种形态的故事。

先把你的请求的形态弄对

要决定选 GPT-6 还是 Grok 4.7,一个有用的方法是看你的任务实际消耗的是哪种资源。三种情况就能覆盖大多数生产流量。

长输入,短输出。 你正在输入一份大型文档、一个代码库或一段很长的智能体记录,然后拿回一份摘要、一个 diff 或一个决定。在这里,上下文窗口是硬约束,而 GPT-6 Sol 的 1,050,000 个 token 大约是 Grok 4.7 的 500,000 的两倍。但请注意两张卡片上的阶梯价格线:Grok 4.7 的 $2.00 费率适用于最多 200,000 个输入 token,超过后升至 $4.00,而 GPT-6 Sol 的 $2.00 费率则一直到 272,000,之后才升至 $4.00。在 200,001 个 token 时,Grok 已经重新计价,而 GPT-6 Sol 还没有,所以一份 250,000 token 的文档在 Grok 4.7 上每百万花费 $4.00,在 GPT-6 Sol 上每百万花费 $2.00——还没算输出,就已经是两倍。

输入短,输出长。你正在生成:一份长篇文档、一个大型代码文件、一份结构化产物,或一串工具调用,而模型必须写出这些调用的结果。这正是 Grok 4.7 所为之打造的场景。450,000 token 的输出上限比大多数模型允许的高出一个数量级以上,而且按每百万输出 token 6.00 美元对比 10.00 美元计算,这些 token 中的每一个你都要少付 40%。如果你的生成经常超过 128,000 个输出 token,GPT-6 Sol 根本无法在一次调用中处理该请求,而 Grok 4.7 可以。

两者都均衡且偏重。长输入与长输出同时出现时,两张卡会相互作用。40万 token 输入搭配 20万 token 输出,在 Grok 4.7 上定价为输入 $4.00、输出 $12.00(两者均高于其阈值),而在 GPT-6 Sol 上为输入 $4.00、输出 $15.00。这是 GPT-6 Sol 按 token 计算更贵的唯一配置,在假定 ChatGPT 时代的默认选项更便宜之前,值得对照检查一下你自己的平均值。

OpenAI 改变了什么,以及这为何在这里重要

GPT-6 是一个由三款模型组成的家族,而 2026 年 10 月 7 日,OpenAI 将其中的中间款推到了公众面前。ChatGPT 中的 GPT-6——即 Intelligent UI 的推出——由面向 Plus、Pro、Business 和 Enterprise 的 GPT-6 Sol 提供支持,并由面向 Free 和 Go 的 GPT-6 Luna 提供支持,覆盖每周使用 ChatGPT 的超过 12 亿人。这是分发层面的事实,而不是能力层面的事实,并且它改变了“GPT-6”在比较中的含义:当有人说 GPT-6 在某项基准测试中击败或输给了另一个模型时,他们具体指的是 GPT-6 Sol,或者是指 $10.00 / $50.00 的旗舰 GPT-6 Astra。

对于这场对决,ChatGPT 的推出只在一个具体方面至关重要。Grok 4.7 于 2026 年 9 月 21 日发布,比 GPT-6 Sol 早四天;它是一款纯 API 和应用模型,没有与之相当的十亿用户级消费者默认产品。SpaceXAI 自己对它的描述狭窄而具体:一款面向长时间运行的软件工程、带工具使用与自我验证的智能体工作流以及知识工作的旗舰模型。这是一种关于产出密集型工作的定位,而这恰恰是 Grok 这张牌更强的情形。

记分牌,如实标注

对这两者的独立评估来自 Artificial Analysis,总结是:它们在综合指数上很接近,但在各项单项测试上表现分化,而这种分化与产品本身相吻合。

• AA Intelligence Index:Grok 4.7 46.4(在其评估的模型中排名第16),GPT-6 Sol 47.6——GPT-6 Sol 领先约1分
• Humanity's Last Exam:Grok 4.7 43.1%,GPT-6 Sol 47.9%
• SciCode:Grok 4.7 57.4%,GPT-6 Sol 57.6%——基本持平
• Long-Context Recall:Grok 4.7 76.7%,GPT-6 Sol 83.7%——GPT-6 Sol 领先,与更大的上下文窗口一致
• Terminal-Bench(Grok 模型卡上的 v4.0):Grok 4.7 25.8%,GPT-6 Sol 在同一测试框架系列上为 43.9%
• Coding:Grok 4.7 进入编程指数的前10%,与排行榜上最强的模型并驾齐驱

两点需要说明,而且它们并非可有可无。这两个模型的指数值是在不同日期评估的,所以这不是同日正面对比,而且一个百分点的差距落在一次修订所产生的波动范围内。另外,上文所有 Grok 4.7 的数据都是提供商自行发布、收录于该目录中的数字,并非我们重新跑出的分数——诚实的解读是:Grok 4.7 是一个位列前十分位的编程模型,在通用推理综合评分上落后 GPT-6 Sol 约一分左右,而 terminal-bench 的差距是这一组数据中最大的单一信号。

Screenshot of the OrcaRouter model page for Grok 4.7, showing the SpaceXAI Grok 4.7 card with a 500,000-token context window, up to 450,000-token output, text/image/file input and text output, and a tiered rate of $2.00 per million input and $6.00 per million output up to 200,000 tokens, stepping to $4.00 and $12.00 above.

延迟和可靠性,规格表所隐瞒的

已发布的费率卡和基准表都遗漏了决定生产环境服务质量的关键因素,因此值得关注实测数字,而非宣传数字。

在 OrcaRouter 自家 playground 于 2026 年 10 月第一周的测量中,Grok 4.7 返回的首 token 延迟中位数为 3,825 毫秒,并以大约每秒 147 个 token 的速度生成输出,错误率约为 8%。同一时间窗口内,GPT-6 Sol 测得的中位延迟更高——6,363 毫秒——错误率也高得多。这些是在共享路由上的 playground 观察结果,并非厂商 SLA;而某个模型路由上 39% 的错误率是路由问题,而不是模型问题;这正是故障转移旨在弥合的那类差距。对于比较而言,要点在于:在那个特定时间窗口内,Grok 4.7 的路由看起来显著比 GPT-6 Sol 的路由响应更快、更可靠,而两家厂商公布的产品卡都不会告诉你这一点。

同时运行两者,但不对任何一方做出承诺

在如此接近的一场对决中,诱惑在于提前根据价格选定其中一个,然后在三个月后才发现你的流量形态已经改变。这正是路由所解决的问题。在 OrcaRouter 上,grok/grok-4.7和 GPT-6 Sol 都是同一目录中的实时路由,位于同一个 API 之后,按提供商的标价、0% 加价——因此当 SpaceXAI 或 OpenAI 调整费率时,变更当天即生效,而不是等到你下一次发票对账时。跨提供商的自动故障转移覆盖了某条路由性能下降的情况,鉴于上文中的错误率差异,这一点直接相关。而路由 DSL 让你按请求形态而非模型偏好来分流流量:把长输入、短输出的工作交给窗口更大的模型,把长输出生成交给具有 450K 上限且输出费率更便宜的那个,让请求大小谓词来做选择,而不是由人来决定。

选择

如果你的工作是长文档分析、大上下文推理,或任何输入 token 超过 200,000 的场景,GPT-6 Sol 才是更好的那张牌:上下文翻倍、独立指数更高,阈值还向外多出 72,000 个 token。如果你的工作是生成——长篇代码产物、长文写作、需要模型把发现写出来的长工具调用链——Grok 4.7 才是更好的那张牌:450,000 token 的输出上限是 GPT-6 Sol 无法企及的,输出 token 便宜 40%,还有与之匹配的、位列前十分位的编码表现。如果你两者都要做,答案就不是某个模型,而是一条路由。

A comparison card titled 'The shape of the request decides'. Left column 'Grok 4.7': rows 'Context: 500K', 'Output: up to 450K', 'Input: $2.00 to 200K, then $4.00', 'Output: $6.00, then $12.00', 'AA Index: 46.4'. Right column 'GPT-6 Sol': rows 'Context: 1,050,000', 'Output: 128K', 'Input: $2.00 to 272K, then $4.00', 'Output: $10.00, then $15.00', 'AA Index: 47.6'. A footer reads 'Figures per each vendor's published card and Artificial Analysis; evaluation dates differ between models.'Screenshot of the OrcaRouter model page for GPT-6 Sol, showing the OpenAI GPT-6 Sol card with a 1,050,000-token context window, 128,000 maximum output, text/image/file input, and the tiered rate card of $2.00 per million input and $10.00 per million output up to 272,000 tokens, stepping to $4.00 and $15.00 above that.

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新