一篇对比 GPT-6 Sol 与 Grok 4.7 的文章的主视觉标题卡,标题为“GPT-6 Sol vs Grok 4.7”,副标题为“更便宜的词元,却贵了三倍”,并展示统计数据“240M 对 77M 输出词元”,其中 Grok 4.7 的输出价格为 $6.00、每任务 $3.74,GPT-6 Sol 的输出价格为 $10.00、每任务 $1.06。
Guides & Insights

GPT-6 Sol 与 Grok 4.7:更便宜的 Token,成本却高出三倍

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026 年 9 月,两款模型相隔一天发布,而在标价上它们并不接近。Grok 4.7于 9 月 21 日上线,定价为每百万输入 token 2.00 美元、每百万输出 token 6.00 美元。GPT-6 Sol于 9 月 22 日上线,输入价格同为 2.00 美元,输出则为 10.00 美元。Grok 的输出便宜了 40%。大多数对比正是完全依据这一点来选择它,而这恰恰是那个不该看的数字。

决定这场配对的数字,并不在两家任何一家的价目表上。它是 2.4 亿对 7700 万——Artificial Analysis 运行其 Intelligence Index 时,两个模型各自生成的输出 token 数。回答同一组问题,Grok 4.7 消耗的 token 量略高于后者的三倍。再乘以每 token 的费率,那个输出更便宜的模型,每个完成任务的成本最终是 3.74 美元,而另一个是 1.06 美元。单 token 更便宜,账单却高出三倍还多。

每个模型实际上是什么

Grok 4.7 是 xAI 推出的 Grok 4.6 继任者,定位为其最强的编程与知识工作模型,拥有 500,000 token 的上下文窗口,支持文本和图像输入、文本输出,推理强度可在 low、medium、high 和 xhigh 之间配置。xAI 未披露参数数量。据报告,它接受的预训练截止时间为 2026 年 6 月,并延续补充训练至 8 月。

GPT-6 Sol 是 OpenAI 的中端 GPT-6 模型——低于旗舰级的 GPT-6 Astra,高于经济型的 GPT-6 Luna——拥有 1,050,000 个 token 的上下文窗口、922,000 个 token 的最大输入、128,000 个 token 的输出上限,以及 2026 年 4 月 20 日的知识截止日期。它支持文本和图像输入、文本输出,推理强度从 none 到 max,OpenAI 将其定价描述为永久而非促销。

上下文窗口的差距并不小。Sol 的大约是它的两倍。这只对某一类工作负载有影响,而这类负载并不是大多数人会跑的那种。

费率表,以及颠覆它的那一行

• Input — GPT-6 Sol 每百万个词元 2.00 美元,而 Grok 4.7 每百万个词元 2.00 美元;完全相同

• 输出 — GPT-6 Sol 每百万个token 10.00美元,而 Grok 4.7 每百万个token 6.00美元;Grok 便宜40%

• 缓存输入 — GPT-6 Sol 每百万个 token 0.20 美元,而 Grok 4.7 为每百万个 token 0.50 美元;Sol 的缓存读取便宜 2.5 倍,这与输出费率所暗示的正好相反

• 缓存写入 — GPT-6 Sol 每百万 token 2.50 美元,而 Grok 4.7 的费率未在同一表格中公布

• 上下文窗口 — GPT-6 Sol 1,050,000 tokens,而 Grok 4.7 为 500,000 tokens

• 长上下文附加费 — 对于超过 272,000 个输入 token 的请求,GPT-6 Sol 会对整个请求重新定价,输入和缓存费率按 2 倍计、输出按 1.5 倍计;而 Grok 4.7 则在 200,000 个输入 token 时将每项费率都翻倍,同样针对整个请求

• 知识截止日期——GPT-6 Sol 为 2026 年 4 月 20 日,而 Grok 4.7 的预训练截止日期据报道为 2026 年 6 月,补充训练持续至 8 月

• 推理强度 — GPT-6 Sol:无、低、中(默认)、高、极高、最大,对比 Grok 4.7:低、中(默认)、高、极高

• 模态 — 输入文本和图像,输出文本,两者皆然

缓存这一档才是买家真正该盯住的。Grok 的输出价格更低,但它的缓存输入价格是 Sol 的两倍半,而冗长的 agent 历史和反复出现的系统提示词,恰恰都落在缓存输入这一块。对于以反复读取庞大稳定上下文为主的工作负载而言,两者之间的差距会比 6 美元对 10 美元所暗示的小得多——而一旦在此基础上再套上 token 用量比,排序就会颠倒过来。

A six-row scoreboard card titled 'GPT-6 Sol vs Grok 4.7 - the scoreboard', comparing the two models on output price, cached input, context window, Intelligence Index score, index output tokens and cost per task. The left column lists GPT-6 Sol at $10.00 output, $0.20 cached input, a 1,050,000-token context, an Index of 48, 77M index tokens and $1.06 per task; the right column lists Grok 4.7 at $6.00 output, $0.50 cached input, a 500,000-token context, an Index of 46, 240M index tokens and $3.74 per task. A footer reads 'Vendor list prices; index figures per Artificial Analysis.'

为什么 2.4 亿个令牌就是全部

Artificial Analysis 测得,Grok 4.7 在 xhigh 下于其索引运行中生成了约 2.4 亿个输出 token,而同一榜单上模型的中位数约为 8800 万。其自身的总结称该模型“显著偏慢且非常冗长”。在同一测试框架上测得的 GPT-6 Sol 生成了 7700 万——在榜单上被描述为“相当简洁”。

该榜单还直接报告了后果。Grok 4.7 在 Intelligence Index 上得分为 46,每任务成本为 3.74 美元。在其高设置下,得分同样为 46,每任务成本为 2.73 美元。GPT-6 Sol 得分为 48,每任务成本为 1.06 美元。相同的 Intelligence Index,相同的测试框架,却存在两到三点五倍的成本差异,而这是任何价目表都没有显示的。

在把这些数字当作一次干净的正面对比之前,有两点需要提醒。这两个页面是在同一天抓取的,但榜单的总数并不相同——Grok 的页面显示的是一个包含 212 个模型的类别,而另一份单独的 Grok 列表报告的排名是在 655 个之中——因此这两个分数并不能保证出自同一个索引版本。而且这两个数字都不是厂商自报的数据:Artificial Analysis 运行的是自己的评测框架,这正是重点所在,但两份列表中的推理设置并不相同(Grok 为 xhigh,Sol 为 max),所以请把 500% 的成本差距当作结论,而把两个点的指数差距当作近似值。

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), captured 23 September 2026, showing an Intelligence Index score of 46, list pricing of $2.00 per million input tokens and $6.00 per million output tokens with a 75% cache discount, a cost of $3.74 per Intelligence Index task, 240 million output tokens generated during the index run, a 500,000-token context window and 39.2 output tokens per second.

xAI 发布了什么,以及没有人核查过什么

xAI 自家的发布数据很亮眼,而且和所有厂商的发布数据一样,未经复现。CursorBench 4.0 在 xhigh 下为 46.3%,对比 Grok 4.6 的 40.4%。Terminal-Bench 4.0 为 38.0%,对比 20.3%——这是本次发布中单项提升最大的一项。DeepSWE v1.1 在 high 下为 71.0%,对比 65.2%。EEBench 为 64.0%,对比 53.0%。这些都是 xAI 自己的测试框架、xAI 自己的设置、xAI 自己的报告。

OpenAI 为 GPT-6 Sol 给出的数字遵循同样的模式,也应该打同样的折扣。区别在于,Sol 比 Grok 多一份独立证据:Artificial Analysis 的每任务成本数据,它是根据实测的 token 消耗量计算出来的,而非取自厂商的评分表。在这样一番比较中,能站得住脚的是这个数字。

对于这两个模型,还没有人发表过在同一批任务、同一套测试框架、同一努力程度设置下的正面对比。如果你看到这样的对比,就检查一下这三个变量中哪一个发生了变化。

为一个月的缓存智能体流量定价

以一个大部分由稳定上下文组成的工作负载为例:一个编码智能体带有 60,000 token 的系统提示词和仓库摘要,每月在 5,000 次调用中被重新读取,每次返回 4,000 个输出 token。假设缓存有效,且稳定前缀按缓存费率计费。

在 GPT-6 Sol 上:3 亿个缓存输入 token,每百万 $0.20,合计 $60.00。2000 万个输出 token,每百万 $10.00,合计 $200.00。总计 $260.00。

在 Grok 4.7 上:同样 3 亿个缓存输入 token,按每百万 $0.50 计算,为 $150.00。2000 万个输出 token,按每百万 $6.00 计算,为 $120.00。总计 $270.00。

几乎完全相同——而这还是在 token 量保持不变的前提下,这已经是很宽松的假设了。在索引运行中,Grok 4.7 的实测冗长度是 Sol 的三倍。哪怕只给输出量乘上 1.5 倍,Grok 的账单也会达到 330.00 美元,而 Sol 为 320.00 美元,并且差距还会从那里继续拉大。更低输出费率的优势经不起缓存加上冗长度的考验;哪怕只有缓存,也勉强撑不住。

这里没有任何内容是在声称这两个模型通过 OrcaRouter 的价格——两者都不在我们的目录中。GPT-6 Sol 可通过 OpenAI 自家的 API 访问,Grok 4.7 则通过 xAI 的 API 访问;Grok 系列的其余型号,包括 Grok 4.6,都可以通过我们进行路由 按 xAI 的标价、采用透传模式。这番计算的意义在于,你编写的升级规则应当基于你自己流量上每个已完成任务的成本,而不是基于价目表——而路由层正是让你无需再签一份合同就能测试该规则的东西。

Screenshot of OrcaRouter's model page for Grok 4.6, captured 23 September 2026, showing the model id grok/grok-4.6 from provider SpaceXAI, a 500,000-token context window, text, image and file input, list pricing of $2.00 per million input tokens and $6.00 per million output tokens, and an OpenAI-compatible API served over both /v1/chat/completions and /v1/responses. Grok 4.7 itself does not appear on the catalogue.

每个所属的地方

• 高吞吐量、缓存上下文的智能体工作负载——GPT-6 Sol。缓存输入这一项以 2.5 倍的差距有利于 Sol,而输出量这一项对 Grok 的优势还高于这个倍数,且两者会叠加。

• 在需要本次发布中已公布的最强 Terminal-Bench 提升的编码工作里——Grok 4.7 就是拥有那个数字的模型,而且这数字很大。只需为 token 做预算,而不是费率。

• 超过 500,000 tokens 的长文档 — GPT-6 Sol,而且差距悬殊。Grok 的窗口在 Sol 的一半处就结束了。

• 对延迟敏感的路径——两者都不合适。Artificial Analysis 列出 Grok 4.7 的输出速度为每秒 39.2 个输出 token,并称其明显偏慢。在你认定 Sol 更快之前,先看看当前榜单上 Sol 自己的速度数据。

• 如果有人给你看了一个逐 token 的对比,并以“所以 Grok 更便宜”结尾——那它就早结束了一步。下一步是 token 数量。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新