
GPT-6 Sol 与 Grok 4.7:更便宜的 Token,成本却高出三倍
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
2026 年 9 月,两款模型相隔一天发布,而在标价上它们并不接近。Grok 4.7于 9 月 21 日上线,定价为每百万输入 token 2.00 美元、每百万输出 token 6.00 美元。GPT-6 Sol于 9 月 22 日上线,输入价格同为 2.00 美元,输出则为 10.00 美元。Grok 的输出便宜了 40%。大多数对比正是完全依据这一点来选择它,而这恰恰是那个不该看的数字。
决定这场配对的数字,并不在两家任何一家的价目表上。它是 2.4 亿对 7700 万——Artificial Analysis 运行其 Intelligence Index 时,两个模型各自生成的输出 token 数。回答同一组问题,Grok 4.7 消耗的 token 量略高于后者的三倍。再乘以每 token 的费率,那个输出更便宜的模型,每个完成任务的成本最终是 3.74 美元,而另一个是 1.06 美元。单 token 更便宜,账单却高出三倍还多。
每个模型实际上是什么
Grok 4.7 是 xAI 推出的 Grok 4.6 继任者,定位为其最强的编程与知识工作模型,拥有 500,000 token 的上下文窗口,支持文本和图像输入、文本输出,推理强度可在 low、medium、high 和 xhigh 之间配置。xAI 未披露参数数量。据报告,它接受的预训练截止时间为 2026 年 6 月,并延续补充训练至 8 月。
GPT-6 Sol 是 OpenAI 的中端 GPT-6 模型——低于旗舰级的 GPT-6 Astra,高于经济型的 GPT-6 Luna——拥有 1,050,000 个 token 的上下文窗口、922,000 个 token 的最大输入、128,000 个 token 的输出上限,以及 2026 年 4 月 20 日的知识截止日期。它支持文本和图像输入、文本输出,推理强度从 none 到 max,OpenAI 将其定价描述为永久而非促销。
上下文窗口的差距并不小。Sol 的大约是它的两倍。这只对某一类工作负载有影响,而这类负载并不是大多数人会跑的那种。
费率表,以及颠覆它的那一行
• Input — GPT-6 Sol 每百万个词元 2.00 美元,而 Grok 4.7 每百万个词元 2.00 美元;完全相同
• 输出 — GPT-6 Sol 每百万个token 10.00美元,而 Grok 4.7 每百万个token 6.00美元;Grok 便宜40%
• 缓存输入 — GPT-6 Sol 每百万个 token 0.20 美元,而 Grok 4.7 为每百万个 token 0.50 美元;Sol 的缓存读取便宜 2.5 倍,这与输出费率所暗示的正好相反
• 缓存写入 — GPT-6 Sol 每百万 token 2.50 美元,而 Grok 4.7 的费率未在同一表格中公布
• 上下文窗口 — GPT-6 Sol 1,050,000 tokens,而 Grok 4.7 为 500,000 tokens
• 长上下文附加费 — 对于超过 272,000 个输入 token 的请求,GPT-6 Sol 会对整个请求重新定价,输入和缓存费率按 2 倍计、输出按 1.5 倍计;而 Grok 4.7 则在 200,000 个输入 token 时将每项费率都翻倍,同样针对整个请求
• 知识截止日期——GPT-6 Sol 为 2026 年 4 月 20 日,而 Grok 4.7 的预训练截止日期据报道为 2026 年 6 月,补充训练持续至 8 月
• 推理强度 — GPT-6 Sol:无、低、中(默认)、高、极高、最大,对比 Grok 4.7:低、中(默认)、高、极高
• 模态 — 输入文本和图像,输出文本,两者皆然
缓存这一档才是买家真正该盯住的。Grok 的输出价格更低,但它的缓存输入价格是 Sol 的两倍半,而冗长的 agent 历史和反复出现的系统提示词,恰恰都落在缓存输入这一块。对于以反复读取庞大稳定上下文为主的工作负载而言,两者之间的差距会比 6 美元对 10 美元所暗示的小得多——而一旦在此基础上再套上 token 用量比,排序就会颠倒过来。

为什么 2.4 亿个令牌就是全部
Artificial Analysis 测得,Grok 4.7 在 xhigh 下于其索引运行中生成了约 2.4 亿个输出 token,而同一榜单上模型的中位数约为 8800 万。其自身的总结称该模型“显著偏慢且非常冗长”。在同一测试框架上测得的 GPT-6 Sol 生成了 7700 万——在榜单上被描述为“相当简洁”。
该榜单还直接报告了后果。Grok 4.7 在 Intelligence Index 上得分为 46,每任务成本为 3.74 美元。在其高设置下,得分同样为 46,每任务成本为 2.73 美元。GPT-6 Sol 得分为 48,每任务成本为 1.06 美元。相同的 Intelligence Index,相同的测试框架,却存在两到三点五倍的成本差异,而这是任何价目表都没有显示的。
在把这些数字当作一次干净的正面对比之前,有两点需要提醒。这两个页面是在同一天抓取的,但榜单的总数并不相同——Grok 的页面显示的是一个包含 212 个模型的类别,而另一份单独的 Grok 列表报告的排名是在 655 个之中——因此这两个分数并不能保证出自同一个索引版本。而且这两个数字都不是厂商自报的数据:Artificial Analysis 运行的是自己的评测框架,这正是重点所在,但两份列表中的推理设置并不相同(Grok 为 xhigh,Sol 为 max),所以请把 500% 的成本差距当作结论,而把两个点的指数差距当作近似值。

xAI 发布了什么,以及没有人核查过什么
xAI 自家的发布数据很亮眼,而且和所有厂商的发布数据一样,未经复现。CursorBench 4.0 在 xhigh 下为 46.3%,对比 Grok 4.6 的 40.4%。Terminal-Bench 4.0 为 38.0%,对比 20.3%——这是本次发布中单项提升最大的一项。DeepSWE v1.1 在 high 下为 71.0%,对比 65.2%。EEBench 为 64.0%,对比 53.0%。这些都是 xAI 自己的测试框架、xAI 自己的设置、xAI 自己的报告。
OpenAI 为 GPT-6 Sol 给出的数字遵循同样的模式,也应该打同样的折扣。区别在于,Sol 比 Grok 多一份独立证据:Artificial Analysis 的每任务成本数据,它是根据实测的 token 消耗量计算出来的,而非取自厂商的评分表。在这样一番比较中,能站得住脚的是这个数字。
对于这两个模型,还没有人发表过在同一批任务、同一套测试框架、同一努力程度设置下的正面对比。如果你看到这样的对比,就检查一下这三个变量中哪一个发生了变化。
为一个月的缓存智能体流量定价
以一个大部分由稳定上下文组成的工作负载为例:一个编码智能体带有 60,000 token 的系统提示词和仓库摘要,每月在 5,000 次调用中被重新读取,每次返回 4,000 个输出 token。假设缓存有效,且稳定前缀按缓存费率计费。
在 GPT-6 Sol 上:3 亿个缓存输入 token,每百万 $0.20,合计 $60.00。2000 万个输出 token,每百万 $10.00,合计 $200.00。总计 $260.00。
在 Grok 4.7 上:同样 3 亿个缓存输入 token,按每百万 $0.50 计算,为 $150.00。2000 万个输出 token,按每百万 $6.00 计算,为 $120.00。总计 $270.00。
几乎完全相同——而这还是在 token 量保持不变的前提下,这已经是很宽松的假设了。在索引运行中,Grok 4.7 的实测冗长度是 Sol 的三倍。哪怕只给输出量乘上 1.5 倍,Grok 的账单也会达到 330.00 美元,而 Sol 为 320.00 美元,并且差距还会从那里继续拉大。更低输出费率的优势经不起缓存加上冗长度的考验;哪怕只有缓存,也勉强撑不住。
这里没有任何内容是在声称这两个模型通过 OrcaRouter 的价格——两者都不在我们的目录中。GPT-6 Sol 可通过 OpenAI 自家的 API 访问,Grok 4.7 则通过 xAI 的 API 访问;Grok 系列的其余型号,包括 Grok 4.6,都可以通过我们进行路由 按 xAI 的标价、采用透传模式。这番计算的意义在于,你编写的升级规则应当基于你自己流量上每个已完成任务的成本,而不是基于价目表——而路由层正是让你无需再签一份合同就能测试该规则的东西。

每个所属的地方
• 高吞吐量、缓存上下文的智能体工作负载——GPT-6 Sol。缓存输入这一项以 2.5 倍的差距有利于 Sol,而输出量这一项对 Grok 的优势还高于这个倍数,且两者会叠加。
• 在需要本次发布中已公布的最强 Terminal-Bench 提升的编码工作里——Grok 4.7 就是拥有那个数字的模型,而且这数字很大。只需为 token 做预算,而不是费率。
• 超过 500,000 tokens 的长文档 — GPT-6 Sol,而且差距悬殊。Grok 的窗口在 Sol 的一半处就结束了。
• 对延迟敏感的路径——两者都不合适。Artificial Analysis 列出 Grok 4.7 的输出速度为每秒 39.2 个输出 token,并称其明显偏慢。在你认定 Sol 更快之前,先看看当前榜单上 Sol 自己的速度数据。
• 如果有人给你看了一个逐 token 的对比,并以“所以 Grok 更便宜”结尾——那它就早结束了一步。下一步是 token 数量。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
