
GPT-6.1 Sol 与 Grok 4.7:全场最低的输出费率,最昂贵的对话
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Grok 4.7,即 xAI 的 Grok 4.6 后继版本,于 2026 年 9 月 21 日推出,定价为每百万输入 token 2.00 美元、每百万输出 token 6.00 美元。GPT-6.1 Sol,即 OpenAI 的中端更新版本,在八天后的 9 月 29 日推出,输入 2.00 美元、输出 10.00 美元。两者的输入价格完全相同,Grok 4.7 的输出价格则便宜 40%,而大多数对比也就到此为止。但这个止步点选错了,因为同一家独立机构如今已对这两款模型做了端到端实测:Grok 4.7 在完成 Artificial Analysis 智能指数时烧掉了约 2.4 亿个输出 token;GPT-6.1 Sol 则烧掉了 6700 万个。把更便宜的价格乘以三点五倍的用量,结果就是:每 token 单价更低的那个模型,每完成一项任务要花 3.74 美元,而另一个只需 0.72 美元。
两款模型,相隔八天,以及一张颠倒的费率表
Grok 4.7 是 xAI 最强大的编程与知识工作模型:拥有 500,000 个 token 的上下文窗口,根据厂商自身的产品列表,单次响应最多可输出 450,000 个 token,支持文本、图像和文件输入,推理力度可在 低、中(默认)、高和 极高之间配置。xAI 未披露参数数量,其预训练截止时间据报告为 2026 年 6 月,并持续补充训练至 8 月。
GPT-6.1 Sol 是 OpenAI 对 GPT-6 Sol 档位的一次小幅迭代更新,定位低于 GPT-6 Astra、高于 GPT-6 Luna:上下文为 1,050,000 个 token——约为 Grok 的两倍——而 128,000 个 token 的输出上限约为 Grok 的三分之一,知识截止日期为 2026 年 4 月 30 日,输入方式同样支持文本、图像和文件。其推理阶梯从 low 到 max,默认值为 medium,并且完全不再接受 none了。
每个维度一行,每行均包含两侧:
• 输入 — GPT-6.1 Sol 每 100 万个 token $2.00 对比 Grok 4.7 每 100 万个 token $2.00;完全相同
• 输出 — GPT-6.1 Sol 每 100 万个 token $10.00 对比 Grok 4.7 每 100 万个 token $6.00;Grok 便宜 40%
• 缓存输入 — GPT-6.1 Sol 每 100 万个 token $0.10 对比 Grok 4.7 每 100 万个 token $0.50;Sol 便宜五倍,这与输出那行所暗示的相反
• 上下文窗口 — 1,050,000 个 token 对比 500,000
• 单次响应最大输出 — 128,000 个 token 对比声称的 450,000
• 长上下文阶梯 — 超过 272,000 个输入 token 时对整个请求重新计价:输入和缓存按 2×,输出按 1.5×;而超过 200,000 个输入 token 时所有费率翻倍,同样是针对整个请求
• 推理强度 — low、medium(默认)、high、xhigh、max 对比 low、medium(默认)、high、xhigh
• 权重与参数 — 闭源、未公开 对比 闭源、未公开;两者都不提供检查点
• 在已公布最大推理强度下的 Intelligence Index — GPT-6.1 Sol 在 max 下为 51.8 对比 Grok 4.7 在 xhigh 下为 46.4
• 每项索引任务成本(独立) — $0.72 对比 $3.74
• 索引运行中的输出 token 数 — 6700 万 对比 2.4 亿,而榜单中位数接近 8100 万
那张表里的两行就构成了整个对比。Grok 4.7 的输出费率确实更低,其缓存那一行也确实高出五倍;而它为了接受测量所生成的 token 量达到了三点五倍。单看费率表,它指向一个方向。实测却指向另一个方向,相差五倍。

Grok 4.7 真正领先的地方
把这篇文章写成一场溃败会是不诚实的,因为 Grok 4.7 在真实评测中获胜。在 Artificial Analysis v4.3.2 上以已公布的最高努力水平并排评分——Grok 以 xhigh,Sol 以 max,这一配置差异值得全程牢记:
• GDPval-AA v2.1 — Grok 4.7 Elo 1715.4 对 GPT-6.1 Sol Elo 1575.1。在经济价值高的知识型工作上领先 140 分 Elo,也是费率更低的模型所取得的最大单项独立优势。
• AutomationBench-AA — Grok 4.7 0.6556 对 GPT-6.1 Sol 0.6487。实际上不相上下,名义上稍胜 Grok。
• SciCode — Grok 4.7 0.5741 对 GPT-6.1 Sol 0.5417。在科学编码方面领先 3.2 分。
• Terminal-Bench 4.0 — Grok 4.7 0.2576 对 GPT-6.1 Sol 0.5606。落后 30 分,也是这组对比中差距最大的一项。
• Humanity's Last Exam — Grok 4.7 0.4314 对 GPT-6.1 Sol 0.5292。
• AA-LCR v1.1,长上下文推理 — Grok 4.7 0.7667 对 GPT-6.1 Sol 0.83。
• AA-Omniscience — Grok 4.7 32.0 对 GPT-6.1 Sol 41.5。
• GDP.pdf — Grok 4.7 0.20 对 GPT-6.1 Sol 0.31。
• CritPt — Grok 4.7 0.1771 对 GPT-6.1 Sol 0.3171。
九项评估中有三项是 Grok 4.7 胜出或打平,其中包括最难反驳的那一项:GDPval-AA 就是为了给具有经济价值的专业工作定价而设计的,而 140 分的 Elo 领先优势绝不是噪声。如果你的工作负载正是 GDPval 旨在代表的那一类——文档密集型的分析、专业交付物、有正确答案的判断性抉择——那么费率表更低的那个模型在公正榜单上也是更好的模型,而每任务成本的劣势,正是你为此付出的代价。
xAI 自己公布的发布数字很可观,而且一如所有厂商的发布数据,都没有被复现过。在 xhigh 档位下,CursorBench 4.0 达到 46.3%,而 Grok 4.6 为 40.4%;Terminal-Bench 4.0 达到 38.0%,对比 20.3%,这是本次发布中宣称的最大单项提升;DeepSWE v1.1 在 high 档位下达到 71.0%,对比 65.2%;EEBench 为 64.0%,对比 53.0%。这些用的是 xAI 自己的测试框架、xAI 自己的设置、xAI 自己的报告——而且请注意,Terminal-Bench 4.0 那个 38.0% 的说法,对应的却是独立榜单上同一模型在同一基准上给出的 0.2576,这种落差正是厂商调优配置与中立的最大努力运行之间理应出现的差距。
OpenAI 为 GPT-6.1 Sol 给出的数字也应打同样的折扣,并且存在同样的弱点。这项比较中唯一一个两家厂商都没有给出的数字,是每完成一项任务的成本,因为它是根据实测的 token 消耗量计算出来的,而不是来自评分表。那才是真正站得住脚的数字。
为什么2.4亿个token能决定成败
Artificial Analysis 在其自己的摘要中描述了 Grok 4.7 的冗长程度,而这一比率背后的 token 数量就是证据:2.4 亿个输出 token,对比榜单中位数约 8100 万,大约是同套件上典型模型产出量的三倍。GPT-6.1 Sol 的 6700 万则远低于中位数。把这两个比率放在一起——3.6 倍的体量、0.6 倍的价格——更便宜的输出单价买到的是更多 token,而不是更低的账单,这正是每任务成本 3.74 美元对 0.72 美元所呈现出的样子。
缓存会改变效应的大小,但不会改变其方向,而正是这个细节让人容易栽跟头。Grok 4.7 的缓存输入为每百万 0.50 美元,而 Sol 是 0.10 美元——在长智能体历史与重复系统提示所依赖的那条线上,前者贵了五倍。因此,对于一个以反复读取大段稳定前缀为主的工作负载而言,两个模型的差距会比 6 美元对 10 美元所暗示的更小;而一旦再叠加 Grok 的冗长,差距又会比输入费率所暗示的更大。在这里,缓存这条线和 token 这条线指向同一个方向,这并不常见,也使得这一对比比费率卡所呈现的更清晰。
长上下文条款值得单独定价,因为它们的触发点各不相同。GPT-6.1 Sol 会在输入 token 超过 272,000 时对整个请求重新计价;Grok 4.7 则在超过 200,000 时这样做。在一次 250,000 token 的调用中,Grok 已经翻倍——$4.00 和 $12.00,外加 $1.00 的缓存读取——而 Sol 仍按标准的 $2.00 和 $10.00 计费。在 200,000 到 272,000 token 之间,费率表更便宜的那个模型反而要贵得多,而这一区间在文档处理工作中很常见。
Grok 真正赢在结构而非分数的地方,是输出上限。450,000 token 的最大响应对比 Sol 的 128,000,属于不同类别的产物:一整个生成的代码库、一份长篇转录稿,或是一次调用完成一本书长度的综合内容。如果你今天正撞上输出上限,那么这一条就决定了这场比较,上面成本算术中的任何内容都不适用——无论出多少钱,你都无法买到另一个模型根本不具备的能力。
两者都在同一个按键上,这才是真正实用的地方
Grok 4.7 在 OrcaRouter 上采用 xAI 自己的标价——每百万 token 2.00 美元和 6.00 美元,缓存读取为 0.50 美元,20 万 token 后阶梯价升至 4.00 美元和 12.00 美元,与 xAI 公布的价格完全一致——而 GPT-6.1 Sol 在发布当天就以 OpenAI 的价格登陆我们的路由,即 2.00 美元和 10.00 美元,缓存输入为 0.10 美元,27.2 万 token 的阶梯价保持不变。两者都没有额外加价:平台按供应商标价原样传递,而非加价转售,这意味着任何一方的厂商降价,在这里与在那里同步当天生效,没有第二张账单,中间也没有经销商。

对于这一对组合来说,其价值远不止于便利。这两个模型对各自擅长什么并不一致——Grok 4.1 在专业工作 Elo 和编码方面领先,GPT-5.1 Sol 在终端执行、事实性和长上下文检索方面领先——而这些领域之间的边界,在你自己的流量中会比在基准测试中更早显现。将 GDPval 形态的请求发往一边,把长时程智能体运行发往另一边,置于同一个端点之后,并在两者之间自动故障转移,再加上一条在配置中而非在部署中更改的路由规则,这比开展一个评估项目更能以更低成本找到那条边界。模型融合,即由一组模型共同作答,是平台提供的另一种选择——如果你根本不想按请求逐一挑选的话。

呼叫
• 长输出智能体与终端工作,缓存前缀循环 — GPT-6.1 Sol。在 Terminal-Bench 4.0 上领先 30 分,缓存行便宜五倍,且每完成一项任务的成本只有五分之一。
• 专业知识工作、文档分析与判断类任务 — Grok 4.7,凭借在 GDPval-AA 上 140 分的 Elo 领先优势,同时 token 账单是纳入预算的,而不是凭空假设的。
• 科学编程 — Grok 4.7,以微弱优势胜出,依据是榜单的 SciCode 分项。请用你自己的测试套件复核;3.2 分处在不同提示集可以改变的范围内。
• 单次响应超过 128,000 个输出 token — Grok 4.7,而且没有任何算术可以替代它。
• 输入 token 在 200,000 到 272,000 之间的请求 — GPT-6.1 Sol,因为 Grok 4.7 的整个请求已经翻倍,而 Sol 还没有。
• 尽可能便宜的对话 — 这两者都不是。两者都是前沿定价的模型,都有着前沿级别的 token 消耗需求;比较的关键在于哪一款能完成你的任务,而不是哪一款在抽象意义上便宜。
• 如果一场比较以“Grok 每 token 更便宜”收尾 — 那它就早结束了一步。下一步是 token 数量,而它是 2.4 亿对 67。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
