
GPT-6 Sol Pro vs Grok 4.7:啰嗦程度翻倍,价格仅为三分之一
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 986 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 196 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 112 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
2026年9月最便宜的两款准前沿模型相隔一天发布,而它们真正有意思的地方并不在于谁更聪明。GPT-6 Sol——也就是人们在搜索GPT-6 Sol Pro时想找的那个模型,它不过是把该模型的reasoning.mode设为pro,而非一个独立产品——于2026年9月22日发布,定价为每百万输入token 2.00美元、每百万输出token 10.00美元。Grok 4.7由该厂商于9月21日发布,输入价格同样是2.00美元,输出为6.00美元。在Artificial Analysis的中立测试框架上,两者的指数相差两个点,每完成一项任务的成本相差约两美元,而这一差距的原因并不在于能力,而在于各自为达到目标所消耗的token数量。
Sol 在运行 Intelligence Index 时生成了 7700 万个输出 token。Grok 4.7 生成了 2.4 亿个。这个比例——略高于三比一——就是整个对比,而它颠覆了按 token 单价表所得出的结论。
两张费率表,以及那张便宜的其实并不便宜之处
两家供应商都自行发布这些数字;两者均未经过独立重新定价。
• 输入 — {{1}}GPT-6 Sol{{/1}} 每百万个标记 2.00 美元,对比 {{2}}Grok 4.7{{/2}} 每百万个标记 2.00 美元
• 输出 — GPT-6 Sol 每百万 tokens $10.00,对比 Grok 4.7 每百万 tokens $6.00
• 缓存输入 — GPT-6 Sol 每百万 token 0.20 美元,而 Grok 4.7 每百万 token 0.50 美元;Sol 的缓存读取费用仅为 Grok 4.7 的五分之二,这与标称输出费率所暗示的正好相反
• 上下文窗口 — GPT-6 Sol 1,050,000 tokens,而 Grok 4.7 为 500,000 tokens
• 长上下文附加费 — 对于超过 272,000 个输入 token 的请求,GPT-6 Sol 会对整个请求重新定价,输入和缓存费率按 2 倍计、输出按 1.5 倍计;而 Grok 4.7 则在 200,000 个输入 token 时将每项费率都翻倍,同样针对整个请求
• 知识截止日期——GPT-6 Sol 为 2026 年 4 月 20 日,而 Grok 4.7 的预训练截止日期据报道为 2026 年 6 月,补充训练持续至 8 月
• 推理强度 — GPT-6 Sol:无、低、中(默认)、高、极高、最大,对比 Grok 4.7:低、中(默认)、高、极高
• 模态——两者均接受文本和图像输入并返回文本
缓存读取那一项才是买家该好好琢磨的地方。Grok 4.7 的输出价格低了 40%,但它的缓存输入价格却高出 150%,而冗长的智能体历史记录和反复出现的系统提示词,恰恰都落在缓存输入这一块。对于以反复读取庞大稳定上下文为主的工作负载来说,两个模型的实际差距会比 $6 对 $10 所暗示的小得多。

独立记录,以及那个决定一切的数字
Artificial Analysis 是唯一一个对两种模型都进行过测量的测试框架,其数据值得并排列出,因为这种差异具有启发性。
• 智能指数——GPT-6 Sol 在最大努力下为 48,Grok 4.7 在极高下为 46;两者均远高于同类模型中位数 25
• 每个索引任务的成本 — GPT-6 Sol $1.06 对比 Grok 4.7 $3.74
• 索引运行的输出 Token 数 — GPT-6 Sol 77M 对比 Grok 4.7 240M,中位数为 88M
• 输出速度 — Grok 4.7 测得为每秒 39 个 token,测试框架本身将其标注为明显偏慢;Sol 在同一榜单上的数值未在同一摘要行中公布
• Coding Agent Index — GPT-6 Sol 以每任务 2.99 美元得 57 分,对比 Grok 4.7 的 56 分(使用其第一方 Grok Build 测试框架),较 Grok 4.6 提升九分
指数上只差两个点,每项任务的成本却高达三倍半。这不是定价上的反常现象——而是冗长带来的算术必然。Grok 4.7 是一个会不厌其烦地出声思考的模型;评测框架将其标记为“非常冗长”,而中位数是 8800 万 token,成本跟着 token 走,而不是价目表。
编程代理对比中有一个记分牌所掩盖的注意事项。Grok 4.7 的 56 分是在 xAI 自家的 Grok Build 评测框架内测得的,而这正是 xAI 发布并用于基准测试的配置。Sol 的 57 分则是在中立的评测框架中测得的。第一方评测框架带来的一两分优势,完全在评测框架选择所能解释的范围内,这意味着诚实的解读是:两者在代理式编程上旗鼓相当——而不是 Sol 领先一分。

每家供应商声称的内容,以及双方均未展示的内容
xAI 的发布材料很具体,而且讲的是一个长周期故事:Grok 4.7 基于比 Grok 4.6 更大的基础模型构建,并接受了一轮更长时间的强化学习训练,目标是那些“可能需要数小时才能完成”的任务,从而提升了自我验证、长上下文处理能力以及它在 Grok Bot 环境中的行为表现。厂商报告的数字包括:Terminal-Bench 4.0 为 38.0%,而 Grok 4.6 为 20.3%;CursorBench 4.0 为 46.3%;DeepSWE v1.1 为 71.0%。这些无一例外都是 xAI 自己的测量结果,没有一个经过独立复现;目前流传的独立 Terminal-Bench 4.0 数字明显低于厂商的数据,而这正是这类差距通常呈现出的形态。
OpenAI 对 GPT-6 Sol 的宣传数据与上文已涵盖的相同,并且带有同样的标签。供应商报告的数字为:在 xhigh 努力下,AutomationBench 上为 33.2%,而 Claude Opus 5 在 max 下为 26.9%,每任务成本约为后者的 9%;在 max 努力下,DeepSWE v1.1 上为 68.8%,与 xhigh 下的 Claude Fable 5 相差在 1.1 个百分点以内,每任务成本约低 80%。请注意比较对象:OpenAI 自己的图表将 Sol 与 Anthropic 的模型对比,而不是与 Grok 4.7 对比。两家供应商均未发布过与对方的正面对比数据。

路由层在何处体现其价值
OrcaRouter 并不提供这场对决中的任何一款模型——Grok 4.7 与 GPT-6 Sol 都不在我们的目录之中,因此这里所讲的一切,都不是关于它们经由我们之价格的宣称。在这一特定配对中,路由层的价值体现于故障模式,而非费率卡本身。选用 Grok 4.7 的理由在于其长时程的智能体行为;不选用它的理由在于,每秒 39 个 token 的输出速度会让长时间运行的智能体任务慢到足以产生影响,而一次缓慢的运行,就是一次可能超时的运行。跨提供商的自动故障转移意味着长时间任务可以被路由到当时实际可用的任一模型上,而不会让那种速度成为单点故障;并且路由 DSL 把模型选择表达为调用内部的一条规则,而不是一次迁移——这在这里很重要,因为对于这一配对而言,正确的答案取决于任务是耗费 token 还是对延迟敏感,而这是请求本身的属性,而非季度的属性。
决策规则
• 固定预算下的智能体编程——GPT-6 Sol。在中立编程指数上具备同级能力,而每个任务的成本仅约三分之一,因为它用三分之一的 token 就能达到这一水平。
• 长时程任务,其中运行时长本身就是关键——Grok 4.7。该版本专门针对持续数小时的工作进行了训练,而 SWE-Marathon 和 CursorBench 上的厂商数据正朝着这个方向发展。
• 对延迟敏感的量——就当前记录而言,两者都不合适。Sol 的每任务成本是更优的指标,但 Grok 4.7 实测的每秒 39 个 token 对任何交互式场景都是实打实的限制。
• 主要是缓存命中的长上下文工作负载——GPT-6 Sol,走的是缓存读取计费项,而不是输出计费项。每百万缓存 token 为 $0.20 对 $0.50,而且窗口大小是其两倍,你的提示词中稳定的部分越多,这个理由就越充分。
• 如果你的对比是依据每 token 费率表做出来的——请改用每任务成本重新构建。$6.00 对 $10.00 的输出,是本文中最缺乏信息量的一对数字,却也是每个现有页面都拿来打头的那一对。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
