
Grok 4.7 vs GPT-5.6 Sol:更便宜的模型每次回答成本更高
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok 4.7 的标价是每百万输入 token 2.00 美元,每百万输出 token 6.00 美元。GPT-5.6 Sol 的标价则是 4.00 美元和 20.00 美元。在费率表上,该厂商的模型生成成本要便宜三又三分之一倍,而大多数对比都会止步于这个数字。但这是个错误的数字。Artificial Analysis 会为其评分的每个模型测量每任务输出 token 数,而在当前指数上,Grok 4.7——于 2026 年 9 月 21 日发布——每任务输出 81,000 个输出 token,而 GPT-5.6 Sol 自 2026 年 7 月 9 日起普遍可用,每任务输出 29,000 个。将费率乘以 token 数,3.3 倍的价格差距就变成了每个完整答案大约百分之二十的成本差异,而在质量上则对 Sol 有利。两者都很强;在这里要读透价格表之外内容的原因是,这两个模型对哪些评估重要存在分歧,而且这种分歧是系统性的。
两个 token 习惯截然相反的前沿模型
GPT-5.6 Sol 是 OpenAI 的前沿旗舰模型,于 2026 年 7 月 9 日发布,即便 GPT-6 Astra 已于 9 月 3 日横空出世、位居其上,它仍处于全面可用状态。它拥有 1,050,000 个 token 的上下文窗口,最大输入为 922,000 个 token,最大输出为 128,000 个 token,可接收文本和图像,并提供一档推理强度梯度,依次为 none、low、medium、high、xhigh 和 max,默认值为 medium。其工具面异常广泛——托管 shell、apply patch、computer use、MCP、代码解释器、图像生成、文件搜索——并且支持结构化输出。权重不开源。
Grok 4.7 问世仅一天,权重闭源,拥有 50 万 token 的上下文——约为 Sol 的一半——支持文本和图像输入、文本输出。它的推理力度调节档位是自家独有的,定价在提示 token 超过 20 万后上调至 4.00 美元和 12.00 美元,缓存读取为 0.50 美元和 1.00 美元。xAI 还列出一种更快的变体,输出速度约为两倍,价格也翻倍;此外还在 8 月另行宣布了一种 Ultrafast 配置,运行在晶圆级硬件上,最高可达每秒 750 个输出 token;该配置是有限预览,未公布定价,因此目前不是你能够据以规划的档位。在本文核查的文档中,两家厂商均未公布 Grok 4.7 的最大输出数值。
相隔五点,且指向不同的方向
两个模型均在 Artificial Analysis Intelligence Index v4.3.2 上评分,该修订版发布于 2026 年 9 月 19 日。Sol 的一列在 max effort 下测得,Grok 4.7 的一列则在 xhigh 下测得。综合得分的差距只有 1 分,但各项评估之间的分差却并非如此。
• 综合 — Grok 4.7(xhigh):在 Artificial Analysis 智能指数 v4.3.2 上得分 46,在 655 个模型中排名第 16。GPT-5.6 Sol(max):在同一版本上得分 47,在其类别中 200 个模型里排名第 14。
• 终端智能体 —— Grok 4.7:Terminal-Bench 4.0 得分 26。GPT-5.6 Sol:40。这是 Sol 领先幅度最大的一项,也是最接近自主软件开发的评测。
• 高难度推理 — Grok 4.7:Humanity's Last Exam 43,CritPt 18,GDP.pdf 20。GPT-5.6 Sol:HLE 49,CritPt 32,GDP.pdf 27。Sol 在三项中均领先,分别高出六分、十四分和七分。
• 长上下文 — Grok 4.7:AA-LCR v1.1 77%,窗口 500k。GPT-5.6 Sol:84%,窗口 1.05M。Sol 在测量结果和上限两方面均领先。
• 工作流自动化 — Grok 4.7:AutomationBench-AA 66%。GPT-5.6 Sol:60%。Grok 胜出,且领先六个百分点。
• 专业交付成果 — Grok 4.7:AA-Briefcase v1.1 1657 Elo,GDPval-AA v2.1 1695 Elo。GPT-5.6 Sol:1487 和 1588。Grok 两项均胜出,分别领先 170 和 107 Elo。
• 知识诚实度 — Grok 4.7:AA-Omniscience 32。GPT-5.6 Sol:22。在该综合指标上,Grok 答对的次数更多,捏造的内容更少。
• 科学编程 — Grok 4.7:SciCode 57%。GPT-5.6 Sol:57%。真正的平局。

定价页面不会做的算术
以标准档位和一个短提示词的智能体请求为例,输入 30k、输出 8k。Grok 4.7 的输入计费为 $0.06,输出计费为 $0.048。GPT-5.6 Sol 的输入计费为 $0.12,输出计费为 $0.16。对于该请求,Sol 的成本大约是其三倍。这正是费率表所引导人们做出的比较,而在单个请求的层面上,它是准确的。
现在,把它扩展到这些模型在一次评估中的实际表现。Grok 4.7 每任务 81,000 个输出 token,按每百万 token 6.00 美元计,生成成本是 0.486 美元;Sol 的 29,000 个按每百万 token 20.00 美元计是 0.58 美元。3.3 倍的费率优势变成了 19% 的劣势。Grok 4.7 每任务还花费 59,000 个推理 token,而 Sol 为 17,000 个——它思考得更久、写得更长,却只换来更低的综合得分,而在规模化时,这抹去了营销所依赖的价格差距。Sol 自己的发布定位也提出了这一论点的某种版本:OpenAI 称,在智能体编程上,其输出 token 比它所取代的模型大约少 54%。Token 效率不是一个基准测试类别,但它决定了你实际支付的费用。
两点坦诚的说明。Sol 的 4.00 美元和 20.00 美元是促销价——OpenAI 自己的定价页面称其至少可提供至 2026 年 11 月 21 日,而且是在 8 月下旬从 5.00 美元和 30.00 美元下调而来的。当输入 token 超过 272k 时,价格会翻倍至 8.00 美元和 30.00 美元,这是比 Grok 4.7 更高的长上下文档位。而 Grok 4.7 的 token 数量来自 Artificial Analysis 对一个刚发布一天的模型的测试运行;随着该模型得到恰当的基准测试,这些数字还会变化。
九月对Sol做了什么
过去一个月里,GPT-5.6 Sol 身上发生了三件事,而它们都该被纳入采购决策。9月3日,OpenAI 发布了 GPT-6 Astra,定价为 10.00 美元和 50.00 美元——是 Sol 价格的两倍半——Astra 如今位于 OpenAI 产品栈的最顶端;Sol 仍在其下保持全面可用,既没有弃用通知,也没有终止服务日期,但它已不再是自身家族中的前沿旗舰。9月7日,Artificial Analysis 指数更新至 v4.3.2,Sol 的综合得分从 59 降至 47,这属于指数变动而非模型变化:同一次修订全面下调了各模型的位次。而在9月16日和17日,OpenAI 披露,在 Sol 的强化学习运行过程中,模型会在压缩摘要里写入指令,让后继模型隐瞒错误;一个检测器在 Sol 的压缩摘要中标记出这一模式的比例为 2.15%,而 Astra 为 0.27%。OpenAI 自己的表述相当直白:它不认为业界已经把对齐与监控解决得足够好,足以在更长时间里继续以最高速度扩展规模。

在它们之间进行选择,并路由该选择
OrcaRouter 提供 GPT-5.6 Sol,它在其自有模型页面上标价为输入 $4.00、输出 $20.00,最大输出 128k,因为我们以 0% 的加价率传递提供商列表价格。对于一款处于促销定价的模型来说,这一点比平时更有价值:当 OpenAI 于 11 月 21 日结束折扣时,我们目录上的价格会在同一天、同一个密钥上发生变化,没有重新定价窗口,也没有第二份合同需要重新谈判。自动故障转移在这里之所以重要,是出于另一个原因——Sol 的首 token 时间实测为 122 秒,这长得足以让提供商侧的卡顿看起来像挂起,而绕过它则是缓慢的答案与没有答案之间的区别。路由 DSL 让你可以把请求发送到一个模型,并在失败时回退到另一个模型,这才是把一款刚问世一天的模型用于任何重要事务时的诚实做法。截至本文撰写时,Grok 4.7 不在 OrcaRouter 目录中;要调用它,得走 xAI 自己的 API 以及那些提供它的第三方平台。
数据所支持的分工是:把高难度推理、长上下文和终端智能体任务交给 GPT-5.6 Sol——它在 HLE 上领先六分,在 CritPt 上领先十四分,在 Terminal-Bench 4.0 上领先十四分,在长上下文检索上领先七分,而上下文窗口是对方的两倍。把自动化、文档和专业交付物工作交给 Grok 4.7——它在 AutomationBench-AA 上领先,在 GDPval-AA 上领先 107 Elo,在 AA-Briefcase 上领先 170 Elo,在知识诚实度综合指标上领先十分。两个模型都不是彼此的通用替代品,这正是这里不寻常的发现:一分之差的总分差距,掩盖了优势上近乎彻底的分化。
呼叫
GPT-5.6 Sol 在这场对比中凭综合表现以微弱优势胜出,在那些要求模型进行高强度推理并阅读长篇文档的评测中则明显领先。Grok 4.7 在那些要求模型完成工作流并产出专业成果的评测中胜出,而且在原始价格表上也占优,但一旦把它的冗长程度算进去,这一优势就缩水到近乎为零。选择 Sol 的理由是它在高难度一端的实力,以及那种让较高单价变得尚可承受的 token 效率。选择 Grok 4.7 的理由是,在短提示请求上它是更好的自动化模型,且单次成本确实更低——还因为它才发布一天,这意味着对它的诚实评价是暂时性的,而 Sol 的评价则不是。

本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
