
GPT-6 vs Grok 4.6:两个中间档位,一张在超过 20 万 Token 后出现分化的账单
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
GPT-6 Sol与Grok 4.6在两栏的最上方标价相同:每百万输入 token 2.00 美元,每百万输出 token 6.00 美元。而几乎没有人会在旁边注明的是:这两栏在请求的不同节点就不再对等了。Grok 4.6 在提示超过 200,000 个输入 token 后便开始按长上下文费率计费;GPT-6 Sol 则要等到 272,000 个。一旦越过这两条线,整个请求都会重新计价——而不只是超出的那部分——并且两家厂商的重新计价方向正好相反,而这一点恰恰决定了一次长时间 agent 运行的账单。GPT-6 Sol 及其同系列模型 GPT-6 Astra 和 GPT-6 Luna 于 2026 年 9 月 22 日发布;Grok 4.6 是 SpaceXAI 产品线中的中间档,于 2026 年 8 月 12 日发布,如今 Grok 4.7 也已问世,因此这是两款已发布模型之间的比较,而非其中任何一款的发布。
2026年10月7日还发生了第二件事,这件事对你如何解读 GPT-6 至关重要:OpenAI 开始将 GPT-6推广到 ChatGPT 的主 Chat 标签页中,并于10月8日覆盖免费套餐,其中 Plus、Pro、Business 和 Enterprise 套餐运行 GPT-6 Sol,Free 和 Go 套餐运行 GPT-6 Luna。这是一个表层变化——相同的模型、远为庞大的受众,以及一个 OpenAI 称之为 Intelligent UI 的新界面层。它不会改变任何一项 API 速率。但它确实意味着,如果你正在将“GPT-6”与任何东西进行基准对比,那么你现在进行基准对比的模型,同时也是极大量的人在浏览器标签页中与之对话的模型。
两张卡真正的区别在哪里
• 短上下文输入——GPT-6 Sol 每百万 2.00 美元,对比 Grok 4.6 每百万 2.00 美元
• 短上下文输出——GPT-6 Sol 每百万 10.00 美元,对比 Grok 4.6 每百万 6.00 美元
• 长请求阈值——GPT-6 Sol 在输入超过 272,000 个 token 时重新计价,对比 Grok 4.6 在超过 200,000 个时重新计价
• 长请求输入——GPT-6 Sol 每百万 4.00 美元,对比 Grok 4.6 每百万 4.00 美元
• 长请求输出——GPT-6 Sol 每百万 15.00 美元,对比 Grok 4.6 每百万 12.00 美元
• 缓存输入——GPT-6 Sol 每百万 0.20 美元,对比 Grok 4.6 每百万 0.50 美元
• 上下文窗口——GPT-6 Sol 1,050,000 个 token,对比 Grok 4.6 500,000 个 token
• 输入模态——两者均接受文本、图像和文件
• 知识工作得分——在 Artificial Analysis Intelligence Index 上,GPT-6 Sol 为 47.6,对比 Grok 4.6 的 44.3
• Terminal-Bench 2.1——GPT-6 Sol 未在同一修订版上公布,对比 Grok 4.6 的 88.4
把两行输出合在一起读,决策的轮廓便浮现出来。在20万token以下的任何请求中,Grok 4.6每百万输出token便宜4.00美元,而超过20万之后只便宜3.00美元。这比标题上说的40%要小得多,因为两个模型都是对整条请求重新计价,而不是只对越过分界线的那部分计价——这个细节值得细细琢磨,毕竟一条200,001 token的提示,并不会被拆成1个token按高价、200,000个token按低价来计费。
那么,阈值本身的作用方向就反过来了。Grok 4.6 比 GPT-6 Sol 早 72,000 个 token 开始重新定价。对于始终落在 200K 到 272K 之间的工作负载,尽管 Grok 4.6 的每 token 标价更低,它却是更贵的模型,而且它是两者中唯一真正发生变动的。你的提示词落在那个窗口的哪一侧,比哪个标价更低是更有用的问题。

基准差距比价格差距更小、更窄
在 Artificial Analysis 的 Intelligence Index 上——这是一项第三方测评,而非厂商自制的榜单——GPT-6 Sol 得分为 47.6,Grok 4.6 为 44.3。在 0 到 100 的评分尺度上,3.3 分的差距是真实存在的,但这种差距并不足以让一个模型在某项任务上算错、另一个算对。而且这一结果是在每个模型特定的推理设置下测得的:GPT-6 Sol 提供可配置的推理强度,Grok 4.6 也有自己的设置——因此,任何引用单一正面交锋数字的人,引用的都只是二维网格中的一个点。
两者真正拉开差距的地方在于终端风格的智能体任务。在 Terminal-Bench 2.1 上,Grok 4.6 的成绩为 88.4。对于本目录所收录的那个修订版本,GPT-6 Sol 没有可比的已公布数据,而对空白单元格的诚实解读是:该数字未被公布——而不是该模型表现不佳。如果工作负载是长时间运行、由 shell 驱动的智能体,那么已公布的证据更支持 Grok 4.6,而缺失的证据不能算作任何一方的证据。
在长文本知识检索上,情况恰好相反。GPT-6 Sol 在长上下文召回上录得 83.7,而 Grok 4.6 为 80.3,且这两款模型的厂商都在别处报告各自的数字——SpaceXAI 强调 Grok 4.6 在 GPQA Diamond 上达到 94.9,而 OpenAI 关于 GPT-6 的材料大多由厂商自报且未经复现。有两条规则可以理清这一点:厂商数字是一种主张,榜单数字是针对某个具名版本的实测结果。两者不可互换,也绝不应被平均成一个单一的“更优”分数。
继任者问题
这两者都不是各自实验室最新的模型,假装它们是,将是这次对比所能做的最具误导性的事。SpaceXAI 于 2026 年 9 月 21 日发布了 Grok 4.7,基础费率同样为 $2.00 / $6.00,智能指数从 44.3 升至 46.4。OpenAI 于 2026 年 9 月 29 日发布了 GPT-6.1 Sol,同样为 $2.00 / $10.00,智能指数为 51.8,而且有一项费率实际上有所改善:缓存输入从每百万 $0.20 降至 $0.10。Artificial Analysis 现在将其 GPT-6 Sol 页面标记为已弃用,并引导读者前往 GPT-6.1 Sol。
所以,公平的提法不是“这两者中你该采用哪一个”,而是“这两者中你该采用哪一个——以及你是否确定,两边都没有已经新出一代的版本”。选择继续使用 GPT-6 Sol 的理由,通常是一个具体的、已存在八天的集成方案,而不是某种能力声明;选择继续使用 Grok 4.6 的理由,则是一个已公布的终端智能体数值,而其继任者尚未在公开场合达到同等水平。两者都有其合理性,而且都有时限。

用一个键同时运行两者
两个模型都由 OrcaRouter 路由,因此让两个候选模型同时保持可用,在机械层面不产生任何成本:用一个 API 面向 200+ 个模型,同一个密钥,无需第二份合同,二者之间也无需改动代码。这一点在这里比通常更重要,因为在这个特定组合中,选用第二个模型的理由不是能力上的对冲,而是路由决策——把 200K 至 272K 的窗口交给 GPT-6 Sol,把所有更短的请求交给 Grok 4.6,同一个应用就能在一个阈值两侧都拿到更便宜的费用,而这个阈值,两家供应商都不让你自行选择。
自动故障转移是同一套配置里乏味的那一半。长上下文智能体运行之所以耗时很长,正是因为有什么东西一直让会话保持打开;而到第四十分钟时提供商的一次小故障,就是那种代价高昂的失败。提前配置好的第二条路由会把这种情况变成一次重试,而不是从头重跑。
我们的目录把两者都按各自提供商自己的标价列出,不加任何加价,因此任一卡片上的费率变动,在到达他们那边的同一天就会到达我们这边。这一点值得平实地讲清楚,而不是当作口号:值得在意的原因是,上面 $0.20 对 $0.50 的缓存输入差价,正是供应商会悄悄改动的那类价格项,而直通意味着你永远不必等转售商跟上。

到底是什么决定的
如果你的提示词很短,Grok 4.6 在输出价格上以任何指数差距都无法弥合的优势胜出,而且它的终端代理得分是两列中已公布的最强数值。如果你的提示词很长,GPT-6 Sol 更晚的重新定价阈值和更长的窗口,比它更高的输出费率更有价值,而缓存输入一项的成本只有四分之一。如果你的提示词介于 200K 和 272K 之间,你手里握着的正是那种看似更便宜的模型反而更贵的工作负载,而解决办法是路由选择,而非模型选择。
值得关注的不是这两款模型中的任何一款,而是已经就位的两个后继者。Grok 4.7 和 GPT-6.1 Sol 都削弱了在此处等待决策的理由,而一项每隔三周就必须重新跑一遍的对比,本就该放在路由器后面,而不是写进架构文档里。
本文中的对比3
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
