生成的 hero 标题卡主标题为“GPT-6 Luna vs Grok 4.6”,副标题为“价格是其二十倍,并在 200,000 tokens 处出现断崖”,页脚为“价格数据来自 OpenAI 和 xAI;指数数据来自 Artificial Analysis.”,OrcaRouter 标志合成于右下角。
Guides & Insights

GPT-6 Luna 与 Grok 4.6:价格差距达二十倍,窗口期才是真正的差异

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

GPT-6 LunaGrok 4.6放在同一页上,第一项对比就不言自明。Luna 的标价是每百万输入 token 0.10 美元、每百万输出 token 0.50 美元。Grok 4.6 的标价是 2.00 美元和 6.00 美元,缓存读取为 0.50 美元。输入上是二十倍,输出上是十二倍,而在该厂商的模型上,缓存输入费率要高出五十倍。这就是标价,而单看标价,答案毫无悬念。

之所以值得把这篇分析的剩余部分写下去,是因为这两个模型在比价格更具结构性的问题上存在分歧。Grok 4.6 搭载 500,000 token 的上下文窗口,一旦提示超过 200,000 token,就会对整个请求重新计价。GPT-6 Luna 搭载 1,050,000 token,并在 272,000 处重新计价。这两个阈值都是悬崖式跳变,而非边际费率——一旦越过其一,整个请求都会按更高的数字计费,而不是只对超出线的那部分计费。这两道悬崖位于何处,以及长上下文工作负载落在各自错误一侧时会发生什么,比那个二十倍的标题数字更能决定这场对比的走向。

两个模型,两种截然不同的姿态

Grok 4.6 是 xAI 于 2026 年 8 月 12 日发布的模型,它是一款通用型前沿发布:文本输入、文本输出,500,000 token 的上下文窗口,在独立评测平台上以高投入模式运行时公布的每任务成本为 1.86 美元,实测输出速度为每秒 57.7 个 token。这正是团队会采用的那类模型,因为它擅长很多事情,而且厂商迭代发布速度很快。

GPT-6 Luna 则采取了相反的定位。OpenAI 于 2026 年 9 月 22 日发布它,将其作为 GPT-6 家族中的走量层级,位于定价 $2.00/$10.00 的 GPT-6 Sol 和定价 $10.00/$50.00 的旗舰 GPT-6 Astra 之下。文本和图像输入,文本输出,1,050,000 token 窗口,最大输入 922,000 token,输出上限 128,000 token,推理档位从 none 一路到 low、medium、high、xhigh 和 max,其中 medium 为默认值。它并非那种靠广度被人选用的模型。它是一种置于工作负载底层的模型。

所以,诚实的说法不是“这些当中哪一个更好”,而是“这些当中哪一个的定价适合你所拥有的工作形态”,而这两种形态确实不同。

卡片,逐行

每个维度一行,每行均包含两侧:

• 每 100 万输入 — GPT-6 Luna $0.10 vs Grok 4.6 $2.00

• 每 100 万输出 — GPT-6 Luna $0.50 对比 Grok 4.6 $6.00

• 每 1M 缓存输入 — GPT-6 Luna $0.01 对比 Grok 4.6 $0.50,前者是其自身输入费率的十分之一,后者则是 xAI 输入费率的四分之一

• 长上下文阈值 — GPT-6 Luna 272,000 输入 token,对比 Grok 4.6 200,000 提示 token

• 长上下文费率 — GPT-6 Luna 将整个请求重新定价为输入 $0.20、输出 $0.75、缓存 $0.02,而 Grok 4.6 将整个请求重新定价为输入 $4.00、输出 $12.00、缓存 $1.00

• 上下文窗口 — GPT-6 Luna 1,050,000 tokens 对比 Grok 4.6 的 500,000 tokens

• 最大输出量——GPT-6 Luna 为 128,000 个 token,而 Grok 4.6 未在规格卡上作为单独上限公布

• 智能指数,独立评测——在指数修订版 v4.3.2 上,GPT-6 Luna 以最大努力取得 37 分,对比 Grok 4.6 以高努力取得 44 分

• 默认努力程度得分——GPT-6 Luna 在其默认的中等档位下为 29 分,而 Grok 4.6 在中等档位下为 43 分,榜单也是在该档位下对其进行测评的

• 每个 Index 任务的成本,独立运行 — GPT-6 Luna 约 $0.07,而 Grok 4.6 在高强度模式下为 $1.86

• 索引运行中的输出 token 数 — GPT-6 Luna 150M 对比 Grok 4.6 94M,而榜单中位数为 88M

• 输出速度,独立测试 — GPT-6 Luna 153.9 tokens/秒 vs Grok 4.6 57.7 tokens/秒,高负载下

• 首 token 时间,独立测试——Grok 4.6 为 38.63 秒,端到端为 47.31 秒;GPT-6 Luna 返回首个 token 的时间足以让用户愿意等待

• 网络能力,独立——Grok 4.6 在该委员会的网络评估中得 57 分;未公布可比的 GPT-6 Luna 数据

• 在 OrcaRouter 上——GPT-6 Luna 不在我们的目录中,而 Grok 4.6 可按 xAI 的标价进行路由

Generated two-column scoreboard titled 'GPT-6 Luna vs Grok 4.6 - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, Long-context threshold 272,000, Context 1,050,000, AA Index 37 at max effort, Cost per index task $0.07. Right column Grok 4.6 rows: Price in/out $2.00 / $6.00, Cached input $0.50, Long-context threshold 200,000, Context 500,000, AA Index 44 at high effort, Cost per index task $1.86. Footer: 'Prices per OpenAI and xAI; index figures per Artificial Analysis.'

20万对27.2万就是全部论点所在

读出两个窗口旁边的两个阈值,对比便会自行重新组织。

Grok 4.6 的断崖出现在 500,000 token 窗口中的 200,000 token 处——也就是走到 40% 的位置。GPT-6 Luna 的断崖则出现在 1,050,000 中的 272,000 token 处——走到 26% 的位置。所以,更便宜的模型不仅开始重新定价的时间更晚,而且在越过阈值之后、直到窗口彻底耗尽之前,它剩下的空间也是前者的两倍多。

具体来说:一个 45 万 token 的请求在两个模型上都能容纳。在 GPT-6 Luna 上,它按长上下文档位计费,价格为 $0.20 和 $0.75。而在 Grok 4.6 上,计费价格为 $4.00 和 $12.00。同样的提示词,输入价格相差二十倍,输出价格相差十六倍——而且这是 Grok 4.6 能够处理的请求,所以这个选择是真实存在的,而非理论上的。

反过来那种情况才是最容易让人栽跟头的。一个 190,000 token 的请求低于两个阈值,并在两者上都按标准费率计费:$0.10/$0.50 对 $2.00/$6.00,正好是二十倍和十二倍。一个 210,000 token 的请求高于 Grok 4.6 的界限,低于 GPT-6 Luna 的界限。它在 Grok 4.6 上按 $4.00/$12.00 计费,在 Luna 上按 $0.10/$0.50 计费——足足四十倍和二十四倍的差距,完全由提示长度上 20,000 token 的差异造成,而两个模型本身都没有任何变化。

这不是回避 Grok 4.6 的理由。这是要弄清楚你的提示词实际落在哪里的理由,因为平均 180,000 个 token、峰值达到 220,000 个 token 的工作负载会按两种不同的费率标准付费,而且在它发生的第一个月,看起来会像一次计费错误。

价差在独立董事会上能换来什么

Grok 4.6 在高强度模式下于 Artificial Analysis Intelligence Index 上得分 44。GPT-6 Luna 在最高强度模式下得分 37。7 分,而在这个综合评分中,单是 1 分的差异就已落在一次重跑的噪声范围内——同时,这两个模型在每完成一项任务的成本上相差约 26 倍,分别为 1.86 美元与约 0.07 美元。

关于那对数字,有两点值得分开来看。

首先是 effort 的默认档位。GPT-6 Luna 的 37 是最高 effort 档位下的数字,它的默认档位是中等,得分为 29。Grok 4.6 的 44 是高 effort 档位下的数字,排行榜也测量了它在中等档位下的表现,得分为 43。因此在默认设置下同口径比较是 29 对 43——相差十四分,而非七分,而十四分这个版本才是同时部署两者且不做任何改动的团队实际会感受到的差距。Grok 4.6 从高降到中等只损失一分。GPT-6 Luna 损失八分。effort 档位对便宜模型造成的代价远高于对昂贵模型的代价,而这种不对称在头条指数数字中完全看不出来。

第二点是冗长程度,而这里的方向与价格比所暗示的相反。GPT-6 Luna 在完成该索引时生成了 1.5 亿个输出 token;Grok 4.6 生成了 9400 万个。每输出 token 成本只有十二分之一的模型,却多用了 60% 的 token,最终得分反而更低。在按输出计费的价格卡上,这就是每任务成本差距是二十六倍还是更小之间的区别,也是任何仅依据标价进行的比较都会高估廉价档位优势的原因。

Grok 4.6 在同一榜单上也公布了 57 分的网络能力评分。GPT-6 Luna 没有可比的数字,因此这一维度只有单方面的数据——但如果你的工作负载涉及安全工具,这类指标就很关键,而较便宜的模型缺少这一数据本身就是一种信息,而不是一个可以用假设来填补的空白。

延迟,其中两者既不接近,也不在同一方向上

Grok 4.6 的独立延迟数据为:在高推理强度下,首个 token 耗时 38.63 秒,端到端耗时 47.31 秒。这是一个在开口前进行深度推理的模型的数字,与一个人盯着光标等待的场景并不兼容。我们自己为该模型列出的数据记录显示,在七天窗口内,首 token 时间的 p50 为 6.71 秒,p95 为 10.00 秒;这测量的是响应中的另一个时间点,与独立数据不具可比性——这两个数字并不矛盾,它们回答的是不同的问题。

GPT-6 Luna 的输出速度达到每秒 153.9 个 token,并且返回首个 token 的速度足够快,足以支撑交互式界面。在高强度模式下,它的吞吐量几乎是 Grok 4.6 的三倍。对于批处理任务而言,这种差距只是实际耗时上的便利。而对于任何用户正在等待的场景,它就是产品与原型之间的差别。

这种组合并不寻常,值得直白地命名:便宜的模型是快的那个,昂贵的模型是慢的那个,而在相同投入下,昂贵的模型在综合得分上领先七分。这正是为了一次深度思考而构建的模型,与为了快速回答大量问题而构建的模型之间的差异。如果你的工作负载是每个任务一次调用,Grok 4.6 的延迟成本是可以承受的。如果是每个任务上千次调用,那就承受不起了。

你实际上在 xAI 这边买到的是什么

Grok 4.6 每完成一项任务的成本大约是 GPT-6 Luna 的二十六倍,并且在同等投入下领先七个指数点。对于通用型工作负载而言,这种交换比很差;但对于某一特定类别的工作来说,它则是合理的。

有三点可以证明它的合理性。57 的网络评分,是 GPT-6 Luna 并未公布对应指标的一项能力。在 Luna 的 1.5 亿 token 对比下,9400 万 token 的索引运行,在任何输出供人而非解析器消费的任务上,都是一项实实在在的简洁性优势。而且该模型自 8 月 12 日起就已投入生产,比 GPT-6 Luna 存在的时间还长六周——这算不上基准测试,但它是一份实绩记录;而对于一个已经基于它构建产品的团队来说,离开的迁移成本本就是离开所需付出代价的一部分。

相比之下,GPT-6 Luna 的理由主要并不在于二十倍的费率。它在于一百万个 token 窗口内的 272,000 token 阈值、能够被要求完全停止推理、每百万 token 一美分的缓存输入费率,以及使其可作为组件而非端点使用的吞吐量数据。这些都是廉价档位的结构性特性,而另一方再多的指数优势也无法取代它们。

运行其中一个,或两个都运行

Grok 4.6 已在 OrcaRouter 上线,价格与 xAI 的标价一致,采用直通式定价:供应商一侧的费率一旦调整,我们当天就能同步,而不必等经销商重新议价。而对这款模型来说,自动故障转移恰恰是真正体现价值的一环:500,000 token 的上下文窗口配上一道 200,000 token 的断崖,在这样的负载下,偶尔会有请求落到界线错误的一侧,而一条无需重新部署就能在上游之间切换的路由,其价值远不止每 token 那零点几美分的差价。

截至本文撰写时,GPT-6 Luna 尚未收录在我们的产品目录中,需通过 OpenAI 自家的 API 访问。因此,若团队想同时使用两者,就得在原本用于 OpenAI 的密钥之外,再为 Grok 4.6 运行一个密钥。路由 DSL 正是契合这一组合的关键所在:一条规则可将超过 token 阈值的提示发送给能够跨过其价格断崖的模型,而将阈值以下的提示发送给价格仅为其十二分之一的模型——这可以表达为配置,而非应用程序中的分支——当阈值与这两个模型的常见提示长度如此接近时,这一点尤为重要。

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

哪一个,什么时候

如果你的工作负载是高吞吐量、由程序消费且短小,就选 GPT-6 Luna。分类、提取、路由、批量摘要、智能体的内层循环。在 $0.10/$0.50 的价格下,缓存读取只需一美分;相比之下,另一个模型在同等努力水平下,每完成一项任务的成本是它的二十六倍,却只换来七个指数点——这笔账根本不用算。显式设置 effort 参数——默认值是 medium,而宣传中的 37 是最大 effort 下的数值——并让你的长调用保持在 272,000 个 token 以下。

如果你需要网络能力,就选 Grok 4.6;如果你的输出由人阅读,且其简洁性值得付费,或者你有一个 300,000 到 500,000 token 的工作负载,GPT-6 Luna 可以处理,但你宁愿不成为第一个弄清它在该长度下表现如何的团队。明确为 200,000-token 断崖做预算,并且不要在高努力下把它放在交互式界面后面——首个 token 耗时 38 秒不是一个延迟数字,而是关于这个模型用途的声明。

这个比较容易引发的错误,是把二十倍的比率当作决策本身。对某一种工作负载形态而言,它确实是决策点。而对另一种形态,决策发生在 200,000 和 272,000 个 token 处,价格比率只是你事后才会读到的一个细节。

Screenshot of the OrcaRouter model page for Grok 4.6 showing the xAI vendor label, list pricing of $2.00 input and $6.00 output per 1M tokens, a 500,000-token context window, recorded latency statistics, an uptime chart, and the provider routing section.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新