一个生成的双栏对比记分板,标题为“GPT-6.1 Sol vs GPT-6 Luna——记分板”。左栏“GPT-6.1 Sol”:各行内容为“智能指数:51.8”、“每个指数任务成本:$0.72”、“每 1M 价格:$2.00 / $10.00”、“索引运行输出 token 数:67M”、“Terminal-Bench 4.0:56.1%”、“努力下限:低”。右栏“GPT-6 Luna”:各行内容为“智能指数:38.1”、“每个指数任务成本:$0.07”、“每 1M 价格:$0.10 / $0.50”、“索引运行输出 token 数:144M”、“Terminal-Bench 4.0:12.6%”、“努力下限:无”。页脚写着“独立数据来自 Artificial Analysis v4.3.2,在最大努力下;供应商标价。”
Guides & Insights

GPT-6.1 Sol 对比 GPT-6 Luna:十三个指数点、十倍的价钱,以及两项它并不占优的评测

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Open​AI 发布了GPT-6.1 Sol,时间为 2026 年 9 月 29 日;而在一周前,GPT-6 Luna于 9 月 22 日在同一场主题演讲周期中问世。它们是同一代模型的两端:Luna 是廉价档,Sol 是高于它的中档,而 GPT-6 Astra 则位于两者之上。两者价格相差一个数量级——每百万 token 0.10 美元和 0.50 美元,对比 2.00 美元和 10.00 美元;缓存输入 0.01 美元对比 0.10 美元——而在独立榜单上的能力差距为 13.7 个 Intelligence Index 分,在最大推理强度下为 51.8 对 38.1。为十三个点花十倍的钱,大致是当前 Open​AI 产品阵容中最差的兑换率。让这一比较值得一写的是随之而来的那个四十美元问题:是哪十三个点?

两个模型,以及它们之间的那一周

GPT-6 Luna 是 GPT-6 代际中的小模型——OpenAI 称其专为高吞吐量、对延迟敏感的工作而打造:分类、抽取、路由、批量摘要,以及智能体的内层循环。它具备 1,050,000 token 的上下文窗口和 128,000 token 的输出上限,可接受文本、图像和文件作为输入,并保留了完整的六级 effort 阶梯,其中包含 无,而 6.1 层级已将其取消。费率表正是它存在的理由:每百万 token 输入 $0.10、输出 $0.50,缓存输入 $0.01、缓存写入 $0.125,并在输入超过 272,000 token 时进入长上下文档位,变为 $0.20、$0.75 和缓存 $0.02。

GPT-6.1 Sol 是一周后发布的中端更新版。相同的上下文窗口、相同的输出上限、相同的输入模态,知识截止日期为 2026 年 4 月 30 日(相较于 Luna 的截止日期),以及一个努力等级阶梯,起始于 低,因为 无 和 最小 会被直接拒绝。它的定价为 2.00 美元和 10.00 美元,缓存输入为 0.10 美元——是 Luna 输入费率的二十倍,也是其输出费率的二十倍,而缓存项每次命中的费用要贵十倍。

两者都在促销中,两者都已接入 ChatGPT Work、Codex 以及 API,并且在我们这边,两者都可以通过同一个密钥调用。这对组合完全不需要二选一。

十三个指数点实际上能换来什么

综合分数是这项比较中信息量最少的数字,因为它对表现迥异的任务取了平均。在 Artificial Analysis v4.3.2 上以最大推理努力逐项评估打分,形态是分化而非斜率:

• AA-LCR v1.1,长上下文推理——GPT-6 Luna 0.833 对比 GPT-6.1 Sol 0.830。Luna 略微领先。

• SciCode——GPT-6 Luna 0.546 对 GPT-6.1 Sol 0.542。再次基本持平,而更便宜的模型又一次在名义上略占上风。

• Terminal-Bench 4.0 — GPT-6 Luna 0.126 对 GPT-6.1 Sol 0.561。43 个百分点的差距;在终端任务上,这两个模型完全不在一个量级。

• 人类的最后考试——GPT-6 Luna 0.385 对比 GPT-6.1 Sol 0.529。

• AutomationBench-AA — GPT-6 Luna 0.532 对比 GPT-6.1 Sol 0.649。

• GDPval-AA v2.1——GPT-6 Luna 的 Elo 为 1437.1,而 GPT-6.1 Sol 的 Elo 为 1575.1,在专业知识工作上存在 138 分的 Elo 差距。

• GDP.pdf — GPT-6 Luna 0.228 对比 GPT-6.1 Sol 0.310。

• CritPt——GPT-6 Luna 0.194 对比 GPT-6.1 Sol 0.317。

• AA-Omniscience — GPT-6 Luna 0.65 对比 GPT-6.1 Sol 41.5。在以零表示答对与答错数量相当的评分尺度上,Luna 恰好处于水位线,而 Sol 则明显高于该水位线。

• MMMU-Pro — GPT-6 Luna 0.797 对比 GPT-6.1 Sol 0.860。

• 每个索引任务的成本,独立核算 — GPT-6 Luna $0.068 对比 GPT-6.1 Sol $0.72;差距约十倍,对便宜模型有利

• 索引运行中的输出 token —— GPT-6 Luna 1.44 亿,而 GPT-6.1 Sol 为 6700 万;同类中位数 Luna 为 1 亿,Sol 约为 8100 万

十次评估中有两次打成平手,且偏向便宜的那个模型。八次由昂贵的模型胜出,而在这八次中,有六次的差距并非微不足道。这才是对这十三个要点的诚实解读:它并不是一条均匀的质量梯度,而是两种能力——持续的智能体式执行与事实可靠性——在这些方面,Luna 根本不属于同一级别的模型;以及一个宽泛的中间地带,在那里差异真实存在,但小到在你自己的评估集里根本看不出来。

AA-LCR 的结果需要附带一点说明,因为这是最能凸显 Luna 优势的数字。0.833 的长上下文推理成绩确实很强,两个模型之间的差距不到半分,但该基准测试衡量的是长输入下的检索与推理能力,而不是在长会话中执行行动的能力。Terminal-Bench 4.0 上的差距,正是“在长会话中执行行动”被量化打分后的模样,而这一差距高达 43 分。

A generated hero card for a GPT-6.1 Sol versus GPT-6 Luna comparison, headed 'Thirteen index points, ten times the money', with two badges reading 'GPT-6.1 Sol: 51.8 at $2.00 / $10.00 per 1M' and 'GPT-6 Luna: 38.1 at $0.10 / $0.50 per 1M', a footer reading 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.', and the OrcaRouter logo in the bottom-right corner.

每任务成本的算术,以及它在何处不再成立

Artificial Analysis 根据实测的 token 消耗为每次指数运行定价,因此成本并非依据价目表推断得出。GPT-6 Luna 的运行成本为每任务 0.068 美元;GPT-6.1 Sol 为 0.72 美元。比值为 10.7 倍,之所以略低于名义上的二十倍价格比,只是因为 Luna 在本次运行中生成了 144 个输出 token,而 Sol 为 6700 万——这个便宜模型的话多程度是对方的两倍多,反而蚕食了自身优势。即便这种排序本身并不接近,而在简答题上差距还会扩大:输出量更少意味着 Luna 的冗长惩罚会缩小,而其价格优势保持不变。

凡是指数无法代表的工作负载,这套算术就不再成立。如果你的任务是一次仓库规模的编辑,需要二十次工具调用保持前后连贯,那么一个完不成任务、定价 0.07 美元的模型会让你付出整个重试循环再加上实际耗时的代价,而一个一次就能跑完、定价 0.72 美元的模型反而更便宜。GPT-6.1 Sol 自己的发布宣传框架完全建立在这个理念之上——按已完成任务计的成本——而且这个框架是正确的:真正相关的比较不是 token 费率,而是每个结果所需的期望成本,而在 Luna 无法完成的任务上,这个期望值是无限的。

两个结构性细节让这条边界更加清晰。第一,长上下文档位:当输入 token 超过 272,000 时,两个模型都会重新定价,Luna 调至 $0.20 和 $0.75,Sol 调至 $4.00 和 $15.00,因此在边界处绝对差距是扩大而不是缩小,但 Luna 调整后的费率仍比 Sol 的标准费率低一个数量级。第二,而且容易被忽略:effort 阶梯的形状并不相同。Luna 接受 none;Sol 不接受。一个先路由到 Sol、在出错或超时时回退到 Luna 的级联,不能把请求的 reasoning.effort原样带过去,因为在一种模型上合法的配置会在另一种模型上返回错误。这是路由层的问题,而不是模型质量的问题,而这正是带路由规则的单一端点应当吸收的那类事情。

两者并行才是关键,而非权宜之计

两个模型都在 OrcaRouter 上,按 Open​AI 自己的标价提供,没有任何加价:GPT-6 Luna 为 $0.10 和 $0.50,缓存输入为 $0.01;GPT-6.1 Sol 为 $2.00 和 $10.00,缓存输入为 $0.10;并且每个模型上的 272,000 token 阶梯都完全按供应商所列原样传递。因为该平台是按提供商的标价原样传递,而不是加价,所以本文中的二十倍比例就是你在两边实际支付的比例。

A screenshot of the OrcaRouter model page for openai/gpt-6-luna, showing the listing dated 2026-09-22, the model described as the fast, cost-efficient tier of OpenAI's GPT-6 series for high-volume and latency-sensitive workloads, a 1M-token context with 128K maximum output, text, image and file input, and the list price of $0.10 input and $0.50 output per million tokens with a 1.45 s median time to first token.

这里特别重要的原因是,这一对组合是一套等待被写出来的级联。分类器、路由器、批量提取任务和仓库级编码智能体不该放在同一个模型上,而价格差距又足够大,以至于无论朝哪个方向选错,代价都很高——一个方向是每次调用贵二十倍,另一个方向是任务失败。一个密钥、两个模型,再加上一条规则:把简单流量发给 Luna,并在任务类别变化或 Luna 的输出未能通过检查时升级到 Sol;这在我们这边只是一次配置变更,而不是再签一份供应商合同。自动故障转移覆盖了二者之一性能降级的情况,而这对一个八天前才发布的模型来说仍是一种现实可能。

A screenshot of OpenAI's GPT-6 Luna documentation page, showing the model ID gpt-6-luna, the effort ladder supporting none, low, medium, high, xhigh and max, a 1,050,000-token context window with 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and the pricing table listing input at $0.10, cached input at $0.01, cache writes at $0.125 and output at $0.50 per million tokens.

决定,一气呵成

• 分类、抽取、路由、批量摘要、智能体内部循环——就用 GPT-6 Luna,别再往下读了。在 $0.10/$0.50、缓存读取仅一分钱的价格下,对于答案简短且可核验的工作而言,十三个指数点的通用能力并不值得付出十倍的账单。

• 仓库级编码、终端智能体、多步执行——GPT-6.1 Sol。Terminal-Bench 4.0 上 43 分的差距就是全部论据;这正是这个价格所购买的能力。

• 错误答案代价高昂的知识工作问题 —— GPT-6.1 Sol,就 AA-Omniscience 与 GDPval-AA 上的差距而言。Luna 的事实可靠性得分正处于水线。

• 输入很长,生成的答案却很短——GPT-6 Luna。它在长上下文上的推理表现与成本高出二十倍的模型不相上下,而其 1.44 亿 token 的冗长惩罚根本没有机会生效。

• 任何已设置为 none 的项目 —— 请继续使用 Luna,或为此次变更预留预算。GPT-6.1 Sol 上不存在这一层级。

• 延迟敏感型场景——根据该榜单自身的测量数据,GPT-6 Luna 每秒输出 129.4 个 token,首个分块耗时 100 秒,而 Sol 则为 59.7 和 332。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新