
GPT-6.1 Sol 对比 GPT-6 Luna:十三个指数点、十倍的价钱,以及两项它并不占优的评测
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
OpenAI 发布了GPT-6.1 Sol,时间为 2026 年 9 月 29 日;而在一周前,GPT-6 Luna于 9 月 22 日在同一场主题演讲周期中问世。它们是同一代模型的两端:Luna 是廉价档,Sol 是高于它的中档,而 GPT-6 Astra 则位于两者之上。两者价格相差一个数量级——每百万 token 0.10 美元和 0.50 美元,对比 2.00 美元和 10.00 美元;缓存输入 0.01 美元对比 0.10 美元——而在独立榜单上的能力差距为 13.7 个 Intelligence Index 分,在最大推理强度下为 51.8 对 38.1。为十三个点花十倍的钱,大致是当前 OpenAI 产品阵容中最差的兑换率。让这一比较值得一写的是随之而来的那个四十美元问题:是哪十三个点?
两个模型,以及它们之间的那一周
GPT-6 Luna 是 GPT-6 代际中的小模型——OpenAI 称其专为高吞吐量、对延迟敏感的工作而打造:分类、抽取、路由、批量摘要,以及智能体的内层循环。它具备 1,050,000 token 的上下文窗口和 128,000 token 的输出上限,可接受文本、图像和文件作为输入,并保留了完整的六级 effort 阶梯,其中包含 无,而 6.1 层级已将其取消。费率表正是它存在的理由:每百万 token 输入 $0.10、输出 $0.50,缓存输入 $0.01、缓存写入 $0.125,并在输入超过 272,000 token 时进入长上下文档位,变为 $0.20、$0.75 和缓存 $0.02。
GPT-6.1 Sol 是一周后发布的中端更新版。相同的上下文窗口、相同的输出上限、相同的输入模态,知识截止日期为 2026 年 4 月 30 日(相较于 Luna 的截止日期),以及一个努力等级阶梯,起始于 低,因为 无 和 最小 会被直接拒绝。它的定价为 2.00 美元和 10.00 美元,缓存输入为 0.10 美元——是 Luna 输入费率的二十倍,也是其输出费率的二十倍,而缓存项每次命中的费用要贵十倍。
两者都在促销中,两者都已接入 ChatGPT Work、Codex 以及 API,并且在我们这边,两者都可以通过同一个密钥调用。这对组合完全不需要二选一。
十三个指数点实际上能换来什么
综合分数是这项比较中信息量最少的数字,因为它对表现迥异的任务取了平均。在 Artificial Analysis v4.3.2 上以最大推理努力逐项评估打分,形态是分化而非斜率:
• AA-LCR v1.1,长上下文推理——GPT-6 Luna 0.833 对比 GPT-6.1 Sol 0.830。Luna 略微领先。
• SciCode——GPT-6 Luna 0.546 对 GPT-6.1 Sol 0.542。再次基本持平,而更便宜的模型又一次在名义上略占上风。
• Terminal-Bench 4.0 — GPT-6 Luna 0.126 对 GPT-6.1 Sol 0.561。43 个百分点的差距;在终端任务上,这两个模型完全不在一个量级。
• 人类的最后考试——GPT-6 Luna 0.385 对比 GPT-6.1 Sol 0.529。
• AutomationBench-AA — GPT-6 Luna 0.532 对比 GPT-6.1 Sol 0.649。
• GDPval-AA v2.1——GPT-6 Luna 的 Elo 为 1437.1,而 GPT-6.1 Sol 的 Elo 为 1575.1,在专业知识工作上存在 138 分的 Elo 差距。
• GDP.pdf — GPT-6 Luna 0.228 对比 GPT-6.1 Sol 0.310。
• CritPt——GPT-6 Luna 0.194 对比 GPT-6.1 Sol 0.317。
• AA-Omniscience — GPT-6 Luna 0.65 对比 GPT-6.1 Sol 41.5。在以零表示答对与答错数量相当的评分尺度上,Luna 恰好处于水位线,而 Sol 则明显高于该水位线。
• MMMU-Pro — GPT-6 Luna 0.797 对比 GPT-6.1 Sol 0.860。
• 每个索引任务的成本,独立核算 — GPT-6 Luna $0.068 对比 GPT-6.1 Sol $0.72;差距约十倍,对便宜模型有利
• 索引运行中的输出 token —— GPT-6 Luna 1.44 亿,而 GPT-6.1 Sol 为 6700 万;同类中位数 Luna 为 1 亿,Sol 约为 8100 万
十次评估中有两次打成平手,且偏向便宜的那个模型。八次由昂贵的模型胜出,而在这八次中,有六次的差距并非微不足道。这才是对这十三个要点的诚实解读:它并不是一条均匀的质量梯度,而是两种能力——持续的智能体式执行与事实可靠性——在这些方面,Luna 根本不属于同一级别的模型;以及一个宽泛的中间地带,在那里差异真实存在,但小到在你自己的评估集里根本看不出来。
AA-LCR 的结果需要附带一点说明,因为这是最能凸显 Luna 优势的数字。0.833 的长上下文推理成绩确实很强,两个模型之间的差距不到半分,但该基准测试衡量的是长输入下的检索与推理能力,而不是在长会话中执行行动的能力。Terminal-Bench 4.0 上的差距,正是“在长会话中执行行动”被量化打分后的模样,而这一差距高达 43 分。

每任务成本的算术,以及它在何处不再成立
Artificial Analysis 根据实测的 token 消耗为每次指数运行定价,因此成本并非依据价目表推断得出。GPT-6 Luna 的运行成本为每任务 0.068 美元;GPT-6.1 Sol 为 0.72 美元。比值为 10.7 倍,之所以略低于名义上的二十倍价格比,只是因为 Luna 在本次运行中生成了 144 个输出 token,而 Sol 为 6700 万——这个便宜模型的话多程度是对方的两倍多,反而蚕食了自身优势。即便这种排序本身并不接近,而在简答题上差距还会扩大:输出量更少意味着 Luna 的冗长惩罚会缩小,而其价格优势保持不变。
凡是指数无法代表的工作负载,这套算术就不再成立。如果你的任务是一次仓库规模的编辑,需要二十次工具调用保持前后连贯,那么一个完不成任务、定价 0.07 美元的模型会让你付出整个重试循环再加上实际耗时的代价,而一个一次就能跑完、定价 0.72 美元的模型反而更便宜。GPT-6.1 Sol 自己的发布宣传框架完全建立在这个理念之上——按已完成任务计的成本——而且这个框架是正确的:真正相关的比较不是 token 费率,而是每个结果所需的期望成本,而在 Luna 无法完成的任务上,这个期望值是无限的。
两个结构性细节让这条边界更加清晰。第一,长上下文档位:当输入 token 超过 272,000 时,两个模型都会重新定价,Luna 调至 $0.20 和 $0.75,Sol 调至 $4.00 和 $15.00,因此在边界处绝对差距是扩大而不是缩小,但 Luna 调整后的费率仍比 Sol 的标准费率低一个数量级。第二,而且容易被忽略:effort 阶梯的形状并不相同。Luna 接受 none;Sol 不接受。一个先路由到 Sol、在出错或超时时回退到 Luna 的级联,不能把请求的 reasoning.effort原样带过去,因为在一种模型上合法的配置会在另一种模型上返回错误。这是路由层的问题,而不是模型质量的问题,而这正是带路由规则的单一端点应当吸收的那类事情。
两者并行才是关键,而非权宜之计
两个模型都在 OrcaRouter 上,按 OpenAI 自己的标价提供,没有任何加价:GPT-6 Luna 为 $0.10 和 $0.50,缓存输入为 $0.01;GPT-6.1 Sol 为 $2.00 和 $10.00,缓存输入为 $0.10;并且每个模型上的 272,000 token 阶梯都完全按供应商所列原样传递。因为该平台是按提供商的标价原样传递,而不是加价,所以本文中的二十倍比例就是你在两边实际支付的比例。

这里特别重要的原因是,这一对组合是一套等待被写出来的级联。分类器、路由器、批量提取任务和仓库级编码智能体不该放在同一个模型上,而价格差距又足够大,以至于无论朝哪个方向选错,代价都很高——一个方向是每次调用贵二十倍,另一个方向是任务失败。一个密钥、两个模型,再加上一条规则:把简单流量发给 Luna,并在任务类别变化或 Luna 的输出未能通过检查时升级到 Sol;这在我们这边只是一次配置变更,而不是再签一份供应商合同。自动故障转移覆盖了二者之一性能降级的情况,而这对一个八天前才发布的模型来说仍是一种现实可能。

决定,一气呵成
• 分类、抽取、路由、批量摘要、智能体内部循环——就用 GPT-6 Luna,别再往下读了。在 $0.10/$0.50、缓存读取仅一分钱的价格下,对于答案简短且可核验的工作而言,十三个指数点的通用能力并不值得付出十倍的账单。
• 仓库级编码、终端智能体、多步执行——GPT-6.1 Sol。Terminal-Bench 4.0 上 43 分的差距就是全部论据;这正是这个价格所购买的能力。
• 错误答案代价高昂的知识工作问题 —— GPT-6.1 Sol,就 AA-Omniscience 与 GDPval-AA 上的差距而言。Luna 的事实可靠性得分正处于水线。
• 输入很长,生成的答案却很短——GPT-6 Luna。它在长上下文上的推理表现与成本高出二十倍的模型不相上下,而其 1.44 亿 token 的冗长惩罚根本没有机会生效。
• 任何已设置为 none 的项目 —— 请继续使用 Luna,或为此次变更预留预算。GPT-6.1 Sol 上不存在这一层级。
• 延迟敏感型场景——根据该榜单自身的测量数据,GPT-6 Luna 每秒输出 129.4 个 token,首个分块耗时 100 秒,而 Sol 则为 59.7 和 332。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
