
GPT-6 Luna 对比 GPT-6 Sol:两张形态相同、数字相差二十倍的费率卡
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GPT-6 Luna 的定价为每百万输入 token 0.10 美元、每百万输出 token 0.50 美元。GPT-6 Sol 的定价为 2.00 美元和 10.00 美元。供应商于 2026 年 9 月 22 日同时推出了这两款模型,它们是 GPT-6 世代中低于旗舰 GPT-6 Astra 的两个较低层级;两者之间二十倍的差距,是任何人从页面上最先读到的信息。更难看出、也更有用的,是除此之外它们之间几乎没有差别。相同的 1,050,000 token 上下文窗口。相同的 922,000 token 最大输入。相同的 128,000 token 输出上限。相同的推理档位,从 none 到 low、medium、high、xhigh 和 max,默认档位为 medium。相同的知识截止日期系列,相差一个月。相同的条款:一旦输入 token 超过 272,000,就会对整个请求重新定价。
两款模型若共享一张费率卡上每一条结构性条目,它们之间的区别就不在功能上。它们的区别在于一个分数,以及获得那个分数需要你付出多少代价。在同时衡量这两者的独立榜单上,在相同的最大努力下,GPT-6 Sol 比 GPT-6 Luna 高出十一个点,而完成同一项评测的成本约为后者的十五倍。"十一个点和十五倍"与"二十倍"是两句不同的话,而这两句话之间的差别,才是这一比较真正的所在。
这两个各自是做什么用的
GPT-6 Sol 是该系列中的日常主力——OpenAI 将其定位为面向复杂编码、智能体工作流以及需要由人阅读的专业工作的层级。它接受文本和图像输入,输出文本,任何拥有 API 密钥的人都可以使用。当团队想要获得 GPT-6 级别的能力,又不想面对旗舰型号的价格表或访问门槛时,这将是大多数团队默认首选的模型。
GPT-6 Luna 是走量档位。OpenAI 自己的描述很克制,且刻意不张扬:面向专注、高吞吐任务的最高效模型。摘要、抽取、分类、路由,以及智能体在完成一项任务途中进行上千次小调用的内层循环。相同的上下文窗口,相同的输出上限,相同的努力程度调节——相同底盘里一台更便宜的引擎。
两者都是采用源自 GPT-6 Astra 的方法训练而成,而非作为独立产品线打造,这正是规格表如此精确吻合的原因。价格则是二者唯一在设计上刻意区分的地方。
费率卡,逐行
每个维度一行,每行均包含两侧:
• 每百万输入 — GPT-6 Luna $0.10 对比 GPT-6 Sol $2.00
• 每 1M 输出 — GPT-6 Luna $0.50 对比 GPT-6 Sol $10.00
• 每 100 万缓存输入 — GPT-6 Luna $0.01,GPT-6 Sol $0.20;两者均为其自身未缓存输入费率的十分之一,因此二十倍的比率在折扣后依然保持不变
• 缓存写入每 1M — GPT-6 Luna $0.125 对比 GPT-6 Sol $2.50,两者均为输入费率的 25% 溢价
• 长上下文层级——两张卡片上的条款完全相同:当输入 token 超过 272,000 时,整个请求的输入和缓存按 2× 计费,输出按 1.5× 计费,使 GPT-6 Luna 分别达到 $0.20 和 $0.75,GPT-6 Sol 分别达到 $4.00 和 $15.00
• 上下文窗口 — 两者均为 1,050,000 个 token,最大输入为 922,000 个 token,输出上限为 128,000 个 token
• 推理强度 — 两者均可设置为:无、低、中(默认)、高、极高、最大;该调节旋钮在两个模型中为同一个部件
• 服务层级 — Flex 可使账单减半,Priority 则使其翻倍,两张卡均是如此,可通过同一个service_tier 参数
• 知识截止日期 — GPT-6 Luna 2026年5月18日 vs GPT-6 Sol 2026年4月20日,同一系列内相差一个月,在假定两者拥有相同世界观之前值得了解
• 智能指数,独立评测 — GPT-6 Luna 在最高推理强度下为 37,对比 GPT-6 Sol 在最高推理强度下为 48,指数版本相同
• 默认努力程度得分——GPT-6 Luna 29 在默认中等设置下,对比 GPT-6 Sol 48 在最大设置下,也就是 Artificial Analysis 对它进行测量时所采用的设置
• 每个 Index 任务的成本,独立测试 — GPT-6 Luna 约 $0.07,而 GPT-6 Sol 为 $1.06
• 索引运行中的输出 token —— GPT-6 Luna 150M 对比 GPT-6 Sol 77M,而排行榜中位数为 88M
• 编程智能体指数,独立 — GPT-6 Luna 41,相较 GPT-5.6 Luna 下降两分(对比 GPT-6 Sol 的 57),相较 GPT-5.6 Sol 上升两分
• AA-Omniscience 上的幻觉率——GPT-6 Luna 77%,低于此前的 93%;相比之下 GPT-6 Sol 60%,低于此前的 92%;两个模型都变得更愿意拒答,而非知识更丰富,而且 Sol 更进一步
• 在 OrcaRouter 上——截至本文撰写时,GPT-6 Luna 和 GPT-6 Sol 均未收录在我们的目录中;两者都需通过 OpenAI 自身的 API 访问

力度旋钮在两个型号中都是同一个部件,这就改变了算术
由于推理阶梯完全相同,两个模型的主要指数数值都是最大努力下的数值。GPT-6 Luna 的 37 是它被允许想多久就多久时所得到的分数。其默认设置为中等,得分为 29。GPT-6 Sol 的 48 也是一个最大努力数值,而且这是独立委员会运行它时所用的设置。
这一点在这里比在大多数对比中都更重要,因为它意味着这两个模型是在同一档位上被引用的。一个部署了 GPT-6 Luna 却什么都不改的团队,不是在用 37 对 48,而是在用 29 对 48。那就是 19 分的差距,而不是 11 分的差距,而这一差距的大小是默认设置的属性,不是模型的属性。
同一个调节旋钮也是两张卡上可用的最便宜优化,而且可以双向调节。把 GPT-6 Sol 在由人工审核的工作上从 max 降到 medium,比将你的一小部分流量从 Sol 切换到 Luna 节省得更多,并且只需改一个参数,而不是进行一次迁移。在每个任务中真正决定结果的那一次调用上,把 GPT-6 Luna 升到 xhigh,相对于总量而言只是舍入误差。这个调节旋钮之所以同时存在于两个模型上,正是为了让档位选择和投入力度选择能够分开做出,而大多数团队只做了其中一项。
悬崖完全相同,这正是关键所在
两个模型都带有相同的长上下文条款,而由于该条款是按比例计算的,它并不会缩小二者之间的差距——反而会让差距的两端都翻倍。在 GPT-6 Luna 上,一个 30 万 token 的请求会按每百万输入 token 0.20 美元对全部 30 万 token 计费,而不是只对超出限额的 28,000 个 token 计费。同一请求在 GPT-6 Sol 上收费 4.00 美元。把任一文档拆成两次低于阈值的调用,成本就会减半,而提示词无需任何更改。
相同条款真正改变的是错误的规模。在批量层级上,一个规模设错的请求每千个 token 花费五分之一美分。在每日层级上,每百万个 token 则要花费四美元。最可能拥有 300,000 token 工作上下文的团队,正是运行这两款模型所面向的智能体流水线的团队,这意味着最无力承担这个错误的层级,并不是最常犯这个错误的层级。
索尔的十一个点在哪里,以及它们不在哪里
这个差距是真实存在的,而且它在你可能运行的各项任务之间并不是均匀分布的。
GPT-6 Sol 的优势集中在编程和智能体执行方面。其编程智能体指数为 57,比 GPT-6 Luna 的 41 高出十六分;而在同一榜单上,上一代对应型号的分数分别为 55 和 43——也就是说,在这项指标上两款模型走向了相反的方向,因此在假定新一代在所有方面都优于上一代之前,这一点值得了解。根据厂商自己公布的数据,Sol 在最大努力设置下于 DeepSWE v1.1 上报告为 68.8%,而 Luna 为 66.6%;在 Terminal-Bench 4.0 上约为 43%,Luna 则为 37%。这些数据由 OpenAI 报告且未经复现,而且它们所描述的差距比指数差距所暗示的要小。
Sol 拉开差距的地方,在于那些奖励一长串正确决策的评测:GPT-6 Sol 在 AutomationBench-AA 上报告约 62%,而 GPT-6 Luna 为 53%;在同一份全知榜单上,幻觉率则为 60% 对 77%。模型凭空编造答案的频率相差十七个百分点,并不是能力上的差距;对于任何有下游使用者的场景而言,这就是决定本身。
这 11 分不体现在通用文本工作上。在提取、分类、路由和摘要——GPT-6 Luna 定价所针对的任务——上,绝大多数情况下,两个模型都会给出相同的可用答案,而这种差异经不起你自己的评估集的检验。Artificial Analysis 指出,两个模型在最大努力设置下都存在一项退步:GPT-6 Sol 在 GDPval-AA v2.1 上相比其前代损失了大约 100 Elo,而 GPT-6 Luna 大约损失 75 Elo。如果你的工作看起来像 GDPval,那么这两个层级都不是当初承诺的升级,而这 11 分比较的是两个都退步了的模型。
在您已有的两个层级之间进行选择
这种组合的不寻常之处在于,它不是一个采购决策。两个模型运行在同一个账户、同一个端点和同一个 SDK 上。没有第二份合同,没有第二次费率谈判,也没有把流量从一个模型迁移到另一个模型所需的集成工作。因此,这是一个路由决策,而路由决策正是值得按每个请求来做、而不是一次性做出的那种决策。
截至本文撰写时,我们的目录中既没有 GPT-6 Luna,也没有 GPT-6 Sol——两者都通过 OpenAI 自己的 API 访问,因此这种拆分必须在你的应用程序中体现,而不是在路由器配置中。这正是需要审慎对待它的理由,因为弄错的代价是代码更改,而不是设置更改。拆分的形态并不复杂:GPT-6 Luna 用于智能体在完成任务途中发出的上千次小型调用,GPT-6 Sol 用于生成人类将阅读的产物的那次调用。请在两边都显式设置 effort 参数,因为默认值是 medium,而这两个模型的所有已公布数据都是最大 effort 下的数值。
跨供应商做路由的团队——我们看到的大多数团队都是如此——可以让 GPT-6 Astra、Grok 4.6、Kimi K3 和 Qwen3.8-Max 共用一个密钥,通过 OrcaRouter 按供应商列表价访问,0% 加价,并在各上游之间故障转移。将 GPT-6 Luna 和 GPT-6 Sol 纳入同一图景,意味着需要第二个密钥,而不是第二套架构,而这是这种组合所引发的两个问题中较小的那个。

哪一个,什么时候
选择 GPT-6 Luna,除非你能说出那二十倍价格换来的是什么能力。它在定价卡的每一行上都更便宜,包括缓存输入;它具有相同的窗口和相同的输出上限;可以要求它完全停止推理;而且它在独立榜单上每完成一项任务的成本大约是 GPT-6 Sol 的十五分之一。明确设置努力程度,让长调用保持在 272,000 个输入 token 以下,并在你假设它适用于你之前,先对照你自己的代码库检查 Coding Agent Index 上十六个百分点的差距。
当任务本身就是产品,而失败模式是悄无声息的错误答案而非响应缓慢时,就选 GPT-6 Sol。让编码智能体操作真实仓库、进行长周期专业分析,以及任何幻觉事实的代价高于所节省 token 的场景。接受这一点:你为每完成一个任务支付十五倍成本,换来十一个指数点,而这十一个点中有相当大一部分落在幻觉列而非能力列——就这对特定组合而言,这已是更值得为之付费的那一半。
要避免的错误,是把那个二十倍的标价当成了答案。它回答的只是一个词元(token)要花多少钱,却完全没说完成一项任务要花多少钱,也没说便宜模型的答案有多经常以你根本察觉不到的方式出错。

