生成的标题卡上写着“GPT-6 vs GPT-6 Luna”,一枚标签上写着“GPT-6 是系列名称,而非模型 ID”,另一枚标签上写着“GPT-6 Luna:输入 $0.10 / 输出 $0.50,为 ChatGPT Free 和 Go 提供支持”,页脚则写着“模型于 2026 年 9 月 22 日发布;层级规则依据 OpenAI 自己的公告。”OrcaRouter 的 logo 合成在右下角。
Guides & Insights

GPT-6 对比 GPT-6 Luna:一毛钱一百万 Token,以及应对免费套餐的档位

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

这个对比有一个版本,答案只有一行:你无法调用 GPT-6,而你可以调用GPT-6 Luna,每百万输入 token 十美分。但更有用的版本,是解释为什么 Luna 如今成了大多数人实际用过的模型——OpenAI 于 2026 年 10 月 8 日将它置于 ChatGPT 的 Free 和 Go 层级背后,这使它成为这一代里最便宜的层级,而按用户数算,也是最繁忙的。接下来先把层级阶梯解释一遍,再说说每百万一毛钱到底能买到什么。

这个家庭,以及卢娜在其中的位置

OpenAI 于 2026 年 9 月 22 日发布 GPT-6 一代,共三个模型 ID,并没有openai/gpt-6端点来支撑该系列名称:

• GPT-6 Astra——旗舰款,每百万 token 输入 $10.00 / 输出 $50.00,在 OpenAI 的价目表中列为最高档
• GPT-6 Sol——中档,$2.00 / $10.00,是 OpenAI 指定用于付费 ChatGPT 套餐中聊天功能的模型
• GPT-6 Luna——低价档,$0.10 / $0.50,是 OpenAI 指定用于 Free 和 Go 套餐的模型

最后那句话才是值得钉死的部分,因为正是它解释了为什么 Luna 的流量能远超这个家族里的其他一切。OpenAI 自己关于 10 月 7—8 日推出的公告称:“ChatGPT 中的 GPT-6 由 GPT-6 Sol 为 Plus、Pro、Business 和 Enterprise 层级提供支持,而 Free 和 Go 层级则由 GPT-6 Luna 提供支持。” 一个定价为 $0.10 / $0.50 的模型在服务免费套餐,意味着它每天回答的问题比任何付费层级都多,而且它正是你可以在 API 上调用的同一个检查点。消费端界面是一条分发渠道,而不是一个单独的 SKU。

这里必须重复一个提醒,因为本博客已经就此发表过内容:同一份公告称 Free 和 Go 获得 {{1}}GPT-6 Luna{{/1}},而 {{2}}OpenAI{{/2}} 在 ChatGPT 中 GPT-6 的帮助中心页面在被查阅当天将 Free 和 Go 描述为运行 {{3}}GPT-5.6 Luna{{/3}}。这些关于同一档位的说法并不兼容,{{2}}OpenAI{{/2}} 尚未说明哪个是当前状态,并且如果你的工作取决于免费计划背后是哪个廉价模型,请将帮助中心条目视为更具体的页面,并在基于其中任何一种进行构建前重新核实。

每百万十美分实际上意味着什么

标题数字是 Luna 卡片上最没意思的数字。下面是整张卡片,以及它下方的层级阶梯:

• 短上下文,最多 272,000 个输入 token — 每百万输入 $0.10,每百万输出 $0.50
• 超过 272,000 个输入 token — 每百万输入 $0.20,每百万输出 $0.75,适用于整个请求
• 缓存输入 — 短档每百万 $0.01,即 90% 折扣;超过该阈值后每百万 $0.02
• 缓存写入 — 短档每百万 $0.125,超过后每百万 $0.25
• 上下文和输出 — 输入 1,050,000 个 token,输出 128,000 个 token
• 输入模态 — 文本、图像和文件,与 Sol 和 Astra 相同的多模态输入
• 推理 — 可配置的 effort 参数,以及工具、JSON 输出和带种子的采样

由此可以得出两点。第一,Luna 并非一款精简版模型。它能接收图像和文件,提供与两款更昂贵的同门模型相同的工具调用和结构化输出接口,而在规格表上,它与 Sol 的唯一区别是深度,而非能力。第二点是阶梯定价。当提示超过 272,000 个输入 token 时,Luna 的输入费率会翻倍,输出费率会上调一半,而且是针对整个请求,而不仅仅是超出部分。在这些价格下,这是一个温和的跳档——一个 300,000 token 的请求,输入费用约为 6 美分,而不是 3 美分——因此,那个在 Astra 的预算规划中占主导、对 Sol 也很重要的长上下文条款,在这里几乎无关紧要。

真正能在规模化下影响成本的数字,是缓存读取。在每百万一美分的价格下,一个每一轮都重新发送同一大段上下文的工作负载,为重复部分支付的费用几乎为零。在高吞吐量的抽取或分类流水线中,如果系统提示词稳定、文档也稳定,这就是便宜模型与近乎免费模型之间的差别,也正是 Luna 每个已完成答案的真实成本远低于费率卡所显示水平的具体原因。

它在能力方面让你付出的代价

Luna 是最便宜的一档,因为它能力最弱,而独立榜单对于它究竟弱多少毫不含糊。请于 2026 年 10 月 8 日通过 OrcaRouter 目录条目中每个模型的 Artificial Analysis 数据来查看:

• AA Intelligence Index — GPT-6 Sol 47.6,排名第 14;GPT-6 Luna 38.1,排名第 37
• Humanity's Last Exam — GPT-6 Sol 47.9 对比 GPT-6 Luna 38.5
• SciCode — GPT-6 Sol 57.6 对比 GPT-6 Luna 54.6
• 长上下文召回 — GPT-6 Sol 83.7 对比 GPT-6 Luna 83.3
• Terminal-Bench 4.0 — GPT-6 Sol 43.9 对比 GPT-6 Luna 12.6
• 七天内的流量 — GPT-6 Luna 约 5.74 亿个 token;GPT-6 Sol 约 210 万
• 首个 token 的中位时间 — GPT-6 Luna 1,494 毫秒 对比 GPT-6 Sol 6,785 毫秒
• 输出速度中位数 — GPT-6 Luna 132.9 tokens/s 对比 GPT-6 Sol 179.6 tokens/s

这一分布形态比标题上的差距更能说明问题。Luna 落后 Sol 9.5 个指数点,而且这种落后并非均匀分布:长上下文召回率是 0.4 个百分点的平局,而 SciCode——考察的是代码理解而非代码生成——仅相差 3 个点。真正崩塌的是智能体式多步执行:Terminal-Bench 4.0 得分为 12.6,而 Sol 为 43.9。一个能从百万 token 文档中检索、表现与其更大同级模型相当,且能写出合格单次回答的模型,与一个能驱动工具循环直至完成任务的模型,是截然不同的器具。

两点注意事项。指数数据来自 {{KEEP}}Artificial Analysis{{/KEEP}},而非 {{KEEP}}OpenAI{{/KEEP}},而且该评测方并不保证两个模型页面在同一天是针对同一版指数渲染的——因此零点几的差异只能看作方向,而非精确精度。另外,服务数据是我们自己在滚动七天窗口内测得的路由数据;每次读取之间都会有所漂移,它们有助于看出差异的形态,而不是作为服务级别的承诺。

有一个服务指标值得停下来关注。Luna 的首 token 中位时间为 1,494 毫秒,而 Sol 为 6,785 毫秒——到达首 token 大约快 4.5 倍——但一旦开始流式输出,其吞吐量则明显更低。对于用户正等待开场第一句话的聊天界面而言,这种反转正是该层级存在的全部意义,也正是为什么免费方案在运行该系列中最便宜的模型时,仍能让人觉得很快。

家庭内部的新竞争

Luna 在同代产品中的价格优势自发布以来已经收窄。 GPT-6.1 Sol于 9 月 29 日问世,定价与 Sol 相同,为 2.00 美元 / 10.00 美元,指数为 51.8,并将缓存输入价格降至每百万 0.10 美元。这并未触及 Luna 的短上下文价格——输入一毛、输出五毛,在输入上仍比任何 Sol 便宜二十倍——但这确实意味着 Luna 之上那一档在缓存流量上的运行成本变低了,而缓存流量恰恰是 Luna 优势最大的工作负载。差距依然很大,但已不再像单看价目表所显示的那样大。

A generated two-column comparison scoreboard titled "GPT-6 Sol vs GPT-6 Luna — the scoreboard". The left column, GPT-6 Sol, reads Input $2.00, Output $10.00, AA Intelligence 47.6, Terminal-Bench 4.0 43.9, First token 6,785 ms, Cached input $0.20. The right column, GPT-6 Luna, reads Input $0.10, Output $0.50, AA Intelligence 38.1, Terminal-Bench 4.0 12.6, First token 1,494 ms, Cached input $0.01. A footer line reads "Index figures per Artificial Analysis; serving figures are a rolling seven-day window from OrcaRouter." The OrcaRouter logo is composited in the bottom-right corner.

层级线在实际中落在哪里

按任务的需求来分配工作,而不是按哪个模型得分更高。

Luna 是高吞吐聊天、分类、抽取、审核以及长文档摘要的正确选择——它在检索上与更大的同门模型打平的那一行,正是决定大上下文是否可用的那一行。它的首 token 延迟让它成为任何非重推理的交互式场景的更优选择。而且,按每百万缓存 token 一美分计算,稳定上下文流水线在重复部分上几乎免费。

Sol,或者说如今的 GPT-6.1 Sol,只要任务需要工具循环、长周期规划,或是一条必须走完的步骤链,它就是正确的选择。Terminal-Bench 上的差距——43.9 对 12.6——是本次对比中最清晰的信号,它对应的正是真实的失败模式:一个廉价模型把第一步答得很漂亮,然后就断了线。effort 参数意味着你可以要求 Luna 做更多推理,但 effort 提升的是 token 数量,而不是能力上限;它没法把 12.6 变成 43.9。

而对于只有旗舰模型才能胜任的工作,Astra 仍然是答案——相较于 Luna 的十美分,Astra 是输入 $10.00、输出 $50.00,因此你应该能按每次调用、而不是按团队来证明这个决定合理。

这一选择的单 API 版本

三层级系列(three-tier family)最棘手的地方在于,层级边界因功能而异,也因请求而异——同一个应用往往希望某个端点用 Luna,下一个端点却用 Sol。这是个路由问题,而不是采购问题。三个 GPT-6 层级都位于同一个 OrcaRouter 目录中,通过一个兼容 OpenAI 的 API 调用,位居 200+ 模型之前,供应商的标价以 0% 加价透传,因此任何层级的供应商价格变动当天就会反映在这里,而不必等到你下一次对账。路由 DSL 会显式地组合这种拆分——按请求大小、按端点或按份额——因此分类路径可以运行 Luna,而智能体路径运行 Sol,跨供应商的自动故障转移可覆盖性能下降的路由,而不必让你从一次失败的运行中才发现问题。

有一件事它做不到,就是让你得到一个行为跟 Sol 一样的 Luna。分层之所以存在,是因为模型本身就不同,而上面的数字就是这种差异的幅度。一把密钥加一条路由规则能给你带来的,是把每个请求放到真正适合它的那一层,而不是为了稳妥把所有请求都堆在最贵的那一层,也不是为了省钱全塞进最便宜的那一层。

Screenshot of the OrcaRouter model page for openai/gpt-6-luna, showing the OpenAI vendor label, a 2026-09-22 catalogue release date, a 1.05M-token context window, a 128K maximum output, text, image and file input with Vision, Tools, JSON and Reasoning badges, and a rate strip reading $0.10 per million input, $0.50 per million output, a 1.49 s median time to first token, a 5.06 s p95, and 574.0M tokens routed in seven days.

答案,由唯一重要的问题决定

如果任务是在大型文档、聊天或批量文本处理上进行先检索后回答,那么 GPT-6 Luna 就是合适的层级,而十美分卡并不是妥协——长上下文召回行表明,它的检索效果与成本高出二十倍的模型一样好。如果任务需要多步智能体来完成,Luna 就是错误的层级,诚实的做法是选择 GPT-6 Sol 或 GPT-6.1 Sol,它们的价格按绝对值计算仍然很低,而且智能体评估不再崩溃。

“GPT-6”本身,再说一次,并不是你能叫得出的某个东西。它是一个家族名,涵盖三个 id、三个价位和三种不同的能力天花板,而 Luna 是其中最底层的那一个——最便宜、最快产出首个 token,负责应答免费套餐,也是当任务所需的超出一个自信答案时,天花板立刻显现的那一个。

Screenshot of the OrcaRouter model page for openai/gpt-6-sol, showing the OpenAI vendor label, a 2026-09-22 catalogue release date, a 1,050,000-token context window (shown as 1.05M-token context in the model blurb), a 128K maximum output, text, image and file input, and a rate strip reading $2.00 per million input, $10.00 per million output, a 6.79 s median time to first token, a 10.00 s p95, and 2.1M tokens routed in seven days.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新