
GPT-6 Luna 对比 GPT-6 Astra:百倍价格换取十六个指数点
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 218 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
该厂商在同一个月内发布了这两款模型。GPT-6 Astra于 2026 年 9 月 3 日上线,输入每百万 token 定价 10.00 美元,输出每百万 token 定价 50.00 美元,被定位为公司面向长周期专业任务的最强系统。GPT-6 Luna则于 2026 年 9 月 22 日跟进,定价为 0.10 美元和 0.50 美元——输入价格只有前者的百分之一,输出价格也只有前者的百分之一——作为该系列中的效率档。在同时评测这两款模型的独立榜单上,两者相差十六个指数点。百倍的价格换来十六个点的差距,一行字就说尽了整个对比,而这并不是真正有意思的部分。
有趣的是,一旦考虑到每个模型在任务上的实际表现,百倍的标价就会缩水到接近四十六倍,而剩下的差距根本不是通用智能。真正起作用的是计算机使用、长时程自主性,以及一种决定你的组织从一开始能否调用该模型的安全分类。最后这一项是任何基准测试表都无法捕捉的,而对许多团队来说,它在提及价格之前就已经决定了答案。
同一家族的两个层级,相隔十九天
Astra 是 OpenAI 的旗舰模型,公司称其为世界上最智能、最对齐的模型。它接受文本、图像和文件输入,拥有 1,050,000 个 token 的上下文窗口,输出上限为 128,000 个 token,并具备始终开启的推理功能,推理力度可从低到最高进行配置。它是首个在公司《准备框架》下跨越“关键”网络安全能力阈值的 OpenAI 模型,而此次推出依据的是该分类,而非产能:首先面向有限组织,企业访问默认关闭,并从 9 月 9 日起可管理,随后保障层级逐步扩大。
Luna 是同一家族的另一端。文本和图像输入,文本输出,相同的 1,050,000 token 上下文窗口和相同的 128,000 token 输出上限,以及一条从 none 到 low、medium、high、xhigh 和 max 的推理阶梯,默认是 medium。没有门控,没有企业级开关,没有需要满足资格的安全层级。任何拥有 API 密钥的人都可以普遍使用,OpenAI 自己的描述简洁而诚实:用于专注的高吞吐量任务的最高效模型。
这两个模型共享同一个上下文窗口、同一个输出上限、同一类知识截止时间,以及同一条长上下文定价条款。除此之外,它们几乎没有任何共同点,原因在于它们是为同一项工作的不同两半而构建的。
费率卡上写的是一百倍。任务成本上写的是四十六。
每个维度一行,每行均包含两侧:
• 每 100 万输入 — GPT-6 Luna $0.10 对比 GPT-6 Astra $10.00
• 每 1M 输出 — GPT-6 Luna $0.50 对比 GPT-6 Astra $50.00
• 缓存输入 — GPT-6 Luna 每 100 万 $0.01,对比 GPT-6 Astra 每 100 万 $1.00,两者均较各自未缓存费率享受 90% 折扣
• 每个索引任务的成本 — GPT-6 Luna 约 $0.07,而 GPT-6 Astra 约 $3.26
• 运行完整索引的成本 — GPT-6 Luna $122.39 对比 GPT-6 Astra $5,324.10
• AA 智能指数 — GPT-6 Luna 37(最大努力)对比 GPT-6 Astra 53(最大努力)
• 索引运行中的输出 token 数 — GPT-6 Luna 150M 对比 GPT-6 Astra 60M,而榜单中位数为 88M
• 输出速度 — 在 xhigh 下,GPT-6 Luna 为 153.9 tokens/秒,而 GPT-6 Astra 为 51.4 tokens/秒
• 首令牌时间 — GPT-6 Luna 快到足以支撑交互式界面,而 GPT-6 Astra 在 xhigh 下为 208.73 秒
• 推理关闭开关 — GPT-6 Luna 从 none 到 max,其中 none 是一个选项;而 GPT-6 Astra 始终开启,没有非推理模式
• 计算机使用与自主性 — GPT-6 Luna 的工具调用与智能体循环 vs GPT-6 Astra,后者专为端到端操作计算机而打造
• 访问权限 — GPT-6 Luna 面向所有人普遍可用,而 GPT-6 Astra 则受限,企业版默认关闭,需要管理员管控
• 在 OrcaRouter 上 — GPT-6 Luna 不在我们的目录中,而 GPT-6 Astra 可按 OpenAI 的标价进行路由

把每任务成本那一行与价目表比率对照起来看,差距就会缩小一半以上。Luna 完成该索引要消耗 1.5 亿个输出 token;Astra 只消耗 6000 万个。Astra 的简洁度是它的两倍半,而在按输出计费的模型上,这一点价值极大——正是它让一百倍的价目表差距变成四十六倍的任务成本差距,也正是它使得任何仅凭标价作出的比较,都会把低价档的优势夸大整整一倍。
速度这几行的情况正好相反,而且差距很大。Luna 每秒生成的 token 数量是 Astra 的三倍,并且返回首个 token 的时间短到用户等得起。Astra 在 xhigh 下 208.73 秒的首 token 时间并不是一个延迟指标;它是在说明这个模型的用途。凡是有人实时盯着看的东西,都无法在那种设置下的 Astra 上运行。
十六个点究竟能换来什么
指数差距是真实存在的,而有用的问题是它里面有什么,因为答案并不是“多出百分之十六的智能”。
Astra 公布的能力集中在某个特定方面。OpenAI 报告在 OSWorld 2.0 上为 72.6%,在 AutomationBench-AA 上为 69%——这两项衡量的都是模型像人一样操作软件的能力,跨越许多步骤、在很长一段时间内。在知识方面,GPQA Diamond 上为 96.1,FrontierMath Tier 4 上为 97.6%,带工具的 Humanity's Last Exam 上为 57.2%,而长上下文检索是一个被重点强调的优势:在 OpenAI 自有的 eight-needle 基准测试中,256K 到 512K tokens 之间为 100%,512K 到 1M 之间为 96.3%。这些都是厂商报告的、未经复现的结果,而且测试框架也很重要——同一个模型在 OpenAI 自定义提供商适配器下的 ARC-AGI-3 上得分为 99.9%,而在标准测试框架上为 62.7%,这一落差既说明了测试框架,也同样说明了模型本身。
综合来看,这并不是一种通用优势。这种优势集中在那些耗时长、需要使用计算机、并且有可验证终点的任务上。Astra 的竞争定位并不是针对另一个聊天机器人,而是针对一次工作会话;而在独立榜单上与它同台比较的模型,是同一梯队里的其他旗舰模型——它在 Intelligence Index 上以 53 分与 Claude Fable 5.1 打成平手,而每任务成本大约只有后者的 40%。
因此,Luna 的十六个百分点差距并非均匀分布。在一项简短、定义明确、由程序消费的任务上,两个模型往往会给出同样可用的答案,差距无从显现。而在一项需要在浏览器中执行四十个连续操作、并在末尾设有检查点的任务上,这一差距就是完成与完不成的分界——而这正是 Astra 被打造来完成、Luna 却并非如此的任务。
无人计入价格的闸门
Astra 是 OpenAI 首个在公司《防范框架》下跨越“关键”网络安全阈值的模型,其实际后果是:面向企业账户时,它默认处于关闭状态。管理员必须在适用的费率卡和协议下将其启用,用户才能看到它。访问权限于 9 月 3 日向一小部分组织开放,此后逐步扩大;管理端相关机制于 9 月 9 日上线。
Luna 完全没有这些限制。任何拥有 API 密钥的人都能在第一天就使用它,无需资格审核步骤,没有管理员开关,开发者与首次调用之间也不存在任何保障层级。
对于身处受监管行业的团队、国防承包商,或采购流程中任何需要安全审查的团队来说,这就是整个决策的关键。百倍的价格差只是一个明细项;而访问关卡是一个项目。对于不受这些限制的团队来说,这道关卡无关紧要,Astra 只是一个价格高昂、首个 token 延迟异常长的模型。
值得补充的是,这种准入限制是一种经过深思熟虑的立场,而不是一种不便。一个能够自主操作计算机并善于发现漏洞的模型,是实验室在对外发放时应当谨慎对待的模型,而部署形态取决于能力评估结果。这并不会让采购变得更容易,但这确实意味着该限制不太可能因为一张支持工单而放宽。
同一处悬崖,同一个家庭,两次
两个模型都带有完全相同的长上下文条款,而这是两份费率表中任何一份上最容易因疏忽而付出高昂代价的地方。超过 272,000 个输入 token 的请求,其输入和缓存费用按两倍计费,输出费用按 1.5 倍计费——而且是针对整个请求,而非仅超出该阈值的部分。在 Astra 上,这会把一次 10.00 美元/50.00 美元的调用变成 20.00 美元/75.00 美元。在 Luna 上,它则把 0.10 美元/0.50 美元变成 0.20 美元/0.75 美元。
由于该条款是按比例计算的,它不会改变两个模型之间的比率——它会让两者都翻倍。它改变的是错误的绝对规模,而错误更可能出现在 Astra 上,因为 Astra 所面向的工作负载,正是那些承载百万 token 工作上下文的负载。一次长上下文 Astra 调用每百万输出 token 收费 75 美元;将同样的工作拆分成两次低于 272K 的调用,就能让成本减半,而无需更改提示词。对于一个全部价值主张都在于长周期工作的模型而言,这笔账值得在第一次生产调用之前算一算,而不是之后。
这个决策是一个路由决策。
这个组合在本博客的众多对比中显得不同寻常的地方在于:这两个模型来自同一家供应商,在同一个账户下运行,并通过同一个端点访问。无需签署第二份合同,也无需学习第二个 SDK。在两者之间做选择根本不是购买决策——而是路由决策,而且大多数团队应该按请求来做这个决策,而不是只做一次。
这种拆分方式的形态已经足够清晰。Luna 负责 agent 在完成任务途中发起的上千次小型调用:分类、提取、工具选择、对中间结果做摘要。Astra 负责任务本身,只在最后执行一次,因为那时答案就是最终产物。这就是同一个应用内部的两级流水线,而整条链路全部跑在 Astra 上、与内层循环跑在 Luna 上之间的成本差异,就是单位经济模型可行与不可行之间的差异。
GPT-6 Astra 已在 OrcaRouter 上线,价格与 OpenAI 的标价一致,在直通定价模式下,这意味着 OpenAI 一旦调整费率,我们这边当天就会同步生效。截至本文撰写时,GPT-6 Luna 尚未纳入我们的目录,需通过 OpenAI 自家的 API 访问,因此若团队两者都想使用,只需为 GPT-6 Astra 配一个密钥,同时沿用其原本用于 OpenAI 的那套即可。也正是这样的搭配,才让模型融合物有所值:让一个廉价的高吞吐模型与一个昂贵的谨慎模型组成一组共同作答,由廉价的那个承担大部分工作,昂贵的那个负责裁定——这是路由层能够直接表达的一种配置,而应用本身甚至无需知道这两个模型的存在。

哪一个,什么时候
除非你有具体理由不这么做,否则就选 GPT-6 Luna。它在价目表上的价格只有百分之一,每个已完成任务的价格只有四十六分之一,速度快三倍,其首个 token 到达的时间在用户可以等待的范围内,而且可以让它完全停止推理——这正是它可用作分类器的原因。请显式设置 effort 参数,因为默认值是 medium,而宣传中的 37 是最大 effort 数值。将长时间调用保持在 272,000 个输入 token 以下。对照你自己的评估,而不是供应商的图表,来检查 Coding Agent Index 两个百分点的回退。
当任务是长程任务、答案本身就是交付物时,就选 GPT-6 Astra。跨多步的电脑操作、以可验证结果为终点的专业分析,以及任何 16 个指数点就决定了究竟是做完还是悄无声息地停下的场景,都归它管。接受首 token 时间——在 xhigh 下 208 秒可不是你能甩给人去扛的数字——如果你的组织有采购审批关卡,也一并接受。至于通往那项任务的一切前置环节,都放在廉价档位上跑,因为钱都花在内循环里。
这种比较容易引发的错误,是把它当成在两个模型之间做选择。它其实是关于每个模型在流水线中各自处于哪个环节的选择,而答案几乎总是两者都要。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
