
OpenAI 的 Decisions API:GPT-6 Luna 停止聊天,只选择一个答案
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 393 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 209 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- xAISpaceXAI: Grok 4.62026-08-1244智能77代码
GPT-6 Luna于 2026 年 9 月 22 日发布,是 OpenAI GPT-6 产品阶梯中廉价的一级。9 月 29 日的新变化,是它有了一个与对话毫无关系的用途。OpenAI 的 Decisions API 接收你编写的一个问题、一份你允许的有限答案列表,以及一段上下文——文本或图像——然后返回其中一个答案。不是散文。不是一段需要解析并寄望于运气的话。而是一个单一选择,因此一张支持工单会被归入五个队列之一,一张图像会落入某个审核类别,或者一个智能体根据你定义的策略挑选下一步行动。它是在 DevDay 2026 上宣布的,目前处于有限预览阶段,OpenAI 表示计划在未来几天内广泛发布。
团队要基于它进行开发之前所需的大部分信息,目前都尚未公布。没有每次调用的价格,没有说明一次请求最多能携带多少个候选答案,没有说明能否用自己的数据对它进行调优,而且——截至 9 月 30 日——OpenAI 自己的开发者文档索引、更新日志或 API 参考中都没有关于它的条目。这三处我们都查过了。目前,这项能力只出现在 OpenAI 的 DevDay 回顾以及 OpenAI 在发布日告诉记者的内容中。因此,本文余下部分会把三个层级清晰区分开:OpenAI 已确认的内容、一次发布日测量所显示的内容,以及目前无人能知的内容。
受约束的决策实际上是什么
两种现有方法在这项任务上表现不佳,而 Decisions API 旨在填补两者之间的空白。第一种是提示聊天模型:你写一条仔细的指令,要求它从列表中选择,它给你写一句话,如果运气好,你可以从响应中读出 token 概率,得到某种类似置信度分数的东西。它能用,但会消耗 token,而且那个置信度数字只是粗略的猜测。第二种是训练一个小型分类器:快速、便宜,但它需要标注数据,并且每次标签集变化时都要重新训练一次。
决策模型介于两者之间。它接受提示词中的新标签——就像提示词本身那样——但返回一个分数或一个选择,开发者无需解析即可据此分支,而这正是分类器曾经具备、聊天模型却从未有过的特性。OpenAI 对这种形态并不陌生:多年来,其 Moderation API 一直返回按类别划分的分数,而非文本,但有一个区别在此处至关重要。Moderation 的类别是 OpenAI 的。Decisions API 的类别是你的。
约束即产品,值得精确说明它能带来什么、不能带来什么。有限的输出空间意味着每个被允许的值都是预先已知的,因此你的应用可以拒绝它未定义的答案,为每个分支附加不同的权限等级,并在置信度或上下文不足时回退到人工处理。它还使离线评估变得可行,因为每个测试用例都有目标类别,出错时也有可衡量的代价。它买不到的是正确性。受约束的模型仍可能选错一个有效答案,被误导性上下文带偏,或继承你所写类别中的偏见。
150毫秒的说法,以及OpenAI没有公布的数字
OpenAI 表示,Decisions API 做出决策的速度大约比 GPT-6 Luna 通过常规 API 快十倍——大约 150 毫秒对约 1.6 秒。该数字由厂商提供且尚未被复现;自发布以来的两天里,没有任何针对它的独立测量,而 OpenAI 自己的总结也只说“实时决策”。这个数字没有附带延迟分布、区域、输入规模、并发水平,也没有服务级别协议。
我们自己的流量数据不能替代那项测试,但它解释了为什么缺失的分布很重要。在截至 9 月 30 日的七天里,经由 OrcaRouter 的常规 chat-completions 路由提供的 GPT-6 Luna,在 32.3 亿 token 的混合工作负载上,中位数为 699 毫秒,p95 为 7.6 秒——中段与尾部之间的差距超过一个数量级。这与受限决策的请求形态不同,所以它并不是与 150 毫秒这一说法所做的比较。这就是为什么单个头条式 p50 并不是用来设计截止时间的正确数字。如果你测试该预览版,请分别记录文本和图像输入的中位数、p95 和 p99,包含网络时间和重试,并衡量你的产品实际拥有的截止时间——异步队列的路由决策,与处在一次点击和一次支付之间的决策,并不共享同一个延迟预算。

定价:底层模型的成本是多少,以及为什么那不是 API 的价格
OpenAI 尚未公布 Decisions API 的费率。同样不能想当然地认为 Luna 的 token 费率适用,因为 Decisions API 是独立的打包产品——不同的端点、不同的限额,而且 OpenAI 表示会在“广泛推广时”分享更多细节。现在任何人向你报出单次决策的成本,都只是推测。
公布的是它所基于的模型的价格表,摘自 OpenAI 于 2026 年 9 月 30 日的定价页面:
• 输入 — 每百万 token $0.10,超过 272,000 个输入 token 后变为 $0.20
• 输出 — 每百万 token $0.50,超过 272,000 个输入 token 后变为 $0.75
• 缓存输入 — 每百万 token $0.01;缓存写入按 $0.125 计费,比未缓存费率高出 25%
• Batch 和 Flex 处理 — 标准费率的 50%;Fast 模式 — 适用费率的 2 倍
长上下文分界线是最容易让人栽跟头的地方,而且它在整个 GPT-6 上都以同样的方式运作:一旦越过 272,000 个输入 token,整个请求都会按更高档位重新计价,而不只是超出的那部分。把长文档或大批图像交给模型的决策,正是可能触及这条线的那类调用,而这也是预览版限制悬而未决的又一点。
GPT-6 Luna 以其自身的方式
抛开 API 不谈,底层模型是一个推理模型,处于一个三档产品家族的最低档——低于定价为 $2.00/$10.00 的 GPT-6 Sol,以及定价为 $10.00/$50.00 的旗舰 GPT-6 Astra——它具有 1,050,000 token 的上下文窗口、128,000 token 的输出上限、2026 年 5 月 18 日的知识截止日期,并且推理力度可在从 none到max的六个值之间设置。它接受文本和图像输入并返回文本,而在 OpenAI 自己的开发者文档中,力度默认值为 medium。同一页面还有一个实际注意事项,虽然与 Decisions API 无关,但如果你要把 Luna 接入作为后备方案,就与之相关:在 Chat Completions 上,函数调用仅在推理力度设为 none时才能正常工作。在其他任何力度设置下,工具都需要使用 Responses API。
在质量方面,独立数字是 Artificial Analysis 的 Intelligence Index:Luna 在最大努力下为 37.3,而 GPT-6 Sol 为 47.5——相差约十个百分点,这正是看待输入价格相差二十倍的诚实方式。这两个数字都不是对 Decisions API 的说明,其受限任务是另一种完全不同的衡量,且没有公开分数。

Jev、Laya,以及"系统一"框架
决策 API 并非横空出世于一片空白。TypeSafe AI 的 Jev 由 Diogo Almeida 于 2026 年 9 月 15 日推出,自 9 月 21 日起全面可用,正是这款模型让这一品类为开发者所理解:它完全不生成文本,而是返回带置信度的类型化答案,输入 token 每百万 0.042 美元,输出不计费。由 Every 开展的 Jev 首次独立测试,在不到 0.7 秒内对 37 份文档作出了 777 项判断,成本约为四分之一美分;第二次测试测得其每段中位耗时 0.35 秒,而 Claude Fable 5.1 在高投入模式下为 8.83 秒——速度约快 25 倍,成本约为其 1/580,同时捕捉到七个刻意植入缺陷中的六个,而 Fable 5 全部七个都捕捉到了。"不错,但并非完美"是 Every 的评语,也是一句到位的概括。Laya 是同一形态下的第三位入局者,一个无需写出一个 token 就能作答的决策模型。
OpenAI 是否是因为 Jev 才构建了 Decisions API,这属于猜测。The New Stack 在发布当天报道此事时,称这是对 TypeSafe 的回应,“很有可能”,并指出 OpenAI 很可能是赶在 DevDay 之前匆忙发布了这一消息;OpenAI 并未说过任何此类话,而时间点——Jev 于 9 月 21 日正式可用,DevDay 在 9 月 29 日——虽引人联想,却并非证据。并非猜测的是,在买家关心的维度上,二者尚不可相提并论。Jev 公布了价格、按次调用的计费形式以及正式发布(GA)日期。Decisions API 这三项一项都没有公布。
它在哪里运行,以及要在它旁边暖着什么
Decisions API 是 OpenAI 自家的封装产品。它不在我们的目录中,我们也不为其提供路由,所以如果你想要这个特定的端点,它就在 OpenAI 那里。它所基于的模型则是另一回事:GPT-6 Luna 是OrcaRouter 上的实时路由,按 OpenAI 的标价零加价透传——每百万 token 输入 $0.10、输出 $0.50,>272K 档位则为 $0.20/$0.75——而在截至 9 月 30 日的七天内,它已通过我们处理了 32.3 亿 token,错误率为 0.18%。
这对如何为一款预览版降低风险至关重要。测试一个受限决策端点的稳妥做法,是让基于提示词的路径保持热备,充当兜底方案,因为预览版可能在毫无预警的情况下更改限制或定价,而处于关键路径上的决策需要有退路。把这个兜底方案与其他模型放在同一个密钥上,就意味着无需第二份合同,兜底路径也无需改动代码:一个 API 覆盖 200 多个模型,并且自动故障转移可在某个提供商出现波动时跨提供商切换。如果你的决策只是更长链条中的一步,路由 DSL 能把多个模型组合成一次调用,而这正是 Jev 相关报道所普及的“编排器加决策者”模式——由更大的模型负责规划,小模型负责选择每一步。这种模式用我们目前提供的模型就能搭建起来;而 Decisions API 本身在这套模式之外,除非 OpenAI 将其开放。
谁该动,谁该等
如果你面对的是高吞吐量的分类或路由任务,走错分支的代价低廉且可逆,那么这个预览版本值得你本周就投入一种请求形态和一套标注集——这项能力是真实存在的,其约束条件相比解析自然语言文本是实实在在的改进,而预览阶段是了解其错误代价会落在何处的最低成本时机。如果你的决策涉及授权资金、向客户发送消息,或位于用户与支付之间,那么本周没有任何东西会改变你的权衡:没有已公布的价格可供建模,没有已公布的限额可供设计,没有 SLA,也没有任何关于能否用自己的数据微调这东西的说法。这四个空白正是“广泛推广”必须填补的内容,而在 OpenAI 明确说出它们之前,对 Decisions API 的诚实解读是:一个前景可期的接口,带着厂商声称的快速时间表,却没有任何账单附上。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
