主视觉标题卡上写着“OpenAI 的 Decisions API”,副标题为“GPT-6 Luna 不再闲聊,只选出一个答案”,三张圆角卡片分别写着“从你定义的列表中选出一个答案”“厂商声称约 150 毫秒”和“尚未公布价格”,页脚写着“OpenAI 数据由厂商提供;尚无独立测量。”,右下角合成有 OrcaRouter 标志。
Guides & Insights

OpenAI 的 Decisions API:GPT-6 Luna 停止聊天,只选择一个答案

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

GPT-6 Luna于 2026 年 9 月 22 日发布,是 OpenAI GPT-6 产品阶梯中廉价的一级。9 月 29 日的新变化,是它有了一个与对话毫无关系的用途。OpenAI 的 Decisions API 接收你编写的一个问题、一份你允许的有限答案列表,以及一段上下文——文本或图像——然后返回其中一个答案。不是散文。不是一段需要解析并寄望于运气的话。而是一个单一选择,因此一张支持工单会被归入五个队列之一,一张图像会落入某个审核类别,或者一个智能体根据你定义的策略挑选下一步行动。它是在 DevDay 2026 上宣布的,目前处于有限预览阶段,OpenAI 表示计划在未来几天内广泛发布。

团队要基于它进行开发之前所需的大部分信息,目前都尚未公布。没有每次调用的价格,没有说明一次请求最多能携带多少个候选答案,没有说明能否用自己的数据对它进行调优,而且——截至 9 月 30 日——OpenAI 自己的开发者文档索引、更新日志或 API 参考中都没有关于它的条目。这三处我们都查过了。目前,这项能力只出现在 OpenAI 的 DevDay 回顾以及 OpenAI 在发布日告诉记者的内容中。因此,本文余下部分会把三个层级清晰区分开:OpenAI 已确认的内容、一次发布日测量所显示的内容,以及目前无人能知的内容。

受约束的决策实际上是什么

两种现有方法在这项任务上表现不佳,而 Decisions API 旨在填补两者之间的空白。第一种是提示聊天模型:你写一条仔细的指令,要求它从列表中选择,它给你写一句话,如果运气好,你可以从响应中读出 token 概率,得到某种类似置信度分数的东西。它能用,但会消耗 token,而且那个置信度数字只是粗略的猜测。第二种是训练一个小型分类器:快速、便宜,但它需要标注数据,并且每次标签集变化时都要重新训练一次。

决策模型介于两者之间。它接受提示词中的新标签——就像提示词本身那样——但返回一个分数或一个选择,开发者无需解析即可据此分支,而这正是分类器曾经具备、聊天模型却从未有过的特性。OpenAI 对这种形态并不陌生:多年来,其 Moderation API 一直返回按类别划分的分数,而非文本,但有一个区别在此处至关重要。Moderation 的类别是 OpenAI 的。Decisions API 的类别是你的。

约束即产品,值得精确说明它能带来什么、不能带来什么。有限的输出空间意味着每个被允许的值都是预先已知的,因此你的应用可以拒绝它未定义的答案,为每个分支附加不同的权限等级,并在置信度或上下文不足时回退到人工处理。它还使离线评估变得可行,因为每个测试用例都有目标类别,出错时也有可衡量的代价。它买不到的是正确性。受约束的模型仍可能选错一个有效答案,被误导性上下文带偏,或继承你所写类别中的偏见。

150毫秒的说法,以及OpenAI没有公布的数字

OpenAI 表示,Decisions API 做出决策的速度大约比 GPT-6 Luna 通过常规 API 快十倍——大约 150 毫秒对约 1.6 秒。该数字由厂商提供且尚未被复现;自发布以来的两天里,没有任何针对它的独立测量,而 OpenAI 自己的总结也只说“实时决策”。这个数字没有附带延迟分布、区域、输入规模、并发水平,也没有服务级别协议。

我们自己的流量数据不能替代那项测试,但它解释了为什么缺失的分布很重要。在截至 9 月 30 日的七天里,经由 OrcaRouter 的常规 chat-completions 路由提供的 GPT-6 Luna,在 32.3 亿 token 的混合工作负载上,中位数为 699 毫秒,p95 为 7.6 秒——中段与尾部之间的差距超过一个数量级。这与受限决策的请求形态不同,所以它并不是与 150 毫秒这一说法所做的比较。这就是为什么单个头条式 p50 并不是用来设计截止时间的正确数字。如果你测试该预览版,请分别记录文本和图像输入的中位数、p95 和 p99,包含网络时间和重试,并衡量你的产品实际拥有的截止时间——异步队列的路由决策,与处在一次点击和一次支付之间的决策,并不共享同一个延迟预算。

A single-column scoreboard titled 'GPT-6 Luna and the Decisions API - the scoreboard' with six rows: Decisions API price 'not published', candidate-answer limit 'not published', fine-tuning on your data 'no statement', stated decision latency '~150 ms vendor-reported', GPT-6 Luna input / output '$0.10 / $0.50 per 1M', and AA Intelligence Index at max effort '37.3', with a footer reading 'OpenAI figures vendor-reported; Index per Artificial Analysis; unpublished means blank, not zero.' and the OrcaRouter logo composited in the bottom-right corner.

定价:底层模型的成本是多少,以及为什么那不是 API 的价格

OpenAI 尚未公布 Decisions API 的费率。同样不能想当然地认为 Luna 的 token 费率适用,因为 Decisions API 是独立的打包产品——不同的端点、不同的限额,而且 OpenAI 表示会在“广泛推广时”分享更多细节。现在任何人向你报出单次决策的成本,都只是推测。

公布的是它所基于的模型的价格表,摘自 OpenAI 于 2026 年 9 月 30 日的定价页面:

• 输入 — 每百万 token $0.10,超过 272,000 个输入 token 后变为 $0.20
• 输出 — 每百万 token $0.50,超过 272,000 个输入 token 后变为 $0.75
• 缓存输入 — 每百万 token $0.01;缓存写入按 $0.125 计费,比未缓存费率高出 25%
• Batch 和 Flex 处理 — 标准费率的 50%;Fast 模式 — 适用费率的 2 倍

长上下文分界线是最容易让人栽跟头的地方,而且它在整个 GPT-6 上都以同样的方式运作:一旦越过 272,000 个输入 token,整个请求都会按更高档位重新计价,而不只是超出的那部分。把长文档或大批图像交给模型的决策,正是可能触及这条线的那类调用,而这也是预览版限制悬而未决的又一点。

GPT-6 Luna 以其自身的方式

抛开 API 不谈,底层模型是一个推理模型,处于一个三档产品家族的最低档——低于定价为 $2.00/$10.00 的 GPT-6 Sol,以及定价为 $10.00/$50.00 的旗舰 GPT-6 Astra——它具有 1,050,000 token 的上下文窗口、128,000 token 的输出上限、2026 年 5 月 18 日的知识截止日期,并且推理力度可在从 none到max的六个值之间设置。它接受文本和图像输入并返回文本,而在 OpenAI 自己的开发者文档中,力度默认值为 medium。同一页面还有一个实际注意事项,虽然与 Decisions API 无关,但如果你要把 Luna 接入作为后备方案,就与之相关:在 Chat Completions 上,函数调用仅在推理力度设为 none时才能正常工作。在其他任何力度设置下,工具都需要使用 Responses API。

在质量方面,独立数字是 Artificial Analysis 的 Intelligence Index:Luna 在最大努力下为 37.3,而 GPT-6 Sol 为 47.5——相差约十个百分点,这正是看待输入价格相差二十倍的诚实方式。这两个数字都不是对 Decisions API 的说明,其受限任务是另一种完全不同的衡量,且没有公开分数。

OpenAI's developer documentation page for the gpt-6-luna model, showing the model heading with compare and playground controls, the reasoning, speed and price tiles, the '$0.1 - $0.5' price range, text and image input with text output, a 1,050,000-token context window, a 128,000-token maximum output, a May 18 2026 knowledge cutoff, the note that reasoning.effort supports none, low, medium (default), high, xhigh and max, and the note that Chat Completions supports function calling only with reasoning effort set to none.

Jev、Laya,以及"系统一"框架

决策 API 并非横空出世于一片空白。TypeSafe AI 的 Jev 由 Diogo Almeida 于 2026 年 9 月 15 日推出,自 9 月 21 日起全面可用,正是这款模型让这一品类为开发者所理解:它完全不生成文本,而是返回带置信度的类型化答案,输入 token 每百万 0.042 美元,输出不计费。由 Every 开展的 Jev 首次独立测试,在不到 0.7 秒内对 37 份文档作出了 777 项判断,成本约为四分之一美分;第二次测试测得其每段中位耗时 0.35 秒,而 Claude Fable 5.1 在高投入模式下为 8.83 秒——速度约快 25 倍,成本约为其 1/580,同时捕捉到七个刻意植入缺陷中的六个,而 Fable 5 全部七个都捕捉到了。"不错,但并非完美"是 Every 的评语,也是一句到位的概括。Laya 是同一形态下的第三位入局者,一个无需写出一个 token 就能作答的决策模型。

OpenAI 是否是因为 Jev 才构建了 Decisions API,这属于猜测。The New Stack 在发布当天报道此事时,称这是对 TypeSafe 的回应,“很有可能”,并指出 OpenAI 很可能是赶在 DevDay 之前匆忙发布了这一消息;OpenAI 并未说过任何此类话,而时间点——Jev 于 9 月 21 日正式可用,DevDay 在 9 月 29 日——虽引人联想,却并非证据。并非猜测的是,在买家关心的维度上,二者尚不可相提并论。Jev 公布了价格、按次调用的计费形式以及正式发布(GA)日期。Decisions API 这三项一项都没有公布。

它在哪里运行,以及要在它旁边暖着什么

Decisions API 是 OpenAI 自家的封装产品。它不在我们的目录中,我们也不为其提供路由,所以如果你想要这个特定的端点,它就在 OpenAI 那里。它所基于的模型则是另一回事:GPT-6 Luna 是OrcaRouter 上的实时路由,按 OpenAI 的标价零加价透传——每百万 token 输入 $0.10、输出 $0.50,>272K 档位则为 $0.20/$0.75——而在截至 9 月 30 日的七天内,它已通过我们处理了 32.3 亿 token,错误率为 0.18%。

这对如何为一款预览版降低风险至关重要。测试一个受限决策端点的稳妥做法,是让基于提示词的路径保持热备,充当兜底方案,因为预览版可能在毫无预警的情况下更改限制或定价,而处于关键路径上的决策需要有退路。把这个兜底方案与其他模型放在同一个密钥上,就意味着无需第二份合同,兜底路径也无需改动代码:一个 API 覆盖 200 多个模型,并且自动故障转移可在某个提供商出现波动时跨提供商切换。如果你的决策只是更长链条中的一步,路由 DSL 能把多个模型组合成一次调用,而这正是 Jev 相关报道所普及的“编排器加决策者”模式——由更大的模型负责规划,小模型负责选择每一步。这种模式用我们目前提供的模型就能搭建起来;而 Decisions API 本身在这套模式之外,除非 OpenAI 将其开放。

谁该动,谁该等

如果你面对的是高吞吐量的分类或路由任务,走错分支的代价低廉且可逆,那么这个预览版本值得你本周就投入一种请求形态和一套标注集——这项能力是真实存在的,其约束条件相比解析自然语言文本是实实在在的改进,而预览阶段是了解其错误代价会落在何处的最低成本时机。如果你的决策涉及授权资金、向客户发送消息,或位于用户与支付之间,那么本周没有任何东西会改变你的权衡:没有已公布的价格可供建模,没有已公布的限额可供设计,没有 SLA,也没有任何关于能否用自己的数据微调这东西的说法。这四个空白正是“广泛推广”必须填补的内容,而在 OpenAI 明确说出它们之前,对 Decisions API 的诚实解读是:一个前景可期的接口,带着厂商声称的快速时间表,却没有任何账单附上。

OrcaRouter's model page for openai/gpt-6-luna, showing the model name and OpenAI attribution dated 2026-09-22, capability pills for vision, tools, JSON and reasoning, the description of GPT-6 Luna as the fast cost-efficient model below GPT-6 Sol, the /v1/chat/completions route, a $0.10 input and $0.50 output rate per million tokens with a 699 ms p50 time to first token, a 1M-token context with 128K maximum output, and 3234.7M tokens of traffic.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新