文章《Ope​nAI 九月平台日》的主视觉标题卡,副标题为“GPT-Live-1 登陆 API,Agents API 开启 Beta”,并附有一枚徽标,内容为“两项公告日期均为 2026 年 9 月 10 日”,以及三张卡片,内容分别为“API 中的 GPT-Live-1:每语音分钟 $0.05,Live Sessions 端点,单一模型 ID”、“Agents API:公开 Beta、Codex 运行框架、托管沙箱或自带沙箱”和“为何重要:模型成为你可选择的组件,运行框架成为你租用的产品”,上方是页脚条,内容为“语音数据由 Ope​nAI 自报且未经复现;Agents API 定价为成本转嫁。”OrcaRouter 标志合成于右下角。
Guides & Insights

OpenAI 九月平台日:GPT-Live-1 登陆 API,Agents API 开启 Beta 测试

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026 年 9 月 10 日,有两样东西离开了 Ope​nAI 的平台,而更低调的那个影响范围更大。GPT-Live-1——自 7 月 8 日起一直在 ChatGPT 内部运行的全双工语音模型——现在开发者可以按每分钟 0.05 美元的价格调用其语音。与它一同出现、但在报道中被提及得少得多的,是 Agents API 进入公开测试:它正是运行 Codex 的那套框架,如今作为带有托管沙箱的托管产品对外提供。一个是更好的语音。另一个则是 Ope​nAI 在出售过去构建智能体时最难的那部分。

二者均读自本文所依据的一手来源:OpenAI 的 Agents API 公告、其开发者社区中介绍 API 中 GPT-Live-1 的帖子,以及二者的开发者文档。若某个数字来自 OpenAI 而非外部评估者,下文会照此标注——而有一个数字确实来自外部,这使情况略有不同。

A two-column scoreboard titled 'September 10, 2026 — what Ope​nAI shipped'. The left column, labelled GPT-Live-1 in the API, reads 'What it is: full-duplex voice model', 'Access: Live Sessions API, one model ID', 'Price: $0.05 per voice minute', 'Status: generally available since Sept 10, 2026', 'Independent score: 69.8% on the Artificial Analysis Speech to Speech Index', 'Catch: delegates its thinking to a backend model'. The right column, labelled Agents API, reads 'What it is: hosted agent runtime', 'Access: public beta, Codex harness', 'Price: no API fee; sandbox time is billed', 'Status: public beta since Sept 10, 2026', 'Evidence: Ope​nAI documentation only, no independent evaluation', 'Catch: US-only data residency, no Zero Data Retention'. The footer reads 'GPT-Live-1 voice benchmarks Ope​nAI-reported and unreproduced; the AA index figure is independently run.' The OrcaRouter logo is composited in the bottom-right corner.

Artificial Analysis 今年开始发布语音到语音指数,GPT-Live-1 在其中占有一席:69.8%,这是语音推理、智能体表现、竞技场偏好和任务成功率的加权平均值。这让它在十一个评分模型中位列第七——落后于 73.9% 的 GPT-Realtime-2.1(即它所取代的模型),也落后于 79.0% 的 Grok Voice Think Fast 2.0。独立排行榜与 OpenAI 自己的基准测试表讲述的并非同一个故事,而两者都属实。

已发布的内容,按它们将改变你架构的顺序排列

• 语音 — GPT-Live-1 已在 API 中上线,名称为 gpt-live-1,语音计费为每分钟 $0.05,按秒计费,后端推理模型按其自身费率单独计费。

• Agents — Agents API 处于公开测试阶段。OpenAI 表示,API 本身不收取额外费用;您需要为模型 token、工具和托管的沙箱容器时间付费。

• 沙盒 —— OpenAI 现在托管执行环境,复用与 Codex 和 ChatGPT 相同的沙盒基础设施,并可通过文件、包、技能和插件进行配置。

• 环境——除了 OpenAI 自己的沙盒之外,团队还可以让智能体指向自己的基础设施,或指向 beta 合作伙伴名单中的第三方沙盒供应商。

语音发布是一个模型故事。Agents API 是一个平台故事,而平台故事才是那些会悄然重新定位代码库的故事。

Agents API:一次 POST 创建一个智能体

核心调用是POST /v1/agents/sessions,并随Ope​nAI-Beta: agents=v1 标头发送;其卖点在于,只要提供任务、模型、工具和环境,就足以取回一个正在运行的智能体。SDK 覆盖 Python、TypeScript/JavaScript、Go、Java 和 Ruby。

让它不止是一个 wrapper 的原因在于,Ope​nAI 是在运营这套 harness,而不是把它交付出去。AgentKit harness 是开源且可审查的,但正在运行的那份副本属于 Ope​nAI——跨长会话的上下文压缩、工具搜索、程序化工具调用、MCP 支持、自定义函数、内置网页搜索,以及并发度可配置的子智能体编排。版本化的 harness 能力会随模型发布一同落地,而这才是真正有意思的承诺:脚手架与模型以相同的节奏向前推进。

对于任何花了一个季度维护一个循环的人——重试逻辑、上下文裁剪、工具路由、总是泄漏状态的子代理扇出——那才是真正的产品。不是模型调用。而是围绕它的、你不再需要编写的管道。

托管沙盒是附带账单的那部分

执行代码的智能体需要有地方来运行代码,而测试版给出了 OpenAI 自己的答案:一个托管沙箱,可运行代码、处理文件并生成产物,还能通过包、技能和插件进行配置。已经拥有加固执行环境的开发者不会被强制使用它——自带基础设施,以及一组具名的沙箱合作伙伴,都在测试版中提供。

在你基于它进行构建之前,有两点运维方面的注意事项值得记下来。测试版的数据驻留仅限美国,并且不支持 Zero Data Retention。对于受监管的工作负载而言,这两条就决定了这是一条试点路径还是生产路径,而它们正是那种往往到最后才被发现的细节。

API 中的 GPT-Live-1:按分钟计费的统一费率才是真正的变化

语音模型本身并不新鲜——它于7月8日取代了ChatGPT内的Advanced Voice Mode——但商业形态却是新的。在Realtime产品线下,音频按token计量,这意味着预测一次通话需要建模音频消耗:一秒静音要消耗多少token,呼叫者打断智能体说话会如何改变输出长度。每语音分钟固定0.05美元,把这一切简化为乘法。连续保持接通一小时是3.00美元。每天一千通电话、平均每通四分钟,大约是每天200美元。

会话通过一个 Live Sessions 端点运行,使用单一模型 ID,且没有带日期的快照可供固定。文档涵盖 WebRTC、WebSockets 以及电话/SIP 作为连接路径,已发布的快速入门构建的是 WebRTC 这条路径。计费有两个计量项,其中只有一个是语音:每一次委托的推理调用、工具调用和网络搜索都按后端模型的正常费率计费。

这套架构的核心是委派。GPT-Live-1 负责处理对话——每秒多次判断是继续聆听、暂停、打断,还是把工作移交出去——并把任何需要真正推理的内容,跨越异步边界传递给一个独立的后端,后者在语音对话持续进行的同时继续工作。文档定义了两种模式:Responses 委派,由 Ope​nAI 替你调用受支持的 Responses 模型,并提供对话上下文;以及客户端委派,由你自己的应用提供后端,并保持对执行、上下文以及哪些结果能到达语音层的控制。在已发布的 Responses 示例中,那个后端是 GPT-5.6 Terra,它被命名在一个委派对象中,并带有自身的指令和工具。在 7 月的消费者版本发布时,它是 GPT-5.5;此后的社区文章则一直指向 GPT-6 Astra

A screenshot of Ope​nAI's developer documentation page 'Agents' under the API section, headed 'Choose a runtime, connect tools, and manage multi-step work', showing a routing row reading 'Run an agent with the Codex harness managed by Ope​nAI — Agents API', and a comparison table with columns Agents API, Agents SDK and Responses API whose rows read 'Where the agent runs: Ope​nAI runs a managed Codex harness', 'State between tasks: saved session configuration, turns, and items' and 'Execution environment: Ope​nAI hosted sandbox, self-hosted sandbox, or no sandbox'.

语音层的每个关键数字都是 Ope​nAI 自己的,并且在撰写本文时,尚未被任何人独立复现:在 Full Duplex Bench v1.5 交互性上达到 80.1%,而 GPT-Realtime-2.1 为 45.4%;轮次切换延迟为 0.798 秒,而后者为 1.41 秒;工具调用成功率为 87%;以及在银行语音支持评估中通过率为 32%,而它所取代的模型为 12.4%。最后一对数字是最诚实的——虽然有了大幅提升,但系统仍然在受监管的工作流程中失败约三分之二。第三方客户证据存在,但很单薄且带有自身利益:Yelp 用于电话预订、EliseAI,以及学习平台 Speak 报告称,与之前的基于轮次的堆栈相比,中断减少了近 80%。

独立评测结果则没那么好看,它值得与上面的榜单并列,而不是附在其下。在 Artificial Analysis 语音到语音指数上——一个综合了语音推理、智能体表现、竞技场偏好和任务成功率的复合得分——GPT-Live-1 为 69.8%,低于 GPT-Realtime-2.1 的 73.9%,也远低于 Grok Voice Think Fast 2.0 的 79.0%。把两者放在一起读,产品的形态就很清楚了:OpenAI 打造出了当下最好的对话机制,却没有造出最好的语音智能体,因为推理被交给了一个在该指数中单独评分的模型。

A screenshot of the Artificial Analysis Speech to Speech Index chart, updated September 2026, ranking eleven speech models by a weighted average of speech reasoning, agentic performance, arena preference and task success rate. Bars run left to right: Grok Voice Think Fast 2.0 at 79.0%, GPT-Realtime-2.1 at 73.9%, GPT-Realtime-2 at 73.6%, Grok Voice Think Fast at 72.3%, Gemini 3.1 Flash Live at 71.5%, GPT-Live-1 mini at 70.3%, GPT-Live-1 at 69.8%, Qwen-Audio-Omni at 66.8%, RealTime Omni at 64.2%, Qwen 3.x Omni at 63.9% and Gemini 2.5 Flash at 52.6%. Companion charts show time to first audio, where GPT-Live-1 sits mid-pack at 0.78 seconds, and cost per hour of input audio, where GPT-Live-1 is $4.42 against GPT-Realtime-2.1 at $10.75.

这两则公告其实是一则公告

放在一起读,这两项发布从两个方向描述了同一次重组。Agents API 把循环、沙箱和上下文管理移入一个托管产品。GPT-Live-1 把对话界面移入一个薄前端,让其思考委托给别处。在两者中,模型都不再是你围绕其构建的东西,而成为你选择的一个组件——并且在两者中,这种选择都只是一行配置,而非一项架构承诺。

这正是路由层所处的接缝。OrcaRouter 并不承载 gpt-live-1:Live Sessions 端点仅属于 OpenAI,我们完全不路由它。委托那一半则是另一回事。语音层把工作交给的后端使用 Responses API,而这是一次普通的模型调用——OpenAI 自己的示例所命名的模型 GPT-5.6 Terra,可通过 OrcaRouter 以 OpenAI 的标价获取:每百万输入 token 2.00 美元、每百万输出 12.00 美元,并开放 Responses 端点。客户端委托更进一步:它允许你的应用直接提供后端,这意味着语音背后的模型可以是你控制的任何端点。Agents API 的模型槽位也是如此:执行框架是 OpenAI 的,但其中的模型由你选择,来自十一家上游提供商的约 190 个模型都位于 一把密钥之后,按提供商标价,且没有任何加价

具体来说,由此可以得出三点。只需修改一行,就能在实时流量上对后端做 A/B 测试,这样你就能在把一条电话线路投入给某个廉价推理器之前,先弄清楚它是否够好。故障转移可以置于委派模型之下,这样上游一个糟糕的下午就不会把整段对话一起拖垮。而且,通过路由 DSL,一次调用就能让一个任务跑在多个后端上,或者借助模型融合由一组模型同时给出回答——当智能体的输出必须被信任、而不仅仅是生成出来时,这一点立刻就有用。

两个发行版里都没有什么?

• GPT-Live-1 不支持图像或视频输入——旧版 ChatGPT 模式所具备的多模态语音功能至今仍未得到解决。

• 语音层不支持结构化输出,因此经 schema 验证的工具参数必须在后端模型中强制执行。

• 免费层级无法访问 GPT-Live-1,且速率限制以并发会话数计量——第 1 层级为 25,到第 5 层级提升至 500。

• 在 Agents API 测试版中,不提供零数据保留,也不支持美国以外的数据驻留。

• 未能独立复现任何 GPT-Live-1 基准数据。

Ope​nAI 在 9 月 10 日押下的赌注是:开发者想要单独购买运行框架,并单独选择大脑。这个赌注的前半部分,如今已成为一项单独列出的条目。后半部分,则是未来十二个月竞争压力将集中落下的地方——因为一个带有可替换模型槽位的托管式运行框架,其表现完全取决于你能放进去的模型,而眼下,这正是整个技术栈中 Ope​nAI 无法独自掌控的那一环。

委托这一半则是另一回事——语音层把工作交出去的后端只是一次普通的模型调用,而 GPT-5.6 Terra可通过 OrcaRouter 以 Ope​nAI 的标价获取,并且已开放 Responses 端点。