
GPT-Live-1 上线 API:全双工语音每分钟 0.05 美元,但从 GPT-Realtime-2.1 没有直接替换的路径
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
GPT-Live-1 自 9 月 10 日起已在 API 中,而真正将重塑预算的数字并非基准测试——而是计费单位。OpenAI 的全双工语音模型现在按每分钟语音固定收费 0.05 美元,按秒计费;而与之对比的 GPT-Realtime-2.1 则按音频 token 计量,输入为每百万 32 美元,输出为每百万 64 美元。该模型本身并不新:GPT-Live-1 于 2026 年 7 月 8 日在 ChatGPT 内上线,替代 Advanced Voice Mode。新之处在于开发者终于可以调用它——而且调用它的方式与大多数团队现有的 Realtime 集成几乎毫无相似之处。OpenAI 自己的文档将语音层与独立的推理后端配对,而在已发布的 WebRTC 示例中,该后端是 GPT-5.6 Terra。
9月10日发布了什么,什么没有发布?
API 范围按设计很窄。只有一个模型 ID:gpt-live-1,它也是自身的默认快照——没有带日期的变体可供固定。只有一个端点,即 Live Sessions 端点,位于 v1/live/sessions。在 OpenAIOpenAI 平台上,此模型的其他所有功能均已关闭:没有 Chat Completions,没有 Responses,没有 Realtime(包括翻译和转录变体),没有 Assistants,没有 Batch,没有微调,没有嵌入,没有图像或视频生成,没有音频语音或转录端点,没有审核。
输入和输出均为音频和文本。支持流式传输和函数调用;不支持结构化输出、微调和预测输出。图像和视频输入明确不受支持——因此 OpenAI 预告的“带视频的语音”形态并不属于本次发布范围。免费层级完全无法调用它,而且速率限制以并发会话数而非每分钟请求数来衡量:Tier 1 为 25,Tier 2 至 Tier 5 依次升至 50、200、300 和 500。

这种并发性的表述是第一个线索,说明这并非即插即用的替代品。以同时进行的实时对话来计量的速率限制告诉你,OpenAIOpenAI 期望的规模单位是什么:一条电话线路,而不是一个请求。
定价调整是那个更低调却更重磅的故事
按分钟统一计费是一次真正的转变。在 token 计量模式下,你必须先对音频消耗建模——一秒静音要消耗多少 token,来电者不断打断智能体说话会如何改变输出长度——然后才能预测单次通话的成本。按每分钟 $0.05 计算,算术就简化为乘法:
• 一次 5 分钟的支持通话 — $0.25 的语音时长
• 10 分钟通话 —— $0.50
• 每天 1,000 通电话,平均时长 4 分钟——每天 200 美元,每月约 6,000 美元
• 一小时持续接通线路 — $3.00
三个细节让这一点更加明确。第一,时长不会向上取整到下一整分钟,因此一通40秒的通话费用约为3.3美分,而不是整整五美分。第二,会话初始化会预先计入15秒的语音时长费用——但这笔费用会抵扣后续的时长费用,而不是叠加在上面,因此短于15秒的通话仍按15秒的价格计费。第三,语音只占账单的一半。后端推理模型、其工具调用以及任何网络搜索都会按该模型的正常费率单独计费,这意味着,如果你把委派指向一个前沿推理模型,并让它在每一轮都进行搜索,那么即便使用“便宜的语音模型”,通话费用依然可能很高。
那个两米高的结构,正是路由从锦上添花变成不可或缺的地方。在 OrcaRouter 上,GPT-Live-1 会话的后端部分不过是又一次模型调用——大约来自十一家上游提供商的 190 个模型汇聚在同一个密钥之下,按提供商列表价原样透传、零加价,而且当你选定的后端出错或超时时会自动故障转移。你无法路由语音层本身;Live Sessions 端点只属于 OpenAI。但你完全可以路由语音层所委派的一切,而这正是随调用方思考强度而扩展的那一半。
仅限 WebRTC —— 为什么你的 Realtime 代码无法移植
这就是迁移的实际代价,而大多数上线报道都略过了它。GPT-Live-1 会话通过 WebRTC 运行,而不是许多现有 Realtime 集成所基于的 WebSocket 传输。用 GPT-Live 模型 ID 去探测旧路径时,会返回一个错误,直白地告诉你会话需要 WebRTC。
按照 OpenAI 的 WebRTC 指南,握手流程是这样的:浏览器打开一个 RTCPeerConnection,附加麦克风轨道,打开数据通道并在发起 offer 之前注册好监听器,设置本地描述,等待 ICE 收集完成,然后把 offer POST 到你自己的服务器。接着你的服务器调用 POST /v1/live/sessions,请求中带有会话配置以及 transport: { type: "webrtc", sdp: ... }。成功时会返回 HTTP 201,其中携带 session.id 和 transport.sdp,浏览器会将其应用为远端描述。媒体通过协商好的轨道传输;数据通道——标签为 oai-events——负责传递转录文本、会话更新和委派的工作。要挂断时,你发送 session.close,并持续读取,直到 session.closed 到达。
有两件事值得贴在显示器上提醒自己。HTTP 调用本身就会启动会话,所以你不能再通过数据通道发送session.start。而且你也不应通过该通道追加输入音频或等待输出音频增量——把audio.format从配置中移除,交给 SDP 处理。服务器示例将请求体限制在 64 KB,ICE 收集在 10 秒后超时,会话最终化在 15 秒后超时。
这些都不难。全都是新代码。如果你的产品是回合制实时智能体,那么迁移到 GPT-Live-1 意味着传输层重写加上委派机制重写,而不是换个模型 ID——值得按一个冲刺来排期,而不是指望一个下午搞定。
这些基准测试,以及每一项分别由谁运行。
下面的每一个数字都是 OpenAIOpenAI 自己的,随 API 发布一同公布,在撰写本文时并未被任何人独立复现。这个说明在这里比平时更重要,因为这些差异大到足以让人把它们当作既定事实来引用。

• 全双工交互性 — GPT-Live-1 达 80.1%,而 GPT-Realtime-2.1 仅为 45.4%
• 轮流发言延迟 — 0.8秒 vs 1.4秒
• 工具调用准确率 — 87% 对比 60%
• 银行语音支持基准,通过率 — 32% 对 12.4%
把最后一行读两遍。32% 的通过率相比 12.4% 是很大的提升,但仍意味着系统在那次评估中大约有三分之二的任务未能完成。交互性和工具调用方面的跃升,才真正描述出一款截然不同的产品;而银行那个数字才是诚实的,它说明语音智能体距离在无人监督的情况下处理受监管的工作流程还有多远。
客户证据比基准表更单薄,但指向同一个方向。Yelp 正将 GPT-Live-1 用于电话预订,并援引其首席技术官 Alex Levy 关于通话处理改善的说法。语言学习平台 Speak 报告称,与之前的回合制系统相比,其中断次数减少了近 80%——这是来自一家与结果存在利益关系的公司的自报数据,却仍是目前可获得的最具体的部署数字。
语音层是前端;大脑由你选择
这一架构上的押注是委托,而它正是本次发布中路由层能自然嵌入的部分。GPT-Live-1 并不进行深度思考。当调用方提出需要推理、检索或工具的问题时,模型会跨异步边界将任务交给一个独立后端;该后端在语音对话继续进行时持续工作,并在答案就绪后将其重新并入。
配置是显式的,值得仔细阅读文档示例。除了 model: "gpt-live-1" 和指令之外,会话还携带一个 delegation 类型的 responses,其内部的 responses 块指定了后端模型、它自己的指令、它的工具——示例中使用的是 web_search——以及一个 tool_choice。在 OpenAI发布的 WebRTC 示例中,该后端模型是 GPT-5.6 Terra。

这才是该设计真正的主张:更换后端,语音体验就会变得更智能,而无需重新训练语音模型。这也意味着委托后端具有语音层所不具备的可移植性。OrcaRouter 不提供 gpt-live-1——Live Sessions 端点仅适用于 OpenAI,我们不对其进行任何路由。但委托这一半使用 Responses API,而这一半完全由你选择。GPT-5.6 Terra 已在 OrcaRouter 上线,价格为 OpenAIOpenAI 的标价——每百万输入 token 2.00 美元,每百万输出 token 12.00 美元,并开放 Responses 端点——因此,OpenAIOpenAI 自己示例中的那个确切模型只需一次调用即可获得,无需第二份合同或 SDK。
实际上,这相当于把后端选择变成了配置。你可以只改一行,就在实时通话流量上让一个便宜的推理模型与一个前沿模型做 A/B 对比,并查看每次通话的费用;或者把委派模型放在自动故障转移之后,这样上游哪怕有一个糟糕的下午,也不会连带把你的电话线路搞垮。你每分钟支付 $0.05 的语音层保持原样;它委派出去的一切,都通过一个密钥,在来自 11 家上游提供商的约 190 个模型上运行,按提供商标价,零加价。
还缺少什么
• 无图像或视频输入——本次发布不包含静态图像与屏幕共享,因此旧版 ChatGPT 模式依然保有的多模态语音界面仍未得到处理
• 不支持结构化输出——如果你的智能体需要经过 schema 校验的工具参数,那么这种校验必须位于你的后端模型中,而不是语音层
• 无免费套餐访问权限,也不支持微调——费用和定制功能都从付费套餐层级开始
• 未对任何核心数字进行独立评估——上述所有数字均为供应商自行运行所得
• 在 Tier 1 上,并发上限为 25 个同时会话——对试点来说很宽裕,但对第一天运营的呼叫中心来说却很紧张
谁该动,谁该等
如果你正在做电话语音——预订热线、预约安排、一线支持——而当前的技术栈还是经典的 ASR→LLM→TTS 级联,那就现在动手。延迟和打断处理正是那条流水线丢失的东西,每分钟的价格也足够可预测、能直接放进电子表格,而 OpenAI 自己的文档现在也附了一个 Twilio 形状的服务器示例可供照抄。如果你已经在用 Realtime 模型,而且产品是真正的对话式而非轮次式,那也要现在动手,因为打断处理恰恰是 GPT-Realtime-2.1 最不擅长的部分。
如果你的集成是基于轮次的且运行正常,那就先等等。传输层的重写是实打实的工作量,该端点不支持其他方式,而且没有任何迁移路径能保留你现有的 WebSocket 代码。同样,如果你的用例依赖结构化工具输出或视频输入——这两者在这里都不具备——那也先等等。
接下来几周值得关注的事项有:80.1% 互动性数字的首次独立复现、$0.05 的费率是否为引入价、更小的 GPT-Live-1 mini 是否会像在消费端那样进入 API,以及图像和屏幕输入能否弥合差距。在外部实验室进行那项评估之前,诚实的总结是:这是任何人已向开发者交付过的最强大的语音模型,而这一说法的凭证是由售卖它的人自己写下的。
