文章〈OpenAI 九月平台日〉的主視覺標題卡,副標題「GPT-Live-1 登上 API,Agents API 開放 Beta 測試」,附帶一枚徽章寫著「兩項公告日期均為 2026 年 9 月 10 日」,以及三張卡片分別寫著「API 中的 GPT-Live-1:每語音分鐘 $0.05、Live Sessions 端點、單一模型 ID」、「Agents API:公開 Beta、Codex 執行框架、代管沙箱或自備沙箱」與「為何重要:模型成為你能挑選的元件,執行框架成為你能租用的產品」,下方橫幅寫著「語音數據為 OpenAI 自行公布、未經重現;Agents API 定價為成本轉嫁。」OrcaRouter 標誌合成於右下角。
Guides & Insights

OpenAI 九月平台日:GPT-Live-1 正式登上 API,Agents API 同步開放 Beta 測試

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

兩樣東西在 2026 年 9 月 10 日離開了 Ope​nAI 的平台,而比較安靜的那一樣,影響範圍反而更大。GPT-Live-1——這款自 7 月 8 日起就在 ChatGPT 內部運作的全雙工語音模型——如今開發者已可呼叫,每分鐘語音收費 0.05 美元。與它一同登場、且在報導中被提及得少得多的,是 Agents API 進入公開測試:那套驅動 Codex 的同一套框架,如今以託管產品的形式對外開放,並配備受管理的沙箱。一個是更好的語音。另一個,則是 Ope​nAI 把過去打造代理時最困難的那一塊拿出來賣。

兩者都是從本文的一手來源讀取而來:Ope​nAI 的 Agents API 發布公告、其開發者社群中介紹 API 內 GPT-Live-1 的貼文,以及這兩者的開發者文件。凡數字來自 Ope​nAI 而非外部評估者,下方都會據此標示——而其中一個數字確實來自外部,這讓整體情況略有不同。

A two-column scoreboard titled 'September 10, 2026 — what Ope​nAI shipped'. The left column, labelled GPT-Live-1 in the API, reads 'What it is: full-duplex voice model', 'Access: Live Sessions API, one model ID', 'Price: $0.05 per voice minute', 'Status: generally available since Sept 10, 2026', 'Independent score: 69.8% on the Artificial Analysis Speech to Speech Index', 'Catch: delegates its thinking to a backend model'. The right column, labelled Agents API, reads 'What it is: hosted agent runtime', 'Access: public beta, Codex harness', 'Price: no API fee; sandbox time is billed', 'Status: public beta since Sept 10, 2026', 'Evidence: Ope​nAI documentation only, no independent evaluation', 'Catch: US-only data residency, no Zero Data Retention'. The footer reads 'GPT-Live-1 voice benchmarks Ope​nAI-reported and unreproduced; the AA index figure is independently run.' The OrcaRouter logo is composited in the bottom-right corner.

Artificial Analysis 今年開始發布語音對語音指數(Speech to Speech Index),而 GPT-Live-1 在其中佔有一列:69.8%,這是語音推理、代理能力、競技場偏好與任務成功率的加權平均。這使它在十一個受評模型中排名第七——落後於以 73.9% 位居其前的 GPT-Realtime-2.1(也就是它所取代的模型),也落後於 Gr​ok Voice Think Fast 2.0 的 79.0%。這份獨立排行榜與 OpenAI 自家的基準測試表並未說出同一個故事,而兩者都是真的。

已推出的項目,依其將改變你架構的順序排列

• 語音 — GPT-Live-1 已在 API 上線,名稱是 gpt-live-1,語音部分按每分鐘 $0.05 計費,以秒為單位計收,後端推理模型則依其自身費率另行計費。

• Agents — Agents API 已進入公開測試版。Ope​nAI 表示,API 本身不收取額外費用;您需為模型 token、工具,以及託管沙箱容器時間付費。

• 沙箱 — Ope​nAI 現在負責託管執行環境,沿用與 Codex 和 ChatGPT 相同的沙箱基礎架構,並可透過檔案、套件、技能與外掛程式進行設定。

• 環境 — 除了 OpenAI 自家的沙箱外,團隊還可以將代理指向自己的基礎設施,或是指向 beta 合作夥伴名單中的第三方沙箱供應商。

語音發布是一個模型故事。Agents API 則是一個平台故事,而平台故事正是那些會悄悄讓一個程式碼庫重新定向的故事。

Agents API:一個 POST 就能建立一個代理

核心呼叫是 POST /v1/agents/sessions,並以 Ope​nAI-Beta: agents=v1 標頭送出;其賣點在於,只要提供任務、模型、工具與環境,就能取回一個可運作的 agent。SDK 涵蓋 Python、TypeScript/JavaScript、Go、Java 與 Ruby。

讓它不只是個包裝殼的原因,在於 OpenAI 親自運行這套框架,而不是把它交給使用者自行部署。AgentKit 框架是開源的、可供檢視,但實際運行的那一份是 OpenAI 的——跨長時間工作階段的上下文壓縮、工具搜尋、程式化工具呼叫、MCP 支援、自訂函式、內建網頁搜尋,以及可設定並行度的子代理編排。具版本號的框架能力會與模型發布同步推出,而這正是有意思的承諾:鷹架與模型以相同的節奏推進。

對任何花了一季維護一個迴圈的人來說——重試邏輯、上下文裁剪、工具路由、總是洩漏狀態的子代理扇出——那才是真正的產品。不是模型呼叫。而是圍繞它、你不再需要撰寫的管線。

託管沙箱是附帶帳單的那一部分。

執行程式碼的代理需要有地方來執行,而 beta 版隨附了 OpenAI 自家的答案:一個託管沙箱,能執行程式碼、處理檔案並產出成品,還可透過套件、技能與外掛進行配置。已經擁有強化執行環境的開發者不會被迫採用它——自帶基礎設施與一組具名沙箱合作夥伴都在 beta 版中。

在你以此為基礎進行開發之前,有兩項營運注意事項值得先記錄下來。Beta 版中的資料落地僅限美國,且不支援 Zero Data Retention。對受監管的工作負載而言,這兩點決定了這是試辦計畫還是正式生產路徑,而這些細節往往到很晚才會被發現。

API 中的 GPT-Live-1:每分鐘固定計費才是真正的改變

語音模型本身並不新——它在 7 月 8 日取代了 ChatGPT 內的 Advanced Voice Mode——但商業形態才是新的。在 Realtime 產品線下,音訊是按 token 計量,這意味著預測一通電話需要對音訊消耗建立模型:一秒沉默要花多少 token,以及通話者插話打斷代理時會讓輸出長度改變多少。每語音分鐘固定 $0.05,把這一切簡化為乘法。連續保持通話一小時是 $3.00。每天一千通電話、平均四分鐘,大約是每天 $200。

工作階段從 Live Sessions 端點執行,使用單一模型 ID,且沒有可固定的日期版本快照。文件涵蓋 WebRTC、WebSockets 及 telephony/SIP 作為連線路徑,而發布的快速入門指南則建構 WebRTC 這條路徑。計費有兩個計量項目,其中只有一個是語音:每個委派的推理呼叫、工具叫用及網頁搜尋,都以後端模型的正常費率計費。

這套架構的核心是委派。GPT-Live-1 負責處理對話——每秒多次決定要繼續聆聽、暫停、插話,還是把工作交出去——並透過非同步邊界,把任何需要真正推理的工作交給獨立的後端,讓後端在口語對話持續進行的同時繼續運作。文件定義了兩種模式:Responses 委派,由 Ope​nAI 替你呼叫支援的 Responses 模型並提供對話脈絡;以及用戶端委派,由你自己的應用程式提供後端,並掌控執行、脈絡,以及哪些結果會傳到語音層。在公開的 Responses 範例中,那個後端是 GPT-5.6 Terra,被命名在一個 委派物件中,並附帶它自己的指示與工具。在七月的消費級產品發表會上,它還是 GPT-5.5;此後的社群文章則指向 GPT-6 Astra

A screenshot of Ope​nAI's developer documentation page 'Agents' under the API section, headed 'Choose a runtime, connect tools, and manage multi-step work', showing a routing row reading 'Run an agent with the Codex harness managed by Ope​nAI — Agents API', and a comparison table with columns Agents API, Agents SDK and Responses API whose rows read 'Where the agent runs: Ope​nAI runs a managed Codex harness', 'State between tasks: saved session configuration, turns, and items' and 'Execution environment: Ope​nAI hosted sandbox, self-hosted sandbox, or no sandbox'.

語音層的每一個頭條數字都出自 OpenAI 自家,而且在撰寫本文時,未經任何人獨立重現:在 Full Duplex Bench v1.5 互動性上達 80.1%,相較 GPT-Realtime-2.1 的 45.4%;輪替延遲 0.798 秒,對比 1.41 秒;工具呼叫成功率 87%;以及在銀行語音客服評測中 32% 的通過率,對比它所取代的模型的 12.4%。最後這一對才是最誠實的——大幅進步,但仍是個在受監管工作流程中約有三分之二失敗的系統。第三方客戶實證確實存在,但單薄且帶有自身利益:Yelp 的電話訂位、EliseAI,以及學習平台 Speak 回報中斷次數比其先前的回合制堆疊少了近 80%。

獨立評測的結果就沒那麼好看了,而且值得放在上面那份清單的旁邊,而不是置於其下。在 Artificial Analysis Speech to Speech Index 上——一個綜合了語音推理、代理式表現、競技場偏好與任務成功率的單一分數——GPT-Live-1 落在 69.8%,低於 GPT-Realtime-2.1 的 73.9%,更低於 Gr​ok Voice Think Fast 2.0 的 79.0%。把兩者放在一起看,這款產品的輪廓就清楚了:Ope​nAI 打造出市面上最出色的對話機制,卻沒有做出最出色的語音代理,因為推理被交給了一個該指數另行評分的模型。

A screenshot of the Artificial Analysis Speech to Speech Index chart, updated September 2026, ranking eleven speech models by a weighted average of speech reasoning, agentic performance, arena preference and task success rate. Bars run left to right: Grok Voice Think Fast 2.0 at 79.0%, GPT-Realtime-2.1 at 73.9%, GPT-Realtime-2 at 73.6%, Grok Voice Think Fast at 72.3%, Gemini 3.1 Flash Live at 71.5%, GPT-Live-1 mini at 70.3%, GPT-Live-1 at 69.8%, Qwen-Audio-Omni at 66.8%, RealTime Omni at 64.2%, Qwen 3.x Omni at 63.9% and Gemini 2.5 Flash at 52.6%. Companion charts show time to first audio, where GPT-Live-1 sits mid-pack at 0.78 seconds, and cost per hour of input audio, where GPT-Live-1 is $4.42 against GPT-Realtime-2.1 at $10.75.

那兩則公告其實是同一則公告

合在一起讀,這些發布從兩個方向描述了同一場重組。Agents API 把迴圈、沙箱和情境管理移進一個託管產品。GPT-Live-1 則把對話介面移進一個輕薄前端,讓它把思考委派到別處。在兩者中,模型不再是你繞著它打造的東西,而是你選用的一個元件——而且在兩者中,這項選擇是一行設定,而不是一項架構承諾。

那正是路由層所處的那道接縫。OrcaRouter 並不承載 gpt-live-1:Live Sessions 端點是 Op​enAI 獨有的,我們完全不經手這部分。委派的那一半則是另一回事。語音層把工作交出去的那個後端,說的是 Responses API,而那是標準的模型呼叫——Op​enAI 自己範例中所點名的模型 GPT-5.6 Terra,可透過 OrcaRouter 以 Op​enAI 的定價取得,每百萬輸入 token 2.00 美元、每百萬輸出 token 12.00 美元,並開放 Responses 端點。用戶端委派更進一步:它讓你的應用程式直接提供後端,這意味著語音背後的模型可以是任何你能控制的端點。Agents API 的模型欄位也是如此:框架是 Op​enAI 的,但裡面的模型是你保留的選擇,而來自十一家上游供應商、約 190 個模型,就在 一把金鑰、以供應商定價之後,上頭不加任何加成。

具體來說,由此可推得三件事。只要改一行,就能在實際流量上對後端進行 A/B 測試,這正是你在把電話線交給某個便宜推理器之前,確認它是否夠好的方法。容錯移轉可以置於委派模型之下,這樣一來,上游某個糟糕的午後就不會連帶讓整段對話掛掉。而透過路由 DSL,一次呼叫就能讓任務跑在多個後端上,或者用模型融合由一組模型同時作答——當代理的輸出必須被信任、而不只是被生成時,這立刻就派上用場。

兩個發行版本中都沒有的內容是什麼?

• GPT-Live-1 不支援圖像或影片輸入——較舊 ChatGPT 模式所具備的多模態語音介面仍未獲處理。

• 語音層不提供結構化輸出,因此經過結構描述驗證的工具引數必須在後端模型中強制執行。

• 免費方案無法使用 GPT-Live-1,且速率限制以並行工作階段為單位——第 1 層為 25,到第 5 層提升至 500。

• 代理 API 測試版不提供零資料保留,且資料不得駐留於美國境外。

• 不得獨立重現任何 {{1}}GPT-Live-1{{/1}} 基準數據。

OpenAI 在 9 月 10 日下的賭注是:開發者想要分開購買外殼框架、分開挑選大腦。這前半部分如今已成了一項明確的支出項目。後半部分,則是未來十二個月競爭壓力將落腳之處——因為一個可替換模型插槽的代管式框架,其好壞取決於你能放進去的模型,而目前這正是整個技術堆疊中 OpenAI 無法獨自掌控的一環。

委派的那一半則是另一回事——語音層把工作交出去的後端,只是一次普通的模型呼叫,而 GPT-5.6 Terra可透過 OrcaRouter、以 Ope​nAI 的定價取得,並已開放 Responses 端點。