
OpenAI 九月平台日:GPT-Live-1 正式登上 API,Agents API 同步開放 Beta 測試
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
兩樣東西在 2026 年 9 月 10 日離開了 OpenAI 的平台,而比較安靜的那一樣,影響範圍反而更大。GPT-Live-1——這款自 7 月 8 日起就在 ChatGPT 內部運作的全雙工語音模型——如今開發者已可呼叫,每分鐘語音收費 0.05 美元。與它一同登場、且在報導中被提及得少得多的,是 Agents API 進入公開測試:那套驅動 Codex 的同一套框架,如今以託管產品的形式對外開放,並配備受管理的沙箱。一個是更好的語音。另一個,則是 OpenAI 把過去打造代理時最困難的那一塊拿出來賣。
兩者都是從本文的一手來源讀取而來:OpenAI 的 Agents API 發布公告、其開發者社群中介紹 API 內 GPT-Live-1 的貼文,以及這兩者的開發者文件。凡數字來自 OpenAI 而非外部評估者,下方都會據此標示——而其中一個數字確實來自外部,這讓整體情況略有不同。

Artificial Analysis 今年開始發布語音對語音指數(Speech to Speech Index),而 GPT-Live-1 在其中佔有一列:69.8%,這是語音推理、代理能力、競技場偏好與任務成功率的加權平均。這使它在十一個受評模型中排名第七——落後於以 73.9% 位居其前的 GPT-Realtime-2.1(也就是它所取代的模型),也落後於 Grok Voice Think Fast 2.0 的 79.0%。這份獨立排行榜與 OpenAI 自家的基準測試表並未說出同一個故事,而兩者都是真的。
已推出的項目,依其將改變你架構的順序排列
• 語音 — GPT-Live-1 已在 API 上線,名稱是 gpt-live-1,語音部分按每分鐘 $0.05 計費,以秒為單位計收,後端推理模型則依其自身費率另行計費。
• Agents — Agents API 已進入公開測試版。OpenAI 表示,API 本身不收取額外費用;您需為模型 token、工具,以及託管沙箱容器時間付費。
• 沙箱 — OpenAI 現在負責託管執行環境,沿用與 Codex 和 ChatGPT 相同的沙箱基礎架構,並可透過檔案、套件、技能與外掛程式進行設定。
• 環境 — 除了 OpenAI 自家的沙箱外,團隊還可以將代理指向自己的基礎設施,或是指向 beta 合作夥伴名單中的第三方沙箱供應商。
語音發布是一個模型故事。Agents API 則是一個平台故事,而平台故事正是那些會悄悄讓一個程式碼庫重新定向的故事。
Agents API:一個 POST 就能建立一個代理
核心呼叫是 POST /v1/agents/sessions,並以 OpenAI-Beta: agents=v1 標頭送出;其賣點在於,只要提供任務、模型、工具與環境,就能取回一個可運作的 agent。SDK 涵蓋 Python、TypeScript/JavaScript、Go、Java 與 Ruby。
讓它不只是個包裝殼的原因,在於 OpenAI 親自運行這套框架,而不是把它交給使用者自行部署。AgentKit 框架是開源的、可供檢視,但實際運行的那一份是 OpenAI 的——跨長時間工作階段的上下文壓縮、工具搜尋、程式化工具呼叫、MCP 支援、自訂函式、內建網頁搜尋,以及可設定並行度的子代理編排。具版本號的框架能力會與模型發布同步推出,而這正是有意思的承諾:鷹架與模型以相同的節奏推進。
對任何花了一季維護一個迴圈的人來說——重試邏輯、上下文裁剪、工具路由、總是洩漏狀態的子代理扇出——那才是真正的產品。不是模型呼叫。而是圍繞它、你不再需要撰寫的管線。
託管沙箱是附帶帳單的那一部分。
執行程式碼的代理需要有地方來執行,而 beta 版隨附了 OpenAI 自家的答案:一個託管沙箱,能執行程式碼、處理檔案並產出成品,還可透過套件、技能與外掛進行配置。已經擁有強化執行環境的開發者不會被迫採用它——自帶基礎設施與一組具名沙箱合作夥伴都在 beta 版中。
在你以此為基礎進行開發之前,有兩項營運注意事項值得先記錄下來。Beta 版中的資料落地僅限美國,且不支援 Zero Data Retention。對受監管的工作負載而言,這兩點決定了這是試辦計畫還是正式生產路徑,而這些細節往往到很晚才會被發現。
API 中的 GPT-Live-1:每分鐘固定計費才是真正的改變
語音模型本身並不新——它在 7 月 8 日取代了 ChatGPT 內的 Advanced Voice Mode——但商業形態才是新的。在 Realtime 產品線下,音訊是按 token 計量,這意味著預測一通電話需要對音訊消耗建立模型:一秒沉默要花多少 token,以及通話者插話打斷代理時會讓輸出長度改變多少。每語音分鐘固定 $0.05,把這一切簡化為乘法。連續保持通話一小時是 $3.00。每天一千通電話、平均四分鐘,大約是每天 $200。
工作階段從 Live Sessions 端點執行,使用單一模型 ID,且沒有可固定的日期版本快照。文件涵蓋 WebRTC、WebSockets 及 telephony/SIP 作為連線路徑,而發布的快速入門指南則建構 WebRTC 這條路徑。計費有兩個計量項目,其中只有一個是語音:每個委派的推理呼叫、工具叫用及網頁搜尋,都以後端模型的正常費率計費。
這套架構的核心是委派。GPT-Live-1 負責處理對話——每秒多次決定要繼續聆聽、暫停、插話,還是把工作交出去——並透過非同步邊界,把任何需要真正推理的工作交給獨立的後端,讓後端在口語對話持續進行的同時繼續運作。文件定義了兩種模式:Responses 委派,由 OpenAI 替你呼叫支援的 Responses 模型並提供對話脈絡;以及用戶端委派,由你自己的應用程式提供後端,並掌控執行、脈絡,以及哪些結果會傳到語音層。在公開的 Responses 範例中,那個後端是 GPT-5.6 Terra,被命名在一個 委派物件中,並附帶它自己的指示與工具。在七月的消費級產品發表會上,它還是 GPT-5.5;此後的社群文章則指向 GPT-6 Astra。

語音層的每一個頭條數字都出自 OpenAI 自家,而且在撰寫本文時,未經任何人獨立重現:在 Full Duplex Bench v1.5 互動性上達 80.1%,相較 GPT-Realtime-2.1 的 45.4%;輪替延遲 0.798 秒,對比 1.41 秒;工具呼叫成功率 87%;以及在銀行語音客服評測中 32% 的通過率,對比它所取代的模型的 12.4%。最後這一對才是最誠實的——大幅進步,但仍是個在受監管工作流程中約有三分之二失敗的系統。第三方客戶實證確實存在,但單薄且帶有自身利益:Yelp 的電話訂位、EliseAI,以及學習平台 Speak 回報中斷次數比其先前的回合制堆疊少了近 80%。
獨立評測的結果就沒那麼好看了,而且值得放在上面那份清單的旁邊,而不是置於其下。在 Artificial Analysis Speech to Speech Index 上——一個綜合了語音推理、代理式表現、競技場偏好與任務成功率的單一分數——GPT-Live-1 落在 69.8%,低於 GPT-Realtime-2.1 的 73.9%,更低於 Grok Voice Think Fast 2.0 的 79.0%。把兩者放在一起看,這款產品的輪廓就清楚了:OpenAI 打造出市面上最出色的對話機制,卻沒有做出最出色的語音代理,因為推理被交給了一個該指數另行評分的模型。

那兩則公告其實是同一則公告
合在一起讀,這些發布從兩個方向描述了同一場重組。Agents API 把迴圈、沙箱和情境管理移進一個託管產品。GPT-Live-1 則把對話介面移進一個輕薄前端,讓它把思考委派到別處。在兩者中,模型不再是你繞著它打造的東西,而是你選用的一個元件——而且在兩者中,這項選擇是一行設定,而不是一項架構承諾。
那正是路由層所處的那道接縫。OrcaRouter 並不承載 gpt-live-1:Live Sessions 端點是 OpenAI 獨有的,我們完全不經手這部分。委派的那一半則是另一回事。語音層把工作交出去的那個後端,說的是 Responses API,而那是標準的模型呼叫——OpenAI 自己範例中所點名的模型 GPT-5.6 Terra,可透過 OrcaRouter 以 OpenAI 的定價取得,每百萬輸入 token 2.00 美元、每百萬輸出 token 12.00 美元,並開放 Responses 端點。用戶端委派更進一步:它讓你的應用程式直接提供後端,這意味著語音背後的模型可以是任何你能控制的端點。Agents API 的模型欄位也是如此:框架是 OpenAI 的,但裡面的模型是你保留的選擇,而來自十一家上游供應商、約 190 個模型,就在 一把金鑰、以供應商定價之後,上頭不加任何加成。
具體來說,由此可推得三件事。只要改一行,就能在實際流量上對後端進行 A/B 測試,這正是你在把電話線交給某個便宜推理器之前,確認它是否夠好的方法。容錯移轉可以置於委派模型之下,這樣一來,上游某個糟糕的午後就不會連帶讓整段對話掛掉。而透過路由 DSL,一次呼叫就能讓任務跑在多個後端上,或者用模型融合由一組模型同時作答——當代理的輸出必須被信任、而不只是被生成時,這立刻就派上用場。
兩個發行版本中都沒有的內容是什麼?
• GPT-Live-1 不支援圖像或影片輸入——較舊 ChatGPT 模式所具備的多模態語音介面仍未獲處理。
• 語音層不提供結構化輸出,因此經過結構描述驗證的工具引數必須在後端模型中強制執行。
• 免費方案無法使用 GPT-Live-1,且速率限制以並行工作階段為單位——第 1 層為 25,到第 5 層提升至 500。
• 代理 API 測試版不提供零資料保留,且資料不得駐留於美國境外。
• 不得獨立重現任何 {{1}}GPT-Live-1{{/1}} 基準數據。
OpenAI 在 9 月 10 日下的賭注是:開發者想要分開購買外殼框架、分開挑選大腦。這前半部分如今已成了一項明確的支出項目。後半部分,則是未來十二個月競爭壓力將落腳之處——因為一個可替換模型插槽的代管式框架,其好壞取決於你能放進去的模型,而目前這正是整個技術堆疊中 OpenAI 無法獨自掌控的一環。
委派的那一半則是另一回事——語音層把工作交出去的後端,只是一次普通的模型呼叫,而 GPT-5.6 Terra可透過 OrcaRouter、以 OpenAI 的定價取得,並已開放 Responses 端點。
