
GPT-Live-1 登陸 API:每分鐘 0.05 美元的全雙工語音,但無法從 GPT-Realtime-2.1 無痛轉移
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
GPT-Live-1 已於 9 月 10 日納入 API,而真正將重塑預算的數字並非某個基準測試——而是計費單位。OpenAI 的全雙工語音模型現在以每分鐘語音 0.05 美元的固定費率計費,按秒收費;相較之下,被拿來與之比較的模型 GPT-Realtime-2.1,則是以音訊詞元計量,每百萬輸入 32 美元、每百萬輸出 64 美元。這個模型本身並不新:GPT-Live-1 於 2026 年 7 月 8 日在 ChatGPT 內上線,作為進階語音模式的替代品。新的是開發者終於可以呼叫它——而且呼叫它的方式,與大多數團隊已有的 Realtime 整合幾乎毫無相似之處。OpenAI 自家的文件將語音層與一個獨立的推理後端配對,而在已發布的 WebRTC 範例中,那個後端是 GPT-5.6 Terra。
9 月 10 日發布了什麼,而什麼沒有發布?
此 API 介面刻意設計得相當精簡。只有一個模型 ID:gpt-live-1,它同時也是自身的預設快照——沒有可固定使用的日期版本。也只有一個端點,即位於 v1/live/sessions 的即時工作階段端點。在 OpenAIOpenAI 平台上,此模型會停用其他所有功能:沒有 Chat Completions、沒有 Responses、沒有 Realtime(包括翻譯與轉錄變體)、沒有 Assistants、沒有 Batch、沒有微調、沒有嵌入、沒有圖像或影片生成、沒有音訊語音或轉錄端點、沒有審核功能。
輸入與輸出為音訊與文字。支援串流與函式呼叫;不支援結構化輸出、微調與預測輸出。明確不支援影像與視訊輸入——因此 OpenAIOpenAI 所預告的「語音搭配視訊」功能並不屬於本次發布內容。免費方案完全無法呼叫它,而速率限制是以並行工作階段而非每分鐘請求數來計算:Tier 1 為 25,並在 Tier 2 至 Tier 5 間依序提升至 50、200、300 與 500。

那種併發框架是第一個線索,顯示這不是外掛程式替代品。以同時進行的即時對話來計量的速率限制告訴你,OpenAIOpenAI 預期規模單位是:一條電話線,而不是一個請求。
定價變更才是那個較安靜、卻更重大的消息。
每分鐘固定計費是一項真正的轉變。在 Token 計量制下,你必須先模擬音訊消耗——一秒的靜音要耗費多少 Token、來電者若不斷搶話蓋過代理會如何改變輸出長度——才能預測單一通話。以每分鐘 $0.05 計算,算術就簡化為乘法:
• 5 分鐘的支援通話 —— 0.25 美元的語音時間
• 10 分鐘的通話 — $0.50
• 每天 1,000 通電話平均 4 分鐘 — 每天 200 美元,每月約 6,000 美元
• 線路持續暢通一小時 — $3.00
有三個細節讓這一點更明確。首先,通話時長不會無條件進位到下一個整分鐘,因此 40 秒的通話費用約為 3.3 美分,而不是整整 5 美分。其次,工作階段初始化會先收取 15 秒的語音時長費用——但這筆費用會折抵後續的時長費用,而不是額外加收,因此短於 15 秒的通話仍會以 15 秒的價格計費。第三,語音只是帳單的一半。後端的推理模型、其工具呼叫,以及任何網頁搜尋,都會依該模型的正常費率另行計費,這表示即使你用的是「便宜的語音模型」,只要把委派指向前沿推理模型,並讓它在每一輪都進行搜尋,仍可能產生昂貴的通話費用。
那個兩公尺的結構,正是路由不再只是錦上添花的地方。在 OrcaRouter 上,GPT-Live-1 工作階段的後端那一半就只是另一次模型呼叫——大約 來自十一家上游供應商的 190 個模型,全部藏在單一金鑰之後,以供應商定價原價轉手、零加成,而且當你選用的後端出錯或逾時時會自動容錯移轉。你無法路由語音層本身;Live Sessions 端點是 OpenAIOpenAI 專屬的。但你絕對可以路由語音層所委派的一切,而那正是會隨著你的來電者思考得多用力而擴展的那一半。
僅限 WebRTC——為什麼你的 Realtime 程式碼無法移植
這是搬遷的實際成本,而大多數發布報導都略過了這點。GPT-Live-1 工作階段是透過 WebRTC 運作,而非許多現有 Realtime 整合所建構於其上的 WebSocket 傳輸。用 GPT-Live 模型 ID 去探查舊有的路徑,會回傳一個錯誤,直截了當地告訴你工作階段需要 WebRTC。
根據 OpenAIOpenAI 的 WebRTC 指南,握手流程如下:你的瀏覽器會開啟 RTCPeerConnection、附加麥克風音軌、開啟資料通道,並在發出 offer 前註冊監聽器、設定本機描述、等待 ICE 收集,然後將 offer 發佈到你的伺服器。你的伺服器接著呼叫POST /v1/live/sessions,並帶上工作階段設定與transport: { type: "webrtc", sdp: ... }。成功時會傳回 HTTP 201,並帶有session.id 與 transport.sdp,瀏覽器會將其套用為遠端描述。媒體會透過協商後的音軌傳輸;資料通道 — 標籤 oai-events — 會承載逐字稿、工作階段更新與委派工作。若要掛斷,你需傳送session.close,並持續讀取直到session.closed 抵達。
有兩個坑值得貼在螢幕上。HTTP 呼叫本身就會啟動 session,所以你不能同時在資料通道上傳送 session.start。而且你不該在那個通道上附加輸入音訊,或等待輸出音訊的 delta——把 audio.format 從設定中拿掉,交給 SDP 處理。伺服器範例把請求主體上限設為 64 KB,ICE 收集在 10 秒後逾時,session 最終化則在 15 秒後逾時。
這些都不難。全都是新程式碼。如果你的產品是回合制的即時代理,遷移到 GPT-Live-1 是傳輸層重寫加上委派重寫,而不是替換模型 ID——這值得以一個衝刺(sprint)而不是一個下午來編列預算。
這些基準測試,以及每一項分別是由誰跑的
以下每一個數字都是 OpenAIOpenAI 自己發布的,隨 API 發布一同公布,且在撰寫本文時未經任何人獨立重現。這項但書在這裡比平時更重要,因為這些差異大到足以讓人把它們引用為既定事實。

• 全雙工互動性 — GPT-Live-1 80.1%,相較 GPT-Realtime-2.1 的 45.4%
• 輪流發言延遲 — 0.8 秒 vs 1.4 秒
• 工具呼叫準確率 — 87% 對比 60%
• 銀行語音客服基準,通過率 — 32% 對 12.4%
把最後一行讀兩遍。32% 的通過率相較於 12.4% 是大幅進步,但仍意味著該系統在該評估中大約有三分之二的任務失敗。互動性與工具呼叫的躍升,才是真正描繪出一個截然不同產品的部分;銀行業的那個數字則誠實地反映了語音代理距離能在無人監督下處理受監管工作流程還有多遠。
客戶證據比基準表更單薄,卻指向同一個方向。Yelp 正在使用 GPT-Live-1 處理電話預訂,技術長 Alex Levy 被引述指出通話處理有所改善。語言學習平台 Speak 回報,相較於先前的回合制系統,打斷次數減少了近 80%——這是來自一家與結果有利害關係的公司的自報數據,卻仍是目前可取得最具體的部署數字。
語音層是前端;大腦由你選擇
這項架構上的賭注是委派,而這正是本次發布中,路由層能自然嵌入的部分。GPT-Live-1 並不負責深度思考。當呼叫方提出需要推理、檢索或工具的請求時,模型會將任務跨越非同步邊界交給一個獨立的後端;該後端在語音對話持續進行的同時繼續運作,待答案就緒後再把它折回對話之中。
這項設定相當明確,值得仔細閱讀文件中的範例。model: "gpt-live-1" 與指令並列,工作階段還帶有一個 delegation 物件,型別為 responses,其內部的 responses 區塊列出了後端模型、它自己的指令、它的工具——範例中使用了 web_search——以及一個 tool_choice。在 OpenAIOpenAI 所發布的 WebRTC 範例中,該後端模型是 GPT-5.6 Terra。

這才是這套設計真正的主張:只要換掉後端,語音體驗就能變得更聰明,無須重新訓練語音模型。這也意味著,委派後端具有語音層所沒有的可攜性。OrcaRouter 並不提供 gpt-live-1 —— Live Sessions 端點是 OpenAI 專屬的,而我們完全不路由這部分。但委派那一半採用的是 Responses API,而那一半完全交由你選擇。GPT-5.6 Terra 已在 OrcaRouter 上線,價格與 OpenAIOpenAI 的定價相同 —— 每百萬個輸入 token 2.00 美元、每百萬個輸出 token 12.00 美元,並開放 Responses 端點 —— 因此,OpenAIOpenAI 自家範例中的那個模型只差一次呼叫,無須再簽第二份合約或使用另一套 SDK。
實際上,這等於把後端選擇變成了設定。你可以用實際通話流量,把便宜的推理模型與前沿模型做 A/B 測試,只要改一行設定,再盯著每通電話的帳單;或是把委派模型放在自動容錯移轉之後,這樣上游出狀況的午後,不會連你的電話線也一起拖垮。你每分鐘付 $0.05 的語音層維持原樣;它委派出去的一切,都透過同一組金鑰、橫跨十一家上游供應商約 190 個模型來執行,以供應商定價計費、零加成。
還缺少什麼
• 沒有圖像或視訊輸入——靜態影像與螢幕分享並未包含在此版本中,因此,舊版 ChatGPT 模式仍保有的多模態語音介面仍未獲處理
• 不支援結構化輸出——如果你的代理需要經過結構描述驗證的工具引數,那麼該驗證必須存在於你的後端模型中,而不是語音層
• 無免費方案使用權,也無微調功能——費用與客製化都從付費方案層級開始
• 未對任何主要數字進行獨立評估——上述每一項數據皆由供應商自行執行。
• Tier 1 的並行上限為 25 個同時工作階段——對試點計畫來說很充裕,但對首日上線的客服中心來說則很吃緊
誰應該移動,誰應該等待
如果你是正在打造電話語音應用——訂位專線、預約服務、第一線支援——而且目前的技術堆疊是典型的 ASR→LLM→TTS 串接架構,現在就該行動。延遲與打斷處理正是那樣的管線所犧牲掉的東西,每分鐘價格的可預測性也高到足以放進試算表,而 OpenAIOpenAI 自家的文件現在更附上了一個 Twilio 形式的伺服器範例可供照抄。如果你已經採用 Realtime 模型,而且產品是真正具備對話性、而非回合制的,也同樣該現在就行動,因為打斷處理正是 GPT-Realtime-2.1 表現最差的部分。
如果你的整合是回合制且運作正常,那就先等等。傳輸層重寫是實打實的工作,該端點不支援其他方式,而且沒有能保留你現有 WebSocket 程式碼的遷移路徑。如果你的使用情境依賴結構化工具輸出或影片輸入,也請先等等,這裡兩者都付之闕如。
未來幾週值得關注的事:80.1% 互動性數據的首次獨立重現、$0.05 的費率是否為 introductory、較小的 GPT-Live-1 mini 是否會像在消費者端那樣進入 API,以及圖像和螢幕輸入是否會縮小差距。在外部的實驗室進行該評估之前,誠實的總結是:這是任何人向開發者發布過的最強大的語音模型,而該聲明的憑證是由銷售它的人所寫的。
