
GPT-Live-1 vs Grok Voice Think Fast 2.0:兩款語音 API 朝相反的價格方向發展
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 每百萬 tokens
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
這場對決中最有用的事實是一個方向,而不是一個數字。當 xAI 在 2026 年 7 月下旬推出 Grok Voice Think Fast 2.0 時,它把每分鐘音訊費率調高了 60%,從 Think Fast 1.0 所收取的 $0.05 提高到 $0.08。六週後,也就是 2026 年 9 月 10 日,OpenAI 將 GPT-Live-1 推上開發者 API,價格正好是 xAI 才剛放棄的價位。這造就了一個罕見局面:兩個領先的全雙工語音 API 可以直接比價,而且較新的進場者反而是較便宜的那一個——而較舊、較貴的模型,才是有第三方基準測試分數撐腰的那一個。
帳本,在任何基準測試之前
這兩者都是專為電話型態工作負載打造的語音對語音模型:與顧客的即時對話、一次打斷、一次工具呼叫,以及以分鐘計量的帳單。除此之外,它們很快就分道揚鑣。
• 每分鐘音訊價格 — GPT-Live-1 $0.05 對比 Grok Voice Think Fast 2.0 $0.08
• 計費單位 — GPT-Live-1 以秒計費,不會向上取整到下一個整分鐘;Grok Voice Think Fast 2.0 以每分鐘音訊計價,換算下來約為每小時 $4.80
• 發布 — GPT-Live-1 於 2026 年 7 月 8 日在 ChatGPT 中推出,並於 2026 年 9 月 10 日在 API 上線;Grok Voice Think Fast 2.0 於 2026 年 7 月 29–30 日左右發布,距 Think Fast 1.0 約三個月
• 端點 — GPT-Live-1 僅限 Live Sessions,位於 v1/live/sessions,透過 WebRTC;Grok Voice Think Fast 2.0 在 xAI 的 Speech-to-Speech API 上,同時透過 WebSocket 與 WebRTC 運行
• 工具介面 — GPT-Live-1 透過 Responses API 委派給後端推理模型;Grok Voice Think Fast 2.0 則在工作階段內提供網頁搜尋、X 搜尋、檔案搜尋、MCP 伺服器與用戶端函式
• 語音可攜性 — GPT-Live-1 採用 OpenAI 重新錄製的十二種語音組合;Grok Voice Think Fast 2.0 支援內建與自訂語音
WebSocket 這條路線比表面上看起來更小,但重要性卻遠超它應得的程度。很大一部分的電信基礎設施——也就是大多數 CPaaS 產品內部的媒體串流管線——用的是 WebSocket,而不是 WebRTC。Grok Voice Think Fast 2.0 在該基礎設施所在之處與之接軌;GPT-Live-1 則不然,而要從一條僅有 WebSocket 的通話路徑走到 WebRTC,是一項實實在在的工程,而不是一個設定開關。

基準的不對稱才是真正的重點
這裡正是比較不再難分高下的地方,也是大多數報導把它弄反的地方:把這兩組數字當成同一種證據。
Grok Voice Think Fast 2.0 的主要分數來自 Artificial Analysis 的 Speech-to-Speech Quality Index,這是一項第三方量測,顯示該模型達到 82.9%,高於 1.0 版的 75.7%,並領先 GPT-Realtime-2.1 的 79.1% 和 Gemini 3.1 Flash 的 69.5%。xAI 也回報在 τ-voice Bench 的代理行為項目中拿下第一名,達 56.5%,領先 GPT-Realtime-2.1 的 45.7%。這些都是外部對 xAI 模型進行的量測結果。
GPT-Live-1 的頭條評分全來自 OpenAI 自家。該公司宣稱其全雙工互動率達 80.1%,而 GPT-Realtime-2.1 為 45.4%;輪替發話延遲從 1.4 秒縮短至 0.8 秒;工具呼叫準確率則從 60% 提升至 87%。這些數字全數由廠商自行提報,未經獨立實驗室重現,而且比較的對象是 OpenAI 自家的前一代模型,而非競爭對手的產品。
那不是一個可以據此否定這些數字的理由——發展方向與早期部署者所回報的內容一致——但這確實意味著,目前唯一可取得的跨廠商比較,是在獨立執行的測試中有利於 xAI 的模型;而 OpenAI 延遲優勢唯一可得的數字,則是 OpenAI 自己的。不要把 0.8 秒和 0.70 秒當作一場真正的較量;這兩個數字中,只有一個是由對結果沒有利害關係的人所測得的。

別名陷阱,以及為何價格上漲讓許多人措手不及
若不是 xAI 也透過別名推行,這 60% 的漲幅在大多數版本說明裡只會是個可忽略不計的捨入誤差。指向 grok-voice-latest 別名的應用程式,在 2026 年 8 月 5 日自動同時繼承了新模型與較高的費率,除非它們已明確鎖定 grok-voice-think-fast-1.0。這是個值得理解、而非抱怨的設計抉擇:浮動別名讓你免費獲得升級,卻也在不問一聲的情況下改變了你的單位經濟效益。
顯而易見的補救辦法比表面上看起來更弱。Grok Voice Think Fast 1.0——每分鐘 0.05 美元、於 2026 年 4 月 23 日推出的模型——如今在 xAI 自家的模型清單上已被標記為已棄用。把它釘選住能讓你免於自動升級,而且它換來的是時間,而不是一條永久更便宜的路徑,因為已棄用的模型前方某處終有退役之日。請依照你自己的時程規劃遷移,而不是跟著別名的時程走。
定價頁面本身就值得在你敲定數字之前仔細閱讀。xAI 的模型頁面明確列出各版本的費率——grok-voice-think-fast-2.0 為每分鐘音訊 $0.08、每小時 $4.80,外加每筆文字輸入 $0.004——而同一頁面上另一張獨立的 Voice API 卡片則標示代理價格「每分鐘 $0.05 起」,那是入門價,而非 2.0 模型實際計費的費率。如果你的容量規劃是依據行銷數字來做的,那大約短少了 60%。
OpenAI 的模型不會以相同形式出現這個問題,因為沒有可供浮動的目標。GPT-Live-1 恰好只有一個模型 ID:gpt-live-1,而它也是自身的預設快照——沒有帶日期的變體可供鎖定,因此也沒有任何別名能悄悄變更模型或價格。取捨在於,你也無法凍結一個已知良好的行為,並在新事物逐步穩定時繼續沿用它。
兩個模型都把推理層與語音層分開計費,而這正是頭條費率不再等於全部成本的地方。GPT-Live-1 委派的 Responses 呼叫,會依所設定的後端模型一般每 token 費率計費。xAI 則在每分鐘音訊費率之外,對語音工作階段中的每筆文字輸入加收 $0.004,再加上工具呼叫、在有需要時約每分鐘 $0.01 的配置電話號碼,以及電話與儲存費用。一個大多在聆聽、偶爾查一下資料的語音代理,實際費用會接近其頭條費率;但每一輪都呼叫工具的代理就不會,而且兩者偏離的方向不會相同,因為委派後端設計與工作階段內工具設計燒掉 token 的地方不一樣。
在我們這邊,每分鐘費率變動之所以值得密切關注,是因為 OrcaRouter 會將供應商的定價原樣傳遞,不加任何加價。當供應商調整已公布的費率時,我們這邊的數字會在同一天跟著變動,而不是等到下一個合約週期。

委派拆分讓你付出什麼工程代價
如果你是在這兩者之間以架構、而非以價格來做選擇,決定性的問題就在於接縫落在何處。
xAI 的模型把工具保留在工作階段內。這樣在推理上更單純——一個連線、一段對話、一個發生函式呼叫的地方——也意味著模型可以在句子講到一半時決定自己需要搜尋,並在等待的同時繼續說話。
OpenAI 的模型把那些工作往外推。語音層負責讓對話持續進行,並透過 Responses API 把任務交給另一個獨立的推理模型,這意味著你的工具定義、你的檢索與你的商業邏輯,是存在於一般的文字模型整合之中,而不是在會話事件串流裡面。這代表更多可動零件,但也更具可攜性:被委派出去的那一半只是一般的 API 呼叫,你可以獨立於語音層之外替換它、定價,並進行故障轉移。
這件事之所以重要,只有一個原因。GPT-Live-1 和 Grok Voice Think Fast 2.0 都只由各自的廠商提供服務——兩者都是單一來源,而路由器在音訊那一半幫不上忙。路由器能做的,是整合你真正能選擇的那一半。GPT-5.6 Terra,也就是 OpenAI 自家委派範例中的後端,可透過 OrcaRouter 取得,每百萬個輸入詞元 $2.00、每百萬個輸出詞元 $12.00,並同時開放 /v1/chat/completions 與 /v1/responses,還可與同一把金鑰上的約 190 個其他模型並用。如果你的語音代理每一輪都會呼叫推理模型,那正是帶有路由槓桿的那一筆項目。
結論,依工作負載拆分
• 若限制在於每分鐘的價格、若你的通話路徑已經採用 WebRTC,或若你希望語音背後的推理大腦是可替換的文字模型,而非工作階段中固定不變的一部分,就選擇 GPT-Live-1。
• 如果你需要在投入之前,就先看到經獨立驗證的品質擺在檯面上;如果你的電話語音技術堆疊是原生 WebSocket;或者如果工作階段內工具——尤其是 X 搜尋——是產品的核心而非附帶功能,那就選 Grok Voice Think Fast 2.0。
• 如果你已經在使用 xAI,請留意別名。鎖定帶版本編號的模型 ID,是唯一能擋在你與下一次自動費率調整之間的屏障;而同樣的紀律,也值得套用在任何出現浮動別名的地方。
令人不安的結論是:比較便宜的模型,是那個背後沒有第三方驗證的模型;而文件記錄得比較完善的模型,則是才剛漲價 60% 的那個。如果你還處於開發初期,兩個整合方案都尚未定案,那麼風險最低的做法,就是同時對兩者做原型驗證——音訊路徑不管走哪一邊都只有幾百行程式碼——再讓你自己轉錄稿的品質來決定,因為目前公開證據還無法斷定哪個更好。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
