一張主視覺標題卡寫著「GPT-Live-1 vs Grok Voice Think Fast 2.0」,副標題為「兩種語音 API 朝相反的價格方向發展」,並有一行「每分鐘 $0.05 對上每分鐘 $0.08」,位於兩個面板上方:左側顯示一個標價牌,帶有向下箭頭並標示「$0.05」,右側顯示一個標價牌,帶有向上箭頭並標示「$0.08」及說明文字「+60%」,每個面板各有一條全雙工音訊波形條,角落則合成上 OrcaRouter 標誌。
Guides & Insights

GPT-Live-1 vs Grok Voice Think Fast 2.0:兩款語音 API 朝相反的價格方向發展

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

這場對決中最有用的事實是一個方向,而不是一個數字。當 xAI 在 2026 年 7 月下旬推出 Grok Voice Think Fast 2.0 時,它把每分鐘音訊費率調高了 60%,從 Think Fast 1.0 所收取的 $0.05 提高到 $0.08。六週後,也就是 2026 年 9 月 10 日,OpenAI 將 GPT-Live-1 推上開發者 API,價格正好是 xAI 才剛放棄的價位。這造就了一個罕見局面:兩個領先的全雙工語音 API 可以直接比價,而且較新的進場者反而是較便宜的那一個——而較舊、較貴的模型,才是有第三方基準測試分數撐腰的那一個。

帳本,在任何基準測試之前

這兩者都是專為電話型態工作負載打造的語音對語音模型:與顧客的即時對話、一次打斷、一次工具呼叫,以及以分鐘計量的帳單。除此之外,它們很快就分道揚鑣。

• 每分鐘音訊價格 — GPT-Live-1 $0.05 對比 Grok Voice Think Fast 2.0 $0.08

• 計費單位 — GPT-Live-1 以秒計費,不會向上取整到下一個整分鐘;Gr​ok Voice Think Fast 2.0 以每分鐘音訊計價,換算下來約為每小時 $4.80

• 發布 — GPT-Live-1 於 2026 年 7 月 8 日在 ChatGPT 中推出,並於 2026 年 9 月 10 日在 API 上線;Gr​ok Voice Think Fast 2.0 於 2026 年 7 月 29–30 日左右發布,距 Think Fast 1.0 約三個月

• 端點 — GPT-Live-1 僅限 Live Sessions,位於 v1/live/sessions,透過 WebRTC;Gr​ok Voice Think Fast 2.0 在 x​AI 的 Speech-to-Speech API 上,同時透過 WebSocket 與 WebRTC 運行

• 工具介面 — GPT-Live-1 透過 Responses API 委派給後端推理模型;Gr​ok Voice Think Fast 2.0 則在工作階段內提供網頁搜尋、X 搜尋、檔案搜尋、MCP 伺服器與用戶端函式

• 語音可攜性 — GPT-Live-1 採用 OpenAI 重新錄製的十二種語音組合;Grok Voice Think Fast 2.0 支援內建與自訂語音

WebSocket 這條路線比表面上看起來更小,但重要性卻遠超它應得的程度。很大一部分的電信基礎設施——也就是大多數 CPaaS 產品內部的媒體串流管線——用的是 WebSocket,而不是 WebRTC。Gr​ok Voice Think Fast 2.0 在該基礎設施所在之處與之接軌;GPT-Live-1 則不然,而要從一條僅有 WebSocket 的通話路徑走到 WebRTC,是一項實實在在的工程,而不是一個設定開關。

A two-column comparison scoreboard titled 'GPT-Live-1 vs Grok Voice Think Fast 2.0 - the scoreboard'. The GPT-Live-1 column lists Price $0.05 / minute; Price direction new entrant at $0.05; Transport WebRTC only; Quality evidence vendor-run, unreproduced; Tool calling delegated to backend model; Model ID single fixed ID. The Grok Voice Think Fast 2.0 column lists Price $0.08 / minute; Price direction raised 60% from $0.05; Transport WebSocket + WebRTC; Quality evidence 82.9 third-party speech index; Tool calling in-session search, MCP, functions; Model ID versioned ID plus floating alias. A footer reads 'Grok quality figure is a third-party index; GPT-Live-1 benchmarks are OpenAI's own and unreproduced.'

基準的不對稱才是真正的重點

這裡正是比較不再難分高下的地方,也是大多數報導把它弄反的地方:把這兩組數字當成同一種證據。

Gr​ok Voice Think Fast 2.0 的主要分數來自 Artificial Analysis 的 Speech-to-Speech Quality Index,這是一項第三方量測,顯示該模型達到 82.9%,高於 1.0 版的 75.7%,並領先 GPT-Realtime-2.1 的 79.1% 和 Gemini 3.1 Flash 的 69.5%。x​AI 也回報在 τ-voice Bench 的代理行為項目中拿下第一名,達 56.5%,領先 GPT-Realtime-2.1 的 45.7%。這些都是外部對 x​AI 模型進行的量測結果。

GPT-Live-1 的頭條評分全來自 OpenAI 自家。該公司宣稱其全雙工互動率達 80.1%,而 GPT-Realtime-2.1 為 45.4%;輪替發話延遲從 1.4 秒縮短至 0.8 秒;工具呼叫準確率則從 60% 提升至 87%。這些數字全數由廠商自行提報,未經獨立實驗室重現,而且比較的對象是 OpenAI 自家的前一代模型,而非競爭對手的產品。

那不是一個可以據此否定這些數字的理由——發展方向與早期部署者所回報的內容一致——但這確實意味著,目前唯一可取得的跨廠商比較,是在獨立執行的測試中有利於 xAI 的模型;而 OpenAI 延遲優勢唯一可得的數字,則是 OpenAI 自己的。不要把 0.8 秒和 0.70 秒當作一場真正的較量;這兩個數字中,只有一個是由對結果沒有利害關係的人所測得的。

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

別名陷阱,以及為何價格上漲讓許多人措手不及

若不是 x​AI 也透過別名推行,這 60% 的漲幅在大多數版本說明裡只會是個可忽略不計的捨入誤差。指向 grok-voice-latest 別名的應用程式,在 2026 年 8 月 5 日自動同時繼承了新模型與較高的費率,除非它們已明確鎖定 grok-voice-think-fast-1.0。這是個值得理解、而非抱怨的設計抉擇:浮動別名讓你免費獲得升級,卻也在不問一聲的情況下改變了你的單位經濟效益。

顯而易見的補救辦法比表面上看起來更弱。Grok Voice Think Fast 1.0——每分鐘 0.05 美元、於 2026 年 4 月 23 日推出的模型——如今在 xAI 自家的模型清單上已被標記為已棄用。把它釘選住能讓你免於自動升級,而且它換來的是時間,而不是一條永久更便宜的路徑,因為已棄用的模型前方某處終有退役之日。請依照你自己的時程規劃遷移,而不是跟著別名的時程走。

定價頁面本身就值得在你敲定數字之前仔細閱讀。xAI 的模型頁面明確列出各版本的費率——grok-voice-think-fast-2.0 為每分鐘音訊 $0.08、每小時 $4.80,外加每筆文字輸入 $0.004——而同一頁面上另一張獨立的 Voice API 卡片則標示代理價格「每分鐘 $0.05 起」,那是入門價,而非 2.0 模型實際計費的費率。如果你的容量規劃是依據行銷數字來做的,那大約短少了 60%。

Ope​nAI 的模型不會以相同形式出現這個問題,因為沒有可供浮動的目標。GPT-Live-1 恰好只有一個模型 ID:gpt-live-1,而它也是自身的預設快照——沒有帶日期的變體可供鎖定,因此也沒有任何別名能悄悄變更模型或價格。取捨在於,你也無法凍結一個已知良好的行為,並在新事物逐步穩定時繼續沿用它。

兩個模型都把推理層與語音層分開計費,而這正是頭條費率不再等於全部成本的地方。GPT-Live-1 委派的 Responses 呼叫,會依所設定的後端模型一般每 token 費率計費。xAI 則在每分鐘音訊費率之外,對語音工作階段中的每筆文字輸入加收 $0.004,再加上工具呼叫、在有需要時約每分鐘 $0.01 的配置電話號碼,以及電話與儲存費用。一個大多在聆聽、偶爾查一下資料的語音代理,實際費用會接近其頭條費率;但每一輪都呼叫工具的代理就不會,而且兩者偏離的方向不會相同,因為委派後端設計與工作階段內工具設計燒掉 token 的地方不一樣。

在我們這邊,每分鐘費率變動之所以值得密切關注,是因為 OrcaRouter 會將供應商的定價原樣傳遞,不加任何加價。當供應商調整已公布的費率時,我們這邊的數字會在同一天跟著變動,而不是等到下一個合約週期。

A screenshot of xAI's developer Models documentation page, showing a Voice API card with an agent price of 'Starting at $0.05 / min' alongside Text to Speech at $15.00 / 1M chars and Speech to Text at $0.10 / hour batch and $0.20 / hour streaming, plus a Grok 4.6 card listing a 500k-token context with $2.00 / 1M input and $6.00 / 1M output tokens, and an Imagine API card for image and video generation.

委派拆分讓你付出什麼工程代價

如果你是在這兩者之間以架構、而非以價格來做選擇,決定性的問題就在於接縫落在何處。

x​AI 的模型把工具保留在工作階段內。這樣在推理上更單純——一個連線、一段對話、一個發生函式呼叫的地方——也意味著模型可以在句子講到一半時決定自己需要搜尋,並在等待的同時繼續說話。

OpenAI 的模型把那些工作往外推。語音層負責讓對話持續進行,並透過 Responses API 把任務交給另一個獨立的推理模型,這意味著你的工具定義、你的檢索與你的商業邏輯,是存在於一般的文字模型整合之中,而不是在會話事件串流裡面。這代表更多可動零件,但也更具可攜性:被委派出去的那一半只是一般的 API 呼叫,你可以獨立於語音層之外替換它、定價,並進行故障轉移。

這件事之所以重要,只有一個原因。GPT-Live-1 和 Grok Voice Think Fast 2.0 都只由各自的廠商提供服務——兩者都是單一來源,而路由器在音訊那一半幫不上忙。路由器能做的,是整合你真正能選擇的那一半。GPT-5.6 Terra,也就是 OpenAI 自家委派範例中的後端,可透過 OrcaRouter 取得,每百萬個輸入詞元 $2.00、每百萬個輸出詞元 $12.00,並同時開放 /v1/chat/completions 與 /v1/responses,還可與同一把金鑰上的約 190 個其他模型並用。如果你的語音代理每一輪都會呼叫推理模型,那正是帶有路由槓桿的那一筆項目。

結論,依工作負載拆分

• 若限制在於每分鐘的價格、若你的通話路徑已經採用 WebRTC,或若你希望語音背後的推理大腦是可替換的文字模型,而非工作階段中固定不變的一部分,就選擇 GPT-Live-1。

• 如果你需要在投入之前,就先看到經獨立驗證的品質擺在檯面上;如果你的電話語音技術堆疊是原生 WebSocket;或者如果工作階段內工具——尤其是 X 搜尋——是產品的核心而非附帶功能,那就選 Gr​ok Voice Think Fast 2.0。

• 如果你已經在使用 x​AI,請留意別名。鎖定帶版本編號的模型 ID,是唯一能擋在你與下一次自動費率調整之間的屏障;而同樣的紀律,也值得套用在任何出現浮動別名的地方。

令人不安的結論是:比較便宜的模型,是那個背後沒有第三方驗證的模型;而文件記錄得比較完善的模型,則是才剛漲價 60% 的那個。如果你還處於開發初期,兩個整合方案都尚未定案,那麼風險最低的做法,就是同時對兩者做原型驗證——音訊路徑不管走哪一邊都只有幾百行程式碼——再讓你自己轉錄稿的品質來決定,因為目前公開證據還無法斷定哪個更好。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新