
GPT-Live-1 vs Inworld Realtime TTS-2:語音的價格戰,聆聽的溢價
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
Inworld Realtime TTS-2 正式全面推出,帶來了語音市場一直欠缺的一樣東西:公開的價目表。旗艦模型隨需計價為每百萬字元 25 美元,速度更快的同系列模型 Inworld Realtime TTS-2 Flash 則是 15 美元,兩者都隨用量級距調降至 12.50 美元與 7 美元。它在 Artificial Analysis 語音競技場以 Elo 1,244 位居第二,這使得旗艦模型價格約為目前競技場領先者的一半,也是購買前五名語音最便宜的方式之一。GPT-Live-1 是這項比較中的另一款模型,主張恰好相反——每分鐘語音 0.05 美元,不涉及字元計費,而且無法只買語音,而不一併購買隨附的聆聽、輪流發言與打斷處理功能。
比較它們的有趣之處在於,價格差距看似極為懸殊,但隨後大多煙消雲散。合成正處於價格戰之中,對話則不然。
Inworld 實際推出了什麼
TTS-2 系列最初是 2026 年 5 月的一項研究預覽,並提出了一項明確主張:這是一款並非獨立生成語音的模型。它會將對話先前的輪次作為音訊輸入,推論語氣與節奏,並據此調整回應方式。這樣的定位——對話感知,而非更純淨的音訊——正是它與截至 2025 年主導文字轉語音的旁白引擎不同之處。
正式推出讓預覽版變成了一個產品系列,並附上價目表。Flash 是主打吞吐量的選擇,Inworld 宣稱其伺服器端首位元組時間在第 90 百分位約為 20 毫秒,而旗艦產品為 100 毫秒,且首次音訊的中位數低於 200 毫秒。這些都是 Inworld 自家文件中的廠商數據;目前流通的唯一一項第三方測量來自 Coval,其測得 Flash 約為 25 毫秒,旗艦產品則落在數百毫秒的低段。兩者都尚未經過端到端的獨立稽核。
最值得注意的功能與延遲無關。Inworld 新增了逐字模式,讓訂單編號、確認代碼、地址和序號會逐字元讀回,而不是被正規化成聽起來自然但錯誤的內容。對於一個剛完成預訂的語音代理來說,這單一標籤就是能否正常運作的產品與一個會被升級轉交給真人的示範之間的差別。

逐維度地
• 類型 — GPT-Live-1:在單一模型中實現全雙工語音對語音,對比 Inworld Realtime TTS-2:一款文字轉語音模型,雙工功能可另行透過 Inworld 的 Realtime API 取得
• 計價單位 — GPT-Live-1:每語音分鐘 $0.05,以秒計費,推理後端另行計量;對比 Inworld Realtime TTS-2:隨需每百萬字元 $25,Creator 方案為 $20,最高階方案為 $12.50,Flash 則為 $15、$10 和 $7
• 獨立品質 — GPT-Live-1:在 Speech to Speech Index 上為 70.3%,在十四個中並列第六,對比 Inworld Realtime TTS-2:來自 1,091 個樣本的 Elo 1,244,並在 Artificial Analysis Provider Voice arena 中排名第二,其中 Flash 以來自 1,626 個樣本的 Elo 1,211 排名第六
• 中斷 — GPT-Live-1:原生支援,每秒在模型內部多次決定 vs Inworld Realtime TTS-2:並非 TTS 模型本身的特性;Inworld 的 Realtime API 支援插話,中斷延遲約為 100 毫秒,透過單一 socket 使用 OpenAI Realtime 協定
• 延遲 — GPT-Live-1:在 OpenAI 自家測試中,輪替發言延遲為 0.798 秒,未公布首次音訊輸出時間;相較之下,Inworld Realtime TTS-2:伺服器端第 90 百分位數為 100 毫秒,Flash 為 20 毫秒,且在完整的 Realtime API 流程中,首個音訊區塊的中位數低於一秒
• 語言——GPT-Live-1:主要語言支援良好,但在其他語言上表現不均;相較之下,Inworld Realtime TTS-2:支援 200 多個地區設定,其中 15 個達到 Tier 1 品質,另有 79 個達到 Tier 2,並在所有這些地區設定中保留同一個聲音身分
• 語音與複製 — GPT-Live-1:十二種預設,不支援複製;相較於 Inworld Realtime TTS-2:282 種內建語音,可從 5 至 15 秒的授權音訊即時進行零樣本複製,專業複製與完整語音表達控制僅限旗艦版。
• 部署 — GPT-Live-1:僅託管、單一端點、無免費方案,併發數上限為 25 至 500 個工作階段,對比 Inworld Realtime TTS-2:託管 API 加上需 H100 的受限制內部部署容器,以及一個免費隨選層級,包含最多約 70 分鐘的合成。

雙面列印問題,精確解答
把這項比較寫成「一方傾聽,另一方只會說話」很容易,但這樣寫是錯的,而且錯得事關重大。Inworld 的文字轉語音模型是文字進、音訊出。但 Inworld 也販售一套 Realtime API,它透過單一 WebSocket、WebRTC 或 SIP 連線運作,而且具備開發者真正在意的那種全雙工能力:它採用可調整積極度設定的語意語音活動偵測、支援手動發話輪替控制,並能在使用者插話時約 100 毫秒內中斷。它與 OpenAI Realtime 介面在協定上相容,這讓遷移變成一件調整設定的差事,而不是重寫。
Inworld 的 Realtime API 並不是原生語音轉語音模型。它是一種串接式架構——可替換的語音辨識模型、你選擇的語言模型,以及語音合成器——在單一連線中協調運作。那是合理的架構選擇,而且大多數正式環境的語音代理也做出同樣的選擇。它只是與 GPT-Live-1 不同;在 GPT-Live-1 中,是由單一模型決定何時讓出對話回合。
實務上的差異會在通話者在句子中途打斷時顯現。在串接式架構中,系統會偵測到打斷、取消生成,並開始新的一輪——這個流程運作良好,但代價是得耗費一次往返。在端到端模型中,決策早已持續在進行。前者是一套快速回應的系統。後者是一套從未停止聆聽的系統。

算一下數字,因為答案藏在單位裡
語音大約每分鐘 150 個詞,而英文平均每個詞約有五個半字元,因此一分鐘的口語輸出約為 800 到 900 個字元。以每百萬字元 25 美元計算,Inworld Realtime TTS-2 產出的一分鐘語音大約要價兩美分。若採用 Flash 的 15 美元價格,則不到 1.5 美分。
相較於 GPT-Live-1 每語音分鐘 0.05 美元,這看起來像是一場壓倒性勝利——直到你把 GPT-Live-1 正在處理的其餘一切也計入成本。Inworld 的 Realtime API 仍需語音辨識與語言模型,兩者分開計費,且各自都帶有延遲。把這些算進去後,只要通話涉及真正的提問,串聯式架構的每分鐘成本就會超過五分美元。端到端模型的溢價不是為了語音,而是為了輪流發言;而這大致就是你不再需要購買的語音辨識階段成本。
串接式架構決定性勝出之處,在於沒有對話的大量通話。通知來電、配送確認、預約提醒、腳本式 IVR——任何在通話開始前文字內容就已確定、且不會有人打斷的情況。在這些情境下,每百萬字元 7 到 15 美元的字元計價,就是比每分鐘計價的雙工便宜,而為你根本用不到的輪流發言付費,純屬浪費。
還有一條中間路線,是雙模型框架所掩蓋的。如果你無論如何都要組裝一套串接流程,語音層未必得來自專門的語音供應商:OpenAI 自家的 TTS 模型與 Google 的 Gemini TTS 預覽模型都只是普通的 API 端點,而且都經過路由。大約 來自十一家上游供應商的 190 個模型位於同一把 OrcaRouter 金鑰之後,以供應商定價提供、零加成——因此合成模型可以和它所饋入的推理模型共用同一份目錄、同一把金鑰和同一張帳單,若某個端點在部署途中效能衰退,還能自動容錯移轉。這是語音堆疊中最不起眼、卻也最容易整併的一環。Inworld 的 Realtime TTS-2 和 GPT-Live-1 的 Live Sessions 端點都無法以這種方式取得;那兩者屬於各自的廠商。
該選哪一個
如果重點在於量體,而且對話是寫好的腳本,就選擇 Inworld Realtime TTS-2。高吞吐量的代理、通知、需要 200 個地區設定與單一保留聲音身分等多語言產品,或任何需要地端容器的部署。你能以大約領導者一半的價格獲得排名前二的競技場語音、可用於原型設計的免費方案、GPT-Live-1 完全未提供的複製功能,以及一個能在你很可能已在使用的串聯模式中稱職處理中斷的 Realtime API。
如果「打斷」本身就是產品,就選 GPT-Live-1。那些不照腳本走的通話、搶在代理講話時插話的來電者、以及輪流發言決定了那是一場對話還是一份選單的工作流程。你付的是每分鐘費率,而當語音變便宜時它也不會跟著調降;你放棄了聲音複製與 200 種語言;你換回的是那些接縫。
語音合成領域的價格戰是真實的,而且對任何打造語音代理的人來說都是好消息——現在一款排名前五的語音,價格只要十八個月前的五分之一。只是這並無法解決這項比較,因為 GPT-Live-1 收費的項目,並不是 Inworld 在降價的項目。
