
GPT-Live-1 對決 Cartesia Sonic 3.6:排名第一的 TTS 排行榜並不衡量中斷
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
Cartesia Sonic 3.6 目前同時稱霸 Artificial Analysis 的兩項文字轉語音競技場——在 Provider Voice 榜上拿下 1,275 Elo,在 Controlled Voice 榜上也位居第一,領先每一個背後有更龐大平台的商業引擎。GPT-Live-1 在兩個榜單上都未獲排名,因為它不是文字轉語音模型。它在 Artificial Analysis 另一個不同的榜單——語音轉語音指數(Speech to Speech Index)——上,以 70.3% 的成績在十四名中並列第六。综合來看,這兩項事實描繪出這兩款產品之間的真正分野:Sonic 3.6 極可能是聲音表現較好的一方,而 GPT-Live-1 則是兩者中唯一能聽出通話者開始說話與停止說話的那一個。
Both are live and both are commercially available — Sonic 3.6 on Cartesia's own API since its stable snapshot landed on August 27, 2026, GPT-Live-1 on OpenAI's developer API since September 10, 2026, at $0.05 per voice minute. Choosing between them is not a quality decision. It is a decision about which half of a voice agent you are buying.
兩個競技場,兩個問題,以及為什麼這種分裂是真實的
Artificial Analysis 經營其語音排行榜的方式,值得在有人拿任一個 Elo 數據向你引述之前先了解。「供應商語音」競技場以各廠商自家的原生語音來為引擎排名——它衡量的是你實際上開箱即得的語音,而那正是買方在乎的數字。「受控語音」競技場則將每個模型複製到相同的八個參考語音上,讓聆聽者比較的是合成引擎,而非配音員的聲音。Sonic 3.6 在兩者皆居冠,這比聽起來更罕見:這兩份排行榜在 2026 年大部分時間裡的冠軍都不同。
這兩個榜單都沒有任何一個模型被打斷的樣本。它們衡量的是語音在孤立情況下聽起來如何、對聽者而言的聽感為何。Speech to Speech Index 的建構方式不同——它把語音推理、代理表現、競技場偏好與任務成功率加權整合成一個數字,而且只納入原生語音對語音的模型。Cartesia 在那裡沒有登錄。不是因為 Sonic 3.6 不好,而是因為文字轉語音引擎沒有東西可以提交。
所以,1,275 和 70.3% 並不是彼此競爭的數字,任何把它們並列在同一條線上的比較,都在悄悄對你撒謊。它們共同確立的是:品質已不再是這項決定所圍繞的軸心。

逐維度地
• 類型 — GPT-Live-1:全雙工語音轉語音,整個迴圈由單一模型處理,對比 Cartesia Sonic 3.6:串流文字轉語音,搭配 Ink-2 語音辨識以支援代理
• 獨立品質 — GPT-Live-1:在 Speech to Speech Index 上為 70.3%,十四者中並列第六;對比 Cartesia Sonic 3.6:在 Provider Voice 排行榜上為 1,275 Elo,來自 1,755 個樣本,且在 Controlled Voice 排行榜上也排名第一
• 中斷處理 — GPT-Live-1:模型本身的特性,每秒會多次決定是否讓出發言權;對比 Cartesia Sonic 3.6:一種整合模式,由用戶端取消合成情境,並仰賴詞彙層級時間戳記在正確時機切斷
• 價格 — GPT-Live-1:每分鐘語音 $0.05,以秒計費,推理後端另行計量;對比 Cartesia Sonic 3.6:在點數方案下每百萬字元約 $49,另加每分鐘 $0.06 的代理通話時長費用,以及 Cartesia 電話號碼每分鐘 $0.014
• Latency — GPT-Live-1: no model-level figure published; turn-taking latency given as 0.798 seconds in OpenAI's own testing vs Cartesia Sonic 3.6: under 90 milliseconds time-to-first-audio, vendor-stated and not independently measured end to end
• 吞吐量 — GPT-Live-1:並行工作階段,第 1 層上限為 25,第 5 層上限為 500,且無免費方案;相較之下,Cartesia Sonic 3.6:每秒約 132 個字元,在相同比較下約為 ElevenLabs v3 速率的兩倍,並提供每月 20,000 點數的免費方案
• 語言 — GPT-Live-1:在首發涵蓋範圍內,主要語言以外的流暢度表現不均;相較之下 Cartesia Sonic 3.6:涵蓋 61 個地區設定的 44 種語言,本次版本新增了奧里亞語與烏爾都語
• 語音控制 — GPT-Live-1:十二種預設語音,透過提示調整語氣與語速,不支援聲音複製;對比 Cartesia Sonic 3.6:超過 500 種預設語音、即時聲音複製、更高階方案提供專業聲音複製、詞彙與音素時間戳記,且不支援 SSML — 模型會根據文字本身調整語速

插話是架構的一項特性,而不是一個核取方塊。
買家在這項比較中最常犯的錯誤,就是把打斷支援當成布林值來看待。Cartesia 的文件對其版本運作方式相當坦率:當來電者插話打斷代理時,客戶端會針對當前的合成情境送出取消,而在 WebSocket 連線上傳回的詞級時間戳,正是讓你能在正確的音節上停止播放的依據。那是個稱職的設計,也是現今大多數正式環境語音代理處理插話的方式。
It is still a design in which the decision to stop talking was made by your application, using a voice-activity signal, at whatever latency the round trip allows. GPT-Live-1 moves that decision inside the model. It is continuously deciding whether to keep listening, pause, take the turn or hand it over, which is why OpenAI's own figures report 80.1% interactivity against 45.4% for GPT-Realtime-2.1 on Full Duplex Bench v1.5, with turn-taking latency of 0.798 seconds against 1.41. Those numbers are OpenAI's, published with the release and not reproduced by anyone outside the company — but the architectural difference behind them is not in dispute, and it is the one thing a cascade cannot approximate by tuning.
串接式架構勝出之處,在於句子之後的所有環節。Cartesia 低於 90 毫秒的首音時間(time-to-first-audio)是廠商公布的數字,衡量的是模型本身,而不是整段對話:來電者實際感受到的數字,還包含語音辨識、輪次偵測、語言模型的生成時間、網路傳輸與音訊緩衝。這正是為什麼當你需要掌控每一個環節時,串接式架構值得打造——簡單的輪次用快速的小模型,困難的輪次用前沿模型,再加上一個永遠不讓你等待的語音合成器。
那個中間階段是兩個堆疊中唯一真正可攜的部分,而且它也是決定通話品質與成本的部分。大約有來自十一家上游供應商的 190 個模型,都置於一把 OrcaRouter 金鑰之後,以供應商定價、零加成提供,而路由 DSL 讓單一端點能將單純的對話輪次送往便宜模型,並把複雜的輪次升級至前沿模型——這正是語音代理真正想要的模式,套用在變化最大的階段上。無論是 Sonic 3.6 還是 GPT-Live-1,都無法透過路由層觸及;語音層屬於其各自的供應商。

管理資金
兩種計價模式對不上,所以這個換算值得好好做。語音速度大約是每分鐘 150 個詞,而英文平均每個詞約五點五個字元,因此一分鐘的語音輸出大約是 800 到 900 個字元。以每百萬字元 49 美元計算,Cartesia 的語音合成每分鐘音訊約花費四美分。
接著,其餘的連鎖成本也隨之而來。Cartesia 對語音代理通話時長每分鐘收取 0.06 美元,若使用其電話號碼則每分鐘再收 0.014 美元,而且這些都還要在字元費用之外另計。再加上語音辨識與處理文字的语言模型,在還沒有人講到任何難處理的內容之前,每分鐘成本就已經超過一毛錢了。GPT-Live-1 每語音分鐘 0.05 美元,涵蓋聆聽、輪流發言與說話,而委派的推理則按後端模型的正常費率另行計費——對於附帶一兩次搜尋的訂位電話來說,這是一個實實在在的數字,而不是可以四捨五入忽略的誤差。
交叉點取決於通話量和難度。簡短、重複、高話務量的通話——確認、通知、簡單查詢——有利於串聯式架構,因為由便宜模型回答制式問題,是這項比較中最便宜的做法。當來電者不照腳本走、在客服人員說話時插話,或話講到一半改變心意時,這類通話有利於端到端模型,因為串聯式在這種情況下的失效模式不是答錯,而是答得尷尬。
該選哪一個
如果你想擁有目前評分最高的語音,而且願意自行掌控對話邏輯,就選擇 Cartesia Sonic 3.6。對於旁白、大量腳本化代理、已有語音辨識流程的團隊,以及任何需要詞彙層級時間戳記來實現精準插話處理的人來說,這都是正確的選擇。你可以享有免費方案、超過 500 種語音、聲音複製、44 種語言,以及在兩大品質排行榜上都名列第一,而且還能掌控每一個階段。
如果打斷本身就是產品,就選 GPT-Live-1。凡是被人搶話屬於常態而非邊緣情況,而且在一個沒人把問題問完的句子上,0.8 秒的輪次交接勝過 90 毫秒的搶先開口——這種情況都適用。你得接受一個封閉、託管、按分鐘計費、只有十二種語音且不支援聲音複製的模型,也得接受它的獨立品質評分只排在中段。
誘惑在於拿 1,275 對上 70.3%,然後就此宣稱已成定局。但事實並非如此,而這兩個數字之間的落差,正是整場爭論的核心:一個衡量的是某個聲音聽起來如何,另一個衡量的則是它值不值得與之交談。
