「GPT-Live-1 對決 Cartesia Sonic 3.6」主視覺標題卡,副標題為「最好聽的聲音,不是聽得見你的那一個」,搭載三張卡片,分別寫著「Cartesia Sonic 3.6:1,275 Elo,在兩個 Artificial Analysis 語音競技場均排名第 1」、「GPT-Live-1:在 Speech to Speech Index 拿下 70.3%,與他者並列 14 名中的第 6」、「不同的計分板,因為它們衡量的是不同的東西」,上方為一列頁尾資訊:「競技場數據依 Artificial Analysis;GPT-Live-1 互動性數據為 OpenAI 所報告。」OrcaRouter 標誌合成於右下角。
Guides & Insights

GPT-Live-1 對決 Cartesia Sonic 3.6:排名第一的 TTS 排行榜並不衡量中斷

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Cartesia Sonic 3.6 目前同時稱霸 Artificial Analysis 的兩項文字轉語音競技場——在 Provider Voice 榜上拿下 1,275 Elo,在 Controlled Voice 榜上也位居第一,領先每一個背後有更龐大平台的商業引擎。GPT-Live-1 在兩個榜單上都未獲排名,因為它不是文字轉語音模型。它在 Artificial Analysis 另一個不同的榜單——語音轉語音指數(Speech to Speech Index)——上,以 70.3% 的成績在十四名中並列第六。综合來看,這兩項事實描繪出這兩款產品之間的真正分野:Sonic 3.6 極可能是聲音表現較好的一方,而 GPT-Live-1 則是兩者中唯一能聽出通話者開始說話與停止說話的那一個。

Both are live and both are commercially available — Sonic 3.6 on Cartesia's own API since its stable snapshot landed on August 27, 2026, GPT-Live-1 on Open​AI's developer API since September 10, 2026, at $0.05 per voice minute. Choosing between them is not a quality decision. It is a decision about which half of a voice agent you are buying.

兩個競技場,兩個問題,以及為什麼這種分裂是真實的

Artificial Analysis 經營其語音排行榜的方式,值得在有人拿任一個 Elo 數據向你引述之前先了解。「供應商語音」競技場以各廠商自家的原生語音來為引擎排名——它衡量的是你實際上開箱即得的語音,而那正是買方在乎的數字。「受控語音」競技場則將每個模型複製到相同的八個參考語音上,讓聆聽者比較的是合成引擎,而非配音員的聲音。Sonic 3.6 在兩者皆居冠,這比聽起來更罕見:這兩份排行榜在 2026 年大部分時間裡的冠軍都不同。

這兩個榜單都沒有任何一個模型被打斷的樣本。它們衡量的是語音在孤立情況下聽起來如何、對聽者而言的聽感為何。Speech to Speech Index 的建構方式不同——它把語音推理、代理表現、競技場偏好與任務成功率加權整合成一個數字,而且只納入原生語音對語音的模型。Cartesia 在那裡沒有登錄。不是因為 Sonic 3.6 不好,而是因為文字轉語音引擎沒有東西可以提交。

所以,1,275 和 70.3% 並不是彼此競爭的數字,任何把它們並列在同一條線上的比較,都在悄悄對你撒謊。它們共同確立的是:品質已不再是這項決定所圍繞的軸心。

A screenshot of the Artificial Analysis Speech to Speech Index chart, ranking fourteen natively speech-to-speech models by a weighted average of speech reasoning, agentic performance, arena preference and task success. Bars run left to right: Grok Voice Think Fast 2.0 High at 79.0%, GPT-Realtime-2.1 High at 73.9%, GPT-Realtime-2 High at 73.6%, Grok Voice Think Fast 1.0 at 72.3%, Gemini 3.1 Flash Live High at 71.5%, GPT-Live-1 Mini and GPT-Live-1 level at 70.3%, then GPT-Realtime-2.1 Minimal at 68.5%, Qwen-Audio-Omni-3.0-Realtime-Plus at 66.8%, Qwen-Audio-Omni-3.0-Realtime-Flash at 64.2%, Gemini 3.1 Flash Live Minimal at 63.9%, GPT-Realtime-2 Minimal at 62.7% and Gemini 2.5 Flash at 52.8%. A companion panel charts cost per hour of input audio across the same field.

逐維度地

• 類型 — GPT-Live-1:全雙工語音轉語音,整個迴圈由單一模型處理,對比 Cartesia Sonic 3.6:串流文字轉語音,搭配 Ink-2 語音辨識以支援代理

• 獨立品質 — GPT-Live-1:在 Speech to Speech Index 上為 70.3%,十四者中並列第六;對比 Cartesia Sonic 3.6:在 Provider Voice 排行榜上為 1,275 Elo,來自 1,755 個樣本,且在 Controlled Voice 排行榜上也排名第一

• 中斷處理 — GPT-Live-1:模型本身的特性,每秒會多次決定是否讓出發言權;對比 Cartesia Sonic 3.6:一種整合模式,由用戶端取消合成情境,並仰賴詞彙層級時間戳記在正確時機切斷

• 價格 — GPT-Live-1:每分鐘語音 $0.05,以秒計費,推理後端另行計量;對比 Cartesia Sonic 3.6:在點數方案下每百萬字元約 $49,另加每分鐘 $0.06 的代理通話時長費用,以及 Cartesia 電話號碼每分鐘 $0.014

• Latency — GPT-Live-1: no model-level figure published; turn-taking latency given as 0.798 seconds in Open​AI's own testing vs Cartesia Sonic 3.6: under 90 milliseconds time-to-first-audio, vendor-stated and not independently measured end to end

• 吞吐量 — GPT-Live-1:並行工作階段,第 1 層上限為 25,第 5 層上限為 500,且無免費方案;相較之下,Cartesia Sonic 3.6:每秒約 132 個字元,在相同比較下約為 ElevenLabs v3 速率的兩倍,並提供每月 20,000 點數的免費方案

• 語言 — GPT-Live-1:在首發涵蓋範圍內,主要語言以外的流暢度表現不均;相較之下 Cartesia Sonic 3.6:涵蓋 61 個地區設定的 44 種語言,本次版本新增了奧里亞語與烏爾都語

• 語音控制 — GPT-Live-1:十二種預設語音,透過提示調整語氣與語速,不支援聲音複製;對比 Cartesia Sonic 3.6:超過 500 種預設語音、即時聲音複製、更高階方案提供專業聲音複製、詞彙與音素時間戳記,且不支援 SSML — 模型會根據文字本身調整語速

A generated two-column comparison scoreboard titled 'GPT-Live-1 vs Cartesia Sonic 3.6 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Interactivity: 80.1%, vendor-reported', 'Turn-taking latency: 0.798 s, vendor testing', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Voices: 12 presets, no cloning'. The right column, labelled Cartesia Sonic 3.6, reads 'Kind: streaming text-to-speech', 'Price: ~$49 per 1M characters, plus $0.06 per agent minute', 'Time to first audio: under 90 ms, vendor-stated', 'Throughput: ~132 characters per second', 'Independent score: 1,275 Elo, #1 on the AA Provider Voice arena', 'Voices: 500+ presets, cloning, word timestamps'. The footer reads 'Sonic 3.6 latency vendor-stated; GPT-Live-1 interactivity OpenAI-reported; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

插話是架構的一項特性,而不是一個核取方塊。

買家在這項比較中最常犯的錯誤,就是把打斷支援當成布林值來看待。Cartesia 的文件對其版本運作方式相當坦率:當來電者插話打斷代理時,客戶端會針對當前的合成情境送出取消,而在 WebSocket 連線上傳回的詞級時間戳,正是讓你能在正確的音節上停止播放的依據。那是個稱職的設計,也是現今大多數正式環境語音代理處理插話的方式。

It is still a design in which the decision to stop talking was made by your application, using a voice-activity signal, at whatever latency the round trip allows. GPT-Live-1 moves that decision inside the model. It is continuously deciding whether to keep listening, pause, take the turn or hand it over, which is why Open​AI's own figures report 80.1% interactivity against 45.4% for GPT-Realtime-2.1 on Full Duplex Bench v1.5, with turn-taking latency of 0.798 seconds against 1.41. Those numbers are Open​AI's, published with the release and not reproduced by anyone outside the company — but the architectural difference behind them is not in dispute, and it is the one thing a cascade cannot approximate by tuning.

串接式架構勝出之處,在於句子之後的所有環節。Cartesia 低於 90 毫秒的首音時間(time-to-first-audio)是廠商公布的數字,衡量的是模型本身,而不是整段對話:來電者實際感受到的數字,還包含語音辨識、輪次偵測、語言模型的生成時間、網路傳輸與音訊緩衝。這正是為什麼當你需要掌控每一個環節時,串接式架構值得打造——簡單的輪次用快速的小模型,困難的輪次用前沿模型,再加上一個永遠不讓你等待的語音合成器。

那個中間階段是兩個堆疊中唯一真正可攜的部分,而且它也是決定通話品質與成本的部分。大約有來自十一家上游供應商的 190 個模型,都置於一把 OrcaRouter 金鑰之後,以供應商定價、零加成提供,而路由 DSL 讓單一端點能將單純的對話輪次送往便宜模型,並把複雜的輪次升級至前沿模型——這正是語音代理真正想要的模式,套用在變化最大的階段上。無論是 Sonic 3.6 還是 GPT-Live-1,都無法透過路由層觸及;語音層屬於其各自的供應商。

A screenshot of Cartesia's official Sonic 3.6 product page, showing the post title 'Introducing Sonic-3.6' dated Aug 27, 2026, the claim that listeners preferred it in up to 93% of blind head-to-head tests across fifteen locales, and the statement that Sonic-3.6 'takes #1 on the Artificial Analysis leaderboard across both the controlled and provider voice boards'. Below it, an embedded Controlled Voice leaderboard lists Sonic 3.6 first ahead of Sonic 3.5, Eleven v3, StepAudio 2.5 and Realtime TTS 1.5.

管理資金

兩種計價模式對不上,所以這個換算值得好好做。語音速度大約是每分鐘 150 個詞,而英文平均每個詞約五點五個字元,因此一分鐘的語音輸出大約是 800 到 900 個字元。以每百萬字元 49 美元計算,Cartesia 的語音合成每分鐘音訊約花費四美分。

接著,其餘的連鎖成本也隨之而來。Cartesia 對語音代理通話時長每分鐘收取 0.06 美元,若使用其電話號碼則每分鐘再收 0.014 美元,而且這些都還要在字元費用之外另計。再加上語音辨識與處理文字的语言模型,在還沒有人講到任何難處理的內容之前,每分鐘成本就已經超過一毛錢了。GPT-Live-1 每語音分鐘 0.05 美元,涵蓋聆聽、輪流發言與說話,而委派的推理則按後端模型的正常費率另行計費——對於附帶一兩次搜尋的訂位電話來說,這是一個實實在在的數字,而不是可以四捨五入忽略的誤差。

交叉點取決於通話量和難度。簡短、重複、高話務量的通話——確認、通知、簡單查詢——有利於串聯式架構,因為由便宜模型回答制式問題,是這項比較中最便宜的做法。當來電者不照腳本走、在客服人員說話時插話,或話講到一半改變心意時,這類通話有利於端到端模型,因為串聯式在這種情況下的失效模式不是答錯,而是答得尷尬。

該選哪一個

如果你想擁有目前評分最高的語音,而且願意自行掌控對話邏輯,就選擇 Cartesia Sonic 3.6。對於旁白、大量腳本化代理、已有語音辨識流程的團隊,以及任何需要詞彙層級時間戳記來實現精準插話處理的人來說,這都是正確的選擇。你可以享有免費方案、超過 500 種語音、聲音複製、44 種語言,以及在兩大品質排行榜上都名列第一,而且還能掌控每一個階段。

如果打斷本身就是產品,就選 GPT-Live-1。凡是被人搶話屬於常態而非邊緣情況,而且在一個沒人把問題問完的句子上,0.8 秒的輪次交接勝過 90 毫秒的搶先開口——這種情況都適用。你得接受一個封閉、託管、按分鐘計費、只有十二種語音且不支援聲音複製的模型,也得接受它的獨立品質評分只排在中段。

誘惑在於拿 1,275 對上 70.3%,然後就此宣稱已成定局。但事實並非如此,而這兩個數字之間的落差,正是整場爭論的核心:一個衡量的是某個聲音聽起來如何,另一個衡量的則是它值不值得與之交談。