「ElevenLabs Eleven v4 vs Cartesia Sonic 3.6」的主視覺卡片,包含兩張評分卡:ElevenLabs Eleven v4 的 Elo 為 1,319,排名第 1,每 100 萬字元 $80.00;Cartesia Sonic 3.6 的 Elo 為 1,276,排名第 2,每 100 萬字元 $49.00;圖說為「43 點 Elo 的差距,對上便宜 39% 的語音」。頁腳:「Provider Voice Arena,依據 Artificial Analysis,2026 年 9 月。」OrcaRouter 標誌位於右下角。
Guides & Insights

Eleven v4 對決 Cartesia Sonic 3.6:43 分的 Elo 差距,對上便宜 39% 的語音

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

ElevenLabs Eleven v4以 43 Elo 分的差距領先Cartesia Sonic 3.6,在 Artificial Analysis 的 Provider Voice Arena 上以 1,319 對 1,276 勝出;它也在 Controlled Voice 排行榜上勝出,位居第二,Sonic 3.6 則排名第四。它在價格上則以極大差距落敗,方向恰恰相反:每百萬字元 $80.00 對上 $49.00,而在推出期間,依廠商自家價目表計算,每字元費率約為對手的九倍。這是罕見的對決:計分板清清楚楚,決策卻依然難定,因為這兩款模型實際上並非競爭同一項工作。

A two-column scoreboard for ElevenLabs Eleven v4 and Cartesia Sonic 3.6. Eleven v4: Provider Voice rank 1 Elo 1,319; Controlled Voice rank 2 Elo 1,157; $80.00 per 1M chars; $0.022 per 1K until Oct 12; 90-plus languages; latency not stated for v4. Sonic 3.6: Provider Voice rank 2 Elo 1,276; Controlled Voice rank 4 Elo 1,138; $49.00 per 1M chars; $0.049 per 1K; 44 languages; sub-90 ms. Footer: 'Elo and board prices per Artificial Analysis; rate cards and specs vendor-reported.'

每個模型是什麼,各用一段文字說明

ElevenLabs Eleven v4 於 9 月 28 日推出,是該公司的旗艦語音合成模型,並與 Eleven v4 Turbo 一同發布。文件說明它支援超過 90 種語言、每次請求的輸入上限為 10,000 個字元、具備可維持穩定說話者身分的多說話者對話、改良的 IPA 音素支援,以及行內指令,讓你能把表達方式寫進腳本。語音複製只需十秒音訊即可建立即時複本,並在此之上提供專業層級。

Cartesia Sonic 3.6 是 Cartesia 旗下一條主打速度與自然度的模型系列目前的最新版本。其自家產品頁面稱它是速度最快、最自然的文字轉語音模型,宣稱延遲低於 90 毫秒、原生支援橫跨 44 種語言的多語運作、可從十秒音訊進行語音複製、提供自訂發音詞典,以及涵蓋 HIPAA、SOC 2 Type 2、GDPR 與 PCI 的合規組合。兩家供應商都公布自家模型的延遲數據;這兩組數據都未經獨立驗證,且測量方式並不相同。

記分板:逐維度檢視

• 盲測偏好,各廠商使用自家語音——Eleven v4 排名第 1,Elo 1,319;Sonic 3.6 排名第 2,Elo 1,276。差距達 43 分。

• 盲測偏好,配對的複製語音 —— Eleven v4 排名第 2,Elo 1,157,對上 Sonic 3.6 排名第 4,Elo 1,138。19 分的差距,比第一個更窄。

• 競技場價格標準化,以每百萬字元計 —— Eleven v4 $80.00 對 Sonic 3.6 $49.00。以排行榜的共同基準計算,Sonic 便宜 39%。

• 供應商價目表,每千字元——Eleven v4 促銷價 $0.022,10月12日後為 $0.08,對比 Sonic 3.6 的 $0.049。一旦促銷結束,Sonic 便宜 39%。

• 語言覆蓋範圍,廠商文件記載 — Eleven v4 超過 90 種 vs Sonic 3.6 的 44 種。大約是兩倍。

• 每次請求的輸入上限 — Eleven v4 為 10,000 個字元,而 Sonic 3.6 未在其產品頁面上說明。

• 延遲(廠商自稱)——Eleven v4 Turbo 首次語音輸出的中位數約為 150 毫秒,對比 Sonic 3.6 低於 90 毫秒。同樣地,測試方式不同。

• 語音複製 — 兩者皆可從十秒的音訊進行,兩者皆具備更高階的專業方案。

• 列舉控制 — Eleven v4 記錄了 IPA 音素輸入與專業複製層級;Sonic 3.6 記錄了自訂發音詞典。

• 合規態勢 — Sonic 3.6 載明 HIPAA、SOC 2 Type 2、GDPR 與 PCI。ElevenLabs 在其模型頁面之外另行說明其合規情形,並未在 v4 旁放置相對應的清單。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing ElevenLabs Eleven v4 first at Elo 1,319 with $80.0 per 1M chars, Cartesia Sonic 3.6 second at Elo 1,276 with $49.0, and Google Gemini 3.8 Flash TTS third at Elo 1,267 with $16.5, each with its sample count, confidence interval, arena voice count and release month.

那幾列中有兩列正是決定實際專案的關鍵。在廠商語音排行榜上,Elo 差距是 43 分,而在複製語音排行榜上是 19 分——當說話者保持不變時,Sonic 系列的差距縮小超過一半。這是一個模型的典型特徵:其調校具有競爭力,但預設語音陣容卻不然;這也說明 Sonic 在這場對決中的問題在於呈現方式,而非合成品質。

為何價格差距比看起來更小

表面上的費率比較在兩個方向上都具誤導性。Eleven v4 的每千字元 $0.022 是促銷數字,到期日為 10 月 12 日;度過該優惠期後仍然有效的是 $0.08,比 Sonic 3.6 的費率表高出 60% 以上。但競技場正規化並不在乎這項促銷:它按各模型的定價計價,得出 $80.00 對 $49.00,而這才是到了 11 月依然成立的比較。

還有第二個問題。Cartesia 並未在其產品頁面上公布每字元費率,因此 $0.049 這個數字來自 arena 正規化,而非供應商本身,而且這兩種計量方式可能無法完全吻合——正規化會對供應商的計費方式做出假設。請把排序視為可靠,並將精確百分比視為近似值。

以每月五百萬字元計算的實例:Eleven v4 採促銷費率為 110 美元,10 月 12 日之後則為 400 美元。Sonic 3.6 為 245 美元。因此,接下來兩週 Eleven v4 的成本不到 Sonic 的一半,而在那之後則高出 63%。今天撰寫採購比較、下個月才交件的人,若不註明自己採用的是哪一種費率,就會把結果弄反。

Sonic 3.6 是正確答案的那個片段

有些正式環境的語音工作負載,arena 排行榜並未衡量真正重要的事,而 Sonic 3.6 正是為它們打造的。

即時對話代理是最明顯的例子。在電話代理中,低於 90 毫秒的延遲不是行銷數字;它關乎一次打斷究竟是感覺被妥善處理,還是感覺像通話斷線,而 ElevenLabs 並未公布 Eleven v4 本身的同等數據——只公布了 Turbo 層級約 150 毫秒的首次發聲中位延遲。如果你的代理的 socket 預算很緊,那 43 點 Elo 對你來說可能不如那些毫秒有價值,而你自己的插話測試會比任何排行榜更快定奪。

受監管部署是第二項。Cartesia 在產品頁面上載明 HIPAA、SOC 2 Type 2、GDPR 與 PCI。合規清單不是 Elo,也不能用 Elo 來替代;如果有醫療照護或支付領域的審查者位於你的發布路徑上,記分板上的那一列會勝過其餘九列。

A screenshot of Cartesia's Sonic product page, captured in English, headed 'Sonic: The fastest and most natural text to speech model' with the claim 'Ranked #1 for naturalness, sub-90ms latency, and natively multilingual across 44 languages', a 'Try Sonic-3.6' button, an 'American English / Jacqueline' voice picker over a support-call sample, a 'Ranked #1 in Speech Arena leaderboard & Speech to Text leaderboard by Artificial Analysis' panel, and a 'Built for Voice Agents' tab strip spanning Naturalness, Reliability, Speed, Scalability, Multilingual, Consistency and Cost.

確定性發音是第三項,而且它更為細微。Eleven v4 有文件記載的 IPA 音素輸入是一項優勢,但 Sonic 3.6 的自訂發音詞典,才是擁有大量產品名稱詞彙的團隊往往早已建立好的工作流程。移植詞典是實實在在的工作;能夠取用你所擁有之產物的模型,則已具備起步優勢。

當 Eleven v4 單純就是更好的模型時

話雖如此,這些排行榜確實衡量了某些東西,而 Eleven v4 兩項都勝出。在 Provider Voice 上,它以 43 分領先 Sonic 3.6,該估計值有 1,674 個樣本支撐;而前代旗艦——ElevenLabs Eleven v3,取得 1,169 分——則落後 Sonic 3.6 107 分,這意味著 ElevenLabs 在一個世代內縮小了實質差距,而非守住領先地位。

語言數量是第二個明確的優勢。90 多種對上 44 種,大約是兩倍,而對於一個要進軍英語和少數幾種歐洲語言以外市場的產品來說,這是涵蓋範圍的問題,而不是品質問題——Sonic 3.6 對你的一些地區設定可能完全沒有語音。而多說話者對話處理加上內嵌語氣指令,是真正的能力差異:在腳本中寫入笑聲是 Sonic 3.6 沒有記載的工作流程,而在沒有這項功能的模型上重現該效果,意味著要進行後製或重錄一次,其成本比 Elo 差距所顯示的還要高。

執行其中任何一個,以及我們幫不上忙的部分

OrcaRouter 並未託管這兩個模型。ElevenLabs 與 Cartesia 不在我們的目錄中,因此這項比較中的任何內容都無法透過我們呼叫,而對「我要怎麼在 OrcaRouter 上使用它」這個問題的誠實答案是:沒有辦法——你得去找供應商。我們真正處理的,是語音堆疊最終橫跨多家供應商而非單一供應商的情況:一組 API 金鑰就能橫跨 200 多個模型,並將供應商牌價以 0% 加價原樣傳遞,讓供應商的價格變更在生效當天就即時反映在我們這邊。對於取決於同一月份字元用量你要付 $110 還是 $400 的決策來說,這個時機絕非小事。

當語音路徑直接面對客戶且不容中斷時,自動容錯移轉會在某個上游服務效能下降時,將流量導向健康的上游。正是這種模式,讓為期兩週的促銷窗口值得善加利用:你可以將正式環境指向較便宜的模型兩週,而無須改寫整合,並在費率恢復時切換回來。

誰該轉換,誰該等待

如果您的產品評價取決於聽起來如何、如果您發佈的語言超過二十幾種,或如果您的使用者聽到的是供應商為他們選擇的聲音,請改用 Eleven v4——最後這一群人正是 Provider Voice board 所代表的對象,而其中差距是所有列中最大的。

若你在延遲預算下運行即時對話、若合規審查人員已簽核你的技術堆疊,或若你擁有無法承擔重建成本的發音詞典,就繼續留在 Sonic 3.6。在這三種情況下,Sonic 並不落後;它是唯一有公開解答的選項。

等等,無論是哪一種情況,只要你的決定取決於價格。兩週後,Eleven v4 的價目表會變動將近四倍,而 Sonic 3.6 的不會,而今天寫下的比較,到了十月中讀起來就會是錯的。Elo 的排序仍然成立,價格則不然。