
Eleven v4 對決 Cartesia Sonic 3.6:43 分的 Elo 差距,對上便宜 39% 的語音
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 982 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 195 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1189 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
ElevenLabs Eleven v4以 43 Elo 分的差距領先Cartesia Sonic 3.6,在 Artificial Analysis 的 Provider Voice Arena 上以 1,319 對 1,276 勝出;它也在 Controlled Voice 排行榜上勝出,位居第二,Sonic 3.6 則排名第四。它在價格上則以極大差距落敗,方向恰恰相反:每百萬字元 $80.00 對上 $49.00,而在推出期間,依廠商自家價目表計算,每字元費率約為對手的九倍。這是罕見的對決:計分板清清楚楚,決策卻依然難定,因為這兩款模型實際上並非競爭同一項工作。

每個模型是什麼,各用一段文字說明
ElevenLabs Eleven v4 於 9 月 28 日推出,是該公司的旗艦語音合成模型,並與 Eleven v4 Turbo 一同發布。文件說明它支援超過 90 種語言、每次請求的輸入上限為 10,000 個字元、具備可維持穩定說話者身分的多說話者對話、改良的 IPA 音素支援,以及行內指令,讓你能把表達方式寫進腳本。語音複製只需十秒音訊即可建立即時複本,並在此之上提供專業層級。
Cartesia Sonic 3.6 是 Cartesia 旗下一條主打速度與自然度的模型系列目前的最新版本。其自家產品頁面稱它是速度最快、最自然的文字轉語音模型,宣稱延遲低於 90 毫秒、原生支援橫跨 44 種語言的多語運作、可從十秒音訊進行語音複製、提供自訂發音詞典,以及涵蓋 HIPAA、SOC 2 Type 2、GDPR 與 PCI 的合規組合。兩家供應商都公布自家模型的延遲數據;這兩組數據都未經獨立驗證,且測量方式並不相同。
記分板:逐維度檢視
• 盲測偏好,各廠商使用自家語音——Eleven v4 排名第 1,Elo 1,319;Sonic 3.6 排名第 2,Elo 1,276。差距達 43 分。
• 盲測偏好,配對的複製語音 —— Eleven v4 排名第 2,Elo 1,157,對上 Sonic 3.6 排名第 4,Elo 1,138。19 分的差距,比第一個更窄。
• 競技場價格標準化,以每百萬字元計 —— Eleven v4 $80.00 對 Sonic 3.6 $49.00。以排行榜的共同基準計算,Sonic 便宜 39%。
• 供應商價目表,每千字元——Eleven v4 促銷價 $0.022,10月12日後為 $0.08,對比 Sonic 3.6 的 $0.049。一旦促銷結束,Sonic 便宜 39%。
• 語言覆蓋範圍,廠商文件記載 — Eleven v4 超過 90 種 vs Sonic 3.6 的 44 種。大約是兩倍。
• 每次請求的輸入上限 — Eleven v4 為 10,000 個字元,而 Sonic 3.6 未在其產品頁面上說明。
• 延遲(廠商自稱)——Eleven v4 Turbo 首次語音輸出的中位數約為 150 毫秒,對比 Sonic 3.6 低於 90 毫秒。同樣地,測試方式不同。
• 語音複製 — 兩者皆可從十秒的音訊進行,兩者皆具備更高階的專業方案。
• 列舉控制 — Eleven v4 記錄了 IPA 音素輸入與專業複製層級;Sonic 3.6 記錄了自訂發音詞典。
• 合規態勢 — Sonic 3.6 載明 HIPAA、SOC 2 Type 2、GDPR 與 PCI。ElevenLabs 在其模型頁面之外另行說明其合規情形,並未在 v4 旁放置相對應的清單。

那幾列中有兩列正是決定實際專案的關鍵。在廠商語音排行榜上,Elo 差距是 43 分,而在複製語音排行榜上是 19 分——當說話者保持不變時,Sonic 系列的差距縮小超過一半。這是一個模型的典型特徵:其調校具有競爭力,但預設語音陣容卻不然;這也說明 Sonic 在這場對決中的問題在於呈現方式,而非合成品質。
為何價格差距比看起來更小
表面上的費率比較在兩個方向上都具誤導性。Eleven v4 的每千字元 $0.022 是促銷數字,到期日為 10 月 12 日;度過該優惠期後仍然有效的是 $0.08,比 Sonic 3.6 的費率表高出 60% 以上。但競技場正規化並不在乎這項促銷:它按各模型的定價計價,得出 $80.00 對 $49.00,而這才是到了 11 月依然成立的比較。
還有第二個問題。Cartesia 並未在其產品頁面上公布每字元費率,因此 $0.049 這個數字來自 arena 正規化,而非供應商本身,而且這兩種計量方式可能無法完全吻合——正規化會對供應商的計費方式做出假設。請把排序視為可靠,並將精確百分比視為近似值。
以每月五百萬字元計算的實例:Eleven v4 採促銷費率為 110 美元,10 月 12 日之後則為 400 美元。Sonic 3.6 為 245 美元。因此,接下來兩週 Eleven v4 的成本不到 Sonic 的一半,而在那之後則高出 63%。今天撰寫採購比較、下個月才交件的人,若不註明自己採用的是哪一種費率,就會把結果弄反。
Sonic 3.6 是正確答案的那個片段
有些正式環境的語音工作負載,arena 排行榜並未衡量真正重要的事,而 Sonic 3.6 正是為它們打造的。
即時對話代理是最明顯的例子。在電話代理中,低於 90 毫秒的延遲不是行銷數字;它關乎一次打斷究竟是感覺被妥善處理,還是感覺像通話斷線,而 ElevenLabs 並未公布 Eleven v4 本身的同等數據——只公布了 Turbo 層級約 150 毫秒的首次發聲中位延遲。如果你的代理的 socket 預算很緊,那 43 點 Elo 對你來說可能不如那些毫秒有價值,而你自己的插話測試會比任何排行榜更快定奪。
受監管部署是第二項。Cartesia 在產品頁面上載明 HIPAA、SOC 2 Type 2、GDPR 與 PCI。合規清單不是 Elo,也不能用 Elo 來替代;如果有醫療照護或支付領域的審查者位於你的發布路徑上,記分板上的那一列會勝過其餘九列。

確定性發音是第三項,而且它更為細微。Eleven v4 有文件記載的 IPA 音素輸入是一項優勢,但 Sonic 3.6 的自訂發音詞典,才是擁有大量產品名稱詞彙的團隊往往早已建立好的工作流程。移植詞典是實實在在的工作;能夠取用你所擁有之產物的模型,則已具備起步優勢。
當 Eleven v4 單純就是更好的模型時
話雖如此,這些排行榜確實衡量了某些東西,而 Eleven v4 兩項都勝出。在 Provider Voice 上,它以 43 分領先 Sonic 3.6,該估計值有 1,674 個樣本支撐;而前代旗艦——ElevenLabs Eleven v3,取得 1,169 分——則落後 Sonic 3.6 107 分,這意味著 ElevenLabs 在一個世代內縮小了實質差距,而非守住領先地位。
語言數量是第二個明確的優勢。90 多種對上 44 種,大約是兩倍,而對於一個要進軍英語和少數幾種歐洲語言以外市場的產品來說,這是涵蓋範圍的問題,而不是品質問題——Sonic 3.6 對你的一些地區設定可能完全沒有語音。而多說話者對話處理加上內嵌語氣指令,是真正的能力差異:在腳本中寫入笑聲是 Sonic 3.6 沒有記載的工作流程,而在沒有這項功能的模型上重現該效果,意味著要進行後製或重錄一次,其成本比 Elo 差距所顯示的還要高。
執行其中任何一個,以及我們幫不上忙的部分
OrcaRouter 並未託管這兩個模型。ElevenLabs 與 Cartesia 不在我們的目錄中,因此這項比較中的任何內容都無法透過我們呼叫,而對「我要怎麼在 OrcaRouter 上使用它」這個問題的誠實答案是:沒有辦法——你得去找供應商。我們真正處理的,是語音堆疊最終橫跨多家供應商而非單一供應商的情況:一組 API 金鑰就能橫跨 200 多個模型,並將供應商牌價以 0% 加價原樣傳遞,讓供應商的價格變更在生效當天就即時反映在我們這邊。對於取決於同一月份字元用量你要付 $110 還是 $400 的決策來說,這個時機絕非小事。
當語音路徑直接面對客戶且不容中斷時,自動容錯移轉會在某個上游服務效能下降時,將流量導向健康的上游。正是這種模式,讓為期兩週的促銷窗口值得善加利用:你可以將正式環境指向較便宜的模型兩週,而無須改寫整合,並在費率恢復時切換回來。
誰該轉換,誰該等待
如果您的產品評價取決於聽起來如何、如果您發佈的語言超過二十幾種,或如果您的使用者聽到的是供應商為他們選擇的聲音,請改用 Eleven v4——最後這一群人正是 Provider Voice board 所代表的對象,而其中差距是所有列中最大的。
若你在延遲預算下運行即時對話、若合規審查人員已簽核你的技術堆疊,或若你擁有無法承擔重建成本的發音詞典,就繼續留在 Sonic 3.6。在這三種情況下,Sonic 並不落後;它是唯一有公開解答的選項。
等等,無論是哪一種情況,只要你的決定取決於價格。兩週後,Eleven v4 的價目表會變動將近四倍,而 Sonic 3.6 的不會,而今天寫下的比較,到了十月中讀起來就會是錯的。Elo 的排序仍然成立,價格則不然。
