一張「Eleven v4 稱霸 Voice Arena」的 Hero 卡片:排行榜中,ElevenLabs Eleven v4 位居第 1 名、Elo 1,319,Cartesia Sonic 3.6 位居第 2 名、Elo 1,276,Google Gemini 3.8 Flash TTS 位居第 3 名、Elo 1,267,ElevenLabs Eleven v3 位居第 18 名、Elo 1,169,另有一條寫著「10 月 12 日前享 72% 折扣」的緞帶。頁尾:「供應商 Voice Arena,資料來源為 Artificial Analysis,2026 年 9 月。」OrcaRouter 標誌位於右下角。
Guides & Insights

Eleven v4 稱霸 Voice Arena:ElevenLabs 全新旗艦究竟贏得了什麼

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

ElevenLabs Eleven v4於 9 月 28 日推出,隨即直接登上 Artificial Analysis 的 Provider Voice Arena 榜首,Elo 達 1,319,以 43 分的差距領先Cartesia Sonic 3.6的 1,276,並以 52 分的差距領先Google Gemini 3.8 Flash TTS的 1,267。同樣在那份排行榜上,它以每百萬字元 80.00 美元的價格,成為前十名中最昂貴的模型。而在第二個競技場——那個由複製語音而非各家廠商自有語音集建構而成的競技場——它完全沒有勝出:它拿下第二名,落後於一個成本僅為它四分之一的模型。這兩件事都是真的,而這次發表真正有用的部分,就是釐清你的使用情境落在哪一邊。

9月28日實際上發布了什麼

ElevenLabs 讓兩款模型正式全面推出,而非一款。ElevenLabs Eleven v4是旗艦合成模型——該公司稱其為最具情感表現力的模型,其文件將每次請求的輸入上限設為 10,000 個字元,語言涵蓋範圍達 90 多種。ElevenLabs Eleven v4 Turbo是低延遲的同系列模型:同樣支援 90 多種語言、10,000 字元上限,並支援內嵌音訊標籤,讓你能把演繹指示直接寫進腳本本身——笑聲、耳語、線路上的嗡嗡聲。兩者從第一天起就已在該公司的代理、創作與 API 介面上線,這比 v3 世代的推出速度更快。

公告頁面是功能清單所在之處,值得注意的是,並非定價所在之處。ElevenLabs 描述了一套新架構、更出色的語氣、節奏與角色處理、更可靠且能維持穩定說話者身分的多說話者對話、改良的 IPA 音素輸入,以及能以十秒音訊建立的即時語音複製,並與既有的專業級複製層級並存。頁面上唯一的數字是一項關於聽眾的宣稱:該廠商表示,在盲測比較中,大約四分之三的情況偏好 v4。那是廠商提供的數字,未經重現,應與下方的看板數字並列閱讀,而非取而代之。

定價實際上落在哪裡——也就是 API 定價頁面——才是更關鍵的文件,這部分會在下方進一步說明。簡言之:這次發布並不是漲價。

兩個委員會,兩種不同的答案

Artificial Analysis 經營兩個語音競技場,而它們並非彼此的變體。Provider Voice 讓聽眾比較每個供應商自家的語音。Controlled Voice 為每位參賽者複製同樣的八個語音——四個美式、四個英式——因此說話者保持不變,只有模型有所差異。一個擁有出色預設語音陣容的模型可能贏得前者,卻輸掉後者。Eleven v4 正是如此。

• 供應商語音,Eleven v4 — 排名第 1,Elo 1,319,每百萬字元 $80.00,1,674 個樣本,八種競技場語音,2026 年 9 月

• 供應商語音,Cartesia Sonic 3.6 — 排名 2,Elo 1,276,$49.00

• 供應商語音,Google Gemini 3.8 Flash TTS — 排名第 3,Elo 1,267,$16.50

• Provider Voice,前一代旗艦 ElevenLabs Eleven v3——排名 18,Elo 1,169,$100.00

• 受控語音,Alibaba Qwen-Audio-3.1-TTS-Plus — 第 1 名,Elo 1,178

• Controlled Voice, Eleven v4 — 排名第 2,Elo 1,157,$80.00

• Controlled Voice、Cartesia Sonic 3.6 — 排名第 4,Elo 1,138

• 受控語音,ElevenLabs Eleven v3 — 排名第 7,Elo 1,073

• 可控語音,Google Gemini 3.8 Flash TTS — 排名第 13,Elo 1,048

• Provider Voice 上最佳開放權重參賽作品 — Breeze TTS 2,Elo 1,206,$34.00

A single-column scoreboard card for ElevenLabs Eleven v4 with six rows: 'Provider Voice rank: 1 (Elo 1,319)', 'Controlled Voice rank: 2 (Elo 1,157)', 'Board price: $80.00 per 1M characters', 'Rate card: $0.022 per 1K characters until Oct 12', 'Languages and cap: 90-plus, 10,000 characters', 'Latency: not stated for v4 itself'. Footer: 'Elo and board prices per Artificial Analysis; rate card and specs vendor-documented.'

對已經在用 ElevenLabs 的人來說,這次的同系列跨代躍升才是最大頭條:在同一張榜單上與自家前代相比,Eleven v4 在 Provider Voice 下提升 150 Elo 分,在 Controlled Voice 下則提升 84 分。這是跨世代的一步,而不是一次調校微調;而且在由廠商自行挑選語音的榜單上,進步幅度更大——坦白說,這正表示它全新的預設聲音陣容確實是這波提升的一部分。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing ElevenLabs Eleven v4 first at Elo 1,319 with $80.0 per 1M chars, 1,674 samples and a -19/19 confidence interval, Cartesia Sonic 3.6 second at Elo 1,276 and $49.0, Google Gemini 3.8 Flash TTS third at Elo 1,267 and $16.5, and ElevenLabs Eleven v3 eighteenth at Elo 1,169 and $100.0, under columns for samples, arena voices, release month and API pricing.

我們無法用數字衡量的發音板

Artificial Analysis 確實設有發音穩健性區塊,而這一點值得好好說明,因為流傳中的排名摘要把 Eleven v4 描述成在這項評比中位居榜首。這個排行榜衡量的是:在被標記的片段中,評審判定發音正確的比例;每段音訊最多由三位評審評估,而且提示詞會完全照原樣送出——不展開數字,也不做文字正規化。這個區塊分成若干子類別,而這項設計的重點在於:如果模型在發音前默默改寫「Dr.」或「$4.50」,就會被刻意評為低分。

這個排行榜在我們能讀取的呈現版本中,並未公佈每個模型可引用的數值分數。因此,在那裡沒有可為 Eleven v4 引用的數字,而 1,319 的 Elo 屬於競技場偏好——也就是聽眾有多喜歡這個聲音——而非發音準確度。如果你看到這兩者被混為一談,那就是混為一談。這次發布中站得住腳的說法,是有數字佐證的那個:在 Provider Voice 以 1,319 排名第一,在 Controlled Voice 以 1,157 排名第二。

對你的帳單來說,上市折扣才是真正的好消息。

ElevenLabs 在推出新模型的同時也重新定了價,而折扣幅度之大,本身就足以改變購買決策。在 API 定價頁面上,Eleven v4 標價為每千字元 $0.022,相較於標示的原價 $0.08——降幅達 72%——而 Eleven v4 Turbo 標價為 $0.011,原價為 $0.04。兩者適用相同的活動期間:促銷持續到 10 月 12 日。之後,價格就會調回,而調回後的 v4 價格是 ElevenLabs 自家 v3 目前 $0.08 成本的兩倍。請以促銷後的價格、而非促銷價來做規劃。

這次重新定價也改變了 v4 以每個字元計相對於同業的定位,而 Arena 標準化早已顯示其價格為每百萬 80.00 美元。Sonic 3.6 在那裡是 49.00 美元,Breeze TTS 2 是 34.00 美元,Qwen-Audio-3.0-TTS-Plus 是 19.30 美元,Gemini 3.8 Flash TTS 則是 16.50 美元。若採促銷價,每百萬 22 美元的 Eleven v4 直接比 Sonic 3.6 更便宜。若採定價,它是排行榜上最貴的語音,而且貴上一大截。任何正在編列第一季預算的人,都應該看第二個數字。

A screenshot of ElevenLabs' API pricing page, captured in English, showing the Eleven v4 row at $0.022 per 1K characters with a struck-through $0.08 and a '72% off until Oct 12' badge, and the Eleven v4 Turbo row at $0.011 with a struck-through $0.04, alongside the v3 row at $0.08 and the Eleven v3 Conversational row at $0.04.

用一個實際的月份來算,就能讓這個價差變得具體。以五百萬個字元為例——相當於一項中型產品朗讀約一百小時的語音——Eleven v4 在優惠期內的費用是 $110。若回到原本的 $0.08 費率,費用則是 $400。Sonic 3.6 的費用是 $245。Gemini 3.8 Flash TTS 的費用是 $82.50。同樣的一個月在 ElevenLabs 自家的 v3 上也要 $400,而這正是這場發布背後那個古怪的事實:接下來兩週,這款新旗艦比它所取代的模型更便宜;而當優惠期結束的那一天,它不再更便宜,只是變得更好而已。

延遲聲明為廠商所述,並視方案層級而定

ElevenLabs 公布的延遲數字是依方案層級區分,而非依模型系列,而且這些都是該公司自行測得的數據,並非任何獨立來源的測量結果。Eleven v4 Turbo 標示的中位推論時間約為 100 毫秒,首次語音的中位時間約為 150 毫秒,測量時間為 2026 年 9 月。Eleven v3 Conversational 標示約為 280 毫秒,較舊的 Flash 與 Turbo 層級則約為 75 毫秒。文件中並未公布 Eleven v4 本身的對應數字,而如果你正在打造即時代理,且是閱讀規格表而非實際測試,這正是你會想選的層級。

Cartesia 聲稱 Sonic 的延遲低於 90 毫秒,並將其描述為自然度排名第一,具備從十秒音訊進行語音複製、自訂發音詞典,以及涵蓋 HIPAA、SOC 2 Type 2、GDPR 和 PCI 的合規組合。那些都是廠商在其自家產品頁面上的自稱說法——與 ElevenLabs 的延遲層級數字屬於同一類證據,不能與競技場 Elo 互換。兩家廠商唯一可直接相比之處,只在排行榜上。

這對你意味著什麼,以及如何試用

如果你是在為產品挑選語音,而預設語音陣容就是使用者聽到的內容,那麼 Provider Voice 的結果才是關鍵,而 Eleven v4 剛剛拿下它,還附帶為期兩週的折扣。如果你是在複製特定人物的聲音,而且每個候選模型都被要求重現同樣的八位說話者,那麼 Controlled Voice 排行榜才是關鍵,而 Eleven v4 排名第二——落後領先者 21 Elo,而且以定價而言,每字元成本是領先者的四倍以上。這兩個結果都沒有錯;它們回答的是不同問題,而第二個才是大多數生產環境語音複製工作實際上在問的問題。

OrcaRouter 並不代管 ElevenLabs、Cartesia 或這些看板上的其他任何廠商,所以這裡沒有可經由我們呼叫的項目,我們也不會暗示並非如此。我們提供的,是當你的語音堆疊最終橫跨多家供應商時的周邊管線:一組 API 金鑰橫跨 200 多個模型,供應商定價以 0% 加成原樣傳遞,因此供應商的降價——包括像這樣的促銷窗口——在我們這邊當天就會生效,而不是等到下一個帳單週期。當語音路徑對生產至關重要時,自動容錯移轉會在某個上游效能降低時切換至健康的上游,這是在不把某個版本押注在其上的情況下,測試全新端點的實用方式。

要記在行事曆上的日期是 10 月 12 日。那一天,Eleven v4 不再是榜上最便宜的好語音,而會成為最貴的那一個;而本週所寫、引用每百萬 $22 卻沒有說明這一點的任何比較,都是你三週後應該重新跑過的比較。