
Eleven v4 稱霸 Voice Arena:ElevenLabs 全新旗艦究竟贏得了什麼
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 983 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 196 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
ElevenLabs Eleven v4於 9 月 28 日推出,隨即直接登上 Artificial Analysis 的 Provider Voice Arena 榜首,Elo 達 1,319,以 43 分的差距領先Cartesia Sonic 3.6的 1,276,並以 52 分的差距領先Google Gemini 3.8 Flash TTS的 1,267。同樣在那份排行榜上,它以每百萬字元 80.00 美元的價格,成為前十名中最昂貴的模型。而在第二個競技場——那個由複製語音而非各家廠商自有語音集建構而成的競技場——它完全沒有勝出:它拿下第二名,落後於一個成本僅為它四分之一的模型。這兩件事都是真的,而這次發表真正有用的部分,就是釐清你的使用情境落在哪一邊。
9月28日實際上發布了什麼
ElevenLabs 讓兩款模型正式全面推出,而非一款。ElevenLabs Eleven v4是旗艦合成模型——該公司稱其為最具情感表現力的模型,其文件將每次請求的輸入上限設為 10,000 個字元,語言涵蓋範圍達 90 多種。ElevenLabs Eleven v4 Turbo是低延遲的同系列模型:同樣支援 90 多種語言、10,000 字元上限,並支援內嵌音訊標籤,讓你能把演繹指示直接寫進腳本本身——笑聲、耳語、線路上的嗡嗡聲。兩者從第一天起就已在該公司的代理、創作與 API 介面上線,這比 v3 世代的推出速度更快。
公告頁面是功能清單所在之處,值得注意的是,並非定價所在之處。ElevenLabs 描述了一套新架構、更出色的語氣、節奏與角色處理、更可靠且能維持穩定說話者身分的多說話者對話、改良的 IPA 音素輸入,以及能以十秒音訊建立的即時語音複製,並與既有的專業級複製層級並存。頁面上唯一的數字是一項關於聽眾的宣稱:該廠商表示,在盲測比較中,大約四分之三的情況偏好 v4。那是廠商提供的數字,未經重現,應與下方的看板數字並列閱讀,而非取而代之。
定價實際上落在哪裡——也就是 API 定價頁面——才是更關鍵的文件,這部分會在下方進一步說明。簡言之:這次發布並不是漲價。
兩個委員會,兩種不同的答案
Artificial Analysis 經營兩個語音競技場,而它們並非彼此的變體。Provider Voice 讓聽眾比較每個供應商自家的語音。Controlled Voice 為每位參賽者複製同樣的八個語音——四個美式、四個英式——因此說話者保持不變,只有模型有所差異。一個擁有出色預設語音陣容的模型可能贏得前者,卻輸掉後者。Eleven v4 正是如此。
• 供應商語音,Eleven v4 — 排名第 1,Elo 1,319,每百萬字元 $80.00,1,674 個樣本,八種競技場語音,2026 年 9 月
• 供應商語音,Cartesia Sonic 3.6 — 排名 2,Elo 1,276,$49.00
• 供應商語音,Google Gemini 3.8 Flash TTS — 排名第 3,Elo 1,267,$16.50
• Provider Voice,前一代旗艦 ElevenLabs Eleven v3——排名 18,Elo 1,169,$100.00
• 受控語音,Alibaba Qwen-Audio-3.1-TTS-Plus — 第 1 名,Elo 1,178
• Controlled Voice, Eleven v4 — 排名第 2,Elo 1,157,$80.00
• Controlled Voice、Cartesia Sonic 3.6 — 排名第 4,Elo 1,138
• 受控語音,ElevenLabs Eleven v3 — 排名第 7,Elo 1,073
• 可控語音,Google Gemini 3.8 Flash TTS — 排名第 13,Elo 1,048
• Provider Voice 上最佳開放權重參賽作品 — Breeze TTS 2,Elo 1,206,$34.00

對已經在用 ElevenLabs 的人來說,這次的同系列跨代躍升才是最大頭條:在同一張榜單上與自家前代相比,Eleven v4 在 Provider Voice 下提升 150 Elo 分,在 Controlled Voice 下則提升 84 分。這是跨世代的一步,而不是一次調校微調;而且在由廠商自行挑選語音的榜單上,進步幅度更大——坦白說,這正表示它全新的預設聲音陣容確實是這波提升的一部分。

我們無法用數字衡量的發音板
Artificial Analysis 確實設有發音穩健性區塊,而這一點值得好好說明,因為流傳中的排名摘要把 Eleven v4 描述成在這項評比中位居榜首。這個排行榜衡量的是:在被標記的片段中,評審判定發音正確的比例;每段音訊最多由三位評審評估,而且提示詞會完全照原樣送出——不展開數字,也不做文字正規化。這個區塊分成若干子類別,而這項設計的重點在於:如果模型在發音前默默改寫「Dr.」或「$4.50」,就會被刻意評為低分。
這個排行榜在我們能讀取的呈現版本中,並未公佈每個模型可引用的數值分數。因此,在那裡沒有可為 Eleven v4 引用的數字,而 1,319 的 Elo 屬於競技場偏好——也就是聽眾有多喜歡這個聲音——而非發音準確度。如果你看到這兩者被混為一談,那就是混為一談。這次發布中站得住腳的說法,是有數字佐證的那個:在 Provider Voice 以 1,319 排名第一,在 Controlled Voice 以 1,157 排名第二。
對你的帳單來說,上市折扣才是真正的好消息。
ElevenLabs 在推出新模型的同時也重新定了價,而折扣幅度之大,本身就足以改變購買決策。在 API 定價頁面上,Eleven v4 標價為每千字元 $0.022,相較於標示的原價 $0.08——降幅達 72%——而 Eleven v4 Turbo 標價為 $0.011,原價為 $0.04。兩者適用相同的活動期間:促銷持續到 10 月 12 日。之後,價格就會調回,而調回後的 v4 價格是 ElevenLabs 自家 v3 目前 $0.08 成本的兩倍。請以促銷後的價格、而非促銷價來做規劃。
這次重新定價也改變了 v4 以每個字元計相對於同業的定位,而 Arena 標準化早已顯示其價格為每百萬 80.00 美元。Sonic 3.6 在那裡是 49.00 美元,Breeze TTS 2 是 34.00 美元,Qwen-Audio-3.0-TTS-Plus 是 19.30 美元,Gemini 3.8 Flash TTS 則是 16.50 美元。若採促銷價,每百萬 22 美元的 Eleven v4 直接比 Sonic 3.6 更便宜。若採定價,它是排行榜上最貴的語音,而且貴上一大截。任何正在編列第一季預算的人,都應該看第二個數字。

用一個實際的月份來算,就能讓這個價差變得具體。以五百萬個字元為例——相當於一項中型產品朗讀約一百小時的語音——Eleven v4 在優惠期內的費用是 $110。若回到原本的 $0.08 費率,費用則是 $400。Sonic 3.6 的費用是 $245。Gemini 3.8 Flash TTS 的費用是 $82.50。同樣的一個月在 ElevenLabs 自家的 v3 上也要 $400,而這正是這場發布背後那個古怪的事實:接下來兩週,這款新旗艦比它所取代的模型更便宜;而當優惠期結束的那一天,它不再更便宜,只是變得更好而已。
延遲聲明為廠商所述,並視方案層級而定
ElevenLabs 公布的延遲數字是依方案層級區分,而非依模型系列,而且這些都是該公司自行測得的數據,並非任何獨立來源的測量結果。Eleven v4 Turbo 標示的中位推論時間約為 100 毫秒,首次語音的中位時間約為 150 毫秒,測量時間為 2026 年 9 月。Eleven v3 Conversational 標示約為 280 毫秒,較舊的 Flash 與 Turbo 層級則約為 75 毫秒。文件中並未公布 Eleven v4 本身的對應數字,而如果你正在打造即時代理,且是閱讀規格表而非實際測試,這正是你會想選的層級。
Cartesia 聲稱 Sonic 的延遲低於 90 毫秒,並將其描述為自然度排名第一,具備從十秒音訊進行語音複製、自訂發音詞典,以及涵蓋 HIPAA、SOC 2 Type 2、GDPR 和 PCI 的合規組合。那些都是廠商在其自家產品頁面上的自稱說法——與 ElevenLabs 的延遲層級數字屬於同一類證據,不能與競技場 Elo 互換。兩家廠商唯一可直接相比之處,只在排行榜上。
這對你意味著什麼,以及如何試用
如果你是在為產品挑選語音,而預設語音陣容就是使用者聽到的內容,那麼 Provider Voice 的結果才是關鍵,而 Eleven v4 剛剛拿下它,還附帶為期兩週的折扣。如果你是在複製特定人物的聲音,而且每個候選模型都被要求重現同樣的八位說話者,那麼 Controlled Voice 排行榜才是關鍵,而 Eleven v4 排名第二——落後領先者 21 Elo,而且以定價而言,每字元成本是領先者的四倍以上。這兩個結果都沒有錯;它們回答的是不同問題,而第二個才是大多數生產環境語音複製工作實際上在問的問題。
OrcaRouter 並不代管 ElevenLabs、Cartesia 或這些看板上的其他任何廠商,所以這裡沒有可經由我們呼叫的項目,我們也不會暗示並非如此。我們提供的,是當你的語音堆疊最終橫跨多家供應商時的周邊管線:一組 API 金鑰橫跨 200 多個模型,供應商定價以 0% 加成原樣傳遞,因此供應商的降價——包括像這樣的促銷窗口——在我們這邊當天就會生效,而不是等到下一個帳單週期。當語音路徑對生產至關重要時,自動容錯移轉會在某個上游效能降低時切換至健康的上游,這是在不把某個版本押注在其上的情況下,測試全新端點的實用方式。
要記在行事曆上的日期是 10 月 12 日。那一天,Eleven v4 不再是榜上最便宜的好語音,而會成為最貴的那一個;而本週所寫、引用每百萬 $22 卻沒有說明這一點的任何比較,都是你三週後應該重新跑過的比較。
