一張「ElevenLabs Eleven v4 對比 Qwen-Audio-3.1-TTS-Plus」的主視覺卡片,內含兩張分數卡:Qwen-Audio-3.1-TTS-Plus 的 Elo 為 1,178,排名第 1,每百萬字元 $19.30;ElevenLabs Eleven v4 的 Elo 為 1,157,排名第 2,每百萬字元 $80.00;標題為「21 點 Elo 差距,對比四倍價格落差」。頁尾:「Controlled Voice Arena,根據 Artificial Analysis,2026 年 9 月。」OrcaRouter 標誌位於右下角。
Engineering & Research

Eleven v4 對決 Qwen Audio 3.1:榜上最便宜的語音勝出

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

在那個每位參賽者都被賦予同樣八種複製語音的排行榜上,Alibaba Qwen-Audio-3.1-TTS-Plus以 Elo 1,178 拿下第一,而ElevenLabs Eleven v4則以 1,157 位居第二。在該排行榜上,奪冠的模型每百萬字元要價 19.30 美元。拿下第二的模型則要價 80.00 美元。這是 21 分的品質差距,以及一個指向相反方向的四倍價格差距,而這是整個發布週中最有趣的結果——比 ElevenLabs 在另一個競技場拿下的第一名更耐人尋味,因為在那個排行榜上,排序合乎常規,而且贏家是前十名中最貴的語音。

這兩塊榜單不能互換,而這場對決之所以讀起來是這樣,原因完全在於你看的是哪一塊。Provider Voice 讓聆聽者評判每家廠商自家的語音。Controlled Voice 則為每個模型複製同樣的八個語音——四個美式、四個英式——所以沒有人能靠自己的預設語音陣容取勝。ElevenLabs 在第一塊以 61 分勝出。Alibaba 在第二塊以 21 分勝出。兩塊榜單都沒有錯,而第二塊才是能預測某項產品推出複製品牌語音的那一塊。

A two-column scoreboard for Qwen-Audio-3.1-TTS-Plus and ElevenLabs Eleven v4. Qwen: Controlled Voice rank 1 Elo 1,178; Provider Voice rank 4 Elo 1,258 on the 3.0 build; $19.30 per 1M chars; rate card not publicly readable; 3.1 on one board and 3.0 on the other; documentation not readable publicly. Eleven v4: Controlled Voice rank 2 Elo 1,157; Provider Voice rank 1 Elo 1,319; $80.00 per 1M chars; $0.022 per 1K until Oct 12; v4 on both boards; 90-plus languages and a 10,000-character cap. Footer: 'All ranks, Elo and board prices per Artificial Analysis; Qwen rate card not readable.'

控制聲音計分板,完整版

• 盲測偏好、配對複製語音——Qwen-Audio-3.1-TTS-Plus 排名第 1,Elo 1,178,每百萬字元 $19.30;相較之下,Eleven v4 排名第 2,Elo 1,157,$80.00。

• 盲測偏好,各廠商自家語音 — Eleven v4 排名第 1,Elo 1,319;Qwen-Audio-3.0-TTS-Plus 排名第 4,Elo 1,258。反向差距 61 分。

• 價格、競技場標準化 — Qwen $19.30 對比 Eleven v4 $80.00。Qwen 便宜 76%。

• 價格、供應商價目表 — Eleven v4 每千字元 $0.022 促銷價,10 月 12 日之後為 $0.08。Qwen Audio 3.1 自身的價目表我們無法讀取,所以競技場標準化是我們唯一能比較的價格。

• 每塊板上的版本 — Controlled Voice 為 3.1,Provider Voice 為 3.0。它們是不同的型號,且這些板子無法互換。

• Controlled Voice 上的 3.0 項目——排名第 5,Elo 1,124,同樣 $19.30 價格。3.1 版本在相同價格下,比自身前代多出 54 Elo。

• Qwen 在 Provider Voice 上的較早世代——Qwen3 TTS Flash 排名第 79,Elo 944;Qwen3 TTS 排名第 82,Elo 930。

• ElevenLabs 自家先前的 Controlled Voice 旗艦——Eleven v3,排名第 7,Elo 1,073。

• 分組長條圖的合理性檢查——在 Controlled Voice 上,從第 1 名到第 10 名的八向差距為 121 Elo。Qwen 領先 Eleven v4 的 21 分,不到整個領域範圍的五分之一,這正是適合維持這個領先幅度的尺度。

A screenshot of the Artificial Analysis Controlled Voice Arena leaderboard, captured in English, showing Alibaba Qwen-Audio-3.1-TTS-Plus first at Elo 1,178 and $19.3 per 1M chars with 1,269 samples, ElevenLabs Eleven v4 second at Elo 1,157 and $80.0 with 1,483 samples, Cartesia Sonic 3.6 fourth at Elo 1,138, and Alibaba Qwen-Audio-3.0-TTS-Plus fifth at Elo 1,124 at the same $19.3 price, over the page subtitle 'Compare Text to Speech (TTS) models using the same 8 cloned voices (4 US, 4 UK)'.

那裡有兩列發揮了主要作用。第一列是 3.0 對比 3.1 的比較:阿里巴巴在一次版本更新中推進了 54 Elo,卻完全沒有改變價格。這比 ElevenLabs 從 v3 到 v4 的 84 點躍升節奏更快,也意味著本文中的具體排名順序只是個快照,而兩家供應商都正在積極變動。

第二個是總分差距達 121 分。在一個有效範圍約 120 分的排行榜上,21 分的落差雖是真實存在的差異,但幅度不算大——大致相當於 Qwen 自家 3.1 與 3.0 之間的差距量級。如果你的使用情境落在兩個模型都未針對其調校的語言,那麼這點差距完全落在只要幾份刁鑽測試腳本就能翻盤的範圍內。

沒有人指出的版本問題

以「Eleven v4 在 Controlled Voice 排名第二」流傳的結果既準確又不完整,而這項遺漏對任何據此規劃的人來說都很重要。在那個榜上位於 Eleven v4 之上的模型,是阿里巴巴的 3.1 版本。與此同時,Provider Voice 榜上的 Qwen 項目則是 3.0 版本——就我們所讀到的,3.1 模型並未出現在該榜單的前列。因此這兩個標題——「Eleven v4 排名第一」與「Eleven v4 排名第二」——是關於兩個不同任務上兩個不同 Qwen 模型的陳述,而在其中一個榜上擊敗它的 Qwen 版本,並非它在另一個榜上擊敗的那個 Qwen 版本。

這不是在抓兩家供應商哪一方的把柄;這反而是讓你不該信任任何用一句話總結這樣一週的說法的理由。如果你正在這兩套系統之間做選擇,你真正想要的比較,是在你自己的複製語音、你自己的語言上,用 3.1 對比 v4,而兩家供應商都沒有公布這樣的比較。

關於 Qwen Audio 3.1,我們可以說什麼、不能說什麼

在這裡,對證據保持誠實比一份完整規格表更有價值,因此以下是本文所依據的界線。從競技場排行榜中,我們取得 Qwen-Audio-3.1-TTS-Plus 的資料:受控語音的 Elo 為 1,178、每百萬字元 19.30 美元的價格標準化,以及它是同一系列中目前發行的版本,而前一版在相同價格下得分低了 54 分。

我們沒有,也不會去猜測:它的語言涵蓋範圍、它的延遲、它每次請求的輸入上限、它是否支援內嵌的演繹指令、它是否提供超出競技場八種聲音的語音複製,或它自家費率表上的計費方式。這些在 Eleven v4 上都有記載——90 多種語言、10,000 字元上限、音訊標籤、十秒即時複製、IPA 音素支援——而 Qwen 這一邊缺少這些,是公開可讀取資訊中的空白,而不是對該模型的扣分。只根據這篇文章做出的購買決定,會是根據兩個數字做出的決定。

A screenshot of Artificial Analysis' Eleven v4 model page, captured in English, headed 'Eleven v4 Quality Elo, Speed & Price Analysis' and labelled 'ElevenLabs, Family ElevenLabs, Elo 1318.77', with the Provider Voice Arena Preference Elo chart showing Eleven v4 first at 1,319 ahead of Sonic 3.6 at 1,276 and Gemini 3.8 Flash TTS at 1,267, a '27 of 96 models' selector, and the Pricing section heading below.

有一項對比確實不受這項限制影響,因為兩邊都是廠商陳述的,或兩邊都是榜單陳述的。在價格上,榜單標準化是共同的比較基礎,而這讓 Qwen 取得 76% 的優勢。在匹配語者下的品質上,同一份榜單讓 Qwen 以 21 Elo 領先。這兩列可以相比。這裡其餘的都不能,而本文不會假裝它們可以。

為何受控董事會應比平時更具分量

大多數語音比較往往會預設採用那個把你已經喜歡的模型排在首位的排行榜。但在這場對決中,偏好 Controlled Voice 有個有原則依據的理由,而且這個理由是具體的,而非籠統的。

Alibaba 和 ElevenLabs 正以截然不同的資產相互競爭。ElevenLabs 的優勢是多年精心策劃選角所建立起來的語音庫;Alibaba 的優勢則是一個以快速節奏推出模型版本的研究機構。一個讓每位參賽者帶上自家語音的排行榜,衡量語音庫的程度不亞於衡量合成器,而在那個排行榜上,ElevenLabs 以 61 分勝出。把語音庫拿掉——所有人用同樣八個複製人聲——優勢就會易主。如果你的使用者聽到的聲音,是複製某個特定人物而來的,你買的就不是 ElevenLabs 的語音庫,因此受控排行榜才是能描述你這筆購買的排行榜。如果你是從現成語音選單中挑選,情況正好相反,而 Eleven v4 的 61 分差距才是真正關鍵的數字。

賦予受控結果更高權重,還有第二個、較不令人自在的理由。廠商語音排行榜會獎勵具特色的預設配音陣容,而具特色的陣容可能會以平均 Elo 所掩蓋的方式造成兩極化評價——某位聽眾覺得有個性,另一位卻覺得矯揉造作。採用配對說話者的克隆語音排行榜則完全移除了這個變數,這使它成為兩者中更具可重現性的量測。

執行其中任一個,以及我們實際上路由的內容

OrcaRouter 既不託管 ElevenLabs 的語音模型,也不託管 Alibaba 的語音模型。這兩家廠商都不在我們的目錄中,因此無法透過我們呼叫其中任何一家,本文也不會暗示可以這麼做——無論是哪一家,你都得前往廠商自家的 API 和幾個第三方平台。

我們涵蓋的是更上層的部分。如果你的語音堆疊只是更大流程中的一個節點,我們提供單一 API 金鑰背後的 200 多個模型,並以 0% 加價直接傳遞供應商的定價,因此任何上游的價格調整——包括 ElevenLabs 的促銷期,以及 10 月 12 日隨之而來、高出許多的定價——都會在發生當天就反映在我們這邊,而不是等到下一個計費週期。對於取決於 4 倍價比的決策而言,這個時間差就是決定一份比較會經得起時間考驗,還是三週後就顯得錯誤的關鍵。

而當語音路徑無法下行時,自動容錯移轉會把流量導向健康的上游,而不是讓請求失敗。在這場品質如此接近、價格卻如此懸殊的對決中,合理的架構是把兩個模型放在同一個端點之後,由路由來決定分配比例——而不是根據排行榜快照做出永久性的選擇,因為兩家供應商都會在一個季度內讓那份快照失效。

判決,及其有效期限

如果你正在複製語音且在意成本,就選 Qwen-Audio-3.1-TTS-Plus。它在固定說話者的排行榜上排名第一,價格大約只要四分之一,而且它的走勢上升得更快——在價格不變的情況下,一個版本迭代就提升 54 Elo,這表示下一個版本比目前版本在紙面上更值得押注。

如果你的使用者聽到的是內建語音、如果你需要在出貨前能驗證的語言涵蓋範圍,或者如果已記載的功能集——音訊標籤、音素控制、10,000 字元請求、十秒複製——正在你的產品中發揮競技場排行榜未能衡量的作用,那就選擇 Eleven v4。它在供應商語音排行榜上領先 61 分,這絕非無足輕重,而你能寫進腳本的那兩項功能是能力,不是分數。

訂定檢視日期。阿里巴巴在本週期的一次版本更新中提升了 54 Elo,而 ElevenLabs 在完整一個世代的跨度中提升了 84,且 Eleven v4 的優惠價將於 10 月 12 日到期。無論這份比較今天呈現什麼結果,最可能讓它翻盤的兩個事實——3.2 版發布與價格回調——都會在本季結束前發生。