一張生成的 Hero Card,標題為「HeyGen Voice vs ElevenLabs」,其中一行文字對比在受控複製語音競技場上登上新科第一的表現,以及在前十五名中佔有五個名次的該供應商,資料來源為 Artificial Analysis,2026年10月9日。OrcaRouter 標誌出現在右下角。
Guides & Insights

HeyGen Voice 對決 ElevenLabs:克隆語音的新科第一,以及仍稱霸榜單的廠商

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

HeyGen Voice 在 2026 年 10 月 9 日以 1,202 Elo 登上 Artificial Analysis 的 Controlled Voice arena 第一名,而它從該位置擠下的模型是 ElevenLabs 旗下的一員:Eleven v4 Turbo,如今以 1,167 位居第三。這是頭條,而且準確無誤。它同時也是一句比聽起來小得多的陳述,因為同一家廠商的模型在同一張受控排行榜上佔據第二、第三、第四、第十一和第十五名,而 Eleven v4 Turbo 在規模大得多的 Provider Voices arena 上仍以 1,328 Elo 穩居第一——領先 HeyGen Voice 126 分,而 HeyGen Voice 在該榜上根本沒有名次。一款引擎贏下一張榜。該廠商仍主宰這個類別。

同一家廠商現在占了前十五名中的五個

受控評測板將語音維持固定不變——八個複製的參考語音,四個美式、四個英式——因此每一項都取決於引擎如何處理一個它無從選擇的語音。該評測板目前顯示:HeyGen Voice 1,202、Qwen-Audio-3.1-TTS-Plus 1,186、Eleven v4 Turbo 1,167、Eleven v4 1,160、Sonic 3.6 1,143、Realtime TTS-2 1,143。再往下,Eleven v3 位於 1,072,v3 Conversational 位於 1,056。

在該領域前十五名中,有五個條目帶著相同的廠商名稱。而在排行榜上擁有唯一最佳模型的競爭對手,則有五個好模型,橫跨兩個世代、兩個價位,外加一個完全屬於不同產品的對話式變體。這就是從排行榜領先地位內部看,在位者所呈現的樣子,也是為什麼 #1 首次登場值得一則頭條,而不是一份遷移計畫。

ElevenLabs 模型究竟是什麼

Eleven v4 Turbo 在供應商自家的文件中被描述為即時語音合成的最先進模型,推薦用於客服人員、AI 助理與互動角色,可透過 Text to Dialogue websocket、以模型識別碼eleven_v4_turbo存取。ElevenLabs 表示其中位推理延遲約為 100 毫秒——此為供應商自行回報的數字,且同一頁面的註腳已將應用程式與網路延遲排除在外,因此這是模型引擎的數字,而非往返延遲的保證。

v4 系列的語言涵蓋範圍在這項比較中遙遙領先:超過 90 種語言,從南非荷蘭語和阿拉伯語,到粵語、印地語、日語、華語和祖魯語都有。HeyGen 自家的文件列出 300 多種預建語音,涵蓋「數十種語言」,但未公布具體數量;這是另一種描述目錄的方式,無法直接與語言數字相提並論。

接著還有完全不會出現在排行榜上的部分:語音庫、穩定性與相似度控制項、每次請求的微調,以及十年的整合介面。模型比較不等同於平台比較,而 ElevenLabs 的參賽項目在兩者上都有競爭力。

A generated two-column scoreboard titled 'HeyGen Voice vs ElevenLabs — the scoreboard'. Rows compare controlled-voice Elo, provider-board Elo, published price per 1M characters, stated latency, language coverage and how many tiers each vendor holds in the controlled top fifteen, with HeyGen Voice at 1,202 in first on the controlled board and Eleven v4 Turbo at 1,328 in first on the provider board. A footer separates vendor-published rates from the arena's derived conversion of credit pricing. The OrcaRouter logo appears in the bottom-right corner.

計分板

• 受控語音 Elo — HeyGen Voice:1,202(#1)。Eleven v4 Turbo:1,167(#3)。Eleven v4:1,160(#4)。

• 供應商語音 Elo — Eleven v4 Turbo:1,328(96 個中排名第 1)。HeyGen Voice:未列入排名。

• 每 100 萬字元公佈價格 — Eleven v4 Turbo:$40.00。Eleven v4:$80.00。HeyGen Voice:$30.00,係依 arena 本身對 HeyGen 點數定價的換算;HeyGen 本身並未公佈語音費率。

• 宣稱延遲 — Eleven v4 Turbo:推論中位數約 100 毫秒,不含應用程式與網路延遲(供應商提供)。HeyGen Voice:未公布數據。

• 語言涵蓋範圍 — ElevenLabs v4 系列:90+ 種語言(供應商文件)。HeyGen Voice:「數十種語言」,未公布具體數量。

• 受控前十五名中的模型——ElevenLabs:五個層級。HeyGen:一個。

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' with HeyGen Voice first at 1,202 Elo, Qwen-Audio-3.1-TTS-Plus second at 1,186, Eleven v4 Turbo third at 1,167, Eleven v4 fourth at 1,160 and Sonic 3.6 fifth at 1,143, plus samples, release dates and per-1M-character API pricing columns.

兩塊板之間的間隙才是有趣的數字。

Eleven v4 Turbo 在 Provider Voices 排行榜上領先 HeyGen Voice 161 分,但在受控排行榜上落後它 35 分。這兩個數字都來自同一個網站、同一套盲聽方法,以及同一段期間。兩者之間的差異,在於聲音。

在供應商榜單上,每家廠商都提供自家原生語音,因此一家花費多年建立並精心策劃語音庫的公司,得以派出最強陣容。在受控榜單上,這項優勢消失了——引擎必須渲染一個它並非自行挑選的克隆語音。兩項結果之間196點的落差,實際上衡量了 ElevenLabs 的地位有多少來自語音,而非引擎。這占了很大一部分。但它也不是零:1,167 仍是四十二者中的第三名。

對買家而言,這對應到一個具體問題。如果你是從供應商的語音庫中挑選語音,供應商排行榜就是你的排行榜,而 ElevenLabs 在該榜上的地位無可撼動。如果你要複製特定說話者的聲音,受控排行榜就是你的排行榜,而本週它的榜首出現了一個新名字。

現任者的成本尚未改變

Eleven v4 Turbo 在供應商 API 上的價格是每百萬字元 40 美元,而較舊的 Eleven v4 是 80 美元——價格是兩倍,卻是在受控排行榜上得分低七個 Elo 分的模型。這種同一供應商內部的價差值得停下來想一想:同一家公司的兩款模型,價格相差 2 倍,排名相差三個名次。

在價格比較中,HeyGen 那一邊確實存在,但不是以 HeyGen 已公布的形式存在。該競技場將其列為每百萬字元 30.00 美元——比它所取代的 ElevenLabs 級距低十美元,且是較舊的 Eleven v4 之 80 美元的 62%——但這個數字是 Artificial Analysis 的換算,不是供應商報價:HeyGen 的公開定價頁面販售點數(600 點為每月 29 美元、1,000 點為 49 美元、1,500 點為 149 美元),並記載用量會因模型、時長與複雜度而異,卻未說明語音費率。因此,這款複製語音評分較高的挑戰者,在一個在位者不必推導出的數字上,定價比在位者低了四分之一。

A screenshot of Artificial Analysis's Provider Voice Arena leaderboard, captured 10 October 2026, showing Eleven v4 Turbo first at 1,328 Elo, Eleven v4 second at 1,320, Qwen-Audio-3.1-TTS-Plus third at 1,296 and Sonic 3.6 fourth at 1,280, with samples, release dates, 8-voice arena badges and API pricing columns.

每一方實際上在哪裡勝出

當廣度是限制條件時,就選 ElevenLabs。九十多種語言、受控排行榜上的五個排名層級、成熟的語音庫,以及一個每百萬字元定價 50 美元、在受控排行榜上名列第十五的對話式版本——這樣的組合很難在其他地方湊齊,而這也是為什麼該供應商在丟掉第一名的寶座後,領先地位仍能維持。

測試 HeyGen Voice 在約束條件是「一致性」時的表現。單一講者、數千行台詞,一個每一次都必須聽起來像那位講者的克隆——這正是受控競技場所模擬的實際工作負載,而 HeyGen Voice 目前是這方面得分最高的引擎。針對這項任務,相關產品是以二十多分鐘音訊訓練而成的專業克隆路徑,而不是從單一錄音即刻生成的克隆。

不要將 1,202 解讀為 HeyGen Voice 普遍勝過 ElevenLabs 的證據。它只在一個排行榜上勝過 ElevenLabs 的其中一個等級。另外三個等級與它相差在 42 分以內,而另一個排行榜的榜首則領先它 126 分。

在沒有遷移的情況下測試挑戰者

這裡有價值的地方就在於成本不對稱:換一套語音引擎的建置成本很低,而且一旦出問題,耳朵馬上就聽得出來;反觀現行方案每百萬字元要價 40 美元,讓它繼續處理挑戰者能做得更好的流量,是件所費不貲的事。要解決這點,就是讓兩者跑在同一套整合之後,由你自己的音訊來決定——OrcaRouter 把兩者放在同一組 API 金鑰上,依供應商牌價計費、不加價,所以廠商調價會直接反映在源頭,而不是等到續約才反映;而自動容錯移轉意味著某個語音請求失敗時,會改由另一個引擎接手,而不是就此無聲無息。第一輪測試時,你可以在一小組測試素材上,把流量加權到你耳朵偏好的那個引擎;而路由 DSL 讓你可以在不需第二套用戶端函式庫的情況下,用一個引擎處理預先渲染的旁白,另一個處理互動式對話輪次。

什麼會改變這個故事

HeyGen Voice 進入 Provider Voices 競技場,將能告訴我們,複製語音的領先優勢是否能轉化為具競爭力的原生語音——這正是 ElevenLabs 以 1,328 通過的測試。HeyGen 自家定價頁面上的語音費率,將能把該競技場推導出的 $30.00 變成你能稽核的計算。而再多一個月的投票,將顯示領先 Qwen-Audio-3.1-TTS-Plus 的 16 Elo 究竟是穩定的排序,還是只是一時的快照。這三者中任何一項都可能改變推薦結果;但它們目前都還沒發生,而在發生之前,誠實的總結是:HeyGen Voice 贏得了受控評測板,而 ElevenLabs 仍主導這個類別。