
HeyGen Voice 對決 ElevenLabs:克隆語音的新科第一,以及仍稱霸榜單的廠商
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
HeyGen Voice 在 2026 年 10 月 9 日以 1,202 Elo 登上 Artificial Analysis 的 Controlled Voice arena 第一名,而它從該位置擠下的模型是 ElevenLabs 旗下的一員:Eleven v4 Turbo,如今以 1,167 位居第三。這是頭條,而且準確無誤。它同時也是一句比聽起來小得多的陳述,因為同一家廠商的模型在同一張受控排行榜上佔據第二、第三、第四、第十一和第十五名,而 Eleven v4 Turbo 在規模大得多的 Provider Voices arena 上仍以 1,328 Elo 穩居第一——領先 HeyGen Voice 126 分,而 HeyGen Voice 在該榜上根本沒有名次。一款引擎贏下一張榜。該廠商仍主宰這個類別。
同一家廠商現在占了前十五名中的五個
受控評測板將語音維持固定不變——八個複製的參考語音,四個美式、四個英式——因此每一項都取決於引擎如何處理一個它無從選擇的語音。該評測板目前顯示:HeyGen Voice 1,202、Qwen-Audio-3.1-TTS-Plus 1,186、Eleven v4 Turbo 1,167、Eleven v4 1,160、Sonic 3.6 1,143、Realtime TTS-2 1,143。再往下,Eleven v3 位於 1,072,v3 Conversational 位於 1,056。
在該領域前十五名中,有五個條目帶著相同的廠商名稱。而在排行榜上擁有唯一最佳模型的競爭對手,則有五個好模型,橫跨兩個世代、兩個價位,外加一個完全屬於不同產品的對話式變體。這就是從排行榜領先地位內部看,在位者所呈現的樣子,也是為什麼 #1 首次登場值得一則頭條,而不是一份遷移計畫。
ElevenLabs 模型究竟是什麼
Eleven v4 Turbo 在供應商自家的文件中被描述為即時語音合成的最先進模型,推薦用於客服人員、AI 助理與互動角色,可透過 Text to Dialogue websocket、以模型識別碼eleven_v4_turbo存取。ElevenLabs 表示其中位推理延遲約為 100 毫秒——此為供應商自行回報的數字,且同一頁面的註腳已將應用程式與網路延遲排除在外,因此這是模型引擎的數字,而非往返延遲的保證。
v4 系列的語言涵蓋範圍在這項比較中遙遙領先:超過 90 種語言,從南非荷蘭語和阿拉伯語,到粵語、印地語、日語、華語和祖魯語都有。HeyGen 自家的文件列出 300 多種預建語音,涵蓋「數十種語言」,但未公布具體數量;這是另一種描述目錄的方式,無法直接與語言數字相提並論。
接著還有完全不會出現在排行榜上的部分:語音庫、穩定性與相似度控制項、每次請求的微調,以及十年的整合介面。模型比較不等同於平台比較,而 ElevenLabs 的參賽項目在兩者上都有競爭力。

計分板
• 受控語音 Elo — HeyGen Voice:1,202(#1)。Eleven v4 Turbo:1,167(#3)。Eleven v4:1,160(#4)。
• 供應商語音 Elo — Eleven v4 Turbo:1,328(96 個中排名第 1)。HeyGen Voice:未列入排名。
• 每 100 萬字元公佈價格 — Eleven v4 Turbo:$40.00。Eleven v4:$80.00。HeyGen Voice:$30.00,係依 arena 本身對 HeyGen 點數定價的換算;HeyGen 本身並未公佈語音費率。
• 宣稱延遲 — Eleven v4 Turbo:推論中位數約 100 毫秒,不含應用程式與網路延遲(供應商提供)。HeyGen Voice:未公布數據。
• 語言涵蓋範圍 — ElevenLabs v4 系列:90+ 種語言(供應商文件)。HeyGen Voice:「數十種語言」,未公布具體數量。
• 受控前十五名中的模型——ElevenLabs:五個層級。HeyGen:一個。

兩塊板之間的間隙才是有趣的數字。
Eleven v4 Turbo 在 Provider Voices 排行榜上領先 HeyGen Voice 161 分,但在受控排行榜上落後它 35 分。這兩個數字都來自同一個網站、同一套盲聽方法,以及同一段期間。兩者之間的差異,在於聲音。
在供應商榜單上,每家廠商都提供自家原生語音,因此一家花費多年建立並精心策劃語音庫的公司,得以派出最強陣容。在受控榜單上,這項優勢消失了——引擎必須渲染一個它並非自行挑選的克隆語音。兩項結果之間196點的落差,實際上衡量了 ElevenLabs 的地位有多少來自語音,而非引擎。這占了很大一部分。但它也不是零:1,167 仍是四十二者中的第三名。
對買家而言,這對應到一個具體問題。如果你是從供應商的語音庫中挑選語音,供應商排行榜就是你的排行榜,而 ElevenLabs 在該榜上的地位無可撼動。如果你要複製特定說話者的聲音,受控排行榜就是你的排行榜,而本週它的榜首出現了一個新名字。
現任者的成本尚未改變
Eleven v4 Turbo 在供應商 API 上的價格是每百萬字元 40 美元,而較舊的 Eleven v4 是 80 美元——價格是兩倍,卻是在受控排行榜上得分低七個 Elo 分的模型。這種同一供應商內部的價差值得停下來想一想:同一家公司的兩款模型,價格相差 2 倍,排名相差三個名次。
在價格比較中,HeyGen 那一邊確實存在,但不是以 HeyGen 已公布的形式存在。該競技場將其列為每百萬字元 30.00 美元——比它所取代的 ElevenLabs 級距低十美元,且是較舊的 Eleven v4 之 80 美元的 62%——但這個數字是 Artificial Analysis 的換算,不是供應商報價:HeyGen 的公開定價頁面販售點數(600 點為每月 29 美元、1,000 點為 49 美元、1,500 點為 149 美元),並記載用量會因模型、時長與複雜度而異,卻未說明語音費率。因此,這款複製語音評分較高的挑戰者,在一個在位者不必推導出的數字上,定價比在位者低了四分之一。

每一方實際上在哪裡勝出
當廣度是限制條件時,就選 ElevenLabs。九十多種語言、受控排行榜上的五個排名層級、成熟的語音庫,以及一個每百萬字元定價 50 美元、在受控排行榜上名列第十五的對話式版本——這樣的組合很難在其他地方湊齊,而這也是為什麼該供應商在丟掉第一名的寶座後,領先地位仍能維持。
測試 HeyGen Voice 在約束條件是「一致性」時的表現。單一講者、數千行台詞,一個每一次都必須聽起來像那位講者的克隆——這正是受控競技場所模擬的實際工作負載,而 HeyGen Voice 目前是這方面得分最高的引擎。針對這項任務,相關產品是以二十多分鐘音訊訓練而成的專業克隆路徑,而不是從單一錄音即刻生成的克隆。
不要將 1,202 解讀為 HeyGen Voice 普遍勝過 ElevenLabs 的證據。它只在一個排行榜上勝過 ElevenLabs 的其中一個等級。另外三個等級與它相差在 42 分以內,而另一個排行榜的榜首則領先它 126 分。
在沒有遷移的情況下測試挑戰者
這裡有價值的地方就在於成本不對稱:換一套語音引擎的建置成本很低,而且一旦出問題,耳朵馬上就聽得出來;反觀現行方案每百萬字元要價 40 美元,讓它繼續處理挑戰者能做得更好的流量,是件所費不貲的事。要解決這點,就是讓兩者跑在同一套整合之後,由你自己的音訊來決定——OrcaRouter 把兩者放在同一組 API 金鑰上,依供應商牌價計費、不加價,所以廠商調價會直接反映在源頭,而不是等到續約才反映;而自動容錯移轉意味著某個語音請求失敗時,會改由另一個引擎接手,而不是就此無聲無息。第一輪測試時,你可以在一小組測試素材上,把流量加權到你耳朵偏好的那個引擎;而路由 DSL 讓你可以在不需第二套用戶端函式庫的情況下,用一個引擎處理預先渲染的旁白,另一個處理互動式對話輪次。
什麼會改變這個故事
HeyGen Voice 進入 Provider Voices 競技場,將能告訴我們,複製語音的領先優勢是否能轉化為具競爭力的原生語音——這正是 ElevenLabs 以 1,328 通過的測試。HeyGen 自家定價頁面上的語音費率,將能把該競技場推導出的 $30.00 變成你能稽核的計算。而再多一個月的投票,將顯示領先 Qwen-Audio-3.1-TTS-Plus 的 16 Elo 究竟是穩定的排序,還是只是一時的快照。這三者中任何一項都可能改變推薦結果;但它們目前都還沒發生,而在發生之前,誠實的總結是:HeyGen Voice 贏得了受控評測板,而 ElevenLabs 仍主導這個類別。
