一張生成的主視覺卡片,標題為「HeyGen Voice 於 Controlled Voice Arena 首次亮相即登上第一名」,並有這行文字「1,202 Elo — 領先 Qwen-Audio-3.1-TTS-Plus 與 Eleven v4 Turbo」,以及註記「相同的八個複製參考語音 — Artificial Analysis,2026 年 10 月 9 日」。OrcaRouter 標誌出現在右下角。
Guides & Insights

HeyGen Voice 在受控語音 TTS Arena 首次登場即登上第 1 名——在複製語音上擊敗 Qwen 與 ElevenLabs

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

2026年10月9日,Artificial Analysis 將 HeyGen Voice 加入其 Controlled Voice 競技場,該模型直接登上榜首。HeyGen Voice——HeyGen 首個在該排行榜上接受評估的文字轉語音模型——獲得 1,202 Elo,領先 1,186 的 Qwen-Audio-3.1-TTS-Plus 與 1,167 的 ElevenLabs Eleven v4 Turbo。在該網站公開的 Provider Voices 排行榜居首的 Cartesia Sonic 3.6,在此以 1,143 排名第五。這是在一個旨在消除語音評估中最大單一混淆因素的排行榜上取得的真實結果,同時也是一個含義非常具體、卻容易被過度解讀的結果:HeyGen Voice 是在這個競技場中、以八個複製參考語音測試下的最佳語音,但還不是擁有九十六個模型的該排行榜上經實測的冠軍。

Controlled Voice 電路板測量什麼,以及為何它很重要

Artificial Analysis 經營兩個語音排行榜,而它們回答的是不同的問題。Provider Voices 競技場讓各家廠商提供自家的原生語音——也就是公司挑選用來代表自己的精緻示範語音——並依據這些語音聽起來有多出色來為模型排名。其排行榜規模龐大且成熟:共有九十六個項目,Eleven v4 Turbo 以 1,328 Elo 位居榜首,Cartesia Sonic 3.6 則以 1,280 排名第四。

Controlled Voice 競技場做的事範圍更窄,但對任何要推出產品的人來說卻更實用。上面的每個模型都用同樣八個複製聲音來生成語音——四個美式、四個英式——所以比較的重點不是「誰的行銷嗓音比較好聽」,而是「每個引擎如何處理同樣的聲音、同樣的文字和同樣的錄音條件」。這是業界最接近對引擎本身、而非對展示影片進行同類比較的測試,而且如果你打算複製一個聲音並交給 TTS 模型,這正是最要緊的排行榜。

HeyGen Voice 現在領先。它領先 Qwen-Audio-3.1-TTS-Plus 的幅度是 16 Elo,領先 Eleven v4 Turbo 的幅度則是 35 Elo,據報導 HeyGen 分數的 95% 信賴區間大約落在 1,185 到 1,219。16 Elo 是真實的差距,但還稱不上鴻溝——在如此密集的排行榜上,這是第一名與第二名的差別,而不是可用與不可用的差別。

A generated single-column scoreboard titled 'HeyGen Voice — the scoreboard' with rows reading 'Controlled Voice Elo: 1,202', '95% confidence interval: roughly 1,185 to 1,219', 'Rank in the controlled field: #1 of 42 ranked entries', 'Provider Voices Elo: not listed, insufficient votes', "Price on the arena's basis: $30.00 per 1M characters, derived from credit pricing" and 'Elo anchor: the board baseline is 1,000 points', with a footer reading 'Elo per Artificial Analysis, 9 October 2026. Price shown is the arena's conversion of credit pricing.' The OrcaRouter logo appears in the bottom-right corner.

HeyGen Voice 尚未獲得排名的地區

這個結果真正坦白的一點是,HeyGen Voice 根本沒有出現在 Provider Voices 榜上,而它的缺席並不是品質好壞的訊號。Artificial Analysis 指出,模型可能因為尚未累積足夠的票數而被略過。一個才問世幾天的模型,背後只有一個評分方式不同的競技場,根本還沒累積到更大榜單所需的盲聽者數量。

所以,2026 年 10 月 10 日的正確解讀是:HeyGen Voice 是在受控的克隆語音比較中排名第一的語音,但相對於更廣泛的領域仍是未知數。任何根據這個數字引用「世界上最好的 TTS 模型」的人,所引用的榜單都比這句話所暗示的來得小。

A screenshot of Artificial Analysis's Provider Voice Arena leaderboard, captured 10 October 2026, showing the ranked model list with Eleven v4 Turbo first at 1,328 Elo, Eleven v4 second at 1,320, Qwen-Audio-3.1-TTS-Plus third at 1,296 and Sonic 3.6 fourth at 1,280, alongside samples, release dates and API pricing columns and 8-voice arena badges.

Elo 背後的兩個數字

• 受控語音 Elo — HeyGen Voice:1,202(95% 信賴區間約為 1,185–1,219)。Qwen-Audio-3.1-TTS-Plus:1,186。Eleven v4 Turbo:1,167。

• 供應商語音 Elo — HeyGen Voice:未列入(票數不足)。Eleven v4 Turbo:1,328,排名第 1。Sonic 3.6:1,280,排名第 4。

• 在受控領域中的排名 — HeyGen Voice:42 個排名項目中的第 1 名(第 42 名是 OpenVoice v2,得分 812)。

• 依競技場基準的價格 — HeyGen Voice:每 100 萬個字元 $30.00,這是競技場自行換算 HeyGen 點數計價的結果。Qwen-Audio-3.1-TTS-Plus:每 100 萬個字元 $19.30。Eleven v4 Turbo:每 100 萬個字元 $40.00。

• Elo 基準 — OpenAudio S1 是固定參考基準,設定為 1,000 分,HeyGen Voice 則比基準高 202 分

• 還有誰進入前五名——Eleven v4 以 1,160 分、Sonic 3.6 以 1,143 分,緊隨領先者之後補齊前五名。

A screenshot of HeyGen's developer documentation sidebar, captured 10 October 2026, showing the Voice Management group with the entries Voices, Browse Voices, Design a Voice, Voice Clone and Text to Speech, above the Realtime Video and Avatar Management groups.

HeyGen 實際上推出了什麼

這項功能背後的引擎是 HeyGen 自家的 TTS,透過該公司的 v3 API 對外開放。GET /v3/voices 呼叫可帶入engine 篩選條件,其值包括orca——HeyGen 自家的語音引擎——以及starfish,並可轉接至 ElevenLabs 的語音。語音合成則透過POST /v3/voices/speech 執行;每次請求的調校可設定speed(0.5 至 1.5)與pitch(−50 至 +50 半音),並可附上 BCP-47 的locale 提示。

該目錄列出橫跨數十種語言的 300 多款預建語音。自訂語音有三種類型:文字轉語音設計,可從上限為 1,000 個字元的描述生成最多三個排序選項;從單一錄音取得的即時克隆;以及以二十分鐘以上音訊訓練的專業克隆。最後一項正是 Controlled Voice 排行榜實際上進行壓力測試的部分——那八個參考語音都是克隆,而克隆品質正是 TTS 引擎分出高下的地方。

文件中 also 將引擎列為可依語音個別選用,這意味著 HeyGen 並不會強迫你採用它的模型:當你偏好某個第三方語音引擎時,可以透過其 API 轉接過去。這是廠商在為自家模型避險,而當你讀到關於 HeyGen 的「#1 語音」宣稱時,這點值得留意。

這對任何挑選語音的人來說有何改變

受控語音結果落地會帶來三個實際後果,而其中沒有一項是「全部切換」。

首先,如果你的使用情境是複製品牌語音——單一講者、大量台詞——這就是現在該參考的排行榜,而 HeyGen Voice 是第一個該測試的模型。一個將聲音保持不變的排行榜,衡量的正是你實際上會做的事。

其次,如果你的使用案例是需要一大批聽起來像母語者的角色,且涵蓋你的克隆語音並未支援的語言,那麼 Provider Voices 排行榜及其九十六個條目依然是相關的參考依據,而 HeyGen Voice 在那裡尚未取得排名。克隆語音的結果無法告訴你,這個引擎如何處理一百種截然不同的聲音。

第三,價格現在有了一個數字,但並非供應商公布的數字。競技場將 HeyGen Voice 列為每 100 萬字元 30.00 美元,這是 Artificial Analysis 對點數系統的換算,而 HeyGen 自家頁面從未將其換算成語音費率。這使這位新領先者低於 Eleven v4 Turbo 的 40.00 美元,高於 Qwen 級距的 19.30 美元——一個附在第一名分數上的中段價格,而且是推導出來的,而非直接報價。

路由問題

語音選擇有一個大多數模型選擇沒有的特性:失敗在使用者耳中一個音節內就聽得出來。這讓遷移測試成本低廉,但在正式環境中出錯的代價高昂。將新引擎運行在與現有引擎相同的介面之後——單一 API 介面、單一金鑰、供應商定價原樣傳遞而非加價,並在請求失敗時自動容錯切換到第二家語音供應商——這才是針對你自己的音訊得到真實答案的方法,而不是從 Elo 排行榜得到關於八個參考語音的答案。OrcaRouter 的路由層正是為這種決策形態而存在:讓挑戰者承接一小部分流量,保持現有模型持續運作,並讓容錯切換涵蓋新模型尚未驗證的期間。排行榜告訴你該往哪裡看。它無法告訴你你的腳本聽起來如何。

接下來要看什麼

兩個數字將決定這個故事的走向。第一個是 HeyGen Voice 是否能累積足夠的票數,進入 Provider Voices 看板,以及它與 Eleven v4 Turbo 的 1,328 相比會位居何處——這個模型在該看板領先,卻在受控競技場中落後,而這正是這兩個看板存在所要揭露的落差。第二個是 HeyGen 是否會公布自家的語音費率,讓競技場推算出的 $30.00 能夠對照供應商提供的數字來查核,而不是從點數推斷而來。在這兩者都出現之前,在受控看板上以第 1 名首次登場,是關於複製語音品質的強力主張,而關於其他一切則仍是未解的問題。