一張自動生成的主視覺卡片,標題為「HeyGen Voice 對上 Qwen-Audio-3.0-TTS」,展示受控語音 Elo 差距達 79 分,並對照兩種每百萬字元的價格;附註說明其中一個價格由廠商公布,另一個則是競技場依點數定價推導換算而來,資料來源為 Artificial Analysis,2026 年 10 月 9 日。OrcaRouter 標誌位於右下角。
Engineering & Research

HeyGen Voice 與 Qwen-Audio-3.0-TTS:你為 Elo 付出的代價是什麼,以及你實際上基準測試的是哪一個 Qwen 層級

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

先做個算術,因為實情不像計分板所示那麼一面倒。Qwen-Audio-3.0-TTS-Plus 在 Model Studio 平台上每百萬字元收費 19.30 美元——這是廠商公布的費率。HeyGen Voice 在 Artificial Analysis 自家的價格圖表上則是每百萬字元 30.00 美元;這個數字是該網站根據 HeyGen 的點數定價推導而來,因為 HeyGen 的公開定價頁面販售點數,卻未說明一次語音生成會消耗多少。與此同時,兩者在受控語音條件下的差距為 79 Elo:HeyGen Voice 在讓全部八個參考語音保持不變的競技場上得分 1,202,Qwen-Audio-3.0-TTS-Plus 則為 1,123。所以,較便宜的模型排名遠遠落後於較好的模型,兩者之間的比率約為 1.55 倍,而且這兩個價格中,只有一個是販售該模型的廠商具名公布的數字。

名字中的陷阱

在做任何那些之前,先選對等級,因為這個系列會欣然讓你對錯誤的模型進行基準測試。這裡有兩個 Alibaba 條目很重要,而且它們不能互換。

Qwen-Audio-3.0-TTS-Plus 是本文的比較對象。它在受控排行榜上拿下 1,123 分——四十二個模型中排名第七——並在 Provider Voices 排行榜上獲得 1,264 分,於九十六個模型中位列第六。它是一款真實、現行的串流 TTS 產品,公開費率為每百萬字元 19.30 美元。

Qwen-Audio-3.1-TTS-Plus 是其後繼等級,而它正是以 1,186 分位居受控排行榜第二的那一個——首次亮相時最接近擊敗 HeyGen Voice 的模型。其價格列為相同的 $19.30,不過阿里巴巴的文件警告,不同的模型版本需要搭配相符的語音,因此「同樣價格、更新等級」並不代表「可直接替換」。

任何讀到「#1 領先 Qwen」的人,接著去評測 Qwen-Audio-3.0-TTS,就會是在測一個比該標題所指模型還弱 63 Elo 的模型。這個層級上的爭議值 63 分,比 HeyGen Voice 與第三名之間的差距還大。

計分板

A generated two-column scoreboard titled 'HeyGen Voice vs Qwen-Audio-3.0-TTS — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Provider Voices Elo: not ranked', 'Price per 1M characters: $30.00, arena conversion of credit pricing', 'Cost of 100 hours of narration: roughly $1,440, derived', 'Voice control: design from a description, instant clone, professional clone' and 'Audio output: speed 0.5 to 1.5, pitch plus or minus 50 semitones'. The Qwen-Audio-3.0-TTS-Plus column reads 'Controlled Voice Elo: 1,123, #7 of 42', 'Provider Voices Elo: 1,264, #6 of 96', 'Price per 1M characters: $19.30 on Alibaba Cloud', 'Cost of 100 hours of narration: roughly $926', 'Voice control: instruction parameter, emotion and language tags, cloning and design' and 'Audio output: PCM, WAV, MP3 and Opus up to 48kHz'. A footer states that the Qwen price is Alibaba Cloud Model Studio's published rate at default settings while the HeyGen figure is the arena's conversion of credit pricing.

• 受控語音 Elo(相同 8 個複製語音) — HeyGen Voice:1,202,在 42 個中排名第 1。Qwen-Audio-3.0-TTS-Plus:1,123,排名第 7。

• 供應商語音 Elo(原生語音) — Qwen-Audio-3.0-TTS-Plus:1,264,在 96 個中排名第 6。HeyGen Voice:未列入排名。

• 每 100 萬字元價格——Qwen-Audio-3.0-TTS-Plus:19.30 美元,由供應商於阿里雲公布。HeyGen:30.00 美元,係依競技場自身的點數定價換算而來;HeyGen 並未公布語音費率。

• 100 小時旁白的成本 — Qwen-Audio-3.0-TTS-Plus:每小時語音約 480,000 個字元,約 926 美元。HeyGen Voice:依該平台 30.00 美元的換算基準,約 1,440 美元——此為推算值,並非報價。

• 語音控制 — Qwen-Audio-3.0-TTS-Plus:指令參數、情緒與語言標籤、語音複製與語音設計。HeyGen Voice:依據不超過 1,000 字的描述進行文字轉語音設計、即時複製,以及以 20 分鐘以上音訊訓練的專業複製。

• 輸出 — Qwen-Audio-3.0-TTS-Plus:支援 PCM、WAV、MP3 與 Opus,最高可達 48kHz,並可調整語速、音調、音量與位元率。HeyGen Voice:每次請求可設定語速 0.5–1.5 及音調 ±50 半音。

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' with HeyGen Voice first at 1,202 Elo, Qwen-Audio-3.1-TTS-Plus second at 1,186 and Qwen-Audio-3.0-TTS-Plus seventh at 1,123, alongside samples, release dates and per-1M-character API pricing columns showing $30.0 and $19.3 respectively.

阿里巴巴的工程實際上為你帶來什麼

Qwen-Audio-3.0-TTS 系列是串流產品,其文件讀起來也是如此。請求透過與 CosyVoice 共用的 WebSocket 協定傳送,並採用 run-task、continue-task 與 finish-task 事件流程,同時伴隨 task-started、result-generated、task-finished 與 task-failed 等回應。北京與新加坡區域的所有 Qwen-Audio-TTS 模型皆支援取消功能,可透過 streaming_cancel()。輸出可達 48kHz,格式包含 Opus,如果你要將音訊送進瀏覽器或電話通話,而非 WAV 檔案,這一點就很重要。

那份文件中有兩個細節很容易被忽略,而太晚才發現的代價卻很高。情感與豐富語言標籤僅適用於 Plus 與 Flash 層級——而非整個系列——而且它們只在單向串流模式下運作。此外,API 金鑰在新加坡與北京區域並不相同,工作區是透過形式如下的 URL 來存取:wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference。區域金鑰平時只是佈建時的細節,直到某天它們演變成一次服務中斷為止。

HeyGen 這邊則是另一種產品形態:POST /v3/voices/speech 負責合成語音,GET /v3/voices會列出引擎篩選條件下的語音目錄,而語音設計則可依一段文字提示回傳最多三個排序後的選項,並附上種子值以確保可重現性。文件也揭露,引擎篩選條件可接受 HeyGen 自家以外的值——因此 HeyGen 會樂於透過它的 API 把你導向第三方語音引擎。一家廠商若把競爭對手的模型做成可選項目,等於是在告訴你它認為自己的強項在哪裡。

A screenshot of HeyGen's public landing page, captured 10 October 2026, showing the headline 'The video you imagine, delivered into your system.' with the line about orchestrating avatars, voices, images, editing, music and assets into deterministic, repeatable renders.

79 Elo 的去向

在受控排行榜上,79 分的差距相當可觀——比 HeyGen Voice 與第二名之間 16 分的差距還大,也大致等於該榜單中第三名與第八名之間的距離。而且,這還只是以單一軸向衡量。

受控競技場複製了八個語音並將其固定不變。它完全未提及 Qwen 所暴露的指令驅動控制介面,未提及透過可取消的 WebSocket 輸出 48kHz Opus,也未提及區域部署。這些都是工程特性,而正是這些原因,讓打造華語客服中心的團隊不會改用一個在八個英語參考語音上得分高出 79 分的模型。

受控結果確實顯示的結論範圍更窄,但仍有用:當兩個引擎都拿到同一個複製語音時,聆聽者更偏好 HeyGen Voice 的合成結果。如果你的產品會複製語音,那就是你的比較軸線。如果你的產品是從語音目錄中挑選一個聲音,並將它串流到通話中,供應商排行榜就更貼近你的實際情境——而在那裡,HeyGen Voice 完全沒有名次,Qwen-Audio-3.0-TTS-Plus 則在九十六個中排第六。

認真看待價格論證

以每百萬字元 19.30 美元計算,Qwen-Audio-3.0-TTS-Plus 大約是 ElevenLabs 40 美元方案成本的一半,也約為 Cartesia Sonic 3.6 的 49 美元方案的 40%。以 100 小時旁白的工作負載來說——在典型語速下約 4,800 萬個字元——這大約是 926 美元。相同用量若採用 Eleven v4 Turbo,約為 1,920 美元;若採用 Sonic 3.6,則約為 2,352 美元。HeyGen Voice 在該競技場的 30.00 美元價位下,落在約 1,440 美元:介於低價方案與兩家既有業者之間,更接近中段而非最高價。

這套算術帶有一個其他項目不需要的但書。19.30 美元是 Alibaba 自己公布的費率。30.00 美元則是 Artificial Analysis 對 HeyGen 從未轉換成字元數的點數制度所做的換算,因此這是善意估算,而非報價。如果真實的每點數字元數比率比圖表假設的更差,那麼 79-Elo 的優勢所付出的代價,就會高於其隱含的 1.55×;若比率更好,代價則更低。一個你必須推斷其價格的模型,是你要在可衡量的一小部分流量上先試行的模型,而不是你要全面標準化的模型。這不是對該引擎的批評——而是在描述 2026 年 10 月 10 日當時可取得的資訊。

決定

當成本與串流基礎架構是決策關鍵時,就選 Qwen-Audio-3.0-TTS-Plus。每百萬字元不到 20 美元、可取消的 WebSocket 並以 48kHz Opus 輸出、具備 instruction 參數與情緒標籤,以及在供應商排行榜上排名第六,使其成為這項比較中最經濟且評分優異的語音。若你想要的是在受控排行榜上真正拿下第二名的模型,就改選 3.1 等級,並在假設能免費替換之前先確認語音清單。

測試 HeyGen Voice,當複製保真度就是產品本身時。單一講者、大量台詞,一個每次都必須是 *那個* 聲音的嗓音——這正是受控評測板所衡量的軸線,也是它領先整個領域的軸線。請為一段量測期編列預算,因為點數計費模式意味著,你得用自己的文本實際跑過,才會知道真實成本,而不是靠閱讀價目表。

而且,如果你的工作負載是中文且即時的,就完全忽略這個比較。這兩個 Elo 分數都不是在你的聲音、你的語言、你的延遲預算下測得的。

保持兩者皆可聯繫

這是少數幾個路由層確實站得住腳、而非事後硬加上去的組合之一。單一 API 金鑰同時涵蓋兩家供應商——以供應商牌價原價直通、不加任何加成,因此阿里雲公告的 19.30 美元就是你實際支付的價格,而 Qwen 的價格若有變動,當天即時生效——這讓你無須在握有證據之前就先選定贏家。自動容錯移轉涵蓋了語音管線中最顯而易見的風險:串流一旦停滯,聽者當場就聽得出來;而路由 DSL 讓你能把大量旁白交給便宜的引擎,把對複製品質至關重要的台詞交給分數高出 79 分的那一個,而且不必維護兩套用戶端函式庫、兩份帳務關係。OrcaRouter 在此的價值不在於它代管了某個語音模型;而在於它讓「弄清楚自己到底想要哪一個」的成本幾乎趨近於零。

未解決的問題

有三件事能讓這件事有定論。HeyGen 自家定價頁面上的語音費率,會把競技場推導出的 $30.00 變成一個你可以稽核的數字。Provider Voices 看板上的一筆 HeyGen 條目,會告訴我們複製語音的領先地位在原生語音面前是否仍能成立——Qwen-Audio-3.0-TTS-Plus 以九十六個中的第六名通過的那項測試。而在更多投票之後,Qwen-Audio-3.1-TTS-Plus 對上 HeyGen Voice 的受控語音結果,會告訴我們 16 Elo 是否是穩定的排序。在那之前:Qwen 是已定價、可串流、排名良好的選項;HeyGen Voice 是分數更高、無法定價的那個;而你拿來做基準測試的層級,比你讀到的標題更重要。