
HeyGen Voice 對決 Cartesia Sonic 3.6:複製語音冠軍迎戰低於 90 毫秒的現任霸主
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
HeyGen Voice 和 Cartesia Sonic 3.6 在 Artificial Analysis 上各自持有不同的第一名主張,而整個比較的關鍵就在兩者之間的落差。HeyGen Voice 以 1,202 Elo 位居 Controlled Voice 競技場榜首——在這個榜單上,每個模型都使用相同的八個複製語音,四個美式、四個英式。Cartesia Sonic 3.6 則以 1,280 Elo 在 Provider Voices 競技場排名第四,在這個榜單中,各家廠商提供自家的原生語音;而 Cartesia 自家網站掛著一個徽章,宣稱在 Speech Arena 與 Speech to Text 排行榜都排名第一,這是廠商自行展示的說法,但目前 Artificial Analysis 的即時排行榜並不支持其位居首位。一個引擎在語音保持不變的測試中勝出,另一個則在反映真實產品預算的測試中領先。
先從每個模型實際上究竟是為了什麼而最佳化開始。
Sonic 3.6 專為以串流方式使用而打造。Cartesia 自家的產品頁面以「90 毫秒內輸出第一個音訊」為主打——這是供應商自行報告、未經重現的數據——同一頁面也描述了一個具備優異串流功能的即時 TTS API。它透過單一模型涵蓋 44 種語言,預設會解讀情緒潛台詞,接受寫入轉錄稿中的非語言提示(例如笑聲),可從大約十秒的音訊複製聲音,將現有音訊本地化為其他語言,並採用自訂發音詞典來處理領域術語和專有名詞。所有這些功能都瞄準同一個客戶:一個能快速回話、並以通話者聽得懂的語言溝通的東西。
HeyGen Voice 的設計是為了以表演的形式被體驗。它是 HeyGen 的自家引擎,透過該公司的 v3 API 對外提供,內建橫跨數十種語言的 300+ 種預建語音,並有三種建立自訂語音的方式——以描述驅動的語音設計,會從上限為 1,000 字元的提示詞回傳最多三個排序選項;從一段錄音進行即時複製;以及以二十分鐘以上訓練的專業級複製。每次請求的調校涵蓋 速度從 0.5 到 1.5,以及 音高達 ±50 個半音。HeyGen 公開資料中完全沒有承諾任何延遲數字。
這種不對稱就是整篇文章的重點。一個模型公布了毫秒數字,卻沒有公布每字元價格;另一個模型公布了價格,卻沒有公布延遲數字。
計分板

• 受控語音 Elo(相同的 8 個複製語音) — HeyGen Voice:1,202,在 42 個中排名第 1。Sonic 3.6:1,143,排名第 5。
• 供應商語音 Elo(原生語音) — HeyGen Voice:未排名,票數不足。Sonic 3.6:1,280,96 個中第 4 名。
• 公佈價格 — Sonic 3.6:每 100 萬字元 $49.00,資料來源為廠商價目表。HeyGen Voice:依該競技場自行對 HeyGen 點數定價所做的換算,為每 100 萬字元 $30.00;HeyGen 本身並未公佈任何語音價格。
• 延遲 — Sonic 3.6:首段音訊延遲低於 90 毫秒(廠商自行報告,未經重現)。HeyGen Voice:廠商未公布任何數據,Artificial Analysis 亦未進行測量。
• 語言 — Sonic 3.6:單一模型可支援 44 種。HeyGen Voice:300+ 種語音,涵蓋「數十種語言」,未以確切數字列舉。
• 自訂語音路徑 — Sonic 3.6:約 10 秒即可完成複製。HeyGen Voice:可依文字描述設計語音、即時複製,或以 20 分鐘以上語音訓練而成的專業複製模型。

正確解讀 Elo 差距
在受控競技場中領先 59 分,到了供應商排行榜卻反轉為落後 137 分,而這種反轉並不矛盾。受控排行榜移除了供應商挑選討喜聲音的能力,並詢問引擎如何處理它未選擇的聲音。HeyGen Voice 贏得了這一點。供應商排行榜問的是供應商自家最佳聲音聽起來有多好,這更接近客戶在銷售示範中聽到的情況——而 Sonic 3.6 在那裡表現出色,在 96 個中排名第四,落後排名第一的 Eleven v4 Turbo 38 分。
這兩個數字都不是普遍適用的真理。如果你正在複製某個特定人物,且需要引擎逼真地呈現那個人,受控結果是更好的預測指標,而 HeyGen Voice 目前領先。如果你是要從語音庫中為必須在大規模下聽起來有辨識度的代理挑選聲音,供應商結果是更好的預測指標,而 Sonic 3.6 有排名,HeyGen Voice 則沒有。
值得提醒任何仍持有較舊數據的人:這兩個排行榜都會隨著票數累積而變動。2026 年稍早,Sonic 3.6 曾被報導在受控語音榜上直接領先;目前榜單顯示它在那裡以 1,143 分排名第五,上方有 HeyGen Voice、Qwen-Audio-3.1-TTS-Plus,以及兩個 Eleven v4 層級。排行榜引用只是一個時間戳,而不是模型的永久屬性。
定價比較失效之處
Sonic 3.6 的每百萬字元 $49.00 價格,是該競技場自身的基準價格,取自供應商在預設設定下公布的 API 費率。這使得每月五位數的音訊帳單,在你寫下一行整合程式碼之前就能計算出來。
HeyGen 的數字比較軟性,但它確實存在。競技場的價格圖表列出 HeyGen Voice 為每百萬字元 30.00 美元——比 Sonic 3.6 低十九美元——而這個數字是 Artificial Analysis 對 HeyGen 點數定價的換算,並非 HeyGen 公布的費率。HeyGen 自家頁面販售點數(Creator 為每月 29 美元、600 點,Pro 為 49 美元、1,000 點,Business 為 149 美元、1,500 點),並明白表示消耗量會因模型、時長與生成複雜度而異,卻從未將這些點數換算成字元數。因此,贏得受控語音排行榜的模型,定價遠低於排名第五的模型,而這個差距是一個推導出來的數字,你會想用自己的文本來確認,而不是靠一份你能查核的價目表。
那不是反對 HeyGen Voice 的論點。那是主張在你負擔得起測量的流量上測試它,因為要了解它在你的流程中真正的成本,唯一的方法就是把你自己的文字透過它跑一遍。
在它們之間做選擇
當語音必須即時應答時,選擇 Sonic 3.6。低於 90 毫秒的首音延遲聲稱、原生串流的 API、單一模型支援 44 種語言,以及——至關重要的是——公開的價目表,使其成為對話式代理、IVR,以及任何「停頓就是錯誤」的情境中風險較低的正式生產選擇。它在受控語音項目中排名第 5 是可敬的表現,而非弱點;而它在更廣泛排行榜上的第 4 名,則是兩個模型之中任何一個所擁有的最強獨立訊號。
當語音必須真正上場表現時,先測試 HeyGen Voice。旁白、品牌口播內容、角色配音,以及任何你正在克隆一位講者、並需要該講者的克隆成為線上最動聽聲音的專案——這正是受控競技場被打造來衡量的任務,而這也正是 HeyGen Voice 剛剛勝出的任務。以二十多分鐘訓練而成的專業克隆路徑,是與十秒即時克隆實質上不同的產品,而它正是與競技場中八個克隆參考語音相符的那一個。
不要單憑一個 Elo 數字就從中挑選。這兩個排行榜在這些模型上意見分歧,這表示排行榜正在告訴你一件真實的事:品質取決於聲音與工作負載,而不只是引擎本身。

兩者都執行但不提交
面對這類分歧,務實的做法是別再把它當成採購決策。把兩個引擎放在同一個介面之後,分流流量,並用自己的音訊來評判——幾行旁白和一個即時代理迴圈,能告訴你的會比五十分 Elo 還多。OrcaRouter 透過單一 API 金鑰,以供應商牌價、無加成地路由兩者,所以你要付的就是供應商自己的價目表,而 Sonic 3.6 的價格變動會當天反映,而不是等到續約時。在這裡,自動容錯移轉比大多數模型替換情況更重要,因為語音供應商若在句子中途停頓,來電者聽得出來;而路由 DSL 讓你可以把一個引擎固定用於延遲敏感的對話輪次,另一個用於預先渲染的旁白,而不必維護兩套整合。
什麼能讓它塵埃落定
兩件事。HeyGen 若公布按字元或按點數計費的語音費率,就能讓這項比較的成本面與品質面同樣具體;而 HeyGen Voice 若累積足夠票數進入 Provider Voices 競技場,就能告訴我們它受控語音的領先優勢在面對原生語音時是否仍能維持——這正是 Sonic 3.6 已在九十六個對手中以第四名通過的考驗。在那之前,Sonic 3.6 是現任者,握有價格與延遲數據;HeyGen Voice 則是挑戰者,擁有更佳的複製語音實證,卻沒有成本數字能與之並列。
