一張產生的主視覺卡片,標題為「HeyGen Voice vs Sesame Preview」,對比一個有文件記載且帶有實測 Elo 的語音 API,與一個沒有公開端點的消費者示範,並標示 Artificial Analysis 的日期 2026年10月9日。OrcaRouter 標誌出現在右下角。
Guides & Insights

HeyGen Voice vs Sesame Preview:你能購買的語音,對比只能與之對話的語音

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

這不是一場模型比較,而假裝它是,會是這裡唯一真正可能犯下的錯誤。HeyGen Voice 是一套 API 引擎——在 Artificial Analysis 的 Controlled Voice 競技場以 1,202 Elo 排名第一,透過 HeyGen 的 v3 端點對外提供,以點數計價販售,只要一段錄音就能複製聲線。Sesame Preview 則是免費的消費級語音助理,你只要打開網頁,對四個具名角色之一說話就能使用;它沒有公開端點、沒有模型識別碼,也沒有任何可以租用的價格。其中一個你能出貨上線。另一個則是你之所以知道好的對話語音聽起來該是什麼樣子,卻永遠不會是你實際部署的東西。

每一個實際上是什麼

Sesame Preview 是對話式語音的示範。你可以透過該公司自家的網站使用它,與 Maya、Miles、Simone 或 Charlie 交談,而這段體驗刻意針對親切感與表達力進行最佳化——公司在說明這些夥伴為何會有這樣的行為時,也表達了這一點。目前它僅支援英文,團隊指出,多語言能力是因為資料污染而偶然出現,且「目前表現還不好」,而擴展到二十種以上語言則是未來計畫。公司自身的說法仍在發展中:「我們還沒做到那一步。」

在示範之下的是 Conversational Speech Model,一種多模態的文字與語音架構,由兩個自迴歸的 Llama 風格 transformer 組成。它推出三種規模——Tiny 具備 1B 主幹與 100M 解碼器,Small 為 3B 與 250M,Medium 為 8B 與 300M——各自以 2,048 個 token 的序列長度(約兩分鐘音訊)訓練五個 epoch,資料涵蓋約一百萬小時、以英語為主的語音。關鍵研究元件以 Apache 2.0 開源,並有對應的 GitHub 儲存庫。而示範——人們真正讚賞的那個東西——並非如此。示範沒有公開 API。

HeyGen Voice 是反向的安排。沒有免費的消費者應用程式可供試用;而是有一套附文件說明的 API,內含語音目錄、語音端點、複製路徑與帳單。你辦不到的是,在瀏覽器裡打開它,然後一時興起就和它對話。

為什麼這兩者還是會被拿來比較呢?

它們之所以被拿來比較,是因為兩者都被舉為合成語音已跨越某道門檻的證據。Sesame Preview 重新定義了人們對對話式音訊聽起來可以多自然的期待——它推出時引發的反應,談的是它聽起來多像真人,而不是文字轉語音引擎。HeyGen Voice 在受控排行榜上的 1,202 分,則是以數字形式傳達同樣的主張:當每個模型都說著同樣八個複製的參考人聲時,它在四十二個參賽項目中拿下第一名。

差別在於之後你能拿這個說法來做什麼。排行榜上的名次是可重現、可測試的,而且附有一個端點。展示所帶來的印象則完全不是如此——而且重要的是,Sesame Preview 根本沒有出現在受控排行榜上,因此沒有 Elo 可以拿來與 1,202 相比。大家想做的比較無法進行,不是因為 Sesame 輸掉了它,而是因為這個模型從未被登錄。

計分板

A generated two-column scoreboard titled 'HeyGen Voice vs Sesame Preview — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Access: documented v3 API with a speech endpoint', 'Price: $30.00 per 1M characters on the arena's conversion of credit pricing', 'Voice selection: 300+ pre-built voices, design and cloning', 'Languages: dozens of languages, count unpublished' and 'Open weights: none'. The Sesame Preview column reads 'Controlled Voice Elo: not listed', 'Access: consumer web and iOS app, no public endpoint', 'Price: free, not purchasable at any price', 'Voice selection: four fixed personas', 'Languages: English only, multilingual underperforming' and 'Open weights: CSM under Apache 2.0 in 1B, 3B and 8B'. A footer notes the arena price is a conversion of credit pricing rather than a vendor-quoted rate.

• 受控語音 Elo — HeyGen Voice:1,202,42 個中排名第 1。Sesame Preview:未列出。

• 存取 — HeyGen Voice:具備官方文件的 v3 API,POST /v3/voices/speech。Sesame Preview:消費端網頁應用程式與 iOS App;沒有公開端點。

• 價格 — HeyGen Voice:依競技場本身對點數定價的換算,每 100 萬字元為 30.00 美元;HeyGen 並未公布語音費率。Sesame Preview:免費,且無論出價多高都無法購買。

• 語音選擇 — HeyGen 語音:300+ 種預建語音、以文字描述設計語音、即時且專業的克隆。Sesame 預覽:四種固定角色。

• 語言 — HeyGen Voice:「數十種語言」,數量未公開。Sesame Preview:僅支援英文,且依該公司自己的說法,目前多語言支援表現不佳。

• 開放權重—— HeyGen Voice:無。Sesame Preview:CSM 以 Apache 2.0 授權釋出,提供 1B、3B 與 8B 三種規模。

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' and the ranked field with HeyGen Voice first at 1,202 Elo and Qwen-Audio-3.1-TTS-Plus second at 1,186; no Sesame entry appears anywhere on the board.

Apache 2.0 的細節才是關鍵

在「沒有 API」這個結論之下,其實還藏著一件事:Sesame 以 Apache 2.0 開源了這個研究模型——那是一種寬鬆授權,共有三種尺寸,其中 1B 變體小到不需要資料中心就能運行。這與那個示範是截然不同的提案,而且這是唯一能讓任何近似 Sesame Preview 聲音的東西,最終進入已出貨產品的途徑。

有兩點但書讓這一切說得誠實。已發布的 CSM 元件是研究產物:該公司指出,這些模型能處理語音內容,卻不處理對話結構,並表示全雙工模型是未來的工作——因此,已發布的權重並不是那種互動體驗。而且,在本機執行的 8B 主幹模型,與託管推論每百萬字元 19.30 美元是截然不同的成本結構;後者是競技場上最便宜的頂尖競爭對手所收取的價格。自行託管沒有按字元計費的帳單,卻有非常真實的按 GPU 小時計費的帳單。

對開發者而言,這會重新定義問題。如果 Sesame Preview 讓你印象深刻的是那段對話,開放權重並不會給你這個。如果讓你印象深刻的是語音模型本身的音質,那他們或許能給——而這件事可以用不同於展示的方式來驗證。

HeyGen Voice 上的發布流程是什麼樣子

實際上的差異就是那些常見的差異。HeyGen 的 API 接受語音選擇、文字,以及選用的 語速(介於 0.5 到 1.5 之間)與 音高(±50 個半音),並附上 BCP-47 地區設定提示。自訂語音有三種取得方式:由描述驅動的設計途徑,可從上限 1,000 字元的提示詞回傳最多三個排序選項;從單一錄音進行即時複製;以及以二十分鐘以上錄音訓練而成的專業複製。語音端點上的引擎篩選條件也接受非 HeyGen 引擎,因此這個平台並非只圍繞自家模型的封閉花園。

那些在 Sesame 這一側都不存在,而這並不是 Sesame Preview 的缺點——這就是它本來的樣子。一個為了展示可能性而最佳化的 demo,不應該附帶 SLA。

不過,帳單才是較不牢靠的那一半。HeyGen 販售點數——600 點每月 29 美元、1,000 點 49 美元、1,500 點 149 美元——並表示用量會因模型、時長與複雜度而異,卻未公布語音費率。競技場所列出的每百萬字元 30.00 美元,是 Artificial Analysis 對那些點數的換算,並非 HeyGen 的報價。因此,你能夠正式推出的模型是有定價的,只不過是建立在別人的算術上——這點支持的是先做一場有節制的試行,而不是對這具引擎的批評。

A screenshot of HeyGen's developer documentation sidebar, captured 10 October 2026, showing the Voice Management group with the entries Voices, Browse Voices, Design a Voice, Voice Clone and Text to Speech.

對於你欣賞的 demo,實際上該怎麼處理

有用的做法,是把 Sesame Preview 所展示的兩件事分開。對話行為——輪流發言、記憶、與某人交談的感覺——是一個尚未發布、也沒有端點的系統所產生的。語音品質則是有 Apache 2.0 權重支持的部分,也是你能用自己的音訊評估、無需徵求任何人許可的部分。

至於介於其間的一切,遷移路徑是最平凡的那一種:先在有 API 與排名的引擎上推出,並且在設計上做到——若 Sesame 的模型真有商業化推出的一天,採用它只是變更組態,而不是改寫。這意味著從第一天起就對語音供應商建立抽象層——單一介面、單一金鑰,引擎由組態選擇。OrcaRouter 的路由層正是為此打造:眾多供應商藏在單一端點之後,以供應商定價提供、不加價;當供應商停滯時自動容錯移轉;還有一套路由 DSL,讓你能替換語音背後的引擎,而不必碰應用程式碼。重點不在於它代管了 Sesame 模型——它並沒有——而在於當你欣賞的語音有一天可以購買時,嘗試它的成本應該只是組態檔案裡的一行。

誠實的成交

Sesame Preview 不是 HeyGen Voice 的競爭對手,也不該被當作競爭對手來評估。它是一個免費、僅支援英文、四人設的示範,卻恰好重新定義了人們對對話式音訊的期待,也恰好釋出了三種尺寸、採用寬鬆授權的研究權重。HeyGen Voice 是唯一一個在固定語音變因的語音排行榜上排名第一的引擎,透過你今天就能呼叫的 API 販售,而價格是你目前還算不出來的。

如果你需要一個能在本季度推出的語音,那麼抉擇並不在這兩者之間——而是在 HeyGen Voice 與競技場上其他有定價的引擎之間。如果你在等 Sesame,那就等權重,而不是等應用程式。