
HeyGen Voice、Controlled Voice TTS Arenaで初登場1位 — クローン音声でQwenとElevenLabsを破る
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
2026年10月9日、Artificial AnalysisはHeyGen VoiceをControlled Voiceアリーナに追加し、このモデルはすぐにその首位に立った。ボード上で評価されたHeyGen初のテキスト読み上げモデルであるHeyGen VoiceはElo 1,202を記録し、1,186のQwen-Audio-3.1-TTS-Plus、1,167のElevenLabsのEleven v4 Turboを上回った。同サイトのオープンなProvider Voicesボードで首位に立つCartesia Sonic 3.6は、ここでは1,143で5位につけている。これは、音声評価における唯一最大の交絡要因を取り除くために作られたリーダーボード上の確かな結果であり、同時に、過大に解釈されやすい非常に特定的な意味を持つ結果でもある。HeyGen Voiceは、8つのクローン参照音声におけるこのアリーナで最高の音声であり、96モデルが載るボード全体で測定された王者ではまだない。
Controlled Voiceボードが測定するもの、そしてそれが重要な理由
Artificial Analysisは2つの音声ボードを運営しており、それぞれ異なる問いに答えます。Provider Voicesアリーナでは、各ベンダーが自社のネイティブ音声——企業が自社を代表するために選ぶ、磨き上げられたデモ音声——を提供でき、それらの音声がどれだけ優れているかでモデルをランク付けします。そのリーダーボードは広範で成熟しています。96件のエントリーがあり、Eleven v4 Turboが1,328 Eloで首位、Cartesia Sonic 3.6が1,280で4位です。
Controlled Voice arena は、より狭い範囲で、そして製品を出荷する誰にとってもより有用なことをしている。そこにあるすべてのモデルは、同じ8つのクローン音声 — 米国4つ、英国4つ — から音声を生成する。そのため、比較は「どちらのマーケティング音声がより良いか」ではなく、「各エンジンが同じ音声、同じテキスト、同じ録音条件をどのように扱うか」である。これは、業界がデモリールではなくエンジンの同一条件比較テストに持つ最も近いものであり、音声をクローンしてTTSモデルに渡すことを計画している場合に重要なボードである。
HeyGen Voiceが今や首位に立っている。Qwen-Audio-3.1-TTS-Plusとの差は16 Elo、Eleven v4 Turboとの差は35で、HeyGenの数値について報告されている95%信頼区間はおよそ1,185~1,219だ。16 Eloは確かな差ではあるが、深い断崖ではない——これほど密集したボードでは、それは1位と2位の違いであって、使えるか使えないかの違いではない。

HeyGen Voice がまだランク付けされていない場所
この結果の正直な限界は、HeyGen Voice が Provider Voices ボードにまったく掲載されていないという点であり、その不在は品質に関するシグナルではない。Artificial Analysis は、モデルはまだ十分な票を得ていないために除外されることがあると指摘している。数日前に登場したばかりで、スコア体系の異なる単一のアリーナしか背景に持たないモデルは、より大きなボードが求めるブラインドリスナーからの投票量をまだ蓄積できていないだけだ。
つまり、2026年10月10日時点で正しい読み取りはこうだ。HeyGen Voiceは、統制されたクローン音声比較において最高位の音声であり、より広い領域に対しては未知数である。この数値から「世界で最高のTTSモデル」を引用する人は、その文が示唆するよりも小さなリーダーボードを引用しているのだ。

Eloを支える2つの数字
• Controlled Voice Elo — HeyGen Voice:1,202(95%信頼区間は概ね1,185~1,219)。Qwen-Audio-3.1-TTS-Plus:1,186。Eleven v4 Turbo:1,167。
• プロバイダー別Voices Elo — HeyGen Voice:未掲載(投票数不足)。Eleven v4 Turbo:1,328で第1位。Sonic 3.6:1,280で第4位。
• 統制条件下での順位 — HeyGen Voice:ランク付けされた42件のエントリ中1位(#42はOpenVoice v2で812)。
• アリーナ基準の価格 — HeyGen Voice: 100万文字あたり$30.00、アリーナ独自によるHeyGenのクレジット価格の換算。Qwen-Audio-3.1-TTS-Plus: 100万文字あたり$19.30。Eleven v4 Turbo: 100万文字あたり$40.00。
• Elo アンカー — Open Audio S1 は 1 の固定基準点であるため、Hey Voice はそこより 202 ポイント上です。
• 他にトップ5に入っているのは? — 1,160のEleven v4と1,143のSonic 3.6が、首位集団に続いてトップ5を完成させている。

HeyGenが実際に出荷したもの
このエントリの背後にあるエンジンは、HeyGenの社内TTSであり、同社のv3 APIで公開されています。GET /v3/voices呼び出しはengineフィルターを受け取り、その値にはorca — HeyGen独自の音声エンジン — が含まれ、starfishやElevenLabs音声へのパススルーも並びます。音声レンダリングはPOST /v3/voices/speechを通じて実行され、リクエストごとの調整ではspeedが0.5から1.5まで、pitchが−50から+50半音まで公開され、BCP-47のlocaleヒントも利用できます。
カタログには、数十の言語にわたる300以上のプリビルド音声が掲載されている。カスタム音声には3つの種類がある。最大1,000文字の説明文から、ランク付けされた最大3つの候補を生成するテキスト・トゥ・ボイス設計、単一の録音から即時クローンを作成するもの、そして20分以上の音声で訓練されたプロフェッショナルクローンだ。最後のものこそ、Controlled Voiceリーダーボードが事実上ストレステストしている部分である——それら8つの参照音声はクローンであり、クローンの品質こそがTTSエンジンの優劣を分ける。
エンジンはドキュメント内でも音声ごとに選択可能として記載されている。つまり、HeyGenは自社モデルを無理に使わせることはない。好みのサードパーティ製音声エンジンがあれば、そのAPI経由でルーティングできる。これはベンダーが自社モデルにヘッジをかけているということであり、HeyGenについて「#1の音声」という主張を読むときには知っておく価値がある。
声を選ぶすべての人にとって、これが変えるもの
制御された音声の結果が出れば、そこから3つの実用的な帰結が導かれる。しかもそのいずれも「すべてを切り替える」ことではない。
まず、あなたのユースケースがクローン化されたブランドボイス——1人の話者、多数のセリフ——であるなら、今読むべきはこのリーダーボードであり、最初に試すべきモデルは HeyGen Voice です。ボイスを一定に保つリーダーボードは、あなたが実際に行うことを測定しています。
第二に、あなたのユースケースが、あなたのクローンではカバーしていない言語でネイティブに聞こえるキャラクターを幅広く演じ分けることなら、Provider Voices ボードとその96件のエントリーが依然として適切な参照先であり、HeyGen Voice はそこではまだランク付けされていません。クローン音声の結果からは、そのエンジンが100種類の異なる声をどう扱うかは何もわかりません。
第三に、価格には今や数字が付いているが、それはベンダーが公表したものではない。アリーナはHeyGen Voiceを100万文字あたり30.00ドルと記載しており、これはHeyGen自身のページでは音声料金に換算されることのないクレジット制度をArtificial Analysisが換算したものだ。これにより、新たな首位はEleven v4 Turboの40.00ドルを下回り、Qwen階層の19.30ドルを上回る——首位のスコアに付いた中位の価格であり、しかも引用ではなく導出されたものだ。
ルーティングの質問
音声選択には、ほとんどのモデル選択にはない特性があります。失敗がエンドユーザーに1音節以内で聞き取れてしまうことです。そのため、移行はテストするのは安く、本番で間違えると高くつきます。新しいエンジンを既存エンジンと同じインターフェースの背後で動かすこと — 単一のAPIサーフェス、単一のキー、プロバイダーの定価をマークアップせずにそのまま通し、リクエストが失敗したときは2番目の音声プロバイダーへ自動フェイルオーバーする — が、8つの参照音声についてのEloチャートの答えではなく、自分の音声についての本当の答えを得る方法です。OrcaRouterのルーティングレイヤーは、まさにそうした形の意思決定のために存在します。挑戦側のモデルにトラフィックの一部を流し、現行モデルは温めておき、新しいモデルが実証されていない期間をフェイルオーバーでカバーするのです。リーダーボードは、どこを見るべきかを教えてくれます。しかし、あなたのスクリプトがどのように聞こえるかは教えてくれません。
次に見るもの
この話に決着をつけるのは2つの数字だ。1つ目は、HeyGen Voice が Provider Voices ボードに入るのに十分な票を集めるかどうか、そして、そのボードをリードしながらコントロールド・アリーナでは後れを取っているモデル、Eleven v4 Turbo の 1,328 に対してどこに位置するかだ。これはまさに、2つのボードが明らかにするために存在するギャップである。2つ目は、HeyGen が自社の音声レートを公表するかどうかであり、そうなればアリーナが導き出した $30.00 を、クレジットから推測するのではなくベンダーの数字と照合できる。両方が存在するまでは、コントロールド・ボードでの #1 デビューは、クローン音声の品質に関する強い主張であり、それ以外のすべてについては未解決の問いである。
