
HeyGen Voice vs ElevenLabs:クローン音声で新たな首位、そして依然として盤面を支配するベンダー
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
HeyGen Voiceは2026年10月9日、Artificial AnalysisのControlled VoiceアリーナでElo 1,202を記録して首位に立った。その座を追われたモデルはElevenLabsのティア、Eleven v4 Turboで、現在は1,167で3位だ。これがヘッドラインであり、正確でもある。ただし、それは響きほど大きな話ではない。同じベンダーのモデルが同じControlledボードで2位、3位、4位、11位、15位につけており、Eleven v4 Turboははるかに大規模なProvider VoicesアリーナでElo 1,328の首位を維持している — HeyGen Voiceより126ポイント上で、しかもHeyGen Voiceはそこには一切ランクインしていない。1つのエンジンが1つのボードで勝った。それでもカテゴリーを支配しているのは、このベンダーだ。
同じベンダーが今やトップ15のうち5つを占めている。
統制されたボードでは音声を一定にしている——8つのクローン参照音声、米国4つと英国4つ——ため、各エントリーは、エンジンが自ら選べなかった音声をどう扱うかで評価される。そのボードは現在こうなっている:HeyGen Voice 1,202、Qwen-Audio-3.1-TTS-Plus 1,186、Eleven v4 Turbo 1,167、Eleven v4 1,160、Sonic 3.6 1,143、Realtime TTS-2 1,143。さらに下位では、Eleven v3が1,072、v3 Conversationalが1,056につけている。
その分野の上位15件のうち5件が同じベンダー名を冠している。ボード上で一番優れたモデルを1つ持つライバルは、2世代にわたり2つの価格帯で5つの優れたモデルを持ち、さらにまったく別の製品である会話型バリアントも持っている。それが、リーダーボード首位の内側から見た現職者の姿であり、#1デビューが移行計画ではなく見出しに値する理由である。
ElevenLabsのモデルとは実際何なのか
Eleven v4 Turbo は、ベンダー自身のドキュメントで、リアルタイム音声合成のための最先端モデルと説明されており、サポートエージェント、AI アシスタント、インタラクティブキャラクターに推奨され、モデル識別子eleven_v4_turboで Text to Dialogue websocket を通じてアクセスします。ElevenLabs は推論レイテンシの中央値がおよそ 100ms であると述べています——これはベンダーによる報告値であり、同じページの脚注ではその数値からアプリケーションとネットワークのレイテンシが除外されているため、モデルエンジンの数値であって、ラウンドトリップの保証ではありません。
v4ファミリーの言語カバレッジは、この比較の中で断トツで最も広い。90以上の言語をカバーしており、アフリカーンス語やアラビア語から、広東語、ヒンディー語、日本語、北京語、ズールー語まで含まれる。HeyGen自身のドキュメントには、「数十の言語」にわたる300以上のプリビルド音声が掲載されているが、その数は公表されておらず、これはカタログの説明の仕方が異なるということであって、言語数とは直接比較できるものではない。
次に、リーダーボードにはまったく表示されない部分があります。音声ライブラリ、安定性と類似性のコントロール、リクエストごとのチューニング、そして10年にわたる統合サーフェスです。モデル比較はプラットフォーム比較ではなく、ElevenLabsのエントリーはその両方で競合しています。

スコアボード
• コントロールされた音声Elo — HeyGen Voice:1,202(#1)。Eleven v4 Turbo:1,167(#3)。Eleven v4:1,160(#4)。
• プロバイダーボイスElo — Eleven v4 Turbo:1,328(96件中1位)。HeyGen Voice:ランク外。
• 100万文字あたりの公表価格 — Eleven v4 Turbo: $40.00。Eleven v4: $80.00。HeyGen Voice: $30.00(アリーナ独自のHeyGenクレジット価格の換算によるもの。HeyGenは音声料金自体を公表していない)。
• 公称レイテンシー — Eleven v4 Turbo: 推論の中央値は約100ms。アプリケーションおよびネットワークのレイテンシーは含まず(ベンダー報告)。HeyGen Voice: 数値の公開なし。
• 言語対応範囲 — ElevenLabs v4ファミリー:90以上の言語(ベンダー資料)。HeyGen Voice:「数十の言語」と記載、具体的な数は非公開。
• 統制条件下の上位15位に入ったモデル — ElevenLabs:5段階。HeyGen:1段階。

2枚のボードの間のギャップが興味深い数字だ
Eleven v4 Turbo は Provider Voices ボードで HeyGen Voice より 161 ポイント先行し、コントロールボードでは 35 ポイント後れを取っている。どちらの数値も、同じサイト、同じブラインドリスナー方式、同じ期間から得られたものだ。両者を分けているのは声そのものだ。
プロバイダーボードでは、各ベンダーが自社のネイティブ音声を提供するため、何年もかけて音声ライブラリを構築しキュレーションしてきた企業は、自社の最高の音声を投入できる。コントロールボードでは、その優位性は消える——エンジンは、自ら選択しなかったクローン音声をレンダリングしなければならない。2つの結果の間の196ポイントの差は、実質的に、ElevenLabsの地位のどれだけがエンジンではなく音声に由来するかの測定値である。それは大きな割合だ。またゼロでもない。1,167は依然として42社中3位である。
買い手にとって、それは具体的な問いにつながる。ベンダーのライブラリから音声を選ぶなら、あなたの見るボードはプロバイダーボードであり、そこでのElevenLabsの地位は揺るぎない。特定の話者をクローンするなら、あなたの見るボードはコントロールドボードであり、今週はその首位に新しい名前が来ている。
既存のコストは変わっていません
Eleven v4 TurboはベンダーのAPIで100万文字あたり40ドル、旧型のEleven v4は80ドルだ — 統制されたボードではEloスコアが7ポイント低いモデルなのに、価格は2倍。この同一ベンダー内の開きは、少し立ち止まって考えたくなる。同じ会社の2つのモデルが、価格では2倍、順位では3つ離れているのだ。
HeyGen側の価格比較は存在するが、HeyGenが公表した形式ではない。アリーナでは100万文字あたり$30.00と記載されている — それが取って代わったElevenLabsの階層より10ドル低く、旧Eleven v4の$80の62%である — しかしその数字はArtificial Analysisによる換算であり、ベンダーの見積もりではない。HeyGenの公開料金ページではクレジットを販売しており(600で月額$29、1,000で$49、1,500で$149)、消費量がモデル、期間、複雑さによって異なることを記述しているが、音声レートは明記していない。したがって、より優れたクローン音声スコアを持つ挑戦者は、現行製品が導き出す必要のなかった数値で、現行製品より25%安く価格設定されている。

各サイドが実際に勝つのはどこか
幅広さが制約条件なら、ElevenLabsを選べ。90以上の言語、統制ボード上の5つのランク付けされた階層、成熟した音声ライブラリ、そして統制ボードが15位にランク付けする、100万文字あたり50ドルの会話型バリアント — その組み合わせを他で揃えるのは難しく、だからこそこのベンダーのリードは首位の座を失っても生き残ったのだ。
同一性が制約条件であるときの HeyGen Voice をテストする。1人の話者、数千行、毎回その話者と同じに聞こえなければならないクローン——それこそが制御されたアリーナがモデル化する正確なワークロードであり、HeyGen Voice は現在それにおいて最高スコアを出しているエンジンだ。20分以上の音声で学習するプロフェッショナルクローンの経路がその仕事に適した製品であり、単一の録音からのインスタントクローンではない。
1,202を、HeyGen Voiceが一般的にElevenLabsを上回る証拠と受け取らないでください。それは1つのボードで、ElevenLabsの1つのティアに勝っているにすぎません。ほかの3つのティアはそれから42ポイント以内にあり、もう一方のボードの首位はそれより126ポイント先行しています。
マイグレーションなしでチャレンジャーをテストする
ここで役立つのがコストの非対称性だ。音声の差し替えは構築が安く、失敗すればすぐ耳でわかる。一方、100万文字あたり40ドルの既存ベンダーを、挑戦者のほうがうまく処理できるトラフィック上で走らせ続けるのは高くつく。これを解決するには、両方を1つの統合の背後で動かし、自分の音声に判断させればよい——OrcaRouterは両方を単一のAPIキーで、プロバイダーの定価のまま上乗せなしで提供するので、ベンダーの料金改定は契約更新時ではなく大元で反映され、自動フェイルオーバーにより、失敗した音声リクエストは無音になるのではなくもう一方のエンジンにフォールスルーする。最初の試しでは、小さなフィクスチャ上で、自分の耳が好むエンジンにトラフィックを重み付けしてよい。また、ルーティングDSLを使えば、事前レンダリング済みナレーションには一方のエンジン、インタラクティブなターンには他方のエンジンを、2つ目のクライアントライブラリなしで使い分けられる。
この物語を変えるものは何でしょうか
HeyGen VoiceがProvider Voicesアリーナに参入すれば、クローン音声での優位性が競争力のあるネイティブ音声につながるかどうかがわかるだろう——ElevenLabsが1,328で通過しているテストだ。HeyGen自身の料金ページに音声レートがあれば、アリーナが導出した$30.00は、監査可能な計算になる。そして、もう1か月分の投票があれば、Qwen-Audio-3.1-TTS-Plusを16 Elo上回る状態が安定した順位付けなのか、それともスナップショットなのかが示される。3つのうちどれでも推薦を動かし得る。まだそのどれも起きていない。そしてそれが起きるまでの正直な要約は、HeyGen Voiceがボードを制し、ElevenLabsが依然としてこのカテゴリーを支配している、というものだ。
