
HeyGen Voice vs Cartesia Sonic 3.6:90ミリ秒未満の王者に挑む、クローン音声のチャンピオン
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
HeyGen VoiceとCartesia Sonic 3.6は、Artificial Analysis上でそれぞれ異なる「ナンバーワン」を主張しており、その比較の全体は両者の間のギャップにこそ宿っています。HeyGen Voiceは、1,202 EloでControlled Voiceアリーナの首位に立ちます。これは、すべてのモデルが同じ8つのクローン音声——米国4つ、英国4つ——を話す部門です。Cartesia Sonic 3.6は、Provider Voicesアリーナで1,280 Eloの4位につけています。ここでは各ベンダーが自前のネイティブ音声を提供しており、Cartesia自身のサイトには、Speech ArenaとSpeech to Textリーダーボードの両方で1位のランキングを主張するバッジが掲載されています。これはベンダーが表示している主張であり、現行のArtificial Analysisの表は首位の座を裏付けていません。一方のエンジンは音声を固定したテストで勝利し、もう一方は制作予算が現実となるテストで首位に立っています。
各モデルが実際に何に最適化されているかから始めましょう
Sonic 3.6はストリームでの利用を前提に構築されている。Cartesia自身の製品ページでは「最初の音声が90ms未満」—ベンダー報告であり、再現されていない—が冒頭に掲げられ、同じページで、ストリーミングを第一級機能として備えたリアルタイムTTS APIについて説明している。単一モデルで44言語をカバーし、感情的な含みをデフォルトで解釈し、文字起こしに書き込まれた笑い声などの非言語的な手がかりを受け付け、約10秒の音声から声をクローンし、既存の音声を他の言語にローカライズし、ドメイン用語や固有名詞向けのカスタム発音辞書を受け入れる。これらの機能はすべて同じ顧客を狙っている。すなわち、通話者が理解できる言語で、すばやく応答するものだ。
HeyGen Voice は、パフォーマンスとして消費されるように設計されています。これは HeyGen の自社開発エンジンで、同社の v3 API を通じて公開されており、数十の言語にわたる 300 以上の既製ボイスと、カスタムボイスへの 3 つのルートを備えています — 説明駆動型の音声設計では、1,000 文字以内のプロンプトから最大 3 つのランク付けされた選択肢が返され、1 回の録音からの即時クローン、20 分以上でトレーニングされたプロフェッショナル クローンがあります。リクエストごとの調整では 速度を 0.5~1.5 の範囲で、ピッチを ±50 半音にわたって調整できます。HeyGen の公開資料には、レイテンシの数値について一切約束されていません。
その非対称性こそがこの記事全体の主題だ。一方のモデルはミリ秒の数値を公表し、1文字あたりの価格は公表していない。もう一方は価格を公表し、レイテンシの数値は公表していない。
スコアボード

• 統制された音声Elo(同じ8つのクローン音声) — HeyGen Voice:1,202、42件中1位。Sonic 3.6:1,143、5位。
• プロバイダーボイスElo(ネイティブ音声) — HeyGen Voice:ランク外、投票数不足。Sonic 3.6:1,280、96件中4位。
• 公開価格 — Sonic 3.6: 100万文字あたり$49.00、ベンダーの料金表による。HeyGen Voice: HeyGenのクレジット価格を当アリーナが独自に換算したもので100万文字あたり$30.00。HeyGen自身は音声の料金を公表していない。
• レイテンシー — Sonic 3.6:最初の音声まで90ms未満(ベンダー報告、未再現)。HeyGen Voice:ベンダーによる公表値も、Artificial Analysisによる測定値もなし。
• 言語 — Sonic 3.6:単一モデルから44言語。HeyGen Voice:「数十の言語」にわたる300以上のボイスで、言語数としては明記されていません。
• カスタム音声パス — Sonic 3.6:約10秒のクローン。HeyGen Voice:テキスト記述からの音声デザイン、インスタントクローン、または20分以上でトレーニングされたプロフェッショナルクローン。

Eloの差を正しく読み解く
制御されたアリーナでの59ポイントのリードは、プロバイダーボードでは137ポイントの劣勢に反転するが、この反転は矛盾ではない。制御ボードは、ベンダーが都合のよい声を選ぶ能力を排除し、エンジンが自ら選ばなかった声をどう扱うかを問う。HeyGen Voiceがそれを制する。プロバイダーボードは、ベンダー自身の最高の声がどれほど優れているかを問うもので、これは顧客がセールスデモで耳にするものにより近い——そしてSonic 3.6はそこで健闘し、96台中4位、首位のEleven v4 Turboに38ポイント差で続いている。
どちらの数値も万能の真実ではない。特定の人物をクローン化し、その人物を説得力をもってエンジンにレンダリングさせる必要があるなら、制御された結果のほうが優れた予測指標であり、現在はHeyGen Voiceがそれをリードしている。エージェント用にライブラリから声を選び、大規模に際立った声にしなければならないなら、プロバイダーの結果のほうが優れた予測指標であり、Sonic 3.6には順位があるが、HeyGen Voiceにはそれがない。
古い数値を持っている人にとっては注目に値します。これらのボードはどちらも、票が積み上がるにつれて変動します。2026年の早い時期には、Sonic 3.6が制御音声ボードで単独首位に立っていると報じられていました。現在の順位表では、そこでは1,143で5位となり、その上にはHeyGen Voice、Qwen-Audio-3.1-TTS-Plus、および2つのEleven v4ティアが並んでいます。リーダーボードの引用はタイムスタンプであり、モデルの恒久的な特性ではありません。
価格比較が破綻する場合
Sonic 3.6の100万文字あたり49.00ドルは、ベンダーが公開しているデフォルト設定でのAPI料金に基づく、この領域における独自のベンチマーク価格です。つまり、統合コードを一行も書く前に、月々の音声費用が5桁に達することを算出できます。
HeyGenの数字はよりあいまいだが、存在はする。アリーナの価格表には、HeyGen Voiceが100万文字あたり30.00ドル——Sonic 3.6より19ドル安い——と記載されており、この数値はArtificial AnalysisがHeyGenのクレジット価格を換算したもので、HeyGenが公表している料金ではない。HeyGen自身のページではクレジットを販売しており(Creatorは月額29ドルで600クレジット、Proは49ドルで1,000、Businessは149ドルで1,500)、消費量はモデル、長さ、生成の複雑さによって異なると明記しているが、それらのクレジットを文字数に換算することは一切していない。したがって、controlled-voiceボードで1位になるモデルは、5位のモデルよりはるかに安く価格設定されており、その差は、監査できる料金表ではなく、自分のテキストで確認したくなる導出値である。
それはHeyGen Voiceに対する反論ではない。むしろ、測定する余裕のあるトラフィックでそれを試すべきだという主張だ。なぜなら、自分のパイプラインにおける実際のコストを知る唯一の方法は、自分のテキストをそれに通してみることだからだ。
それらの中から選ぶこと
音声が応答しなければならないなら、Sonic 3.6 を選ぼう。90ms未満の初回音声という主張、ストリーミングネイティブAPI、1つのモデルで44言語、そして——決定的なことに——公開された料金表が、会話型エージェント、IVR、そして沈黙がバグになるあらゆる用途にとって、より低リスクな本番運用の選択肢にしている。制御音声での第5位は弱みではなく立派なものであり、より広範なボードでの第4位は、どちらのモデルが持つ中でも最も強力な独立したシグナルだ。
音声にパフォーマンスが求められる場合は、まずHeyGen Voiceを試してほしい。ナレーション、ブランドの読み上げコンテンツ、キャラクターボイス、そして1人の話者をクローンし、その話者のクローンが配信に乗る中で最も良い音であることを必要とするあらゆるプロジェクト——それこそが、管理されたアリーナが測定するために構築された仕事であり、HeyGen Voiceがたった今勝ち取った仕事だ。20分以上でトレーニングされたプロフェッショナルクローンの道筋は、10秒のインスタントクローンとは実質的に異なる製品であり、アリーナ内の8つのクローン参照音声と一致するのはこちらだ。
単一のElo数値の強さだけを根拠に、どちらも選ぶな。2つのボードはこれらのモデルについて見解が分かれている。つまり、ボードは何か確かなことを伝えている。品質はエンジンだけでなく、声とワークロードに左右されるのだ。

コミットせずに両方を実行する
このような意見の不一致を乗り切る実践的な道筋は、これを調達の判断として扱うのをやめることだ。2つのエンジンを1つのインターフェースの背後に置き、トラフィックを分割し、自分の音声で判断する——ほんの数行のナレーションとライブエージェントループがあれば、50のEloポイントよりも多くのことが分かる。OrcaRouterは両方を単一のAPIキー経由で、プロバイダーの定価どおり、マークアップなしでルーティングするので、支払うのはベンダー自身の料金表どおりであり、Sonic 3.6の価格改定は更新時ではなく当日に反映される。自動フェイルオーバーは、ほとんどのモデル差し替えの場合よりもここでこそ重要だ。なぜなら、文中で止まってしまう音声プロバイダーは発信者に聞こえてしまうからであり、ルーティングDSLを使えば、2つの連携を維持することなく、遅延に敏感なターンには一方のエンジンを、事前レンダリング済みナレーションにはもう一方を固定できる。
それを解決するものは何だろう
2点あります。HeyGenから公表された文字単位またはクレジット単位の音声料金があれば、この比較のコスト面が品質面と同じくらい具体的になるでしょう。そして、HeyGen VoiceがProvider Voicesのアリーナに入るのに十分な票を集めれば、その制御された音声の優位性がネイティブ音声との接触に耐えられるかどうかがわかるでしょう——それはSonic 3.6が96台中4位で既に通過したテストです。それまでは、Sonic 3.6が価格とレイテンシの数値を備えた現行の王者であり、HeyGen Voiceはより優れたクローン音声の証拠を持ちながら、並べて示せるコストがない挑戦者です。
