「HeyGen Voice vs Sesame Preview」と題された生成ヒーローカードは、測定されたEloを持つ文書化された音声APIと、公開エンドポイントのないコンシューマー向けデモを対比しており、2026年10月9日というArtificial Analysisの日付が記されています。OrcaRouterのロゴは右下隅に表示されます。
Guides & Insights

HeyGen Voice vs Sesame Preview:購入できる音声 対 話しかけることしかできない音声

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

これはモデル比較ではない。そして、そうでないふりをすることだけが、ここで犯し得る唯一の本当の誤りだ。HeyGen VoiceはAPIエンジンだ——Artificial AnalysisのControlled VoiceアリーナでElo 1,202の首位にランクされ、HeyGenのv3エンドポイント経由で公開され、クレジット単位で販売され、1回の録音からクローン作成可能だ。Sesame Previewは、Webページを開いて、名前の付いた4つのペルソナの1つに話しかけることで利用できる無料のコンシューマー向け音声アシスタントであり、公開エンドポイントも、モデル識別子も、レンタルできる価格もない。そのうち一方は出荷できる。もう一方は、良い会話音声とはどんなものかをあなたが知っている理由であり、決してあなたがデプロイするものではない。

それぞれが実際に何なのか

Sesame Previewは会話音声のデモンストレーションだ。同社自身のサイトを通じてアクセスし、Maya、Miles、Simone、Charlieと話すことができ、その体験は親しみやすさと表現力のために意図的に最適化されている——コンパニオンがなぜそのように振る舞うのかを説明する際、同社はそう明言している。現在は英語のみで、チームは多言語能力はデータ汚染によって偶発的に現れるもので、「まだ十分に機能しない」と指摘し、20言語を超えて拡大することは将来の計画だと述べている。同社自身の位置づけは進行中の取り組みだ:「まだそこには到達していない」。

デモの土台にあるのは Conversational Speech Model です。これは 2 つの自己回帰型 Llama スタイルのトランスフォーマーから構築された、マルチモーダルなテキスト音声アーキテクチャです。3 つのサイズで提供されています — Tiny は 1B バックボーンと 100M デコーダー、Small は 3B と 250M、Medium は 8B と 300M — いずれも 2,048 トークンのシーケンス長、およそ 2 分の音声で、ほぼ英語の約 100 万時間の音声データを 5 エポックにわたって学習しています。主要な研究コンポーネントは Apache 2.0 のもとでオープンソース化されており、それら用の GitHub リポジトリがあります。デモ — 人々が実際に称賛しているもの — はそうではありません。デモには公開 API がありません。

HeyGen Voiceは逆の仕組みだ。試せる無料のコンシューマー向けアプリはない。あるのは、音声カタログ、音声エンドポイント、クローン作成の経路、そして請求書を備えた、文書化されたAPIだ。できないのは、ブラウザで開いて気まぐれにそれと会話することだ。

そもそもなぜその2つが比較されるのか

これらが比較されるのは、どちらも合成音声がある一線を越えた証拠として持ち出されているからだ。Sesame Preview は、会話音声がどのように聞こえうるかについての期待を一新した。登場したときの反応は、テキスト読み上げエンジンというより、どれだけ人間らしく聞こえるかに関するものだった。統制されたボードでの HeyGen Voice の1,202は、同じ主張を数値の形で表したものだ。すべてのモデルが同じ8つのクローン参照音声を話すなかで、42件のエントリー中1位である。

違いは、その後その主張をどう扱えるかにある。ボード上の位置は再現可能で、検証可能で、エンドポイントに紐づいている。デモの印象はそのどれでもない。そして重要なことに、Sesame Preview は管理されたボードにまったく登場しないため、1,202 と比較できる Elo は存在しない。人々が望む比較は利用できない。それは Sesame がそれを失ったからではなく、そのモデルがそもそも登録されなかったからだ。

スコアボード

A generated two-column scoreboard titled 'HeyGen Voice vs Sesame Preview — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Access: documented v3 API with a speech endpoint', 'Price: $30.00 per 1M characters on the arena's conversion of credit pricing', 'Voice selection: 300+ pre-built voices, design and cloning', 'Languages: dozens of languages, count unpublished' and 'Open weights: none'. The Sesame Preview column reads 'Controlled Voice Elo: not listed', 'Access: consumer web and iOS app, no public endpoint', 'Price: free, not purchasable at any price', 'Voice selection: four fixed personas', 'Languages: English only, multilingual underperforming' and 'Open weights: CSM under Apache 2.0 in 1B, 3B and 8B'. A footer notes the arena price is a conversion of credit pricing rather than a vendor-quoted rate.

• Controlled Voice Elo — HeyGen Voice:1,202、42件中1位。Sesame Preview:記載なし。

• アクセス — HeyGen Voice: 文書化された v3 API、POST /v3/voices/speech。Sesame Preview: コンシューマー向けウェブアプリおよび iOS アプリ。公開エンドポイントなし。

• 価格 — HeyGen Voice:アリーナ独自のクレジット料金換算で100万文字あたり$30.00。HeyGenは音声の料金を公表していない。Sesame Preview:無料で、いくら払っても購入できない。

• 音声の選択 — HeyGen Voice: 300種類以上の既成ボイス、テキストで指定するボイスデザイン、インスタントおよびプロ品質のクローニング。Sesame Preview: 4つの固定ペルソナ。

• 言語 — HeyGen Voice:「数十の言語」、正確な数は非公開。Sesame Preview:英語のみで、多言語サポートは同社自身の説明によれば現時点では十分な性能を発揮していない。

• オープンウェイト — HeyGen Voice:なし。Sesame Preview:CSMはApache 2.0の下、1B、3B、8Bのサイズで公開。

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' and the ranked field with HeyGen Voice first at 1,202 Elo and Qwen-Audio-3.1-TTS-Plus second at 1,186; no Sesame entry appears anywhere on the board.

Apache 2.0 の細部こそが重要な点です

「APIなし」という判定の下に埋もれているのは、Sesameが研究モデルをApache 2.0の下でオープンソース化したという事実だ。寛容なライセンスで、3つのサイズがあり、1B版はデータセンターなしで実行できるほど小さい。これはデモとはまったく異なる提案であり、Sesame Previewの声に似た何かが出荷される製品に搭載される唯一の道筋である。

2つの注意点が、それを誠実に保っている。公開されたCSMコンポーネントは研究成果物だ。企業は、これらのモデルが音声コンテンツは扱えても会話構造は扱えないと指摘し、全二重モデルを今後の課題として挙げている。したがって、公開された重みは対話体験そのものではない。また、ローカルで動作する8Bバックボーンは、アリーナで最安のトップティアのライバルが課すホスト型推論の100万文字あたり19.30ドルとは異なるコスト構造だ。セルフホスティングには文字単位の請求はなく、GPU時間単位の、非常に現実的な請求がある。

開発者にとって、それは問いの立て方を変える。会話に感銘を受けたのなら、オープンウェイトはそうではない。音声モデルそのものの声に感銘を受けたのなら——そしてそれは、デモとは違う形で検証可能だ。

HeyGen Voiceでのリリースはどのようなものか

実用的な違いはごく普通のものだ。HeyGenのAPIは音声の選択、テキスト、そしてオプションで速度を0.5~1.5の範囲、ピッチを±50半音の範囲で、BCP-47のロケールヒントとともに受け取る。カスタムボイスは3通りの方法で作成できる。説明文に基づく設計ルートでは、1,000文字を上限とするプロンプトから最大3つの順位付けされた候補が返され、1回の録音からのインスタントクローン、そして20分以上の音声で学習させるプロフェッショナルクローンがある。ボイスエンドポイントのエンジンフィルターはHeyGen以外のエンジンも受け付けるため、このプラットフォームは自社モデルだけに囲い込まれた閉鎖的な庭ではない。

そうしたものはSesame側には一切存在せず、それはSesame Previewの欠点ではありません——それがこのものの本質なのです。可能なことを示すために最適化されたデモがSLAを負うべきではありません。

もっとも、請求額のほうはより曖昧な半面だ。HeyGenはクレジットを販売しており——月額29ドルで600、49ドルで1,000、149ドルで1,500——消費量はモデル、長さ、複雑さによって異なると述べているが、音声の単価は公表していない。アリーナが掲載している100万文字あたり30.00ドルは、Artificial Analysisによるそれらクレジットの換算であり、HeyGenからの見積もりではない。したがって、実運用に投入できるモデルには値付けがなされているが、それは他人の計算に基づいている——これはエンジンへの批判ではなく、測定を伴うパイロットを支持する論拠である。

A screenshot of HeyGen's developer documentation sidebar, captured 10 October 2026, showing the Voice Management group with the entries Voices, Browse Voices, Design a Voice, Voice Clone and Text to Speech.

憧れているデモを実際にどう扱うべきか

有益なのは、Sesame Preview が示す2つのものを切り分けることだ。会話の振る舞い——ターンテイキング、記憶、誰かと話しているという感覚——は、まだ公開されておらず、エンドポイントも存在しないシステムの産物である。音声品質こそ、Apache 2.0 の重みが背後にある部分であり、誰の許可も求めずに自分の音声で評価できる部分だ。

その間にあるすべてについては、移行パスはありふれたものだ。API とランクを持つエンジンで出荷し、Sesame のモデルが商業化されることがあれば、それを採用するのが書き直しではなく設定変更で済むように設計する。つまり、初日から音声プロバイダーを抽象化しておく——1 つのインターフェース、1 つのキー、エンジンは設定で選択する。OrcaRouter のルーティング層は、まさにこのために作られている。単一のエンドポイントの背後に多数のプロバイダーを、プロバイダー定価でマークアップなしに配置し、ベンダーが止まったときには自動フェイルオーバーし、アプリケーションコードに触れることなく音声の背後にあるエンジンを差し替えられるルーティング DSL を備えている。重要なのは、Sesame モデルをホストしていることではない——ホストしていない——が、あなたが憧れる音声が購入可能になった日、それを試すコストが設定ファイルの 1 行で済むべきだということだ。

誠実なクローズ

Sesame PreviewはHeyGen Voiceの競合ではなく、競合として評価されるべきではない。これは無料で、英語のみ、4人のペルソナによるデモであり、たまたま会話音声に対する期待をリセットし、たまたま寛容なライセンスの研究用重みを3つのサイズで公開した。HeyGen Voiceは、音声を一定に保つ唯一の音声リーダーボードで最高位のエンジンであり、今日呼び出せるAPIによって販売され、その価格はまだ計算できない。

今四半期にリリースできる音声が必要なら、選ぶべきはこの2つの間ではありません。HeyGen Voice と、アリーナ上で価格がついているほかのエンジンとの間です。Sesame を待っているなら、アプリではなく、モデルの重みを待ちましょう。