「HeyGen Voice vs Qwen-Audio-3.0-TTS」というタイトルの生成されたヒーローカードは、controlled-voiceのElo差79ポイントを、100万文字あたりの2つの価格と対比して示しており、一方の価格はベンダー公表、もう一方はアリーナがクレジット価格を換算して導出したものであるという注記が付いている(Artificial Analysis、2026年10月9日)。右下隅にはOrcaRouterのロゴが表示される。
Engineering & Research

HeyGen Voice vs Qwen-Audio-3.0-TTS:Elo のために何を支払うのか、そして実際にベンチマークしたのはどの Qwen ティアか

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

まず計算をしてみよう。スコアボードが示すほどには、それほど偏っていないからだ。Qwen-Audio-3.0-TTS-Plus は Model Studio プラットフォームで100万文字あたり19.30ドルかかる——これはベンダーが公表している料金だ。HeyGen Voice は Artificial Analysis 自身の価格表で100万文字あたり30.00ドルに位置する。この数字は、HeyGen の公開価格ページが、音声生成がどれだけのクレジットを消費するかを明記せずにクレジットを販売しているため、同サイトが HeyGen のクレジット価格から導出したものだ。一方、両者の統制音声での差は Elo 79 だ。8つの参照音声をすべて固定したアリーナで、HeyGen Voice は1,202、Qwen-Audio-3.0-TTS-Plus は1,123を記録した。つまり、より安いモデルはより良いモデルのはるか後方に位置し、両者の比率はおよそ1.55倍で、その2つの価格のうち、販売元が自らの名で示している数字は一方だけなのだ。

名前の中の罠

その前に、ティアを正しく把握してください。というのも、これは間違ったモデルを平気でベンチマークさせてしまうファミリーだからです。ここではAlibabaの2つのエントリーが重要で、それらは互換ではありません。

Qwen-Audio-3.0-TTS-Plus は、本記事が比較対象としているモデルです。統制ボードでは 1,123 で 42 中 7 位、Provider Voices ボードでは 1,264 で 96 中 6 位にランクされています。実際に提供されている現行のストリーミング TTS 製品であり、公表されている料金は 100 万文字あたり 19.30 ドルです。

Qwen-Audio-3.1-TTS-Plusはその後継ティアであり、管理されたボードで1,186で2位に位置している——初登場時にHeyGen Voiceを破るのに最も近づいたモデルだ。その料金は同じ$19.30で記載されているが、Alibabaのドキュメントは、異なるモデルバージョンには対応するボイスを組み合わせる必要があると警告している。そのため、「同じ価格、より新しいティア」は「そのまま差し替え可能」を意味しない。

「Qwenを上回る1位」を読んでからQwen-Audio-3.0-TTSをベンチマークする人は、その見出しが対象としていたモデルより63 Elo弱いモデルをテストすることになる。このtierについての揚げ足取りは63ポイント分の価値があり、それはHeyGen Voiceと3位の間の差よりも大きい。

スコアボード

A generated two-column scoreboard titled 'HeyGen Voice vs Qwen-Audio-3.0-TTS — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Provider Voices Elo: not ranked', 'Price per 1M characters: $30.00, arena conversion of credit pricing', 'Cost of 100 hours of narration: roughly $1,440, derived', 'Voice control: design from a description, instant clone, professional clone' and 'Audio output: speed 0.5 to 1.5, pitch plus or minus 50 semitones'. The Qwen-Audio-3.0-TTS-Plus column reads 'Controlled Voice Elo: 1,123, #7 of 42', 'Provider Voices Elo: 1,264, #6 of 96', 'Price per 1M characters: $19.30 on Alibaba Cloud', 'Cost of 100 hours of narration: roughly $926', 'Voice control: instruction parameter, emotion and language tags, cloning and design' and 'Audio output: PCM, WAV, MP3 and Opus up to 48kHz'. A footer states that the Qwen price is Alibaba Cloud Model Studio's published rate at default settings while the HeyGen figure is the arena's conversion of credit pricing.

• 統制音声Elo(同一の8つのクローン音声) — HeyGen Voice: 1,202、42件中1位。Qwen-Audio-3.0-TTS-Plus: 1,123、7位。

• プロバイダーボイスElo(ネイティブ音声) — Qwen-Audio-3.0-TTS-Plus:1,264、96件中6位。HeyGen Voice:ランク外。

• 100万文字あたりの料金 — Qwen-Audio-3.0-TTS-Plus:19.30ドル、Alibaba Cloud上でベンダーが公表。HeyGen Voice:30.00ドル、アリーナ独自のクレジット料金換算によるもので、HeyGenは音声料金を公表していない。

• ナレーション100時間のコスト — Qwen-Audio-3.0-TTS-Plus:1時間あたり約480,000文字で、およそ926ドル。HeyGen Voice:アリーナの30.00ドル換算でおよそ1,440ドル — 引用ではなく算出値。

• 音声コントロール — Qwen-Audio-3.0-TTS-Plus: 指示パラメータ、感情と言語のタグ、音声クローニング、音声デザイン。HeyGen Voice:1,000文字以内の説明からテキスト音声をデザイン、インスタントクローン、20分以上でトレーニングされたプロフェッショナルクローン。

• 出力 — Qwen-Audio-3.0-TTS-Plus:最大48kHzのPCM、WAV、MP3、Opusに対応し、レート、ピッチ、音量、ビットレートを調整可能。HeyGen Voice:リクエストごとに速度0.5~1.5、ピッチ±50半音。

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' with HeyGen Voice first at 1,202 Elo, Qwen-Audio-3.1-TTS-Plus second at 1,186 and Qwen-Audio-3.0-TTS-Plus seventh at 1,123, alongside samples, release dates and per-1M-character API pricing columns showing $30.0 and $19.3 respectively.

アリババのエンジニアリングが実際にあなたに与えるもの

Qwen-Audio-3.0-TTS ファミリーはストリーミング製品であり、ドキュメントもそのようになっています。リクエストは CosyVoice と共有される WebSocket プロトコル上を流れ、run-task、continue-task、finish-task というイベントフローと、task-started、result-generated、task-finished、task-failed というレスポンスがそれに伴います。キャンセルは北京リージョンとシンガポールリージョンの両方で、すべての Qwen-Audio-TTS モデルにおいて streaming_cancel() を通じてサポートされています。出力は 48kHz に達し、フォーマットには Opus も含まれます。これは、WAV ファイルではなくブラウザや電話通話へ音声を送り込む場合に重要な点です。

そのドキュメントには、見落としやすく、後から発見すると高くつく 2 つの詳細があります。Emotion タグと rich language タグは Plus および Flash ティアにのみ適用され、ファミリー全体には適用されません。また、単方向ストリーミングモードでのみ機能します。そして、API キーはシンガポールリージョンと北京リージョンで異なり、ワークスペースは次の形式の URL でアドレス指定されますwss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference。リージョン別キーは、障害が発生するその日まではプロビジョニング上の詳細にすぎません。

HeyGen側は製品の形が異なります。RESTスタイルのv3 APIであり、POST /v3/voices/speechが音声をレンダリングし、GET /v3/voicesは、engineフィルターの背後にあるカタログを一覧表示し、ボイスデザインはテキストプロンプトから最大3つの順位付けされた選択肢を、再現性のためのシードとともに返します。ドキュメントはまた、engineフィルターがHeyGen自身の値を超える値も受け入れることを明らかにしています——つまりHeyGenはAPI経由でサードパーティの音声エンジンへ喜んでルーティングするのです。競合他社のモデルを選択可能なオプションとして提供するベンダーは、自社の強みがどこにあると考えているかについて、何かを物語っています。

A screenshot of HeyGen's public landing page, captured 10 October 2026, showing the headline 'The video you imagine, delivered into your system.' with the line about orchestrating avatars, voices, images, editing, music and assets into deterministic, repeatable renders.

79 Elo はどこへ行くのか

統制されたボード上での79ポイントの差は相当なものである——HeyGen Voiceを2位から引き離す16ポイントの差よりも大きく、その分野における3位と8位の間の距離とほぼ同じだ。しかも、それは単一の軸で測定されたものでもある。

管理されたアリーナは8つの声をクローンし、それらを固定したまま評価する。それは、Qwenが公開する指示駆動型のコントロールサーフェスについて何も語らず、キャンセル可能なWebSocket経由の48kHz Opus出力についても何も語らず、リージョン展開についても何も語っていない。これらはエンジニアリング上の特性であり、マンダリン語のコンタクトセンターを構築するチームが、8つの英語参照音声で79ポイント高いスコアを出すモデルに切り替えない理由でもある。

統制された結果が実際に示すのは、より限定的でありながら依然として有用なことだ。両方のエンジンに同じクローン音声を渡すと、聴取者はHeyGen Voiceのレンダリングを好んだ。あなたの製品が音声をクローンするなら、それがあなたの判断軸になる。あなたの製品がカタログから音声を選んで通話にストリーミングするなら、プロバイダーランキングの方があなたの実態に近い。そしてそこでは、HeyGen Voiceはまったくランク付けされていない一方、Qwen-Audio-3.0-TTS-Plusは96件中6位に位置している。

真剣に受け止められる価格論

100万文字あたり19.30ドルで、Qwen-Audio-3.0-TTS-PlusはElevenLabsの40ドル帯のおよそ半分、Cartesia Sonic 3.6の49ドルの約40%のコストです。ナレーション100時間というワークロード——一般的な話速で約4,800万文字——では、およそ926ドルになります。同じ量をEleven v4 Turboで処理すると約1,920ドル、Sonic 3.6では約2,352ドルになります。HeyGen Voiceは、アリーナの30.00ドルでは約1,440ドルに位置します。安価な価格帯と既存2社の間で、最高価格帯よりも中間に近いところです。

その計算には、他の計算には必要のない但し書きが伴う。$19.30 は Alibaba 自身が公表している料金だ。$30.00 は、HeyGen が一度も文字数に換算したことのないクレジット制度を Artificial Analysis が換算したものであり、引用ではなく誠意ある推定値である。実際のクレジットあたり文字数比がグラフの想定より悪ければ、79-Elo の優位性はそれが示唆する 1.55× よりも高くつく。良ければ、より安くつく。価格を推測しなければならないモデルは、標準採用するモデルではなく、計測されたトラフィックの一部で試験導入するモデルだ。これはエンジンへの批判ではない — 2026年10月10日時点で入手可能な情報についての説明である。

決定

コストとストリーミング基盤が判断を左右するなら、Qwen-Audio-3.0-TTS-Plus を選びましょう。100万文字あたり20ドル未満、キャンセル可能な WebSocket と48kHz Opus 出力、指示パラメータと感情タグ、そしてプロバイダーボードで6位という順位により、この比較の中で最も経済的で高スコアの音声になっています。管理されたボードで実際に2位につけたモデルが欲しい場合は、代わりに3.1ティアを選び、切り替えが無料だと決めつける前に音声リストを確認してください。

クローン忠実度が製品なのであれば、HeyGen Voiceを試すべきだ。1人の話者、多数のセリフ、毎回*その*声でなければならない声——それこそが統制された評価ボードが測定する軸であり、同ボードが業界全体をリードする軸でもある。クレジットモデルでは、料金表を読むのではなく、自分のテキストを実行して初めて本当のコストが分かるのだから、計測期間の予算を見込んでおけ。

ワークロードが中国語でリアルタイムなのであれば、その比較は完全に無視してください。どちらのElo値も、あなたの音声で、あなたの言語で、あなたのレイテンシー予算で測定されたものではありません。

両方に連絡できる状態を保つ

これは、ルーティング層が後付けではなく、その存在価値を発揮する組み合わせの一つです。両ベンダーをカバーする単一のAPIキー — プロバイダーの定価をマークアップなしでそのまま適用するため、Alibabaが公表している$19.30がそのまま支払額となり、Qwenの価格改定も当日に反映されます — により、証拠を得る前に勝者を選ぶ必要がなくなります。自動フェイルオーバーは、ストリームの停滞がリスナーに聞こえてしまう音声パイプラインにおける明白なリスクをカバーし、ルーティングDSLを使えば、一括ナレーションは安価なエンジンへ、クローンに重要な行は79ポイント高いスコアのエンジンへ送ることができ、2つのクライアントライブラリや2つの請求関係は不要です。ここでのOrcaRouterの価値は、音声モデルをホストしていることではなく、どちらが必要かを見極めるコストをほぼゼロにすることにあります。

未解決の疑問

これを決着させるには3つのものが必要だ。HeyGen自身の料金ページに音声単価があれば、アリーナが導き出した$30.00は監査可能な数値になる。Provider VoicesのボードにHeyGenのエントリーがあれば、クローン音声の優位がネイティブ音声に対して生き残るかどうかが分かる——そのテストでQwen-Audio-3.0-TTS-Plusは96件中6位で通過している。そして、さらに投票が進んだ後のQwen-Audio-3.1-TTS-Plus対HeyGen Voiceの統制音声結果があれば、16 Eloが安定した順位付けかどうかが分かる。それまでは:Qwenは価格が設定され、ストリーミング可能で、ランキングも高い選択肢であり、HeyGen Voiceはより高スコアだが価格を設定できないものであり、そしてベンチマークする階層は、目にする見出しよりも重要だ。