「ElevenLabs Eleven v4 vs Qwen-Audio-3.1-TTS-Plus」のヒーローカード。2枚のスコアカードを備える:Qwen-Audio-3.1-TTS-Plus は Elo 1,178、1位、100万文字あたり $19.30。ElevenLabs Eleven v4 は Elo 1,157、2位、100万文字あたり $80.00。キャプションは「4倍の価格差に対して21 Eloポイント」。フッター:「Controlled Voice Arena、Artificial Analysis 調べ、2026年9月」。OrcaRouter のロゴは右下隅に配置される。
Engineering & Research

Eleven v4 vs Qwen Audio 3.1:ボード上で最も安い音声が勝利した

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

すべての参加者に同じ8つのクローン音声が与えられるこのボードで、Alibaba Qwen-Audio-3.1-TTS-Plusが Elo 1,178 で首位となり、ElevenLabs Eleven v4が 1,157 で2位となった。このボードにおける勝者モデルの価格は100万文字あたり19.30ドル。2位のモデルは80.00ドルだ。つまり、21ポイントの品質差と4倍の価格差が互いに反対方向を指していることになり、これはローンチ週全体で最も興味深い結果である — もう一方のアリーナで ElevenLabs が獲得した1位よりも興味深い。なぜならそちらでは順序が慣例どおりで、勝者はトップ10の中で最も高価な音声だからだ。

この2つのボードは互換性がなく、この対決がこう読める理由は、どちらを見るかだけにある。Provider Voice では、聴取者が各ベンダー自身の音声を評価する。Controlled Voice は同じ8つの音声——米国4つ、英国4つ——をすべてのモデル用にクローンするので、既定の声の顔ぶれで勝てる者はいない。ElevenLabs が前者で61ポイント差で勝つ。Alibaba が後者で21ポイント差で勝つ。どちらのボードも間違っていない。そして、クローンされたブランド音声を搭載した製品の登場を予測するのは、後者のほうだ。

A two-column scoreboard for Qwen-Audio-3.1-TTS-Plus and ElevenLabs Eleven v4. Qwen: Controlled Voice rank 1 Elo 1,178; Provider Voice rank 4 Elo 1,258 on the 3.0 build; $19.30 per 1M chars; rate card not publicly readable; 3.1 on one board and 3.0 on the other; documentation not readable publicly. Eleven v4: Controlled Voice rank 2 Elo 1,157; Provider Voice rank 1 Elo 1,319; $80.00 per 1M chars; $0.022 per 1K until Oct 12; v4 on both boards; 90-plus languages and a 10,000-character cap. Footer: 'All ranks, Elo and board prices per Artificial Analysis; Qwen rate card not readable.'

統制された声のスコアボード、その全容

• ブラインド選好、マッチしたクローン — Qwen-Audio-3.1-T-Plus は1位、Elo 1,178、100万文字あたり19.30ドル 対 Eleven v4 は2位、Elo 1,157、80.00ドル。

• ブラインド偏好テスト、各ベンダー自身の音声 — Eleven v4 が1位、Elo 1,319、対して Qwen-Audio-3.0-TTS-Plus が4位、Elo 1,258。逆方向に61ポイントの差。

• 価格、アリーナ正規化 — Qwen $19.30 vs Eleven v4 $80.00。Qwen は 76% 安いです。

• 価格、ベンダー料金表 — Eleven v4 は1,000文字あたり $0.022 のプロモーション価格で、10月12日以降は $0.08。Qwen Audio 3.1 自体の料金表は当方では確認できなかったため、アリーナの正規化が比較できる唯一の価格です。

• 各ボードのバージョン — Controlled Voice では 3.1、Provider Voice では 3.0。これらは異なるモデルであり、ボードに互換性はありません。

• Controlled Voiceの3.0エントリー — ランク5、Elo 1,124、価格は同じ$19.30。3.1リリースは同一価格で、その前身より54 Elo分の価値がある。

• Provider VoiceにおけるQwenの以前の世代 — Qwen3 TTS Flashは79位、Elo 944、Qwen3 TTSは82位、Elo 930。

• Controlled VoiceにおけるElevenLabs自身の前回のフラッグシップ — Eleven v3は7位、Elo 1,073。

• グループ化棒グラフによる健全性チェック — Controlled Voiceにおける1位から10位までの8-wayの広がりは121 Elo。QwenのEleven v4に対する21ポイントのリードは、フィールド全体の範囲の5分の1未満であり、これはそれを位置づけるのに適した尺度だ。

A screenshot of the Artificial Analysis Controlled Voice Arena leaderboard, captured in English, showing Alibaba Qwen-Audio-3.1-TTS-Plus first at Elo 1,178 and $19.3 per 1M chars with 1,269 samples, ElevenLabs Eleven v4 second at Elo 1,157 and $80.0 with 1,483 samples, Cartesia Sonic 3.6 fourth at Elo 1,138, and Alibaba Qwen-Audio-3.0-TTS-Plus fifth at Elo 1,124 at the same $19.3 price, over the page subtitle 'Compare Text to Speech (TTS) models using the same 8 cloned voices (4 US, 4 UK)'.

そこにある2つの行がほとんどの仕事をしている。1つ目は3.0対3.1の比較だ。Alibabaは価格をまったく変えずに、一度のバージョンアップでEloを54動かした。これはElevenLabsのv3からv4への84ポイントの動きよりも速いペースであり、この記事の具体的な順位は、両ベンダーが活発に入れ替えている一瞬のスナップショットにすぎないことを意味する。

2つ目は、121ポイントの総合差です。有効レンジが約120ポイントのボードにおける21ポイントの差は、実際に存在するものの控えめな差です——おおよそ、Qwen自身の3.1と3.0の差と同じ大きさです。もしあなたのユースケースが、どちらのモデルもチューニング対象としていない言語にあるなら、その差は、厳しいテストスクリプトをいくつか使えば覆せる範囲に十分収まります。

誰も指摘していないバージョン問題

「Eleven v4はControlled Voiceで2位」として出回っている結果は正確だが不完全であり、その省略は、それを前提に計画を立てる人にとって重要だ。そのボードでEleven v4の上に位置するモデルは、Alibabaの3.1リリースだ。一方、Provider VoiceボードのQwenの項目は3.0リリースであり、私たちが読む限り、そのボードの上位行に3.1モデルは現れない。したがって、「Eleven v4が1位」と「Eleven v4が2位」という2つの見出しは、2つの異なるタスクにおける2つの異なるQwenモデルについての記述であり、一方のボードでEleven v4を上回ったQwenのバージョンは、もう一方でEleven v4が上回ったQwenのバージョンではない。

これはどちらのベンダーに対する引っかけではない。むしろ、このような一週間を一文で要約したものを信用すべきでない理由だ。この2つのシステムのどちらかを選ぶなら、あなたが求めるべき比較は、あなた自身のクローン音声、あなた自身の言語で、3.1 と v4 を比べたものだ。そして、どちらのベンダーもそんな比較は公開していない。

Qwen Audio 3.1について言えることと、言えないこと

証拠について正直であることは、ここでは完全なスペック表よりも価値がある。そこで、この記事が依拠しているものの境界を示しておく。アリーナのボードから得られているのは、Qwen-Audio-3.1-TTS-Plus について、統制音声のEloが1,178、100万文字あたり19.30ドルの価格正規化、そして同じ価格で前バージョンが54ポイント低いスコアだった系統の現行リリースであるという事実だ。

私たちは、次のことを把握しておらず、推測もしません。それは、その言語対応範囲、レイテンシ、リクエストあたりの入力上限、インライン配信ディレクティブをサポートするかどうか、アリーナの8つの音声を超えるボイスクローニングを提供するかどうか、そして独自の料金表で何を課金するのかです。これらはいずれも Eleven v4 については文書化されています——90以上の言語、10,000文字の上限、オーディオタグ、10秒のインスタントクローン、IPA音素サポート——そして Qwen 側にそれらがないことは、公開されている情報の欠落であり、モデルに対する減点ではありません。この記事だけに基づいて購入を決めるなら、それは2つの数字だけで決めることになります。

A screenshot of Artificial Analysis' Eleven v4 model page, captured in English, headed 'Eleven v4 Quality Elo, Speed & Price Analysis' and labelled 'ElevenLabs, Family ElevenLabs, Elo 1318.77', with the Provider Voice Arena Preference Elo chart showing Eleven v4 first at 1,319 ahead of Sonic 3.6 at 1,276 and Gemini 3.8 Flash TTS at 1,267, a '27 of 96 models' selector, and the Pricing section heading below.

その制約を生き延びる対比が1つだけある。なぜなら、両側ともベンダー公称であるか、両側ともボード公称だからだ。価格では、ボードの正規化が共通の基準であり、それが Qwen を 76% 有利にしている。話者を揃えた条件下の品質では、同じボードが Qwen を 21 Elo 分有利にしている。この2行は比較可能だ。ここにあるそれ以外は比較可能ではなく、記事はそうでないふりはしない。

支配された取締役会が通常よりも重みを持つべき理由

ほとんどの音声比較は、あなたがすでに気に入っているモデルを首位に据えるリーダーボードに、そのまま従うだけです。この対決では、Controlled Voice を優先すべき筋の通った理由があり、それは一般的な理由ではなく、このケースに固有のものです。

AlibabaとElevenLabsは、まったく異なる資産で競っている。ElevenLabsの強みは、長年にわたる厳選されたキャスティングで築かれた音声ライブラリだ。Alibabaの強みは、高速なサイクルでモデル版をリリースする研究組織であることだ。各参加者が自前の音声を持ち込めるリーダーボードは、音声合成エンジンと同じくらいライブラリも測る。そのボードではElevenLabsが61ポイント差で勝つ。ライブラリを排除し、全員に同じ8人のクローン話者を使わせると、優位は入れ替わる。ユーザーが耳にする音声が特定の人物のクローンなら、あなたが買っているのはElevenLabsのライブラリではない。したがって、あなたの購入内容を表すのは統制されたリーダーボードのほうだ。既製の音声メニューから選ぶなら逆になり、Eleven v4の61ポイント差こそが効いてくる数字だ。

統制された結果を重く見るべき、もう一つ、あまり居心地のよくない理由がある。ベンダー音声のボードは際立った既定の声を高く評価し、そうした際立った声は、平均Eloが覆い隠してしまう形で二極化を招きうる——ある聴取者にとっての「個性的」は、別の聴取者にとっては「作為的」だ。話者を揃えたクローン音声のボードは、その変数を完全に取り除くため、二者のうち再現性の高い測定となる。

どちらか一方を実行すること、そして実際にルーティングされるもの

OrcaRouterは{{1}}ElevenLabs{{/1}}も{{2}}Alibaba{{/2}}も提供していません。どちらも当社の{{3}}model catalog{{/3}}には含まれていないため、当社を通じてどちらかにアクセスする方法はなく、これは変わりません — どちらについても、プロバイダー自身のAPIか、複数あるサードパーティプラットフォームのいずれかにアクセスする必要があります。

当社がカバーするのは、その上のレイヤーです。御社の音声スタックがより大きなパイプラインの1ノードにすぎない場合、当社は単一のAPIキーの背後で200以上のモデルを提供し、プロバイダーの定価を0%のマークアップでそのまま反映します、そのため、上流での価格改定——ElevenLabsのプロモーション期間や、10月12日にそれに続くはるかに高額な定価も含めて——は、次の請求サイクルではなく、発生した当日に当社側で反映されます。4倍という価格比が判断を左右する状況では、このタイミングの差が、長く通用する比較と、3週間後には誤りと読めてしまう比較とを分けます。

そして、音声経路を落とすわけにいかない場合には、リクエストを失敗させる代わりに、自動フェイルオーバーがトラフィックを正常な上流へと移します品質でこれほど互角、価格でこれほど一方的なこの対決では、賢明なアーキテクチャは、両モデルを単一のエンドポイントの背後に置き、ルーティングに振り分けを決めさせることです。両ベンダーが四半期のうちに無効化してしまうリーダーボードのスナップショットから恒久的な選択を下すことではありません。

評決、およびその有効期限

音声をクローンしつつコストを抑えたいなら、Qwen-Audio-3.1-TTS-Plus を選ぼう。話者を固定したボードでは首位で、価格はおよそ4分の1、しかもその伸びはより速い——価格を据え置いたまま1バージョンで54 Eloというのは、現行版よりも次バージョンのほうがスペック上は有望な賭けであることを示唆している。

ユーザーが既製の音声を耳にするなら、出荷前に検証できる言語のカバレッジが必要なら、あるいは文書化された機能セット——オーディオタグ、音素制御、10,000文字のリクエスト、10秒クローン——が、アリーナのボードでは測られない仕事をあなたの製品で果たしているなら、Eleven v4を選ぼう。ベンダーボイスボードでの61ポイントのリードは決して無意味ではなく、スクリプトに書き込める2つの機能はスコアではなく能力なのだ。

レビュー日を設定しましょう。Alibabaは今回のサイクルでバージョンアップによりEloが54変動し、ElevenLabsはフル世代を通じて84変動しました。またEleven v4のプロモーション料金は10月12日に終了します。この比較が今日何を示していても、それを覆す可能性が最も高い2つの事実——3.2のリリースと価格の巻き戻し——はいずれも四半期の終わりまでに起こります。