Qwen-Audio-3.1-TTS と ElevenLabs Eleven v3 を比較するヒーローカード。Qwen の16言語と20方言、70%の価格削減、アリーナスコアがないことを、ElevenLabs の74言語、100万文字あたり約100ドル、Elo 1,168 と対比して示し、「2026年9月23日に Apsara で発表」と書かれたリボンの上に配置されている。
Guides & Insights

Qwen-Audio-3.1 vs ElevenLabs:70%の価格削減が既存王者に挑む

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

ベンダーは2026年9月23日、Qwen-Audio-3.1-TTS APIの価格をおよそ70%引き下げた。杭州で開催されたApsara Conferenceの壇上で、他4つの音声モデルとともに発表されたものだ。この一つの数字こそ、この比較を書く価値がある理由である。ElevenLabs Eleven v3は、ほとんどの西側チームにとって既定の本番用音声であり、実効レートは100万文字あたり約100ドルだった。そこへ、信頼に足る挑戦者が、同じ仕事の値段をその何分の一かに付け替え、同時に対応言語まで広げてきた。両システムは同等ではない。Qwen-Audio-3.1-TTSはベンダーのTongyi Labによるホスト型専用APIで、音声エコシステムはより小さい。一方、ElevenLabsは業界で最も充実した音声ライブラリを備えた完全なコンテンツプラットフォームだ。だが、あなたの意思決定がこれまでに請求書で決まったことがあるなら、その算術は今週変わった。

9月23日に実際に出荷されたもの

Qwen-Audio-3.1は単一のモデルではありません。Alibabaの音声スタック全体を刷新する5モデルであり、階層が重要なのは、価格と役割がそれぞれ異なるからです:

Qwen-Audio-3.1-TTS — 多くのチームが使用している音声合成モデルの直系の後継版。7言語を追加して合計16言語に対応し、中国語の20の方言地域を維持。自然な言語間の音色転送(1つの声が北京語、広東語、英語、日本語をまたいで引き継がれる)、指示に基づく感情・話速・話し方のスタイルの制御を追加し、ノイズやエコーなど劣悪な参照音声も別途ノイズ除去モードなしで処理します。

Qwen-Audio-3.1-TTS-Next — 新しいティアであり、別の製品です。Alibaba はこれを「Audiogen」モデルと呼んでいます。テキスト、タイムスタンプ、参照音声から、音声、効果音、背景アンビエンスを1回のパスで生成します。複数話者の対話、ポッドキャスト、映画やテレビのサウンドスケープ、48 kHz 出力。Alibaba Cloud の Model Studio のドキュメントによると、最大 3,000 文字の入力を受け付け、生成音声はポッドキャストで最大 240 秒、それ以外では 120 秒に制限され、毎秒 3 リクエストで実行され、WAV、MP3、PCM を返します。

Qwen-Audio-3.1-ASRQwen-Audio-3.1-ASR-Next、およびQwen-Audio-3.1-Realtime — それぞれ音声認識、音声理解(感情、音楽、環境音、イベントの位置特定)、そして全二重会話を担う。Alibaba がハードウェアに押し込もうとしているのは Realtime だ。Qwen Office、Qoder、QwenNote A2、QwenNote Eva デスクトップロボット、そして Qwen AI グラスである。

値下げはTTSだけにとどまらず、ライン全体に及んだ。音声合成は約70%減、リアルタイムは約85%減、認識は最大95%減となった。Alibabaはさらに、リアルタイム音声エージェントを構築するためのフレームワーク「Qwen-Audio-Agent」をオープンソース化し、レイテンシーを2.5秒未満に抑えた「Qwen3.8-LiveTranslate」を初公開した。

A screenshot of Alibaba Cloud Model Studio's English documentation site showing the reference page for qwen3.8-livetranslate-flash-realtime, a real-time audio and video translation model that accepts audio and images and outputs text and audio across 60 input languages and 29 speech output languages, under an Apsara 2026 Conference banner, with the Speech-to-Speech branch of the navigation listing the qwen-audio-3.0 realtime models.

スコアボード

A two-column scoreboard for Qwen-Audio-3.1-TTS and ElevenLabs Eleven v3 across price, languages, weights, voice library, delivery control and arena score, with a footer stating that the Qwen figures are vendor-reported and unscored and the ElevenLabs figures are per Artificial Analysis.

価格 — Qwen-Audio-3.1-TTS:前世代のQwen-Audioより約70%低く、前世代では3.0 Plusティアが100万文字あたり約27.60ドル、Flashティアが約15ドルでした。ElevenLabs Eleven v3:Artificial Analysisの追跡によると100万文字あたり約100ドル、Flashは約50ドルです。

言語 — Qwen-Audio-3.1-TTS:16言語に加え、中国語の20方言地域。ElevenLabs Eleven v3:74言語。

ウェイト — Qwen-Audio-3.1-TTS:クローズド、Alibaba Cloud Model Studio でのみホスト提供。ElevenLabs Eleven v3:クローズド、ホスト提供のみ。

音声ライブラリ — Qwen-Audio-3.1-TTS:ネイティブクローニングに加え、言語間の音色転送が可能。同等の公開マーケットプレイスは存在しない。ElevenLabs:業界最大の共有音声ライブラリに加え、約30秒の音声からのインスタントクローニングに対応。

読み上げ制御 — Qwen-Audio-3.1-TTS:指示ベースの感情、ペース、スタイル。3.0で導入された86個のインライン読み上げタグを継承。ElevenLabs Eleven v3:音声タグに加え、周辺プラットフォーム(吹き替え、エージェント、スタジオ)。

独立系ベンチマーク — Qwen-Audio-3.1-TTS:まだなし。ElevenLabs Eleven v3:2026年8月時点で、Artificial AnalysisのProvider Voice ArenaリーダーボードにおいてElo 1,168。

挑戦者が真に勝利する場面

3つのこと、そしてそのうちの1つだけが価格です。

価格です。当然でしょう。 100万文字あたり100ドルという既存サービスに対して70%削減は、誤差の範囲ではありません。それは、試作に使う製品と、すべてのユーザーに出荷する製品との違いです。大量にナレーションを生成しているなら、年間の節約額は社内で議論すべき費目ではありません——それ自体が説得力を持ちます。

中国語、紛れもなく。20の中国語方言地域は、{{KEEP}}ElevenLabs{{/KEEP}}が提供するどの機能も及ばない堀です。あなたの製品が中国本土のユーザー、広東語話者、または文中で言語を切り替えるディアスポラのオーディエンスにサービスを提供しているなら、比較は始まる前から終わっています。

言語をまたぐ音色転移。Qwen-Audio-3.1-TTSは、1つの声を北京語、広東語、英語、日本語へと自然に引き継ぎます。これは特定のユースケースを伴う特定の機能です。つまり、言語を切り替えても維持される単一のブランドボイスであり、市場ごとに新たな声をキャスティングするのではなく、1人のプレゼンターをローカライズする人にとって、真の差別化要因となります。

ElevenLabsが依然として圧勝している分野、しかもその差は歴然としている

言語の幅広さが第一の点であり、最大の点でもある。74言語対16言語という差は、価格の発表では埋められない。ポーランド語、トルコ語、ベトナム語、ポルトガル語で提供するなら、ElevenLabsは現時点で対応しているが、Qwen-Audio-3.1-TTSは対応していない。

2つ目はエコシステムです。ElevenLabsは音声合成のエンドポイントではなく、コンテンツプラットフォームです。クローンするのではなくライセンスできる共有ボイスライブラリ、吹き替えワークフロー、エージェント基盤、スタジオ製品、長年のクライアントライブラリに支えられた文書化されたAPIサーフェス。そこから移行するのは設定変更ではなくプロジェクトであり、その上に構築してきたチームは、何を手放すことになるかを正確に理解しています。

第三は、名付けるのがより難しく、それでもなお名付ける価値のあるものだ。単一の英語音声における自然さの知覚である。Qwenの音声合成は歴史的に中国語では卓越しており、英語ではかなり良い程度にとどまってきた。3.1リリースは多言語での発話向上を謳っているが、新しいモデルに関する独立した聴取テストはまだ存在しない。新しいQwenの声が英語でどう聞こえるかを知っていると言う人は、推測しているにすぎない。

まだ誰も引用すべきではない数字

これは報道で歪められて伝えられる部分なので、はっきりと記しておく。Qwen-Audio-3.1-TTSには独立したベンチマークスコアが存在しない。その前身であるQwen-Audio-3.0-TTS-Plusは、2026年8月中旬時点でArtificial AnalysisのProvider Voice ArenaリーダーボードにおいてElo 1,234に位置し、同ボードで2位から5位の間にランクされていた。Qwen-Audio-3.1-TTSは、まだどのアリーナにも追加されていない。Alibabaの発表資料にある品質に関するあらゆる主張はベンダーによる申告であり、再現されていない。

それは主張を偽りにするものではない。ただそれらを未検証にするのであり、今この対決を正直に位置づけるならこうだ:価格はあるがスコアがないモデル一つ対、スコアがあり、はるかに高い価格のモデル一つ。それ以上に強いことを言えば、ベンチマークの衣をまとった憶測にすぎない。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in its August 2026 state, ranking text-to-speech models by Elo: Cartesia Sonic 3.6 first at 1,277, Alibaba's Qwen-Audio-3.0-TTS-Plus at 1,234 and ElevenLabs Eleven v3 at 1,168.

同じ規律はレイテンシにも当てはまる。このファミリーのASR側についてAlibabaが掲げる看板となる初回トークン値——92ミリ秒——は、0.6B仕様に関する同社独自の高同時実行ベンチマークに由来するもので、第三者によるテストに基づくものではない。また、ローンチ以降に公開された分析は、ASRとTTSが単一のエンドツーエンドモデルではなく、パイプライン内の別個の製品であること、そしてコミュニティの報告では、疑似ストリーミング方式の下で長い対話においてレイテンシが蓄積することが述べられている。このファミリー全体にわたるベンダーのレイテンシ数値は、実測された体験ではなく上限として扱うべきだ。

値下げは実際にどれほどの価値があるのか

現実的なワークロードを例に取ってみましょう。英語と標準中国語で月に2,000万文字のナレーションを合成する製品です。ElevenLabs Eleven v3の100万文字あたり約100ドルという料金では、月額約2,000ドル、年間約24,000ドルになります。Qwen-Audio-3.0-TTS-Plusの100万文字あたり約27.60ドルという料金では、同じボリュームでもすでに月額約552ドルでした。9月23日にAlibabaが発表した約70%の値下げを適用すると、同じワークロードでも月額は数百ドル台前半になります。

そうした数字はどれも、そのまま契約の基準にできる定価ではない——ElevenLabsはサブスクリプション階層を通じてクレジット単位で請求し、Alibabaの値下げは、地域や階層によって異なる料金に対する割合ベースの引き下げだ。だが、比較の全体像は明白であり、予算を立てる際に基準にすべきなのはその全体像だ。

慎重にモデル化しようとしている人に向けて、ぜひ指摘しておきたい注意点が1つあります。Alibaba Cloudはシンガポールノードのリアルタイム文字起こしの課金を、時間ベースの計量からトークンベースの計量に移行しました。料金は入力トークン100万あたり0.93ドル、出力トークン100万あたり0.70ドルです。トークン課金は、与えられた音声スライスが何トークンになるかを自分で制御できない場合、時間ベース課金よりも予測しにくく、ノイズ、無音、マルチターンのコンテキストはいずれもトークン消費を押し上げます。70%という見出しの削減は、あなたの特定のトラフィックにおいて自動的に70%の節約になるわけではありません。

実際にスイッチを実行する方法

これを評価しているなら、知っておくと役立つのは、移行にエンジニアリング時間がどれだけかかるかです。どちらのモデルもクローズドなホスト型APIなので、どちらにせよHTTPエンドポイントに対して統合することになり、作業はクライアント、リトライポリシー、ボイスインベントリであり、アーキテクチャの再設計ではありません。

そこで効いてくるのが OrcaRouter の形です。ただし、まず正直な留保をひとつ。当社は Qwen-Audio-3.1-TTS も、その他の Qwen-Audio モデルもルーティングしていません。Alibaba の音声エンドポイントは当社の対象外であり、ElevenLabs も同様です。当社が担うのは、それらの周辺にある推論レイヤーです——200 以上のテキストモデルにまたがる 1 つの API キーを 0% のマークアップで、つまりプロバイダーの定価がそのまま透過され、ベンダーの値下げは再価格設定サイクルを経た後ではなく当日に当社側で反映されるということです。音声パイプラインを動かすアプリケーション——要約ツール、スクリプト生成ツール、コンテンツプランナー——を構築するチームにとって、それは複数の契約ではなく 1 つの契約を意味し、上流が劣化したときの自動フェイルオーバー、そしてモデルを組み合わせて 1 回の呼び出しにまとめるためのルーティング DSL を意味します。当社を通じて Qwen の音声を呼び出せるという意味ではありません。そうでないと言う人は、カタログを読んでいないだけです。

誰が動くべきで、誰が待つべきか

今すぐ移行を——ワークロードが中国語優先なら、方言カバレッジが要件リストに入っているなら、大量処理のコストこそが、より安いが品質の劣る音声に留まらせている制約なら、あるいは言語を切り替えてもひとつのブランドボイスを使い続けたいなら。9月23日の価格設定によって、その経済性はもはや覆しがたく、中国語の品質はそれ以前からすでに競争力があった。

待ってください——およそ16言語以上で配信している場合、製品がクローニングではなくライセンス可能な音声ライブラリに依存している場合、プラットフォームの吹き替えやエージェント向けツールに深く組み込まれている場合、あるいは調達プロセスで承認前に独立した品質スコアを求めている場合。これらはいずれも恒久的な障害ではありませんが、値下げによって解決されたものは一つもありませんでした。

そして特に注目すべき点が一つあります。Qwen-Audio-3.1-TTSがブラインドリスニングのアリーナに登場するかどうかです。それが実現した瞬間、この比較は価格や対応言語数の話ではなくなり、安価な音声が本当に同じくらい優れているのかという話になります。それこそが、今回のローンチが答えなかった問いです。