Qwen-Audio-3.0-TTSとQwen-Audio-3.1-TTSを比較するヒーローカード。旧モデルの2026年7月20日リリース、Elo 1,238、86個のインライン・デリバリータグと、新モデルの2026年9月23日発表、70%の値下げ、指示ベースの制御を並べ、その間に「9週間」とラベルされた矢印を配置。
Guides & Insights

Qwen-Audio-3.1-TTS 対 Qwen-Audio-3.0-TTS:2か月で何が変わったか

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Qwen-Audio-3.0-TTSは2026年7月20日にリリースされ、独立系音声リーダーボードの首位に直行しました。PlusティアはArtificial AnalysisのProvider Voice ArenaリーダーボードでElo 1,238に達し、同ボードで2位でした。9週間後の2026年9月23日、ベンダーは杭州のApsara ConferenceでQwen-Audio-3.1-TTSを発表し、約70%の値下げを付けました。このタイミングが異例の比較にしています。置き換えられるモデルは時代遅れではなく、ベンチマーク済みで、実績があり、依然としてトップ近くにいるのです。つまり、本当の問いはどちらが優れているかではありません。具体的に何が変わり、そのどれが自分のワークロードにとって重要で、後継モデルがまったくスコアリングされていないときに、すでに信頼しているスコアがどうなるのか、ということです。

2か月、5つのエンドポイント、1つのファミリー

アリババは単一のモデルを投入したのではない。3.1リリースには5つが含まれる:Qwen-Audio-3.1-ASR、Qwen-Audio-3.1-ASR-Next、Qwen-Audio-3.1-TTS、Qwen-Audio-3.1-TTS-Next、Qwen-Audio-3.1-Realtime。現在Qwen-Audio-3.0-TTSを呼び出している人にとって、そのうちドロップインで置き換えられるのは1つだけ——通常のTTSティア——であり、もう1つはアップグレードではなく真の新製品だ。

その2つ目は、たとえ一度も使うことがなくても、理解しておく価値がある。Qwen-Audio-3.1-TTS-Nextは、Alibabaが「Audiogen」モデルと呼ぶもので、テキスト、タイムスタンプ、参照音声から、音声、効果音、背景環境音を一度に生成するシングルパスのモデルだ。マルチスピーカー対話、ポッドキャストの組み立て、シーンのサウンドスケープ、48 kHz出力。Alibaba CloudのModel Studioのドキュメントには、その制限が明確に記載されている。入力は3,000文字、生成音声はポッドキャストの場合240秒、それ以外は120秒、1秒あたり3リクエスト、出力はWAV、MP3、PCM、そしてWAV、MP3、OGG Opus形式の30秒の参照クリップを最大3つまで受け付ける。生のPCM参照入力には対応していない。北京ノードでの価格は、入力トークン100万あたり0.848ドル、出力トークン100万あたり1.696ドル(プロモーション料金を除く)で、中国語と英語のみに対応している。

3.0-TTSを使っていて、あなたの仕事が「このスクリプトを音声にする」ことなら、それは統合方法を何も変えません。あなたの仕事が「音楽ベッド付きの2ホストポッドキャストを組み立てる」ことなら、3.1-TTS-Nextは別の製品カテゴリーであり、場合によっては、このリリースにそもそも目を向ける理由になるかもしれません。

アップグレードを1行ずつ

A two-column scoreboard for Qwen-Audio-3.1-TTS and Qwen-Audio-3.0-TTS across languages, dialects, timbre transfer, delivery control, noisy reference audio and arena score, with a footer stating that the 3.1 figures are vendor-reported and unscored and the 3.0 Plus Elo is per Artificial Analysis.

• 言語 — Qwen-Audio-3.1-TTS:ベンダー報告による16言語で、前世代から7言語が追加されています。Qwen-Audio-3.0-TTS:7月リリースに関する公開情報に記載されている16言語。

• 中国語の方言 — Qwen-Audio-3.1-TTS:20の方言地域、引き継ぎ。Qwen-Audio-3.0-TTS:20の方言地域。

• 言語間の音色転送 — Qwen-Audio-3.1-TTS:対応。1つの声を北京語、広東語、英語、日本語にまたがって引き継げます。Qwen-Audio-3.0-TTS:非対応。

• 読み上げの制御 — Qwen-Audio-3.1-TTS: 感情・話速・スタイルを指示ベースで制御。Qwen-Audio-3.0-TTS: 86種類のインライン読み上げタグ。

• ノイズの多い参照入力 — Qwen-Audio-3.1-TTS:ノイズやエコーのある参照音声をそのまま処理でき、ノイズ除去モードを別途用意する必要はありません。Qwen-Audio-3.0-TTS:クリーンな参照音声が必要です。

• 独立系スコア — Qwen-Audio-3.1-TTS:まだなし。Qwen-Audio-3.0-TTS-Plus:2026年8月時点でArtificial AnalysisのProvider Voice ArenaリーダーボードにおいてElo 1,238。

言語の数が合わない、そしてそれは重要なことだ

これは、ほかのどこでもなら丸め込まれてしまうような些細な点だからこそ、述べておく価値がある。Alibabaの発表資料には、3.1 TTSティアが7言語を追加すると書かれている。7月の3.0世代に関する公表された報道では——当社自身のその月の比較記事も含めて——3.0ティアに16言語が挙げられていた。7に16を足せば23であり、16ではない。そしてAlibabaは、この2つの数字を整合させる説明を公表していない。

考えられる説明はどれも地味だ。3.1の数字は別の集合を数えているのかもしれないし、3.0の数値はローンチ時に誇張されていたのかもしれないし、「7つ追加」はTTSではなくASR層を指しているのかもしれない。どれなのかは分からない。分かっているのは、この比較の両側における言語数は、一度も独立した監査を受けていないベンダー報告の数字であり、「16言語」をどちらかのモデルについて厳然たる事実として引用する人は、マーケティングスライドを引用しているにすぎないということだ。数に基づいて計画を立てる前に、必要な特定の言語をModel Studioのドキュメントに照らして確認してください。

A screenshot of Alibaba Cloud Model Studio's English documentation site with the Speech-to-Speech branch of the navigation open, showing the reference page for qwen3.8-livetranslate-flash-realtime with its model capabilities and context limit tables, under an Apsara 2026 Conference banner.

インストラクション制御は、実際にコードに現れる変化です

3.1 TTSリリースの中でも、これこそがプロンプトの書き方を変えるものだ。3.0世代は86個のインラインタグで発話を制御していた——覚えて正しい位置に挿入しなければならない固定の語彙であり、書かれたとおりのことだけを実行し、それ以上は何もしなかった。3.1ティアは、それを自然言語による指示に置き換える。感情、ペース、望むスタイルをあなたが記述し、モデルがそれを解釈する。

実用的な違いは、表現力と予測可能性の対比にある。タグ語彙は契約である——同じタグは毎回同じ発声を生み出し、それは1万のクリップにわたって音声が一貫していなければならない制作パイプラインで求められるものである。自由形式の指示はより広範だがより緩く、通常のプロンプト感度問題を引き継ぐ。「温かいが感傷的でない」という2つの言い回しは同じようには響かず、同じ言い回しを別の日に2回呼び出しても同様である。

現在のパイプラインがそれら86個のタグで構築されているなら、アップグレードは無料ではない。あなたは決定論的な制御面を確率論的な制御面と引き換えにすることになり、移植作業とはAPI呼び出しではなく、所有するすべてのプロンプトテンプレートを新しいモデルの解釈に照らして再検証することだ。節約分を予算計上する前に、そのための予算を確保せよ。

言語間音色転送、そしてその実際の用途とは

1つのリファレンスボイスが、北京語、広東語、英語、日本語をまたいで引き継がれ、言語が変わってもその同一性を保つ。書面上は、これは機能の箇条書きのように読める。実際には、それは特定の、そしてコストの高い問題を解決する。すなわち、1人のプレゼンターが、それぞれの言語で別人のように聞こえることなく、複数の言語に存在しなければならないという問題だ。

従来の回避策は、言語ごとに別々の声優を起用し、自社のブランドボイスが同じ台本を共有する4つの声になったことを受け入れることだった。代替策は、1人の話者を各言語にクローンすることだったが、これはまさにクローン音声がずれやすいワークフローであり、アクセントが持ち越され、音色が薄れ、聴き手は一文のうちに気づく。言語間音色転送は、どちらの妥協も必要ないという主張である。

また、現時点では、まったく検証されていません。Qwen-Audio-3.1-TTS については、どの言語でも第三者による聴取テストは存在せず、転移が成立することを示す唯一の証拠は Alibaba 自身のデモだけです。この機能がアップグレードを検討している理由なら、導入を決める前にご自身の参照音声で試してください。それは5分でできる実験であり、この疑問に答えられる唯一の方法です。

値下げが3.0法案に何をもたらすか

アリババは音声関連の価格を全面的に引き下げた。音声合成は約70%、リアルタイムは約85%、音声認識は最大95%の引き下げとなる。この調整は、北京時間2026年9月22日00:00にAlibaba Cloud Model Studioで有効となり、北京リージョンとシンガポールリージョンを対象とし、3.1 TTSおよび3.0リアルタイムのエンドポイントに適用される。調整後、TTS Flashティアの価格は入力トークン100万個あたり1.5元、出力トークン100万個あたり12元。リアルタイムFlashティアは、テキスト入力1.5、音声入力6、テキスト出力4.5、テキストと音声の合算出力12(いずれも100万トークンあたり)となる。

すでに3.0-TTSを運用しているなら、重要なのはここです。3.0 Plusティアは、8月までArtificial Analysis上で100万文字あたり約$27.60付近で推移しており、Flashティアは約$15でした。約70%の削減が利用中のティアに適用されるなら、同じワークロードでの請求額は、コードを一行も変更することなく、以前のおよそ3分の1に下がります。これが今回のリリースの異例な点です。3.0のお客様にとって、値下げはモデルのアップグレードよりも価値があり、移行するかどうかに関係なく適用されます。

心に留めておく価値のある注意点が2つある。パーセンテージの削減幅は、地域やティアによって異なる料金を基準に示されているため、見出しの70%は、あなたの特定のトラフィックについての約束ではない。そしてAlibaba Cloudは、シンガポールノードのリアルタイム文字起こし課金を、時間ベースの従量制からトークンベースの従量制へと移行した — 入力トークン100万個あたり0.93ドル、出力トークン100万個あたり0.70ドル — これは、無音、ノイズ、マルチターンの文脈がすべてトークン消費を膨らませる場合、より予測しにくい基準となる。新しい料金表は、プレスリリースではなく、自社の音声と照らし合わせて読むべきだ。

Qwen-Audio-3.0-TTSが依然として正しい選択となる場合

三つのケースがあり、しかもそれらはエッジケースではない。

正当化できる数字が必要なとき。Qwen-Audio-3.0-TTS-Plus には独立した Elo スコア 1,238 があります — 同じボードでは、そのモデルの9月のスコアは1,259を示しており、依然として2位です。つまりスコアは衰えたのではなく上昇しているのです — 何千もの投票に裏付けられたブラインドリスニングアリーナによるものです。Qwen-Audio-3.1-TTS にはアリーナスコアが一切ありません。承認プロセスで第三者による証拠が必要なら、それを持っているのは旧モデルのほうであり、値下げしてもその事実は変わりません。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, ranking text-to-speech models by Elo with vote counts and API pricing: Cartesia Sonic 3.6 first at 1,277, Alibaba's Qwen-Audio-3.0-TTS-Plus at 1,259 on a rank range of 2-3, and ElevenLabs Eleven v3 at 1,166.

決定論が表現力を上回るとき。本番パイプラインを86タグの制御サーフェス上に構築しているなら、その出力を論理的に推論できるシステムを手にしていることになります。指示ベースの制御はより高機能である一方で予測しにくく、移行コストも実際にかかります。

アップグレードの内容があなたのワークロードに一切関わらない場合。 クリーンな参照音声と固定されたデリバリータグを使って、中程度の音量で北京語と英語を合成しているなら、言語をまたぐ音色転送、ノイズの多い入力への堅牢性、さらに7つの追加言語は、どれもあなたには存在しない問題を解決するものだ。値下げを受け入れ、モデルはそのまま使い続けよう。

2つの統合を動かさずに両方を実行する

世代交代の切り替えの厄介な点は、多くの場合、両方のモデルを同時に稼働させたいということです — スコアを背後に持つ本番パス用の3.0、新しい言語と転送機能用の3.1、そして再デプロイなしでそれらの間でトラフィックを移動する方法です。どちらもAlibaba Cloud Model Studio上のクローズドなホスト型APIであるため、1つの機能の背後に2つのエンドポイント、2つのレート制限、2つの障害モードが存在することになります。

私たちの立ち位置についての正直な注記:OrcaRouter は Qwen-Audio-3.1-TTS や Qwen-Audio モデルをルーティングしておらず、Alibaba の音声エンドポイントも一切ルーティングしていません。私たちが提供するのは、次のようなパイプラインを支えるテキスト推論レイヤーです — 200 以上のモデルにまたがる 1 つの API キーを 0% のマークアップで、プロバイダーの定価をそのまま透過適用するため、ベンダーの値下げは再価格設定サイクルを待たずに当日中に当社側へ反映されます。音声パイプラインを動かしているサービスがスクリプトジェネレーター、要約ツール、コンテンツプランナーのいずれかであれば、それは複数ではなく 1 つの契約、上流が劣化したときの自動フェイルオーバー、そしてモデルを単一の呼び出しに組み合わせるためのルーティング DSL を意味します。それは、Qwen の音声を私たち経由で呼び出せるという意味ではありません。また、そう示唆するページは、私たち自身のカタログについて誤っています。

正直な要約

Qwen-Audio-3.1-TTSは、重要な3つの追加要素——指示に基づく話し方制御、言語をまたぐ音色転送、劣悪な参照音声に対する堅牢性——を備えた本格的なアップグレードであり、さらにそれらすべてを上回る価値のある価格引き下げも実現している。Qwen-Audio-3.0-TTSは、通常なら2か月前のモデルが置き換えられてしまうようには取って代わられていない。後継モデルがまだ獲得していない独立したベンチマークスコアを依然として保持しており、このファミリーの差別化の大半が依拠する中国語方言の範囲も引き続きカバーしている。

つまり、この決断はマーケティングが示唆するよりも狭いものです。大量に生成しているなら、価格変更はすでにあなたに適用されています。新しい言語や音色転送が必要なら、まず移行して、自分の音声でその機能を検証してください。根拠のある品質の数値が必要なら、Qwen-Audio-3.1-TTSがブラインドリスニングアリーナに登場するまで待ってください——それがこれを決着させる唯一の出来事であり、それが起こるまでは、新しいモデルはより安価で、古いモデルは実績がある、というのが正直な見解です。