「Gemini 3.8 TTS vs Qwen Audio 3.0 TTS」用に生成されたヒーローカードで、白背景に柔らかなブルーとシアンのグラデーションアクセントをあしらっています。左側のカード「Qwen-Audio-3.0-TTS-Plus」には、Elo 1,259、アリーナボイス15種、16言語+20方言、100万文字あたり$27.6が記載されています。右側のカード「Gemini 3.8 Flash TTS」には、Elo 1,260、アリーナボイス8種、130言語、100万文字あたり$33.0が記載されています。フッター行には「Artificial Analysis Provider Voice ArenaによるElo、2026年9月」と記載されています。OrcaRouterのロゴは右下隅に合成されています。
Engineering & Research

Gemini 3.8 TTS 対 Qwen Audio 3.0 TTS:「自然に聞こえるようにする」への2つの異なる答え

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Artificial Analysis Provider Voice Arenaでは、この2つのモデルをわずか1 Eloポイントが隔てており、両者はまったく異なる課題を解決することでそこに到達しています。Qwen-Audio-3.0-TTS-Plusはランク3、Elo 1,259、1,447サンプル、アリーナ音声15種、2026年9月リリース、100万文字あたり27.60ドルで掲載されています。Gemini 3.8 Flash TTSはランク2、1,260、1,999サンプル、アリーナ音声8種、2026年9月23日リリース、100万文字あたり33.00ドルで掲載されています。統計的に区別がつかず、価格は20パーセント差、そして合成音声を優れたものにする要因についての正反対の理論の上に築かれています。

理論のほうが興味深い部分だ。Qwenの答えはインライン制御だ。テキスト全体に散りばめる86個のデリバリータグによって、モデルはどこで息継ぎをし、どこを強調し、声域を切り替えるべきかを知る。Googleの答えはディレクション層だ。行ごとの指示、2話者の段取り、そして少数の非言語キューだ。もしSSML風のアノテーションを出力するパイプラインをすでに構築しているなら、どちらか一方は適合し、もう一方は適合しない。そして、その互換性はEloポイント1点よりも重要だ。

その2つが実際にボード上でどこに位置するのか

Provider Voice Arena を正直に読み解くには、順位ではなく区間を見る必要がある。

• Qwen-Audio-3.0-TTS-Plus — ランク3、Elo 1,259、1,447サンプル、15のアリーナボイス、2026年9月、100万文字あたり27.6ドル。

• Gemini 3.8 Flash TTS — 2位、Elo 1,260、1,999サンプル、8つのアリーナボイス、2026年9月、100万文字あたり$33.0。

• Cartesia Sonic 3.6 — 1位、Elo 1,273、1,757サンプル、アリーナボイス8種、2026年8月、100万文字あたり49.0ドル。

上位3つは同じ一団だ。上位2つについて公表されている区間は上下に17ポイントずつ広がっており、これは1位と3位の間の広がり全体よりも大きい。したがって、それらの間の順序は安定した証拠とは言えない。このボードが確かに示しているのは、3つとも先頭集団にあり、その下に近いものはないということだ — 10位のGemini 3.1 Flash TTSは1,199だ。

注目すべき唯一の非対称性は、アリーナの音声数です。Qwenは15音声を投入しているのに対し、Geminiは8音声なので、Qwenのスコアはベンダー自身の製品のより広いサンプルにわたる平均です。これはいい面も悪い面もあります。Qwenのカタログ全体がどんな音かをより公平に推定できる一方で、平均を押し下げる弱い音声を投入する機会をQwenに多く与えてもいます。どちらの見方でも、両者が同点であるという結論は変わりません。

A generated two-column scoreboard for Qwen-Audio-3.0-TTS-Plus and Gemini 3.8 Flash TTS — Qwen at Arena Elo 1,259, $27.60 per 1M characters, 15 arena voices, 16 languages and inline-tag style control; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 8 arena voices, 130 languages and a direction layer — over the footer 'Per Artificial Analysis Provider Voice Arena, Sept 2026.'

方向レイヤーに対する86個の配送タグ

これが実質的な違いであり、ほとんどの統合を左右します。

Qwen-Audio-3.0-TTS には、86 個のインライン・デリバリータグ — テキストに埋め込まれ、あるスパンがどのように読み上げられるかを制御する注釈 — が搭載されています。これはマークアップ方式であり、台本が演技を担います。これは SSML を扱ったことがある人なら誰でも馴染みがあり、テキストをプログラムで生成するツールとも相性が良いです。なぜなら、制御面が API 呼び出しではなく文字列変換だからです。

Gemini 3.8 Flash TTSは別の道をたどる。台詞の演出は、俳優に指示を出すのと同じように、ペース、強調、感情のトーンを、インラインのマークアップではなく独立した指示として与える。2話者のシーンも1回の呼び出しの中で演出できる。さらに、少数の非言語キューがスクリプトに書き込める:<laughs><sigh><gasp>をインラインキューとして、加えて|mhm||yeah|をあいづちの音として使える。

つまり、どちらのモデルもテキスト内アノテーションを受け付けます。違いは語彙の規模と、残りの制御がどこにあるかです。Qwen のほうはより広範でフラットで、86 個のタグがすべてテキスト内にあります。Google のほうはテキスト内ではより限定的で、テキスト外ではより広範です。発話の方向付けと話者のステージングは、呼び出しレベルのパラメータになっています。すでに豊富なインラインマークアップを出力するシステムを移植するなら、Qwen のほうが移植は短く済みます。どうせアプリケーションコードで方向付けロジックを構築するなら、Google の分割のほうがすっきりしています。

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

言語カバレッジ対方言カバレッジ

カバレッジ数値は比較可能ではなく、単純に比較するのは誤りです。

Gemini 3.8 Flash TTS は130言語をカバーし、言語はテキストから自動検出されます。Flash-Lite TTS は101言語をカバーします。これは言語ファミリーをまたぐ広がりであり、市場のロングテールに到達しなければならないローカリゼーション処理に求めるものです。

Qwen-Audio-3.0-TTSは、16言語に加えて中国語の20方言地域をカバーしている。これは一つの語族内での深さだ。20の方言地域は、見た目どおりに130言語より少ない数ではない——それは種類の異なる主張であり、中国大陸の各地域にまたがる中国語話者にサービスを提供する製品にとっては、より有用な主張だ。130言語と標準中国語の音声1つを備えたモデルは、20の方言地域を備えたモデルが四川のユーザーに果たすようには、そのユーザーに応えられない。

どちらが重要かは、完全にあなたのオーディエンス次第です。要件が「少なくとも20の市場でそこそこ通用すること」なら、Gemini。 「中国市場で本当に正しいこと」なら、Qwen。

価格、そして文字単価が隠すもの

• Qwen-Audio-3.0-TTS-Plus — リーダーボードの正規化基準で100万文字あたり27.60ドル。Flash版は100万文字あたり約15ドルで、公称の初回パケット遅延は約300ms。

• Gemini 3.8 Flash TTS — 正規化後100万文字あたり$33.00。Googleによる請求は、2026年12月31日まで入力テキスト100万トークンあたり$0.50、出力音声100万トークンあたり$9.00、その後は$1.00と$18.00です。

• Gemini 3.8 Flash-Lite TTS — 正規化1M文字あたり$22.10、ランク6、Elo 1,235。2026年12月31日まで、100万オーディオトークンあたり$6.00で課金されます。

文字あたりの数値はどちらもArtificial Analysisによる正規化であり、ベンダーの定価ではありません — QwenはAlibaba Cloud Model Studioを通じて請求し、Googleはトークン単位で請求しており、どちらもこれらのモデルの文字あたりの料金を公表していません。これらは比率のために使用し、その比率はQwenに有利な約1.2倍であり、引用として使用しないでください。

各ティアはその形を異にしている。QwenはPlusとFlashに分かれ、Flashティアは品質と引き換えに約300 msの初回パケットという触れ込みを手に入れている。GoogleはFlashとFlash-Liteに分かれ、さらにStandard、Batch、Flex、Priorityへと細分化される——Flash TTSでは音声トークン100万個あたり$4.50、$9.00、$16.20。Googleのモデルではワークロードを分類することが報われ、Qwenのモデルでは品質ティアを事前に選ぶことが報われる。

利用可能性ももう一つの実質的な違いです。Gemini 3.8 Flash TTS は Gemini Developer API で一般提供されています。Qwen-Audio-3.0-TTS はクローズドでホスト型専用であり、オープンウェイトなしで Alibaba Cloud Model Studio を通じて提供されています。モデルを自分で実行する必要があるなら、このどちらもあなた向けではありません — しかし、あなたのインフラがすでに Alibaba Cloud 上にあるなら、Qwen モデルは解決すべきエグレス(外部転送)の話がない方です。

双方のベンダーの主張

どちらのモデルもアリーナ以外に独立したベンチマークを持っておらず、両ベンダーは公表した主張をそのようにラベル付けすべきです。

Googleの、Gemini 3.8 Flash TTSに関する成績:Hume AI Voice Design Benchmarkでは71.4で1位、アクセントモデリングでは60.8で1位、FlashおよびFlash-LiteのHume Overall Quality Indexでは1位と2位、そして日本語、ブラジルポルトガル語、ベトナム語、現代標準アラビア語、メキシコスペイン語、ヒンディー語で主張されているブラインド選好の上位入賞。実行結果は公開されていない。

アリババの、Qwen-Audio-3.0-TTSに関するもの:86タグの話し方制御システム、20の方言地域、そしてFlash版における約300 msという初回パケットの数値。これも未再現。

arena Elo はこの記事で唯一独立に収集された品質数値であり、それによると両者はボードの首位で並んでいる。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing Cartesia Sonic 3.6 at rank 1 with Elo 1,273, Gemini 3.8 Flash TTS at rank 2 with 1,260 across 1,999 samples, Qwen-Audio-3.0-TTS-Plus at rank 3 with 1,259, 1,447 samples, 15 arena voices and $27.6 per 1M characters, and ElevenLabs Eleven v3 at rank 17 with 1,167.

Geminiが追加するもの、Qwenにはないもの

音声作成は最も明確なギャップです。Gemini 3.8 Flash TTSは、自然言語による説明からの音声デザインと、30秒のサンプルからの音声複製をサポートしており、同意の確認と、出力へのSynthIDウォーターマークおよびC2PAクレデンシャルが付与されます。カスタム音声には2つの形態があります。プロジェクトごとに200個のステートフル音声(有効期間は1年)か、voicekey_...ハンドルで指定されるステートレス音声で、7日後に失効します。音声リミキシングは近日提供予定として記載されています。

出力フォーマットの制御は2番目です。unary エンドポイントでは WAV 24 kHz モノラル 16 ビット符号付き PCM、ストリーミング エンドポイントではヘッダーレス PCM(audio/l16)、さらに audio/mulaw と audio/alaw、および設定可能なサンプルレートに対応します。電話関連の作業では、mulaw サポートによってトランスコーディングのステップが不要になります。

どちらに電話しますか

Qwen-Audio-3.0-TTSを選ぶべきなのは、ユーザーが中国語話者で方言カバレッジが要件である場合、ジェネレーターが直接出力できる豊富なインライン マークアップ語彙が必要な場合、またはすでにAlibaba Cloudを利用していて動作するエンドポイントまでの最短経路を求める場合です。また、正規化ベースでは2つの中で安い方であり、初回パケットが約300 msで許容できるならFlash版はさらに安くなります。

多くの言語にわたる広さが必要で、1つの言語での深さは必要ない場合、特定の音声を作成または複製する必要がある場合、mulawまたはalaw出力が必要な場合、あるいは「ホスト専用ではなく一般提供されていること」が調達要件である場合は、Gemini 3.8 Flash TTSを選んでください。

どちらも悪い選択ではなく、どちらが明らかに優れているわけでもない — それこそが1 Eloポイント差の意味するところだ。決め手となるのは品質ではなく、相性だ。

どちらか一方にまだ本腰を入れてコミットしない理由も、そこにあります。OrcaRouterなら1つのキーの背後に200以上のモデルを、プロバイダー表示価格のままマークアップなしで利用できるので、どちらかのラボの料金改定は更新時ではなくその日のうちに請求へ反映されます。さらに自動フェイルオーバーにより、負荷がかかると弱る合成エンドポイントはリクエストを落とすのではなく別のエンドポイントへ引き継がれます。当社はQwen-Audio-3.0-TTSをホストしていません — それはAlibaba Cloud Model Studio経由で提供されています — また、GoogleのAPIから提供されるGemini 3.8 TTSエンドポイントもホストしていません。当社が担っているのはテキスト層とその上位のルーティングであり、これによって、選ぶ前に1か月間、実際のトラフィック上で両方を動かせるのです。

注目すべき数字は、次回のアリーナ改訂です。Qwenでは1,447サンプル、Geminiでは1,999サンプルであり、どちらの区間もまだ十分に広いため、1か月分の投票で両者を分けられる可能性があります——あるいは、引き分けが答えであることを確認するかもしれません。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新