「Gemini 3.8 Live vs Qwen-Audio-3.1-TTS」向けに生成されたヒーローカード。白い背景に、柔らかなブルーとシアンのグラデーションアクセント。 「二つの半分、8日違いで刷新」という見出しの下に、2つのパネルが並ぶ。左のパネルは「2026年9月15日 — Live API上のGemini 3.8 LiveとExtended Thinking」を扱う。右のパネルは「2026年9月23日 — ApsaraのQwen-Audio-3.1-TTS、合成を約70%削減」を扱う。フッターの一行には「両者は同じ仕事ではなく、パイプラインの途中で出会う」とある。OrcaRouterのロゴが右下隅に合成されている。
Guides & Insights

Gemini 3.8 Live vs Qwen-Audio-3.1-TTS:音声スタックの二つの半身、8日違いで価格改定

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Gemini 3.8 Liveは、2026年9月15日にgemini-3.8-liveおよびgemini-3.8-live-extended-thinkingとしてLive API上で提供開始されたGoogleの音声対音声モデルです。Qwen-Audio-3.1-TTSは、それから8日後の2026年9月23日に杭州のApsara Conferenceで発表されたAlibabaのテキスト音声合成モデルで、音声合成に関する約70%の値下げも同時に打ち出されました。この8日間の隔たりこそ、この比較を7月ではなく今読む価値がある理由です。両製品の役割は何も変わっていません — 一方は聞いて話し、もう一方はテキストを読み上げる — しかし、本番用の音声パイプラインの両方の半分が、わずか2週間のうちに再構築されるか価格が改定され、かつてこの対決の決着をつけていた計算は静かに動いたのです。

2つの半分が8日間隔で更新

まず、この組み合わせを異例にしている点から始めよう。2つのモデルは競合しない。音声プロダクトには口と耳があり、これはそれぞれそのどちらか一方を担っている。Gemini 3.8 Live はループを閉じる — 音声と映像を入力し、音声を出力し、割り込みを処理し、会話の背後でツール呼び出しが動く。Qwen-Audio-3.1-TTS は文字列と参照音声を受け取り、パフォーマンスを返す。それは何よりも優れた口であり、耳になろうとはしていない。

9月というタイミングが興味深いのは、この2つの発表が同じ予算項目の両端を狙っている点にある。Googleの9月15日のローンチは価格変更を伴わない機能の話で、Alibabaの9月23日の発表は主に利益率の話であり、新しい機能が付随していた。8月にハイブリッドパイプラインを構築したチームは、わずか8日の間に、両方のレッグを見直す理由を突きつけられた——そして、そのレッグのうち安くなったのは片方だけだった。

3.1リリースがQwen側で実際に変えたもの

アリババは9月23日に1つのモデルを投入したわけではない。3.1世代は5つのエンドポイント——Qwen-Audio-3.1-ASR、Qwen-Audio-3.1-ASR-Next、Qwen-Audio-3.1-TTS、Qwen-Audio-3.1-TTS-Next、Qwen-Audio-3.1-Realtime——をカバーしており、そのうち1つだけ、通常のTTS階層が、すでに3.0 TTSモデルを呼び出している人にとってそのまま置き換え可能なドロップインだ。

そのティアでは3つの点が変わり、そのうち1つは実質的な移行コストです。デリバリー制御は、86個のインラインタグからなる固定語彙から自然言語による指示へと移りました。適切な位置に正しいブラケットを挿入する代わりに、望む感情、ペース、スタイルを記述します。言語間の音色転送が登場し、1つの参照音声が北京語、広東語、英語、日本語をまたいでその同一性を保てるようになりました。そしてモデルは、別個のノイズ除去ステップなしで、ノイズやエコーのある参照音声を直接扱えるようになりました。言語カバレッジは、ベンダー報告で16言語+中国語の20方言地域のままで変わっていません。そして——これは他の場所ではうやむやにされるため指摘する価値がありますが——Aliba​ba自身の資料では3.1ティアで7言語が追加されるとされており、7月世代の公開カバレッジが挙げていた16言語とは整合しません。必要な特定の言語をModel Studioで確認するまでは、どちらの数値もベンダー報告として扱ってください。

このリリースで本当に新しい製品は Qwen-Audio-3.1-TTS-Next で、Alibaba はこれを「Audiogen」モデルと呼んでいる。音声、効果音、背景アンビエンスを一度に生成するワンパスで、マルチスピーカー対話、ポッドキャストの組み立て、シーン制作に対応する。北京ノードでの価格は、入力100万トークンあたり0.848ドル、出力100万トークンあたり1.696ドルで、入力は3,000文字まで、生成音声はポッドキャストで240秒、それ以外では120秒、毎秒3リクエスト、各30秒の参照クリップを最大3つまで受け付ける。対応するのは中国語と英語のみだ。あなたのパイプラインが台本を読む単一のナレーターなら、その製品はあなたには無関係だ。2人のホストとBGMなら、このリリースをわざわざ見る理由はまさにそれだ。

継ぎ目こそが、あなたが実際に選んでいるものだ

2つのモデルは同じ仕事をするわけではないので、この決定はベイクオフではない。問題は、ハンドオフをどこに置くか、そしてその継ぎ目を目に見えなくするためにどれだけ支払う用意があるかだ。

正直な設計は二つある。一つ目は単一のネットワークだ。Gemini 3.8 Live がターン全体を処理し、発信者の声を聞き、何を言うかを決めてそれを話す。そして与えられた声をそのまま受け入れる——それはクローンもできず、ブランドも付けられない。二つ目はカスケードだ。認識、次に推論、そして口としての Qwen-Audio-3.1-TTS。自社のタレントが録音した声を含む千もの声が手に入るが、その代償として二つか三つのベンダー境界をまたぐレイテンシと、一文が API 呼び出しをまたいで分割されるときに失われる韻律を抱えることになる。

ほとんどのチームは最終的に両方を採用することになるが、それは決断力の欠如ではない。遅延が体感される場面——割り込み、相づち、相手がまだそこにいると伝える「mm-hm」——ではリアルタイムモデルを使い、品質が聞き取られる場面——ポリシーの長い読み上げ、意図的にゆっくりしたペースで読まれる確認番号、通話のたびに完全に同一でなければならないブランドボイス——では合成モデルを使う。幅広い製品群にとって、ハイブリッドが正解だ。同時に、ここでコストモデルが難しくなる。異なる2つの単位を計量することになるからである。

A screenshot of the Artificial Analysis Speech to Speech leaderboard in English, captured 25 September 2026, showing the AA Speech to Speech Index panel with index values of 82.6, 81.5, 81.3, 80.1, 76.0, 73.9 and 71.5, with the cost-per-hour-of-input-audio axis running to roughly $10.75. The bar labels are set vertically and are not legible at capture size. No Alibaba Qwen-Audio model appears on the board, because the board scores speech-to-speech models and Qwen-Audio-3.1-TTS is a synthesis model.

音声1時間単位で価格設定されており、それは両方に当てはまる唯一の単位です。

GoogleはLive APIを分単位で課金し、AlibabaはQwen TTSの各料金ティアを文字単位およびトークン単位で課金する。両者を比較するには正規化の基準を選ばなければならないが、音声について唯一正当化できる基準は、完成した音声の1時間である。

• 入力の従量課金 — Gemini 3.8 Live は音声1分あたりで、入力 $0.005、出力 $0.018 なのに対し、Qwen-Audio-3.1-TTS は100万文字あたり。値下げ前は 3.0 Plus ティアが約 $27.60、Flash ティアが約 $15 に達し、値下げ後は TTS Flash ティアが入力トークン100万あたり1.5元、出力トークン100万あたり12元
• 出力の従量課金 — Gemini 3.8 Live の双方向会話は、定価で実時間1時間の通話あたり約 $1.38(キャッシュ利用前)なのに対し、Qwen-Audio-3.1-TTS は一方向ストリーム。北京ノードでは 3.1-Next ティアが入力トークン100万あたり $0.848、出力トークン100万あたり $1.696
• 発信者の音声を聞き取れる — Gemini 3.8 Live は対応、ネイティブの音声・映像入力 対 Qwen-Audio-3.1-TTS は非対応、テキスト入力と音声出力
• 音声 — Gemini 3.8 Live は1種類、クローン不可、ブランド化不可 対 Qwen-Audio-3.1-TTS は1000種類以上、ノイズの多い参照音声からのゼロショットクローニングに対応
• 言語 — Gemini 3.8 Live はベンダー申告で97言語、会話途中での切り替えに対応 対 Qwen-Audio-3.1-TTS はベンダー申告で16言語に加え中国語の20方言地域、北京語・広東語・英語・日本語をまたぐ音色転送に対応
• 話し方の制御 — Gemini 3.8 Live はプロンプトと会話コンテキスト 対 Qwen-Audio-3.1-TTS は自然言語による指示で、3.0世代の86個のインラインタグを置き換え
• 独立系スコア — Gemini 3.8 Live は Artificial Analysis Speech to Speech Index で Extended Thinking 版が82.6、標準版が76.0 対 Qwen-Audio-3.1-TTS はなし。Qwen で最も近い数値は、Provider Voice Arena における前世代 3.0 Plus ティアの Elo 1,259 だが、これは本モデルではなく前身モデルのスコアである

この値引き率は、リージョンやティアによって異なる料金を基準に提示されたものです。つまり、見出しの70%はあなたのトラフィックに関する約束ではありません。また、Aliba​ba Cloudはシンガポールノードのリアルタイム文字起こしを、時間ベースの計量からトークンベースの計量に変更しました。これは、無音もマルチターンのコンテキストもトークン消費を膨らませるため、より予測しにくい基準です。新しい料金表は、ご自身の音声と照らし合わせて確認してください。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273 with a 17-point interval over 1,757 samples and $49.0 per million characters, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples at $16.5, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259 on 1,447 samples at $27.6, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0. The board scores synthesis models and carries no row for Qwen-Audio-3.1-TTS or for any Gemini 3.8 Live endpoint.

3.1アップグレードが解決しないもの

ここが、どちらの方向にも間違えやすい部分です。3.1 の改善によって Qwen-Audio-3.1-TTS が Gemini 3.8 Live の担う仕事の候補になるわけではありません — 指示ベースの制御、音色転送、ノイズ入力耐性はいずれもそれをより優れた口にしますが、そのどれもそれに耳を与えるものではありません。同様に、Gemini 3.8 Live のベンチマーク上の位置づけは、あなたのブランドボイスが広東語の一文に耐えられるかどうかについて何も教えてくれません。

値下げがあると、なおさら目を背けたくなる証拠の穴も存在する。Qwen-Audio-3.1-TTSには独立したスコアがない。Provider Voice ArenaでQwenの名の隣に表示される1,259 Eloは、置き換えられるモデルであるQwen-Audio-3.0-TTS-Plusのもので、1,447サンプルで測定されたものだ。後継モデル自身のArena行はまだ存在しない。承認プロセスで第三者による数値を必要とするなら — ブランドボイスならおそらくそうすべきだが — それがないのは新しい方のモデルであり、まだ擁護できないのは安価なティアの方だ。これを決着させる唯一の出来事は、Qwen-Audio-3.1-TTSがブラインドリスニングのボードに登場することだ。

1つの鍵が役立つ場合と役立たない場合

3.1リリースの一つの帰結は、インフラの詳細ではなくプロンプトエンジニアリングの詳細のように見えるため、見落とされがちです。86個のハードコードされたタグを自由形式の指示に置き換えると、デリバリー指示がテキスト成果物になります。今やあなたはそれらを生成し、バージョン管理し、新モデルの解釈に対してそれらすべてを再検証します。そして障害モードはエラーではなくドリフトです。なぜなら「温かいが感傷的でない」という二つの言い回しは同じようには響かないからです。

これは音声パイプラインを包み込むテキスト推論の問題であり、まさに私たちが役に立てる領域です。OrcaRouter は Qwen-Audio-3.1-TTS やその他の Qwen-Audio モデルをルーティングしておらず、Gemini 3.8 Live エンドポイントもルーティングしていません。このスタックのどちらの半分も当社を通じて呼び出すことはできず、ここに書かれていることを、そうであるという主張として読むべきではありません。私たちが担っているのは、方向テキストを書き、検証するレイヤーです。qwen/qwen3.8-flash および google/gemini-3.8-flashを、200以上のモデルの中からプロバイダー表示価格のままマークアップなしで使える単一のキーで利用でき、複数のモデルを1回の呼び出しに組み合わせるルーティング DSL と、上流が劣化したときの自動フェイルオーバーを備えています。読み取り方を変えたばかりのモデルに対して1万件の配信プロンプトを再検証しようとしているとき、バリアントを生成し一貫性をスコアリングすることこそ、4つの契約ではなく1つの契約であるべき部分です。

選ぶ前に測るべきもの

3つの実験は、どんなボードにも勝る答えを出す。参照音声を1つと、自分の台本の1段落をQwen-Audio-3.1-TTSに通し、指示ベースの制御が同じ話し方を2回与えるかどうかに耳を傾けよ——それが移行リスクであり、それを前提に計画するより測定するほうが安くつく。自分の背景ノイズが入った実際の通話録音をGemini 3.8 Liveに通し、発信者が単語の途中で割り込んだときにターンテイキングが保たれるかを確認せよ——それが音声対音声インデックスが定量化しようとしているものであり、それは実際の電話回線に触れたときに、鵜呑みにできるほど確実に持ちこたえるものではない。そして、自分の利用量については、2社のベンダーが請求に使う単位ではなく、音声時間で計算を回せ。なぜなら、この特定の組み合わせでは、「安価な中国製TTS」と「Goog​le flagship」の間に予想される価格差は、見た目ほど大きかったことはなく、9月23日以降はさらに小さくなっているからだ。

A generated summary card for Gemini 3.8 Live vs Qwen-Audio-3.1-TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — speech-to-speech, Live API, 15 September 2026', 'Qwen-Audio-3.1-TTS — text-to-speech, Apsara, 23 September 2026', 'The gap: eight days, and only one of them got cheaper', 'Independent score: Gemini 82.6 on AA Speech to Speech; Qwen 3.1-TTS none', and 'Verdict: not substitutes — pick which half you are shopping for'. A footer line reads 'Vendor-reported figures where stated; independently measured where a board is named.' The OrcaRouter logo is composited in the bottom-right corner.

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新