「Gemini 3.8 Live vs Gemini 3.8 TTS」の生成されたヒーローカード。白い背景に、柔らかなブルーとシアンのグラデーションアクセント。左の列は「Live API で提供」という見出しで、'gemini-3.8-live'、'聞き取り、話す'、'音声入力、音声出力' を列挙している。右の列は「TTS エンドポイントで提供」という見出しで、'gemini-3.8-flash-tts'、'書かれたテキストを読み上げる'、'テキスト入力、音声出力' を列挙している。フッター行には「どちらも Gemini 3.8 TTS とは呼ばれていない。」と書かれている。OrcaRouter のロゴが右下隅に合成されている。
Guides & Insights

Gemini 3.8 Live 対 Gemini 3.8 TTS:会話ループと読み上げ音声が同じ世代名を共有している

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Gemini 3.8 Liveは、2026年9月15日にgemini-3.8-liveおよびgemini-3.8-live-extended-thinkingとして出荷された音声対音声モデルです。「Gemini 3.8 TTS」はモデルではありません。これは、Goog​le自身の投稿タイトルを含むローンチ報道が、2026年9月23日にgemini-3.8-flash-ttsおよびgemini-3.8-flash-lite-ttsとして登場した2つのテキスト読み上げエンドポイントに対して用いている包括的な用語です。つまり、これは2つの製品が1つの役割を巡って争う、よくある比較ページではありません。同じ世代番号を共有する2つの役割についてのページであり、「Live」と「TTS」という言葉を同じものの2つの種類として扱うときに人々が犯す、特定の間違いについてのページです。

共有世代番号が隠しているフォーク

Google の音声生成ドキュメントは自ら線引きしており、その一文はうっかり読み飛ばしやすいものです。「TTS 機能は、Live API を通じて提供される音声生成とは異なります。」同じ箇所でその理由も説明されており、理由は品質の問題ではなく構造上のものです。Live API は「インタラクティブで非構造化された音声、およびマルチモーダルな入力と出力」向けに構築されています。Gemini API 経由の TTS は「正確なテキスト読み上げと細やかな制御を必要とするシナリオに合わせて調整されています。」後の注記では入力の形が明示されています。TTS モデルはテキストのみを受け取り、音声のみを返します。

その単一の制約——テキスト入力、音声出力、音声入力なし——が、この比較のすべてだ。Gemini 3.8 Live モデルは、自分に話しかけている人の声を聞く。Gemini 3.8 Flash TTS や Flash-Lite TTS モデルは誰の声も聞かない。文字列を読み取り、それを演じるだけだ。あとはそこからすべてが導かれる。一方のために存在するベンチマークは他方には無意味であり、料金は異なる単位で課金され、故障モードはまったく比較にならない。

これが重要なのは、二つのユースケースが外から見るとまったく同じに見えるからです。音声エージェントもナレーションパイプラインも、最終的には人間が話しているように聞こえる音声を出力します。しかし、中断できるのはそのうちの一方だけです。

「Gemini 3.8 TTS」が実際に解決される場所

Gemini APIの音声生成用のサポート対象モデル表を開くと、4つのTTSエントリが見つかり、Gemini 3.8 TTSというエントリはありません。そのうち2つはこの世代です。Gemini 3.8 Flash TTS、モデルID gemini-3.8-flash-tts、130言語対応、およびGemini 3.8 Flash-Lite TTS、モデルID gemini-3.8-flash-lite-tts、101言語対応。残りの2つ — Gemini 3.1 Flash TTS Preview と Gemini 2.5 Pro Preview TTS — は、Flash-Liteが置き換えるプレビュー世代です。

つまり、誰かが「Gemini 3.8 TTS」と言うとき、たいていは Flash ティアを指している。発表記事が真っ先に取り上げるのがそれで、Arena ボードで最高位にランクされているのもそれだからだ。ライブ音声エージェントについてそう言うときには、何も指していない。求めているものは、別の名前と別の入力コントラクトを持つ別のエンドポイントにあるからだ。

3つ目の衝突は名付ける価値がある。なぜなら、それは最も悪い助言を生み出すからだ。Gemini 3.8 Live は、追加機能を備えたテキスト読み上げモデルではない。それは音声対音声モデルであり、単位あたりのコストが高いのは、単位あたりにより多くの処理を行っているからだ。聞き取り、発話途中での推論、割り込みへの対応、そして Extended Thinking バリアントでは、答える前に熟考すること。

本当に比較できる唯一の数字

品質スコアはこの2つのファミリー間では移行しない。ナレーターと会話者を同じ軸で採点する単一のボードは存在しない。お金は移行する――単位を正直に選びさえすれば。そして、音声に関するあらゆるものにとって正直な単位はオーディオアワーだ。

• 従量課金(入力)— Gemini 3.8 Live は音声の1分単位で課金され、入力は1分あたり $0.005、出力は1分あたり $0.018 であるのに対し、Gemini 3.8 Flash TTS は音声100万トークン単位で課金され、2026年12月31日までは $9.00、それ以降は $18.00
• 従量課金(出力)— Gemini 3.8 Live の双方向音声は、同時に入力と出力を行う1時間あたり、プロンプトキャッシュ適用前の定価で約 $1.38 であるのに対し、Gemini 3.8 Flash TTS は片方向ストリームで、完成したナレーション100万文字は Artificial Analysis の正規化によると $16.5 になる
• テキスト入力 — Gemini 3.8 Live はテキストと音声を別々の行で課金し、テキストは入力100万トークンあたり $0.75、出力は $4.50 であるのに対し、TTS エンドポイントはテキスト入力を100万トークンあたり $0.50 で課金する
• Flash-Lite ティア — Gemini 3.8 Live にはより安価な兄弟モデルがなく、選択肢は Live か Extended Thinking であるのに対し、Gemini 3.8 Flash-Lite TTS は100万音声トークンあたり $6.00、その後 $12.00 で、Artificial Analysis では100万文字あたり $11.0
• 入力形式 — Gemini 3.8 Live は音声・映像・テキストを入力して音声を出力するのに対し、TTS エンドポイントはテキストを入力して音声を出力する

Liveの数値は、Googleが公表している1分あたりの料金から当社が計算したものであり、Googleが公表している1時間あたりの数値ではありません。文字数の数値はArtificial Analysisによる正規化であり、合成ティアを比較する際に引用すべきものです。Artificial Analysis自身のSpeech to Speechボードには、Liveモデル向けに別途、入力音声1時間あたりのコスト列があり、Gemini 3.8 Liveで約$3.50、Extended Thinkingバリアントで$0.84です。これはまた別の正規化であり、1分あたりの料金表と同一の測定値であるかのように並べて比較すべきではありません。

A screenshot of Google's Gemini API pricing documentation in English, captured 25 September 2026, showing the speech-generation model index — a limited-access group listing Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking and Gemini 3.1 Flash Live Preview, alongside Gemini 3.8 Flash TTS, Gemini 3.8 Flash-Lite TTS and Gemini 3.1 Flash TTS Preview — above the Gemini 3.8 Flash per-million-token rates: $0.75 input through 31 December 2026 rising to $1.50, $3.75 output including thinking rising to $7.50, $0.075 context caching rising to $0.15, and storage at $0.50 rising to $1.00 per million tokens per hour, with search requests and prompts billed at $14 per 1,000 beyond the monthly free allowance. The page carries no rate-card line for a model named Gemini 3.8 TTS.

間違った方を選ぶと、何が壊れるのか

故障モードは、互いにあまりにも似ていないため、示唆に富んでいる。

会話ループが必要な場面でTTSエンドポイントを呼び出してしまい、しかも何もエラーにならない。リクエストは有効な音声を返す。固定された文字列に対して流暢で読み上げも見事な応答が返ってきて、その後は沈黙——聴いているものがそもそも何もなかったのだから。チームがこれに気づくのは、最初のバージイン(割り込み)テストを作るときだ。「ユーザー」が次のターンを始める前に、クリップ全体が終わるのを待たなければならないと分かる。合成エンドポイントに会話を後付けするということは、その周りに音声認識、ターンテイキングポリシー、割り込み機構を追加することを意味する。その時点で、あなたはカスケードを再構築しており、1つではなく2つのモデルのコストを払っている。

ナレーションが必要なときにLiveエンドポイントを呼び出すと、使っていない機能に対して料金を払うことになります。Liveモデルは双方向で課金されます。双方向を前提としているからです。オーディオブックやトレーニング動画のナレーションでは、入力側は決して変わらない台本であり、モデルは何も聞く必要がありません。文書を読み上げるために会話ループを買っているのです。

選択が本当に難しい唯一のケースはカスケードだ。認識、次に推論、次に合成。そのアーキテクチャは廃れたものではなく、多くの本番システムにとって今なお正しい選択肢である。各段階を独立に差し替え、それぞれに別のベンダーを選べるからだ。その代わりにレイテンシを犠牲にし、単一のエンドツーエンドモデルがターン境界をまたいで保つ韻律も犠牲にする。このトレードオフはどちらの方向にも現実に存在する。

ルートが既に存在する場合

OrcaRouterはGemini 3.8 Liveエンドポイントや3.8 TTSエンドポイントを扱っていません。そして、そのことはルーティングについて何よりも先に言っておく価値があります。これほど広いカタログからは逆を想定しやすいからです。カタログが実際に含んでいるのは、そのファミリーの残りです — google/gemini-3.8-flashは28のGoogleモデルの中にあり、そして全体で200以上のモデルの1つとして、プロバイダー定価のまま、マークアップなしで1つのキーから利用できます。

これは特にカスケードにとって重要だ。あなたのアーキテクチャが認識、次に推論、そして合成という流れなら、多数のベンダーにまたがる単一のキーが効いてくるのは推論の段階だ。なぜなら、そこは最も頻繁に差し替える段階であり、ベンダーの値下げが次の契約更新時ではなくその日のうちに請求に反映されるべき段階だからだ。また、自動フェイルオーバーがその真価を発揮する段階でもある。カスケードには壊れる箇所が3つあり、真ん中を冗長化するのが最も安上がりだ。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples and priced at $16.5 per million characters, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0 per million characters. The board lists no model named Gemini 3.8 TTS.

短い意思決定ルール

モデルがまだテキストとして持っていないものに応答しなければならないなら、必要なのは Gemini 3.8 Live であり、予算は Goog​le の音声の分単位の料金で見積もり、2つのバリアントのどちらが必要かを考えることになる。テキストがすでに書かれていて、それを実行するのが仕事なら、必要なのは Gemini 3.8 Flash TTS か Flash-Lite TTS であり、100万文字あたりで予算を立て、言語対応範囲と、品質の差が価格の差に見合うかどうかでティアを選ぶ。

そして、あたかも2つの製品であるかのように「Gemini 3.8 Live and Gemini 3.8 TTS」を比較するよう求められているなら、まず役立つのは、どのエンドポイントなのかを尋ねることだ。ブリーフに書かれた名前は1つのエンドポイントには定まらず、その答えは請求書だけでなくアーキテクチャを変える。

A generated summary card for Gemini 3.8 Live vs Gemini 3.8 TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — gemini-3.8-live on the Live API, shipped 15 September 2026', 'Gemini 3.8 TTS — not a model ID; resolves to gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts', 'Input contract: Live hears audio and video; TTS reads text only', 'The one shared unit: the hour of finished audio, not the benchmark', and 'Verdict: two jobs, one generation number — ask which endpoint'. A footer line reads 'Prices and language counts are vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.