
Gemini 3.8 Live 対 Gemini 3.8 TTS:会話ループと読み上げ音声が同じ世代名を共有している
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 36 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 181 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
Gemini 3.8 Liveは、2026年9月15日にgemini-3.8-liveおよびgemini-3.8-live-extended-thinkingとして出荷された音声対音声モデルです。「Gemini 3.8 TTS」はモデルではありません。これは、Google自身の投稿タイトルを含むローンチ報道が、2026年9月23日にgemini-3.8-flash-ttsおよびgemini-3.8-flash-lite-ttsとして登場した2つのテキスト読み上げエンドポイントに対して用いている包括的な用語です。つまり、これは2つの製品が1つの役割を巡って争う、よくある比較ページではありません。同じ世代番号を共有する2つの役割についてのページであり、「Live」と「TTS」という言葉を同じものの2つの種類として扱うときに人々が犯す、特定の間違いについてのページです。
共有世代番号が隠しているフォーク
Google の音声生成ドキュメントは自ら線引きしており、その一文はうっかり読み飛ばしやすいものです。「TTS 機能は、Live API を通じて提供される音声生成とは異なります。」同じ箇所でその理由も説明されており、理由は品質の問題ではなく構造上のものです。Live API は「インタラクティブで非構造化された音声、およびマルチモーダルな入力と出力」向けに構築されています。Gemini API 経由の TTS は「正確なテキスト読み上げと細やかな制御を必要とするシナリオに合わせて調整されています。」後の注記では入力の形が明示されています。TTS モデルはテキストのみを受け取り、音声のみを返します。
その単一の制約——テキスト入力、音声出力、音声入力なし——が、この比較のすべてだ。Gemini 3.8 Live モデルは、自分に話しかけている人の声を聞く。Gemini 3.8 Flash TTS や Flash-Lite TTS モデルは誰の声も聞かない。文字列を読み取り、それを演じるだけだ。あとはそこからすべてが導かれる。一方のために存在するベンチマークは他方には無意味であり、料金は異なる単位で課金され、故障モードはまったく比較にならない。
これが重要なのは、二つのユースケースが外から見るとまったく同じに見えるからです。音声エージェントもナレーションパイプラインも、最終的には人間が話しているように聞こえる音声を出力します。しかし、中断できるのはそのうちの一方だけです。
「Gemini 3.8 TTS」が実際に解決される場所
Gemini APIの音声生成用のサポート対象モデル表を開くと、4つのTTSエントリが見つかり、Gemini 3.8 TTSというエントリはありません。そのうち2つはこの世代です。Gemini 3.8 Flash TTS、モデルID gemini-3.8-flash-tts、130言語対応、およびGemini 3.8 Flash-Lite TTS、モデルID gemini-3.8-flash-lite-tts、101言語対応。残りの2つ — Gemini 3.1 Flash TTS Preview と Gemini 2.5 Pro Preview TTS — は、Flash-Liteが置き換えるプレビュー世代です。
つまり、誰かが「Gemini 3.8 TTS」と言うとき、たいていは Flash ティアを指している。発表記事が真っ先に取り上げるのがそれで、Arena ボードで最高位にランクされているのもそれだからだ。ライブ音声エージェントについてそう言うときには、何も指していない。求めているものは、別の名前と別の入力コントラクトを持つ別のエンドポイントにあるからだ。
3つ目の衝突は名付ける価値がある。なぜなら、それは最も悪い助言を生み出すからだ。Gemini 3.8 Live は、追加機能を備えたテキスト読み上げモデルではない。それは音声対音声モデルであり、単位あたりのコストが高いのは、単位あたりにより多くの処理を行っているからだ。聞き取り、発話途中での推論、割り込みへの対応、そして Extended Thinking バリアントでは、答える前に熟考すること。
本当に比較できる唯一の数字
品質スコアはこの2つのファミリー間では移行しない。ナレーターと会話者を同じ軸で採点する単一のボードは存在しない。お金は移行する――単位を正直に選びさえすれば。そして、音声に関するあらゆるものにとって正直な単位はオーディオアワーだ。
• 従量課金(入力)— Gemini 3.8 Live は音声の1分単位で課金され、入力は1分あたり $0.005、出力は1分あたり $0.018 であるのに対し、Gemini 3.8 Flash TTS は音声100万トークン単位で課金され、2026年12月31日までは $9.00、それ以降は $18.00
• 従量課金(出力)— Gemini 3.8 Live の双方向音声は、同時に入力と出力を行う1時間あたり、プロンプトキャッシュ適用前の定価で約 $1.38 であるのに対し、Gemini 3.8 Flash TTS は片方向ストリームで、完成したナレーション100万文字は Artificial Analysis の正規化によると $16.5 になる
• テキスト入力 — Gemini 3.8 Live はテキストと音声を別々の行で課金し、テキストは入力100万トークンあたり $0.75、出力は $4.50 であるのに対し、TTS エンドポイントはテキスト入力を100万トークンあたり $0.50 で課金する
• Flash-Lite ティア — Gemini 3.8 Live にはより安価な兄弟モデルがなく、選択肢は Live か Extended Thinking であるのに対し、Gemini 3.8 Flash-Lite TTS は100万音声トークンあたり $6.00、その後 $12.00 で、Artificial Analysis では100万文字あたり $11.0
• 入力形式 — Gemini 3.8 Live は音声・映像・テキストを入力して音声を出力するのに対し、TTS エンドポイントはテキストを入力して音声を出力する
Liveの数値は、Googleが公表している1分あたりの料金から当社が計算したものであり、Googleが公表している1時間あたりの数値ではありません。文字数の数値はArtificial Analysisによる正規化であり、合成ティアを比較する際に引用すべきものです。Artificial Analysis自身のSpeech to Speechボードには、Liveモデル向けに別途、入力音声1時間あたりのコスト列があり、Gemini 3.8 Liveで約$3.50、Extended Thinkingバリアントで$0.84です。これはまた別の正規化であり、1分あたりの料金表と同一の測定値であるかのように並べて比較すべきではありません。

間違った方を選ぶと、何が壊れるのか
故障モードは、互いにあまりにも似ていないため、示唆に富んでいる。
会話ループが必要な場面でTTSエンドポイントを呼び出してしまい、しかも何もエラーにならない。リクエストは有効な音声を返す。固定された文字列に対して流暢で読み上げも見事な応答が返ってきて、その後は沈黙——聴いているものがそもそも何もなかったのだから。チームがこれに気づくのは、最初のバージイン(割り込み)テストを作るときだ。「ユーザー」が次のターンを始める前に、クリップ全体が終わるのを待たなければならないと分かる。合成エンドポイントに会話を後付けするということは、その周りに音声認識、ターンテイキングポリシー、割り込み機構を追加することを意味する。その時点で、あなたはカスケードを再構築しており、1つではなく2つのモデルのコストを払っている。
ナレーションが必要なときにLiveエンドポイントを呼び出すと、使っていない機能に対して料金を払うことになります。Liveモデルは双方向で課金されます。双方向を前提としているからです。オーディオブックやトレーニング動画のナレーションでは、入力側は決して変わらない台本であり、モデルは何も聞く必要がありません。文書を読み上げるために会話ループを買っているのです。
選択が本当に難しい唯一のケースはカスケードだ。認識、次に推論、次に合成。そのアーキテクチャは廃れたものではなく、多くの本番システムにとって今なお正しい選択肢である。各段階を独立に差し替え、それぞれに別のベンダーを選べるからだ。その代わりにレイテンシを犠牲にし、単一のエンドツーエンドモデルがターン境界をまたいで保つ韻律も犠牲にする。このトレードオフはどちらの方向にも現実に存在する。
ルートが既に存在する場合
OrcaRouterはGemini 3.8 Liveエンドポイントや3.8 TTSエンドポイントを扱っていません。そして、そのことはルーティングについて何よりも先に言っておく価値があります。これほど広いカタログからは逆を想定しやすいからです。カタログが実際に含んでいるのは、そのファミリーの残りです — google/gemini-3.8-flashは28のGoogleモデルの中にあり、そして全体で200以上のモデルの1つとして、プロバイダー定価のまま、マークアップなしで1つのキーから利用できます。
これは特にカスケードにとって重要だ。あなたのアーキテクチャが認識、次に推論、そして合成という流れなら、多数のベンダーにまたがる単一のキーが効いてくるのは推論の段階だ。なぜなら、そこは最も頻繁に差し替える段階であり、ベンダーの値下げが次の契約更新時ではなくその日のうちに請求に反映されるべき段階だからだ。また、自動フェイルオーバーがその真価を発揮する段階でもある。カスケードには壊れる箇所が3つあり、真ん中を冗長化するのが最も安上がりだ。

短い意思決定ルール
モデルがまだテキストとして持っていないものに応答しなければならないなら、必要なのは Gemini 3.8 Live であり、予算は Google の音声の分単位の料金で見積もり、2つのバリアントのどちらが必要かを考えることになる。テキストがすでに書かれていて、それを実行するのが仕事なら、必要なのは Gemini 3.8 Flash TTS か Flash-Lite TTS であり、100万文字あたりで予算を立て、言語対応範囲と、品質の差が価格の差に見合うかどうかでティアを選ぶ。
そして、あたかも2つの製品であるかのように「Gemini 3.8 Live and Gemini 3.8 TTS」を比較するよう求められているなら、まず役立つのは、どのエンドポイントなのかを尋ねることだ。ブリーフに書かれた名前は1つのエンドポイントには定まらず、その答えは請求書だけでなくアーキテクチャを変える。

