
Gemini 3.8 Flash TTSが登場:Google、音声ラインを2つに分割し価格を引き下げ
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
そのベンダーは2026年9月23日に2つの音声モデルを出荷したが、発表はまるで見出しが音声品質であるかのように書かれている。そうではない。Gemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSは、そのベンダーがGemini Developer APIに投入した最初のテキスト読み上げモデルであり、置き換えるプレビューモデルより低い価格で提供されている——そして、これまで他のどこかで文字単位で支払ってきた人にとって、それこそが予算の一行を変える部分だ。Gemini 3.8 Flash TTSの音声出力料金は、2026年末まで100万トークンあたり9.00ドル。音声は毎秒25トークンで課金され、生成された音声1秒あたりおよそ0.02セントになる。これに取って代わるモデルであるGemini 3.1 Flash TTS Previewは、音声100万トークンあたり20.00ドルに設定されていた。
ストーリーの後半は、今やモデルが1つではなく2つあるということだ。Googleはラインを分割した。Flash TTSは全言語セットとより高いオーディオレートを担い、Flash-Lite TTSはより短い言語リストとより安価な方を担う。これは4月以降APIに存在してきた単一のプレビューモデルという構成とは異なる形であり、Googleが市場をどう見ているかを示している——130言語と音声クローニングを必要とする少数のアプリケーションと、サポートボット向けに十分使える英語音声だけを必要とする、はるかに多数のアプリケーションだ。
9月23日に実際に出荷されたもの
両モデルは発表時点でGemini APIおよびAI Studioで一般提供されており、ウェイトリストによる制限はありません。API上の名前はgemini-3.8-flash-ttsとgemini-3.8-flash-lite-ttsです。
• Flash TTS — 130言語対応、テキストから言語を自動検出、KoreやPuckを含む30のプリビルトスタジオボイス。
• Flash-Lite TTS — 101言語、同一のボイスデザインサーフェス、大量処理ティアとして位置づけ。
• 両方 — 自然言語の記述による音声デザイン、行ごとの話し方の演出指示、2話者シーンのステージング、そしてスクリプトに直接書き込まれた非言語的なキュー。
• 出力 — ユナリエンドポイントでは WAV 24 kHz モノラル 16 ビット符号付き PCM、ストリーミングエンドポイントではヘッダーなし PCM(audio/l16)。audio/mulaw および audio/alaw も受け付け可能で、サンプルレートは設定可能です。
料金表は、100万トークンあたりで、 Tierがヘッドラインの数字以上に異なるため、全文を読む価値があります:
Flash TTS Standard — テキスト入力 $0.50 / 音声出力 $9.00、2026年12月31日以降は $1.00 / $18.00 に値上げ。
• Flash TTS Batch と Flex — $0.25 / $4.50
• Flash TTS 優先 — $0.90 / $16.20
• Flash-Lite TTS Standard — $0.50 / $6.00、2026年12月31日以降は$1.00 / $12.00に値上げ。
• Flash-Lite TTS Batch と Flex — $0.25 / $3.00
• Flash-Lite TTS 優先 — $0.90 / $10.80
• Gemini 3.1 Flash TTS Preview、比較用 — $1.00 / $20.00、バッチ $0.50 / $10.00。
注目すべきはプロモーション期間です。Googleは両方の新モデルを年末まで半額に設定し、プロモーション終了後の数値を同じ表に掲載しています。1,000分あたりのコストをモデル化する人は、9月の数値ではなく1月の数値を使うべきです。

ボイスデザインは、真に新しい能力です
既製の音声はもはや参加の前提条件にすぎない。Googleが3.8で追加したのは、音声を言葉で記述してそのとおりに得る方法と、短いサンプルから同意確認付きでクローンを作る方法だ。
ボイスデザインは自然言語のプロンプト——話す速さ、音色、アクセント、本来なら丸々半日かけてオーディションに費やすようなもの——を受け取り、参照用の録音なしで使える音声を返します。ボイス複製はその逆です。30秒のサンプルを提供すると、システムが同意を確認し、生成された音声には SynthID ウォーターマークと C2PA クレデンシャルが付与されます。既存のカスタムボイスを混ぜ合わせたり修正したりできるボイスリミックスは、提供済みではなく近日公開として記載されています。
カスタムボイスには2つの種類があり、その挙動は本番環境で区別が重要になるほど異なります。ステートフルなカスタムボイスはプロジェクトに紐づけて保存され、プロジェクトあたり最大200件、有効期限は1年です。ステートレスなボイスはvoicekey_...ハンドルで指定し、7日後に失効します。アプリケーションが顧客ごとにボイスをプロビジョニングする場合、上限とTTLというこの2つの数値が、独自のストレージレイヤーが必要かどうかを決めます。
デリバリーのコントロールは「新しい」のもう半分です。声を選んで願うだけでなく、俳優を演出するように、ペース、強調、感情のトーンを指示できます。二人の話者のシーンを1回のコールの中で演出することもできます。そして非言語的な発声も一級の脚本要素です。<laughs>、<sigh>、<gasp>をインラインのキューとして、さらに|mhm|と|yeah|を、合成された会話を本物の会話のように聞かせる小さな相づちの音として使えます。長文の読み上げでは、話者のアイデンティティがほとんどドリフトせずに保たれると謳われており、これは40分のオーディオブックの章を生成したときに真っ先に現れる失敗モードです。
ベンチマーク、そして誰がそれを実施したか
Googleの発表資料は、2件の外部評価と一連のアリーナ順位に依拠している。これらはすべてベンダーによる報告だ——Googleがそれを引用しているだけで、基となる実行結果は公開されていない——したがって、測定値ではなく主張として扱うべきである。

• Hume AI Voice Design Benchmark — Gemini 3.8 Flash TTSは71.4で1位、アクセントモデリングでは60.8で1位となりました。
• Hume総合品質指数 — Flash TTSが1位、Flash-Lite TTSが2位。
• Speech Arenaにおけるブラインド選好 — 日本語、ブラジルポルトガル語、ベトナム語、現代標準アラビア語、メキシコスペイン語、ヒンディー語が上位を獲得。
• Gemini 3.1 Flash TTS との比較 — Google は長文での一貫性と2話者スクリーンプレイ制御における向上を主張しているが、これはまさに話し方指示機能が想定して作られた2つの要素そのものだ。
外部から見て整合性を取ることは不可能である。正直に読めば、デフォルトで得られるプリビルドセットは30であり、拡張ボイスライブラリはそれより多く、漠然と説明されており、大きな数字はユーザー作成ボイスを含むカタログを指している。ボイス数があなたの判断を左右するなら、三つの数字のいずれかを信じるのではなく、必要な特定のボイスをテストすべきである。
あなたがそれを基盤に構築している場合、それが何を意味するのか
実務上の変化は、テキスト読み上げが専門的な個別費目から、言語トークンと同じコストモデルに載せられるものへと移ったことです。毎秒25トークンなら、1時間の生成音声は90,000音声トークンで、プロモーションのFlash-Lite料金では約54セントになります。これは十分に安いので、興味深い問いは「合成音声にコストをかけられるか」から「このサーフェスには2つのティアのどちらが必要か」へと変わります。
2つ目の実用的な変化は、まったく新しいTTSモデルこそ、本番の経路をそれに賭けることなく試してみたい類のものだという点です。新しいモデルを直接配線するのではなくルーターの背後に置くべきなのは、まさにそういう理由からです。OrcaRouterは200以上のモデルを単一のキーで、プロバイダーの定価のままマークアップなしで利用可能にし、その自動フェイルオーバーにより、負荷がかかると不安定になる新しい音声エンドポイントは、通話を落とす代わりに、すでに信頼しているモデルへと縮退します。当社はGemini 3.8 TTSエンドポイントをホストしていません — それらはGoogle自身のAPIから提供されます — が、音声の下にあるテキスト層、そして合成呼び出しが失敗したときのフォールバック経路こそ、ルーターが本来果たすべき役割です。
まだ足りないものは何か
ローンチには3つの要素が欠けている。そしてそれらはいずれも、些末な指摘ではなく、現実の制約である。
公表された独立評価は存在しない。Google の Hume の数値は、ベンダーが第三者のベンチマークを引用したものであり、何もないよりはましだが、監査には劣る。Artificial Analysis か同等の機関が同じモデルについて独自の実行結果を公表するまでは、この記事のあらゆる品質に関する主張は、主張として読むべきだ。
オープンウェイトの選択肢はありません。両モデルともクローズドかつAPI専用であり、同じ分野に登場してきたオープンな音声モデルとは別カテゴリーに位置づけられます。自身でモデルを実行する必要があるデプロイメントであれば、今回のリリースはその要件に応えるものではありません。
そしてプロモーション価格は終了する。Flash TTSの2027年1月の料金は9月料金の2倍であり、ローンチ時の数字に基づいて作られたビジネスケースは、第1四半期に作り直す必要がある。これは批判ではない——両方の数字を最初から公表するのは大半より誠実だ——しかし、スプレッドシートに入れるべきなのはこの数字だ。
Googleは、Gemini 3.1 Flash TTS Previewが非推奨になるかどうかは明言しておらず、Flash-Lite TTSがその主力の後継として位置づけられていると述べているだけです。プレビューモデルをまだ利用しているユーザーは、シャットダウン通知を待つのではなく、移行を計画すべきです。

