
Gemini 3.8 Flash TTS でカスタム音声を作成・デプロイ:ボイスデザイン、クローニング、そして判断を下す2つの時計
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 506 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 184 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
Gemini 3.8 Flash TTS と Gemini 3.8 Flash-Lite TTS はどちらも、リストから1つ選ぶのではなく、書かれた説明から音声を創り出せるようにするもので、両方とも2026年9月23日に Gemini API で一般提供が開始されました。人々が繰り返し口にしている見出しは、音声デザインです。計画に織り込むべきなのは、デザインした音声がその後どうなるかです。というのも、ベンダーは音声を保持する方法を2つ用意し、それぞれに異なる寿命を付けているからです。間違った方を選べば、製品が依存する音声は1週間で失効します。
これが、これまでのローンチ報道に欠けている点だ。発表記事では、プロンプトで音声を生成できると説明されており、そのうちいくつかは30秒のサンプルからのクローニングにも言及している。しかし、どれもストレージモデルを詳しく解説していない。ストレージモデルこそが、音声パイプラインを設定ファイルから再現可能にするのか、それとも定期的に再プロビジョニングしなければならないのかを決めるものだ。本稿では、設計、保存、呼び出し、支払いという全経路を、Googleが公開しているとおりの価格とクォータとともに扱う。
9月23日に出荷されたものは何ですか
2つのモデル、1つのAPIスキーマ。識別子はgemini-3.8-flash-ttsとgemini-3.8-flash-lite-ttsで、Googleのドキュメントは、両方が「まったく同じAPIスキーマとプロンプト形式」を採用すると明言しています——それらの間の切り替えは、書き直しではなく1つのパラメータの変更です。
• 入力 — テキストのみ。両モデルはテキストを受け取って音声を返すものであり、マルチモーダルではなく、テキストを返すこともありません。
• 出力 — ユニタリエンドポイントでは WAV、24 kHz モノラル 16 ビット符号付き PCM、ヘッダーなし PCM(audio/l16) はストリーミングエンドポイントで、audio/mulaw および audio/alaw は設定可能なサンプルレートで受け付けられます。
• 言語 — Flash TTSでは130言語、Flash-Lite TTSでは101言語に対応し、リクエストで指定するのではなくテキストから自動検出されます。
• ボイス — ドキュメントに掲載されている30種類の厳選されたスタジオボイス(KoreやPuckなど)、voicesエンドポイントを通じて検索可能な「数百」種類以上の拡張ボイスライブラリ、さらに以下に示す2つの作成方法があります。
• 演出 — 行単位のデリバリー制御、単一のスクリプトから組み立てられる2話者シーン、そして <laughs>、<sigh>、|mhm| といった非言語キューをトランスクリプトに直接書き込むこと。
2つのティアが存在するのは、ワークロードが分岐したためだ。Flash TTSは最大限の音響忠実度と複雑な演技を狙った位置づけで、Flash-Lite TTSはGoogle自身の言葉を借りれば、次のモデルに代わる「workhorse replacement(主力の後継)」だと説明されている。すなわちgemini-3.1-flash-tts-previewであり、大量の吹き替え、読み上げ機能、音声エージェントのカスケードを狙ったものだ。どちらも、2026年4月からAPIに存在していた単一のプレビューモデルを置き換えるもので、プレビュー版を使っていたなら、移行はバージョンアップではなくティアの選択になる。

声をデザインすることはプロンプトであり、それがレビューのステップを変える
この世代で真に新しいのは、作成サーフェスです。プロンプトで指定された音声は、自然言語の記述 — 役割、アクセント、声の特徴 — から構築され、再利用できる識別子を返します。API では、これは音声作成呼び出しで、store: true とプロンプト入力を受け取ります。Google 自身の例では、その記述はエネルギッシュなメルボルンの DJ から日本のドラゴンまで多岐にわたります。一度作成されると、その音声は識別子によって音声リクエスト内で参照され、リクエストごとのスタイル指示は最小限か空にできます。なぜなら、キャラクターはすでに音声に焼き込まれているからです。
実務上の帰結は、単なる機能ではなくワークフローの変更だ。声のキャスティングはかつてライセンス交渉かスタジオ予約であり、つまり声の選定は早い段階で一度だけ行われ、変更にコストがかかったためレビューを乗り切った。声が1段落のテキストになると、キャスティングはデザイントークンになる——プロダクトマネージャーが火曜日に再生成を依頼できるようなものだ。説明文字列をソース管理下に置き、生成された音声IDをビルド成果物として扱うチームは、環境間で一貫した出力を得られる。AI Studioで手作業で声を作成するチームはそうならず、その失敗はステージングと本番の音声の間の不可解な差異として現れる。
二つの時計
ここが、ローンチ記事が飛ばしてしまうセクションです。Googleでは、設計された音声や複製された音声を2つの状態のどちらかで保持できますが、それらが失効する速度は大きく異なります。
• 保存済み音声 — ストレージを有効にして作成され、プロジェクト内に保存され、プロジェクトごとに200音声のクォータと1年間の存続期間(TTL)によって管理されます。
• ステートレスキー — 音声複製は保存された識別子の代わりにクライアント管理のキー(voicekey_…の形式)を返すことがあり、そのキーの有効期間は7日間です。
この2つは合わせて読むと、設計上の指示になる。保存型ボイスは1年間のコミットメントであり、プロジェクトあたり200という厳しい上限がある。これは固定キャストの製品には寛大だが、顧客ごとに新しい声を生成するものには役立たない。ステートレスキーはその逆だ。クォータの圧力はないが、毎週再発行しなければならないキーであり、つまりアプリケーションにはリフレッシュ経路が必要で、インフラにはローテーションする認証情報を保存する必要がある。どちらも間違いではない。音声エージェントが8日目に沈黙するのは、どちらを選んだかに気づかずに選ぶからだ。
レプリケーションにはさらに2つの特性が付随しており、法務チームに何かを約束する前に知っておく価値があります。複製音声を作成するには、音声の所有者による口頭同意の録音が必要で、それは参照話者と一致していなければなりません — チェックボックスではなく、肉声による確認です。そして出力には来歴が付帯します。すべてのクリップにはSynthIDでウォーターマークが埋め込まれ、複製音声にはさらにC2PAコンテンツクレデンシャルが付与されます。設計上の道筋は、悪用するにはあえてより困難なものになっており、両方の障壁はポリシー上の宣言ではなく構造的なものです。
解決せずに指摘しておく価値のある不一致が1つある。Googleのサポート対象モデル一覧表では、音声デザインと音声複製は両方の3.8 TTSモデルで利用可能と記載されている。一方、ローンチ時の報道の多くは、複製を特にFlash TTSの話の一部として説明している。複製がティア間の判断材料になるなら、どちらの要約も鵜呑みにせず、実際に出荷予定のティアのドキュメントで確認してほしい。
音声1時間のコスト
Google は音声を文字数や秒数ではなくトークンで課金しており、その換算方法は公開されています。音声は出力 1 秒あたり 25 トークン、つまり 1 時間あたり 90,000 トークンで計量されます。そのおかげで計算は驚くほど明快になり、予算に計上すべきなのは 100 万トークンあたりの料金ではなく、この数値のほうです。
• Flash TTS standard — 入力テキストトークン100万あたり$0.50、出力音声トークン100万あたり$9.00(2026年12月31日まで)、以降は$1.00と$18.00。BatchとFlexは$0.25と$4.50、Priorityは$0.90と$16.20。
Flash-Lite TTS standard — 同一日付まで $0.50 と $6.00、その後 $1.00 と $12.00。Batch と Flex は $0.25 と $3.00、Priority は $0.90 と $10.80。
• 秒単位で見ると — Flash TTS は、プロモーション期間中は生成された音声1時間あたりおよそ$0.81、期間終了後は約$1.62になります。Flash-Lite TTS はおよそ$0.54、その後$1.08です。
• 置き換えるモデルと比較して — gemini-3.1-flash-tts-previewは100万トークンあたり$1.00と$20.00の価格に設定されているため、音声出力の行はFlash TTSで55パーセント、Flash-Lite TTSで70パーセント下落しました。
宣伝価格を前提に計画を立ててはいけません。Googleは両方の列を同じ表に公開しています。つまり、1月の料金は後から判明する噂ではなく、今日すでに料金表に載っているのであり、$0.81で算出した1000分あたりの見積もりは、それが2倍になることに耐えなければなりません。
独立した数が1つ、そしてそうでないものがいくつか
Googleの発表はベンチマーク結果を先頭に掲げており、それらはまさにそのとおりのものとして読まれるべきだ。同社によると、Flash TTSはHume AIのVoice Design Benchmarkで71.4を記録して1位となり、アクセントモデリングでは60.8で首位に立った。またFlash TTSとFlash-Lite TTSはHumeのOverall Quality Indexで1位と2位になり、Voice Arenaでは日本語、ブラジルポルトガル語、ベトナム語、現代標準アラビア語、メキシコスペイン語、ヒンディー語でブラインド選好の上位に入った。すべてベンダー報告であり、その実行はいずれも公開されていない。
そのリストには注目に値する細部がある。Googleの発表の著者としてクレジットされている{{KEEP}}Alan Cowen{{/KEEP}}は、{{KEEP}}Hume AI{{/KEEP}}の創業者である——見出しの数字を提供している{{KEEP}}Voice Design Benchmark{{/KEEP}}のラボだ。だからといってその数値が誤りになるわけではなく、{{KEEP}}Hume{{/KEEP}}のベンチマークも本物ではあるが、両者は互いに独立しておらず、{{KEEP}}71.4{{/KEEP}}を検討している読者は、それを第三者による検証として繰り返す前に、そのことを知っておくべきだ。
独立して収集された数値は、Artificial AnalysisのProvider Voice Arenaに掲載されており、本記事のために2026年9月24日に取得された。Gemini 3.8 Flash TTSはElo 1,260で2位につけ、1,999サンプルにわたる17ポイントの信頼区間を持ち、1,273のCartesia Sonic 3.6に次ぐ。Gemini 3.8 Flash-Lite TTSは1,235で6位。置き換えられるモデルであるGemini 3.1 Flash TTSは、3,430サンプルにわたる1,199で10位。実験室自身の評価ではなく、盲検のリスナー選好によるもの——そしてここにある唯一、Googleが委託していない品質数値である。

どこで実行できるか、そしてどこではまだできないか
両モデルは本日よりGemini APIとGoogle AI Studioで利用可能で、ウェイトリストはありません。コンシューマー向けとエンタープライズ向けのサーフェスは提供済みではなく、段階的に展開予定です。Flash TTSはGemini Notebookに、Flash-Lite TTSはGoogle Vidsに登場予定で、Gemini Enterpriseへのアクセスは近日提供と説明されており、音声リミックス — 既存の音声の音色、ピッチ、ペース、アクセントを調整すること — は現在の機能ではなく将来の機能として挙げられています。あなたの計画がリミックスに依存しているなら、それはまだ存在しません。
まずは自社の立場について正直に申し上げます。Gemini 3.8 TTS のエンドポイントは OrcaRouter のルーティングテーブルにはありません。それが置き換える世代のほうは載っています——google/gemini-3.1-flash-tts-previewは、Google が公表しているのと同じ 100 万トークンあたり $1.00 と $20.00 でカタログに掲載されています。なぜなら、プロバイダーの定価がマークアップなしでそのまま反映されるからで、しかも応答する先は同じ/v1/audio/speechエンドポイントです。お使いの OpenAI 互換 SDK がすでに接続先としているものです。これは音声ワークロードにとって、聞こえ以上に重要な意味を持ちます。というのも、実際に購入しているのは、背後でモデルが入れ替わってもアプリケーションが呼び出せる安定したエンドポイントだからです。コードが保持するのはモデル文字列であり、ルーティングを保持するのはカタログです。Google のプロモーション期間が 12 月 31 日に終了して Flash TTS が倍になれば、ルーティングされたモデルの価格は次の契約更新時ではなくその日のうちに動きます。そしてダウンしたモデルは、あなたのナレーションキューを道連れにするのではなく、フェイルオーバーします。

この生成を本番採用する前に評価するなら、安上がりな実験は2段構えでやるのがいい。同じスクリプトを Flash TTS と Flash-Lite TTS で実行する。スキーマは同一で、違いはパラメータひとつだからだ。そしてベンチマークのグラフではなく自分の音声で判断し、割増料金を払う前に、品質差が誤差範囲を超えて残るかを Artificial Analysis で確認する。大規模なナレーションプロジェクトなら、割増料金は実際の大金になる。電話番号を読み上げるサポートボットなら、聞き手に聞こえる何かを買っているとは明らかには言えない。
