「Gemini 3.8 TTS:2羽のペリカン、2つのモデル」の生成ヒーローカードで、白い背景に柔らかなブルーとシアンのグラデーションアクセントをあしらったもの。3枚のカードには「Gemini 3.8 Flash TTS — Elo 1,260、ランク2、アリーナボイス8種、音声トークン100万あたり$9.00」「Gemini 3.8 Flash-Lite TTS — Elo 1,235、ランク6、音声トークン100万あたり$6.00」「2話者対話 — 対応、ボイスデザイン、30秒の複製」と記されている。フッター行には「EloはArtificial Analysis Provider Voice Arena(2026年9月)による。定価はGoogleによる。」とある。右下隅にはOrcaRouterのロゴが合成されている。
Guides & Insights

Gemini 3.8 TTS:2羽のペリカン、2つのモデル、そして1月に倍になる価格

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

ベンダーが2026年9月23日に何を出荷したのかを最速で理解するには、それと一緒に出回ったデモを見るのが一番です。2羽のペリカンがパシフィカ・ピアへ引っ越すべきかどうかで言い争うもので、1羽につき1つの声、台本に従って順番に話します。Gemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTSはそのデモで使われている2つのモデルで、どちらもGemini APIで一般提供されており、ペリカンは小細工ではありません。これは、これまでのGemini音声モデルにはまったくできなかった、この世代で最初のものです。2人の話者、1回の生成、誰が何を言うかを制御する台本。

価格は話のもう半分であり、ここで2つのモデルが分かれます。Flash TTSは、2026年12月31日まで入力テキストトークン100万個あたり$0.50、出力音声トークン100万個あたり$9.00で課金され、その後は$18.00になります。Flash-Lite TTSは同じスケジュールで$0.50と$6.00、その後は$12.00です。これらはGoogle自身の料金です。Artificial Analysisが、他のすべてと同じボードに並べられるよう100万文字あたりの基準に換算すると、$16.50と$11.00になります — Liteモデルは約3分の1安く、どちらもそのボードのトップが請求する額を大きく下回ります。

つまり、興味深い問いは、そのモデルが優れているかどうかではない。どちらを土台にすべきかだ。というのも、両者の隔たりは、名前から想像するような隔たりではないからだ。

9月23日の発表に実際に含まれている内容

2つのモデルであり、1つではない。そしてGoogleは、それらが同一のものの小型版と大型版ではなく、分割されたものだと明言している。発表では、それらが展開される5つの場——Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook、Google Vids——が挙げられており、API識別子もそのまま明示されている。gemini-3.8-flash-tts と gemini-3.8-flash-lite-tts だ。

A screenshot of Google's blog post 'Gemini 3.8 text-to-speech says hello', published September 23, 2026 and credited to Leland Rechis and Alan Cowen, showing the launch announcement for Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS.

機能のリストは見出しが示すよりも長い。Googleの発表とGemini APIの音声生成ドキュメントによると:

• 音声デザイン — 固定リストから選ぶのではなく、言葉で音声を描写するとカスタム音声IDが返ってきます。

• ボイスレプリケーション — 30秒のサンプルから音声IDが生成され、これがブランドボイスやナレーターのためにほとんどのチームが実際に用いる道筋となる。

• 2話者対話 — ペリカンのケース。スクリプトは、一続きの文章ではなく、話者の交代を含みます。

• ターンレベルのスタイリング — ドキュメントには、リクエスト全体ではなく特定のターンに演出指示を付加する speech_metadata アノテーションについて記載されています。

• プリビルドボイス、さらに GET /v1beta/voices で利用できる拡張ボイスライブラリ。

• 3つのオーディオエンコーディング — デフォルトはWAV、電話向けのパイプラインにはmulawとalawが利用可能です。

• 入力はテキストのみ、出力は音声のみ。この点についてドキュメントは率直だ。TTSモデルは他の入力モダリティを受け付けず、他の出力も生成しない。そして、制限事項を列挙した独立のLimitationsセクションが存在する。

発表に含まれていないのは、キャパシティプランナーが必要とする数値の類だ。レート制限、クォータ、そして設計された音声の保存期間はすべてドキュメントと料金ページに記載されており、ローンチ投稿にはない。これが、ローンチ週にデモは順調に進み、本番はうまくいかない通常の理由だ。

A screenshot of the Gemini API speech-generation documentation, showing the two model identifiers gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts alongside the speech generation request and response format.

ペリカンこそが本当のニュースだ

単一話者TTSは、この2年間、十分に解決済みの問題だった。欠けていたのは、長い台本を通して2つのアイデンティティを混ざらせず、ドリフトせずに保ち続けるモデルであり、デモが本当に検証しているのはそこだ——声が人間らしく聞こえるかどうかではなく、4分経過しても話者Aが話者Aのままでいられるかどうかを。

そこから二つのことが導かれる。そして、これがポッドキャストの玩具の域を超えて重要な意味を持つ理由は、まさにそこにある。

第一に、作業単位が変わる。単一話者モデルでは、20分の対話は、2つの独立した実行からつなぎ合わせる20分の音声であり、その継ぎ目はすべて韻律がリセットされる箇所になる。二話者モデルでは、それは1回の呼び出し、1つのコンテキストであり、モデルはその前のセリフに反応できる。これはポストプロセッシングでは取り戻せない品質の違いだ。

第二に、スクリプト形式がインターフェースになるということだ。もしあなたのパイプラインがすでにSSMLの形をしたもの——フレーズごとの注釈——を出力しているなら、この生成はほぼそのまま差し込める。もしあなたのパイプラインがモデルに大量のテキストを渡して期待をかけるだけなら、今こそそれを再構築すべき理由がある。かつて暗黙的だったスタイル付けが、今や声に出して言わなければならないものになったからだ。それは、業界の他のプレイヤーがさまざまな形で行っているのと同じトレードオフであり、この2つのGoogleモデルが盤上のほかのすべてと競い合う軸でもある。

2羽のペリカンの音声1時間にかかる費用

トークンの計算は一度やっておく価値があります。というのも、100万オーディオトークンあたりの数字は1時間あたりの数字ではなく、その違いに驚く人がいるからです。

音声トークンは、出力1秒あたり一定のレートで生成されるため、コストは完成した音声の長さに比例し、スクリプトの長さには比例しません。Google自身のFlash TTSの料金 — 出力音声トークン100万あたり$9.00 — を当てはめると、1時間の完成作品の計算は標準ティアで1桁台のドルになり、Liteモデルではその3分の2になります。バッチとFlexの料金は、Flash TTSで入力$0.25、出力$4.50、Flash-Lite TTSで$0.25と$3.00であり、オンデマンドで生成する必要のないものについては、さらに削減します。プライオリティは、入力$0.90、出力$16.00で、オンデマンド生成が必要な作業向けです。

3つの実用的な帰結:

• 段落を再生成するのは安い;だがシリーズを再生成するのは決断だ。このレートでは、音声パイプラインで高くつく部分は推論ではなくなり、テイクを承認する人間に戻る。

• テキスト入力のレートはノイズみたいなものだ。数千語の台本で100万テキストトークンあたり$0.50なんて、音声側に比べれば丸め誤差にすぎない。台本を文字数のために最適化する必要はない。

• 12月31日の崖は現実のもので、オーディオ料金が2倍になります。2027年の展開を計画しているなら、導入時の金額ではなくプロモーション後の金額で予算を組んでください。さもないと、1月に計画をやり直すことになります。

独立している数と、そうでない数たち

このローンチにおけるある数字は、Google以外のどこかから来ている。2026年9月24日に取得されたArtificial Analysis Provider Voice Arenaでは、Gemini 3.8 Flash TTSが1,999サンプルと8つのアリーナボイスにわたってElo 1,260で2位に位置し、Gemini 3.8 Flash-Lite TTSが2,000サンプルにわたって1,235で6位に位置している。どちらも±16と±17の互いの信頼区間内にあるため、このボードは、好みにおいて統計的に区別できないことを示している — これは本当に有用な結果である。なぜなら、安価な方がリスナーにとって測定可能なほど悪くはないことを意味するからだ。

それ以外はすべてGoogle自身の主張であり、そのように読むべきだ。表現力、言語、言語数、再現品質については。アリーナが与えてくれるのは選好ランキングだけで、それ以外は何もない。どちらのモデルが40分の台本をドリフトなしでどう処理するか、これまで見たことのない固有名詞でどう振る舞うか、デザインされた声が1週間後にどうなるかまでは教えてくれない。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and Gemini 3.8 Flash-Lite TTS at rank 6 with an Elo of 1,235, with Cartesia Sonic 3.6, Qwen-Audio-3.0-TTS-Plus, Inworld Realtime TTS-2 and BreezeBlue Breeze TTS 2 filling the rows between and around them.

Lite モデルはまた、このペアがマーケティング上の階層ではなく本当の分割であることを示す、より強い根拠でもある。誤差範囲に収まる 25 ポイントの Elo 差が、33% の価格差と対置されるのは、価格に敏感なパイプラインがほぼ常に Lite を選ぶべき決定の形であり――そして、レイテンシに敏感なパイプラインが逆方向に選ぶべき決定の形でもある。なぜなら両者は請求額だけでなく時間の上でも異なるからだ。

どこでそれを実行するか、そしてその答えの正直なバージョン

OrcaRouterはGemini 3.8 TTSエンドポイントをホストしていません。これはそうではないかのように示唆するのではなく、はっきりと述べておく価値があります。というのも、これら2つのモデルについて言える有益なことは、当社がそれらを提供しているという点ではなく——提供してはいません——12月31日の変更のようなベンダーによる値下げこそが、ルーティングを持つ価値をまさに生み出す出来事だという点だからです。

OrcaRouterは200以上のモデルを単一のAPIキーの背後に、プロバイダーの定価で配置し、マークアップは一切ありません。そのため、ベンダーの料金表がそのまま支払額となり、その変更は次の請求サイクルではなく、同じ日に当社側で反映されます。移行の途中にある音声パイプラインにとっては、フェイルオーバー層のほうがカタログよりも重要です。評価中のモデルにリクエスト経路を向けても、本番経路をそれに賭ける必要はありません。失敗した呼び出しは、すでに実績のあるものへフォールスルーできるからです。ルーティングDSLは、単一の音声では十分ではないケースのために複数のモデルを1つの呼び出しに組み合わせ、モデルフュージョンは、レイテンシよりも回答が重要である場合に、プロンプトにパネルで答えます。

Gemini 3.8 TTS モデル自体について言えば、それを呼び出す場所は Google 自身の API であり、Google が 9 月 23 日に名前を挙げたサーフェスでもある。このペアがあなたのアーキテクチャにもたらすもの — 2 人の話者を 1 回の呼び出しで扱えること、スタイル指定をアノテーションとして行えること、選ぶのではなく記述できる声 — こそが、ローンチ割引よりも長く残る部分だ。

次に見るもの

この世代が飛躍的な変化となるか、単なる一機能にすぎないかを決めるのは、三つのことだ。

第一はドリフトだ。2話者経路がまる1時間にわたって同一性を保つかどうかについて、長尺の評価を公表した者は誰もおらず、誰かがそうするまでは、pelican のデモはデモにすぎない。第二はボイスのライフタイムだ。1週間で失効する設計済みのボイスはプロトタイプであり、保存された設定から再導出できるボイスは製品である。そしてその答えは、2つの識別子のどちらを保持するかによって決まる。第三は、プロモーション料金が終了し、音声パイプラインの1時間あたりのコストが一夜にして倍になる12月31日の後に何が起こるかだ。

それらのどれも、ローンチ投稿からは見えない。三つともドキュメントを見れば分かるのだが、ローンチ報道はそこで読むのをやめてしまう。