「Gemini 3.8 TTS vs ElevenLabs」の生成されたヒーローカード。白い背景に柔らかなブルーとシアンのグラデーションアクセント。左のカード「ElevenLabs Eleven v3」には、100万文字あたり$100、70以上の言語、Elo 1,167、ランク17が記載されている。右のカード「Gemini 3.8 Flash TTS」には、100万文字あたり$33、130言語、Elo 1,260、ランク2が記載されている。フッター行には「Artificial Analysis Provider Voice ArenaによるElo、2026年9月」とある。OrcaRouterのロゴは右下隅に合成されている。
Guides & Insights

Gemini 3.8 TTS vs ElevenLabs:3倍の価格で得られるもの

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

同じ利用量であれば、ElevenLabsのフラッグシップ音声合成モデルのコストは、同社の新しいモデルの約3倍になります。ElevenLabs Eleven v3は1,000文字あたり0.10ドル、つまり100万文字あたり100ドルを請求し、Gemini 3.8 Flash TTSは100万オーディオトークンあたり9.00ドルを請求しますが、Artificial Analysisはこれを100万文字あたり33.00ドルに正規化しています。これは料金メーター上で3.0倍の開きであり、この比較において最も重要な事実です。興味深い問いは、その差が実在するかどうかではなく、100万文字あたり追加の67ドルが実際に何を買っているのかという点です。というのも、その答えは「より良い音声」ではないからです。

A generated two-column scoreboard for ElevenLabs Eleven v3 and Gemini 3.8 Flash TTS — Eleven v3 at Arena Elo 1,167, $100.00 per 1M characters, 70-plus languages, a 280 ms latency claim and 4,345 samples; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 130 languages, no latency claim and 1,999 samples — over the footer 'Elo per Artificial Analysis; latency vendor-reported.'

1メートルではなく3メートル

まずはっきりさせておくべきことは、これら二つの製品は同じものを測定しているわけではなく、公表されている料金表はその事実を覆い隠しているということだ。

• ElevenLabs は文字単位で課金されます。Eleven v3 は 1,000 文字あたり $0.10 で、1 リクエストあたり 5,000 文字が上限です。Eleven v3 Conversational は 1,000 文字あたり $0.05 で、Flash および Turbo モデルも 1,000 文字あたり $0.05 ですが、1 リクエストあたり 40,000 文字の上限があり、v3 Conversational の約 280 ms に対して約 75 ms のレイテンシをうたっています。

Googleはトークン単位で課金され、音声トークンはテキストトークンとは異なります。Gemini 3.8 Flash TTSは、入力のテキストトークン100万あたり$0.50、出力の音声トークン100万あたり$9.00を課金し、生成された音声1秒あたり25音声トークンで計測されます。リクエストごとの文字数上限は公開されていません。

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

• Artificial Analysis はどちらの請求も行わない。正規化しているのだ。Provider Voice Arena リーダーボード上の100万文字あたり $100.00 と $33.00 は、ボードがそもそも価格で順位付けできるようにするための、導出された共通分母である。比率には有用だが、見積もりには向かない。

では、3.0倍という数字の正直な姿はこうだ。利用できる唯一の同一条件での比較に基づけば、Googleは価格がおよそ3分の1になる。それが自分のスプレッドシート上で何を意味するかは、ワークロードの大部分が短い文字列なのか長い文字列なのかによって変わる。秒単位の音声メーターと文字単位のテキストメーターは、発話が長くなるにつれて大きく乖離する。なぜなら、沈黙、ポーズ、韻律的なパディングはすべて音声トークンを消費し、文字は消費しないからだ。

稼働月

100万文字のテキストを、およそ中規模の小説ほどの長さで、一度音声に変換するとしましょう。

• ElevenLabs Eleven v3 — 音声合成に $100.00、さらに同時実行数で実行するために必要なプラン階層の費用が加わります。公開されているプランでは、Starter が $6、Creator が $22、Pro が $99、Scale が $299、Business が $990 で、文字許容量は別途請求されるのではなく、それらにバンドルされています。

• Gemini 3.8 Flash TTS — 33.00ドル相当、ジョブがバッチ処理可能ならおよそ16.50ドル。BatchおよびFlexティアでは音声レートが半分の100万トークンあたり4.50ドルになるためだ。優先サービスを使うと100万トークンあたり16.20ドル、つまり約59.40ドル相当になるが、それでもElevenLabsをはるかに下回っている。

• Gemini 3.8 Flash-Lite TTS — 音声トークン100万個あたり$6.00、同じ正規化に基づく換算で約$22.10相当、ただし対応言語は130ではなく101になります。

同じ100万文字をGoogleのプロモーション価格で処理すると、差はさらに広がります。というのも、新しいGemini TTSモデルは2つとも2026年12月31日まで半額で、その後は2倍になるからです。9月の数字でビジネスケースを組み立てている人は、公表された有効期限付きの割引の上にそれを組み立てていることになります。

A screenshot of ElevenLabs' API pricing page, captured in English, showing the Eleven v3 card at $0.10 per 1K characters with a 5,000-character limit, v3 Conversational at $0.05 with a 280 ms latency claim, v2 Multilingual at $0.10 with 29 languages, and Flash/Turbo at $0.05 with a 40,000-character limit.

比較が逆転する唯一の場面は、ごく短い発話です。文字単位の課金体系では、三語の確認応答にほとんど料金はかかりません。一方、秒単位の音声課金体系では、その確認応答を言うのにかかる1秒分について、前後の無音も含めて課金されます。あなたの製品が、一文の応答で構成される音声インターフェースなら、計算上はElevenLabsに傾きます。ナレーション、オーディオブック、長尺のローカライゼーション、あるいはテキストが長く音声がさらに長いものなら何であれ、強くGoogleに傾きます。

品質の問い、正直なところ

Artificial Analysis Provider Voice Arena — 各プロバイダー自身のネイティブ音声に対するブラインドのペアワイズ投票 — では、両モデルに大きな差があり、Googleが先行している。

• Gemini 3.8 Flash TTS — 2位、Elo 1,260、17ポイント間隔、1,999サンプル、8つのアリーナ音声、2026年9月リリース。

• ElevenLabs Eleven v3 — 17位、Elo 1,167、変動幅11ポイント、サンプル数4,345、アリーナ音声8種、ボード上では2026年2月として掲載。

93 Eloポイントが両者を隔てており、あのボードのトップ3の間の差とは違い、この差は本物だ。Eleven v3の区間は1,156から1,178、Geminiの区間は1,243から1,277で、重なりはない。Eleven v3のサンプル数はGeminiの2倍以上なので、推定が薄いということもない。

それは価格論にとって本当に厄介な結果であり、明白な結論に反している。ElevenLabsは3倍の料金を請求し、盲検の好みでは17位も低い。追加の67ドルが何をもたらすにせよ、直接対決でより良い声を買えるわけではない。

イレブンラボが実際に売っているもの

ElevenLabsが主に売っているのは音声合成エンドポイントではない。それをあたかもそうであるかのように価格評価するのが、ほとんどの比較が間違う原因だ。そのお金で買えるもの:

• ボイスライブラリ。ElevenLabsの共有ボイスライブラリは数百種類のボイスを擁し、紛れもなく製品の主要な接点です — 人々がElevenLabsに求めるものは、多くの場合、どこかで聞いた特定のボイスであって、その背後にあるモデルではありません。Gemini 3.8 Flash TTSは30種類のプリビルドのスタジオボイスを搭載し、自然言語の説明からボイスを生成するボイスデザインの経路と、同意確認、SynthIDウォーターマーク、C2PAクレデンシャルを付帯した30秒のサンプルからクローンする複製経路を備えています。デフォルトのカタログはより小規模ですが、特定のボイスを作成する能力は同程度です。

• レイテンシの階層は別製品です。約75 msで40,000文字の上限があるFlashとTurboは、約280 msで5,000文字のv3とは別製品であり、どちらもv3より安価です。アプリケーションが100 ms未満を必要とするなら、ElevenLabsはそれを明示的に販売しており、Googleの発表資料はどちらの新しいTTSモデルについても同等のレイテンシを主張していません。

• エコシステム。ダビング、音声エージェント、会話型エンドポイント、同時実行数が紐づくプラン構造——Cartesiaがテレフォニーを売るのと同じ理由だ。それはモデルではなく、スタックなのだ。

スタックを購入する場合、3.0倍というのは、それを自分で組み立てないことに対する代価だ。音声合成の呼び出しを購入する場合、その対価は音声ライブラリとレイテンシ階層に対して支払っていることになる。

Googleが実際に売っているもの

反対事例は「より安い」よりも狭く、より強力である。

• 言語カバレッジ — Flash TTS で130言語、Flash-Lite TTS で101言語。テキストから自動検出され、ElevenLabs が Eleven v3 について記載している70以上の言語と対比されます。ローカリゼーションの工程にとって、この差は機能の比較ではなく、カバレッジのギャップです。

• 演出 — 行ごとの読み上げ制御、1回の呼び出し内での2話者シーンの演出、そして台本に<laughs><sigh><gasp>|mhm||yeah|として書き込まれる非言語キュー。Googleは、3.8世代がGemini 3.1 Flash TTSよりも長文の一貫性と2話者制御を改善したと主張しているが、まさにこれらの機能はそのために存在する。ベンダーの主張であり、未再現。

• 音声の状態モデル — プロジェクトごとに有効期間(TTL)1年のステートフルなカスタム音声を最大200個、または voicekey_... ハンドルで指定されるステートレスな音声で、こちらは7日で失効します。これは、事前に計画に組み込めるインフラ上の判断です。

• 出力制御 — 単項エンドポイントでは WAV 24 kHz モノラル 16 ビット符号付き PCM、ストリーミング エンドポイントではヘッダーなし PCM(audio/l16)、および設定可能なサンプル レートの audio/mulaw と audio/alaw。

Googleのローンチ時ベンチマークはベンダー報告によるもので、その前提で読むべきだ。Hume AI Voice Design Benchmarkでは71.4で1位、アクセントモデリングでは60.8で1位、Hume Overall Quality IndexではFlashとFlash-Liteがそれぞれ1位と2位、さらに日本語、ブラジルポルトガル語、ベトナム語、現代標準アラビア語、メキシコスペイン語、ヒンディー語で主張されているブラインド選好の上位入賞。これらの実行結果はどれも公開されていない。本記事で唯一独立に収集された数値は上記のarena Eloであり、それはたまたまベンダーの主張の方向性と一致している。

スイッチ計算

ワークロードが長尺・多言語、あるいは3.0xが明細の一行として現れるほどの大容量で、かつデフォルトの音声カタログがより小さく、公表されたsub-100 msティアがなくても許容できるなら、切り替えましょう。これでナレーション、吹き替え、アクセシビリティ、そしてほとんどの製品組み込み型音声をカバーできます。

スタックを購入しているなら — ボイスライブラリ、レイテンシ階層、ダビングとエージェント製品 — 残るべきですし、ワークロードの大半がごく短い発話で、秒単位の音声課金が不利に働く場合も同様です。また、ElevenLabs ですでにユーザーに認知されている声のアイデンティティをファインチューニング済みなら、これも残る理由になります。声の継続性は製品の機能であり、新しいモデルでそれを再現するのは一大プロジェクトだからです。

いずれにせよ賢明なのは、本番トラフィックで1か月間両方を走らせてから決めることであり、それがどちらも直接あなたのコードベースに組み込まないほうがよい理由です。OrcaRouterは200以上のモデルを、プロバイダーの定価のまま、マークアップなしで単一のキーの背後に置きます。そのため、どちらかのラボによる価格変更は、更新時ではなくその日のうちに請求へ反映されます。そして自動フェイルオーバーが本番の音声パスを維持します できたばかりのエンドポイントが誤動作したときも。当社はElevenLabsをホストしていません — その合成とエージェントのレイヤーは同社独自の製品です — またGemini 3.8 TTSエンドポイントもホストしていません。これらはGoogleのAPIから提供されています。当社が担うのは、その下にあるテキストレイヤーと、その上にあるルーティングです。

注目すべき数字は、次回のリーダーボード改訂におけるEleven v3のEloだ。93ポイントは、3倍の価格を請求するモデルにとって大きな後れであり、隔たりが埋まらないまま区間が狭まれば、価格の論拠はトレードオフであることをやめ、評決になる。