
Eleven v4 vs Gemini 3.1 Flash TTS:116ポイントの差、そしてより安価なGoogleモデル
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 982 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 197 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
今日Googleの音声を探すなら、間違ったものを選ぶことになる。Google Gemini 3.1 Flash TTSは、Artificial AnalysisのProvider Voice Arenaで、3,512回の登場に対してElo 1,203で11位、100万文字あたり18.31ドルと表示されている。ElevenLabs Eleven v4は2026年9月28日にリリースされ、1,674回の登場に対してElo 1,319で1位、100万文字あたり80.00ドルにつけている。これは、より安価な挑戦者に対する116ポイントの差に見える——だが、Google自身のGemini 3.8 Flash TTSが同じボードで1,267で3位、正規化価格もより安い16.49ドルだと気づくまでは。本当の争いは、見出しの対決が示唆するものではない。そしてその理由はリリース日にある。
これらのうちの1つは、見た目よりも18か月新しい
Gemini 3.1 Flash TTSはボード上で2026年4月15日のリリース日を持っている。Eleven v4は2026年9月28日だ。それは5か月半であり、音声合成における世代ほどではないが、Googleがすでに後継製品を出荷するには十分な長さだ。Gemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSはどちらも2026年9月23日、Eleven v4の5日前に一般提供を開始しており、両方とも同じボード上で3.1より上位にランクされている。Gemini 3.8 Flash-Lite TTSは1,241で6位、100万あたり11.03ドルだ。

つまり、正直な比較には2点ではなく3点あり、価格による順序が興味深い部分だ:
• ランク1、ElevenLabs Eleven v4 — Elo 1,319、100万文字あたり80.00ドル、1,674回の登場、±19の区間
• 第3位、Google Gemini 3.8 Flash TTS — Elo 1,267、100万文字あたり$16.49、2026年9月23日リリース
• 6位、Google Gemini 3.8 Flash-Lite TTS — Elo 1,241、100万文字あたり11.03ドル、2026年9月23日リリース
• 第11位、Google Gemini 3.1 Flash TTS — Elo 1,203、100万文字あたり18.31ドル、2026年4月15日リリース、登場回数3,512回、±12区間
その順位付けに対して各区間が何をもたらすかに注目してほしい。Gemini 3.1 Flash TTS は 1,203、区間は ±12 と推定しているので、その真の値はおよそ 1,191 から 1,215 のどこかにある。Eleven v4 は 1,319、区間は ±19 と推定しており、およそ 1,300 から 1,338 になる。この2つの範囲は重ならず、その間の隔たりは100ポイントを超える。選好ボードとしては、これ以上なく明快だ。

なぜサンプル数が順位よりも重要なのか
Gemini 3.1 Flash TTS は、その推定値の背後に 3,512 件の登場があります。Eleven v4 は、このボードではまだ 1 日しか経っていないため、1,674 件です。より新しいモデルの推定値はサンプルあたりの不確実性がより大きく、±19 の区間はそれを反映しています。数値が落ち着くのを待つタイプの買い手なら、経験則として、区間幅を超えている順位関係こそ、実際に判断の拠り所にできる部分です。ここでは、この順位は誤差範囲を上下両方向に余裕で生き残っています — 3.8 Flash TTS より上で、この比較では誰の後ろにもありません。
アリーナではアリーナボイスも数えています。Eleven v4 は8、Gemini 3.1 Flash TTS は7です。これはブラインドテストで使用されたベンダー固有の異なる音声の数であり、ベンダーがどれだけのデフォルトのキャストを用意しているかを示すおおよその目安です。Eleven v4 の1位は8つの音声で獲得されたもので、つまりその勝利は一度の幸運によるものではありません。
Eloが織り込まない能力差
ランキングボードが測るのは好みであって、機能の網羅性ではない。実際のプロジェクトを左右する4つの違いがあり、そのどれもEloには現れない。
• スクリプト演出 — Eleven v4 はインライン音声タグ([笑う]、[ささやく]、[フランス語なまりで怒って言う])と自然言語による話し方のプロンプトをドキュメント化している;Google の 3.1 世代は音声の選択とプロンプトについてはドキュメント化しているが、パフォーマンス演出のための同等のタグ構文はドキュメント化していない。
• 音声作成 — Gemini 3.8世代では、書き起こした説明文から音声をデザインする機能と、30秒のサンプルから音声を複製する機能が追加され、出力にはウォーターマークと来歴メタデータが付与されます。Gemini 3.1 Flash TTSはそれより前のもので、あらかじめ用意された音声セットを搭載しています。
• 実音声からのクローニング — Eleven v4のInstant Voice Cloningは10秒の音声から実行でき、その上にプロフェッショナル向けのティアがある。Googleの3.8世代におけるレプリケーション経路は30秒を要求し、同意確認を追加する。基準が異なれば、同意の仕組みも異なる。
• リクエストごとの入力上限 — Eleven v4 は10,000文字と記載しています。Google は TTS モデルの課金を文字ではなくトークン単位で行っているため、リクエストごとの文字数上限を同条件で比較できるものは存在せず、この2つの指標を同種のものであるかのように並べて比較すべきではありません。
その最後の点こそが、調達スプレッドシートをつまずかせる。ElevenLabsは1,000文字あたりの価格を提示している。Googleは入力・出力のトークン100万個あたりの価格を提示している。Artificial Analysisは両方を100万文字あたりの軸に正規化している——$80.00と$18.31はそこから来ている——だが、その正規化はボードによる換算であり、どちらのベンダーの請求書でもない。順位付けに使うものであって、予測に使うものではない。

Eleven v4の料金表がこの比較に与える影響
2週間の間、上記の価格比較はElevenLabsに有利な形で誤っており、その後は同社に不利な形で誤っている。ElevenLabsのAPI料金ページでは、Eleven v4は1,000文字あたり$0.022と表示され、表示上の定価$0.08に対して、10月12日まで72%オフとラベル付けされている。Eleven v4 Turboは$0.011と、$0.04に対して表示されている。10月12日以降、プロモーションの数字は消え、100万文字あたり$80.00という料金表の数字が実際に支払う料金になる。
500万文字分の1か月で計算してみよう。Eleven v4はキャンペーン期間中は110ドル、期間後は400ドルかかる。Gemini 3.1 Flash TTSは、ボードの18.31ドル換算で、同じ1か月で約92ドルになる。これはプロモーションより安く、定価よりおよそ4倍安い。9月にベンチマークを実施し、11月に出荷するチームは、もはや存在しない数字に基づいて判断を下したことになる。
ルーティングが適する場合と、そうでない場合
これらのモデルはどちらもOrcaRouterのカタログにはありません。ここには呼び出せるElevenLabsのエンドポイントもGoogle TTSのエンドポイントも存在せず、「あなたを通じてそれらにどうアクセスすればよいですか」という問いへの正直な答えは、アクセスできない、というものです。Eleven v4にはElevenLabs自身のAPIを通じて、Gemini 3.1 Flash TTSにはGoogleのAPIを通じてアクセスします。それ以外のことを言うのは、存在しない統合をでっち上げることになります。
こうした比較で単一のキーが役立つのは、意思決定そのものだ。月400ドルのエンドポイントと月92ドルのエンドポイントを天秤にかけるなら、答えは自分のスクリプト、自分の言語、自分のリスナー次第であり、その答えを出すには、1つのテストを走らせるために2つのベンダー統合を立ち上げるのではなく、同じコードパスから同じリクエスト形状で両方を呼び出す必要がある。OrcaRouterはそのレイヤーを担う:200以上のモデルが1つのキーの背後に集約され、プロバイダーの定価を0%のマークアップでそのまま通す。そのためベンダーの価格変更は発効した当日に反映され、さらに自動フェイルオーバーを備えており、評価の途中でいずれかの上流が劣化した場合にも対応する。
誰がどれを選ぶべきか
声そのものが製品なら、Eleven v4 を選ぼう。それはすぐ下のモデルよりクリーンな区間で、116ポイント差でボードの首位に立っている。2つの中で、パフォーマンス指示用のインラインタグ構文が文書化されているのはこれだけで、クローニングの基準は30秒ではなく10秒だ。プレミアムは本物だ — 定価での正規化価格の4倍 — そしてそれはボードの頂点を買う。
Gemini 3.1 Flash TTS を選ぶのは、すでにそれにコミットしている場合だけにしましょう。これは5か月前のプレビュー世代モデルで、Google 自身の9月リリースよりスコアが低く、正規化価格は高く、それを維持する唯一の理由は既存統合における惰性です。その惰性があるなら、Google スタック内で 3.8 Flash TTS に移行すれば、ベンダーを変えることなく64 Elo ポイントとより低い正規化価格が得られます。これは、アップグレードが同時により安価な選択肢にもなる稀なケースです。
他の皆にとって、今の争点は Eleven v4 対 Gemini 3.8 Flash TTS であり、答えはランキングではなく純粋なトレードオフだ。52 Elo ポイントとタグ構文か、文字あたりコスト約5分の1か。10月12日以降、ElevenLabs のプロモーションが終了し、価格差が実際に支払うものになるので、同じスクリプトで両方を実行してみてください。
