記事「Gemini 3.8 Live vs ElevenLabs」用に生成されたヒーローカードで、見出しの左右に角丸のカードが2枚配置されている。左のカードには、クラウドと波形のアイコンの上に「Gemini 3.8 Live」、その下に「音声から音声へ、1パス、1分あたり」という行が表示されている。右のカードには、「STT - LLM - TTS」とラベル付けされた3ブロックのパイプラインアイコンの上に「ElevenLabs Agents」、その下に「組み立て済み、エージェント1分あたり」という行が表示されている。サブタイトルは「レンタルする部品 vs 部品をレンタルするシステム」と読める。OrcaRouterのロゴが右下隅に合成されている。
Guides & Insights

Gemini 3.8 Live vs ElevenLabs:モデル 対 パイプライン

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

ElevenLabsのエージェントプラットフォームのドキュメントを開くと、その真ん中にGeminiモデルが座っている。ElevenLabs Agentsはカスケード型——音声認識のフロントエンド、言語モデル、テキスト読み上げのバックエンド——であり、公開されているスタックに組み込まれている言語モデルはGeminiのものだ。Gemini 3.8 LiveとElevenLabsの比較はここから始めるのが正しい。なぜなら、比較される両者は同じ種類の対象ではないからだ。Gemini 3.8 Liveは音声対音声モデルで、2026年9月15日にLive APIで提供が始まり、音声の分数単位で課金される。ElevenLabs Eleven v3は、ElevenLabs Agentsも販売している音声プラットフォームの旗艦合成モデルであり、会話単位ではなく文字単位で課金される。一方は借りられる部品。もう一方は部品を借りるシステム——少なくとも一つの公開された構成では、Geminiモデルの部品を借りている。

その非対称性が、この比較に人が実際に持ち込む疑問のほとんどを解決してくれる。どちらを呼び出すべきかと問うているなら、正直に言えば、両者は代替品ではない。一方は料金表を備えるがテレフォニーを持たないモデルであり、もう一方はテレフォニー、同時実行数の上限、そして同時に動く3つのメーターを備えた製品だ。どちらが安いか、優れているか、速いかは、あなたのアプリケーションがすでにその2つの形のどちらであるかによって完全に決まる。

1つのモデル、または直列に並んだ3つのモデル

Gemini 3.8 Liveはネイティブの音声対音声システムです。音声が入力され、音声が出力され、推論は音声を生成するのと同じフォワードパス内で行われます——1つのモデル、1つのレイテンシ予算、1つの請求。Googleは2026年9月15日にこれを2つのバリアントで出荷しました:gemini-3.8-liveは大規模な会話業務向け、そしてgemini-3.8-live-extended-thinkingは同じインターフェースに多段階推論を備えたものです。どちらも会話中の切り替えに対応した97言語を扱い、どちらも視覚入力をほぼリアルタイムで処理し、どちらも会話を続けながらバックグラウンドでツール呼び出しとAPI呼び出しを実行し、どちらも生成された音声の毎秒にSynthIDで電子透かしを入れます。公表されている料金は、音声入力1分あたり$0.005、音声出力1分あたり$0.018です。

ElevenLabs Agents はそういうものではない。それはパイプラインであり、パイプラインそのものが製品だ。リアルタイム音声認識モデルが発信者の音声を文字起こしし、言語モデルが何を言うかを決め、合成モデル——ElevenLabs が文書化している構成では Eleven Flash v2——が応答を読み上げる。各段階は個別に課金され、各段階は差し替え可能で、全体はテレフォニー、ターン検出、同時実行数を処理するマネージドレイヤーの背後にある。ElevenLabs の看板合成モデルである ElevenLabs Eleven v3 は、また別の製品だ。100万文字あたり100ドルで販売されるテキスト読み上げモデルで、会話を行うためではなく、ナレーション、吹き替え、ボイスデザイン向けに販売されている。

まず最初に正しく押さえるべきは、「Gemini 3.8 Live vs ElevenLabs Eleven v3」は2つの音声モデル同士の直接対決ではないということです。Eleven v3は音声入力を受け取らず、会話も行いません。意味のある比較は、Gemini 3.8 Live 対 ElevenLabs Agents であり、Eleven v3 が場に加わっているのは、このプラットフォームがその上に構築されている合成品質の上限としてだけです。

それぞれが盤上で実際にどこに位置するか

この2つを互いに比較して順位づけるリーダーボードは存在しない。そしてその理由は示唆に富んでいる。両者は、それぞれ異なるものを測る別々のボードに現れ続けているからだ。

Screenshot of the Artificial Analysis Speech to Speech AI Model & Provider Leaderboard page, captured September 2026, showing the page header and title, the methodology blurb describing comparison across reasoning quality, conversational dynamics, generation time and price, Highlights cards for the AA-Speech to Speech Index, Arena and Time to first audio, a Related Links panel listing the Text to Speech, Speech to Text and Speech Agent Arena leaderboards, and the Cost per Hour of Input Audio chart with its cheapest bar at $0.78 beneath the Speech to Speech Index / Index by Component panel.

Artificial AnalysisのSpeech to Speech Index — 音声推論、エージェント的タスク完了、アリーナでの選好、タスク成功率を1つの数値に統合した指標 — では、Gemini 3.8 Liveが76.0を記録し、Extended Thinkingバリアントは82.6で首位に立っています。これらはArtificial Analysisが独自のハーネスで実施した測定値であり、Googleが公表した数値ではありませんが、Google自身の発表も同じ構成要素から得られた数値を引用しています。

ElevenLabs はあのボードにはまったく登場しない。測定対象となる音声対音声モデルを出荷していないからだ。それが登場するのは Speech Agent Arena であり、こちらはモデルではなく組み立て済みのエージェントを評価する。そこでの状況は本当にまちまちだ:ElevenLabs Agents は 937 Elo、タスク成功率 90.5% と測定されている。一方、前世代の Gemini Live を基に構築されたエージェントは 1,046 Elo、タスク成功率 74.6% で、その Gemini エージェントは最初の音声出力まで 0.96 秒だった。この2つの結果を注意深く読んでほしい。Gemini を基盤とするエージェントは選好と速度で勝ち、ElevenLabs エージェントはタスクを完了させる点で勝っている。これはカスケードが信頼性でネイティブモデルを打ち負かしているということであり、アーキテクチャ図が予測するであろう結果ではない。

これらの数値には2つの注意点があり、どちらも重要だ。その比較のGemini側は、3.8 Liveではなく2026年初頭のGemini Live世代を使用していたため、本記事が扱うモデルについての測定値ではない。そして登場する3つ目のボード——合成モデルをランク付けするArtificial AnalysisのProvider Voices speech arena——では、ElevenLabs Eleven v3が1,177 Elo、会話用バリアントのElevenLabs v3 Conversationalが1,219 Elo、首位のCartesia Sonic 3.6の1,283に対してとなる。このボードが測定するのは音声がどれだけ良く聞こえるかであり、エージェントがどれだけうまく機能するかではない。そしてこの2つを混同することが、人々が合成スコアを会話システムに関する証拠として引用してしまう所以である。

スペック対比

A generated two-column scoreboard titled 'Gemini 3.8 Live vs ElevenLabs - the scoreboard'. The Gemini 3.8 Live column reads: Architecture 'native speech to speech', Audio in 'yes, one pass', Audio out 'yes, one pass', Languages '97, mid-conversation switching', Audio price '$0.005 in / $0.018 out per minute', Telephony 'none first-party', Agent tooling 'bring your own', Task success '93.2% (AA component)'. The ElevenLabs column reads: Architecture 'cascaded STT - LLM - TTS', Audio in 'yes, via Scribe v2 Realtime', Audio out 'yes, via Eleven Flash v2', Languages '74 on Eleven v3', Audio price 'per agent minute, plus LLM tokens', Telephony 'managed, first-party', Agent tooling 'built in', Task success '90.5% (Speech Agent Arena)'. Footer: 'Gemini 3.8 Live figures per Artificial Analysis and vendor materials; ElevenLabs figures vendor-reported. Not a like-for-like head-to-head.'

• アーキテクチャ — Gemini 3.8 Live は単一のネイティブ音声対音声モデルであるのに対し、ElevenLabs Agents は音声認識、言語モデル、音声合成を組み合わせたカスケード構成です

• 入力と出力 — Gemini 3.8 Live は音声を受け取って音声を返すまでを単一パスで行うのに対し、ElevenLabs は音声を Scribe v2 Realtime に通し、Eleven Flash v2 を通して返すため、その間にテキストの文字起こしが挟まります

• 交換できるもの — Gemini 3.8 Live では何もない。モデルはモデルそのものだ vs ElevenLabs では、言語モデルも含め、すべての段階を独立して交換できる。ドキュメント化されたスタックでは、その言語モデルは Google のものだ

• 言語 — Gemini 3.8 Live 97(会話途中での切り替え対応)vs ElevenLabs Eleven v3 74

• 音声の料金 — Gemini 3.8 Live は入力1分あたり $0.005、出力1分あたり $0.018 であるのに対し、ElevenLabs はエージェントの分数で課金され、言語モデルのトークンは別途上乗せで計量される

• テレフォニー — Gemini 3.8 Live はファーストパーティのテレフォニーを提供せず、キャリアとセッションマネジメントは自分で用意する必要があります。一方、ElevenLabs はマネージドかつファーストパーティです。

• 同時実行数 — Gemini 3.8 Live は Live API のクォータが許す範囲で自由、ElevenLabs は同時実行数の階層単位で販売

• エージェントツール群 — Gemini 3.8 Live のバックグラウンドツールとモデル内部での API 実行 対 ターン検出、ワークフロー、ボイスライブラリを備えたマネージドエージェント層である ElevenLabs

• オープンな成果物 — どちらでもない。どちらもクローズドで、クラウド専用、かつプロプライエタリです

• レイテンシ — Gemini 3.8 Live は、標準モデルで最初の音声まで1.18秒、Extended Thinkingで1.35秒(Artificial Analysis調べ)。それに対しElevenLabsは単一の数値として公表していない。カスケードのレイテンシは3段階の合計だからだ

最後の行こそが、他のどの行よりもアーキテクチャの選択をよく説明している。ネイティブモデルのレイテンシ予算は1つ。カスケードには3つあり、それでもチームがカスケードを選ぶ理由は、その上にあるすべての要素にある。記録に残せるトランスクリプト、差し替えられるステージ、そしてそのまま動く電話番号だ。

1分にかかるコスト、双方向で

Gemini 3.8 Liveの計算が異例なほど簡単なのは、課金対象のメーターが1つしかないからだ。会話1分はおおよそ、通話者音声1分+モデル音声1分、つまり$0.005+$0.018なので、1分あたり約2.3セントとなる(公表レート換算)。Artificial Analysisの「1時間あたりコスト」列は、固定の音声推論セットを完了するコストを1時間単位の数値に正規化したものだが、これによると標準モデルは入力音声1時間あたり$0.84——この表で最も安い有料レート——で、Extended Thinking版は$3.50となっている。

Screenshot of the ElevenLabs pricing page captured September 2026, showing the ElevenCreative, ElevenAgents and ElevenAPI product tabs, a Monthly billing toggle, and the Free, Starter, Creator and Pro plan cards with their monthly prices of $0, $6, $11 and $99, the 'First month 50% off' promotion on Pro, and each tier's included credit allowance and feature list.

ElevenLabsの計算はより複雑で、そしてそれは批判というよりむしろ要点だ。エージェントの1分は単一の価格ではない。エージェント分そのものにかかるプラットフォーム料金、中間区間で消費される言語モデルのトークン、そしてその下にあるキャリアの通話分——最悪の場合で3つのメーター、3つのベンダー、そしてどれか一つが動けば変わる請求書。ElevenLabs Eleven v3は100万文字あたり100ドルで、通常の話速で連続ナレーションを流した場合、1時間およそ8ドル。同じアリーナで最安のオープンウェイトの競合は約2.70ドルだ。ElevenLabsはその声に対して割増料金を課しており、このボード上でその割増は本物だ——総合4位につけている。

この2つのコスト構造が実際に意味するのは、Gemini 3.8 Liveは会話1分あたりのコストが安く、音声1時間あたりでははるかに安い一方、ElevenLabsはより高コストだが、運用の予測可能性ははるかに高いということだ。MLエンジニアがおらず、電話番号を立ち上げる必要があるチームは、最初の月にはElevenLabsへの支出が少なくて済む。なぜなら、もう一方の選択肢はElevenLabsがすでに構築したものを自作することだからだ。すでに自前のセッション管理と自前のキャリアを運用しているチームは、モデル本体への支出が少なくて済む。なぜなら、すでに持っているパイプラインに対して支払う必要がないからだ。

ElevenLabsが本当に優れている点

価格差を評決として読むのはたやすい。だがそれは評決ではない。その理由は、料金表が決して見せることのないものの中にある。

• テレフォニー。ElevenLabsは電話番号、SIPトランキング、通話に応答するための同時接続数を販売している。Googleは話すモデルを販売している。あなたの製品が電話回線なら、その二つの文の間の隔たりは数か月分のエンジニアリングだ。

• 音声アイデンティティ。Voice Library、クローニングパイプライン、ダビングスタジオは成熟した製品領域です。Gemini 3.8 Live はモデルを提供しますが、ライセンスされた音声のカタログや、既存の録音を9つの言語にローカライズするワークフローを提供するものではありません。

• デフォルトで文字起こしが付いてくる。カスケードは推論する前に文字起こしを行うので、すべての通話のテキストログを追加コストなしで得られる — コンプライアンス、評価、そしてエージェントがなぜ何かを間違えたのかを突き止める地味な作業に役立つ。ネイティブの音声対音声モデルには、自分で作らない限り、そのような成果物は存在しない。

• 交換可能な部品。より優れた言語モデルが登場しても、ElevenLabsのカスケードは何も再トレーニングせずにそれを採用できる。まさにそのため、文書化されたスタックの中央にはGoogleのモデルがある——そして、これがカスケードアーキテクチャを支持する唯一最も強力な論拠である。

rawモデルで得られるもの

反論は価格についてではない。1回のフォワードパスができること、3つのステージにはできないことについてだ。

Gemini 3.8 Liveは、すでにそれらを捨て去った文字起こしを介するのではなく、韻律や声の調子、ためらいを直接聞き取る。だからこそ文の途中で言語を切り替えられるのであり、その会話ダイナミクススコア——Artificial Analysisによれば標準モデルで96.1%——が、推論重視の兄弟モデルを上回る唯一の構成要素になっている。また、話し続けながらバックグラウンドでツールやAPI呼び出しを実行するので、検索しても沈黙は生じない。そしてExtended Thinking版は、同じ能力の大型版ではなく、真に異なる能力だ。τ-Voiceの顧客サービスシナリオを68.6%解決し、標準モデルは30.1%にとどまる。その38ポイント差は今回のリリースで最大の単一数値であり、Googleがこのラインを二つに分けた理由でもある。

エージェントの仕事が楽しい会話を交わすことではなく、多段階のタスクをやり遂げることにあるなら、その38ポイントの差がすべてを決める。そして費用は1時間あたり$0.84ではなく$3.50かかる——それでも、そのボード上で打ち負かすどのモデルよりもまだ安い。

{{1}}真ん中{{/1}}の{{2}}脚{{/2}}が、実際に動かせるものだ

ここにこそ、名前を付ける価値のある継ぎ目がある。なぜなら、ここはアーキテクチャの問いが調達の問いに変わる場所だからだ。カスケードでは、中間の脚——何を言うかを決め、ツールを呼び出し、推論を行う部分——は通常のテキスト推論である。それはまた、コストの変動が最も大きく、ロックインが最も強く、単一のベンダーに縛られている理由が最も少ない脚でもある。ElevenLabs が文書化しているスタックは、たまたまそこで Gemini モデルを使っている。そうする必要はない。

OrcaRouterがカバーするのはその区間で、外側の2つは対象外です。当社はGemini 3.8 Liveの音声エンドポイントをホストしていません——これらはGoogle自身のLive APIから提供されるものです——またElevenLabsもホストしていません。その合成レイヤーとエージェントレイヤーは同社独自の製品です。当社が担うのは、その土台にあるテキストレイヤーです:単一のキーで、プロバイダーの定価のまま、マークアップなしで200以上のモデルを利用可能。そのため、上流ラボによる値下げは、次回の更新時ではなくその日のうちに請求へ反映されます。特に音声スタックにおいては、これらの特性のうち3つが真価を発揮します。自動フェイルオーバーは、バックエンドがエラーを起こしたり文の途中でタイムアウトした場合でも通話を維持します。これは発信者がすぐに気づく種類の障害です。ルーティングDSLは複数のモデルを1回の呼び出しに組み合わせるため、安価なモデルが相槌のターンを担い、より高性能なモデルがトランザクションを担当できます。そしてモデルフュージョンにより、単一モデルの判断だけでは信頼するに不十分なターンでは、パネルが一斉に回答できます。カスケードの途中にどのモデルを置くかを変えるのは、再構築ではなく設定の変更です——それこそがカスケードアーキテクチャが存在する理由そのものです。

どちらを選ぶべきですか

電話回線を提供していて、音声スタックを自前で構築したくないなら、ElevenLabsを選ぼう。購入するのは電話機能、音声カタログ、文字起こし、同時実行数、サポート契約であり、分単位の割増料金はそれらの対価だ。さらに、ほかは何も変えずに途中でモデルを差し替えられる能力も手に入る。これは言葉の印象以上に価値がある。

すでに運用している何かの機能として音声があるなら、Gemini 3.8 Liveを選ぼう。現在公表されている中で最も安い、実用的な音声対音声の料金が手に入り、会話途中で切り替え可能な97言語、モデルが話し続けている間にも実行されるツール実行、そして——エージェントが単に会話するだけでなくタスクを完了しなければならないなら——Extended Thinking版が時間あたりの音声コスト約4倍で手に入れる38ポイントのエージェント性能差も得られる。通信事業者、セッションライフサイクル、ログは自分で用意する必要がある。

注目すべき点:ElevenLabsがマネージドエージェント1分あたりの単一のレイテンシ数値を公表するかどうか。なぜなら、それこそがこの比較を構造的なものではなく定量的なものにする数値だからだ。そして、3.8 Liveで構築されたエージェントをSpeech Agent Arenaで測定したときに、その結果が維持されるかどうか。なぜなら、カスケードが現在タスク成功率でネイティブモデルを上回っていることは、この対決で最も興味深く、最も説明がついていない点だからだ。