「GPT-Live-1 vs ElevenLabs」のヒーロータイトルカード。サブタイトルは「単一のエンドツーエンドモデル対カスケードスタック、実際に交わる地点で測定」。3枚のカードには「GPT-Live-1: 音声1分あたり$0.05、全二重、クローニングなし」、「ElevenLabs Agents: Speech Agent ArenaでElo 937、タスク成功率90.5%」、「ElevenLabs Eleven v3: 70以上の言語、10,000以上のライブラリ音声」と記され、その下のフッターストリップには「Arenaの数値はArtificial Analysisによる。価格はベンダー文書(2026年9月)による。」とある。OrcaRouterのロゴが右下隅に合成されている。
Guides & Insights

GPT-Live-1 vs ElevenLabs:聴くモデルがひとつ、それ以外のすべてを売る企業がひとつ

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

この比較で最も有用な数値は90.5%だ。これはArtificial AnalysisがSpeech Agent ArenaでElevenLabs Agentsについて測定したタスク成功率であり、そのボードの上位6位の中で最高だ。これを達成したのは、単一のモデルではなく、音声認識、言語モデル、音声合成器をElevenLabs独自のターンテイキングロジックでつなぎ合わせたカスケードである。OpenAIのエンドツーエンド全二重モデルであるGPT-Live-1はそのボードには現れない。なぜなら、それは別のボード、Speech to Speech Indexで競っており、そこでは14件中同率6位の70.3%に位置するからだ。一方、ElevenLabs Eleven v3は依然として業界で最も広く導入されている本番用音声であり、ライブラリには10,000を超える音声と70以上の言語を備えている。

手っ取り早く言えば、片方は会話を売り、もう片方は会社を売っている、ということだ。その要約は概ね正しいが、その下にはもっと興味深い発見が隠れている。つまり、よく設計されたカスケードは、タスクを完了させるという点では、ネイティブの全二重モデルを依然として上回るのだ。

2つのアーキテクチャ。違いは継ぎ目の位置にある。

GPT-Live-1は、音声とテキストを入力として受け取り、音声とテキストを出力する単一のモデルです。割り込みをネイティブに処理します——OpenAI自身のテストは、9月のAPIリリースとともに公開され、社外では再現されていませんが、Full Duplex Bench v1.5で80.1%のインタラクティブ性を報告しており、GPT-Realtime-2.1の45.4%と対比されます。また、ターンテイキング遅延は0.798秒で、1.41秒と対比されます。継ぎ目はありません。なぜなら、継ぎ合わせるものが何もないからです。

ElevenLabs Agentsは、意図的に逆の賭けに出ている。ElevenLabsのドキュメントでは、パイプラインについて説明している。チューニングされた音声認識、自分で選択または持ち込む言語モデル、低遅延の合成器(通常はFlashラインのもの)、そしてその上に独自のターンテイキングモデルが載っている。バージインは、モデルの特性ではなく、ターンの積極性やタイムアウトを公開するエージェントごとの設定である。Artificial Analysisのベンチマークによるデフォルト構成では、スタックは音声認識にScribe v2 Realtime、推論にGem​iniモデル、合成にEleven Flash v2を採用している。

その設計には、莫大な利点が1つと、構造上のコストが1つある。利点は、すべての段階が交換可能なことだ。単純なターンには安価なモデル、難しいターンにはフロンティアモデル、異なるロケールには異なるシンセサイザーを使える。コストは、各接合部でレイテンシが累積し、ターンテイキングの判断を外部から下さなければならないことだ。

次元ごとに

• アーキテクチャ — GPT-Live-1:音声入力・音声出力の単一エンドツーエンドモデル 対 ElevenLabs Agents:独自のターンテイキング層を備えた、カスケード型の音声認識・言語モデル・合成

• 独立したエビデンス — GPT-Live-1:Artificial Analysis Speech to Speech Indexで70.3%、14社中同率6位。対ElevenLabs Agents:Speech Agent ArenaでElo 937、676サンプルで90.5%のタスク成功率、そのボードのトップ6で最高の成功率。

• 品質ボード — GPT-Live-1: ElevenLabsとは異なる種類のモデルであるため、音声合成アリーナではランク付けされていません。Eleven v3 ConversationalはProvider Voice boardでElo 1,194、Eleven v3は1,166、価格はそれぞれ100万文字あたり$50と$100です

• 価格 — GPT-Live-1:音声1分あたり$0.05、秒単位で課金、バックエンド推論は別途従量課金 対 ElevenLabs:Eleven v3 Conversationalは100万文字あたり約$50、Eleven v3は約$100、エージェントは1分あたり約$0.08と報告されており、同時実行数の上限を超えると上昇し、言語モデルとテレフォニーのコストは別途課金

• レイテンシ — GPT-Live-1: モデルレベルの初回音声出力までの時間(time-to-first-audio)は公開されていません。ベンダーテストにおけるターン交代レイテンシは0.798秒。ElevenLabsとの比較では、Flash v2.5が約75ミリ秒、Eleven v3 Conversationalが約280ミリ秒で、ベンダーはエージェントレベルでの初回音声出力まで800ミリ秒未満をガイドラインとして示しています。

• 音声とクローニング — GPT-Live-1: 12のAPIプリセット、設計上クローニングなし 対 ElevenLabs: ライブラリに10,000以上の音声、短いサンプルからのインスタントクローニング、自己検証付きで30~180分の音声からのプロフェッショナルクローニング

• 言語 — GPT-Live-1:主要言語は十分に対応しているが、提供開始時のカバレッジではそれ以外の言語の流暢さにばらつきがある。一方、ElevenLabs Eleven v3:70以上の言語。これに対し、Flashラインは32、その音声認識は90以上

• 広範さ — GPT-Live-1:単一のエンドポイント、単一のモデルID、同時実行ティアは25~500セッション、無料枠なし 対 ElevenLabs:音声合成、音声認識、吹き替え、効果音、音楽、ボイスマーケットプレイス、エージェントプラットフォームを1つの契約で提供し、商用ライセンスを含まない無料枠もある

A two-column comparison scoreboard titled 'GPT-Live-1 vs ElevenLabs — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Architecture: one end-to-end full-duplex model', 'Price: $0.05 per voice minute plus backend', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Interactivity: 80.1% (vendor, unreproduced)', 'Voices: 12 presets, no cloning', 'Best at: interruption handling'. The right column, labelled ElevenLabs, reads 'Architecture: cascaded STT + LLM + TTS', 'Price: ~$50 to $100 per 1M characters; agents ~$0.08 per minute', 'Independent score: Elo 937 on the AA Speech Agent Arena, 90.5% task success', 'Latency: ~75 ms Flash v2.5, ~280 ms v3 Conversational (vendor)', 'Voices: 10,000+ library voices, cloning with verification', 'Best at: platform breadth and voice quality'. The footer reads 'ElevenLabs agent pricing is third-party reported; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the Artificial Analysis Speech Agent Arena leaderboard, ranking cascaded voice-agent systems by Elo and task success rate. The top rows read Gemini 3.1 Flash Live Minimal at 1,046 Elo over 768 samples with a 74.6% task success rate, Gemini 3.1 Flash Live High at 1,014 with 71.8%, GPT-Realtime-1.5 at 1,000 with 85.1%, GPT Realtime (Aug '25) at 944 with 89.4%, and ElevenLabs Agents, labelled 'Default Cascaded System', at Elo 937 over 676 samples with a task success rate of 90.5% — the highest in the top six. The board continues with Amazon Bedrock Nova 2.0 Sonic at 917 and Grok Voice Think Fast 2.0 High at 908 with a 94.7% success rate.

ElevenLabsが単に先行しているだけでなく、独走している領域

そのリストにある格差のうち三つは僅差ではない。それらを一文で済ませるような比較は、現職にとって不公平である。

クローニングが最初です。GPT-Live-1は12のプリセットを搭載し、設計上、クローニングは一切ありません — 機能の欠落ではなく、意図的な安全上の姿勢です。ElevenLabsは短い参照サンプルからのインスタントクローニングと、30~180分の音声でトレーニングされたプロフェッショナルクローニングを提供しており、プラン階層と自己検証ステップによって制限されています。あなたの製品の声がそのアイデンティティの一部であるなら、これはGPT-Live-1が競合する次元ではありません。

ボイスライブラリは2つ目です。1万を超える声に加え、遺産管理団体やパフォーマーからライセンス供与された象徴的な声のマーケットプレイスは、どのモデルリリースも再現できない資産です。また、買い手が最もよく過小評価する点でもあります。声を選ぶことは音声製品のラストマイルであり、1万もの選択肢があれば、ブランディング作業を午後ひとつに圧縮できます。

第三は幅の広さだ。音声認識、吹き替え、効果音、音楽、エージェントプラットフォーム——それらのうち4つを必要とするチームは、4つではなく1つの契約を買う。それは品質上の優位ではなく戦略上の優位であり、相手がベンチマークで勝っても揺るがない。

両社はいずれも、脚注ではなく調達レビューで扱うべきガバナンス上の問題を抱えている。ElevenLabsのプロフェッショナル向けクローニングは自己確認を必要とし、その利用規約は同意があっても他人の声をクローニングすることを禁じている。同社はまた、学習データの同意をめぐり2026年5月に提起された一連の集団訴訟にも直面しており、その主張は立証されていない。OpenAIの立場はより単純である。なぜなら、リスクを生み出す機能を削除したからだ。

A screenshot of ElevenLabs' official models documentation page, describing Eleven v3 under a 'Flagship models' heading as 'Our most emotionally rich, expressive speech synthesis model', with the supporting lines 'Dramatic delivery and performance', '70+ languages supported', '5,000 character limit' and 'Support for natural multi-speaker dialogue'. The surrounding navigation lists ElevenLabs' wider product set, including text to speech, speech to text, music, text to dialogue, dubbing, sound effects, voices and voice agents.

カスケード税、そしてそれを支払う価値があるのはどこか

カスケードのコストは、レイテンシーとして、そしてオーケストレーションとして現れる。ElevenLabsのベンダーガイダンスでは、エージェントが最初の音声を出すまでの時間は中央値で800ミリ秒未満、95パーセンタイルで1.5秒未満とされている——これはパイプライン全体を表す数値であり、合成エンジンの75ミリ秒ではない。その上に、言語モデルの生成時間とネットワーク転送が積み重なる。その一部は、各段階を慎重に選ぶことで取り戻せる。だが、ただで済むものは一つもない。

オーケストレーションにかかるコストは見えにくいが、確かに存在する。余分な段階が増えるたびに、呼び出しが失敗しうる箇所が増え、調整すべきタイムアウトが増え、請求書を突き合わせるべきベンダーが増える。まさにその部分を、ネイティブなエンドツーエンドモデルは完全に取り除く。壊れる可能性があるものは1つだけで、それは応答するか、しないかのどちらかだ。

カスケードが元を取れるのは中間段階だ。音声エージェントの背後にある言語モデルは、品質が最も速く向上し、コストの変動が最も大きいコンポーネントであり、音声レイヤーに触れることなくそれを差し替えられることは、製品のライフサイクルを通じて実際の金銭的価値がある。およそ11社の上流プロバイダーからの190モデルが、プロバイダの定価でマークアップなしに単一のOrcaRouterキーの背後に並んでおり、ベンダーの価格変更はその日のうちにそのレイヤーへ届き、自動フェイルオーバーによってバックエンドのタイムアウトが通話を終わらせることがなくなる。ElevenLabsのエージェントスタックもGPT-Live-1のLive Sessionsエンドポイントもそのようには到達できない——音声レイヤーはそれぞれのベンダーに属しており、これはその下にあるレイヤーだ。

どちらを選ぶべきですか

会話の仕組みそのものが製品であり、1つの契約と1つの障害モードを望むなら、GPT-Live-1 を選んでください。発信者がエージェントに被せて話し、完璧な声よりも自然な引き継ぎが重要で、12種類の良好な声で十分な電話回線。クローズドなホスト型モデル、クローニングなし、中位の独立系品質、プロトタイプを試せる無料枠なしを受け入れます。

音声品質、クローニング、あるいは幅の広さが制約条件なら、ElevenLabsを選べ。ナレーション、吹き替え、多言語製品、声そのものがブランドであるもの、同じ契約内で音声認識を必要とするもの。運用にはカスケードを組み込むことを受け入れ、音声1単位あたりの価格はGPT-Live-1のおよそ10倍から20倍であること、そして割り込みロジックの設定は自分自身の手にあり、それを誤るのも自分であるという事実を受け入れることになる。

90.5%という数字こそ、持ち帰る価値のある部分だ。それは、3つのモデルとターンテイキング層を組み合わせた企業が、すべてを1つのモデルに学習させた企業を、通話が機能したかどうかに最も近い指標において上回ったことを示している。フルデュプレックスは確かにアーキテクチャ上の進歩だが、現時点の証拠を見る限り、発信者が望むものを得られるかどうかを決めるものではない。