
Gemini 3.8 Live 対 GPT-Live-1:全二重 vs 話しながら考えるモデル
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240知能72コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0340知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2134知能69コーディング
およそ2か月の間、この議論はアーキテクチャによって決着していた。GPT-Live-1は真の全二重であり、話しながら聞き、「うん」「了解」といった相槌を打ち、1秒に何度も話すか譲るかを判断する。Gemini 3.8 Liveは2026年9月15日に発表された、ターン制のモデルだ。以前の枠組みでは、そのことが比較を簡単にしていたが、今ではそれはこの比較を読み解く間違った方法だ。
変わったのは、Googleが全二重に追いついたことではない。Googleが、全二重が補おうとしていたもの、つまり、複数ステップのタスクがバックグラウンドで実行されている間も会話を続けられる音声モデルと、動作しながら声に出して推論する第2のバリアントをリリースしたことだ。アーキテクチャ上の違いは本物だ。ただ、それはもはや購入を決める軸ではない。
会話を続ける2つの方法
全二重化への賭けは、会話の品質こそが製品だという点にある。GPT-Live-1 は、音声認識を言語モデルにつなぎ、さらに音声合成へとつなぐのではなく、単一のモデル内で入力音声と出力音声を継続的かつ同期的に処理する。これにより段階間の情報損失がなくなり、人々が実際に気づく挙動が生まれる。回答の途中で割り込んでも、それに適応する。沈黙や背景雑音を、あなたの発話の終わりだと誤認しない。呼びかけられるまで静かにしている。
Gemini 3.8 Live が仕掛けるターン制の賭けは、会話とは仕事のための足場にすぎないというものだ。その機能は、会話のリズムを自然に保つことよりも、セッションを生産的に保つことに主眼を置いている。ほぼリアルタイムの視覚入力処理、会話の途中で97の対応言語間を自動的に切り替える機能、そしてリクエストを受理した旨を応答しつつ通話が完了するまで話し続けるバックグラウンドでのツールおよびAPI実行である。
どちらのモデルも、考えている間はあなたとの通話を切ろうとしません。ただ、拒否の仕方が違うだけです。GPT-Live-1は音声ストリームを決して止めないことでそれを行います。Googleは作業に被せるように話すことでそれを行います。

インデックスが実際に言っていること
Artificial Analysis は Speech to Speech Index を維持しています — これは音声推論、エージェント性能、アリーナ選好、タスク成功率を重み付けして合成した指標です。2026年9月16日に取得されたボードを注意深く読んでください。なぜなら、見出しは構造を隠しているからです:
• Gemini 3.8 Live Extended Thinking — 82.6(1位)
• GPT-Live-1(Astraバックエンド、中程度のエフォート) — 81.5
• Grok Voice Think Fast 2.0 High — 81.3
• GPT-Live-1(Solバックエンド、低エフォート) — 80.1
• Gemini 3.8 Live — 76.0
• GPT-Realtime-2.1 High — 73.9
• Gemini 3.1 Flash Live High — 71.5
その順位付けから3つのことが浮かび上がる。第一に、Googleは首位につけているが、その座を占めているのは高価なバリアントであり、多くの人が実際に導入するものではない。第二に、GPT-Live-1が2回登場する。Artificial Analysisが音声フロントエンドではなくシステム全体を採点しているためだ。そして、その2つの構成の間の1.4ポイントの差は、1位と2位の間の0.2ポイントの差の7倍に達する。第三に、この対決のタイトルにあるモデル、Gemini 3.8 Liveは、GPT-Live-1の両構成より下の5位に位置している。
同じ条件で比較するなら——標準ティア対標準ティア——GPT-Live-1が総合指数でこの対決を制しており、しかも大差だ。82.6はGemini 3.8 Live Extended Thinkingのもので、それは価格も展開も異なる別製品である。

GPT-Live-1がまだ優位な点
全二重はマーケティング上の違いではなく、ベンチマークの内訳が、それがどこで真の優位性に変わるかを示している:
• エージェント性能 — GPT-Live-1はτ-Voiceで67.9%と、Grokの56.5%に対して決定的にリードしています。GoogleはGemini 3.8 Liveについて比較可能なτ-Voiceの数値を公表しておらず、Extended Thinkingバリアントの68.6%のみです。
• 会話のダイナミクス — 全二重のターンテイキングは依然として自然さを測る基準であり、ターン制モデルは従来これに後れを取ってきた。
• 委任の深さ — GPT-Live-1 は難しいクエリを最先端のテキストモデルに引き渡し、GPT-5.5 と GPT-6 Astra の両方がバックエンドとして文書化されており、推論エフォートのセレクターを公開しています。
• 出典 — ChatGPTの音声文字起こしには引用リンクが含まれており、これは一般的な音声インタラクションでは依然として珍しい。
これに対する相殺要因は、GPT-Live-1が生の音声推論では後れを取っていることだ。Big Bench Audioでは90.1%で、Grokの97.2%には及ばない。また、Full Duplex Benchでの0.798秒という看板レイテンシ値は、APIの最初の音声までの時間(1.24–1.34秒)とは異なる測定値である。
Gemini 3.8 Liveが優位に立つ点
Googleの利点は、会話にあるというより、そのセッションで何ができるかにある:
• ビジョン、現状 — Gemini は以前からカメラ入力と画面共有をサポートしてきた。GPT-Live-1 は映像も画面共有もなしでローンチされ、OpenAI はそれらが近日対応予定だと述べ、つなぎとして旧来の Advanced Voice Mode を挙げている。Gemini 3.8 Live はその上に、ほぼリアルタイムの視覚入力処理を追加する。
• 対応言語 — 97言語をサポートし、会話の途中でも自動的に言語を切り替え可能。これに対し、OpenAI側の対応範囲ははるかに限られています。
• コスト — 発表されている料金は、音声入力1分あたり0.005ドル、音声出力1分あたり0.018ドルです。GPT-Live-1はフロントエンドのみで音声1分あたり0.05ドルが課金され、バックエンドのトークンを含めて実測した総コストは1時間あたりおよそ4.47~5.83ドルになります。
• 声に出して推論する第2の階層 — Gemini 3.8 Live Extended Thinking は「ちょっと確認しますね…」といったキューで進行状況を語る。これは沈黙の問題に対する、全二重とはまた別の答え方だ。
重要なコスト比較
フロントエンドの料金は一方的な圧勝のように見える — 毎分$0.018 対 $0.05 — そして1時間あたりの数字はさらに際立っている。Artificial Analysisの入力音声1時間あたりコストのチャートでは、Gemini 3.8 Liveは1時間あたり$1.50で、GPT-Realtime-2 Highの$4.14、GPT-Realtime-2.1 Highの$10.75と対比される。Grok Voice Think Fast 2.0は$4.80だ。
落とし穴は、どちらの数字も実際の請求額ではないという点だ。GPT-Live-1の毎分0.05ドルは音声フロントエンドのみを対象としており、実際の推論を担うバックエンドのテキストモデルは別途課金される。だからこそ、0.05ドルという見出しの数字が、総額では1時間あたり4.47~5.83ドルになる。Gemini 3.8 Liveも同じ構造的な形をしており——バックグラウンドでのツール実行はテキストモデルの作業だ——Googleはその費用を公表していない。
つまり、正直に読み取れば、Gemini 3.8 Live は入口の時点で大差をつけて安く、オールインの比較は、自分のワークロードを測定するまでどちらについても不明だ。それは逃げではなく、情報の実際の状態なのだ。
両方が委譲する先のレイヤー
この対決が、見た目ほどロックインを強いられる選択ではないものにしている構造的な事実がこれだ。どちらのモデルも処理を委任する。GPT-Live-1 は設計上、難しいクエリをバックエンドのテキストモデルに渡し、Gemini 側ではバックグラウンドでのツール実行が通常のモデル呼び出しに帰着する。どちらの場合も、音声フロントエンドは推論を担うテキストモデルの上にある薄い層にすぎず、コストの変動幅が生まれるのも、切り替えが安く済むのも、そのテキスト層なのだ。
OrcaRouterは単一のキーで190のモデルをプロバイダー定価、マークアップなしで提供しており、そのため上流の値下げは、次の契約更新時ではなく当日に当社側にも反映されます。音声スタックで重要な2つの特性は、音声統合に触れずにライブトラフィック上で委任先を切り替えられることと、バックエンドがエラーまたはタイムアウトしたときに自動フェイルオーバーで通話を維持できることです。1点明確にしておきます。そうでないと誤解されやすいためです。当社はGemini 3.8 LiveやGPT-Live-1の音声エンドポイントをホストしていません — これらはベンダー自身のAPIから提供されます。それらが作業を委ねるテキストモデルは、一般にルーター上にあります。

選び方
選びましょうGPT-Live-1——会話の質こそが製品なのであれば。つまり、自然な割り込みへの対応、あいづち、そして操作するのではなく何かと話しているという感覚——そして、見かけの料金が示唆するよりもはるかに高い総コストを吸収できるのであれば。なお、そのAPIが利用可能になったのは2026年9月になってからなので、それを取り巻くサードパーティ製ツールはまだ若い点に注意してください。
選びましょうGemini 3.8 Live。今すぐビジョンが必要な場合、20数言語以上が必要な場合、あるいは分単位のコスト効率がモデル選びを左右する場合です。標準ティアを購入することになり、総合指数では1位ではなく5位に位置すること、そして誰もが引用する82.6はExtended Thinkingバリアントのものであることを、受け入れましょう。
を選ぼうGemini 3.8 Live Extended Thinking——推論こそが本命で、現時点のインデックス首位が欲しいなら。ただし、まずその展開状況を確認すること。というのも、Gemini Live、Docs、Gmail、Keep を通じたその配信経路は標準モデルより広く、企業向けの提供はまだプライベートプレビューだからだ。
次の四半期に注目すべき点は、フルデュプレックスが競争上の堀であり続けるかどうかだ。ターン制モデルは別の道筋から会話のギャップを埋めつつある——処理が進む間、ナレーションで音声を埋めておく——そして、それが実トラフィック下でも持ちこたえるなら、このカテゴリーを1年間定義してきたアーキテクチャ上の違いは、買い手が尋ねる事柄ではなくなるだろう。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
