Gemini 3.8 Live Extended Thinking 対 GPT-Live-1 のヒーロータイトルカード。インデックス値が1.1ポイント異なる2つの音声モデルを、それぞれ異なる課金モデルとともに示したもの。
Guides & Insights

Gemini 3.8 Live Extended Thinking 対 GPT-Live-1:1.1ポイントの同点と2つの異なる請求書

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

総合スコアでは、これは引き分けだ。Gemini 3.8 Live Extended ThinkingはArtificial AnalysisのSpeech to Speech Indexで82.6、GPT-Live-1はAstraバックエンドのmedium reasoning effortで81.5だ。その下にあるエージェント的要素——τ-Voiceのタスク完了率——では、差は0.7ポイント、68.6%対67.9%である。推論要素では差はより大きく、しかも逆方向に開く。Big Bench AudioでGeminiモデルが97.7%、GPT-Live-1が90.1%だ。このばらつきの中に、ベンチマークをもう一度回しても残るものは何もないし、あなたが判断の根拠にすべきものも何もない。

この2つを分けているのは品質ではない。声のエージェントとは何か、誰が思考を行うのか、そして——真っ先に予算項目に響く部分——セッションがどのように課金されるのかについて、両者は見解を異にしているからだ。Gemini 3.8 Live Extended Thinking は音声トークン単位で課金し、話すのと同じモデルで推論する。GPT-Live-1 は、誰が話していようといまいと、セッション時間に対して定額を課金し、実際の思考は、別途選択して別途支払う独立したテキストモデルに任せる。これらは同じベンチマークスコアをまとった2つの異なる製品であり、どちらが合うかは、リーダーボードが決して尋ねない問いにかかっている。あなたの回線では、平均的な通話はどのようなものか?

1.1ポイントの同点、そしてそれが実際にどこで崩れるのか

まず数字から始めよう。見出しの薄さこそが要点なのだから:

音声対音声インデックス — Gemini 3.8 Live Extended Thinking (High) 82.6 対 GPT-Live-1(Astra バックエンド、中程度のエフォート)81.5

エージェント性能(τ-Voice タスク完了率) — 68.6% 対 67.9%、低エフォートで Sol バックエンドを実行した場合の GPT-Live-1 は 59.3%

音声推論(Big Bench Audio) — 97.7% 対 90.1%、差がノイズではない唯一のコンポーネント

複雑な銀行業務ワークフロー(Sierra τ³-Banking、ベンダー報告) — 35.1% vs 32.0%

最初の音声が出力されるまでの時間 — API経由では1.35秒 vs 1.24~1.34秒

時間あたりの実測コスト — Astra構成では$3.50 対 $5.83、いずれもArtificial Analysisの入力音声測定に基づく

正直に読めば、両モデルは総合では区別できず、音声推論では区別でき、そこではGeminiモデルがほぼ8ポイント先行し、コストでも区別でき、そこでは約40%先行している。GPT-Live-1が前に出るのは、ベンチマークが採点に苦しむ体験の部分だ。すなわち、真に全二重で、話しながら聞き、相槌を返し、1秒に何度も話すか譲るかを決めている。Gemini 3.8 Live Extended Thinkingはターン制だ。同じ根本的な問題——エージェントが作業している間、発信者が沈黙させられる——を、代わりにナレーションすることで解決する。タスクの実行中に「確認しますね…」のような合図とともに、推論と発話を同時に行う。

どちらのアプローチもそのラインを存続させる。だが、両者の感触は異なる。インデックスに載るのは、そのうちの一方だけだ。

A two-column scoreboard comparing Gemini 3.8 Live Extended Thinking and GPT-Live-1 across six dimensions: Speech to Speech Index 82.6 vs 81.5, agentic performance on tau-Voice 68.6 percent vs 67.9 percent, speech reasoning on Big Bench Audio 97.7 percent vs 90.1 percent, billing model per audio token vs per session minute, reasoning location in-model vs delegated to a backend text model, and cost per hour $3.50 vs $5.83.

2つの請求モデル、そして料金表が誤解を招く理由

ここはほとんどのデプロイを左右するセクションであり、そしてカバレッジが飛ばしてしまうまさにその部分だ。

Gemini 3.8 Live Extended Thinkingは、トークンモデルと同じ方法で課金されます。Live API を通じた公表レートは、音声入力100万トークンあたり$3.00(音声入力1分あたりおよそ$0.005)、音声出力100万トークンあたり$12.00(1分あたりおよそ$0.018)で、思考トークンはその出力に含めてカウントされます。課金されるのは、動きのある音声だけです。通話者が間を置いたり、考え込んだり、保留にされたりしている間、その静かな時間には一切費用がかかりません。

GPT-Live-1 は、電話回線と同じように課金されます。セッション時間1分あたり一律 $0.05 で、秒単位で課金され、誰が話しているか、あるいは誰も話していないかは関係ありません。推論バックエンドは含まれていません。思考を担うテキストモデルと、それが呼び出すあらゆるツールは、別途その上に加算されます。こうして $0.05 という見出し価格が、Sol バックエンドでは1時間あたり約 $4.47、Astra medium では1時間あたり約 $5.83 という総額になります(Artificial Analysis による計測)。

それらを並べてみると、素朴な比較 — 1分あたり$0.018 対 $0.05、2.8倍の差 — はどちらの方向にも間違っている。実測の時間あたりの数値では、実際の差は$3.50 対 $5.83、1.7倍に近い。しかしセッションクロック型のモデルは、請求額の水準だけでなく形も変える。GPT-Live-1 ではコストは通話時間に連動するため、長く静かで内容の薄い通話 — サポート窓口、本人確認ステップ、IVRの引き継ぎ — の回線も、内容の濃い回線と同じ料金を払うことになる。Gemini 側ではコストは音声に連動するので、無音は無料で、饒舌は無料ではない。1分あたりの料金で計算する前に、自分の平均通話時間で計算してみるべきだ。なぜなら、どちらが自分にとって安いかを決めるのはその数字であり、予約回線とトリアージ回線では答えが同じにはならないからだ。

思考が行われる場所

第二の構造上の違いは委譲であり、このスタックのどこまでを実際に差し替えられるかを決めるのは、まさにこれだ。

GPT-Live-1はフロントエンドである。双方向の音声を処理し、クエリに真の推論が必要な場合は、その処理を別個のバックエンドモデルに引き渡す——GPT-5.5GPT-6 Astraはいずれもバックエンドとして記載されている——そして推論努力セレクターによって、そのバックエンドをどれだけ購入するかを選べる。これが、このボードでGPT-Live-1が異なるスコアで2回掲載されている理由である。Astra上で中程度の努力なら81.5、Sol上で低なら80.1。その2つの構成の間の1.4ポイントの差は、この対戦における2つのモデル間の1.1ポイントの差よりも大きい。つまり、OpenAI側では、どのモデルを選ぶかよりも、どの構成を選ぶかのほうが重要だということである。

Gemini 3.8 Live Extended Thinkingは、発話するのと同じモデルで推論します。選択する別個のバックエンドも、そのための別個の請求もありません。引き換えに、同じモデル上で思考レベル(低・中・高)を使って深さを調整します。82.6 と 68.6 という数値は (高)構成のものです。バックグラウンドのツール実行と API 実行は両側で非同期に動作するため、どちらのモデルも動作中にハングしません。

1つの実際的な帰結:GPT-Live-1 の知能は音声フロントエンドの背後にある購入済みのテキストモデルであるため、その品質の上限が動くのは OpenAI がテキストモデルを出荷したときであり、音声モデルを出荷したときではない。Gemini 3.8 Live Extended Thinking の上限が動くのは、Google が音声モデルを再トレーニングしたときだ。音声プラットフォームに2年がかりの賭けをするなら、そのアップグレード周期の違いは、1.1 インデックスポイントよりも熟考に値する。

どちらに進んでも、切り替えコストはいくらかかるのか

これらいずれもモデルIDの差し替えではない。そう扱うチームは本番環境でその違いを思い知ることになる。次にGemini 3.8 Live Extended Thinkingへ移行するということは、異なるターン契約を受け入れることを意味する。関数呼び出しは常に非同期であるため、ブロッキングなツール宣言はキューに入れられるのではなくハードエラーを返し、クライアントはinteraction_statusフィールドを — 推論中またはツールがまだ実行中の間はIN_PROGRESS、タスク全体が完了したときにのみIDLE — 読む必要がある。turnCompleteが作業完了を意味すると鵜呑みにしてはならない。次にGPT-Live-1へ移行するということは、そのバックエンド選択の仕組みと2つ目の課金面を採用し、APIと付き合っていくことを意味する。そのAPIが開発者向けに一般提供されたのは2026年9月10日のことで、7月8日のChatGPTでの初登場から間もない — つまり、それを取り巻くサードパーティ製ツール、SDK、オブザーバビリティは、数年ではなく数か月の歴史しかない。どちらの方向に移行するにせよ、トークン費用と並んで統合作業の予算も見込んでおくべきだ。成熟した音声スタックでは、通常、リファクタリングのほうがこの2つの中で大きい。

このような比較を、それに賭けずに実行する方法

1.1ポイントの差を決着させる賢明な方法は、両方を自社のトラフィックで実行することです。そして厄介なのは、そうすると通常は2つの統合、2つの契約、2セットの認証情報が必要になることです。しかし、それは2つのアーキテクチャを意味する必要はありません。これらのシステムはいずれも、音声フロントエンドは通常のテキストモデル呼び出しの上の薄い層です — GPT-Live-1ではそれが明示的であり、Gemini側ではバックグラウンドでのツール実行も同じように解決されます — そしてそのテキスト層こそ、コストのばらつきが存在する場所であり、切り替えが本当に安価な場所です。

OrcaRouterは単一のキーで190のモデルをプロバイダー定価で、マークアップなしで提供しているため、上流の価格変更は次回の契約更新時ではなく当日に当社側で反映されます。ボイススタックにとって重要な2つの特性は、デリゲーション先をボイス統合に一切触れることなくライブトラフィック上で差し替えられること、そしてバックエンドのエラーやタイムアウト時にも自動フェイルオーバーが通話を維持することです。これにより、実トラフィック上で未検証の構成を試しつつ、その背後に本番回線を置かずに済みます。当社がホストするものとそうでないものを正確に言うと、Gemini 3.8 Live Extended ThinkingエンドポイントもGPT-Live-1エンドポイントも当社のルーター上にはありません — これらはGoogleとOpenAI自身のAPIから提供されます。それらが委譲するテキストモデルは多くの場合当社にあり、Gemini 3.8 Flashもその一つです。

ボードの一番上、そしてそれがほとんど落ち着かないこと

下のキャプチャは2026年9月16日に撮影されました:

Gemini 3.8 Live Extended Thinking(High) — 82.6、第1位

GPT-Live-1(Astraバックエンド、中程度のエフォート)— 81.5

Grok Voice Think Fast 2.0 High — 81.3

• GPT-Live-1(Solバックエンド、低エフォート) — 80.1

• Gemini 3.8 Live — 76.0

• GPT-Realtime-2.1 High — 73.9

• Gemini 3.1 Flash Live High — 71.5

注目すべき点が3つある。第一に、1位と3位は1.3ポイント差、1位と5位は6.6ポイント差であり、このボードの上位はランキングではなく混戦だ。第二に、この対戦のタイトルにあるモデルは5位のGeminiエントリではない。それは標準のGemini 3.8 Liveであり、ここで比較されている推論バリアントと混同すべきではない、別の、そしてはるかに安価な製品だ。第三に、単一の指数値を暫定的なものとして扱う前例がある。xAIは7月にGrok Voice Think Fast 2.0について82.9を報告したが、そのモデルはこのボードでは81.3を示している。ベンダー報告の指数スコアは、生きたリーダーボードとの接触に常に耐えられるわけではない。68.6%と67.9%というτ-Voiceの数値は、今やArtificial Analysis自身のハーネスで運用される公開ボードに載っているため、単に主張されただけでなく裏付けられている——だが、同じハーネス上の2つのモデル間の0.7ポイントの差は差ではない。自分のトラフィックで検証するか、無視するかだ。

Screenshot of the Artificial Analysis Speech to Speech leaderboard captured September 16, 2026, showing Gemini 3.8 Live Extended Thinking at 82.6, GPT-Live-1 at 81.5 and 80.1, Grok Voice Think Fast 2.0 at 81.3, and Gemini 3.8 Live at 76.0.

この比較で最も居心地の悪い数字であり、意思決定に織り込む価値のあるもう一つの数値がある。GoogleはSierraのτ³-Bankingリーダーボードで、Gemini 3.8 Live Extended Thinkingが35.1%、GPT-Live-1 Astraが32.0%だと報告している。いずれもベンダーによる報告値で、再現もされておらず、しかもこれらの数字が描き出す世界では、同ボード首位の音声エージェントでさえ、現実的な銀行業務タスクの試行のおよそ3回に2回は失敗する。規制下の多段階業務をエージェントに完遂させなければならないのであれば、これらのモデルはどちらも完成していない。そして、そのベンチマークでの3.1ポイントのリードは、ベンダーを選ぶ理由にはならない。人間をループに残しておく理由なのである。

Screenshot of an OrcaRouter model page for google/gemini-3.8-flash, showing a 1M-token context window, 65K maximum output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and a p50 time to first token of 3.35 seconds.

つまり、会話の自然さが製品価値であり、通話が短く高密度なら、GPT-Live-1 の全二重動作はインデックスには見えない実質的な優位性であり、その通話長ならセッションクロック課金も許容できる。通話が長い、静か、または変動的だったり、音声推論や1時間あたりのコストが支配的だったりするなら、Gemini 3.8 Live Extended Thinking は重要な要素で優位に立ち、それを実現しながら1時間あたり約40%安い——ただし、ターン制であり、エンタープライズ向けではまだプレビュー中で、あなたのツールを実行するにはクライアントのリファクタリングが必要だという注意点は付く。しかし、これらいずれも、1.1インデックスポイントの強さだけでどちらかを選ぶことを正当化するものではない。入手可能な証拠に基づけば、この2つから選ぶ正直な理由は課金モデルとその下のアーキテクチャであり、どちらも今週あなた自身のトラフィックで測定できるものだ。

OrcaRouterでは、自動フェイルオーバーによって通話が維持されますバックエンドでエラーが発生したりタイムアウトした場合に、

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新