Gemini 3.8 Live Extended Thinking vs Gemini 3.8 Liveのヒーロータイトルカード。2つのモデルが1時間あたりの音声コストで4倍差、$3.50 対 $0.84 で分かれていることを示す。
Guides & Insights

Gemini 3.8 Live Extended Thinking 対 Gemini 3.8 Live:重要な38ポイントに4倍を支払う

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2つのモデル、1回のリリース、1つの料金表、そして多くの記事が同じ方向に間違える判断。Gemini 3.8 Live Extended ThinkingGemini 3.8 Liveは2026年9月15日に同時リリースされ、どちらもGemini 3 Pro上に構築され、どちらも会話途中の自動切り替えに対応した97言語を扱い、どちらもほぼリアルタイムの視覚入力を受け付け、どちらも生成音声にSynthIDで電子透かしを入れます。Artificial Analysisが公表する複合Speech to Speech Indexでは、両者は6.6ポイント差 — 82.6対76.0です。同じボードが測定する時間あたりの音声コストでは、両者は4倍を少し超える差があります。

それらのどちらも、あなたのアーキテクチャを決めるべき数値ではない。決めるべき数値は38だ。τ-Voice上での両者の差、すなわちエージェント型タスク完了コンポーネントでの差であり、そこでは推論バリアントがレプリカ顧客対応シナリオの68.6%を解決し、標準バリアントが30.1%を解決する。あなたは良いモデルとより良いモデルの間で選んでいるのではない。会話型インターフェースと、たまたま話す推論システムの間で選んでいるのだ。そして価格差は、その選択について最も興味深い点ではない。

価格の分岐点、実際に請求される単位で

まず請求額から見ていこう。そこは多くの人が正しく理解したうえで、つい重く見すぎてしまう部分だからだ。両モデルは Live API を通じて同じ公表レートを適用する。音声入力は1分あたり $0.005、音声出力は1分あたり $0.018 で、Extended Thinking 側では、その出力トークンに思考も含まれる。同じ料金表、同じレートで、推論用の別個のプレミアム階層はない。

分ではなく作業量で測ると、その乖離が明らかになる。Artificial Analysisの「入力音声1時間あたりのコスト」列——固定された40問のBig Bench Audioサブセットを完了するコストを1時間あたりの数値に正規化したもの——は、この2つのモデルをまったく別の区分に位置づける:

Gemini 3.8 Live Extended Thinking(High)— 入力音声1時間あたり$3.50、Artificial Analysis自身の測定による

Gemini 3.8 Live — 1時間あたり$0.84、その掲示板で最も低い報酬レート

• {{1}}GPT-Live-1({{2}}Astraバックエンド、中程度のエフォート{{/2}}){{/1}} — 1時間あたり5.83ドルなので、推論バリアントは依然として打ち負かすモデルを約40%下回る

Grok Voice Think Fast 2.0 High — 1時間あたり4.80ドル

• GPT-Realtime-2.1 High — 1時間あたり$10.75

そこが分岐点だ。公表されている分あたりの料金は同じなのに、1時間あたりの音声コストは4倍になる。推論バリアントは、同じ量の聞き取りをするのにより多くのトークンを消費するからだ。標準モデルの0.84ドルは割引ではない。ボード全体の下限なのだ。

38ポイントで買えるもの

複合体を分解すると、2つのモデルはもはやペアには見えなくなる:

音声対音声インデックス — Gemini 3.8 Live Extended Thinking(High)82.6 対 Gemini 3.8 Live 76.0

エージェント性能(τ-Voiceタスク完了率) — 68.6% 対 30.1%

音声推論(Big Bench Audio) — 98% 対 92%

会話のダイナミクス — 91.9% 対 96.1%

アリーナ選好(Elo) — 990 対 1083

タスク成功率 — 89.1% 対 93.2%

初回音声出力までの時間 — 1.35秒 対 1.18秒

入力音声1時間あたりのコスト — $3.50 対 $0.84

これを正直に読めば、安価なモデルは8項目のうち4項目で勝っている。初回音声までが速く、アリーナで選好され、浅いタスクを完了する可能性が高く、会話のダイナミクスでもより高く評価されている。最後の項目は残念賞ではない。なぜなら、会話のダイナミクスこそ通話者が気づくものだからだ。それができないのは、手順のある仕事を最後までやり遂げることだ。31.1% 対 68.6% は、このリリースのどこを見ても最大の単一の差であり、それはエージェントとインターフェースを分ける唯一の軸に位置している。

これらの行には2つの注意点があります。インデックス内のアリーナ選好値は、モデルが公開可能になった時点で固定されるため、継続的に更新されるEloではなくスナップショットです。つまり、時点での評価として読むべきであり、ライブのSpeech Agent Arenaチャートとして読むべきではありません。また、τ-Voiceボードのトップは僅差です。推論バリアントの68.6%が、GPT-Live-1の67.9%(Astraバックエンド、medium effort)を0.7ポイント上回っており、GPT-Live-1(Sol、low effort)が59.3%、Grok Voice Think Fast 2.0 Highが56.5%で後れを取っています。GPT-Live-1に対する0.7ポイントのリードはノイズの範囲内です。このペア内の38ポイントの差はそうではありません。

A two-column scoreboard comparing Gemini 3.8 Live Extended Thinking and Gemini 3.8 Live across six dimensions: Speech to Speech Index 82.6 vs 76.0, agentic performance on tau-Voice 68.6 percent vs 30.1 percent, speech reasoning on Big Bench Audio 98 percent vs 92 percent, arena preference Elo 990 vs 1083, time to first audio 1.35 seconds vs 1.18 seconds, and cost per hour of input audio $3.50 vs $0.84.

もう1つの4x:推論ティアがコードでどれほどのコストになるか

このリリースには2つ目のフォークがあり、それはどのリーダーボードにも表示されない。この2つのモデルはそのまま差し替え可能なものではない。推論バリアントが、クライアントが守るべき契約を変えるからだ。

標準モデルでは、Gemini 3.8 LiveはLive APIクライアントが期待するとおりに動作します。バックグラウンドのツール呼び出しとAPI呼び出しはモデルが発話を続けている間も実行され、turnComplete: trueは引き続きターンの終了を示します。選択できる思考レベルの設定はありません。別途構成するものが何もないからです。モデルが応答し、応答し終えれば、そのターンは完了です。

ではGemini 3.8 Live Extended Thinking、一度に3つのことが変わります:

関数呼び出しは常に非同期です。ブロッキングツールの宣言は丁寧にキューに入るわけではなく、ハードエラーを返します。標準モデル向けに書いたツールスキーマは、すべて非ブロッキングとして再宣言する必要があります。

新しいステータスフィールドが実際の状態を保持します。クライアントはinteraction_statusを信頼するのではなく、turnComplete を読み取る必要があります。このフィールドは IN_PROGRESS となり、モデルがまだ推論中かツールがまだ実行されている間はその状態のままで、タスク全体が完了したときにのみ IDLE に落ち着きます。タスクがまだ完了していなくても、ターンは終了することがあります。

思考の深さは調整つまみです。モデルは設定可能な推論レベル(低・中・高)を公開しており、ボード上の82.6と68.6という数値は(高)構成です。低に下げると、品質とトークンコストの両方が変わり、インデックスには、低にすることでタスク完了において何を犠牲にするかは何も示されていません。

その3点目は移行の罠です。Extended Thinking はツール呼び出しが絡むまでは、標準モデルと同じようにネットワーク上で応答するため、チームはモデルIDを差し替え、動くデモを確認し、本番環境で予約ツールが結果ではなくエラーを返して初めて非同期契約に気づくことになります。クライアント側のリファクタリングは、音声料金の4倍と併せて予算に計上してください。成熟した統合では、2つのコストのうち大きいのはクライアント側リファクタリングの方です。

ワークロードが実際に求めているのはどちらか

判断するためのすっきりした方法は、どれだけ賢くしたいかではなく、そのセッションが何のためにあるのかを問うことだ。

選ぶべきなのはGemini 3.8 Live、会話そのものが成果物であるときだ。応答し、話の流れを保ち、伝言を承り、発信者を見極め、感じよく、速く、安く。入力音声1時間あたり$0.84で、現在公開されている中で最も安価な有能な音声モデルであり、アリーナでも選好され、浅いタスクではより信頼性が高く、最初の音声までの速さも170ミリ秒上回る——発信者が体感できる違いだ。受け入れるべき唯一の点はその天井である。マルチステップタスク完了率30.1%ということは、手順のある作業をやり遂げられないということであり、どれだけプロンプトエンジニアリングを重ねてもこの数字は動かない。

使うGemini 3.8 Live Extended Thinkingのは、セッションに仕事があるときだ。予約、変更、キャンセル、アカウント問題の解決、電話相手を待たせながら多段階プロセスを案内する——そういう場面だ。それが38ポイントのラインであり、時給$3.50の価値がある。しかも注目すべきは、これが、総合スコアでこのモデルが上回る2つのモデルよりもなお安いことだ。さらに、待ち時間を耐えられるものにするナレーションの挙動も得られる。このモデルは推論と発話を同時に行うので、何かを調べている間の沈黙の代わりに、発信者には「ちょっと確認します…」という言葉と、進み具合がその都度聞こえる。これは、全二重アーキテクチャが音声を決して止めないことで解決するのと同じ問題であり、Googleの答えは、作業中も話し続けることにある。

検討に値する行がさらに2つある。Googleはまた、Sierraのτ³-BankingリーダーボードでExtended Thinkingモデルについて35.1%を報告しており、これはGPT-Live-1 Astraの32.0%に対する数値だ——独立した測定に裏打ちされていないベンダー報告値であり、絶対値としても厳しい。35.1%とは、そのボードで最高のモデルが、現実的な銀行業務タスクの試行のおよそ3回に2回は失敗することを意味するからだ。そして、標準モデルがSpeech Agent Arenaで2位につけていること——Googleが自社資料で引用している——は、タスク完了ではなく選好を測る別のボードにおける実際の結果だ。どちらの記述も成り立つ。合わせて言えるのは、安価なモデルは話しかけられることにかけて非常に優れており、高価なモデルだけが、この2つのうち実際に仕事を任せられるモデルだということだ。

2つの連携なしで両方を実行する

これらすべてに対する実務上の反論は、ワークロードごとに選ぶということが2つの経路を維持することを意味する、というものだ。そうする必要はない。どちらのバリアントも同じクラスのバックエンドの手前に位置する——バックグラウンドのツール実行と多段階計画は通常のテキストモデル呼び出しに帰着する——そしてその層こそが、コストのばらつきが存在する場所であり、切り替えが安価な場所である。

OrcaRouter は単一のキーで190ものモデルをプロバイダーの定価のまま、マークアップなしで利用できるようにしており、ベンダーの価格変更は次回の契約更新時ではなく当社側でその日のうちに反映されます。安価な会話ティアと高価な推論ティアの間でルーティングするスタックにとって重要なのは、委任先をライブトラフィック上で切り替えられ、しかも音声統合には一切手を触れずに済むこと、そしてバックエンドでエラーやタイムアウトが発生しても自動フェイルオーバーがセッションを維持することです。当社がホストするものとホストしないものを正確に述べると、Gemini 3.8 Live と Gemini 3.8 Live Extended Thinking のエンドポイントは当社のルーターにはありません — これらは Google 自身の API、すなわち Gemini API、Live API、Google AI Studio から提供されています。これらのエージェントが作業を引き継ぐ先のテキストモデルは、多くの場合まさにそうしたモデルで、Gemini 3.8 Flash もその一つです。

ボード上で各モデルがどこに位置するか

以下のキャプチャは2026年9月16日に取得されたもので、Speech to Speech Index の上部は次のとおりです:

Gemini 3.8 Live Extended Thinking(High) — 82.6、第1位

• GPT-Live-1(Astraバックエンド、中程度のエフォート) — 81.5

• Grok Voice Think Fast 2.0 High — 81.3

• GPT-Live-1(Solバックエンド、低エフォート) — 80.1

Gemini 3.8 Live — 76.0、第5位

• GPT-Realtime-2.1 High — 73.9

• Gemini 3.1 Flash Live High — 71.5

そのリストをお読みになる際に、命名について1点: (High)カバレッジでこのモデルに付されている接尾辞は、推論エフォートの構成ラベルであり、別個のリリースではありません。これは、ボードが Grok Voice Think Fast 2.0 High と GPT-Realtime-2.1 High に用いているのと同じ慣例です。

Screenshot of the Artificial Analysis Speech to Speech leaderboard captured September 16, 2026, showing Gemini 3.8 Live Extended Thinking at 82.6 in first place, GPT-Live-1 at 81.5, Grok Voice Think Fast 2.0 at 81.3, and Gemini 3.8 Live at 76.0.

まだコミットされていないものは何ですか?

この2つについては見誤りやすい点が1つあるので、はっきり言っておく価値がある。どちらのモデルも、契約上の意味では一般提供されていない。ただし、どちらも価格が設定され、文書化されている。

開発者はGemini 3.8 LiveをGemini API、Live API、Google AI Studioで、ID gemini-3.8-liveとして利用できます。企業はGemini Enterpriseでプライベートプレビューを利用でき、Gemini Enterprise for Customer Experienceは近日提供予定と記載されています。消費者はSearch Liveで利用できます。Gemini 3.8 Live Extended Thinkinggemini-3.8-live-extended-thinkingで同じ開発者向けサーフェスを持ち、さらに幅広い消費者向け経路があります — Gemini Live、Google AI ProおよびUltra加入者向けのDocs Live、すべてのGoogle AI加入者向けのGmail LiveとKeep Live。Workspaceの法人顧客は近日提供予定と記載されています。

欠けているのは、企業がこれに収益ラインを載せる前に必要とするものだ。すなわち、一般提供(GA)のコミットメント、公表された稼働率の数値、そして Google が据え置くと約束した料金である。価格は公表されているが、プレビュー価格は変動するのが常だ。今すぐプロトタイプを作り、移行を計画し、提示されていない可用性目標には署名しないこと。

Screenshot of an OrcaRouter model page for google/gemini-3.8-flash, showing a 1M-token context window, 65K maximum output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and a p50 time to first token of 3.35 seconds.

この2つが実際に突きつける選択は、インデックスが見せるほど広いものではなく、品質の階段でもない。あなたのエージェントの仕事が話すことなら、安価なモデルは妥協ではない——より低い価格でより良い製品であり、4分の1の料金は論拠ではなくおまけだ。あなたのエージェントの仕事が何かを仕上げることなら、推論バリアントはこの2つのうち、そもそもそのタスクを任せられる唯一のものであり、1時間3.50ドルは、そうでなければ失敗する予約に対しては端数誤差にすぎない。避けるべき間違いは、中間を取ることだ。つまり、良い会話しか必要としなかったワークロードに推論の深さの対価を払うことであり、これはチームが6.6ポイントの総合差を読んで、38までスクロールしないときに起きることだ。