
Gemini 3.8 Liveと3.8 Live Extended Thinkingを発表:Google、音声ラインを2つに分割
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240知能72コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0340知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2134知能69コーディング
GoogleのGemini 3.8 LiveとGemini 3.8 Live Extended Thinkingが2026年9月15日に登場しました。ひとつの発表、ふたつのモデル、そして製品ラインに生じた真正の分岐点です。注目の数字はArtificial AnalysisのSpeech to Speech Indexにおける6.6ポイントの差、82.6対76.0。その下にある数字は38です。同じボードのτ-Voiceエージェントタスク完了度指標では、推論バリアントが再現カスタマーサービスシナリオの68.6%を解決し、標準モデルは30.1%にとどまります。6.6ポイントは指数が語るものです。38ポイントは、どちらかのモデルに実際に何かをやらせようとしたときに起きることです。
ローンチから1日が経ち、このフォークには価格が付いた。両モデルとも Live API を通じて分単位の音声料金が公開されており、Artificial Analysis のリーダーボードでは入力音声の1時間あたりコストが$0.84で標準モデル、$3.50で推論バリアントとなっている——6.6 のインデックスポイントに対して1時間あたり4倍強だ。このトレードオフこそが判断のすべてであり、インデックスだけから読み取ると間違える。
このリリースが通常の音声モデルの刷新と一線を画すのは、その分岐がサイズ階層によるものではない点だ。これは、音声エージェントの役割とは何かに関する見解の相違である。これらのモデルの一方は対話インターフェースだ。もう一方は、たまたま話す推論システムである。
2つのモデル、2つの仕事
Google自身による説明は、この点について異例なほど明確だ。Gemini 3.8 Liveは「スケールとコスト効率のために設計され、会話知能を流暢な対話や視覚的グラウンディングと組み合わせている」と説明されている。Gemini 3.8 Live Extended Thinkingは「高度に複雑なタスク向けに設計され、知能と多段階推論が強化されている」と説明されている。
実際の違いは、仕様書ではなくケイパビリティ一覧に現れる:
• Gemini 3.8 Live — ほぼリアルタイムの視覚入力処理、対応する97言語にわたる会話途中での自動切り替え、そしてバックグラウンドでのツール/API実行により、モデルはリクエストを認識したうえで通話の完了を待たずに会話を続けられます。
• Gemini 3.8 Live Extended Thinking — 推論しながら同時に話し、多段階のタスクが実行されている間は「ちょっと確認します…」といった合図で進捗を実況します。
• 共有 — 生成されたすべての音声には Google の SynthID 透かしが含まれており、両方とも、以下の名前で公開されたモデルカードの対象となっています:gemini-3-8-audio、両方とも文書化された API モデル ID を持つようになりました:gemini-3.8-live と gemini-3.8-live-extended-thinking。
Extended Thinkingモデルは、単に思考バジェットを長くした3.8 Liveではない。会話を停滞させることなく、会話とタスク計画を同時に保持できるモデルだ。そして会話の停滞こそが、音声エージェントを本番環境で失敗させるまさにその原因である。ユーザーは、エージェントが何かを調べている間の沈黙を望まない。エージェントには話し続けてほしいのだ。

ボードには6.6と表示されています。コンポーネントには38と表示されています。
Speech to Speech Indexは、4つの基礎となる結果の加重平均です。Speech ReasoningはArtificial Analysis独自のBig Bench Audioセットで測定され、Agentic Performanceはτ-Voiceカスタマーサービスベンチマークの実行によって測定され、Arena PreferenceはSpeech Agent Arenaから取得され、Task Success Rateも含まれます。4つの要素すべてが揃ったモデルのみがインデックススコアを受け取るため、そのボード上で一部の行が空欄になっています。
分解してみると、この2つの新しいモデルは、まったく6.6ポイント差のペアには見えない。
• 音声対音声インデックス — Gemini 3.8 Live Extended Thinking(High)82.6 対 Gemini 3.8 Live 76.0
• エージェント性能(τ-Voiceタスク完了率) — 68.6% 対 30.1%
• 音声推論(Big Bench Audio) — 98% 対 92%
• 会話のダイナミクス — 91.9% 対 96.1%
• アリーナ選好(Elo) — 990 対 1083
• タスク成功率 — 89.1% 対 93.2%
• 初回音声出力までの時間 — 1.35秒 対 1.18秒
• 入力音声1時間あたりのコスト — $3.50 対 $0.84
率直に読めば、標準モデルは8項目のうち4項目で勝っている。最初の音声までの速さで上回り、アリーナでの評価がより高く、タスクを完了する可能性がより高く、会話のダイナミクスでも評価がより高い。価格も3分の1だ。それができないのは、仕事に手順があるときにその仕事を終わらせることだ。30.1% 対 68.6% は、このリリース全体で最大の単一の差であり、そしてそれは、音声エージェントを音声インターフェースから分かつ唯一の軸に位置している。
その表を確定したものとして扱う前に、2点の注意点があります。このインデックスで使用されているアリーナ選好の数値は、モデルが公開可能になった時点で固定されるため、Speech Agent Arena チャート上のライブ Elo を追跡するものではありません。これはスナップショットとして読み取るべきで、実行中のスコアではありません。また、ボード上位の τ-Voice の差はノイズと言えるほど小さいものです。推論バリアントの 68.6% は、GPT-Live-1 の 67.9%(Astra バックエンド、medium effort)を 0.7 ポイント上回っており、その後ろに GPT-Live-1(Sol、low)の 59.3% と Grok Voice Think Fast 2.0 High の 56.5% が続いています。2つの Gemini モデル間の 38 ポイントの差は小さくありません。GPT-Live-1 に対する 0.7 ポイントのリードは小さいのです。
インデックス上のどこに位置するか
2026年9月16日に撮影された下のキャプチャでは、ボードの上部に次のように表示されています:
• Gemini 3.8 Live Extended Thinking (High) — 82.6(第1位)
• GPT-Live-1(Astraバックエンド、中程度のエフォート) — 81.5
• Grok Voice Think Fast 2.0 High — 81.3
• GPT-Live-1(Solバックエンド、低エフォート) — 80.1
• Gemini 3.8 Live — 76.0
• GPT-Realtime-2.1 High — 73.9
• Gemini 3.1 Flash Live High — 71.5
1つの画面でこの分断が生じているのは、まさにこういう理由である。Extended Thinking 版が首位に立ち、このボードの (High)推論エフォート・ラベルで動作している — これは Grok Voice Think Fast 2.0 High や GPT-Realtime-2.1 High で用いているのと同じ表記法であり、報道などでこのモデルに付いているのを見かけるかもしれない「(High)」という接尾辞が、別個のリリースではなく構成ラベルである理由でもある。標準版は5位に位置する — 2つの GPT-Live-1 構成の下、そして Grok の下である。Google 自身のブログは、標準モデルを「非常に費用対効果が高い」と評し、「Speech Agent Arena で2位を確保した」と記しているが、それは別のものを測る別のボードである。どちらの記述も事実である。併せて読めばこういうことになる。3.8 Live は非常に手頃な価格で提供される非常に優れた会話モデルであり、音声知能の最先端ではない。

先にそこへ到達したリーク
モデルは発表の前日に Google Cloud のクォータページで見つかっていた。当時、私たちはその目撃情報を、モデルカードも価格も Google の確認もない未確認のスラッグとして報じた。あの投稿はステータスについては正しく、タイムラインについては間違っていた——確認はおよそ24時間以内に届いた。
この教訓は記録に残す価値がある。なぜなら、それは通常の直感に反するからだ。ローンチ前日にリークされたスラッグは、ローンチである。8週間にわたって裏付けとなる書類が一切ないリーク済みスラッグは、まったく別物だ。両者を分けたシグナルはスラッグではなく、クォータページの存在だった。それはキャパシティがプロビジョニングされたときにしか存在しない。

1分あたりの料金
発表時点で、Googleの資料は価格について2つのモデルを区別していなかった——標準モデルには料金が示されていたが、推論バリアントには示されておらず、上のスコアボードが記録しているのはまさにその点である。その差はその後埋まった。両モデルは現在、Live APIを通じて公開価格を備えている。音声入力は1分あたり$0.005、音声出力は1分あたり$0.018であり、これはGoogleが9月16日、両モデルの展開に合わせて確認したものである。同じ公開料金表はGemini 3 Live階層のトークン価格も対象としている——テキストトークンは入力100万あたり$0.75、出力$4.50、音声トークンは入力100万あたり$3.00、出力$12.00、画像または動画入力は100万あたり$1.00——ただしこれらのトークン行はモデル単位ではなく階層に対して公開されているため、特定のバリアントの見積もりではなく階層の料金表として読むべきである。
Artificial Analysisは、計画立案で最も重要となる数値も補完している。そのリーダーボードには現在、入力音声1時間あたりのコスト列が掲載されている。これは、固定の40問からなるBig Bench Audioサブセットを完了するためのコストを時間単価に正規化したもので、両方の新モデルにその数値が示されている:
• Gemini 3.8 Live — 入力音声1時間あたり$0.84、そのボードで最も低い有料レート
• Gemini 3.8 Live Extended Thinking(High)— 1時間あたり$3.50、品質で上回る両モデルよりもさらにお得
• Grok Voice Think Fast 2.0 High — $4.80/時間
• GPT-Live-1(Astraバックエンド、中程度のエフォート) — 1時間あたり$5.83
• GPT-Realtime-2(High)— $4.14/時間
• GPT-Realtime-2.1 High — 1時間あたり$10.75
上記のキャプチャについて1点補足します。リーダーボードのスクリーンショットにあるコストパネルはこの2行より前のものなので、そこには$0.84も$3.50も表示されておらず、最も安いバーは$1.42です。リスト内の数値は、その画像からではなく、2026年9月16日時点のボードのサマリーテーブルから読み取ったものです。画像に示されているインデックス値は影響を受けず、テーブルと一致しています。
上のコンポーネントと照らしてこの2つの新しい数値を見れば、このリリースは2モデルの発表ではなくなり、公表された交換レートを伴う単一の意思決定になる。推論バリアントは、時間あたりの音声コストが4倍強と引き換えに、6.6インデックスポイント、音声推論6ポイント、エージェント型タスク完了38.5ポイントを買う。それが支払う価値があるかどうかは、あなたのエージェントが何をしているかだけにかかっている——そして、コンポーネントが公開された時点で、答えの形は変わった。多段階タスクを完了することが仕事の音声エージェントは、このリリースで単一最大の改善を買っている。時間あたり$3.50で、GPT-Live-1 Astraを約40%下回り、Grok Voice Think Fast 2.0 Highをおよそ4分の1下回り、しかも両方より高いスコアを出す。会話することが仕事の音声エージェント——答える、話の流れを保つ、伝言を引き受ける、感じよくする——は、追加の推論深度ではほとんど何も買っておらず、時間あたり$0.84で、現在誰かが公開している中で最も安い有能な音声モデルを買っている。
それがこのリストの形だ。Googleは、自社の推論モデルを、それが打ち負かしている2つのモデルより安く価格設定し、標準モデルはこのボード上のあらゆるものより安く設定した。大量の音声通話分数を回しているなら、請求額を動かすのは指数スコアではなくこの数字だ。そして2つのバリアントが4×離れて位置しているという事実は、どちらを呼び出すかの選択がスタック内で唯一最大のコストレバーであることを意味する。
「Private preview」はその一文で実際に重要な役割を果たしている。
どちらのモデルも契約上の意味では一般提供されていないが、開発者向けサーフェスは公開されており、今では価格も設定されている。このことは、何を前提に計画できるかを変える:
• Gemini 3.8 Live— 開発者は、ドキュメントに記載された ID gemini-3.8-liveを通じて Gemini API、Live API、Google AI Studio で利用できます。エンタープライズは Gemini Enterprise でプライベートプレビューを利用でき、Gemini Enterprise for Customer Experience は「まもなく提供予定」です。誰でも Search Live で利用できます。
• Gemini 3.8 Live Extended Thinking — gemini-3.8-live-extended-thinking と同じ開発者向けサーフェスに加え、より幅広いコンシューマー向け経路:Google AI Pro および Ultra サブスクライバー向けの Gemini Live、Docs Live、そしてすべての Google AI サブスクライバー向けの Gmail Live と Keep Live。
まだ足りていないのは、企業が必要とする部分である。つまり、一般提供(GA)の確約、公開された稼働率の数値、そして Google が維持すると約束した料金だ。それらが必要なら、待つべきだ。試作段階なら、今日すでに道は開かれており、その背後には実際の料金表がある。これは、公開価格のないプレビューよりも実質的に良い立場だ。今すぐ統合を構築するのは妥当だが、Google が確約していない可用性目標に、収益を左右する電話回線を載せるのは妥当ではない。それに対する解決策は以下で説明する。
ベンダーの主張が終わるところ
Googleは発表に合わせて、自社によるコンポーネント別の数値も公表した — τ-Voiceでは68.6%、Sierraのτ³-Bankingリーダーボードでは35.1%、Big Bench Audioでは97.7%で、いずれもExtended Thinkingモデルの成果とされている。これらは現在2つのグループに分かれており、その分け方は重要だ。
3つのうち2つは、Artificial Analysisが独自のハーネスで自ら実行する測定値と一致している。同社のτ-Voiceエージェント型コンポーネントは、このモデルで68.6%を記録しており、GPT-Live-1 Astraは67.9%、Grok Voice Think Fast 2.0は56.5%となっている。Big Bench Audio音声推論コンポーネントは98%を記録しており、Googleは97.7%だ。Artificial Analysisはτ-VoiceとBig Bench Audioを自社のベンチマークと説明しており、可能な場合は3回の試行にわたって実行される。したがって、τ-Voiceと推論の数値は今や、Googleの発表の中だけでなく、自分で見に行ける公開ボード上にある。ただし、これらは確定したものではなく、裏付けが取れたものとして扱うべきだ。Googleが引用した正確な数値は、2回目の実行ではなく、まさに同じ実行のものである可能性が十分にあるからだ。
Sierra の数値にはそのような裏付けがなく、ベンダーの主張にとどまっている。Sierra の τ³-Banking リーダーボードでは 35.1% で、GPT-Live-1 Astra の 32.0%、xAI-Realtime の 16.5% と対比される。これはまた、じっくり考える価値のある数値でもある。なぜなら 35.1% とは、このボードで首位の音声モデルが、現実的な銀行業務のタスク完了試行のほぼ3回に2回失敗することを意味するからだ。Google はまた、Gemini Enterprise Agent Platform の Live API で実行された ServiceNow EVA-Bench の結果を引用し、両モデルが複雑なワークフローにおけるパレートフロンティアを押し広げていると述べているが、そのいずれにも独立した評価は付されていない。
ここには心に留めておく価値のある前例がある。xAIは7月、Grok Voice Think Fast 2.0についてSpeech to Speech Indexの数値82.9を報告した。上にキャプチャされたボードでは、そのモデルは81.3に位置している。ベンダー報告のインデックススコアは、生きたリーダーボードと接触しても常に生き残るとは限らない——通常はインデックスが改訂されるためであり、時にはテストされた構成が出荷されたものではなかったためだ。τ-VoiceとBig Benchの数値は自分のトラフィックで検証し、agentic列は最も厳しくテストすべきものとして読め。
これらのエージェントが実際に動作する層
どちらのモデルもバックエンドの前面に位置します。バックグラウンドでのツール実行、複数ステップにわたるタスク計画、そして本格的な音声エージェントが例外なく採用している委譲パターンは、いずれも通常のテキストモデル呼び出しに帰着します。そしてそこが、コストのばらつきが最も大きく、ロックインが最も少ないレイヤーなのです。
OrcaRouterはプロバイダーの定価で、マークアップなしで、単一のキーから190のモデルを提供します。つまり、上流のラボによる値下げは、次の契約更新時ではなく、同日中に当社側で反映されます。フロントエンドがプレビューモデルである音声スタックにとって、有用な特性は2つあります。委任先を音声統合に手を触れずに差し替えられること、そしてバックエンドのエラーやタイムアウト時にも自動フェイルオーバーが通話を維持することです。当社が何をホストし、何をホストしていないかを正確に言うと、Gemini 3.8 Liveエンドポイントは当社のルーター上にはありません — それらはGoogle自身のAPIから提供されます — しかし、これらのエージェントが作業を引き渡すテキストモデルは、多くの場合当社のルーター上にあり、Gemini 3.8 Flashもその一つです。
次に見るもの
このリリースの未解決の疑問を決着させるのは3つの点だ。1つ目は一般提供と、Googleが維持すると約束した料金である——価格は今公表されているが、プレビュー価格は動きがちであり、料金表は契約ではない。2つ目は、アリーナとタスク成功率の列が持ちこたえるかどうかだ。というのも、標準モデルの1083 Eloと93.2%のタスク成功率は、推論バリアントに4倍を支払うことに対する最も強い反論であり、またインデックスのアリーナ数値はライブではなく適格性の時点で凍結されているからだ。3つ目は、エージェント能力の差そのものについての独立した実行である。68.6% 対 30.1% はこのリリースで最大の主張であり、最も再現する価値のあるものだ。というのも、2つのモデルに関する他のすべては僅差だからだ。
それまでは、正直な要約は一つではなく二つの数字で成り立つ。Gemini 3.8 Live Extended Thinking は公開ボード上で最高スコアの音声モデルであり、エージェント系コンポーネントでは断トツの首位に立ち、時間あたりコストではすぐ後ろに続く2モデルを下回る。Gemini 3.8 Live はそのボード上で最も安価な使える音声モデルであり、アリーナで好まれ、浅いタスクではより信頼でき、総合では6.6ポイント後れを取っている——ただし、エージェントが採用される唯一の点では厳しい頭打ちがある。Google は同じフォークを二度投入し、価格は4倍の開きがあり、選択肢の値付けを異例なほど容易にした——構成要素を読み、インデックスだけを見なければ。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
