
Gemini 3.8 LiveとLive Avatar:Googleが音声モデルに顔を与える
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 36 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 181 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
Gemini 3.8 LiveとGemini 3.8 Live Extended Thinkingは2026年9月15日に登場した — GoogleがベンダーのAPI上で公開した2つのネイティブなライブ対話エンドポイントで、一方はレイテンシー向け、もう一方は熟考向けに最適化されている。9月24日、同社はLive Avatarを備えたGemini 3.8 Liveを発表した。これはほぼリアルタイムの動画生成と同一の音声ループを組み合わせることで、モデルが話す際に顔を持つようにする。2つのモデルIDについては何も変わっていない。変わったのは、会話がどのような形を取れるように許されるかであり、そして — さらに重大なことに — 会話がまだ進行している間にモデルがその会話に対して何をすることを許されるかである。
9月24日に実際に出荷されたもの
DeepMindの投稿は短く具体的であり、それが主張していることと、それが意味することは分けて考える価値がある。Live Avatarは、Google自身の言葉を借りれば、リアルタイムの動画生成を既存の音声スタックと組み合わせることで、「Geminiの対話型AIにほぼリアルタイムの視覚的プレゼンスをもたらす」。同社は、精密なリップシンク、自然な表情、滑らかなターンテイキングについて述べ、導入例を2つ挙げている。カスタマーサービスとインタラクティブなウォークスルーだ。そして、何かを構築しようと計画している人にとって最も重要な一文をこう述べている——「本日より、Live Avatarを備えたGemini 3.8 LiveがGemini Enterpriseで利用可能になりました」。
これが可用性に関するすべてです。Live Avatar は Gemini API のモデル ID ではありません。API の音声モデル一覧には依然として gemini-3.8-live と gemini-3.8-live-extended-thinking が含まれており、アバターの行はありません。また、料金表にアバターの項目はありません。この機能は Gemini Enterprise 内に搭載されるため、この発表の対象となるのは企業のバイヤーと、彼らに代わって統合を行う開発者であり、今日キーを使って Live API を呼び出す個人開発者ではありません。
投稿の主張のうち2つは、正確に引用する価値がある。どちらも、よくある製品発表の文言より踏み込んでいるからだ。第一点:Live Avatarは「ネイティブな多言語音声対音声同期を備え」、「映像の忠実度を低下させたり視覚的なドリフトを生じさせたりすることなく、97言語をシームレスに移行できる」。97という数字は、9月15日の発表で基盤となるライブ対話モデルについてうたわれた言語数と同じだ。つまりこれは、既存の多言語に関する主張に新たな制約を添えて言い直したものだ——文の途中で言語が変わっても、リップシンクと顔のアニメーションが追随しなければならない。第二点:すべての出力にはSynthIDによる電子透かしが入れられており、「音声と映像の出力に直接織り込まれている」。音声だけでなく、両方のトラックだ。
本当に新しい能力とは、真ん中にあるものです。
ビジュアルは読み飛ばして、最も興味深い段落はツール呼び出しに関するものだ。Googleによれば、Live Avatarは「非同期ツール呼び出し」に支えられており、これによって「アクティブな対話を続けながら、バックグラウンドでツール呼び出しをトリガーしてデータを取得し、複雑なタスクを処理しつつ、途切れない会話の流れを確保できる」という。その実例として挙げられているのはホテルのゲストチェックインで、モデルはバックグラウンドでツールを呼び出しながら話し続ける。
それは、ほとんどの音声連携が前提としているリクエスト-レスポンス型とは根本的に異なるアーキテクチャ上の違いであり、しかもコストが伴う部分です。非同期実行とは、モデルがトランスクリプトには表示されない処理を行っていることを意味します。テキストパイプラインなら、ツール呼び出しは1ターンとして見えるはずです。ここでは、まだ進行中の会話の下でそれが起きるため、あらゆる並行実行が提起するのと同じ疑問が生じます。文の途中でツール呼び出しが黙って失敗したら何が起きるのか、そして発信者はどうやってそれを知るのか。Googleの投稿には書かれておらず、それを知るにはモデルカードを見るべきです。「途切れない会話の流れ」という主張は、ベンダーによる報告であり、我々が見つけられる限りどの第三者によっても検証されていないものとして扱ってください。
プリセットアバター、そして興味深い半分を制限する許可リスト
カスタマイズの話には2つの階層があり、そのうち一般提供されているのは1つだけだ。すべてのエンタープライズ導入には「多様なプリセットアバターのライブラリ」が付属する。カスタムアバター——「高品質な参照画像」から生成され、「参照元の人物の似姿、ブランドのスタイル、またはキャラクターのアイデンティティを保ちながら」作られるもの——はゲートの背後にあり、Googleはそれを明言している。「カスタムアバターの作成は現在、エンタープライズの許可リスト登録を通じてのみ利用可能です。」
だから、ほとんどのチームが実際に欲しがる機能——アバターをブランドや名前の知られたキャラクターに合わせられるようにする機能——は、セルフサービスでは使えないものだ。もしあなたの計画が、あなたのマスコットに似た合成プレゼンターに依存しているなら、あなたが待っているのはモデルのリリースではなく、許可リストへの掲載判断だ。これは技術上の事実ではなく調達上の事実であり、静かに一四半期遅れる類のものだ。

行の残りの部分に対してどこに位置するか
Live Avatarが登場したのは空の製品ファミリーではなく、それが占める位置は、同じ2週間に出荷された兄弟製品と照らし合わせると最も見えやすくなる。
• 提供形態 — Live Avatar を備えた Gemini 3.8 Live は Gemini Enterprise 内のエンタープライズ機能 vs Gemini 3.8 Live と Gemini 3.8 Live Extended Thinking は、モデルと公表された分単位料金を備えた Gemini API エンドポイントです
• 開発者が呼び出し可能 — Live Avatar は不可、モデル ID も料金表の記載もなし vs 2 つの Live エンドポイントは可、gemini-3.8-live と gemini-3.8-live-extended-thinking
• 出力 — Live Avatar は音声と同期した映像 vs Live エンドポイントは音声のみ
• 言語 — Live Avatar はリップシンクと表情の連続性を備えた 97 言語 vs Live エンドポイントは会話途中の自動切り替えに対応した 97 言語
• ウォーターマーク — Live は音声トラックと映像トラックの両方に SynthID vs Live エンドポイントは生成音声に SynthID
2 つの Live エンドポイント自体は、十分に文書化されたペアである。独立した測定では、いくつかの軸では両者が大きく離れ、他の軸では近い。Artificial Analysis Speech to Speech Index では、Gemini 3.8 Live Extended Thinking (High) が 82.6 であるのに対し Gemini 3.8 Live は 76.0 で、その差は主に会話のダイナミクスではなく推論品質によって生じており、会話のダイナミクスでは順位が逆転する。Google 自身の数値では、τ-Voice のタスク完了率で 68.6% と 30.1%、Big Bench Audio で 98% と 92% としている。Live Avatar は、その下でどちらを呼び出しても、そのどちらかを受け継ぎ、料金も受け継ぐ。なぜなら、アバターは同じ会話ループ上のプレゼンテーション層だからである。

これによって変わらないこと
これはモデルを改善するものではない。Live Avatar はプレゼンテーションとオーケストレーションのレイヤーであり、Gemini 3.8 Live の品質指標は9月15日時点から変わっていない。2つのバリアントのうちより強力な方を必要とする人は、依然として Extended Thinking を選び、そのレイテンシーを受け入れなければならない。これは API に動画を追加するものでもない。また、モデルと対話する際の価格を変えるものでもない。料金は依然として Live API の1分単位の音声料金で請求される — 音声入力は1分あたり $0.005、音声出力は1分あたり $0.018 — そしてアバターの動画生成は個別販売されていないため、公開価格は設定されていない。
それが実際に変えるのは、別個のレンダリング層なしに構築できる製品の集合だ。以前は話しながら画面上に空白のパネルを残していたサポートエージェントが、今では作業中も表情を保てるようになり、バックグラウンドで行っている作業も無音の空白として見えなくなる。これはインターフェースの形にとって意味のある変化であり、基盤モデルにとっては控えめな変化だ。その両方が同時に成り立つ。

注目すべき点と、ルーティングに関する注意点を1つ
三つのことがあれば、これは発表から構築の決断へと変わる。カスタムアバターの許可リスト登録が開放される必要がある。なぜなら、プリセットアバターはデモであり、カスタムアバターこそ製品だからだ。動画トラックには価格がつく必要がある。なぜなら、価格のない出力では誰もユニットエコノミクスをモデル化できないからだ。そして、アバターのエンドポイントがAPIのモデル一覧に現れる必要がある。なぜなら、それがエンタープライズ機能と、開発者が今夜にも呼び出せるものとの違いだからだ。
当社側について、一つだけ正確に述べておくべきことがあります。逆に思い込まれやすいからです。OrcaRouterはGemini 3.8 LiveエンドポイントやLive Avatarをルーティングしておらず、ここに記された内容はそうしているという主張として読まれるべきものではありません。当社が取り扱っているのは、Googleの3.8ラインの残りの部分、google/gemini-3.8-flash などを含むラインであり、それに加えて200を超えるモデルのカタログをプロバイダー定価のまま、マークアップなしの単一キーでご利用いただけます。Live Avatarによってお客様のアーキテクチャが、顧客の発言について推論しなければならないエージェントへと向かうのであれば、そのスタックの推論を担う側こそ、今日統合できる側です。
