一张为“Gemini 3.8 Live with Live Avatar”生成的 主视觉卡片,白色背景,带有柔和的蓝青渐变点缀。三张堆叠的卡片上分别写着:“2026年9月15日 — Gemini 3.8 Live 与 3.8 Live Extended Thinking 在 Live API 上线”“2026年9月24日 — Live Avatar 发布,Gemini Enterprise”“今天 — Avatar 是一项企业级能力,而不是一个模型 ID”。页脚一行写着:“日期依据 Google DeepMind。”OrcaRouter 标志合成在右下角。
Guides & Insights

Gemini 3.8 Live 携 Live Avatar 亮相:谷歌为其语音模型赋予一张脸

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 于 2026 年 9 月 15 日发布——这是 Google 在该厂商 API 上开放的两个原生实时对话端点,一个针对延迟进行优化,一个针对深思熟虑进行优化。9 月 24 日,该公司发布了 Gemini 3.8 Live with Live Avatar,它将近乎实时的视频生成与同一套语音循环配对,让模型在说话时有一张脸。两个模型 ID 没有任何变化。变化的是对话被允许呈现的样子,以及——影响更为深远的是——模型在对话仍在进行时被允许对对话做什么。

9月24日实际发布了什么

DeepMind 的这篇帖子简短而具体,值得将其所声称的内容与它所意味着的东西区分开来。用谷歌自己的话说,Live Avatar 通过将实时视频生成与现有的语音技术栈相结合,“为 Gemini 的对话式 AI 带来近乎实时的视觉临场感”。该公司描述了精准的口型同步、自然的表情和流畅的话轮转换,并给出了两个部署示例:客户服务和交互式导览。接着,它说出了对任何计划进行构建的人来说最重要的一句话——“从今天起,搭载 Live Avatar 的 Gemini 3.8 Live 已在 Gemini Enterprise 中可用。”

这就是关于可用性的全部情况。Live Avatar 并不是一个 Gemini API 模型 ID。该 API 的音频模型列表中仍然包含 gemini-3.8-live和 gemini-3.8-live-extended-thinking,并没有 avatar 这一行,价目表上也没有 avatar 这一条目。该功能落在 Gemini Enterprise 内部,这意味着这则公告的受众是企业采购方,以及代他们进行集成的开发者,而不是今天拿着密钥调用 Live API 的个人开发者。

帖子中有两项说法值得精确引用,因为二者都比常见的发布措辞更为强势。第一项:Live Avatar“具备原生多语言语音到语音同步功能”,并且“可在 97 种语言之间无缝切换,而不会降低视频保真度或引入视觉偏移”。97 这一数字与 9 月 15 日发布时为底层实时对话模型所声称的语言数量相同,因此这不过是把现有的多语言说法重述了一遍,并附加了一项新约束——当语言在句子中途切换时,唇形同步和面部动画必须跟得上。第二项:所有输出都带有 SynthID 水印,“直接编织进音频和视频输出之中”。两条轨道都有,而不只是语音。

真正全新的能力是中间那个。

跳过那些视觉呈现,最有趣的段落是关于工具调用的那一段。谷歌表示,Live Avatar 依托的是“异步工具调用”,它能够“在继续活跃对话的同时,在后台触发工具调用并获取数据,处理复杂任务,同时确保对话流程不中断”。文中给出的实例是酒店客人入住:模型在后台调用工具,同时继续与客人交谈。

这与大多数语音集成所基于的请求-响应形态存在真正的架构差异,而且正是这部分附带着成本。异步执行意味着模型正在做转录文本不会显示的工作。在文本流水线中,你会把工具调用看作一个轮次。而在这里,它发生在仍在进行中的对话底层,这就引发了任何并发执行都会引发的同样问题:如果工具调用在句子中间静默失败,会发生什么,调用方又如何知道?Google 的帖子没有说明,而模型卡才是查找这一点的地方。请把“不间断的对话流”这一说法视为供应商自述,并且未经我们能找到的任何第三方测试。

预设头像,以及限制有趣那一半的允许列表

定制化方案分为两个层级,其中只有一个层级是普遍可用的。每个企业部署都会获得“一个多样化预设头像库”。自定义头像——从“高质量参考图像”生成,同时“保留参考对象的相似度、品牌风格或角色身份”——则设有一道门槛,Google 明确表示:“自定义头像创建目前仅通过企业白名单提供。”

所以,大多数团队实际上真正想要的那个能力——让虚拟形象匹配品牌或具名角色的能力——恰恰是你无法自助开通的。如果你的计划依赖于一个长得像你们吉祥物的合成主持人,那么你等的是白名单审批决定,而不是模型发布。这是一个采购事实,而非技术事实,而且这种事会悄无声息地拖掉一个季度。

A screenshot of the Google DeepMind blog post 'Introducing Gemini 3.8 Live with Live Avatar', captured in English on 25 September 2026, showing the 24 September 2026 date, the authors listed as Shuo-yiin Chang and CJ Zheng on behalf of the Gemini Audio Team, the lede 'Building on the momentum of last week's Gemini 3.8 Live launch', the sentence 'Starting today, Gemini 3.8 Live with Live Avatar is available in Gemini Enterprise', and the section heading 'More natural and multimodal conversations'.

它相对于该行其余部分所处的位置

Live Avatar 并非诞生于一个空无一物的产品家族;要最清楚地看出它所处的位置,最好是与同一两周内一同发布的兄弟产品作对比。

• 交付形式 — 带 Live Avatar 的 Gemini 3.8 Live 是 Gemini Enterprise 内的一项企业级能力,而 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 则是 Gemini API 端点,具有模型 ID 和公开发布的按分钟费率
• 可供开发者调用 — Live Avatar 不可以,没有模型 ID,也没有费率表条目;而两个 Live 端点则可以,gemini-3.8-live 和 gemini-3.8-live-extended-thinking
• 输出 — Live Avatar 输出音频加同步视频,而 Live 端点仅输出音频
• 语言能力声明 — Live Avatar 支持 97 种语言,具备唇形同步和表情连续性;而 Live 端点支持 97 种语言,可在对话中途自动切换
• 水印 — Live Avatar 在音频和视频轨道上均带有 SynthID,而 Live 端点仅在生成的音频上带有 SynthID

这两个 Live 端点本身便是那对记录完备的组合。独立测量显示,它们在某些维度上相距甚远,在另一些维度上则很接近:在 Artificial Analysis Speech to Speech Index 上,Gemini 3.8 Live Extended Thinking (High) 为 82.6,而 Gemini 3.8 Live 为 76.0,这一差距主要建立在推理质量而非对话动态之上;而在对话动态上,排序会发生反转。Google 自己的数据则显示,二者在 τ-Voice 任务完成率上分别为 68.6% 和 30.1%,在 Big Bench Audio 上分别为 98% 和 92%。Live Avatar 会继承你在其底层调用的是这两者中的哪一个,也会继承它们的定价,因为该头像只是同一对话循环之上的一层呈现。

A screenshot of the Artificial Analysis Speech to Speech leaderboard, captured in English on 25 September 2026, showing the AA Speech to Speech Index speed and cost-per-hour-of-input-audio panel. The top index values read 82.6, 81.5, 81.3, 80.1, 76.0, 73.9 and 71.5, with a cost axis running to roughly $10.75 per hour. The bar labels are set vertically and are not legible at capture size.

这不会改变什么

它并不会让模型变得更好。Live Avatar 是一个呈现与编排层:Gemini 3.8 Live 的质量指标仍与 9 月 15 日时相同,任何需要两个变体中更强那个的人,仍然必须选择 Extended Thinking,并接受它的延迟。它没有把视频放进 API。它也没有改变与模型对话的价格,该价格仍按 Live API 的每分钟音频费率计费——音频输入每分钟 0.005 美元,音频输出每分钟 0.018 美元——而虚拟形象的视频生成在公开层面没有定价,因为它不单独出售。

它真正改变的是无需单独渲染层就能构建的产品集合。一个此前只会说话、在屏幕上留下一块空白面板的客服代理,如今可以在工作时拥有一张面孔,而它在后台所做的工作也不再以冷场的形式显现。这对界面形态而言是实实在在的变化,对底层模型而言则是温和的变化。这两点可以同时成立。

A generated summary card for Gemini 3.8 Live with Live Avatar on a white background with soft blue-and-cyan gradient accents. Four rows read 'Announced: 24 September 2026', 'Underlying models: gemini-3.8-live and gemini-3.8-live-extended-thinking, unchanged', 'Availability: Gemini Enterprise; custom avatars by enterprise allowlist', and 'Watermark: SynthID on audio and video'. A footer line reads 'Per Google DeepMind, 24 September 2026; vendor-reported and not independently benchmarked.' The OrcaRouter logo is composited in the bottom-right corner.

值得关注的内容,以及一条路由说明

有三件事会把它从一则公告变成一项构建决策。自定义虚拟形象的白名单准入必须开放,因为预设虚拟形象只是演示,自定义虚拟形象才是产品。视频轨道必须有一个定价,因为没人能基于一个未定价的产出建模单位经济。而且一个虚拟形象端点必须出现在 API 的模型列表中,因为这就是企业级功能与开发者今晚就能调用的东西之间的区别。

就我们自己而言,有一点值得明确说明,因为人们很容易作出相反的假设:OrcaRouter 并不路由 Gemini 3.8 Live 端点或 Live Avatar,本文中的任何内容都不应被理解为它具备这一能力。我们确实提供的是 Google 3.8 系列的其他部分——google/gemini-3.8-flash便是其中之一——以及一个包含 200 多个模型的目录,全部来自单一密钥,按供应商标价,无任何加价。如果 Live Avatar 把你的架构引向一个必须对客户所说内容进行推理的智能体,那么该技术栈中推理的那一半,正是你今天就能整合起来的部分。