
Gemini 3.8 Live 携 Live Avatar 亮相:谷歌为其语音模型赋予一张脸
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 36 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 181 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 于 2026 年 9 月 15 日发布——这是 Google 在该厂商 API 上开放的两个原生实时对话端点,一个针对延迟进行优化,一个针对深思熟虑进行优化。9 月 24 日,该公司发布了 Gemini 3.8 Live with Live Avatar,它将近乎实时的视频生成与同一套语音循环配对,让模型在说话时有一张脸。两个模型 ID 没有任何变化。变化的是对话被允许呈现的样子,以及——影响更为深远的是——模型在对话仍在进行时被允许对对话做什么。
9月24日实际发布了什么
DeepMind 的这篇帖子简短而具体,值得将其所声称的内容与它所意味着的东西区分开来。用谷歌自己的话说,Live Avatar 通过将实时视频生成与现有的语音技术栈相结合,“为 Gemini 的对话式 AI 带来近乎实时的视觉临场感”。该公司描述了精准的口型同步、自然的表情和流畅的话轮转换,并给出了两个部署示例:客户服务和交互式导览。接着,它说出了对任何计划进行构建的人来说最重要的一句话——“从今天起,搭载 Live Avatar 的 Gemini 3.8 Live 已在 Gemini Enterprise 中可用。”
这就是关于可用性的全部情况。Live Avatar 并不是一个 Gemini API 模型 ID。该 API 的音频模型列表中仍然包含 gemini-3.8-live和 gemini-3.8-live-extended-thinking,并没有 avatar 这一行,价目表上也没有 avatar 这一条目。该功能落在 Gemini Enterprise 内部,这意味着这则公告的受众是企业采购方,以及代他们进行集成的开发者,而不是今天拿着密钥调用 Live API 的个人开发者。
帖子中有两项说法值得精确引用,因为二者都比常见的发布措辞更为强势。第一项:Live Avatar“具备原生多语言语音到语音同步功能”,并且“可在 97 种语言之间无缝切换,而不会降低视频保真度或引入视觉偏移”。97 这一数字与 9 月 15 日发布时为底层实时对话模型所声称的语言数量相同,因此这不过是把现有的多语言说法重述了一遍,并附加了一项新约束——当语言在句子中途切换时,唇形同步和面部动画必须跟得上。第二项:所有输出都带有 SynthID 水印,“直接编织进音频和视频输出之中”。两条轨道都有,而不只是语音。
真正全新的能力是中间那个。
跳过那些视觉呈现,最有趣的段落是关于工具调用的那一段。谷歌表示,Live Avatar 依托的是“异步工具调用”,它能够“在继续活跃对话的同时,在后台触发工具调用并获取数据,处理复杂任务,同时确保对话流程不中断”。文中给出的实例是酒店客人入住:模型在后台调用工具,同时继续与客人交谈。
这与大多数语音集成所基于的请求-响应形态存在真正的架构差异,而且正是这部分附带着成本。异步执行意味着模型正在做转录文本不会显示的工作。在文本流水线中,你会把工具调用看作一个轮次。而在这里,它发生在仍在进行中的对话底层,这就引发了任何并发执行都会引发的同样问题:如果工具调用在句子中间静默失败,会发生什么,调用方又如何知道?Google 的帖子没有说明,而模型卡才是查找这一点的地方。请把“不间断的对话流”这一说法视为供应商自述,并且未经我们能找到的任何第三方测试。
预设头像,以及限制有趣那一半的允许列表
定制化方案分为两个层级,其中只有一个层级是普遍可用的。每个企业部署都会获得“一个多样化预设头像库”。自定义头像——从“高质量参考图像”生成,同时“保留参考对象的相似度、品牌风格或角色身份”——则设有一道门槛,Google 明确表示:“自定义头像创建目前仅通过企业白名单提供。”
所以,大多数团队实际上真正想要的那个能力——让虚拟形象匹配品牌或具名角色的能力——恰恰是你无法自助开通的。如果你的计划依赖于一个长得像你们吉祥物的合成主持人,那么你等的是白名单审批决定,而不是模型发布。这是一个采购事实,而非技术事实,而且这种事会悄无声息地拖掉一个季度。

它相对于该行其余部分所处的位置
Live Avatar 并非诞生于一个空无一物的产品家族;要最清楚地看出它所处的位置,最好是与同一两周内一同发布的兄弟产品作对比。
• 交付形式 — 带 Live Avatar 的 Gemini 3.8 Live 是 Gemini Enterprise 内的一项企业级能力,而 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 则是 Gemini API 端点,具有模型 ID 和公开发布的按分钟费率
• 可供开发者调用 — Live Avatar 不可以,没有模型 ID,也没有费率表条目;而两个 Live 端点则可以,gemini-3.8-live 和 gemini-3.8-live-extended-thinking
• 输出 — Live Avatar 输出音频加同步视频,而 Live 端点仅输出音频
• 语言能力声明 — Live Avatar 支持 97 种语言,具备唇形同步和表情连续性;而 Live 端点支持 97 种语言,可在对话中途自动切换
• 水印 — Live Avatar 在音频和视频轨道上均带有 SynthID,而 Live 端点仅在生成的音频上带有 SynthID
这两个 Live 端点本身便是那对记录完备的组合。独立测量显示,它们在某些维度上相距甚远,在另一些维度上则很接近:在 Artificial Analysis Speech to Speech Index 上,Gemini 3.8 Live Extended Thinking (High) 为 82.6,而 Gemini 3.8 Live 为 76.0,这一差距主要建立在推理质量而非对话动态之上;而在对话动态上,排序会发生反转。Google 自己的数据则显示,二者在 τ-Voice 任务完成率上分别为 68.6% 和 30.1%,在 Big Bench Audio 上分别为 98% 和 92%。Live Avatar 会继承你在其底层调用的是这两者中的哪一个,也会继承它们的定价,因为该头像只是同一对话循环之上的一层呈现。

这不会改变什么
它并不会让模型变得更好。Live Avatar 是一个呈现与编排层:Gemini 3.8 Live 的质量指标仍与 9 月 15 日时相同,任何需要两个变体中更强那个的人,仍然必须选择 Extended Thinking,并接受它的延迟。它没有把视频放进 API。它也没有改变与模型对话的价格,该价格仍按 Live API 的每分钟音频费率计费——音频输入每分钟 0.005 美元,音频输出每分钟 0.018 美元——而虚拟形象的视频生成在公开层面没有定价,因为它不单独出售。
它真正改变的是无需单独渲染层就能构建的产品集合。一个此前只会说话、在屏幕上留下一块空白面板的客服代理,如今可以在工作时拥有一张面孔,而它在后台所做的工作也不再以冷场的形式显现。这对界面形态而言是实实在在的变化,对底层模型而言则是温和的变化。这两点可以同时成立。

值得关注的内容,以及一条路由说明
有三件事会把它从一则公告变成一项构建决策。自定义虚拟形象的白名单准入必须开放,因为预设虚拟形象只是演示,自定义虚拟形象才是产品。视频轨道必须有一个定价,因为没人能基于一个未定价的产出建模单位经济。而且一个虚拟形象端点必须出现在 API 的模型列表中,因为这就是企业级功能与开发者今晚就能调用的东西之间的区别。
就我们自己而言,有一点值得明确说明,因为人们很容易作出相反的假设:OrcaRouter 并不路由 Gemini 3.8 Live 端点或 Live Avatar,本文中的任何内容都不应被理解为它具备这一能力。我们确实提供的是 Google 3.8 系列的其他部分——google/gemini-3.8-flash便是其中之一——以及一个包含 200 多个模型的目录,全部来自单一密钥,按供应商标价,无任何加价。如果 Live Avatar 把你的架构引向一个必须对客户所说内容进行推理的智能体,那么该技术栈中推理的那一半,正是你今天就能整合起来的部分。
