Gemini 3.8 Live 对决 GLM-4-Voice 的主视觉标题卡,带有引题“OrcaRouter · 模型雷达——正面对决”,副标题为“21 个月的语音 AI 究竟换来了什么。”两张卡片分别写着“Gemini 3.8 Live — 2026 年 9 月,托管,工具,97 种语言”和“GLM-4-Voice — 2024 年 12 月,开放权重,9B,中文和英文”,并带有“相隔 21 个月”“Apache-2.0 代码”和“自定义权重许可”的标签。OrcaRouter 标志合成在右下角。
Guides & Insights

Gemini 3.8 Live 对比 GLM-4-Voice:21 个月的语音 AI 究竟带来了什么

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

GLM-4-Voice于 2024 年 12 月 3 日发布。Gemini 3.8 Live于 2026 年 9 月 15 日发布。两者相隔 21 个月,而这是本次对比中最重要的事实——比任何基准测试都更重要,因为它决定了你实际提出的究竟是哪种问题。

这两个模型并非竞争对手。2026年,任何大规模部署语音的人,都不会在它们之间比质量。真正的问题,是GLM-4-Voice提出、而Gemini 3.8 Live回答不了的那个:要真正拥有它,而不是租用它,需要付出什么?这个问题确实有答案,而21个月来,它的变化比你预想的要小。

谷歌发布了什么,智谱发布了什么

Gemini 3.8 Live是一款托管式、权重不公开的实时对话模型。它能处理近实时的视觉输入,在对话中途自动检测并在 97 种受支持的语言之间切换,还能在对话持续进行的同时在后台执行工具与 API 调用。开发者可通过 Gemini API 和 Google AI Studio 使用它,在 Gemini Enterprise 中处于私密预览阶段,并已在 Search Live 中提供。公布的定价为音频输入每分钟 0.005 美元、音频输出每分钟 0.018 美元,通过 Live API 提供;Artificial Analysis 的每小时输入音频成本图表独立估算其成本为每小时 1.50 美元。其姊妹模型 Gemini 3.8 Live Extended Thinking 目前以 82.6 位居同一指数榜首,而 Gemini 3.8 Live 本身则为 76.0。

GLM-4-Voice是 Zhipu AI 的首个端到端语音模型,也是一个可下载的检查点。它由三部分组成:一个基于 Whisper-large-v3 编码器构建的语音分词器,带有参数量约为 0.4B 的向量量化瓶颈;一个自回归语言模型(GLM-4-Voice-9B,从 GLM-4-9B 初始化),参数量约为 9B;以及一个从 CosyVoice 重新训练的流匹配解码器。它会说中文和英文,支持通过指令控制情感、语气、语速和方言——其中包括粤语、重庆官话、北京话——并以 12.5 Hz 对语音进行分词,形成约 175 bps 的单一码本流,比典型的神经音频编解码器低一个数量级。

尺寸并排对比:

• 发布 — Gemini 3.8 Live:2026年9月15日。GLM-4-Voice:2024年12月3日。

• 权重——闭源、仅托管,还是可下载;Apache-2.0 代码搭配自定义权重许可协议。

• 语言 — 97 种,支持对话中途切换(对比中文和英文)。

• 视觉 — 近实时视觉输入与无视觉输入的对比。

• 工具调用——对话中途在后台执行工具与 API,对比完全没有工具通道的情况。

• 上下文—— 未由 Google 公布,对比 8K 上下文、4K 最大输出。

• 自托管门槛——不适用;官方要求为 32 GB 内存外加一块 CUDA GPU;int4 精度下约需 12 GB 显存。

• 水印 — 所有生成的音频均使用 SynthID 水印,相比之下未描述任何水印。

A two-column scoreboard comparing Gemini 3.8 Live and GLM-4-Voice. Released Sep 15 2026 vs Dec 3 2024; weights closed and hosted vs open with a custom licence; languages 97 vs Chinese and English; tool calling background execution vs none; self-host floor not applicable vs 32 GB RAM plus a GPU or about 12 GB VRAM at int4; cost $1.50 per hour of input audio vs no per-minute bill. Footer reads 'GLM-4-Voice VoiceBench and UTMOS figures self-reported or third-party, unreproduced.' The OrcaRouter logo is composited in the bottom-right corner.

21个月换来的是能力,而不仅仅是质量

最简单的说法是,2026年的前沿模型击败了2024年的开放检查点。确实如此,而且差距很大——但更有用的观察是,这个类别改变了形态,而不是沿着单一轴线前进。

在智谱自己的技术报告中,GLM-4-Voice 在 Topic-StoryCloze 上的语音转文本准确率为 93.6%,语音到语音为 82.9%,UTMOS 自然度为 4.45,口语问答在通用方面为 5.40/10,知识方面为 5.20/10——均为自报且未经复现。独立评估更少且不那么令人满意:在 VoiceBench 上,其总体得分为 56.48,在一份统计中排名约 42 个中的第 29 位,在另一份中排名 40 个中的第 30 位,且多轮理解在两种语言中都被描述为薄弱。在 C³ 多轮对话理解基准上,其中文成绩为 11.09%,英文为 33.22%。VCB Bench 发现它在情感控制方面领先,中文 SIF 子指标为 93.0,并且文本-语音对齐很强,但 TELEVAL 方言处理在无明确指令的情况下仅为 4.57%。

那些数字描述的是一个擅长声音表达、却在持续理解方面表现不佳的模型。用一句话概括,这就是一款2024年的语音模型。

Gemini 3.8 Live 在 Artificial Analysis 的 Speech to Speech Index 上取得 76.0,这一分数是语音推理、智能体表现、竞技场偏好和任务成功率的综合结果。并不是说较新的模型在同一个任务上以更大的倍数表现更好。而是说,这个综合指标现在把智能体表现和任务成功率也纳入了——而 GLM-4-Voice 完全无法在这些类别中竞争,因为它没有工具通道。这个 2024 年的模型正在被按照一场它从未被设计来参与的游戏来评分。

Screenshot of the OrcaRouter models catalogue, showing hosted models listed with provider names and per-million-token pricing behind a single API key.

许可证是人们会跳过的那部分。

如果你因为GLM-4-Voice是开源的而关注它,请在权重下载完成之前先阅读条款。这种割裂是真实存在的,而且很容易被误读:

• 代码 — Apache-2.0。真正宽松。

• 权重——一项自定义许可,要求在商业使用时署名并在智谱注册。

“开放权重”与“Apache-2.0”不是同一种主张,而关于该模型的许多二手报道将它们混为一谈。如果你打算基于 GLM-4-Voice 推出商业产品,注册要求就是一道法律步骤,而非形式手续,并且应当处于关键路径上。有一个追踪项目更进一步,将该模型描述为专有,商业使用附条件。无论如何,没有按分钟计费的账单,并不等于不存在商业关系。

成本算术,如实计算

自托管的理由在于,当规模上去后,固定的月度成本比按分钟计费更划算。这个理由确实成立,但一旦把你需要运维的东西算进去,它就没有看上去那么大了。

GLM-4-Voice 官方要求 32 GB 内存和一块 CUDA GPU。社区 int4 量化版本大约需要 12 GB 显存,实际运行中约 10–11 GB,属于 RTX 3060 的范畴,且实际每轮语音上限约为 30 秒。云上的 A10 每小时大约 $0.50–$1.00,折算下来,一个持续运行的实例每月约在 $350 到 $700 之间——这还是在没有服务任何一个用户之前,而且没有故障转移、没有突发容量,凌晨 3 点解码器输出噪声时也没有人会被叫醒。

相比之下,Gemini 3.8 Live 按每小时输入音频 1.50 美元计算,意味着 350 美元大约能买到 233 小时的语音。这显然不算更差,而且它还带来了你并未预留的容量。交叉点是存在的;它比标题式对比所暗示的更高,并且会随着你的流量是稳定还是突发而变化。突发流量正是按分钟计费决定性胜出的场景,因为空闲的 GPU 和忙碌的 GPU 计费完全相同。

在花钱能换来什么这一点上,两者同样存在差异。社区中关于量化版 GLM-4-Voice 部署的报告称,其连续对话延迟为 38–120 毫秒,不过这些数字来自第三方撰文,而非智谱官方。Gemini 3.8 Live 的延迟则 Google 从未公布过。如果低延迟是你的硬性要求,那么这两者都没有一个可供你据此规划的数字——一个有第三方社区的实测数据,另一个只有合作伙伴的证言,却没有任何数字。

Screenshot of Google's official blog post titled 'Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking', dated Sep 15, 2026 and credited to Tom Ouyang and Malini Jaganathan of the Gemini Audio Team, with the summary describing the models as Google's most advanced live dialogue models with major upgrades in intelligence and parallel reasoning.

中间选项:拥有逻辑,租用能力

把这个问题框定为自托管与托管之争,忽略了大多数团队实际最终采用的安排。GLM-4-Voice 没有工具通道,因此任何基于它构建的产品都需要一个单独的文本模型来完成查询——这意味着无论如何,自托管的语音模型都位于托管文本模型的前面。部署决策与能力决策是可以分开的。

这种拆分正是路由器真正发挥作用的地方。OrcaRouter 用一把密钥承载 190 个模型,按供应商标价提供、不加价,因此语音前端背后的委派目标可以在实时流量上直接切换,无需重建任何东西,上游的降价当天就能传导到你这里,而不必等到下一次续约。在自托管环境中,自动故障转移比平时更为重要,因为当出故障的正是你自己的 GPU 实例时,后端模型仍然可达,会话不必随之一起终结。有两点需要澄清,因为这种比较容易引起混淆:我们不托管 GLM-4-Voice,Gemini 3.8 Live 端点也不在我们的路由器上——它们来自各自的厂商。路由器上提供的是二者都会把工作交付给它的文本层。

这个决定,以及它背后的教训

在以下情况下选择 GLM-4-Voice:你需要把该模型部署在自己的硬件上;你的流量确实稳定且体量很大;你只面向中文或英文进行开发;以及你需要修改模型,而不是调用它。请把许可证注册当作一项实实在在的任务来预留时间,并做好自行解决多轮理解问题的准备——这是该模型有据可查的短板,而在 4K 输出上限的限制下,再怎么微调也无法完全掩盖这一点。

如果你的需求涉及视觉、工具调用、两种以上的语言,或者任何你会形容为突发性的流量模式,那就选择Gemini 3.8 Live。它是一个预览模型,上下文和延迟数据均未公布,这确实是实实在在的规划风险,但它也是这两者中唯一一个能在句子说到一半时去查资料的模型。

总体教训比两个结论中的任何一个都更有价值。二十一个月的语音 AI 研究催生出的模型,主要并不是一个更好的语音模型——而是一个接入智能体的语音界面。如果你想要开放权重的原因是成本,那么这笔账比“免许可”的说法所暗示的要接近得多。如果你的原因是控制权,那它根本没有被商品化,而 GLM-4-Voice 仍然是对 Gemini 3.8 Live 未能回应的问题的一个合理答案。