
Gemini 3.8 Live 对比 GLM-4-Voice:21 个月的语音 AI 究竟带来了什么
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 459 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 183 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
GLM-4-Voice于 2024 年 12 月 3 日发布。Gemini 3.8 Live于 2026 年 9 月 15 日发布。两者相隔 21 个月,而这是本次对比中最重要的事实——比任何基准测试都更重要,因为它决定了你实际提出的究竟是哪种问题。
这两个模型并非竞争对手。2026年,任何大规模部署语音的人,都不会在它们之间比质量。真正的问题,是GLM-4-Voice提出、而Gemini 3.8 Live回答不了的那个:要真正拥有它,而不是租用它,需要付出什么?这个问题确实有答案,而21个月来,它的变化比你预想的要小。
谷歌发布了什么,智谱发布了什么
Gemini 3.8 Live是一款托管式、权重不公开的实时对话模型。它能处理近实时的视觉输入,在对话中途自动检测并在 97 种受支持的语言之间切换,还能在对话持续进行的同时在后台执行工具与 API 调用。开发者可通过 Gemini API 和 Google AI Studio 使用它,在 Gemini Enterprise 中处于私密预览阶段,并已在 Search Live 中提供。公布的定价为音频输入每分钟 0.005 美元、音频输出每分钟 0.018 美元,通过 Live API 提供;Artificial Analysis 的每小时输入音频成本图表独立估算其成本为每小时 1.50 美元。其姊妹模型 Gemini 3.8 Live Extended Thinking 目前以 82.6 位居同一指数榜首,而 Gemini 3.8 Live 本身则为 76.0。
GLM-4-Voice是 Zhipu AI 的首个端到端语音模型,也是一个可下载的检查点。它由三部分组成:一个基于 Whisper-large-v3 编码器构建的语音分词器,带有参数量约为 0.4B 的向量量化瓶颈;一个自回归语言模型(GLM-4-Voice-9B,从 GLM-4-9B 初始化),参数量约为 9B;以及一个从 CosyVoice 重新训练的流匹配解码器。它会说中文和英文,支持通过指令控制情感、语气、语速和方言——其中包括粤语、重庆官话、北京话——并以 12.5 Hz 对语音进行分词,形成约 175 bps 的单一码本流,比典型的神经音频编解码器低一个数量级。
尺寸并排对比:
• 发布 — Gemini 3.8 Live:2026年9月15日。GLM-4-Voice:2024年12月3日。
• 权重——闭源、仅托管,还是可下载;Apache-2.0 代码搭配自定义权重许可协议。
• 语言 — 97 种,支持对话中途切换(对比中文和英文)。
• 视觉 — 近实时视觉输入与无视觉输入的对比。
• 工具调用——对话中途在后台执行工具与 API,对比完全没有工具通道的情况。
• 上下文—— 未由 Google 公布,对比 8K 上下文、4K 最大输出。
• 自托管门槛——不适用;官方要求为 32 GB 内存外加一块 CUDA GPU;int4 精度下约需 12 GB 显存。
• 水印 — 所有生成的音频均使用 SynthID 水印,相比之下未描述任何水印。

21个月换来的是能力,而不仅仅是质量
最简单的说法是,2026年的前沿模型击败了2024年的开放检查点。确实如此,而且差距很大——但更有用的观察是,这个类别改变了形态,而不是沿着单一轴线前进。
在智谱自己的技术报告中,GLM-4-Voice 在 Topic-StoryCloze 上的语音转文本准确率为 93.6%,语音到语音为 82.9%,UTMOS 自然度为 4.45,口语问答在通用方面为 5.40/10,知识方面为 5.20/10——均为自报且未经复现。独立评估更少且不那么令人满意:在 VoiceBench 上,其总体得分为 56.48,在一份统计中排名约 42 个中的第 29 位,在另一份中排名 40 个中的第 30 位,且多轮理解在两种语言中都被描述为薄弱。在 C³ 多轮对话理解基准上,其中文成绩为 11.09%,英文为 33.22%。VCB Bench 发现它在情感控制方面领先,中文 SIF 子指标为 93.0,并且文本-语音对齐很强,但 TELEVAL 方言处理在无明确指令的情况下仅为 4.57%。
那些数字描述的是一个擅长声音表达、却在持续理解方面表现不佳的模型。用一句话概括,这就是一款2024年的语音模型。
Gemini 3.8 Live 在 Artificial Analysis 的 Speech to Speech Index 上取得 76.0,这一分数是语音推理、智能体表现、竞技场偏好和任务成功率的综合结果。并不是说较新的模型在同一个任务上以更大的倍数表现更好。而是说,这个综合指标现在把智能体表现和任务成功率也纳入了——而 GLM-4-Voice 完全无法在这些类别中竞争,因为它没有工具通道。这个 2024 年的模型正在被按照一场它从未被设计来参与的游戏来评分。

许可证是人们会跳过的那部分。
如果你因为GLM-4-Voice是开源的而关注它,请在权重下载完成之前先阅读条款。这种割裂是真实存在的,而且很容易被误读:
• 代码 — Apache-2.0。真正宽松。
• 权重——一项自定义许可,要求在商业使用时署名并在智谱注册。
“开放权重”与“Apache-2.0”不是同一种主张,而关于该模型的许多二手报道将它们混为一谈。如果你打算基于 GLM-4-Voice 推出商业产品,注册要求就是一道法律步骤,而非形式手续,并且应当处于关键路径上。有一个追踪项目更进一步,将该模型描述为专有,商业使用附条件。无论如何,没有按分钟计费的账单,并不等于不存在商业关系。
成本算术,如实计算
自托管的理由在于,当规模上去后,固定的月度成本比按分钟计费更划算。这个理由确实成立,但一旦把你需要运维的东西算进去,它就没有看上去那么大了。
GLM-4-Voice 官方要求 32 GB 内存和一块 CUDA GPU。社区 int4 量化版本大约需要 12 GB 显存,实际运行中约 10–11 GB,属于 RTX 3060 的范畴,且实际每轮语音上限约为 30 秒。云上的 A10 每小时大约 $0.50–$1.00,折算下来,一个持续运行的实例每月约在 $350 到 $700 之间——这还是在没有服务任何一个用户之前,而且没有故障转移、没有突发容量,凌晨 3 点解码器输出噪声时也没有人会被叫醒。
相比之下,Gemini 3.8 Live 按每小时输入音频 1.50 美元计算,意味着 350 美元大约能买到 233 小时的语音。这显然不算更差,而且它还带来了你并未预留的容量。交叉点是存在的;它比标题式对比所暗示的更高,并且会随着你的流量是稳定还是突发而变化。突发流量正是按分钟计费决定性胜出的场景,因为空闲的 GPU 和忙碌的 GPU 计费完全相同。
在花钱能换来什么这一点上,两者同样存在差异。社区中关于量化版 GLM-4-Voice 部署的报告称,其连续对话延迟为 38–120 毫秒,不过这些数字来自第三方撰文,而非智谱官方。Gemini 3.8 Live 的延迟则 Google 从未公布过。如果低延迟是你的硬性要求,那么这两者都没有一个可供你据此规划的数字——一个有第三方社区的实测数据,另一个只有合作伙伴的证言,却没有任何数字。

中间选项:拥有逻辑,租用能力
把这个问题框定为自托管与托管之争,忽略了大多数团队实际最终采用的安排。GLM-4-Voice 没有工具通道,因此任何基于它构建的产品都需要一个单独的文本模型来完成查询——这意味着无论如何,自托管的语音模型都位于托管文本模型的前面。部署决策与能力决策是可以分开的。
这种拆分正是路由器真正发挥作用的地方。OrcaRouter 用一把密钥承载 190 个模型,按供应商标价提供、不加价,因此语音前端背后的委派目标可以在实时流量上直接切换,无需重建任何东西,上游的降价当天就能传导到你这里,而不必等到下一次续约。在自托管环境中,自动故障转移比平时更为重要,因为当出故障的正是你自己的 GPU 实例时,后端模型仍然可达,会话不必随之一起终结。有两点需要澄清,因为这种比较容易引起混淆:我们不托管 GLM-4-Voice,Gemini 3.8 Live 端点也不在我们的路由器上——它们来自各自的厂商。路由器上提供的是二者都会把工作交付给它的文本层。
这个决定,以及它背后的教训
在以下情况下选择 GLM-4-Voice:你需要把该模型部署在自己的硬件上;你的流量确实稳定且体量很大;你只面向中文或英文进行开发;以及你需要修改模型,而不是调用它。请把许可证注册当作一项实实在在的任务来预留时间,并做好自行解决多轮理解问题的准备——这是该模型有据可查的短板,而在 4K 输出上限的限制下,再怎么微调也无法完全掩盖这一点。
如果你的需求涉及视觉、工具调用、两种以上的语言,或者任何你会形容为突发性的流量模式,那就选择Gemini 3.8 Live。它是一个预览模型,上下文和延迟数据均未公布,这确实是实实在在的规划风险,但它也是这两者中唯一一个能在句子说到一半时去查资料的模型。
总体教训比两个结论中的任何一个都更有价值。二十一个月的语音 AI 研究催生出的模型,主要并不是一个更好的语音模型——而是一个接入智能体的语音界面。如果你想要开放权重的原因是成本,那么这笔账比“免许可”的说法所暗示的要接近得多。如果你的原因是控制权,那它根本没有被商品化,而 GLM-4-Voice 仍然是对 Gemini 3.8 Live 未能回应的问题的一个合理答案。
