
Qwen3.8-LiveTranslate 对比 Gemini 3.5 Live Translate:一个交付的是数字,另一个交付的是地图
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
两个领先的实时语音翻译模型在愿意接受何种衡量标准上存在分歧,而这种分歧比任何规格对比都更有用。 Qwen3.8-LiveTranslate于 2026 年 9 月 19 日发布,主打一项硬指标:平均滞后为 2.3 秒,较上一代的 2.8 秒有所下降。 Gemini 3.5 Live Translate是该厂商于 2026 年 6 月宣布的语音到语音模型,至今仍带有预览版模型 ID,它主打覆盖面——70 多种语言、自动检测、对话中切换,以及集成到该厂商的 Translate 和 Meet 应用中。一家公司公布了一个可供外界据此问责的延迟数字。另一家则公布了一个语言数量。如果你要在两者之间做选择,理解它们为何是不同类型的承诺,比哪份清单更长更重要。
两种架构,除了目标一致之外别无共同点
这两个模型的存在,都是为了消灭同一种行为:那种要等你说完一整句话才开口的按轮次翻译器。正是这种停顿,让机器口译感觉像机器口译。
Qwen3.8-LiveTranslate 通过基于 Hybrid MoE 主干的 Interleave 架构实现了这一点,该架构分为一个 Thinker 模块和一个 Talker 模块:前者将音频、视频、源文本和译文折叠进一个因果序列,后者用原说话人的音色重新合成译文。其主张是,将识别、翻译和合成合并为单一序列,消除了三阶段流水线在每个模块边界处所付出的延迟和语义损失。
Gemini 3.5 Live Translate 从另一个方向采取了同样的端到端立场:它基于 Gemini 3 Pro 构建,作为原生音频到音频模型,通过 Gemini Live API 持续流式传输,而不是执行离散的 ASR → MT → TTS 级联。在实践中,你保持一个持久的双向 WebSocket,向上推送 100 毫秒的音频块,向下拉取翻译后的音频块。这两个模型都不再做旧的那一套。现在两者都在做新的事情。差异全都在二阶细节里。
延迟对比并不像看上去那样打成平手。
Google 将 Gemini 3.5 Live Translate 描述为比说话者“落后几秒钟”。它尚未公布该模型的 LAAL 数值,也没有公布任何其他具名、可复现的延迟指标。Qwen 已公布 2.3 秒,并明确了其含义。
这种不对称常被简化为"两者都在大约两三秒左右"。这种解读得不到两家公司任何表态的支持。谷歌的说法既与2秒相符,也与4秒相符;该公司只是拒绝被钉死在某个数字上。如今真正可以做的比较是:
• 已发布的延迟指标——Qwen3.8-LiveTranslate:LAAL 2.3 秒,由供应商报告。Gemini 3.5 Live Translate:未公布。
• 独立延迟测量——两个模型均无。没有任何第三方发布过正面对比测试。
诚实的结论是:在延迟方面,Qwen 提出了一个可证伪的说法,而 Google 提出的说法则很含糊。这在透明度上是 Qwen 的一个加分项,而在性能上,除非有人对两者都进行测量,否则给它加的分恰好为零。如果延迟是你的部署的决定性因素,那么当前的证据状况并不支持朝任何一个方向做出购买决定。

60 种语言对 70 多种语言,是搞错了记分牌
语言统计数字被不断引用,而它们在两个方向上都具有误导性。
Qwen3.8-LiveTranslate 可识别 60 种源语言,并能为其中 29 种生成语音输出。Gemini 3.5 Live Translate 支持 70 多种语言并具备自动检测功能,而在 Google Meet 中,这一能力可扩展至 2000 多种语言组合,此前的上限是基于英语的、覆盖五种语言的翻译。
在把它当成三重胜利之前,请仔细看清第二个数字。Google 的 2,000 多这个数字统计的是有序对——每一种源语言与每一种目标语言两两组合——这确实是一种合理且真正有用的覆盖范围衡量方式,但无法与单语言计数相提并论。而 Google 的清单虽然更广,却严重偏向使用人口众多的语言:南非荷兰语、阿拉伯语、孟加拉语、荷兰语、英语、法语、德语、印地语、印度尼西亚语、意大利语、日语、韩语、马来语、波斯语、波兰语、葡萄牙语、俄语、西班牙语、斯瓦希里语、泰米尔语、泰卢固语、泰语、土耳其语、乌克兰语、乌尔都语、越南语、祖鲁语。Qwen 的 29 种语音输出语言范围还要更窄,而且两家供应商的清单都没有认真解决长尾问题——那些地区方言和低资源语言,恰恰是口译工具历来表现最差的地方。两家公司都表示正在努力。但两家都尚未交付。
两者真正产生分歧的地方:满屋子的人
这些模型真正作出不同承诺的唯一地方是多说话人处理,而这一差异最有可能决定实际部署的成败。
Qwen3.8-LiveTranslate 支持实时说话人日志:每句话一到达就会被归属到相应说话人,语音复刻也被描述为在话轮切换时保持稳定。Qwen 自报其自有的长时多说话人测试集上的说话人日志错误率为 9.7%,而 Seed LiveInterpret 2.0 为 30.6%——这是厂商在自家评测上做的对比,因此应将其视为一个附带数字的说法,而非一项结果。该模型还在同一时间轴上输出源文本和译文,这正是无需单独对齐步骤即可实现同步双语字幕的原因。
Gemini 3.5 Live Translate 则有着相反的侧重点。其有据可查的优势是韵律保留——保持说话者的音高、节奏、语调和情感基调,使翻译后的声音带有原声的感觉。其有据可查的弱点恰恰是说话人分离(diarization)能帮上忙的地方:语音克隆不一致,可能在长时间停顿后发生漂移,或落到错误的性别上;轮次转换能力薄弱,没有清晰的句末信号;难以处理浓重口音以及西班牙语和葡萄牙语等关系密切的语言对;对背景噪音的处理也不完美。Google 还将纯音频会话限制在 15 分钟以内,除非进行延长,并且每个生成的音频流都会被打上目前无法移除的 SynthID 水印。
• 多说话人归属 — Qwen:实时说话人分离,号称 9.7% DER。Gemini:有文档记载的轮流发言能力薄弱,未宣称支持说话人分离。
• 语音保真度 — Qwen:通过 Talker 模块复现源音色。Gemini:保留韵律、音高与节奏;存在已记录的克隆漂移。
• 双语输出——Qwen:源语言和译文在同一时间轴上输出。Gemini:可选的输入与输出转写文本,按会话进行配置。
• 水印 — Qwen:未说明。Gemini:所有生成的音频均带有 SynthID,无移除途径。
• 会话时长 — Qwen:未说明。Gemini:纯音频会话上限为 15 分钟。
• 输入类型 — Qwen:音频和图像。Gemini:仅音频,无文本输入。

实际运行每一个需要多少成本
Qwen3.8-LiveTranslate 通过 WebSocket Realtime API 按每百万 token 计费。在新加坡区域:音频输入 $7.50、图像输入 $0.55、文本输出 $20.00、音频输出 $30.00。在北京:每百万 ¥40 / ¥3.3 / ¥100 / ¥160 —— 约合 $5.65 / $0.47 / $14.13 / $22.61。其上下文长度为 53,248 个 token,两个区域的速率限制均为每分钟 10 次请求和每分钟 100,000 个 token。
10 RPM 的上限是费率表中最关键的数字。Gemini 3.5 Live Translate 的商业条款并未以同样的方式公布,这本身就表明了其成熟度:Google 正通过公共预览版的 Live API 和 AI Studio、面向部分 Workspace 客户的私密预览版 Google Meet,以及 Android 和 iOS 上的 Translate 应用来分发它。预览版定价和预览版速率限制可能随时更改,恕不另行通知,并且 Google 尚未承诺 GA 日期。
所以,目前的成本比较是在一个具有公开定价和硬性并发上限的模型,与一个没有公开定价且上限未明确的模型之间进行的。如果你需要在本季度为单位经济效益建模,那么这两者中只有一个是可纳入预算的。

独立测试必须证明什么
以上所有内容都基于两家厂商各自的公告,因为还没有人把这些模型放在一起较量过。要真正为这场对决定论,需要四个条件,而这些条件目前一个都不存在:
• LAAL 在两个模型上以相同方式、针对同一音频、在相同语言对中进行测量——Qwen 的 2.3 秒这一数字,无法与 Google 拒绝说明的任何数据相比较。
• 在共享的多说话人语料库上的说话人分离错误率,而不是在 Qwen 自有的 Omnilingua-MSpeaker 集上。
• 语音克隆在长时间会话中的稳定性——Gemini 自己的文档正是在这一点上指出漂移,而 Qwen 也正是在这一点上做出最强主张。
• 并发限制下的表现——Qwen 的 10 RPM 在真实会议负载下是否顶得住,以及 Gemini 的预览版配额能否经受住生产环境的考验。
在那项测试出现之前,站得住脚的立场很有限:Qwen 发布的内容更多,承诺也更具体;Google 则拥有更广泛的语言覆盖,以及仅靠 API 的模型无法匹敌的分发规模。
该选哪一个
要着眼于你问题的形态,而不是记分牌,因为记分牌目前还不可信。
如果你的工作负载涉及多方,且归属很重要——会议转录、专家小组、法庭,任何需要知道谁说了哪句译文才算有价值的场景——Qwen3.8-LiveTranslate 是两者中唯一声称具备此能力的产品,而 Gemini 有据可查的轮流发言弱点也指向同一方向。如果你的工作负载语言范围广、面向消费者,并且已经身处 Google 生态系统中,那么 Gemini 3.5 Live Translate 支持 70 多种语言,以及它出现在 Translate 应用和 Meet 中,都是仅提供 API 的竞争对手在分发上无法匹敌的优势。
如果你是在打造一款产品,而不是买一个演示样例,请注意这两者都是窄领域的专精模型。两者都不运行 agent 循环,也都不做摘要,而 Qwen3.8-LiveTranslate 明确不支持函数调用、结构化输出、上下文缓存和微调。这个翻译模型只是你流水线的前端,而不是整条流水线。今天 OrcaRouter 并不是调用这两款翻译模型的地方——它们都不在我们的目录中,我们宁愿如实说明,也不愿暗示并非如此。我们真正提供的,是整套技术栈中负责消费转录文本的那一半:一个密钥即可按提供商标价使用 200 多款模型,零加价转售,因此,读取该转录文本的摘要器、术语表执行器或下游 agent 都可以被替换或故障转移,而无需再签第二份供应商合同。
它的底部
Qwen3.8-LiveTranslate 和 Gemini 3.5 Live Translate 在基本面上已经足够接近,以至于营销成了区分二者的关键:一家公布了延迟数字和价目表,另一家则公布了语言地图和生态系统。两者都还没有接受过独立测试。这场对比中真正值得一读的版本,是有人在同样的音频上把两者都跑一遍之后写出来的那个——而考虑到这个领域发展得有多快,那可能并不遥远。
本文中的对比3
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
