Gemini 3.5 Transcribe Live 对比 Gemini 3.5 Transcribe — 您的应用应调用哪个端点 重新生成的插图
Guides & Insights

Gemini 3.5 Transcribe Live 与 Gemini 3.5 Transcribe 对比:您的应用应调用哪个端点

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026年8月26日,Go​ogle发布Ge​mini 3.5 Transcribe系列时,推出了两个共享名称与使命但为对话不同阶段构建的模型:通过Live API提供的流式端点Ge​mini 3.5 Transcribe Live,以及通过Interactions API提供的预录制端点Ge​mini 3.5 Transcribe。大多数团队在第一周犯的错误,就是把它当作同一个模型的两个按钮。这是两个SKU——不同的API、不同的价格、不同的硬性限制——它们之间的准确性对比并不公平,因为衡量规则本身不同。本文将两者并列对比,让你的决策取决于工作负载,而非排行榜。

两者一览

• API — Ge​mini 3.5 Transcribe Live 基于 Live API(WebSocket,双向流式传输)运行,而 Ge​mini 3.5 Transcribe 基于 Interactions API(文件输入,转录文本输出)运行。

• 任务 — 实时对话、字幕生成、语音代理与会议、通话记录、存档音频。

• 准确度 — 流式 WER 为 4.0%,非流式 WER 为 2.6%,数据来自 Artificial Analysis,由 Go​ogle 引用;测量机制不同,不可直接比较。

• 延迟 — 语音结束后 0.40 秒即可获得最终转录文本,相对于完整文件的批处理。

• 会话 — 每次实时会话上限为10分钟,而文件最长可达60分钟(启用说话人分离和时间戳时为30分钟)。

• 说话人 — 流式端无;预录制端最多支持三个说话人,并带有词级时间戳。

• 价格 — 综合费率约为每分钟0.009美元,对比综合费率约为每分钟0.005美元。

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe - the scoreboard'. Left column Gemini 3.5 Transcribe Live: API Live API streaming, WER 4.0% streaming, Final latency 0.40s after speech, Session 10-minute cap, Speaker ID not supported, Timestamps none. Right column Gemini 3.5 Transcribe: API Interactions API files, WER 2.6% non-streaming, Final latency batch async, Session 60-minute files (30 with diarization), Speaker ID up to 3 speakers, Timestamps word-level. Footer reads 'WER per Artificial Analysis, cited by Google; limits per Google launch materials.'

架构决策:Interactions API 或 Live API

这两款模型都属于GoogleGemini Audio系列,目前均处于公开预览阶段。两者的差异始于传输方式。gemini-3-5-transcribe-live会打开一个WebSocket并保持连接:原始音频持续流入——常见的帧格式为16 kHz或24 kHz的16位PCM数据块——模型会在您说话时返回部分转写结果,并在语音结束后为每段话语返回最终转写。gemini-3-5-transcribe则接收完整文件,处理后返回包含说话人归属和词级时间戳的最终转写结果。

传输决策决定其他一切。如果你的产品在说话的同时渲染文字——实时字幕、在句子中间读取意图的语音代理、在通话进行中采取行动的通话助手——你就处于实时路径。如果你的产品生成记录——会议纪要、通话日志、存档——你就处于交互路径。令人困惑的是,两者都会生成文本;区别在于文本是实时状态还是最终产物。

准确性:流式处理的代价确实存在

Artificial Analysis,这家独立基准测试机构,其数据被 Go​ogle 在其发布帖子中引用,测得流式端点的平均词错误率为 4.0%,非流式端点为 2.6%。在 FLEURS 多语言基准测试中,Go​ogle 报告流式错误率为 5.50%,非流式为 5.04%。2.6% 的数字使 Ge​mini 3.5 Transcribe 在发布时位居 AA 的 WER 排行榜第 5 位,仅次于 ElevenLabs Scribe v2(2.2%)和 Microsoft 的 MAI-Transcribe-1.5(2.4%)——这些是 AA 的测量结果,而非 Go​ogle 的说法。

流式识别的数字并不是同一测试的更差版本。这是一种不同的模式:模型在听到句子结尾之前就已对词语做出承诺,并为此付出代价。不要仅凭准确率在两者之间做选择,因为在任何给定的工作负载下,差距都可能反转。要根据约束条件来选择:流式端点有10分钟的会话时长上限,不支持说话人分离,也没有时间戳;预录端点则可处理长达一小时的音频文件,支持识别多达三位说话人,并返回词级时间戳。如果你的应用需要说话人标签,流式模型根本无法胜任这项工作,无论其WER如何。

A screenshot of the Artificial Analysis speech-to-text leaderboard page showing the WER Index (Non-streaming) view with model rows including an entry for Gemini 3.5 Transcribe alongside ElevenLabs and Deepgram, plus AA-WER Index dataset filters, captured August 27 2026.

它们的共同点

两个端点共享“intelligent transcription”引擎,在共享功能上,它们之间的选择是中性的:

• 支持自动检测的 85+ 种语言,包括直播路径中的中途语言切换。

• 不流利清理 — 删除填充词,解决自我纠正("Tuesday — no, Wednesday" 最终输出为更正后的Wednesday)。

• 自动格式化 — 将标点、大小写和段落结构应用于输出。

• 自定义词汇表 — 最多 1,000 个术语,用于行话和产品名称,Google 的文档建议约 100 个以获得最佳效果。

对两者都适用的一点提醒:所谓“智能”清理功能虽然让输出变得易读,但这是一种以牺牲逐字保真度为代价的设计决策。别扭的措辞会被打磨流畅;最终文本是模型对意图的解读,而非法庭记录式的逐字稿。若需要精确的转录,在提供逐字选项的地方应选用该选项;并且无论选择哪种方式,都应当用自己的音频来验证实际效果。

每分钟费用:直播溢价

Google 以 token 为单位对音频计价,音频 token 为每秒 25 个,输出约为每分钟转录文本 175 个文本 token。按标价计算,gemini-3-5-transcribe 每分钟音频的混合成本约为 0.005 美元,gemini-3-5-transcribe-live 约为 0.009 美元——输入分别为每百万 token 2 美元和 3.50 美元,输出分别为每百万 token 12 美元和 21 美元。两者目前都有免费额度。

高级版购买的是实时路径,而非更高的准确性:你为流式端点每分钟大约多支付80%,而它的转录词错误率(WER)更高。这就是诚实的定位。预录制模型既更便宜又更准确;流式模型之所以存在,是因为有些产品无法等待文件处理完毕。

您应该基于哪个端点进行构建?

• 实时字幕和副标题 — Ge​mini 3.5 Transcribe Live,如果您需要时间对齐的输出,请查看无时间戳限制。

• 语音代理 — {{2}}Ge​mini 3.5 Transcribe Live{{/2}} 用于在句子中途识别意图;长时间会话需围绕 10 分钟上限进行规划。

• 会议、访谈、存档——Ge​mini 3.5 Transcribe,提供2.6%的词错误率(WER)、说话人识别和词级时间戳。

• 通话后分析 — 对于已完成的记录使用 Ge​mini 3.5 Transcribe;仅当分析必须在通话期间运行时才使用 Ge​mini 3.5 Transcribe Live。

• 长时间连续音频 — Ge​mini 3.5 Transcribe,因为一个 60 分钟的文件胜过手动拼接十个 10 分钟的实时会话。

A generated decision card titled 'Which endpoint - by workload' with a left column headed 'Pick Transcribe Live if' listing live captions, voice agents reading intent mid-sentence, and in-call analytics, and a right column headed 'Pick Transcribe if' listing meetings and interviews, call logs needing speaker labels, word-level timestamps for alignment, and long continuous audio, a footer reading 'Both are Google APIs in public preview since Aug 26 2026', and the OrcaRouter logo in the bottom-right corner.

字幕上方的图层

这两种模型都不是 OrcaRouter 托管的——我们目前不提供语音转文本路由,无论选择哪个端点,你都将直接调用 Google 的 API。路由层在语音管道中的位置是位于转录文本之上:摘要器、实体提取器、以及将流转为决策的行动项模型。OrcaRouter 的价值正体现在这一层——通过一个 API 访问 200 多个模型,按供应商列表价收费,无加价,跨供应商自动故障转移,以及一个可将多个模型组合成一次调用的路由 DSL。按工作负载选择转录端点,然后在同一个密钥后面运行读取转录文本的模型。

底线

Ge​mini 3.5 Transcribe Live 和 Ge​mini 3.5 Transcribe 属于同一系列,但却是不同的产品。当转录文本必须在对话结束前生成,并且你能接受 10 分钟的会话、没有说话人标签、也没有时间戳时,请选择 Live。当输出需要作为记录存档,且准确性和归属判定比速度更重要时,请选择 Transcribe——它更便宜、更准确,而且限制少得多。唯一错误的做法是认为一个接口能同时实现两种功能。