
{{1}}使用 Gemini 3.5 Transcribe 进行智能转写{{/1}}
- 智谱新Z.ai: GLM 5.3 Flash2026-08-26$0.07 / $0.25 每百万 tokens
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
Gemini 3.{{1}}5{{/1}} Transcribe 于 2026 年 8 月 26 日进入公开预览。它是第一个真正以 G{{3}}emini{{/3}} 模型形式出售的 G{{2}}o{{/2}}ogle 语音转文本模型:你可以通过 G{{4}}emini{{/4}} API 使用模型 ID 调用它,音频以 token 计价,Go{{5}}ogle{{/5}} 在定价页面上列出了每分钟音频的费用。最后这一点正是消费者报道所忽略的。发布当天的报道聚焦于 Gboard 中的填充词移除和语音编辑,但对开发者来说,真正的变化在于转录功能现在与 G{{6}}emini{{/6}} 系列的其他产品处于同一个 API 层面,说话人标注和词级时间戳包含在基础模型中,而不是作为单独的附加组件。这篇文章读起来像一份 API 参考文档,因为这是第一波报道留下的空白。
先说两个注意事项,以免下面的数字产生误导。Google 并未称 Gemini 3.5 Transcribe 是“我们拥有的最准确的语音转文字模型”——其说法是用于智能语音交互的最精确模型,这是两种不同的说法,而当你阅读 WER 数据时,这种差异至关重要。此外,这里描述的一切均属公开预览:两个模型 ID、价格和基准数字都是 Google 今天发布的内容,所有这些在正式发布(GA)前都可能发生变化。
这两个API路径——以及需要记住的模型ID
Gemini 3.5 Transcribe 提供两个端点,而选择正确的端点是团队要做的第一个架构决策:
• gemini-3-5-transcribe — 通过 Interactions API 的预录制路径。发送文件,即可获得带说话人归属(最多三位说话人;三位以上为实验性功能)和词级时间戳的转录文本。这是批处理和异步处理的主力工具。
• gemini-3-5-transcribe-live — 通过 Live API 的实时路径。双向流式传输,亚秒级延迟,面向实时对话、字幕生成和语音驱动界面。
这种区分反映了Gemini Audio系列其他产品的排列方式,这一点很重要,因为“live”是一个独立SKU,有自己的价格。早期对此次发布的几种解读都假设一个型号兼具两种功能;事实并非如此。

“智能转写”到底意味着什么
Google 的发布文章将此表述为超越语音准确性、走向理解。由这一表述框架衍生出的功能才是需要评估的,而非框架本身:
• 不流利处理——“嗯”“啊”之类的语气词会被去除,自我修正也会被解决。“我们周二见面——不,周三”会被转录为修正后的日期,而不是错误开头的记录。这是模型做出的决定,这正是谷歌称之为“智能”的含义所在。
• 自动格式化 — 输出返回为格式规范的文本:应用标点、大小写和段落结构,而非原始的标记流。
• 多说话人识别 — 在预录音频中可识别最多三位说话人,并带有词级时间戳;三位以上说话人属于实验性功能。此功能位于基础模型中,而非独立的说话人分离服务。
• 自定义词汇 — 通过提供词汇表,您可以让识别偏向行话、产品名称和特殊拼写,这是针对垂直领域的机制。
• 85+ 种语言 — 自动检测,并明确标注地区口音和方言。
• 函数调用 —— 模型可以将图像生成或文件分析等工作委托给其他 Gemini 模型,这会将转录转变为更大智能体(agent)的一个组件,而非末端步骤。
• 实体捕获 — Google 声称在嘈杂的真实世界音频以及邮政编码和订单 ID 等字母数字实体上表现强劲。
媒体报道还称其拥有 96,000 token 的上下文窗口(约相当于一小时的会议音频,无需切分)以及情绪检测功能。这两点与发布时的定位框架相符,但 Google 发布的模型卡并未将其列为核心卖点,因此在 GA 规格说明书出现之前,应将其视为"据报道"而非"已确认"。

标记的准确度数字
Google引用的WER数据来自Artificial Analysis:流式转录的平均词错误率为4.0%,非流式转录为2.6%。在FLEURS多语言基准测试中,Google报告流式转录的WER为5.50%,非流式转录为5.04%。Google还声称,与上一代Chirp 3相比,最终转录时间缩短了70%。
诚实的解读是:就 Artificial Analysis 并非 {{1}}Google{{/1}} 而言,这些测量算是独立的;但它们是 Google 挑选的测量结果,发布在 {{2}}Google{{/2}} 自己的公告中,而且该模型才刚开放调用一天。{{3}}Google{{/3}} 之外还没有人用大多数团队对比时所参照的那些开放权重模型,对它做过对抗性的正面测试;发布材料中也完全没有与 Whisper 家族或 NVIDIA Parakeet 系列的直接对比。所谓比 Chirp-3 快 70% 不过是厂商自述,仅此而已。请把 2.6% 和 4.0% 当作有力的早期信号,而不是定论。
费用是多少
Google 的定价页面以 token 数和预计音频分钟数对每个模型进行报价。对于 gemini-3-5-transcribe,按标价计算的混合估算约为每分钟音频 $0.005 —— 输入约 $0.003/分钟,输出约 $0.002/分钟。对于 gemini-3-5-transcribe-live,混合估算约为每分钟 $0.009。两者目前都有免费层级。
这些按分钟计算的数字是基于假定的令牌速率(每秒输入 25 个音频令牌,每分钟输出 175 个文本令牌)估算得出的,因此如果 Google 更改令牌核算方式,这些数字也会随之变化。真正可靠的是这个原则:标价就是价格。这正是 OrcaRouter 这类透传路由器所遵循的原则——0% 加价,提供商标价原样透传——因此,如果 Google 在预览版到正式版(GA)的窗口期内下调转录定价,降价当天就会在我们这边生效,而不是等经销商更新费率卡之后才生效。
它正在推广的地方
对于开发者而言,今日的公开预览意味着两个层面:Google AI Studio 中的 Gemini API,以及面向企业工作负载的 Gemini Enterprise Agent Platform。在消费端,Gemini 3.5 Transcribe 已经为 Android 上 Gboard 的 Rambler 听写功能以及 macOS 上的 Gemini 应用提供支持。接下来是 Chrome——在任何网页字段中实现语音转文字——随后是 Search Live、Gemini Live、Docs、Keep 和 Gmail。对于正在评估它的团队来说,实际答案更简单:在 Gemini API 可用的地区,它今天即可通过代码以英文调用。

这对你的流水线意味着什么
真正的新事物不是WER数字,而是Google现在在基础模型中提供转录服务,并附带了两个此前团队需要自行组装的特性——说话人标签和词级时间戳——而且是在支持函数调用的Gemini API界面上。如果你之前是用普通转录器、单独的说话人分离器和格式化流程来搭建带说话人标签的会议记录管线,这是第一个将这些步骤合并起来的Google模型。悬而未决的问题是,2.6%的非流式WER在你自己的音频上表现如何;在独立复现结果出现之前,生产团队负责任的做法是通过API运行真实样本,而不是按Google选定的基准来预算。至于在转录文本之上运行的LLM工作——摘要、结构化提取、行动项——这一层才是路由发挥价值的地方,也正是OrcaRouter覆盖的层:一个API接入200多个模型,跨供应商自动故障转移,以及一个将多个模型组合成单次调用的路由DSL。转录步骤本身,你应该先用自己的音频测试,再相信任何人的头条数字。
