
Gemini 3.5 Transcribe 对比 Whisper Large v3 Turbo:基线需要更换吗?
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
Whisper Large v3 Turbo 是业内大部分人在提到「语音转文本」时默认想到的模型,而 Gemini 3.5 Transcribe 是 Google 第一款明确以挑战这一基线而非通用语音 API 为卖点的转录模型。Gemini 3.5 Transcribe 自 2026 年 8 月 26 日起进入公开预览,它将转录重新定义为一项推理任务——它能自行处理自我修正、格式化输出、识别说话人,并自主调用其他 Gemini 模型。Whisper Large v3 Turbo 是 OpenAI 基于 Whisper Large-v3 蒸馏出的 8.09 亿参数模型,采用 MIT 许可证,可自行托管,支持 99 种语言,速度约为其蒸馏源模型的四到八倍(视硬件而定)。前者是音频之上的托管智能层,后者则是一个免费、人尽皆知的组件,你可以把它部署在任何地方。本页要回答的问题比「哪个更好」更具体、也更有用:基线模型在什么情况下会不再够用?
基线,以防你忘了它有多好
Whisper Large v3 Turbo 配得上其默认地位,因此我们先说明支持它的理由:
• 它可以在任何地方运行 — MIT 许可证、开放权重,可安装到笔记本电脑、单个 GPU 或 Serverless 函数。无供应商锁定,无计量,数据不会离开你的网络。
• 它速度很快——蒸馏解码器(32 个编码器层、4 个解码器层,从 32 层缩减而来)在典型硬件上比 Whisper Large-v3 快约四倍,在部分硬件上更快,同时保持了其大部分准确性。OpenAI 自己的数据是在 A100 上约快八倍。
• 它支持99种语言的转录,比Gemini 3.5 Transcribe的85+语言更广泛。
• 其精确度已得到充分记录:LibriSpeech test-clean 的 WER 为 2.1%,test-other 为 4.2%,Common Voice 英语为 9.1%——这些数字多年来已在社区中反复复现。
这个生态非常庞大——{{1}}faster-whisper、whisper.cpp、ONNX 导出,以及你已经在用的每一个推理框架{{/1}}。只要能跑模型,就能跑这个。

对于英语及近似英语的大规模批量转写,Whisper Large v3 Turbo 是当前的主流选择,这是出于结构性原因,任何基准测试上的差距都难以轻易撼动:它免费,它归你所有,它无处不在。

Gemini 3.5 Transcribe 在此基础上增加了什么
受管挑战者的价值不在于它能在干净的英语上击败基线——那是一场目前连数据都无法明确裁决的较量。它的价值在于文字之上所进行的工作,而这正是Whisper明确不去做的:
• 说话人归属 — 基础模型中支持最多三个说话人,带有词级时间戳。Whisper 转录单一语音流;它没有“谁说了什么”的概念。
• 智能格式化 — 消除不流畅表达,修正自我纠正,应用标点和大小写。Whisper 原样返回所说的话,包括"嗯"之类的语气词。
• 自定义词汇表——偏向行话和非常规拼写。Whisper 没有这种机制;你需要后处理或微调。
• 函数调用——转录可以交接给其他 Gemini 模型,使转录成为 Agent 流水线中的一个步骤,而非最终输出。
• 长会话——一次处理约一小时的音频(据媒体报道为96K上下文),而Whisper实际需要将长文件分块后拼接。
那是另一款产品。这就是谷歌所说的“智能转录”,也是比较中不依赖基准测试计算的部分。
还没有人能给出明确答案的准确性问题
这两个模型的宣传数字实际上并不构成正面交锋。Gemini 3.5 Transcribe 的 2.6% 非流式 WER 是 Google 引用的 Artificial Analysis 测量结果,覆盖 85 种以上语言。Whisper Large v3 Turbo 的 2.1% LibriSpeech test-clean 则是 OpenAI 自家蒸馏论文中的英语基准,已被广泛复现。两者语料不同、语言覆盖不同、厂商也不同。可以如实说的是:在清晰的英语语音上,开放基线模型与托管挑战者模型很可能处于同一水平区间;而托管模型的优势在于其多语言和结构化特性,而非已被证明的英语 WER 领先。Google 的发布材料中没有任何与 Whisper 系列模型的正面较量,独立的对抗性对比也尚不存在,因为 Gemini 3.5 Transcribe 才公开一天。在这样一项对比出现之前,精度桂冠尚无归属;任何基于这两组数字就宣称 WER 胜者的文章——包括本文——都是言过其实。

费用:免费运行,对比每分钟0.005美元
Whisper Large v3 Turbo 有硬件成本,但没有按量计费。在你自己已有的 GPU 上运行,每转录一分钟的边际成本接近于零;租用 GPU 的话,成本就是实例在运行期间的租用费。Gemini 3.5 Transcribe 对混合音频的收费约为每分钟 0.005 美元,实时 SKU 约为每分钟 0.009 美元,另有免费额度。转录一千小时音频,用 Gemini 按量计费大约要花 300 美元,而开放基线只需几美元的 GPU 时间。这个差距才是这场对决中真正的成本故事,也是为什么在批量处理英文音频这一高吞吐场景中,基线模型能在很长一段时间内继续充当默认选择。只有当托管模型捆绑的功能——说话人分离、格式化、词汇控制——需要你自己花工程时间在 Whisper 之上拼装时,它在经济性上才追得上。
语言与流媒体
Whisper Large v3 Turbo 支持 99 种语言,而 Gemini 则是 85+ 种;但实际的多语言情况并不相同:Whisper 一次即可转录全部 99 种语言,无需自动检测;其准确率在低资源和嘈杂语言上下降幅度最大——这是蒸馏模型的取舍。Gemini 则在其 85+ 种语言中自动检测,而 Google 强调地域口音和方言。在流式处理方面,Whisper 没有原生实时模型;实时部署通常使用 faster-whisper 和类似框架,并运行在你自己的硬件上,而 Gemini 3.5 Transcribe 提供专用实时端点,宣称亚秒级延迟,价格也相应更高。如果你的工作负载是实时且多语言的,托管端点更易于运维;如果是批处理且仅英语,则开源基线更便宜。
判决,姑且如此
Whisper Large v3 Turbo 仍然是大规模英语批量转录的正确默认选择,适用于任何必须在自有基础设施上运行的任务,也适用于希望获得冻结、可审计产物的团队。当转录结果必须超越单纯的文字——例如说话人标签、整洁的格式、领域词汇、多语言覆盖或智能体钩子——并且你愿意为这些功能按量付费时,Gemini 3.5 Transcribe 才是正确的选择。两者共存,而让这种共存成本低廉的模式是路由边界:先选择匹配音频的转录器,再由 LLM 层决定文本的去向。OrcaRouter 正是在这一层运作:一个 API 覆盖 200 多个模型,跨提供商自动故障转移,并提供用于将多个模型组合成一次调用的路由 DSL。这两种语音模型均不托管在我们这边;转录的选择在于你的 GPU 与 Google 的按量计费之间,而两者都将在很长一段时间内继续存在。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
