“Gemini 3.5 Transcribe 对比 Whisper Large v3 Turbo”的主标题卡片,副标题为“基线需要更换吗?”;左侧展示一张托管 API 卡片,标注为 Gemini 3.5 Transcribe,非流式 WER 为 2.6%;右侧展示一张开放权重卡片,标注为 Whisper Large v3 Turbo,LibriSpeech clean 为 2.1%,并带有 MIT 徽章和 809M 标签;右下角为 OrcaRouter 标识。
Guides & Insights

Gemini 3.5 Transcribe 对比 Whisper Large v3 Turbo:基线需要更换吗?

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Whisper Large v3 Turbo 是业内大部分人在提到「语音转文本」时默认想到的模型,而 Gemini 3.​5 Transcribe 是 Go​ogle 第一款明确以挑战这一基线而非通用语音 API 为卖点的转录模型。Gemini 3.​5 Transcribe 自 2026 年 8 月 26 日起进入公开预览,它将转录重新定义为一项推理任务——它能自行处理自我修正、格式化输出、识别说话人,并自主调用其他 G​emini 模型。Whisper Large v3 Turbo 是 Ope​nAI 基于 Whisper Large-v3 蒸馏出的 8.09 亿参数模型,采用 MIT 许可证,可自行托管,支持 99 种语言,速度约为其蒸馏源模型的四到八倍(视硬件而定)。前者是音频之上的托管智能层,后者则是一个免费、人尽皆知的组件,你可以把它部署在任何地方。本页要回答的问题比「哪个更好」更具体、也更有用:基线模型在什么情况下会不再够用?

基线,以防你忘了它有多好

Whisper Large v3 Turbo 配得上其默认地位,因此我们先说明支持它的理由:

• 它可以在任何地方运行 — MIT 许可证、开放权重,可安装到笔记本电脑、单个 GPU 或 Serverless 函数。无供应商锁定,无计量,数据不会离开你的网络。

• 它速度很快——蒸馏解码器(32 个编码器层、4 个解码器层,从 32 层缩减而来)在典型硬件上比 Whisper Large-v3 快约四倍,在部分硬件上更快,同时保持了其大部分准确性。OpenAI 自己的数据是在 A100 上约快八倍。

• 它支持99种语言的转录,比Gemini 3.5 Transcribe的85+语言更广泛。

• 其精确度已得到充分记录:LibriSpeech test-clean 的 WER 为 2.1%,test-other 为 4.2%,Common Voice 英语为 9.1%——这些数字多年来已在社区中反复复现。

这个生态非常庞大——{{1}}faster-whisper、whisper.cpp、ONNX 导出,以及你已经在用的每一个推理框架{{/1}}。只要能跑模型,就能跑这个。

A screenshot of the Hugging Face model page for openai/whisper-large-v3-turbo, showing the MIT license tag, the automatic-speech-recognition pipeline tag, the Transformers and Safetensors tags, the 99-languages tag, and the model card for the 809 million parameter distilled version of Whisper Large-v3, captured August 27 2026.

对于英语及近似英语的大规模批量转写,Whisper Large v3 Turbo 是当前的主流选择,这是出于结构性原因,任何基准测试上的差距都难以轻易撼动:它免费,它归你所有,它无处不在。

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe vs Whisper Large v3 Turbo - the scoreboard'. Left column Gemini 3.5 Transcribe: Deployment managed API, Languages 85+, WER 2.6% non-streaming, Speaker ID built in, Formatting intelligent, Price ~$0.005/min. Right column Whisper Large v3 Turbo: Deployment anywhere self-host, Languages 99, WER 2.1% LibriSpeech clean, Speaker ID none, Formatting plain, Price free to run. Footer reads 'Gemini WER per Artificial Analysis, cited by Google; Whisper WER on LibriSpeech - a different set, see text.'

Gemini 3.​5 Transcribe 在此基础上增加了什么

受管挑战者的价值不在于它能在干净的英语上击败基线——那是一场目前连数据都无法明确裁决的较量。它的价值在于文字之上所进行的工作,而这正是Whisper明确不去做的:

• 说话人归属 — 基础模型中支持最多三个说话人,带有词级时间戳。Whisper 转录单一语音流;它没有“谁说了什么”的概念。

• 智能格式化 — 消除不流畅表达,修正自我纠正,应用标点和大小写。Whisper 原样返回所说的话,包括"嗯"之类的语气词。

• 自定义词汇表——偏向行话和非常规拼写。Whisper 没有这种机制;你需要后处理或微调。

• 函数调用——转录可以交接给其他 G​emini 模型,使转录成为 Agent 流水线中的一个步骤,而非最终输出。

• 长会话——一次处理约一小时的音频(据媒体报道为96K上下文),而Whisper实际需要将长文件分块后拼接。

那是另一款产品。这就是谷歌所说的“智能转录”,也是比较中不依赖基准测试计算的部分。

还没有人能给出明确答案的准确性问题

这两个模型的宣传数字实际上并不构成正面交锋。Gemini 3.5 Transcribe 的 2.6% 非流式 WER 是 Google 引用的 Artificial Analysis 测量结果,覆盖 85 种以上语言。Whisper Large v3 Turbo 的 2.1% LibriSpeech test-clean 则是 OpenAI 自家蒸馏论文中的英语基准,已被广泛复现。两者语料不同、语言覆盖不同、厂商也不同。可以如实说的是:在清晰的英语语音上,开放基线模型与托管挑战者模型很可能处于同一水平区间;而托管模型的优势在于其多语言和结构化特性,而非已被证明的英语 WER 领先。Google 的发布材料中没有任何与 Whisper 系列模型的正面较量,独立的对抗性对比也尚不存在,因为 Gemini 3.5 Transcribe 才公开一天。在这样一项对比出现之前,精度桂冠尚无归属;任何基于这两组数字就宣称 WER 胜者的文章——包括本文——都是言过其实。

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

费用:免费运行,对比每分钟0.005美元

Whisper Large v3 Turbo 有硬件成本,但没有按量计费。在你自己已有的 GPU 上运行,每转录一分钟的边际成本接近于零;租用 GPU 的话,成本就是实例在运行期间的租用费。Gemini 3.5 Transcribe 对混合音频的收费约为每分钟 0.005 美元,实时 SKU 约为每分钟 0.009 美元,另有免费额度。转录一千小时音频,用 Gemini 按量计费大约要花 300 美元,而开放基线只需几美元的 GPU 时间。这个差距才是这场对决中真正的成本故事,也是为什么在批量处理英文音频这一高吞吐场景中,基线模型能在很长一段时间内继续充当默认选择。只有当托管模型捆绑的功能——说话人分离、格式化、词汇控制——需要你自己花工程时间在 Whisper 之上拼装时,它在经济性上才追得上。

语言与流媒体

Whisper Large v3 Turbo 支持 99 种语言,而 G​emini 则是 85+ 种;但实际的多语言情况并不相同:Whisper 一次即可转录全部 99 种语言,无需自动检测;其准确率在低资源和嘈杂语言上下降幅度最大——这是蒸馏模型的取舍。G​emini 则在其 85+ 种语言中自动检测,而 Go​ogle 强调地域口音和方言。在流式处理方面,Whisper 没有原生实时模型;实时部署通常使用 faster-whisper 和类似框架,并运行在你自己的硬件上,而 Gemini 3.​5 Transcribe 提供专用实时端点,宣称亚秒级延迟,价格也相应更高。如果你的工作负载是实时且多语言的,托管端点更易于运维;如果是批处理且仅英语,则开源基线更便宜。

判决,姑且如此

Whisper Large v3 Turbo 仍然是大规模英语批量转录的正确默认选择,适用于任何必须在自有基础设施上运行的任务,也适用于希望获得冻结、可审计产物的团队。当转录结果必须超越单纯的文字——例如说话人标签、整洁的格式、领域词汇、多语言覆盖或智能体钩子——并且你愿意为这些功能按量付费时,Gemini 3.​5 Transcribe 才是正确的选择。两者共存,而让这种共存成本低廉的模式是路由边界:先选择匹配音频的转录器,再由 LLM 层决定文本的去向。OrcaRouter 正是在这一层运作:一个 API 覆盖 200 多个模型,跨提供商自动故障转移,并提供用于将多个模型组合成一次调用的路由 DSL。这两种语音模型均不托管在我们这边;转录的选择在于你的 GPU 与 Google 的按量计费之间,而两者都将在很长一段时间内继续存在。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube