
StepAudio 3 ASR 对比 Whisper Large v3 Turbo:1.7% 对 4.6%,却无人做过这项测试
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
你想要的那种对比并不存在。StepAudio 3 ASR和Whisper Large v3 Turbo在非流式语音转文本方面位于同一个 Artificial Analysis AA-WER 指数上——词错误率为 1.7%,相比之下其他数字在 4% 到 5.5% 的区间——而截至 2026 年 9 月下旬,还没有人发布过基于相同音频的正面对比。StepFun 没有,Whisper 的维护者没有,独立实验室也没有。StepFun 自己的文档以 Doubao ASR 2.0、Seed 2.0 Lite 和 HY3.0 ASR Preview 为基准进行对比,而这些都是中文 ASR 产品。Whisper 这一侧则完全没有厂商发布对比,因为 Whisper Large v3 Turbo 多年来一直可供下载,其数字取决于由谁提供服务。
所以这一页做的是实话实说的版本:它读取唯一同时衡量两者的榜单,把可比较的部分与不可比较的部分分开,并直白指出证据在哪里断档。简短的回答是:准确率上的差距真实存在,大约有三个百分点宽;而在其他所有方面——价格、许可、可部署性——差距则朝相反方向,而且更大。
每一个到底是什么
StepAudio 3 ASR 是 StepFun 于 2026 年 9 月 15 日发布的托管式转录模型,属于包含五款模型的 StepAudio 3 音频系列。它通过单个流式端点访问,该端点在解码过程中返回增量文本,并在结束时返回最终转录文本。StepFun 将其描述为附带语言模型以提供上下文的转录,并针对医疗、法律、金融、汽车和编程音频,以及会难倒传统识别器的输入进行了调优——包括耳语、快速语音、连读语音、歌声,以及底下有音乐的音频。它没有开放权重,没有本地部署途径,任何层级都没有自托管选项。公布的标价费率为每小时 2.8 元,按排行榜自身的价格轴计算,约合每 1,000 分钟 6.67 美元。
Whisper Large v3 Turbo是由 OpenAI 以 MIT 许可证发布的一款开放权重模型:8.09 亿参数,支持 99 种语言,是 Whisper large-v3 经过剪枝和微调、并减少了解码器层数的衍生模型。它已被下载数百万次,由众多平台提供商业服务,并且可在你自己的硬件上运行。最后这一点正是整个比较的核心,也是为什么准确率差距并非唯一重要的数字。
一块板,两者皆可测
Artificial Analysis 的 AA-WER 指数报告转写错误的单词所占百分比,越低越好,其第 2 版融合了三个数据集:AA-AgentTalk 占 50%、VoxPopuli-Cleaned-AA 占 25%、Earnings22-Cleaned-AA 占 25%。非流式视图显示其追踪的 71 个模型中的 36 个。两个模型都出现在其中,这比大多数对比所能声称的还要多。
按董事会列出的顺序阅读:
• StepAudio 3 ASR — 1.7% AA-WER,每 1,000 分钟音频约 6.67 美元
• Whisper Large v3 Turbo,单个托管端点 — 4.6% AA-WER,每 1,000 分钟约 0.67 美元
• Whisper Large v3 Turbo,第二个托管端点——5.5% AA-WER,每 1,000 分钟约 $15.00
• Whisper Large v3,另一代开放权重模型——在一个端点上为 4.1%,在另一个端点上为 10.1%
• StepAudio 2.5 ASR,StepFun 的上一代产品 — 4.7%
榜单上最后两行最具启发性,而且它们根本不是在讲 StepFun。同一组开源 Whisper 权重在一个端点上得分 4.1%,在另一个端点上得分 10.1%。在完全相同参数下,这就是 6 个百分点的差距,完全由服务方式差异造成:分块策略、硬件、解码配置,以及每个托管方如何处理超过其内部限制的音频。该榜单自己的脚注也说明了这一点,指出在其某个数据集上,由于时间限制,一些模型的音频被切分成约九分钟,而另一些则被切分成约三十秒。
这意味着,“StepAudio 3 ASR vs Whisper Large v3 Turbo”这个对比实际上是两个对比叠在一起。一个是模型与权重之间的对比,另一个是模型与你恰好用来做基准测试的那个端点之间的对比。第二个的差异比第一个更大。

准确率差距从何而来,以及该在多大程度上信任它
三个百分点的词错误率差距,在一个前五名系统彼此仅相差0.6个百分点的领域里,是很大的差距。它也是这项比较中唯一由第三方测得的数字,并且附带着实实在在的、可能向两个方向起作用的保留条件。
对 StepAudio 3 ASR 不利的一面:这个数字是一个混合指数,其中 50% 来自 AA-AgentTalk——一个智能体对话数据集。一个针对特定领域转写进行调优、并接入 LLM 来提供上下文的模型,非常适合这种形态的音频。如果把该指数的权重重新调整为偏向朗读语音或广播新闻,排名可能会更接近。此外,该 ASR 模型仍然没有已发布的技术报告,没有公开的测试集,没有解码配置,也没有来自 StepFun 之外任何人提供的可复现协议。
与 Whisper Large v3 Turbo 相比:4.6% 是某个托管端点的数字,而不是模型本身的属性。权重是固定且公开的;分数则不是。一个团队如果谨慎地运行相同的权重,采用适合领域的切块和良好的解码器配置,就能取得明显优于榜单那一行的成绩——而一个团队如果粗心大意地运行它们,则可能比另一代开放权重模型所公布的 10.1% 更差。诚实的总结是,这个比较中开放权重这一侧有一个可衡量的下限,以及一个必须靠自己争取的上限。
缺少的是那个能一锤定音的数字:两个系统、同一套音频集、同一套解码协议,并且公开发表。没有人运行过它,而在有人做到之前,“1.7% 对 4.6%”只是对不同条件下取得的两个测量值进行比较,而不是把两个系统相互对照的测量。
其他四个维度中,Whisper 的优势更大
准确率是 StepFun 胜出的维度。在列表其余部分,开放权重模型差距明显,而正是这些决定了部署是否可行:
• 许可与权重——MIT 许可的开放权重,参数量为 8.09 亿,对比未在任何层级公开权重的托管 API。
• 部署 — 自托管、本地部署、气隙环境,或通过数十个商业平台中的任意一个 vs 仅使用{{KEEP}}StepFun{{/KEEP}}的API。
• 成本下限——在一个托管端点上,每 1,000 分钟约 $0.67,若自行运行则更低,而供应商公布的费率为每 1,000 分钟约 $6.67。
• 数据驻留——音频永远不会离开您控制的基础设施,而音频则会被发送至第三方端点。
• 集成风险——模型不会被从你手中撤回、重新定价或弃用,因为你持有模型权重,而非依赖可能随价目表变化的托管费率。
• 长音频行为——分块方式由你决定,既可以按文件调整,也可以交由供应商端点在内部处理,而后者并无文档说明。
这一价格差距大约是较便宜的 Whisper 端点的十倍,而这与阶跃星辰自身产品线内发生的情况正好相反:它所取代的模型 StepAudio 2.5 ASR 标价为每小时 0.15 元,而当前档位标价为 2.8 元。阶跃星辰将转录价格提高了约十九倍,以换取准确率,这使其进入了一个不同于自托管开放权重模型的市场,而不是后者的更昂贵版本。

你应该选哪一个
这种分歧比大多数正面交锋都更清晰:
• 如果音频内容普通、音频量大、数据不能离开你的基础设施,或者你需要部署长期存在且价格稳定,就选择 Whisper Large v3 Turbo。MIT 许可证意味着,是否推翻这个决定由你决定,没有人能把它夺走。
• 如果音频确实难处理——带口音、低语、歌唱,或底下有音乐——或者如果领域是 StepFun 专门调优的五个领域之一,就采用 StepAudio 3 ASR。这正是付费版本所换来的价值,而在这种音频上,三个百分点的准确率差距就是可用转写与手动校正一遍之间的区别。
• 如果你不清楚自己的音频属于哪一种,就不要只选其中一种。选错的代价是不对称的:开放权重路径可以在你自己的硬件上测试,代价不过是一小时的 GPU 时间;而托管路径试用不花钱,却会让你受制于你无法控制的费率。
在这种情况下,采用混合方案的理由比大多数对比中都更充分,原因在于板上的端点分布。由于相同的 {{1}}Whisper{{/1}} 权重会根据托管者的不同而在 4.1% 到 10.1% 之间波动,务实的做法是将 {{2}}开放权重{{/2}}路径路由到多个主机上,而不是只固定使用一个主机——这正是自动故障转移所提供的,而它也是同一种机制,让你能够把托管模型放在生产路径前面,而不必把整条路径押在它上面。
这如何融入技术栈,以及我们提供什么、不提供什么
无论你为转录选择什么,转录文本总得去往某个地方。摘要生成器、结构化抽取、合规检查、搜索索引——这些调用最终都会落在普通文本模型上,而它们正是账单中随用量而非随音频分钟数增长的那部分。StepFun 自家的实时模型宣称支持工具调用和长任务异步执行,这意味着即便是音频层也在不断把工作交给并非音频模型的东西。
关于覆盖范围需要明确说明,因为很容易让人产生相反的暗示:StepAudio 3 ASR 和 Whisper Large v3 Turbo 都不在 OrcaRouter 上。StepAudio 要通过 StepFun 自家的 API 访问,而 Whisper 的权重归你所有,你可以自行运行,也可以带到托管平台上。OrcaRouter 提供的是转录内容所汇入的委派层——近 200 个文本模型汇聚在同一个 API 之后,并具备自动故障转移,因此下游调用不会因为单一提供商而中断;还有路由 DSL,可将多个模型组合成一次调用;当单个模型的判断力不够时,还能进行模型融合。只要提供商公布了价格,该标价就会原样传递,不加任何加价,因此价格一有变动,公布当天就会反映到你的账单上——考虑到本次对比中有一家供应商在单次发布中把其转录价格上调了十九倍,这并非假设中的好处。
如果你即将为准确率问题投入真金白银,省钱的顺序是这样的:先在自己的音频上运行开放权重模型,因为你做得到,而且你得到的数字会比任何榜单的都更相关。然后再决定剩下的差距是否值得付出十倍的费用。大多数团队会发现,对于他们的一部分流量来说值得,对其余流量则不值得,而这是一个路由问题,而不是模型选择。
怎样才能了结
一项已发表的测试。两个系统、相同的音频、相同的解码协议,并在朗读语音、对话音频以及 StepFun 声称已针对性调优的困难案例之间做出诚实的划分。在这样的测试出现之前,这一比较一边是第三方指数,另一边是一组分数可变的开放权重,而唯一负责任的解读方式,是把它当作起点,而非答案。

