一张生成的 hero 标题卡,标题为“StepAudio 3 ASR 对比 StepAudio 3”,副标题为“一个是模型。另一个是五个产品共用一个名字”,下方页脚为“StepFun 于 2026 年 9 月公布的数据”。
Guides & Insights

StepAudio 3 ASR 对比 StepAudio 3:没有叫这个名字的模型

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

搜索StepAudio 3,你会发现这是一个系列,而不是一个模型。StepFun 于 2026 年 9 月 15 日发布的音频产品把五款产品归入这个名称之下——Realtime、ASR、text-to-speech、Gen 和 Music——而其中的转写产品,StepAudio 3 ASR,正是此后一直在排行榜上攀升的那一个。StepFun 自家文档称其为迄今为止最大的 ASR 模型的那个层级是 StepAudio 3 ASR Max,而与它共享主干架构的对话型兄弟产品是 StepAudio 3 Realtime。如果你试图将“StepAudio 3 ASR”与“StepAudio 3”进行比较,你是在拿一款产品与一个产品线作比较,而答案完全取决于你实际指的是三者中的哪一个。

本页正是为了解决这个问题。它不是营销式的对比,而是在你能够正确读懂任何一份 StepAudio 3 规格表之前,为你消除歧义所必需的内容,因为上面这三个名称对应着不同的价格、不同的端点和不同的故障模式。

为什么这个名字有歧义

StepFun 在一天内推出了整套音频栈,而命名规范让系列名成了每个产品名的词干。这在发布幻灯片上很整齐,放到其他任何地方都很别扭。这意味着搜索系列名会返回五种不同产品的混合结果,而一行标着“StepAudio 3”的基准测试结果,可能对应其中任何一款。

实际后果是,你无法仅凭标题判断所衡量的是什么。一条写着“StepAudio 3 在转录排行榜上登顶”的帖子,描述的是 StepAudio 3 ASR。一条写着“StepAudio 3 在会话动态性上胜出”的帖子,描述的是 StepAudio 3 Realtime。两者都属实,但它们是不同的产品,不能互换。

在 ASR 产品线内部,还存在第二处歧义。StepFun 的文档将 ASR Max 层级称为其迄今为止最大的 ASR 模型,拥有独立的定价和独立的端点,而公开排行榜中的行则使用更为朴素的标签。厘清这两者究竟是同一 SKU 的两个名称,还是两个不同的 SKU,是本页所能做的最有价值的事,下一节将完成这一工作。

这个名字可能意味着的三层含义

StepAudio 3 ASR——转写产品。一个流式端点,在解码时返回增量文本,并在结束时返回最终转录文本。StepFun 将其描述为附带语言模型以提供上下文的转写,并针对医疗、法律、金融、汽车和编程音频进行了调优,也针对耳语、快速语音、连读语音、歌唱和背景音乐等困难输入进行了调优。在 Artificial Analysis 的非流式语音转文本 AA-WER 指数上,该模型的词错误率为 1.7%。

StepAudio 3 ASR Max——StepFun 的文档称其为迄今为止规模最大的 ASR 模型。其公布的标准费率为每小时 2.8 元。它不是更便宜的转写工具,而是 ASR 产品线中的顶级产品。

StepAudio 3 Realtime — 全双工对话模型。它直接对语音进行推理,而非走“先转写、再推理”的链路,转写只是这一过程的副产品。它并非 ASR 产品,其在转写任务上的准确率也并非其调优目标。

这个系列中的其他一切——TTS、Gen、Music——完全是另一码事,根本不应出现在转录对比中。

ASR 和 ASR Max 是同一个模型吗?

证据表明答案是肯定的,而验证方法就是算术。StepFun 将 ASR Max 档位列为每小时 2.8 元。按约 7.1 元兑 1 美元换算,约为每小时 0.39 美元,也就是每 1000 分钟约 6.6 美元。Artificial Analysis 在其排行榜上将该模型列为每 1000 分钟 6.67 美元。两个独立发布的数字,一个来自厂商价目表,一个来自第三方榜单,彼此相差不到一美分。如果排行榜中的那一行和 ASR Max 的标价描述的是同一个 SKU,这正是你会预期看到的结果。

有必要精确说明这能证明什么、不能证明什么。它证明了排行榜的价格轴和厂商的价目表描述的是同一款产品、同一价格。它不能证明排行榜上的 1.7% 是在你会调用的那个确切端点上测得的,因为该榜单没有公布其解码配置,也没有公布它实际访问的端点。因此:同一款产品,可能性很大;相同的测量条件,尚未验证。

可以确定的是,这条产品线内部的代际跃升。StepAudio 2.5 ASR 在同一榜单上为 4.7%,每小时 0.15 元。当前档位是 1.7%,每小时 2.8 元。也就是说,以大约十九倍的价格换来词错误率降低 64%——这是该系列中最尖锐的权衡,也是决定这次升级是否划算的那一个。

A generated two-column scoreboard titled 'StepAudio 3 ASR vs StepAudio 2.5 ASR — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', List price '2.8 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'tuned for whisper and singing', Vendor gains 'Chinese down 9.3%'. Right column StepAudio 2.5 ASR reads AA-WER '4.7%', List price '0.15 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'not tuned for it', Vendor gains 'previous baseline'. Footer reads 'Accuracy figures per Artificial Analysis; the rest vendor-reported.'

真正不同的维度

一旦命名敲定,比较就会缩减为一份简短清单。这些才是能改变决策的选项:

• 准确率 — StepAudio 3 ASR 在非流式模式下 AA-WER 为 1.7%,而 StepAudio 2.5 ASR 在同一测试集上为 4.7%。该数据由 Artificial Analysis 测量,而非 StepFun。

• 价格——每小时 2.8 元对比每小时 0.15 元。两者均为供应商标价,且均为现行价格。约为 19 倍。

• 权重 — 两者均仅提供托管 API。整个系列中没有任何开放权重,没有本地部署路径,任何层级都没有自托管选项。

• 端点形态——与上一代相同的形态相比,是一个返回增量文本和最终文本的单一流式转录端点。集成模型没有任何改变,因此迁移只是更换模型标识符,而非重写。

• 困难音频调优——StepAudio 3 ASR 专门针对耳语、快速、连读和歌唱语音,以及带有背景音乐的音频进行了调优。这种调优本身就是产品;上一代并非为此而打造。

• 厂商声称的领域收益——StepFun 报告称,逐代比较,中文下降 9.3%,英文下降 25.0%,方言下降 22.3%,垂直领域下降 42.1%,语码转换下降 27.9%。由于是厂商报告且未经复现,因此应将其视为方向性参考。

值得注意的是,该列表中并未包含:上下文长度、音频格式支持、最大音频时长以及模型标识符。StepFun 关于该模型的公开文档并未说明这些内容,任何引用这些数字的人所引用的都是别的东西。

ASR vs Realtime 才是人们真正需要的对比

如果你是在不同的转写产品之间做选择,而不是在不同代际之间做选择,那么真正有意思的对决并不是 ASR 与 ASR Max,而是 ASR 与 Realtime。StepFun 自家的技术资料称,两者共享预训练和中期训练阶段,仅在监督微调阶段才出现分化。相同的基础,不同的微调,不同的产品。

这一事实有一种务实的解读。1.7% 的词错误率是 ASR 微调模型的属性,而不是对实时模型的承诺——后者优化的是轮次交替、打断处理和基于语音的推理,而非转写准确率。如果你的架构只是在实时对话过程中顺带进行转写,那么你买到的并不是那 1.7%,而是一个恰好能输出文本的对话模型。

反向也同样成立,而且不那么明显:因为它们共享同一个骨干网络,所以 ASR 模型并不是被硬加到这个家族上的小型专用模型。它是同一规模的系统,只是微调方式不同。这就是为什么 ASR 的价格接近该家族的其他成员,而不是接近市场上的低价端。

如果你要选一个,这个该怎么办?

三个问题就能定论。你需要的是转写稿,还是对话?如果是转写稿,那么 StepAudio 3 ASR 就是产品,系列名只是干扰。如果是对话,你要的是 StepAudio 3 Realtime,而且你根本不该看 ASR 基准测试。而如果你需要的是真正困难音频的转写稿——带口音、低语、歌唱,或者底下有音乐——那么 19 倍溢价就是为它调优的那一档的价格,而诚实的测试是你自己的音频,而不是混合指数。

最容易做错的决定,就是把转录层当作永久性的。无论你选择什么,转录文本都是其他环节的输入——摘要器、结构化提取、合规检查、搜索索引——而这些调用最终落在的是普通的文本模型上。这一层随使用量而非音频分钟数扩展,也正是从一开始就值得保持可移植的一层。OrcaRouter 将近 200 个文本模型置于同一个 API 之后,具备跨提供商的自动故障转移、可将多个模型组合为单次调用的路由 DSL,以及在单个模型的判断力不足时进行模型融合的能力。凡是提供商公布了费率的,该标价都会不加价地原样透传,因此文本侧的价格变动在公布当天就会反映到你的账单上。

明确一下范围,因为本页介绍的是我们并不提供支持的一个模型系列:OrcaRouter 上没有 StepAudio 3 端点。转录和语音模型通过 StepFun 自有 API 访问。OrcaRouter 承载的是转录下游的推理层,而这正是做出切换决策成本低、拖延代价高的环节。

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR in first place at 1.7% and StepAudio 2.5 ASR at 4.7% further down the ranking, with the AA-WER v2 three-dataset methodology line naming AA-AgentTalk, VoxPopuli-Cleaned-AA and Earnings22-Cleaned-AA.

无人解决之事

命名问题是可以弄清楚的,性能宣称则还不能。这个 ASR 模型至今仍没有公开发表的技术报告,没有放出的测试集,没有解码配置,也没有来自 StepFun 之外任何人可复现的评测协议,而且厂商自己做的对比是针对其他中文 ASR 产品,而非针对开放权重的现有主导者。1.7% 是在三个数据集混合指标上真实的第三方测量结果;关于这个模型的其他一切,都只是厂商的说法。

有两件事会改变局面。一是在相同音频上与 Whisper Large v3 Turbo 进行正面直接对比,而目前还没有人公布过这样的结果。二是该系列其余产品的价格——StepAudio 3 的五款模型中有四款在发布时仍处于限时免费预览定价阶段,只有转写和语音合成公布了价格,这意味着你如今能查到的价目表只涵盖五款产品中的两款。

Screenshot of the arXiv abstract page for the StepAudio 3 Realtime Technical Report, listing the v1 submission of 12 September 2026 and the v2 revision of 19 September 2026, with the abstract describing the integrated voice agent and the top-performer claim on the Artificial Analysis Full-Duplex Bench.

这一层随使用量而非音频分钟数扩展,正是值得从一开始就保持可移植的那一层。 跨提供商自动故障转移、一个能将多个调用组合为单次调用的路由 DSL,以及当单个模型的判断力不足时的模型融合。