为 StepAudio 3 TTS 与 Qwen-Audio-3.0-TTS 生成的主视觉标题卡,带有引题“OrcaRouter · 模型雷达 — 正面交锋”、主标题“StepAudio 3 TTS 对比 Qwen-Audio-3.0-TTS”和副标题“一个拥有盲听竞技场评分。另一个在最后一轮投票七周后才发布”,位于两个圆角模型卡片上方,卡片分列于一个对决标记两侧。
Guides & Insights

StepAudio 3 TTS 与 Qwen-Audio-3.0-TTS:其中之一拥有 Arena 评分,而它并非新出的那个

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

整个对比可以概括为一句话。Qwen-Audio-3.0-TTS在 Text-to-Speech Arena 上,其 Plus 层级的 Elo 为 1,234——这一分数来自 2,502 次盲听投票。StepAudio 3 TTS,由 StepFun 于 2026 年 9 月 15 日发布,根本没有出现在该榜单上。它的前代是:StepAudio 2.5 TTS 以 1,306 票获得 Elo 1,209。

所以,真正诚实的问题不是“哪个听起来更好”。而是,在上一代上测得的那25点 Elo 差距,能否在一次 StepFun 称已改进韵律并将价格削减一半以上的发布后依然成立。还没有人进行过那场投票,而下文的一切都围绕证据中的这一缺口来安排,而不是假装它不存在。

看板,按其今天实际显示的内容

值得看看真实排名,因为有几篇流传的文章引用的是过时版本。盲听竞技场根据投票者更偏好哪个样本,对合成模型进行排名。横向看一下提供商语音榜的顶部:

• Cartesia Sonic 3.6 — Elo 1,277,2026年8月,每百万字符 $49.0

• Inworld Realtime TTS-2 — Elo 1,243,2026年8月,每百万字符 $20.8

• SpeechifyAI Simba 3.2 — Elo 1,238,2026年7月,每百万字符 6.6 美元

Alibaba Qwen-Audio-3.0-TTS-Plus — Elo 1,234,2026年7月,每百万字符 27.6 美元,8 种竞技场音色

• VUI Labs Luna TTS — Elo 1,229,2026年6月,每百万字符 $80.0

• Inworld Realtime TTS-2 Flash — Elo 1,213,2026年8月,每百万字符 10.4 美元

• StepFun StepAudio 2.5 TTS — Elo 1,209,2026 年 8 月,每百万字符 $85.0,8 个竞技场音色

Google Gemini 3.1 Flash TTS — Elo 1,204,2026年4月,每百万字符 $18.3

Screenshot of the Artificial Analysis Provider Voice Arena text-to-speech leaderboard, showing Cartesia Sonic 3.6 first at Elo 1,277, Alibaba Qwen-Audio-3.0-TTS-Plus fourth at Elo 1,234 over 2,502 samples at $27.6 per million characters, and StepFun StepAudio 2.5 TTS seventh at Elo 1,209 over 1,306 samples at $85.0 per million characters, with confidence intervals of -14/+14 and -16/+16 respectively.

从这份榜单中立刻能得出两点。第一,Qwen 的 Plus 档并非领跑者——它排在第四,落后于 Cartesia、Inworld 和 Speechify,而那个被当作王冠来引用的 1,234 分数,在如今已然变化的榜单上只是一个中游成绩。第二,StepAudio 2.5 TTS 于 2026 年 8 月重新跑测,位列第七,比 Qwen 低 25 Elo,价格却是其三倍多。

还有第三件事,它比这一切都更重要:看看置信区间。Qwen 的 Plus 档在 2,502 个样本上标注为 −14/+14。StepAudio 2.5 TTS 在 1,306 个样本上标注为 −16/+16。这些区间相互重叠。两个模型的误差范围分别向两侧延伸 14 个点和 16 个点,它们之间 25 个点的差距并不是已被证明的质量差异——这是竞技场目前无法区分的两个模型,而它们现在的排名,再多几百票就可能被逆转。

A generated scoreboard titled 'StepAudio 3 TTS vs Qwen-Audio-3.0-TTS — the scoreboard'. The StepAudio column reads Arena Elo 'not scored yet', Samples 'none', Price '2.5 yuan / 10,000 chars', Voices 'not published', Languages 'Chinese-first', Request size 'not published'. The Qwen column reads Arena Elo '1,234, Plus tier', Samples '2,502', Price '$27.6 / 1M chars', Voices 'over 1,000', Languages '16 + 20 dialects', Request size '20,000 chars'. Footer: 'Qwen figures per the Artificial Analysis text-to-speech arena; StepAudio 3 TTS has no arena score yet.'

缺失的数据点会让你付出什么代价

StepAudio 3 TTS 是 StepFun 用来取代 StepAudio 2.5 TTS 的模型,其发布宣称可控制音色、语调、节奏和呼吸停顿,并具备副语言行为——笑声、犹豫、口吃、重复、自我纠正——这些通过生成与播放重叠的流式架构实现。

这正是竞技场所衡量的那组特质。这也正是为什么缺少分数令人沮丧而非致命:能回答这个问题的基准测试存在、公开运行,而且只是自新模型发布以来尚未重新运行。任何告诉你 StepAudio 3 TTS 听起来比 Qwen-Audio-3.0-TTS 更好的人,都是在从一个以落在其自身误差范围内的差距落败的前代模型外推。

价格是有完整记录的部分,而且它波动很大

StepAudio 3 TTS 在 StepFun 自家平台上的计费为每万字符 2.5 元。StepAudio 2.5 TTS 的计费则为 5.8。在该竞技场自身按字符计价的栏目中,较旧的模型为每百万字符 85.00 美元;按近期汇率,每万字符 2.5 元约合每百万字符 35 美元——这一换算由我们得出,而非官方公布数字,值得你结合自己所在地区和汇率重新计算。在同一计费项上,这意味着降幅接近 60%。

它仍然高于 Qwen。Qwen-Audio-3.0-TTS-Plus 标价为每百万字符 27.6 美元,而 Flash 档还要更便宜——阿里云百炼(Model Studio)按输入字符而非实际生成的音频计费,输出不单独收费。列出 Flash 档的第三方平台报价为每百万字符十几美元(接近二十美元),不过地区差异使得任何单一的标称数字都不可靠。

所以情况是这样的:StepFun 大致将合成成本减半,缩小了与 Qwen 的大部分差距,但并未超越它。如果按字符计价的价格是你的硬性约束,那么论证的范围会收窄,但答案不会改变。如果不是,价格就不再是选择任一模型的理由。

语音库存和语言覆盖还差得远

在这里,比较不再是一个主观判断的问题,而变成了一个规格问题。

音色库存 — Qwen-Audio-3.0-TTS 在其各层级中提供超过 1,000 种音色,而 StepAudio 3 TTS 没有可比的已公布数量

• 语言 — Qwen-Audio-3.0-TTS:16 种语言外加 20 种中文方言,其中 Flash 层级针对低资源语言和方言地道性进行调优;相比之下,StepAudio 3 TTS 以中文为先,且未声称具备同等覆盖范围

• 请求大小 — Qwen-Audio-3.0-TTS 每次请求 20,000 个字符,而 StepAudio 3 TTS 未公布

• 延迟 — 根据阿里巴巴自己的文档,Qwen-Audio-3.0-TTS Flash 的目标是将首包延迟控制在 200 毫秒以内,而 StepAudio 3 TTS 流式传输则没有公布数据

• 分层 — Qwen-Audio-3.0-TTS Plus 用于表现力,Flash 用于实时;六款旗舰音色被锁定在二者之一,而 StepAudio 3 TTS 则只有单一层级

• 控制面 — Qwen-Audio-3.0-TTS 的自然语言演绎指导,加上嵌入输入文本中的 [excited]、[laughing]、[whispers] 等内联表达标签,对比 StepAudio 3 TTS 根据上下文由模型推断的韵律

• 声音克隆 — StepAudio 3 TTS 在所有 TTS 档位中,每个克隆音色一律 9.9 元,而 Qwen-Audio-3.0-TTS 的克隆则需通过 Alibaba Cloud Model Studio 进行

• 输出 — Qwen-Audio-3.0-TTS 默认采样率为 24 kHz,而 StepAudio 3 TTS 未公布

控制面板那一行才是真正的设计差异,而不是质量问题。Qwen 的表情标签是显式且同步的:你把情绪写进文本,模型就将其渲染出来,这使它们可测试、且对回归友好。StepFun 所描述的是一种会从上下文中推断出合适迟疑或笑声的模型,这在它判断正确时听起来更好,而在它出错时则远更难定位。选择取决于你更愿意亲自编排表演,还是把它委托出去。

Screenshot of Alibaba Cloud Model Studio documentation for qwen-audio-3.0-tts-flash, showing the model capabilities table with text input and audio output, function calling and fine-tuning unsupported, and a note that the Flash version controls first-packet latency within 200 ms.

如何在没有测量的情况下做出决定

你无法从已公布的数据中靠推理得出答案,因为那个决定性的数字并不存在。那就只剩下测试,而测试这两者有一种特定的形态,值得为之做好规划。

两者都是仅提供托管服务的商业 API——Qwen-Audio-3.0-TTS 通过 Alibaba Cloud Model Studio 提供,StepAudio 3 TTS 通过 StepFun 开放平台提供。两者均非开放权重,因此没有可供评估的自托管途径。在此需要明确说明 OrcaRouter 覆盖的范围:目前我们目录中的文本转语音模型包括 OpenAI tts-1 系列、gpt-4o-mini-tts 以及 Google 的 Gemini TTS 预览版。本文提到的两个模型都不在其中,Qwen-Audio-3.0-TTS 同样不在其中——本文中的任何内容都不应被理解为我们提供这些模型的声明。

真正运行在 OrcaRouter 上的,是流水线中的文本部分。你的合成层所读取的脚本由语言模型生成,而这正是变化最频繁、重新签约成本最高、也最容易被放任不锁定的组件——近 200 个文本模型藏在同一个 API 之后,自动故障转移,一种可将多个模型组合成一次调用的路由 DSL,以及当一个模型的判断不够用时的模型融合,按提供商列表价原样透传,不加价。如果你要对这两个合成模型进行盲测评估,请通过同一个端点生成语料,使两个候选模型读取完全相同的输入,并把合成层放在一个可以随时替换的接口之后。

这让决定处于何种境地

如果你需要广度,今天就选 Qwen-Audio-3.0-TTS——一千多种声音、16 种语言和 20 种方言、有文档记录的 20,000 字符请求上限、一个延迟层级和一个表现力层级、200 毫秒首包目标,以及低于 StepFun 的费率。它是背后有测量数据、覆盖面也更广的模型,其第四名的 Elo 是真实结果,即便它并非人们引用时所称的那顶桂冠。

如果你正在构建中文优先的产品、想要单一档位而不是做档位选择、希望以公开的固定费用获得克隆,并且愿意率先采用一个尚未经过盲测的模型,那就选 StepAudio 3 TTS。相比 Qwen 的 Plus 档,你每字符大约多付 27%,换来的是:相较于一个 Elo 落后 25 分、误差条重叠的模型,号称在韵律上提升了一代。

能定论的做法,是让 StepAudio 3 TTS 进入评测池,把竞技场重新跑一次。在这次投票发生之前,这只是一个已测模型与一个未测模型之间的比较,而它们前代之间相差的那 25 分仍在噪声范围内——这算不上排名,也不应被当作排名来兜售。