
StepAudio 3 TTS 与 Qwen-Audio-3.0-TTS:其中之一拥有 Arena 评分,而它并非新出的那个
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
整个对比可以概括为一句话。Qwen-Audio-3.0-TTS在 Text-to-Speech Arena 上,其 Plus 层级的 Elo 为 1,234——这一分数来自 2,502 次盲听投票。StepAudio 3 TTS,由 StepFun 于 2026 年 9 月 15 日发布,根本没有出现在该榜单上。它的前代是:StepAudio 2.5 TTS 以 1,306 票获得 Elo 1,209。
所以,真正诚实的问题不是“哪个听起来更好”。而是,在上一代上测得的那25点 Elo 差距,能否在一次 StepFun 称已改进韵律并将价格削减一半以上的发布后依然成立。还没有人进行过那场投票,而下文的一切都围绕证据中的这一缺口来安排,而不是假装它不存在。
看板,按其今天实际显示的内容
值得看看真实排名,因为有几篇流传的文章引用的是过时版本。盲听竞技场根据投票者更偏好哪个样本,对合成模型进行排名。横向看一下提供商语音榜的顶部:
• Cartesia Sonic 3.6 — Elo 1,277,2026年8月,每百万字符 $49.0
• Inworld Realtime TTS-2 — Elo 1,243,2026年8月,每百万字符 $20.8
• SpeechifyAI Simba 3.2 — Elo 1,238,2026年7月,每百万字符 6.6 美元
• Alibaba Qwen-Audio-3.0-TTS-Plus — Elo 1,234,2026年7月,每百万字符 27.6 美元,8 种竞技场音色
• VUI Labs Luna TTS — Elo 1,229,2026年6月,每百万字符 $80.0
• Inworld Realtime TTS-2 Flash — Elo 1,213,2026年8月,每百万字符 10.4 美元
• StepFun StepAudio 2.5 TTS — Elo 1,209,2026 年 8 月,每百万字符 $85.0,8 个竞技场音色
• Google Gemini 3.1 Flash TTS — Elo 1,204,2026年4月,每百万字符 $18.3

从这份榜单中立刻能得出两点。第一,Qwen 的 Plus 档并非领跑者——它排在第四,落后于 Cartesia、Inworld 和 Speechify,而那个被当作王冠来引用的 1,234 分数,在如今已然变化的榜单上只是一个中游成绩。第二,StepAudio 2.5 TTS 于 2026 年 8 月重新跑测,位列第七,比 Qwen 低 25 Elo,价格却是其三倍多。
还有第三件事,它比这一切都更重要:看看置信区间。Qwen 的 Plus 档在 2,502 个样本上标注为 −14/+14。StepAudio 2.5 TTS 在 1,306 个样本上标注为 −16/+16。这些区间相互重叠。两个模型的误差范围分别向两侧延伸 14 个点和 16 个点,它们之间 25 个点的差距并不是已被证明的质量差异——这是竞技场目前无法区分的两个模型,而它们现在的排名,再多几百票就可能被逆转。

缺失的数据点会让你付出什么代价
StepAudio 3 TTS 是 StepFun 用来取代 StepAudio 2.5 TTS 的模型,其发布宣称可控制音色、语调、节奏和呼吸停顿,并具备副语言行为——笑声、犹豫、口吃、重复、自我纠正——这些通过生成与播放重叠的流式架构实现。
这正是竞技场所衡量的那组特质。这也正是为什么缺少分数令人沮丧而非致命:能回答这个问题的基准测试存在、公开运行,而且只是自新模型发布以来尚未重新运行。任何告诉你 StepAudio 3 TTS 听起来比 Qwen-Audio-3.0-TTS 更好的人,都是在从一个以落在其自身误差范围内的差距落败的前代模型外推。
价格是有完整记录的部分,而且它波动很大
StepAudio 3 TTS 在 StepFun 自家平台上的计费为每万字符 2.5 元。StepAudio 2.5 TTS 的计费则为 5.8。在该竞技场自身按字符计价的栏目中,较旧的模型为每百万字符 85.00 美元;按近期汇率,每万字符 2.5 元约合每百万字符 35 美元——这一换算由我们得出,而非官方公布数字,值得你结合自己所在地区和汇率重新计算。在同一计费项上,这意味着降幅接近 60%。
它仍然高于 Qwen。Qwen-Audio-3.0-TTS-Plus 标价为每百万字符 27.6 美元,而 Flash 档还要更便宜——阿里云百炼(Model Studio)按输入字符而非实际生成的音频计费,输出不单独收费。列出 Flash 档的第三方平台报价为每百万字符十几美元(接近二十美元),不过地区差异使得任何单一的标称数字都不可靠。
所以情况是这样的:StepFun 大致将合成成本减半,缩小了与 Qwen 的大部分差距,但并未超越它。如果按字符计价的价格是你的硬性约束,那么论证的范围会收窄,但答案不会改变。如果不是,价格就不再是选择任一模型的理由。
语音库存和语言覆盖还差得远
在这里,比较不再是一个主观判断的问题,而变成了一个规格问题。
音色库存 — Qwen-Audio-3.0-TTS 在其各层级中提供超过 1,000 种音色,而 StepAudio 3 TTS 没有可比的已公布数量
• 语言 — Qwen-Audio-3.0-TTS:16 种语言外加 20 种中文方言,其中 Flash 层级针对低资源语言和方言地道性进行调优;相比之下,StepAudio 3 TTS 以中文为先,且未声称具备同等覆盖范围
• 请求大小 — Qwen-Audio-3.0-TTS 每次请求 20,000 个字符,而 StepAudio 3 TTS 未公布
• 延迟 — 根据阿里巴巴自己的文档,Qwen-Audio-3.0-TTS Flash 的目标是将首包延迟控制在 200 毫秒以内,而 StepAudio 3 TTS 流式传输则没有公布数据
• 分层 — Qwen-Audio-3.0-TTS Plus 用于表现力,Flash 用于实时;六款旗舰音色被锁定在二者之一,而 StepAudio 3 TTS 则只有单一层级
• 控制面 — Qwen-Audio-3.0-TTS 的自然语言演绎指导,加上嵌入输入文本中的 [excited]、[laughing]、[whispers] 等内联表达标签,对比 StepAudio 3 TTS 根据上下文由模型推断的韵律
• 声音克隆 — StepAudio 3 TTS 在所有 TTS 档位中,每个克隆音色一律 9.9 元,而 Qwen-Audio-3.0-TTS 的克隆则需通过 Alibaba Cloud Model Studio 进行
• 输出 — Qwen-Audio-3.0-TTS 默认采样率为 24 kHz,而 StepAudio 3 TTS 未公布
控制面板那一行才是真正的设计差异,而不是质量问题。Qwen 的表情标签是显式且同步的:你把情绪写进文本,模型就将其渲染出来,这使它们可测试、且对回归友好。StepFun 所描述的是一种会从上下文中推断出合适迟疑或笑声的模型,这在它判断正确时听起来更好,而在它出错时则远更难定位。选择取决于你更愿意亲自编排表演,还是把它委托出去。

如何在没有测量的情况下做出决定
你无法从已公布的数据中靠推理得出答案,因为那个决定性的数字并不存在。那就只剩下测试,而测试这两者有一种特定的形态,值得为之做好规划。
两者都是仅提供托管服务的商业 API——Qwen-Audio-3.0-TTS 通过 Alibaba Cloud Model Studio 提供,StepAudio 3 TTS 通过 StepFun 开放平台提供。两者均非开放权重,因此没有可供评估的自托管途径。在此需要明确说明 OrcaRouter 覆盖的范围:目前我们目录中的文本转语音模型包括 OpenAI tts-1 系列、gpt-4o-mini-tts 以及 Google 的 Gemini TTS 预览版。本文提到的两个模型都不在其中,Qwen-Audio-3.0-TTS 同样不在其中——本文中的任何内容都不应被理解为我们提供这些模型的声明。
真正运行在 OrcaRouter 上的,是流水线中的文本部分。你的合成层所读取的脚本由语言模型生成,而这正是变化最频繁、重新签约成本最高、也最容易被放任不锁定的组件——近 200 个文本模型藏在同一个 API 之后,自动故障转移,一种可将多个模型组合成一次调用的路由 DSL,以及当一个模型的判断不够用时的模型融合,按提供商列表价原样透传,不加价。如果你要对这两个合成模型进行盲测评估,请通过同一个端点生成语料,使两个候选模型读取完全相同的输入,并把合成层放在一个可以随时替换的接口之后。
这让决定处于何种境地
如果你需要广度,今天就选 Qwen-Audio-3.0-TTS——一千多种声音、16 种语言和 20 种方言、有文档记录的 20,000 字符请求上限、一个延迟层级和一个表现力层级、200 毫秒首包目标,以及低于 StepFun 的费率。它是背后有测量数据、覆盖面也更广的模型,其第四名的 Elo 是真实结果,即便它并非人们引用时所称的那顶桂冠。
如果你正在构建中文优先的产品、想要单一档位而不是做档位选择、希望以公开的固定费用获得克隆,并且愿意率先采用一个尚未经过盲测的模型,那就选 StepAudio 3 TTS。相比 Qwen 的 Plus 档,你每字符大约多付 27%,换来的是:相较于一个 Elo 落后 25 分、误差条重叠的模型,号称在韵律上提升了一代。
能定论的做法,是让 StepAudio 3 TTS 进入评测池,把竞技场重新跑一次。在这次投票发生之前,这只是一个已测模型与一个未测模型之间的比较,而它们前代之间相差的那 25 分仍在噪声范围内——这算不上排名,也不应被当作排名来兜售。
