'Realtime-Venus 对阵 Qwen-Audio-3.0-TTS' 的主视觉标题卡,副标题为"渲染器与倾听者不是同一笔采购",配有三张卡片,分别写有"Qwen-Audio-3.0-TTS-Plus:Elo 1,259,在 Artificial Analysis Provider Voice Arena 上排名第二"、"Realtime-Venus:完全不存在语音质量评分"和"输入即是全部差异:仅文本,对比音频、视频与文本",下方页脚条写有"Qwen 数据来自 Artificial Analysis;Realtime-Venus 数据来自其技术报告,未经复现。" OrcaRouter 标志合成于右下角。
Guides & Insights

Realtime-Venus 对比 Qwen-Audio-3.0-TTS:一个读取你的脚本,另一个必须听你说

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

把 Realtime-Venus 和 Qwen-Audio-3.0-TTS 放在一起比较时,最诱人的方式是按每音频小时的价格来比,而这会得出一个干净利落却完全错误的答案。Qwen-Audio-3.0-TTS-Plus 合成语音的价格约为每百万字符 27.6 美元,折合每小时的成品音频接近 1.66 美元。Realtime-Venus 是 Ant Group 的 Venus Team 与清华大学联合构建的 90 亿参数全双工系统,它根本没有价格,因为它没有托管服务——但如果自托管,你就得让一个 GPU 节点持续运行,每小时成本至少高出一个数量级。在算术上,合成器赢了。这套算术衡量的是两种不同的产品:Qwen-Audio-3.0-TTS 接收文本并返回音频,而 Realtime-Venus 接收音频和视频并返回一段对话。真正区分它们的问题,不在于它们输出什么,而在于是否有任何东西必须回话。

输入就是全部差别

Qwen-Audio-3.0-TTS 由阿里云通义实验室于 2026 年 7 月 20 日发布,是一个以托管 API 形式提供的文本转语音模型,不开放权重。文本通过 HTTP 端点输入,音频输出。它没有音频输入通道,没有需要承接的轮次,没有需要返回的转写文本,也没有被打断的概念——这个模型从未听到过任何东西。它的整套成本模型就像一台印刷机:字符进去,音频出来。

相比之下,Realtime-Venus 则会持续聆听。这个视听检查点搭载了一个用于流式帧的 SigLIP2 视觉编码器,以及一个为 Qwen3-8B 主干网络提供输入的 Whisper-Medium 音频编码器,并且两个检查点都运行着一秒的交互循环,不断更新对话状态并决定是开口说话还是保持沉默。它通过离散的 S3 token 和流式流匹配解码器生成语音,而非依赖单独的合成阶段,并且可以在输出波形的同�时返回文本。

这不是功能差异。而是组件与系统之间的区别。把两者并排放在一起看,其中一个可以直接放进一条前面已经有语音识别器和语言模型的流水线中。另一个则会取代这三者。

一个实操案例能使其具体化。

设想一下客服热线。一位客户打来电话,把问题描述得一团糟,说到一半停下来找账号,被背景广播打断,然后在座席还没回答完时又追问了一个后续问题。

基于 Qwen-Audio-3.0-TTS 构建的系统把这件事处理成三个供应商和三笔账单:识别器把呼叫者的语音转成文本,语言模型决定该说什么,Qwen-Audio-3.0-TTS 再把它说出来。每一跳都会增加延迟,而每一个边界都是韵律消亡之处。关键故障是结构性的——TTS 这一环节听不到它已经在说的句子中间的停顿,所以打断必须由它前面的某个东西来处理。

Realtime-Venus 将同一通通话作为一个模型来处理,无需外部语音活动检测器,也无需交接。其 Full-Duplex-Bench v1.5 数据——对打断的响应率为 75%,在反馈信号下的持续率为 97%,在指向他人的言语下为 88%,在背景语音下为 86%——正是描述这一场景的指标。它们也是自我报告的,来自模型自己的技术报告,没有外部复现。应把它们解读为设计主张,而非测量结果。

语音质量:一个有 Elo,另一个什么都没有

这是对比中最一边倒的部分,且以较大幅度有利于阿里巴巴。

• 独立评分——截至 2026 年 9 月 18 日,Qwen-Audio-3.0-TTS-Plus 在 Artificial Analysis 的 Provider Voice Arena 上以 1,259 的 Elo(基于 1,544 个样本)位列第二,落后于 Cartesia Sonic 3.6 的 1,277,领先于 Inworld Realtime TTS-2 的 1,247 和 Speechify Simba 3.2 的 1,241。

• 起点——该竞技场自己的发布栏将这款模型列为 2026 年 9 月的条目,这是按当前评分所属的层级,而不是 2026 年 7 月 20 日的发布日期。无论它何时变动,它始终都保持在前两名。

• Realtime-Venus — 没有竞技场参赛记录,没有第三方语音评估,什么都没有。其唯一与语音相关的数字,是一项自报的 VoiceBench AlpacaEval 得分 4.81,报告中称该得分与最佳对比数值相当。

• 这意味着什么——除了作者之外,没有人评判过 Realtime-Venus 听起来是否好听。这并不是对它的贬低;它只是未知,而未知不同于糟糕。但如果语音质量是交付成果,那么购买一个有 Elo 评分的模型,胜过凭信任选择一个未评分的模型。

A screenshot of the Artificial Analysis Provider Voice Arena Leaderboard for text-to-speech, captured 18 September 2026, showing the ranked table: Cartesia Sonic 3.6 first at Elo 1,277 with 1,810 samples, released August 2026 at $49.0 per million characters; Alibaba's Qwen-Audio-3.0-TTS-Plus second at Elo 1,259 with 1,544 samples and $27.6 per million characters; Inworld Realtime TTS-2 third at Elo 1,247; SpeechifyAI Simba 3.2 fourth at Elo 1,241; VUI Labs Luna TTS fifth at Elo 1,231; Inworld Realtime TTS-2 Flash sixth at Elo 1,216; StepFun StepAudio 2.5 TTS seventh at Elo 1,209; and BreezeBlue Breeze TTS 2 eighth at Elo 1,207 with an Open Weights badge.A two-column comparison scoreboard titled 'Realtime-Venus vs Qwen-Audio-3.0-TTS — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Job: full-duplex conversation', 'Input: audio, video and text', 'Output: text and speech', 'Independent voice score: none', 'Availability: Apache-2.0 weights, no API', 'Price: none published'. The right column, labelled Qwen-Audio-3.0-TTS, reads 'Job: text-to-speech rendering', 'Input: text only', 'Output: audio', 'Independent voice score: Elo 1,259, second of 20-plus', 'Availability: hosted API since 20 July 2026', 'Price: about $27.6 per 1M characters'. The footer reads 'Qwen figures per Artificial Analysis and Alibaba Cloud documentation; Realtime-Venus figures from its technical report, unreproduced.'

语言、语音和表达控制

阿里巴巴的模型为广泛的语音交付而构建。它提供超过一千种音色,覆盖十六种语言(其中包括二十个中文方言区),并开放 86 个用于情感和表达的内联标签——一种可直接写入文本的控制界面,外加自然语言表达指令。输出最高可达 48 kHz,高于上一代的 24 kHz,单次合成最长可达三分钟。Flash 层级的目标是约 300 毫秒首包,以实现实时播放;Plus 层级是质量层级,生成速度约为每秒 16 个字符,这在实时产品中慢到足以产生影响,而在批量渲染中则几乎难以察觉。

Realtime-Venus 文档涵盖英语和中文,随权重只附带一个参考音色,并且提供的是 token 到波形的解码器,而不是一个音色库。Qwen 意义上的表现力——标签、指令、上千种预设——在这里没有对应物。它取而代之的能力,是根据所听到的内容改变自己的表达方式,这是一种不同性质的表现力控制,也更难写进规格表里。

每条路的代价,说实话

在任何人用阿里巴巴这个数字做预算之前,都有一个实实在在的注意事项。被广泛引用的每百万字符 27.6 美元,并不在每个快照中都符合阿里巴巴自己的定价页面,而且各档位是分开计价的。请在账户层面核对这个数字,而不是相信对比表,包括这张表。

Realtime-Venus 没有标价,因为没有什么可买的。成本是两个 BF16 的 9B 检查点——在激活内存之前,每个大约十八 GB 的权重——外加一个持续运行的流式循环,这意味着一个按月计费的 GPU 节点,无论是否有人调用。在稳定用量下,按每次对话计算,这比按量计费的语音 API 更便宜。在间歇性用量下,它要糟糕得多,而交叉点才是唯一重要的财务问题。

还有第三条路,很多团队最终都会走到它上面,而它值得被点明,因为它会改变决策的形态。如果你保留级联架构,唯一需要托管模型的环节就是中间那一环——推理。OrcaRouter 既不提供 Qwen-Audio-3.0-TTS,也不提供 Realtime-Venus;这两个语音层都不在我们所服务的范围内,我们宁愿把这一点说清楚,也不愿含糊其辞地暗示相反的情况。推理这一环正是我们所覆盖的部分:近 200 个文本模型,凭一个密钥即可调用,按供应商标价计费,零加价,跨上游的自动故障转移,这样某家供应商一个不顺的下午也不会让一通正在进行的通话掉线,一套路由 DSL,能把多个模型组合成单次调用,以及当某个决策值得听取不止一种意见时的模型融合。在级联架构中,这正是你最希望能不经合同谈判就能替换的一环,也是供应商降价当天就能落地、而不必等到续约之时的一环。

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Apache-2.0 licence badge alongside the Any-to-Any, Safetensors, audio, video, streaming and full-duplex tags, the model card heading 'A full-duplex interaction system with asynchronous delegation', and a side panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

克隆是双刃剑

Qwen-Audio-3.0-TTS 能从一段简短的参考样本中克隆声音,且支持跨语言,据文档记载,它对含噪或混响输入也具备鲁棒性。这是整个对比中最具商业价值的能力,也是最大的合规风险面。一款能用十秒音频复现任何说话人的产品,在回答“那是谁的声音,又是谁同意了它”时,所需给出的解释要比一款只会用厂商预设音色说话的产品长得多。

Realtime-Venus 随权重一起附带了一个参考音色。如果你有音频和训练运行,就可以用它来克隆,但发布版中没有任何东西是围绕让这件事变得容易而构建的——对于合规边界内的自托管部署来说,这可以说是更安全的默认做法。

你实际买的是哪一个?

当音频就是产出物时,选择 Qwen-Audio-3.0-TTS。旁白、本地化、无障碍、配音,以及任何文本先于声音存在、并以每渲染小时的质量作为衡量指标的工作流程。如果播放是实时的,就从 Flash 起步;当声音本身就是产品时,转向 Plus;并将克隆工作流与预设库分开定价。

当输入对象是人,而系统必须表现得像一位倾听者时,就选 Realtime-Venus。摄像头感知辅助、免手交互,任何人类会在句子中间打断并指望系统能处理的情形。取舍很鲜明:你放弃了 Elo 评级的语音、上千个预设以及任何托管选项,换来的是两者中唯一能听见你的那一个。

大多数产品两者都想要,只是用在不同地方。它们不该共用的是一个成本模型——按音频小时计价,只对这两种模型中的一种才是正确的衡量标准,而它不是正在进行对话的那一种。