
GPT-Live-1 vs Qwen-Audio-3.0-TTS:对话与旁白不是同一个行项目
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码

把 GPT-Live-1 和 Qwen-Audio-3.0-TTS 按每音频小时的价格并排比较,差距显得极为明显:Alibaba 的 Qwen-Audio-3.0-TTS-Plus 以每百万字符 27.6 美元合成语音,约合每小时 1.66 美元的音频,而 OpenAI 的 GPT-Live-1 对一小时连续开放线路收费 3.00 美元。旁白更便宜,所以旁白胜出——只不过这是一个错误的比较,而它之所以错误,才是任何人都能从这场对比中得到的最有用的收获。Qwen-Audio-3.0-TTS 是文本转语音模型。GPT-Live-1 是全双工对话模型。其中一个会朗读你写下的内容。另一个则必须每秒多次判断你是否已经说完。
一个渲染,一个对话
文本转语音接收文本并返回音频。没有输入音频,没有轮次可接,没有被中断的概念,也没有可返回的转写文本,因为模型从未听到任何东西。它的成本模型就像一台印刷机:纸页进、音频出,质量和吞吐量是唯一重要的两个数字,而且这两者在发布前都可以测量。
全双工对话模型在输出音频的同时处理传入的音频。它的工作涵盖对话中与文字无关的部分——用户停顿时就停顿,遇到「yeah」这类附和语时继续推进,而不是把它当成打断;说到一半就主动让出话轮;以及在不中断话题的情况下触发工具调用。GPT-Live-1 能完成所有这些,并随会话一并返回语音识别转写文本——它能做到这一点,靠的是全程都在倾听。
如果你的产品会朗读文章、将文档转换为音频或为视频配音,那么 GPT-Live-1 就是错误的工具,而且按小时计费的价格还要贵四倍。如果你的产品要接听电话,Qwen-Audio-3.0-TTS 只是整条流水线的三分之一,这条流水线仍然需要 ASR 模型和语言模型才能构成一场对话。
在 Qwen-Audio-3.0-TTS 真正是最佳答案的场景中
Alibaba 的模型能立足,并非营销使然。Plus 版本由 Alibaba 的 Tongyi Lab 于 2026 年 7 月 20 日发布,并通过 Alibaba Cloud Model Studio 以托管式闭源 API 的形式对外开放;它一经问世便登上 Artificial Analysis 文本转语音竞技场的榜首。不过,排行榜是一个不断变动的目标,而这一榜单已经变了:截至 2026 年 9 月,Qwen-Audio-3.0-TTS-Plus 在 Provider Voice Arena 上以 1,232 的 Elo(基于 2,306 个样本)位列第四,落后于 1,275 的 Cartesia Sonic 3.6、1,244 的 Inworld Realtime TTS-2 和 1,233 的 Speechify 的 Simba 3.2——这三个模型分别出自 8 月和 7 月,且都在它之后推出。在二十多个模型中排名第四,虽然领先优势已失,但价格优势仍在,这仍然是一个强势位置。只不过,它不是发布报道所描述的那个位置。

它在其覆盖的16种语言中有10种处于领先地位,新增了20个中文方言区,支持基于短样本的语音克隆,包括跨语言克隆,并带有86个内联情感和表达标签。
这些注意事项已经足够具体,可以据此制定计划。
• 吞吐量 — Plus 每秒大约生成 16 个字符,而 Simba 3.2 为 30.2,Gemini 3.1 Flash TTS 为 27,Sonic 3.5 约为 120。对于批量渲染来说这一点无关紧要;但对于实时产品而言,正是这个数字决定了你的缓冲区大小。
• 价格文档——被广泛引用的每百万字符 27.6 美元这一数字,并非在每个快照中都符合 Alibaba 自家定价页面上的内容,后者在某些时点曾为两个档位都列出了更低的数字。在做预测之前,请在账户层面核实当前数字,而不是排行榜上的数字。
• 语音库——尽管支持 16 种语言,公开的预设音色几乎全是中文和英语。其余十四种语言要通过克隆流程才能获得,而不是开箱即用。
• 功能限制 — 86 个内联情感标签仅在单向流式模式下有效,因此这种富有表现力的控制并非在所有集成路径中都能保留。
• 档位 — Flash 面向实时场景,目标首包延迟约为 300 毫秒;Plus 则是质量档。它们是同名却截然不同的产品,选错一个是新手常犯的第一个错误。
级联法案的真实版本
以下是按小时对比所遗漏的内容。一个基于 TTS 模型构建的对话产品是一条级联链路:ASR 模型将呼叫者的语音转成文本,语言模型决定说什么,TTS 模型把它说出来。三家供应商、三张账单、三份会累加的延迟预算,以及每个边界处的一次交接,而韵律正是在那里消亡。TTS 这一环节每小时音频可能要花 1.66 美元。另外两个环节才是钱和错误真正所在——而且级联模型听不到自己已经在说的句子中间的停顿。
GPT-Live-1 将三个计费环节合并为一次会话和一个计量表,语音部分为每分钟 $0.05,而推理后端则单独计费。有两个细节让这笔账单保持名副其实。会话初始化会预先计收 15 秒语音,这 15 秒用于抵扣后续时长,而不是叠加在其上。此外,后端是第二个计量表:每一次委派的推理调用、工具调用和网络搜索,都按该模型的正常费率计费,因此若把委派指向一个每轮都要搜索的前沿推理模型,就会在廉价的语音层背后产生一笔昂贵的调用。
独立评测榜单对两者的评价颇具启发性,恰恰因为它们衡量的是不同维度,而且对各自的评测对象都不加粉饰。Qwen-Audio-3.0-TTS-Plus 在质量上排名第四,在吞吐量上则接近垫底。GPT-Live-1 在 Artificial Analysis 的语音到语音指数(Speech to Speech Index)十一款模型中位列第七,得分 69.8%——落后于它所取代的 GPT-Realtime-2.1(73.9%)——而其计费却处于该指数每小时输入音频成本区间的低端,为 4.42 美元,相比之下 GPT-Realtime-2.1 为 10.75 美元。两款模型都未能拿下各自类别的头名。两者都比它们本要超越的对象更便宜。

第二层计量正是路由层从优化手段转变为设计决策的地方。OrcaRouter 既不带 GPT-Live-1,也不带 Qwen-Audio-3.0-TTS——这两处的语音层都超出我们的掌控范围,我们不做任何路由。推理环节则不然。来自十一家上游提供商的大约 190 个模型位于一个密钥之后,按提供商标价、零加价,而且提供商降价当天就能生效,而不是等到下一次合同续签。对于级联而言,这直接覆盖了中间环节:在一个端点后保留两个 ASR 选项和三个推理器,在真实流量上让它们互相对比,并让自动故障转移吸收上游的糟糕时段而不掉线
同意问题指向相反的方向
声音克隆是 Qwen-Audio-3.0-TTS 最具商业价值的能力,也是其最大的合规风险面。仅需十秒参考音频,就能跨语言复现某个说话人的声音——这对本地化是颠覆性的,但在任何涉及身份的场景里都是隐患。OpenAI 发布 GPT-Live-1 时完全没有克隆功能,也没有任何自定义音色——API 只有 12 种音色可选,就这么多。
这种不对称在功能对比中很容易被略过,在风险审查中却很难被略过。一个只会用十二种供应商声音中的一种说话的产品,对“那是谁的声音,谁同意使用它”的回答,要比一个能从样本复现任意声音的产品简短得多。如果你需要克隆,管线决策已经替你做好了,问题就变成:由什么来治理它。如果你不需要,那么 GPT-Live-1 的限制就值得一读,把它当作一种你本不必自行构建的控制措施。
该买哪一个
购买 Qwen-Audio-3.0-TTS,如果输出是内容:旁白、本地化、无障碍音频、配音,或任何文本先于音频存在、且以每小时渲染质量作为衡量指标的工作流。如果需要实时播放,请从 Flash 开始;当声音本身是交付物时,转到 Plus;并将克隆工作流与预设音色分开定价。
如果输入的是人,就买 GPT-Live-1。客服热线、预约流程、接待面谈,任何用户的第一句话在模型话说一半时就插进来、系统必须表现得像倾听者而非主讲人的场景,都适用。它的每音频小时成本更高,而且是这两者中唯一能被中途打断的。
这两者作为互补的情况远多于作为竞争对手:许多产品既要 Qwen-Audio-3.0-TTS 朗读文档,也要一个双工模型来处理随后的通话。它们不该共用的,是成本模型。按音频小时计费只对其中一方才是正确的指标。
