
GPT-Live-1 vs Breeze TTS 2:你无法发布的开放权重语音领导者
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
Breeze TTS 2 是 Artificial Analysis 的 Provider Voices Speech Arena 上评分最高的开放权重文本转语音模型,拥有 1,205 Elo,在超过一百个已评分系统中总排名第七——领先于所有会公开权重的商业授权引擎。其权重自 2026 年 8 月 25 日起即可下载。同时,根据这些权重所附带的许可证,它无法用于产品中。GPT-Live-1 则在每个维度上都是相反的取舍:闭源、托管,自 2026 年 9 月 10 日登陆 OpenAI 的开发者 API 以来,按每分钟语音 0.05 美元计费,并且是两者中唯一能听到来电者打断自己的那个。
把这两句话并排放在一起,对比就会比大多数模型对决更快地见分晓。这不是一场争论谁合成语音更出色的较量。这是一场争论:你买到的是一个声音,还是一场对话;以及“开放”是否真的意味着你所以为的意思。
它们不是同一种东西,而这正是关键所在
Breeze TTS 2 来自一家名为 BreezeBlue、约十五人的初创公司,是一个拥有 30 亿参数的文本转语音模型。输入文本,输出音频。它什么也听不见。它对一轮对话该在何时结束没有任何看法,因为它根本没有“轮次”的概念。通过 WebSocket 流式传输时,它会在你的文本还没生成完就开始输出音频,这对于让语音智能体保持紧凑的节奏确实很有用——但何时开口说话,是由写出这段文本的东西决定的。
GPT-Live-1 是一款全双工语音到语音模型。音频和文本输入,音频和文本输出;模型每秒会多次决定是继续聆听、暂停、接过话轮,还是让出话轮。OpenAI 自家的 Full Duplex Bench v1.5 数据随此次发布一并公布,且未在公司外部复现,其交互性得分为 80.1%,而 GPT-Realtime-2.1 为 45.4%;话轮转换延迟为 0.798 秒,对比后者为 1.41 秒。
这种不对称并不是对 Breeze TTS 2 的贬低。它是在提醒你,二者在技术栈中各自应处于什么位置。如果你正在构建一条级联流程——语音识别输送给语言模型,语言模型再输送给合成器——那么 Breeze TTS 2 是最后三分之一环节的候选。如果你购买的是 GPT-Live-1,你买下的是整个闭环,并随之把轮流发言逻辑也交了出去。
逐个维度
• 交互模式 — GPT-Live-1:全双工、原生打断、边说边听,对比 Breeze TTS 2:流式文本转语音,完全没有音频输入
• 权重 — GPT-Live-1:闭源,仅提供托管服务,只有一个模型 ID,且没有带日期的快照版本;相比之下,Breeze TTS 2:自 2026 年 8 月 25 日起在 Hugging Face 上提供 30 亿参数,PyTorch 推理代码采用 Apache-2.0 许可
• 许可 — GPT-Live-1:通过 OpenAI 的 API 提供商业条款,无需审查;而 Breeze TTS 2:一份涵盖权重、微调、LoRA、合并、量化及自托管输出的研究与非商业许可
• 价格单位 — GPT-Live-1:每语音分钟 $0.05,按秒计费,推理后端单独计量;相比之下 Breeze TTS 2:在托管端点上每百万字符 $34,在最高公开套餐下递减至 $28
• 质量证据 — GPT-Live-1:在 Artificial Analysis 语音到语音指数上达到 70.3%,在十四个获得评分的模型中并列第六;相比之下,Breeze TTS 2 在 Provider Voices 竞技场中取得 1,205 Elo,总排名第七,并在开放权重模型中排名第一,据 Artificial Analysis 称
• 语言 — GPT-Live-1:发布报道一致指出,其在主要语言之外的流利度参差不齐;相比之下 Breeze TTS 2:厂商声称支持 50 种语言,而模型卡仅标注了英语和中文
• 语音控制 — GPT-Live-1:十二种 API 音色,语气和语速由提示词控制,完全不支持克隆;而 Breeze TTS 2 则支持:参考音频克隆、无参考音频的语音设计、语音指导,以及内联人声事件
• 吞吐量 — GPT-Live-1:按并发会话计量,层级1上限为25,层级5上限为500,且无免费层级;对比 Breeze TTS 2:根据 Artificial Analysis 的测量,大约每秒45个字符,这比几个商业竞争对手慢,并且对长篇幅工作很重要。

许可证干的活比排行榜更多
BreezeBlue 自家的模型卡在这一点上异常直白,这对公司来说值得称赞。推理代码采用 Apache-2.0 许可。权重以及你通过自行托管它们所生成的任何输出,均限于研究用途;商业部署则需要付费的托管订阅或书面授权。该限制明确延伸至衍生模型、LoRA、合并模型和量化模型——这就堵住了人们通常会钻的空子。
所以,“开放权重领军者”这一说法需要一个新闻标题很少会带上的限定条件。Breeze TTS 2 的开放,是指你可以下载它、检查它、对它做基准测试,并在自己的硬件上运行它进行评估。它的不开放,则是指它不能让一家初创公司在不向 BreezeBlue 付费或不做法律审查的情况下,基于它构建产品。人们说开放权重时通常指的三件事里,有两件——可验证性和成本——你能得到。第三件——自由发布——你得不到。
这与像 GPT-Live-1 这样的模型有着真正的区别:在那种模型里,许可问题不是“我可不可以”,而是“多少钱”。两者最终都会带来一笔账单。只不过其中一个会先以一份律师意见收场。

这两个价格单位无法比较,以下是算术计算。
每分钟 $0.05 和每百万字符 $34 看起来像是活在两个不同的宇宙里——因为它们确实如此。要想比较两者,你必须先做换算。语音的速度大约是每分钟 150 个词,而英语在计入空格后平均每个词约为五个半字符,所以一分钟的语音输出大约是 800 到 900 个字符。按 Breeze TTS 2 每百万字符 $34 的价格,这相当于每分钟约三美分的合成成本——单就原始语音而言,比 GPT-Live-1 的五美分更便宜。
对比在紧接着的下一刻就站不住脚了,因为 GPT-Live-1 的五美分里包含了聆听。它同时还在转写来电者的话、判断话轮何时结束,并处理打断——这些工作级联方案得从别处花钱买来:一个语音识别模型、一个话轮检测模型,以及一个用来生成 Breeze TTS 2 将要朗读的文本的语言模型。把这些都算进去,级联合成那三美分的成本,就落在一张通常比端到端模型更贵的账单之下了。
诚实的总结是:更便宜的语音是 Breeze TTS 2,更便宜的对话是 GPT-Live-1,而这两种说法之间的差异,正是语音智能体实际成本的全部所在。

他们实际会相遇的地方
如今,一支正在打造电话代理、又不愿绑定某一家供应商端到端技术栈的团队,恰好会搭出这样一条级联:用 Breeze TTS 2 或同类引擎当嘴,用别的东西当耳朵,再用一个经过路由的语言模型来思考。这三者中的最后一环,是最常发生变化的部分——它的质量提升最快,成本波动最大,而且这一季度胜出的模型,很少也是下一季度胜出的那个。
那一层是普通的 API 调用,也是这套技术栈中唯一值得保持可移植的部分。大约来自十一家上游提供商的 190 个模型以提供商标价、零加价的方式,统一通过一个 OrcaRouter 密钥访问,因此更换语音代理背后的推理模型只是一项配置变更,而不是一个集成项目;自动故障转移还能避免后端超时导致通话中断。GPT-Live-1 的 Live Sessions 端点和 Breeze TTS 2 的托管 API 都无法通过这种方式访问——本次对比中的语音层不在路由层的覆盖范围内,这一点值得说清楚,而不应暗示并非如此。
该选哪一个
如果对话本身就是产品,并且你能接受托管、封闭的前端,那就选择 GPT-Live-1。预订热线、一线支持,以及任何来电者打断座席属于常态而非例外的情况。你购买的是打断处理能力,而且是以按分钟计费、保持可预测的价格购买,而背后的推理部分才是由你来调优的。
如果你需要一个可以检查的语音,如果你正在打造一款产品、而语音合成只是其中众多组件之一,或者你需要 GPT-Live-1 完全不提供的克隆和语音设计功能,那就选择 Breeze TTS 2。事先要明白:这些权重仅供研究使用;50 种语言的说法属于厂商宣称,而对应的模型卡上标注的却只有两种语言;延迟数据是 BreezeBlue 自己在预热快速路径上的测量结果,而非独立审计。
把这件事当作一场质量竞赛,是一种错误的本能。Breeze TTS 2 在它所竞争的榜单上接近顶端,而 GPT-Live-1 完全是在另一个榜单上竞争。真正花钱的决定,是两者之下的那个决定:由哪个模型来思考,以及你是否能在一个下午之内改变主意。
