“GPT-Live-1 vs Breeze TTS 2”的主视觉标题卡,副标题为“一段对话还是一种声音——而只有其中一项会产生账单”,配有三张卡片,分别写着“GPT-Live-1:每语音分钟 $0.05,不开放权重,边说边听”“Breeze TTS 2:3B 开放权重,1,205 Elo,仅限研究许可”“决定这一局的是许可证,而非 Elo”,卡片下方是一条页脚横幅,写着“Breeze TTS 2 的竞技场数据来自 Artificial Analysis;GPT-Live-1 的数据由 OpenAI 提供”。OrcaRouter 标志合成在右下角。
Guides & Insights

GPT-Live-1 vs Breeze TTS 2:你无法发布的开放权重语音领导者

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Breeze TTS 2 是 Artificial Analysis 的 Provider Voices Speech Arena 上评分最高的开放权重文本转语音模型,拥有 1,205 Elo,在超过一百个已评分系统中总排名第七——领先于所有会公开权重的商业授权引擎。其权重自 2026 年 8 月 25 日起即可下载。同时,根据这些权重所附带的许可证,它无法用于产品中。GPT-Live-1 则在每个维度上都是相反的取舍:闭源、托管,自 2026 年 9 月 10 日登陆 OpenAI 的开发者 API 以来,按每分钟语音 0.05 美元计费,并且是两者中唯一能听到来电者打断自己的那个。

把这两句话并排放在一起,对比就会比大多数模型对决更快地见分晓。这不是一场争论谁合成语音更出色的较量。这是一场争论:你买到的是一个声音,还是一场对话;以及“开放”是否真的意味着你所以为的意思。

它们不是同一种东西,而这正是关键所在

Breeze TTS 2 来自一家名为 BreezeBlue、约十五人的初创公司,是一个拥有 30 亿参数的文本转语音模型。输入文本,输出音频。它什么也听不见。它对一轮对话该在何时结束没有任何看法,因为它根本没有“轮次”的概念。通过 WebSocket 流式传输时,它会在你的文本还没生成完就开始输出音频,这对于让语音智能体保持紧凑的节奏确实很有用——但何时开口说话,是由写出这段文本的东西决定的。

GPT-Live-1 是一款全双工语音到语音模型。音频和文本输入,音频和文本输出;模型每秒会多次决定是继续聆听、暂停、接过话轮,还是让出话轮。OpenAI 自家的 Full Duplex Bench v1.5 数据随此次发布一并公布,且未在公司外部复现,其交互性得分为 80.1%,而 GPT-Realtime-2.1 为 45.4%;话轮转换延迟为 0.798 秒,对比后者为 1.41 秒。

这种不对称并不是对 Breeze TTS 2 的贬低。它是在提醒你,二者在技术栈中各自应处于什么位置。如果你正在构建一条级联流程——语音识别输送给语言模型,语言模型再输送给合成器——那么 Breeze TTS 2 是最后三分之一环节的候选。如果你购买的是 GPT-Live-1,你买下的是整个闭环,并随之把轮流发言逻辑也交了出去。

逐个维度

• 交互模式 — GPT-Live-1:全双工、原生打断、边说边听,对比 Breeze TTS 2:流式文本转语音,完全没有音频输入

• 权重 — GPT-Live-1:闭源,仅提供托管服务,只有一个模型 ID,且没有带日期的快照版本;相比之下,Breeze TTS 2:自 2026 年 8 月 25 日起在 Hugging Face 上提供 30 亿参数,PyTorch 推理代码采用 Apache-2.0 许可

• 许可 — GPT-Live-1:通过 OpenAI 的 API 提供商业条款,无需审查;而 Breeze TTS 2:一份涵盖权重、微调、LoRA、合并、量化及自托管输出的研究与非商业许可

• 价格单位 — GPT-Live-1:每语音分钟 $0.05,按秒计费,推理后端单独计量;相比之下 Breeze TTS 2:在托管端点上每百万字符 $34,在最高公开套餐下递减至 $28

• 质量证据 — GPT-Live-1:在 Artificial Analysis 语音到语音指数上达到 70.3%,在十四个获得评分的模型中并列第六;相比之下,Breeze TTS 2 在 Provider Voices 竞技场中取得 1,205 Elo,总排名第七,并在开放权重模型中排名第一,据 Artificial Analysis 称

• 语言 — GPT-Live-1:发布报道一致指出,其在主要语言之外的流利度参差不齐;相比之下 Breeze TTS 2:厂商声称支持 50 种语言,而模型卡仅标注了英语和中文

• 语音控制 — GPT-Live-1:十二种 API 音色,语气和语速由提示词控制,完全不支持克隆;而 Breeze TTS 2 则支持:参考音频克隆、无参考音频的语音设计、语音指导,以及内联人声事件

• 吞吐量 — GPT-Live-1:按并发会话计量,层级1上限为25,层级5上限为500,且无免费层级;对比 Breeze TTS 2:根据 Artificial Analysis 的测量,大约每秒45个字符,这比几个商业竞争对手慢,并且对长篇幅工作很重要。

A two-column comparison scoreboard titled 'GPT-Live-1 vs Breeze TTS 2 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Weights: closed, hosted only', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Interactivity: 80.1% (vendor, unreproduced)', 'Voices: 12 presets, no cloning'. The right column, labelled Breeze TTS 2, reads 'Kind: streaming text-to-speech', 'Price: $34 per 1M characters hosted', 'Weights: 3B on Hugging Face, research licence', 'Independent score: 1,205 Elo, 7th of 100+ on the AA Provider Voices arena', 'Latency: p50 133.6 ms time to first audio (vendor)', 'Voices: cloning, voice design, inline events'. The footer reads 'GPT-Live-1 interactivity OpenAI-reported and unreproduced; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

许可证干的活比排行榜更多

BreezeBlue 自家的模型卡在这一点上异常直白,这对公司来说值得称赞。推理代码采用 Apache-2.0 许可。权重以及你通过自行托管它们所生成的任何输出,均限于研究用途;商业部署则需要付费的托管订阅或书面授权。该限制明确延伸至衍生模型、LoRA、合并模型和量化模型——这就堵住了人们通常会钻的空子。

所以,“开放权重领军者”这一说法需要一个新闻标题很少会带上的限定条件。Breeze TTS 2 的开放,是指你可以下载它、检查它、对它做基准测试,并在自己的硬件上运行它进行评估。它的不开放,则是指它不能让一家初创公司在不向 BreezeBlue 付费或不做法律审查的情况下,基于它构建产品。人们说开放权重时通常指的三件事里,有两件——可验证性和成本——你能得到。第三件——自由发布——你得不到。

这与像 GPT-Live-1 这样的模型有着真正的区别:在那种模型里,许可问题不是“我可不可以”,而是“多少钱”。两者最终都会带来一笔账单。只不过其中一个会先以一份律师意见收场。

A screenshot of the Hugging Face model card for BreezeBlue/Breeze-TTS-2, showing the tags 'Text-to-Speech', Transformers, Safetensors, PyTorch, English and Chinese, the licence label 'breezeblue-research-and-non-commercial-license', the notice 'Source code is licensed under Apache 2.0. Breeze TTS 2 model weights, derivative models, and self-hosted outputs are for research and non-commercial use only', a news entry dated 2026.08.25 reading 'We release Breeze TTS 2 model weights and the PyTorch inference code', the claim that it 'ranks #1 among open-weight models on the Artificial Analysis TTS leaderboard', a model size of 3B params with F32 and BF16 tensor types, and the note 'This model isn't deployed by any inference provider'.

这两个价格单位无法比较,以下是算术计算。

每分钟 $0.05 和每百万字符 $34 看起来像是活在两个不同的宇宙里——因为它们确实如此。要想比较两者,你必须先做换算。语音的速度大约是每分钟 150 个词,而英语在计入空格后平均每个词约为五个半字符,所以一分钟的语音输出大约是 800 到 900 个字符。按 Breeze TTS 2 每百万字符 $34 的价格,这相当于每分钟约三美分的合成成本——单就原始语音而言,比 GPT-Live-1 的五美分更便宜。

对比在紧接着的下一刻就站不住脚了,因为 GPT-Live-1 的五美分里包含了聆听。它同时还在转写来电者的话、判断话轮何时结束,并处理打断——这些工作级联方案得从别处花钱买来:一个语音识别模型、一个话轮检测模型,以及一个用来生成 Breeze TTS 2 将要朗读的文本的语言模型。把这些都算进去,级联合成那三美分的成本,就落在一张通常比端到端模型更贵的账单之下了。

诚实的总结是:更便宜的语音是 Breeze TTS 2,更便宜的对话是 GPT-Live-1,而这两种说法之间的差异,正是语音智能体实际成本的全部所在。

A screenshot of the Artificial Analysis Provider Voices speech arena leaderboard, ranking text-to-speech models by blind-listener Elo. The table runs Cartesia Sonic 3.6 first on 1,275 Elo from 1,755 samples and $49.0 per million characters, then Inworld Realtime TTS-2 at 1,244, Speechify Simba 3.2 at 1,233 and Qwen-Audio-3.0-TTS-Plus at 1,232, down to BreezeBlue Breeze TTS 2 at 1,205 Elo from 1,227 samples, seventh overall, carrying the only Open Weights badge in the top ten at $34.0 per million characters with an August 2026 release date.

他们实际会相遇的地方

如今,一支正在打造电话代理、又不愿绑定某一家供应商端到端技术栈的团队,恰好会搭出这样一条级联:用 Breeze TTS 2 或同类引擎当嘴,用别的东西当耳朵,再用一个经过路由的语言模型来思考。这三者中的最后一环,是最常发生变化的部分——它的质量提升最快,成本波动最大,而且这一季度胜出的模型,很少也是下一季度胜出的那个。

那一层是普通的 API 调用,也是这套技术栈中唯一值得保持可移植的部分。大约来自十一家上游提供商的 190 个模型以提供商标价、零加价的方式,统一通过一个 OrcaRouter 密钥访问,因此更换语音代理背后的推理模型只是一项配置变更,而不是一个集成项目;自动故障转移还能避免后端超时导致通话中断。GPT-Live-1 的 Live Sessions 端点和 Breeze TTS 2 的托管 API 都无法通过这种方式访问——本次对比中的语音层不在路由层的覆盖范围内,这一点值得说清楚,而不应暗示并非如此。

该选哪一个

如果对话本身就是产品,并且你能接受托管、封闭的前端,那就选择 GPT-Live-1。预订热线、一线支持,以及任何来电者打断座席属于常态而非例外的情况。你购买的是打断处理能力,而且是以按分钟计费、保持可预测的价格购买,而背后的推理部分才是由你来调优的。

如果你需要一个可以检查的语音,如果你正在打造一款产品、而语音合成只是其中众多组件之一,或者你需要 GPT-Live-1 完全不提供的克隆和语音设计功能,那就选择 Breeze TTS 2。事先要明白:这些权重仅供研究使用;50 种语言的说法属于厂商宣称,而对应的模型卡上标注的却只有两种语言;延迟数据是 BreezeBlue 自己在预热快速路径上的测量结果,而非独立审计。

把这件事当作一场质量竞赛,是一种错误的本能。Breeze TTS 2 在它所竞争的榜单上接近顶端,而 GPT-Live-1 完全是在另一个榜单上竞争。真正花钱的决定,是两者之下的那个决定:由哪个模型来思考,以及你是否能在一个下午之内改变主意。