Breeze TTS 2 —— 开放权重 TTS 的新领导者,Elo 1,215。重新生成的插图。
Guides & Insights

Breeze TTS 2:以 1,215 Elo 分领跑的新开源权重 TTS 模型

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Breeze TTS 2 现在是 Artificial Analysis 的 Provider Voices Speech Arena 上排名最高的开放权重文本转语音模型,Elo 达到 1,215——比之前的开放权重领跑者 Fish Audio S2 Pro 高出 90 分,在 100 多个受评系统中总排名第 6。这是 BreezeBlue 自 2026 年 8 月中旬发布该模型以来所宣称内容的首次独立证实:一个来自约 15 人初创公司的、问世仅两周的语音模型,可以与商业文本转语音的前沿产品比肩。开放权重于 2026 年 8 月 25 日上线 Hugging Face;榜单结果在一天之内便随之出炉。无论 Breeze TTS 2 最终还会展现出什么,它都不再只是厂商的承诺——它有一个 Elo 评分可以作证。

实际发生了什么,按顺序来。

时间线在这里很重要,因为它解释了为什么一封“开放权重排行榜”的帖子来自一家三周前大多数人还没听说过的公司。BreezeBlue由杨斌创立——他是中国领先的人工智能实验室之一的前技术联合创始人——创立时获得了一轮600万美元的种子融资,由元璟资本和红点中国领投。该模型经历了三个明显的里程碑:

• 2026年8月7日 — BreezeBlue 在 Hugging Face 上发布了其自己的文本转语音基准测试套件,用于语音设计、语音方向和延迟评估。

• 2026年8月16日至17日——该公司正式宣布Breeze TTS 2作为面向交互媒体的实时旗舰语音模型,并推出了托管API,价格为每100万字符34美元。

• 2026年8月25日——权重和PyTorch推理代码以BreezeBlue/Breeze-TTS-2的形式在Hugging Face上开源,这是一个3B参数模型,采用研究与非商业许可。

The Artificial Analysis Provider Voices ranking was live within days of the open-weights release. Because the arena rates models on blind side-by-side listening, the 1,215 Elo is not a benchmark BreezeBlue ran on itself — it is the accumulated judgement of listeners comparing real samples, which is exactly what a model this young lacks most.

记分牌

A single-column scoreboard titled 'Breeze TTS 2 — the scoreboard' showing arena rank #6 overall and #1 open weights, Elo 1,215, 50 languages, price $34 per 1M characters, speed ~45 chars/s, and sub-40ms streaming latency (vendor-stated), with a footer noting Elo is per Artificial Analysis.

• 竞技场排名——在 Provider Voices 中总排名第 6;在开放权重模型中排名第 1,领先 Fish Audio S2 Pro(1,125 Elo)。

• Elo — 1,215,95% 置信区间约为 ±17(Artificial Analysis,截至2026年8月下旬)。

• 语言 — 50,根据BreezeBlue;模型卡片标记为英语和中文。

• 价格 — 在BreezeBlue托管端点上每100万字符34美元;开放权重可免费下载,但附带非商业许可。

• 速度——根据 Artificial Analysis 的测量,每秒约 45 个字符——比几个竞争对手慢,这对长文本任务很重要。

• 延迟——低于40毫秒的流式传输延迟,据BreezeBlue(厂商声明,未经独立测量)。

A screenshot of the Artificial Analysis Provider Voices Speech Arena leaderboard (captured August 26 2026) showing BreezeBlue Breeze TTS 2 ranked #6 at 1,215 Elo with an Open Weights tag, behind Cartesia Sonic 3.6 (1,283) and Qwen-Audio-3.0-TTS-Plus (1,238), with ElevenLabs Eleven v3 further down at 1,177, each row listing provider API price per 1M characters.

Breeze TTS 2 到底有何不同

Elo 登上了头条,但产品宣称比分数更有意思。Breeze TTS 2 围绕大多数文本转语音模型视若次要的两个理念构建:语音设计和语音方向。语音设计是零样本且无需参考的——你用一种自然语言描述声音(“一位温暖、四十多岁、带点南方拖腔和冷幽默的旁白”),模型就会在无需录音室录音或参考音频片段的情况下生成这种声音。语音方向将说话人的音色与表达意图解耦,因此你可以让一句台词听上去带讽刺、轻声或急促,而不会让模型漂移成不同的角色。BreezeBlue 表示,同一说话人身份在转换后依然保持不变,其自己的语音方向基准测试报告了 0.67 的说话人相似度(SPK_SIM,厂商自述)。

这两项能力指向了 Breeze TTS 2 的目标市场。新闻材料中明确提到:视频游戏角色、数字伴侣、叙事故事、广播剧和虚拟主播——长篇、角色驱动、多角色的音频,而不仅仅是另一种旁白 API。该公司推出了一款名为 Voice Galaxy 的配套语音库,包含超过 15,000 个由社区和工作室打造的角色声音;而 BreezeBlue 的演示样带是一部时长超过十分钟的多角色粉丝广播剧。根据其自行发布的基准测试(供应商报告,未经复现),Breeze TTS 2 声称在文本转语音的 Voice Design 基准测试中位居第一,Role Fit 得分为 78.02,而 MiMo-V2.5-TTS 为 72.78,Voice Direction 综合得分为 4.25。

许可证星号

在“开放权重”这个词被过度用作营销话术之前,先读模型卡。Breeze TTS 2 拥有 3B 参数,采用 safetensors,支持 F32/BF16,并且源代码采用 Apache 2.0 许可证——但权重、衍生模型和自托管输出仅依照 breezeblue-research-and-non-commercial-license 获得研究与非商业用途的许可。这意味着这里的“开放权重”并不等于“你的产品可免费使用”。按许可证的书面规定,商业自托管不被允许;商业途径是托管 API,价格为每 100 万个字符 34 美元。这与 2026 年其它几个开放发布的形态相同——可供检查、可自托管用于研究,但创收用途保留给厂商自己的端点。

为什么路由器对这么年轻的模型很重要

Breeze TTS 2 当前真正的风险不是质量,而是它太新。模型已上线十天,权重发布两天。任何生产团队都不应该在没有退出路径的情况下,把语音管线押在一个这么年轻的模型上——而这正是路由层存在所要吸收的失效模式。如果你通过一个将供应商端点视为众多路由之一的网关来评估 Breeze TTS 2,你今天就能得到 Elo 领先者、API 降级时自动故障转移到备用提供商的机制,以及在模型仅有一周历史就出现回归时只需一行代码的变更。这与路由 DSL 应用于任何模型的纪律是一致的:与替代方案组合、保持接口稳定、在让它承担负载之前先让模型证明自己。该系列中还没有任何模型在 OrcaRouter 本身上路由,因此诚实的建议是:把 Breeze TTS 2 接入你已在运行的任何网关——并让你的现有提供商与之并行保持在线,让 Elo 数据随时间变得更成熟、更可信。

接下来看什么

今天的焦点是 Provider Voices 中 #1 开放权重的名额,但这是该模型在两个竞技场中表现较弱的一个。在 Artificial Analysis 的 Controlled Voice 竞技场中,所有模型都使用相同的固定参考语音进行比较,Breeze TTS 2 以 1,002 Elo 在开放权重模型中排名第 3,落后于 Mistral 的 Voxtral(1,010 Elo),在总共 39 个模型中总体排名第 16。其 provider-voice 得分(1,215,开放权重第 1)与 controlled-voice 得分(1,002,开放权重第 3)之间的差距值得关注:这表明 Breeze TTS 2 的优势集中在其为自己设计的语音上——这正是产品的卖点,同时也是独立基准测试应该持续施压的地方。要留意 controlled-voice Elo 是否会向 provider-voice 数值靠拢、商业许可是收紧还是放宽,以及——最重要的是——是否有人在 BreezeBlue 自己的测试套件之外重现语音设计与语音控制基准测试。

对于一个月前还不存在的模型,Breeze TTS 2 已经赢得了文本转语音模型所能赢得的最有用的东西:一个与营销宣传相符的独立评分。它是否会成为交互式产品的默认语音,与其说取决于下一次 Elo 更新,不如说取决于许可证和自托管方案如何演变——但截至本周,开源权重文本转语音有了新的领跑者,而它才问世两周。

A screenshot of the Hugging Face model card for BreezeBlue/Breeze-TTS-2 (captured August 26 2026) showing a 3B-parameter text-to-speech model tagged English and Chinese, the breezeblue-research-and-non-commercial license, and news entries for the August 25 2026 open-source release of the weights and inference code.