
Breeze TTS 2:以 1,215 Elo 成為新的開放權重 TTS 領導者
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 523 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 187 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
{{1}}Breeze TTS 2 現在是 Artificial Analysis 的 Provider Voices Speech Arena 中排名最高的開放權重文字轉語音模型,{{2}}擁有 1,215 Elo——比先前的開放權重領導者 Fish Audio S2 Pro 高出 90 分,並且在超過 100 個受評系統中整體排名第 6。{{3}}這項排名是對 BreezeBlue 自 2026 年 8 月中旬發布該模型以來所宣稱內容的首次獨立確認:{{4}}一個來自約 15 人新創公司的兩週齡語音模型,能夠與商業級文字轉語音前沿技術並駕齊驅。{{5}}開放權重於 2026 年 8 月 25 日上傳至 Hugging Face;{{6}}競技場結果在一天之內隨之而來。{{7}}無論 Breeze TTS 2 最終會成為什麼,它都不再只是供應商的承諾——{{8}}它有 Elo 積分為證。
按順序,實際發生的事情
時間線在這裡很重要,因為它解釋了為什麼一篇關於「開放權重排行榜」的文章會來自一家三週前大多數人從未聽過的公司。BreezeBlue 由楊斌創立,他是中國頂尖人工智慧實驗室之一的技術聯合創辦人,種子輪融資600萬美元,由元璟資本和紅點中國領投。該模型經歷了三個明顯的里程碑:
• 2026年8月7日 — BreezeBlue 在 Hugging Face 上發布了自家用於語音設計、語音導演及延遲評估的文字轉語音基準測試套件。
• 2026年8月16日至17日——該公司正式宣布Breeze TTS 2作為面向互動媒體的即時旗艦語音模型,並開放了託管API,價格為每100萬字元34美元。
• 2026年8月25日 — 權重與 PyTorch 推論程式碼已在 Hugging Face 上以 BreezeBlue/Breeze-TTS-2 開源,這是一個採用研究及非商業用途授權的 3B 參數模型。
Artificial Analysis Provider Voices 排名在開放權重釋出後數天內便已上線。由於競技場是透過盲測並排聆聽來為模型評分,1,215 的 Elo 並非 BreezeBlue 自行執行的基準測試——而是聽眾比較真實樣本後累積的判斷,而這正是這個年輕模型最缺乏的。
計分板

• 競技場排名 — 在 Provider Voices 中整體排名第 6;在所有開放權重模型中排名第 1,領先 Fish Audio S2 Pro(1,125 Elo)。
• Elo — 1,215,95% 信賴區間約為 ±17(Artificial Analysis,截至 2026 年 8 月下旬)。
• 語言 — 50 種,根據 BreezeBlue;模型卡標記為英語和中文。
• 價格 — BreezeBlue 的託管端點上每 1M 字元 34 美元;開放權重可免費下載,但附帶非商業授權。
• 速度 — 根據 Artificial Analysis 的測量,每秒約 45 個字元 — 比數個競爭對手慢,這對長篇任務而言很重要。
• 延遲——低於 40 毫秒的串流延遲,據 BreezeBlue 所述(廠商聲稱,未經獨立測量)。

Breeze TTS 2 實際上有何不同之處
Elo 佔據了頭條,但產品主張比分數更有意思。Breeze TTS 2 圍繞兩個大多數文字轉語音模型視為次要考量的概念而建構:語音設計與語音導向。語音設計是零樣本且無需參考的——你可以用自然語言描述一種聲音(「一位溫暖、四十多歲的敘述者,帶點輕微的南方拖腔和冷面幽默」),模型便會生成該聲音,無需錄音室錄製或參考片段。語音導向將說話者的音色與表達意圖解耦,因此你可以讓一句台詞聽起來諷刺、輕聲或急促,而不會讓模型漂移到不同的角色。BreezeBlue 表示,同一說話者身分在轉換後依然保持,其自家的語音導向基準報告的說話者相似度為 0.67 SPK_SIM(廠商報告)。
這兩項能力彰顯了 Breeze TTS 2 鎖定的目標市場。新聞資料說得很明確:電玩角色、數位夥伴、敘事故事、廣播劇、虛擬直播主——長篇、角色驅動、多角色的音訊內容,而不只是另一個旁白 API。該公司隨附了一個名為 Voice Galaxy 的語音庫,收錄超過 15,000 個由社群與工作室打造的角色語音;BreezeBlue 的示範片是一段長度超過十分鐘的多角色粉絲廣播劇。在其自行發布的基準測試中(供應商自報、未經複現),Breeze TTS 2 宣稱在文字轉語音 Voice Design 基準上拿下第一名,角色適配分數為 78.02,對比 MiMo-V2.5-TTS 的 72.78;語音方向綜合指數為 4.25。
授權星號
在「開放權重」一詞被過度用作行銷話術之前,請閱讀模型卡。Breeze TTS 2 有 3B 參數,採用 safetensors、F32/BF16,而原始碼為 Apache 2.0——但權重、衍生模型及自架輸出僅在 breezeblue-research-and-non-commercial-license 之下授權為研究與非商業用途。這表示這裡的「開放權重」並非「可免費用於你的產品」。依授權條款文字,商業自架並不被允許;商業途徑是每 1M 字元 $34 的託管 API。這與其他幾個 2026 年的開放釋出模式相同——可供檢查與自架以進行研究,但能產生收益的用途則保留給供應商自己的端點。
為何路由器對如此年輕的模型很重要
Breeze TTS 2 目前真正的風險不在品質,而在於它的資歷。模型上線十天,權重釋出兩天。任何生產團隊都不該在沒有撤離方案的情況下,把語音管線押在一個這麼新的模型上——而這正是路由層存在所要吸收的失敗模式。如果你透過一個把廠商端點視為眾多路由之一的閘道器來評估 Breeze TTS 2,你今天就拿到 Elo 排行榜的領先者;當 API 效能低落時自動故障轉移到備援供應商;若一個一週大的模型出現回歸,只需改一行程式碼。這正是路由 DSL 套用於任何模型的紀律:將它與替代方案組合、保持介面穩定,並讓模型先證明自己,然後才讓它承擔重任。這個系列目前還沒有任何模型真正路由在 OrcaRouter 上,所以最誠實的建議是:把 Breeze TTS 2 接入你已運行的閘道器——並讓現有供應商與之並行運作,直到 Elo 數據越來越成熟、越來越可信為止。
接下來要看什麼
今天的話題是 Provider Voices 的 #1 開放權重名次,但對這個模型來說,它是兩個競技場中較弱的一個。在 Artificial Analysis 的 Controlled Voice 競技場中,所有模型都在相同的固定參考語音下進行比較,Breeze TTS 2 在開放權重模型中排名第 3,Elo 為 1,002,落後於 Mistral 的 Voxtral(1,010)——並在總共 39 個模型中排名第 16。其 Provider Voices 分數(1,215,開放權重第 1)與 Controlled Voice 分數(1,002,開放權重第 3)之間的差距值得關注:這表明 Breeze TTS 2 的優勢集中在它為自己設計的語音上,而這正是產品的賣點,也正是一個獨立基準應該持續施壓的地方。觀察 Controlled Voice 的 Elo 是否會向 Provider Voices 的分數靠攏、商業授權是收緊還是放寬,而且——最重要的是——是否有人會在 BreezeBlue 自己的測試套件之外,重現語音設計與語音方向的基準測試。
對於一個一個月前還不存在的模型來說,Breeze TTS 2 已經贏得了文字轉語音模型所能贏得的最有用的東西:一個與行銷宣傳相符的獨立評分。它是否會成為互動產品的預設語音,與其說取決於下一次 Elo 更新,不如說取決於授權和自行託管方案的發展——但截至本週,開放權重的文字轉語音已有新的領導者,而它才兩週大。

