
GPT-Live-1 對決 Breeze TTS 2:你無法交付的開放權重語音領導者
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
Breeze TTS 2 是 Artificial Analysis 的 Provider Voices Speech Arena 上評分最高的開放權重文字轉語音模型,持有 1,205 Elo,在超過一百個受評系統中總排名第七——領先所有公開發布權重的商業授權引擎。其權重自 2026 年 8 月 25 日起即可下載。而依這些權重隨附的授權條款,它也無法用於任何產品之中。GPT-Live-1 則在每個面向上都是完全相反的取捨:封閉、託管,自 2026 年 9 月 10 日登上 OpenAI 開發者 API 以來,語音計費為每分鐘 0.05 美元,而且是兩者之中唯一能察覺來電者打斷它的模型。
把那兩句話並排放在一起,這個比較就比大多數模型對決更快分出高下。這不是在爭論誰能合成出更好的語音。而是在爭論你買的究竟是一個聲音,還是一場對話,以及「開放」是否真的意味著你所以為的意思。
它們不是同一類事物,而這正是重點所在。
Breeze TTS 2 來自一家名為 BreezeBlue、約十五人的新創公司,是一個 30 億參數的文字轉語音模型。文字輸入,音訊輸出。它什麼都聽不到。它對一個回合應該何時結束沒有任何意見,因為它根本沒有回合的概念。透過 WebSocket 串流時,它會在你的文字還沒生成完之前就開始產生音訊,這對於讓語音代理的節奏保持緊湊確實很實用——但何時該開口的決定,是由寫出那段文字的東西所做出的。
GPT-Live-1 是一款全雙工語音轉語音模型。音訊與文字輸入;音訊與文字輸出;而模型每秒會多次決定要繼續聆聽、暫停、接過話輪,還是讓出話輪。OpenAI 自家隨發布一同公布、未在公司外部重製的 Full Duplex Bench v1.5 數據顯示,其互動性為 80.1%,相較 GPT-Realtime-2.1 的 45.4%;輪替發言延遲為 0.798 秒,對比之下為 1.41 秒。
這種不對稱並不是在貶低 Breeze TTS 2。它是一項警告,指出各自在堆疊中應該放在哪裡。如果你正在打造串接式系統——語音辨識接上語言模型,再接上合成器——Breeze TTS 2 是其中最後三分之一環節的候選者。如果你買的是 GPT-Live-1,你買的是整個迴路,同時也把輪流發言的邏輯一併交了出去。
逐維度地
• 互動模式 — GPT-Live-1:全雙工、原生插話、邊說邊聽,對比 Breeze TTS 2:串流文字轉語音,完全沒有音訊輸入
• 權重 — GPT-Live-1:封閉、僅託管,單一模型 ID 且無帶日期的快照,對比 Breeze TTS 2:自 2026 年 8 月 25 日起在 Hugging Face 上提供 30 億參數,PyTorch 推論程式碼 Apache-2.0
• 授權 — GPT-Live-1:透過 OpenAI 的 API 取得商業條款,沒什麼需要審查;相較於 Breeze TTS 2:涵蓋權重、微調、LoRA、合併、量化與自架輸出的研究與非商業授權
• 價格單位 — GPT-Live-1:每語音分鐘 $0.05,按秒計費,推理後端另行計量;對比 Breeze TTS 2:在代管端點上每百萬字元 $34,於最高階公開方案降至 $28
• 品質佐證 — GPT-Live-1:在 Artificial Analysis 語音對語音指數上達到 70.3%,於十四個受評模型中並列第六;相較之下,Breeze TTS 2 在 Provider Voices 競技場獲得 1,205 Elo,整體排名第七,並在開放權重模型中位居第一(資料來源:Artificial Analysis)
• 語言 — GPT-Live-1:發布報導一致指出,在主要語言之外的流暢度不均,相較於 Breeze TTS 2:廠商聲稱支援 50 種語言,而模型卡標示為英文與中文
• 語音控制 — GPT-Live-1:十二種 API 語音,語氣與語速由提示詞操控,完全不做複製;對比 Breeze TTS 2:參考音訊複製、免參考語音設計、語音指導,以及內嵌人聲事件
• 吞吐量 — GPT-Live-1:以並行工作階段計量,第 1 級上限為 25,第 5 級上限為 500,且沒有免費層級;對比 Breeze TTS 2:依 Artificial Analysis 的測量,約每秒 45 個字元,這比數家商業競爭對手慢,對長篇內容工作有影響

許可證比排行榜還更賣力。
BreezeBlue 自家的模型卡對此異常直白,這點值得肯定該公司。推理程式碼採用 Apache-2.0 授權。權重以及你透過自行託管這些權重所生成的任何輸出,僅供研究用途;若要商業部署,則需要付費的託管訂閱或書面授權。這項限制明確延伸至衍生模型、LoRAs、合併模型與量化版本——這堵住了人們通常會鑽的漏洞。
所以「開放權重領導者」這種說法,需要一個標題很少會帶上的限定條件。Breeze TTS 2 的開放,在於你可以下載它、檢視它、對它做基準測試,並在自己的硬體上執行以進行評估。但它並不是那種能讓新創公司不必付錢給 BreezeBlue、也不必買法律審查,就能據以打造產品的開放。人們講到開放權重時所指的三件事當中,有兩件——可驗證性和成本——你得到了。第三件——自由推出產品——你沒有。
這和像 GPT-Live-1 這樣的模型有真正差別:在那裡,授權問題不是「我可以嗎」,而是「多少錢」。兩者最終都會變成一張帳單。只有其中一個會先以律師的意見收場。

這兩個價格單位無法互相比較,因此以下是計算。
$0.05 每分鐘和 $34 每百萬字元,看起來像是活在不同的宇宙裡,因為它們確實如此。若要比較兩者,你得先換算。語音速度大約是每分鐘 150 個單字,而英語在把空格算進去後,平均每個單字約 5.5 個字元,所以一分鐘的口語輸出大約是 800 到 900 個字元。以 Breeze TTS 2 每百萬字元 $34 的價格來算,那大約是每分鐘 3 美分的合成成本——單就原始語音而言,比 GPT-Live-1 的 5 美分便宜。
這個比較緊接著就站不住腳了,因為 GPT-Live-1 的五分錢裡包含了聆聽這回事。它同時也在轉錄來電者的話、判斷對話輪次何時結束,並處理插話——這些工作,串接式架構得從別的地方買來:一個語音辨識模型、一個輪次偵測模型,以及一個語言模型來產生 Breeze TTS 2 要念出的文字。把這些算進去,串接式架構那三分錢的語音合成,就墊在一張通常比端到端模型的帳單還大的帳單底下。
誠實的總結是,較便宜的語音是 Breeze TTS 2,較便宜的對話是 GPT-Live-1,而這兩種說法之間的差異,正是語音代理實際成本的全貌。

他們實際上會碰面的地方
如今正在打造電話代理、卻不願綁定單一供應商端到端堆疊的團隊,拼出來的正是這樣一串架構:嘴巴用 Breeze TTS 2 或同級引擎,耳朵用另一套東西,思考則交給一個經路由的語言模型。三者之中最後一項是最常變動的一環——品質在那裡進步得最快、成本在那裡變動得最大,而本季勝出的模型,到了下一季往往不再是贏家。
那一層是正常的 API 呼叫,也是這套技術堆疊中唯一值得保持可攜的部分。大致上來自十一家上游供應商的 190 個模型,以供應商定價、零加成的方式,置於單一 OrcaRouter 金鑰之後,因此替換語音代理背後的推理模型只是設定變更,而非整合專案;自動容錯移轉也能避免逾時的後端導致通話中斷。GPT-Live-1 的 Live Sessions 端點和 Breeze TTS 2 的託管 API 都無法透過這種方式觸及——本次比較中的語音層級位於路由層的觸及範圍之外,這一點值得說清楚,而不是暗示並非如此。
該選哪一個
如果對話本身就是產品,而你能接受託管、封閉的前端,就選 GPT-Live-1。訂位專線、第一線支援,任何來電者插話打斷客服人員是常態而非例外的情況。你買的是插話處理能力,而且是以每分鐘費率購買,這個費率保持可預測,而背後的推理則是你調校的部分。
如果你需要一個可以檢查的語音、如果你正在打造一款產品而語音合成只是眾多元件之一,或者你需要 GPT-Live-1 完全沒有提供的複製與語音設計功能,那就選擇 Breeze TTS 2。心裡要先有數:這些權重僅供研究用途;50 種語言的宣稱是廠商說法,而模型卡卻只標註了兩種語言;延遲數據是 BreezeBlue 自己在預熱過的快速路徑上測得的,並非獨立稽核的結果。
把這件事當成品質競賽的直覺,是錯誤的直覺。Breeze TTS 2 在它所屬的競爭盤面上已接近頂端,而 GPT-Live-1 完全是在另一個盤面上競爭。真正會讓你付出金錢代價的決策,是位於兩者之下的那個決策:由哪個模型負責思考,以及你是否能在一個下午之內改變心意。
