
GPT-Live-1 vs Qwen-Audio-3.0-TTS:對話與旁白並非同一回事
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式

把 GPT-Live-1 和 Qwen-Audio-3.0-TTS 在每小時音訊價格上並排比較,差距看起來具有決定性:Alibaba 的 Qwen-Audio-3.0-TTS-Plus 以每百萬字元 27.6 美元生成語音,約等於每小時 1.66 美元的音訊;而 OpenAI 的 GPT-Live-1 對一小時連續開放線路收費 3.00 美元。旁白比較便宜,所以旁白勝出——只不過,這是錯誤的比較,而它之所以錯誤,正是任何人能從這場對決中得到的最有用啟示。Qwen-Audio-3.0-TTS 是文字轉語音模型。GPT-Live-1 是全雙工對話模型。其中一個會朗讀你寫下的內容。另一個則必須每秒好幾次判斷你是否已經講完。
一者渲染,一者對話
文字轉語音會接收文字並回傳音訊。沒有輸入音訊,沒有輪次要接,沒有被打斷的概念,也沒有逐字稿要回傳,因為模型從未聽見任何東西。它的成本模型就像印刷機:頁面進、音訊出,品質與吞吐量是唯一重要的兩個數字,而且兩者都能在出貨前測量。
全雙工對話模型在產生輸出音訊的同時,也會處理傳入的音訊。它的工作包含對話中與字詞無關的部分——使用者停頓時跟著停頓、在「對啊」這類附和語出現時繼續進行而不是把它當成打斷、在句子講到一半時讓出發言權,以及觸發工具呼叫卻不中斷對話脈絡。GPT-Live-1 全都做得到,還會在 session 之外一併回傳語音辨識逐字稿,而它之所以能做到這點,正是因為它全程都在聆聽。
如果你的產品會朗讀文章、將文件轉換為音訊,或為影片旁白,那麼 GPT-Live-1 是錯誤的工具,而且每小時價格貴四倍。如果你的產品會接聽電話,Qwen-Audio-3.0-TTS 只是流程的三分之一,仍需 ASR 模型和語言模型才能成為對話。
在什麼情況下 Qwen-Audio-3.0-TTS 才是真正的最佳答案
阿里巴巴這款模型的理由不在行銷。這款 Plus 版本由 Alibaba 的 Tongyi Lab 於 2026 年 7 月 20 日發布,並透過 Alibaba Cloud Model Studio 以託管式、封閉的 API 形式提供;甫推出便登上 Artificial Analysis 文字轉語音競技場的榜首。然而排行榜是會移動的目標,而這一份已經移動了:截至 2026 年 9 月,Qwen-Audio-3.0-TTS-Plus 在 Provider Voice Arena 上以 2,306 個樣本、Elo 1,232 的成績位居第四,落後於 Cartesia Sonic 3.6 的 1,275、Inworld Realtime TTS-2 的 1,244,以及 Speechify 的 Simba 3.2 的 1,233——這三款分別來自 8 月與 7 月的模型,都在它之後才推出。在二十多款模型中排名第四,領先地位已然失去、價格優勢卻依然完好,這仍是一個強勢的位置。只是它並不是發布報導所描述的那個位置。

它在所涵蓋的 16 種語言中有 10 種領先,新增 20 個中文方言區,支援從簡短樣本進行語音複製(包括跨語言複製),並具備 86 個內嵌的情緒與表達標籤。
這些注意事項已足夠具體,可供規劃時納入考量。
• 吞吐量 —— Plus 每秒約產生 16 個字元,相較之下 Simba 3.2 為 30.2,Gemini 3.1 Flash TTS 為 27,Sonic 3.5 則約 120。對批次渲染來說,這點難以察覺;但對即時產品而言,這個數字決定了你的緩衝區大小。
• 價格文件 — 廣為引用的每百萬字元 27.6 美元,並非在每個快照中都與 Alibaba 自家的定價頁面相符;該頁面有時曾針對兩個級別列出更低的數字。預測之前,請在帳戶層級查看目前數字,而不是排行榜上的數字。
• 語音庫——儘管支援 16 種語言,公開預設語音幾乎全是中文與英文。其他十四種語言須透過語音複製流程取得,而非現成可用。
• 功能閘控 — 這 86 個內嵌情緒標籤僅能在單向串流模式下運作,因此這項表達性控制無法在每條整合路徑中都保留下來。
• 層級——Flash 以約 300 毫秒的首封包延遲為目標,適用於即時使用;Plus 則是品質層級。它們是名稱相同但不同的產品,而選錯是常見的第一個錯誤。
瀑布法案的誠實版本
以下是每小時比較所忽略的部分。建構在 TTS 模型上的對話式產品是一條串接式流程:ASR 模型把來電者的語音轉成文字,語言模型決定要說什麼,TTS 模型再把它說出來。三家供應商、三份帳單、三筆會層層累加的延遲預算,以及每個交界處的一次交接——而韻律就死在這些交接點上。TTS 這一段可能每小時音訊要價 1.66 美元。另外兩段才是金錢與錯誤真正所在之處——而這種串接式模型聽不見它已在朗讀的那句話中間出現的停頓。
GPT-Live-1 將三條計費路徑收攏為單一工作階段與單一計量錶,語音每分鐘 $0.05,而推論後端則另行計費。有兩個細節讓這筆帳單保持誠實。工作階段初始化會預先計收 15 秒的語音費用,這筆費用是從後續時長中折抵,而非累加上去。而後端則是第二個計量錶:每一次委派的推論呼叫、工具叫用與網路搜尋,都依該模型的正常費率計費,因此若把委派指向一個每一輪都會搜尋的前沿推論模型,就會在便宜的語音層背後產生一通昂貴的呼叫。
獨立評測榜對這兩者的評語之所以深具啟發性,正是因為它們衡量的東西不同,而且兩者都沒有美化受測對象。Qwen-Audio-3.0-TTS-Plus 在品質上排名第四,在吞吐量上則接近墊底。GPT-Live-1 在 Artificial Analysis 的 Speech to Speech Index 中,以 69.8% 在十一個模型中排名第七——落後於它所取代的 GPT-Realtime-2.1 的 73.9%——而其收費卻處於該指數「每小時輸入音訊成本」區間的最低端,為 4.42 美元,相較於 GPT-Realtime-2.1 的 10.75 美元。這兩個模型都沒有拿下各自類別的榜首。兩者都比它們當初被打造來擊敗的對象更便宜。

那個第二個計量指標,正是路由層成為設計決策、而非單純最佳化的地方。OrcaRouter 既不搭載 GPT-Live-1,也不搭載 Qwen-Audio-3.0-TTS——兩者的語音層都在我們觸及範圍之外,我們也完全不路由這部分。但推理這條腿可不是如此。來自十一家上游供應商的約 190 個模型,全都置於單一金鑰、以供應商定價、零加成之後,而且供應商降價當天就會反映,不必等到下一次合約續約。對串接式架構來說,這直接涵蓋了中間那條腿:在單一端點後方同時持有兩個 ASR 選項與三個推理模型,用真實流量讓它們互相 A/B 測試,並讓自動容錯移轉吸收上游的突發狀況,而不會中斷通話。
同意問題的作用方向恰恰相反
Qwen-Audio-3.0-TTS 最具商業價值的功能就是語音複製,而這也是它最大的合規風險面。只需十秒的參考音訊,就能跨語言複製說話者,這對本地化帶來革命性影響,卻也在任何涉及身分識別的地方成為隱患。OpenAI 推出 GPT-Live-1 時完全沒有語音複製功能,也完全沒有自訂語音——只有 12 種 API 語音可選,而這就是全部選項。
那種不對稱在功能比較中很容易被略過,在風險審查中卻很難略過。一個向來只以十二種供應商語音其中一種說話的產品,對於「那是誰的聲音,又是誰同意使用」這個問題的答案,會比一個能從樣本重現任何聲音的產品短得多。如果你需要聲音複製,管線決策已經替你決定好了,問題就變成由什麼來規範它。如果你不需要,GPT-Live-1 的這項限制就值得當成一項你無須自己打造的控制措施來看待。
該買哪一個
若產出是內容:旁白、在地化、無障礙音訊、配音,或任何文字先於音訊存在、並以每渲染小時的品質作為衡量指標的工作流程,就購買 Qwen-Audio-3.0-TTS。如果需要即時播放,就從 Flash 開始;當聲音本身就是交付成果時,改用 Plus;並將克隆工作流程與預設語音分開計價。
若輸入的是真人,就購買 GPT-Live-1。客服專線、預約流程、收案訪談——凡是使用者的第一個音節會在模型話說到一半時傳來,而系統必須表現得像聆聽者而非播放器的情況,都適用。它每小時音訊的費用較高,而且是這兩者中唯一能被打斷的。
這兩者互補的時刻遠比競爭多:許多產品既要 Qwen-Audio-3.0-TTS 朗讀文件,也要一個雙工模型處理隨之而來的通話。它們不該共用的是一套成本模型。以每小時音訊計算,只對其中一個來說才是正確的指標。
