「GPT-Live-1 vs Qwen-Audio-3.0-TTS」的主視覺標題卡,副標為「一個能對話,一個朗讀腳本」,搭配一枚寫著「不是替代品——不同工作,不同帳單」的徽章,以及三張卡片:「Qwen-Audio-3.0-TTS Plus — Elo 1,232,在 AA Provider Voice Arena 排名第四,每 100 萬字元 $27.6」、「GPT-Live-1 — 每語音分鐘 $0.05,全雙工,每小時通話線 $3.00」,以及「但要注意——旁白端約每秒 16 個字元,文字進、音訊出」,上方則有一條頁腳寫著「Qwen 數據來自 Artificial Analysis;GPT-Live-1 數據為 OpenAI 公布。」OrcaRouter 標誌合成於右下角。
Guides & Insights

GPT-Live-1 vs Qwen-Audio-3.0-TTS:對話與旁白並非同一回事

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章
A two-column scoreboard titled 'GPT-Live-1 vs Qwen-Audio-3.0-TTS - the scoreboard'. Left column GPT-Live-1: 'Job: full-duplex conversation', 'Input: audio and text', 'Price: $0.05 per voice minute', 'Interruption handling: native', 'Voices: 12, no cloning', 'Independent score: 69.8% on the AA Speech to Speech Index'. Right column Qwen-Audio-3.0-TTS: 'Job: text-to-speech rendering', 'Input: text only', 'Price: $27.6 per 1M characters, about $1.66 per hour of audio', 'Interruption handling: not applicable, it never hears', 'Voices: 16 languages, cloning from short samples', 'Independent score: Elo 1,232, fourth on the AA Provider Voice Arena'. Footer: 'Qwen pricing and Elo per Artificial Analysis; GPT-Live-1 voice benchmarks Ope​nAI-reported and unreproduced.'

把 GPT-Live-1 和 Qwen-Audio-3.0-TTS 在每小時音訊價格上並排比較,差距看起來具有決定性:Aliba​ba 的 Qwen-Audio-3.0-TTS-Plus 以每百萬字元 27.6 美元生成語音,約等於每小時 1.66 美元的音訊;而 Ope​nAI 的 GPT-Live-1 對一小時連續開放線路收費 3.00 美元。旁白比較便宜,所以旁白勝出——只不過,這是錯誤的比較,而它之所以錯誤,正是任何人能從這場對決中得到的最有用啟示。Qwen-Audio-3.0-TTS 是文字轉語音模型。GPT-Live-1 是全雙工對話模型。其中一個會朗讀你寫下的內容。另一個則必須每秒好幾次判斷你是否已經講完。

一者渲染,一者對話

文字轉語音會接收文字並回傳音訊。沒有輸入音訊,沒有輪次要接,沒有被打斷的概念,也沒有逐字稿要回傳,因為模型從未聽見任何東西。它的成本模型就像印刷機:頁面進、音訊出,品質與吞吐量是唯一重要的兩個數字,而且兩者都能在出貨前測量。

全雙工對話模型在產生輸出音訊的同時,也會處理傳入的音訊。它的工作包含對話中與字詞無關的部分——使用者停頓時跟著停頓、在「對啊」這類附和語出現時繼續進行而不是把它當成打斷、在句子講到一半時讓出發言權,以及觸發工具呼叫卻不中斷對話脈絡。GPT-Live-1 全都做得到,還會在 session 之外一併回傳語音辨識逐字稿,而它之所以能做到這點,正是因為它全程都在聆聽。

如果你的產品會朗讀文章、將文件轉換為音訊,或為影片旁白,那麼 GPT-Live-1 是錯誤的工具,而且每小時價格貴四倍。如果你的產品會接聽電話,Qwen-Audio-3.0-TTS 只是流程的三分之一,仍需 ASR 模型和語言模型才能成為對話。

在什麼情況下 Qwen-Audio-3.0-TTS 才是真正的最佳答案

阿里巴巴這款模型的理由不在行銷。這款 Plus 版本由 Alibaba 的 Tongyi Lab 於 2026 年 7 月 20 日發布,並透過 Alibaba Cloud Model Studio 以託管式、封閉的 API 形式提供;甫推出便登上 Artificial Analysis 文字轉語音競技場的榜首。然而排行榜是會移動的目標,而這一份已經移動了:截至 2026 年 9 月,Qwen-Audio-3.0-TTS-Plus 在 Provider Voice Arena 上以 2,306 個樣本、Elo 1,232 的成績位居第四,落後於 Cartesia Sonic 3.6 的 1,275、Inworld Realtime TTS-2 的 1,244,以及 Speechify 的 Simba 3.2 的 1,233——這三款分別來自 8 月與 7 月的模型,都在它之後才推出。在二十多款模型中排名第四,領先地位已然失去、價格優勢卻依然完好,這仍是一個強勢的位置。只是它並不是發布報導所描述的那個位置。

A screenshot of the Artificial Analysis Provider Voice Arena Leaderboard for text-to-speech, captured September 2026, showing the top four: Cartesia Sonic 3.6 first at Elo 1,275 and $49.0 per million characters, Inworld Realtime TTS-2 second at 1,244, SpeechifyAI Simba 3.2 third at 1,233, and Alibaba's Qwen-Audio-3.0-TTS-Plus fourth at Elo 1,232 with a confidence interval of -14/14, 2,306 samples, a July 2026 release and $27.6 per million characters.

它在所涵蓋的 16 種語言中有 10 種領先,新增 20 個中文方言區,支援從簡短樣本進行語音複製(包括跨語言複製),並具備 86 個內嵌的情緒與表達標籤。

這些注意事項已足夠具體,可供規劃時納入考量。

• 吞吐量 —— Plus 每秒約產生 16 個字元,相較之下 Simba 3.2 為 30.2,Gemini 3.1 Flash TTS 為 27,Sonic 3.5 則約 120。對批次渲染來說,這點難以察覺;但對即時產品而言,這個數字決定了你的緩衝區大小。

• 價格文件 — 廣為引用的每百萬字元 27.6 美元,並非在每個快照中都與 Alibaba 自家的定價頁面相符;該頁面有時曾針對兩個級別列出更低的數字。預測之前,請在帳戶層級查看目前數字,而不是排行榜上的數字。

• 語音庫——儘管支援 16 種語言,公開預設語音幾乎全是中文與英文。其他十四種語言須透過語音複製流程取得,而非現成可用。

• 功能閘控 — 這 86 個內嵌情緒標籤僅能在單向串流模式下運作,因此這項表達性控制無法在每條整合路徑中都保留下來。

• 層級——Flash 以約 300 毫秒的首封包延遲為目標,適用於即時使用;Plus 則是品質層級。它們是名稱相同但不同的產品,而選錯是常見的第一個錯誤。

瀑布法案的誠實版本

以下是每小時比較所忽略的部分。建構在 TTS 模型上的對話式產品是一條串接式流程:ASR 模型把來電者的語音轉成文字,語言模型決定要說什麼,TTS 模型再把它說出來。三家供應商、三份帳單、三筆會層層累加的延遲預算,以及每個交界處的一次交接——而韻律就死在這些交接點上。TTS 這一段可能每小時音訊要價 1.66 美元。另外兩段才是金錢與錯誤真正所在之處——而這種串接式模型聽不見它已在朗讀的那句話中間出現的停頓。

GPT-Live-1 將三條計費路徑收攏為單一工作階段與單一計量錶,語音每分鐘 $0.05,而推論後端則另行計費。有兩個細節讓這筆帳單保持誠實。工作階段初始化會預先計收 15 秒的語音費用,這筆費用是從後續時長中折抵,而非累加上去。而後端則是第二個計量錶:每一次委派的推論呼叫、工具叫用與網路搜尋,都依該模型的正常費率計費,因此若把委派指向一個每一輪都會搜尋的前沿推論模型,就會在便宜的語音層背後產生一通昂貴的呼叫。

獨立評測榜對這兩者的評語之所以深具啟發性,正是因為它們衡量的東西不同,而且兩者都沒有美化受測對象。Qwen-Audio-3.0-TTS-Plus 在品質上排名第四,在吞吐量上則接近墊底。GPT-Live-1 在 Artificial Analysis 的 Speech to Speech Index 中,以 69.8% 在十一個模型中排名第七——落後於它所取代的 GPT-Realtime-2.1 的 73.9%——而其收費卻處於該指數「每小時輸入音訊成本」區間的最低端,為 4.42 美元,相較於 GPT-Realtime-2.1 的 10.75 美元。這兩個模型都沒有拿下各自類別的榜首。兩者都比它們當初被打造來擊敗的對象更便宜。

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%, with companion cost and speed charts showing GPT-Live-1 at $4.42 per hour of input audio and 0.78 seconds to first audio.

那個第二個計量指標,正是路由層成為設計決策、而非單純最佳化的地方。OrcaRouter 既不搭載 GPT-Live-1,也不搭載 Qwen-Audio-3.0-TTS——兩者的語音層都在我們觸及範圍之外,我們也完全不路由這部分。但推理這條腿可不是如此。來自十一家上游供應商的約 190 個模型,全都置於單一金鑰、以供應商定價、零加成之後,而且供應商降價當天就會反映,不必等到下一次合約續約。對串接式架構來說,這直接涵蓋了中間那條腿:在單一端點後方同時持有兩個 ASR 選項與三個推理模型,用真實流量讓它們互相 A/B 測試,並讓自動容錯移轉吸收上游的突發狀況,而不會中斷通話。

Qwen-Audio-3.0-TTS 最具商業價值的功能就是語音複製,而這也是它最大的合規風險面。只需十秒的參考音訊,就能跨語言複製說話者,這對本地化帶來革命性影響,卻也在任何涉及身分識別的地方成為隱患。Ope​nAI 推出 GPT-Live-1 時完全沒有語音複製功能,也完全沒有自訂語音——只有 12 種 API 語音可選,而這就是全部選項。

那種不對稱在功能比較中很容易被略過,在風險審查中卻很難略過。一個向來只以十二種供應商語音其中一種說話的產品,對於「那是誰的聲音,又是誰同意使用」這個問題的答案,會比一個能從樣本重現任何聲音的產品短得多。如果你需要聲音複製,管線決策已經替你決定好了,問題就變成由什麼來規範它。如果你不需要,GPT-Live-1 的這項限制就值得當成一項你無須自己打造的控制措施來看待。

該買哪一個

若產出是內容:旁白、在地化、無障礙音訊、配音,或任何文字先於音訊存在、並以每渲染小時的品質作為衡量指標的工作流程,就購買 Qwen-Audio-3.0-TTS。如果需要即時播放,就從 Flash 開始;當聲音本身就是交付成果時,改用 Plus;並將克隆工作流程與預設語音分開計價。

若輸入的是真人,就購買 GPT-Live-1。客服專線、預約流程、收案訪談——凡是使用者的第一個音節會在模型話說到一半時傳來,而系統必須表現得像聆聽者而非播放器的情況,都適用。它每小時音訊的費用較高,而且是這兩者中唯一能被打斷的。

這兩者互補的時刻遠比競爭多:許多產品既要 Qwen-Audio-3.0-TTS 朗讀文件,也要一個雙工模型處理隨之而來的通話。它們不該共用的是一套成本模型。以每小時音訊計算,只對其中一個來說才是正確的指標。