一張主視覺卡片,將 Qwen-Audio-3.1-TTS 與 ElevenLabs Eleven v3 相比,列出 Qwen 的 16 種語言加 20 種方言、70% 價格降幅,以及沒有競技場分數,對比 ElevenLabs 的 74 種語言、每百萬字元約 $100 與 Elo 1,168,卡片位於一條寫著「2026 年 9 月 23 日於 Apsara 發表」的緞帶上方。
Guides & Insights

Qwen-Audio-3.1 對決 ElevenLabs:降價 70% 迎戰現任霸主

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

該供應商於 2026 年 9 月 23 日將其 Qwen-Audio-3.1-TTS API 的價格調降約 70%,並在杭州舉行的 Apsara Conference 舞台上與另外四款語音模型一同發表。光是這個數字,就足以讓這篇比較值得一寫:ElevenLabs Eleven v3 一直是大多數西方團隊的預設製作語音,實際費率接近每百萬字元 100 美元,而如今一個可信的挑戰者以僅其一小部分的價格,重新為同一項工作定價,同時還擴大了語言涵蓋範圍。這兩套系統並不等同——Qwen-Audio-3.1-TTS 是來自該供應商 Tongyi Lab 的純託管 API,語音生態系較小;而 ElevenLabs 則是完整的內容平台,擁有業界最豐富的語音庫。但若你的決策向來取決於帳單,那麼這週的計算已經改變了。

9 月 23 日實際出貨了什麼

Qwen-Audio-3.1 不是單一模型。它是阿里巴巴整個語音技術堆疊的五款模型更新,而這些層級很重要,因為它們有不同的定價和不同的用途:

Qwen-Audio-3.1-TTS — 大多數團隊所用合成模型的直接後繼之作。新增七種語言,總計達 16 種,保留 20 個中文方言區,新增自然的跨語言音色轉移(同一嗓音可跨越國語、粵語、英語、日語),以指令為基礎控制情緒、語速與表達風格,並能處理嘈雜、帶有回音或其他品質不佳的參考音訊,無需另設降噪模式。

Qwen-Audio-3.1-TTS-Next — 一個全新的層級,也是截然不同的產品。阿里巴巴稱之為「Audiogen」模型:它能從文字、時間戳與參考音訊,一次生成語音、音效與背景環境音。支援多講者對話、播客、影視音景,輸出為 48 kHz。根據阿里雲 Model Studio 文件,它最多可接受 3,000 個字元的輸入,生成音訊的上限為播客 240 秒、其他用途 120 秒,每秒可處理 3 次請求,並回傳 WAV、MP3 或 PCM。

Qwen-Audio-3.1-ASRQwen-Audio-3.1-ASR-NextQwen-Audio-3.1-Realtime——分別對應辨識、音訊理解(情緒、音樂、環境音、事件定位)以及全雙工對話。Realtime 正是阿里巴巴積極推向硬體的那一款:Qwen Office、Qoder、QwenNote A2、QwenNote Eva 桌上型機器人與 Qwen AI 眼鏡。

降價遍及整個產品線,不只是 TTS:語音合成降約 70%,即時語音降約 85%,語音辨識降幅高達 95%。Alibaba 也開源了 Qwen-Audio-Agent,一個用於打造即時語音代理的框架,並推出 Qwen3.8-LiveTranslate,將延遲壓低至 2.5 秒以下。

A screenshot of Alibaba Cloud Model Studio's English documentation site showing the reference page for qwen3.8-livetranslate-flash-realtime, a real-time audio and video translation model that accepts audio and images and outputs text and audio across 60 input languages and 29 speech output languages, under an Apsara 2026 Conference banner, with the Speech-to-Speech branch of the navigation listing the qwen-audio-3.0 realtime models.

計分板

A two-column scoreboard for Qwen-Audio-3.1-TTS and ElevenLabs Eleven v3 across price, languages, weights, voice library, delivery control and arena score, with a footer stating that the Qwen figures are vendor-reported and unscored and the ElevenLabs figures are per Artificial Analysis.

價格 — Qwen-Audio-3.1-TTS:約比前一代 Qwen-Audio 低 70%,而前一代將 3.0 Plus 級距定在每 100 萬字元約 27.60 美元,Flash 級距約 15 美元。ElevenLabs Eleven v3:根據 Artificial Analysis 的追蹤,每 100 萬字元約 100 美元,Flash 則約 50 美元。

語言 — Qwen-Audio-3.1-TTS:16 種語言加上 20 個中文方言地區。ElevenLabs Eleven v3:74 種語言。

權重 — Qwen-Audio-3.1-TTS:閉源,僅於阿里雲百鍊(Model Studio)提供託管服務。ElevenLabs Eleven v3:閉源,僅提供託管服務。

語音庫 — Qwen-Audio-3.1-TTS:原生複製功能,加上跨語言音色轉移;市面上沒有可與之相比的公開市集。ElevenLabs:業界最大的共享語音庫,還能用約 30 秒的音訊即時複製。

表達控制 — Qwen-Audio-3.1-TTS:以指令控制情緒、語速與風格,承襲 3.0 所推出的 86 個行內表達標籤。ElevenLabs Eleven v3:音訊標籤,再加上周邊平台(配音、代理程式、工作室)。

獨立基準測試 — Qwen-Audio-3.1-TTS:尚無。ElevenLabs Eleven v3:截至 2026 年 8 月,在 Artificial Analysis 的 Provider Voice Arena 排行榜上取得 1,168 Elo。

挑戰者真正勝出之處

三件事,而其中只有一件是價格。

價格,顯而易見。 相較於每百萬字元要價 100 美元的現行方案,降低 70% 絕不是四捨五入的微幅差距。這是「用來做原型」的產品與「出貨給所有使用者」的產品之間的差別。如果你大量生成旁白,每年省下的金額不是你得在內部費力爭取的項目——它自己就會說話。

中文,無庸置疑。二十個中文方言區域,是一道 ElevenLabs 端不出任何東西足以匹敵的護城河。若你的產品服務的是中國大陸使用者、粵語使用者,或是會在句子中途轉換語言的離散族群受眾,這場比較還沒開始就已結束。

跨語言音色轉移。Qwen-Audio-3.1-TTS 能讓同一把嗓音自然地穿梭於國語、粵語、英語與日語之間。這是一項具備明確應用場景的特定能力——讓同一個品牌嗓音在語言切換後依然保持一致——對於只想為單一主持人做本地化、而非為每個市場另覓配音的人來說,這是真正的差異化優勢。

ElevenLabs 依然勝出的地方,而且差距不小

語言廣度是第一要務,也是最大的一項。七十四種語言對比十六種,這不是發一則定價公告就能彌補的差距。如果你要推出波蘭語、土耳其語、越南語和葡萄牙語版本,ElevenLabs 今天就能涵蓋,而 Qwen-Audio-3.1-TTS 則做不到。

第二個是生態系統。ElevenLabs 不是一個合成端點;它是一個內容平台。一個你可以授權而非複製的共享語音庫、配音工作流程、代理基礎設施、一個工作室產品、一個有文件記載的 API 介面,背後有多年累積的客戶端函式庫。從那裡遷移是一個專案,而不是設定變更,而在其上建構的團隊清楚知道他們將放棄什麼。

第三點更難命名,但無論如何仍值得命名:對單一英語嗓音自然度的感知。Qwen 的語音合成歷來在中文上表現卓越,在英語上則只是非常好;而儘管 3.1 版宣稱改善了多語言表現,目前仍沒有針對新模型的獨立聽測。任何人若告訴你他們知道新的 Qwen 嗓音聽起來英語如何,都只是在猜。

那個任何人還不該引用的數字

這是報導中會被扭曲的那部分,所以在此直白說明。Qwen-Audio-3.1-TTS沒有獨立的基準測試分數。它的前身 Qwen-Audio-3.0-TTS-Plus 截至 2026 年 8 月中旬,在 Artificial Analysis 的 Provider Voice Arena 排行榜上以 1,234 Elo 位居該榜第二至第五名之間。Qwen-Audio-3.1-TTS 尚未被加入任何競技場。阿里巴巴發布資料中的每一項品質聲稱都是廠商自行報告且未經重現的。

那並不會讓這些說法變成假的。它只會讓它們未經證實,而這也意味著,目前如實描述這場對決的方式是:一個有價格但沒有分數的模型,對上一個有分數但價格高得多的模型。任何比這更強烈的說法,都只是披著基準測試外衣的臆測。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in its August 2026 state, ranking text-to-speech models by Elo: Cartesia Sonic 3.6 first at 1,277, Alibaba's Qwen-Audio-3.0-TTS-Plus at 1,234 and ElevenLabs Eleven v3 at 1,168.

同樣的原則也適用於延遲。阿里巴巴針對此系列 ASR 端所主打的首個 token 數據——92 毫秒——來自該公司自己在 0.6B 規格上的高併發基準測試,而非第三方測試;自推出以來發布的分析指出,ASR 與 TTS 是管線中的獨立產品,而不是單一的端到端模型,且社群回報也描述,在偽串流模式下,長對話中的延遲會不斷累積。請把這整個系列中各家廠商提供的延遲數字都視為上限,而不是實測體驗。

降價在實務上值多少

以一項實際的工作負載為例:一款每月以英文與中文(普通話)合成 2,000 萬字元旁白的產品。以 ElevenLabs Eleven v3 每百萬字元約 100 美元的價格計算,這大約是每月 2,000 美元,也就是每年 24,000 美元。以 Qwen-Audio-3.0-TTS-Plus 每百萬字元約 27.60 美元的費率計算,同樣的用量原本就已經是每月約 552 美元。套用阿里巴巴在 9 月 23 日宣布的約 70% 降幅後,同樣的工作負載每月只需數百美元出頭。

那些數字都不是你可以據以簽約的牌價——ElevenLabs 是透過訂閱方案以點數計費,而阿里巴巴的降幅則是針對因地區與方案層級而異的費率所做的百分比調降。但這項比較的整體輪廓明確無疑,而這個輪廓正是你編列預算時所依據的。

有一個值得提醒任何認真建模這件事的人注意的地方:Alibaba Cloud 已將新加坡節點的即時轉錄計費,從按時長計量改為按 token 計量,每百萬個輸入 token 收費 0.93 美元,每百萬個輸出 token 收費 0.70 美元。當你無法控制某段音訊會變成多少 token 時,token 計費會比時長計費更難預測,而且噪音、靜音與多輪對話上下文都會推高 token 消耗量。帳面上的 70% 降幅,並不自動等於你的特定流量也能省下 70%。

如何實際執行這個切換

如果你正在評估這件事,真正該知道的有用資訊是:遷移會耗費你多少工程時間。這兩個模型都是封閉的託管 API,所以無論如何你都是在對接 HTTP 端點,而這項工作只是一個用戶端、一套重試策略,以及一份語音清單——而不是重新架構。

這正是 OrcaRouter 的形態能派上用場的地方,不過先誠實地說一個但書:我們不路由 Qwen-Audio-3.1-TTS 或任何 Qwen-Audio 模型。阿里巴巴的語音端點不在我們的範疇內,ElevenLabs 也是如此。我們涵蓋的是它們周邊的推論層——一組 API 金鑰即可使用 200 多個文字模型,且 0% 加成,也就是供應商的牌價原封不動直接傳遞,因此廠商一降價,我們這邊當天就生效,而不是等過一輪重新定價週期。對於要打造那驅動語音管線的應用程式的團隊——摘要工具、腳本產生器、內容規劃工具——這代表一份合約而不是好幾份,上游服務劣化時自動容錯移轉,以及一套路由 DSL,能把多個模型組合成單一次呼叫。這不代表你可以透過我們呼叫 Qwen 的語音。任何告訴你相反說法的人,都沒讀過產品目錄。

誰應該移動,誰應該等待

立即行動如果你的工作負載以中文為優先、如果方言涵蓋範圍列在你的需求清單上、如果大量使用的成本是讓你一直屈就於更便宜但品質更差語音服務的限制因素,或者你需要一個品牌語音在語言切換後仍能維持一致。9 月 23 日的定價讓這樣的經濟效益難以反駁,而其中文品質在此之前就已經具備競爭力。

等等如果你的產品要推出超過約十六種語言、如果你的產品依賴的是可授權的語音庫而非語音複製、如果你深耕於某個平台的配音或代理工具,或者如果你的採購流程要求在簽核前取得獨立的品質評分。這些都不是永久的障礙,但降價並沒有解決其中任何一項。

而且要特別注意一件事:Qwen-Audio-3.1-TTS 是否會出現在盲聽競技場上。一旦它出現,這項比較就不再是關於價格和語言數量,而是關於較便宜的聲音是否真的同樣出色。這正是這次發表沒有回答的問題。