一張英雄卡片比較 Qwen-Audio-3.0-TTS 與 Qwen-Audio-3.1-TTS,列出較舊模型於 2026 年 7 月 20 日發布、Elo 為 1,238,以及 86 個行內交付標籤,對比新模型於 2026 年 9 月 23 日發布、降價 70%,以及基於指令的控制,兩者之間有一個標示「九週」的箭頭。
Guides & Insights

Qwen-Audio-3.1-TTS 與 Qwen-Audio-3.0-TTS:兩個月換來了什麼

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Qwen-Audio-3.0-TTS 於 2026 年 7 月 20 日推出,隨即登上獨立語音排行榜榜首——Plus 等級在 Artificial Analysis 的 Provider Voice Arena 排行榜上達到 1,238 Elo,位居該榜第二。九週後,也就是 2026 年 9 月 23 日,該廠商在杭州舉行的 Apsara Conference 上發表 Qwen-Audio-3.1-TTS,並附帶約 70% 的降價。這樣的時間點使這成為一場不尋常的比較:被取代的模型並未過時,它經過基準測試、獲得實證,而且仍位居頂尖附近。因此,真正的問題不是哪一個更好,而是具體改變了什麼、其中任何改變是否對你的工作負載有影響,以及當後繼者完全尚未被評分時,你已經信任的那個分數會發生什麼事。

兩個月,五個端點,一個家庭

阿里巴巴並非只推出單一模型。3.1 版本涵蓋五個:Qwen-Audio-3.1-ASR、Qwen-Audio-3.1-ASR-Next、Qwen-Audio-3.1-TTS、Qwen-Audio-3.1-TTS-Next 和 Qwen-Audio-3.1-Realtime。對於目前正在呼叫 Qwen-Audio-3.0-TTS 的人來說,這些之中只有一個可以直接替換——也就是一般的 TTS 層級——而有一個是真正的新產品,而非升級。

第二個值得了解,即使你永遠不會呼叫它。Qwen-Audio-3.1-TTS-Next 是阿里巴巴所稱的「Audiogen」模型:單次處理就能從文字、時間戳與參考音訊同時產生語音、音效與背景環境音。支援多講者對話、播客組裝、場景音景,輸出 48 kHz。阿里雲的 Model Studio 文件直白列出其限制——輸入 3,000 個字元,播客生成音訊 240 秒,其他情況 120 秒,每秒 3 次請求,輸出 WAV、MP3 或 PCM,並接受最多三段各 30 秒的參考片段,格式為 WAV、MP3 或 OGG Opus。不支援原始 PCM 參考輸入。在北京節點,價格為每百萬輸入 Token $0.848、每百萬輸出 Token $1.696,不含促銷費率,且僅支援中文與英文。

如果你使用的是 3.0-TTS,而你的工作是「把這份腳本變成語音」,那這些都不會改變你的整合方式。如果你的工作是「組出一個有配樂的雙主持人播客」,3.1-TTS-Next 就是不同的產品類別,也可能正是你該關注這次發布的原因。

升級,逐行解析

A two-column scoreboard for Qwen-Audio-3.1-TTS and Qwen-Audio-3.0-TTS across languages, dialects, timbre transfer, delivery control, noisy reference audio and arena score, with a footer stating that the 3.1 figures are vendor-reported and unscored and the 3.0 Plus Elo is per Artificial Analysis.

• 語言 — Qwen-Audio-3.1-TTS:廠商回報支援 16 種語言,較上一代新增七種。Qwen-Audio-3.0-TTS:依七月發布的公開報導所列,為 16 種語言。

• 中文方言 — Qwen-Audio-3.1-TTS:20 個方言區域,沿用。Qwen-Audio-3.0-TTS:20 個方言區域。

• 跨語言音色轉移 — Qwen-Audio-3.1-TTS:支援,同一把聲音可跨國語、粵語、英語及日語。Qwen-Audio-3.0-TTS:不提供。

• 語音表現控制 — Qwen-Audio-3.1-TTS:以指令控制情緒、語速與風格。Qwen-Audio-3.0-TTS:86 個內嵌語音表現標籤。

• 含雜訊的參考輸入 — Qwen-Audio-3.1-TTS:可直接處理含雜訊或帶回音的參考音訊,無需獨立的降噪模式。Qwen-Audio-3.0-TTS:預期須使用乾淨的參考音訊。

• 獨立評分——Qwen-Audio-3.1-TTS:尚無。Qwen-Audio-3.0-TTS-Plus:截至 2026 年 8 月,在 Artificial Analysis 的 Provider Voice Arena 排行榜上取得 1,238 Elo。

語言數量對不上,而這很重要

這是件小事,在其他地方都會被輕輕帶過,所以值得說明。阿里巴巴的發布資料稱,3.1 TTS 層級新增了七種語言。針對七月 3.0 世代的已發表報導——包括我們自己當月的比較文章——列出 3.0 層級有 16 種語言。七加十六等於二十三,不是十六,而阿里巴巴尚未公布這兩個數字的核對說明。

可能的解釋並不光鮮:3.1 這個數字可能算的是另一組語言,3.0 的數字可能在發布時被誇大了,或者「增加七種」可能指的是 ASR 層級而非 TTS。我們不知道是哪一種。我們確實知道的是,這項比較兩邊的語言數量都是廠商自行呈報的數字,從未經過獨立稽核,而任何人把「16 種語言」當成這兩個模型的確鑿事實來引用,都是在引用一張行銷投影片。在你根據某個語言數量做規劃之前,請先對照 Model Studio 說明文件,查核你需要的特定語言。

A screenshot of Alibaba Cloud Model Studio's English documentation site with the Speech-to-Speech branch of the navigation open, showing the reference page for qwen3.8-livetranslate-flash-realtime with its model capabilities and context limit tables, under an Apsara 2026 Conference banner.

指令控制才是真正會體現在程式碼中的改變

在 3.1 TTS 版本的所有內容中,這一項會改變你撰寫提示的方式。3.0 世代透過 86 個行內標籤來控制表達——那是一套你必須學會的固定詞彙,得插入正確位置,而且只會做到標籤所說的事,不多也不少。3.1 層級則以自然語言指令取而代之:你描述想要的情緒、節奏和風格,模型會加以解讀。

實務上的差異在於表現力與可預測性之間的取捨。標籤詞彙是一份契約——同一個標籤每次都會產生相同的呈現效果,這正是你在製作流程中所需要的,尤其當某個聲音必須在一萬支片段中保持一致時。自由形式的指示範圍更廣,但也更鬆散,而且它承襲了常見的提示敏感度問題:「溫暖但不多愁善感」的兩種措辭不會產生完全相同的效果,而同一種措辭在不同日子呼叫兩次也不會一樣。

如果你目前的管線是建立在那些 86 個標籤上,升級並不是免費的。你是在用一個確定性的控制介面,換取一個機率性的控制介面;而移植的工作不在於 API 呼叫——而是在於拿你擁有的每一個提示範本,對照新模型的解讀重新驗證。先為這件事編列預算,再為省下的成本編列預算。

跨語言音色轉換,以及它實際上是用來做什麼的

一個參考語音,貫穿國語、粵語、英語與日語,在語言轉換之際仍保有其身分。紙面上,這讀起來像一項功能亮點。實際上,它解決了一個具體且代價高昂的問題:同一位主持人必須存在於多種語言中,卻不能在每種語言裡聽起來像不同的人。

傳統的變通做法是為每種語言分別找一位配音員,並接受你的品牌聲音如今成了四個共用同一份腳本的聲音。另一種做法則是把同一位講者複製到每種語言,而這正是複製聲音容易走樣的工作流程——口音會跟著帶過去,音色會變單薄,聽眾在一句話內就會察覺。跨語言音色轉移所主張的是:這兩種妥協都沒有必要。

而且,它目前也完全未經驗證。無論哪種語言,都沒有針對 Qwen-Audio-3.1-TTS 的第三方聆聽測試,而 Alibaba 自家的示範是這種轉移仍然成立的唯一證據。如果這項能力是你考慮升級的原因,請在做出決定前用你自己的參考音訊測試它——那是五分鐘的實驗,也是唯一能回答這個問題的方法。

{{1}}降價對{{2}}3.0{{/2}}法案的影響{{/1}}

阿里巴巴全面調降語音價格:語音合成降幅約 70%,即時語音降幅約 85%,語音辨識降幅最高達 95%。此次調整自北京時間 2026 年 9 月 22 日 00:00 起於阿里雲 Model Studio 生效,涵蓋北京與新加坡區域,適用於 3.1 TTS 與 3.0 即時端點。調整後,TTS Flash 方案定價為每百萬輸入 token 人民幣 1.5 元、每百萬輸出 token 人民幣 12 元;即時 Flash 方案則為每百萬 token 文字輸入人民幣 1.5 元、音訊輸入人民幣 6 元、文字輸出人民幣 4.5 元,文字與音訊合併輸出人民幣 12 元。

如果你已經在使用 3.0-TTS,以下是真正重要的部分。3.0 Plus 層級在 Artificial Analysis 上截至八月的價格一直維持在每百萬字元約 $27.60,而 Flash 層級則接近 $15。如果這約 70% 的降幅適用於你使用的層級,那麼在相同工作量下,你的帳單會降到原本的大約三分之一——而你完全不需要改動任何一行程式碼。這就是這次發布不尋常的地方:對 3.0 的客戶來說,降價的價值高於模型升級,而且無論你是否遷移,降價都會生效。

有兩點值得謹記在心。百分比降幅是相對於各地區、各層級都不同的費率來報價的,因此標題上的 70% 並不保證你自身的流量情況。而 Alibaba Cloud 已將新加坡節點的即時轉錄計費,從按時長計量改為按權杖計量——每百萬輸入權杖 0.93 美元、每百萬輸出權杖 0.70 美元——當靜音、噪音與多輪對話情境都會推高權杖用量時,這種計價基準的可預測性就比較低。請拿新的價目表對照你自己的音訊,而不是對照新聞稿。

Qwen-Audio-3.0-TTS 在哪些情況下仍是正確的選擇

三種情況,而且它們並非邊緣情況。

當你需要一個站得住腳的數字時。Qwen-Audio-3.0-TTS-Plus 的獨立 Elo 分數為 1,238——同一排行榜在九月對該模型顯示為 1,259,仍居第二,因此分數是向上漂移而非衰退——這來自一個有數千票支持的盲聽競技場。Qwen-Audio-3.1-TTS 完全沒有競技場分數。如果你的簽核流程需要第三方證據,擁有證據的是較舊的模型,而降價並不會改變這一點。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, ranking text-to-speech models by Elo with vote counts and API pricing: Cartesia Sonic 3.6 first at 1,277, Alibaba's Qwen-Audio-3.0-TTS-Plus at 1,259 on a rank range of 2-3, and ElevenLabs Eleven v3 at 1,166.

當確定性勝過表現力。如果你的生產流程是建立在 86 個標籤的控制介面上,你所擁有的系統其輸出是可以推理預期的。以指令為基礎的控制能力更強,卻也更難預測,而遷移成本更是實實在在。

當升級內容完全沒有觸及你的工作負載時。如果你以中等用量、乾淨的參考語音,以及一組固定的語氣標籤來合成華語和英語,那麼跨語言音色轉換、雜訊輸入的穩健性,還有另外七種語言,全都只是在解決你根本沒有的問題。接受降價,繼續用這個模型。

執行兩者,而無需執行兩個整合

跨世代切換棘手的地方在於,你通常會希望兩個模型同時上線——3.0 用於生產路徑,背後有分數支援,3.1 用於新語言和轉移功能,以及一種無需重新部署就能在兩者之間轉移流量的方法。兩者都是 Alibaba Cloud Model Studio 上的閉源託管 API,所以這就意味著一個功能背後有兩個端點、兩個速率限制和兩個故障模式。

坦白說明我們的定位:OrcaRouter 並不路由 Qwen-Audio-3.1-TTS 或任何 Qwen-Audio 模型,我們也完全不路由阿里巴巴的語音端點。我們提供的是這類管線周邊的文字推論層——一把 API 金鑰即可取用 200 多個模型,0% 加成,供應商定價直接透傳,因此廠商降價當天就會反映在我們這邊,而不必等到重新定價週期之後。如果驅動你語音管線的服務是腳本產生器、摘要工具或內容規劃工具,這代表你只需簽一份合約,而非好幾份,上游服務品質下降時自動容錯移轉,以及一套能將多個模型組合進單次呼叫的路由 DSL。這並不代表你可以透過我們呼叫 Qwen 的語音,任何暗示相反的頁面,都是對我們自家型錄的錯誤描述。

誠實的總結

Qwen-Audio-3.1-TTS 是真正的升級,帶來三項重要的新增功能——基於指令的語音表達控制、跨語言音色轉移,以及對劣質參考音訊的穩健性——再加上一次降價,而這比上述任何一項都更有價值。Qwen-Audio-3.0-TTS 並沒有像一般推出兩個月的模型那樣被取代:它仍保有後繼者尚未取得的獨立基準測試分數,而且仍涵蓋這個模型家族大多數差異化所仰賴的漢語方言範圍。

所以,這個決定比行銷所暗示的還要狹窄。若你正在大量生成,這項定價變更就已經對你生效。若你需要新增語言或音色轉換,請先遷移,並用自己的音訊驗證該功能。若你需要一個站得住腳的品質數字,就等 Qwen-Audio-3.1-TTS 登上盲聽競技場——那是唯一能為此事定案的事件;而在它發生之前,誠實的立場是:較新的模型是較便宜的那個,較舊的模型是已獲驗證的那個。