一張為「Gemini 3.8 Live 對上 Qwen-Audio-3.1-TTS」生成的主視覺卡片,背景為白色,並帶有柔和的藍與青色漸層點綴。兩個面板位於標題「兩半,相隔八天各自更新」之下。左側面板的主題是「2026 年 9 月 15 日 — Gemini 3.8 Live 與 Live API 上的 Extended Thinking」。右側面板的主題是「2026 年 9 月 23 日 — 阿里雲 Apsara 上的 Qwen-Audio-3.1-TTS,合成量削減約 70%」。頁尾一行寫著「它們在一條管線的中段交會,而不是做同一份工作。」OrcaRouter 的標誌合成於右下角。
Guides & Insights

Gemini 3.8 Live 對比 Qwen-Audio-3.1-TTS:語音堆疊的兩半,相隔八天重新定價

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Gemini 3.8 Live 是 Google 的語音對語音模型,於 2026 年 9 月 15 日以 gemini-3.8-live 及 gemini-3.8-live-extended-thinking 在 Live API 上推出。Qwen-Audio-3.1-TTS 是阿里巴巴的文字轉語音模型,於 2026 年 9 月 23 日在杭州雲棲大會(Apsara Conference)發表,晚了八天,並附帶語音合成約 70% 的降價。這八天的差距,正是為什麼這個比較現在值得一讀,而不是等到七月。兩個產品各自的角色並沒有任何改變——一個負責聆聽與說話,另一個負責把文字朗讀出來——但一條正式上線的語音處理流程,其兩半都在短短兩週內被重建或重新定價,而以往用來判定這場對決的算式,也就這麼悄悄地改變了。

兩半,相隔八天更新

先從讓這個組合與眾不同的一點說起:這兩個模型並不互相競爭。一個語音產品有一張嘴,也有一隻耳朵,而這兩個模型各是其中之一。Gemini 3.8 Live 把迴路閉合起來——音訊與視訊輸入、音訊輸出、中斷處理,以及對話底下運行的工具呼叫。Qwen-Audio-3.1-TTS 接收一段字串和一個參考語音,然後回傳一場演出。它最擅長扮演的是一張嘴,而不是其他任何東西,而且它並不想當一隻耳朵。

九月這個時間點之所以耐人尋味,在於這兩則公告瞄準的是同一條預算線的兩端。Google 九月十五日的發布談的是能力,完全沒動到價格;阿里巴巴九月二十三日的公告則主要在講利潤率,新能力只是順帶一提。一個在八月打造出混合式流程的團隊,在短短八天之內就被給了一個重新檢視這兩條腿的理由——而其中只有一條腿變便宜了。

3.1 版本在 Qwen 端究竟改變了什麼

阿里巴巴在 9 月 23 日發布的不只一款模型。3.1 世代涵蓋五個端點——Qwen-Audio-3.1-ASR、Qwen-Audio-3.1-ASR-Next、Qwen-Audio-3.1-TTS、Qwen-Audio-3.1-TTS-Next 和 Qwen-Audio-3.1-Realtime——而其中只有一個,也就是一般的 TTS 層級,對任何已經在呼叫 3.0 TTS 模型的人來說,是可以直接替換的選擇。

在那個層級上,有三件事改變了,而其中一件是真正的遷移成本。表達控制從固定的 86 個行內標籤詞彙,改為自然語言指令:你描述自己想要的情緒、節奏與風格,而不再是在正確位置插入正確的括號標記。跨語言音色轉移功能問世,讓單一參考語音能將其音色身分帶到華語、粵語、英語與日語之中。而該模型現在可直接容忍含雜訊或有回音的參考音訊,無須另外進行降噪步驟。語言涵蓋範圍不變,仍是廠商回報的 16 種語言加上 20 個漢語方言區;而且——這點值得特別提出,因為它在其他地方常被含糊帶過——Aliba​ba 自家的資料聲稱 3.1 層級新增了七種語言,這與七月版本公布涵蓋範圍時所列的 16 種語言並不相符。在你針對 Model Studio 核對自己所需的特定語言之前,這兩個數字都應視為廠商說法。

這次發布中真正全新的產品是 Qwen-Audio-3.1-TTS-Next,阿里巴巴稱之為「Audiogen」模型:一次生成即可同時產出人聲、音效與背景環境音,適用於多人對話、播客組裝與場景製作。在北京節點上,它的定價為每百萬輸入詞元 0.848 美元、每百萬輸出詞元 1.696 美元,輸入上限為 3,000 字元,播客可生成 240 秒音訊,其他用途則為 120 秒,每秒可發出三次請求,最多可接受三段各 30 秒的參考音訊片段。它僅支援中文與英文。如果你的流程只是單一旁白朗讀腳本,這個產品與你無關;如果是兩位主持人加上背景配樂,那它正是你該關注這次發布的唯一理由。

接縫才是你真正在選擇的東西

因為這兩個模型並不執行相同的工作,所以這個決定並不是一場評比。問題在於你把交接點放在哪裡,以及你願意付出多少代價,讓那道接縫隱形。

有兩種誠實的架構。第一種是單一網路:Gemini 3.8 Live 處理整個對話回合,聽見來電者、決定要說什麼並說出來,而你得接受它給你的聲音——那是你無法複製、也無法打上自家品牌的。第二種是串接式架構:先辨識,再推理,然後由 Qwen-Audio-3.1-TTS 發聲,讓你擁有上千種聲音,包括由自家配音員錄製的那一把,代價則是跨越兩到三個供應商界線所帶來的延遲,以及當一句話被拆散在多次 API 呼叫之間時所流失的韻律。

多數團隊最後兩者都會採用,而這並不是缺乏膽識。在延遲會被感受到的地方使用即時模型——打斷、回應確認、讓來電者知道你還在線上的那聲「嗯哼」——並在品質會被聽見的地方使用語音合成模型:長篇政策的覆誦、以刻意放慢的速度念出的確認號碼、每一通電話都必須一模一樣的品牌語音。對一大類產品而言,混合式做法才是正確答案。這也是成本模型變得棘手的地方,因為你現在要計量兩種不同的單位。

A screenshot of the Artificial Analysis Speech to Speech leaderboard in English, captured 25 September 2026, showing the AA Speech to Speech Index panel with index values of 82.6, 81.5, 81.3, 80.1, 76.0, 73.9 and 71.5, with the cost-per-hour-of-input-audio axis running to roughly $10.75. The bar labels are set vertically and are not legible at capture size. No Alibaba Qwen-Audio model appears on the board, because the board scores speech-to-speech models and Qwen-Audio-3.1-TTS is a synthesis model.

以每音訊小時計價,這是兩者唯一都適用的單位

Google 的 Live API 按分鐘計費;Alibaba 的 Qwen TTS 各級方案則按字元和 token 計費。要比較兩者,你必須選擇一個標準化基準,而對語音來說,唯一站得住腳的基準就是成品音訊的小時數。

• 輸入計費 — Gemini 3.8 Live 每分鐘音訊 $0.005 輸入、$0.018 輸出,對比 Qwen-Audio-3.1-TTS 每百萬字元計費,3.0 Plus 級距在降價前約為 $27.60,Flash 級距約為 $15,而降價後 TTS Flash 級距的定價為每百萬輸入 token 人民幣 1.5 元、每百萬輸出 token 人民幣 12 元
• 輸出計費 — Gemini 3.8 Live 雙向對話依定價表,每小時實際通話時間約 $1.38,尚未計入任何快取,對比 Qwen-Audio-3.1-TTS 為單向串流,其 3.1-Next 級距在北京節點為每百萬輸入 token $0.848、每百萬輸出 $1.696
• 能聽見來電者 — Gemini 3.8 Live 可以,原生音訊與視訊輸入;Qwen-Audio-3.1-TTS 不行,僅文字輸入、音訊輸出
• 語音 — Gemini 3.8 Live 僅一種語音,無法複製、無法品牌化;Qwen-Audio-3.1-TTS 則有上千種以上,可從嘈雜的參考音訊進行零樣本複製
• 語言 — Gemini 3.8 Live 廠商回報為 97 種,可在對話中切換;Qwen-Audio-3.1-TTS 廠商回報為 16 種,另加 20 個中文方言區,並可在華語、粵語、英語與日語之間進行音色轉移
• 表達控制 — Gemini 3.8 Live 透過提示與對話上下文;Qwen-Audio-3.1-TTS 則採用自然語言指令,取代 3.0 世代的 86 個行內標籤
• 獨立評分 — Gemini 3.8 Live 在 Artificial Analysis 語音對語音指數中,Extended Thinking 變體為 82.6,標準版為 76.0;Qwen-Audio-3.1-TTS 則無;最接近的 Qwen 數字是前一代 3.0 Plus 級距在 Provider Voice Arena 上的 1,259 Elo,那是對前代產品的評分,而非本模型

這個百分比降幅是對照依區域與層級而異的費率所報出的,因此主打的 70% 並非對你的流量所作的承諾;而且 Alibaba Cloud 也把新加坡節點上的即時轉錄從按時長計費改為按 token 計量——這是較難以預測的基準,因為靜音與多輪對話脈絡都會推高 token 消耗量。請拿新的價目表對照你自己的音訊。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273 with a 17-point interval over 1,757 samples and $49.0 per million characters, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples at $16.5, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259 on 1,447 samples at $27.6, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0. The board scores synthesis models and carries no row for Qwen-Audio-3.1-TTS or for any Gemini 3.8 Live endpoint.

3.1 版升級未能解決的問題

這裡有個雙向都容易搞錯的地方。3.1 的改進並不會讓 Qwen-Audio-3.1-TTS 成為能勝任 Gemini 3.8 Live 所做工作的候選者——基於指令的控制、音色轉移和雜訊輸入容忍度,全都讓它成為一張更好的嘴,卻沒有一項給它一隻耳朵。同樣地,Gemini 3.8 Live 的基準測試地位,也完全無法告訴你你的品牌語音能否在粵語的一句話中撐住。

證據裡還有一個缺口,而降價讓人更想忽略它。Qwen-Audio-3.1-TTS 沒有獨立評分。Provider Voice Arena 上 Qwen 名稱旁顯示的 1,259 Elo,屬於即將被取代的 Qwen-Audio-3.0-TTS-Plus,是根據 1,447 個樣本測得的。後繼模型自己的 Arena 條目還不存在。如果你的核准流程需要第三方數字——而對品牌語音來說,大概應該要——那麼較新的模型正是沒有這個數字的那個,而較便宜的方案則是你還無法捍衛的那個。唯一能一錘定音的事,就是 Qwen-Audio-3.1-TTS 出現在盲聽評測板上。

單一關鍵在哪些情況下有所幫助、哪些情況下沒有

3.1 版發布的一個後果很容易被忽略,因為它看起來像是提示工程的細節,而非基礎設施的細節。用自由形式的指示取代 86 個硬編碼標籤,會把你的交付指示變成文字產物。你現在要生成它們、為它們建立版本,並逐一對照新模型的解讀重新驗證——而失效模式是漂移,不是錯誤,因為「溫暖但不濫情」的兩種說法不會有一模一樣的效果。

那是一個包住語音管線的文字推論問題,而這正是我們能派上用場的地方。OrcaRouter 不路由 Qwen-Audio-3.1-TTS 或任何 Qwen-Audio 模型,我們也不路由 Gemini 3.8 Live 端點——這個堆疊的兩半都無法透過我們呼叫,這裡沒有任何內容應被解讀為我們宣稱可以這麼做。我們確實提供的是負責撰寫與檢查方向文字的層:qwen/qwen3.8-flash與google/gemini-3.8-flash,這些都在超過 200 個模型中,來自單一金鑰、依供應商定價且無加成,並具備可將多個模型組合成一次呼叫的路由 DSL,以及自動容錯移轉,當上游服務品質下降時。當你即將針對一個剛改變解讀方式的模型,重新驗證一萬筆投放提示詞時,產生變體並為一致性評分,這部分應該是一份合約,而不是四份。

在你選擇之前該衡量什麼

三項實驗能回答的,比任何董事會都多。拿一個參考語音和你自己腳本裡的一段文字,透過 Qwen-Audio-3.1-TTS 跑一遍,聽聽看基於指令的控制是否能兩次都給你同樣的表現——那就是遷移風險,而衡量它比繞著它做規劃更便宜。用一段帶有你自己背景噪音的真實通話錄音,透過 Gemini 3.8 Live 跑一遍,檢查當來電者在字句中打斷時,輪流發言是否還能維持——那正是語音對語音指標試圖量化的東西,而它遇到真實電話線時,並不可靠到足以憑信心採信。然後用音訊小時,而不是兩家供應商開票所用的單位,來計算你自己用量上的數字,因為在這一組特定搭配上,「便宜的中國 TTS」與「Google 旗艦」之間的預期價差,從來沒有看起來那麼大,而 9 月 23 日之後,它還更小。

A generated summary card for Gemini 3.8 Live vs Qwen-Audio-3.1-TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — speech-to-speech, Live API, 15 September 2026', 'Qwen-Audio-3.1-TTS — text-to-speech, Apsara, 23 September 2026', 'The gap: eight days, and only one of them got cheaper', 'Independent score: Gemini 82.6 on AA Speech to Speech; Qwen 3.1-TTS none', and 'Verdict: not substitutes — pick which half you are shopping for'. A footer line reads 'Vendor-reported figures where stated; independently measured where a board is named.' The OrcaRouter logo is composited in the bottom-right corner.

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新