
Gemini 3.8 Live 對比 Qwen-Audio-3.1-TTS:語音堆疊的兩半,相隔八天重新定價
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 36 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 181 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
Gemini 3.8 Live 是 Google 的語音對語音模型,於 2026 年 9 月 15 日以 gemini-3.8-live 及 gemini-3.8-live-extended-thinking 在 Live API 上推出。Qwen-Audio-3.1-TTS 是阿里巴巴的文字轉語音模型,於 2026 年 9 月 23 日在杭州雲棲大會(Apsara Conference)發表,晚了八天,並附帶語音合成約 70% 的降價。這八天的差距,正是為什麼這個比較現在值得一讀,而不是等到七月。兩個產品各自的角色並沒有任何改變——一個負責聆聽與說話,另一個負責把文字朗讀出來——但一條正式上線的語音處理流程,其兩半都在短短兩週內被重建或重新定價,而以往用來判定這場對決的算式,也就這麼悄悄地改變了。
兩半,相隔八天更新
先從讓這個組合與眾不同的一點說起:這兩個模型並不互相競爭。一個語音產品有一張嘴,也有一隻耳朵,而這兩個模型各是其中之一。Gemini 3.8 Live 把迴路閉合起來——音訊與視訊輸入、音訊輸出、中斷處理,以及對話底下運行的工具呼叫。Qwen-Audio-3.1-TTS 接收一段字串和一個參考語音,然後回傳一場演出。它最擅長扮演的是一張嘴,而不是其他任何東西,而且它並不想當一隻耳朵。
九月這個時間點之所以耐人尋味,在於這兩則公告瞄準的是同一條預算線的兩端。Google 九月十五日的發布談的是能力,完全沒動到價格;阿里巴巴九月二十三日的公告則主要在講利潤率,新能力只是順帶一提。一個在八月打造出混合式流程的團隊,在短短八天之內就被給了一個重新檢視這兩條腿的理由——而其中只有一條腿變便宜了。
3.1 版本在 Qwen 端究竟改變了什麼
阿里巴巴在 9 月 23 日發布的不只一款模型。3.1 世代涵蓋五個端點——Qwen-Audio-3.1-ASR、Qwen-Audio-3.1-ASR-Next、Qwen-Audio-3.1-TTS、Qwen-Audio-3.1-TTS-Next 和 Qwen-Audio-3.1-Realtime——而其中只有一個,也就是一般的 TTS 層級,對任何已經在呼叫 3.0 TTS 模型的人來說,是可以直接替換的選擇。
在那個層級上,有三件事改變了,而其中一件是真正的遷移成本。表達控制從固定的 86 個行內標籤詞彙,改為自然語言指令:你描述自己想要的情緒、節奏與風格,而不再是在正確位置插入正確的括號標記。跨語言音色轉移功能問世,讓單一參考語音能將其音色身分帶到華語、粵語、英語與日語之中。而該模型現在可直接容忍含雜訊或有回音的參考音訊,無須另外進行降噪步驟。語言涵蓋範圍不變,仍是廠商回報的 16 種語言加上 20 個漢語方言區;而且——這點值得特別提出,因為它在其他地方常被含糊帶過——Alibaba 自家的資料聲稱 3.1 層級新增了七種語言,這與七月版本公布涵蓋範圍時所列的 16 種語言並不相符。在你針對 Model Studio 核對自己所需的特定語言之前,這兩個數字都應視為廠商說法。
這次發布中真正全新的產品是 Qwen-Audio-3.1-TTS-Next,阿里巴巴稱之為「Audiogen」模型:一次生成即可同時產出人聲、音效與背景環境音,適用於多人對話、播客組裝與場景製作。在北京節點上,它的定價為每百萬輸入詞元 0.848 美元、每百萬輸出詞元 1.696 美元,輸入上限為 3,000 字元,播客可生成 240 秒音訊,其他用途則為 120 秒,每秒可發出三次請求,最多可接受三段各 30 秒的參考音訊片段。它僅支援中文與英文。如果你的流程只是單一旁白朗讀腳本,這個產品與你無關;如果是兩位主持人加上背景配樂,那它正是你該關注這次發布的唯一理由。
接縫才是你真正在選擇的東西
因為這兩個模型並不執行相同的工作,所以這個決定並不是一場評比。問題在於你把交接點放在哪裡,以及你願意付出多少代價,讓那道接縫隱形。
有兩種誠實的架構。第一種是單一網路:Gemini 3.8 Live 處理整個對話回合,聽見來電者、決定要說什麼並說出來,而你得接受它給你的聲音——那是你無法複製、也無法打上自家品牌的。第二種是串接式架構:先辨識,再推理,然後由 Qwen-Audio-3.1-TTS 發聲,讓你擁有上千種聲音,包括由自家配音員錄製的那一把,代價則是跨越兩到三個供應商界線所帶來的延遲,以及當一句話被拆散在多次 API 呼叫之間時所流失的韻律。
多數團隊最後兩者都會採用,而這並不是缺乏膽識。在延遲會被感受到的地方使用即時模型——打斷、回應確認、讓來電者知道你還在線上的那聲「嗯哼」——並在品質會被聽見的地方使用語音合成模型:長篇政策的覆誦、以刻意放慢的速度念出的確認號碼、每一通電話都必須一模一樣的品牌語音。對一大類產品而言,混合式做法才是正確答案。這也是成本模型變得棘手的地方,因為你現在要計量兩種不同的單位。

以每音訊小時計價,這是兩者唯一都適用的單位
Google 的 Live API 按分鐘計費;Alibaba 的 Qwen TTS 各級方案則按字元和 token 計費。要比較兩者,你必須選擇一個標準化基準,而對語音來說,唯一站得住腳的基準就是成品音訊的小時數。
• 輸入計費 — Gemini 3.8 Live 每分鐘音訊 $0.005 輸入、$0.018 輸出,對比 Qwen-Audio-3.1-TTS 每百萬字元計費,3.0 Plus 級距在降價前約為 $27.60,Flash 級距約為 $15,而降價後 TTS Flash 級距的定價為每百萬輸入 token 人民幣 1.5 元、每百萬輸出 token 人民幣 12 元
• 輸出計費 — Gemini 3.8 Live 雙向對話依定價表,每小時實際通話時間約 $1.38,尚未計入任何快取,對比 Qwen-Audio-3.1-TTS 為單向串流,其 3.1-Next 級距在北京節點為每百萬輸入 token $0.848、每百萬輸出 $1.696
• 能聽見來電者 — Gemini 3.8 Live 可以,原生音訊與視訊輸入;Qwen-Audio-3.1-TTS 不行,僅文字輸入、音訊輸出
• 語音 — Gemini 3.8 Live 僅一種語音,無法複製、無法品牌化;Qwen-Audio-3.1-TTS 則有上千種以上,可從嘈雜的參考音訊進行零樣本複製
• 語言 — Gemini 3.8 Live 廠商回報為 97 種,可在對話中切換;Qwen-Audio-3.1-TTS 廠商回報為 16 種,另加 20 個中文方言區,並可在華語、粵語、英語與日語之間進行音色轉移
• 表達控制 — Gemini 3.8 Live 透過提示與對話上下文;Qwen-Audio-3.1-TTS 則採用自然語言指令,取代 3.0 世代的 86 個行內標籤
• 獨立評分 — Gemini 3.8 Live 在 Artificial Analysis 語音對語音指數中,Extended Thinking 變體為 82.6,標準版為 76.0;Qwen-Audio-3.1-TTS 則無;最接近的 Qwen 數字是前一代 3.0 Plus 級距在 Provider Voice Arena 上的 1,259 Elo,那是對前代產品的評分,而非本模型
這個百分比降幅是對照依區域與層級而異的費率所報出的,因此主打的 70% 並非對你的流量所作的承諾;而且 Alibaba Cloud 也把新加坡節點上的即時轉錄從按時長計費改為按 token 計量——這是較難以預測的基準,因為靜音與多輪對話脈絡都會推高 token 消耗量。請拿新的價目表對照你自己的音訊。

3.1 版升級未能解決的問題
這裡有個雙向都容易搞錯的地方。3.1 的改進並不會讓 Qwen-Audio-3.1-TTS 成為能勝任 Gemini 3.8 Live 所做工作的候選者——基於指令的控制、音色轉移和雜訊輸入容忍度,全都讓它成為一張更好的嘴,卻沒有一項給它一隻耳朵。同樣地,Gemini 3.8 Live 的基準測試地位,也完全無法告訴你你的品牌語音能否在粵語的一句話中撐住。
證據裡還有一個缺口,而降價讓人更想忽略它。Qwen-Audio-3.1-TTS 沒有獨立評分。Provider Voice Arena 上 Qwen 名稱旁顯示的 1,259 Elo,屬於即將被取代的 Qwen-Audio-3.0-TTS-Plus,是根據 1,447 個樣本測得的。後繼模型自己的 Arena 條目還不存在。如果你的核准流程需要第三方數字——而對品牌語音來說,大概應該要——那麼較新的模型正是沒有這個數字的那個,而較便宜的方案則是你還無法捍衛的那個。唯一能一錘定音的事,就是 Qwen-Audio-3.1-TTS 出現在盲聽評測板上。
單一關鍵在哪些情況下有所幫助、哪些情況下沒有
3.1 版發布的一個後果很容易被忽略,因為它看起來像是提示工程的細節,而非基礎設施的細節。用自由形式的指示取代 86 個硬編碼標籤,會把你的交付指示變成文字產物。你現在要生成它們、為它們建立版本,並逐一對照新模型的解讀重新驗證——而失效模式是漂移,不是錯誤,因為「溫暖但不濫情」的兩種說法不會有一模一樣的效果。
那是一個包住語音管線的文字推論問題,而這正是我們能派上用場的地方。OrcaRouter 不路由 Qwen-Audio-3.1-TTS 或任何 Qwen-Audio 模型,我們也不路由 Gemini 3.8 Live 端點——這個堆疊的兩半都無法透過我們呼叫,這裡沒有任何內容應被解讀為我們宣稱可以這麼做。我們確實提供的是負責撰寫與檢查方向文字的層:qwen/qwen3.8-flash與google/gemini-3.8-flash,這些都在超過 200 個模型中,來自單一金鑰、依供應商定價且無加成,並具備可將多個模型組合成一次呼叫的路由 DSL,以及自動容錯移轉,當上游服務品質下降時。當你即將針對一個剛改變解讀方式的模型,重新驗證一萬筆投放提示詞時,產生變體並為一致性評分,這部分應該是一份合約,而不是四份。
在你選擇之前該衡量什麼
三項實驗能回答的,比任何董事會都多。拿一個參考語音和你自己腳本裡的一段文字,透過 Qwen-Audio-3.1-TTS 跑一遍,聽聽看基於指令的控制是否能兩次都給你同樣的表現——那就是遷移風險,而衡量它比繞著它做規劃更便宜。用一段帶有你自己背景噪音的真實通話錄音,透過 Gemini 3.8 Live 跑一遍,檢查當來電者在字句中打斷時,輪流發言是否還能維持——那正是語音對語音指標試圖量化的東西,而它遇到真實電話線時,並不可靠到足以憑信心採信。然後用音訊小時,而不是兩家供應商開票所用的單位,來計算你自己用量上的數字,因為在這一組特定搭配上,「便宜的中國 TTS」與「Google 旗艦」之間的預期價差,從來沒有看起來那麼大,而 9 月 23 日之後,它還更小。

本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
