一張為「Gemini 3.8 TTS vs Qwen Audio 3.0 TTS」產生的主視覺卡片,白色背景,帶有柔和的藍青色漸層點綴。左側卡片「Qwen-Audio-3.0-TTS-Plus」列出 Elo 1,259、15 種 Arena 語音、16 種語言 + 20 種方言,以及每 100 萬字元 $27.6;右側卡片「Gemini 3.8 Flash TTS」列出 Elo 1,260、8 種 Arena 語音、130 種語言,以及每 100 萬字元 $33.0。頁尾一行寫著「Elo 資料來源:Artificial Analysis Provider Voice Arena,2026 年 9 月。」OrcaRouter 標誌合成於右下角。
Engineering & Research

Gemini 3.8 TTS 對比 Qwen Audio 3.0 TTS:「讓聲音聽起來對」的兩種不同答案

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

在 Artificial Analysis Provider Voice Arena 上,這兩個模型之間僅相差一分 Elo,而它們達到這個成績的方式,是解決了截然不同的問題。Qwen-Audio-3.0-TTS-Plus排名第 3,Elo 為 1,259,涵蓋 1,447 個樣本與 15 種競技場語音,於 2026 年 9 月發布,標價為每百萬字元 27.60 美元。Gemini 3.8 Flash TTS排名第 2,Elo 為 1,260,涵蓋 1,999 個樣本與 8 種競技場語音,於 2026 年 9 月 23 日發布,標價為每百萬字元 33.00 美元。在統計上無從區分,價格相差百分之二十,且建立在關於什麼讓合成語音出色的截然相反理論之上。

理論才是有趣的部分。Qwen 的答案在於行內控制:86 個表達標籤,讓你穿插在文字中,好讓模型知道哪裡該換氣、加重語氣、轉換語域。Google 的答案則是一層導演指令:逐行指示、雙說話者的場面調度,以及少量非語言提示。如果你已經打造了一條會輸出類 SSML 標註的管線,這兩種做法會有一種適用,另一種不適用,而這種相容性比單一 Elo 分數更重要。

這兩者實際上在董事會中的位置

誠實解讀 Provider Voice Arena 需要看的是區間,而非排名。

• Qwen-Audio-3.0-TTS-Plus — 排名第 3,Elo 1,259,1,447 個樣本,15 種競技場語音,2026 年 9 月,每 100 萬字元 27.6 美元。

• Gemini 3.8 Flash TTS — 排名第 2,Elo 1,260,1,999 個樣本,8 種競技場語音,2026 年 9 月,每 100 萬字元 33.0 美元。

• Cartesia Sonic 3.6 — 排名第 1,Elo 1,273,1,757 個樣本,8 種競技場語音,2026 年 8 月,每 100 萬字元 49.0 美元。

前三名屬於同一梯隊。前兩名公佈的區間上下各延伸十七分,這比第一名與第三名之間的整體差距還大,因此它們之間的排序並非穩定可靠的證據。這份榜單確實能確定的是,這三者都位於領先群,而且它們下方沒有任何名次接近——排名第 10 的 Gemini 3.1 Flash TTS 為 1,199。

唯一值得注意的不對稱之處,是競技場語音數量。Qwen 提供 15 種語音,而 Gemini 為 8 種,因此 Qwen 的分數是對該廠商自家產品更廣泛樣本取平均。這是一體兩面:它既能更公平地估計 Qwen 整體語音庫聽起來如何,也讓 Qwen 有更多機會推出拉低平均的弱語音。無論哪種解讀,都不改變兩者並列打平的結論。

A generated two-column scoreboard for Qwen-Audio-3.0-TTS-Plus and Gemini 3.8 Flash TTS — Qwen at Arena Elo 1,259, $27.60 per 1M characters, 15 arena voices, 16 languages and inline-tag style control; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 8 arena voices, 130 languages and a direction layer — over the footer 'Per Artificial Analysis Provider Voice Arena, Sept 2026.'

86 個交付標籤對照方向圖層

這是實質上的差異,而它決定了大多數的整合。

Qwen-Audio-3.0-TTS 隨附 86 個行內表達標籤——這些嵌入文字中的註解可控制某段文字要如何被唸出。這是一種標記式做法:由你的文稿承載演出效果。對任何用過 SSML 的人來說,這都很熟悉,而且它能與以程式化方式產生文字的工具良好搭配,因為其控制介面是字串轉換,而非 API 呼叫。

Gemini 3.8 Flash TTS 走的是另一條路。你就像指導演員那樣來指導一句台詞——語速、強調、情緒基調——把它當成獨立指令,而不是行內標記。雙人對白的場景可以在單一次呼叫中安排演出。此外,還有一小組非語言提示可以直接寫進腳本:<laughs><sigh><gasp> 作為行內提示,再加上 |mhm||yeah| 來表示應答聲。

所以兩個模型都接受文內標註;差別在於詞彙集的大小,以及其餘控制所在的位置。Qwen 的詞彙集更廣、更扁平——86 個標籤,全都放在文字中。Google 的詞彙集在文字內較窄,在文字外則較廣,並以表達指示與說話者配置作為呼叫層級參數。如果你要移植的系統已經會輸出豐富的行內標記,Qwen 的移植路徑較短。如果你反正都要在應用程式碼中建構指示邏輯,Google 的拆分方式更乾淨。

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

語言覆蓋與方言覆蓋

這些涵蓋率數字無法互相比較,而天真地進行比較是錯誤的。

Gemini 3.8 Flash TTS 涵蓋 130 種語言,並可從文字自動偵測;Flash-Lite TTS 則涵蓋 101 種。這種橫跨各語系的廣泛涵蓋,正是必須觸及長尾市場的在地化流程所需要的。

Qwen-Audio-3.0-TTS 涵蓋 16 種語言,外加 20 個中文方言區。這是在單一語系內部的深度。20 個方言區乍看之下,並不是比 130 種語言更小的數字——它是一種不同性質的宣稱,而對於一款服務中國大陸各地中文使用者的產品來說,它才是更有用的那種。一個支援 130 種語言卻只有一種普通話語音的模型,無法像一個涵蓋 20 個方言區的模型那樣服務四川的使用者。

哪一個比較重要,完全取決於你的受眾。如果你的需求是「至少在二十個市場還過得去」,那就選 Gemini。如果是「在中國市場真正到位」,那就選 Qwen。

價格,以及每字元數字所隱藏的事

• Qwen-Audio-3.0-TTS-Plus — 在排行榜的標準化基準下,每百萬字元為 $27.60;Flash 版本則約為每百萬字元 $15,並宣稱首封包延遲約 300 毫秒。

• Gemini 3.8 Flash TTS — 每 100 萬個正規化字元 $33.00;由 Google 計費,每百萬個輸入文字 token 為 $0.50,每百萬個輸出音訊 token 為 $9.00,此費率適用至 2026 年 12 月 31 日,之後為 $1.00 與 $18.00。

• Gemini 3.8 Flash-Lite TTS — 排名第 6、Elo 為 1,235,每 100 萬個正規化字元為 $22.10;至 2026 年 12 月 31 日止,每百萬個音訊 token 以 $6.00 計費。

這兩個每字元數字都是 Artificial Analysis 的正規化數據,並非供應商的牌價——Qwen 透過 Alibaba Cloud Model Studio 計費,而 Google 以詞元計費,且兩者皆未公布這些模型的每字元費率。請將它們用於計算比率,該比率大約為 1.2 倍,對 Qwen 有利,而非當作報價。

這些層級在形態上出現分歧。Qwen 拆分為 Plus 與 Flash,其中 Flash 層級以品質換取約 300 毫秒首封包延遲的宣稱。Google 拆分為 Flash 與 Flash-Lite,然後再進一步分為 Standard、Batch 與 Flex,以及 Priority——在 Flash TTS 上,每百萬音訊 token 分別為 $4.50、$9.00 和 $16.20。Google 的模式會獎勵你將工作負載分類;Qwen 的模式則獎勵你事先選好品質層級。

可用性是另一個真正的差異。Gemini 3.8 Flash TTS 已在 Gemini Developer API 上正式推出。Qwen-Audio-3.0-TTS 是封閉且僅限託管的,透過 Alibaba Cloud Model Studio 提供,沒有開放權重。如果你需要自行執行模型,這兩者都不適合你——但如果你的基礎架構已經在 Alibaba Cloud 上,Qwen 模型就是那個不必處理資料傳出(egress)問題的選擇。

雙方供應商主張

這兩個模型都沒有競技場以外的獨立基準,而兩家廠商也都發表了應如此標示的宣稱。

Google 針對 Gemini 3.8 Flash TTS 的表現:在 Hume AI Voice Design Benchmark 以 71.4 排名第一,在口音建模以 60.8 排名第一,在 Flash 與 Flash-Lite 的 Hume Overall Quality Index 上分別排名第一與第二,並宣稱在日語、巴西葡萄牙語、越南語、現代標準阿拉伯語、墨西哥西班牙語和印地語的盲測偏好中取得頂尖名次。這些測試運行並未公開。

阿里巴巴的,針對 Qwen-Audio-3.0-TTS:86 種標籤的演繹系統、20 個方言區域,以及 Flash 版本上約 300 毫秒的首包數據。同樣未經重現。

競技場 Elo 是本文中唯一獨立收集的品質數字,而它顯示這兩者在排行榜上並列第一。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing Cartesia Sonic 3.6 at rank 1 with Elo 1,273, Gemini 3.8 Flash TTS at rank 2 with 1,260 across 1,999 samples, Qwen-Audio-3.0-TTS-Plus at rank 3 with 1,259, 1,447 samples, 15 arena voices and $27.6 per 1M characters, and ElevenLabs Eleven v3 at rank 17 with 1,167.

Gemini 新增了哪些 Qwen 沒有的東西

語音建立是最明顯的缺口。Gemini 3.8 Flash TTS 支援從自然語言描述進行語音設計,以及從 30 秒樣本進行語音複製,並具備同意驗證,輸出還帶有 SynthID 浮水印與 C2PA 憑證。自訂語音有兩種形式:每個專案 200 個具狀態語音,有效期為一年;或是無狀態語音,其位址由 voicekey_... 控制代碼決定,這些控制代碼會在七天後失效。語音重混功能列為即將推出。

輸出格式控制是第二項。在單一(unary)端點上採用 WAV 24 kHz 單聲道 16 位元有號 PCM,在串流端點上採用無標頭 PCM(audio/l16),另外還支援 audio/mulaw 與 audio/alaw,以及可設定的取樣率。對於與電話語音相關的工作,支援 mulaw 可省去一道轉碼步驟。

該打哪一個

若你的使用者說中文,且需求在於涵蓋各種方言,就選 Qwen-Audio-3.0-TTS;若你想要一套豐富的內嵌標記詞彙,讓你的產生器能直接輸出,也選它;或者你已經在阿里雲上,想要最快接上可運作的端點,同樣選它。以正規化基準來看,它也是兩者中較便宜的那個;而若約 300 毫秒的首包延遲可接受,Flash 版本又更便宜。

如果您需要的是橫跨多種語言的廣度,而非單一語言的深度;如果您需要建立或複製特定語音;如果您需要 mulaw 或 alaw 輸出;或者如果「一般可用,而非僅限託管」是採購要求,請選擇 Gemini 3.8 Flash TTS。

兩者都不是糟糕的選擇,而且兩者也都沒有明顯較好——這正是只差一個 Elo 分的重點。這項決定取決於相容性,而非品質。

這也是為什麼還不該急著押寶任何一方。OrcaRouter 讓你用一把金鑰就能取用 200+ 個模型,價格就是供應商定價、不加任何加成,因此任一實驗室的費率變動,當天就會反映到你的帳單上,而不是等到續約才調整,而且自動容錯移轉意味著在負載下撐不住的語音合成端點會改由另一個接手,而不是讓請求直接失敗。我們不代管 Qwen-Audio-3.0-TTS——那是透過 Alibaba Cloud Model Studio 提供的——我們也不代管 Gemini 3.8 TTS 端點,那些來自 Google 的 API。我們提供的是文字層以及其上的路由層,正是這一點讓你能在做出選擇之前,先讓兩者在真實流量上跑一個月。

值得關注的數字是下一次的 arena 修訂。Qwen 有 1,447 個樣本、Gemini 有 1,999 個樣本,兩者的區間仍都夠寬,因此單一個月的投票就可能將它們分出高下——或確認平手才是答案。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新