
StepAudio 3 TTS vs Qwen-Audio-3.0-TTS:其中一個有 Arena 分數,而它不是新的那一個
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
這是一句話總結的完整比較。Qwen-Audio-3.0-TTS在 Text-to-Speech Arena 上,其 Plus 等級的 Elo 為 1,234——這分數是從 2,502 次盲聽投票中獲得的。StepAudio 3 TTS由 StepFun 於 2026 年 9 月 15 日發布,根本不在該排行榜上。它的前代是:StepAudio 2.5 TTS 以 1,306 票獲得 1,209 的 Elo。
所以,誠實的問題並不是「哪一個聽起來更好」。問題是,在上一代測出的 25 點 Elo 差距,能否在一次 StepFun 聲稱改善了韻律、且價格降低超過一半的發布後依然成立。還沒有人辦過那場投票,而下文的一切都是圍繞證據中的那道落差來安排,而不是假裝它不存在。
董事會,按今日實際的組成而言
值得看看真正的排名,因為有好幾篇流傳的報導引用了過時的版本。盲聽競技場會依據投票者偏好哪個樣本,為語音合成模型排名。請從供應商語音排行榜的最上方橫向讀起:
• Cartesia Sonic 3.6 — Elo 1,277,2026 年 8 月,每百萬字元 $49.0
• Inworld Realtime TTS-2 — Elo 1,243,2026 年 8 月,每百萬字元 20.8 美元
• SpeechifyAI Simba 3.2 — Elo 1,238,2026 年 7 月,每百萬字元 6.6 美元
• Alibaba Qwen-Audio-3.0-TTS-Plus — Elo 1,234,2026 年 7 月,每百萬字元 27.6 美元,8 種 Arena 語音
• VUI Labs Luna TTS — Elo 1,229,2026年6月,每百萬字元 $80.0
• Inworld 即時 TTS-2 Flash — Elo 1,213,2026 年 8 月,每百萬字元 $10.4
• StepFun StepAudio 2.5 TTS — Elo 1,209,2026 年 8 月,每百萬字元 $85.0,8 種競技場語音
• Google Gemini 3.1 Flash TTS — Elo 1,204,2026 年 4 月,每百萬字元 18.3 美元

那張清單立刻透露出兩件事。第一,Qwen 的 Plus 等級並非領先者——它排名第四,落後於 Cartesia、Inworld 和 Speechify,而被引用為冠軍的 1,234 這個數字,在一個如今已經變動的排行榜上只是中游分數。第二,StepAudio 2.5 TTS 於 2026 年 8 月重新測試,排名第七,落後 Qwen 25 Elo,價格卻是其三倍以上。
還有第三件事,比這一切都更重要:看看信賴區間。Qwen 的 Plus 等級在 2,502 個樣本中列為 −14/+14。StepAudio 2.5 TTS 則在 1,306 個樣本中列為 −16/+16。這兩個區間互相重疊。兩個模型的誤差範圍分別往兩邊各延伸 14 點與 16 點,它們之間 25 點的差距並不是已獲證實的品質差異——而是兩個競技場目前無法區分的模型,被排成一個再多幾百票就可能翻轉的順序。

缺失的資料點讓你付出多少代價
StepAudio 3 TTS 是 StepFun 用來取代 StepAudio 2.5 TTS 的模型,其發表宣稱能控制音色、語調、節奏與換氣停頓,還具備副語言行為——笑聲、遲疑、口吃、重複、自我修正——並透過生成與播放相互重疊的串流架構來實現。
那正是這個競技場所衡量的一系列特質。這也正是為什麼缺少分數令人沮喪,而非致命:能夠回答這個問題的基準測試確實存在,是公開運行的,只是自新模型發布以來尚未重新運行。任何告訴你 StepAudio 3 TTS 聽起來比 Qwen-Audio-3.0-TTS 更好的人,都是在根據一個以落在其自身誤差範圍內的差距落敗的前代模型進行外推。
價格是唯一有完整紀錄的部分,而且它波動很大
StepAudio 3 TTS 在 StepFun 自家平台上以每萬字 2.5 元人民幣計費。StepAudio 2.5 TTS 則為 5.8。在該競技場自家以字元為單位的定價欄中,較舊的模型是每百萬字元 85.00 美元;以近期匯率換算,每萬字 2.5 元人民幣約等於每百萬字元 35 美元——這項換算是我們自行計算的,而非官方公布的數字,值得依你所在區域與匯率重新換算一次。這在同一費用項目上相當於降價近 60%。
它仍然高於 Qwen。Qwen-Audio-3.0-TTS-Plus 的定價為每百萬字元 27.6 美元,而 Flash 方案甚至更便宜;Alibaba Cloud Model Studio 的語音合成是以輸入字元計費,而非依產生的音訊計費——輸出不會另行收費。第三方平台上架 Flash 方案時所報的價格為每百萬字元十幾美元(接近二十美元),不過地區差異使任何單一宣傳數字都不可靠。
所以情況大致是這樣:StepFun 大約把合成成本減半,拉近了與 Qwen 的大部分差距,但並未超越它。如果每字元價格是你的硬性限制,論點會收窄,但答案不會改變。如果不是,價格已不再是選擇任一模型的理由。
語音庫存與語言覆蓋範圍相差甚遠
這正是比較不再取決於個人判斷,而成為規格問題的地方。
• 語音數量 — Qwen-Audio-3.0-TTS 在其各層級中提供超過 1,000 種語音,而 StepAudio 3 TTS 則沒有可比的已公布數量
• 語言 — Qwen-Audio-3.0-TTS 支援 16 種語言外加 20 種中文方言,其中 Flash 層級針對低資源語言與方言真實度進行調校,相較於 StepAudio 3 TTS 以中文為優先,且未宣稱具備同等的涵蓋範圍
• 請求大小 — Qwen-Audio-3.0-TTS 每次請求 20,000 字元,相較之下 StepAudio 3 TTS 未公布
• 延遲 — 根據阿里巴巴自家文件,Qwen-Audio-3.0-TTS Flash 的目標是首封包延遲在 200 毫秒以內;相較之下,StepAudio 3 TTS 串流則未公布數據。
• 分層機制 — Qwen-Audio-3.0-TTS Plus 主打表現力,Flash 主打即時性;六款旗艦語音各自鎖定在其中一個層級,對比 StepAudio 3 TTS 僅有單一層級
• 控制介面 — Qwen-Audio-3.0-TTS 的自然語言表達指導,加上嵌入輸入文本中的行內表情標籤(如 [excited]、[laughing]、[whispers]),相對於 StepAudio 3 TTS 由模型從上下文推斷的韻律
• 聲音克隆 — StepAudio 3 TTS 在其各 TTS 方案中,每個克隆語音一律 9.9 元,對比透過 Alibaba Cloud Model Studio 使用 Qwen-Audio-3.0-TTS 進行克隆
輸出 — Qwen-Audio-3.0-TTS 24 kHz 預設取樣率,對比 StepAudio 3 TTS 未公布
那一列控制介面才是真正的設計差異,而這不是品質問題。Qwen 的表達標籤既明確又同步:你把情緒寫進文字裡,模型就會把它渲染出來,這讓標籤可測試、也利於回歸驗證。StepFun 的描述則是:模型會從脈絡推斷出適當的遲疑或笑聲,這在推斷正確時聽起來更好,但推斷錯誤時卻難得多定位。要選哪個,取決於你比較想自己編排演出,還是把它交給模型代勞。

如何在沒有測量的情況下決定
你無法根據已公布的數字,靠推理解出答案,因為那個決定性的數字並不存在。剩下的就是測試,而測試這兩者有一種值得事先規劃的特定形態。
兩者都是僅提供託管服務的商業 API——Qwen-Audio-3.0-TTS 透過 Alibaba Cloud Model Studio,StepAudio 3 TTS 則透過 StepFun 的開放平台。兩者皆非開放權重,因此沒有可供評估的自架途徑。在此精確說明 OrcaRouter 的涵蓋範圍:我們目前目錄中的文字轉語音模型是 OpenAI tts-1 系列、gpt-4o-mini-tts 以及 Google 的 Gemini TTS 預覽版。本文提到的兩個模型都不在其中,Qwen-Audio-3.0-TTS 也不在——此處的任何內容都不應被解讀為我們提供這些模型的宣稱。
真正落在 OrcaRouter 上的部分,是這條流程中負責文字的那一半。你的合成層所讀取的腳本是由語言模型產生的,而這正是最常變動、重新簽約成本最高,也最容易被擺著不鎖定版本的元件——近 200 個文字模型藏在單一 API 之後、自動容錯移轉、能把多個模型組合成一次呼叫的路由 DSL,以及在一顆模型的判斷力不夠時所用的模型融合,同時以不加價的方式直接反映供應商的定價表。如果你要在這兩個合成模型之間做盲測,請透過同一個端點產生語料,讓兩個候選模型讀到完全相同的輸入,並把合成層放在一個能隨時替換的介面之後。
這讓決定處於什麼境地
如果你需要的是廣度,今天就選 Qwen-Audio-3.0-TTS——超過一千種音色、16 種語言與 20 種方言、有文件記載的 20,000 字元請求上限、延遲層級與表現力層級、200 毫秒首封包目標,以及低於 StepFun 的費率。它是有實測數據撐腰、涵蓋面也更廣的模型,而它第四名的 Elo 是真實的成績,即使那不是它被引述時所冠上的王冠。
選擇 StepAudio 3 TTS,如果你是以中文優先進行開發、想要單一層級而非層級選擇決策、想要以固定的公開費用進行聲音複製,並且願意搶先使用一個尚未經過盲測的模型。你每字元支付的費用比 Qwen 的 Plus 層級大約多 27%,換取的是號稱比一個 Elo 低 25 分、誤差範圍重疊的模型領先一個世代的韻律改善。
要讓事情有定論,就是讓 StepAudio 3 TTS 加入候選池,重新跑一次競技場。在那次投票出現之前,這是一個已受測模型對上一個未受測模型,而分隔它們前代模型的 25 分差距落在雜訊範圍內——這不是排名,也不該被當成排名來推銷。
