
Realtime-Venus 與 Qwen-Audio-3.0-TTS:一個讀你的腳本,另一個則必須聽見你
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
將 Realtime-Venus 與 Qwen-Audio-3.0-TTS 拿來比較每小時音訊的價格,這種比較很誘人,而且能得出一個乾淨俐落的答案——但這個答案完全錯誤。Qwen-Audio-3.0-TTS-Plus 的語音生成價格約為每百萬字元 27.6 美元,換算下來,一小時成品音訊大約是 1.66 美元。Realtime-Venus 是 Ant Group 的 Venus 團隊與清華大學共同打造、擁有 9B 參數的全雙工系統;它根本沒有定價,因為它沒有託管服務——但若自行架設,你就得讓一個 GPU 節點持續運作,每小時成本至少高出一個數量級。在這道算術題上,語音渲染器勝出。但這道算術題衡量的其實是兩種不同的產品:Qwen-Audio-3.0-TTS 接收文字並回傳音訊,而 Realtime-Venus 接收音訊與視訊並回傳一段對話。真正將兩者區分開來的問題,不在於它們輸出什麼,而在於是否有任何東西必須回話。
輸入就是全部的差別
Qwen-Audio-3.0-TTS 由阿里雲通義實驗室於 2026 年 7 月 20 日發布,是一款以託管 API 形式提供的文字轉語音模型,並不開放權重。文字透過 HTTP 端點輸入,音訊則從中輸出。它沒有音訊輸入路徑、沒有可接的對話回合、沒有可回傳的逐字稿,也沒有被打斷的概念——這個模型從未聽過任何東西。它整個成本模型就像一台印刷機:輸入字元,輸出音訊。
相較之下,Realtime-Venus 會持續不斷地聆聽。這個視聽檢查點搭載 SigLIP2 視覺編碼器來處理串流影格,並以 Whisper-Medium 音訊編碼器饋入 Qwen3-8B 主幹;兩個檢查點都運行一秒的互動迴圈,持續更新對話狀態,並決定要發言還是保持靜默。它透過離散的 S3 符元與串流式流匹配解碼器來產生語音,而不是另設獨立的合成階段,且能隨波形一併回傳文字。
那不是功能上的差異。那是元件和系統之間的差別。把兩者並排放在一起,其中一個可以直接放進一條前端已經有語音辨識器和語言模型的管線裡。另一個則取代全部三者。
一個具體的案例能讓它變得明確
試想一通客服專線。一位顧客來電,把問題描述得不清不楚,話講到一半停下來找帳號,被背景廣播打斷,接著又在客服人員還沒回答完之前提出追問。
一套以 Qwen-Audio-3.0-TTS 為基礎打造的系統,會把這件事當成三家供應商和三筆帳單來處理:辨識器把來電者的語音轉成文字,語言模型決定要說什麼,Qwen-Audio-3.0-TTS 再把話說出來。每一次跳轉都會增加延遲,而每一個交界處都是韻律消亡的地方。關鍵的失效是結構性的——TTS 這一段聽不見它正在說的那句話中間的停頓,因此插話必須由它前面的某個東西來處理。
Realtime-Venus 以單一模型處理同一通通話,不需要外部語音活動偵測器,也不需要交接。它在 Full-Duplex-Bench v1.5 的數據——對打斷的回應率 75%,以及在附和訊號下的延續率 97%、在他向言語下 88%、在背景語音下 86%——正是描述這個情境的指標。這些數據同樣是自我呈報的,出自該模型自家的技術報告,沒有外部重現。請把它們當作設計主張來解讀,而不是量測結果。
語音品質:一個有 Elo,另一個什麼都沒有
這是比較中最懸殊的部分,明顯大幅偏向阿里巴巴。
• 獨立評分 — 截至 2026 年 9 月 18 日,Qwen-Audio-3.0-TTS-Plus 在 Artificial Analysis 的 Provider Voice Arena 上,以 1,544 個樣本取得 Elo 1,259,排名第二,落後於 1,277 的 Cartesia Sonic 3.6,並領先 1,247 的 Inworld Realtime TTS-2 與 1,241 的 Speechify Simba 3.2。
它的起點——該排行榜自家的發布欄位把這款模型列為 2026 年 9 月的項目,那是目前計分所採用的分級,而非 2026 年 7 月 20 日的上市日期。每當它的名次有變動,它自始至終都穩居前兩名。
• Realtime-Venus — 沒有列入競技場,沒有第三方語音評估,什麼都沒有。它唯一與語音相關的數字,是自我回報的 VoiceBench AlpacaEval 分數 4.81,報告形容該分數與最佳比較數字相符。
• 這代表什麼——除了作者之外,沒有人評判過 Realtime-Venus 聽起來好不好。這不是對它的貶抑;這只是未知,而未知不同於糟糕。但如果語音品質是交付成果,購買有 Elo 評級的模型,勝過憑信心選擇未評級的模型。


語言、語音與表現力控制
阿里巴巴的模型以廣泛的交付能力為設計核心。它提供超過一千種音色,涵蓋十六種語言,其中包括二十個中文方言地區,並提供 86 個內嵌標籤來控制情感與表達——這是一套直接寫進文本本身的控制介面,另加自然語言的表達指令。輸出最高可達 48 kHz,高於前一代的 24 kHz,而單次合成可長達三分鐘。Flash 層級以約 300 毫秒的首包時間為目標,適合即時播放;Plus 層級則是品質層級,生成速度約為每秒十六個字元,這在即時產品中慢得足以造成影響,在批次渲染中卻幾乎察覺不到。
Realtime-Venus 支援英語和中文,隨權重附帶一個參考語音,並為你提供一個 token-to-waveform 解碼器,而不是語音庫。Qwen 意義上的表現力——標籤、指令、上千個預設——在這裡沒有對等物。它取而代之的是能夠根據所聽到的內容改變其表達方式,這是一種不同的表現力控制,而且更難寫在規格表中。
每條路徑的代價,說真的
在任何人用它來編列預算之前,Alibaba 的這個數字確實有個必須注意的但書。被廣泛引用的每百萬字元 $27.6,並非在每一份快照中都與 Alibaba 自家的定價頁面相符,而且各級距是分開定價的。請在帳戶層級核對這個數字,而不是信任比較表,包括這一份在內。
Realtime-Venus 沒有標價,因為根本沒有東西可買。成本是兩個 BF16 的 9B 檢查點——在算進激活記憶體之前,每個就有大約十八 GB 的權重——再加上一個持續運作的串流迴圈,也就是一台不論有沒有人呼叫、都按月計費的 GPU 節點。在穩定流量下,換算成每通對話的成本比按量計費的語音 API 更低;但在間歇性流量下就糟得多,而交叉點是唯一真正重要的財務問題。
還有第三條路,是許多團隊最終會走上的,而且值得把它說清楚,因為它會改變這項決策的樣貌。如果你維持串接式架構,唯一需要採用託管模型的一段就是中間那一段——推理。OrcaRouter 既不提供 Qwen-Audio-3.0-TTS,也不提供 Realtime-Venus;這兩個語音層都不在我們的服務範圍內,而我們寧可直說,也不願暗示並非如此。推理這一段才是我們確實涵蓋的:近 200 個文字模型,透過單一金鑰即可取用,以供應商牌價提供,零加成,跨上游的自動容錯移轉,讓某家供應商即使狀況不佳,也不會中斷進行中的通話,一種路由 DSL,可將多個模型組成單一呼叫,以及當一項決策值得聽取不只一種意見時的模型融合。在串接式架構中,這正是你最希望能不必重新談合約就能替換的一段,也是供應商降價會在同一天反映,而不是等到續約時才反映的一段。

複製是一把雙面刃
Qwen-Audio-3.0-TTS 能從一段簡短的參考樣本複製聲音,而且可跨語言進行,並在文件記載中對嘈雜或具殘響的輸入具備穩健性。這是這項比較中單一最具商業價值的功能,也是最大的合規暴露面。一款能從十秒音訊重現任何說話者聲音的產品,對於「那是誰的聲音,以及誰同意過使用它」這個問題,所需要給出的答案,會比一款只會以供應商預設語音說話的產品長得多。
Realtime-Venus 隨權重一同附帶一個參考語音。如果你有音訊和訓練執行,就能用它來進行複製,但這個發行版本中沒有任何部分是為了讓那件事變得容易而打造——而對於在合規邊界內的自架部署來說,這可以說是比較安全的預設做法。
你實際上買的是哪一個?
當音訊就是產出時,就選購 Qwen-Audio-3.0-TTS。旁白、在地化、無障礙、配音,任何文字先於聲音存在、且以每渲染小時品質為指標的工作流程皆然。若播放是即時的,就從 Flash 開始;當聲音本身就是產品時,再轉到 Plus;並將複製工作流程與預設音色庫分開計價。
當輸入是真人,而系統必須像聆聽者般運作時,就採用 Realtime-Venus。攝影機感知輔助、免手持互動,任何人類會在半句話中間打斷、並期待系統能處理的情況皆適用。取捨非常明顯:你放棄了經 Elo 評分的語音、上千種預設集,以及任何託管選項,換來的卻是兩者之中唯一聽得見你的那個。
大多數產品兩者都想要,只是用在不同的地方。它們不該共用的是一套成本模型——每小時音訊的價格,恰好只適用於這兩種模型中的其中一種,而且不是那個負責對話的模型。
