
Gemini 3.8 TTS 對上 Inworld Realtime TTS-2:你相信哪個計分板會改變答案
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
將 Gemini 3.8 Flash TTS 與 Inworld Realtime TTS-2放在 Artificial Analysis Provider Voice Arena 上並排比較,答案顯而易見:排名第 2 對上排名第 4,Elo 分數 1,260 對上 1,245,兩者各有 8 個競技場語音,正規化後每百萬字元 $16.50 對上 $20.80。這家供應商在排名和價格上都勝出,而 15 分的差距本來就落在兩列的信心區間內。
切到 Artificial Analysis 發布的另一個排行榜,排名就會反轉。Inworld Realtime TTS-2 在 Controlled Voice Arena 以 1,123 的 Elo 拿下榜首,其 Flash 變體則為 1,075。這不是四捨五入的差異——而是由不同模型勝出,原因在於這兩個排行榜衡量的並不是同一件事。如果你正在為產品挑選語音,那麼知道你的使用情境實際上是在問這兩個問題中的哪一個,就是整個決策的關鍵。

兩個看板,兩個不同的問題
Provider Voice Arena 會為模型自家的原生語音評分——也就是供應商隨附並代管的那一些。Controlled Voice Arena 則將語音維持固定,評估每個模型在被要求以非自身聲音說話時表現如何。相同的評審,相同類型的盲測比較,不同的變數。
那個區別對應到兩個不同的工作:
• 供應商排名回答的是「這個模型開箱即用聽起來好不好」。對於一款內建固定旁白語音組合、且從不複製任何聲音的產品而言,這才是正確的排行榜。
• 受控排名回答「這個模型是否遵循聲音規格」。對於聲音屬於客戶的產品——複製的品牌聲音、授權的演員、各租戶專屬的身分——它才是正確的排行榜。
Google 的模型在第一份榜單上領先,Inworld 的模型則在第二份榜單上領先。這兩句話同時成立,而且彼此並不矛盾,這正是為什麼單單一個「哪個 TTS 模型最好」的答案,通常代表作者只挑了一份榜單來看,而沒有看另一份。

Inworld 排名第一的地位在實務上意味著什麼
在受控條件下取得第一名的結果,是一項關於指令遵循程度的宣稱,而指令遵循程度正是決定複製究竟是否可用的關鍵屬性。
Inworld 的複製路徑有兩種形式。即時複製以簡短樣本運作——廠商公布的數字是 5 到 15 秒的參考音訊——而專業複製層級仍處於 Beta 階段,需要大約十分鐘的音訊。兩者皆為廠商自行提報,競技場並未獨立驗證其中任何一項;競技場衡量的是模型在擁有聲音之後的行為表現,而非產生該聲音的複製步驟品質。
附屬於該系列的各項延遲宣稱也屬於同一類別。Flash 變體的首位元組數據——25 毫秒,經由第三方量測回報——以及完整模型的 p99 數據都是 Inworld 自家的,而競技場對這兩者都無從置喙。對於一個以即時為導向的模型而言,它們看似合理,卻未經證實,而這正是看待它們的正確方式。
所以,實際的解讀是:如果你的產品會複製聲音,Inworld 的 Controlled 結果是這兩項分數中較相關的一項,而這也是較低的 Provider 排名並不構成淘汰理由的原因。如果你的產品不進行聲音複製,那項優勢對你來說就看不見,而你該看的是 Provider 排行榜。
價格階梯有三個級距,而便宜的那一個是訂閱制
將一個價格與另一個價格相比,會讓這場對決失準,因為 Inworld 並沒有單一價格——它有一整套定價階梯。
• 隨需 — Realtime TTS-2 每百萬字元 25.00 美元,Flash 15.00 美元。這是隨用隨付使用者看到的費率,也是供應商自行公布的數字。
• 創作者方案 — 同樣這兩款模型分別為 $20.00 與 $10.00,換算下來,選擇訂閱方案而非按量計費,等同於 20% 與 33% 的折扣。此為廠商提供的數據,也是在決定前最值得上即時定價頁面重新確認的一個級距,因為方案條款的變動速度比牌價更快。
• 標準化 — 該競技場的每百萬字元換算得出 Realtime TTS-2 為 $20.80、Flash 為 $10.40,這是排行榜的計算結果,而非任一供應商的報價。
相較之下,Google 的費率是以 token 計價且屬促銷價:輸入每百萬個文字 token 為 0.50 美元,輸出每百萬個音訊 token 為 9.00 美元,優惠至 2026 年 12 月 31 日,之後為 18.00 美元;Flash-Lite TTS 則為 0.50 美元與 6.00 美元,之後為 12.00 美元。經標準化後,即為 16.50 美元與 11.00 美元。

把兩者放在一起看,情況比「Google 比較便宜」更有趣。以今天公布的數字來看,Flash TTS 是三款模型中最便宜的,而 Inworld 的 Flash 版本則位居第二便宜——這兩款 Flash 模型差距之小,只要你的音訊對文字比例稍有變動,就可能翻轉哪一款的計費更低。到了 2027 年 1 月 1 日,當 Google 的費率翻倍時,排名就會底定,Inworld 在其方案階梯的每一階都會成為較便宜的選擇。任何在九月比較這兩者、卻在十二月做出決定的人,比的是錯的數字。
在每種情況下,哪一個才是更好的答案
這兩款模型在品質上足夠接近,差異點在於結構,因此誠實的版本是一份條件清單,而非一個定論。
當聲音由你挑選時,就選 Gemini 3.8 Flash TTS。可依書面描述設計語音、單次呼叫即可進行雙講者對話、逐輪樣式設定,以及按 Google 自己的計算,在兩者中涵蓋語言最廣——這些在本次比較中 Inworld 全都比不過。它同時也是目前較便宜的模型,而其同系列的 Flash-Lite 在同一套 API 內為你提供第二個價格選擇。
當聲音屬於客戶時,就選擇 Inworld Realtime TTS-2。頂級的 Controlled Voice 列、以數秒參考音訊衡量的即時複製途徑、為需要更多功能的情況而設的專業複製層級,以及由廠商公布的首位元組宣稱所支撐的即時定位——但要注意,這些宣稱是廠商自己的說法。依廠商自家文件,它僅支援英文;若你需要其他語言,這是一項硬性限制。
這兩款模型都不是由 OrcaRouter 代管,這一點值得明說,而非含糊地反過來暗示:要呼叫 Gemini 3.8 Flash TTS,該去的是 Google 自家的 API,以及 Google 在 9 月 23 日點名的那些介面;要呼叫 Inworld Realtime TTS-2,該去的是 Inworld 自家的平台。OrcaRouter 的用途在於這個選擇周邊的一切——200 多款模型全都只要一組金鑰即可取用,以供應商定價、不加任何加成,因此像 1 月那次調價,廠商費率一有變動,我們這邊當天就同步生效,自動容錯移轉讓已評估過的模型不必成為正式環境的依賴,還有一套路由 DSL,能在單一嗓音撐不起整項工作時,把多個模型組合成一次呼叫。
之所以要讓這兩者都留在考慮之列,是因為一月的費率變動以及 Controlled 與 Provider 的區別,是答案可能變動的兩個彼此獨立的原因。一條只能呼叫其中之一的管線,兩者都無法依循。
