
Inworld Realtime TTS-2 對比 Cartesia Sonic 3.6:會傾聽的聲音 vs 競技場之王
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
關於合成語音為何會讓人覺得像真人,有兩種相互競爭的理論,而目前這兩種理論各自最佳的商業範例分別是 Inworld Realtime TTS-2 和 Cartesia Sonic 3.6。Cartesia 的理論是,人性存在於音訊之中:讓音色、韻律及節奏都與真人難以分辨,聽眾就會把你排在第一——Sonic 3.6 在八月就做到了這一點,以 Elo 1,282 分躍居 Artificial Analysis 的 Provider Voice 競技場榜首。Inworld 的理論則是,人性存在於聆聽之中:TTS-2 會根據先前對話的實際音訊來調整它的表達方式,因此它不只是聽起來像真人,回應方式也像真人。本週,這兩種理論在記分板上交鋒:同一份重新計分,讓 Inworld Realtime TTS-2 以 Elo 1,252 分在 Provider 排行榜上名列第二,同時也讓它在 Controlled Voice 競技場——這個榜單原本由 Cartesia 領先——以 1,123 分登上第一,勝過 Sonic 3.6 的 1,119 分。其中一個模型保有 Provider 排行榜的桂冠,另一個則剛奪下 Controlled Voice 排行榜的寶座。
这不是一场某一方明显有错的较量。两款模型是为重叠但并非完全相同的任务而构建的,价格差异——Sonic 3.6 每百万字符 49.0 美元,对比 Inworld Realtime TTS-2 的按需 25 美元——确实真实存在,使得决策既包含预算因素,也包含质量因素。
關於人類語音的兩種理論
Cartesia 在 2026 年 8 月低調發布了 Sonic 3.6,這是一個在 Sonic 3.5 基礎上改進的小版本,並未改變價格或架構敘事。這項改進出現在 Cartesia 最需要的地方:該模型在 Artificial Analysis 的 Provider Voice 競技場中躍升至 Elo 1,282——該競技場中每個模型都使用自己的原生語音——並在整個 8 月保持 Controlled Voice 競技場的領先地位。在受控排行榜上,每個模型都被克隆到相同的八位參考說話者身上,因此那個桂冠是對合成引擎本身的評判,與配音人才無關。本週 Inworld 一般可用性重新評分後,Cartesia 仍領先供應商排行榜,但 Sonic 3.6 現在以 Elo 1,119 位居受控排行榜第二,落後 Inworld Realtime TTS-2 的 1,123 四分。
Inworld Realtime TTS-2 源自不同的傳統。其前身產品線 TTS 1.5 在 2026 年初時即位居同類榜單的頂尖之列;而 TTS-2 的研究預覽版在 6 月於供應商排行榜上測得 Elo 1,209。自推出正式版(GA)後,排名持續攀升:在目前的榜單上,Provider Voice 獲得 1,252(第 2 名,僅次於 Sonic 3.6 的 1,282),Controlled Voice 獲得 1,123(第 1 名)。不過,這款旗艦模型的真正差異點不在於 Elo,而在於它能將對話中先前的輪次當作音訊輸入,並以此塑造下一句的呈現方式。Cartesia 從文字紀錄校準情緒;Inworld 則聆聽上一句話的表達方式。
記分板,如實標示。
Elo 分數來自 Artificial Analysis 的語音競技場,於 2026 年 9 月從即時排行榜讀取。延遲數據除非另有註明,否則皆為廠商回報,且這兩款型號均未發布獨立的延遲審計報告。
• 獨立品質 — Cartesia Sonic 3.6:Elo 1,282(第 1 名,供應商語音)與 1,119(第 2 名,受控語音)對比 Inworld Realtime TTS-2:Elo 1,252(第 2 名,供應商語音)與 1,123(第 1 名,受控語音)
• 每 1M 字符價格 — 49.0 美元(Artificial Analysis 追蹤)對比按需 25 美元、混合 20.8 美元(Artificial Analysis 追蹤),批量購買時可低至 12.50 美元(供應商)
• 首次音訊時間 — 低於 90 毫秒(廠商宣稱),對比 Inworld 上市測試中的中位數低於 200 毫秒、p99 低於 100 毫秒(廠商宣稱);Inworld 針對 Sonic 的低延遲對應方案是獨立的 TTS-2 Flash 層級,其首字節時間約 25 毫秒
語言 — 42 種本地化語言 vs. 100+ 種用於投放導向的語言;Inworld 宣稱的單一語音身分識別可涵蓋 200+ 個語言地區(依廠商說法)
• 即時語音複製 — 約 10 秒音訊 vs 5–15 秒,另有專業複製測試版,使用約 10 分鐘音訊以產生更高保真度的語音複製。
• 傳遞控制 — 包含內聯轉錄標籤(如 [笑聲])、音量與速度調節,或「[平靜、令人安心]」與 [低語] 等平實英文指示、請求層級指令,以及從 Stable 到 Expressive 的三種穩定度模式。

為什麼「聽取對話」是不同的一個軸向?
上面的記分板衡量的是聲音在單獨聆聽時的聽感。這兩個模型真正出現分歧的維度,不會顯示在任何排行榜上,因為它只存在於多輪對話之間。
Inworld Realtime TTS-2 是為某人剛對它說完話的情境而建。該模型會吸收先前對話輪次的音訊——而不只是文字轉錄——考量語氣、節奏與情緒狀態,並在開口前選定回應狀態。如果來電者感到沮喪,表達方式會隨之改變;如果對方放鬆,則會調回原狀。這就是為什麼 Inworld 將此模型定位於代理、伴侶與遊戲,而非旁白:此功能在一次性文字轉語音呼叫中沒有意義,但在對話中卻至關重要。
Cartesia Sonic 3.6 的運作方式不同。它是一個快速、高品質的串流引擎,而 Cartesia 自己的主張是能從文字轉錄中自動進行情緒校準——它會讀取文字內容並據此調整語氣。它所不做的事情,是去聆聽前面回合的音訊。在單一 utterance 內,兩者聽起來可能相當;但若放到整個對話脈絡中,Inworld 所建模的是 Sonic 並未嘗試去做的事。如果你的產品是單回合的配音,那麼這種建模是額外負擔;如果它是即時代理,那它就是產品本身。

速度、價格,以及 Flash 的注意事項
在純延遲表現上,Cartesia 一直握有領先優勢:亞 90 毫秒的首音時間(time-to-first-audio)雖為廠商自行宣稱,但這是該公司自 Sonic 3 世代以來實際出貨的數字,且至今沒有任何人發布過相反的審計結果。Inworld 的旗艦產品則以亞 200 毫秒的延遲交出相近的對話等級表現,對即時代理(live agents)而言已足夠。Inworld 真正的延遲亮點,是與 GA 模型同步推出的 Flash 等級——這是一個獨立的模型,首位元組時間(time-to-first-byte)約 25 毫秒,鎖定高用量工作負載,在這些場景中 Sonic 等級的成本與延遲比表現力更重要。不過需要注意的是,Flash 是該系列中功能精簡的成員:支援即時複製與內聯非語言聲音(inline non-verbals),但不具備專業複製(professional cloning)功能,也無法進行完整的自然語言控制。
價格方面則恰恰相反。Sonic 3.6 每百萬字元收費 49.0 美元——約為 Inworld 按需費率 25 美元的兩倍,將近頂級方案 12.50 美元的四倍。在兩者雙雙入榜的排行榜上,品質差距並不足以讓高用量買家接受如此高的倍數價差。對每次對話都會產生數千字元的即時語音代理而言,字元單價的差異,正是健康單位經濟與單薄單位經濟之間的分水嶺。
該選哪個
• 請選擇 Cartesia Sonic 3.6,如果你想要的是供應商排行榜的桂冠——它是採用自家原生語音的聲音中得分最高者,Elo 1,282,適合簡短且自足的語句,如助理回答、遊戲臺詞與狀態播報。以每百萬字符 49 美元的價格,你是在為這頂桂冠付費;而它仍然是該排行榜上最難被擊敗的模型。
• 選擇 Inworld Realtime TTS-2,若產品屬於多輪對話,需要對另一端的人作出回應——例如客服電話、陪伴型應用、面試、課輔教學。它在受控排行榜上居冠;該榜上的每個模型都使用相同的八個參考語音,而它在聆聽對話音訊的同時,價格只需約一半。
• 把切換機制建入路由層,如果你無法事先知道通話需要哪種語音。截至本文撰寫之際,這兩個模型都還不在 OrcaRouter 上——Sonic 可透過 Cartesia 自己的 API 和數個第三方平台存取,Inworld 則透過自己的 API——但路由層正是讓對話先以某一種語音開始、再故障切換到另一種語音的結構,而且各家供應商的牌價都以 0% 加成原價轉嫁。當其中一個排行榜再次翻轉——而本週確實如此——選擇就只是改變設定,而不是重寫。
簡短版本
這是一個真正的分岔點,而誠實的答案是:這個分岔點在於對話輪替(turn-taking),而非音訊品質。如果你需要以自家原生語音取得最高評分的獨立語音,Cartesia Sonic 3.6 以 Elo 1,282 佔據供應商榜首,並為此收取每百萬字元 49 美元的費用。如果你需要能回應說話方式的語音,Inworld Realtime TTS-2 本週以 25 美元的隨選價格正式上市(GA),在雙方以相同語音交鋒的受控榜單中領先,並具備沒有任何競技場能完整衡量的對話感知功能。排行榜如今在這兩個模型之間一分為二——這正是「最佳」取決於測試標準的市場所能呈現的最誠實樣貌。

