一張主視覺標題卡,主題為「Inworld Realtime TTS-2 vs Cartesia Sonic 3.6——會聆聽的聲音 vs 競技場之王」,左側卡片寫著「Cartesia Sonic 3.6——供應商 #1 · Elo 1,282 · 每 100 萬字元 $49」,右側卡片寫著「Inworld Realtime TTS-2——受控組 #1 · Elo 1,123 · 每 100 萬字元 $25」,另有一個統計標籤寫著「雙冠分屬——供應商 vs 受控競技場」,OrcaRouter 標誌置於右下角。
Guides & Insights

Inworld Realtime TTS-2 對比 Cartesia Sonic 3.6:會傾聽的聲音 vs 競技場之王

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

關於合成語音為何會讓人覺得像真人,有兩種相互競爭的理論,而目前這兩種理論各自最佳的商業範例分別是 Inworld Realtime TTS-2Cartesia Sonic 3.6。Cartesia 的理論是,人性存在於音訊之中:讓音色、韻律及節奏都與真人難以分辨,聽眾就會把你排在第一——Sonic 3.6 在八月就做到了這一點,以 Elo 1,282 分躍居 Artificial Analysis 的 Provider Voice 競技場榜首。Inworld 的理論則是,人性存在於聆聽之中:TTS-2 會根據先前對話的實際音訊來調整它的表達方式,因此它不只是聽起來像真人,回應方式也像真人。本週,這兩種理論在記分板上交鋒:同一份重新計分,讓 Inworld Realtime TTS-2 以 Elo 1,252 分在 Provider 排行榜上名列第二,同時也讓它在 Controlled Voice 競技場——這個榜單原本由 Cartesia 領先——以 1,123 分登上第一,勝過 Sonic 3.6 的 1,119 分。其中一個模型保有 Provider 排行榜的桂冠,另一個則剛奪下 Controlled Voice 排行榜的寶座。

这不是一场某一方明显有错的较量。两款模型是为重叠但并非完全相同的任务而构建的,价格差异——Sonic 3.6 每百万字符 49.0 美元,对比 Inworld Realtime TTS-2 的按需 25 美元——确实真实存在,使得决策既包含预算因素,也包含质量因素。

關於人類語音的兩種理論

Cartesia 在 2026 年 8 月低調發布了 Sonic 3.6,這是一個在 Sonic 3.5 基礎上改進的小版本,並未改變價格或架構敘事。這項改進出現在 Cartesia 最需要的地方:該模型在 Artificial Analysis 的 Provider Voice 競技場中躍升至 Elo 1,282——該競技場中每個模型都使用自己的原生語音——並在整個 8 月保持 Controlled Voice 競技場的領先地位。在受控排行榜上,每個模型都被克隆到相同的八位參考說話者身上,因此那個桂冠是對合成引擎本身的評判,與配音人才無關。本週 Inworld 一般可用性重新評分後,Cartesia 仍領先供應商排行榜,但 Sonic 3.6 現在以 Elo 1,119 位居受控排行榜第二,落後 Inworld Realtime TTS-2 的 1,123 四分。

Inworld Realtime TTS-2 源自不同的傳統。其前身產品線 TTS 1.5 在 2026 年初時即位居同類榜單的頂尖之列;而 TTS-2 的研究預覽版在 6 月於供應商排行榜上測得 Elo 1,209。自推出正式版(GA)後,排名持續攀升:在目前的榜單上,Provider Voice 獲得 1,252(第 2 名,僅次於 Sonic 3.6 的 1,282),Controlled Voice 獲得 1,123(第 1 名)。不過,這款旗艦模型的真正差異點不在於 Elo,而在於它能將對話中先前的輪次當作音訊輸入,並以此塑造下一句的呈現方式。Cartesia 從文字紀錄校準情緒;Inworld 則聆聽上一句話的表達方式。

記分板,如實標示。

Elo 分數來自 Artificial Analysis 的語音競技場,於 2026 年 9 月從即時排行榜讀取。延遲數據除非另有註明,否則皆為廠商回報,且這兩款型號均未發布獨立的延遲審計報告。

• 獨立品質 — Cartesia Sonic 3.6:Elo 1,282(第 1 名,供應商語音)與 1,119(第 2 名,受控語音)對比 Inworld Realtime TTS-2:Elo 1,252(第 2 名,供應商語音)與 1,123(第 1 名,受控語音)

• 每 1M 字符價格 — 49.0 美元(Artificial Analysis 追蹤)對比按需 25 美元、混合 20.8 美元(Artificial Analysis 追蹤),批量購買時可低至 12.50 美元(供應商)

• 首次音訊時間 — 低於 90 毫秒(廠商宣稱),對比 Inworld 上市測試中的中位數低於 200 毫秒、p99 低於 100 毫秒(廠商宣稱);Inworld 針對 Sonic 的低延遲對應方案是獨立的 TTS-2 Flash 層級,其首字節時間約 25 毫秒

語言 — 42 種本地化語言 vs. 100+ 種用於投放導向的語言;Inworld 宣稱的單一語音身分識別可涵蓋 200+ 個語言地區(依廠商說法)

• 即時語音複製 — 約 10 秒音訊 vs 5–15 秒,另有專業複製測試版,使用約 10 分鐘音訊以產生更高保真度的語音複製。

• 傳遞控制 — 包含內聯轉錄標籤(如 [笑聲])、音量與速度調節,或「[平靜、令人安心]」與 [低語] 等平實英文指示、請求層級指令,以及從 Stable 到 Expressive 的三種穩定度模式。

A generated two-column scoreboard titled 'Inworld Realtime TTS-2 vs Cartesia Sonic 3.6 — the scoreboard'. Left column Inworld Realtime TTS-2: AA Provider Elo 1,252 (#2), AA Controlled Elo 1,123 (#1), Price $25/1M on demand ($20.8 AA), First audio sub-200 ms, Languages 100+ with 200+ locales claimed, Listening prior-turn audio input. Right column Cartesia Sonic 3.6: AA Provider Elo 1,282 (#1), AA Controlled Elo 1,119 (#2), Price $49.0/1M chars, First audio sub-90 ms, Languages 42 localized, Listening transcript only. Footer 'Elo per Artificial Analysis, September 2026; latency vendor-reported.' OrcaRouter logo bottom-right.

為什麼「聽取對話」是不同的一個軸向?

上面的記分板衡量的是聲音在單獨聆聽時的聽感。這兩個模型真正出現分歧的維度,不會顯示在任何排行榜上,因為它只存在於多輪對話之間。

Inworld Realtime TTS-2 是為某人剛對它說完話的情境而建。該模型會吸收先前對話輪次的音訊——而不只是文字轉錄——考量語氣、節奏與情緒狀態,並在開口前選定回應狀態。如果來電者感到沮喪,表達方式會隨之改變;如果對方放鬆,則會調回原狀。這就是為什麼 Inworld 將此模型定位於代理、伴侶與遊戲,而非旁白:此功能在一次性文字轉語音呼叫中沒有意義,但在對話中卻至關重要。

Cartesia Sonic 3.6 的運作方式不同。它是一個快速、高品質的串流引擎,而 Cartesia 自己的主張是能從文字轉錄中自動進行情緒校準——它會讀取文字內容並據此調整語氣。它所不做的事情,是去聆聽前面回合的音訊。在單一 utterance 內,兩者聽起來可能相當;但若放到整個對話脈絡中,Inworld 所建模的是 Sonic 並未嘗試去做的事。如果你的產品是單回合的配音,那麼這種建模是額外負擔;如果它是即時代理,那它就是產品本身。

A screenshot of Inworld's Realtime TTS-2 product page (captured September 3, 2026) headed 'General Availability — August 31, 2026 — Realtime TTS-2, a new frontier voice model that feels as human as it sounds', with copy explaining it hears the full audio of the exchange, picks up the user's tone, pacing and emotional state, and holds one voice identity across 100+ languages.

速度、價格,以及 Flash 的注意事項

在純延遲表現上,Cartesia 一直握有領先優勢:亞 90 毫秒的首音時間(time-to-first-audio)雖為廠商自行宣稱,但這是該公司自 Sonic 3 世代以來實際出貨的數字,且至今沒有任何人發布過相反的審計結果。Inworld 的旗艦產品則以亞 200 毫秒的延遲交出相近的對話等級表現,對即時代理(live agents)而言已足夠。Inworld 真正的延遲亮點,是與 GA 模型同步推出的 Flash 等級——這是一個獨立的模型,首位元組時間(time-to-first-byte)約 25 毫秒,鎖定高用量工作負載,在這些場景中 Sonic 等級的成本與延遲比表現力更重要。不過需要注意的是,Flash 是該系列中功能精簡的成員:支援即時複製與內聯非語言聲音(inline non-verbals),但不具備專業複製(professional cloning)功能,也無法進行完整的自然語言控制。

價格方面則恰恰相反。Sonic 3.6 每百萬字元收費 49.0 美元——約為 Inworld 按需費率 25 美元的兩倍,將近頂級方案 12.50 美元的四倍。在兩者雙雙入榜的排行榜上,品質差距並不足以讓高用量買家接受如此高的倍數價差。對每次對話都會產生數千字元的即時語音代理而言,字元單價的差異,正是健康單位經濟與單薄單位經濟之間的分水嶺。

該選哪個

請選擇 Cartesia Sonic 3.6,如果你想要的是供應商排行榜的桂冠——它是採用自家原生語音的聲音中得分最高者,Elo 1,282,適合簡短且自足的語句,如助理回答、遊戲臺詞與狀態播報。以每百萬字符 49 美元的價格,你是在為這頂桂冠付費;而它仍然是該排行榜上最難被擊敗的模型。

選擇 Inworld Realtime TTS-2,若產品屬於多輪對話,需要對另一端的人作出回應——例如客服電話、陪伴型應用、面試、課輔教學。它在受控排行榜上居冠;該榜上的每個模型都使用相同的八個參考語音,而它在聆聽對話音訊的同時,價格只需約一半。

把切換機制建入路由層,如果你無法事先知道通話需要哪種語音。截至本文撰寫之際,這兩個模型都還不在 OrcaRouter 上——Sonic 可透過 Cartesia 自己的 API 和數個第三方平台存取,Inworld 則透過自己的 API——但路由層正是讓對話先以某一種語音開始、再故障切換到另一種語音的結構,而且各家供應商的牌價都以 0% 加成原價轉嫁。當其中一個排行榜再次翻轉——而本週確實如此——選擇就只是改變設定,而不是重寫。

簡短版本

這是一個真正的分岔點,而誠實的答案是:這個分岔點在於對話輪替(turn-taking),而非音訊品質。如果你需要以自家原生語音取得最高評分的獨立語音,Cartesia Sonic 3.6 以 Elo 1,282 佔據供應商榜首,並為此收取每百萬字元 49 美元的費用。如果你需要能回應說話方式的語音,Inworld Realtime TTS-2 本週以 25 美元的隨選價格正式上市(GA),在雙方以相同語音交鋒的受控榜單中領先,並具備沒有任何競技場能完整衡量的對話感知功能。排行榜如今在這兩個模型之間一分為二——這正是「最佳」取決於測試標準的市場所能呈現的最誠實樣貌。

A screenshot of the Artificial Analysis Controlled Voice leaderboard (captured September 3, 2026) showing Inworld Realtime TTS-2 at rank 1 with Elo 1,123, Cartesia Sonic 3.6 at rank 2 with Elo 1,119, Cartesia Sonic 3.5 at rank 3, and Inworld Realtime TTS-2 Flash at rank 4.