一張為「Gemini 3.8 TTS vs Cartesia Sonic 3.6」生成的主視覺卡片,背景為白色,並帶有柔和的藍色與青色漸層點綴。左側卡片「Cartesia Sonic 3.6」列出 Elo 1,273、1,757 個樣本、每百萬字元 $49.0,以及 2026 年 8 月;右側卡片「Gemini 3.8 Flash TTS」列出 Elo 1,260、1,999 個樣本、每百萬字元 $33.0,以及 2026 年 9 月。頁腳一行寫著「Elo 依據 Artificial Analysis Provider Voice Arena,2026 年 9 月。」OrcaRouter 標誌合成於右下角。
Guides & Insights

Gemini 3.8 TTS 對決 Cartesia Sonic 3.6:十三個 Elo 積分與十六美元

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

在 Artificial Analysis 盲投排行榜上,最接近的兩個文字轉語音模型名次只差一名、價格卻相差十六美元,而這兩項差距指向相反的方向。Cartesia Sonic 3.6以 Provider Voice Arena Elo 1,273 位居第一,樣本數為 1,757。Gemini 3.8 Flash TTS以 1,260 位居第二,樣本數為 1,999。Elo 差距為十三點——落在兩者已公布的信心區間之內——而價格差距則朝反方向發展,Gemini 為每百萬字元 $33.00,Cartesia 則是 $49.00。若你正在這兩者之間做選擇,誠實的說法是:你每百萬字元多付了十六美元,換來的品質差異卻是排行榜無法分辨的。

這就是整個決定的全貌,而它值得我們放慢腳步仔細思考,因為這兩個模型都夠新,以致於幾乎沒有其他東西被衡量過。Cartesia Sonic 3.6 於 2026 年 8 月推出。Gemini 3.8 Flash TTS 於 2026 年 9 月 23 日推出。除了競技場投票之外,兩者都沒有已發布的獨立基準測試,而競技場投票讓它們在頂端呈現統計上的平手。

排行榜實際上說的是什麼

Artificial Analysis Provider Voice Arena 是這裡有用的排行榜,因為它以盲測成對投票,將各供應商自家的原生語音與其他所有供應商的語音進行比較。對於「哪個產品聽起來更好」這個問題而言,這比受控語音排行榜是更公平的比較,因為它讓每個廠商推出其實際推出的語音。

• 第 1 名 — {{1}}Cartesia Sonic 3.6{{/1}},Elo {{2}}1,273{{/2}},區間 {{3}}17 分{{/3}},{{4}}1,757{{/4}} 個樣本,{{5}}8{{/5}} 個競技場語音,於 {{6}}2026 年 8 月{{/6}}發布,每 {{7}}100 萬字元{{/7}} {{8}}49.0 美元{{/8}}。

• 第 2 名 — Gemini 3.8 Flash TTS,Elo 1,260,信賴區間 17 點,1,999 個樣本,8 種競技場語音,2026 年 9 月發布,每 100 萬字元 33.0 美元。

• 排名第 3 — Alibaba Qwen-Audio-3.0-TTS-Plus,Elo 1,259,1,447 個樣本,15 種競技場語音,每 100 萬字元 $27.6。

• 第 4 至第 9 名,供參考——Inworld Realtime TTS-2 為 1,245,SpeechifyAI Simba 3.2 為 1,237,Google Gemini 3.8 Flash-Lite TTS 為 1,235,VUI Labs Luna TTS 為 1,230,Inworld Realtime TTS-2 Flash 為 1,210,以及 BreezeBlue Breeze TTS 2 為 1,204。

看這些區間,前三名彼此重疊、難分難捨。Sonic 3.6 的 1,273 帶有十七點的範圍;Gemini 的 1,260 也帶有相同範圍。它們的範圍幾乎在整個寬度上重疊。Qwen-Audio-3.0-TTS-Plus 的 1,259 與兩者都重疊。這個排行榜告訴你,就目前收集到的樣本而言,這三者以盲測偏好無法區分,而它們之間的排序並非穩定證據。

樣本數也接近到同樣無法解釋這個差異——Cartesia 為 1,757,Gemini 為 1,999。兩者都落在數千的低段,足以將一個模型歸入某個級距,但不足以區分同一級距內的相鄰模型。

A generated two-column scoreboard for Cartesia Sonic 3.6 and Gemini 3.8 Flash TTS — Sonic 3.6 at Arena Elo 1,273, $49.00 per 1M characters, 8 arena voices, 1,757 samples and hosted beta; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 8 arena voices, 1,999 samples and generally available — over the footer 'Per Artificial Analysis Provider Voice Arena, Sept 2026.'

這十六美元從何而來

Cartesia 自家的定價頁面並未公布 Sonic 每百萬字元的費率。它販售的是綁定分鐘數的訂閱方案——Free 為 $0,附帶 20,000 點 credits,約可兌換 27 分鐘的 Sonic 3.6;Pro 為 $5,附帶 100,000 點 credits,約 133 分鐘;Startup 為 $49,附帶 125 萬點 credits,約 1,667 分鐘;Scale 為 $299,附帶 800 萬點 credits,約 10,667 分鐘——另外還有併發限制分別為 2、3、5 和 15,每增加一種口音的語音本地化為 225 點 credits,語音代理通話時長為每分鐘 $0.06,電信費用為每分鐘 $0.014。

所以,每百萬個字元 $49.00 並不是 Cartesia 以其自身單位所列的定價。那是 Artificial Analysis 把 Cartesia 的點數標準化成共同分母,讓這個排行榜至少能依價格排名。對一個比較型排行榜來說,這是合理的做法,而且這是唯一可得的同基準可比數字;但這也意味著 Cartesia 的數字是換算推導出來的費率,而 Gemini 的數字則是已公布的費率。

Google 的價格很直接。Gemini 3.8 Flash TTS 在 2026 年 12 月 31 日之前,文字輸入每百萬個 token 收費 0.50 美元,音訊輸出每百萬個 token 收費 9.00 美元,之後則為 1.00 美元和 18.00 美元。音訊以每秒 25 個 token 計量,因此音訊輸出費率換算後約為每秒語音 0.02 美分。價格較低的同系列產品 Flash-Lite TTS,在相同的每秒 25 個 token 下,每百萬個音訊 token 為 6.00 美元,而 Artificial Analysis 將其列為每 100 萬字元等價 22.10 美元,排名第 6,Elo 為 1,235。

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

• 每 100 萬字元價格 — Cartesia Sonic 3.6 $49.00,對比 Gemini 3.8 Flash TTS $33.00,對比 Gemini 3.8 Flash-Lite TTS $22.10。

• Arena Elo — 1,273 對 1,260 對 1,235,前兩名均相差 17 分。

• 競技場語音 — 8 對 8 對 8。

• 樣本 — 1,757 對 1,999 對 2,000。

• 可用性 — Cartesia 託管測試版 vs Google 自家的 Gemini Developer API,已正式推出。

• Weight release —— 兩者皆已關閉;皆無法下載。

價格比較所隱藏的部分

每百萬字元是個方便的單位,但這兩個產品都不是這樣計費的。

Cartesia 的計價單位是訂閱方案中的抵用額度,而並行上限則取決於方案等級。這表示在你觸及上限之前,接下來一千個字元的邊際成本是零;一旦觸及上限,成本就變成升級到下一個方案等級的費用。對於用量上限可預期的工作負載而言,這比按字元計費的價格看起來更划算——你買的是餘裕空間,而不是實際消耗量。對於用量會暴增的工作負載而言,這反而更糟,因為免費方案的並行數為 2、Pro 方案為 3,這是一道硬性上限,而不是一種價格。

Gemini 的計價單位是 token,按每次呼叫計量,且未公布併發上限,並有三個服務層級——Standard、Batch 與 Flex,以及 Priority——各自採用不同費率。Batch 與 Flex 將 Flash TTS 的音訊費率減半至每百萬個 token 4.50 美元;Priority 則將其提高到 16.20 美元。這是精細許多的成本模型,而它獎勵的正是 Google 定價通常獎勵的東西:事先知道某項工作是互動式還是批次處理。

因此,哪個更便宜取決於你的語音工作負載看起來像訂閱制還是計量制。Cartesia 的價格方案是為用量穩定且有上限的產品設計的。Gemini 的價格方案則是為你可以分類的用量而設計的。

Cartesia 仍擁有而 Google 所沒有的東西

有兩件事,而這兩件事都關乎成為一款語音產品,而非一個語音模型。

Cartesia 直接販售電話語音與語音代理基礎架構:電話語音每分鐘 0.014 美元,語音代理通話時長每分鐘 0.06 美元,而語音在地化則為每增加一種口音 225 點。如果你正在打造電話代理,那是一套可以在單一地點購足的技術堆疊。Gemini 3.8 Flash TTS 是一個合成端點——它回傳音訊後就停止。傳輸、輪次偵測與電話語音都得由你自己提供,或者向其他供應商拼湊組裝。

A screenshot of Cartesia's pricing page, captured in English, showing the Free, Pro, Startup, Scale and Enterprise tiers at $0, $5, $49, $299 and custom per month, with monthly credit allowances of 20K, 100K, 1.25M and 8M credits and the features bundled into each tier.

Cartesia 在榜上的時間也更長。它於八月發布,相對於 Google 的九月發布,意味著它有更多樣本數是累積在一個已穩定的版本上,而九月的發布則仍在收集投票。一個模型在第一週的 Elo 是比同一模型一個月後的 Elo 雜訊更多的估計值,而這也使得我們不宜將這十三分的差距解讀為支持 Cartesia 的證據。

Google 有而 Cartesia 沒有的東西

語言涵蓋範圍是最明顯的一項。Flash TTS 支援 130 種語言,並具備自動偵測功能;Flash-Lite 則支援 101 種。Cartesia 的在地化模式是疊加式的——你得在基礎語音之上額外購買口音,每個要價 225 點——這是截然不同的做法,而且一旦超過少數幾種語言,成本曲線也完全不同。

再來是表達層面,也就是第二項重點。Gemini 3.8 Flash TTS 讓你像指導演員那樣為一句台詞下指示,在一次呼叫中安排雙人對話場景,並把非語言提示——<laughs><sigh><gasp>|mhm||yeah|——直接寫進腳本裡。它也提供從自然語言描述進行語音設計,以及從 30 秒樣本進行語音複製,並附帶同意驗證,輸出還會有 SynthID 浮水印與 C2PA 憑證。語音混音功能則列為即將推出。

而且它已正式推出,並非 Beta 版。Cartesia Sonic 3.6 則是託管 Beta 版,這說明了供應商本身對該端點在負載下表現的信心。

實際上該呼叫哪一個

如果你的工作負載是可預測量的電話代理,而你希望電信、併發與語音合成都來自單一供應商,那麼 Cartesia Sonic 3.6 就是順理成章的選擇,而那十六美元的價差,就是你不必自己拼湊三家供應商的代價。

如果你的工作負載是在你已經營運的產品內部進行合成——旁白、無障礙層、客服機器人的嗓音、涵蓋 130 種語言的地化流程——那麼 Gemini 3.8 Flash TTS 每字元成本更低、語言覆蓋更廣、語調控制更細緻,而且已全面推出。Elo 分數的差距並不構成反對它的理由,因為那個 Elo 差距在統計上並不真實。

如果你想選榜單前三名中最便宜的那一款,又能接受較短的語言清單,那麼 Gemini 3.8 Flash-Lite TTS 每百萬個音訊 token 要價 6.00 美元,排名低六位、落在 1,235 名——這個差距同樣落在雜訊範圍內。

無論你選哪一個,遷移路徑都比選擇本身更重要,因為這兩個模型都是新的,而且兩家廠商都還在調校。OrcaRouter 就是你的避險方案:一組金鑰就能取用 200 多個模型,價格即供應商定價、不加收任何費用,因此任一實驗室降價,當天就反映在你的帳單上,而不是等到續約時才調整,若合成呼叫失敗會自動容錯移轉,而且還有路由 DSL,讓你可以把批次工作送往某個模型、把互動式呼叫送往另一個模型。我們並不代管 Cartesia Sonic 3.6 或 Gemini 3.8 的 TTS 端點——Cartesia 的合成是它自家的產品,而 Gemini 語音模型則來自 Google 的 API——但文字層與容錯移轉路徑是我們提供的,而正是這些部分讓全新模型變得安全、值得一試。

值得留意的是下一版的 Artificial Analysis。若 Gemini 3.8 Flash TTS 在樣本數累積成熟後補上這十三分的差距,價格落差就不再是取捨,而會變成一個再直接不過的答案。若否,Cartesia 仍穩坐品質王座,Google 則守住價格王座,而選擇依舊和現在一模一樣:一個附加電話功能的訂閱方案,或是一個附加 130 種語言的計量方案。