一張「ElevenLabs Eleven v4 vs Sesame Preview」的主視覺卡片,內含兩張對比卡片:ElevenLabs Eleven v4 被描述為「一個可以買到的模型」、「實際運作的 API,公開價目表」、「Arena Elo 1,319,排名第 1」;Sesame Preview 被描述為「一個可以對話的示範」、「僅限網頁,沒有可呼叫的端點」、「未列於任何競技排行榜」;圖說為「兩個類別,不是兩個選項」。頁腳:「廠商頁面與 artificialanalysis.ai,2026 年 9 月。」OrcaRouter 標誌位於右下角。
Guides & Insights

Eleven v4 與 Sesame Preview:這不是你想的那種比較

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

搜尋ElevenLabs Eleven v4與Sesame Preview的比較,會找到大量樂於把兩者放進表格的頁面。這些頁面幾乎全都在拿產品比基準、再拿基準比示範,而表格往往是頁面上最沒用的東西。Eleven v4 是正式推出、具備 API、費率表與已公布競技場排名的語音合成模型。Sesame Preview 則是免費的消費級語音助理,點一下連結就會回應。它們不是同一筆採購的兩個選項;這篇文章誠實的版本,要談的是你真正想要的究竟是哪一個——因為答案取決於一個兩家廠商的行銷頁面都沒問的問題。

A two-column card for ElevenLabs Eleven v4 and Sesame Preview. Eleven v4: model identifier Eleven v4; live API; $0.022 per 1K until Oct 12; Arena Elo 1,319 at rank 1; 10,000-character input cap; 90-plus languages. Sesame Preview: no announced model identifier; web demo only; free and not purchasable; not on any arena board; sessions capped around 30 minutes; English only. Footer: 'Eleven v4 figures per Artificial Analysis and vendor docs; Sesame Preview per its own site.'

Eleven v4 究竟是什麼

ElevenLabs 於 9 月 28 日推出 Eleven v4 與 Eleven v4 Turbo,作為正式環境端點。Eleven v4 支援 90 多種語言、每次請求上限 10,000 個字元、具備穩定說話者身分的多人對話、行內表達指令、更完善的 IPA 音素支援,以及只需十秒音訊即可完成的即時語音複製。它在 Artificial Analysis 的 Provider Voice Arena 以 Elo 1,319 排名第一,該估計背後有 1,674 個樣本,並在 Controlled Voice 排行榜以 1,157 位居第二。在 API 費率表上,其定價為每千字元 0.022 美元,此優惠促銷將於 10 月 12 日結束,之後回復為 0.08 美元——與先前的 ElevenLabs Eleven v3 相同費率。

那段文字的每一個部分都可以查證。有模型識別碼、有明文記載的輸入上限、有公開的每字元價格、有針對較舊 Turbo 層級的淘汰說明,還有一筆附帶信賴區間的獨立排行榜紀錄。這才是模型在你買得到的時候該有的樣子。

A screenshot of ElevenLabs' blog post announcing Eleven v4, captured in English and dated Sep 28, 2026, headed 'Introducing Eleven v4, our most emotive model' and credited to Mati Staniszewski and Piotr Dabkowski, showing the site-wide 'Introducing Eleven v4, our fastest and most emotive voice model' banner, a 'Listen to this article 10:32' control, the line 'Ranked #1 by Artificial Analysis, and preferred by ~75% of listeners in blind head-to-head tests over competing models', and a left-hand section list running from 'A new architecture built for performance' to 'Hear the difference for yourself'.

Sesame Preview 究竟是什麼

Sesame Preview 是一項消費級示範。它是可透過該公司自家網站存取的語音助理,內含一小群具名角色——Maya、Miles、Simone 和 Charlie——跨越工作階段保留的對話記憶、網路搜尋、筆記與提醒,以及通話後的摘要。它是免費的。已登入的工作階段約進行半小時;訪客工作階段約五分鐘。它僅支援英文。而且 Sesame 明白表示它不會執行任務:這項示範的重點在於對話的質感,而不是一個能替你預約會議的代理。

這個比較真正重要的是缺少了什麼。沒有模型識別碼、沒有端點、沒有費率表、沒有可供你據以設計的輸入限制,也沒有正式版模型的公布日期。Sesame 發表的研究產品線是另一回事——那是個具備 4K 上下文的開放權重對話語音模型——而且那並不是你在 Preview 中與之交談的同一個系統。所以,每個比較表上名為「Sesame Preview」的東西,是你無法整合的產品,而你能下載的東西並不是那個產品。

為什麼他們不能共用一個計分板?

在 Artificial Analysis 上的受控語音競技場,是這個領域最接近中立測量的東西,而 Sesame Preview 並不在其中。它也不在供應商語音排行榜上。沒有 Elo,沒有票數,沒有價格標準化——也沒有辦法產生一個,因為排行榜需要可呼叫的端點和每單位價格,而 Sesame Preview 兩者都沒有。

所以任何把這兩者並排放在同一張表裡的,都是在用一場產品導覽來填 Sesame 那一欄。拿一個每百萬字元 $80 的端點,去和一個免費的網頁示範比「自然度」,這根本不是比較;這是一種範疇錯誤,而且上頭還留著一個 Elo 形狀的洞。如果某個頁面在這場對決中宣稱有贏家,那它是在為這項主張憑空發明依據。

老實說,能說的就是它們各自想成為的樣子。Eleven v4 的最佳化目標,是透過 API 大規模地把腳本變成演出,而且每次都用同樣的聲音。Sesame Preview 的最佳化目標,是讓陌生人在瀏覽器分頁裡,感覺自己正在跟某個人交談——就那麼一次。

比較真正成立的唯一地方

在這次搜尋背後,有一個真正的問題,而它跟開放權重有關。如果你真正想要的是一個可以下載並自行執行的語音模型,那麼兩家廠商的旗艦產品都不是答案——ElevenLabs 的技術堆疊是封閉的,而你能執行的 Sesame 系統是具備 4K 上下文的研究模型,不是那個助理。

對於那項工作,有用的參考基準就在競技場排行榜上:Breeze TTS 2 是 Provider Voice 上排名最高的開放權重項目,Elo 為 1,206,每百萬字元 $34.00,而該排行榜的 92 個模型陣容中就有 16 個開放權重模型。這比 Eleven v4 落後 113 分,但大幅領先 Qwen3 TTS 系列的 944 與 930。如果你的專案需要在自己的硬體上執行,值得做的比較是 Eleven v4 對上 Breeze TTS 2——而不是對上瀏覽器示範——而且那裡的取捨是真實的:你放棄大約一百分的 Elo 以及音訊標籤工作流程,換來的是對整個技術堆疊的掌控。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing ElevenLabs Eleven v4 first at Elo 1,319 with $80.0 per 1M chars, Cartesia Sonic 3.6 second at Elo 1,276, Google Gemini 3.8 Flash TTS third at Elo 1,267, and BreezeBlue Breeze TTS 2 tenth at Elo 1,206 with $34.0 per 1M chars and an Open Weights flag, over the Open Weights and Global Leaderboard filter tabs.

選擇,依據各自用途

• 如果你正在打造一款會說話的產品 —— Eleven v4,有 API,有費率表。Sesame Preview 沒有任何部分可供整合,因此不在這項決策的考慮範圍內。

• 如果你想用一個對話式示範讓別人感受語音 AI 是什麼感覺——Sesame Preview,而且它免費,這正是它最大的賣點。

• 如果你在決定採用某家廠商之前,正在評估情感表現範圍——Eleven v4 在供應商語音榜上的 Elo 為 1,319,在複製語音榜上為 1,157,這些才是該參考的數字;但要注意,後者才是描述複製品牌語音產品的數字。

• 如果你需要英文以外的語言語音——Eleven v4 記載了 90 多種;Sesame Preview 僅支援英文,且也如此說明。

• 如果你需要模型真正執行某些任務——在這場對比中,兩者都不行。Sesame Preview 刻意不執行任務,而 Eleven v4 是合成引擎,需要你自己的一套技術堆疊來搭配它。

• 如果你需要在本機執行——兩者皆非。Breeze TTS 2 才是開放權重的參考基準。

• 如果成本是決定性因素——Eleven v4 在 10 月 12 日之前每千字元是 $0.022,之後是 $0.08;而 Sesame Preview 是免費的,因為它不是你能購買的產品。免費試用版不是更便宜的選項;它是不同的類別。

兩者唯一的共同點是日期問題。Eleven v4 的促銷價格將於 10 月 12 日到期,這會讓其成本變成將近四倍。Sesame 則完全沒有公布正式版模型的日期,這是另一種不確定性——Preview 可能下個月就被取代,也可能一整年維持不變,而對於一個沒有人排定時程的發布,根本無從規劃。

如果你的技術堆疊最終橫跨多個語音供應商

OrcaRouter 本身既不代管 ElevenLabs,也不代管 Sesame,因此本文沒有任何內容是透過我們呼叫的,我們也不會暗示並非如此。我們真正涵蓋的,是早已屬於多供應商架構的堆疊之上那一層。一組 API 金鑰即可觸及 200 多款模型,並以 0% 加價直接傳遞供應商的定價列表,因此上游一旦調整價格——本次發布的促銷期間就是現成的例子——當天就會反映在我們這邊,而不是等到下一期帳單。在語音路徑面向客戶的情境下,當某個上游服務品質下降時,自動容錯切換會將流量導向健康的上游,這正是你可以在真實流量上試聽新端點,而不必拿一次正式發布來賭的原因。

重點摘要

Eleven v4 是一款你可以購買、衡量並依賴的模型,而且它目前正以兩週的降價位居供應商語音排行榜榜首。Sesame Preview 則是一項免費的對話感受實驗,僅支援英文,上限為三十分鐘,且不是你能用來開發應用的東西。它們會出現在同一組搜尋結果中,是因為兩者都是語音 AI,而且兩者都是新產品——而不是因為其中任何一個是另一個的替代方案。

如果你來到這裡,是想在它們之間做選擇,真正有用的重新思考角度是:你并不是在選一個語音模型。你是在決定自己是要推出產品,還是只是試用一個 demo,而這兩種決定中,只有一種會附帶價目表。如果是推出產品,那就去讀 Eleven v4 的數字,並在 10 月 13 日再讀一次——屆時促銷費率將到期,而與看板上其他所有供應商的比較也會隨之改變。