一張為 ElevenLabs Eleven v4 生成的主視覺卡片,包含兩個面板:左側是腳本區塊,展示 [laughs]、[whispers] 和 [said angrily in French accent] 等行內音訊標籤;右側面板顯示排名第 1、Elo 1,319、每 100 萬字元 80.00 美元,以及在 Artificial Analysis 的 Provider Voice Arena 上出現 1,674 次,頁腳寫著「Provider Voice 排名、Elo 與價格資料來源為 Artificial Analysis,2026 年 9 月;標籤語法與延遲均為廠商文件所載」。OrcaRouter 標誌位於右下角。
Engineering & Research

Eleven v4 的 Audio Tags 與十秒複製:你的流程會有什麼改變

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

關於 ElevenLabs Eleven v4,最關鍵的一點不是它的 Elo。而是這個模型能讀懂寫入腳本中的指示——[笑聲]、[低語]、[嘆息]、[以法國口音憤怒地說],甚至[小雨聲]——而且ElevenLabs Eleven v4 Turbo,這個同日推出的低延遲同系列版本,也會遵循同樣的標籤,供應商稱其首次語音輸出的中位時間約為 150 毫秒。兩者均於 2026 年 9 月 28 日正式推出。Artificial Analysis' Provider Voice Arena 已將 Eleven v4 列為第 1 名,Elo 為 1,319,出現次數為 1,674 次,榜單價格為每百萬字元 80.00 美元。排名是頭條新聞。指示語法與十秒聲音複製,才是改變你必須打造什麼的部分。

A generated four-card summary of what ElevenLabs Eleven v4 changed in the pipeline: a Script direction card listing [laughs], [whispers], [sighs], [said angrily in French accent] and natural-language delivery prompts; a Sound and scene card listing [light rain], [phone buzzing], multi-speaker dialogue with turn-level context and IPA phonemes for custom pronunciations; a Voice creation card listing Instant Voice Cloning from 10 s of audio, a Professional Voice Cloning tier above it, and 90-plus languages with a 10,000-character cap; and a Two endpoints card describing Eleven v4 as the most emotive, highest-quality model against Eleven v4 Turbo at about 100 ms median inference and about 150 ms to first speech. Footer: 'Tag syntax, cloning bar, language count, character cap and Turbo latency are vendor-documented; no independent score is quoted on this card.' The OrcaRouter logo sits in the bottom-right corner.

兩款模型,一次發布,各司其職

ElevenLabs 於 2026 年 9 月 28 日推出了兩個端點,而它們並不是同一款產品加上速度切換而已。ElevenLabs Eleven v4 是富有表現力的模型:支援 90 多種語言、每次請求上限 10,000 字元、針對自訂發音改良的國際音標支援,以及公司表示能在整個場景中保持說話者身分一致的多說話者對話。ElevenLabs Eleven v4 Turbo 保留了 90 多種語言與 10,000 字元上限,但針對代理調校——公告引述中位推論延遲約 100 毫秒,以及中位首次語音時間約 150 毫秒,這些數據由 ElevenLabs 於 2026 年 9 月測量。

A screenshot of the ElevenLabs models documentation page, flagship Text to Speech section. Eleven v4 is described as the most emotive, high quality speech synthesis model, with exceptional voice cloning capabilities, 90+ languages supported, a 10,000 character limit and support for natural multi-speaker dialogue. Eleven v4 Turbo is described as the most emotive, real-time speech synthesis model, with ultra-low latency (median inference latency of ~100ms), exceptional voice cloning capabilities, 90+ languages supported and audio tags for fine-grained control. Below them the page lists Eleven v3, Eleven v3 Conversational, Eleven Multilingual v2 and Eleven Flash v2.5.

這個反應性問題——旗艦模型是否快到足以支援電話代理——並沒有公開答案。ElevenLabs 提供的是 Turbo 的延遲數據,而非 Eleven v4 本身;而且這兩者是不同的端點,並不是同一個模型掛上兩個名稱。如果你的代理預算是在 200 ms 內取得首個音訊,那麼文件記載的端點是 Turbo,而不是旗艦模型。

這些標籤是真正的介面,也是真正的相依性

行內音訊標籤對語音合成而言並非新鮮事,但這裡有用的改變在於遵循的準確度。公告指出,Eleven v4 比先前的模型更精確地遵循音訊標籤與自然語言指示提示,而這正是你能指示笑聲、耳語,或以特定口音呈現某段內容,而不必事後編輯音訊的方式。

隨之而來的有三個實際後果,而它們比那些示範短片更重要:

• 你的腳本會變成一件範本化的產物,而不是一個字串。標籤是你內容管線中的一個 token:若有任何不受信任的文字經過,它就需要轉義,而且它必須能安然通過你的 CMS、你的翻譯層與你的差異審閱。一個漏掉[低語]的譯者,已經在無聲無息中改變了一場演出。

• 標籤遵循度是附帶版本號的廠商宣稱。這一世代比上一世代更遵循標籤的說法,是 ElevenLabs 自家的主張,由 ElevenLabs 自行測試,而且不會在所有語言中都同樣成立。在據此建立風格指南之前,請用你自己的腳本和你自己的語言地區設定來驗證。

• 像[小雨]或[手機震動]這類音效標籤,會把音訊後製的部分工作移進文字提示裡。這是一項值得衡量的成本移轉:如果一個標籤取代了一道擬音(foley)工序,那它就很划算;如果它什麼都沒取代、只是徒增變異,那它就是你的 QA 裡的一種新失效模式。

十秒,是改變入職流程的關鍵數字

本次發行中的 Instant Voice Cloning 能從十秒音訊中以高保真度擷取嗓音,而專業克隆層級仍在其上提供。十秒短到足以壓縮一道工作流程步驟:取得同意、上傳樣本與首次合成可以在一次坐定內完成,用手機就行,無需錄音室。

同意問題不會因為樣本變小而跟著縮小,反而會擴大,因為製作逼真克隆的門檻已降到任何人都能錄下的一段音訊。如果你正在克隆不屬於自己的聲音,合規問題現在完全得由你在 API 呼叫之前自行回答——模型會照你的要求去做。請把「十秒」這個數字視為操作門檻,而不是一張許可證。

在視窗開啟期間的費用是多少

ElevenLabs 在推出時重新調整了價格,而目前頁面上顯示的就是促銷價。在 API 定價表中,Eleven v4 標價為每 1,000 個字元 $0.022,相對於標示的原價 $0.08;Eleven v4 Turbo 則為 $0.011,相對於 $0.04。兩者都帶有相同的標籤:10 月 12 日前享 72% 折扣。同一頁面將前一代旗艦產品 Eleven v3 定價為每 1,000 個字元 $0.08。

• 排行榜上的價格,每百萬字元——Eleven v4 為 $80.00,是該排行榜前十名中最高的。

• 廠商價目表,每千個字元 — $0.022,直到10月12日,之後為 $0.08。

• 這在實務上意味著什麼——以腳本用量繁重的月份來說,五百萬個字元在優惠期間內花費 110 美元,優惠結束後則要 400 美元,而且使用的是同一個端點與同一份程式碼。

A screenshot of the ElevenLabs API pricing page filtered to ElevenAPI. Four Text to Speech columns are shown: v4 at $0.022 with $0.08 struck through, v4 Turbo at $0.011 with $0.04 struck through, both carrying a '72% off until Oct 12' badge, Eleven v3 at $0.08 and Eleven v3 Conversational at $0.04 per 1K characters. The v4 column lists audio tags for fine-grained control and 90+ languages supported; the Turbo column lists ultra-low latency (~100ms) and v4 expressiveness tuned for latency; the v3 column lists 70+ languages and a 5,000 character limit. The cost calculator below prices a Starter plan at $6 per month with 272.727k characters of TTS (v4) included.

任何以今天頁面上的數字來編列第一季預算的人,都是在依據一個兩週後就會失效的數字。請使用 $0.08。

在這樣的發布會中,路由器如何贏得一席之地

OrcaRouter 並不代管 ElevenLabs,所以這次發布中沒有任何東西可以透過我們呼叫,我們也不會暗示並非如此——要呼叫 Eleven v4,該去的地方就是 ElevenLabs 自家的 API。在發布後的兩週內,單一金鑰真正有用的地方在於比較。如果你正在判斷這個新旗艦是否勝過你目前使用的方案,你會想在自己的腳本上對兩者做 A/B 測試,而不是在排行榜上;而要橫跨兩家供應商這麼做,就意味著在你得到答案之前,得先有兩個帳號、兩套帳務關係和兩條整合路徑。

這正是我們處理的情況:一組 API 金鑰即可橫跨 200 多款模型,並將供應商定價以0% 加成直接傳遞,因此供應商的價格變動——包括附有到期日的促銷期間——會在我們這邊當天生效,而不是等到下一個帳單週期。當語音路徑需要面向客戶時,自動容錯移轉會在某個端點效能衰退時將流量移至健全的上游,這就是你試用全新模型、又不必把發布賭在它身上的方式。

先測試什麼,以及要忽略什麼

三項檢查會比任何排名告訴你更多。首先,把你最長的真實腳本丟進一萬字元的上限,看看接縫落在哪裡——上限是每次請求計算的,而多說話者的對話正是最可能被它切開的功能。第二,把你自己的五句帶標籤的句子分別放進 v4 和 v4 Turbo,聽聽表達型端點與低延遲端點之間的標籤遵循度漂移;它們是各自獨立的模型,在一個模型上生效的標籤,未必會在另一個模型上以完全相同的方式生效。第三,用 $0.08 而不是 $0.022 來計算你實際的每月字元量,因為那才是你下一季據以運作的數字。

公告中那個約 75% 的盲測偏好數字是廠商自行測量的結果,我們不會把它洗白成別的東西。這次發表會上真正獨立的數字,是排行榜上的那一個:以 1,674 次出賽、1,319 Elo 拿下第一名,而誤差區間大約是正負 19 分。在真實的排行榜上,這是個很強的成績。它不是規格,也不會告訴你你的標籤語法能不能撐過一輪翻譯。