![一張為 ElevenLabs Eleven v4 生成的主視覺卡片,包含兩個面板:左側是腳本區塊,展示 [laughs]、[whispers] 和 [said angrily in French accent] 等行內音訊標籤;右側面板顯示排名第 1、Elo 1,319、每 100 萬字元 80.00 美元,以及在 Artificial Analysis 的 Provider Voice Arena 上出現 1,674 次,頁腳寫著「Provider Voice 排名、Elo 與價格資料來源為 Artificial Analysis,2026 年 9 月;標籤語法與延遲均為廠商文件所載」。OrcaRouter 標誌位於右下角。](https://cms.orcarouter.ai/api/media/file/1-1462.png)
Eleven v4 的 Audio Tags 與十秒複製:你的流程會有什麼改變
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 982 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 197 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
關於 ElevenLabs Eleven v4,最關鍵的一點不是它的 Elo。而是這個模型能讀懂寫入腳本中的指示——[笑聲]、[低語]、[嘆息]、[以法國口音憤怒地說],甚至[小雨聲]——而且ElevenLabs Eleven v4 Turbo,這個同日推出的低延遲同系列版本,也會遵循同樣的標籤,供應商稱其首次語音輸出的中位時間約為 150 毫秒。兩者均於 2026 年 9 月 28 日正式推出。Artificial Analysis' Provider Voice Arena 已將 Eleven v4 列為第 1 名,Elo 為 1,319,出現次數為 1,674 次,榜單價格為每百萬字元 80.00 美元。排名是頭條新聞。指示語法與十秒聲音複製,才是改變你必須打造什麼的部分。
![A generated four-card summary of what ElevenLabs Eleven v4 changed in the pipeline: a Script direction card listing [laughs], [whispers], [sighs], [said angrily in French accent] and natural-language delivery prompts; a Sound and scene card listing [light rain], [phone buzzing], multi-speaker dialogue with turn-level context and IPA phonemes for custom pronunciations; a Voice creation card listing Instant Voice Cloning from 10 s of audio, a Professional Voice Cloning tier above it, and 90-plus languages with a 10,000-character cap; and a Two endpoints card describing Eleven v4 as the most emotive, highest-quality model against Eleven v4 Turbo at about 100 ms median inference and about 150 ms to first speech. Footer: 'Tag syntax, cloning bar, language count, character cap and Turbo latency are vendor-documented; no independent score is quoted on this card.' The OrcaRouter logo sits in the bottom-right corner.](https://cms.orcarouter.ai/api/media/file/2-1397.png)
兩款模型,一次發布,各司其職
ElevenLabs 於 2026 年 9 月 28 日推出了兩個端點,而它們並不是同一款產品加上速度切換而已。ElevenLabs Eleven v4 是富有表現力的模型:支援 90 多種語言、每次請求上限 10,000 字元、針對自訂發音改良的國際音標支援,以及公司表示能在整個場景中保持說話者身分一致的多說話者對話。ElevenLabs Eleven v4 Turbo 保留了 90 多種語言與 10,000 字元上限,但針對代理調校——公告引述中位推論延遲約 100 毫秒,以及中位首次語音時間約 150 毫秒,這些數據由 ElevenLabs 於 2026 年 9 月測量。

這個反應性問題——旗艦模型是否快到足以支援電話代理——並沒有公開答案。ElevenLabs 提供的是 Turbo 的延遲數據,而非 Eleven v4 本身;而且這兩者是不同的端點,並不是同一個模型掛上兩個名稱。如果你的代理預算是在 200 ms 內取得首個音訊,那麼文件記載的端點是 Turbo,而不是旗艦模型。
這些標籤是真正的介面,也是真正的相依性
行內音訊標籤對語音合成而言並非新鮮事,但這裡有用的改變在於遵循的準確度。公告指出,Eleven v4 比先前的模型更精確地遵循音訊標籤與自然語言指示提示,而這正是你能指示笑聲、耳語,或以特定口音呈現某段內容,而不必事後編輯音訊的方式。
隨之而來的有三個實際後果,而它們比那些示範短片更重要:
• 你的腳本會變成一件範本化的產物,而不是一個字串。標籤是你內容管線中的一個 token:若有任何不受信任的文字經過,它就需要轉義,而且它必須能安然通過你的 CMS、你的翻譯層與你的差異審閱。一個漏掉[低語]的譯者,已經在無聲無息中改變了一場演出。
• 標籤遵循度是附帶版本號的廠商宣稱。這一世代比上一世代更遵循標籤的說法,是 ElevenLabs 自家的主張,由 ElevenLabs 自行測試,而且不會在所有語言中都同樣成立。在據此建立風格指南之前,請用你自己的腳本和你自己的語言地區設定來驗證。
• 像[小雨]或[手機震動]這類音效標籤,會把音訊後製的部分工作移進文字提示裡。這是一項值得衡量的成本移轉:如果一個標籤取代了一道擬音(foley)工序,那它就很划算;如果它什麼都沒取代、只是徒增變異,那它就是你的 QA 裡的一種新失效模式。
十秒,是改變入職流程的關鍵數字
本次發行中的 Instant Voice Cloning 能從十秒音訊中以高保真度擷取嗓音,而專業克隆層級仍在其上提供。十秒短到足以壓縮一道工作流程步驟:取得同意、上傳樣本與首次合成可以在一次坐定內完成,用手機就行,無需錄音室。
同意問題不會因為樣本變小而跟著縮小,反而會擴大,因為製作逼真克隆的門檻已降到任何人都能錄下的一段音訊。如果你正在克隆不屬於自己的聲音,合規問題現在完全得由你在 API 呼叫之前自行回答——模型會照你的要求去做。請把「十秒」這個數字視為操作門檻,而不是一張許可證。
在視窗開啟期間的費用是多少
ElevenLabs 在推出時重新調整了價格,而目前頁面上顯示的就是促銷價。在 API 定價表中,Eleven v4 標價為每 1,000 個字元 $0.022,相對於標示的原價 $0.08;Eleven v4 Turbo 則為 $0.011,相對於 $0.04。兩者都帶有相同的標籤:10 月 12 日前享 72% 折扣。同一頁面將前一代旗艦產品 Eleven v3 定價為每 1,000 個字元 $0.08。
• 排行榜上的價格,每百萬字元——Eleven v4 為 $80.00,是該排行榜前十名中最高的。
• 廠商價目表,每千個字元 — $0.022,直到10月12日,之後為 $0.08。
• 這在實務上意味著什麼——以腳本用量繁重的月份來說,五百萬個字元在優惠期間內花費 110 美元,優惠結束後則要 400 美元,而且使用的是同一個端點與同一份程式碼。

任何以今天頁面上的數字來編列第一季預算的人,都是在依據一個兩週後就會失效的數字。請使用 $0.08。
在這樣的發布會中,路由器如何贏得一席之地
OrcaRouter 並不代管 ElevenLabs,所以這次發布中沒有任何東西可以透過我們呼叫,我們也不會暗示並非如此——要呼叫 Eleven v4,該去的地方就是 ElevenLabs 自家的 API。在發布後的兩週內,單一金鑰真正有用的地方在於比較。如果你正在判斷這個新旗艦是否勝過你目前使用的方案,你會想在自己的腳本上對兩者做 A/B 測試,而不是在排行榜上;而要橫跨兩家供應商這麼做,就意味著在你得到答案之前,得先有兩個帳號、兩套帳務關係和兩條整合路徑。
這正是我們處理的情況:一組 API 金鑰即可橫跨 200 多款模型,並將供應商定價以0% 加成直接傳遞,因此供應商的價格變動——包括附有到期日的促銷期間——會在我們這邊當天生效,而不是等到下一個帳單週期。當語音路徑需要面向客戶時,自動容錯移轉會在某個端點效能衰退時將流量移至健全的上游,這就是你試用全新模型、又不必把發布賭在它身上的方式。
先測試什麼,以及要忽略什麼
三項檢查會比任何排名告訴你更多。首先,把你最長的真實腳本丟進一萬字元的上限,看看接縫落在哪裡——上限是每次請求計算的,而多說話者的對話正是最可能被它切開的功能。第二,把你自己的五句帶標籤的句子分別放進 v4 和 v4 Turbo,聽聽表達型端點與低延遲端點之間的標籤遵循度漂移;它們是各自獨立的模型,在一個模型上生效的標籤,未必會在另一個模型上以完全相同的方式生效。第三,用 $0.08 而不是 $0.022 來計算你實際的每月字元量,因為那才是你下一季據以運作的數字。
公告中那個約 75% 的盲測偏好數字是廠商自行測量的結果,我們不會把它洗白成別的東西。這次發表會上真正獨立的數字,是排行榜上的那一個:以 1,674 次出賽、1,319 Elo 拿下第一名,而誤差區間大約是正負 19 分。在真實的排行榜上,這是個很強的成績。它不是規格,也不會告訴你你的標籤語法能不能撐過一輪翻譯。
