一張為 ElevenLabs Eleven v4 與 VoxCPM2 對比而生成的 hero 卡片,包含兩個面板:ElevenLabs Eleven v4 為託管端點,Elo 1,319、排名第 1,每 100 萬字元 $80.00;VoxCPM2 為 Apache-2.0 檢查點,具備 2B 參數、48 kHz 輸出,且沒有競技場列。頁腳:「Eleven v4 排名與價格依據 Artificial Analysis,2026 年 9 月;VoxCPM2 規格依據 OpenBMB 模型卡。」OrcaRouter 標誌位於右下角。
Guides & Insights

Eleven v4 對決 VoxCPM2:一個榜上有名的模型,對上一個你租不到的檢查點

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

這場對決中最有用的事實,是一列根本不存在的資料。ElevenLabs Eleven v4在 Artificial Analysis 的 Provider Voice Arena 上以 1,319 的 Elo、累計 1,674 次出現位居第 1 名,價格為每百萬字元 80.00 美元。VoxCPM2,這個 OpenBMB 於 2026 年 4 月發布的檢查點,在兩個語音排行榜上都完全找不到——沒有排名、不在未排名名單中,也不是預覽條目。這不是對品質的評斷。這意味著,無論你原本希望拿哪個數字來和 1,319 比較,都沒有人產出過那個數字,而這項比較就必須建立在偏好以外的東西上。剩下的是所有權、微調,以及一個託管端點不會讓你提出的授權問題。

每一方實際上交給你的

這些是不同類別的產品,而差異並非僅止於表面。

• 存取方式 — Eleven v4 是透過 ElevenLabs 自家 API 存取的託管端點,按字元計費。VoxCPM2 則是 Hugging Face 上 openbmb/VoxCPM2 的檢查點;你得自行下載並執行,而且沒有官方端點可供呼叫。

• 授權 — VoxCPM2 採用 Apache 2.0,明確允許商業使用。Eleven v4 則是商業 API,條款由 ElevenLabs 制定。如果你的法務審查要問你能不能微調、重新散布或交付權重,這項差異就事關重大;有了這份檢查點,答案是白紙黑字寫下且固定不變的。

• 大小與硬體 — VoxCPM2 是基於 MiniCPM-4 主幹的 2B 參數模型,規格表標示在 bfloat16 下約需 8 GB 的 VRAM,最大序列長度為 8,192 個 token。ElevenLabs 並未公布 Eleven v4 的參數數量,而託管模型的硬體佔用也不是你需要管理的東西。

• 輸出鏈 — VoxCPM2 接受 16 kHz 參考音訊,並透過 AudioVAE V2 內建的超解析度技術輸出 48 kHz,路徑中不需任何外部升頻器。託管式 TTS 則以供應商自行選擇的任意取樣率,直接交給你一串串流。

• 獨立評分——Eleven v4 有一個,而且位居第一。VoxCPM2 則沒有。沒有分數並非低分;它是一個未獲評分的模型,而兩者絕不該被放在同一句話裡談論,彷彿後者是一個數字。

A generated scoreboard comparing ElevenLabs Eleven v4 and VoxCPM2 across six dimensions: arena rank (1, Elo 1,319 against not on the board), price ($80.00 per 1M characters against no per-character rate), licence (vendor API terms against Apache 2.0 for commercial use), voice creation (clone from 10 s of audio against voice design and cloning), languages (90-plus against 30) and operations (none, it is hosted, against your own GPU at about 8 GB). Footer: 'Eleven v4 figures per Artificial Analysis and vendor docs; VoxCPM2 figures per the OpenBMB model card.' The OrcaRouter logo sits in the bottom-right corner.

用來取代缺失 Elo 的數字

如果無法比較偏好,就比較你能計算的東西,而對自架模型而言,那就是吞吐量。VoxCPM2 的模型卡指出,在 RTX 4090 上以標準 PyTorch 執行時,即時因子約為 0.30,在 Nano-VLLM 下則降至約 0.13。即時因子是每生成一秒音訊所需的運算秒數,因此這兩個數字意味著:在第一種情況下,一個 GPU 小時可產出約 3.3 小時的成品語音,在第二種情況下則約為 7.7 小時。

A screenshot of the Hugging Face model card for openbmb/VoxCPM2, tagged Text-to-Speech, VoxCPM, Safetensors, 30 languages, multilingual, voice-cloning, voice-design, diffusion and audio, with License: apache-2.0. The summary reads: 'VoxCPM2 is a tokenizer-free, diffusion autoregressive Text-to-Speech model - 2B parameters, 30 languages, 48kHz audio output, trained on over 2 million hours of multilingual speech data.' Highlights list 30-language multilingual input with no language tag, voice design from a natural-language description with no reference audio, controllable cloning from a short clip with optional style guidance, 48 kHz studio-quality output via AudioVAE V2's built-in super-resolution, context-aware synthesis, real-time streaming with an RTF as low as about 0.3 on an NVIDIA RTX 4090 and about 0.13 accelerated by Nano-VLLM, and an Apache-2.0 licence free for commercial use. The sidebar shows 341,299 downloads last month, 2B params, BF16, and a note under Inference Providers that the model is not deployed by any inference provider.

兩個後果立刻隨之而來。服務堆疊比模型更重要:同一張卡上的同一個檢查點,只要更換推論引擎,輸出就會增加超過一倍,因此任何採用 0.30 這個數字的成本模型,都會把你的自架成本高估約 2.3 倍。而使用率才是關鍵:閒置的顯示卡無論價格如何都贏不過按字元計費的 API,因為 API 的帳單隨你說多少而變動,顯示卡的帳單則取決於你何時買下它。

這就是為什麼這個決策的誠實版本不是「哪個聽起來比較好」,而是「你一個月產出多少小時的音訊,以及硬體是否忙碌」。在顯示卡能持續滿載的用量之下,API 勝出,而且差距不小。超過那個用量後,在你已擁有的硬體上,checkpoint 每千分之一小時的邊際成本,與第一個小時的成本相同——而這是任何費率表都無法比擬的結構性優勢。

託管端點不會賣給你的能力

這裡就是比較不再呈現鏡像對照的地方,因為有一件事是 VoxCPM2 做得到、而 Eleven v4 根本做不到的:你可以重新訓練它。模型卡記載了完整 SFT 與 LoRA 微調,只需少至五到十分鐘的音訊,並為兩者分別提供訓練腳本與設定。

這改變了語音專案的樣貌。託管式 API 給你一個固定模型,再加上廠商所開放的任何複製功能——以 Eleven v4 來說,是十秒的參考音訊即可進行即時複製,其上還有專業層級。可用 LoRA 微調的檢查點則給你一個從未見過他人資料的模型,而且其行為可依版本鎖定。對於品牌語音、受監管的領域,或廠商的配音陣容處理不佳的語言來說,那是不同類別的解決方案,而不是比較便宜的方案。

這個取捨很明確,也值得說明:使用 VoxCPM2 時,你接受沒有任何第三方曾為這個模型評分、品質保證得由你自己建立與衡量,以及 8,192-token 序列限制和模型卡本身的警告——語音設計與風格控制會隨每次執行而異,且建議生成一到三次——如今都成了你的 QA 問題。

Eleven v4 能帶給你什麼,而檢查點做不到?

反過來說,託管式模型的優勢,是那些會出現在發布時程表上、而非規格表上的優勢。

• 一項經實測得出的排名——在一個背後有 1,674 個樣本支撐該估計值的排行榜上位居第一,而其周圍的信賴區間約為 ±19 分。無論那個排行榜衡量的是什麼,它都獨立於兩家廠商,而且它是這項比較中唯一的第三方品質訊號。

• 文本中的表演指示——行內音訊標籤,例如 [laughs]、[whispers] 和 [said angrily in French accent],再加上自然語言的表達提示,以及更完善的國際音標支援。想讓自託管模型做出情緒變化,就得重新生成或微調;在這裡,它只是腳本裡的一個詞元。

• 你無需自行驗證的涵蓋範圍 — 90 多種語言對比 VoxCPM2 的 30 種,但需注意:該檢查點的語言清單是明確且具名的(包括中文方言),而廠商所稱的「90 多種」只是個數字,沒有清單。

• 沒有營運負擔——沒有 GPU、沒有服務堆疊、沒有版本漂移,10 月 12 日前享每 1,000 個字元 $0.022 的促銷價,之後的定價則為 $0.08。

A screenshot of Artificial Analysis' Eleven v4 model page, titled Eleven v4 Quality Elo, Speed & Price Analysis, credited to ElevenLabs and the ElevenLabs family with an Elo of 1318.77. The page presents Quality, Pricing and 1M Throughput views over the Provider Voice Arena Preference Elo, and the model selector reads '27 of 96 models'.

這兩者都不是我們的,而這正是本節的重點

OrcaRouter 並未託管這兩個模型。我們的目錄中沒有 ElevenLabs 端點,也沒有 VoxCPM2 端點,而誠實的路由答案是:Eleven v4 是透過 ElevenLabs 自家的 API 存取的,而 VoxCPM2 則是你得部署在自己硬體上的東西。我們不會為了讓比較看起來更俐落,就暗示並非如此。

單一金鑰真正幫得上忙的地方,在於「做出決定之前的那個決定」。自架相關的討論之所以會卡住,是因為另一個選項從來沒被真正評估過:API 不過是一次呼叫,而 checkpoint 卻是一整套推論服務堆疊,所以 API 往往是靠預設值勝出,而不是靠算數勝出。OrcaRouter 的貢獻,就在於讓這場比較中「代管」的那一半變得便宜好測——200 多個模型只要一組 API 金鑰就能取用,供應商定價原價轉嫁,0% 加成因此代管選項是以其實際費率而非估算費率來評估,再加上自動容錯移轉,讓你在還沒下定決心之前,就能先把候選方案放到實際的流量路徑上測試。

如何一次決定

如果聲音必須一次到位,而且你想在這週內完成,就選 Pick Eleven v4。你能獲得獨立排行榜的榜首、有文件記載的方向語法、這份比較中記載最廣泛的語言數量,以及零基礎設施。從 10 月 13 日起,每 1,000 個字元你需支付 $0.08,並且你接受無法重新訓練它、鎖定版本,或將音訊保留在自己的硬體上。

如果模型必須是你自己的,就選 VoxCPM2。Apache 2.0、在約 8 GB 的 VRAM 上跑 2B 參數、48 kHz 輸出且鏈路中沒有升頻器,再加上只需五到十分鐘音訊就能執行的微調流程——這些是託管端點無論出多少錢都提供不了的能力,而競技場排行上沒有它的一席之地,正是換來這些能力的代價。在你下定決心之前,先在自己的顯示卡上實測吞吐量數字,因為 0.30 和 0.13 這兩個即時因子是模型卡自己的量測值,你的服務堆疊不會完全重現它們。

而如果誠實的答案是,你不知道自己每月的音訊量,那就是你該去查出來的數字。它會決定這項比較。兩塊板子都不會告訴你。