
Eleven v4 對決 VoxCPM2:一個榜上有名的模型,對上一個你租不到的檢查點
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 982 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 197 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
這場對決中最有用的事實,是一列根本不存在的資料。ElevenLabs Eleven v4在 Artificial Analysis 的 Provider Voice Arena 上以 1,319 的 Elo、累計 1,674 次出現位居第 1 名,價格為每百萬字元 80.00 美元。VoxCPM2,這個 OpenBMB 於 2026 年 4 月發布的檢查點,在兩個語音排行榜上都完全找不到——沒有排名、不在未排名名單中,也不是預覽條目。這不是對品質的評斷。這意味著,無論你原本希望拿哪個數字來和 1,319 比較,都沒有人產出過那個數字,而這項比較就必須建立在偏好以外的東西上。剩下的是所有權、微調,以及一個託管端點不會讓你提出的授權問題。
每一方實際上交給你的
這些是不同類別的產品,而差異並非僅止於表面。
• 存取方式 — Eleven v4 是透過 ElevenLabs 自家 API 存取的託管端點,按字元計費。VoxCPM2 則是 Hugging Face 上 openbmb/VoxCPM2 的檢查點;你得自行下載並執行,而且沒有官方端點可供呼叫。
• 授權 — VoxCPM2 採用 Apache 2.0,明確允許商業使用。Eleven v4 則是商業 API,條款由 ElevenLabs 制定。如果你的法務審查要問你能不能微調、重新散布或交付權重,這項差異就事關重大;有了這份檢查點,答案是白紙黑字寫下且固定不變的。
• 大小與硬體 — VoxCPM2 是基於 MiniCPM-4 主幹的 2B 參數模型,規格表標示在 bfloat16 下約需 8 GB 的 VRAM,最大序列長度為 8,192 個 token。ElevenLabs 並未公布 Eleven v4 的參數數量,而託管模型的硬體佔用也不是你需要管理的東西。
• 輸出鏈 — VoxCPM2 接受 16 kHz 參考音訊,並透過 AudioVAE V2 內建的超解析度技術輸出 48 kHz,路徑中不需任何外部升頻器。託管式 TTS 則以供應商自行選擇的任意取樣率,直接交給你一串串流。
• 獨立評分——Eleven v4 有一個,而且位居第一。VoxCPM2 則沒有。沒有分數並非低分;它是一個未獲評分的模型,而兩者絕不該被放在同一句話裡談論,彷彿後者是一個數字。

用來取代缺失 Elo 的數字
如果無法比較偏好,就比較你能計算的東西,而對自架模型而言,那就是吞吐量。VoxCPM2 的模型卡指出,在 RTX 4090 上以標準 PyTorch 執行時,即時因子約為 0.30,在 Nano-VLLM 下則降至約 0.13。即時因子是每生成一秒音訊所需的運算秒數,因此這兩個數字意味著:在第一種情況下,一個 GPU 小時可產出約 3.3 小時的成品語音,在第二種情況下則約為 7.7 小時。

兩個後果立刻隨之而來。服務堆疊比模型更重要:同一張卡上的同一個檢查點,只要更換推論引擎,輸出就會增加超過一倍,因此任何採用 0.30 這個數字的成本模型,都會把你的自架成本高估約 2.3 倍。而使用率才是關鍵:閒置的顯示卡無論價格如何都贏不過按字元計費的 API,因為 API 的帳單隨你說多少而變動,顯示卡的帳單則取決於你何時買下它。
這就是為什麼這個決策的誠實版本不是「哪個聽起來比較好」,而是「你一個月產出多少小時的音訊,以及硬體是否忙碌」。在顯示卡能持續滿載的用量之下,API 勝出,而且差距不小。超過那個用量後,在你已擁有的硬體上,checkpoint 每千分之一小時的邊際成本,與第一個小時的成本相同——而這是任何費率表都無法比擬的結構性優勢。
託管端點不會賣給你的能力
這裡就是比較不再呈現鏡像對照的地方,因為有一件事是 VoxCPM2 做得到、而 Eleven v4 根本做不到的:你可以重新訓練它。模型卡記載了完整 SFT 與 LoRA 微調,只需少至五到十分鐘的音訊,並為兩者分別提供訓練腳本與設定。
這改變了語音專案的樣貌。託管式 API 給你一個固定模型,再加上廠商所開放的任何複製功能——以 Eleven v4 來說,是十秒的參考音訊即可進行即時複製,其上還有專業層級。可用 LoRA 微調的檢查點則給你一個從未見過他人資料的模型,而且其行為可依版本鎖定。對於品牌語音、受監管的領域,或廠商的配音陣容處理不佳的語言來說,那是不同類別的解決方案,而不是比較便宜的方案。
這個取捨很明確,也值得說明:使用 VoxCPM2 時,你接受沒有任何第三方曾為這個模型評分、品質保證得由你自己建立與衡量,以及 8,192-token 序列限制和模型卡本身的警告——語音設計與風格控制會隨每次執行而異,且建議生成一到三次——如今都成了你的 QA 問題。
Eleven v4 能帶給你什麼,而檢查點做不到?
反過來說,託管式模型的優勢,是那些會出現在發布時程表上、而非規格表上的優勢。
• 一項經實測得出的排名——在一個背後有 1,674 個樣本支撐該估計值的排行榜上位居第一,而其周圍的信賴區間約為 ±19 分。無論那個排行榜衡量的是什麼,它都獨立於兩家廠商,而且它是這項比較中唯一的第三方品質訊號。
• 文本中的表演指示——行內音訊標籤,例如 [laughs]、[whispers] 和 [said angrily in French accent],再加上自然語言的表達提示,以及更完善的國際音標支援。想讓自託管模型做出情緒變化,就得重新生成或微調;在這裡,它只是腳本裡的一個詞元。
• 你無需自行驗證的涵蓋範圍 — 90 多種語言對比 VoxCPM2 的 30 種,但需注意:該檢查點的語言清單是明確且具名的(包括中文方言),而廠商所稱的「90 多種」只是個數字,沒有清單。
• 沒有營運負擔——沒有 GPU、沒有服務堆疊、沒有版本漂移,10 月 12 日前享每 1,000 個字元 $0.022 的促銷價,之後的定價則為 $0.08。

這兩者都不是我們的,而這正是本節的重點
OrcaRouter 並未託管這兩個模型。我們的目錄中沒有 ElevenLabs 端點,也沒有 VoxCPM2 端點,而誠實的路由答案是:Eleven v4 是透過 ElevenLabs 自家的 API 存取的,而 VoxCPM2 則是你得部署在自己硬體上的東西。我們不會為了讓比較看起來更俐落,就暗示並非如此。
單一金鑰真正幫得上忙的地方,在於「做出決定之前的那個決定」。自架相關的討論之所以會卡住,是因為另一個選項從來沒被真正評估過:API 不過是一次呼叫,而 checkpoint 卻是一整套推論服務堆疊,所以 API 往往是靠預設值勝出,而不是靠算數勝出。OrcaRouter 的貢獻,就在於讓這場比較中「代管」的那一半變得便宜好測——200 多個模型只要一組 API 金鑰就能取用,供應商定價原價轉嫁,0% 加成因此代管選項是以其實際費率而非估算費率來評估,再加上自動容錯移轉,讓你在還沒下定決心之前,就能先把候選方案放到實際的流量路徑上測試。
如何一次決定
如果聲音必須一次到位,而且你想在這週內完成,就選 Pick Eleven v4。你能獲得獨立排行榜的榜首、有文件記載的方向語法、這份比較中記載最廣泛的語言數量,以及零基礎設施。從 10 月 13 日起,每 1,000 個字元你需支付 $0.08,並且你接受無法重新訓練它、鎖定版本,或將音訊保留在自己的硬體上。
如果模型必須是你自己的,就選 VoxCPM2。Apache 2.0、在約 8 GB 的 VRAM 上跑 2B 參數、48 kHz 輸出且鏈路中沒有升頻器,再加上只需五到十分鐘音訊就能執行的微調流程——這些是託管端點無論出多少錢都提供不了的能力,而競技場排行上沒有它的一席之地,正是換來這些能力的代價。在你下定決心之前,先在自己的顯示卡上實測吞吐量數字,因為 0.30 和 0.13 這兩個即時因子是模型卡自己的量測值,你的服務堆疊不會完全重現它們。
而如果誠實的答案是,你不知道自己每月的音訊量,那就是你該去查出來的數字。它會決定這項比較。兩塊板子都不會告訴你。
