
Eleven v4 vs VoxCPM2: En rankad modell mot en checkpoint du inte kan hyra
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 982 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 197 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
Det mest användbara faktumet i den här matchningen är en rad som inte finns. ElevenLabs Eleven v4 innehar rank 1 i Artificial Analysis' Provider Voice Arena med en Elo på 1 319 över 1 674 framträdanden, till $80.00 per miljon tecken. VoxCPM2, OpenBMB-checkpointen som släpptes i april 2026, förekommer inte någonstans på någon av taltopplistorna – inte rankad, inte orankad, inte som en förhandsvisningspost. Det är inte ett omdöme om kvalitet. Det innebär att vilket nummer du än hoppades jämföra med 1 319, har ingen tagit fram det, och jämförelsen måste göras utifrån något annat än preferens. Det som återstår är ägande, finjustering och en licensfråga som en hostad slutpunkt inte låter dig ställa.
Vad varje sida faktiskt ger dig
Dessa är olika produktklasser, och skillnaden är inte kosmetisk.
• Åtkomst — Eleven v4 är en hostad slutpunkt som nås via ElevenLabs eget API och debiteras per tecken. VoxCPM2 är en checkpoint på Hugging Face under openbmb/VoxCPM2; du laddar ner den och kör den, och det finns ingen förstapartsslutpunkt att anropa.
• Licens — VoxCPM2 levereras under Apache 2.0, uttryckligen fri för kommersiell användning. Eleven v4 är ett kommersiellt API vars villkor är ElevenLabs'. Den skillnaden spelar roll om din juridiska granskning frågar om du får finjustera, vidaredistribuera eller skeppa vikter; med checkpointen är svaret nedskrivet och statiskt.
• Storlek och hårdvara — VoxCPM2 har 2B parametrar på en MiniCPM-4-stomme och kortet uppger ungefär 8 GB VRAM vid bfloat16, med en maximal sekvenslängd på 8 192 tokens. ElevenLabs publicerar inget parameterantal för Eleven v4, och en hostad modells hårdvaruavtryck är inget man hanterar.
• Utdatakedja – VoxCPM2 tar emot referensljud på 16 kHz och matar ut 48 kHz via AudioVAE V2:s inbyggda superupplösning, utan någon extern uppsamplare i signalvägen. Hostad TTS ger dig en ström med vilken samplingsfrekvens leverantören än har valt.
• Oberoende poäng — Eleven v4 har en, och den ligger på första plats. VoxCPM2 har ingen. Avsaknad är inte en låg poäng; det är en modell utan poäng, och de två bör aldrig nämnas i samma mening som om den andra vore en siffra.

Siffran som ersätter det saknade Elo:t
Om du inte kan jämföra preferens, jämför det du kan beräkna, och för en självhostad modell är det genomströmning. VoxCPM2:s kort anger en realtidsfaktor på omkring 0,30 i standard-PyTorch på ett RTX 4090, som sjunker till omkring 0,13 med Nano-VLLM. Realtidsfaktor är sekunder beräkning per sekund ljud, så de två siffrorna innebär att en GPU-timme ger ungefär 3,3 timmar färdigt tal i det första fallet och omkring 7,7 timmar i det andra.

Två konsekvenser följer omedelbart. Serveringsstacken är viktigare än modellen: samma checkpoint på samma kort mer än fördubblar sin utdata när du byter ut inferensmotorn, så varje kostnadsmodell som använder siffran 0,30 överdriver din självhostade kostnad med en faktor på ungefär 2,3. Och utnyttjandegraden är allt: ett kort som står oanvänt slår inte ett teckenbaserat API till något pris, eftersom API:ets kostnad skalar med vad du säger, medan kortets kostnad skalar med när du köpte det.
Vilket är anledningen till att den ärliga versionen av det här beslutet inte är "vilket låter bättre". Den är "hur många timmar ljud producerar du i månaden, och är hårdvaran upptagen". Under den volym där ett kort förblir laddat vinner API:et, och det är inte ens nära. Ovanför den, på hårdvara du redan äger, är checkpoints marginalkostnad för den tusende timmen densamma som dess kostnad för den första timmen — och det är en strukturell fördel som ingen prislista kan matcha.
Förmågan som en hostad slutpunkt inte säljer till dig
Det är här jämförelsen slutar vara en spegelbild, för det finns en sak som VoxCPM2 gör som Eleven v4 i grunden inte kan: du kan träna om den. Modellkortet dokumenterar både full SFT och LoRA-fintrimning på så lite som fem till tio minuters ljud, med ett medföljande träningsskript och en konfiguration för vardera.
Det förändrar formen på ett röstprogram. Ett hostat API ger dig en fast modell plus den kloning som leverantören än exponerar — i Eleven v4:s fall tio sekunders referensljud för omedelbara kloner, med en professionell nivå ovanför. En LoRA-justerbar checkpoint ger dig en modell som aldrig har sett någon annans data och vars beteende du kan låsa vid en version. För en varumärkesröst, en reglerad domän eller ett språk som leverantörens röstbesättning hanterar dåligt är det en annan kategori av lösning, inte en billigare sådan.
Avvägningen är explicit och värd att nämna: med VoxCPM2 accepterar du att ingen tredje part någonsin har betygsatt modellen, att kvalitetsgarantier är sådana som du bygger och mäter själv, och att sekvensgränsen på 8 192 token och kortets egen varning – att röstdesign och stilkontroll varierar mellan körningar och att en till tre genereringar rekommenderas – nu är ditt QA-problem.
Vad Eleven v4 ger dig som checkpointen inte kan
Omvänt är den hostade modellens fördelar de som syns i en releasekalender snarare än på ett specifikationsblad.
• En uppmätt rangordning – etta på en resultattavla med 1 674 stickprov bakom uppskattningen, och ett intervall på ungefär ±19 punkter runt den. Vad den resultattavlan än mäter, är den oberoende av båda leverantörerna och den är den enda kvalitetssignalen från tredje part i den här jämförelsen.
• Framförandeanvisning i texten — infogade ljudtaggar som [skrattar], [viskar] och [sade argt med fransk accent], plus naturliga framförandepromptar och förbättrat stöd för Internationella fonetiska alfabetet. Att få en stämningsändring från en självhostad modell innebär en återgenerering eller en finjustering; här är det en token i skriptet.
• Täckning du inte behöver verifiera — över 90 språk mot VoxCPM2:s 30, med förbehållet att checkpointens lista är explicit och namngiven (inklusive kinesiska dialekter), medan leverantörens ”över 90” är en siffra utan en lista.
• Ingen drift att hantera – ingen GPU, ingen serving-stack, ingen versionsdrift och ett kampanjpris på 0,022 USD per 1 000 tecken fram till den 12 oktober, mot ett listpris på 0,08 USD därefter.

Ingendera av dessa tillhör oss, och det är poängen med det här avsnittet.
OrcaRouter hostar ingen av modellerna. Det finns ingen ElevenLabs-endpoint och ingen VoxCPM2-endpoint i vår katalog, och det ärliga routningssvaret är att Eleven v4 nås via ElevenLabs eget API medan VoxCPM2 är något man driftsätter på sin egen hårdvara. Vi tänker inte antyda något annat för att göra en jämförelse prydligare.
Där en enda nyckel faktiskt hjälper är i beslutet före beslutet. Anledningen till att samtal om självhosting kör fast är att alternativet aldrig utvärderas: ett API är ett anrop och en checkpoint är en serveringsstack, så API:et vinner som standard snarare än genom aritmetik. OrcaRouters bidrag är att den hostade halvan av den jämförelsen är billig att testa — över 200 modeller bakom en enda API-nyckel med leverantörernas listpriser vidarebefordrade till 0 % påslag, så att det hostade alternativet utvärderas till sin verkliga kostnad i stället för en uppskattad, med automatisk redundansväxling om du sätter en kandidat bakom en aktiv väg innan du har fattat beslutet.
Så avgör du i ett svep
Välj Eleven v4 om rösten måste vara bra vid första tagningen och du vill få det klart den här veckan. Du får toppen av en oberoende rankning, en dokumenterad instruktionssyntax, det bredaste dokumenterade antalet språk i den här jämförelsen och noll infrastruktur. Du betalar 0,08 USD per 1 000 tecken från och med 13 oktober, och du accepterar att du inte kan träna om den, versionslåsa den eller behålla ljudet på din egen hårdvara.
Välj VoxCPM2 om modellen måste vara din egen. Apache 2.0, 2B parametrar på ungefär 8 GB VRAM, 48 kHz utdata utan uppsamplare i kedjan, och en finjusteringsväg som körs på fem till tio minuters ljud — det är funktioner som en hostad slutpunkt inte erbjuder till något pris, och avsaknaden av en arena-rad är priset för dem. Kör genomströmningstalen på ditt eget kort innan du bestämmer dig, eftersom realtidsfaktorerna 0.30 och 0.13 är modellkortets egna mätningar och din serveringsstack inte kommer att återskapa dem exakt.
Och om det ärliga svaret är att du inte vet din månatliga ljudvolym, är det siffran du ska ta reda på. Den avgör den här jämförelsen. Ingen av panelerna kommer att berätta det för dig.
