Een gegenereerde hero-kaart voor ElevenLabs Eleven v4 vs VoxCPM2 met twee panelen: ElevenLabs Eleven v4 als gehost endpoint met Elo 1.319, rang 1 en $80,00 per 1 miljoen tekens; VoxCPM2 als een Apache-2.0-checkpoint met 2B parameters, 48 kHz-uitvoer en geen arena-rij. Voettekst: 'Eleven v4-rang en -prijs volgens Artificial Analysis, september 2026; VoxCPM2-specificaties volgens de OpenBMB-modelkaart.' Het OrcaRouter-logo staat in de rechteronderhoek.
Guides & Insights

Eleven v4 vs VoxCPM2: Een gerangschikt model tegenover een checkpoint dat je niet kunt huren

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het meest bruikbare feit in deze matchup is een rij die niet bestaat. ElevenLabs Eleven v4staat op de eerste plaats in de Provider Voice Arena van Artificial Analysis met een Elo van 1.319 over 1.674 optredens, tegen $80,00 per miljoen tekens. VoxCPM2, het OpenBMB-checkpoint dat in april 2026 werd uitgebracht, komt op geen van beide spraakleaderboards voor — niet gerangschikt, niet ongerangschikt, niet als preview-vermelding. Dat is geen oordeel over de kwaliteit. Het betekent dat welk getal je ook hoopte te vergelijken met 1.319, niemand het heeft geproduceerd, en de vergelijking moet worden gemaakt op basis van iets anders dan voorkeur. Wat overblijft is eigendom, fine-tuning en een licentievraag die een gehost endpoint je niet laat stellen.

Wat elke kant je eigenlijk geeft

Dit zijn verschillende productklassen, en het verschil is niet cosmetisch.

• Toegang — Eleven v4 is een gehost endpoint dat je bereikt via ElevenLabs' eigen API, met facturering per teken. VoxCPM2 is een checkpoint op Hugging Face onder openbmb/VoxCPM2; je downloadt het en draait het zelf, en er is geen first-party endpoint om aan te roepen.

• Licentie — VoxCPM2 wordt geleverd onder Apache 2.0, expliciet vrij voor commercieel gebruik. Eleven v4 is een commerciële API waarvan de voorwaarden die van ElevenLabs zijn. Dat verschil is van belang als je juridische afdeling vraagt of je mag fine-tunen, herdistribueren of gewichten mag meeleveren; met het checkpoint staat het antwoord opgeschreven en vast.

• Grootte en hardware — VoxCPM2 heeft 2B parameters op een MiniCPM-4-backbone en op de kaart staat ongeveer 8 GB VRAM bij bfloat16, met een maximale sequentielengte van 8.192 tokens. ElevenLabs publiceert geen parameteraantal voor Eleven v4, en de hardwarevoetafdruk van een gehost model is niet iets dat je beheert.

• Uitvoerketen — VoxCPM2 accepteert referentie-audio van 16 kHz en levert 48 kHz via de ingebouwde superresolutie van AudioVAE V2, zonder externe upsampler in het signaalpad. Hosted TTS geeft je een stream tegen welke snelheid de leverancier ook maar heeft gekozen.

• Onafhankelijke score — Eleven v4 heeft er een, en die staat op de eerste plaats. VoxCPM2 heeft er geen. Afwezigheid is geen lage score; het is een model zonder score, en over de twee zou nooit in dezelfde zin gesproken mogen worden alsof de tweede een getal was.

A generated scoreboard comparing ElevenLabs Eleven v4 and VoxCPM2 across six dimensions: arena rank (1, Elo 1,319 against not on the board), price ($80.00 per 1M characters against no per-character rate), licence (vendor API terms against Apache 2.0 for commercial use), voice creation (clone from 10 s of audio against voice design and cloning), languages (90-plus against 30) and operations (none, it is hosted, against your own GPU at about 8 GB). Footer: 'Eleven v4 figures per Artificial Analysis and vendor docs; VoxCPM2 figures per the OpenBMB model card.' The OrcaRouter logo sits in the bottom-right corner.

Het getal dat de ontbrekende Elo vervangt

Als je voorkeuren niet kunt vergelijken, vergelijk dan wat je kunt berekenen, en voor een self-hosted model is dat doorvoer. De kaart van VoxCPM2 vermeldt een real-timefactor van ongeveer 0,30 in standaard PyTorch op een RTX 4090, die daalt tot ongeveer 0,13 onder Nano-VLLM. De real-timefactor is seconden rekenwerk per seconde audio, dus die twee cijfers betekenen dat één GPU-uur in het eerste geval ruwweg 3,3 uur voltooide spraak oplevert en in het tweede ongeveer 7,7 uur.

A screenshot of the Hugging Face model card for openbmb/VoxCPM2, tagged Text-to-Speech, VoxCPM, Safetensors, 30 languages, multilingual, voice-cloning, voice-design, diffusion and audio, with License: apache-2.0. The summary reads: 'VoxCPM2 is a tokenizer-free, diffusion autoregressive Text-to-Speech model - 2B parameters, 30 languages, 48kHz audio output, trained on over 2 million hours of multilingual speech data.' Highlights list 30-language multilingual input with no language tag, voice design from a natural-language description with no reference audio, controllable cloning from a short clip with optional style guidance, 48 kHz studio-quality output via AudioVAE V2's built-in super-resolution, context-aware synthesis, real-time streaming with an RTF as low as about 0.3 on an NVIDIA RTX 4090 and about 0.13 accelerated by Nano-VLLM, and an Apache-2.0 licence free for commercial use. The sidebar shows 341,299 downloads last month, 2B params, BF16, and a note under Inference Providers that the model is not deployed by any inference provider.

Twee gevolgen volgen onmiddellijk. De serving-stack is belangrijker dan het model: dezelfde checkpoint op dezelfde kaart zorgt voor meer dan een verdubbeling van zijn output wanneer je de inference-engine vervangt, dus elk kostenmodel dat het cijfer 0,30 gebruikt, overschat je self-hosted kosten met een factor van ongeveer 2,3. En benutting is alles: een kaart die niets doet, verslaat een per-teken-API tegen geen enkele prijs, omdat de rekening van de API meeschaalt met wat je zegt, terwijl de rekening van de kaart meeschaalt met wanneer je die hebt gekocht.

Daarom is de eerlijke versie van deze beslissing niet "wat klinkt beter". Het is "hoeveel uur audio producer je per maand, en is de hardware bezet". Onder het volume waarbij een kaart continu belast blijft, wint de API, en het is niet eens een close call. Daarboven, op hardware die je al bezit, zijn de marginale kosten van het checkpoint per duizendste uur gelijk aan de kosten voor het eerste uur — en dat is een structureel voordeel dat geen enkele tariefkaart kan evenaren.

De mogelijkheid die een gehost endpoint je niet verkoopt

Hier houdt de vergelijking op een spiegelbeeld te zijn, want er is één ding dat VoxCPM2 doet wat Eleven v4 fundamenteel niet kan: je kunt het opnieuw trainen. De modelkaart documenteert zowel volledige SFT als LoRA-finetuning met slechts vijf tot tien minuten audio, met een meegeleverd trainingsscript en configuratie voor elk.

Dat verandert de vorm van een stemprogramma. Een gehoste API geeft je een vast model plus alles wat de leverancier aan cloning beschikbaar stelt — in het geval van Eleven v4 tien seconden referentieaudio voor instant clones, met daarboven een professionele tier. Een met LoRA afstembare checkpoint geeft je een model dat nog nooit andermans data heeft gezien en waarvan je het gedrag per versie kunt vastpinnen. Voor een merkstem, een gereguleerd domein of een taal die de cast van de leverancier slecht aankan, is dat een andere categorie oplossing, niet een goedkopere.

De afweging is expliciet en het vermelden waard: met VoxCPM2 accepteer je dat geen enkele derde partij het model ooit heeft beoordeeld, dat kwaliteitsgaranties zaken zijn die je zelf opbouwt en meet, en dat de limiet van 8.192 tokens per sequentie en de waarschuwing van de kaart zelf — dat stemontwerp en stijlbeheersing per run verschillen en dat één tot drie generaties worden aanbevolen — nu jouw QA-probleem zijn.

Wat Eleven v4 je geeft wat de checkpoint niet kan

Andersom zijn de voordelen van het gehoste model juist de voordelen die op een releasekalender verschijnen, niet op een specsheet.

• Een gemeten ranking — als eerste op een ranglijst met 1.674 steekproeven achter de schatting, en een interval van ongeveer ±19 punten eromheen. Wat die ranglijst ook meet, ze is onafhankelijk van beide leveranciers en ze is het enige kwaliteitssignaal van een derde partij in deze vergelijking.

• Voordrachtsaanwijzingen in de tekst — inline-audiotags zoals [lacht], [fluistert] en [boos gezegd met een Frans accent], plus prompts in natuurlijke taal voor de voordracht en verbeterde ondersteuning voor het Internationaal Fonetisch Alfabet. Om een stemmingsverandering uit een zelfgehost model te krijgen, is een regeneratie of een fine-tune nodig; hier is het een token in het script.

• Dekking die je niet hoeft te verifiëren — 90-plus talen tegenover de 30 van VoxCPM2, met de kanttekening dat de lijst van het checkpoint expliciet en met naam genoemd is (inclusief Chinese dialecten), terwijl het "90-plus" van de leverancier een aantal zonder een lijst is.

• Geen operationeel oppervlak — geen GPU, geen serving-stack, geen versiedrift, en een promotietarief van $0,022 per 1.000 tekens tot 12 oktober tegenover een lijsttarief van $0,08 daarna.

A screenshot of Artificial Analysis' Eleven v4 model page, titled Eleven v4 Quality Elo, Speed & Price Analysis, credited to ElevenLabs and the ElevenLabs family with an Elo of 1318.77. The page presents Quality, Pricing and 1M Throughput views over the Provider Voice Arena Preference Elo, and the model selector reads '27 of 96 models'.

Geen van beide is van ons, en dat is precies het punt van deze sectie.

OrcaRouter host geen van beide modellen. Er is geen ElevenLabs-endpoint en geen VoxCPM2-endpoint in onze catalogus, en het eerlijke routeringsantwoord is dat Eleven v4 via ElevenLabs' eigen API wordt bereikt, terwijl VoxCPM2 iets is dat je op je eigen hardware uitrolt. We gaan niet anders suggereren om een vergelijking netter te maken.

Waar één enkele sleutel wél helpt, is de beslissing vóór de beslissing. De reden dat gesprekken over self-hosting vastlopen, is dat het alternatief nooit wordt geëvalueerd: een API is één aanroep en een checkpoint is een serving-stack, dus de API wint bij verstek in plaats van op basis van rekenwerk. De bijdrage van OrcaRouter is dat de gehoste helft van die vergelijking goedkoop te testen is — meer dan 200 modellen achter één API-sleutel, waarbij de lijstprijzen van de providers worden doorgegeven tegen 0% opslag, zodat de gehoste optie tegen het werkelijke tarief wordt afgewogen in plaats van tegen een geschat tarief, met automatische failover als je een kandidaat achter een live pad zet voordat je klaar bent met beslissen.

Hoe te beslissen, in één doorgang

Kies Eleven v4 als de stem bij de eerste take goed moet zijn en je het deze week gedaan wilt hebben. Je krijgt de top van een onafhankelijke ranglijst, een gedocumenteerde regiesyntaxis, het grootste gedocumenteerde aantal talen in deze vergelijking, en nul infrastructuur. Je betaalt $ 0,08 per 1.000 tekens vanaf 13 oktober, en je accepteert dat je het niet kunt hertrainen, niet aan een versie kunt vastpinnen, of de audio op je eigen hardware kunt houden.

Kies VoxCPM2 als het model van jou moet zijn. Apache 2.0, 2B parameters op ongeveer 8 GB VRAM, 48 kHz-uitvoer zonder upsampler in de keten, en een fine-tuningtraject dat op vijf tot tien minuten audio draait — dat zijn mogelijkheden die een gehoste endpoint tegen geen enkele prijs biedt, en het ontbreken van een arena-rij is de prijs ervoor. Draai de doorvoercijfers op je eigen kaart voordat je je vastlegt, want de real-timefactoren 0,30 en 0,13 zijn de eigen metingen van de modelkaart en je servingstack zal ze niet exact reproduceren.

En als het eerlijke antwoord is dat je je maandelijkse audiovolume niet kent, is dat het getal dat je moet gaan opzoeken. Het bepaalt deze vergelijking. Geen van beide boards zal het je vertellen.