
Eleven v4 vs VoxCPM2: Een gerangschikt model tegenover een checkpoint dat je niet kunt huren
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 982 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 197 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
Het meest bruikbare feit in deze matchup is een rij die niet bestaat. ElevenLabs Eleven v4staat op de eerste plaats in de Provider Voice Arena van Artificial Analysis met een Elo van 1.319 over 1.674 optredens, tegen $80,00 per miljoen tekens. VoxCPM2, het OpenBMB-checkpoint dat in april 2026 werd uitgebracht, komt op geen van beide spraakleaderboards voor — niet gerangschikt, niet ongerangschikt, niet als preview-vermelding. Dat is geen oordeel over de kwaliteit. Het betekent dat welk getal je ook hoopte te vergelijken met 1.319, niemand het heeft geproduceerd, en de vergelijking moet worden gemaakt op basis van iets anders dan voorkeur. Wat overblijft is eigendom, fine-tuning en een licentievraag die een gehost endpoint je niet laat stellen.
Wat elke kant je eigenlijk geeft
Dit zijn verschillende productklassen, en het verschil is niet cosmetisch.
• Toegang — Eleven v4 is een gehost endpoint dat je bereikt via ElevenLabs' eigen API, met facturering per teken. VoxCPM2 is een checkpoint op Hugging Face onder openbmb/VoxCPM2; je downloadt het en draait het zelf, en er is geen first-party endpoint om aan te roepen.
• Licentie — VoxCPM2 wordt geleverd onder Apache 2.0, expliciet vrij voor commercieel gebruik. Eleven v4 is een commerciële API waarvan de voorwaarden die van ElevenLabs zijn. Dat verschil is van belang als je juridische afdeling vraagt of je mag fine-tunen, herdistribueren of gewichten mag meeleveren; met het checkpoint staat het antwoord opgeschreven en vast.
• Grootte en hardware — VoxCPM2 heeft 2B parameters op een MiniCPM-4-backbone en op de kaart staat ongeveer 8 GB VRAM bij bfloat16, met een maximale sequentielengte van 8.192 tokens. ElevenLabs publiceert geen parameteraantal voor Eleven v4, en de hardwarevoetafdruk van een gehost model is niet iets dat je beheert.
• Uitvoerketen — VoxCPM2 accepteert referentie-audio van 16 kHz en levert 48 kHz via de ingebouwde superresolutie van AudioVAE V2, zonder externe upsampler in het signaalpad. Hosted TTS geeft je een stream tegen welke snelheid de leverancier ook maar heeft gekozen.
• Onafhankelijke score — Eleven v4 heeft er een, en die staat op de eerste plaats. VoxCPM2 heeft er geen. Afwezigheid is geen lage score; het is een model zonder score, en over de twee zou nooit in dezelfde zin gesproken mogen worden alsof de tweede een getal was.

Het getal dat de ontbrekende Elo vervangt
Als je voorkeuren niet kunt vergelijken, vergelijk dan wat je kunt berekenen, en voor een self-hosted model is dat doorvoer. De kaart van VoxCPM2 vermeldt een real-timefactor van ongeveer 0,30 in standaard PyTorch op een RTX 4090, die daalt tot ongeveer 0,13 onder Nano-VLLM. De real-timefactor is seconden rekenwerk per seconde audio, dus die twee cijfers betekenen dat één GPU-uur in het eerste geval ruwweg 3,3 uur voltooide spraak oplevert en in het tweede ongeveer 7,7 uur.

Twee gevolgen volgen onmiddellijk. De serving-stack is belangrijker dan het model: dezelfde checkpoint op dezelfde kaart zorgt voor meer dan een verdubbeling van zijn output wanneer je de inference-engine vervangt, dus elk kostenmodel dat het cijfer 0,30 gebruikt, overschat je self-hosted kosten met een factor van ongeveer 2,3. En benutting is alles: een kaart die niets doet, verslaat een per-teken-API tegen geen enkele prijs, omdat de rekening van de API meeschaalt met wat je zegt, terwijl de rekening van de kaart meeschaalt met wanneer je die hebt gekocht.
Daarom is de eerlijke versie van deze beslissing niet "wat klinkt beter". Het is "hoeveel uur audio producer je per maand, en is de hardware bezet". Onder het volume waarbij een kaart continu belast blijft, wint de API, en het is niet eens een close call. Daarboven, op hardware die je al bezit, zijn de marginale kosten van het checkpoint per duizendste uur gelijk aan de kosten voor het eerste uur — en dat is een structureel voordeel dat geen enkele tariefkaart kan evenaren.
De mogelijkheid die een gehost endpoint je niet verkoopt
Hier houdt de vergelijking op een spiegelbeeld te zijn, want er is één ding dat VoxCPM2 doet wat Eleven v4 fundamenteel niet kan: je kunt het opnieuw trainen. De modelkaart documenteert zowel volledige SFT als LoRA-finetuning met slechts vijf tot tien minuten audio, met een meegeleverd trainingsscript en configuratie voor elk.
Dat verandert de vorm van een stemprogramma. Een gehoste API geeft je een vast model plus alles wat de leverancier aan cloning beschikbaar stelt — in het geval van Eleven v4 tien seconden referentieaudio voor instant clones, met daarboven een professionele tier. Een met LoRA afstembare checkpoint geeft je een model dat nog nooit andermans data heeft gezien en waarvan je het gedrag per versie kunt vastpinnen. Voor een merkstem, een gereguleerd domein of een taal die de cast van de leverancier slecht aankan, is dat een andere categorie oplossing, niet een goedkopere.
De afweging is expliciet en het vermelden waard: met VoxCPM2 accepteer je dat geen enkele derde partij het model ooit heeft beoordeeld, dat kwaliteitsgaranties zaken zijn die je zelf opbouwt en meet, en dat de limiet van 8.192 tokens per sequentie en de waarschuwing van de kaart zelf — dat stemontwerp en stijlbeheersing per run verschillen en dat één tot drie generaties worden aanbevolen — nu jouw QA-probleem zijn.
Wat Eleven v4 je geeft wat de checkpoint niet kan
Andersom zijn de voordelen van het gehoste model juist de voordelen die op een releasekalender verschijnen, niet op een specsheet.
• Een gemeten ranking — als eerste op een ranglijst met 1.674 steekproeven achter de schatting, en een interval van ongeveer ±19 punten eromheen. Wat die ranglijst ook meet, ze is onafhankelijk van beide leveranciers en ze is het enige kwaliteitssignaal van een derde partij in deze vergelijking.
• Voordrachtsaanwijzingen in de tekst — inline-audiotags zoals [lacht], [fluistert] en [boos gezegd met een Frans accent], plus prompts in natuurlijke taal voor de voordracht en verbeterde ondersteuning voor het Internationaal Fonetisch Alfabet. Om een stemmingsverandering uit een zelfgehost model te krijgen, is een regeneratie of een fine-tune nodig; hier is het een token in het script.
• Dekking die je niet hoeft te verifiëren — 90-plus talen tegenover de 30 van VoxCPM2, met de kanttekening dat de lijst van het checkpoint expliciet en met naam genoemd is (inclusief Chinese dialecten), terwijl het "90-plus" van de leverancier een aantal zonder een lijst is.
• Geen operationeel oppervlak — geen GPU, geen serving-stack, geen versiedrift, en een promotietarief van $0,022 per 1.000 tekens tot 12 oktober tegenover een lijsttarief van $0,08 daarna.

Geen van beide is van ons, en dat is precies het punt van deze sectie.
OrcaRouter host geen van beide modellen. Er is geen ElevenLabs-endpoint en geen VoxCPM2-endpoint in onze catalogus, en het eerlijke routeringsantwoord is dat Eleven v4 via ElevenLabs' eigen API wordt bereikt, terwijl VoxCPM2 iets is dat je op je eigen hardware uitrolt. We gaan niet anders suggereren om een vergelijking netter te maken.
Waar één enkele sleutel wél helpt, is de beslissing vóór de beslissing. De reden dat gesprekken over self-hosting vastlopen, is dat het alternatief nooit wordt geëvalueerd: een API is één aanroep en een checkpoint is een serving-stack, dus de API wint bij verstek in plaats van op basis van rekenwerk. De bijdrage van OrcaRouter is dat de gehoste helft van die vergelijking goedkoop te testen is — meer dan 200 modellen achter één API-sleutel, waarbij de lijstprijzen van de providers worden doorgegeven tegen 0% opslag, zodat de gehoste optie tegen het werkelijke tarief wordt afgewogen in plaats van tegen een geschat tarief, met automatische failover als je een kandidaat achter een live pad zet voordat je klaar bent met beslissen.
Hoe te beslissen, in één doorgang
Kies Eleven v4 als de stem bij de eerste take goed moet zijn en je het deze week gedaan wilt hebben. Je krijgt de top van een onafhankelijke ranglijst, een gedocumenteerde regiesyntaxis, het grootste gedocumenteerde aantal talen in deze vergelijking, en nul infrastructuur. Je betaalt $ 0,08 per 1.000 tekens vanaf 13 oktober, en je accepteert dat je het niet kunt hertrainen, niet aan een versie kunt vastpinnen, of de audio op je eigen hardware kunt houden.
Kies VoxCPM2 als het model van jou moet zijn. Apache 2.0, 2B parameters op ongeveer 8 GB VRAM, 48 kHz-uitvoer zonder upsampler in de keten, en een fine-tuningtraject dat op vijf tot tien minuten audio draait — dat zijn mogelijkheden die een gehoste endpoint tegen geen enkele prijs biedt, en het ontbreken van een arena-rij is de prijs ervoor. Draai de doorvoercijfers op je eigen kaart voordat je je vastlegt, want de real-timefactoren 0,30 en 0,13 zijn de eigen metingen van de modelkaart en je servingstack zal ze niet exact reproduceren.
En als het eerlijke antwoord is dat je je maandelijkse audiovolume niet kent, is dat het getal dat je moet gaan opzoeken. Het bepaalt deze vergelijking. Geen van beide boards zal het je vertellen.
