Carte principale générée pour ElevenLabs Eleven v4 vs VoxCPM2, avec deux panneaux : ElevenLabs Eleven v4 en tant que point de terminaison hébergé à l'Elo 1 319, classé n° 1 et 80,00 $ par million de caractères ; VoxCPM2 en tant que checkpoint Apache-2.0 comptant 2 milliards de paramètres, une sortie à 48 kHz et aucune ligne dans l'arène. Pied de page : « Classement et prix d'Eleven v4 selon Artificial Analysis, septembre 2026 ; spécifications de VoxCPM2 selon la fiche de modèle OpenBMB. » Le logo OrcaRouter figure dans le coin inférieur droit.
Guides & Insights

Eleven v4 vs VoxCPM2 : un modèle classé face à un checkpoint que vous ne pouvez pas louer

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le fait le plus utile dans cette confrontation est une ligne qui n'existe pas. ElevenLabs Eleven v4 occupe la 1re place sur Provider Voice Arena d'Artificial Analysis avec un Elo de 1 319 sur 1 674 apparitions, à 80,00 $ par million de caractères. VoxCPM2, le checkpoint OpenBMB publié en avril 2026, n'apparaît nulle part sur l'un ou l'autre des classements vocaux — ni classé, ni non classé, ni comme entrée en aperçu. Ce n'est pas un verdict sur la qualité. Cela signifie que quel que soit le chiffre que vous espériez comparer à 1 319, personne ne l'a produit, et la comparaison doit se faire sur autre chose que la préférence. Ce qui reste, c'est la propriété, le fine-tuning et une question de licence qu'un point de terminaison hébergé ne vous permet pas de poser.

Ce que chaque camp vous remet réellement

Il s'agit de classes de produits différentes, et la différence n'est pas cosmétique.

• Accès — Eleven v4 est un point de terminaison hébergé accessible via l'API propre d'ElevenLabs, facturé au caractère. VoxCPM2 est un checkpoint sur Hugging Face sous openbmb/VoxCPM2 ; vous le téléchargez et l'exécutez, et il n'y a aucun point de terminaison propriétaire à appeler.

• Licence — VoxCPM2 est distribué sous Apache 2.0, explicitement libre pour un usage commercial. Eleven v4 est une API commerciale dont les conditions sont celles d'ElevenLabs. Cette différence compte si votre service juridique vous demande si vous pouvez affiner, redistribuer ou livrer les poids ; avec le checkpoint, la réponse est écrite et statique.

• Taille et matériel — VoxCPM2 compte 2 milliards de paramètres sur une base MiniCPM-4, et la fiche technique annonce environ 8 Go de VRAM en bfloat16, avec une longueur de séquence maximale de 8 192 tokens. ElevenLabs ne publie aucun nombre de paramètres pour Eleven v4, et l'empreinte matérielle d'un modèle hébergé n'est pas quelque chose que vous gérez.

• Chaîne de sortie — VoxCPM2 accepte un audio de référence à 16 kHz et émet en 48 kHz grâce à la super-résolution intégrée d'AudioVAE V2, sans suréchantillonneur externe dans la chaîne. Un TTS hébergé vous fournit un flux à la fréquence choisie par le fournisseur.

• Score indépendant — Eleven v4 en possède un, et il est à la première place. VoxCPM2 n'en a aucun. L'absence n'est pas un score faible ; c'est un modèle non évalué, et l'on ne devrait jamais parler des deux dans la même phrase comme si le second était un chiffre.

A generated scoreboard comparing ElevenLabs Eleven v4 and VoxCPM2 across six dimensions: arena rank (1, Elo 1,319 against not on the board), price ($80.00 per 1M characters against no per-character rate), licence (vendor API terms against Apache 2.0 for commercial use), voice creation (clone from 10 s of audio against voice design and cloning), languages (90-plus against 30) and operations (none, it is hosted, against your own GPU at about 8 GB). Footer: 'Eleven v4 figures per Artificial Analysis and vendor docs; VoxCPM2 figures per the OpenBMB model card.' The OrcaRouter logo sits in the bottom-right corner.

Le nombre qui remplace l'Elo manquant

Si vous ne pouvez pas comparer les préférences, comparez ce que vous pouvez calculer, et pour un modèle auto-hébergé, c’est le débit. La fiche de VoxCPM2 indique un facteur temps réel d’environ 0,30 dans PyTorch standard sur une RTX 4090, qui tombe à environ 0,13 avec Nano-VLLM. Le facteur temps réel correspond à des secondes de calcul par seconde d’audio ; ainsi, ces deux chiffres signifient qu’une heure de GPU produit environ 3,3 heures de parole finalisée dans le premier cas et environ 7,7 heures dans le second.

A screenshot of the Hugging Face model card for openbmb/VoxCPM2, tagged Text-to-Speech, VoxCPM, Safetensors, 30 languages, multilingual, voice-cloning, voice-design, diffusion and audio, with License: apache-2.0. The summary reads: 'VoxCPM2 is a tokenizer-free, diffusion autoregressive Text-to-Speech model - 2B parameters, 30 languages, 48kHz audio output, trained on over 2 million hours of multilingual speech data.' Highlights list 30-language multilingual input with no language tag, voice design from a natural-language description with no reference audio, controllable cloning from a short clip with optional style guidance, 48 kHz studio-quality output via AudioVAE V2's built-in super-resolution, context-aware synthesis, real-time streaming with an RTF as low as about 0.3 on an NVIDIA RTX 4090 and about 0.13 accelerated by Nano-VLLM, and an Apache-2.0 licence free for commercial use. The sidebar shows 341,299 downloads last month, 2B params, BF16, and a note under Inference Providers that the model is not deployed by any inference provider.

Deux conséquences en découlent immédiatement. La pile de service compte plus que le modèle : le même checkpoint sur la même carte voit son débit plus que doubler lorsque vous changez de moteur d’inférence, donc tout modèle de coût qui utilise le chiffre de 0,30 surestime votre coût en auto-hébergement d’un facteur d’environ 2,3. Et l’utilisation est tout l’enjeu : une carte qui reste inactive ne bat pas une API facturée au caractère, à aucun prix, car la facture de l’API dépend de ce que vous dites, tandis que celle de la carte dépend du moment où vous l’avez achetée.

C'est pourquoi la version honnête de cette décision n'est pas « laquelle sonne mieux ». C'est « combien d'heures d'audio produisez-vous par mois, et le matériel est-il occupé ». En dessous du volume où une carte reste chargée, l'API l'emporte, et de loin. Au-dessus, sur du matériel que vous possédez déjà, le coût marginal du checkpoint par millième d'heure est identique à son coût pour la première heure — et c'est un avantage structurel qu'aucune grille tarifaire ne peut égaler.

La capacité qu'un point de terminaison hébergé ne vous vendra pas

C'est ici que la comparaison cesse d'être un miroir, car il y a une chose que VoxCPM2 fait et qu'Eleven v4 ne peut fondamentalement pas faire : vous pouvez le réentraîner. La fiche du modèle documente à la fois le SFT complet et le fine-tuning LoRA sur aussi peu que cinq à dix minutes d'audio, avec un script d'entraînement et une configuration fournis pour chacun.

Cela change la forme d'un programme vocal. Une API hébergée vous donne un modèle figé, plus tout ce que le fournisseur expose en matière de clonage — dix secondes d'audio de référence dans le cas d'Eleven v4 pour des clones instantanés, avec un niveau professionnel au-dessus. Un checkpoint ajustable par LoRA vous donne un modèle qui n'a jamais vu les données de quiconque et dont vous pouvez figer le comportement par version. Pour une voix de marque, un domaine réglementé ou une langue que le catalogue de voix du fournisseur gère mal, il s'agit d'une catégorie de solution différente, et non d'une solution moins chère.

Le compromis est explicite et mérite d'être énoncé : avec VoxCPM2, vous acceptez qu'aucun tiers n'ait jamais évalué le modèle, que les garanties de qualité sont celles que vous construisez et mesurez vous-même, et que la limite de séquence de 8 192 jetons ainsi que l'avertissement de la fiche — selon lequel la conception de la voix et le contrôle du style varient d'une exécution à l'autre et qu'une à trois générations sont recommandées — relèvent désormais de votre problème d'assurance qualité.

Ce qu'Eleven v4 vous apporte et que le checkpoint ne peut pas offrir

À l'inverse, les avantages du modèle hébergé sont ceux qui apparaissent sur un calendrier de publication plutôt que sur une fiche technique.

• Un classement mesuré — premier sur un tableau avec 1 674 échantillons à l’appui de l’estimation, et un intervalle d’environ ±19 points autour de celle-ci. Quoi que mesure ce tableau, il est indépendant des deux fournisseurs et c’est le seul signal de qualité provenant d’un tiers dans cette comparaison.

• Direction de la performance dans le texte — balises audio en ligne telles que [rires], [chuchote] et [dit avec colère avec un accent français], ainsi que des invites de diction en langage naturel et une prise en charge améliorée de l'alphabet phonétique international. Obtenir un changement d'humeur d'un modèle auto-hébergé nécessite une régénération ou un fine-tuning ; ici, c'est un jeton dans le script.

• Une couverture que vous n'avez pas à vérifier — plus de 90 langues contre les 30 de VoxCPM2, avec la réserve que la liste du checkpoint est explicite et nommée (y compris les dialectes chinois) tandis que le « plus de 90 » du fournisseur est un nombre sans liste.

• Aucune surface d’exploitation — pas de GPU, pas de pile de service, aucune dérive de version, et un tarif promotionnel de 0,022 $ pour 1 000 caractères jusqu’au 12 octobre, contre un tarif catalogue de 0,08 $ ensuite.

A screenshot of Artificial Analysis' Eleven v4 model page, titled Eleven v4 Quality Elo, Speed & Price Analysis, credited to ElevenLabs and the ElevenLabs family with an Elo of 1318.77. The page presents Quality, Pricing and 1M Throughput views over the Provider Voice Arena Preference Elo, and the model selector reads '27 of 96 models'.

Ni l’un ni l’autre n’est à nous, et c’est là tout l’intérêt de cette section.

OrcaRouter n'héberge aucun des deux modèles. Il n'y a pas de point de terminaison ElevenLabs ni de point de terminaison VoxCPM2 dans notre catalogue, et la réponse honnête en matière de routage est qu'Eleven v4 est accessible via l'API propre d'ElevenLabs, tandis que VoxCPM2 est quelque chose que vous déployez sur votre propre matériel. Nous n'allons pas laisser entendre le contraire pour rendre une comparaison plus nette.

Là où une clé unique aide vraiment, c'est pour la décision qui précède la décision. Si les discussions sur l'auto-hébergement s'enlisent, c'est que l'alternative n'est jamais évaluée : une API, c'est un seul appel, tandis qu'un checkpoint, c'est une pile de service à part entière ; l'API l'emporte donc par défaut plutôt que par calcul. Ce qu'apporte OrcaRouter, c'est que la moitié hébergée de cette comparaison est peu coûteuse à tester — plus de 200 modèles derrière une seule clé API, avec les prix catalogue des fournisseurs répercutés à 0 % de marge, de sorte que l'option hébergée est évaluée à son tarif réel plutôt qu'estimé, avec un basculement automatique en cas de défaillance si vous placez un candidat derrière un chemin en production avant même d'avoir fini de décider.

Comment décider, en une seule passe

Choisissez Eleven v4 si la voix doit être bonne du premier coup et que vous voulez que ce soit fait cette semaine. Vous obtenez la première place d’un classement indépendant, une syntaxe de direction documentée, le plus grand nombre de langues documenté dans cette comparaison, et zéro infrastructure. Vous payez 0,08 $ pour 1 000 caractères à partir du 13 octobre, et vous acceptez de ne pas pouvoir le réentraîner, l’épingler à une version, ni conserver l’audio sur votre propre matériel.

Choisissez VoxCPM2 si le modèle doit être le vôtre. Apache 2.0, 2 milliards de paramètres pour environ 8 Go de VRAM, une sortie en 48 kHz sans suréchantillonneur dans la chaîne, et une voie de fine-tuning qui tourne sur cinq à dix minutes d'audio — ce sont des capacités qu'un endpoint hébergé n'offre à aucun prix, et l'absence d'une ligne d'arène est le prix à payer. Mesurez les chiffres de débit sur votre propre carte avant de vous engager, car les facteurs temps réel de 0,30 et 0,13 sont les mesures de la fiche du modèle elle-même et votre pile de service ne les reproduira pas exactement.

Et si la réponse honnête est que vous ne connaissez pas votre volume audio mensuel, c'est le chiffre qu'il faut aller chercher. C'est lui qui décide de cette comparaison. Aucun des deux tableaux de bord ne vous le dira.