Eine generierte Hero-Karte für ElevenLabs Eleven v4 vs. VoxCPM2 mit zwei Panels: ElevenLabs Eleven v4 als gehosteter Endpunkt bei Elo 1.319, Rang 1 und 80,00 $ pro 1 Mio. Zeichen; VoxCPM2 als Apache-2.0-Checkpoint mit 2B-Parametern, 48-kHz-Ausgabe und ohne Arena-Zeile. Fußzeile: „Rang und Preis von Eleven v4 laut Artificial Analysis, September 2026; VoxCPM2-Spezifikationen laut der OpenBMB-Modellkarte.“ Das OrcaRouter-Logo befindet sich in der unteren rechten Ecke.
Guides & Insights

Eleven v4 vs. VoxCPM2: Ein geranktes Modell gegen einen Checkpoint, den Sie nicht mieten können

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die nützlichste Tatsache in diesem Duell ist eine Zeile, die nicht existiert. ElevenLabs Eleven v4 belegt Rang 1 in Artificial Analysis' Provider Voice Arena mit einem Elo von 1.319 über 1.674 Auftritte hinweg, bei 80,00 $ pro Million Zeichen. VoxCPM2, der im April 2026 veröffentlichte OpenBMB-Checkpoint, taucht auf keiner der beiden Sprach-Bestenlisten auf — weder gelistet noch ungelistet, noch als Vorschau-Eintrag. Das ist kein Urteil über die Qualität. Es bedeutet: Welche Zahl auch immer Sie mit 1.319 vergleichen wollten, niemand hat sie ermittelt, und der Vergleich muss auf etwas anderem als Präferenz beruhen. Was bleibt, sind Eigentümerschaft, Fine-Tuning und eine Lizenzfrage, die sich bei einem gehosteten Endpunkt nicht stellen lässt.

Was jede Seite dir tatsächlich gibt

Dabei handelt es sich um unterschiedliche Produktklassen, und der Unterschied ist nicht kosmetischer Natur.

• Zugriff — Eleven v4 ist ein gehosteter Endpunkt, der über die eigene API von ElevenLabs erreicht wird, mit Abrechnung pro Zeichen. VoxCPM2 ist ein Checkpoint auf Hugging Face unter openbmb/VoxCPM2; Sie laden ihn herunter und führen ihn selbst aus, und es gibt keinen Erstanbieter-Endpunkt, den man aufrufen könnte.

• Lizenz — VoxCPM2 wird unter Apache 2.0 ausgeliefert, ausdrücklich kostenlos für die kommerzielle Nutzung. Eleven v4 ist eine kommerzielle API, deren Bedingungen die von ElevenLabs sind. Dieser Unterschied ist wichtig, wenn Ihre Rechtsabteilung fragt, ob Sie Gewichte fine-tunen, weiterverbreiten oder ausliefern dürfen; beim Checkpoint ist die Antwort schriftlich festgehalten und statisch.

• Größe und Hardware — VoxCPM2 hat 2 Mrd. Parameter auf einem MiniCPM-4-Backbone, und die Karte gibt rund 8 GB VRAM bei bfloat16 an, mit einer maximalen Sequenzlänge von 8.192 Tokens. ElevenLabs veröffentlicht keine Parameteranzahl für Eleven v4, und der Hardware-Fußabdruck eines gehosteten Modells ist nichts, das man selbst verwaltet.

• Ausgabekette – VoxCPM2 akzeptiert 16-kHz-Referenzaudio und gibt über die in AudioVAE V2 integrierte Superauflösung 48 kHz aus – ohne externen Upsampler im Signalweg. Host-TTS liefert Ihnen einen Stream, ganz gleich, wofür sich der Anbieter entschieden hat.

• Unabhängige Bewertung — Eleven v4 hat eine, und sie belegt den ersten Platz. VoxCPM2 hat keine. Fehlen ist keine niedrige Bewertung; es ist ein unbewertetes Modell, und die beiden sollten niemals im selben Satz erwähnt werden, als wäre das zweite eine Zahl.

A generated scoreboard comparing ElevenLabs Eleven v4 and VoxCPM2 across six dimensions: arena rank (1, Elo 1,319 against not on the board), price ($80.00 per 1M characters against no per-character rate), licence (vendor API terms against Apache 2.0 for commercial use), voice creation (clone from 10 s of audio against voice design and cloning), languages (90-plus against 30) and operations (none, it is hosted, against your own GPU at about 8 GB). Footer: 'Eleven v4 figures per Artificial Analysis and vendor docs; VoxCPM2 figures per the OpenBMB model card.' The OrcaRouter logo sits in the bottom-right corner.

Die Zahl, die das fehlende Elo ersetzt

Wenn du Präferenzen nicht vergleichen kannst, vergleiche das, was du berechnen kannst, und bei einem selbst gehosteten Modell ist das der Durchsatz. Die Modellkarte von VoxCPM2 nennt einen Echtzeitfaktor von etwa 0,30 in Standard-PyTorch auf einer RTX 4090, der unter Nano-VLLM auf etwa 0,13 sinkt. Der Echtzeitfaktor entspricht Sekunden Rechenzeit pro Sekunde Audio, diese beiden Werte bedeuten also, dass eine GPU-Stunde im ersten Fall ungefähr 3,3 Stunden fertig erzeugter Sprache liefert und im zweiten etwa 7,7 Stunden.

A screenshot of the Hugging Face model card for openbmb/VoxCPM2, tagged Text-to-Speech, VoxCPM, Safetensors, 30 languages, multilingual, voice-cloning, voice-design, diffusion and audio, with License: apache-2.0. The summary reads: 'VoxCPM2 is a tokenizer-free, diffusion autoregressive Text-to-Speech model - 2B parameters, 30 languages, 48kHz audio output, trained on over 2 million hours of multilingual speech data.' Highlights list 30-language multilingual input with no language tag, voice design from a natural-language description with no reference audio, controllable cloning from a short clip with optional style guidance, 48 kHz studio-quality output via AudioVAE V2's built-in super-resolution, context-aware synthesis, real-time streaming with an RTF as low as about 0.3 on an NVIDIA RTX 4090 and about 0.13 accelerated by Nano-VLLM, and an Apache-2.0 licence free for commercial use. The sidebar shows 341,299 downloads last month, 2B params, BF16, and a note under Inference Providers that the model is not deployed by any inference provider.

Zwei Konsequenzen ergeben sich unmittelbar. Der Serving-Stack ist wichtiger als das Modell: Derselbe Checkpoint auf derselben Karte liefert mehr als die doppelte Ausgabe, wenn man die Inferenz-Engine austauscht, sodass jedes Kostenmodell, das den Wert 0,30 verwendet, deine Self-Hosting-Kosten um den Faktor etwa 2,3 überschätzt. Und Auslastung ist das A und O: Eine Karte, die im Leerlauf liegt, schlägt eine API mit Abrechnung pro Zeichen zu keinem Preis, weil die Rechnung der API damit skaliert, was du sagst, während die Rechnung der Karte damit skaliert, wann du sie gekauft hast.

Deshalb ist die ehrliche Version dieser Entscheidung nicht „Was klingt besser?“, sondern „Wie viele Stunden Audio produzierst du pro Monat, und ist die Hardware ausgelastet?“. Unterhalb des Volumens, bei dem eine Karte geladen bleibt, gewinnt die API, und zwar deutlich. Darüber, auf Hardware, die du bereits besitzt, sind die Grenzkosten des Checkpoints pro Tausendstelstunde dieselben wie seine Kosten für die erste Stunde – und das ist ein struktureller Vorteil, den keine Preisliste erreichen kann.

Die Fähigkeit, die Ihnen ein gehosteter Endpunkt nicht verkaufen wird

Hier hört der Vergleich auf, ein Spiegelbild zu sein, denn es gibt eine Sache, die VoxCPM2 kann, die Eleven v4 grundsätzlich nicht kann: Man kann es neu trainieren. Die Modellkarte dokumentiert sowohl vollständiges SFT als auch LoRA-Fine-Tuning mit nur fünf bis zehn Minuten Audio, jeweils mit mitgeliefertem Trainingsskript und Konfiguration.

Das verändert die Form eines Voice-Programms. Eine gehostete API bietet Ihnen ein festes Modell plus die Klonmöglichkeiten, die der Anbieter freigibt – im Fall von Eleven v4 zehn Sekunden Referenzaudio für Instant-Clones, mit einer Professional-Stufe darüber. Ein LoRA-tunebarer Checkpoint liefert Ihnen ein Modell, das noch nie die Daten anderer gesehen hat und dessen Verhalten Sie per Version festlegen können. Für eine Markenstimme, eine regulierte Domäne oder eine Sprache, die die Stimmen des Anbieters schlecht abdecken, ist das eine andere Kategorie von Lösung, nicht eine billigere.

Der Trade-off ist eindeutig und es lohnt sich, ihn zu benennen: Mit VoxCPM2 akzeptieren Sie, dass keine dritte Partei das Modell jemals bewertet hat, dass Sie Qualitätsgarantien selbst aufbauen und messen müssen und dass das 8.192-Token-Sequenzlimit und die Warnung der Karte selbst – dass Voice-Design und Stilsteuerung von Durchlauf zu Durchlauf variieren und dass ein bis drei Generierungen empfohlen werden – jetzt Ihr QA-Problem sind.

Was Eleven v4 dir bietet, was der Checkpoint nicht kann

Umgekehrt sind die Vorteile des Hosted-Modells diejenigen, die eher auf einem Release-Kalender als auf einem Datenblatt auftauchen.

• Ein messbasiertes Ranking – Platz eins auf einer Rangliste, hinter der 1.674 Stichproben für die Schätzung stehen, mit einem Intervall von rund ±19 Punkten darum. Was auch immer diese Rangliste misst: Sie ist unabhängig von beiden Anbietern und das einzige Qualitätssignal von unabhängiger Seite in diesem Vergleich.

• Regieanweisungen im Text — Inline-Audio-Tags wie [laughs], [whispers] und [said angrily in French accent], plus natürlichsprachliche Sprechstil-Prompts und verbesserte Unterstützung für das Internationale Phonetische Alphabet. Bei einem selbstgehosteten Modell erfordert eine Stimmungsänderung eine Neugenerierung oder ein Fine-Tuning; hier ist es ein Token im Skript.

• Abdeckung, die Sie nicht überprüfen müssen — über 90 Sprachen gegenüber den 30 von VoxCPM2, mit dem Vorbehalt, dass die Liste des Checkpoints explizit und namentlich ist (einschließlich chinesischer Dialekte), während die „90-plus“ des Anbieters eine Zahl ohne Liste ist.

• Keine Ops-Oberfläche – keine GPU, kein Serving-Stack, kein Versions-Drift, und ein Aktionspreis von 0,022 $ pro 1.000 Zeichen bis zum 12. Oktober gegenüber einem Listenpreis von 0,08 $ danach.

A screenshot of Artificial Analysis' Eleven v4 model page, titled Eleven v4 Quality Elo, Speed & Price Analysis, credited to ElevenLabs and the ElevenLabs family with an Elo of 1318.77. The page presents Quality, Pricing and 1M Throughput views over the Provider Voice Arena Preference Elo, and the model selector reads '27 of 96 models'.

Keines von beiden gehört uns, und genau darum geht es in diesem Abschnitt.

OrcaRouter hostet keines der beiden Modelle. In unserem Katalog gibt es weder einen ElevenLabs-Endpunkt noch einen VoxCPM2-Endpunkt, und die ehrliche Routing-Antwort lautet, dass Eleven v4 über die eigene API von ElevenLabs erreicht wird, während VoxCPM2 etwas ist, das man selbst auf eigener Hardware deployt. Wir werden nichts anderes suggerieren, nur damit ein Vergleich ordentlicher aussieht.

Wo ein einzelner Schlüssel tatsächlich hilft, ist die Entscheidung vor der Entscheidung. Der Grund, warum Gespräche über Self-Hosting ins Stocken geraten, ist, dass die Alternative nie bewertet wird: Eine API ist ein einziger Aufruf und ein Checkpoint ist ein Serving-Stack, also gewinnt die API standardmäßig statt durch Rechnung. OrcaRouters Beitrag besteht darin, dass die gehostete Hälfte dieses Vergleichs günstig zu testen ist — über 200 Modelle hinter einem einzigen API-Schlüssel, wobei die Listenpreise der Anbieter weitergegeben werden zu 0 % Aufschlag, sodass die gehostete Option zu ihrem tatsächlichen Satz bewertet wird statt zu einem geschätzten, mit automatischem Failover, wenn Sie einen Kandidaten hinter einen Live-Pfad setzen, bevor Sie sich entschieden haben.

Wie man in einem Durchgang entscheidet

Nimm Eleven v4, wenn die Stimme beim ersten Take sitzen muss und du willst, dass es diese Woche erledigt wird. Du bekommst die Spitze eines unabhängigen Rankings, eine dokumentierte Syntax für Regieanweisungen, die höchste dokumentierte Sprachenanzahl in diesem Vergleich und keinerlei Infrastruktur. Ab dem 13. Oktober zahlst du 0,08 $ pro 1.000 Zeichen, und du akzeptierst, dass du es nicht neu trainieren, nicht an eine Version binden und das Audio nicht auf deiner eigenen Hardware behalten kannst.

Nimm VoxCPM2, wenn das Modell unbedingt deins sein muss. Apache 2.0, 2B Parameter auf etwa 8 GB VRAM, 48-kHz-Ausgabe ohne Upsampler in der Kette und ein Fine-Tuning-Pfad, der mit fünf bis zehn Minuten Audio auskommt – das sind Fähigkeiten, die ein gehosteter Endpunkt zu keinem Preis bietet, und das Fehlen einer Arena-Zeile ist der Preis dafür. Führe die Durchsatzmessungen auf deiner eigenen Karte durch, bevor du dich festlegst, denn die Echtzeitfaktoren 0,30 und 0,13 sind die Messungen der Modellkarte selbst, und dein Serving-Stack wird sie nicht exakt reproduzieren.

Und wenn die ehrliche Antwort ist, dass Sie Ihr monatliches Audiovolumen nicht kennen, dann ist das die Zahl, die Sie herausfinden müssen. Sie entscheidet diesen Vergleich. Keines der Boards wird Ihnen das sagen.