
Eleven v4 vs. VoxCPM2: Ein geranktes Modell gegen einen Checkpoint, den Sie nicht mieten können
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 982 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 197 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
Die nützlichste Tatsache in diesem Duell ist eine Zeile, die nicht existiert. ElevenLabs Eleven v4 belegt Rang 1 in Artificial Analysis' Provider Voice Arena mit einem Elo von 1.319 über 1.674 Auftritte hinweg, bei 80,00 $ pro Million Zeichen. VoxCPM2, der im April 2026 veröffentlichte OpenBMB-Checkpoint, taucht auf keiner der beiden Sprach-Bestenlisten auf — weder gelistet noch ungelistet, noch als Vorschau-Eintrag. Das ist kein Urteil über die Qualität. Es bedeutet: Welche Zahl auch immer Sie mit 1.319 vergleichen wollten, niemand hat sie ermittelt, und der Vergleich muss auf etwas anderem als Präferenz beruhen. Was bleibt, sind Eigentümerschaft, Fine-Tuning und eine Lizenzfrage, die sich bei einem gehosteten Endpunkt nicht stellen lässt.
Was jede Seite dir tatsächlich gibt
Dabei handelt es sich um unterschiedliche Produktklassen, und der Unterschied ist nicht kosmetischer Natur.
• Zugriff — Eleven v4 ist ein gehosteter Endpunkt, der über die eigene API von ElevenLabs erreicht wird, mit Abrechnung pro Zeichen. VoxCPM2 ist ein Checkpoint auf Hugging Face unter openbmb/VoxCPM2; Sie laden ihn herunter und führen ihn selbst aus, und es gibt keinen Erstanbieter-Endpunkt, den man aufrufen könnte.
• Lizenz — VoxCPM2 wird unter Apache 2.0 ausgeliefert, ausdrücklich kostenlos für die kommerzielle Nutzung. Eleven v4 ist eine kommerzielle API, deren Bedingungen die von ElevenLabs sind. Dieser Unterschied ist wichtig, wenn Ihre Rechtsabteilung fragt, ob Sie Gewichte fine-tunen, weiterverbreiten oder ausliefern dürfen; beim Checkpoint ist die Antwort schriftlich festgehalten und statisch.
• Größe und Hardware — VoxCPM2 hat 2 Mrd. Parameter auf einem MiniCPM-4-Backbone, und die Karte gibt rund 8 GB VRAM bei bfloat16 an, mit einer maximalen Sequenzlänge von 8.192 Tokens. ElevenLabs veröffentlicht keine Parameteranzahl für Eleven v4, und der Hardware-Fußabdruck eines gehosteten Modells ist nichts, das man selbst verwaltet.
• Ausgabekette – VoxCPM2 akzeptiert 16-kHz-Referenzaudio und gibt über die in AudioVAE V2 integrierte Superauflösung 48 kHz aus – ohne externen Upsampler im Signalweg. Host-TTS liefert Ihnen einen Stream, ganz gleich, wofür sich der Anbieter entschieden hat.
• Unabhängige Bewertung — Eleven v4 hat eine, und sie belegt den ersten Platz. VoxCPM2 hat keine. Fehlen ist keine niedrige Bewertung; es ist ein unbewertetes Modell, und die beiden sollten niemals im selben Satz erwähnt werden, als wäre das zweite eine Zahl.

Die Zahl, die das fehlende Elo ersetzt
Wenn du Präferenzen nicht vergleichen kannst, vergleiche das, was du berechnen kannst, und bei einem selbst gehosteten Modell ist das der Durchsatz. Die Modellkarte von VoxCPM2 nennt einen Echtzeitfaktor von etwa 0,30 in Standard-PyTorch auf einer RTX 4090, der unter Nano-VLLM auf etwa 0,13 sinkt. Der Echtzeitfaktor entspricht Sekunden Rechenzeit pro Sekunde Audio, diese beiden Werte bedeuten also, dass eine GPU-Stunde im ersten Fall ungefähr 3,3 Stunden fertig erzeugter Sprache liefert und im zweiten etwa 7,7 Stunden.

Zwei Konsequenzen ergeben sich unmittelbar. Der Serving-Stack ist wichtiger als das Modell: Derselbe Checkpoint auf derselben Karte liefert mehr als die doppelte Ausgabe, wenn man die Inferenz-Engine austauscht, sodass jedes Kostenmodell, das den Wert 0,30 verwendet, deine Self-Hosting-Kosten um den Faktor etwa 2,3 überschätzt. Und Auslastung ist das A und O: Eine Karte, die im Leerlauf liegt, schlägt eine API mit Abrechnung pro Zeichen zu keinem Preis, weil die Rechnung der API damit skaliert, was du sagst, während die Rechnung der Karte damit skaliert, wann du sie gekauft hast.
Deshalb ist die ehrliche Version dieser Entscheidung nicht „Was klingt besser?“, sondern „Wie viele Stunden Audio produzierst du pro Monat, und ist die Hardware ausgelastet?“. Unterhalb des Volumens, bei dem eine Karte geladen bleibt, gewinnt die API, und zwar deutlich. Darüber, auf Hardware, die du bereits besitzt, sind die Grenzkosten des Checkpoints pro Tausendstelstunde dieselben wie seine Kosten für die erste Stunde – und das ist ein struktureller Vorteil, den keine Preisliste erreichen kann.
Die Fähigkeit, die Ihnen ein gehosteter Endpunkt nicht verkaufen wird
Hier hört der Vergleich auf, ein Spiegelbild zu sein, denn es gibt eine Sache, die VoxCPM2 kann, die Eleven v4 grundsätzlich nicht kann: Man kann es neu trainieren. Die Modellkarte dokumentiert sowohl vollständiges SFT als auch LoRA-Fine-Tuning mit nur fünf bis zehn Minuten Audio, jeweils mit mitgeliefertem Trainingsskript und Konfiguration.
Das verändert die Form eines Voice-Programms. Eine gehostete API bietet Ihnen ein festes Modell plus die Klonmöglichkeiten, die der Anbieter freigibt – im Fall von Eleven v4 zehn Sekunden Referenzaudio für Instant-Clones, mit einer Professional-Stufe darüber. Ein LoRA-tunebarer Checkpoint liefert Ihnen ein Modell, das noch nie die Daten anderer gesehen hat und dessen Verhalten Sie per Version festlegen können. Für eine Markenstimme, eine regulierte Domäne oder eine Sprache, die die Stimmen des Anbieters schlecht abdecken, ist das eine andere Kategorie von Lösung, nicht eine billigere.
Der Trade-off ist eindeutig und es lohnt sich, ihn zu benennen: Mit VoxCPM2 akzeptieren Sie, dass keine dritte Partei das Modell jemals bewertet hat, dass Sie Qualitätsgarantien selbst aufbauen und messen müssen und dass das 8.192-Token-Sequenzlimit und die Warnung der Karte selbst – dass Voice-Design und Stilsteuerung von Durchlauf zu Durchlauf variieren und dass ein bis drei Generierungen empfohlen werden – jetzt Ihr QA-Problem sind.
Was Eleven v4 dir bietet, was der Checkpoint nicht kann
Umgekehrt sind die Vorteile des Hosted-Modells diejenigen, die eher auf einem Release-Kalender als auf einem Datenblatt auftauchen.
• Ein messbasiertes Ranking – Platz eins auf einer Rangliste, hinter der 1.674 Stichproben für die Schätzung stehen, mit einem Intervall von rund ±19 Punkten darum. Was auch immer diese Rangliste misst: Sie ist unabhängig von beiden Anbietern und das einzige Qualitätssignal von unabhängiger Seite in diesem Vergleich.
• Regieanweisungen im Text — Inline-Audio-Tags wie [laughs], [whispers] und [said angrily in French accent], plus natürlichsprachliche Sprechstil-Prompts und verbesserte Unterstützung für das Internationale Phonetische Alphabet. Bei einem selbstgehosteten Modell erfordert eine Stimmungsänderung eine Neugenerierung oder ein Fine-Tuning; hier ist es ein Token im Skript.
• Abdeckung, die Sie nicht überprüfen müssen — über 90 Sprachen gegenüber den 30 von VoxCPM2, mit dem Vorbehalt, dass die Liste des Checkpoints explizit und namentlich ist (einschließlich chinesischer Dialekte), während die „90-plus“ des Anbieters eine Zahl ohne Liste ist.
• Keine Ops-Oberfläche – keine GPU, kein Serving-Stack, kein Versions-Drift, und ein Aktionspreis von 0,022 $ pro 1.000 Zeichen bis zum 12. Oktober gegenüber einem Listenpreis von 0,08 $ danach.

Keines von beiden gehört uns, und genau darum geht es in diesem Abschnitt.
OrcaRouter hostet keines der beiden Modelle. In unserem Katalog gibt es weder einen ElevenLabs-Endpunkt noch einen VoxCPM2-Endpunkt, und die ehrliche Routing-Antwort lautet, dass Eleven v4 über die eigene API von ElevenLabs erreicht wird, während VoxCPM2 etwas ist, das man selbst auf eigener Hardware deployt. Wir werden nichts anderes suggerieren, nur damit ein Vergleich ordentlicher aussieht.
Wo ein einzelner Schlüssel tatsächlich hilft, ist die Entscheidung vor der Entscheidung. Der Grund, warum Gespräche über Self-Hosting ins Stocken geraten, ist, dass die Alternative nie bewertet wird: Eine API ist ein einziger Aufruf und ein Checkpoint ist ein Serving-Stack, also gewinnt die API standardmäßig statt durch Rechnung. OrcaRouters Beitrag besteht darin, dass die gehostete Hälfte dieses Vergleichs günstig zu testen ist — über 200 Modelle hinter einem einzigen API-Schlüssel, wobei die Listenpreise der Anbieter weitergegeben werden zu 0 % Aufschlag, sodass die gehostete Option zu ihrem tatsächlichen Satz bewertet wird statt zu einem geschätzten, mit automatischem Failover, wenn Sie einen Kandidaten hinter einen Live-Pfad setzen, bevor Sie sich entschieden haben.
Wie man in einem Durchgang entscheidet
Nimm Eleven v4, wenn die Stimme beim ersten Take sitzen muss und du willst, dass es diese Woche erledigt wird. Du bekommst die Spitze eines unabhängigen Rankings, eine dokumentierte Syntax für Regieanweisungen, die höchste dokumentierte Sprachenanzahl in diesem Vergleich und keinerlei Infrastruktur. Ab dem 13. Oktober zahlst du 0,08 $ pro 1.000 Zeichen, und du akzeptierst, dass du es nicht neu trainieren, nicht an eine Version binden und das Audio nicht auf deiner eigenen Hardware behalten kannst.
Nimm VoxCPM2, wenn das Modell unbedingt deins sein muss. Apache 2.0, 2B Parameter auf etwa 8 GB VRAM, 48-kHz-Ausgabe ohne Upsampler in der Kette und ein Fine-Tuning-Pfad, der mit fünf bis zehn Minuten Audio auskommt – das sind Fähigkeiten, die ein gehosteter Endpunkt zu keinem Preis bietet, und das Fehlen einer Arena-Zeile ist der Preis dafür. Führe die Durchsatzmessungen auf deiner eigenen Karte durch, bevor du dich festlegst, denn die Echtzeitfaktoren 0,30 und 0,13 sind die Messungen der Modellkarte selbst, und dein Serving-Stack wird sie nicht exakt reproduzieren.
Und wenn die ehrliche Antwort ist, dass Sie Ihr monatliches Audiovolumen nicht kennen, dann ist das die Zahl, die Sie herausfinden müssen. Sie entscheidet diesen Vergleich. Keines der Boards wird Ihnen das sagen.
