Eine Hero-Karte für „Eleven v4 Tops the Voice Arena": eine Rangliste mit ElevenLabs Eleven v4 auf Platz 1 und Elo 1.319, Cartesia Sonic 3.6 auf Platz 2 und Elo 1.276, Google Gemini 3.8 Flash TTS auf Platz 3 und Elo 1.267, ElevenLabs Eleven v3 auf Platz 18 und Elo 1.169 sowie ein Ribbon mit der Aufschrift „72 % Rabatt bis zum 12. Oktober". Fußzeile: „Anbieter Voice Arena, laut Artificial Analysis, Sept. 2026." Das OrcaRouter-Logo befindet sich in der unteren rechten Ecke.
Guides & Insights

Eleven v4 führt die Voice Arena an: Was das neue Flaggschiff von ElevenLabs tatsächlich gewonnen hat

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

ElevenLabs Eleven v4 erschien am 28. September und stieg direkt an die Spitze der Provider Voice Arena von Artificial Analysis auf, mit einem Elo von 1.319 – 43 Punkte Vorsprung vor Cartesia Sonic 3.6 bei 1.276 und 52 Punkte Vorsprung vor Google Gemini 3.8 Flash TTS bei 1.267. Es ist außerdem mit 80,00 $ pro Million Zeichen auf derselben Rangliste das teuerste Modell in den Top Ten. Und in der zweiten Arena – der, die aus geklonten Stimmen statt aus den eigenen Stimmensets der einzelnen Anbieter aufgebaut ist – gewinnt es überhaupt nicht: Es belegt den zweiten Platz, hinter einem Modell, das ein Viertel so viel kostet. Beides ist wahr, und der nützliche Teil dieses Launches besteht darin, herauszufinden, welche der beiden auf deinen Anwendungsfall zutrifft.

Was wurde am 28. September tatsächlich veröffentlicht?

ElevenLabs hat zwei Modelle allgemein verfügbar gemacht, nicht nur eines. ElevenLabs Eleven v4 ist das Flaggschiff-Synthesemodell – das Unternehmen nennt es sein emotionalstes, und seine Dokumentation legt die Eingabeobergrenze auf 10.000 Zeichen pro Anfrage und die Sprachabdeckung auf über 90 fest. ElevenLabs Eleven v4 Turbo ist das Geschwistermodell mit niedriger Latenz: dieselben über 90 Sprachen, eine Obergrenze von 10.000 Zeichen und Unterstützung für die Inline-Audio-Tags, mit denen Sie eine Sprechanweisung direkt in das Skript schreiben können – ein Lachen, ein Flüstern, ein Brummen in der Leitung. Beide sind ab dem ersten Tag über die Agent-, Kreativ- und API-Oberflächen des Unternehmens live, was ein schnellerer Rollout ist, als ihn die v3-Generation bekam.

Die Ankündigungsseite ist der Ort, an dem die Funktionsliste steht, und bemerkenswerterweise nicht die Preisgestaltung. ElevenLabs beschreibt eine neue Architektur, einen besseren Umgang mit Ton, Tempo und Charakter, zuverlässigeren Dialog mit mehreren Sprechern bei stabiler Sprecheridentität, verbesserte Eingabe von IPA-Phonemen und sofortige Stimmklone, die aus zehn Sekunden Audio erstellt werden, neben der bestehenden professionellen Klon-Stufe. Die einzige Zahl darauf ist eine Behauptung über Hörer: Der Anbieter sagt, Blindvergleiche hätten v4 in ungefähr drei Viertel der Fälle bevorzugt. Das ist eine Anbieterangabe, nicht reproduziert, und sie sollte neben den unten stehenden Board-Zahlen gelesen werden, nicht an deren Stelle.

Wo die Preisgestaltung tatsächlich steht – die API-Preisseite –, ist das gewichtigere Dokument, und darauf wird weiter unten eingegangen. Kurz gesagt: Dieser Launch ist keine Preiserhöhung.

Zwei Boards, zwei unterschiedliche Antworten

Artificial Analysis betreibt zwei Spracharenen, und sie sind keine Varianten voneinander. Bei Provider Voice vergleichen Zuhörer die eigenen Stimmen jedes Anbieters. Controlled Voice klont für jeden Teilnehmer dieselben acht Stimmen – vier US-amerikanische, vier britische –, sodass der Sprecher konstant bleibt und nur das Modell variiert. Ein Modell mit einem großartigen Standard-Stimmenensemble kann die erste gewinnen und die zweite verlieren. Eleven v4 macht genau das.

• Provider Voice, Eleven v4 — Rang 1, Elo 1.319, 80,00 $ pro Million Zeichen, 1.674 Samples, acht Arena-Stimmen, September 2026

• Anbieter-Stimme, Cartesia Sonic 3.6 — Rang 2, Elo 1.276, 49,00 $

• Anbieter-Stimme, Google Gemini 3.8 Flash TTS — Rang 3, Elo 1.267, 16,50 $

• Anbieter-Stimme, das vorherige Flaggschiff ElevenLabs Eleven v3 – Rang 18, Elo 1.169, 100,00 $

• Kontrollierte Stimme, Alibaba Qwen-Audio-3.1-TTS-Plus — Rang 1, Elo 1.178

• Controlled Voice, Eleven v4 — Rang 2, Elo 1,157, 80,00 $

• Kontrollierte Stimme, Cartesia Sonic 3.6 — Rang 4, Elo 1.138

• Kontrollierte Stimme, ElevenLabs Eleven v3 — Rang 7, Elo 1.073

• Kontrollierte Stimme, Google Gemini 3.8 Flash TTS — Rang 13, Elo 1.048

• Bester Open-Weights-Eintrag auf Provider Voice — Breeze TTS 2, Elo 1.206, 34,00 $

A single-column scoreboard card for ElevenLabs Eleven v4 with six rows: 'Provider Voice rank: 1 (Elo 1,319)', 'Controlled Voice rank: 2 (Elo 1,157)', 'Board price: $80.00 per 1M characters', 'Rate card: $0.022 per 1K characters until Oct 12', 'Languages and cap: 90-plus, 10,000 characters', 'Latency: not stated for v4 itself'. Footer: 'Elo and board prices per Artificial Analysis; rate card and specs vendor-documented.'

Der Generationssprung ist die Schlagzeile für alle, die bereits ElevenLabs nutzen: Gegenüber seinem eigenen Vorgänger auf demselben Board gewinnt Eleven v4 150 Elo-Punkte unter Provider Voice und 84 unter Controlled Voice. Das ist ein Generationswechsel, kein bloßes Tuning, und die Verbesserung ist auf dem Board größer, auf dem der Anbieter die Stimmen auswählen darf – was die ehrliche Art ist zu sagen, dass seine neue Standardbesetzung ein echter Teil des Zugewinns ist.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing ElevenLabs Eleven v4 first at Elo 1,319 with $80.0 per 1M chars, 1,674 samples and a -19/19 confidence interval, Cartesia Sonic 3.6 second at Elo 1,276 and $49.0, Google Gemini 3.8 Flash TTS third at Elo 1,267 and $16.5, and ElevenLabs Eleven v3 eighteenth at Elo 1,169 and $100.0, under columns for samples, arena voices, release month and API pricing.

Das Aussprache-Board, das wir nicht beziffern können

Artificial Analysis hat tatsächlich einen Abschnitt zur Pronunciation Robustness, und es lohnt sich, ihn ordentlich zu beschreiben, denn die kursierende Ranglisten-Zusammenfassung beschreibt Eleven v4 als an der Spitze stehend. Das Board misst den Anteil der hervorgehobenen Textabschnitte, die Reviewer als korrekt ausgesprochen beurteilten, mit bis zu drei Reviewern pro Clip, und die Prompts werden exakt wie geschrieben übermittelt – keine Zahlenerweiterung, keine Textnormalisierung. Es ist in Unterkategorien gegliedert, und der Sinn des Designs ist, dass ein Modell, das „Dr.“ oder „$4.50“ vor dem Sprechen stillschweigend umschreibt, absichtlich schlecht abschneidet.

Was das Board – in der Darstellung, die wir lesen konnten – nicht veröffentlicht, ist eine zitierfähige numerische Bewertung pro Modell. Es gibt dort also keine Zahl, die man für Eleven v4 anführen könnte, und der Elo von 1.319 gehört zur Arena-Präferenz – wie gut Hörer die Stimme fanden –, nicht zur Aussprachegenauigkeit. Wenn Sie die beiden vermengt sehen, dann ist das die Vermengung. Die belastbare Aussage aus diesem Launch ist die mit den Zahlen: Platz eins bei Provider Voice mit 1.319, Platz zwei bei Controlled Voice mit 1.157.

Der Einführungsrabatt ist die eigentliche Neuigkeit für deine Rechnung

ElevenLabs hat die Preise für die neuen Modelle gleichzeitig mit ihrer Veröffentlichung neu festgelegt, und der Rabatt ist groß genug, um allein dadurch eine Kaufentscheidung zu verändern. Auf der API-Preisseite wird Eleven v4 mit 0,022 $ pro tausend Zeichen gegenüber einem angegebenen Listenpreis von 0,08 $ geführt – eine Reduzierung um 72 % –, und Eleven v4 Turbo wird mit 0,011 $ gegenüber 0,04 $ geführt. Beide haben dasselbe Zeitfenster: Die Aktion läuft bis zum 12. Oktober. Danach werden die Preise zurückgesetzt, und der zurückgesetzte v4-Preis ist doppelt so hoch wie das, was ElevenLabs' eigenes v3 heute mit 0,08 $ kostet. Planen Sie mit dem Preis nach der Aktion, nicht mit dem Aktionspreis.

Die Preisanpassung verschiebt zudem v4s Position gegenüber dem Feld auf Zeichenbasis, was die Arena-Normalisierung bereits mit 80,00 $ pro Million zeigt. Sonic 3.6 liegt dort bei 49,00 $, Breeze TTS 2 bei 34,00 $, Qwen-Audio-3.0-TTS-Plus bei 19,30 $ und Gemini 3.8 Flash TTS bei 16,50 $. Zum Aktionspreis unterbietet Eleven v4 mit 22 $ pro Million Sonic 3.6 deutlich. Zum Listenpreis ist es mit großem Abstand die teuerste Stimme im Feld. Wer ein Budget für Q1 aufstellt, sollte sich die zweite Zahl ansehen.

A screenshot of ElevenLabs' API pricing page, captured in English, showing the Eleven v4 row at $0.022 per 1K characters with a struck-through $0.08 and a '72% off until Oct 12' badge, and the Eleven v4 Turbo row at $0.011 with a struck-through $0.04, alongside the v3 row at $0.08 and the Eleven v3 Conversational row at $0.04.

Ein durchgerechneter Monat macht die Preisspanne konkret. Bei fünf Millionen Zeichen – ein mittelgroßes Produkt, das ungefähr hundert Stunden Sprachmaterial verarbeitet – kostet Eleven v4 während des Zeitfensters 110 $. Beim zurückgesetzten Preis von 0,08 $ kostet es 400 $. Sonic 3.6 kostet 245 $. Gemini 3.8 Flash TTS kostet 82,50 $. Derselbe Monat auf dem eigenen v3 von ElevenLabs kostet ebenfalls 400 $, was die merkwürdige Tatsache hinter dieser Markteinführung ist: In den nächsten zwei Wochen ist das neue Flaggschiff günstiger als das Modell, das es ersetzt, und an dem Tag, an dem das Zeitfenster endet, ist es nicht mehr günstiger, sondern nur noch besser.

Die Latenzangabe stammt vom Anbieter und ist tarifabhängig.

ElevenLabs veröffentlicht Latenzwerte pro Stufe, nicht pro Modellfamilie, und es handelt sich um Messungen des Unternehmens selbst und nicht um unabhängige Erhebungen. Eleven v4 Turbo wird mit etwa 100 ms medianer Inferenz und rund 150 ms medianer Zeit bis zur ersten Sprachausgabe angegeben, gemessen im September 2026. Eleven v3 Conversational wird mit etwa 280 ms angegeben, die älteren Flash- und Turbo-Stufen mit etwa 75 ms. Die Dokumentation veröffentlicht keinen entsprechenden Wert für Eleven v4 selbst, also die Stufe, die man haben möchte, wenn man einen Echtzeit-Agenten entwickelt und ein Datenblatt liest, statt zu testen.

Cartesia beansprucht für Sonic eine Latenz von unter 90 ms und gibt an, dass es bei der Natürlichkeit den ersten Platz belegt, mit Voice-Cloning aus zehn Sekunden Audio, benutzerdefinierten Aussprachewörterbüchern und einem Compliance-Paket, das HIPAA, SOC 2 Type 2, DSGVO und PCI abdeckt. Das sind die eigenen Angaben des Anbieters auf seiner eigenen Produktseite — dieselbe Kategorie von Belegen wie die Latenzstufen-Zahlen von ElevenLabs und nicht gleichzusetzen mit dem Arena-Elo. Direkt vergleichbar sind die beiden Anbieter nur in den Ranglisten.

Was das für Sie bedeutet, und wie Sie es ausprobieren

Wenn Sie eine Stimme für ein Produkt auswählen, bei dem die Standardbesetzung das ist, was Ihre Nutzer hören, dann ist das Ergebnis von Provider Voice das, worauf es ankommt, und Eleven v4 hat es gerade für sich entschieden – mit einem Rabatt für zwei Wochen. Wenn Sie die Stimme einer bestimmten Person klonen und jedes Kandidatenmodell aufgefordert wird, dieselben acht Sprecher zu reproduzieren, dann ist das Controlled Voice Board das, worauf es ankommt, und Eleven v4 liegt auf Platz zwei – 21 Elo hinter dem Spitzenreiter und zum Listenpreis mehr als viermal so teuer pro Zeichen. Keines der beiden Ergebnisse ist falsch; sie sind Antworten auf unterschiedliche Fragen, und beim zweiten handelt es sich um die Frage, die der Großteil der produktiven Voice-Cloning-Arbeit tatsächlich stellt.

OrcaRouter hostet weder ElevenLabs, Cartesia noch einen der anderen Anbieter auf diesen Boards, daher gibt es hier nichts, was über uns laufen würde, und wir werden auch nichts anderes implizieren. Was wir anbieten, ist die umgebende Infrastruktur, falls Ihr Sprach-Stack am Ende mehrere Anbieter umspannt: ein API-Schlüssel für über 200 Modelle, bei dem die Listenpreise der Anbieter mit 0 % Aufschlag durchgereicht werden, sodass eine Preissenkung eines Anbieters – einschließlich eines Aktionszeitraums wie diesem – bei uns noch am selben Tag live ist und nicht erst zum nächsten Abrechnungszyklus. Wo ein Sprachpfad produktionskritisch ist, wechselt ein automatisches Failover zu einem intakten Upstream, sobald einer beeinträchtigt ist, was der praktische Weg ist, einen brandneuen Endpunkt zu testen, ohne eine Veröffentlichung darauf zu verwetten.

Der Termin, den Sie sich vormerken sollten, ist der 12. Oktober. Dann ist Eleven v4 nicht mehr die günstigste gute Stimme auf dem Markt, sondern die teuerste, und jeder Vergleich, der diese Woche geschrieben wird und 22 $ pro Million nennt, ohne darauf hinzuweisen, ist ein Vergleich, den Sie in drei Wochen erneut durchführen sollten.