
Eleven v4 vs. Cartesia Sonic 3.6: Eine 43-Punkte-Elo-Lücke gegenüber einer um 39 % günstigeren Stimme
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 982 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 195 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1189 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
ElevenLabs Eleven v4 liegt 43 Elo-Punkte über Cartesia Sonic 3.6 in der Provider Voice Arena von Artificial Analysis – 1.319 zu 1.276 – und gewinnt auch das Controlled Voice Board, mit Platz zwei gegenüber Platz vier von Sonic 3.6. Beim Preis verliert es mit großem Abstand in die andere Richtung: 80,00 $ pro Million Zeichen gegenüber 49,00 $ und etwa das Neunfache des Pro-Zeichen-Preises auf den eigenen Preislisten der Anbieter während des Markteinführungszeitraums. Dies ist eines der seltenen Duelle, bei denen der Punktestand eindeutig ist und die Entscheidung trotzdem nicht, weil die beiden Modelle nicht wirklich um dieselbe Aufgabe konkurrieren.

Was die einzelnen Modelle sind, jeweils in einem Absatz
ElevenLabs Eleven v4 wurde am 28. September als Flaggschiff-Sprachsynthesemodell des Unternehmens veröffentlicht, zusammen mit Eleven v4 Turbo. Die Dokumentation nennt über 90 Sprachen, eine Eingabebegrenzung von 10.000 Zeichen pro Anfrage, Multi-Speaker-Dialoge mit stabiler Sprecheridentität, verbesserte IPA-Phonemunterstützung und Inline-Anweisungen, mit denen Sie die Sprechweise direkt in das Skript schreiben können. Voice-Cloning ist ab zehn Sekunden Audio für Instant-Clones möglich, wobei darüber eine professionelle Stufe verfügbar ist.
Cartesia Sonic 3.6 ist die aktuelle Version einer Modellreihe, die Cartesia auf Geschwindigkeit und Natürlichkeit ausrichtet. Auf der eigenen Produktseite wird es als schnellstes und natürlichstes Text-to-Speech-Modell bezeichnet; dort werden eine Latenz von unter 90 ms, native Mehrsprachigkeit in 44 Sprachen, Voice Cloning aus zehn Sekunden Audio, benutzerdefinierte Aussprachewörterbücher und ein Compliance-Set mit HIPAA, SOC 2 Type 2, DSGVO und PCI angegeben. Beide Anbieter veröffentlichen Latenzwerte für ihre eigenen Modelle; keine der beiden Angaben ist unabhängig überprüft, und sie werden nicht auf dieselbe Weise gemessen.
Die Anzeigetafel, Dimension für Dimension
• Blindpräferenz, eigene Stimmen jedes Anbieters — Eleven v4 Rang 1, Elo 1.319 vs. Sonic 3.6 Rang 2, Elo 1.276. Ein Abstand von 43 Punkten.
• Blinde Präferenz, gematchte geklonte Stimmen — Eleven v4 Rang 2, Elo 1.157 vs. Sonic 3.6 Rang 4, Elo 1.138. Eine Lücke von 19 Punkten, enger als die erste.
• Arena-Preisnormalisierung, pro Million Zeichen — Eleven v4 80,00 $ vs. Sonic 3.6 49,00 $. Sonic ist 39 % günstiger, gemessen am gemeinsamen Nenner des Boards.
• Anbieter-Preisliste, pro tausend Zeichen — Eleven v4 0,022 $ Aktionspreis, 0,08 $ nach dem 12. Oktober vs. Sonic 3.6 0,049 $. Sonic ist 39 % günstiger, sobald die Aktion endet.
• Sprachabdeckung, vom Anbieter dokumentiert — Eleven v4 über 90 gegenüber Sonic 3.6 44. Etwa doppelt so viele.
• Eingabelimit pro Anfrage — Eleven v4 10.000 Zeichen vs. Sonic 3.6 nicht auf der Produktseite angegeben.
• Latenz, laut Herstellerangabe — Eleven v4 Turbo etwa 150 ms Median bis zur ersten Sprachausgabe vs. Sonic 3.6 unter 90 ms. Wieder einmal unterschiedliche Tests.
• Voice-Cloning – beide aus zehn Sekunden Audio, beide mit einem höheren Professional-Tarif.
• Aufzählungssteuerungen — Eleven v4 dokumentiert IPA-Phonem-Eingabe und eine professionelle Clone-Stufe; Sonic 3.6 dokumentiert benutzerdefinierte Aussprachewörterbücher.
• Compliance-Status — Sonic 3.6 nennt HIPAA, SOC 2 Type 2, GDPR und PCI. ElevenLabs gibt seine Compliance getrennt von der Modellseite an und stellt keine entsprechende Liste neben v4.

Zwei dieser Zeilen sind diejenigen, die über echte Projekte entscheiden. Der Elo-Abstand beträgt 43 Punkte auf dem Vendor-Voice-Board und 19 auf dem Cloned-Voice-Board — der Abstand der Sonic-Linie verringert sich um mehr als die Hälfte, wenn die Sprecher konstant gehalten werden. Das ist die Signatur eines Modells, dessen Tuning wettbewerbsfähig ist, dessen Standard-Stimmenbesetzung aber nicht – und sie verrät dir, dass Sonics Problem in diesem Matchup die Präsentation und nicht die Synthesequalität ist.
Warum der Preisunterschied kleiner ist, als er aussieht
Der Preisvergleich in der Überschrift ist in beide Richtungen irreführend. Die 0,022 $ pro tausend Zeichen für Eleven v4 sind ein Aktionspreis mit Ablaufdatum 12. Oktober; der Wert, der über dieses Zeitfenster hinaus Bestand hat, beträgt 0,08 $, was mehr als 60 % über der Preisliste von Sonic 3.6 liegt. Doch die Arena-Normalisierung kümmert sich nicht um die Aktion: Sie bepreist die Modelle zu ihren Listenpreisen und kommt auf 80,00 $ gegenüber 49,00 $ – das ist der Vergleich, der auch im November noch stimmen wird.
Es gibt einen zweiten Haken. Cartesia veröffentlicht auf der eigenen Produktseite keinen Preis pro Zeichen, daher stammt die Zahl von $0.049 aus der Arena-Normalisierung und nicht vom Anbieter, und die beiden Messwerte stimmen möglicherweise nicht exakt überein — die Normalisierung trifft Annahmen darüber, wie ein Anbieter abrechnet. Betrachten Sie die Reihenfolge als verlässlich und die genauen Prozentsätze als ungefähr.
Ein durchgerechneter Monat mit fünf Millionen Zeichen: Eleven v4 kostet zum Aktionspreis 110 US-Dollar und ab dem 12. Oktober 400 US-Dollar. Sonic 3.6 kostet 245 US-Dollar. In den nächsten zwei Wochen kostet Eleven v4 also weniger als die Hälfte von Sonic, danach aber 63 % mehr. Wer heute einen Beschaffungsvergleich schreibt und ihn nächsten Monat verschickt, wird das umgekehrt darstellen, wenn er nicht angibt, welchen Tarif er verwendet hat.
Der Abschnitt, in dem Sonic 3.6 die richtige Antwort ist
Es gibt Produktions-Voice-Workloads, bei denen die Arena-Boards nicht messen, worauf es ankommt, und Sonic 3.6 ist genau dafür gebaut.
Echtzeit-Konversationsagenten sind der eindeutigste Fall. Eine Latenz unter 90 ms ist bei einem Telefonagenten keine Marketingzahl; sie ist der Unterschied, ob sich eine Unterbrechung als bearbeitet anfühlt oder wie ein abgebrochener Anruf, und ElevenLabs veröffentlicht für Eleven v4 selbst keine vergleichbare Zahl – nur für die Turbo-Stufe mit etwa 150 ms Median bis zur ersten Sprachausgabe. Wenn das Socket-Budget deines Agenten knapp ist, sind die 43 Elo-Punkte für dich möglicherweise weniger wert als die Millisekunden, und deine eigenen Barge-in-Tests werden das schneller klären als jede Rangliste.
Regulierte Bereitstellung ist der zweite Punkt. Cartesia nennt HIPAA, SOC 2 Type 2, DSGVO und PCI auf der Produktseite. Eine Compliance-Liste ist kein Elo-Wert und kann nicht durch einen solchen ersetzt werden; wenn ein Prüfer aus dem Gesundheitswesen oder dem Zahlungsverkehr in Ihrem Freigabepfad ist, überwiegt diese Zeile der Anzeigetafel die anderen neun.

Deterministische Aussprache ist die dritte, und sie ist subtiler. Die dokumentierte IPA-Phonemeingabe von Eleven v4 ist eine Stärke, aber die benutzerdefinierten Aussprachewörterbücher von Sonic 3.6 sind der Workflow, den Teams mit großen Vokabularen an Produktnamen in der Regel bereits aufgebaut haben. Ein Wörterbuch zu portieren ist echte Arbeit; das Modell, das das Artefakt nutzt, das Sie besitzen, hat einen Vorsprung.
Wo Eleven v4 einfach das bessere Modell ist
Nach alledem messen die Boards etwas, und Eleven v4 hat beide gewonnen. Bei Provider Voice führt es mit 43 Punkten vor Sonic 3.6, mit 1.674 Samples hinter der Schätzung, und das vorherige Flaggschiff — ElevenLabs Eleven v3 bei 1.169 — liegt 107 Punkte hinter Sonic 3.6, was bedeutet, dass ElevenLabs in einer Generation eine echte Lücke geschlossen hat, statt einen Vorsprung zu verteidigen.
Die Anzahl der Sprachen ist der zweite eindeutige Vorteil. Über 90 gegenüber 44 ist ungefähr doppelt so viel, und für ein Produkt, das über Englisch und eine Handvoll europäischer Sprachen hinaus ausgeliefert wird, ist das eine Frage der Abdeckung und nicht der Qualität — Sonic 3.6 hat für einige Ihrer Locales möglicherweise überhaupt keine Stimme. Und die Handhabung von Dialogen mit mehreren Sprechern plus Inline-Vortragsanweisungen sind ein echter Unterschied in den Fähigkeiten: Ein Lachen in das Skript zu schreiben, ist ein Workflow, den Sonic 3.6 nicht dokumentiert, und diesen Effekt bei einem Modell ohne diese Funktion zu reproduzieren, bedeutet Nachbearbeitung oder einen zweiten Take, was mehr kostet, als der Elo-Abstand vermuten lässt.
Eines von beiden ausführen und der Teil, bei dem wir nicht helfen können
OrcaRouter hostet keines dieser beiden Modelle. ElevenLabs und Cartesia sind nicht in unserem Katalog, daher lässt sich nichts in diesem Vergleich über uns aufrufen, und die ehrliche Antwort auf „Wie bekomme ich es auf OrcaRouter?“ lautet: Gar nicht – Sie wenden sich an den Anbieter. Was wir abdecken, ist der Fall, dass ein Speech-Stack sich letztlich über mehrere Anbieter statt nur einen erstreckt: ein einziger API-Schlüssel über mehr als 200 Modelle hinweg, wobei die Listenpreise der Anbieter mit 0 % Aufschlag durchgereicht werden, sodass eine Preisänderung eines Anbieters bei uns am selben Tag live ist, an dem sie wirksam wird. Bei einer Entscheidung, die davon abhängt, ob Sie 110 $ oder 400 $ für die Zeichen desselben Monats zahlen, ist dieses Timing keine Kleinigkeit.
Wenn ein Voice-Pfad kundenorientiert ist und nicht ausfallen darf, verlagert automatisches Failover den Datenverkehr auf einen intakten Upstream, wenn einer an Leistung verliert. Das ist das Muster, das ein zweiwöchiges Aktionsfenster lohnenswert macht: Sie können die Produktion zwei Wochen lang auf das günstigere Modell ausrichten, ohne die Integration umzuschreiben, und wieder zurückwechseln, wenn der Tarif zurückgeht.
Wer sollte wechseln, und wer sollte warten
Wechseln Sie zu Eleven v4, wenn Ihr Produkt danach beurteilt wird, wie es klingt, wenn Sie in mehr als ein paar Dutzend Sprachen ausliefern oder wenn Ihre Nutzer die Stimme hören, die der Anbieter für sie ausgewählt hat – die letzte Gruppe ist genau die, die der Provider Voice board repräsentiert, und die Lücke dort ist die größte aller Zeilen.
Bleiben Sie bei Sonic 3.6, wenn Sie Echtzeit-Konversation unter einem Latenzbudget betreiben, wenn ein Compliance-Prüfer Ihren Stack freigibt oder wenn Sie ein Aussprachewörterbuch haben, dessen Neuerstellung Sie sich nicht leisten können. In diesen drei Punkten liegt Sonic nicht zurück; es ist die einzige Option mit einer veröffentlichten Antwort.
Moment, in beiden Fällen, wenn deine Entscheidung vom Preis abhängt. In zwei Wochen ändert sich die Preisliste von Eleven v4 um fast das Vierfache, die von Sonic 3.6 nicht, und ein heute verfasster Vergleich wird Mitte Oktober falsch dastehen. Die Elo-Reihenfolge wird weiterhin gelten. Das Geld nicht.
