Eine generierte Hero-Karte für ElevenLabs Eleven v4 vs. SpeechifyAI Simba 3.2 mit zwei Ergebniskarten: Eleven v4 mit Elo 1.319, Rang 1 und 80,00 $ pro 1 Mio. Zeichen; Simba 3.2 mit Elo 1.240, Rang 7 und 6,58 $ pro 1 Mio. Zeichen; mit der Bildunterschrift „79 Elo-Punkte bei etwa zwölfmal so hohem Preis“. Fußzeile: „Anbieter Voice Arena, laut Artificial Analysis, September 2026.“ Das OrcaRouter-Logo befindet sich in der unteren rechten Ecke.
Guides & Insights

Eleven v4 vs. Simba 3.2: Die 79-Punkte-Lücke, die zwölfmal so viel kostet

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

In der Provider Voice Arena von Artificial Analysis ElevenLabs Eleven v4 mit einem Elo von 1,319 auf Platz eins und SpeechifyAI Simba 3.2 mit 1,240 auf Platz sieben – 79 Punkte Unterschied, auf einem Board, auf dem die Top Ten kaum 113 Punkte umfassen. Die Preise liegen dagegen alles andere als nah beieinander: 80,00 $ pro Million Zeichen für das neue Flaggschiff von ElevenLabs, veröffentlicht am 28. September 2026, gegenüber 6,58 $ für Simba 3.2. Das ist ein Unterschied von etwa dem Zwölffachen und die größte Preis-Qualitäts-Diskrepanz zwischen zwei beliebigen Modellen in den Top Ten. Ob diese Diskrepanz ein Schnäppchen oder eine Falle ist, hängt ganz davon ab, welches der beiden Sie ersetzen.

Das Board, richtig gelesen

Die Zahlen, die man in eine Entscheidung mitnehmen sollte, sind nicht allein die beiden Schlagzeilenwerte. Der Rang auf einem Präferenzboard ist ein bewegliches Ziel; das Intervall um jede Schätzung sagt dir, wie viel an der Reihenfolge Signal ist.

• ElevenLabs Eleven v4 — Rang 1, Elo 1.319, ±19, 1.674 Auftritte, acht Arena-Stimmen, 80,00 $ pro Million Zeichen, veröffentlicht am 28. September 2026

• SpeechifyAI Simba 3.2 — Rang 7, Elo 1.240, ±14, 2.535 Einsätze, acht Arena-Stimmen, 6,58 $ pro Million Zeichen, veröffentlicht am 1. Juli 2026

• SpeechifyAI Simba 3.0 — Elo 1.123, 6,58 $ pro Million Zeichen, veröffentlicht am 19. Februar 2026

A generated scoreboard comparing ElevenLabs Eleven v4 and SpeechifyAI Simba 3.2 across six dimensions: Provider Voice rank and Elo (1 / 1,319 against 7 / 1,240), interval and samples (plus or minus 19 on 1,674 against plus or minus 14 on 2,535), board price ($80.00 against $6.58 per 1M characters), rate card ($0.022 per 1K characters until October 12 against $6.58 per 1M unchanged), arena voices (8 against 8) and release date (September 28, 2026 against July 1, 2026). Footer: 'Ranks, Elo, intervals and board prices per Artificial Analysis, Sept 2026.' The OrcaRouter logo sits in the bottom-right corner.

Daraus ergeben sich zwei Dinge. Erstens: Das Intervall von Eleventh v4 reicht ungefähr von 1.300 bis 1.338, und das von Simba 3.2 von etwa 1.226 bis 1.254; die Bereiche sind durch rund 46 Punkte klarer Luft getrennt, sodass die Reihenfolge kein Münzwurf ist. Zweitens, und das ist nützlicher: Simba 3.2 verbesserte sich um genau 100 Elo-Punkte gegenüber Simba 3.0 bei identischem Board-Preis (1.240 gegen 1.140). SpeechifyAI hat einen Generationsgewinn geliefert und den Preis nicht erhöht, was das Gegenteil von dem ist, was ElevenLabs mit diesem Launch gemacht hat.

A screenshot of Artificial Analysis' Provider Voice Arena leaderboard. ElevenLabs Eleven v4 is first at Elo 1,319 with an interval of plus or minus 19, 1,674 samples, eight arena voices and $80.0 per 1M characters. Cartesia Sonic 3.6 is second at 1,276, Google Gemini 3.8 Flash TTS third at 1,267 and $16.5, Google Gemini 3.8 Flash-Lite TTS sixth at 1,241 and $11.0, and SpeechifyAI Simba 3.2 seventh at Elo 1,240 with an interval of plus or minus 14, 2,535 samples, eight arena voices, released Jul 2026 at $6.6 per 1M characters.

Was man für den zwölffachen Preis konkret bekommt

Die Elo-Zahl ist der abstrakte Teil. Hier ist der Teil, den Sie in eine Budgetzeile eintragen können. Bei fünf Millionen Zeichen pro Monat – grob 100 Stunden fertig produzierter Sprache – liest sich der Vergleich so:

• Eleven v4 während des Launch-Zeitraums, zu 0,022 $ pro 1.000 Zeichen — 110 $ pro Monat

• Eleven v4 zum Listenpreis, 0,08 $ pro 1.000 Zeichen nach dem 12. Oktober — 400 $ pro Monat

• Simba 3.2, zu den vom Board normalisierten 6,58 $ pro Million — etwa 33 $ pro Monat

• ElevenLabs Eleven v3, das bisherige Flaggschiff, zu 0,08 $ pro 1.000 Zeichen — 400 $ pro Monat

Zwei Wochen lang liegt der Abstand beim Faktor drei. Nach dem 12. Oktober liegt er beim Faktor zwölf, und dabei bleibt es, denn die $80,00 pro Million auf der Preistafel sind der Listenpreis und nicht die Aktion. Jeder Vergleich, der diese Woche geschrieben wird und den Aktionspreis zitiert, als wäre er der reguläre Preis, wird Mitte Oktober falsch sein – und zwar in die Richtung, die ElevenLabs billig aussehen lässt.

Wo Simba 3.2 die richtige Antwort ist

Das Modell auf Platz sieben des Leaderboards ist kein schlechtes Modell. Es liegt über Googles Gemini 3.1 Flash TTS, über ElevenLabs’ eigenem v3 Conversational mit 1.197 und über Cartesias Sonic 3.5 der vorherigen Generation mit 1.185. Drei Workloads machen es zur naheliegenden Wahl.

A screenshot of Artificial Analysis' Simba 3.2 model page, titled Simba 3.2 Quality Elo, Speed & Price Analysis, credited to SpeechifyAI with an Elo of 1,239.94. The Provider Voice Arena Preference Elo bar chart shows Simba 3.2 highlighted in blue at 1,240 in the middle of the row, with Eleven v4 at 1,319 at the left, and the model selector reads '27 of 96 models'.

Das Langform-Volumen steht an erster Stelle. Hörbuch-Backkataloge, Podcast-Archive und Barrierefreiheits-Vorlesungen werden pro Zeichen abgerechnet und über Stunden statt Sekunden bewertet, und bei 6,58 $ pro Million sind die Grenzkosten für hundert weitere Stunden in einer Weise trivial, wie sie es bei 80,00 $ nie sind. Die Präferenzlücke von 79 Punkten ist ein Unterschied, den ein Zuhörer im Direktvergleich bemerken würde; über sechs Stunden Erzählung bemerken die meisten Zuhörer die Rechnung weniger.

Workloads mit Standardbesetzung sind die zweite Kategorie, und hier kommt es auf den Aufbau des Boards an. Provider Voice misst jeden Anbieter anhand seiner eigenen Stimmen, daher wurde der Rang von Simba 3.2 mit acht Arena-Stimmen erzielt, die seinen eigenen Charakter transportieren. Wenn Ihr Produkt die vom Anbieter gewählte Stimme ausliefert, kaufen Sie genau das, was das Board gemessen hat, und Sie kaufen es zu einem Siebtel des Preises der bestplatzierten Alternative.

Bereits integrierte Simba-Deployments sind die dritte. Wenn Sie Simba 3.0 verwenden, bringt das Upgrade auf 3.2 100 Elo-Punkte bei unveränderter Rate und vermutlich unveränderter Integration. Das ist der absolut beste Preis-Leistungs-Schritt in diesem gesamten Vergleich, und daran sind weder ElevenLabs noch wir beteiligt.

Wo die zusätzlichen zwölf Male nicht optional sind

Die Lücke, die Simba 3.2 nicht schließt, ist diejenige, die die Arena nicht bewerten kann. Zwei Fähigkeitsunterschiede trennen diese Modelle.

Die Regieanweisungen im Skript sind am eindeutigsten. Eleven v4 dokumentiert Inline-Audio-Tags, mit denen Sie eine Performance in den Text schreiben können – [lacht], [flüstert], [wütend mit französischem Akzent gesagt] – sowie Regieanweisungen in natürlicher Sprache und verbesserte Unterstützung des Internationalen Phonetischen Alphabets für benutzerdefinierte Aussprachen. Das auf einem Modell ohne diese Funktion zu reproduzieren, bedeutet einen zweiten Take, einen menschlichen Editor oder eine andere Stimme. Diese kosten pro Stunde mehr als das Zeichen-Delta.

Die Sprachabdeckung ist der zweite Punkt. Eleven v4 dokumentiert über 90 Sprachen bei einer Eingabeobergrenze von 10.000 Zeichen. SpeechifyAI veröffentlicht keine entsprechende Zahl für Simba 3.2, die wir hätten verifizieren können; betrachten Sie den Vergleich daher als nicht belegt und eher zugunsten von ElevenLabs als bewiesen: Wenn Ihr Produkt in zwei Dutzend Locales ausgeliefert wird, prüfen Sie die Abdeckung anhand Ihrer eigenen Liste, bevor Sie davon ausgehen, dass eines der beiden Modelle eine Stimme dafür hat.

Ein dritter Unterschied verdient Erwähnung, weil er auf den Ranglisten unsichtbar ist: Das Instant-Cloning von Eleven v4 funktioniert ab zehn Sekunden Audio. Wenn Ihr Workflow auf dem Klonen bestimmter Personen statt auf der Nutzung eines Anbieter-Casts basiert, zählt die Hürde der Beispiellänge mehr als 79 Elo-Punkte, und sie ist ein modellspezifischer Fakt, den Sie prüfen müssen, statt eine allgemeine Eigenschaft von Speech-APIs.

Die Routing-Frage, ehrlich beantwortet

Weder SpeechifyAI Simba 3.2 noch irgendein ElevenLabs-Modell ist im OrcaRouter-Katalog. Es gibt hier nichts, das sich über uns aufrufen ließe, und die richtige Anlaufstelle für beide ist die API des jeweiligen Anbieters – die von SpeechifyAI für Simba, die von ElevenLabs für Eleven v4. Wir sagen das lieber klar, als einen Vergleich als Verkaufsgespräch aufzuhübschen.

Der Punkt, an dem ein einzelner Schlüssel sich bezahlt macht, sind die zwei Wochen nach einem Launch, wenn die vernünftige Engineering-Antwort lautet: „beide mit unseren eigenen Skripten laufen lassen und daraus entscheiden". Über zwei Anbieter hinweg bedeutet das normalerweise zwei Konten, zwei Abrechnungsbeziehungen und zwei Request-Formate, bevor man überhaupt einen einzigen Vergleichspunkt hat. Ein API-Schlüssel über über 200 Modelle mit den Listenpreisen der Anbieter, die zu 0 % Aufschlag durchgereicht werden, beseitigt diesen Einrichtungsaufwand, und automatisches Failover bedeutet, dass das Modell, das man testet, hinter einem Produktionspfad sitzen kann, ohne für diesen zu einem Single Point of Failure zu werden.

Wer wechseln sollte und wer sich überhaupt nicht bewegen sollte

Wechseln Sie zu Eleven v4, wenn die Stimmqualität das Produkt ist: wenn Nutzer eine Standardstimme hören, die Sie nicht ausgewählt haben, wenn Sie Performance-Regie benötigen, die in das Skript geschrieben wird, oder wenn Ihr Cloning-Workflow in Sekunden an Quellaudio gemessen wird. Die 79-Punkte-Lücke ist real, und das Fähigkeitsdelta dahinter ist größer, als die Zahl vermuten lässt. Planen Sie 0,08 $ pro 1.000 Zeichen ein, nicht 0,022 $.

Bleiben Sie bei Simba 3.2, wenn Sie auf Masse produzieren: Langform-Erzählungen, Archivinhalte, alles, wobei sich der Preis pro Zeichen über Stunden Audio hinweg summiert. Sie geben die Spitze der Rangliste auf und behalten ungefähr elf Zwölftel des Geldes. Und wenn Sie auf Simba 3.0 sind, upgraden Sie zuerst auf 3.2 und messen Sie erneut — 100 Elo-Punkte gratis sind eine bessere Rendite als alles, was eine der beiden Seiten dieses Vergleichs bietet.

Was Sie nicht tun sollten, ist, sich allein aufgrund dieses Artikels zu entscheiden. Die ehrliche Einschränkung all dessen, was oben steht, ist, dass die Arena eine blinde Präferenz bei Anbieterstimmen zu einem einzigen Zeitpunkt misst und dass sich die Preisliste von ElevenLabs am 12. Oktober ändert. Führen Sie die Berechnung nach diesem Datum mit Ihrer eigenen monatlichen Zeichenzahl erneut durch, bevor Sie einen Produktionspfad umstellen.