Eine generierte Hero-Karte für ElevenLabs Eleven v4 vs. OpenAI TTS-1 HD mit zwei Score-Karten: Eleven v4 bei Elo 1.319, Rang 1 und $80,00 pro 1 Mio. Zeichen; OpenAI TTS-1 HD bei Elo 1.104, Rang 35 und $30,00 pro 1 Mio. Zeichen; mit der Bildunterschrift „216 Elo-Punkte, und beide Endpunkte nehmen weiterhin Traffic an“. Fußzeile: „Provider Voice Arena, laut Artificial Analysis, September 2026.“ Das OrcaRouter-Logo sitzt in der unteren rechten Ecke.
Guides & Insights

Eleven v4 vs. OpenAI TTS-1 HD: Zwei Jahre Drift in einem Board

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

OpenAI TTS-1 HD hat ein Veröffentlichungsdatum vom 6. November 2023. ElevenLabs Eleven v4 hat eines vom 28. September 2026. Auf der Provider Voice Arena von Artificial Analysis liegen diese beiden Daten 216 Elo-Punkte auseinander — TTS-1 HD liegt auf Rang 35 mit 1.104 bei 3.500 Auftritten zu 30,00 $ pro Million Zeichen, während Eleven v4 auf Rang 1 mit 1.319 bei 1.674 Auftritten zu 80,00 $ liegt. Beide Werte haben enge Intervalle, ±12 und ±19, sodass die Rangfolge außer Zweifel steht. Die interessante Frage ist nicht, welches Modell besser ist, denn das wurde geklärt, bevor es diesen Artikel gab. Sie ist, warum ein 2023er Endpunkt noch 3.500 Auftritte auf einem Board hat, auf dem ein fünf Tage altes Modell 1.674 hat, und was das über die Migration aussagt, die Sie in Betracht ziehen sollen.

Die Rangliste – und die eine Zeile, in der OpenAI gewinnt

Über dieses Aufeinandertreffen entscheiden fünf Dimensionen, und beide Seiten jeder einzelnen sind es wert, nebeneinander gelesen zu werden.

• Blinde Präferenz, Anbieterstimmen — Eleven v4 Rang 1, Elo 1.319 (±19, 1.674 Auftritte) vs. TTS-1 HD Rang 35, Elo 1.104 (±12, 3.500 Auftritte). Ein Abstand von 216 Punkten, der die Fehlerbalken übersteht.

• Listenpreis pro Million Zeichen — Eleven v4 80,00 $ vs. TTS-1 HD 30,00 $. OpenAI ist laut Liste um 62 % günstiger und während der ElevenLabs-Aktion noch günstiger.

• Stimmen — Eleven v4 dokumentiert sofortiges Klonen aus zehn Sekunden Audio plus eine professionelle Klon-Stufe; TTS-1 HD bietet ein festes Stimmen-Set, neun für die tts-1-Familie in OpenAIs eigener Dokumentation (alloy, ash, coral, echo, fable, onyx, nova, sage, shimmer), und kein Klonen.

• Performance-Regie — Eleven v4 dokumentiert Inline-Audio-Tags und natürlichsprachliche Regieanweisungen; TTS-1 HD nimmt reinen Text entgegen, und OpenAIs Parameter für steuerbare Anweisungen gehört zu dessen neuerem TTS-Modell und nicht zu diesem.

• Veröffentlichungsdatum — Eleven v4 28. September 2026 vs. TTS-1 HD 6. November 2023.

A generated scoreboard comparing ElevenLabs Eleven v4 and OpenAI TTS-1 HD across six dimensions: Provider Voice rank and Elo (1 / 1,319 against 35 / 1,104), samples (1,674 with an interval of plus or minus 19 against 3,500 with plus or minus 12), board price ($80.00 against $30.00 per 1M characters), rate card ($0.022 per 1K characters until October 12 against $30.00 per 1M at list), voices (cloning from 10 s of audio plus a professional tier against nine fixed presets) and direction (inline audio tags against plain text only). Footer: 'Ranks, Elo and board prices per Artificial Analysis; voice set, list price and capabilities vendor-documented.' The OrcaRouter logo sits in the bottom-right corner.

Der Preis ist die Zeile, in der OpenAI gewinnt, und es ist ein größerer Sieg, als es aussieht, weil die ElevenLabs-Aktion befristet ist. Bei 0,022 US-Dollar pro 1.000 Zeichen kostet Eleven v4 bis zum 12. Oktober 22 US-Dollar pro Million – schlichtweg günstiger als TTS-1 HD. Nach dem 12. Oktober kostet es 80 US-Dollar pro Million gegenüber den 30 US-Dollar von OpenAI und bleibt auf diesem Niveau.

Warum ein 2023er-Modell die doppelte Stichprobenanzahl hat

Diese Zahl ist das Nützlichste auf diesem Board, und sie ist leicht falsch zu lesen. Arena-Auftritte summieren sich mit Traffic, und Traffic summiert sich durch Integrationen, die einmal gebaut und nie wieder angefasst wurden. TTS-1 HD hat 3.500 Auftritte hinter sich, weil es der Standard-Sprach-Endpunkt für jedes Team war, das OpenAI bereits für Chat-Completions aufrief: derselbe Schlüssel, dasselbe SDK, dieselbe Abrechnungszeile, ein weiterer Aufruf. Nichts in diesem Satz dreht sich um Sprachqualität, und der 216-Punkte-Rückstand hat es nicht aufgehalten.

A screenshot of Artificial Analysis' TTS-1 HD model page, titled TTS-1 HD Quality Elo, Speed & Price Analysis, credited to OpenAI and the OpenAI TTS family with an Elo of 1,103.83. The Provider Voice Arena Preference Elo bar chart runs from Eleven v4 at 1,319 at the left through Gemini 3.8 Flash TTS, Simba 3.2, Eleven v3 and Gemini 3.8 Flash-Lite TTS to TTS-1 HD at 1,104 at the right, with the model selector reading '28 of 96 models'.

So sieht Migrationsschuld auf einer Rangliste aus. Es ist kein Signal dafür, dass das ältere Modell wettbewerbsfähig ist; es ist ein Signal dafür, dass ein Wechsel etwas kostet und dass eine große Zahl von Teams entschieden hat, dass dieses Etwas mehr wert ist als 216 Elo-Punkte. Das ist eine legitime Schlussfolgerung für eine Benachrichtigungsanzeige und eine schlechte für ein Produkt, bei dem die Stimme das ist, was der Kunde hört.

Das Plädoyer dafür, bei TTS-1 HD zu bleiben

Drei Dinge machen es verteidigbar, und keines davon ist Qualität.

Der Determinismus steht an erster Stelle. Ein festes Set von neun Stimmen erzeugt über Versionen hinweg konsistente Ausgaben – anders als eine Klon-Pipeline –, und konsistente Ausgaben sind genau das, was man in einem Utility-Pfad will, in dem niemand auf Kunstfertigkeit achtet. Es gibt keinen Klon, der abdriften könnte, kein Referenzsample, das neu aufgenommen werden müsste, und kein Einwilligungsartefakt, das gepflegt werden müsste.

Die Integrationskosten sind der zweite Punkt, und sie sind derjenige, den die Arena nicht bepreisen kann. Einen zweiten Sprachanbieter hinzuzufügen bedeutet ein neues Konto, eine neue Preisliste, eine neue Ausfallart und einen neuen Punkt, der überwacht werden muss. Für ein Team, das bereits im OpenAI-Stack arbeitet, ist das echte Engineering-Zeit, und 216 Elo-Punkte wiegen das nicht auf.

Low-End-Volumen ist das dritte. Bei 30 $ pro Million Zeichen ist die gesamte monatliche Sprachrechnung eines kleinen Produkts ein Rundungsfehler, und es gibt nichts zu optimieren. Das ist das Regime, in dem die billige Antwort und die faule Antwort dieselbe Antwort sind, und das ist in Ordnung.

Das Plädoyer für einen Umzug und das Gegenargument dazu

Wechseln Sie, wenn die Stimme für Kunden gedacht ist. Zehn-Sekunden-Klonen, Inline-Performance-Steuerung, über 90 Sprachen und eine Eingabeobergrenze von 10.000 Zeichen pro Anfrage sind keine kosmetischen Unterschiede gegenüber einem festen Satz von neun Stimmen aus dem Jahr 2023, und der 216-Punkte-Abstand der Arena ist die komprimierte Version einer viel größeren Fähigkeitslücke. Wenn Sie einen Agenten, einen Marken-Assistenten oder irgendetwas entwickeln, bei dem ein Zuhörer sich schon beim ersten Satz eine Meinung über Ihr Produkt bildet, ist der ältere Endpunkt die falsche Standardeinstellung.

Das Gegenargument lautet, dass „der Wechsel zu Eleven v4“ nicht die einzige Option ist. OpenAI hat seitdem ein neueres TTS-Modell mit einem steuerbaren Instruktionsparameter veröffentlicht, und Googles Gemini 3.8 Flash TTS belegt auf demselben Board mit 1.267 und normalisierten 16,49 $ pro Million den dritten Platz – ein Zugewinn von 163 Punkten gegenüber TTS-1 HD bei ungefähr der Hälfte des Board-Preises. Wenn Ihre Vorgabe darin besteht, bei Ihrem aktuellen Anbieter zu bleiben, ist das das günstigere Upgrade. Wenn sie darin besteht, in Ihrer aktuellen Cloud zu bleiben, ist es die einzige.

Wo OrcaRouter in diesem Vergleich tatsächlich steht

This is the rare article in this series where we host one of the two models, so let us be precise about which. openai/tts-1-hd is live in the OrcaRouter catalogue at OpenAI's list rate passed through at 0% markup: $30 per million, model ID openai/tts-1-hd, served on the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1 with a POST /v1/audio/speech route and the voice, speed and response_format parameters. Our own page reports a median latency of 2,461 ms and a 95th percentile of 4,769 ms, which is the honest reason not to put it in front of a live conversation — that is a batch-shaped number, not an agent-shaped one.

A screenshot of the OrcaRouter model page for openai/tts-1-hd. The header shows the model ID openai/tts-1-hd with Audio and JSON tags, the description 'OpenAI's high-definition text-to-speech model, accessed via OrcaRouter's API at $30 per 1M tokens (zero markup)', and the endpoint /v1/audio/speech. Stat tiles read $30.00 per 1M characters, p50 TTFT 2.46 s, p95 TTFT 4.77 s and traffic of 1.5K characters over 7 days. Supported parameters are response_format, speed and voice, the OpenAI-compatible base URL is https://api.orcarouter.ai/v1, and the pricing panel states 'This model is not billed per token. The rate above is the unit it actually meters, and it is what settlement charges.'

ElevenLabs Eleven v4 ist nicht in unserem Katalog, und es gibt nichts, was über uns aufgerufen werden könnte: Es wird über die eigene API von ElevenLabs nach ElevenLabs' eigener Preisliste erreicht. Was ein einziger Key ändert, ist die Form der Migration. Wenn der Grund, warum Sie den neuen Marktführer nicht getestet haben, darin liegt, dass er eine zweite Anbieterintegration bedeutet, dann kostet das Herausfinden einen API-Aufruf mit einem Key, den Sie bereits besitzen, statt einen Beschaffungszyklus. Anbieter-Listenpreise werden mit 0 % Aufschlag durchgereicht, sodass eine Preisanpassung eines Anbieters — einschließlich der Rückumstellung von ElevenLabs am 12. Oktober — an dem Tag, an dem sie erfolgt, auf unserer Seite live ist, und automatisches Failover bedeutet, dass ein Sprachpfad, der gerade evaluiert wird, nicht zu einer Produktionsabhängigkeit werden muss, während Sie sich entscheiden.

Die Arithmetik, die es klären sollte

Fünf Millionen Zeichen pro Monat, was einem mittelgroßen Produkt und etwa 100 Stunden Sprache entspricht. TTS-1 HD kostet 150 $. Eleven v4 kostet 110 $ während des Aktionszeitraums und 400 $ nach dem 12. Oktober. Gemini 3.8 Flash TTS kostet nach der Normalisierung durch das Board etwa 82,50 $.

Lies diese vier Zahlen noch einmal, und die Entscheidung fällt eindeutig aus. Während des Zeitfensters ist das neueste und am besten platzierte Modell auf der Rangliste zugleich das zweitgünstigste – günstiger als der 2023-Endpunkt, den es um 216 Elo-Punkte schlägt. Nach dem 12. Oktober ist es die teuerste Option auf der Liste – und das um fast das Fünffache. An diesem Datum ändert sich an den Modellen nichts; nur die Rechnung ändert sich.

Also: Wenn Sie diesen Monat evaluieren, evaluieren Sie mit dem Aktionspreis und schreiben Sie den Listenpreis in den Business Case. Wenn Sie im nächsten Quartal ausliefern, kalkulieren Sie mit $0,08 pro 1.000 Zeichen und behandeln Sie jeden Vergleich, der $0,022 nennt, wie ein Dokument mit aufgedrucktem Ablaufdatum. Und wenn Sie TTS-1 HD nutzen und der ehrliche Grund Integrationsträgheit ist, ist der nützliche erste Schritt kein Migrationsplan – sondern ein einzelner A/B-Test mit Ihren eigenen Skripten, kalkuliert mit dem Preis, den Sie im November tatsächlich zahlen werden.