![Eine generierte Hero-Karte für ElevenLabs Eleven v4 mit zwei Panels: links ein Skriptblock, der Inline-Audio-Tags wie [laughs], [whispers] und [said angrily in French accent] zeigt; rechts ein Panel mit Rang 1, Elo 1.319, 80,00 $ pro 1 Mio. Zeichen und 1.674 Auftritten in der Provider Voice Arena von Artificial Analysis, mit einer Fußzeile: „Provider-Voice-Rang, Elo und Preis laut Artificial Analysis, September 2026; Tag-Syntax und Latenz anbieterseitig dokumentiert." Das OrcaRouter-Logo befindet sich in der unteren rechten Ecke.](https://cms.orcarouter.ai/api/media/file/1-1462.png)
Eleven v4s Audio-Tags und Zehn-Sekunden-Clones: Was sich in Ihrer Pipeline ändert
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 982 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 197 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
Das folgenreichste an ElevenLabs Eleven v4 ist nicht sein Elo. Es ist, dass das Modell Regieanweisungen liest, die in das Skript geschrieben sind — [lacht], [flüstert], [seufzt], [wütend mit französischem Akzent gesagt], sogar [leichter Regen] — und dass ElevenLabs Eleven v4 Turbo, das am selben Tag veröffentlichte latenzarme Geschwistermodell, denselben Tags bei einer medianen Zeit bis zur ersten Sprachausgabe folgt, die der Anbieter mit etwa 150 ms angibt. Beide gingen am 28. September 2026 in die allgemeine Verfügbarkeit. Artificial Analysis' Provider Voice Arena führt Eleven v4 bereits auf Rang 1 mit einem Elo von 1.319 bei 1.674 Auftritten, zu einem Listenpreis von 80,00 $ pro Million Zeichen. Das Ranking ist die Schlagzeile. Die Regieanweisungs-Syntax und der Zehn-Sekunden-Klon sind der Teil, der verändert, was man bauen muss.
![A generated four-card summary of what ElevenLabs Eleven v4 changed in the pipeline: a Script direction card listing [laughs], [whispers], [sighs], [said angrily in French accent] and natural-language delivery prompts; a Sound and scene card listing [light rain], [phone buzzing], multi-speaker dialogue with turn-level context and IPA phonemes for custom pronunciations; a Voice creation card listing Instant Voice Cloning from 10 s of audio, a Professional Voice Cloning tier above it, and 90-plus languages with a 10,000-character cap; and a Two endpoints card describing Eleven v4 as the most emotive, highest-quality model against Eleven v4 Turbo at about 100 ms median inference and about 150 ms to first speech. Footer: 'Tag syntax, cloning bar, language count, character cap and Turbo latency are vendor-documented; no independent score is quoted on this card.' The OrcaRouter logo sits in the bottom-right corner.](https://cms.orcarouter.ai/api/media/file/2-1397.png)
Zwei Modelle, ein Launch, verschiedene Aufgaben
ElevenLabs hat am 28. September 2026 zwei Endpunkte veröffentlicht, und sie sind nicht dasselbe Produkt mit einem Geschwindigkeitsschalter. ElevenLabs Eleven v4 ist das expressive Modell: über 90 Sprachen, ein Limit von 10.000 Zeichen pro Anfrage, verbesserte Unterstützung des Internationalen Phonetischen Alphabets für benutzerdefinierte Aussprachen und Mehrsprecher-Dialoge, die laut Unternehmen die Sprecheridentität über eine Szene hinweg bewahren. ElevenLabs Eleven v4 Turbo behält die über 90 Sprachen und das Limit von 10.000 Zeichen bei, ist aber auf Agenten abgestimmt – die Ankündigung nennt eine mediane Inferenzlatenz von etwa 100 ms und eine mediane Zeit bis zur ersten Sprachausgabe von etwa 150 ms, gemessen von ElevenLabs im September 2026.

Die reaktive Frage – ist das Flaggschiff schnell genug für einen Telefon-Agenten – hat keine veröffentlichte Antwort. ElevenLabs gibt Latenzwerte für Turbo an, nicht für Eleven v4 selbst, und die beiden sind verschiedene Endpunkte statt ein Modell unter zwei Namen. Wenn das Budget Ihres Agenten 200 ms bis zum ersten Audio beträgt, ist Turbo der Endpunkt in der Dokumentation, und das Flaggschiff ist es nicht.
Die Tags sind eine echte Schnittstelle und eine echte Abhängigkeit.
Inline-Audio-Tags sind für die Sprachsynthese nichts Neues, doch die nützliche Veränderung hier ist die Genauigkeit der Befolgung. Die Ankündigung besagt, dass Eleven v4 Audio-Tags und natürlichsprachliche Regieanweisungen präziser befolgt als frühere Modelle und dass man so ein Lachen, ein Flüstern oder eine Darbietung in einem bestimmten Akzent steuern kann, ohne das Audio anschließend zu bearbeiten.
Daraus ergeben sich drei praktische Konsequenzen, und sie sind wichtiger als die Demo-Reels:
• Ihr Skript wird zu einem Vorlagen-Artefakt, nicht zu einer Zeichenkette. Ein Tag ist ein Token in Ihrer Content-Pipeline: Es muss escaped werden, wenn jemals nicht vertrauenswürdiger Text durchgeleitet wird, und es muss Ihr CMS, Ihre Übersetzungsschicht und Ihre Diff-Überprüfung überstehen. Eine Übersetzerin, die [flüstert] weglässt, hat eine Aufführung verändert, still und leise.
• Tag-Treue ist eine Anbieteraussage mit einer angehängten Version. Die Behauptung, dass diese Generation Tags besser befolgt als die letzte, stammt von ElevenLabs selbst, wurde von ElevenLabs getestet, und sie wird nicht über alle Sprachen hinweg identisch gelten. Validieren Sie anhand Ihrer eigenen Skripte und Ihrer eigenen Locales, bevor Sie darauf einen Styleguide aufbauen.
• Soundeffekt-Tags wie [leichter Regen] oder [Telefon vibriert] verlagern einen kleinen Teil der Arbeit der Audio-Postproduktion in den Text-Prompt. Das ist eine Kostenverschiebung, die es wert ist, gemessen zu werden: Wenn ein Tag einen Foley-Durchlauf ersetzt, ist er günstig; wenn er nichts ersetzt und nur Varianz hinzufügt, ist er ein neuer Fehlermodus in Ihrer QA.
Zehn Sekunden ist die Zahl, die das Onboarding verändert
Instant Voice Cloning erfasst in dieser Version eine Stimme mit hoher Wiedergabetreue aus zehn Sekunden Audio, wobei die professionelle Cloning-Stufe weiterhin darüber verfügbar ist. Zehn Sekunden sind kurz genug, um einen Workflow-Schritt zusammenzufassen: Einwilligungserfassung, Sample-Upload und erste Synthese können in einem Durchgang erfolgen, auf einem Telefon, ohne Studio.
Das Einwilligungsproblem schrumpft nicht mit dem Sample. Es wächst, weil die Hürde, einen überzeugenden Klon zu erzeugen, auf einen Clip gesunken ist, den jeder aufnehmen kann. Wenn Sie Stimmen klonen, die Ihnen nicht gehören, müssen Sie die Compliance-Frage jetzt vollständig selbst beantworten, und zwar vor dem API-Aufruf – das Modell tut, worum Sie es bitten. Betrachten Sie die Zehn-Sekunden-Angabe als operative Schwelle, nicht als Freibrief.
Was es kostet, solange das Fenster offen ist
ElevenLabs hat zum Marktstart die Preise geändert, und der Aktionspreis ist der, den man heute auf der Seite sieht. In der API-Preistabelle wird Eleven v4 mit $0,022 pro 1.000 Zeichen gegenüber einem angegebenen Listenpreis von $0,08 aufgeführt, und Eleven v4 Turbo mit $0,011 gegenüber $0,04. Beide tragen dasselbe Label: 72 % Rabatt bis zum 12. Oktober. Auf derselben Seite wird das vorherige Flaggschiff, Eleven v3, mit $0,08 pro 1.000 Zeichen angegeben.
• Board-Preis in der Arena, pro Million Zeichen — Eleven v4 80,00 $, der höchste in den Top Ten dieses Boards.
• Anbieter-Preisliste, pro tausend Zeichen — 0,022 $ bis zum 12. Oktober, danach 0,08 $.
• Was das in der Praxis bedeutet — ein skriptlastiger Monat mit fünf Millionen Zeichen kostet während des Zeitfensters $110 und danach $400, auf demselben Endpunkt mit demselben Code.

Wer für Q1 anhand der Zahl, die heute auf der Seite steht, budgetiert, budgetiert anhand einer Zahl, die in zwei Wochen abläuft. Verwenden Sie 0,08 $.
Wo ein Router bei einem Launch wie diesem seinen Platz verdient
OrcaRouter hostet ElevenLabs nicht, daher gibt es in diesem Launch nichts, was über uns aufgerufen werden könnte, und wir werden nichts anderes nahelegen – der Ort, an dem man Eleven v4 aufruft, ist die eigene API von ElevenLabs. Wofür ein einzelner Schlüssel in den zwei Wochen nach einem Launch wirklich nützlich ist, ist der Vergleich. Wenn Sie entscheiden, ob das neue Flaggschiff das schlägt, was Sie bereits betreiben, möchten Sie die beiden lieber an Ihren eigenen Skripten als an einem Leaderboard A/B-testen, und das über zwei Anbieter hinweg zu tun, bedeutet zwei Konten, zwei Abrechnungsbeziehungen und zwei Integrationswege, bevor Sie eine Antwort haben.
Das ist der Fall, den wir abdecken: ein API-Schlüssel für über 200 Modelle mit den Listpreisen der Anbieter, weitergegeben mit 0 % Aufschlag, sodass eine Preisänderung eines Anbieters – einschließlich eines Aktionszeitraums mit Ablaufdatum – bei uns noch am selben Tag live ist und nicht erst im nächsten Abrechnungszyklus. Wenn ein Sprachpfad für Kunden bestimmt ist, automatisches Failover verlagert den Datenverkehr auf einen gesunden Upstream, wenn ein Endpunkt beeinträchtigt ist, und so können Sie ein brandneues Modell testen, ohne dafür ein Release aufs Spiel zu setzen.
Was zuerst getestet werden sollte und was ignoriert werden kann
Drei Prüfungen werden Ihnen mehr sagen als jedes Ranking. Erstens: Führen Sie Ihr längstes realistisches Skript durch die 10.000-Zeichen-Grenze und sehen Sie, wo die Nahtstellen liegen – die Grenze gilt pro Anfrage, und Dialog mit mehreren Sprechenden ist die Funktion, die am ehesten dadurch aufgeteilt wird. Zweitens: Geben Sie fünf Ihrer eigenen Sätze mit Tags sowohl in v4 als auch in v4 Turbo ein und achten Sie auf Befolgungsdrift zwischen dem expressiven und dem Low-Latency-Endpunkt; es sind getrennte Modelle, und ein Tag, der bei dem einen greift, greift bei dem anderen möglicherweise nicht identisch. Drittens: Kalkulieren Sie Ihr tatsächliches monatliches Zeichenvolumen mit 0,08 $ statt mit 0,022 $, denn mit dieser Zahl läuft Ihr nächstes Quartal.
Die Zahl von ~75 % aus dem Blindpräferenz-Test in der Ankündigung ist eine Anbietermessung, und wir werden sie nicht in irgendetwas anderes umdeuten. Die unabhängige Zahl bei diesem Launch ist die auf der Rangliste: erster Platz mit 1.319 Elo bei 1.674 Auftritten und einem Intervall von ungefähr ±19 Punkten um diesen Wert. Das ist ein starkes Ergebnis auf einer echten Rangliste. Es ist keine Spezifikation, und es wird Ihnen nicht sagen, ob Ihre Tag-Syntax einen Übersetzungsdurchlauf übersteht.
