
Eleven v4 vs. Gemini 3.1 Flash TTS: Eine 116-Punkte-Lücke – und das günstigere Google-Modell
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 982 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 197 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
Wenn Sie heute nach der Stimme von Google suchen, landen Sie bei der falschen. Google Gemini 3.1 Flash TTS wird auf Rang 11 in der Provider Voice Arena von Artificial Analysis mit einem Elo von 1.203 bei 3.512 Auftritten aufgeführt, bei 18,31 $ pro Million Zeichen. ElevenLabs Eleven v4, am 28. September 2026 veröffentlicht, liegt auf Rang 1 mit einem Elo von 1.319 bei 1.674 Auftritten, bei 80,00 $ pro Million. Das sieht nach einer Lücke von 116 Punkten gegenüber einem günstigeren Herausforderer aus — bis Ihnen auffällt, dass das eigene Gemini 3.8 Flash TTS von Google auf demselben Board den dritten Platz belegt, bei 1.267 und einem niedrigeren normalisierten Preis von 16,49 $. Der eigentliche Wettbewerb ist nicht der, den das Duell aus der Schlagzeile nahelegt, und der Grund dafür ist ein Veröffentlichungsdatum.
Eines davon ist achtzehn Monate neuer, als es aussieht.
Gemini 3.1 Flash TTS steht auf der Rangliste mit einem Veröffentlichungsdatum vom 15. April 2026. Eleven v4 steht dort mit dem 28. September 2026. Das sind fünfeinhalb Monate, was in der Sprachsynthese keine Generation ist, aber lang genug, dass Google bereits einen Nachfolger auf den Markt gebracht hat: Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS gingen beide am 23. September 2026 in die allgemeine Verfügbarkeit, fünf Tage vor Eleven v4, und beide sind auf derselben Rangliste besser platziert als 3.1. Gemini 3.8 Flash-Lite TTS landet auf Platz sechs mit 1.241 und 11,03 US-Dollar pro Million.

Der ehrliche Vergleich hat also drei Punkte, nicht zwei, und die Reihenfolge nach dem Preis ist der interessante Teil:
• Rang 1, ElevenLabs Eleven v4 — Elo 1.319, 80,00 $ pro Million Zeichen, 1.674 Auftritte, ±19-Intervall
Rang 3, Google Gemini 3.8 Flash TTS — Elo 1.267, 16,49 $ pro Million Zeichen, veröffentlicht am 23. September 2026
• Rang 6, Google Gemini 3.8 Flash-Lite TTS — Elo 1.241, 11,03 $ pro Million Zeichen, veröffentlicht am 23. September 2026
• Rang 11, Google Gemini 3.1 Flash TTS — Elo 1.203, 18,31 $ pro Million Zeichen, veröffentlicht am 15. April 2026, 3.512 Auftritte, ±12-Intervall
Beachte, was die Intervalle mit dieser Reihenfolge machen. Gemini 3.1 Flash TTS schätzt 1.203 mit einem ±12-Intervall, sodass sein wahrer Wert irgendwo um 1.191 bis 1.215 liegt. Eleven v4 schätzt 1.319 mit einem ±19-Intervall – grob 1.300 bis 1.338. Die beiden Bereiche berühren sich nicht, und die Lücke zwischen ihnen ist über hundert Punkte breit. Das ist so sauber, wie ein Präferenz-Board nur sein kann.

Warum die Stichprobenumfänge mehr zählen als die Ränge
Gemini 3.1 Flash TTS hat 3.512 Auftritte hinter seiner Schätzung; Eleven v4 hat 1.674, weil es auf diesem Board erst einen Tag alt ist. Die Schätzung eines neueren Modells bringt mehr Unsicherheit pro Stichprobe mit sich, und das ±19-Intervall spiegelt das wider. Wenn Sie zu der Art von Käufer gehören, die darauf wartet, dass sich eine Zahl einpendelt, gilt als Faustregel, dass die Rangfolge oberhalb der Intervallbreite der Teil ist, nach dem Sie handeln können. Hier übersteht die Rangfolge ihre Fehlerbalken in beide Richtungen mühelos – vor 3.8 Flash TTS und hinter niemandem in diesem Vergleich.
Die Arena zählt außerdem Arena-Stimmen: acht für Eleven v4, sieben für Gemini 3.1 Flash TTS. Das ist die Anzahl der verschiedenen Anbieter-Stimmen, die in den Blindtests verwendet wurden, und ein grober Anhaltspunkt dafür, wie umfangreich die Standardbesetzung ist, die ein Anbieter mitbringt. Rang 1 von Eleven v4 wurde mit acht Stimmen errungen, was bedeutet, dass der Sieg nicht auf einem einzigen glücklichen Erzähler beruht.
Die Leistungsunterschiede, die das Elo nicht einpreist
Die Ranglisten messen Präferenz, nicht Feature-Abdeckung. Vier Unterschiede entscheiden über echte Projekte, und keiner von ihnen taucht in einem Elo auf.
• Regieanweisung — Eleven v4 dokumentiert Inline-Audio-Tags ([lacht], [flüstert], [wütend mit französischem Akzent gesprochen]) und natürlichsprachliche Sprechanweisungen; Googles 3.1-Generierung dokumentiert Stimmauswahl und Prompting, jedoch keine äquivalente Tag-Syntax für Darbietungsanweisungen.
• Stimmenerstellung — die Gemini-3.8-Generation fügte Voice-Design anhand einer schriftlichen Beschreibung sowie Stimmreplikation anhand eines 30-Sekunden-Samples hinzu, mit Wasserzeichen und Herkunfts-Metadaten in der Ausgabe. Gemini 3.1 Flash TTS ist älter und bringt ein vorgefertigtes Stimmen-Set mit.
• Klonen aus echtem Audio – das Instant Voice Cloning von Eleven v4 läuft mit zehn Sekunden Audio, mit einer professionellen Stufe darüber. Googles Replikationsweg in der 3.8-Generation verlangt 30 Sekunden und ergänzt eine Einwilligungsprüfung. Unterschiedliche Maßstäbe, unterschiedliche Einwilligungsmechanismen.
• Eingabeobergrenze pro Anfrage — Eleven v4 gibt 10.000 Zeichen an. Google rechnet seine TTS-Modelle in Tokens statt in Zeichen ab, daher gibt es keine direkt vergleichbare Zeichenobergrenze pro Anfrage zum Gegenüberstellen, und die beiden Messgrößen sollten nicht nebeneinander gestellt werden, als wären sie vergleichbar.
Der letzte Punkt ist der, der Beschaffungstabellen zum Stolpern bringt. ElevenLabs gibt einen Preis pro 1.000 Zeichen an. Google gibt einen Preis pro Million Tokens an, Input und Output. Artificial Analysis normalisiert beides auf eine Skala pro Million Zeichen – daher stammen die 80,00 $ und 18,31 $ –, doch die Normalisierung ist die Umrechnung des Boards, nicht die Rechnung eines der beiden Anbieter. Verwenden Sie sie, um eine Rangfolge zu bilden, nicht um Prognosen abzugeben.

Was die Eleven v4 Preisliste mit diesem Vergleich macht
Zwei Wochen lang fällt der obige Preisvergleich zugunsten von ElevenLabs falsch aus, danach zu seinem Nachteil. Auf der API-Preisseite von ElevenLabs wird Eleven v4 mit 0,022 $ pro 1.000 Zeichen gegenüber einem angegebenen Listenpreis von 0,08 $ ausgewiesen, gekennzeichnet mit 72 % Rabatt bis zum 12. Oktober. Eleven v4 Turbo wird mit 0,011 $ gegenüber 0,04 $ ausgewiesen. Nach dem 12. Oktober verschwindet die Aktionszahl, und die auf der Preistafel angegebene Zahl von 80,00 $ pro Million wird der Preis, den Sie tatsächlich zahlen.
Rechnen Sie einmal einen Monat mit fünf Millionen Zeichen durch. Eleven v4 kostet $110 während des Zeitfensters und $400 danach. Gemini 3.1 Flash TTS kommt bei der $18,31-Normalisierung des Boards für denselben Monat auf etwa $92 – günstiger als die Aktion und rund viermal günstiger als der Listenpreis. Ein Team, das im September Benchmarks durchführt und im November ausliefert, wird die Entscheidung anhand einer Zahl getroffen haben, die es nicht mehr gibt.
Wo Routing passt und wo nicht
Keines dieser beiden Modelle ist im OrcaRouter-Katalog enthalten. Es gibt hier keinen ElevenLabs-Endpunkt und keinen Google-TTS-Endpunkt, den man aufrufen könnte, und die ehrliche Antwort auf „Wie erreiche ich sie über Sie?“ lautet: gar nicht. Eleven v4 erreicht man über die eigene API von ElevenLabs und Gemini 3.1 Flash TTS über die von Google. Alles andere zu sagen, hieße, eine Integration zu erfinden.
Wofür ein einzelner Schlüssel in einem Vergleich wie diesem gut ist, ist die Entscheidung selbst. Wenn Sie einen Endpunkt für 400 $ pro Monat gegen einen für 92 $ pro Monat abwägen, hängt die Antwort von Ihren eigenen Skripten, Ihren eigenen Sprachen und Ihren eigenen Listenern ab – und um diese Antwort zu erhalten, müssen Sie beide vom selben Codepfad aus mit derselben Anfrageform aufrufen, statt zwei Anbieterintegrationen hochzuziehen, um einen einzigen Test durchzuführen. OrcaRouter deckt diese Ebene ab: über 200 Modelle hinter einem Schlüssel, wobei die Listenpreise der Anbieter zu 0 % Aufschlag durchgereicht werden, sodass eine Preisänderung eines Anbieters am Tag ihres Inkrafttretens widergespiegelt wird, plus automatisches Failover, falls ein Upstream während der Evaluierung schlechter wird.
Wer sollte welche auswählen?
Nimm Eleven v4, wenn die Stimme das Produkt ist. Es führt das Board mit 116 Punkten Vorsprung an, mit einem saubereren Intervall als das Modell darunter, es ist das einzige der beiden mit einer dokumentierten Inline-Tag-Syntax zur Performance-Steuerung, und seine Klon-Schwelle liegt bei zehn Sekunden statt bei dreißig. Der Aufpreis ist real — das Vierfache des normalisierten Listenpreises — und er erkauft die Spitze des Boards.
Wählen Sie Gemini 3.1 Flash TTS nur, wenn Sie sich bereits darauf festgelegt haben. Es ist ein fünf Monate altes Vorschau-Generationsmodell mit einer niedrigeren Punktzahl und einem höheren normalisierten Preis als das eigene September-Release von Google, und der einzige Grund, es beizubehalten, ist Trägheit in einer bestehenden Integration. Wenn Sie diese Trägheit haben, bringt eine Migration innerhalb des Google-Stacks zu 3.8 Flash TTS 64 Elo-Punkte und einen niedrigeren normalisierten Preis, ohne den Anbieter zu wechseln – ein seltener Fall, in dem das Upgrade zugleich die günstigere Option ist.
Für alle anderen lautet die entscheidende Frage Eleven v4 gegen Gemini 3.8 Flash TTS, und die Antwort ist ein echter Tausch statt einer Rangfolge: 52 Elo-Punkte und die Tag-Syntax gegen etwa ein Fünftel der Kosten pro Zeichen. Testen Sie beide nach dem 12. Oktober mit denselben Skripten, wenn die ElevenLabs-Aktion vorbei ist und die Preisdifferenz die ist, die Sie tatsächlich zahlen werden.
