Eine generierte Hero-Karte für ElevenLabs Eleven v4 vs. Google Gemini 3.1 Flash TTS mit zwei Score-Karten: Eleven v4 bei Elo 1.319 und 80,00 $ pro 1 Mio. Zeichen sowie Gemini 3.1 Flash TTS bei Elo 1.203 und 18,31 $ pro 1 Mio. Zeichen, mit der Bildunterschrift „116 Elo-Punkte, das 4,4-Fache des Board-Preises“. Fußzeile: „Provider Voice Arena, laut Artificial Analysis, September 2026.“ Das OrcaRouter-Logo befindet sich in der unteren rechten Ecke.
Guides & Insights

Eleven v4 vs. Gemini 3.1 Flash TTS: Eine 116-Punkte-Lücke – und das günstigere Google-Modell

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Wenn Sie heute nach der Stimme von Goog​le suchen, landen Sie bei der falschen. Goog​le Gemini 3.1 Flash TTS wird auf Rang 11 in der Provider Voice Arena von Artificial Analysis mit einem Elo von 1.203 bei 3.512 Auftritten aufgeführt, bei 18,31 $ pro Million Zeichen. ElevenLabs Eleven v4, am 28. September 2026 veröffentlicht, liegt auf Rang 1 mit einem Elo von 1.319 bei 1.674 Auftritten, bei 80,00 $ pro Million. Das sieht nach einer Lücke von 116 Punkten gegenüber einem günstigeren Herausforderer aus — bis Ihnen auffällt, dass das eigene Gemini 3.8 Flash TTS von Goog​le auf demselben Board den dritten Platz belegt, bei 1.267 und einem niedrigeren normalisierten Preis von 16,49 $. Der eigentliche Wettbewerb ist nicht der, den das Duell aus der Schlagzeile nahelegt, und der Grund dafür ist ein Veröffentlichungsdatum.

Eines davon ist achtzehn Monate neuer, als es aussieht.

Gemini 3.1 Flash TTS steht auf der Rangliste mit einem Veröffentlichungsdatum vom 15. April 2026. Eleven v4 steht dort mit dem 28. September 2026. Das sind fünfeinhalb Monate, was in der Sprachsynthese keine Generation ist, aber lang genug, dass Google bereits einen Nachfolger auf den Markt gebracht hat: Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS gingen beide am 23. September 2026 in die allgemeine Verfügbarkeit, fünf Tage vor Eleven v4, und beide sind auf derselben Rangliste besser platziert als 3.1. Gemini 3.8 Flash-Lite TTS landet auf Platz sechs mit 1.241 und 11,03 US-Dollar pro Million.

A generated scoreboard comparing ElevenLabs Eleven v4 and Google Gemini 3.1 Flash TTS across six dimensions: Provider Voice rank and Elo (1 / 1,319 against 11 / 1,203), samples (1,674 with an interval of plus or minus 19 against 3,512 with plus or minus 12), board price ($80.00 against $18.31 per 1M characters), rate card ($0.022 per 1K characters until October 12 against billed per token), script direction (inline audio tags against a voice set and prompting) and release date (September 28, 2026 against April 15, 2026). Footer: 'Ranks, Elo, intervals and board prices per Artificial Analysis; rate meters and capabilities vendor-documented.' The OrcaRouter logo sits in the bottom-right corner.

Der ehrliche Vergleich hat also drei Punkte, nicht zwei, und die Reihenfolge nach dem Preis ist der interessante Teil:

• Rang 1, ElevenLabs Eleven v4 — Elo 1.319, 80,00 $ pro Million Zeichen, 1.674 Auftritte, ±19-Intervall

Rang 3, Google Gemini 3.8 Flash TTS — Elo 1.267, 16,49 $ pro Million Zeichen, veröffentlicht am 23. September 2026

• Rang 6, Google Gemini 3.8 Flash-Lite TTS — Elo 1.241, 11,03 $ pro Million Zeichen, veröffentlicht am 23. September 2026

• Rang 11, Google Gemini 3.1 Flash TTS — Elo 1.203, 18,31 $ pro Million Zeichen, veröffentlicht am 15. April 2026, 3.512 Auftritte, ±12-Intervall

Beachte, was die Intervalle mit dieser Reihenfolge machen. Gemini 3.1 Flash TTS schätzt 1.203 mit einem ±12-Intervall, sodass sein wahrer Wert irgendwo um 1.191 bis 1.215 liegt. Eleven v4 schätzt 1.319 mit einem ±19-Intervall – grob 1.300 bis 1.338. Die beiden Bereiche berühren sich nicht, und die Lücke zwischen ihnen ist über hundert Punkte breit. Das ist so sauber, wie ein Präferenz-Board nur sein kann.

A screenshot of Artificial Analysis' Provider Voice Arena leaderboard, top of the table. ElevenLabs Eleven v4 is rank 1 at Elo 1,319 with an interval of plus or minus 19, 1,674 samples, eight arena voices, released Sept 2026 at $80.0 per 1M characters. Cartesia Sonic 3.6 is second at 1,276. Google Gemini 3.8 Flash TTS is third at 1,267 with $16.5 per 1M characters. Google Gemini 3.8 Flash-Lite TTS is sixth at 1,241 with $11.0. SpeechifyAI Simba 3.2 is seventh at 1,240 with $6.6. Google Gemini 3.1 Flash TTS is eleventh at 1,203 with an interval of plus or minus 12, 3,512 samples, seven arena voices, released Apr 2026 at $18.3 per 1M characters.

Warum die Stichprobenumfänge mehr zählen als die Ränge

Gemini 3.1 Flash TTS hat 3.512 Auftritte hinter seiner Schätzung; Eleven v4 hat 1.674, weil es auf diesem Board erst einen Tag alt ist. Die Schätzung eines neueren Modells bringt mehr Unsicherheit pro Stichprobe mit sich, und das ±19-Intervall spiegelt das wider. Wenn Sie zu der Art von Käufer gehören, die darauf wartet, dass sich eine Zahl einpendelt, gilt als Faustregel, dass die Rangfolge oberhalb der Intervallbreite der Teil ist, nach dem Sie handeln können. Hier übersteht die Rangfolge ihre Fehlerbalken in beide Richtungen mühelos – vor 3.8 Flash TTS und hinter niemandem in diesem Vergleich.

Die Arena zählt außerdem Arena-Stimmen: acht für Eleven v4, sieben für Gemini 3.1 Flash TTS. Das ist die Anzahl der verschiedenen Anbieter-Stimmen, die in den Blindtests verwendet wurden, und ein grober Anhaltspunkt dafür, wie umfangreich die Standardbesetzung ist, die ein Anbieter mitbringt. Rang 1 von Eleven v4 wurde mit acht Stimmen errungen, was bedeutet, dass der Sieg nicht auf einem einzigen glücklichen Erzähler beruht.

Die Leistungsunterschiede, die das Elo nicht einpreist

Die Ranglisten messen Präferenz, nicht Feature-Abdeckung. Vier Unterschiede entscheiden über echte Projekte, und keiner von ihnen taucht in einem Elo auf.

• Regieanweisung — Eleven v4 dokumentiert Inline-Audio-Tags ([lacht], [flüstert], [wütend mit französischem Akzent gesprochen]) und natürlichsprachliche Sprechanweisungen; Googles 3.1-Generierung dokumentiert Stimmauswahl und Prompting, jedoch keine äquivalente Tag-Syntax für Darbietungsanweisungen.

• Stimmenerstellung — die Gemini-3.8-Generation fügte Voice-Design anhand einer schriftlichen Beschreibung sowie Stimmreplikation anhand eines 30-Sekunden-Samples hinzu, mit Wasserzeichen und Herkunfts-Metadaten in der Ausgabe. Gemini 3.1 Flash TTS ist älter und bringt ein vorgefertigtes Stimmen-Set mit.

• Klonen aus echtem Audio – das Instant Voice Cloning von Eleven v4 läuft mit zehn Sekunden Audio, mit einer professionellen Stufe darüber. Googles Replikationsweg in der 3.8-Generation verlangt 30 Sekunden und ergänzt eine Einwilligungsprüfung. Unterschiedliche Maßstäbe, unterschiedliche Einwilligungsmechanismen.

• Eingabeobergrenze pro Anfrage — Eleven v4 gibt 10.000 Zeichen an. Google rechnet seine TTS-Modelle in Tokens statt in Zeichen ab, daher gibt es keine direkt vergleichbare Zeichenobergrenze pro Anfrage zum Gegenüberstellen, und die beiden Messgrößen sollten nicht nebeneinander gestellt werden, als wären sie vergleichbar.

Der letzte Punkt ist der, der Beschaffungstabellen zum Stolpern bringt. ElevenLabs gibt einen Preis pro 1.000 Zeichen an. Google gibt einen Preis pro Million Tokens an, Input und Output. Artificial Analysis normalisiert beides auf eine Skala pro Million Zeichen – daher stammen die 80,00 $ und 18,31 $ –, doch die Normalisierung ist die Umrechnung des Boards, nicht die Rechnung eines der beiden Anbieter. Verwenden Sie sie, um eine Rangfolge zu bilden, nicht um Prognosen abzugeben.

A screenshot of Google's Gemini API documentation page for text-to-speech generation, headed by a banner reading 'Gemini 3.8 Flash is now available'. The page covers single-speaker and multi-speaker TTS, states that the TTS capability differs from the Live API in being designed for exact text recitation with fine-grained control, names the gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts models, notes that TTS models accept text-only input and produce audio-only output, and shows a Python example that attaches a speech_metadata annotation with the style 'cheerful and friendly' and a voice of 'Kore' in generation_config.speech_config.

Was die Eleven v4 Preisliste mit diesem Vergleich macht

Zwei Wochen lang fällt der obige Preisvergleich zugunsten von ElevenLabs falsch aus, danach zu seinem Nachteil. Auf der API-Preisseite von ElevenLabs wird Eleven v4 mit 0,022 $ pro 1.000 Zeichen gegenüber einem angegebenen Listenpreis von 0,08 $ ausgewiesen, gekennzeichnet mit 72 % Rabatt bis zum 12. Oktober. Eleven v4 Turbo wird mit 0,011 $ gegenüber 0,04 $ ausgewiesen. Nach dem 12. Oktober verschwindet die Aktionszahl, und die auf der Preistafel angegebene Zahl von 80,00 $ pro Million wird der Preis, den Sie tatsächlich zahlen.

Rechnen Sie einmal einen Monat mit fünf Millionen Zeichen durch. Eleven v4 kostet $110 während des Zeitfensters und $400 danach. Gemini 3.1 Flash TTS kommt bei der $18,31-Normalisierung des Boards für denselben Monat auf etwa $92 – günstiger als die Aktion und rund viermal günstiger als der Listenpreis. Ein Team, das im September Benchmarks durchführt und im November ausliefert, wird die Entscheidung anhand einer Zahl getroffen haben, die es nicht mehr gibt.

Wo Routing passt und wo nicht

Keines dieser beiden Modelle ist im OrcaRouter-Katalog enthalten. Es gibt hier keinen ElevenLabs-Endpunkt und keinen Google-TTS-Endpunkt, den man aufrufen könnte, und die ehrliche Antwort auf „Wie erreiche ich sie über Sie?“ lautet: gar nicht. Eleven v4 erreicht man über die eigene API von ElevenLabs und Gemini 3.1 Flash TTS über die von Google. Alles andere zu sagen, hieße, eine Integration zu erfinden.

Wofür ein einzelner Schlüssel in einem Vergleich wie diesem gut ist, ist die Entscheidung selbst. Wenn Sie einen Endpunkt für 400 $ pro Monat gegen einen für 92 $ pro Monat abwägen, hängt die Antwort von Ihren eigenen Skripten, Ihren eigenen Sprachen und Ihren eigenen Listenern ab – und um diese Antwort zu erhalten, müssen Sie beide vom selben Codepfad aus mit derselben Anfrageform aufrufen, statt zwei Anbieterintegrationen hochzuziehen, um einen einzigen Test durchzuführen. OrcaRouter deckt diese Ebene ab: über 200 Modelle hinter einem Schlüssel, wobei die Listenpreise der Anbieter zu 0 % Aufschlag durchgereicht werden, sodass eine Preisänderung eines Anbieters am Tag ihres Inkrafttretens widergespiegelt wird, plus automatisches Failover, falls ein Upstream während der Evaluierung schlechter wird.

Wer sollte welche auswählen?

Nimm Eleven v4, wenn die Stimme das Produkt ist. Es führt das Board mit 116 Punkten Vorsprung an, mit einem saubereren Intervall als das Modell darunter, es ist das einzige der beiden mit einer dokumentierten Inline-Tag-Syntax zur Performance-Steuerung, und seine Klon-Schwelle liegt bei zehn Sekunden statt bei dreißig. Der Aufpreis ist real — das Vierfache des normalisierten Listenpreises — und er erkauft die Spitze des Boards.

Wählen Sie Gemini 3.1 Flash TTS nur, wenn Sie sich bereits darauf festgelegt haben. Es ist ein fünf Monate altes Vorschau-Generationsmodell mit einer niedrigeren Punktzahl und einem höheren normalisierten Preis als das eigene September-Release von Google, und der einzige Grund, es beizubehalten, ist Trägheit in einer bestehenden Integration. Wenn Sie diese Trägheit haben, bringt eine Migration innerhalb des Google-Stacks zu 3.8 Flash TTS 64 Elo-Punkte und einen niedrigeren normalisierten Preis, ohne den Anbieter zu wechseln – ein seltener Fall, in dem das Upgrade zugleich die günstigere Option ist.

Für alle anderen lautet die entscheidende Frage Eleven v4 gegen Gemini 3.8 Flash TTS, und die Antwort ist ein echter Tausch statt einer Rangfolge: 52 Elo-Punkte und die Tag-Syntax gegen etwa ein Fünftel der Kosten pro Zeichen. Testen Sie beide nach dem 12. Oktober mit denselben Skripten, wenn die ElevenLabs-Aktion vorbei ist und die Preisdifferenz die ist, die Sie tatsächlich zahlen werden.