Eine generierte Hero-Karte für „Gemini 3.8 TTS vs ElevenLabs" auf weißem Hintergrund mit sanften blau- und cyanfarbenen Farbverlaufsakzenten. Die linke Karte „ElevenLabs Eleven v3" listet 100 $ pro 1 Mio. Zeichen, 70+ Sprachen, Elo 1.167 und Rang 17 auf; die rechte Karte „Gemini 3.8 Flash TTS" listet 33 $ pro 1 Mio. Zeichen, 130 Sprachen, Elo 1.260 und Rang 2 auf. Eine Fußzeile lautet „Elo laut Artificial Analysis Provider Voice Arena, Sept. 2026." Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Guides & Insights

Gemini 3.8 TTS vs. ElevenLabs: Was Sie für den dreifachen Preis bekommen

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Bei gleichem Volumen kostet das Flaggschiff-Synthesemodell von ElevenLabs etwa dreimal so viel wie das neue Modell des Anbieters. ElevenLabs Eleven v3 berechnet $0,10 pro tausend Zeichen — $100 pro Million — und Gemini 3.8 Flash TTS berechnet $9,00 pro Million Audio-Tokens, was Artificial Analysis auf $33,00 pro Million Zeichen normalisiert. Das ist eine 3,0-fache Differenz auf dem Zähler, und es ist die wichtigste Einzeltatsache in diesem Vergleich. Die interessante Frage ist nicht, ob die Lücke real ist; sie ist, was die zusätzlichen siebenundsechzig Dollar pro Million Zeichen tatsächlich kaufen, denn die Antwort lautet nicht „bessere Sprache“.

A generated two-column scoreboard for ElevenLabs Eleven v3 and Gemini 3.8 Flash TTS — Eleven v3 at Arena Elo 1,167, $100.00 per 1M characters, 70-plus languages, a 280 ms latency claim and 4,345 samples; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 130 languages, no latency claim and 1,999 samples — over the footer 'Elo per Artificial Analysis; latency vendor-reported.'

Drei Meter, nicht einer

Das Wichtigste zuerst: Diese beiden Produkte messen nicht dasselbe, und die veröffentlichten Tarifkarten verschleiern das.

• ElevenLabs rechnet pro Zeichen ab. Eleven v3 kostet 0,10 $ pro 1.000 Zeichen, begrenzt auf 5.000 Zeichen pro Anfrage. Eleven v3 Conversational kostet 0,05 $ pro 1.000, und die Modelle Flash und Turbo kosten ebenfalls 0,05 $ pro 1.000, haben aber ein Anfrage-Limit von 40.000 Zeichen und eine angegebene Latenz von ca. 75 ms gegenüber den ca. 280 ms von v3 Conversational.

Google rechnet tokenbasiert ab, und Audio-Token sind keine Text-Token. Gemini 3.8 Flash TTS berechnet 0,50 $ pro Million Text-Token bei der Eingabe und 9,00 $ pro Million Audio-Token bei der Ausgabe, abgerechnet mit 25 Audio-Token pro Sekunde generierter Sprache. Es gibt kein veröffentlichtes Zeichenlimit pro Anfrage.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

• Artificial Analysis stellt weder dem einen noch dem anderen Rechnungen aus; es normalisiert. Die 100,00 $ und 33,00 $ pro Million Zeichen auf seinem Provider Voice Arena-Leaderboard sind ein abgeleiteter gemeinsamer Nenner, damit die Rangliste überhaupt nach dem Preis sortieren kann. Nützlich für ein Verhältnis, nicht für ein Angebot.

Die ehrliche Version der 3,0x-Zahl lautet also: Auf der einzigen verfügbaren Vergleichsbasis liegt Google preislich bei etwa einem Drittel. Was das in Ihrer eigenen Tabelle bedeutet, hängt davon ab, ob Ihre Arbeitslast von kurzen oder langen Zeichenketten dominiert wird – ein sekundenbasierter Audio-Zähler und ein zeichenbasierter Text-Zähler weichen stark voneinander ab, je länger die Äußerungen werden, weil Stille, Pausen und prosodische Auffüllung allesamt Audio-Tokens kosten und keine Zeichen.

Ein gearbeiteter Monat

Eine Million Zeichen Text, ungefähr die Länge eines mittelgroßen Romans, einmal in Sprache umgewandelt.

• ElevenLabs Eleven v3 — 100,00 $ für die Synthese, plus den jeweiligen Plan-Tarif, den Sie benötigen, um ihn mit Ihrer Parallelität auszuführen. Die veröffentlichten Tarife führen Starter mit 6 $, Creator mit 22 $, Pro mit 99 $, Scale mit 299 $ und Business mit 990 $, und die Zeichenkontingente sind in diese eingebunden, statt separat abgerechnet zu werden.

• Gemini 3.8 Flash TTS – 33,00 $ entsprechend, oder ungefähr 16,50 $, wenn der Auftrag batchfähig ist, da die Batch- und Flex-Stufe den Audio-Tarif auf 4,50 $ pro Million Token halbiert. Der Priority-Service erhöht ihn auf 16,20 $ pro Million, was einem Betrag von etwa 59,40 $ entspricht und immer noch deutlich unter ElevenLabs liegt.

• Gemini 3.8 Flash-Lite TTS — 6,00 $ pro Million Audio-Tokens, was bei derselben Normalisierung etwa 22,10 $ entspricht – auf Kosten von 101 statt 130 Sprachen.

Rechnet man dieselben eine Million Zeichen mit Googles Aktionspreis ab, wird die Lücke noch größer, denn beide neuen Gemini-TTS-Modelle kosten bis zum 31. Dezember 2026 nur die Hälfte und danach das Doppelte. Wer einen Business Case auf den Septemberzahlen aufbaut, baut ihn auf einem Rabatt auf, der ein veröffentlichtes Ablaufdatum hat.

A screenshot of ElevenLabs' API pricing page, captured in English, showing the Eleven v3 card at $0.10 per 1K characters with a 5,000-character limit, v3 Conversational at $0.05 with a 280 ms latency claim, v2 Multilingual at $0.10 with 29 languages, and Flash/Turbo at $0.05 with a 40,000-character limit.

Die eine Stelle, an der der Vergleich kippt, sind sehr kurze Äußerungen. Eine Abrechnung pro Zeichen berechnet für eine Bestätigung aus drei Wörtern fast nichts; eine Abrechnung pro Sekunde Audio berechnet die Sekunde, die die Bestätigung zum Aussprechen braucht, einschließlich der Stille darum herum. Wenn Ihr Produkt eine Sprachschnittstelle ist, die aus Antworten mit einem Satz besteht, verschiebt sich die Rechnung in Richtung ElevenLabs. Wenn es Erzählung, Hörbücher, Longform-Lokalisierung oder irgendetwas ist, bei dem der Text lang und das Audio länger ist, verschiebt sie sich stark in Richtung Google.

Die Qualitätsfrage, ehrlich gesagt

In der Artificial Analysis Provider Voice Arena — blinde paarweise Abstimmungen über die jeweils eigenen nativen Stimmen der Anbieter — liegen die beiden Modelle nicht dicht beieinander, und Google liegt vorn.

• Gemini 3.8 Flash TTS — Rang 2, Elo 1.260, ein 17-Punkte-Intervall, 1.999 Samples, 8 Arena-Stimmen, veröffentlicht im September 2026.

• ElevenLabs Eleven v3 — Rang 17, Elo 1.167, ein 11-Punkte-Intervall, 4.345 Samples, 8 Arena-Stimmen, auf dem Board als Februar 2026 gelistet.

Dreiundneunzig Elo-Punkte trennen sie, und anders als die Lücke zwischen den Top drei auf dieser Rangliste ist diese real: Das Intervall von Eleven v3 reicht von 1.156 bis 1.178 und das von Gemini von 1.243 bis 1.277, ohne Überschneidung. Die Stichprobenanzahl von Eleven v3 ist mehr als doppelt so hoch wie die von Gemini, also ist die Schätzung auch nicht dünn.

Das ist ein wirklich unangenehmes Ergebnis für das Preisargument, und es spricht gegen die naheliegende Schlussfolgerung. ElevenLabs verlangt dreimal so viel und liegt bei der Blindpräferenz siebzehn Plätze niedriger. Was auch immer die zusätzlichen siebenundsechzig Dollar bringen, im direkten Vergleich ist es keine besser klingende Stimme.

Was ElevenLabs tatsächlich verkauft

ElevenLabs verkauft nicht in erster Linie einen Synthese-Endpunkt, und ihn so zu bepreisen, als wäre er einer, ist der Punkt, an dem die meisten Vergleiche schiefgehen. Was man für das Geld bekommt:

• Eine Voice-Bibliothek. Die gemeinsame Voice-Bibliothek von ElevenLabs umfasst Hunderte von Stimmen und ist eine echte Produktoberfläche – der Grund, warum Leute zu ElevenLabs kommen, ist oft eine bestimmte Stimme, die sie irgendwo gehört haben, nicht das dahinterstehende Modell. Gemini 3.8 Flash TTS liefert 30 vorgefertigte Studio-Stimmen, einen Voice-Design-Pfad, der eine Stimme aus einer natürlichsprachlichen Beschreibung generiert, und einen Replikationspfad, der aus einer 30-sekündigen Probe klont, mit Einwilligungsprüfung, einem SynthID-Wasserzeichen und angehängten C2PA-Anmeldeinformationen. Der Standardkatalog ist kleiner; die Möglichkeit, eine bestimmte Stimme zu erstellen, ist vergleichbar.

• Latenzstufen als separate Produkte. Flash und Turbo mit ~75 ms und einem Limit von 40.000 Zeichen sind ein anderes Produkt als v3 mit ~280 ms und 5.000 Zeichen, und beide sind günstiger als v3. Wenn Ihre Anwendung unter 100 ms benötigt, verkauft ElevenLabs das explizit, und Googles Launch-Material erhebt für keines der beiden neuen TTS-Modelle einen vergleichbaren Latenzanspruch.

• Ein Ökosystem. Dubbing, Voice-Agents, konversationelle Endpunkte, eine Planstruktur mit daran geknüpfter Nebenläufigkeit — aus demselben Grund verkauft Cartesia Telefonie: Es ist ein Stack, kein Modell.

Wenn Sie einen Stack kaufen, ist der 3,0x-Faktor der Preis dafür, ihn nicht selbst zusammenzubauen. Wenn Sie einen Synthesis-Call kaufen, bezahlen Sie ihn für eine Voice Library und eine Latenzstufe.

Was Google tatsächlich verkauft

Das Gegenargument ist enger und stärker als „billiger“.

• Sprachabdeckung — 130 Sprachen bei Flash TTS und 101 bei Flash-Lite TTS, automatisch aus dem Text erkannt, gegenüber den über 70 Sprachen, die ElevenLabs für Eleven v3 dokumentiert. Für einen Lokalisierungsdurchlauf ist dieser Unterschied kein Funktionsvergleich, sondern eine Abdeckungslücke.

• Regie — zeilengenaue Steuerung der Sprechweise, Inszenierung von Zwei-Sprecher-Szenen innerhalb eines einzigen Aufrufs und in das Skript geschriebene nonverbale Hinweise wie <laughs>, <sigh>, <gasp>, |mhm| und |yeah|. Google behauptet, die 3.8-Generation habe die Langform-Konsistenz und die Zwei-Sprecher-Steuerung gegenüber Gemini 3.1 Flash TTS verbessert, wofür diese Funktionen genau gedacht sind. Anbieteraussage, nicht reproduziert.

• Voice-Statusmodell — 200 zustandsbehaftete benutzerdefinierte Stimmen pro Projekt mit einer TTL von einem Jahr oder zustandslose Stimmen, adressiert über einen voicekey_...-Handle, die nach sieben Tagen ablaufen. Das ist eine Infrastrukturentscheidung, mit der Sie planen können.

• Ausgabesteuerung — WAV 24 kHz Mono 16-Bit signed PCM am Unary-Endpunkt, headerloses PCM (audio/l16) am Streaming-Endpunkt sowie audio/mulaw und audio/alaw mit konfigurierbarer Abtastrate.

Googles Launch-Benchmarks sind vom Anbieter gemeldet und sollten auch so gelesen werden: Erster beim Hume AI Voice Design Benchmark mit 71,4 und Erster bei der Akzentmodellierung mit 60,8, Erster bzw. Zweiter beim Hume Overall Quality Index für Flash bzw. Flash-Lite sowie Spitzenplatzierungen bei der Blindpräferenz, die für Japanisch, brasilianisches Portugiesisch, Vietnamesisch, Modernes Hocharabisch, mexikanisches Spanisch und Hindi beansprucht werden. Keiner dieser Durchläufe ist öffentlich. Das oben genannte Arena-Elo ist die einzige unabhängig erhobene Zahl in diesem Artikel, und es stimmt zufällig mit der Richtung der Anbieterangaben überein.

Der Switch-Kalkül

Wechseln Sie, wenn Ihr Arbeitsaufkommen aus Langform-Inhalten besteht, mehrsprachig oder so umfangreich ist, dass 3.0x als eigener Posten auftaucht, und wenn Sie mit einem kleineren Standard-Stimmkatalog und ohne eine veröffentlichte Sub-100-ms-Stufe leben können. Das deckt Narration, Synchronisation, Barrierefreiheit und die meisten in Produkte eingebetteten Sprachfunktionen ab.

Bleiben Sie, wenn Sie den Stack kaufen — die Voice-Bibliothek, die Latenzstufen, die Dubbing- und Agent-Produkte — oder wenn Ihre Workload von sehr kurzen Äußerungen dominiert wird, bei denen ein sekundengenauer Audio-Zähler Sie bestraft. Bleiben Sie auch, wenn Sie bereits eine Voice-Identität auf ElevenLabs fine-tuned haben, die Ihre Nutzer wiedererkennen, denn Voice-Kontinuität ist ein Produktmerkmal, und sie auf einem neuen Modell neu zu erstellen, ist ein Projekt.

So oder so ist der vernünftige Schritt, beide einen Monat lang mit echtem Traffic laufen zu lassen, bevor man sich festlegt, und das ist das Argument dafür, keines von beiden direkt in die eigene Codebasis zu verdrahten. OrcaRouter stellt 200+ Modelle hinter einem einzigen Schlüssel zum Listenpreis des Anbieters ohne Aufschlag bereit, sodass eine Preisänderung aus einem der beiden Labs noch am selben Tag auf Ihrer Rechnung ankommt statt erst bei der Verlängerung, und automatisches Failover hält einen produktiven Sprachpfad am Leben, wenn ein brandneuer Endpunkt sich danebenbenimmt. Wir hosten ElevenLabs nicht — seine Synthese- und Agent-Ebenen sind sein eigenes Produkt — und wir hosten auch nicht die Gemini 3.8 TTS-Endpunkte, die aus Googles API stammen. Was wir bereitstellen, ist die Textebene darunter und das Routing darüber.

Die Zahl, auf die man achten sollte, ist der Elo-Wert von Eleven v3 in der nächsten Revision des Leaderboards. Dreiundneunzig Punkte sind ein großer Rückstand für ein Modell, das dreimal so viel verlangt, und wenn sich das Intervall verengt, ohne dass die Lücke sich schließt, hört das Preisargument auf, ein Kompromiss zu sein, und wird zu einem Urteil.