Eine generierte Hero-Karte für „Gemini 3.8 TTS: zwei Pelikane, zwei Modelle“ auf weißem Hintergrund mit sanften blau- und cyanfarbenen Verlaufsakzenten. Drei Karten zeigen „Gemini 3.8 Flash TTS — Elo 1.260, Rang 2, 8 Arena-Stimmen, 9,00 $ pro 1 Mio. Audio-Token“, „Gemini 3.8 Flash-Lite TTS — Elo 1.235, Rang 6, 6,00 $ pro 1 Mio. Audio-Token“ und „Zwei-Sprecher-Dialog — unterstützt, Voice Design, 30-Sekunden-Replikation“. Eine Fußzeile lautet „Elo laut Artificial Analysis Provider Voice Arena, Sept. 2026; Listenpreise laut Google.“ Das OrcaRouter-Logo ist unten rechts eingefügt.
Guides & Insights

Gemini 3.8 TTS: Zwei Pelikane, zwei Modelle und ein Preis, der sich im Januar verdoppelt

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Der schnellste Weg zu verstehen, was der Anbieter am 23. September 2026 veröffentlicht hat, ist ein Blick auf die Demo, die damit die Runde machte: zwei Pelikane, die darüber streiten, ob sie zum Pacifica Pier ziehen sollen, eine Stimme pro Vogel, Sprecherwechsel für Sprecherwechsel geskriptet. Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTSsind die beiden Modelle hinter dieser Demo, beide allgemein über die Gemini API verfügbar, und die Pelikane sind kein Gimmick. Sie sind das Erste in dieser Generation, was die vorherigen Gemini-Sprachmodelle überhaupt nicht konnten: zwei Sprecher, eine Generierung, ein Skript, das steuert, wer was sagt.

Der Preis ist die andere Hälfte der Geschichte, und er ist der Punkt, an dem sich die beiden Modelle unterscheiden. Flash TTS berechnet 0,50 $ pro Million Text-Tokens für die Eingabe und 9,00 $ pro Million Audio-Tokens für die Ausgabe bis zum 31. Dezember 2026, danach 18,00 $; Flash-Lite TTS berechnet 0,50 $ und 6,00 $ nach demselben Zeitplan, danach 12,00 $. Das sind Googles eigene Tarife. Von Artificial Analysis auf eine Basis pro Million Zeichen umgerechnet, damit sie in derselben Rangliste wie alle anderen stehen können, ergeben sie 16,50 $ und 11,00 $ – für das Lite-Modell rund ein Drittel günstiger und beide deutlich unter dem, was die Spitze dieser Rangliste verlangt.

Die interessante Frage ist also nicht, ob die Modelle gut sind. Sie lautet, auf welchem der beiden du aufbauen solltest, denn die Kluft zwischen ihnen ist nicht die Kluft, die du anhand der Namen vermuten würdest.

Was die Ankündigung vom 23. September tatsächlich enthält

Zwei Modelle, nicht eines, und Google stellt ausdrücklich klar, dass es sich um eine Aufteilung handelt und nicht um eine kleine und eine große Version derselben Sache. Die Ankündigung nennt fünf Orte, an denen sie eingeführt werden – Google AI Studio, die Gemini API, Gemini Enterprise, Gemini Notebook und Google Vids – und die API-Identifikatoren lauten schlicht: gemini-3.8-flash-tts und gemini-3.8-flash-lite-tts.

A screenshot of Google's blog post 'Gemini 3.8 text-to-speech says hello', published September 23, 2026 and credited to Leland Rechis and Alan Cowen, showing the launch announcement for Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS.

Die Liste der Fähigkeiten ist länger, als die Schlagzeile vermuten lässt. Aus Googles Ankündigung und der Dokumentation zur Sprachgenerierung der Gemini API:

• Voice-Design — Sie beschreiben eine Stimme in Worten und erhalten eine benutzerdefinierte Voice-ID zurück, anstatt aus einer festen Liste auszuwählen.

• Sprachreplikation — eine 30-Sekunden-Probe erzeugt eine Stimm-ID, und das ist der Weg, den die meisten Teams tatsächlich für eine Markenstimme oder einen Erzähler nutzen werden.

• Zwei-Sprecher-Dialog — der Pelikan-Fall. Das Skript enthält Sprecherwechsel statt eines einzelnen Prosablocks.

• Styling auf Turn-Ebene — die Dokumentation beschreibt eine speech_metadata-Annotation, die eine Anweisung an einen bestimmten Turn statt an die gesamte Anfrage bindet.

• Vorgefertigte Stimmen, plus eine erweiterte Stimmenbibliothek, erreichbar unter GET /v1beta/voices.

• Drei Audio-Kodierungen — standardmäßig WAV, mit mulaw und alaw für telefonieähnliche Pipelines verfügbar.

• Nur Text rein, nur Audio raus. Die Dokumentation ist diesbezüglich unmissverständlich: TTS-Modelle akzeptieren keine andere Eingabemodalität und erzeugen keine andere Ausgabe, und es gibt einen separaten Abschnitt „Limitations“, der die Einschränkungen auflistet.

Was in der Ankündigung fehlt, sind all die Zahlen, die ein Kapazitätsplaner braucht. Rate Limits, Kontingente und die Speicherlebensdauer einer entworfenen Stimme stehen alle in der Dokumentation und auf der Preisseite, nicht im Launch-Post, was der übliche Grund dafür ist, dass eine Launch-Woche für Demos reibungslos und für die Produktion schlecht verläuft.

A screenshot of the Gemini API speech-generation documentation, showing the two model identifiers gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts alongside the speech generation request and response format.

Die Pelikane sind die eigentlichen Nachrichten.

Single-Speaker-TTS ist seit zwei Jahren ein ausreichend gelöstes Problem. Was fehlte, war ein Modell, das zwei Identitäten über ein langes Skript hinweg auseinanderhalten konnte, ohne abzudriften, und genau das testet die Demo wirklich – nicht, ob die Stimme menschlich klingt, sondern ob Sprecher A nach vier Minuten noch Sprecher A ist.

Daraus folgen zwei Dinge, und sie sind der Grund, warum das über Podcast-Spielereien hinaus von Bedeutung ist.

Das Erste ist, dass sich die Arbeitseinheit ändert. Bei einem Einzelsprecher-Modell sind zwanzig Minuten Dialog zwanzig Minuten Audio, die man aus zwei unabhängigen Durchläufen zusammensetzt, und jede Nahtstelle ist ein Ort, an dem sich die Prosodie zurücksetzt. Bei einem Zwei-Sprecher-Modell ist es ein Aufruf, ein Kontext, und das Modell kann auf die vorherige Zeile reagieren. Das ist ein Qualitätsunterschied, den man mit Nachbearbeitung nicht zurückgewinnen kann.

Der zweite Punkt ist, dass das Skriptformat zur Schnittstelle wird. Wenn Ihre Pipeline bereits etwas SSML-Förmiges ausgibt – eine Annotation pro Phrase –, kommt diese Generierung einem Drop-in nahe. Wenn Ihre Pipeline einem Modell eine Textwand übergibt und hofft, haben Sie jetzt einen Grund, sie umzustrukturieren, denn das Styling, das früher implizit war, müssen Sie jetzt laut aussprechen. Das ist derselbe Kompromiss, den der Rest des Feldes auf unterschiedliche Weise eingeht, und es ist die Achse, auf der diese beiden Google-Modelle mit allem anderen auf dem Spielfeld konkurrieren.

Was eine Stunde Audio von zwei Pelikanen kostet

Es lohnt sich, die Token-Rechnung einmal anzustellen, denn die Zahl pro Million Audio-Token ist keine Zahl pro Stunde, und dieser Unterschied hat Leute überrascht.

Audio-Tokens werden mit einer festen Rate pro Sekunde Ausgabe erzeugt, daher skalieren die Kosten mit der Länge des fertigen Audios, nicht mit der Länge des Skripts. Nimmt man Googles eigenen Preis für Flash TTS – 9,00 $ pro Million ausgegebener Audio-Tokens – landet die Rechnung für ein einstündiges fertiges Stück auf der Standard-Stufe im einstelligen Dollarbereich, wobei das Lite-Modell bei zwei Dritteln davon liegt. Batch- und Flex-Preise, mit 0,25 $ für die Eingabe und 4,50 $ für die Ausgabe bei Flash TTS gegenüber 0,25 $ und 3,00 $ bei Flash-Lite TTS, senken das weiter für alles, was nicht bei Bedarf generiert werden muss. Priority – mit 0,90 $ und 16,00 $ – ist für die Arbeit gedacht, die bei Bedarf generiert werden muss.

Drei praktische Konsequenzen:

• Einen Absatz neu zu generieren, ist billig; eine Serie neu zu generieren, ist eine Entscheidung. Bei diesen Raten ist der teure Teil einer Sprachpipeline nicht mehr die Inferenz, sondern wieder der Mensch, der den Take freigibt.

Die Texteingabe-Rate ist Rauschen. 0,50 $ pro Million Text-Token bei einem Skript von einigen tausend Wörtern ist ein Rundungsfehler im Vergleich zur Audioseite. Optimieren Sie das Skript nicht auf Länge.

• Der Cliff zum 31. Dezember ist real, und er verdoppelt den Audio-Tarif. Wenn Sie einen Rollout für 2027 planen, kalkulieren Sie mit dem Wert nach der Promo-Phase, nicht mit dem Launch-Wert – sonst planen Sie im Januar neu.

Die Zahl, die unabhängig ist, und diejenigen, die es nicht sind

Eine Zahl in diesem Launch stammt aus einer anderen Quelle als Google. In der Artificial Analysis Provider Voice Arena, erfasst am 24. September 2026, liegt Gemini 3.8 Flash TTS auf Rang 2 mit einem Elo von 1.260 über 1.999 Stichproben und 8 Arena-Stimmen, und Gemini 3.8 Flash-Lite TTS liegt auf Rang 6 mit 1.235 über 2.000 Stichproben. Beide liegen innerhalb der Konfidenzintervalle des jeweils anderen bei ±16 und ±17, die Rangliste sagt Ihnen also, dass sie hinsichtlich der Präferenz statistisch nicht unterscheidbar sind – was ein wirklich nützliches Ergebnis ist, denn es bedeutet, dass die günstigere Variante für die Zuhörer nicht messbar schlechter ist.

Alles andere ist Googles eigene Behauptung und sollte auch so gelesen werden: die Ausdruckssprache, die Sprachanzahlen, die Replikationsqualität. Die Arena liefert dir ein Präferenzranking und sonst nichts. Sie sagt dir nicht, wie jedes der beiden Modelle ein 40-minütiges Skript ohne Drift bewältigt, wie es sich bei einem Eigennamen verhält, den es noch nie gesehen hat, oder was nach einer Woche mit einer gestalteten Stimme passiert.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and Gemini 3.8 Flash-Lite TTS at rank 6 with an Elo of 1,235, with Cartesia Sonic 3.6, Qwen-Audio-3.0-TTS-Plus, Inworld Realtime TTS-2 and BreezeBlue Breeze TTS 2 filling the rows between and around them.

Das Lite-Modell ist zudem das bessere Argument dafür, dass es sich bei dem Paar um eine echte Aufteilung handelt und nicht um eine Marketing-Stufe. Eine Elo-Lücke von 25 Punkten, die innerhalb der Fehlerbalken liegt, gegenüber einer Preisabweichung von 33 %, hat die Form einer Entscheidung, die preissensible Pipelines fast immer zugunsten von Lite treffen sollten — und die Form einer Entscheidung, die latenzempfindliche Pipelines in die andere Richtung treffen sollten, da sich die beiden sowohl in puncto Takt als auch in puncto Rechnung unterscheiden.

Wo man es ausführt, und die ehrliche Version dieser Antwort

OrcaRouter hostet die Gemini 3.8 TTS-Endpunkte nicht. Das sollte man klar sagen, statt etwas anderes anzudeuten, denn das Nützliche, was wir über diese beiden Modelle sagen können, ist nicht, dass wir sie bereitstellen – das tun wir nicht –, sondern dass eine Anbieter-Preissenkung wie die Änderung vom 31. Dezember genau die Art von Ereignis ist, die Routing erst wertvoll macht.

OrcaRouter stellt über 200 Modelle hinter einen einzigen API-Schlüssel zum Listenpreis des Anbieters ohne Aufschlag bereit, sodass die Preisliste eines Anbieters das ist, was Sie zahlen, und eine Änderung daran bei uns noch am selben Tag live ist statt erst im nächsten Abrechnungszyklus. Für eine Sprachpipeline, die sich mitten in der Migration befindet, ist die Failover-Schicht wichtiger als der Katalog: Sie können einen Anfragepfad auf ein Modell legen, das noch evaluiert wird, ohne eine Produktionsroute darauf zu wetten, weil ein fehlschlagender Aufruf auf etwas ausweichen kann, das bereits bewiesen ist. Die Routing-DSL kombiniert mehrere Modelle zu einem Aufruf für die Fälle, in denen eine einzelne Stimme nicht gut genug ist, und Modellfusion beantwortet einen Prompt mit einem Panel, wenn die Antwort wichtiger ist als die Latenz.

Für die Gemini 3.8 TTS-Modelle selbst ist die Anlaufstelle, um sie aufzurufen, Googles eigene API und die Oberflächen, die Google am 23. September genannt hat. Was die beiden mit Ihrer Architektur machen – ein Aufruf für zwei Sprecher, Styling als Annotation, eine Stimme, die beschrieben statt ausgewählt werden kann –, ist der Teil, der den Einführungsrabatt überdauert.

Was als Nächstes ansehen

Drei Dinge werden darüber entscheiden, ob diese Generation ein grundlegender Wandel ist oder ein Feature.

Das erste ist Drift. Niemand hat eine Langzeitbewertung darüber veröffentlicht, ob der Zwei-Sprecher-Pfad über eine volle Stunde hinweg Identität hält, und bis jemand das tut, ist die pelican-Demo eine Demo. Das zweite ist die Lebensdauer der Stimme. Eine entworfene Stimme, die in einer Woche abläuft, ist ein Prototyp; eine Stimme, die aus einer gespeicherten Konfiguration neu abgeleitet werden kann, ist ein Produkt, und die Antwort hängt davon ab, welchen der beiden Identifikatoren man behält. Das dritte ist, was nach dem 31. Dezember passiert, wenn die Aktionsrate endet und die stündlichen Kosten einer Sprachpipeline sich über Nacht verdoppeln.

Keines davon ist im Launch-Post zu sehen. Alle drei sind in der Dokumentation zu sehen, und genau dort hört die Launch-Berichterstattung auf zu lesen.