
Gemini 3.8 Flash TTS sagt Hallo: Google teilt seine Sprachlinie in zwei und senkt den Preis
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
Der Anbieter hat am 23. September 2026 zwei Sprachmodelle veröffentlicht, und die Ankündigung ist so geschrieben, als wäre die Stimmenqualität die Schlagzeile. Das ist sie nicht. Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS sind die ersten Text-to-Speech-Modelle, die der Anbieter in der Gemini Developer API zu einem Preis unterhalb des Vorschaumodells anbietet, das sie ersetzen – und für alle, die woanders pro Zeichen bezahlt haben, ist das der Teil, der eine Budgetposition verändert. Der Audio-Ausgabesatz für Gemini 3.8 Flash TTS beträgt bis Ende 2026 9,00 US-Dollar pro Million Tokens. Audio wird mit 25 Tokens pro Sekunde abgerechnet, was ungefähr 0,02 Cent pro Sekunde generierter Sprache entspricht. Das Modell, das es ablöst, Gemini 3.1 Flash TTS Preview, war mit 20,00 US-Dollar pro Million Audio-Tokens bepreist.
Die zweite Hälfte der Geschichte ist, dass es jetzt zwei Modelle gibt, nicht eines. Google hat die Reihe aufgeteilt: Flash TTS bietet den vollständigen Sprachumfang und die höhere Audiorate, Flash-Lite TTS bietet eine kürzere Sprachliste und ist günstiger. Das ist eine andere Ausgestaltung als die Regelung mit einem einzigen Vorschaumodell, die seit April in der API gilt, und sie verrät Ihnen, wie Google den Markt sieht — eine kleine Anzahl von Anwendungen, die 130 Sprachen und Voice-Cloning benötigen, und eine viel größere Anzahl, die eine kompetente englische Stimme für einen Support-Bot und sonst nichts benötigen.
Was wurde am 23. September tatsächlich ausgeliefert?
Beide Modelle sind ab der Ankündigung allgemein auf der Gemini API und in AI Studio verfügbar, nicht hinter einer Warteliste gesperrt. Die Namen in der API lauten gemini-3.8-flash-tts und gemini-3.8-flash-lite-tts.
• Flash TTS — 130 Sprachen, Sprache automatisch aus dem Text erkannt, 30 vorgefertigte Studio-Stimmen, darunter Kore und Puck.
Flash-Lite TTS — 101 Sprachen, dieselbe Voice-Design-Oberfläche, positioniert als High-Volume-Tarif.
• Beides — Stimmdesign aus einer natürlichsprachigen Beschreibung, Zeile-für-Zeile-Regieanweisungen, Inszenierung von Zwei-Sprecher-Szenen und nonverbale Signale, die direkt ins Skript geschrieben werden.
• Ausgabe — WAV 24 kHz Mono 16-Bit vorzeichenbehaftetes PCM am unären Endpunkt; headerloses PCM (audio/l16) am Streaming-Endpunkt; audio/mulaw und audio/alaw werden ebenfalls akzeptiert, mit einer konfigurierbaren Abtastrate.
Die Tarifkarte pro Million Tokens ist es wert, vollständig gelesen zu werden, denn die Stufen unterscheiden sich um mehr als die Zahl in der Überschrift:
• Flash TTS Standard — 0,50 $ für Text-Eingabe / 9,00 $ für Audio-Ausgabe, ab dem 31. Dezember 2026 steigend auf 1,00 $ / 18,00 $.
• Flash TTS Batch und Flex — 0,25 $ / 4,50 $.
• Flash TTS Priority — 0,90 $ / 16,20 $.
• Flash-Lite TTS Standard — 0,50 $ / 6,00 $, steigt nach dem 31. Dezember 2026 auf 1,00 $ / 12,00 $.
• Flash-Lite TTS Batch und Flex — $0,25 / $3,00.
• Flash-Lite TTS-Priorität — 0,90 $ / 10,80 $.
• Gemini 3.1 Flash TTS Preview, zum Vergleich — 1,00 $ / 20,00 $, Batch 0,50 $ / 10,00 $.
Der Aktionszeitraum ist der Punkt, den man beachten sollte. Google hat beide neuen Modelle bis Ende des Jahres zum halben Preis angeboten und die Zahlen nach der Aktion in derselben Tabelle veröffentlicht. Wer die Kosten pro tausend Minuten modelliert, sollte die Januar-Zahl verwenden, nicht die September-Zahl.

Voice Design ist die wirklich neue Fähigkeit
Vorgefertigte Stimmen sind Grundvoraussetzung. Was Google in 3.8 hinzugefügt hat, ist eine Möglichkeit, eine Stimme mit Worten zu beschreiben und sie zu erhalten, sowie eine Möglichkeit, eine Stimme anhand einer kurzen Sprachprobe zu klonen – mit beigefügter Einwilligungsprüfung.
Voice-Design nimmt einen natürlichsprachlichen Prompt entgegen – Tempo, Timbre, Akzent, genau das, wofür man sonst einen ganzen Nachmittag mit Vorsprechen verbringen würde – und liefert eine nutzbare Stimme ohne Referenzaufnahme. Voice-Replikation funktioniert umgekehrt: Sie liefern eine 30-Sekunden-Probe, das System überprüft die Einwilligung, und die resultierende Stimme wird mit einem SynthID-Wasserzeichen und C2PA-Credentials im generierten Audio gekennzeichnet. Voice-Remixing, mit dem Sie eine vorhandene benutzerdefinierte Stimme mischen oder ändern können, ist als „demnächst verfügbar“ aufgeführt statt als bereits veröffentlicht.
Benutzerdefinierte Stimmen gibt es in zwei Varianten, und sie verhalten sich so unterschiedlich, dass die Unterscheidung in der Produktion wichtig ist. Zustandsbehaftete benutzerdefinierte Stimmen werden projektbezogen gespeichert, sind auf 200 pro Projekt begrenzt und haben eine Lebensdauer von einem Jahr. Zustandslose Stimmen werden über einen voicekey_...-Handle angesprochen und laufen nach sieben Tagen ab. Wenn Ihre Anwendung pro Kunde eine Stimme bereitstellt, sind die Obergrenze und die TTL die beiden Zahlen, die entscheiden, ob Sie eine eigene Speicherschicht benötigen.
Die Vortragssteuerung ist die andere Hälfte des „Neuen“. Sie können eine Zeile so vortragen lassen, wie Sie einen Schauspieler führen würden – Tempo, Betonung, emotionale Ebene –, statt nur eine Stimme auszuwählen und zu hoffen. Szenen mit zwei Sprechern lassen sich in einem einzigen Aufruf inszenieren. Und nonverbale Lautäußerungen sind vollwertige Skriptelemente: <laughs>, <sigh> und <gasp> als Inline-Cues, plus |mhm| und |yeah| für die kleinen Backchannel-Geräusche, die eine synthetische Konversation wie eine Konversation klingen lassen. Beim Vorlesen langer Texte wird behauptet, dass die Sprecheridentität mit minimaler Drift erhalten bleibt – der Fehlermodus, der zuerst auftritt, wenn Sie ein 40-minütiges Hörbuchkapitel erzeugen.
Die Benchmarks und wer sie durchgeführt hat
Googles Material zur Markteinführung stützt sich auf zwei externe Bewertungen und eine Reihe von Arena-Platzierungen. All dies sind Angaben des Anbieters – Google zitiert sie, und die zugrunde liegenden Durchläufe sind nicht öffentlich –, daher sind sie als Behauptungen und nicht als Messungen zu behandeln.

• Hume AI Voice Design Benchmark — Gemini 3.8 Flash TTS belegte mit 71,4 den ersten Platz und bei der Akzentmodellierung mit 60,8 den ersten Platz.
• Hume-Gesamtqualitätsindex — Flash TTS an erster Stelle, Flash-Lite TTS an zweiter Stelle.
• Blinde Präferenz in der Speech Arena – Spitzenplatzierungen in Japanisch, brasilianischem Portugiesisch, Vietnamesisch, modernem Standardarabisch, mexikanischem Spanisch und Hindi erzielt.
• Im Vergleich zu Gemini 3.1 Flash TTS — Google gibt an, Verbesserungen bei der Konsistenz von Langform-Inhalten und bei der Steuerung von Zwei-Sprecher-Drehbüchern erzielt zu haben, genau die beiden Dinge, für die die Funktionen zur Sprechregie entwickelt wurden.
Eine dokumentierte Diskrepanz ist es wert, hervorgehoben zu werden, denn sie wird jeden verwirren, der Quellen vergleicht. Der Blogbeitrag beschreibt eine Bibliothek mit über 2.000 produktionsbereiten Stimmen. Die Entwicklerdokumentation beschreibt „Hunderte" von Stimmen in der Extended Voice Library neben den 30 vorgefertigten Studio-Stimmen. Die Berichterstattung Dritter hat erneut Zahlen genannt, die eine Größenordnung höher liegen. Diese lassen sich von außen nicht in Einklang bringen — die ehrliche Lesart ist, dass das vorgefertigte Set, das man standardmäßig erhält, 30 umfasst, die Extended Voice Library größer und vage beschrieben ist und die großen Zahlen einen Katalog meinen, der von Nutzern erstellte Stimmen einschließt. Wenn eine Stimmennzahl für Ihre Entscheidung tragend ist, testen Sie die spezifische Stimme, die Sie benötigen, anstatt einer der drei Zahlen zu vertrauen.
Was es bedeutet, wenn du darauf aufbaust
Die praktische Veränderung besteht darin, dass Text-to-Speech von einem Spezialposten zu etwas geworden ist, das man in dasselbe Kostenmodell wie die eigenen Sprach-Tokens aufnehmen kann. Bei 25 Tokens pro Sekunde sind es für eine Stunde generiertes Audio 90.000 Audio-Tokens, was zum Aktionspreis von Flash-Lite etwa 54 Cent entspricht. Das ist günstig genug, dass die interessante Frage nicht mehr lautet: „Können wir uns eine synthetische Stimme leisten?“, sondern: „Welche der beiden Stufen braucht diese Oberfläche?“
Die zweite praktische Veränderung ist, dass ein brandneues TTS-Modell genau die Art von Sache ist, die man ausprobieren möchte, ohne einen Produktionspfad darauf zu setzen. Das spricht dafür, ein neues Modell hinter einen Router zu stellen, statt es direkt zu verdrahten: OrcaRouter stellt über 200 Modelle hinter einem einzigen Schlüssel zum Listenpreis des Anbieters ohne Aufschlag bereit, und sein automatisches Failover bedeutet, dass ein neuer Speech-Endpunkt, der unter Last wackelt, auf ein Modell zurückgestuft wird, dem Sie bereits vertrauen, statt den Anruf abzubrechen. Wir hosten die Gemini 3.8 TTS-Endpunkte nicht – diese stammen aus Googles eigener API –, aber die Textebene unter der Stimme und der Fallback-Pfad, wenn ein Syntheseaufruf fehlschlägt, sind genau die Teile, für die ein Router tatsächlich da ist.
Was fehlt noch?
Beim Launch fehlen drei Dinge, und jedes davon ist eine echte Einschränkung, keine Kleinigkeit.
Es gibt keine veröffentlichte unabhängige Bewertung. Googles Hume-Zahlen sind der Anbieter, der einen Benchmark eines Dritten zitiert, was besser als nichts und schlechter als ein Audit ist. Bis Artificial Analysis oder ein Äquivalent einen eigenen Durchlauf mit denselben Modellen veröffentlicht, sollte jede Qualitätsaussage in diesem Artikel als Behauptung gelesen werden.
Es gibt keine Open-Weights-Option. Beide Modelle sind geschlossen und ausschließlich über eine API verfügbar, was sie in eine andere Kategorie einordnet als die offenen Sprachmodelle, die in derselben Arena aufgeschlagen sind. Wenn Ihr Deployment erfordert, das Modell selbst zu betreiben, richtet sich dieser Launch nicht an Sie.
Und die Aktionspreise enden. Der Tarif für Flash TTS im Januar 2027 ist doppelt so hoch wie der September-Tarif, und jeder Business Case, der auf den Launch-Zahlen aufbaut, muss im ersten Quartal neu erstellt werden. Das ist keine Kritik – beide Zahlen von Anfang an zu veröffentlichen, ist ehrlicher als bei den meisten –, aber es ist die Zahl, die in die Tabelle gehört.
Google hat nicht bekannt gegeben, ob Gemini 3.1 Flash TTS Preview abgekündigt wird, sondern nur, dass Flash-Lite TTS als sein Arbeitspferd-Ersatz positioniert wird. Wer noch das Vorschaumodell verwendet, sollte eine Migration planen, anstatt auf eine Abschaltungsmitteilung zu warten.

