
Benutzerdefiniertes Audio mit Gemini 3.8 Flash TTS erstellen und bereitstellen: Voice Design, Klonen und die zwei Uhren, die entscheiden
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 506 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 184 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Mit Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS können Sie jeweils eine Stimme aus einer schriftlichen Beschreibung erfinden, statt eine aus einer Liste auszuwählen, und beide wurden am 23. September 2026 in der Gemini API allgemein verfügbar. Die Schlagzeile, die alle wiederholen, ist das Stimmendesign. Der Teil, den man einplanen sollte, ist, was danach mit einer entworfenen Stimme passiert, denn der Anbieter bietet Ihnen zwei Möglichkeiten, eine zu behalten, und verknüpft mit jeder eine unterschiedliche Lebensdauer. Wählen Sie die falsche, und die Stimme, auf die Ihr Produkt angewiesen ist, läuft in einer Woche ab.
Das ist die Lücke in der bisherigen Berichterstattung zum Launch. Die Ankündigungsbeiträge erklären, dass man eine Stimme per Prompt entstehen lassen kann, und einige erwähnen das Klonen anhand einer 30-Sekunden-Probe. Keiner von ihnen erläutert das Speichermodell, das darüber entscheidet, ob eine Sprach-Pipeline aus einer Konfigurationsdatei reproduzierbar ist oder nach einem Zeitplan neu bereitgestellt werden muss. Dieser Artikel behandelt den gesamten Weg – Design, Speichern, Aufrufen und Bezahlen – mit den Preisen und den Kontingenten, wie Google sie veröffentlicht.
Was wurde am 23. September veröffentlicht
Zwei Modelle, ein API-Schema. Die Bezeichner sind gemini-3.8-flash-tts und gemini-3.8-flash-lite-tts, und Googles Dokumentation ist eindeutig: Beide verwenden „das exakt gleiche API-Schema und Prompting-Format“ – ein Wechsel zwischen ihnen ist eine Änderung an einem einzigen Parameter, kein Neuschreiben.
• Input — nur Text. Beide Modelle akzeptieren Text und geben Audio zurück; sie sind nicht multimodal und generieren keinen Text zurück.
• Ausgabe — WAV, 24 kHz Mono 16-Bit signed PCM am Unary-Endpunkt; headerloses PCM (audio/l16) am Streaming-Endpunkt; audio/mulaw und audio/alaw werden mit einer konfigurierbaren Abtastrate akzeptiert.
• Sprachen — 130 bei Flash TTS, 101 bei Flash-Lite TTS, automatisch aus dem Text erkannt statt in der Anfrage angegeben.
• Stimmen — 30 kuratierte Studio-Stimmen, die in der Dokumentation aufgeführt sind (darunter Kore und Puck), eine erweiterte Stimmbibliothek mit „hunderten“ weiteren, die über den voices-Endpunkt abfragbar sind, plus die beiden unten beschriebenen Erstellungswege.
• Regie — zeilenweise Steuerung der Sprechweise, Zwei-Sprecher-Szenen, die aus einem einzigen Skript inszeniert werden, und nonverbale Hinweise wie <laughs>, <sigh> und |mhm|, die direkt ins Transkript geschrieben werden.
Die beiden Stufen existieren, weil die Workloads auseinandergelaufen sind. Flash TTS ist auf maximale akustische Wiedergabetreue und komplexe schauspielerische Leistung ausgelegt; Flash-Lite TTS wird in Googles eigenen Worten als „Arbeitstier-Ersatz“ für gemini-3.1-flash-tts-previewbeschrieben, ausgerichtet auf Massen-Dubbing, Vorlesefunktionen und Voice-Agent-Kaskaden. Beide ersetzen ein einzelnes Vorschaumodell, das seit April 2026 in der API war; wenn Sie also die Vorschau verwendet haben, ist die Migration eine Entscheidung über die Stufe und nicht ein Versionssprung.

Das Entwerfen einer Stimme ist ein Prompt, und das verändert den Review-Schritt.
Die Erstellungsoberfläche ist das wirklich Neue in dieser Generation. Eine prompt-basierte Stimme wird aus einer natürlichsprachlichen Beschreibung – Rolle, Akzent, stimmlicher Charakter – erzeugt und liefert eine Kennung zurück, die Sie wiederverwenden. In der API ist dies ein Aufruf zur Stimmerstellung mit store: true und einer Prompt-Eingabe; in Googles eigenen Beispielen reichen die Beschreibungen von einem energiegeladenen Melbourne-DJ bis zu einem japanischen Drachen. Sobald sie erstellt wurde, wird die Stimme in einer Sprachausgabe-Anfrage über ihre Kennung referenziert, und die Stilanweisungen pro Anfrage können dann minimal oder leer sein, weil der Charakter bereits in der Stimme steckt.
Die praktische Konsequenz ist eine Änderung des Workflows, nicht nur ein Feature. Voice-Casting war früher eine Lizenzverhandlung oder eine Studio-Buchung, was bedeutete, dass die Stimmauswahl einmalig und früh stattfand und die Überprüfung überstand, weil eine Änderung teuer war. Wenn eine Stimme ein Absatz Text ist, wird Casting zu einem Design-Token – etwas, das ein Produktmanager am Dienstag neu auswürfeln lassen kann. Teams, die den Beschreibungs-String unter Versionskontrolle stellen und die generierte Voice-ID als Build-Artefakt behandeln, erhalten konsistente Ergebnisse über alle Umgebungen hinweg. Bei Teams, die Stimmen in AI Studio von Hand erstellen, ist das nicht der Fall, und der Fehler wird wie ein unerklärlicher Unterschied zwischen Staging- und Produktions-Audio aussehen.
Die beiden Uhren
Das ist der Abschnitt, den die Launch-Posts überspringen. Google lässt dich eine entworfene oder replizierte Stimme in einem von zwei Zuständen behalten, und sie laufen mit völlig unterschiedlicher Geschwindigkeit ab.
• Gespeicherte Stimmen — mit aktivierter Speicherung erstellt — befinden sich in Ihrem Projekt und unterliegen einem Kontingent von 200 Stimmen pro Projekt mit einer Gültigkeitsdauer von einem Jahr.
• Zustandslose Schlüssel — die Stimmreplikation kann einen vom Client verwalteten Schlüssel (die voicekey_…Form) statt einer gespeicherten Kennung zurückgeben, und dieser Schlüssel hat eine Lebensdauer von sieben Tagen.
Zusammen gelesen sind diese beiden eine Design-Anweisung. Eine gespeicherte Stimme ist eine einjährige Verpflichtung und eine harte Obergrenze von 200 pro Projekt – großzügig für ein Produkt mit fester Besetzung und nutzlos für alles, was pro Kunde eine neue Stimme erzeugt. Der zustandslose Schlüssel ist das Gegenteil: kein Kontingentdruck, aber ein Schlüssel, den du wöchentlich neu ausstellen musst, was bedeutet, dass deine Anwendung einen Aktualisierungspfad braucht und deine Infrastruktur rotierende Anmeldedaten speichern muss. Keines von beiden ist falsch. Wenn du dich entscheidest, ohne zu bemerken, wofür du dich entschieden hast, verstummt ein Voice-Agent am achten Tag.
Zwei weitere Eigenschaften sind an die Replikation geknüpft und sollten bekannt sein, bevor man einem Rechtsteam irgendetwas verspricht. Das Erstellen einer replizierten Stimme erfordert eine mündliche Einwilligungsaufnahme des Stimmeneigentümers, die mit dem Referenzsprecher übereinstimmen muss – eine gesprochene Prüfung, kein Kontrollkästchen. Und die Ausgabe trägt Provenienz: Jeder Clip wird mit SynthID mit einem Wasserzeichen versehen, und replizierte Stimmen tragen zusätzlich C2PA-Inhaltsnachweise. Der Designweg ist bewusst der schwerer zu missbrauchende, und beide Hürden sind struktureller Natur statt bloßer Richtlinienaussagen.
Eine Diskrepanz, die es wert ist, hervorgehoben statt aufgelöst zu werden. In der Tabelle der unterstützten Modelle von Google werden Voice Design und Voice Replication als bei beiden 3.8-TTS-Modellen verfügbar aufgeführt. Die meiste Berichterstattung zum Launch beschreibt Replication speziell als Teil der Flash-TTS-Story. Wenn Replication für Ihre Entscheidung zwischen den Stufen wichtig ist, prüfen Sie es anhand der Dokumentation für die Stufe, die Sie ausliefern möchten, statt einer der beiden Zusammenfassungen zu vertrauen.
Was eine Stunde Audio kostet
Google rechnet Sprache in Tokens ab, nicht in Zeichen oder Sekunden, und die Umrechnung ist veröffentlicht: Audio wird mit 25 Tokens pro Sekunde Ausgabe berechnet, was 90.000 Tokens pro Stunde entspricht. Das macht die Rechnung ungewöhnlich sauber, und diese Zahl gehört ins Budget, nicht der Preis pro Million.
Flash TTS Standard — 0,50 $ pro Million Text-Token-Eingabe, 9,00 $ pro Million Audio-Token-Ausgabe bis zum 31. Dezember 2026, danach 1,00 $ und 18,00 $. Batch und Flex kosten 0,25 $ und 4,50 $; Priority kostet 0,90 $ und 16,20 $.
Flash-Lite TTS Standard — 0,50 $ und 6,00 $ bis zum selben Datum, danach 1,00 $ und 12,00 $. Batch und Flex 0,25 $ und 3,00 $; Priority 0,90 $ und 10,80 $.
• Kurz gesagt — Flash TTS kostet während des Aktionszeitraums etwa 0,81 $ pro Stunde erzeugtem Audio und danach etwa 1,62 $; Flash-Lite TTS liegt bei etwa 0,54 $ und dann bei 1,08 $.
• Gegenüber dem Modell, das es ersetzt — gemini-3.1-flash-tts-preview kostet 1,00 $ und 20,00 $ pro Million, sodass die Audioausgabe-Position bei Flash TTS um 55 Prozent und bei Flash-Lite TTS um 70 Prozent sank.
Planen Sie nicht anhand der Aktionszahl. Google veröffentlicht beide Spalten in derselben Tabelle, was bedeutet, dass der Januar-Tarif kein Gerücht ist, das erst später entdeckt wird – er steht heute auf der Karte, und jede Schätzung pro tausend Minuten, die auf 0,81 $ basiert, muss eine Verdopplung überstehen.
Eine unabhängige Zahl und mehrere, die es nicht sind.
Googles Ankündigung beginnt mit Benchmark-Ergebnissen, und diese sollten genau als das gelesen werden, was sie sind. Das Unternehmen sagt, Flash TTS habe mit 71,4 den ersten Platz in Hume AIs Voice Design Benchmark belegt, die Akzentmodellierung mit 60,8 angeführt, und dass Flash TTS und Flash-Lite TTS auf Humes Overall Quality Index die Plätze eins und zwei belegten, mit starken Platzierungen bei der Blindpräferenz auf Voice Arena für Japanisch, brasilianisches Portugiesisch, Vietnamesisch, Modernes Hocharabisch, mexikanisches Spanisch und Hindi. Alles vom Anbieter berichtet, keiner der Durchläufe öffentlich.
Es gibt ein Detail in dieser Liste, das Beachtung verdient. Alan Cowen, der als Autor von Googles Ankündigung aufgeführt wird, ist Gründer von Hume AI – des Labors, dessen Voice Design Benchmark die Schlagzeilenzahl liefert. Das macht die Zahl nicht falsch, und Humes Benchmark ist echt, aber die beiden sind nicht unabhängig voneinander, und wer die 71,4 abwägt, sollte das wissen, bevor er sie als Bestätigung durch Dritte weitergibt.
Die unabhängig erhobene Zahl steht auf der Provider Voice Arena von Artificial Analysis, erfasst für diesen Artikel am 24. September 2026: Gemini 3.8 Flash TTS liegt mit einem Elo von 1.260 und einem 17-Punkte-Intervall über 1.999 Stichproben auf Platz zwei, hinter Cartesia Sonic 3.6 mit 1.273. Gemini 3.8 Flash-Lite TTS liegt mit 1.235 auf Platz sechs. Das ersetzte Modell, Gemini 3.1 Flash TTS, liegt mit 1.199 über 3.430 Stichproben auf Platz zehn. Präferenz von Blind-Hörern, nicht die eigene Evaluation eines Labors – und die einzige Qualitätszahl hier, die Google nicht in Auftrag gegeben hat.

Wo man es ausführen kann und wo noch nicht
Beide Modelle sind heute in der Gemini API und im Google AI Studio ohne Warteliste verfügbar. Die Consumer- und Enterprise-Oberflächen werden eher gestaffelt eingeführt als bereits ausgeliefert: Flash TTS kommt zu Gemini Notebook und Flash-Lite TTS zu Google Vids, der Zugang zu Gemini Enterprise wird als demnächst verfügbar beschrieben, und Voice-Remixing – die Anpassung von Timbre, Tonhöhe, Tempo und Akzent einer vorhandenen Stimme – wird als zukünftige Funktion und nicht als gegenwärtige aufgeführt. Wenn Ihr Plan von Remixing abhängt, gibt es das noch nicht.
Auf unserer eigenen Seite, Ehrlichkeit zuerst: Die Gemini-3.8-TTS-Endpunkte stehen nicht auf der Routing-Tabelle von OrcaRouter. Die Generation, die sie ersetzen, ist – google/gemini-3.1-flash-tts-preview ist im Katalog enthalten, zu denselben 1,00 $ und 20,00 $ pro Million Tokens, die Google veröffentlicht, weil der Listenpreis des Anbieters ohne Aufschlag durchgereicht wird, und sie antwortet auf demselben /v1/audio/speech Endpunkt, den Ihr OpenAI-kompatibles SDK bereits anspricht. Das ist für eine Sprach-Workload wichtiger, als es klingt, denn was Sie tatsächlich kaufen, ist ein stabiler Endpunkt, den Ihre Anwendung aufrufen kann, während sich die Modelle dahinter ändern. Ihr Code enthält einen Modell-String; der Katalog enthält das Routing. Wenn sich Googles Aktionsfenster am 31. Dezember schließt und Flash TTS doppelt so teuer wird, ändert sich der Preis eines gerouteten Modells noch am selben Tag statt erst zur nächsten Vertragsverlängerung – und ein Modell, das ausfällt, weicht per Failover aus, anstatt Ihre Narrations-Warteschlange mitzureißen.

Wenn Sie diese Generierung bewerten, bevor Sie sich festlegen, ist das günstige Experiment ein zweistufiges. Lassen Sie dasselbe Skript durch Flash TTS und Flash-Lite TTS laufen, denn das Schema ist identisch und der Unterschied ist ein Parameter – dann entscheiden Sie anhand Ihres eigenen Audios statt anhand eines Benchmark-Diagramms und prüfen Sie bei Artificial Analysis, ob der Qualitätsunterschied trotz der Fehlerbalken Bestand hat, bevor Sie den Aufpreis zahlen. Bei einem Großformat-Narrationsprojekt ist der Aufpreis echtes Geld; bei einem Support-Bot, der eine Telefonnummer laut vorliest, bringt er Ihnen nicht unbedingt etwas, das ein Zuhörer hören kann.
