Googles schnelles, kosteneffizientes Text-zu-Sprache-Modell für die Echtzeit-Audioerzeugung, zugänglich über OrcaRouter.
google/gemini-3.1-flash-tts-preview ist ein Text-to-Speech-Modell von Google, das zur Gemini-Flash-Familie gehört. Es nimmt Texteingaben entgegen und erzeugt gesprochene Audioausgabe. Das Modell ist…
Die primäre Fähigkeit besteht darin, geschriebenen Text in natürlich klingende Sprache umzuwandeln. Das Modell ist auf Geschwindigkeit ausgelegt und nutzt die Flash-Architektur, um die Latenz zu reduzieren. Es unterstützt mehrere Sprachen und Stimmen? Die Sprach- und Stimmunterstützung dieser speziellen Vorschau wird in den bereitgestellten Fakten nicht näher erläutert; Sie sollten die Google-Dokumentation für aktuelle Sprachoptionen konsultieren. Das Modell kann verschiedene Texteingaben verarbeiten, einschließlich Satzzeichen, Zahlen und Abkürzungen, und erzeugt eine gesprochene Ausgabe, die den beabsichtigten Rhythmus und Ton widerspiegelt.
Die besten Anwendungsfälle umfassen jede Anwendung, bei der eine Sprachgenerierung mit geringer Latenz entscheidend ist: Echtzeit-Sprachassistenten, Live-Übersetzungssynchronisation, interaktive Chatbots mit Sprachausgabe und automatische Telefonsysteme. Es eignet sich auch hervorragend für die Stapelverarbeitung, wenn Sie viele kurze Audioclips schnell generieren müssen. Inhaltsproduzenten können es für dynamische Sprachaufnahmen in Videospielen oder Hörbüchern verwenden. Da die Ausgabekosten im Verhältnis zur Eingabe hoch sind, ist es am wirtschaftlichsten, wenn das Ausgabeaudio prägnant ist.
Falls Ihr Anwendungsfall extrem lange Audioerzeugung umfasst (z. B. stundenlange Sprache) oder keine geringe Latenz erfordert, sollten Sie ein gebündeltes TTS-Modell mit niedrigeren Kosten pro Token in Betracht ziehen. Für Anwendungen, bei denen das Eingabevolumen dominiert (z. B. viele kurze Aufforderungen), machen die günstigen Eingabekosten dieses Flash-Modell attraktiv. Für Szenarien, die eine sehr hohe Ausgabequalität erfordern – wie emotional ausdrucksstarke Charaktere – könnten Sie Premium-TTS-Modelle von Google oder anderen Anbietern evaluieren. Überwachen Sie stets das gesamte Tokenvolumen und die Latenzanforderungen.
Als Gemini Flash-Modell ist diese TTS-Variante für niedrige Latenz optimiert. Spezifische Latenz-Benchmarks (z.B. Zeit bis zum ersten Audiopaket) sind in den verfügbaren Fakten nicht angegeben. In der Praxis antworten Flash-Modelle bei kurzen Eingaben oft innerhalb von Hunderten von Millisekunden. Die Latenz kann je nach Ausgabelänge, Netzwerkbedingungen und gleichzeitiger Anfragelast variieren. Das Routing von OrcaRouter kann einen minimalen Overhead hinzufügen. Testen Sie bei Echtzeitanwendungen mit Ihren erwarteten Audiodauern unter Last.
Stärken umfassen geringe Eingabekosten ($1.00/1M Tokens), schnelle Generierung und Googles robuste Infrastruktur. Der Vorschau-Status bedeutet, dass Modellqualität und Verfügbarkeit sich ändern können. Eine Einschränkung sind die hohen Ausgabekosten ($20.00/1M Tokens) im Vergleich zu Textmodellen. Zudem wird die Ausgabe-Audioqualität – wie Natürlichkeit, Akzentvielfalt und Prosodie – hier nicht bewertet. Sie sollten die Stimmqualität des Modells für Ihre spezifische Domäne (z. B. technisches Fachvokabular, emotionale Bandbreite) vor der Produktionseinführung evaluieren.
In den verfügbaren Fakten werden keine Benchmark-Ergebnisse für google/gemini-3.1-flash-tts-preview bereitgestellt. TTS-Modelle werden häufig anhand von Metriken wie Mean Opinion Score (MOS) für Natürlichkeit, Word Error Rate (WER) für Verständlichkeit und Latenz-Perzentilen bewertet. Ohne spezifische Zahlen sollten Sie Ihre eigene Bewertung mit repräsentativen Prompts durchführen, um Qualität und Geschwindigkeit im Hinblick auf Ihre Anforderungen zu bewerten. OrcaRouter fügt keine Modellleistung hinzu oder verändert sie.
Die verfügbaren Fakten geben keine Auskunft über unterstützte Sprachen oder Akzentfähigkeiten für diese TTS-Vorschau. Googles breitere TTS-Modelle unterstützen in der Regel mehrere Sprachen, aber die Abdeckung dieser spezifischen Variante ist unbekannt. Sie sollten mit mehrsprachigem Text testen, um die Ausgabequalität zu bestätigen. Für Englisch ist die Leistung angesichts der Investitionen von Google wahrscheinlich robust. Für weniger verbreitete Sprachen sollten Sie Google direkt kontaktieren oder mit Beispieltext über die API von OrcaRouter testen.
Die Preisgestaltung folgt den offiziellen Tarifen von Google ohne Aufschlag von OrcaRouter. Eingabetoken (Text) kosten 1,00 $ pro 1 Million Token. Ausgabetoken (Audio) kosten 20,00 $ pro 1 Million Token. Ausgabetoken werden pro Audioeinheit generiert; das genaue Verhältnis von Token zu Zeit ist nicht angegeben. Ihnen werden sowohl die Eingabe- als auch die Ausgabetoken für jede Anfrage in Rechnung gestellt. Es gibt keine zusätzlichen Plattformgebühren oder Mindestausgaben. Die Abrechnung erfolgt über die bestehenden Zahlungsmethoden von OrcaRouter.
Input tokens sind 20x günstiger als Output tokens. Dies fördert das Senden längerer Text-Prompts (innerhalb der Token-Grenzen), um proportional längere Audio-Ausgaben zu generieren, da die Input-Kosten niedrig bleiben. Zum Beispiel kann die Erzeugung einer 1-minütigen Audio-Clips viele Output-Tokens zu $20/1M verbrauchen, während der Text-Prompt nur ein paar Cent kostet. Optimieren Sie, indem Sie die Ausgabe wann immer möglich kurz halten. Wenn Ihr Anwendungsfall sehr lange Audios generiert, können die Output-Kosten pro Anfrage schnell steigen.
Die verfügbaren Fakten erwähnen keine Caching- oder Rabattprogramme für dieses Modell auf OrcaRouter. Die Preisgestaltung von OrcaRouter erfolgt als Durchlaufposten zu den Tarifen des Anbieters. Sie sollten bei OrcaRouter nach Mengenrabattoptionen oder reservierter Kapazität fragen, die modellübergreifend gelten könnten. Da die Kosten für Ausgabe-Token hoch sind, kann das Caching generierter Audio-Segmente für wiederholte Verwendung (z. B. häufige Antworten) die Gesamtausgaben erheblich reduzieren.
Vergleiche werden nicht direkt bereitgestellt. Googles Flash TTS gilt jedoch als kosteneffizient für den Echtzeiteinsatz mit niedrigen Eingabekosten. Andere TTS-Modelle (z. B. OpenAI TTS, ElevenLabs) können unterschiedliche Preisstrukturen haben – oft wird pro Zeichen oder pro Sekunde Audio abgerechnet. Die Preisgestaltung pro Token dieses Modells kann bei sehr langen Audiodateien teurer sein, bei kurzen, stoßweisen Ausgaben jedoch günstiger. Bewerten Sie Ihre erwarteten Token-Volumen im Vergleich zu anderen Angeboten im OrcaRouter-Katalog.
Verwenden Sie einen beliebigen OpenAI-kompatiblen Client. Setzen Sie die Basis-URL auf https://api.orcarouter.ai/v1, den API-Schlüssel aus Ihrem OrcaRouter-Konto und die Modell-ID auf "google/gemini-3.1-flash-tts-preview". Senden Sie eine Chat-Completion-Anfrage mit einer Benutzernachricht, die den zu sprechenden Text enthält. Die Antwort wird Audioinhalte enthalten (wahrscheinlich als base64-codierter Chunk oder URL). Das genaue Ausgabeformat hängt von der Implementierung des Google-Modells ab. Lesen Sie die Dokumentation von OrcaRouter für Streaming-Unterstützung und Antwortanalyse.
Standard-Chat-Vervollständigungsparameter gelten: Modell, Nachrichten (mit Rolle und Inhalt) und optional Temperatur oder top_p für Ausgabevariabilität (weniger relevant für TTS). Für die Sprachauswahl unterstützt Googles Modell möglicherweise einen zusätzlichen Parameter (z. B. Sprachname). Die verfügbaren Fakten listen keine spezifischen TTS-Parameter auf. Möglicherweise müssen zusätzliche Felder wie „voice“ oder „language“ im Request-Body übergeben werden. Konsultieren Sie Googles API-Dokumentation für das Vorschaumodell für genaue Optionen.
Es ist üblich, dass TTS-Modelle Streaming-Audio unterstützen, bei dem Audio-Chunks während der Generierung gesendet werden. Die bereitgestellten Fakten bestätigen keine Streaming-Unterstützung für dieses Vorschaumodell. Wenn Streaming aktiviert ist, können Sie den Parameter stream auf true in Ihrer API-Anfrage setzen und die Chunks verarbeiten, sobald sie eintreffen. OrcaRouter unterstützt Streaming für kompatible Modelle. Testen Sie mit einer einfachen Anfrage, ob Audio inkrementell oder als vollständiger Blob zurückgegeben wird.
Wenn Sie bereits eine OpenAI-kompatible API verwenden, ändern Sie die Basis-URL auf https://api.orcarouter.ai/v1 und aktualisieren Sie die Modell-ID. Aktualisieren Sie Ihre Anfrageparameter, um den Google TTS-Spezifikationen zu entsprechen (z. B. Sprachname). Möglicherweise müssen Sie die Handhabung der Audioausgabe anpassen, falls sich das Format unterscheidet (z. B. MP3 vs. WAV). Testen Sie mit Beispiel-Prompts, um die Qualität zu überprüfen. Da die Preisgestaltung ohne Aufschlag erfolgt, können sich Ihre Kosten je nach Token-Nutzung ändern. Es sind keine speziellen Migrationswerkzeuge erforderlich.
OpenAI bietet TTS-Modelle (tts-1, tts-1-hd) mit einer Preisgestaltung pro Zeichen (~0,015 $ pro 1.000 Zeichen). Im Gegensatz dazu verwendet Googles Modell eine token-basierte Preisgestaltung, die für kurze Eingaben günstiger, für lange Ausgaben jedoch teurer sein kann. OpenAIs TTS unterstützt mehrere Stimmen und Sprachen; die genauen Details von Googles Vorschau sind nicht vollständig bekannt. Latenz: Sowohl Flash als auch OpenAIs Modelle sind auf niedrige Latenz ausgelegt. Die Qualität ist subjektiv; Sie sollten mit Ihren Inhalten testen, um Natürlichkeit und Prosodie zu vergleichen.
Google bietet auch Premium-TTS-Modelle (z. B. WaveNet, Studio) über seine Cloud Text-to-Speech API an. Diese Modelle berechnen in der Regel pro Zeichen des gesendeten Texts, was bei sehr langem Audio günstiger sein kann, aber höhere Kosten pro Anfrage verursacht. Der Flash TTS ist schneller und hat eine einfachere Eingabepreisgestaltung (pro Token), bietet aber möglicherweise weniger Sprachoptionen. Für hochwertige, emotional ausdrucksstarke Sprache ist ein Premium-Modell möglicherweise besser geeignet. Für Geschwindigkeit und niedrige Kosten pro Eingabe ist die Flash-Variante vorteilhaft.
Wenn Sie Echtzeit-Antworten benötigen und kurze Eingabetexte haben (viele kleine Anfragen), sind die niedrigen Eingabekosten und die schnelle Generierung dieses Flash-Modells ideal. Bei sehr langer Audiogenerierung (z. B. vollständige Hörbücher) könnte ein Modell, das pro Zeichen Eingabe berechnet (wie Googles Standard-TTS), günstiger sein, da Kosten für Ausgabe-Token vermieden werden. Berücksichtigen Sie auch die Stimmenvielfalt und Sprachunterstützung: Wenn Sie viele verschiedene Stimmen benötigen, prüfen Sie, ob diese Vorschau dies unterstützt. Testen Sie beide Optionen mit Ihrem Workload, bevor Sie sich festlegen.
OpenAI-kompatibel — behalte dein bisheriges SDK
https://api.orcarouter.ai/v1voice| Eingabe / 1M Tokens | $1.00 |
| Ausgabe / 1M Tokens | $20.00 |
| Währung | USD |
Schätzung auf Basis des Listenpreises
Nur eine Schätzung — die tatsächliche Token-Anzahl hängt vom Tokenizer des Anbieters ab.
GET /api/public/models/google/gemini-3.1-flash-tts-previewÖffnen @misc{orcarouter_gemini_3_1_flash_tts_preview,
title = {google/gemini-3.1-flash-tts-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview}
}google. (n.d.). google/gemini-3.1-flash-tts-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview