Google Gemini 2.5 Pro preview with TTS, abgerufen über OrcaRouter ohne Aufschlag.
google/gemini-2.5-pro-preview-tts ist ein Text-to-Speech-Vorschaumodell von Google, das auf der Gemini 2.5 Pro-Grundlage basiert. Es wandelt Texteingaben in gesprochene Audioausgaben um. Das Modell…
Die Hauptfähigkeit von google/gemini-2.5-pro-preview-tts ist die Umwandlung von geschriebenem Text in gesprochene Audioausgabe. Es basiert auf Googles Gemini 2.5 Pro, was auf ein starkes Sprachverständnis hindeutet, das zu natürlicher Satzmelodie, angemessener Betonung und klarer Aussprache führen sollte. Das Modell akzeptiert ausschließlich Texteingaben, ist also auf der Eingabeseite nicht multimodal. Es verarbeitet keine Audioeingaben, Bilder oder Videos. Die Ausgabe erfolgt wahrscheinlich als Audio in einem gängigen digitalen Format. Als TTS-Modell kann es mehrere Sprachen verarbeiten, der genaue Sprachumfang für diese Vorschau wurde jedoch nicht bekannt gegeben. Es ist für die Sprachsynthese optimiert, nicht für andere Fähigkeiten von Gemini 2.5 Pro wie logisches Denken oder Codegenerierung.
Das Modell eignet sich hervorragend für Anwendungen, die schriftlichen Text in natürlich klingende Sprache umwandeln. Zu den besten Einsatzmöglichkeiten gehören Sprachassistenten, bei denen der Assistent Antworten vorliest, automatisierte Hörbuch- und Podcast-Erzählungen, Barrierefreiheitsfunktionen, die Bildschirmtext für sehbehinderte Nutzer vorlesen, sowie Kundenservicesysteme, die gesprochene Antworten liefern. Es kann auch für Sprachlernanwendungen eingesetzt werden, bei denen die korrekte Aussprache modelliert wird, oder zur Generierung von Sprachinhalten aus RSS-Feeds oder Artikeln. Aufgrund des Vorschau-Status wird empfohlen, vor einem großflächigen Einsatz gründlich für Ihre spezifische Sprache, Domäne oder Stilanforderungen zu testen.
Während google/gemini-2.5-pro-preview-tts erstklassige TTS-Qualität bietet, ist es für einfache Pieptöne oder Benachrichtigungssounds oder für Anwendungen, bei denen niedrige Latenz entscheidend ist, die Verarbeitungszeit des Modells jedoch länger ist als die dedizierter TTS-Chips, möglicherweise überdimensioniert. Wenn Sie nur grundlegende, monotone Sprache benötigen oder ein sehr hohes Volumen mit strengen Budgetvorgaben haben, ist ein leichteres TTS-Modell (z. B. von anderen Anbietern auf OrcaRouter) mit niedrigeren Kosten pro Token möglicherweise besser geeignet. Wenn Ihr Anwendungsfall außerdem Echtzeit-Streaming mit extrem niedriger Latenz erfordert, prüfen Sie, ob das Vorschaumodell von Gemini Ihre Geschwindigkeitsanforderungen erfüllt, da größere Modelle eine höhere Latenz beim ersten Token verursachen können.
Mit der Vorschauveröffentlichung des Modells hat Google noch keine spezifischen Benchmark-Ergebnisse für die Variante gemini-2.5-pro-preview-tts veröffentlicht. Das zugrunde liegende Basismodell Gemini 2.5 Pro hat starke Leistung bei Aufgaben des Sprachverständnisses und des logischen Denkens gezeigt, aber die Sprachqualitätsmetriken der TTS-Variante (z. B. Mean Opinion Score, Wortfehlerrate) wurden nicht öffentlich geteilt. Ohne offizielle Benchmarks empfiehlt OrcaRouter, das Modell anhand Ihres eigenen Testsatzes von Texteingaben zu evaluieren und dabei subjektive Audioqualität, Latenz und Zuverlässigkeit unter Last zu messen. Für Produktionsentscheidungen führen Sie Ihre eigenen A/B-Vergleiche mit anderen TTS-Diensten durch.
Spezifische Latenzwerte für google/gemini-2.5-pro-preview-tts wurden nicht öffentlich bekannt gegeben. Als TTS-Modell, das auf einer Large-Language-Modell-Architektur basiert, kann es eine höhere Latenz aufweisen als spezialisierte neuronale TTS-Modelle, die für Echtzeit-Streaming optimiert sind. Zu den Faktoren, die die Geschwindigkeit beeinflussen, gehören die Länge des Eingabetextes, die interne Verarbeitungszeit des Modells und die Netzwerk-Roundtrip-Zeit zu den Endpunkten von OrcaRouter. Für Anwendungen, bei denen eine niedrige Latenz entscheidend ist (z. B. konversationelle KI), sollte dieses Modell mit typischen Eingabelängen getestet werden, um seine Eignung zu bewerten. Erwägen Sie die Verwendung von Streaming oder chunked text generation, wenn die API dies unterstützt.
Stärken: Es basiert auf der fortschrittlichen Gemini 2.5 Pro-Architektur von Google, wodurch es wahrscheinlich sehr natürliche, ausdrucksstarke Sprache mit guter Prosodie und Aussprache erzeugt. Der Zugriff über die mit OpenAI kompatible API von OrcaRouter vereinfacht die Integration. Keine Aufschläge auf die Preise des Anbieters machen die Kosten kalkulierbar. Einschränkungen: Die Eingabemodalität ist nur Text; es kann keine Audiodaten oder andere Modalitäten verarbeiten. Als Vorschauversion kann es unentdeckte Randfälle oder inkonsistente Qualität aufweisen. Die Größe des Kontextfensters ist unbekannt, was die Länge des Texts einschränkt, der in einer einzelnen Anfrage konvertiert werden kann. Details zum Ausgabeformat werden nicht bereitgestellt. Es ist nicht für Aufgaben wie Spracherkennung oder Stimmklonen ausgelegt.
Preise für google/gemini-2.5-pro-preview-tts basieren auf der Token-Nutzung, berechnet mit $1.00 pro 1 Million Eingabe-Token und $20.00 pro 1 Million Ausgabe-Token. Eingabe-Token umfassen den Text-Prompt und alle Anweisungen. Ausgabe-Token repräsentieren das generierte Audio. OrcaRouter berechnet den exakten Anbieterpreis ohne Aufschlag, d. h. Sie zahlen nur das, was Google verlangt, zuzüglich etwaiger Steuern. Es gibt keine Mindestabnahmen oder monatlichen Gebühren. Die Nutzung wird pro Anfrage gemessen und auf Ihrer OrcaRouter-Rechnung zusammengefasst. Da die Anzahl der TTS-Ausgabe-Token hoch sein kann (Audio ist token-dichter als Text), sind die Ausgabekosten der primäre Kostenfaktor.
Der Ausgabe-Token-Preis (20 $ pro 1 Mio.) ist deutlich höher als der Eingabe-Token-Preis (1 $ pro 1 Mio.). Dies ist typisch für generative Modelle, da Ausgabe-Tokens mehr Rechenleistung benötigen. Bei der Text-zu-Sprache-Umwandlung wird das Audio als eine Reihe von Tokens dargestellt, und die Umwandlung von Text in Sprache umfasst die Erzeugung einer langen Sequenz von Audio-Tokens. Die Gesamtkosten für eine bestimmte Aufgabe hängen von der Länge der Audioausgabe im Verhältnis zum Eingabetext ab. Wenn Sie lange Sprachpassagen generieren müssen (z. B. ein komplettes Hörbuch), können die Kosten steigen. Bei kurzen Eingabeaufforderungen (z. B. einem einzelnen Satz) sind die Kosten minimal. Überwachen Sie Ihre Token-Nutzung, um die Kosten abzuschätzen.
Nein, OrcaRouter fügt keinen Aufschlag auf den Anbieterpreis für google/gemini-2.5-pro-preview-tts hinzu. Die aufgeführten Preise von $1.00 pro 1M Eingabe-Tokens und $20.00 pro 1M Ausgabe-Tokens sind genau das, was Google berechnet. OrcaRouter gibt diese direkt an Sie weiter. Dies entspricht dem Preismodell von OrcaRouter für viele Modelle, bei dem die Plattform als transparenter Proxy fungiert. Sie bezahlen nur für die Tokens, die Sie verbrauchen. Optionale Funktionen wie Caching oder Premium-Support können separate Gebühren verursachen, aber die grundlegenden Kosten pro Token enthalten keinen Aufschlag.
Um google/gemini-2.5-pro-preview-tts zu verwenden, stellen Sie Anfragen an OrcaRouters OpenAI-kompatible API unter der Basis-URL https://api.orcarouter.ai/v1. Verwenden Sie die Modell-ID 'google/gemini-2.5-pro-preview-tts' in Ihren API-Aufrufen. Das Anfrageformat folgt der standardmäßigen OpenAI-Chat-Completions-Struktur mit einem 'model'-Feld, einem 'messages'-Array, das Ihre Textaufforderung (mit einer System- und/oder User-Rolle) enthält, sowie Standardparametern wie temperature und max_tokens. Die Antwort enthält die generierten Audio-Tokens, die Ihr Client dekodieren kann, um sie als Sprache abzuspielen. Die Authentifizierung erfolgt über einen API-Schlüssel, der von OrcaRouter bereitgestellt wird.
Die API unterstützt standardmäßig OpenAI-kompatible Parameter, darunter 'model', 'messages' (Array von Objekten mit role und content), 'temperature' (zur Steuerung der Variabilität der Audioausgabe), 'max_tokens' (zur Begrenzung der Länge des generierten Audios) und 'top_p'. Als TTS-Modell kann es zusätzliche Parameter für Sprachstil oder Geschwindigkeit geben, aber diese sind in den verfügbaren Fakten nicht dokumentiert. Informationen zu den neuesten unterstützten Feldern finden Sie in der API-Dokumentation von OrcaRouter's. Der Parameter 'response_format' kann die Angabe der Audiokodierung (z. B. wav oder mp3) ermöglichen. Falls dies standardmäßig nicht unterstützt wird, müssen Sie möglicherweise den zurückgegebenen Token-Stream decodieren.
Wenn Sie derzeit einen anderen TTS-Dienst verwenden (z. B. Google Cloud Text-to-Speech, Amazon Polly), erfordert die Migration zu google/gemini-2.5-pro-preview-tts über OrcaRouter die Aktualisierung Ihres API-Endpunkts und Ihres Anfrageformats. OrcaRouter verwendet OpenAI-kompatible Endpunkte, sodass Sie von einem anbieterspezifischen SDK zu einem OpenAI-kompatiblen wechseln. Ersetzen Sie Ihre vorhandene Basis-URL durch https://api.orcarouter.ai/v1, verwenden Sie die Modell-ID 'google/gemini-2.5-pro-preview-tts' und passen Sie Ihre Anfragekörper an das Chat-Completions-Schema an. Möglicherweise müssen Sie die Handhabung der Antwort ändern: Anstatt Audiodateien direkt zu erhalten, erhalten Sie tokenisierte Ausgaben, die Sie decodieren müssen. Testen Sie mit Beispieleingaben.
Die Authentifizierung erfolgt durch Einfügen eines API-Schlüssels in den Authorization-Header (Format: Bearer YOUR_API_KEY). Den API-Schlüssel erhalten Sie von Ihrem OrcaRouter-Konto. Die Ratenbegrenzungen werden von OrcaRouter basierend auf Ihrem Tarif festgelegt; sie sind nicht identisch mit den Grenzwerten von Google. Bei hohem Nutzungsvolumen kontaktieren Sie OrcaRouter, um die Grenzwerte anzupassen. Das Vorschaumodell kann zusätzliche Einschränkungen von Google aufweisen – wenn Sie Fehler wie 'model not available' erhalten, überprüfen Sie, ob Ihr OrcaRouter-Tarif dieses Modell beinhaltet. Es gibt keine spezifischen Ratenbegrenzungen für dieses Modell, aber es werden die üblichen Best Practices (Wiederholungsversuche mit exponentiellem Backoff) empfohlen.
google/gemini-2.5-pro-preview-tts ist eine spezialisierte Variante der Gemini 2.5 Pro Familie, die für Text-to-Speech optimiert ist. Andere Gemini 2.5 Pro Modelle sind universell einsetzbar und verarbeiten Texte, Bilder, Audio- und Videoeingaben; sie erzeugen jedoch nativ keine Sprachausgabe. Diese TTS-Variante entfernt multimodale Eingaben und konzentriert sich auf die Erzeugung von Audio aus Text. Sie nutzt vermutlich dasselbe zugrunde liegende Sprachverständnis für Prosodie und Tempo, ist aber nicht für Reasoning, Programmierung oder multimodale Analyse geeignet. Wenn Sie TTS-Fähigkeiten benötigen, ohne auf multimodale Eingaben zu verzichten, würden Sie ein Standard-Gemini-Modell mit einer separaten TTS-Pipeline kombinieren. Die Preview-TTS bietet eine optimierte Pipeline.
OrcaRouter bietet Zugriff auf TTS-Modelle von verschiedenen Anbietern. Dieses Modell von Google basiert auf einer Large-Language-Modell-Architektur, die möglicherweise natürlichere und kontextbewusstere Sprache erzeugen kann als ältere konkatenative oder parametrische TTS-Systeme. Allerdings kann es langsamer und teurer pro Token sein im Vergleich zu spezialisierten neuronalen TTS-Modellen, die für niedrige Latenz und hohen Durchsatz ausgelegt sind. Viele beliebte TTS-Dienste berechnen pro Zeichen oder pro Sekunde Audio, nicht pro Token, was den direkten Kostenvergleich erschwert. Für Produktionsumgebungen, die extrem niedrige Kosten erfordern, können dedizierte TTS-Modelle vorzuziehen sein. Googles Modell eignet sich am besten für Anwendungsfälle, bei denen die höchste Ausgabequalität die höheren Token-Kosten rechtfertigt.
Wählen Sie dieses Modell, wenn Sie hochmoderne Sprachqualität von Googles neuester Gemini-Architektur benötigen und über eine standardmäßige OpenAI-kompatible API darauf zugreifen möchten, ohne Google Cloud-Anmeldedaten verwalten zu müssen. Die Preisgestaltung ohne Aufschlag gewährleistet Transparenz. Es ist ideal für Anwendungen, bei denen Natürlichkeit entscheidend ist, z. B. für Konversations-KI oder narrative Inhalte. Der Vorschau-Status ermöglicht frühe Experimente, um seine Qualität für Ihre Domäne zu bewerten. Wenn Sie jedoch Echtzeit-Streaming mit einer Latenz von unter 100 ms benötigen, ist ein dediziertes Streaming-TTS-Modell möglicherweise besser geeignet. Falls Ihr Budget sensibel ist, testen Sie den Tokenverbrauch für typische Anwendungsfälle, um sicherzustellen, dass die Kosten akzeptabel sind.
OpenAI-kompatibel — behalte dein bisheriges SDK
https://api.orcarouter.ai/v1voice| Eingabe / 1M Tokens | $1.00 |
| Ausgabe / 1M Tokens | $20.00 |
| Währung | USD |
Schätzung auf Basis des Listenpreises
Nur eine Schätzung — die tatsächliche Token-Anzahl hängt vom Tokenizer des Anbieters ab.
Worüber Entwickler diese Woche sprechen
GET /api/public/models/google/gemini-2.5-pro-preview-ttsÖffnen @misc{orcarouter_gemini_2_5_pro_preview_tts,
title = {google/gemini-2.5-pro-preview-tts API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts}
}google. (n.d.). google/gemini-2.5-pro-preview-tts API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts