Le modèle de synthèse vocale rapide et économique de Google pour la génération audio en temps réel, accessible via OrcaRouter.
google/gemini-3.1-flash-tts-preview est un modèle de synthèse vocale de Google, faisant partie de la famille Gemini Flash. Il accepte une entrée textuelle et génère une sortie audio parlée. Le modèle…
La capacité principale est de convertir du texte écrit en parole naturelle. Le modèle est conçu pour la vitesse, en tirant parti de l'architecture Flash pour réduire la latence. Il prend en charge plusieurs langues et voix ? La prise en charge des langues et des voix de cet aperçu spécifique n'est pas détaillée dans les faits fournis ; vous devriez consulter la documentation de Google pour les options vocales actuelles. Le modèle peut traiter diverses entrées de texte, y compris la ponctuation, les nombres et les abréviations, produisant une sortie parlée qui reflète le rythme et le ton souhaités.
Les meilleurs cas d'utilisation incluent toute application où la génération de parole à faible latence est critique : assistants vocaux en temps réel, doublage de traduction en direct, chatbots interactifs avec sortie vocale, et systèmes téléphoniques automatisés. Il excelle également pour le traitement par lots lorsque vous devez générer rapidement de nombreux petits clips audio. Les producteurs de contenu peuvent l'utiliser pour des voix off dynamiques dans les jeux vidéo ou les livres audio. Parce que le coût de sortie est élevé par rapport à l'entrée, il est plus économique lorsque l'audio de sortie est concis.
Si votre cas d'utilisation implique la génération de données audio extrêmement longues (par exemple, des heures de parole) ou ne nécessite pas une faible latence, envisagez un modèle TTS par lots avec un coût de sortie par jeton inférieur. Pour les applications où le volume d'entrée domine (par exemple, de nombreuses invites courtes), le faible coût d'entrée rend ce modèle Flash attractif. Pour les scénarios nécessitant une très haute qualité de sortie — comme des personnages expressifs sur le plan émotionnel — vous pourriez évaluer des modèles TTS premium de Google ou d'autres fournisseurs. Surveillez toujours le volume total de jetons et les exigences de latence.
En tant que modèle Gemini Flash, cette variante TTS est optimisée pour une faible latence. Des benchmarks de latence spécifiques (par exemple, le temps jusqu'au premier paquet audio) ne sont pas fournis dans les faits disponibles. En pratique, les modèles Flash répondent souvent en quelques centaines de millisecondes pour des entrées courtes. La latence peut varier en fonction de la longueur de la sortie, des conditions réseau et de la charge de requêtes simultanées. Le routage d'OrcaRouter peut ajouter une surcharge minimale. Pour les applications en temps réel, testez avec les durées audio attendues sous charge.
Les points forts incluent un faible coût d'entrée ($1.00/1M tokens), une génération rapide et l'infrastructure robuste de Google. Le statut d'aperçu signifie que la qualité et la disponibilité du modèle peuvent changer. Une limitation est le coût élevé de sortie ($20.00/1M tokens) par rapport aux modèles de texte. De plus, la qualité audio de sortie — comme le naturel, la variété des accents et la prosodie — n'est pas évaluée ici. Vous devez évaluer la qualité vocale du modèle pour votre domaine spécifique (par exemple, jargon technique, gamme émotionnelle) avant le déploiement en production.
Aucun score de benchmark pour google/gemini-3.1-flash-tts-preview n'est fourni dans les faits disponibles. Les modèles TTS sont souvent évalués sur des métriques comme le Mean Opinion Score (MOS) pour le naturel, le taux d'erreur de mots (WER) pour l'intelligibilité, et les percentiles de latence. Sans chiffres spécifiques, vous devez effectuer votre propre évaluation en utilisant des invites représentatives pour évaluer la qualité et la vitesse par rapport à vos exigences. OrcaRouter n'ajoute ni ne modifie les performances du modèle.
Les faits disponibles ne précisent pas les langues prises en charge ni les capacités d'accent pour cet aperçu TTS. Les modèles TTS plus larges de Google prennent généralement en charge plusieurs langues, mais la couverture de cette variante spécifique est inconnue. Vous devriez tester avec du texte multilingue pour confirmer la qualité de sortie. Pour l'anglais, les performances sont probablement robustes compte tenu des investissements de Google. Pour les langues moins courantes, envisagez de contacter Google directement ou de tester avec un échantillon de texte via l'API d'OrcaRouter.
Les prix suivent les tarifs officiels de Google, sans aucune marge ajoutée par OrcaRouter. Les tokens d'entrée (texte) coûtent 1,00 $ par million de tokens. Les tokens de sortie (audio) coûtent 20,00 $ par million de tokens. Les tokens de sortie sont générés par unité audio ; le ratio exact token/temps n'est pas spécifié. Vous êtes facturé pour les tokens d'entrée et de sortie utilisés dans chaque requête. Il n'y a pas de frais de plateforme supplémentaires ni d'exigence de dépense minimale. La facturation s'effectue via les méthodes de paiement existantes d'OrcaRouter.
Les tokens d'entrée sont 20 fois moins chers que les tokens de sortie. Cela encourage l'envoi de prompts textuels plus longs (dans les limites de tokens) pour générer un résultat audio proportionnellement plus long, car le coût d'entrée reste faible. Par exemple, générer un clip audio d'une minute peut consommer beaucoup de tokens de sortie à 20 $/1M, tandis que le prompt textuel ne coûte que quelques centimes. Optimisez en gardant la sortie concise lorsque cela est possible. Si votre cas d'usage génère un audio très long, le coût de sortie par requête peut rapidement s'accumuler.
Les faits disponibles ne mentionnent aucun programme de mise en cache ou de réduction pour ce modèle sur OrcaRouter. La tarification d'OrcaRouter est transparente, basée sur les tarifs des fournisseurs. Vous pouvez vérifier auprès d'OrcaRouter s'il existe des options de remise par volume ou une capacité réservée pouvant s'appliquer à plusieurs modèles. Comme le coût des tokens de sortie est élevé, la mise en cache des segments audio générés pour une utilisation répétée (par exemple, les réponses courantes) peut réduire considérablement les dépenses totales.
Les comparaisons ne sont pas directement fournies. Cependant, le Flash TTS de Google est présenté comme économique pour une utilisation en temps réel avec un faible coût d'entrée. D'autres modèles TTS (par exemple, OpenAI TTS, ElevenLabs) peuvent avoir des structures de tarification différentes — facturant souvent par caractère ou par seconde d'audio. La tarification par token de sortie de ce modèle peut être plus coûteuse pour des très longs audios, mais moins chère pour des générations courtes et sporadiques. Évaluez vos volumes de tokens attendus par rapport aux autres offres du catalogue d'OrcaRouter.
Utilisez n'importe quel client compatible OpenAI. Définissez l'URL de base sur https://api.orcarouter.ai/v1, la clé API depuis votre compte OrcaRouter, et l'ID du modèle sur "google/gemini-3.1-flash-tts-preview". Envoyez une requête de complétion de chat avec un message utilisateur contenant le texte à prononcer. La réponse inclura un contenu audio (probablement sous forme de bloc encodé en base64 ou d'une URL). Le format exact de sortie dépend de l'implémentation du modèle de Google. Reportez-vous à la documentation d'OrcaRouter pour le support du streaming et l'analyse des réponses.
Les paramètres standard de complétion de chat s'appliquent : model, messages (avec role et content), et optionnellement temperature ou top_p pour la variabilité de sortie (bien que moins pertinents pour TTS). Pour la sélection vocale, le modèle de Google peut prendre en charge un paramètre supplémentaire (par exemple, le nom de la voix). Les faits disponibles ne listent pas de paramètres TTS spécifiques. Vous devrez peut-être passer des champs supplémentaires comme "voice" ou "language" dans le corps de la requête. Consultez la documentation de l'API Google pour le modèle en prévisualisation pour connaître les options exactes.
Il est courant que les modèles TTS prennent en charge l'audio en streaming, où des morceaux audio sont envoyés au fur et à mesure de leur génération. Les faits fournis ne confirment pas la prise en charge du streaming pour ce modèle d'aperçu. Si le streaming est activé, vous pouvez utiliser le paramètre stream défini sur true dans votre requête API et traiter les morceaux au fur et à mesure de leur arrivée. OrcaRouter prend en charge le streaming pour les modèles compatibles. Testez avec une requête simple pour voir si l'audio est renvoyé de manière incrémentielle ou sous forme de blob complet.
Si vous utilisez déjà une API compatible OpenAI, modifiez l'URL de base en https://api.orcarouter.ai/v1 et mettez à jour l'identifiant du modèle. Mettez à jour vos paramètres de requête pour qu'ils correspondent aux spécifications TTS de Google (par exemple, le nom de la voix). Vous devrez peut-être ajuster la gestion de la sortie audio si le format diffère (par exemple, MP3 vs WAV). Testez avec des exemples de prompts pour vérifier la qualité. Étant donné que la tarification est sans marge, vos coûts peuvent changer en fonction de l'utilisation des tokens. Aucun outil de migration spécial n'est requis.
OpenAI propose des modèles TTS (tts-1, tts-1-hd) avec un tarif par caractère (~$0.015 pour 1 000 caractères). En revanche, le modèle de Google utilise une tarification basée sur les tokens, ce qui peut être plus économique pour des entrées courtes mais plus coûteux pour des sorties longues. Le TTS d'OpenAI prend en charge plusieurs voix et langues ; les spécificités de l'aperçu de Google ne sont pas entièrement connues. Latence : les modèles Flash et OpenAI sont conçus pour une faible latence. La qualité est subjective ; vous devriez tester avec votre contenu pour comparer le naturel et la prosodie.
Google propose également des modèles TTS premium (par ex., WaveNet, Studio) via son API Cloud Text-to-Speech. Ces modèles facturent généralement par caractère de texte envoyé, ce qui peut être moins cher pour des audios très longs, mais engendre des coûts par requête plus élevés. Le Flash TTS est plus rapide et propose une tarification d'entrée plus simple (par token), mais peut offrir moins d'options de voix. Pour une parole haute-fidélité et riche en émotions, un modèle premium peut être préférable. Pour la rapidité et un faible coût par entrée, la variante Flash est avantageuse.
Si vous avez besoin d'une réponse en temps réel et de textes d'entrée courts (nombreuses petites requêtes), ce modèle Flash, avec son faible coût d'entrée et sa génération rapide, est idéal. Pour une génération audio très longue (ex. livres audio complets), un modèle facturant par caractère saisi (comme le TTS standard de Google) pourrait être moins cher, car le coût des jetons de sortie est évité. Tenez également compte de la variété des voix et du support linguistique : si vous avez besoin de nombreuses voix distinctes, vérifiez que cette preview les prend en charge. Testez les deux options avec votre charge de travail avant de vous engager.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1voice| Entrée / 1M tokens | $1.00 |
| Sortie / 1M tokens | $20.00 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
GET /api/public/models/google/gemini-3.1-flash-tts-previewOuvrir @misc{orcarouter_gemini_3_1_flash_tts_preview,
title = {google/gemini-3.1-flash-tts-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview}
}google. (n.d.). google/gemini-3.1-flash-tts-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview