Google Gemini 2.5 Pro preview avec TTS, accessible via OrcaRouter sans marge.
google/gemini-2.5-pro-preview-tts est un modèle de synthèse vocale en prévisualisation de Google, construit sur la base de Gemini 2.5 Pro. Il convertit l'entrée de texte en sortie audio parlée. Le…
La capacité principale de google/gemini-2.5-pro-preview-tts est de convertir du texte écrit en audio parlé. Il est basé sur le Gemini 2.5 Pro de Google, ce qui indique une forte compréhension linguistique, devant aboutir à un phrasé naturel, une intonation appropriée et une prononciation claire. Le modèle n'accepte que des entrées textuelles, il n'est donc pas multimodal du côté des entrées. Il ne gère pas l'entrée audio, les images ou la vidéo. La sortie est probablement un audio dans un format numérique standard. En tant que modèle TTS, il peut gérer plusieurs langues, mais le support linguistique spécifique n'a pas été divulgué pour cet aperçu. Il est optimisé pour générer de la parole, et non pour d'autres capacités du Gemini 2.5 Pro comme le raisonnement ou la génération de code.
Le modèle excelle dans les applications nécessitant la conversion de texte écrit en parole naturelle. Les cas d'usage les plus adaptés incluent les assistants vocaux où l'assistant lit les réponses à haute voix, la narration automatisée de livres audio et de podcasts, les fonctionnalités d'accessibilité qui lisent le texte à l'écran pour les utilisateurs malvoyants, et les systèmes de service client qui délivrent des réponses orales. Il peut également être utilisé pour les applications d'apprentissage des langues où la prononciation correcte est modélisée, ou pour générer du contenu vocal à partir de flux RSS ou d'articles. En raison de son statut d'aperçu, il est conseillé de tester en profondeur pour vos exigences spécifiques de langue, de domaine ou de style avant de vous engager dans un déploiement à grande échelle.
Bien que google/gemini-2.5-pro-preview-tts offre une qualité TTS premium, cela peut être excessif pour de simples bips ou sons de notification, ou pour des applications où une faible latence est cruciale mais où le temps de traitement du modèle est plus long que celui des puces TTS dédiées. Si vous avez besoin uniquement d'une parole basique et monotone, ou si vous avez un volume très élevé avec des contraintes budgétaires strictes, un modèle TTS plus léger (par exemple, d'autres fournisseurs sur OrcaRouter) avec des coûts par jeton plus faibles peut être plus approprié. De plus, si votre cas d'utilisation nécessite un streaming en temps réel avec une latence extrêmement faible, évaluez si le modèle preview de Gemini répond à vos exigences de vitesse, car les modèles plus grands peuvent introduire une latence plus élevée sur le premier jeton.
À compter de la version préliminaire du modèle, Google n'a pas publié de scores de référence spécifiques pour la variante gemini-2.5-pro-preview-tts. Le modèle de base Gemini 2.5 Pro sous-jacent a démontré de bonnes performances sur des tâches de compréhension linguistique et de raisonnement, mais les indicateurs de qualité vocale de la variante TTS (par exemple, le score d'opinion moyen, le taux d'erreur sur les mots) n'ont pas été partagés publiquement. En l'absence de références officielles, OrcaRouter recommande d'évaluer le modèle sur votre propre jeu de test de saisies textuelles, en mesurant la qualité audio subjective, la latence et la fiabilité sous charge. Pour les décisions de production, effectuez vos propres comparaisons A/B avec d'autres services TTS.
Les chiffres de latence spécifiques pour google/gemini-2.5-pro-preview-tts n'ont pas été divulgués publiquement. En tant que modèle TTS basé sur une architecture de grand modèle de langage, il peut présenter une latence plus élevée que les modèles TTS neuronaux spécialisés optimisés pour le streaming en temps réel. Les facteurs qui influencent la vitesse incluent la longueur du texte d'entrée, le temps de traitement interne du modèle et l'aller-retour réseau vers les points de terminaison d'OrcaRouter. Pour les applications où une faible latence est critique (par exemple l'IA conversationnelle), testez ce modèle avec des longueurs d'entrée typiques pour évaluer son adéquation. Envisagez d'utiliser la génération en flux continu ou par morceaux si l'API le prend en charge.
Points forts : Construit sur l’architecture avancée Gemini 2.5 Pro de Google, il produit probablement un discours très naturel et expressif avec une bonne prosodie et prononciation. L’accès via l’API compatible OpenAI d’OrcaRouter simplifie l’intégration. L’absence de majoration sur le prix du fournisseur rend son coût prévisible. Limites : La modalité d’entrée est uniquement textuelle ; il ne peut pas traiter l’audio ou d’autres modalités. En tant qu’aperçu, il peut présenter des cas limites non découverts ou une qualité incohérente. La taille de la fenêtre de contexte est inconnue, ce qui limite la longueur du texte pouvant être converti en une seule requête. Les détails du format de sortie ne sont pas fournis. Il n’est pas conçu pour des tâches comme la reconnaissance vocale ou le clonage de voix.
La tarification de google/gemini-2.5-pro-preview-tts est basée sur l'utilisation de tokens, facturée à 1,00 $ par million de tokens d'entrée et 20,00 $ par million de tokens de sortie. Les tokens d'entrée incluent le texte de la requête et toutes les instructions. Les tokens de sortie représentent l'audio généré. OrcaRouter facture au tarif exact du fournisseur sans marge, ce qui signifie que vous ne payez que ce que Google facture, plus les taxes applicables. Il n'y a ni engagement minimum ni frais mensuels. L'utilisation est mesurée par requête et agrégée sur votre facture OrcaRouter. Étant donné que le nombre de tokens de sortie TTS peut être élevé (l'audio étant plus dense en tokens que le texte), le coût de sortie constitue la dépense principale.
Le prix des jetons de sortie (20 $ par 1M) est nettement plus élevé que celui des jetons d'entrée (1 $ par 1M). C'est typique des modèles génératifs car les jetons de sortie nécessitent plus de calcul. Pour la synthèse vocale, la sortie audio est représentée comme une série de jetons, et la conversion de texte en parole implique la génération d'une longue séquence de jetons audio. Le coût total pour une tâche spécifique dépend de la longueur de l'audio de sortie par rapport au texte d'entrée. Si vous devez générer de longs passages de parole (par exemple, un livre audio complet), les coûts peuvent s'accumuler. Pour les prompts courts (par exemple, une seule phrase), les coûts sont minimes. Surveillez l'utilisation de vos jetons pour estimer les coûts.
Non, OrcaRouter n'ajoute aucune marge au tarif du fournisseur pour google/gemini-2.5-pro-preview-tts. Les prix indiqués de $1.00 par 1M de jetons d'entrée et $20.00 par 1M de jetons de sortie sont exactement ce que Google facture. OrcaRouter vous les transmet directement. Cela correspond au modèle tarifaire d'OrcaRouter pour de nombreux modèles, où la plateforme agit comme un proxy transparent. Vous ne payez que pour les jetons que vous consommez. Toute fonctionnalité optionnelle telle que la mise en cache ou le support premium peut entraîner des frais séparés, mais le coût de base par jeton n'a aucune marge.
Pour utiliser google/gemini-2.5-pro-preview-tts, envoyez des requêtes à l'API compatible OpenAI d'OrcaRouter via l'URL de base https://api.orcarouter.ai/v1. Utilisez l'ID de modèle 'google/gemini-2.5-pro-preview-tts' dans vos appels API. Le format de la requête suit la structure standard des complétions de chat OpenAI avec un champ 'model', un tableau 'messages' contenant votre invite textuelle (avec un rôle système et/ou utilisateur), et des paramètres standard comme temperature et max_tokens. La réponse contiendra les jetons audio générés, que votre client pourra décoder pour lire comme parole. L'authentification se fait via une clé API fournie par OrcaRouter.
L'API prend en charge les paramètres standard compatibles avec OpenAI, notamment 'model', 'messages' (tableau d'objets avec rôle et contenu), 'temperature' (pour contrôler la variabilité de la sortie audio), 'max_tokens' (pour limiter la longueur de l'audio généré) et 'top_p'. En tant que modèle TTS, il peut y avoir des paramètres supplémentaires pour le style ou la vitesse de la voix, mais ceux-ci n'ont pas été documentés dans les faits disponibles. Référez-vous à la documentation de l'API d'OrcaRouter pour connaître les derniers champs pris en charge. Le paramètre 'response_format' peut permettre de spécifier l'encodage audio (par exemple wav ou mp3). S'il n'est pas pris en charge par défaut, vous devrez peut-être décoder le flux de tokens renvoyé.
Si vous utilisez actuellement un autre service TTS (par exemple, Google Cloud Text-to-Speech, Amazon Polly), migrer vers google/gemini-2.5-pro-preview-tts via OrcaRouter implique de mettre à jour votre endpoint API et le format de vos requêtes. OrcaRouter utilise des endpoints compatibles OpenAI, vous passerez donc d'un SDK propre au fournisseur à un SDK compatible OpenAI. Remplacez votre URL de base existante par https://api.orcarouter.ai/v1, utilisez l'ID de modèle 'google/gemini-2.5-pro-preview-tts', et adaptez le corps de vos requêtes pour correspondre au schéma des complétions de chat. Vous devrez peut-être modifier la façon dont vous gérez la réponse : au lieu de recevoir directement des fichiers audio, vous obtiendrez une sortie tokenisée que vous devrez décoder. Testez avec des entrées échantillons.
L'authentification se fait en incluant une clé API dans l'en-tête Authorization (format : Bearer YOUR_API_KEY). Vous obtenez la clé API depuis votre compte OrcaRouter. Les limites de taux sont définies par OrcaRouter en fonction de votre plan ; elles ne sont pas les mêmes que celles de Google. Pour une utilisation à volume élevé, contactez OrcaRouter pour ajuster les limites. Le modèle d'aperçu peut avoir des contraintes supplémentaires de Google – si vous rencontrez des erreurs telles que 'model not available', vérifiez que votre plan OrcaRouter inclut ce modèle. Aucune limite de taux spécifique n'est divulguée pour ce modèle, mais les meilleures pratiques standard (réessayer avec un backoff exponentiel) sont recommandées.
google/gemini-2.5-pro-preview-tts est une variante spécialisée de la famille Gemini 2.5 Pro conçue pour la synthèse vocale. Les autres modèles Gemini 2.5 Pro sont polyvalents et traitent les entrées textuelles, images, audio et vidéo ; ils ne génèrent pas de sortie vocale nativement. Cette variante TTS supprime les entrées multimodales et se concentre sur la génération d'audio à partir de texte. Elle utilise probablement la même compréhension linguistique sous-jacente pour la prosodie et le rythme, mais elle n'est pas adaptée au raisonnement, au codage ou à l'analyse multimodale. Si vous avez besoin de capacités TTS sans renoncer aux entrées multimodales, vous combinerez un modèle Gemini standard avec un pipeline TTS séparé. Le TTS en version préliminaire offre un pipeline plus rationalisé.
OrcaRouter offre l'accès à des modèles TTS provenant de divers fournisseurs. Ce modèle de Google est basé sur une architecture de grand modèle de langage, ce qui peut produire une parole plus naturelle et contextuellement consciente que les anciens systèmes TTS concaténatifs ou paramétriques. Cependant, il peut être plus lent et plus coûteux par jeton par rapport aux modèles TTS neuronaux spécialisés conçus pour une faible latence et un haut débit. De nombreux services TTS populaires facturent par caractère ou par seconde d'audio, et non par jeton, ce qui rend la comparaison directe des coûts délicate. Pour les déploiements en production nécessitant un coût extrêmement bas, les modèles TTS dédiés peuvent être préférables. Le modèle de Google est le meilleur pour les cas d'utilisation où la qualité de sortie la plus élevée justifie le coût plus élevé des jetons de sortie.
Choisissez ce modèle si vous avez besoin d’une qualité vocale de pointe issue de la dernière architecture Gemini de Google et que vous souhaitez y accéder via une API standard compatible OpenAI, sans avoir à gérer les identifiants Google Cloud. La tarification sans marge garantit la transparence. Ce modèle est idéal pour les applications où le naturel est crucial, comme l’IA conversationnelle ou le contenu narratif. Le statut de préversion permet une expérimentation précoce pour évaluer sa qualité dans votre domaine. Cependant, si vous avez besoin d’un streaming en temps réel avec une latence inférieure à 100 ms, un modèle TTS dédié au streaming pourrait être plus adapté. De plus, si votre budget est sensible, testez la consommation de tokens en sortie pour des cas d’usage typiques afin de vous assurer que le coût est acceptable.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1voice| Entrée / 1M tokens | $1.00 |
| Sortie / 1M tokens | $20.00 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
Ce dont parlent les développeurs cette semaine
GET /api/public/models/google/gemini-2.5-pro-preview-ttsOuvrir @misc{orcarouter_gemini_2_5_pro_preview_tts,
title = {google/gemini-2.5-pro-preview-tts API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts}
}google. (n.d.). google/gemini-2.5-pro-preview-tts API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts