El modelo de texto a voz rápido y rentable de Google para generación de audio en tiempo real, accesible a través de OrcaRouter.
google/gemini-3.1-flash-tts-preview es un modelo de texto a voz de Google, parte de la familia Gemini Flash. Acepta entrada de texto y genera salida de audio hablado. El modelo está optimizado para…
La capacidad principal es convertir texto escrito en voz de sonido natural. El modelo está diseñado para la velocidad, aprovechando la arquitectura Flash para reducir la latencia. ¿Admite múltiples idiomas y voces? El soporte de idiomas y voces de esta vista previa específica no se detalla en los datos proporcionados; debe consultar la documentación de Google para conocer las opciones de voz actuales. El modelo puede manejar entradas de texto variadas, incluyendo puntuación, números y abreviaturas, produciendo una salida hablada que refleja el ritmo y tono previstos.
Los mejores casos de uso incluyen cualquier aplicación donde la generación de voz de baja latencia sea crítica: asistentes de voz en tiempo real, doblaje de traducción en vivo, chatbots interactivos con salida de voz y sistemas telefónicos automatizados. También sobresale para el procesamiento por lotes cuando necesitas generar muchos clips de audio cortos rápidamente. Los productores de contenido pueden usarlo para voces dinámicas en videojuegos o audiolibros. Debido a que el costo de salida es alto en relación con la entrada, es más económico cuando el audio de salida es conciso.
Si tu caso de uso implica la generación de audio extremadamente largo (por ejemplo, horas de discurso) o no requiere baja latencia, considera un modelo TTS por lotes con un menor costo de salida por token. Para aplicaciones donde el volumen de entrada es dominante (por ejemplo, muchas indicaciones cortas), el bajo costo de entrada hace que este modelo Flash sea atractivo. Para escenarios que requieren una calidad de salida muy alta, como personajes emocionalmente expresivos, podrías evaluar modelos TTS premium de Google u otros proveedores. Siempre monitorea el volumen total de tokens y los requisitos de latencia.
Como modelo Gemini Flash, esta variante de TTS está optimizada para baja latencia. No se proporcionan puntos de referencia de latencia específicos (por ejemplo, tiempo hasta el primer paquete de audio) en los datos disponibles. En la práctica, los modelos Flash suelen responder en unos cientos de milisegundos para entradas cortas. La latencia puede variar según la longitud de la salida, las condiciones de la red y la carga de solicitudes concurrentes. El enrutamiento de OrcaRouter puede agregar una sobrecarga mínima. Para aplicaciones en tiempo real, pruebe con las duraciones de audio esperadas bajo carga.
Las fortalezas incluyen bajo costo de entrada ($1.00/1M tokens), generación rápida y la infraestructura robusta de Google. El estado de vista previa significa que la calidad del modelo y la disponibilidad pueden cambiar. Una limitación es el alto costo de salida ($20.00/1M tokens) en comparación con los modelos de texto. Además, la calidad del audio de salida —como naturalidad, variedad de acentos y prosodia— no se evalúa aquí. Debe evaluar la calidad de voz del modelo para su dominio específico (por ejemplo, jerga técnica, rango emocional) antes del despliegue en producción.
No se proporcionan puntuaciones de referencia para google/gemini-3.1-flash-tts-preview en los hechos disponibles. Los modelos TTS a menudo se evalúan con métricas como la Puntuación de Opinión Media (MOS) para naturalidad, la tasa de error de palabras (WER) para inteligibilidad y los percentiles de latencia. Sin números específicos, debe realizar su propia evaluación utilizando indicaciones representativas para evaluar la calidad y la velocidad en relación con sus requisitos. OrcaRouter no agrega ni modifica el rendimiento del modelo.
Los datos disponibles no especifican los idiomas compatibles ni las capacidades de acento para esta vista previa de TTS. Los modelos TTS más amplios de Google suelen admitir varios idiomas, pero se desconoce la cobertura de esta variante específica. Debes probar con texto multilingüe para confirmar la calidad de salida. Para el inglés, es probable que el rendimiento sea robusto dada la inversión de Google. Para idiomas menos comunes, considera contactar a Google directamente o probar con texto de muestra a través de la API de OrcaRouter.
Los precios siguen las tarifas oficiales de Google sin margen adicional por parte de OrcaRouter. Los tokens de entrada (texto) cuestan $1.00 por cada 1 millón de tokens. Los tokens de salida (audio) cuestan $20.00 por cada 1 millón de tokens. Los tokens de salida se generan por unidad de audio; la relación exacta entre token y tiempo no está especificada. Se le cobrará tanto por los tokens de entrada como por los de salida utilizados en cada solicitud. No hay tarifas adicionales de plataforma ni requisitos de gasto mínimo. La facturación se realiza a través de los métodos de pago existentes de OrcaRouter.
Los tokens de entrada son 20 veces más baratos que los tokens de salida. Esto incentiva el envío de prompts de texto más largos (dentro de los límites de tokens) para generar audio de salida proporcionalmente más largo, ya que el costo de entrada sigue siendo bajo. Por ejemplo, generar un clip de audio de 1 minuto puede consumir muchos tokens de salida a $20/1M, mientras que el prompt de texto podría costar solo centavos. Optimice manteniendo la salida concisa siempre que sea posible. Si su caso de uso genera audio muy largo, el costo de salida por solicitud puede acumularse rápidamente.
Los hechos disponibles no mencionan ningún programa de caché o descuento para este modelo en OrcaRouter. El precio de OrcaRouter es de transferencia directa a las tarifas del proveedor. Es posible que desee consultar con OrcaRouter sobre opciones de descuento por volumen o capacidad reservada que podrían aplicarse entre modelos. Dado que el costo de tokens de salida es alto, almacenar en caché segmentos de audio generados para uso repetido (por ejemplo, respuestas comunes) puede reducir significativamente el gasto total.
No se proporcionan comparaciones directamente. Sin embargo, el Flash TTS de Google se posiciona como rentable para uso en tiempo real con bajo costo de entrada. Otros modelos de TTS (por ejemplo, OpenAI TTS, ElevenLabs) pueden tener estructuras de precios diferentes, que a menudo cobran por carácter o por segundo de audio. El precio de salida por token de este modelo puede ser más caro para audio muy largo, pero más barato para generaciones cortas y rápidas. Evalúe sus volúmenes de tokens esperados frente a otras ofertas en el catálogo de OrcaRouter.
Usa cualquier cliente compatible con OpenAI. Configura la URL base en https://api.orcarouter.ai/v1, la clave de API de tu cuenta de OrcaRouter, y el ID del modelo en "google/gemini-3.1-flash-tts-preview". Envía una solicitud de finalización de chat con un mensaje de usuario que contenga el texto a pronunciar. La respuesta incluirá contenido de audio (probablemente como un fragmento codificado en base64 o una URL). El formato exacto de salida depende de la implementación del modelo de Google. Consulta la documentación de OrcaRouter para el soporte de transmisión y el análisis de respuestas.
Se aplican los parámetros estándar de finalización de chat: modelo, mensajes (con rol y contenido) y opcionalmente temperatura o top_p para la variabilidad de salida (aunque menos relevante para TTS). Para la selección de voz, el modelo de Google puede admitir un parámetro adicional (por ejemplo, nombre de la voz). Los datos disponibles no enumeran parámetros TTS específicos. Es posible que deba pasar campos adicionales como "voice" o "language" en el cuerpo de la solicitud. Consulte la documentación de la API de Google para el modelo de vista previa para conocer las opciones exactas.
Es común que los modelos TTS admitan transmisión de audio, donde los fragmentos de audio se envían a medida que se generan. Los hechos proporcionados no confirman la compatibilidad con transmisión para este modelo preliminar. Si la transmisión está habilitada, puede usar el parámetro stream establecido en true en su solicitud API y procesar los fragmentos a medida que llegan. OrcaRouter admite transmisión para modelos compatibles. Pruebe con una solicitud simple para ver si el audio se devuelve de forma incremental o como un blob completo.
Si ya utiliza una API compatible con OpenAI, cambie la URL base a https://api.orcarouter.ai/v1 y actualice el ID del modelo. Actualice los parámetros de su solicitud para que coincidan con las especificaciones de TTS de Google (por ejemplo, nombre de voz). Es posible que deba ajustar el manejo de la salida de audio si el formato difiere (por ejemplo, MP3 vs WAV). Pruebe con indicaciones de muestra para verificar la calidad. Debido a que el precio no tiene margen, sus costos pueden cambiar según el uso de tokens. No se requieren herramientas de migración especiales.
OpenAI ofrece modelos TTS (tts-1, tts-1-hd) con precios por carácter (~$0.015 por cada 1.000 caracteres). En contraste, el modelo de Google utiliza precios basados en tokens, que pueden ser más económicos para entradas cortas pero más costosos para salidas largas. El TTS de OpenAI admite múltiples voces e idiomas; los detalles específicos de la vista previa de Google no se conocen por completo. Latencia: tanto Flash como los modelos de OpenAI están diseñados para baja latencia. La calidad es subjetiva; deberías probar con tu contenido para comparar naturalidad y prosodia.
Google también ofrece modelos TTS premium (p. ej., WaveNet, Studio) a través de su API Cloud Text-to-Speech. Estos modelos suelen cobrar por carácter de texto enviado, lo que puede resultar más económico para audio muy largo, pero tienen costos más altos por solicitud. El Flash TTS es más rápido y tiene una estructura de precios de entrada más simple (por token), pero puede tener menos opciones de voz. Para lograr voz de alta fidelidad y emocionalmente rica, un modelo premium puede ser mejor. Para velocidad y bajo costo por entrada, la variante Flash es ventajosa.
Si necesitas respuesta en tiempo real y tienes textos de entrada cortos (muchas solicitudes pequeñas), este modelo Flash, con su bajo costo de entrada y generación rápida, es ideal. Para generación de audio muy larga (por ejemplo, audiolibros completos), un modelo que cobre por carácter de entrada (como el TTS estándar de Google) podría ser más económico, ya que se evita el costo por token de salida. También considera la variedad de voces y el soporte de idiomas: si requieres muchas voces distintas, verifica si esta preview lo admite. Prueba ambas opciones con tu carga de trabajo antes de comprometerte.
Compatible con OpenAI: conserva tu SDK actual
https://api.orcarouter.ai/v1voice| Entrada / 1M tokens | $1.00 |
| Salida / 1M tokens | $20.00 |
| Moneda | USD |
Estimación según precio de lista
Solo una estimación: el número real de tokens depende del tokenizador del proveedor.
GET /api/public/models/google/gemini-3.1-flash-tts-previewAbrir @misc{orcarouter_gemini_3_1_flash_tts_preview,
title = {google/gemini-3.1-flash-tts-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview}
}google. (n.d.). google/gemini-3.1-flash-tts-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview