O modelo de conversão de texto em fala rápido e econômico do Google para geração de áudio em tempo real, acessado via OrcaRouter.
google/gemini-3.1-flash-tts-preview é um modelo de texto para fala do Google, parte da família Gemini Flash. Ele aceita entrada de texto e gera saída de áudio falado. O modelo é otimizado para…
A principal capacidade é converter texto escrito em fala com som natural. O modelo é projetado para velocidade, utilizando a arquitetura Flash para reduzir latência. Suporta vários idiomas e vozes? O suporte a idiomas e vozes desta prévia específica não está detalhado nos fatos fornecidos; você deve consultar a documentação do Google para opções de voz atuais. O modelo pode lidar com entradas de texto variadas, incluindo pontuação, números e abreviações, produzindo saída falada que reflete o ritmo e tom pretendidos.
Os melhores casos de uso incluem qualquer aplicação onde a geração de fala com baixa latência é crítica: assistentes de voz em tempo real, dublagem de tradução ao vivo, chatbots interativos com saída de voz e sistemas telefônicos automatizados. Também se destaca para processamento em lote quando você precisa gerar muitos clipes de áudio curtos rapidamente. Produtores de conteúdo podem usá-lo para narrações dinâmicas em jogos de vídeo ou audiolivros. Como o custo de saída é alto em relação à entrada, é mais econômico quando o áudio de saída é conciso.
Se o seu caso de uso envolve geração de áudio extremamente longa (por exemplo, horas de fala) ou não requer baixa latência, considere um modelo TTS em lote com menor custo por token de saída. Para aplicações onde o volume de entrada domina (por exemplo, muitos prompts curtos), o baixo custo de entrada torna este modelo Flash atraente. Para cenários que exigem qualidade de saída muito alta—como personagens emocionalmente expressivos—você pode avaliar modelos TTS premium do Google ou de outros provedores. Sempre monitore o volume total de tokens e os requisitos de latência.
Como um modelo Gemini Flash, esta variante TTS é otimizada para baixa latência. Benchmarks específicos de latência (por exemplo, tempo para o primeiro pacote de áudio) não são fornecidos nos fatos disponíveis. Na prática, modelos Flash geralmente respondem em centenas de milissegundos para entradas curtas. A latência pode variar com base no comprimento da saída, condições de rede e carga de solicitações simultâneas. O roteamento do OrcaRouter pode adicionar uma sobrecarga mínima. Para aplicações em tempo real, teste com as durações de áudio esperadas sob carga.
Os pontos fortes incluem baixo custo de entrada ($1.00/1M tokens), geração rápida e a infraestrutura robusta do Google. O status de pré-visualização indica que a qualidade do modelo e a disponibilidade podem mudar. Uma limitação é o alto custo de saída ($20.00/1M tokens) em relação a modelos de texto. Além disso, a qualidade do áudio de saída – como naturalidade, variedade de sotaques e prosódia – não é avaliada aqui. Você deve avaliar a qualidade de voz do modelo para seu domínio específico (por exemplo, jargão técnico, alcance emocional) antes da implantação em produção.
Não há pontuações de benchmark para google/gemini-3.1-flash-tts-preview fornecidas nos fatos disponíveis. Modelos TTS são frequentemente avaliados com métricas como Mean Opinion Score (MOS) para naturalidade, taxa de erro de palavras (WER) para inteligibilidade e percentis de latência. Sem números específicos, você deve realizar sua própria avaliação usando prompts representativos para avaliar a qualidade e a velocidade em relação aos seus requisitos. OrcaRouter não adiciona ou modifica o desempenho do modelo.
Os fatos disponíveis não especificam os idiomas suportados ou as capacidades de sotaque para esta prévia de TTS. Os modelos de TTS mais amplos da Google geralmente suportam vários idiomas, mas a cobertura desta variante específica é desconhecida. Você deve testar com texto multilíngue para confirmar a qualidade da saída. Para o inglês, o desempenho provavelmente é robusto dado o investimento da Google. Para idiomas menos comuns, considere entrar em contato diretamente com a Google ou testar com texto de amostra por meio da API da OrcaRouter.
Os preços seguem as tarifas oficiais do Google, sem nenhum markup da OrcaRouter. Tokens de entrada (texto) custam $1,00 por 1 milhão de tokens. Tokens de saída (áudio) custam $20,00 por 1 milhão de tokens. Tokens de saída são gerados por unidade de áudio; a proporção exata entre token e tempo não é especificada. Você é cobrado tanto pelos tokens de entrada quanto pelos de saída usados em cada solicitação. Não há taxas adicionais de plataforma nem requisitos de gasto mínimo. A cobrança ocorre através dos métodos de pagamento existentes da OrcaRouter.
Tokens de entrada são 20x mais baratos que tokens de saída. Isso incentiva o envio de prompts de texto mais longos (dentro dos limites de tokens) para gerar saída de áudio proporcionalmente mais longa, já que o custo de entrada permanece baixo. Por exemplo, gerar um clipe de áudio de 1 minuto pode consumir muitos tokens de saída a $20/1M, enquanto o prompt de texto pode custar apenas centavos. Otimize mantendo a saída concisa sempre que possível. Se o seu caso de uso gerar áudio muito longo, o custo de saída por solicitação pode aumentar rapidamente.
Os fatos disponíveis não mencionam nenhum programa de cache ou desconto para este modelo no OrcaRouter. O preço do OrcaRouter é repassado conforme as taxas do provedor. Você pode querer verificar com o OrcaRouter opções de desconto por volume ou capacidade reservada que possam ser aplicadas entre modelos. Como o custo do token de saída é alto, armazenar em cache segmentos de áudio gerados para uso repetido (por exemplo, respostas comuns) pode reduzir significativamente o gasto total.
Comparações não são fornecidas diretamente. No entanto, o Google Flash TTS é posicionado como econômico para uso em tempo real com baixo custo de entrada. Outros modelos de TTS (por exemplo, OpenAI TTS, ElevenLabs) podem ter estruturas de preços diferentes—geralmente cobrando por caractere ou por segundo de áudio. O preço por token de saída deste modelo pode ser mais caro para áudios muito longos, mas mais barato para gerações curtas e intermitentes. Avalie seus volumes de token esperados em relação a outras ofertas no catálogo do OrcaRouter.
Use qualquer cliente compatível com OpenAI. Defina a URL base para https://api.orcarouter.ai/v1, a chave API da sua conta OrcaRouter e o ID do modelo para "google/gemini-3.1-flash-tts-preview". Envie uma solicitação de conclusão de chat com uma mensagem do usuário contendo o texto a ser falado. A resposta incluirá conteúdo de áudio (provavelmente como um trecho codificado em base64 ou URL). O formato exato da saída depende da implementação do modelo do Google. Consulte a documentação da OrcaRouter para suporte a streaming e análise de resposta.
Os parâmetros padrão de chat completion se aplicam: model, messages (com role e content) e, opcionalmente, temperature ou top_p para variabilidade de saída (embora menos relevantes para TTS). Para seleção de voz, o modelo do Google pode suportar um parâmetro extra (por exemplo, voice name). Os fatos disponíveis não listam parâmetros específicos de TTS. Talvez seja necessário passar campos adicionais como "voice" ou "language" no corpo da solicitação. Consulte a documentação da API do Google para o modelo de pré-visualização para obter opções exatas.
É comum que modelos TTS ofereçam suporte a áudio em streaming, onde blocos de áudio são enviados à medida que são gerados. As informações fornecidas não confirmam suporte a streaming para este modelo de pré-visualização. Se o streaming estiver habilitado, você pode usar o parâmetro stream definido como verdadeiro na sua solicitação de API e processar os blocos conforme eles chegam. O OrcaRouter oferece suporte a streaming para modelos compatíveis. Teste com uma solicitação simples para ver se o áudio é retornado incrementalmente ou como um bloco completo.
Se você já usa uma API compatível com OpenAI, altere a URL base para https://api.orcarouter.ai/v1 e atualize o ID do modelo. Atualize seus parâmetros de requisição para corresponder às especificações do Google TTS (por exemplo, nome da voz). Talvez seja necessário ajustar o tratamento da saída de áudio se o formato for diferente (por exemplo, MP3 vs WAV). Teste com prompts de amostra para verificar a qualidade. Como o preço é sem margem de lucro (zero-markup), seus custos podem mudar com base no uso de tokens. Nenhuma ferramenta especial de migração é necessária.
A OpenAI oferece modelos TTS (tts-1, tts-1-hd) com preços por caractere (~$0,015 por 1.000 caracteres). Em contraste, o modelo do Google usa precificação baseada em tokens, que pode ser mais econômica para entradas curtas, mas mais cara para saídas longas. O TTS da OpenAI suporta múltiplas vozes e idiomas; os detalhes específicos da prévia do Google não são totalmente conhecidos. Latência: tanto o Flash quanto os modelos da OpenAI são projetados para baixa latência. A qualidade é subjetiva; você deve testar com seu conteúdo para comparar naturalidade e prosódia.
O Google também oferece modelos TTS premium (por exemplo, WaveNet, Studio) por meio de sua API Cloud Text-to-Speech. Esses modelos geralmente cobram por caractere de texto enviado, o que pode ser mais barato para áudios muito longos, mas têm custos mais altos por requisição. O Flash TTS é mais rápido e possui precificação de entrada mais simples (por token), mas pode ter menos opções de voz. Para fala de alta fidelidade e emocionalmente rica, um modelo premium pode ser melhor. Para velocidade e baixo custo por entrada, a variante Flash é vantajosa.
Se você precisa de resposta em tempo real e tem textos de entrada curtos (muitas solicitações pequenas), este modelo Flash, com seu baixo custo de entrada e geração rápida, é ideal. Para geração de áudio muito longa (por exemplo, audiolivros completos), um modelo que cobra por caractere de entrada (como o TTS padrão do Google) pode ser mais barato, pois evita o custo por token de saída. Considere também a variedade de vozes e o suporte a idiomas: se você precisa de muitas vozes distintas, verifique se esta prévia oferece suporte a isso. Teste ambas as opções com sua carga de trabalho antes de se comprometer.
Compatível com OpenAI — mantenha seu SDK
https://api.orcarouter.ai/v1voice| Entrada / 1M tokens | $1.00 |
| Saída / 1M tokens | $20.00 |
| Moeda | USD |
Estimativa com base no preço de tabela
Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.
GET /api/public/models/google/gemini-3.1-flash-tts-previewAbrir @misc{orcarouter_gemini_3_1_flash_tts_preview,
title = {google/gemini-3.1-flash-tts-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview}
}google. (n.d.). google/gemini-3.1-flash-tts-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview