Google Gemini 2.5 Pro preview com TTS, acessado via OrcaRouter com margem zero.
google/gemini-2.5-pro-preview-tts é um modelo de conversão de texto em fala (text-to-speech) em pré-visualização do Google, construído sobre a base do Gemini 2.5 Pro. Ele converte entrada de texto em…
A principal capacidade do google/gemini-2.5-pro-preview-tts é converter texto escrito em áudio falado. Ele é construído sobre o Gemini 2.5 Pro do Google, indicando um forte entendimento de linguagem, o que deve resultar em frases naturais, entonação adequada e pronúncia clara. O modelo aceita apenas entrada de texto, portanto não é multimodal no lado da entrada. Ele não processa entrada de áudio, imagens ou vídeo. A saída provavelmente é áudio em um formato digital padrão. Como modelo TTS, ele pode lidar com vários idiomas, mas o suporte específico a idiomas não foi divulgado para esta prévia. Ele é otimizado para gerar fala, não para outras capacidades do Gemini 2.5 Pro, como raciocínio ou geração de código.
O modelo se destaca em aplicações que exigem conversão de texto escrito em fala com som natural. Os melhores casos de uso incluem assistentes de voz, onde o assistente lê as respostas em voz alta, narração automatizada de audiolivros e podcasts, recursos de acessibilidade que leem texto na tela para usuários com deficiência visual e sistemas de atendimento ao cliente que fornecem respostas faladas. Também pode ser usado para aplicações de aprendizado de idiomas, onde a pronúncia correta é modelada, ou para gerar conteúdo de voz a partir de feeds RSS ou artigos. Devido ao seu status de pré-visualização, é aconselhável testar minuciosamente para seu idioma, domínio ou requisitos de estilo específicos antes de se comprometer com uma implantação em larga escala.
Embora o google/gemini-2.5-pro-preview-tts ofereça qualidade TTS premium, pode ser exagerado para simples bipes ou sons de notificação, ou para aplicações onde a baixa latência é crítica, mas o tempo de processamento do modelo é maior do que o de chips TTS dedicados. Se você precisa apenas de fala básica e monótona ou tem um volume muito alto com restrições orçamentárias rigorosas, um modelo TTS mais leve (por exemplo, de outros provedores no OrcaRouter) com custos por token mais baixos pode ser mais adequado. Além disso, se o seu caso de uso requer streaming em tempo real com latência extremamente baixa, avalie se o modelo de pré-visualização do Gemini atende aos seus requisitos de velocidade, já que modelos maiores podem introduzir maior latência do primeiro token.
A partir da versão de pré-visualização do modelo, o Google não publicou pontuações de referência específicas para a variante gemini-2.5-pro-preview-tts. O modelo base subjacente Gemini 2.5 Pro demonstrou forte desempenho em tarefas de compreensão de linguagem e raciocínio, mas as métricas de qualidade de fala da variante TTS (por exemplo, Mean Opinion Score, Word Error Rate) não foram divulgadas publicamente. Sem benchmarks oficiais, a OrcaRouter recomenda avaliar o modelo em seu próprio conjunto de teste de entradas de texto, medindo a qualidade subjetiva do áudio, latência e confiabilidade sob carga. Para decisões de produção, realize suas próprias comparações A/B com outros serviços TTS.
Os valores específicos de latência para o google/gemini-2.5-pro-preview-tts não foram divulgados publicamente. Como um modelo TTS baseado em uma arquitetura de modelo de linguagem grande, ele pode apresentar latência mais alta em comparação com modelos neurais TTS especializados que são otimizados para transmissão em tempo real. Os fatores que influenciam a velocidade incluem o comprimento do texto de entrada, o tempo de processamento interno do modelo e o round-trip de rede para os endpoints da OrcaRouter. Para aplicações onde a baixa latência é crítica (por exemplo, IA conversacional), teste este modelo com comprimentos típicos de entrada para avaliar sua adequação. Considere usar geração de texto em streaming ou fragmentada se a API suportar.
**Pontos fortes:** Construído sobre a avançada arquitetura Gemini 2.5 Pro do Google, provavelmente produz uma fala altamente natural e expressiva, com boa prosódia e pronúncia. O acesso via API compatível com OpenAI do OrcaRouter simplifica a integração. A ausência de margem sobre o preço do provedor torna o custo previsível. **Limitações:** A modalidade de entrada é apenas texto; não é possível processar áudio ou outras modalidades. Por ser uma versão de pré-visualização, pode apresentar casos extremos não descobertos ou qualidade inconsistente. O tamanho da janela de contexto é desconhecido, restringindo o texto que pode ser convertido em uma única solicitação. Os detalhes do formato de saída não são fornecidos. Não foi projetado para tarefas como reconhecimento de fala ou clonagem de voz.
O preço do google/gemini-2.5-pro-preview-tts é baseado no uso de tokens, cobrado a $1.00 por 1 milhão de tokens de entrada e $20.00 por 1 milhão de tokens de saída. Os tokens de entrada incluem o prompt de texto e quaisquer instruções. Os tokens de saída representam o áudio gerado. A OrcaRouter cobra exatamente a taxa do provedor, sem margem de lucro, ou seja, você paga apenas o que o Google cobra, mais quaisquer impostos aplicáveis. Não há compromissos mínimos ou taxas mensais. O uso é medido por solicitação e agregado na sua fatura da OrcaRouter. Como as contagens de tokens de saída de TTS podem ser altas (o áudio sendo mais denso em tokens que o texto), o custo de saída é a despesa principal.
O preço dos tokens de saída ($20 por 1M) é significativamente maior do que o dos tokens de entrada ($1 por 1M). Isso é típico para modelos generativos porque os tokens de saída exigem mais computação. Para texto-para-fala, a saída de áudio é representada como uma série de tokens, e converter texto em fala envolve gerar uma longa sequência de tokens de áudio. O custo total de uma tarefa específica depende do comprimento do áudio de saída em relação ao texto de entrada. Se você precisar gerar longos trechos de fala (por exemplo, um audiolivro completo), os custos podem se acumular. Para solicitações curtas (por exemplo, uma única frase), os custos são mínimos. Monitore seu uso de tokens para projetar custos.
Não, o OrcaRouter não adiciona nenhum markup à taxa do provedor para google/gemini-2.5-pro-preview-tts. Os preços listados de $1.00 por 1M de tokens de entrada e $20.00 por 1M de tokens de saída são exatamente o que o Google cobra. O OrcaRouter repassa esses valores diretamente para você. Isso é consistente com o modelo de precificação do OrcaRouter para muitos modelos em que a plataforma atua como um proxy transparente. Você paga apenas pelos tokens que consome. Quaisquer funcionalidades opcionais, como cache ou suporte premium, podem incorrer em taxas separadas, mas o custo base por token não tem markup.
Para usar o google/gemini-2.5-pro-preview-tts, faça requisições para a API compatível com OpenAI do OrcaRouter na URL base https://api.orcarouter.ai/v1. Use o ID do modelo 'google/gemini-2.5-pro-preview-tts' nas suas chamadas de API. O formato da requisição segue a estrutura padrão de chat completions do OpenAI com um campo 'model', um array 'messages' contendo seu prompt de texto (com um papel de sistema e/ou usuário) e parâmetros padrão como temperature e max_tokens. A resposta conterá os tokens de áudio gerados, que seu cliente pode decodificar para reproduzir como fala. A autenticação é feita por meio de uma chave de API fornecida pelo OrcaRouter.
A API suporta parâmetros padrão compatíveis com OpenAI, incluindo 'model', 'messages' (array de objetos com role e content), 'temperature' (para controlar a variabilidade da saída de áudio), 'max_tokens' (para limitar o comprimento do áudio gerado) e 'top_p'. Como modelo TTS, pode haver parâmetros adicionais para estilo de voz ou velocidade, mas estes não foram documentados nos fatos disponíveis. Consulte a documentação da API da OrcaRouter para obter os campos suportados mais recentes. O parâmetro 'response_format' pode permitir especificar a codificação de áudio (por exemplo, wav ou mp3). Se não for suportado por padrão, pode ser necessário decodificar o fluxo de tokens retornado.
Se você estiver usando atualmente um serviço TTS diferente (ex.: Google Cloud Text-to-Speech, Amazon Polly), migrar para o google/gemini-2.5-pro-preview-tts via OrcaRouter envolve atualizar seu endpoint de API e o formato da requisição. O OrcaRouter usa endpoints compatíveis com OpenAI, então você mudará de um SDK específico do provedor para um compatível com OpenAI. Substitua sua URL base atual por https://api.orcarouter.ai/v1, use o ID do modelo 'google/gemini-2.5-pro-preview-tts' e ajuste os corpos das suas requisições para corresponder ao schema de chat completions. Talvez seja necessário modificar como você lida com a resposta: em vez de receber arquivos de áudio diretamente, você obterá uma saída tokenizada que precisará decodificar. Teste com entradas de exemplo.
A autenticação é feita incluindo uma chave de API no cabeçalho Authorization (formato: Bearer YOUR_API_KEY). Você obtém a chave de API da sua conta OrcaRouter. Os limites de taxa são definidos pela OrcaRouter com base no seu plano; eles não são os mesmos que os limites do Google. Para uso de alto volume, entre em contato com a OrcaRouter para ajustar os limites. O modelo de pré-visualização pode ter restrições adicionais do Google – se você encontrar erros como 'modelo não disponível', verifique se seu plano OrcaRouter inclui este modelo. Não há limites de taxa específicos divulgados para este modelo, mas as melhores práticas padrão (tentar novamente com backoff exponencial) são recomendadas.
google/gemini-2.5-pro-preview-tts é uma variante especializada da família Gemini 2.5 Pro adaptada para conversão de texto em fala (text-to-speech). Outros modelos Gemini 2.5 Pro são de propósito geral e lidam com entrada de texto, imagens, áudio e vídeo; eles não geram saída de fala nativamente. Esta variante TTS elimina a entrada multimodal e foca na geração de áudio a partir de texto. Provavelmente utiliza o mesmo entendimento de linguagem subjacente para prosódia e ritmo, mas não é adequada para raciocínio, codificação ou análise multimodal. Se você precisar de capacidades TTS sem abrir mão da entrada multimodal, combinaria um modelo Gemini padrão com um pipeline TTS separado. O TTS de pré-visualização fornece um pipeline mais simplificado.
OrcaRouter oferece acesso a modelos TTS de diversos provedores. Este modelo da Google é baseado em uma arquitetura de modelo de linguagem grande, que pode produzir fala mais natural e contextualmente consciente do que sistemas TTS concatenativos ou paramétricos mais antigos. No entanto, pode ser mais lento e mais caro por token em comparação com modelos TTS neurais especializados, projetados para baixa latência e alta taxa de transferência. Muitos serviços TTS populares cobram por caractere ou por segundo de áudio, não por token, o que dificulta a comparação direta de custos. Para implantações em produção que exigem custo extremamente baixo, modelos TTS dedicados podem ser preferíveis. O modelo da Google é melhor para casos de uso onde a mais alta qualidade da saída justifica o maior custo por token de saída.
Escolha este modelo se você precisar de qualidade de fala de ponta da mais recente arquitetura Gemini do Google e quiser acessá-lo por meio de uma API padrão compatível com OpenAI, sem gerenciar credenciais do Google Cloud. O preço sem margem de lucro garante transparência. É ideal para aplicações onde a naturalidade é crítica, como IA conversacional ou conteúdo narrativo. O status de pré-visualização permite experimentação precoce para avaliar sua qualidade para seu domínio. No entanto, se você precisar de streaming em tempo real com latência inferior a 100ms, um modelo de TTS de streaming dedicado pode ser melhor. Além disso, se seu orçamento for sensível, teste o consumo de tokens de saída para casos de uso típicos para garantir que o custo seja aceitável.
Compatível com OpenAI — mantenha seu SDK
https://api.orcarouter.ai/v1voice| Entrada / 1M tokens | $1.00 |
| Saída / 1M tokens | $20.00 |
| Moeda | USD |
Estimativa com base no preço de tabela
Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.
Do que os desenvolvedores estão falando esta semana
GET /api/public/models/google/gemini-2.5-pro-preview-ttsAbrir @misc{orcarouter_gemini_2_5_pro_preview_tts,
title = {google/gemini-2.5-pro-preview-tts API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts}
}google. (n.d.). google/gemini-2.5-pro-preview-tts API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts