Um cartão hero gerado para 'Gemini 3.8 TTS vs VoxCPM2' sobre um fundo branco com suaves acentos em gradiente azul e ciano. O cartão à esquerda, 'Gemini 3.8 Flash TTS', lista um endpoint de API, Elo 1.260 na posição 2 e US$ 16,50 por 1 milhão de caracteres normalizados; o cartão à direita, 'VoxCPM2', lista Apache 2.0, 2B parâmetros, cerca de 8 GB de VRAM para executar, um fator de tempo real de 0,30 em PyTorch puro e nenhum endpoint hospedado. Uma linha de rodapé diz 'Elo por Artificial Analysis Provider Voice Arena, setembro de 2026; números do VoxCPM2 conforme seu model card.' O logotipo da OrcaRouter está composto no canto inferior direito.
Guides & Insights

Gemini 3.8 TTS vs VoxCPM2: Alugar uma Voz ou Executar a Sua, em Números Reais

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Não existe nenhuma linha de ranking que coloque Gemini 3.8 Flash TTS e VoxCPM2lado a lado, e essa ausência é o fato mais útil nesta comparação. O Gemini 3.8 Flash TTS é um endpoint hospedado com um Elo de 1.260 na 2ª posição do Artificial Analysis Provider Voice Arena e uma tabela de preços publicada em tokens. O VoxCPM2 é um checkpoint da OpenBMB — 2 bilhões de parâmetros, Apache 2.0, lançado em abril de 2026 — que nenhum provedor de inferência hospeda. Você não pode alugá-lo. Você o executa.

Portanto, a questão não é qual modelo soa melhor. É se a sua carga de trabalho é melhor atendida pagando por caractere pelas GPUs de outra pessoa ou possuindo as GPUs e pagando por elas estejam elas trabalhando ou não. Essa é uma questão aritmética e, ao contrário da maioria das comparações de modelos, tem uma resposta que você pode calcular antes de se comprometer.

A generated comparison scoreboard for Gemini 3.8 Flash TTS and VoxCPM2, showing access (a hosted API against self-hosted only), size (undisclosed against 2B parameters), licence (vendor terms against Apache 2.0), price ($16.50 per 1M characters against a GPU-hour cost), throughput (not applicable against a real-time factor of 0.13 to 0.30) and independent Elo (1,260 against none).

Um desses você aluga, o outro você opera.

Comece pelo que cada um realmente lhe entrega.

• Acesso — O Gemini 3.8 Flash TTS é somente API, chamado por meio da API Gemini e das superfícies do Google nomeadas em seu anúncio de 23 de setembro de 2026. O VoxCPM2 não tem endpoint próprio em uso em produção nem provedor de inferência que o sirva; o checkpoint é o produto.

• Licença — O VoxCPM2 é distribuído sob a Apache 2.0, que permite uso comercial sem um acordo separado. Essa é uma licença genuinamente permissiva, e não é o padrão para pesos abertos de fala, vários dos quais são distribuídos sob termos exclusivos para pesquisa que encaminham o uso comercial de volta por meio de uma API hospedada.

• Tamanho — O VoxCPM2 tem 2 bilhões de parâmetros e cabe em aproximadamente 8 GB de VRAM com precisão reduzida para desenvolvimento, com pico de serving em torno de 22 GB em uma placa de 24 GB. O Google não publicou contagem de parâmetros para nenhum dos modelos Gemini 3.8 TTS.

• Criação de voz — O Gemini 3.8 Flash TTS faz design de voz a partir de uma descrição escrita, replicação de voz a partir de uma amostra de 30 segundos e diálogo com dois falantes em uma única chamada. O VoxCPM2 é um modelo de conversão de texto em fala de voz única; uma conversa consiste em duas execuções costuradas.

• Pontuação independente — o Flash TTS tem uma. O VoxCPM2 não aparece entre as linhas classificadas na Provider Voice Arena capturada em 24 de setembro de 2026. A ausência em um quadro não é um veredito sobre a qualidade — geralmente significa que ninguém inscreveu o modelo —, mas significa que não há um número de preferência de terceiros para ponderar.

A screenshot of the Hugging Face model card for OpenBMB/VoxCPM2, showing the Apache 2.0 licence, the 2 billion parameter checkpoint size, the 30-language coverage, 48 kHz output and the 2 million hours of training audio recorded on the card.

Esse último ponto corta nos dois sentidos e vale a pena afirmá-lo claramente em vez de minimizá-lo: se você precisa de um sinal de qualidade independente antes de se comprometer, apenas um desses dois oferece um.

O número que decide: fator de tempo real

A auto-hospedagem de um modelo de fala converte uma cobrança por caractere em uma cobrança por hora de GPU, e a taxa de câmbio entre essas duas unidades é o fator de tempo real do modelo — quantos segundos de computação são necessários para produzir um segundo de áudio.

Os números publicados do VoxCPM2 são 0,30 em PyTorch puro e 0,13 sob o Nano-VLLM. Leia esses valores como taxa de transferência, não como latência: a 0,13, uma hora-GPU de tempo real produz algo na ordem de 7,7 horas de áudio finalizado. A 0,30, a mesma hora-GPU produz mais perto de 3,3 horas. Esses são os números da própria ficha do modelo, medidos pela OpenBMB, e são o dado mais importante para qualquer decisão de construir versus comprar neste caso.

Três coisas seguem delas.

• O stack de serving importa mais do que o modelo. Migrar do PyTorch puro para o Nano-VLLM mais do que dobra a vazão em hardware idêntico. Qualquer modelo de custo baseado no número 0,30 superestima o custo da auto-hospedagem em um fator de cerca de 2,3.

• Utilização é tudo. Uma GPU alugada que fica ociosa 90% do tempo não é mais barata do que uma API a preço algum. O ponto de equilíbrio só aparece quando você mantém a placa ocupada.

• O processamento em lote altera novamente a aritmética. O fator de tempo real é medido por fluxo; um servidor que lida com requisições simultâneas amortiza o custo fixo entre elas, que é exatamente o regime em que a auto-hospedagem começa a compensar.

Quanto custa uma hora de áudio, nos dois sentidos

Coloque os dois modelos de cobrança no mesmo eixo. Uma hora de áudio finalizado equivale a 3.600 segundos de saída.

Do lado do aluguel, o Google cobra em tokens, e não em caracteres: US$ 0,50 por milhão de tokens de texto de entrada e US$ 9,00 por milhão de tokens de áudio de saída até 31 de dezembro de 2026, depois US$ 18,00; o Flash-Lite TTS custa US$ 0,50 e US$ 6,00, depois US$ 12,00. Batch e Flex custam US$ 0,25 e US$ 4,50 para o Flash TTS, contra US$ 0,25 e US$ 3,00 para o Flash-Lite TTS, e Priority custa US$ 0,90 e US$ 16,00. A Artificial Analysis normaliza as tarifas padrão para US$ 16,50 e US$ 11,00 por milhão de caracteres, o que é a conversão do ranking, e não uma cotação do Google, e é o valor a ser usado ao comparar com um modelo que cobra em caracteres.

Do lado da infraestrutura própria, não existe nenhuma tarifa por caractere. O custo é a hora de GPU, multiplicada por quantas horas você precisar na vazão acima, mais o stack de serviço, mais as pessoas que o mantêm funcionando. A vantagem do VoxCPM2 é que o custo marginal da milésima hora é o mesmo da primeira — e a desvantagem é que o custo marginal da primeira hora é uma GPU.

É por isso que a decisão é excepcionalmente clara:

• Abaixo de determinado volume, a API vence — e não é por pouco. Você está pagando valores de um dígito em dólares por hora de áudio, em comparação com um custo de capital, e a tarifa promocional do Google amplia essa diferença até 1º de janeiro de 2027.

• Acima desse volume, em hardware que você já possui e pode manter ocupado, o checkpoint Apache 2.0 vence decisivamente — e, ao contrário de um checkpoint com licença de pesquisa, nada na licença impede que você o distribua.

• No meio disso, a resposta honesta é que você está comprando opcionalidade, e não economia. A auto-hospedagem oferece a capacidade de fixar uma versão, manter o áudio na sua própria infraestrutura e parar de se preocupar com mudanças de tarifas de um fornecedor.

Onde cada um é a resposta correta

Escolha o Gemini 3.8 Flash TTS quando quiser o produto com melhor documentação. Ele tem uma pontuação independente, um preço publicado, diálogo com dois locutores em uma única chamada, design de voz e replicação, e nenhuma superfície operacional além de uma chave de API. O modelo irmão Flash-Lite TTS oferece um segundo ponto de preço dentro da mesma interface, a um valor normalizado de US$ 11,00 por milhão de caracteres. O que você aceita em troca é uma tarifa que dobra em 1º de janeiro de 2027 e a impossibilidade de executar o modelo em qualquer lugar.

Escolha o VoxCPM2 quando o trabalho operacional é o essencial. O Apache 2.0 significa que o uso comercial é permitido sem restrições, o tamanho de 2B significa que um único acelerador é suficiente, e o fator de tempo real de 0,13 no Nano-VLLM significa que uma placa modesta produz várias horas de áudio por hora de relógio. O que você aceita é que ninguém mais vai executá-lo para você: sem endpoint hospedado, sem linha de arena, sem tabela de preços do fornecedor, e cada garantia de qualidade que você obtém é uma que você mesmo constrói e mede.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and 8 arena voices, with Gemini 3.8 Flash-Lite TTS at rank 6 and no VoxCPM2 row on the board.

Nenhum dos modelos é hospedado pela OrcaRouter, e isso vale dizer diretamente em vez de insinuar o contrário. O lugar para chamar o Gemini 3.8 Flash TTS é a própria API do Google e as superfícies que o Google nomeou; o VoxCPM2 é um checkpoint que você mesmo implanta. O que a OrcaRouter cobre é a camada acima dessa decisão — mais de 200 modelos atrás de uma única chave pelo preço de tabela do provedor sem markup, de modo que uma mudança de preço de um fornecedor entra em vigor do nosso lado no mesmo dia, e não no próximo ciclo de faturamento, failover automático para que um modelo em avaliação nunca precise ser uma dependência de produção, e uma DSL de roteamento que compõe vários modelos em uma única chamada quando uma só voz não dá conta do trabalho inteiro.

O que assistir em seguida

Duas coisas mudariam substancialmente essa comparação, e nenhuma delas aconteceu ainda.

O primeiro é alguém que hospeda o VoxCPM2. Sua ausência do mercado de inferência é o principal motivo de os dois modelos estarem sendo comparados por critérios econômicos, e não por qualidade — se um provedor o adotar, a conta de alugar versus possuir deixa de ser o fator decisivo, e a linha ausente da arena passa a ser aquilo que você quer ver preenchido.

A segunda é a mudança de tarifas de janeiro por parte do Google. Na tarifa promocional, a API é barata o suficiente para que a maioria das cargas de trabalho não deva hospedar nada por conta própria; na tarifa pós-promocional, a diferença diminui a ponto de uma equipe com capacidade de GPU já existente e volume constante dever refazer as contas, em vez de presumir que a API ainda leva vantagem.

Até que uma dessas coisas mude, o fator decisivo não é um ranking. É quantas horas de áudio por mês você produz, e se a placa está ocupada.