Um cartão hero gerado para 'Gemini 3.8 TTS vs ElevenLabs' sobre um fundo branco com suaves acentos de gradiente azul e ciano. O cartão esquerdo 'ElevenLabs Eleven v3' lista $100 por 1M de caracteres, mais de 70 idiomas, Elo 1.167 e posição 17; o cartão direito 'Gemini 3.8 Flash TTS' lista $33 por 1M de caracteres, 130 idiomas, Elo 1.260 e posição 2. Uma linha de rodapé diz 'Elo por Artificial Analysis Provider Voice Arena, set. 2026.' O logotipo do OrcaRouter é composto no canto inferior direito.
Guides & Insights

Gemini 3.8 TTS vs ElevenLabs: O que você ganha ao pagar três vezes o preço

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Com o mesmo volume, o modelo de síntese carro-chefe da ElevenLabs custa cerca de três vezes o que custa o novo modelo da fornecedora. ElevenLabs Eleven v3 cobra US$ 0,10 por mil caracteres — US$ 100 por milhão — e Gemini 3.8 Flash TTS cobra US$ 9,00 por milhão de tokens de áudio, o que a Artificial Analysis normaliza para US$ 33,00 por milhão de caracteres. Isso representa uma diferença de 3,0x no medidor, e é o fato mais importante desta comparação. A pergunta interessante não é se a diferença é real; é o que os sessenta e sete dólares extras por milhão de caracteres estão de fato comprando, porque a resposta não é "melhor fala".

A generated two-column scoreboard for ElevenLabs Eleven v3 and Gemini 3.8 Flash TTS — Eleven v3 at Arena Elo 1,167, $100.00 per 1M characters, 70-plus languages, a 280 ms latency claim and 4,345 samples; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 130 languages, no latency claim and 1,999 samples — over the footer 'Elo per Artificial Analysis; latency vendor-reported.'

Três metros, não um

A primeira coisa a esclarecer é que estes dois produtos não medem a mesma coisa, e os tarifários publicados escondem isso.

• A ElevenLabs cobra por caractere. O Eleven v3 custa US$ 0,10 por 1.000 caracteres, com limite de 5.000 caracteres por solicitação. O Eleven v3 Conversational custa US$ 0,05 por 1.000, e os modelos Flash e Turbo também custam US$ 0,05 por 1.000, mas com um limite de 40.000 caracteres por solicitação e uma latência declarada de ~75 ms contra os ~280 ms do v3 Conversational.

• O Google cobra por token, e tokens de áudio não são tokens de texto. O Gemini 3.8 Flash TTS cobra $0.50 por milhão de tokens de texto de entrada e $9.00 por milhão de tokens de áudio de saída, medidos a 25 tokens de áudio por segundo de fala gerada. Não há limite de caracteres por solicitação publicado.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

• A Artificial Analysis não cobra de nenhum dos dois; ela normaliza. Os US$ 100,00 e US$ 33,00 por milhão de caracteres em seu ranking Provider Voice Arena são um denominador comum derivado para que o ranking possa ao menos classificar por preço. Útil para uma proporção, não para uma cotação.

Então, a versão honesta do valor de 3,0x é: na única base comparável disponível, o Google custa cerca de um terço do preço. O que isso significa na sua própria planilha depende de sua carga de trabalho ser dominada por strings curtas ou longas — um medidor de áudio por segundo e um medidor de texto por caractere divergem acentuadamente à medida que os enunciados ficam mais longos, porque silêncio, pausas e preenchimento prosódico custam tokens de áudio e nenhum caractere.

Um mês trabalhado

Pegue um milhão de caracteres de texto, aproximadamente o comprimento de um romance de tamanho médio, convertidos em fala uma vez.

• ElevenLabs Eleven v3 — US$ 100,00 pela síntese, mais o nível de plano que você precisar para executá-lo na sua concorrência. Os planos publicados oferecem o Starter por US$ 6, o Creator por US$ 22, o Pro por US$ 99, o Scale por US$ 299 e o Business por US$ 990, e as franquias de caracteres estão incluídas nesses valores, em vez de serem cobradas separadamente.

• Gemini 3.8 Flash TTS — equivalente a $33.00, ou cerca de $16.50 se a tarefa puder ser processada em lote, porque o nível Batch e Flex reduz pela metade a tarifa de áudio para $4.50 por milhão de tokens. O serviço prioritário eleva para $16.20 por milhão, ou cerca de $59.40 equivalente, o que ainda está bem abaixo da ElevenLabs.

• Gemini 3.8 Flash-Lite TTS — US$ 6,00 por milhão de tokens de áudio, cerca do equivalente a US$ 22,10 na mesma normalização, ao custo de 101 idiomas em vez de 130.

Passe o mesmo milhão de caracteres pelo preço promocional do Google e a diferença aumenta ainda mais, porque os dois novos modelos Gemini TTS estão com metade da tarifa até 31 de dezembro de 2026 e depois ela dobra. Quem monta um caso de negócios com base nos números de setembro está fazendo isso sobre um desconto que tem uma data de validade publicada.

A screenshot of ElevenLabs' API pricing page, captured in English, showing the Eleven v3 card at $0.10 per 1K characters with a 5,000-character limit, v3 Conversational at $0.05 with a 280 ms latency claim, v2 Multilingual at $0.10 with 29 languages, and Flash/Turbo at $0.05 with a 40,000-character limit.

O único ponto em que a comparação se inverte são as falas muito curtas. Uma tarifação por caractere cobra quase nada por uma confirmação de três palavras; uma tarifação por segundo de áudio cobra pelo segundo que a confirmação leva para ser dita, incluindo o silêncio ao redor. Se o seu produto é uma interface de voz construída com respostas de uma frase, a aritmética pende para a ElevenLabs. Se for narração, audiolivros, localização de formato longo ou qualquer coisa em que o texto seja longo e o áudio seja mais longo, pende fortemente para a Google.

A questão da qualidade, sinceramente.

Na Artificial Analysis Provider Voice Arena — votos cegos em pares entre as vozes nativas de cada provedor — os dois modelos não estão próximos, e o Google está na frente.

• Gemini 3.8 Flash TTS — 2.º lugar, Elo 1.260, um intervalo de 17 pontos, 1.999 amostras, 8 vozes de arena, lançado em setembro de 2026.

• ElevenLabs Eleven v3 — posição 17, Elo 1.167, um intervalo de 11 pontos, 4.345 amostras, 8 vozes de arena, listado como fevereiro de 2026 no ranking.

Noventa e três pontos Elo os separam e, ao contrário da diferença entre os três primeiros daquele ranking, esta é real: o intervalo do Eleven v3 é de 1.156 a 1.178, e o do Gemini é de 1.243 a 1.277, sem sobreposição. A contagem de amostras do Eleven v3 é mais que o dobro da do Gemini, então a estimativa também não é frágil.

Isso é um resultado genuinamente incômodo para o argumento de preço, e vai contra a conclusão óbvia. A ElevenLabs cobra três vezes mais e fica dezessete posições abaixo na preferência em teste cego. Compre o que comprar com os sessenta e sete dólares extras, não é uma voz que soe melhor num confronto direto.

O que a ElevenLabs está realmente vendendo

A ElevenLabs não vende primariamente um endpoint de síntese, e precificá-lo como se assim fosse é onde a maioria das comparações erra. O que o dinheiro compra:

• Uma biblioteca de vozes. A biblioteca de vozes compartilhada do ElevenLabs tem centenas de vozes e é uma superfície de produto genuína — o motivo pelo qual as pessoas vêm ao ElevenLabs geralmente é uma voz específica que ouviram em algum lugar, não o modelo por trás dela. O Gemini 3.8 Flash TTS vem com 30 vozes de estúdio pré-definidas, um caminho de design de voz que gera uma a partir de uma descrição em linguagem natural, e um caminho de replicação que clona a partir de uma amostra de 30 segundos com verificação de consentimento, uma marca d'água SynthID e credenciais C2PA anexadas. O catálogo padrão é menor; a capacidade de criar uma voz específica é comparável.

• Níveis de latência como produtos separados. Flash e Turbo a ~75 ms e um limite de 40.000 caracteres são um produto diferente do v3 a ~280 ms e 5.000 caracteres, e ambos são mais baratos que o v3. Se sua aplicação precisa de menos de 100 ms, a ElevenLabs vende isso explicitamente e o material de lançamento do Google não faz uma afirmação de latência comparável para nenhum dos novos modelos TTS.

• Um ecossistema. Dublagem, agentes de voz, endpoints conversacionais, uma estrutura de planos com concorrência associada — a mesma razão pela qual a Cartesia vende telefonia: é uma stack, não um modelo.

Se você está comprando um stack, o 3.0x é o preço de não montá-lo. Se você está comprando uma chamada de síntese, você está pagando por uma biblioteca de vozes e um nível de latência.

O que o Google está realmente vendendo

O contra-argumento é mais restrito e mais forte do que «mais barato».

• Cobertura de idiomas — 130 idiomas no Flash TTS e 101 no Flash-Lite TTS, detetados automaticamente a partir do texto, em comparação com os mais de 70 idiomas que a ElevenLabs documenta para o Eleven v3. Para uma etapa de localização, essa diferença não é uma comparação de recursos, é uma lacuna de cobertura.

• Direção — controle de locução linha por linha, encenação de cena com dois falantes dentro de uma única chamada, e sinais não verbais escritos no roteiro como <laughs>, <sigh>, <gasp>, |mhm| e |yeah|. O Google afirma que a geração 3.8 melhorou a consistência de formato longo e o controle de dois falantes em relação ao Gemini 3.1 Flash TTS, que é exatamente para isso que esses recursos existem. Alegação do fornecedor, não reproduzida.

• Modelo de estado de voz — 200 vozes personalizadas com estado por projeto, com TTL de um ano, ou vozes sem estado endereçadas por um identificador voicekey_... que expiram em sete dias. É uma decisão de infraestrutura que você pode levar em conta no seu planejamento.

• Controle de saída — WAV 24 kHz mono PCM assinado de 16 bits no endpoint unário, PCM sem cabeçalho (audio/l16) no endpoint de streaming, e audio/mulaw e audio/alaw com uma taxa de amostragem configurável.

Os benchmarks de lançamento do Google são relatados pelo fornecedor e devem ser lidos dessa forma: primeiro no Hume AI Voice Design Benchmark, com 71,4, e primeiro em modelagem de sotaque, com 60,8; primeiro e segundo no Hume Overall Quality Index para o Flash e o Flash-Lite, respectivamente; e as principais colocações em preferência cega alegadas em japonês, português brasileiro, vietnamita, árabe padrão moderno, espanhol mexicano e híndi. Nenhuma dessas execuções é pública. O Elo da arena acima é o único número coletado de forma independente neste artigo, e, por acaso, concorda com a direção das alegações do fornecedor.

O cálculo switch

Mude se a sua carga de trabalho for de formato longo, multilíngue ou de volume alto o suficiente para que 3.0x apareça como um item de linha, e se você puder conviver com um catálogo de vozes padrão menor e nenhuma camada publicada abaixo de 100 ms. Isso cobre narração, dublagem, acessibilidade e a maioria das falas incorporadas em produtos.

Fique se você está comprando o conjunto — a biblioteca de vozes, os níveis de latência, os produtos de dublagem e de agentes — ou se sua carga de trabalho é dominada por falas muito curtas, em que um medidor de áudio por segundo penaliza você. Fique também se você já ajustou finamente uma identidade de voz no ElevenLabs que seus usuários reconhecem, porque a continuidade da voz é um recurso do produto e recriá-la em um novo modelo é um projeto.

De qualquer forma, a atitude sensata é rodar os dois por um mês com tráfego real antes de se comprometer, e esse é o argumento para não conectar nenhum deles diretamente à sua base de código. A OrcaRouter coloca mais de 200 modelos atrás de uma única chave, pelo preço de lista do provedor e sem markup, então um reajuste de preço de qualquer um dos laboratórios chega à sua fatura no mesmo dia, em vez de só na renovação, e o failover automático mantém um caminho de fala em produção ativo quando um endpoint recém-lançado se comporta mal. Nós não hospedamos a ElevenLabs — suas camadas de síntese e de agente são produto próprio dela — e não hospedamos os endpoints de TTS do Gemini 3.8, que vêm da API do Google. O que nós oferecemos é a camada de texto por baixo e o roteamento por cima.

O número que vale a pena acompanhar é o Elo do Eleven v3 na próxima revisão do ranking. Noventa e três pontos é uma desvantagem considerável para um modelo que cobra três vezes mais, e se o intervalo diminuir sem que a diferença se feche, o argumento de preço deixa de ser uma troca e se torna um veredito.