Um hero card gerado para 'Gemini 3.8 TTS vs Inworld Realtime TTS-2' sobre um fundo branco, com suaves detalhes em gradiente azul e ciano. O card da esquerda, 'Gemini 3.8 Flash TTS', lista Elo 1.260 na 2ª posição, 8 vozes na arena, 130 idiomas declarados e US$ 16,50 por 1 milhão de caracteres normalizados; o card da direita, 'Inworld Realtime TTS-2', lista Elo 1.245 na 4ª posição, 8 vozes na arena, apenas inglês, US$ 20,80 por 1 milhão de caracteres normalizados e a primeira posição na Controlled Voice Arena. Uma linha de rodapé diz 'Elo conforme o Artificial Analysis Provider Voice Arena, set. 2026; preços conforme Google e Inworld.' O logotipo da OrcaRouter está composto no canto inferior direito.
Guides & Insights

Gemini 3.8 TTS vs Inworld Realtime TTS-2: Qual placar em que você acredita muda a resposta

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Coloque Gemini 3.8 Flash TTS e Inworld Realtime TTS-2 lado a lado na Artificial Analysis Provider Voice Arena e a resposta parece óbvia: posição 2 contra posição 4, Elo 1.260 contra 1.245, 8 vozes de arena cada um, e $16,50 normalizados por milhão de caracteres contra $20,80. O fornecedor vence em posição e em preço, e a diferença de 15 pontos está dentro dos intervalos de confiança de ambas as linhas de qualquer forma.

Mude para o outro ranking que a Artificial Analysis publica e a ordem se inverte. O Inworld Realtime TTS-2 ocupa o primeiro lugar no Controlled Voice Arena, com um Elo de 1.123, e sua variante Flash em 1.075. Isso não é uma diferença de arredondamento — é um modelo diferente vencendo, e a razão é que os dois rankings não estão medindo a mesma coisa. Se você está escolhendo uma voz para um produto, saber qual dessas duas perguntas o seu caso de uso está realmente fazendo é a decisão inteira.

A generated comparison scoreboard for Gemini 3.8 Flash TTS and Inworld Realtime TTS-2, showing Provider Arena position (rank 2, Elo 1,260 against rank 4, Elo 1,245), Controlled Arena position (not top ranked against rank 1 at Elo 1,123), price ($16.50 against $20.80 per 1M characters), languages (130 claimed against English only), cloning path (a 30-second sample against 5 to 15 seconds) and dialogue (two speakers against a single voice).

Dois quadros, duas perguntas diferentes

O Provider Voice Arena avalia as vozes nativas de um modelo — as que o fornecedor envia e hospeda. O Controlled Voice Arena mantém a voz constante e avalia o desempenho de cada modelo quando lhe é pedido para falar numa voz que não é a sua. Os mesmos juízes, o mesmo tipo de comparação cega, uma variável diferente.

Essa distinção corresponde a duas funções diferentes:

• O ranking de provedores responde à pergunta “este modelo soa bem pronto para uso?”. É o quadro certo para um produto que vem com um conjunto fixo de vozes de narrador e nunca clona nada.

• O ranking controlado responde a "este modelo obedece a uma especificação de voz". É o ranking certo para um produto em que a voz é do cliente — uma voz de marca clonada, um ator licenciado, uma identidade por tenant.

Os modelos do Google lideram no primeiro. Os da Inworld lideram no segundo. Ambas as afirmações são verdadeiras ao mesmo tempo, e nenhuma delas é uma contradição, o que explica exatamente por que uma resposta única para "qual modelo de TTS é melhor" costuma ser sinal de que quem escreveu escolheu um ranking e não olhou o outro.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and Inworld Realtime TTS-2 at rank 4 with an Elo of 1,245, with Inworld Realtime TTS-2 Flash further down at 1,210 and Gemini 3.8 Flash-Lite TTS at rank 6.

O que a posição número um da Inworld implica na prática

Um resultado Controlado em primeiro lugar é uma alegação sobre fidelidade a uma instrução, e a fidelidade a uma instrução é a propriedade que decide se a clonagem é minimamente utilizável.

O caminho de clonagem da Inworld vem em duas formas. A clonagem instantânea funciona a partir de uma amostra curta — o número indicado pelo fornecedor é de 5 a 15 segundos de áudio de referência — e um nível de clonagem profissional está em beta e exige algo em torno de dez minutos. Ambos são informados pelo fornecedor, e nenhum deles é verificado de forma independente pela arena; o que a arena mede é o comportamento do modelo depois que ele tem uma voz, não a qualidade da etapa de clonagem que a produziu.

As alegações de latência associadas à família estão na mesma categoria. O valor de primeiro byte da variante Flash — 25 milissegundos, relatado por meio de uma medição de terceiros — e os números p99 do modelo completo são da própria Inworld, e a arena não tem nada a dizer sobre nenhum dos dois. São plausíveis para um modelo voltado a tempo real e não são verificados, o que é a forma correta de encará-los.

Então, a leitura prática é: se o seu produto clona vozes, o resultado Controlled da Inworld é o mais relevante entre as duas pontuações, e é a razão pela qual uma classificação Provider mais baixa não é desqualificadora. Se o seu produto não clona, essa vantagem é invisível para você, e o painel Provider é o que deve ser lido.

A escada de preços tem três degraus, e o mais barato é uma assinatura.

Comparar um preço contra um preço faz esta comparação ficar errada, porque a Inworld não tem um preço — tem uma escada.

• Sob demanda — Realtime TTS-2 a $25,00 por milhão de caracteres, Flash a $15,00. Esta é a tarifa que um cliente de pagamento conforme o uso vê, e é o valor publicado pelo próprio fornecedor.

• Plano Creator — US$ 20,00 e US$ 10,00 para os mesmos dois modelos, o que representa um desconto de 20% e um de 33% por optar por um plano em vez da cobrança por medição. Informado pelo fornecedor, e é o degrau que mais vale a pena conferir novamente na página de preços em tempo real antes de contratar, já que os termos dos planos mudam mais rápido que os preços de tabela.

• Normalizado — a conversão por milhão de caracteres da arena resulta em US$ 20,80 para o Realtime TTS-2 e US$ 10,40 para o Flash, o que é a aritmética do painel, e não a cotação de nenhum dos fornecedores.

Em contrapartida, as tarifas do Google são baseadas em tokens e promocionais: US$ 0,50 por milhão de tokens de texto de entrada e US$ 9,00 por milhão de tokens de áudio de saída até 31 de dezembro de 2026, depois US$ 18,00; o Flash-Lite TTS custa US$ 0,50 e US$ 6,00, depois US$ 12,00. Normalizado, isso equivale a US$ 16,50 e US$ 11,00.

A screenshot of Inworld's text-to-speech product page, showing the Realtime TTS-2 and TTS-2 Flash model cards, the instant and professional voice cloning tiers, per-million-character pricing, and usage statistics including 642,022,085 characters used and 223,764 minutes generated.

Leia os dois juntos e o quadro é mais interessante do que "Google é mais barato". Nos números publicados hoje, o Flash TTS é o mais barato dos três modelos e a variante Flash da Inworld é o segundo mais barato — os dois modelos Flash são próximos o suficiente para que uma pequena mudança na sua proporção de áudio para texto possa inverter qual deles cobra menos. Em 1º de janeiro de 2027, quando a tarifa do Google dobrar, a ordenação se estabiliza e a Inworld se torna a opção mais barata em cada degrau de sua escada. Qualquer pessoa comparando esses dois em setembro e se comprometendo em dezembro está comparando os números errados.

Onde cada um é a melhor resposta

Os dois modelos estão suficientemente próximos em qualidade, de modo que os diferenciais são estruturais; portanto, a versão honesta é uma lista de condições, e não um veredito.

Escolha o Gemini 3.8 Flash TTS quando a escolha da voz for sua. Design de voz a partir de uma descrição escrita, diálogo com dois falantes numa única chamada, estilização por turno e a cobertura de idiomas mais ampla das duas, segundo a própria contagem do Google — nada disso o Inworld iguala nesta comparação. Ele também é o modelo mais barato hoje, e o seu irmão Flash-Lite oferece um segundo patamar de preço dentro da mesma API.

Escolha o Inworld Realtime TTS-2 quando a voz for do cliente. Uma linha Controlled Voice de destaque, um caminho de clonagem instantânea medido em segundos de áudio de referência, um nível de clonagem profissional para os casos que precisam de mais e uma orientação em tempo real respaldada por alegações de first byte publicadas pelo fornecedor — com a ressalva de que as alegações são do fornecedor. É somente em inglês, de acordo com a própria documentação do fornecedor, o que é uma restrição rígida se você precisar de qualquer outra coisa.

Nenhum desses modelos é hospedado pela OrcaRouter, e vale dizer isso em vez de insinuar o contrário: o lugar para chamar o Gemini 3.8 Flash TTS é a própria API do Google e as superfícies que o Google indicou em 23 de setembro, e o lugar para chamar o Inworld Realtime TTS-2 é a própria plataforma da Inworld. O que a OrcaRouter oferece é tudo o que está em volta dessa escolha — mais de 200 modelos atrás de uma única chave, ao preço de lista do provedor e sem nenhum acréscimo, de modo que uma mudança de tarifa de um fornecedor, como o reajuste de janeiro, entra em vigor do nosso lado no mesmo dia, failover automático para que um modelo avaliado não precise ser uma dependência de produção, e uma DSL de roteamento para compor modelos em uma única chamada quando nenhuma voz sozinha dá conta de todo o trabalho.

A razão para manter ambos em jogo é que a mudança de taxa de janeiro e a distinção Controlado versus Provedor são dois motivos separados pelos quais a resposta pode mudar. Um pipeline que só consegue chamar um deles não consegue acompanhar nenhum dos dois.