
Gemini 3.8 TTS vs Inworld Realtime TTS-2: Qual placar em que você acredita muda a resposta
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
Coloque Gemini 3.8 Flash TTS e Inworld Realtime TTS-2 lado a lado na Artificial Analysis Provider Voice Arena e a resposta parece óbvia: posição 2 contra posição 4, Elo 1.260 contra 1.245, 8 vozes de arena cada um, e $16,50 normalizados por milhão de caracteres contra $20,80. O fornecedor vence em posição e em preço, e a diferença de 15 pontos está dentro dos intervalos de confiança de ambas as linhas de qualquer forma.
Mude para o outro ranking que a Artificial Analysis publica e a ordem se inverte. O Inworld Realtime TTS-2 ocupa o primeiro lugar no Controlled Voice Arena, com um Elo de 1.123, e sua variante Flash em 1.075. Isso não é uma diferença de arredondamento — é um modelo diferente vencendo, e a razão é que os dois rankings não estão medindo a mesma coisa. Se você está escolhendo uma voz para um produto, saber qual dessas duas perguntas o seu caso de uso está realmente fazendo é a decisão inteira.

Dois quadros, duas perguntas diferentes
O Provider Voice Arena avalia as vozes nativas de um modelo — as que o fornecedor envia e hospeda. O Controlled Voice Arena mantém a voz constante e avalia o desempenho de cada modelo quando lhe é pedido para falar numa voz que não é a sua. Os mesmos juízes, o mesmo tipo de comparação cega, uma variável diferente.
Essa distinção corresponde a duas funções diferentes:
• O ranking de provedores responde à pergunta “este modelo soa bem pronto para uso?”. É o quadro certo para um produto que vem com um conjunto fixo de vozes de narrador e nunca clona nada.
• O ranking controlado responde a "este modelo obedece a uma especificação de voz". É o ranking certo para um produto em que a voz é do cliente — uma voz de marca clonada, um ator licenciado, uma identidade por tenant.
Os modelos do Google lideram no primeiro. Os da Inworld lideram no segundo. Ambas as afirmações são verdadeiras ao mesmo tempo, e nenhuma delas é uma contradição, o que explica exatamente por que uma resposta única para "qual modelo de TTS é melhor" costuma ser sinal de que quem escreveu escolheu um ranking e não olhou o outro.

O que a posição número um da Inworld implica na prática
Um resultado Controlado em primeiro lugar é uma alegação sobre fidelidade a uma instrução, e a fidelidade a uma instrução é a propriedade que decide se a clonagem é minimamente utilizável.
O caminho de clonagem da Inworld vem em duas formas. A clonagem instantânea funciona a partir de uma amostra curta — o número indicado pelo fornecedor é de 5 a 15 segundos de áudio de referência — e um nível de clonagem profissional está em beta e exige algo em torno de dez minutos. Ambos são informados pelo fornecedor, e nenhum deles é verificado de forma independente pela arena; o que a arena mede é o comportamento do modelo depois que ele tem uma voz, não a qualidade da etapa de clonagem que a produziu.
As alegações de latência associadas à família estão na mesma categoria. O valor de primeiro byte da variante Flash — 25 milissegundos, relatado por meio de uma medição de terceiros — e os números p99 do modelo completo são da própria Inworld, e a arena não tem nada a dizer sobre nenhum dos dois. São plausíveis para um modelo voltado a tempo real e não são verificados, o que é a forma correta de encará-los.
Então, a leitura prática é: se o seu produto clona vozes, o resultado Controlled da Inworld é o mais relevante entre as duas pontuações, e é a razão pela qual uma classificação Provider mais baixa não é desqualificadora. Se o seu produto não clona, essa vantagem é invisível para você, e o painel Provider é o que deve ser lido.
A escada de preços tem três degraus, e o mais barato é uma assinatura.
Comparar um preço contra um preço faz esta comparação ficar errada, porque a Inworld não tem um preço — tem uma escada.
• Sob demanda — Realtime TTS-2 a $25,00 por milhão de caracteres, Flash a $15,00. Esta é a tarifa que um cliente de pagamento conforme o uso vê, e é o valor publicado pelo próprio fornecedor.
• Plano Creator — US$ 20,00 e US$ 10,00 para os mesmos dois modelos, o que representa um desconto de 20% e um de 33% por optar por um plano em vez da cobrança por medição. Informado pelo fornecedor, e é o degrau que mais vale a pena conferir novamente na página de preços em tempo real antes de contratar, já que os termos dos planos mudam mais rápido que os preços de tabela.
• Normalizado — a conversão por milhão de caracteres da arena resulta em US$ 20,80 para o Realtime TTS-2 e US$ 10,40 para o Flash, o que é a aritmética do painel, e não a cotação de nenhum dos fornecedores.
Em contrapartida, as tarifas do Google são baseadas em tokens e promocionais: US$ 0,50 por milhão de tokens de texto de entrada e US$ 9,00 por milhão de tokens de áudio de saída até 31 de dezembro de 2026, depois US$ 18,00; o Flash-Lite TTS custa US$ 0,50 e US$ 6,00, depois US$ 12,00. Normalizado, isso equivale a US$ 16,50 e US$ 11,00.

Leia os dois juntos e o quadro é mais interessante do que "Google é mais barato". Nos números publicados hoje, o Flash TTS é o mais barato dos três modelos e a variante Flash da Inworld é o segundo mais barato — os dois modelos Flash são próximos o suficiente para que uma pequena mudança na sua proporção de áudio para texto possa inverter qual deles cobra menos. Em 1º de janeiro de 2027, quando a tarifa do Google dobrar, a ordenação se estabiliza e a Inworld se torna a opção mais barata em cada degrau de sua escada. Qualquer pessoa comparando esses dois em setembro e se comprometendo em dezembro está comparando os números errados.
Onde cada um é a melhor resposta
Os dois modelos estão suficientemente próximos em qualidade, de modo que os diferenciais são estruturais; portanto, a versão honesta é uma lista de condições, e não um veredito.
Escolha o Gemini 3.8 Flash TTS quando a escolha da voz for sua. Design de voz a partir de uma descrição escrita, diálogo com dois falantes numa única chamada, estilização por turno e a cobertura de idiomas mais ampla das duas, segundo a própria contagem do Google — nada disso o Inworld iguala nesta comparação. Ele também é o modelo mais barato hoje, e o seu irmão Flash-Lite oferece um segundo patamar de preço dentro da mesma API.
Escolha o Inworld Realtime TTS-2 quando a voz for do cliente. Uma linha Controlled Voice de destaque, um caminho de clonagem instantânea medido em segundos de áudio de referência, um nível de clonagem profissional para os casos que precisam de mais e uma orientação em tempo real respaldada por alegações de first byte publicadas pelo fornecedor — com a ressalva de que as alegações são do fornecedor. É somente em inglês, de acordo com a própria documentação do fornecedor, o que é uma restrição rígida se você precisar de qualquer outra coisa.
Nenhum desses modelos é hospedado pela OrcaRouter, e vale dizer isso em vez de insinuar o contrário: o lugar para chamar o Gemini 3.8 Flash TTS é a própria API do Google e as superfícies que o Google indicou em 23 de setembro, e o lugar para chamar o Inworld Realtime TTS-2 é a própria plataforma da Inworld. O que a OrcaRouter oferece é tudo o que está em volta dessa escolha — mais de 200 modelos atrás de uma única chave, ao preço de lista do provedor e sem nenhum acréscimo, de modo que uma mudança de tarifa de um fornecedor, como o reajuste de janeiro, entra em vigor do nosso lado no mesmo dia, failover automático para que um modelo avaliado não precise ser uma dependência de produção, e uma DSL de roteamento para compor modelos em uma única chamada quando nenhuma voz sozinha dá conta de todo o trabalho.
A razão para manter ambos em jogo é que a mudança de taxa de janeiro e a distinção Controlado versus Provedor são dois motivos separados pelos quais a resposta pode mudar. Um pipeline que só consegue chamar um deles não consegue acompanhar nenhum dos dois.
