
GPT-Live-1 vs Inworld Realtime TTS-2: Uma guerra de preços por vozes, um prêmio para ouvir
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
A Inworld Realtime TTS-2 atingiu a disponibilidade geral com algo que faltava ao mercado de voz: uma tabela de preços publicada. O modelo principal custa US$ 25 por milhão de caracteres sob demanda, sua versão irmã mais rápida, a Inworld Realtime TTS-2 Flash, custa US$ 15, e ambos caem por faixas de volume até US$ 12,50 e US$ 7. Com Elo 1.244 e segundo lugar na arena de fala da Artificial Analysis, isso torna o modelo principal cerca de metade do preço do atual líder da arena e uma das formas mais baratas de comprar uma voz entre as cinco melhores. O GPT-Live-1 é o outro modelo nesta comparação e a proposta oposta — US$ 0,05 por minuto de voz, sem caracteres envolvidos, e não há como comprá-lo sem também comprar a escuta, a alternância de turnos e o tratamento de interrupções que vêm embutidos.
O interessante ao compará-los é que a diferença de preço parece enorme e depois quase evapora. A síntese está em uma guerra de preços. A conversa não.
O que a Inworld realmente lançou
A linha TTS-2 começou como uma prévia de pesquisa em maio de 2026 com uma afirmação específica: a de que este é um modelo que não gera fala de forma isolada. Ele usa os turnos anteriores de uma conversa como entrada de áudio, raciocina sobre tom e ritmo e ajusta a forma como responde. Esse posicionamento — consciência conversacional em vez de áudio mais limpo — foi o que a separou dos motores de narração que dominaram a síntese de fala até 2025.
Disponibilidade geral transformou a prévia em uma família e anexou uma lista de preços. O Flash é a aposta na taxa de transferência, com a Inworld citando cerca de 20 milissegundos de tempo até o primeiro byte do lado do servidor no percentil 90, contra 100 milissegundos do carro-chefe, e uma mediana inferior a 200 milissegundos até o primeiro áudio. Esses são números do fornecedor, da própria documentação da Inworld; a única medição de terceiros em circulação, da Coval, coloca o Flash em cerca de 25 milissegundos e o carro-chefe na casa das centenas baixas. Nenhum deles foi auditado de forma independente de ponta a ponta.
A funcionalidade que mais vale a pena notar não tem nada a ver com latência. A Inworld adicionou um modo verbatim para que números de encomenda, códigos de confirmação, endereços e números de série sejam lidos caractere por caractere, em vez de serem normalizados para algo que soa natural mas está errado. Para um agente de voz que acabou de receber uma reserva, essa única tag é a diferença entre um produto funcional e uma demo que acaba por ser escalada para um humano.

Dimensão por dimensão
• Tipo — GPT-Live-1: fala para fala full-duplex em um único modelo vs Inworld Realtime TTS-2: um modelo de conversão de texto em fala, com duplex disponível separadamente através da API Realtime da Inworld
• Unidade de preço — GPT-Live-1: $0,05 por minuto de voz, cobrado por segundo, backend de raciocínio medido separadamente vs Inworld Realtime TTS-2: $25 por milhão de caracteres sob demanda, $20 no plano Creator e $12,50 no nível mais alto, com o Flash a $15, $10 e $7
• Qualidade independente — GPT-Live-1: 70,3% no Índice de Fala para Fala, empatado em sexto lugar entre catorze vs. Inworld Realtime TTS-2: Elo 1.244 de 1.091 amostras e segundo lugar na arena Provider Voice da Artificial Analysis, com o Flash em Elo 1.211 de 1.626 amostras e em sexto lugar
• Interrupção — GPT-Live-1: nativa, decidida dentro do modelo muitas vezes por segundo vs Inworld Realtime TTS-2: não é uma propriedade do modelo TTS; a API Realtime da Inworld suporta barge-in com aproximadamente 100 milissegundos de latência de interrupção, através de um único socket que fala o protocolo OpenAI Realtime
• Latência — GPT-Live-1: 0,798 segundos de latência de troca de turno nos próprios testes da OpenAI, nenhum tempo até o primeiro áudio publicado vs Inworld Realtime TTS-2: 100 milissegundos do lado do servidor no percentil 90, Flash em 20, com uma mediana inferior a um segundo até o primeiro trecho de áudio em todo o pipeline da API Realtime
• Idiomas — GPT-Live-1: os principais idiomas são bem atendidos, mas de forma desigual além deles, em comparação com Inworld Realtime TTS-2: mais de 200 locales, com 15 em qualidade Tier 1 e mais 79 em Tier 2, e uma identidade de voz preservada em todos eles
• Vozes e clonagem — GPT-Live-1: doze predefinições, sem clonagem vs Inworld Realtime TTS-2: 282 vozes integradas, clonagem instantânea zero-shot a partir de 5 a 15 segundos de áudio autorizado, clonagem profissional e controlo total da entrega apenas no modelo principal
• Implantação — GPT-Live-1: somente hospedado, um endpoint, sem nível gratuito, concorrência limitada a 25 a 500 sessões vs Inworld Realtime TTS-2: API hospedada mais um contêiner on-premises com acesso restrito que exige uma H100, e um nível gratuito sob demanda que inclui até cerca de 70 minutos de síntese

A questão duplex, respondida com precisão
Seria fácil escrever esta comparação como “um escuta, o outro apenas fala”, e isso estaria errado de uma forma que importa. Os modelos de conversão de texto em fala da Inworld são entrada de texto, saída de áudio. Mas a Inworld também vende uma API Realtime que funciona por uma única conexão WebSocket, WebRTC ou SIP e é full-duplex no sentido que importa para quem constrói: ela adota detecção semântica de atividade de voz com uma configuração de eagerness ajustável, oferece controle manual de turno e interrompe em caso de barge-in em aproximadamente 100 milissegundos. Ela é compatível em protocolo com a interface Realtime da OpenAI, o que faz da migração um exercício de configuração, e não uma reescrita.
O que a API Realtime da Inworld não é, é um modelo nativo de fala para fala. É uma cascata — um modelo de reconhecimento de fala intercambiável, um modelo de linguagem à sua escolha e um sintetizador — orquestrada dentro de uma única conexão. Essa é uma escolha arquitetural legítima e é a mesma que a maioria dos agentes de voz em produção faz. É simplesmente diferente da GPT-Live-1, em que um único modelo decide quando ceder o turno.
A diferença prática aparece quando o interlocutor interrompe no meio de uma frase. Em uma cascata, a interrupção é detectada, a geração é cancelada e um novo turno começa — uma sequência que funciona bem e custa uma ida e volta. No modelo ponta a ponta, a decisão já estava sendo tomada continuamente. O primeiro é um sistema que responde rapidamente. O segundo é um sistema que nunca parou de escutar.

Fazendo as contas, porque as unidades escondem a resposta
A fala ocorre a cerca de 150 palavras por minuto, e o inglês tem em média cerca de cinco caracteres e meio por palavra, então um minuto de saída falada equivale a cerca de 800 a 900 caracteres. A US$ 25 por milhão, o Inworld Realtime TTS-2 produz um minuto de fala por cerca de dois centavos. No preço de US$ 15 do Flash, fica abaixo de um centavo e meio.
Em comparação com os US$ 0,05 por minuto de voz do GPT-Live-1, isso parece um massacre — até você calcular o custo do restante do que o GPT-Live-1 está fazendo. A Realtime API da Inworld ainda precisa de reconhecimento de fala e de um modelo de linguagem, ambos cobrados separadamente e ambos com sua própria latência. Some isso e o custo por minuto da cascata ultrapassa os cinco centavos em qualquer chamada que envolva uma pergunta de verdade. O adicional do modelo ponta a ponta não se deve à voz. Deve-se à alternância de turnos, e equivale aproximadamente ao custo da etapa de reconhecimento de fala que você deixa de comprar.
Onde a cascata vence de forma decisiva é em volume sem conversa. Chamadas de notificação, confirmações de entrega, lembretes de agendamento, IVR com script — qualquer caso em que o texto já é conhecido antes de a chamada começar e ninguém vai interromper. Aí, a cobrança por caractere, de US$ 7 a US$ 15 por milhão, é simplesmente mais barata do que o duplex por minuto, e pagar pela alternância de turnos que você nunca usa é desperdício.
Há também um caminho intermediário que o enquadramento de dois modelos esconde. Se você vai montar uma cascata de qualquer forma, a camada de fala não precisa vir de um fornecedor dedicado de voz: os próprios modelos TTS da OpenAI e os modelos de pré-visualização do Gemini TTS do Google são endpoints de API comuns, e são roteados. Cerca de 190 modelos de onze provedores upstream ficam atrás de uma única chave do OrcaRouter pelo preço de tabela do provedor, sem markup — assim, um modelo de síntese pode ficar no mesmo catálogo, na mesma chave e na mesma fatura que o modelo de raciocínio que ele alimenta, com failover automático se um endpoint se degradar no meio da implantação. É a etapa menos glamourosa de uma pilha de voz e a mais fácil de consolidar. Nem o Realtime TTS-2 da Inworld nem o endpoint Live Sessions do GPT-Live-1 estão disponíveis dessa forma; esses dois pertencem aos seus fornecedores.
Qual escolher
Escolha o Inworld Realtime TTS-2 se o volume é o ponto e a conversa é roteirizada. Agentes de alto rendimento, notificações, produtos multilíngues em que 200 localidades e uma identidade vocal preservada importam, ou qualquer implantação que precise do contêiner on-premises. Você obtém uma voz de arena top-two por aproximadamente metade do preço do líder, um nível gratuito para prototipar, clonagem que o GPT-Live-1 não oferece de forma alguma, e uma API Realtime que lida com interrupção competentemente no padrão de cascata que você provavelmente já executa.
Escolha o GPT-Live-1 se a interrupção for o produto. Chamadas que saem do roteiro, quem liga e fala por cima do agente, fluxos de trabalho em que a alternância de turnos é a diferença entre uma conversa e um menu. Você paga uma tarifa por minuto que não cai quando a fala fica barata, abre mão da clonagem e de 200 idiomas, e recompra as costuras.
A guerra de preços na síntese é real e é uma boa notícia para quem está construindo um agente de voz — uma voz entre as cinco melhores agora custa um quinto do que custava dezoito meses atrás. Só que isso não resolve esta comparação, porque aquilo pelo que o GPT-Live-1 cobra não é aquilo que a Inworld está descontando.
