Cartão de título principal para 'GPT-Live-1 vs Inworld Realtime TTS-2', com o subtítulo 'A síntese está ficando barata; ouvir ainda é caro', contendo três cartões com os dizeres 'Inworld Realtime TTS-2: US$ 25 por 1 milhão de caracteres, com escalonamento para US$ 12,50', 'Inworld Realtime TTS-2 Flash: US$ 15 por 1 milhão de caracteres, com escalonamento para US$ 7', 'GPT-Live-1: US$ 0,05 por minuto de voz, além do raciocínio por trás disso', acima de uma faixa de rodapé com os dizeres 'Preços da Inworld publicados pelo fornecedor, setembro de 2026; preços do GPT-Live-1 conforme a documentação da OpenAI.' O logotipo da OrcaRouter está composto no canto inferior direito.
Guides & Insights

GPT-Live-1 vs Inworld Realtime TTS-2: Uma guerra de preços por vozes, um prêmio para ouvir

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A Inworld Realtime TTS-2 atingiu a disponibilidade geral com algo que faltava ao mercado de voz: uma tabela de preços publicada. O modelo principal custa US$ 25 por milhão de caracteres sob demanda, sua versão irmã mais rápida, a Inworld Realtime TTS-2 Flash, custa US$ 15, e ambos caem por faixas de volume até US$ 12,50 e US$ 7. Com Elo 1.244 e segundo lugar na arena de fala da Artificial Analysis, isso torna o modelo principal cerca de metade do preço do atual líder da arena e uma das formas mais baratas de comprar uma voz entre as cinco melhores. O GPT-Live-1 é o outro modelo nesta comparação e a proposta oposta — US$ 0,05 por minuto de voz, sem caracteres envolvidos, e não há como comprá-lo sem também comprar a escuta, a alternância de turnos e o tratamento de interrupções que vêm embutidos.

O interessante ao compará-los é que a diferença de preço parece enorme e depois quase evapora. A síntese está em uma guerra de preços. A conversa não.

O que a Inworld realmente lançou

A linha TTS-2 começou como uma prévia de pesquisa em maio de 2026 com uma afirmação específica: a de que este é um modelo que não gera fala de forma isolada. Ele usa os turnos anteriores de uma conversa como entrada de áudio, raciocina sobre tom e ritmo e ajusta a forma como responde. Esse posicionamento — consciência conversacional em vez de áudio mais limpo — foi o que a separou dos motores de narração que dominaram a síntese de fala até 2025.

Disponibilidade geral transformou a prévia em uma família e anexou uma lista de preços. O Flash é a aposta na taxa de transferência, com a Inworld citando cerca de 20 milissegundos de tempo até o primeiro byte do lado do servidor no percentil 90, contra 100 milissegundos do carro-chefe, e uma mediana inferior a 200 milissegundos até o primeiro áudio. Esses são números do fornecedor, da própria documentação da Inworld; a única medição de terceiros em circulação, da Coval, coloca o Flash em cerca de 25 milissegundos e o carro-chefe na casa das centenas baixas. Nenhum deles foi auditado de forma independente de ponta a ponta.

A funcionalidade que mais vale a pena notar não tem nada a ver com latência. A Inworld adicionou um modo verbatim para que números de encomenda, códigos de confirmação, endereços e números de série sejam lidos caractere por caractere, em vez de serem normalizados para algo que soa natural mas está errado. Para um agente de voz que acabou de receber uma reserva, essa única tag é a diferença entre um produto funcional e uma demo que acaba por ser escalada para um humano.

A screenshot of the OpenAI developer documentation page for GPT-Live 1, headed '< Models' with a 'Default' badge and the summary 'Our premier model for natural, expressive voice conversations with smooth interruption handling'. A price panel reads '$0.05 Per minute' against audio and text for both input and output, with performance and speed marked 'Not specified', and a knowledge cutoff of Jul 31, 2025. The body text reads 'GPT-Live 1 is a full-duplex voice model for real-time conversations. It can listen and speak at the same time, and delegate reasoning and tool use to a backend agent.' A pricing section states 'Voice sessions cost $0.05 per minute, billed per second. Backend model and tool usage is billed separately.'

Dimensão por dimensão

• Tipo — GPT-Live-1: fala para fala full-duplex em um único modelo vs Inworld Realtime TTS-2: um modelo de conversão de texto em fala, com duplex disponível separadamente através da API Realtime da Inworld

• Unidade de preço — GPT-Live-1: $0,05 por minuto de voz, cobrado por segundo, backend de raciocínio medido separadamente vs Inworld Realtime TTS-2: $25 por milhão de caracteres sob demanda, $20 no plano Creator e $12,50 no nível mais alto, com o Flash a $15, $10 e $7

• Qualidade independente — GPT-Live-1: 70,3% no Índice de Fala para Fala, empatado em sexto lugar entre catorze vs. Inworld Realtime TTS-2: Elo 1.244 de 1.091 amostras e segundo lugar na arena Provider Voice da Artificial Analysis, com o Flash em Elo 1.211 de 1.626 amostras e em sexto lugar

• Interrupção — GPT-Live-1: nativa, decidida dentro do modelo muitas vezes por segundo vs Inworld Realtime TTS-2: não é uma propriedade do modelo TTS; a API Realtime da Inworld suporta barge-in com aproximadamente 100 milissegundos de latência de interrupção, através de um único socket que fala o protocolo OpenAI Realtime

• Latência — GPT-Live-1: 0,798 segundos de latência de troca de turno nos próprios testes da OpenAI, nenhum tempo até o primeiro áudio publicado vs Inworld Realtime TTS-2: 100 milissegundos do lado do servidor no percentil 90, Flash em 20, com uma mediana inferior a um segundo até o primeiro trecho de áudio em todo o pipeline da API Realtime

• Idiomas — GPT-Live-1: os principais idiomas são bem atendidos, mas de forma desigual além deles, em comparação com Inworld Realtime TTS-2: mais de 200 locales, com 15 em qualidade Tier 1 e mais 79 em Tier 2, e uma identidade de voz preservada em todos eles

• Vozes e clonagem — GPT-Live-1: doze predefinições, sem clonagem vs Inworld Realtime TTS-2: 282 vozes integradas, clonagem instantânea zero-shot a partir de 5 a 15 segundos de áudio autorizado, clonagem profissional e controlo total da entrega apenas no modelo principal

• Implantação — GPT-Live-1: somente hospedado, um endpoint, sem nível gratuito, concorrência limitada a 25 a 500 sessões vs Inworld Realtime TTS-2: API hospedada mais um contêiner on-premises com acesso restrito que exige uma H100, e um nível gratuito sob demanda que inclui até cerca de 70 minutos de síntese

A generated two-column comparison scoreboard titled 'GPT-Live-1 vs Inworld Realtime TTS-2 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Interactivity: 80.1%, vendor-reported', 'Turn-taking latency: 0.798 s, vendor testing', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Languages: major languages only'. The right column, labelled Inworld Realtime TTS-2, reads 'Kind: text-to-speech; duplex via the separate Realtime API', 'Price: $25 per 1M characters, from $12.50 on volume', 'Time to first byte: 100 ms p90, 20 ms for Flash (vendor)', 'Barge-in: ~100 ms, cascade-level', 'Independent score: Elo 1,244, #2 on the AA Provider Voice arena', 'Languages: 200+ locales, 15 at Tier 1 quality'. The footer reads 'Inworld latency and pricing vendor-published; GPT-Live-1 interactivity OpenAI-reported; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

A questão duplex, respondida com precisão

Seria fácil escrever esta comparação como “um escuta, o outro apenas fala”, e isso estaria errado de uma forma que importa. Os modelos de conversão de texto em fala da Inworld são entrada de texto, saída de áudio. Mas a Inworld também vende uma API Realtime que funciona por uma única conexão WebSocket, WebRTC ou SIP e é full-duplex no sentido que importa para quem constrói: ela adota detecção semântica de atividade de voz com uma configuração de eagerness ajustável, oferece controle manual de turno e interrompe em caso de barge-in em aproximadamente 100 milissegundos. Ela é compatível em protocolo com a interface Realtime da OpenAI, o que faz da migração um exercício de configuração, e não uma reescrita.

O que a API Realtime da Inworld não é, é um modelo nativo de fala para fala. É uma cascata — um modelo de reconhecimento de fala intercambiável, um modelo de linguagem à sua escolha e um sintetizador — orquestrada dentro de uma única conexão. Essa é uma escolha arquitetural legítima e é a mesma que a maioria dos agentes de voz em produção faz. É simplesmente diferente da GPT-Live-1, em que um único modelo decide quando ceder o turno.

A diferença prática aparece quando o interlocutor interrompe no meio de uma frase. Em uma cascata, a interrupção é detectada, a geração é cancelada e um novo turno começa — uma sequência que funciona bem e custa uma ida e volta. No modelo ponta a ponta, a decisão já estava sendo tomada continuamente. O primeiro é um sistema que responde rapidamente. O segundo é um sistema que nunca parou de escutar.

A screenshot of Inworld AI's official pricing page, showing per-million-character rates for its speech models. The On-Demand column lists TTS-2 at $25 per 1M characters, TTS-2 Flash at $15, STT-1 at $0.15 per hour and LLMs at cost, alongside the inclusions 'Up to 70 min TTS included', '100 custom voices', 'Voice cloning & voice design', 'Realtime API access', '220+ LLM models via Router' and 'Commercial license'. The Creator column at $25 per month shows TTS-2 reduced to $20 and Flash to $10, with 500 custom voices and up to 33% off TTS and STT rates.

Fazendo as contas, porque as unidades escondem a resposta

A fala ocorre a cerca de 150 palavras por minuto, e o inglês tem em média cerca de cinco caracteres e meio por palavra, então um minuto de saída falada equivale a cerca de 800 a 900 caracteres. A US$ 25 por milhão, o Inworld Realtime TTS-2 produz um minuto de fala por cerca de dois centavos. No preço de US$ 15 do Flash, fica abaixo de um centavo e meio.

Em comparação com os US$ 0,05 por minuto de voz do GPT-Live-1, isso parece um massacre — até você calcular o custo do restante do que o GPT-Live-1 está fazendo. A Realtime API da Inworld ainda precisa de reconhecimento de fala e de um modelo de linguagem, ambos cobrados separadamente e ambos com sua própria latência. Some isso e o custo por minuto da cascata ultrapassa os cinco centavos em qualquer chamada que envolva uma pergunta de verdade. O adicional do modelo ponta a ponta não se deve à voz. Deve-se à alternância de turnos, e equivale aproximadamente ao custo da etapa de reconhecimento de fala que você deixa de comprar.

Onde a cascata vence de forma decisiva é em volume sem conversa. Chamadas de notificação, confirmações de entrega, lembretes de agendamento, IVR com script — qualquer caso em que o texto já é conhecido antes de a chamada começar e ninguém vai interromper. Aí, a cobrança por caractere, de US$ 7 a US$ 15 por milhão, é simplesmente mais barata do que o duplex por minuto, e pagar pela alternância de turnos que você nunca usa é desperdício.

Há também um caminho intermediário que o enquadramento de dois modelos esconde. Se você vai montar uma cascata de qualquer forma, a camada de fala não precisa vir de um fornecedor dedicado de voz: os próprios modelos TTS da Open​AI e os modelos de pré-visualização do Gem​ini TTS do Goog​le são endpoints de API comuns, e são roteados. Cerca de 190 modelos de onze provedores upstream ficam atrás de uma única chave do OrcaRouter pelo preço de tabela do provedor, sem markup — assim, um modelo de síntese pode ficar no mesmo catálogo, na mesma chave e na mesma fatura que o modelo de raciocínio que ele alimenta, com failover automático se um endpoint se degradar no meio da implantação. É a etapa menos glamourosa de uma pilha de voz e a mais fácil de consolidar. Nem o Realtime TTS-2 da Inworld nem o endpoint Live Sessions do GPT-Live-1 estão disponíveis dessa forma; esses dois pertencem aos seus fornecedores.

Qual escolher

Escolha o Inworld Realtime TTS-2 se o volume é o ponto e a conversa é roteirizada. Agentes de alto rendimento, notificações, produtos multilíngues em que 200 localidades e uma identidade vocal preservada importam, ou qualquer implantação que precise do contêiner on-premises. Você obtém uma voz de arena top-two por aproximadamente metade do preço do líder, um nível gratuito para prototipar, clonagem que o GPT-Live-1 não oferece de forma alguma, e uma API Realtime que lida com interrupção competentemente no padrão de cascata que você provavelmente já executa.

Escolha o GPT-Live-1 se a interrupção for o produto. Chamadas que saem do roteiro, quem liga e fala por cima do agente, fluxos de trabalho em que a alternância de turnos é a diferença entre uma conversa e um menu. Você paga uma tarifa por minuto que não cai quando a fala fica barata, abre mão da clonagem e de 200 idiomas, e recompra as costuras.

A guerra de preços na síntese é real e é uma boa notícia para quem está construindo um agente de voz — uma voz entre as cinco melhores agora custa um quinto do que custava dezoito meses atrás. Só que isso não resolve esta comparação, porque aquilo pelo que o GPT-Live-1 cobra não é aquilo que a Inworld está descontando.