
Inworld Realtime TTS-2 vs Cartesia Sonic 3.6: A Voz que Escuta vs o Rei das Arenas
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Existem duas teorias concorrentes sobre por que uma voz sintética soa humana e, neste momento, os dois melhores exemplos comerciais de cada uma são Inworld Realtime TTS-2 e Cartesia Sonic 3.6. A teoria da Cartesia é que a humanidade vive no áudio: se o timbre, a prosódia e o ritmo forem indistinguíveis dos de uma pessoa, os ouvintes colocarão você em primeiro lugar — e foi isso que o Sonic 3.6 fez em agosto, saltando para o topo da arena Provider Voice da Artificial Analysis com Elo 1.282. A teoria da Inworld é que a humanidade vive na escuta: o Inworld Realtime TTS-2 molda a própria fala com base no áudio real da conversa que veio antes; assim, ele não apenas soa como uma pessoa — ele responde como uma. Nesta semana, as duas teorias colidiram no placar: a mesma reavaliação que colocou o Inworld Realtime TTS-2 em #2 no ranking de provedores, com Elo 1.252, também o colocou em #1 na arena Controlled Voice — o ranking que a Cartesia liderava — com 1.123 contra 1.119 do Sonic 3.6. Um modelo mantém a coroa de provedores. O outro acaba de conquistar a coroa controlada.
Este não é um confronto em que um lado está obviamente errado. Os dois modelos foram criados para tarefas sobrepostas, mas não idênticas, e a diferença de preço — Sonic 3.6 a $49.0 por milhão de caracteres contra $25 sob demanda para Inworld Realtime TTS-2 — é real o suficiente para que a decisão tenha um componente orçamentário além de um componente de qualidade.
Duas teorias de uma voz com som humano
Cartesia lançou o Sonic 3.6 discretamente em agosto de 2026, uma versão pontual que melhorou o Sonic 3.5 sem alterar o preço nem a proposta de arquitetura. A melhoria apareceu onde a Cartesia precisava: o modelo saltou para Elo 1.282 no Provider Voice arena da Artificial Analysis — onde cada modelo usa suas próprias vozes nativas — e manteve o topo do Controlled Voice arena durante todo o mês de agosto. No painel controlado, cada modelo é clonado nos mesmos oito falantes de referência, então essa coroa é um veredito sobre o próprio motor de síntese, independente do talento vocal. Após a reavaliação da disponibilidade geral da Inworld nesta semana, a Cartesia ainda lidera o painel de provedores, mas o Sonic 3.6 agora está em #2 no painel controlado com Elo 1.119, quatro pontos atrás do Inworld Realtime TTS-2, com 1.123.
O Inworld Realtime TTS-2 vem de uma tradição diferente. Sua linha antecessora, a TTS 1.5, passou o início de 2026 perto do topo das mesmas arenas, e a prévia de pesquisa do TTS-2 registrou Elo 1.209 no ranking de provedores em junho. O modelo GA subiu desde então: nos rankings atuais, ele está com 1.252 no Provider Voice (nº 2, atrás dos 1.282 do Sonic 3.6) e 1.123 no Controlled Voice (nº 1). O verdadeiro diferencial do carro-chefe, porém, não é o Elo; é que o modelo usa as falas anteriores de uma conversa como entrada de áudio e deixa que isso molde como ele entrega a próxima fala. A Cartesia calibra a emoção a partir da transcrição. A Inworld escuta como a última fala foi dita.
O placar, honestamente rotulado
Os valores de Elo vêm das arenas de fala da Artificial Analysis, obtidos dos painéis ao vivo em setembro de 2026. Os valores de latência são informados pelo fornecedor, salvo indicação em contrário, e nenhuma auditoria independente de latência foi publicada para nenhum dos modelos.
• Qualidade independente — Cartesia Sonic 3.6: Elo 1.282 (#1, Voz do Provedor) e 1.119 (#2, Voz Controlada) vs Inworld Realtime TTS-2: Elo 1.252 (#2, Voz do Provedor) e 1.123 (#1, Voz Controlada)
• Preço por 1 milhão de caracteres — US$ 49,0 (medido pela Artificial Analysis) vs US$ 25 sob demanda, US$ 20,8 combinado, conforme medido pela Artificial Analysis, chegando a US$ 12,50 em volume (fornecedor)
• Tempo até o primeiro áudio — menos de 90 ms (declarado pelo fornecedor) vs mediana inferior a 200 ms, menos de 100 ms no p99 nos testes de lançamento da Inworld (declarado pelo fornecedor); a resposta de baixa latência da Inworld ao Sonic é a camada separada TTS-2 Flash, com cerca de 25 ms de tempo até o primeiro byte.
• Idiomas — 42 localizados vs. mais de 100 idiomas para direcionamento de entrega, com a alegação da Inworld de identidade de voz única se estendendo a mais de 200 localidades (declarado pelo fornecedor)
• Clonagem instantânea de voz — ~10 segundos de áudio vs 5–15 segundos, além de uma versão beta de clonagem profissional que leva ~10 minutos de áudio para obter clones de maior fidelidade
• Controle de entrega — tags de transcrição inline como [laughter], além de modulação de volume e velocidade versus direção em inglês simples como "[calm, reassuring]" ou [whisper], instruções em nível de solicitação e três modos de estabilidade, de Stable a Expressive.

Por que "listens to the conversation" é um eixo diferente
O placar acima mede como uma voz soa isoladamente. A dimensão em que os dois modelos realmente divergem não aparece em nenhum ranking, porque ela só existe ao longo de múltiplas interações.
Inworld Realtime TTS-2 é projetado para o caso em que uma pessoa acabou de dizer algo a ele. O modelo consome o áudio dos turnos anteriores — não apenas uma transcrição deles —, avalia tom, ritmo e estado emocional e seleciona um estado de resposta antes de falar. Se um interlocutor está frustrado, a forma de falar muda; se está relaxado, ela volta ao normal. É por isso que a Inworld comercializa o modelo para agentes, companheiros e jogos, em vez de narração: o recurso não tem sentido em uma chamada única de texto para áudio, mas faz sentido em uma conversa.
{{1}}O Cartesia Sonic 3.6 funciona de forma diferente.{{/1}} {{2}}É um mecanismo de streaming rápido e de alta qualidade, e a própria alegação da Cartesia é a calibração emocional automática a partir do transcript — ele lê as palavras e modula de acordo.{{/2}} {{3}}O que ele não faz é ouvir o áudio das falas anteriores.{{/3}} {{4}}Dentro de uma única fala, os dois podem soar comparáveis;{{/4}} {{5}}ao longo de uma conversa, a Inworld está modelando algo que a Sonic não tenta fazer.{{/5}} {{6}}Se o seu produto é uma narração de uma única fala, essa modelagem é um custo extra. Se é um agente ao vivo, ela é o produto.{{/6}}

Velocidade, preço e a ressalva do Flash
Em latência pura, a Cartesia mantém a dianteira: o tempo até o primeiro áudio abaixo de 90 ms é declarado pelo fornecedor, mas é o número que a empresa vem entregando desde a geração Sonic 3, e ninguém publicou uma auditoria que o contradiga. O carro-chefe da Inworld responde em uma classe conversacional semelhante, abaixo de 200 ms, o que é suficiente para agentes em tempo real. A verdadeira jogada de latência da Inworld é o nível Flash, lançado junto com o modelo GA — um modelo separado com cerca de 25 ms de tempo até o primeiro byte, voltado para cargas de trabalho de alto volume, em que custo e latência de classe Sonic importam mais do que expressividade. A ressalva é que o Flash é um membro enxuto da família: clonagem instantânea e vocalizações não verbais inline, mas sem clonagem profissional e sem direcionamento completo por linguagem natural.
Já no preço, é o contrário. Sonic 3.6 custa US$ 49,0 por milhão de caracteres — cerca do dobro da tarifa sob demanda de US$ 25 da Inworld, e quase quatro vezes os US$ 12,50 do nível superior. A diferença de qualidade entre eles, nos rankings em que ambos aparecem, não justifica esse múltiplo para um comprador de alto volume. Para um agente de voz em tempo real que gera milhares de caracteres por conversa, a diferença por caractere é o que separa uma economia unitária saudável de uma enxuta.
Qual escolher
• Escolha o Cartesia Sonic 3.6 se a coroa do ranking de provedores é o que você quer — a voz com a maior pontuação entre as que usam suas próprias vozes nativas, com Elo 1.282, para enunciados curtos e autocontidos, como respostas de assistente, falas de jogos e leituras de status. A US$ 49 por milhão de caracteres, você paga pela coroa, e ele segue sendo o modelo a ser batido nesse ranking.
• Escolha o Inworld Realtime TTS-2 se o produto for uma conversa de múltiplos turnos em que a entrega das falas deve responder à pessoa do outro lado — chamadas de suporte, um companheiro, uma entrevista, uma sessão de tutoria. Ele agora lidera o quadro controlado, em que cada modelo fala as mesmas oito vozes de referência, e o faz por cerca de metade do preço enquanto escuta o áudio da conversa.
• Incorpore a troca ao roteamento se você não puder saber com antecedência que tipo de voz uma chamada exige. Nenhum dos dois modelos está no OrcaRouter no momento em que escrevo — Sonic é acessado pela própria API da Cartesia e por várias plataformas de terceiros; Inworld, pela própria API — mas uma camada de roteamento é exatamente a estrutura que permite que uma conversa comece com uma voz e faça failover para a outra, com o preço de tabela de cada provedor repassado com markup de 0%. No dia em que um desses painéis mudar de estado de novo — e nesta semana eles mudaram — a escolha se torna uma mudança de configuração em vez de uma reescrita.
A versão curta
Esta é uma bifurcação genuína, e a resposta honesta é que a bifurcação diz respeito à alternância de turnos, não à qualidade de áudio. Se você precisa da voz independente com melhor pontuação usando suas próprias vozes nativas, a Cartesia Sonic 3.6 detém a coroa de provedor no Elo 1.282 e cobra US$ 49 por milhão de caracteres por isso. Se você precisa de uma voz que responda à forma como foi falada, a Inworld Realtime TTS-2 entrou em GA esta semana a US$ 25 sob demanda, lidera o quadro de líderes controlado onde as duas se encontram em vozes iguais e carrega um recurso de consciência conversacional que nenhuma arena mede completamente. Os placares agora estão divididos entre os dois modelos — o que é a imagem mais honesta possível de um mercado em que "melhor" depende do teste.

