Um cartão de título em destaque para 'Inworld Realtime TTS-2 vs Cartesia Sonic 3.6 — a voz que escuta vs o rei das arenas', com um cartão à esquerda 'Cartesia Sonic 3.6 — Provedor #1 · Elo 1.282 · $49 / 1M caracteres', um cartão à direita 'Inworld Realtime TTS-2 — Controlado #1 · Elo 1.123 · $25 / 1M caracteres', um chip de estatística 'Coroas divididas — Arenas Provedor vs Controlado' e o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

Inworld Realtime TTS-2 vs Cartesia Sonic 3.6: A Voz que Escuta vs o Rei das Arenas

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Existem duas teorias concorrentes sobre por que uma voz sintética soa humana e, neste momento, os dois melhores exemplos comerciais de cada uma são Inworld Realtime TTS-2 e Cartesia Sonic 3.6. A teoria da Cartesia é que a humanidade vive no áudio: se o timbre, a prosódia e o ritmo forem indistinguíveis dos de uma pessoa, os ouvintes colocarão você em primeiro lugar — e foi isso que o Sonic 3.6 fez em agosto, saltando para o topo da arena Provider Voice da Artificial Analysis com Elo 1.282. A teoria da Inworld é que a humanidade vive na escuta: o Inworld Realtime TTS-2 molda a própria fala com base no áudio real da conversa que veio antes; assim, ele não apenas soa como uma pessoa — ele responde como uma. Nesta semana, as duas teorias colidiram no placar: a mesma reavaliação que colocou o Inworld Realtime TTS-2 em #2 no ranking de provedores, com Elo 1.252, também o colocou em #1 na arena Controlled Voice — o ranking que a Cartesia liderava — com 1.123 contra 1.119 do Sonic 3.6. Um modelo mantém a coroa de provedores. O outro acaba de conquistar a coroa controlada.

Este não é um confronto em que um lado está obviamente errado. Os dois modelos foram criados para tarefas sobrepostas, mas não idênticas, e a diferença de preço — Sonic 3.6 a $49.0 por milhão de caracteres contra $25 sob demanda para Inworld Realtime TTS-2 — é real o suficiente para que a decisão tenha um componente orçamentário além de um componente de qualidade.

Duas teorias de uma voz com som humano

Cartesia lançou o Sonic 3.6 discretamente em agosto de 2026, uma versão pontual que melhorou o Sonic 3.5 sem alterar o preço nem a proposta de arquitetura. A melhoria apareceu onde a Cartesia precisava: o modelo saltou para Elo 1.282 no Provider Voice arena da Artificial Analysis — onde cada modelo usa suas próprias vozes nativas — e manteve o topo do Controlled Voice arena durante todo o mês de agosto. No painel controlado, cada modelo é clonado nos mesmos oito falantes de referência, então essa coroa é um veredito sobre o próprio motor de síntese, independente do talento vocal. Após a reavaliação da disponibilidade geral da Inworld nesta semana, a Cartesia ainda lidera o painel de provedores, mas o Sonic 3.6 agora está em #2 no painel controlado com Elo 1.119, quatro pontos atrás do Inworld Realtime TTS-2, com 1.123.

O Inworld Realtime TTS-2 vem de uma tradição diferente. Sua linha antecessora, a TTS 1.5, passou o início de 2026 perto do topo das mesmas arenas, e a prévia de pesquisa do TTS-2 registrou Elo 1.209 no ranking de provedores em junho. O modelo GA subiu desde então: nos rankings atuais, ele está com 1.252 no Provider Voice (nº 2, atrás dos 1.282 do Sonic 3.6) e 1.123 no Controlled Voice (nº 1). O verdadeiro diferencial do carro-chefe, porém, não é o Elo; é que o modelo usa as falas anteriores de uma conversa como entrada de áudio e deixa que isso molde como ele entrega a próxima fala. A Cartesia calibra a emoção a partir da transcrição. A Inworld escuta como a última fala foi dita.

O placar, honestamente rotulado

Os valores de Elo vêm das arenas de fala da Artificial Analysis, obtidos dos painéis ao vivo em setembro de 2026. Os valores de latência são informados pelo fornecedor, salvo indicação em contrário, e nenhuma auditoria independente de latência foi publicada para nenhum dos modelos.

• Qualidade independente — Cartesia Sonic 3.6: Elo 1.282 (#1, Voz do Provedor) e 1.119 (#2, Voz Controlada) vs Inworld Realtime TTS-2: Elo 1.252 (#2, Voz do Provedor) e 1.123 (#1, Voz Controlada)

• Preço por 1 milhão de caracteres — US$ 49,0 (medido pela Artificial Analysis) vs US$ 25 sob demanda, US$ 20,8 combinado, conforme medido pela Artificial Analysis, chegando a US$ 12,50 em volume (fornecedor)

• Tempo até o primeiro áudio — menos de 90 ms (declarado pelo fornecedor) vs mediana inferior a 200 ms, menos de 100 ms no p99 nos testes de lançamento da Inworld (declarado pelo fornecedor); a resposta de baixa latência da Inworld ao Sonic é a camada separada TTS-2 Flash, com cerca de 25 ms de tempo até o primeiro byte.

• Idiomas — 42 localizados vs. mais de 100 idiomas para direcionamento de entrega, com a alegação da Inworld de identidade de voz única se estendendo a mais de 200 localidades (declarado pelo fornecedor)

• Clonagem instantânea de voz — ~10 segundos de áudio vs 5–15 segundos, além de uma versão beta de clonagem profissional que leva ~10 minutos de áudio para obter clones de maior fidelidade

• Controle de entrega — tags de transcrição inline como [laughter], além de modulação de volume e velocidade versus direção em inglês simples como "[calm, reassuring]" ou [whisper], instruções em nível de solicitação e três modos de estabilidade, de Stable a Expressive.

A generated two-column scoreboard titled 'Inworld Realtime TTS-2 vs Cartesia Sonic 3.6 — the scoreboard'. Left column Inworld Realtime TTS-2: AA Provider Elo 1,252 (#2), AA Controlled Elo 1,123 (#1), Price $25/1M on demand ($20.8 AA), First audio sub-200 ms, Languages 100+ with 200+ locales claimed, Listening prior-turn audio input. Right column Cartesia Sonic 3.6: AA Provider Elo 1,282 (#1), AA Controlled Elo 1,119 (#2), Price $49.0/1M chars, First audio sub-90 ms, Languages 42 localized, Listening transcript only. Footer 'Elo per Artificial Analysis, September 2026; latency vendor-reported.' OrcaRouter logo bottom-right.

Por que "listens to the conversation" é um eixo diferente

O placar acima mede como uma voz soa isoladamente. A dimensão em que os dois modelos realmente divergem não aparece em nenhum ranking, porque ela só existe ao longo de múltiplas interações.

Inworld Realtime TTS-2 é projetado para o caso em que uma pessoa acabou de dizer algo a ele. O modelo consome o áudio dos turnos anteriores — não apenas uma transcrição deles —, avalia tom, ritmo e estado emocional e seleciona um estado de resposta antes de falar. Se um interlocutor está frustrado, a forma de falar muda; se está relaxado, ela volta ao normal. É por isso que a Inworld comercializa o modelo para agentes, companheiros e jogos, em vez de narração: o recurso não tem sentido em uma chamada única de texto para áudio, mas faz sentido em uma conversa.

{{1}}O Cartesia Sonic 3.6 funciona de forma diferente.{{/1}} {{2}}É um mecanismo de streaming rápido e de alta qualidade, e a própria alegação da Cartesia é a calibração emocional automática a partir do transcript — ele lê as palavras e modula de acordo.{{/2}} {{3}}O que ele não faz é ouvir o áudio das falas anteriores.{{/3}} {{4}}Dentro de uma única fala, os dois podem soar comparáveis;{{/4}} {{5}}ao longo de uma conversa, a Inworld está modelando algo que a Sonic não tenta fazer.{{/5}} {{6}}Se o seu produto é uma narração de uma única fala, essa modelagem é um custo extra. Se é um agente ao vivo, ela é o produto.{{/6}}

A screenshot of Inworld's Realtime TTS-2 product page (captured September 3, 2026) headed 'General Availability — August 31, 2026 — Realtime TTS-2, a new frontier voice model that feels as human as it sounds', with copy explaining it hears the full audio of the exchange, picks up the user's tone, pacing and emotional state, and holds one voice identity across 100+ languages.

Velocidade, preço e a ressalva do Flash

Em latência pura, a Cartesia mantém a dianteira: o tempo até o primeiro áudio abaixo de 90 ms é declarado pelo fornecedor, mas é o número que a empresa vem entregando desde a geração Sonic 3, e ninguém publicou uma auditoria que o contradiga. O carro-chefe da Inworld responde em uma classe conversacional semelhante, abaixo de 200 ms, o que é suficiente para agentes em tempo real. A verdadeira jogada de latência da Inworld é o nível Flash, lançado junto com o modelo GA — um modelo separado com cerca de 25 ms de tempo até o primeiro byte, voltado para cargas de trabalho de alto volume, em que custo e latência de classe Sonic importam mais do que expressividade. A ressalva é que o Flash é um membro enxuto da família: clonagem instantânea e vocalizações não verbais inline, mas sem clonagem profissional e sem direcionamento completo por linguagem natural.

Já no preço, é o contrário. Sonic 3.6 custa US$ 49,0 por milhão de caracteres — cerca do dobro da tarifa sob demanda de US$ 25 da Inworld, e quase quatro vezes os US$ 12,50 do nível superior. A diferença de qualidade entre eles, nos rankings em que ambos aparecem, não justifica esse múltiplo para um comprador de alto volume. Para um agente de voz em tempo real que gera milhares de caracteres por conversa, a diferença por caractere é o que separa uma economia unitária saudável de uma enxuta.

Qual escolher

Escolha o Cartesia Sonic 3.6 se a coroa do ranking de provedores é o que você quer — a voz com a maior pontuação entre as que usam suas próprias vozes nativas, com Elo 1.282, para enunciados curtos e autocontidos, como respostas de assistente, falas de jogos e leituras de status. A US$ 49 por milhão de caracteres, você paga pela coroa, e ele segue sendo o modelo a ser batido nesse ranking.

Escolha o Inworld Realtime TTS-2 se o produto for uma conversa de múltiplos turnos em que a entrega das falas deve responder à pessoa do outro lado — chamadas de suporte, um companheiro, uma entrevista, uma sessão de tutoria. Ele agora lidera o quadro controlado, em que cada modelo fala as mesmas oito vozes de referência, e o faz por cerca de metade do preço enquanto escuta o áudio da conversa.

Incorpore a troca ao roteamento se você não puder saber com antecedência que tipo de voz uma chamada exige. Nenhum dos dois modelos está no OrcaRouter no momento em que escrevo — Sonic é acessado pela própria API da Cartesia e por várias plataformas de terceiros; Inworld, pela própria API — mas uma camada de roteamento é exatamente a estrutura que permite que uma conversa comece com uma voz e faça failover para a outra, com o preço de tabela de cada provedor repassado com markup de 0%. No dia em que um desses painéis mudar de estado de novo — e nesta semana eles mudaram — a escolha se torna uma mudança de configuração em vez de uma reescrita.

A versão curta

Esta é uma bifurcação genuína, e a resposta honesta é que a bifurcação diz respeito à alternância de turnos, não à qualidade de áudio. Se você precisa da voz independente com melhor pontuação usando suas próprias vozes nativas, a Cartesia Sonic 3.6 detém a coroa de provedor no Elo 1.282 e cobra US$ 49 por milhão de caracteres por isso. Se você precisa de uma voz que responda à forma como foi falada, a Inworld Realtime TTS-2 entrou em GA esta semana a US$ 25 sob demanda, lidera o quadro de líderes controlado onde as duas se encontram em vozes iguais e carrega um recurso de consciência conversacional que nenhuma arena mede completamente. Os placares agora estão divididos entre os dois modelos — o que é a imagem mais honesta possível de um mercado em que "melhor" depende do teste.

A screenshot of the Artificial Analysis Controlled Voice leaderboard (captured September 3, 2026) showing Inworld Realtime TTS-2 at rank 1 with Elo 1,123, Cartesia Sonic 3.6 at rank 2 with Elo 1,119, Cartesia Sonic 3.5 at rank 3, and Inworld Realtime TTS-2 Flash at rank 4.