Cartão de título principal para 'GPT-Live-1 vs Cartesia Sonic 3.6', com o subtítulo 'A voz com o melhor som não é a que consegue ouvir você', trazendo três cartões com os textos 'Cartesia Sonic 3.6: 1.275 Elo, nº 1 nas duas arenas de fala da Artificial Analysis', 'GPT-Live-1: 70,3% no Speech to Speech Index, 6º lugar empatado entre 14', 'Placares diferentes, porque medem coisas diferentes', acima de uma faixa de rodapé com o texto 'Números das arenas segundo a Artificial Analysis; números de interatividade do GPT-Live-1 reportados pela OpenAI.' O logotipo da OrcaRouter é composto no canto inferior direito.
Guides & Insights

GPT-Live-1 vs Cartesia Sonic 3.6: O ranking número um de TTS não mede a interrupção

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O Cartesia Sonic 3.6 atualmente lidera as duas arenas de conversão de texto em fala da Artificial Analysis — 1.275 Elo no quadro Provider Voice e também o primeiro lugar no quadro Controlled Voice, à frente de todos os mecanismos comerciais com uma plataforma maior em torno de si. O GPT-Live-1 não está classificado em nenhuma das duas, porque não é um modelo de conversão de texto em fala. Ele está empatado em sexto lugar entre catorze num quadro diferente da Artificial Analysis, o Speech to Speech Index, com 70,3%. Lidos em conjunto, esses dois fatos descrevem a verdadeira divisão entre estes produtos: o Sonic 3.6 é muito provavelmente a melhor voz, e o GPT-Live-1 é o único dos dois que consegue ouvir o interlocutor começar a falar e parar.

Ambos estão ativos e ambos estão comercialmente disponíveis — Sonic 3.6 na própria API da Cartesia desde que seu snapshot estável chegou em 27 de agosto de 2026, GPT-Live-1 na API de desenvolvedor da OpenAI desde 10 de setembro de 2026, a US$ 0,05 por minuto de voz. Escolher entre eles não é uma decisão de qualidade. É uma decisão sobre qual metade de um agente de voz você está comprando.

Duas arenas, duas perguntas e por que a divisão é real

Artificial Analysis conduz seus rankings de fala de um jeito que vale a pena entender antes que alguém lhe cite qualquer um dos Elo. A arena Provider Voice classifica engines usando as vozes nativas de cada fornecedor — ela mede a voz que você realmente recebe pronta para uso, que é o número que importa para um comprador. A arena Controlled Voice clona cada modelo nas mesmas oito vozes de referência, para que os ouvintes comparem o motor de síntese em vez do talento vocal. Sonic 3.6 lidera ambos, o que é mais raro do que parece: os dois rankings tiveram campeões diferentes durante a maior parte de 2026.

Nenhum dos dois quadros contém uma única amostra de um modelo sendo interrompido. Eles medem como a fala soa, isoladamente, para um ouvinte. O Speech to Speech Index é construído de forma diferente — ele pondera raciocínio de fala, desempenho agêntico, preferência de arena e sucesso em tarefas em um único número, e só admite modelos que são nativamente fala-para-fala. A Cartesia não tem entrada lá. Não porque o Sonic 3.6 seja ruim, mas porque um motor de texto para fala não tem nada a submeter.

Portanto, 1.275 e 70,3% não são números concorrentes, e qualquer comparação que os coloque na mesma linha está mentindo silenciosamente para você. O que eles estabelecem em conjunto é que a qualidade deixou de ser o eixo em torno do qual essa decisão gira.

A screenshot of the Artificial Analysis Speech to Speech Index chart, ranking fourteen natively speech-to-speech models by a weighted average of speech reasoning, agentic performance, arena preference and task success. Bars run left to right: Grok Voice Think Fast 2.0 High at 79.0%, GPT-Realtime-2.1 High at 73.9%, GPT-Realtime-2 High at 73.6%, Grok Voice Think Fast 1.0 at 72.3%, Gemini 3.1 Flash Live High at 71.5%, GPT-Live-1 Mini and GPT-Live-1 level at 70.3%, then GPT-Realtime-2.1 Minimal at 68.5%, Qwen-Audio-Omni-3.0-Realtime-Plus at 66.8%, Qwen-Audio-Omni-3.0-Realtime-Flash at 64.2%, Gemini 3.1 Flash Live Minimal at 63.9%, GPT-Realtime-2 Minimal at 62.7% and Gemini 2.5 Flash at 52.8%. A companion panel charts cost per hour of input audio across the same field.

Dimensão por dimensão

• Kind — GPT-Live-1: fala para fala full-duplex, um único modelo para todo o ciclo vs Cartesia Sonic 3.6: texto para fala em streaming, emparelhado com reconhecimento de fala Ink-2 para agentes

• Qualidade independente — GPT-Live-1: 70,3% no Speech to Speech Index, sexto lugar empatado entre catorze, versus Cartesia Sonic 3.6: 1.275 Elo no ranking Provider Voice, com base em 1.755 amostras, e também em primeiro no ranking Controlled Voice

• Tratamento de interrupção — GPT-Live-1: uma propriedade do modelo, que decide várias vezes por segundo se deve ceder o turno vs Cartesia Sonic 3.6: um padrão de integração, em que o cliente cancela o contexto de síntese e conta com timestamps em nível de palavra para cortar no momento certo

• Preço — GPT-Live-1: US$ 0,05 por minuto de voz, cobrado por segundo, backend de raciocínio medido separadamente vs. Cartesia Sonic 3.6: cerca de US$ 49 por milhão de caracteres nos planos de crédito, mais US$ 0,06 por minuto de duração de chamada do agente e US$ 0,014 por minuto por um número de telefone Cartesia

• Latência — GPT-Live-1: nenhum número publicado em nível de modelo; latência de troca de turno informada como 0,798 segundos nos próprios testes da OpenAI vs. Cartesia Sonic 3.6: menos de 90 milissegundos de tempo até o primeiro áudio, declarado pelo fornecedor e não medido de forma independente ponta a ponta

• Vazão — GPT-Live-1: sessões simultâneas, limitadas a 25 no nível 1 e 500 no nível 5, sem nível gratuito, vs Cartesia Sonic 3.6: cerca de 132 caracteres por segundo, aproximadamente o dobro da taxa do v3 da ElevenLabs na mesma comparação, com um nível gratuito de 20.000 créditos mensais

• Idiomas — GPT-Live-1: fluência irregular fora dos principais idiomas na cobertura de lançamento vs. Cartesia Sonic 3.6: 44 idiomas em 61 locales, com odiá e urdu adicionados nesta versão

• Controle de voz — GPT-Live-1: doze predefinições, tom e ritmo por meio de prompts, sem clonagem vs Cartesia Sonic 3.6: mais de 500 vozes predefinidas, clonagem instantânea, clonagem profissional em planos superiores, timestamps de palavras e fonemas, e sem SSML — o modelo adapta o ritmo a partir do próprio texto

A generated two-column comparison scoreboard titled 'GPT-Live-1 vs Cartesia Sonic 3.6 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Interactivity: 80.1%, vendor-reported', 'Turn-taking latency: 0.798 s, vendor testing', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Voices: 12 presets, no cloning'. The right column, labelled Cartesia Sonic 3.6, reads 'Kind: streaming text-to-speech', 'Price: ~$49 per 1M characters, plus $0.06 per agent minute', 'Time to first audio: under 90 ms, vendor-stated', 'Throughput: ~132 characters per second', 'Independent score: 1,275 Elo, #1 on the AA Provider Voice arena', 'Voices: 500+ presets, cloning, word timestamps'. The footer reads 'Sonic 3.6 latency vendor-stated; GPT-Live-1 interactivity OpenAI-reported; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

O barge-in é uma característica da arquitetura, não uma caixa de seleção

A coisa mais comum que os compradores erram nessa comparação é tratar o suporte a interrupção como um booleano. A documentação da Cartesia é franca sobre como a versão dela funciona: quando o interlocutor fala por cima do agente, o cliente envia um cancelamento para o contexto de síntese atual, e os timestamps em nível de palavra retornados na conexão WebSocket são o que permite interromper a reprodução na sílaba correta. Esse é um projeto competente e é assim que a maioria dos agentes de voz em produção lida com barge-in hoje.

É ainda um design em que a decisão de parar de falar era tomada pela sua aplicação, usando um sinal de atividade de voz, com qualquer latência que a ida e volta permita. O GPT-Live-1 move essa decisão para dentro do modelo. Ele decide continuamente se deve continuar ouvindo, pausar, tomar a vez ou passá-la adiante, e é por isso que os próprios números da OpenAI relatam 80,1% de interatividade contra 45,4% do GPT-Realtime-2.1 no Full Duplex Bench v1.5, com latência de troca de turno de 0,798 segundos contra 1,41. Esses números são da OpenAI, publicados com o lançamento e não reproduzidos por ninguém fora da empresa — mas a diferença arquitetural por trás deles não está em disputa, e é a única coisa que uma cascata não consegue aproximar por ajuste.

Onde a cascata vence é em tudo o que está a jusante da frase. O tempo até o primeiro áudio abaixo de 90 milissegundos da Cartesia é um número de fornecedor e mede o modelo, não a conversa: o número que quem liga experimenta também inclui reconhecimento de fala, detecção de turno, tempo de geração do modelo de linguagem, trânsito de rede e buffering de áudio. É exatamente por isso que vale a pena construir uma cascata quando você precisa controlar cada estágio — um modelo pequeno e rápido para turnos simples, um modelo de fronteira para os difíceis, e um sintetizador que nunca faz você esperar.

Essa etapa intermediária é a única parte de qualquer uma das duas pilhas que é genuinamente portátil, e é a parte que decide tanto a qualidade quanto o custo da chamada. Cerca de 190 modelos de onze provedores upstream ficam atrás de uma única chave OrcaRouter ao preço de lista do provedor, sem nenhuma margem, e a DSL de roteamento permite que um único endpoint envie turnos simples para um modelo barato e escale os complicados para um modelo de fronteira — o padrão que um agente de voz realmente deseja, aplicado à etapa que mais varia. Nem Sonic 3.6 nem GPT-Live-1 são acessíveis por meio de uma camada de roteamento; as camadas de voz pertencem aos seus fornecedores.

A screenshot of Cartesia's official Sonic 3.6 product page, showing the post title 'Introducing Sonic-3.6' dated Aug 27, 2026, the claim that listeners preferred it in up to 93% of blind head-to-head tests across fifteen locales, and the statement that Sonic-3.6 'takes #1 on the Artificial Analysis leaderboard across both the controlled and provider voice boards'. Below it, an embedded Controlled Voice leaderboard lists Sonic 3.6 first ahead of Sonic 3.5, Eleven v3, StepAudio 2.5 and Realtime TTS 1.5.

Gerenciando o dinheiro

Os dois modelos de preços não coincidem, por isso vale a pena fazer a conversão corretamente. A fala ocorre a aproximadamente 150 palavras por minuto, e o inglês tem, em média, cerca de cinco caracteres e meio por palavra, então um minuto de saída falada fica em torno de 800 a 900 caracteres. A US$ 49 por milhão de caracteres, a síntese da Cartesia custa cerca de quatro centavos por minuto de áudio.

Então o resto da cascata chega. A Cartesia cobra US$ 0,06 por minuto de duração de chamada do agente de voz e US$ 0,014 por minuto se você usar o número de telefone dela, além dos caracteres. Adicione reconhecimento de fala e um modelo de linguagem para o texto e você já passou de dez centavos por minuto antes de alguém dizer qualquer coisa difícil. Os US$ 0,05 por minuto de voz do GPT-Live-1 cobrem a escuta, a alternância de turnos e a fala, com o raciocínio delegado cobrado separadamente pela tarifa normal do modelo de backend — o que, para uma chamada de reserva com uma ou duas buscas associadas, é um número real, não um erro de arredondamento.

O ponto de transição está no volume e na dificuldade. Chamadas curtas, repetitivas e de alto volume — confirmações, notificações, consultas simples — favorecem a cascata, porque um modelo barato respondendo a uma pergunta roteirizada é o item mais barato nesta comparação. Chamadas em que o interlocutor sai do script, fala por cima do agente ou muda de ideia no meio da frase favorecem o modelo ponta a ponta, porque o modo de falha da cascata nesse caso não é uma resposta errada, e sim uma resposta desajeitada.

Qual escolher

Escolha o Cartesia Sonic 3.6 se você quer a voz disponível com melhor pontuação e está disposto a assumir você mesmo a lógica da conversa. É a escolha certa para narração, para agentes roteirizados de alto volume, para equipes com um pipeline de reconhecimento de fala já existente e para qualquer pessoa que precise dos carimbos de data/hora em nível de palavra que tornam possível um tratamento preciso de interrupções. Você tem um nível gratuito, mais de 500 vozes, clonagem, 44 idiomas e o topo dos dois rankings de qualidade, e ainda mantém o controle de cada etapa.

Escolha o GPT-Live-1 se a interrupção for o produto. Qualquer coisa em que ser interrompido seja o caso normal, e não um caso excepcional, e em que uma passagem de turno de 0,8 segundo seja melhor que um início de 90 milissegundos numa frase que ninguém terminou de perguntar. Você aceita um modelo fechado, hospedado, cobrado por minuto, com doze vozes e sem clonagem, e aceita que sua pontuação de qualidade independente esteja no meio da tabela.

A tentação é ler 1.275 contra 70,3% e considerar resolvido. Não é, e a diferença entre esses dois números é todo o argumento: um mede como uma voz soa, o outro mede se vale a pena conversar com ela.