
GPT-Live-1 vs Cartesia Sonic 3.6: O ranking número um de TTS não mede a interrupção
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
O Cartesia Sonic 3.6 atualmente lidera as duas arenas de conversão de texto em fala da Artificial Analysis — 1.275 Elo no quadro Provider Voice e também o primeiro lugar no quadro Controlled Voice, à frente de todos os mecanismos comerciais com uma plataforma maior em torno de si. O GPT-Live-1 não está classificado em nenhuma das duas, porque não é um modelo de conversão de texto em fala. Ele está empatado em sexto lugar entre catorze num quadro diferente da Artificial Analysis, o Speech to Speech Index, com 70,3%. Lidos em conjunto, esses dois fatos descrevem a verdadeira divisão entre estes produtos: o Sonic 3.6 é muito provavelmente a melhor voz, e o GPT-Live-1 é o único dos dois que consegue ouvir o interlocutor começar a falar e parar.
Ambos estão ativos e ambos estão comercialmente disponíveis — Sonic 3.6 na própria API da Cartesia desde que seu snapshot estável chegou em 27 de agosto de 2026, GPT-Live-1 na API de desenvolvedor da OpenAI desde 10 de setembro de 2026, a US$ 0,05 por minuto de voz. Escolher entre eles não é uma decisão de qualidade. É uma decisão sobre qual metade de um agente de voz você está comprando.
Duas arenas, duas perguntas e por que a divisão é real
Artificial Analysis conduz seus rankings de fala de um jeito que vale a pena entender antes que alguém lhe cite qualquer um dos Elo. A arena Provider Voice classifica engines usando as vozes nativas de cada fornecedor — ela mede a voz que você realmente recebe pronta para uso, que é o número que importa para um comprador. A arena Controlled Voice clona cada modelo nas mesmas oito vozes de referência, para que os ouvintes comparem o motor de síntese em vez do talento vocal. Sonic 3.6 lidera ambos, o que é mais raro do que parece: os dois rankings tiveram campeões diferentes durante a maior parte de 2026.
Nenhum dos dois quadros contém uma única amostra de um modelo sendo interrompido. Eles medem como a fala soa, isoladamente, para um ouvinte. O Speech to Speech Index é construído de forma diferente — ele pondera raciocínio de fala, desempenho agêntico, preferência de arena e sucesso em tarefas em um único número, e só admite modelos que são nativamente fala-para-fala. A Cartesia não tem entrada lá. Não porque o Sonic 3.6 seja ruim, mas porque um motor de texto para fala não tem nada a submeter.
Portanto, 1.275 e 70,3% não são números concorrentes, e qualquer comparação que os coloque na mesma linha está mentindo silenciosamente para você. O que eles estabelecem em conjunto é que a qualidade deixou de ser o eixo em torno do qual essa decisão gira.

Dimensão por dimensão
• Kind — GPT-Live-1: fala para fala full-duplex, um único modelo para todo o ciclo vs Cartesia Sonic 3.6: texto para fala em streaming, emparelhado com reconhecimento de fala Ink-2 para agentes
• Qualidade independente — GPT-Live-1: 70,3% no Speech to Speech Index, sexto lugar empatado entre catorze, versus Cartesia Sonic 3.6: 1.275 Elo no ranking Provider Voice, com base em 1.755 amostras, e também em primeiro no ranking Controlled Voice
• Tratamento de interrupção — GPT-Live-1: uma propriedade do modelo, que decide várias vezes por segundo se deve ceder o turno vs Cartesia Sonic 3.6: um padrão de integração, em que o cliente cancela o contexto de síntese e conta com timestamps em nível de palavra para cortar no momento certo
• Preço — GPT-Live-1: US$ 0,05 por minuto de voz, cobrado por segundo, backend de raciocínio medido separadamente vs. Cartesia Sonic 3.6: cerca de US$ 49 por milhão de caracteres nos planos de crédito, mais US$ 0,06 por minuto de duração de chamada do agente e US$ 0,014 por minuto por um número de telefone Cartesia
• Latência — GPT-Live-1: nenhum número publicado em nível de modelo; latência de troca de turno informada como 0,798 segundos nos próprios testes da OpenAI vs. Cartesia Sonic 3.6: menos de 90 milissegundos de tempo até o primeiro áudio, declarado pelo fornecedor e não medido de forma independente ponta a ponta
• Vazão — GPT-Live-1: sessões simultâneas, limitadas a 25 no nível 1 e 500 no nível 5, sem nível gratuito, vs Cartesia Sonic 3.6: cerca de 132 caracteres por segundo, aproximadamente o dobro da taxa do v3 da ElevenLabs na mesma comparação, com um nível gratuito de 20.000 créditos mensais
• Idiomas — GPT-Live-1: fluência irregular fora dos principais idiomas na cobertura de lançamento vs. Cartesia Sonic 3.6: 44 idiomas em 61 locales, com odiá e urdu adicionados nesta versão
• Controle de voz — GPT-Live-1: doze predefinições, tom e ritmo por meio de prompts, sem clonagem vs Cartesia Sonic 3.6: mais de 500 vozes predefinidas, clonagem instantânea, clonagem profissional em planos superiores, timestamps de palavras e fonemas, e sem SSML — o modelo adapta o ritmo a partir do próprio texto

O barge-in é uma característica da arquitetura, não uma caixa de seleção
A coisa mais comum que os compradores erram nessa comparação é tratar o suporte a interrupção como um booleano. A documentação da Cartesia é franca sobre como a versão dela funciona: quando o interlocutor fala por cima do agente, o cliente envia um cancelamento para o contexto de síntese atual, e os timestamps em nível de palavra retornados na conexão WebSocket são o que permite interromper a reprodução na sílaba correta. Esse é um projeto competente e é assim que a maioria dos agentes de voz em produção lida com barge-in hoje.
É ainda um design em que a decisão de parar de falar era tomada pela sua aplicação, usando um sinal de atividade de voz, com qualquer latência que a ida e volta permita. O GPT-Live-1 move essa decisão para dentro do modelo. Ele decide continuamente se deve continuar ouvindo, pausar, tomar a vez ou passá-la adiante, e é por isso que os próprios números da OpenAI relatam 80,1% de interatividade contra 45,4% do GPT-Realtime-2.1 no Full Duplex Bench v1.5, com latência de troca de turno de 0,798 segundos contra 1,41. Esses números são da OpenAI, publicados com o lançamento e não reproduzidos por ninguém fora da empresa — mas a diferença arquitetural por trás deles não está em disputa, e é a única coisa que uma cascata não consegue aproximar por ajuste.
Onde a cascata vence é em tudo o que está a jusante da frase. O tempo até o primeiro áudio abaixo de 90 milissegundos da Cartesia é um número de fornecedor e mede o modelo, não a conversa: o número que quem liga experimenta também inclui reconhecimento de fala, detecção de turno, tempo de geração do modelo de linguagem, trânsito de rede e buffering de áudio. É exatamente por isso que vale a pena construir uma cascata quando você precisa controlar cada estágio — um modelo pequeno e rápido para turnos simples, um modelo de fronteira para os difíceis, e um sintetizador que nunca faz você esperar.
Essa etapa intermediária é a única parte de qualquer uma das duas pilhas que é genuinamente portátil, e é a parte que decide tanto a qualidade quanto o custo da chamada. Cerca de 190 modelos de onze provedores upstream ficam atrás de uma única chave OrcaRouter ao preço de lista do provedor, sem nenhuma margem, e a DSL de roteamento permite que um único endpoint envie turnos simples para um modelo barato e escale os complicados para um modelo de fronteira — o padrão que um agente de voz realmente deseja, aplicado à etapa que mais varia. Nem Sonic 3.6 nem GPT-Live-1 são acessíveis por meio de uma camada de roteamento; as camadas de voz pertencem aos seus fornecedores.

Gerenciando o dinheiro
Os dois modelos de preços não coincidem, por isso vale a pena fazer a conversão corretamente. A fala ocorre a aproximadamente 150 palavras por minuto, e o inglês tem, em média, cerca de cinco caracteres e meio por palavra, então um minuto de saída falada fica em torno de 800 a 900 caracteres. A US$ 49 por milhão de caracteres, a síntese da Cartesia custa cerca de quatro centavos por minuto de áudio.
Então o resto da cascata chega. A Cartesia cobra US$ 0,06 por minuto de duração de chamada do agente de voz e US$ 0,014 por minuto se você usar o número de telefone dela, além dos caracteres. Adicione reconhecimento de fala e um modelo de linguagem para o texto e você já passou de dez centavos por minuto antes de alguém dizer qualquer coisa difícil. Os US$ 0,05 por minuto de voz do GPT-Live-1 cobrem a escuta, a alternância de turnos e a fala, com o raciocínio delegado cobrado separadamente pela tarifa normal do modelo de backend — o que, para uma chamada de reserva com uma ou duas buscas associadas, é um número real, não um erro de arredondamento.
O ponto de transição está no volume e na dificuldade. Chamadas curtas, repetitivas e de alto volume — confirmações, notificações, consultas simples — favorecem a cascata, porque um modelo barato respondendo a uma pergunta roteirizada é o item mais barato nesta comparação. Chamadas em que o interlocutor sai do script, fala por cima do agente ou muda de ideia no meio da frase favorecem o modelo ponta a ponta, porque o modo de falha da cascata nesse caso não é uma resposta errada, e sim uma resposta desajeitada.
Qual escolher
Escolha o Cartesia Sonic 3.6 se você quer a voz disponível com melhor pontuação e está disposto a assumir você mesmo a lógica da conversa. É a escolha certa para narração, para agentes roteirizados de alto volume, para equipes com um pipeline de reconhecimento de fala já existente e para qualquer pessoa que precise dos carimbos de data/hora em nível de palavra que tornam possível um tratamento preciso de interrupções. Você tem um nível gratuito, mais de 500 vozes, clonagem, 44 idiomas e o topo dos dois rankings de qualidade, e ainda mantém o controle de cada etapa.
Escolha o GPT-Live-1 se a interrupção for o produto. Qualquer coisa em que ser interrompido seja o caso normal, e não um caso excepcional, e em que uma passagem de turno de 0,8 segundo seja melhor que um início de 90 milissegundos numa frase que ninguém terminou de perguntar. Você aceita um modelo fechado, hospedado, cobrado por minuto, com doze vozes e sem clonagem, e aceita que sua pontuação de qualidade independente esteja no meio da tabela.
A tentação é ler 1.275 contra 70,3% e considerar resolvido. Não é, e a diferença entre esses dois números é todo o argumento: um mede como uma voz soa, o outro mede se vale a pena conversar com ela.
