
GPT-Live-1 vs ElevenLabs: Um modelo que escuta, uma empresa que vende todo o resto
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
O número mais útil nesta comparação é 90,5%. Essa é a taxa de sucesso em tarefas que a Artificial Analysis mediu para o ElevenLabs Agents em sua Speech Agent Arena — a mais alta entre os seis primeiros desse ranking, alcançada por um sistema que não é um único modelo, mas sim uma cascata de reconhecimento de fala, um modelo de linguagem e um sintetizador interligados pela própria lógica de alternância de turnos da ElevenLabs. O GPT-Live-1, modelo full-duplex ponta a ponta da OpenAI, não aparece nesse ranking, porque compete em outro: o Speech to Speech Index, onde está empatado em sexto lugar entre catorze, com 70,3%. Enquanto isso, o ElevenLabs Eleven v3 continua sendo a voz de produção mais amplamente implantada do setor, com mais de 10.000 vozes em sua biblioteca e mais de 70 idiomas.
A ideia resumida é que um lado vende uma conversa para você e o outro vende uma empresa. Esse resumo está em grande parte certo, e esconde a descoberta mais interessante por baixo: uma cascata bem projetada ainda supera um modelo full-duplex nativo na conclusão da tarefa.
Duas arquiteturas, e a diferença está em onde ficam as costuras
O GPT-Live-1 é um único modelo que recebe áudio e texto e produz áudio e texto. Ele lida com interrupções nativamente — os próprios testes da OpenAI, publicados com o lançamento da API de setembro e não reproduzidos fora da empresa, relatam 80,1% de interatividade no Full Duplex Bench v1.5 contra 45,4% do GPT-Realtime-2.1, e latência de troca de turno de 0,798 segundo contra 1,41. Não há costuras, porque não há nada para costurar.
ElevenLabs Agents é a aposta oposta, deliberadamente. A documentação da ElevenLabs descreve um pipeline: reconhecimento de fala ajustado, um modelo de linguagem que você escolhe ou traz o seu próprio, um sintetizador de baixa latência — tipicamente algo da linha Flash — e um modelo proprietário de gestão de turnos por cima. Barge-in é uma configuração por agente que expõe prontidão de turno e timeouts, em vez de ser uma propriedade do modelo. Na configuração padrão avaliada pela Artificial Analysis, a stack é composta por Scribe v2 Realtime para reconhecimento de fala, um modelo Gemini para raciocínio e Eleven Flash v2 para síntese.
Esse design tem uma vantagem enorme e um custo estrutural. A vantagem é que cada etapa é substituível: um modelo barato para turnos simples, um modelo de fronteira para os difíceis, um sintetizador diferente para uma localidade diferente. O custo é que a latência se acumula em cada junção, e a decisão de alternância de turnos tem de ser tomada de fora.
Dimensão por dimensão
• Arquitetura — GPT-Live-1: um modelo ponta a ponta, entrada e saída de áudio vs ElevenLabs Agents: reconhecimento de fala, modelo de linguagem e síntese em cascata com uma camada proprietária de gestão de turnos
• Evidência independente — GPT-Live-1: 70,3% no Índice Speech to Speech da Artificial Analysis, sexto lugar empatado entre catorze vs. ElevenLabs Agents: Elo 937 na Speech Agent Arena com uma taxa de sucesso em tarefas de 90,5% em 676 amostras, a melhor taxa de sucesso entre os seis primeiros desse ranking
• Rankings de qualidade — GPT-Live-1: não está classificado nas arenas de conversão de texto em fala, por ser um tipo diferente de modelo em comparação com a ElevenLabs: Eleven v3 Conversational com 1.194 Elo e Eleven v3 com 1.166 no ranking Provider Voice, com preços de US$ 50 e US$ 100 por milhão de caracteres, respectivamente
• Preço — GPT-Live-1: US$ 0,05 por minuto de voz, cobrado por segundo, raciocínio de backend medido separadamente vs ElevenLabs: cerca de US$ 50 por milhão de caracteres para Eleven v3 Conversational e cerca de US$ 100 para Eleven v3, com agentes reportados em aproximadamente US$ 0,08 por minuto, ultrapassando o teto de concorrência, e custos de modelo de linguagem e telefonia cobrados separadamente
• Latência — GPT-Live-1: nenhum tempo até o primeiro áudio no nível do modelo foi publicado; latência de troca de turno de 0,798 segundos em testes do fornecedor vs ElevenLabs: cerca de 75 milissegundos para o Flash v2.5 e cerca de 280 milissegundos para o Eleven v3 Conversational, com orientação do fornecedor de menos de 800 milissegundos até o primeiro áudio no nível do agente
• Vozes e clonagem — GPT-Live-1: doze predefinições de API, sem clonagem por design vs. ElevenLabs: mais de 10.000 vozes na biblioteca, clonagem instantânea a partir de uma amostra curta, clonagem profissional a partir de 30 a 180 minutos de áudio com autoverificação
• Idiomas — GPT-Live-1: principais idiomas bem atendidos, fluência irregular além deles na cobertura de lançamento vs. ElevenLabs Eleven v3: mais de 70 idiomas, contra 32 da linha Flash e mais de 90 para seu reconhecimento de fala
• Abrangência — GPT-Live-1: um endpoint, um ID de modelo, níveis de concorrência de 25 a 500 sessões e nenhum plano gratuito, vs. ElevenLabs: síntese, reconhecimento de fala, dublagem, efeitos sonoros, música, um marketplace de vozes e uma plataforma de agentes sob um único contrato, com um plano gratuito que não inclui licença comercial


Onde a ElevenLabs não está apenas à frente, mas incontestada
Três das lacunas dessa lista não são pequenas, e qualquer comparação que lhes dedique uma frase está sendo injusta com o ocupante do cargo.
A clonagem é o primeiro. O GPT-Live-1 vem com doze predefinições e, por design, nenhuma clonagem — uma postura de segurança deliberada, e não uma funcionalidade ausente. A ElevenLabs oferece clonagem instantânea a partir de uma curta amostra de referência e clonagem profissional treinada em 30 a 180 minutos de áudio, condicionadas a níveis de plano e a uma etapa de autoverificação. Se a voz do seu produto faz parte de sua identidade, esta não é uma dimensão na qual o GPT-Live-1 compete.
A biblioteca de vozes vem em segundo lugar. Mais de 10.000 vozes, além de um marketplace licenciado de vozes icônicas de espólios e intérpretes, são um ativo que nenhum lançamento de modelo consegue replicar. É também aquilo que os compradores mais costumam subestimar: escolher uma voz é a última milha de um produto de voz, e ter dez mil para escolher comprime um exercício de branding em uma tarde.
A terceira é a amplitude. Reconhecimento de fala, dublagem, efeitos sonoros, música, uma plataforma de agentes — uma equipe que precisa de quatro desses compra um contrato em vez de quatro. Isso é uma vantagem estratégica, não de qualidade, e sobrevive ao fato de o outro lado vencer um benchmark.
Ambas as empresas carregam questões de governança que deveriam constar de uma revisão de aquisições, e não de uma nota de rodapé. A clonagem profissional da ElevenLabs exige autoverificação, e seus termos proíbem a clonagem da voz de outra pessoa mesmo com consentimento; a empresa também enfrenta uma série de ações coletivas ajuizadas em maio de 2026 relativas ao consentimento para dados de treinamento, nas quais as alegações não foram comprovadas. A posição da OpenAI é mais simples porque ela removeu a funcionalidade que gera o risco.

O imposto em cascata, e onde vale a pena pagá-lo
Os custos de uma cascata revelam-se na latência e na orquestração. As orientações do fornecedor para a ElevenLabs colocam o tempo até ao primeiro áudio de um agente abaixo de 800 milissegundos na mediana e abaixo de 1,5 segundos no percentil 95 — valores que descrevem todo o pipeline, e não os 75 milissegundos do sintetizador. A isso acrescem o tempo de geração do modelo de linguagem e o trânsito de rede. Parte disso é recuperável com uma escolha criteriosa das etapas; nada disso é gratuito.
A fatura da orquestração é mais suave, mas é real. Cada etapa extra é mais um ponto onde uma chamada pode falhar, mais um timeout para ajustar, mais um fornecedor com quem conciliar faturas. É essa a parte que um modelo nativo ponta a ponta elimina por completo: há uma única coisa que pode quebrar, e ou responde ou não responde.
Onde a cascata se paga é no estágio intermediário. O modelo de linguagem por trás de um agente de voz é o componente cuja qualidade melhora mais rápido e cujo custo varia mais, e poder trocá-lo sem tocar na camada de voz vale dinheiro de verdade ao longo da vida de um produto. Aproximadamente 190 modelos de onze provedores upstream ficam atrás de uma única chave OrcaRouter ao preço de tabela do provedor, sem markup, então uma mudança de preço de um fornecedor chega a essa camada no mesmo dia, e o failover automático impede que um timeout de backend encerre uma chamada ao vivo. Nem o stack de agentes da ElevenLabs nem o endpoint Live Sessions do GPT-Live-1 são acessíveis dessa forma — as camadas de voz pertencem aos seus fornecedores, e esta é a camada abaixo delas.
Qual escolher
Escolha o GPT-Live-1 se a mecânica da conversa for o produto e você quiser um contrato, um modo de falha. Linhas telefônicas em que os interlocutores falam por cima do agente, em que uma transferência natural importa mais do que uma voz perfeita e em que doze boas vozes são suficientes. Você aceita um modelo hospedado fechado, sem clonagem, qualidade independente mediana e nenhum nível gratuito para prototipar.
Escolha a ElevenLabs se a qualidade de voz, a clonagem ou a abrangência for a restrição. Narração, dublagem, produtos multilíngues, qualquer coisa em que a voz seja a marca, qualquer coisa que precise de reconhecimento de fala no mesmo contrato. Você aceita uma cascata para operar, preços cerca de dez a vinte vezes os do GPT-Live-1 por unidade de fala, e o fato de que a lógica de interrupção é sua para configurar e sua para errar.
Os 90,5% são a parte que vale a pena levar. Eles dizem que uma empresa que montou três modelos e uma camada de troca de turnos superou uma empresa que treinou um único modelo para fazer tudo isso, na métrica mais próxima de indicar se a chamada funcionou. O full duplex é um avanço arquitetural genuíno e não é, com base nas evidências atuais, aquilo que decide se quem ligou conseguiu o que queria.
