
Muse Realtime Avatar vs GPT-Live-1: Presença Contra Conversa
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 180 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
A unidade de cobrança informa o que cada empresa acredita estar vendendo. GPT-Live-1, o modelo de voz full-duplex da OpenAI, cobra uma tarifa fixa de US$ 0,05 por minuto de voz, cobrada por segundo, e seus limites de taxa são expressos em sessões simultâneas — 25 no Nível 1, subindo para 500 no Nível 5. Essa é a unidade de uma linha telefônica. Muse Realtime Avatar, anunciado pela Meta em 23 de setembro de 2026, não tem unidade de cobrança, porque não há nada a cobrar: nenhuma API, nenhum endpoint, nenhum preço, nenhuma data. Sua unidade publicada é, em vez disso, um número de hardware — 12 sessões simultâneas em tempo real em uma única NVIDIA GB200. Uma empresa está vendendo conversa por minuto. A outra está mostrando quanto custa renderizar um rosto, e ainda não decidiu vendê-lo.
Ambos os modelos são relativamente novos e nenhum deles é um lançamento no sentido que a palavra costuma ter. GPT-Live-1 foi lançado dentro do ChatGPT em 8 de julho de 2026 e só chegou à API de desenvolvedores em 10 de setembro — dois meses durante os quais foi a voz padrão de um produto de consumo e ficou indisponível para quem estava desenvolvendo. Muse Realtime Avatar foi anunciado em 23 de setembro de 2026 na Meta Connect, é demonstrado no próprio post de pesquisa da Meta e permanece como uma capacidade do agente Muse em vez de um produto. Compará-los é comparar dois estágios diferentes da mesma ideia: o que acontece quando um modelo conversacional é bom o suficiente para que a próxima pergunta seja o que o usuário está olhando enquanto ele fala.
O que a OpenAI construiu: uma conversa que nunca trava
O GPT-Live-1 é full-duplex no sentido que importa operacionalmente — ele não espera que você termine antes de começar a trabalhar. Ele acessa a API de desenvolvedor por exatamente um endpoint, o endpoint Live Sessions, sob exatamente um ID de modelo, gpt-live-1, sem snapshots datados para fixar e sem endpoints irmãos habilitados. Sem Chat Completions, sem Responses, sem Realtime, sem fine-tuning, sem endpoints de transcrição de áudio ou de fala. A entrada de imagem e vídeo não é explicitamente suportada.
A decisão de design que molda tudo o que vem depois é a delegação. O GPT-Live-1 não faz seu próprio raciocínio pesado. A documentação da OpenAI combina a camada de voz com um backend de raciocínio separado, e no exemplo de WebRTC publicado esse backend é o GPT-5.6 Terra. Assim, uma sessão do GPT-Live-1 é dois medidores rodando ao mesmo tempo: US$ 0,05 por minuto pela voz, mais as taxas normais de tokens do modelo de backend para cada chamada de ferramenta, busca e etapa de raciocínio que ele delega. No Speech to Speech Index, essa personalidade dividida aparece como o mesmo modelo pontuando duas vezes — 81,5 com o GPT-6 Astra fazendo o raciocínio em esforço médio, 80,1 com o GPT-5.6 Sol em esforço baixo. A diferença de 1,4 ponto entre essas duas configurações é maior que a margem de 0,2 ponto que coloca a melhor configuração do GPT-Live-1 em primeiro lugar.
Essa é a forma honesta do modelo. O front-end de voz é fixo; a inteligência é um parâmetro que você define, e ele move a pontuação mais do que qualquer modelo concorrente.
O que a Meta construiu: um rosto que se move com a voz
O Muse Realtime Avatar ataca um problema que o GPT-Live-1 não tem — manter o vídeo gerado em sincronia perfeita com a fala gerada. A resposta da Meta é transformá-los no mesmo fluxo: o Muse Realtime Voice emite tokens de fala que carregam tanto conteúdo quanto prosódia, e o avatar é um Diffusion Transformer guiado por áudio que consome esses mesmos tokens, condicionado a uma imagem de referência e a uma janela móvel de latentes de vídeo recentes. Nada é sincronizado labialmente a posteriori, porque não existe “a posteriori” — voz, boca e expressão saem de um único processo.
Os números publicados são da própria Meta, medidos em relação a baselines que a Meta escolheu, e nenhum foi reproduzido fora da empresa. 870 ms do fim do seu turno até o primeiro byte de uma resposta sincronizada de voz e vídeo. Vídeo retrato 448×768 a 25 quadros por segundo, marcado com uma sobreposição transparente para que o espectador perceba que não é uma câmera. Doze sessões simultâneas em um GB200, um ganho de capacidade de 8× sobre o baseline BF16 de duas etapas da própria Meta, proveniente de treinamento ciente de quantização de quatro bits, caches KV persistentes e batching dinâmico sensível à latência. E um resultado de preferência que a Meta relata ter passado de 45% para 55% sobre esse baseline, com duas vitórias divulgadas contra sistemas comerciais de avatar — além da divulgação de que, em maneirismos, o resultado contra um deles não é estatisticamente distinguível da paridade.
Nada nessa lista é uma taxa, um endpoint ou uma data.

A conta de dois metros, e onde o roteamento ganha seu lugar.
A estrutura de custos do GPT-Live-1 não é um único número, e tratá-la como se fosse é assim que um modelo de voz que parece barato produz um mês caro. Voz custa US$ 0,05 por minuto, cobrado por segundo, sem arredondamento para cima, e os primeiros 15 segundos de uma sessão são cobrados antecipadamente, mas creditados contra a duração posterior em vez de somados por cima. Tudo o que a sessão delega — o raciocínio, as chamadas de ferramentas, qualquer busca — é cobrado separadamente pelas próprias tarifas do modelo de backend. Direcione a delegação para um raciocinador de ponta e deixe-o buscar a cada turno, e você terá construído uma linha aberta de US$ 3 por hora com um modelo premium por trás dela.
Esse segundo medidor é a metade roteável. No OrcaRouter, o backend de uma sessão do GPT-Live-1 é apenas mais uma chamada de modelo: 196 modelos de 15 provedores por trás de uma única chave, ao preço de tabela do provedor, repassado com zero de margem, com failover automático quando o modelo que você escolheu dá erro ou expira. Você não pode rotear a camada de voz — o Live Sessions é exclusivamente o endpoint da OpenAI —, mas tudo a que a camada de voz delega fica em uma única chave, o que significa que a parte da conta que escala com o esforço de raciocínio de quem liga para você também é a parte que você pode mudar sem contrato.
O Muse Realtime Avatar, por outro lado, não tem medidores para rotear. É um recurso de um aplicativo.

Duas apostas sobre para que serve um agente de voz
Tire as especificações e as duas empresas discordam sobre o produto. A aposta da OpenAI é que a conversa é o produto — que um agente de voz é uma linha telefônica, e o trabalho é fazer com que pareça uma: nunca travar, entregar o raciocínio difícil a um modelo por trás dele, cobrar por minuto, escalar pelas chamadas simultâneas. Cada escolha na superfície da API do GPT-Live-1 decorre disso. Limites de taxa baseados em concorrência, transporte apenas WebRTC, um único endpoint deliberadamente estreito, sem vídeo de entrada ou de saída.
A aposta da Meta é que a presença é o produto — que um usuário capaz de ver o agente é um usuário que permanece na conversa, e que a engenharia interessante não é a alternância de turnos, mas manter um personagem renderizado coerente durante toda a duração de uma chamada. Essas escolhas produzem um sistema otimizado para taxa de quadros e densidade de sessão em uma GPU, sem nenhuma superfície comercial.
Há uma possibilidade real de que ambos estejam certos e de que os dois sejam combinados. Um produto poderia executar sua conversa em um modelo de voz full-duplex e sua camada visual em um renderizador de avatar, e a única coisa que impede isso hoje é que o renderizador de avatar não tem endpoint. O que não é plausível é tratá-los como duas versões da mesma compra.
Quem deve agir, e quem deve esperar
Se você está construindo um produto de voz agora, o GPT-Live-1 pode ser chamado e o Muse Realtime Avatar não, e isso encerra a decisão. A escolha interessante dentro do GPT-Live-1 é o backend ao qual você delega, porque é aí que tanto a pontuação quanto a conta realmente se movem — e é a única parte da stack que você pode rotear, trocar e fazer failover sem tocar na integração de voz.
Se o que você quer é um avatar, esperar não é passivo. As coisas que vale a pena acompanhar são específicas: se a Meta publica uma tabela de preços e um endpoint, se aparece uma data declarada e se os 870 ms sobrevivem ao contato com um telefone numa conexão celular, em vez de uma demonstração do Connect. O próprio post da Meta observa que suas demonstrações não refletem todos os avatares disponíveis no aplicativo Muse, e é essa a frase a que devemos nos agarrar.
Até que uma dessas coisas mude, a comparação tem uma resposta em uma linha. GPT-Live-1 é uma linha telefônica com um cérebro que você escolhe. Muse Realtime Avatar é um rosto sem número de telefone.

