Um cartão de destaque gerado para o artigo 'Muse Realtime Avatar vs GPT-Live-1', mostrando dois cartões arredondados de cada lado do título. O cartão esquerdo exibe 'Muse Realtime Avatar' acima de um ícone de avatar de retrato e as linhas 'vídeo + voz, um stream' e 'sem API, sem preço, sem data'; o cartão direito exibe 'GPT-Live-1' acima de um ícone de balão de fala e as linhas 'US$ 0,05 por minuto, cobrado por segundo' e 'sessões simultâneas, WebRTC'. Um subtítulo diz 'Um vende minutos. O outro vende presença.' O logotipo da OrcaRouter é composto no canto inferior direito.
Guides & Insights

Muse Realtime Avatar vs GPT-Live-1: Presença Contra Conversa

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A unidade de cobrança informa o que cada empresa acredita estar vendendo. GPT-Live-1, o modelo de voz full-duplex da Open​AI, cobra uma tarifa fixa de US$ 0,05 por minuto de voz, cobrada por segundo, e seus limites de taxa são expressos em sessões simultâneas — 25 no Nível 1, subindo para 500 no Nível 5. Essa é a unidade de uma linha telefônica. Muse Realtime Avatar, anunciado pela Meta em 23 de setembro de 2026, não tem unidade de cobrança, porque não há nada a cobrar: nenhuma API, nenhum endpoint, nenhum preço, nenhuma data. Sua unidade publicada é, em vez disso, um número de hardware — 12 sessões simultâneas em tempo real em uma única NVIDIA GB200. Uma empresa está vendendo conversa por minuto. A outra está mostrando quanto custa renderizar um rosto, e ainda não decidiu vendê-lo.

Ambos os modelos são relativamente novos e nenhum deles é um lançamento no sentido que a palavra costuma ter. GPT-Live-1 foi lançado dentro do ChatGPT em 8 de julho de 2026 e só chegou à API de desenvolvedores em 10 de setembro — dois meses durante os quais foi a voz padrão de um produto de consumo e ficou indisponível para quem estava desenvolvendo. Muse Realtime Avatar foi anunciado em 23 de setembro de 2026 na Meta Connect, é demonstrado no próprio post de pesquisa da Meta e permanece como uma capacidade do agente Muse em vez de um produto. Compará-los é comparar dois estágios diferentes da mesma ideia: o que acontece quando um modelo conversacional é bom o suficiente para que a próxima pergunta seja o que o usuário está olhando enquanto ele fala.

O que a OpenAI construiu: uma conversa que nunca trava

O GPT-Live-1 é full-duplex no sentido que importa operacionalmente — ele não espera que você termine antes de começar a trabalhar. Ele acessa a API de desenvolvedor por exatamente um endpoint, o endpoint Live Sessions, sob exatamente um ID de modelo, gpt-live-1, sem snapshots datados para fixar e sem endpoints irmãos habilitados. Sem Chat Completions, sem Responses, sem Realtime, sem fine-tuning, sem endpoints de transcrição de áudio ou de fala. A entrada de imagem e vídeo não é explicitamente suportada.

A decisão de design que molda tudo o que vem depois é a delegação. O GPT-Live-1 não faz seu próprio raciocínio pesado. A documentação da OpenAI combina a camada de voz com um backend de raciocínio separado, e no exemplo de WebRTC publicado esse backend é o GPT-5.6 Terra. Assim, uma sessão do GPT-Live-1 é dois medidores rodando ao mesmo tempo: US$ 0,05 por minuto pela voz, mais as taxas normais de tokens do modelo de backend para cada chamada de ferramenta, busca e etapa de raciocínio que ele delega. No Speech to Speech Index, essa personalidade dividida aparece como o mesmo modelo pontuando duas vezes — 81,5 com o GPT-6 Astra fazendo o raciocínio em esforço médio, 80,1 com o GPT-5.6 Sol em esforço baixo. A diferença de 1,4 ponto entre essas duas configurações é maior que a margem de 0,2 ponto que coloca a melhor configuração do GPT-Live-1 em primeiro lugar.

Essa é a forma honesta do modelo. O front-end de voz é fixo; a inteligência é um parâmetro que você define, e ele move a pontuação mais do que qualquer modelo concorrente.

O que a Meta construiu: um rosto que se move com a voz

O Muse Realtime Avatar ataca um problema que o GPT-Live-1 não tem — manter o vídeo gerado em sincronia perfeita com a fala gerada. A resposta da Meta é transformá-los no mesmo fluxo: o Muse Realtime Voice emite tokens de fala que carregam tanto conteúdo quanto prosódia, e o avatar é um Diffusion Transformer guiado por áudio que consome esses mesmos tokens, condicionado a uma imagem de referência e a uma janela móvel de latentes de vídeo recentes. Nada é sincronizado labialmente a posteriori, porque não existe “a posteriori” — voz, boca e expressão saem de um único processo.

Os números publicados são da própria Meta, medidos em relação a baselines que a Meta escolheu, e nenhum foi reproduzido fora da empresa. 870 ms do fim do seu turno até o primeiro byte de uma resposta sincronizada de voz e vídeo. Vídeo retrato 448×768 a 25 quadros por segundo, marcado com uma sobreposição transparente para que o espectador perceba que não é uma câmera. Doze sessões simultâneas em um GB200, um ganho de capacidade de 8× sobre o baseline BF16 de duas etapas da própria Meta, proveniente de treinamento ciente de quantização de quatro bits, caches KV persistentes e batching dinâmico sensível à latência. E um resultado de preferência que a Meta relata ter passado de 45% para 55% sobre esse baseline, com duas vitórias divulgadas contra sistemas comerciais de avatar — além da divulgação de que, em maneirismos, o resultado contra um deles não é estatisticamente distinguível da paridade.

Nada nessa lista é uma taxa, um endpoint ou uma data.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs GPT-Live-1 — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'GPT-Live-1'. Rows read: What it returns — video + voice vs audio + text; Where it runs — Muse app only vs Live Sessions API, WebRTC; Billing unit — none published vs $0.05 per minute, by the second; Scale limit — 12 sessions per GB200 vs 25 to 500 concurrent sessions by tier; Independent score — none vs AA Speech to Speech 81.5 with Astra; Reasoning — inside Muse vs delegated to a separate backend model. A footer line reads 'Meta figures company-reported; GPT-Live-1 index figure per Artificial Analysis and configuration-specific.'

A conta de dois metros, e onde o roteamento ganha seu lugar.

A estrutura de custos do GPT-Live-1 não é um único número, e tratá-la como se fosse é assim que um modelo de voz que parece barato produz um mês caro. Voz custa US$ 0,05 por minuto, cobrado por segundo, sem arredondamento para cima, e os primeiros 15 segundos de uma sessão são cobrados antecipadamente, mas creditados contra a duração posterior em vez de somados por cima. Tudo o que a sessão delega — o raciocínio, as chamadas de ferramentas, qualquer busca — é cobrado separadamente pelas próprias tarifas do modelo de backend. Direcione a delegação para um raciocinador de ponta e deixe-o buscar a cada turno, e você terá construído uma linha aberta de US$ 3 por hora com um modelo premium por trás dela.

Esse segundo medidor é a metade roteável. No OrcaRouter, o backend de uma sessão do GPT-Live-1 é apenas mais uma chamada de modelo: 196 modelos de 15 provedores por trás de uma única chave, ao preço de tabela do provedor, repassado com zero de margem, com failover automático quando o modelo que você escolheu dá erro ou expira. Você não pode rotear a camada de voz — o Live Sessions é exclusivamente o endpoint da Open​AI —, mas tudo a que a camada de voz delega fica em uma única chave, o que significa que a parte da conta que escala com o esforço de raciocínio de quem liga para você também é a parte que você pode mudar sem contrato.

O Muse Realtime Avatar, por outro lado, não tem medidores para rotear. É um recurso de um aplicativo.

A screenshot of the Artificial Analysis Speech to Speech leaderboard showing the Speech to Speech Index ranking, with GPT-Live-1 listed at 81.5 in its Astra configuration alongside the other ranked speech-to-speech models.

Duas apostas sobre para que serve um agente de voz

Tire as especificações e as duas empresas discordam sobre o produto. A aposta da OpenAI é que a conversa é o produto — que um agente de voz é uma linha telefônica, e o trabalho é fazer com que pareça uma: nunca travar, entregar o raciocínio difícil a um modelo por trás dele, cobrar por minuto, escalar pelas chamadas simultâneas. Cada escolha na superfície da API do GPT-Live-1 decorre disso. Limites de taxa baseados em concorrência, transporte apenas WebRTC, um único endpoint deliberadamente estreito, sem vídeo de entrada ou de saída.

A aposta da Meta é que a presença é o produto — que um usuário capaz de ver o agente é um usuário que permanece na conversa, e que a engenharia interessante não é a alternância de turnos, mas manter um personagem renderizado coerente durante toda a duração de uma chamada. Essas escolhas produzem um sistema otimizado para taxa de quadros e densidade de sessão em uma GPU, sem nenhuma superfície comercial.

Há uma possibilidade real de que ambos estejam certos e de que os dois sejam combinados. Um produto poderia executar sua conversa em um modelo de voz full-duplex e sua camada visual em um renderizador de avatar, e a única coisa que impede isso hoje é que o renderizador de avatar não tem endpoint. O que não é plausível é tratá-los como duas versões da mesma compra.

Quem deve agir, e quem deve esperar

Se você está construindo um produto de voz agora, o GPT-Live-1 pode ser chamado e o Muse Realtime Avatar não, e isso encerra a decisão. A escolha interessante dentro do GPT-Live-1 é o backend ao qual você delega, porque é aí que tanto a pontuação quanto a conta realmente se movem — e é a única parte da stack que você pode rotear, trocar e fazer failover sem tocar na integração de voz.

Se o que você quer é um avatar, esperar não é passivo. As coisas que vale a pena acompanhar são específicas: se a Meta publica uma tabela de preços e um endpoint, se aparece uma data declarada e se os 870 ms sobrevivem ao contato com um telefone numa conexão celular, em vez de uma demonstração do Connect. O próprio post da Meta observa que suas demonstrações não refletem todos os avatares disponíveis no aplicativo Muse, e é essa a frase a que devemos nos agarrar.

Até que uma dessas coisas mude, a comparação tem uma resposta em uma linha. GPT-Live-1 é uma linha telefônica com um cérebro que você escolhe. Muse Realtime Avatar é um rosto sem número de telefone.

A screenshot of the OrcaRouter models catalogue page, showing the subtitle '196 models · 15 providers · one API key, one bill', a 'How to call any model' panel with a POST example against the OpenAI-compatible endpoint, and a grid of model cards including DeepSeek V4.1 Flash, GPT-6 Astra, Gemini 3.8 Flash, Qwen3.8 Max and Claude Fable 5.1.