Um cartão hero gerado para o artigo 'Muse Realtime Avatar vs Gemini 3.8 Live', mostrando dois cartões arredondados de cada lado do título. O cartão esquerdo exibe 'Muse Realtime Avatar' acima de um ícone de quadro de vídeo e as linhas 'vídeo + voz de saída', '448x768 retrato, 25 fps' e 'anunciado em 23 de setembro, sem API'; o cartão direito exibe 'Gemini 3.8 Live' acima de um ícone de microfone e balão de fala e as linhas 'áudio + texto de saída', '$0.005/min áudio de entrada' e 'GA em 15 de setembro, Live API'. Um subtítulo diz 'Um renderiza um rosto. O outro opera uma linha telefônica.' O logotipo da OrcaRouter é composto no canto inferior direito.
Guides & Insights

Muse Realtime Avatar vs Gemini 3.8 Live: Uma Face Contra uma Linha de Voz

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Estes dois não são substitutos, e a forma mais rápida de perceber isso é perguntar o que cada um produz. Muse Realtime Avatar, anunciado pela Meta em 23 de setembro de 2026, devolve vídeo sincronizado de um personagem a falar — fornece uma imagem de referência e ele renderiza essa coisa a falar e a gesticular em frames verticais de 448×768. Gemini 3.8 Live, anunciado pelo Google em 15 de setembro de 2026 e disponibilizado geralmente aos programadores no mesmo dia, devolve áudio e texto. Não tem qualquer saída de vídeo. Colocá-los na mesma comparação não é um erro — os dois estão a competir pela mesma superfície conversacional, e os compradores já estão a perguntar sobre qual deles construir — mas a decisão não é "qual é melhor". É "qual de dois produtos diferentes é que eu preciso", e quase todas as comparações publicadas do par erram nisso ao alinhar benchmarks que medem coisas diferentes.

Aqui está a assimetria que deve enquadrar tudo o que vem a seguir. Você pode chamar o Gemini 3.8 Live hoje, de um terminal, com uma chave. Você não pode chamar o Muse Realtime Avatar de forma alguma — sem API, sem preço, sem data. A Meta o demonstrou no Connect e publicou um post de pesquisa; o Google lançou uma tabela de preços e um ID de modelo. Essa é uma comparação entre um produto e um anúncio, e significa que a pergunta útil não é qual deles vence, mas a que cada um compromete você.

O que cada um realmente produz

Esta é toda a comparação em seis linhas, e nenhuma das seis chega perto.

Saída — Muse Realtime Avatar retorna voz e vídeo de retrato sincronizados, gerados juntos a partir de um único fluxo de tokens de fala; Gemini 3.8 Live retorna áudio e texto, sem qualquer geração de vídeo em nenhuma parte do modelo.

Acesso para desenvolvedores — Muse Realtime Avatar não tem nenhum: foi anunciado em 23 de setembro de 2026 como um recurso do agente Muse da Meta, sem API, sem endpoint e sem data definida. O Gemini 3.8 Live está na API Gemini e no Goog​le AI Studio desde 15 de setembro de 2026, sob dois IDs de modelo, gemini-3.8-live e gemini-3.8-live-extended-thinking.

Preço — O Muse Realtime Avatar não tem preço publicado porque não há nada para comprar. O Gemini 3.8 Live publica $0.005 por minuto de entrada de áudio e $0.018 por minuto de saída de áudio através da Live API.

Pontuação independente — o Muse Realtime Avatar não tem nenhuma; os seus números são da própria Meta, medidos em relação a baselines que a Meta selecionou. O Gemini 3.8 Live apresenta 76,0 no Índice Speech to Speech da Artificial Analysis, com a variante de pensamento estendido em 82,6 — um número de terceiros, o que constitui uma classe de evidência diferente.

Latência — os dois números publicados não correspondem à mesma medição, e é aqui que a maioria dos textos erra. A Meta reporta 870 ms desde o fim da sua vez de falar até o primeiro byte de uma resposta sincronizada de voz e vídeo. O número do Goog​le, conforme medido pela Artificial Analysis, é 1,18 segundo até o primeiro áudio no modelo padrão e 1,35 segundo na variante de raciocínio.

Quadro e idioma — Muse Realtime Avatar renderiza vídeo em modo retrato de 448×768 a 25 quadros por segundo. Gemini 3.8 Live possui alternância automática no meio da conversa entre 97 idiomas suportados e processa, em quase tempo real, dados visuais de entrada.

Essa última linha contém a distinção que as pessoas insistem em confundir. Gemini 3.8 Live consegue ver. Não consegue mostrar. Muse Realtime Avatar consegue mostrar. Se ele consegue ver não é o assunto do post da Meta — ele é um gerador orientado por áudio, condicionado por tokens de fala e uma imagem de referência, e sua função é produzir um rosto, não lê-lo.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs Gemini 3.8 Live — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'Gemini 3.8 Live'. Rows read: Output — video + voice vs audio + text; Developer access — none, announced only vs Live API and AI Studio; Price — none published vs $0.005/min in, $0.018/min out; Independent score — none vs AA Speech to Speech 76.0; Latency — 870 ms to first byte of voice + video vs 1.18 s to first audio; Frame — 448x768 portrait at 25 fps vs audio only, 97 languages. A footer line reads 'Meta figures company-reported; Google and index figures per Artificial Analysis.'

Os números de latência não são comparáveis, e a diferença é menor do que parece.

870 ms contra 1,18 segundo soa como se a Meta fosse 26% mais rápida. Leia as medições e a comparação se desfaz. O número da Meta é o tempo entre o fim da vez do usuário e o primeiro byte de uma resposta que inclui vídeo — e o post da Meta deixa explícito que é uma medida de primeiro byte, não o tempo até uma resposta completa nem a latência de entrega contínua pelo resto da chamada. Um sistema pode atingir 870 ms até o primeiro byte e ainda assim parecer lento no segundo doze. O número do Google é o tempo até o primeiro áudio, algo estritamente menor de se produzir, e é medido por um avaliador externo, e não pelo fornecedor.

Ambos são o tipo de número que indica que um sistema é conversacional, e não baseado em turnos, e nenhum dos dois diz como é a sensação da chamada aos cinco minutos. Se você está escolhendo entre eles pela responsividade, a posição honesta é que ninguém publicou uma medição comparável, e a única forma de conseguir uma é executar aquele que pode ser chamado.

O que você pode usar como base hoje, e o que você estaria esperando.

Gemini 3.8 Live vem com as coisas que uma decisão de produção precisa: dois IDs de modelo que você pode fixar, tarifas por minuto publicadas, uma pontuação de índice de terceiros, e uma data de disponibilidade geral declarada. Ele também vem com as restrições que um produto de voz geralmente tem — entrada de áudio, saída de áudio e texto, e sem geração de vídeo.

Muse Realtime Avatar vem com as coisas que uma publicação de pesquisa tem: uma arquitetura, quatro números divulgados pela empresa e um conjunto de testes de preferência divulgados que a Meta realizou contra dois sistemas comerciais de avatar, um dos quais a própria Meta relata como estatisticamente indistinguível da paridade em maneirismos. O que ele não tem é uma forma de comprá-lo. A publicação da Meta também observa que as demonstrações exibidas não refletem todos os avatares disponíveis no app Muse, que é a frase que deve reger qualquer plano que você construir em torno disso.

Há uma terceira opção que vale a pena mencionar, porque é a que a maioria das equipes de fato adota. Nenhum desses modelos é um agente completo. O Gemini 3.8 Live passa o trabalho de bastidor para ferramentas e APIs enquanto continua conversando; o GPT-Live-1 delega seu raciocínio inteiramente a um modelo de backend separado. A camada conversacional é o front end, e o pensamento é uma chamada diferente a um modelo diferente. Essa segunda chamada é inferência de texto comum, e é roteável.

Na OrcaRouter, essa camada é um único endpoint: 196 modelos de 15 provedores por trás de uma única chave, pelo preço de lista do provedor, repassado sem nenhuma margem, com failover automático caso o modelo que você escolheu apresente erro ou expire. Não hospedamos o Gemini 3.8 Live — a API Live é exclusiva do Goog​le — e não hospedamos o Muse Realtime Avatar, que ninguém hospeda. O que oferecemos é a metade de um agente de voz que escala conforme o esforço de raciocínio dos seus interlocutores, e a metade que você pode mudar sem renegociar nada.

A screenshot of Google's blog post 'Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking', dated September 15, 2026, showing the announcement headline and the opening of the post introducing the two speech-to-speech models.

Onde os dois podem realmente se encontrar

A justificativa para colocá-los lado a lado não está nos benchmarks. É que ambos estão tentando ocupar o mesmo espaço em um produto: aquilo com que um usuário conversa. A aposta do Google é que esse espaço é uma conversa e que o entregável é bom — 97 idiomas, execução de ferramentas em segundo plano, uma variante de raciocínio que resolve 68,6% dos cenários de atendimento ao cliente do τ-Voice, contra 30,1% do modelo padrão. A aposta da Meta é que esse espaço é uma presença, e que um usuário que consegue ver o agente é um usuário que permanece na conversa.

Essas apostas não são excludentes. Um produto poderia plausivelmente usar o Gemini 3.8 Live para o loop de voz e algo como o Muse Realtime Avatar para a camada visual, se a camada de avatar algum dia puder ser chamada. O que ele não pode fazer é tratá-las como intercambiáveis, porque uma delas nunca lhe dará um rosto e a outra pode nunca lhe dar um endpoint.

Como decidir

Se você está lançando um produto de voz neste trimestre, a decisão já foi tomada para você: o Gemini 3.8 Live pode ser chamado, e o Muse Realtime Avatar não. Escolha sua variante no eixo sobre o qual o lançamento de fato argumenta — o modelo de pensamento estendido rende 38 pontos de conclusão de tarefas agênticas por pouco mais de quatro vezes o custo de áudio por hora, e o modelo padrão é o modelo de voz competente mais barato do ranking público. Depois, encaminhe o raciocínio delegado separadamente, porque é aí que estão tanto a conta quanto a latência.

Se você estiver avaliando uma camada de avatar, a resposta honesta é que ainda não há nada para avaliar. O que existe é um post de pesquisa com quatro números divulgados pela empresa e uma demonstração. O ponto a observar não é o índice — o Muse Realtime Avatar não aparecerá em um —, mas se a Meta publicará uma tabela de preços, um endpoint e uma data, e se seus 870 ms se sustentam quando o avatar estiver rodando em um telefone com conexão celular, e não em uma demo do Connect.

Até lá, a comparação tem uma forma mais curta do que a maioria dos artigos lhe dá. Um deles é um produto com preço, um ID de modelo e uma pontuação externa. O outro é uma demonstração muito boa de algo que ainda não tem nada disso.

A screenshot of the Artificial Analysis Speech to Speech leaderboard, showing the Speech to Speech Index ranking with Gemini 3.8 Live Extended Thinking at 82.6 and Gemini 3.8 Live at 76.0 among the listed rows, alongside panels for time to first audio and cost per hour of input audio.