Um cartão hero gerado para 'Gemini 3.8 Live com Live Avatar' sobre um fundo branco com suaves detalhes em gradiente azul e ciano. Três cartões empilhados exibem '15 de setembro de 2026 — Gemini 3.8 Live e 3.8 Live Extended Thinking são lançados na Live API', '24 de setembro de 2026 — Live Avatar anunciado, Gemini Enterprise' e 'Hoje — o avatar é um recurso empresarial, não um ID de modelo'. Uma linha de rodapé diz 'Datas segundo o Google DeepMind.' O logotipo da OrcaRouter está composto no canto inferior direito.
Guides & Insights

Gemini 3.8 Live com Live Avatar: Google Dá um Rosto ao Seu Modelo de Voz

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking foram lançados em 15 de setembro de 2026 — os dois endpoints nativos de diálogo ao vivo que o Google disponibilizou na API do fornecedor, um otimizado para latência e outro para deliberação. Em 24 de setembro, a empresa anunciou o Gemini 3.8 Live with Live Avatar, que combina geração de vídeo quase em tempo real com o mesmo loop de fala, para que o modelo tenha um rosto enquanto fala. Nada mudou nos dois IDs de modelo. O que mudou é a aparência que a conversa pode ter e — de modo mais significativo — o que o modelo pode fazer com a conversa enquanto ela ainda está em andamento.

O que de fato foi lançado em 24 de setembro

A publicação da DeepMind é curta e específica, e vale a pena separar o que ela afirma do que ela significa. O Live Avatar, nas próprias palavras do Google, "traz presença visual quase em tempo real para a IA conversacional do Gemini" ao combinar geração de vídeo em tempo real com a pilha de fala existente. A empresa descreve sincronização labial precisa, expressões naturais e troca de turnos fluida, e dá dois exemplos de implantação: atendimento ao cliente e tutoriais interativos. Depois, diz a frase que mais importa para quem planeja uma implementação — "A partir de hoje, o Gemini 3.8 Live com Live Avatar está disponível no Gemini Enterprise."

Essa é toda a história da disponibilidade. Live Avatar não é um ID de modelo da API Gemini. A lista de modelos de áudio da API ainda contém gemini-3.8-live e gemini-3.8-live-extended-thinking e nenhuma linha de avatar, e a tabela de preços não tem um item de linha de avatar. O recurso chega dentro do Gemini Enterprise, o que significa que o público do anúncio são compradores corporativos e os desenvolvedores que integram em nome deles, não o desenvolvedor individual que chama a Live API com uma chave hoje.

Duas das afirmações da publicação merecem ser citadas com precisão, porque ambas são mais fortes do que a linguagem usual de lançamento. A primeira: o Live Avatar "apresenta sincronização nativa multilíngue de fala para fala" e "consegue transitar perfeitamente entre 97 idiomas sem degradar a fidelidade do vídeo ou introduzir desvio visual". O número 97 é a mesma contagem de idiomas que o lançamento de 15 de setembro alegou para os modelos subjacentes de diálogo ao vivo, portanto esta é a alegação multilíngue existente reafirmada com uma nova restrição acrescentada — a sincronização labial e a animação facial precisam acompanhar quando o idioma muda no meio da frase. A segunda: toda a saída recebe marca d'água com SynthID, "entrelaçado diretamente na saída de áudio e vídeo". Ambas as faixas, não apenas a voz.

A capacidade genuinamente nova é a do meio.

Vá além dos elementos visuais e o parágrafo mais interessante é o que fala sobre chamadas de ferramentas. O Google diz que o Live Avatar é respaldado por "chamada assíncrona de ferramentas" que pode "acionar chamadas de ferramentas e buscar dados em segundo plano enquanto continua o diálogo ativo, lidando com tarefas complexas e garantindo um fluxo de conversa ininterrupto". O exemplo desenvolvido é o check-in de um hóspede de hotel, no qual o modelo chama ferramentas em segundo plano e continua falando.

Isso é uma diferença arquitetural real em relação ao formato de requisição-resposta em torno do qual a maioria das integrações de voz é construída, e é justamente a parte que tem um custo associado. A execução assíncrona significa que o modelo está fazendo um trabalho que a transcrição não mostra. Em um pipeline de texto, você veria a chamada de ferramenta como um turno. Aqui, ela acontece por baixo de uma conversa que ainda está em andamento, o que levanta as mesmas perguntas que qualquer execução concorrente levanta: o que acontece se a chamada de ferramenta falhar silenciosamente no meio de uma frase, e como o interlocutor fica sabendo? A postagem do Goog​le não diz, e o cartão do modelo é o lugar onde se deve procurar isso. Trate a alegação de "fluxo conversacional ininterrupto" como relatada pelo fornecedor e não testada por nenhum terceiro que conseguimos encontrar.

Avatares predefinidos, e a lista de permissões que limita a metade interessante

A história da personalização tem dois níveis, e apenas um deles está disponível em geral. Toda implantação empresarial recebe "uma biblioteca de avatares predefinidos e diversificados". Avatares personalizados — gerados "a partir de uma imagem de referência de alta qualidade" enquanto "preservam a semelhança com a referência, o estilo da marca ou a identidade do personagem" — estão atrás de uma barreira, e o Google afirma claramente: "A criação de avatares personalizados está disponível atualmente apenas por meio de lista de permissões empresarial."

Então, o recurso que a maioria das equipes vai realmente querer, aquele que permite que um avatar corresponda a uma marca ou a um personagem nomeado, é o que você não consegue obter em autoatendimento. Se o seu plano depende de um apresentador sintético que se pareça com o seu mascote, você está esperando uma decisão de lista de permissões, e não o lançamento de um modelo. Isso é um fato de aquisição, não técnico, e é o tipo de coisa que atrasa um trimestre sem que ninguém perceba.

A screenshot of the Google DeepMind blog post 'Introducing Gemini 3.8 Live with Live Avatar', captured in English on 25 September 2026, showing the 24 September 2026 date, the authors listed as Shuo-yiin Chang and CJ Zheng on behalf of the Gemini Audio Team, the lede 'Building on the momentum of last week's Gemini 3.8 Live launch', the sentence 'Starting today, Gemini 3.8 Live with Live Avatar is available in Gemini Enterprise', and the section heading 'More natural and multimodal conversations'.

Onde se posiciona em relação ao resto da linha

O Live Avatar não chegou a uma família de produtos vazia, e a posição que ocupa é mais fácil de perceber em contraste com os produtos irmãos que foram lançados na mesma quinzena.

• Disponibilizado como — Gemini 3.8 Live com Live Avatar é um recurso empresarial dentro do Gemini Enterprise, enquanto Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking são endpoints da API Gemini com IDs de modelo e tarifas por minuto publicadas
• Invocável por desenvolvedores — Live Avatar não, sem ID de modelo e sem linha no tarifário, enquanto os dois endpoints Live sim, gemini-3.8-live e gemini-3.8-live-extended-thinking
• Saída — Live Avatar áudio mais vídeo sincronizado vs os endpoints Live apenas áudio
• Alegação de idiomas — Live Avatar 97 idiomas com lip-sync e continuidade de expressão vs os endpoints Live 97 idiomas com troca automática no meio da conversa
• Marca d'água — Live Avatar SynthID tanto na faixa de áudio quanto na de vídeo vs os endpoints Live SynthID no áudio gerado

Os dois endpoints Live em si são o par bem documentado. A medição independente os coloca muito distantes em alguns eixos e próximos em outros: no Artificial Analysis Speech to Speech Index, o Gemini 3.8 Live Extended Thinking (High) fica em 82,6 contra o Gemini 3.8 Live em 76,0, uma diferença baseada sobretudo na qualidade de raciocínio, e não na dinâmica conversacional, na qual a ordem se inverte. Os próprios números do Goog​le os colocam em 68,6% e 30,1% na conclusão de tarefas do τ-Voice e em 98% e 92% no Big Bench Audio. O Live Avatar herda qualquer um deles que você chamar por baixo dele e também herda a precificação deles, porque o avatar é uma camada de apresentação sobre o mesmo loop de conversa.

A screenshot of the Artificial Analysis Speech to Speech leaderboard, captured in English on 25 September 2026, showing the AA Speech to Speech Index speed and cost-per-hour-of-input-audio panel. The top index values read 82.6, 81.5, 81.3, 80.1, 76.0, 73.9 and 71.5, with a cost axis running to roughly $10.75 per hour. The bar labels are set vertically and are not legible at capture size.

O que isto não muda

Isso não torna os modelos melhores. O Live Avatar é uma camada de apresentação e orquestração: os números de qualidade do Gemini 3.8 Live são os mesmos de 15 de setembro, e quem precisa da mais forte das duas variantes ainda tem de escolher o Extended Thinking e aceitar sua latência. Isso não coloca vídeo na API. Isso não altera o preço de falar com o modelo, que ainda é cobrado com base nas tarifas de áudio por minuto da Live API — US$ 0,005 por minuto de áudio de entrada e US$ 0 por minuto de áudio de saída — com a geração de vídeo do avatar não precificada, pois não é vendida separadamente.

O que isso muda é o conjunto de produtos que podem ser construídos sem uma camada de renderização separada. Um agente de suporte que antes falava e deixava um painel em branco na tela agora pode ter um rosto enquanto trabalha, e o trabalho que ele realiza em segundo plano já não aparece como um vazio silencioso. Essa é uma mudança significativa na forma de uma interface e uma mudança modesta no modelo subjacente. Ambas as coisas podem ser verdadeiras ao mesmo tempo.

A generated summary card for Gemini 3.8 Live with Live Avatar on a white background with soft blue-and-cyan gradient accents. Four rows read 'Announced: 24 September 2026', 'Underlying models: gemini-3.8-live and gemini-3.8-live-extended-thinking, unchanged', 'Availability: Gemini Enterprise; custom avatars by enterprise allowlist', and 'Watermark: SynthID on audio and video'. A footer line reads 'Per Google DeepMind, 24 September 2026; vendor-reported and not independently benchmarked.' The OrcaRouter logo is composited in the bottom-right corner.

O que observar, e uma nota de roteamento

Três coisas fariam isso passar de um anúncio para uma decisão de desenvolvimento. A inclusão de avatares personalizados em lista de permissões teria que ser liberada, porque avatares predefinidos são uma demonstração e avatares personalizados são um produto. A trilha de vídeo teria que ganhar um preço, porque ninguém consegue modelar a economia unitária de um resultado sem preço. E um endpoint de avatar teria que aparecer na lista de modelos da API, porque essa é a diferença entre um recurso empresarial e algo que um desenvolvedor pode chamar hoje à noite.

Do nosso lado, vale a pena dizer uma coisa com precisão, pois é fácil presumir o contrário: o OrcaRouter não roteia os endpoints Gemini 3.8 Live nem o Live Avatar, e nada aqui deve ser entendido como uma afirmação de que o faz. O que nós oferecemos é o restante da linha 3.8 do Google — google/gemini-3.8-flash, entre eles —, ao lado de um catálogo de mais de 200 modelos acessíveis com uma única chave, pelo preço de tabela do provedor e sem markup. Se o Live Avatar leva sua arquitetura na direção de um agente que precisa raciocinar sobre o que o cliente disse, a metade de raciocínio dessa pilha é a metade que você pode consolidar hoje.