Um cartão de destaque gerado intitulado Gemini 3.8 Live com um selo NÃO VERIFICADO em negrito, o subtítulo 'Dois slugs de voz não lançados em uma página de cota do Google Cloud — o que sabemos até agora', chips exibindo 'Fonte: X/@testingcatalog', '15 de setembro de 2026' e 'Não público — sem model card', três cartões exibindo 'Slug reportado: Gemini 3.8 Live', 'Slug reportado: Live Extended Thinking' e 'Linha Live hoje: gemini-3.1-flash-live-preview, março de 2026', e o rodapé 'Ambos os slugs não verificados — o Google não reconheceu nenhum dos dois.'
Guides & Insights

Vazamento ao Vivo do Gemini 3.8: Dois Novos Slugs de Voz, e Por Que o "Live Extended Thinking" Importa Mais

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Duas strings que não aparecem em nenhuma documentação publicada surgiram esta semana numa página de quotas do GCP: Gemini 3.8 Live, e algo chamado Live Extended Thinking. Foram detetadas pela conta de acompanhamento de lançamentos @testingcatalog e publicadas a 15 de setembro, com a ressalva categórica de que nenhuma delas é pública. Esse é todo o registo público até agora — sem ficha do modelo, sem linha de preços, sem entrada no changelog da API, sem confirmação. Mas os dois nomes estão no fim de uma linha muito legível. Gemini 3.1 Flash Live continua a ser o modelo que a própria documentação da empresa recomenda para trabalho com a Live API, Gemini 3.5 Live e o Gemini 3.5 Live Experimental chegaram a 26 de agosto como a família Gemini Audio, e o lado de texto da mesma família — Gemini 3.8 Flash — tem sido disponibilizado desde 2 de setembro. Um "3.8 Live" fecharia essa lacuna. O segundo slug é o mais interessante dos dois.

Rótulos primeiro, porque um artigo sobre vazamento vive ou morre por causa deles. Isto não é um lançamento. Nenhum dos slugs foi anunciado, documentado, precificado ou confirmado pelo Google, e a fonte é uma única conta que acompanha lançamentos. Tudo abaixo especificamente sobre Gemini 3.8 Live e Live Extended Thinking não é verificado. Tudo abaixo sobre modelos já disponíveis — Gemini 3.1 Flash Live, Gemini 3.5 Live, Gemini 3.8 Flash — está documentado e é verificável, e marquei qual é qual ao longo do texto.

O que o sinal diz, e o que ele não diz

• Reportado — dois slugs, "Gemini 3.8 Live" e "Live Extended Thinking", aparecendo em uma página de cotas do Google Cloud, postados em 15 de setembro com a observação de que são "não públicos"

• Não reportado — um anúncio, um cartão de modelo, um preço, uma janela de contexto, uma data de lançamento, um ID de API, qualquer número de benchmark ou qualquer confirmação do Google

• Corroboração — nenhuma até o momento. A página de modelos da API Gemini do Google, atualizada pela última vez em 4 de setembro, lista exatamente dois modelos Live conversacionais, gemini-3.1-flash-live-preview e gemini-3.5-live-translate-preview, e nenhum deles possui uma variante "Live Extended Thinking"

• Mesmo briefing, afirmação separada — a mesma publicação de 15 de setembro também previu que o Grok 4.7 "deveria chegar perto do Opus 5.0, não do 5.1" e que seu trabalho multimodal "ainda precisa de trabalho". Esse é o modelo de outro fornecedor e uma previsão, e não um artefato; isso é mencionado aqui apenas para completude da fonte

• A implicação do próprio nome — as entradas de cota do Cloud do Google são SKUs por modelo, o que argumenta a favor de um modelo de API faturável, em vez de um recurso dentro do app Gemini para consumidores. Isso é uma inferência a partir da superfície em que a string apareceu, não um fato confirmado

A generated six-row scoreboard titled 'Gemini 3.8 Live - the scoreboard', rows reading 'Status: leak - quota page only, not public', 'Reported slugs: Gemini 3.8 Live + Live Extended Thinking', 'Live line today: gemini-3.1-flash-live-preview, March 2026', 'Thinking control: thinkingLevel minimal/low/medium/high', 'Text sibling: Gemini 3.8 Flash, shipped Sept 2', 'Independent score: none - nothing to test', with the footer 'Gemini 3.8 Live and Live Extended Thinking unverified; Live-line details per Google's Gemini API docs.'

Por que uma página de cota é onde um modelo vaza primeiro

Esta é a parte que vale a pena entender, porque explica por que um artefato de duas palavras merece um artigo inteiro. Páginas de quota não são superfícies de marketing. São infraestrutura de cobrança e limite de taxa: cada modelo que um cliente Cloud pode chamar precisa de uma entrada de quota por projeto antes que a primeira requisição paga seja atendida, e essas entradas são provisionadas pelo mesmo trabalho de engenharia que prepara um modelo para disponibilidade geral. Um slug aparecer ali significa que alguém construiu a infraestrutura para um SKU — não que alguém tenha redigido um comunicado de imprensa.

Isso corta nos dois sentidos, e a leitura honesta é a cautelosa. Uma entrada de cota está mais adiantada do que um codinome num artigo de pesquisa, porque implica uma superfície destinada ao cliente. É também exatamente o tipo de coisa que é criada, testada e discretamente renomeada antes do lançamento. O lado de texto desta família avançou rápido o suficiente para tornar isso concreto: o Gemini 3.6 Flash chegou em 21 de julho, o Gemini 3.7 Flash em 13 de agosto, e o Gemini 3.8 Flash em 2 de setembro — três lançamentos do Flash em seis semanas. Uma linha de modelos que itera tão rapidamente é uma linha que prepara mais SKUs do que lança sob esses nomes.

A linha Live tem rodado uma versão atrás

Eis o que faz de "Gemini 3.8 Live" uma história real, e não uma mera curiosidade de nomenclatura: os modelos de voz da Google não têm acompanhado de forma alguma os seus modelos de texto.

• Modelo Live API recomendado atualmente — gemini-3.1-flash-live-preview, atualização mais recente em março de 2026, ainda descrito na própria documentação do Google como o modelo a ser usado para todos os casos de uso da Live API

• Seus limites — 131.072 tokens de entrada e 65.536 tokens de saída, recebendo texto, imagens, áudio e vídeo e retornando texto e áudio

• A família Gemini Audio, anunciada em 26 de agosto — Gemini 3.5 Live, Gemini 3.5 Live Experimental e Gemini 3.5 Transcribe, com os modelos Transcribe substituindo o Chirp 3 para conversão de fala em texto

• Enquanto isso, a linha de texto — Gemini 3.5 Flash, Gemini 3.6 Flash, Gemini 3.7 Flash e Gemini 3.8 Flash — passou por quatro versões públicas em praticamente a mesma janela de tempo

A screenshot of Google's Gemini API documentation page for gemini-3.1-flash-live-preview, captured September 15, 2026, showing the banner 'Gemini 3.8 Flash is now available', the heading 'Gemini 3.1 Flash Live preview' described as a low-latency audio-to-audio model, model code gemini-3.1-flash-live-preview, supported data types text/images/audio/video in and text and audio out, an input token limit of 131,072 and an output token limit of 65,536, and capability chips including Live API Supported and Thinking Supported.

Então, a linha de áudio está na geração 3.5, enquanto a linha de texto está na 3.8. Um slug "Gemini 3.8 Live" é a primeira evidência de que o Google pretende colocar a voz de volta na mesma geração do texto — o que, para qualquer pessoa que esteja construindo um agente de voz, significa que o raciocínio por trás de uma sessão Live pode saltar três gerações de modelo de texto de uma só vez, em vez de uma.

Por que "Live Extended Thinking" é o slug mais interessante

Hoje, o raciocínio em um modelo Gemini Live é um botão de ajuste, não um modelo. A Live API expõe um thinkingLevel parâmetro com quatro configurações — minimal, low, medium e high — e o padrão é minimal, escolhido explicitamente para otimizar a menor latência. Esse padrão revela para que serve o produto: uma conversa na qual uma pausa é um bug.

Um slug separado chamado "Live Extended Thinking" implica que o Google está se preparando para dividir isso em dois produtos, em vez de um único ajuste, e o raciocínio é direto. Latência e deliberação estão em tensão direta em um modelo de voz — não dá para responder instantaneamente e, ao mesmo tempo, pensar bastante antes de responder —, então um único modelo com um alternador força cada chamador a escolher um ponto nessa linha para cada requisição. Dois SKUs permitem que um cliente roteie o caminho rápido (tratamento de interrupções, barge-in, consultas rápidas) e o caminho lento (um agente de voz trabalhando em uma tarefa de várias etapas) para endpoints ajustados de forma diferente, sem que um degrade o outro.

O precedente já existe dentro do próprio lançamento de agosto do Google. O Gemini 3.5 Live Experimental foi descrito como a variante capaz de "raciocinar diretamente enquanto fala" e narrar seu progresso passo a passo durante uma tarefa — um modelo de voz de cariz explicitamente pensante, lançado como um id próprio em vez de como uma configuração. "Live Extended Thinking" soa como esse instinto a passar de um rótulo experimental para um produto nomeado. Isso é inferência a partir de uma string, e é inferência — mas é o tipo que esta linha em particular já recompensou antes.

O que você pode realmente chamar hoje

Nada aqui muda o que você pode acessar neste momento, e vale a pena ser franco quanto a isso. Não há endpoint Gemini 3.8 Live para chamar, nem ajuste Live Extended Thinking para ativar, e não há como comprar acesso a nenhum dos dois. Qualquer conta que esteja vendendo "acesso ao Gemini 3.8 Live" hoje está vendendo um rótulo, não um modelo. Os modelos Live que você pode realmente usar são gemini-3.1-flash-live-preview e gemini-3.5-live-translate-preview, ambos em pré-visualização por meio da API do próprio Google.

O lado do texto é um cenário diferente, e é a parte que de fato é roteável. Gemini 3.8 Flash — lançado em 2 de setembro a US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de saída no preço de tabela do próprio Google, com previsão de dobrar para US$ 1,50 e US$ 7,50 em 1º de janeiro de 2027 — roda no OrcaRouter por esse mesmo preço de tabela, com 0% de acréscimo por cima. O preço de repasse importa mais do que o habitual em um modelo com um aumento pré-anunciado: quando o número de janeiro entrar em vigor, ele mudará aqui no mesmo dia, sem um segundo contrato para renegociar e sem nenhuma alteração de código a fazer.

The OrcaRouter model page for google/gemini-3.8-flash, showing the Google vendor name and the 2026-09-02 date, a 1M-token context window, 65K max output, text, image, video, file and audio input with text output, a p50 time-to-first-token of 3.46s, and pricing of $0.75 per 1M input tokens and $3.75 per 1M output tokens.

A linha de voz não está no OrcaRouter hoje — nenhum SKU Live ou de áudio nativo está, de fornecedor algum —, então nada aqui deve ser lido como se nós o estivéssemos hospedando. Para o que uma camada de roteamento é genuinamente útil é a outra metade desta história. Quando um modelo Live de geração 3.8 de fato chegar, e quando uma segunda variante, com viés de raciocínio, chegar ao lado dele, escolher entre um caminho de voz rápido e um de deliberação passa a ser uma decisão de roteamento, e não uma reescrita: dois endpoints atrás de uma única chave, com failover automático se o preview id com o qual você construiu for descontinuado. Numa linha que já se renomeou uma vez neste ano, isso não é hipotético.

O que confirmaria isso — e o que o mataria

Um artigo sobre vazamentos deve informar como pode estar errado. Para o Gemini 3.8 Live e o Live Extended Thinking, a evidência confirmatória é específica e verificável:

• A entrada de cota tornando-se pública — o mesmo slug aparecendo em uma lista de modelos do Google Cloud ou Vertex AI com um limite de taxa associado, em vez de apenas em uma captura de tela

• Uma entrada no changelog da API Gemini ou uma linha na página de modelos, que atualmente vai apenas até gemini-3.1-flash-live-preview e gemini-3.5-live-translate-preview

• Uma ficha de modelo do DeepMind — os modelos de áudio de agosto foram documentados ali como "Gemini 3.5 Audio", mesmo enquanto a cobertura os chamava de Live e Transcribe, então a ficha é o artefato que define um nome

• Uma linha de preço, que é a única coisa que transforma um SKU preparado em um produto que alguém pode comprar

• Desconfirmação — os slugs sendo renomeados, incorporados às configurações de pensamento do modelo existente, ou simplesmente nunca reaparecendo. Todos os três são resultados comuns para uma página de quotas, e qualquer um deles significa que esta peça estava adiantada em vez de correta

O que observar, e quem deve agir

Se você está criando um agente de voz na Live API, nada na sua arquitetura precisa mudar esta semana — o modelo no qual você construiria ainda é gemini-3.1-flash-live-preview, e o conselho honesto é manter o ID do modelo atrás de um valor de configuração e manter um segundo endpoint Live aquecido, porque esta linha já mudou de nome uma vez e pode fazer isso de novo. Se você está escolhendo um modelo de texto, este vazamento é irrelevante para você; o Gemini 3.8 Flash está sendo lançado, com preço e mensurável agora, e a pergunta mais útil é a mudança de preço de janeiro, em vez de um slug de voz.

O que realmente importa observar não é o lançamento. É se "Live Extended Thinking" chega como um segundo modelo ou como uma quinta configuração no primeiro. Se for um SKU separado, o Google está dizendo aos desenvolvedores que um agente de voz que pensa e um agente de voz que fala são produtos diferentes — e essa é uma afirmação de maior consequência do que qualquer número de versão no nome.

Aquilo para que uma camada de roteamento é genuinamente útil é a outra metade desta história.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente