Una hero card generata per 'Gemini 3.8 Live with Live Avatar' su sfondo bianco con morbidi accenti sfumati blu e ciano. Tre card impilate recitano '15 set 2026 — Gemini 3.8 Live e 3.8 Live Extended Thinking arrivano sulla Live API', '24 set 2026 — annunciato Live Avatar, Gemini Enterprise' e 'Oggi — l'avatar è una funzionalità enterprise, non un ID di modello'. Una riga a piè di pagina recita 'Date secondo Google DeepMind.' Il logo OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

Gemini 3.8 Live con Live Avatar: Google dà un volto al suo modello vocale

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking sono stati rilasciati il 15 settembre 2026 — i due endpoint nativi per il dialogo dal vivo che Goog​le ha aperto sull'API del fornitore, uno ottimizzato per la latenza e uno per la riflessione. Il 24 settembre l'azienda ha annunciato Gemini 3.8 Live with Live Avatar, che abbina la generazione video quasi in tempo reale allo stesso ciclo vocale, così il modello ha un volto mentre parla. Nulla è cambiato nei due ID modello. Ciò che è cambiato è l'aspetto che la conversazione può assumere e — cosa più consequenziale — ciò che al modello è consentito fare alla conversazione mentre è ancora in corso.

Cosa è stato effettivamente rilasciato il 24 settembre

Il post di DeepMind è breve e specifico, e vale la pena separare ciò che afferma da ciò che significa. Live Avatar, nelle parole di Goog​le, «porta una presenza visiva quasi in tempo reale all'IA conversazionale di Gemini» abbinando la generazione video in tempo reale allo stack vocale esistente. L'azienda descrive un lip-sync preciso, espressioni naturali e un'alternanza dei turni fluida, e fornisce due esempi di implementazione: servizio clienti e tour interattivi. Poi arriva la frase che conta di più per chiunque stia pianificando una build — «A partire da oggi, Gemini 3.8 Live con Live Avatar è disponibile in Gemini Enterprise».

Questa è tutta la storia della disponibilità. Live Avatar non è un ID di modello dell'API Gemini. L'elenco dei modelli audio dell'API contiene ancora gemini-3.8-live e gemini-3.8-live-extended-thinking e nessuna riga avatar, e il listino prezzi non presenta alcuna voce relativa agli avatar. La funzionalità arriva all'interno di Gemini Enterprise, il che significa che il pubblico dell'annuncio è costituito dagli acquirenti aziendali e dagli sviluppatori che integrano per loro conto, non dal singolo sviluppatore che oggi chiama la Live API con una chiave.

Due delle affermazioni del post meritano di essere citate con precisione, perché entrambe sono più forti del consueto linguaggio di lancio. La prima: Live Avatar "offre una sincronizzazione nativa speech-to-speech multilingue" e "può passare senza soluzione di continuità tra 97 lingue senza degradare la fedeltà video o introdurre derive visive". Il numero 97 è lo stesso conteggio di lingue che il lancio del 15 settembre rivendicava per i modelli di dialogo dal vivo sottostanti, quindi questa è la rivendicazione multilingue esistente, riformulata con un nuovo vincolo aggiunto — il lip-sync e l'animazione facciale devono tenere il passo quando la lingua cambia a metà frase. La seconda: tutti gli output sono contrassegnati con watermark SynthID, "intessuto direttamente nell'output audio e video". Entrambe le tracce, non solo la voce.

La capacità davvero nuova è quella nel mezzo.

Al di là degli elementi visivi, il paragrafo più interessante è quello sulle chiamate agli strumenti. Google afferma che Live Avatar è supportato da una "chiamata asincrona agli strumenti" che può "attivare chiamate agli strumenti e recuperare dati in background mentre continua il dialogo attivo, gestendo attività complesse e garantendo un flusso conversazionale ininterrotto". L'esempio pratico è il check-in di un ospite in hotel, in cui il modello chiama gli strumenti in background e continua a parlare.

Questa è una vera differenza architetturale rispetto alla forma richiesta-risposta su cui sono costruite la maggior parte delle integrazioni vocali, ed è la parte con un costo associato. L'esecuzione asincrona significa che il modello sta svolgendo un lavoro che la trascrizione non mostra. In una pipeline testuale vedresti la chiamata allo strumento come un turno. Qui avviene sotto una conversazione ancora in corso, il che solleva le stesse domande che qualsiasi esecuzione concorrente solleva: cosa succede se la chiamata allo strumento fallisce silenziosamente a metà frase, e come fa il chiamante a saperlo? Il post di Goog​le non lo dice, e la model card è il posto dove cercarlo. Considera l'affermazione di "flusso conversazionale ininterrotto" come dichiarata dal fornitore e non testata da alcuna terza parte che possiamo trovare.

Avatar preimpostati, e l'allowlist che limita la metà limitante.

La storia della personalizzazione ha due livelli e solo uno di essi è generalmente disponibile. Ogni distribuzione enterprise riceve "una libreria di avatar diversi e predefiniti". Gli avatar personalizzati — generati "da un'immagine di riferimento di alta qualità" preservando "la somiglianza con il riferimento, lo stile del brand o l'identità del personaggio" — sono soggetti a un accesso controllato, e Google lo dichiara chiaramente: "La creazione di avatar personalizzati è attualmente disponibile solo tramite allowlisting aziendale."

Quindi la funzionalità che la maggior parte dei team vorrà davvero, quella che consente a un avatar di corrispondere a un brand o a un personaggio con un nome, è quella che non puoi gestire in autonomia. Se il tuo piano dipende da un presentatore sintetico che assomiglia alla tua mascotte, stai aspettando una decisione di allowlist e non il rilascio di un modello. Questo è un fatto di procurement, non tecnico, ed è il genere di cosa che fa silenziosamente slittare un trimestre.

A screenshot of the Google DeepMind blog post 'Introducing Gemini 3.8 Live with Live Avatar', captured in English on 25 September 2026, showing the 24 September 2026 date, the authors listed as Shuo-yiin Chang and CJ Zheng on behalf of the Gemini Audio Team, the lede 'Building on the momentum of last week's Gemini 3.8 Live launch', the sentence 'Starting today, Gemini 3.8 Live with Live Avatar is available in Gemini Enterprise', and the section heading 'More natural and multimodal conversations'.

Dove si colloca rispetto al resto della riga

Live Avatar non è arrivato in una famiglia di prodotti vuota, e la posizione che occupa è più facile da vedere confrontandola con i fratelli lanciati nella stessa quindicina.

• Disponibile come — Gemini 3.8 Live with Live Avatar è una funzionalità enterprise all'interno di Gemini Enterprise vs Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking sono endpoint dell'API Gemini con ID modello e tariffe al minuto pubblicate
• Richiamabile dagli sviluppatori — Live Avatar no, nessun ID modello e nessuna voce nel listino prezzi vs i due endpoint Live sì, gemini-3.8-live e gemini-3.8-live-extended-thinking
• Output — Live Avatar audio più video sincronizzato vs gli endpoint Live solo audio
• Lingue dichiarate — Live Avatar 97 lingue con lip-sync e continuità delle espressioni vs gli endpoint Live 97 lingue con passaggio automatico a metà conversazione
• Filigrana — Live Avatar SynthID sia sulla traccia audio che su quella video vs gli endpoint Live SynthID sull'audio generato

I due endpoint Live stessi sono la coppia ben documentata. Le misurazioni indipendenti li collocano molto distanti su alcuni assi e vicini su altri: sull'Artificial Analysis Speech to Speech Index, Gemini 3.8 Live Extended Thinking (High) si attesta a 82,6 contro il 76,0 di Gemini 3.8 Live, un divario costruito soprattutto sulla qualità del ragionamento più che sulle dinamiche conversazionali, dove l'ordine si inverte. Le cifre di Goog​le stessa li danno al 68,6% e al 30,1% sul completamento delle attività di τ-Voice e al 98% e al 92% su Big Bench Audio. Live Avatar eredita quello dei due che si chiama sotto di esso, e ne eredita anche il prezzo, perché l'avatar è uno strato di presentazione sopra lo stesso ciclo conversazionale.

A screenshot of the Artificial Analysis Speech to Speech leaderboard, captured in English on 25 September 2026, showing the AA Speech to Speech Index speed and cost-per-hour-of-input-audio panel. The top index values read 82.6, 81.5, 81.3, 80.1, 76.0, 73.9 and 71.5, with a cost axis running to roughly $10.75 per hour. The bar labels are set vertically and are not legible at capture size.

Ciò che questo non cambia

Non rende migliori i modelli. Live Avatar è un livello di presentazione e orchestrazione: i valori di qualità di Gemini 3.8 Live sono quelli che erano il 15 settembre, e chiunque abbia bisogno della variante più potente delle due deve comunque scegliere Extended Thinking e accettarne la latenza. Non inserisce il video nell'API. E non cambia il prezzo per parlare con il modello, che viene ancora fatturato secondo le tariffe audio al minuto della Live API — 0,005 $ al minuto per l'audio in ingresso e 0,018 $ al minuto per l'audio in uscita — con la generazione video dell'avatar senza un prezzo pubblico perché non viene venduta separatamente.

Ciò che cambia è l'insieme dei prodotti che possono essere realizzati senza un livello di rendering separato. Un agente di supporto che prima parlava e lasciava un pannello vuoto sullo schermo ora può mostrare un volto mentre lavora, e il lavoro che svolge in background non è più visibile come un vuoto. Questo è un cambiamento significativo nella forma di un'interfaccia e un cambiamento modesto nel modello sottostante. Entrambe le cose possono essere vere allo stesso tempo.

A generated summary card for Gemini 3.8 Live with Live Avatar on a white background with soft blue-and-cyan gradient accents. Four rows read 'Announced: 24 September 2026', 'Underlying models: gemini-3.8-live and gemini-3.8-live-extended-thinking, unchanged', 'Availability: Gemini Enterprise; custom avatars by enterprise allowlist', and 'Watermark: SynthID on audio and video'. A footer line reads 'Per Google DeepMind, 24 September 2026; vendor-reported and not independently benchmarked.' The OrcaRouter logo is composited in the bottom-right corner.

Cosa tenere d'occhio, e una nota sul routing

Tre cose farebbero passare questo da un annuncio a una decisione di sviluppo. L'allowlisting degli avatar personalizzati dovrebbe aprirsi, perché gli avatar preimpostati sono una demo e gli avatar personalizzati sono un prodotto. La traccia video dovrebbe avere un prezzo, perché nessuno può modellare l'economia unitaria su un output senza prezzo. E un endpoint avatar dovrebbe comparire nell'elenco dei modelli dell'API, perché è la differenza tra una funzionalità enterprise e qualcosa che uno sviluppatore può chiamare stasera.

Da parte nostra, una cosa vale la pena dichiararla con precisione, perché è facile supporre il contrario: OrcaRouter non instrada gli endpoint Gemini 3.8 Live né Live Avatar, e nulla di quanto segue va inteso come un'affermazione in tal senso. Ciò che offriamo è il resto della linea 3.8 di Goog​le — google/gemini-3.8-flash tra gli altri — insieme a un catalogo di oltre 200 modelli con una singola chiave al prezzo di listino del provider, senza ricarichi. Se Live Avatar orienta la vostra architettura verso un agente che deve ragionare su ciò che ha detto il cliente, la metà di quel stack dedicata al ragionamento è quella che potete consolidare già oggi.