
Gemini 3.8 Live met Live Avatar: Google geeft zijn stemmodel een gezicht
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 36 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 181 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking werden op 15 september 2026 uitgebracht — de twee native endpoints voor live-dialoog die Google op de API van de leverancier opende, één geoptimaliseerd voor latentie en één voor beraad. Op 24 september kondigde het bedrijf Gemini 3.8 Live with Live Avatar aan, dat bijna-realtime videogeneratie combineert met dezelfde spraaklus, zodat het model een gezicht heeft terwijl het praat. Aan de twee model-ID's is niets veranderd. Wat is veranderd, is hoe het gesprek eruit mag zien, en — ingrijpender — wat het model met het gesprek mag doen terwijl het nog gaande is.
Wat er op 24 september daadwerkelijk is uitgebracht
De DeepMind-post is kort en specifiek, en het is de moeite waard om te scheiden wat er wordt geclaimd van wat het betekent. Live Avatar brengt, in de eigen woorden van Google, "bijna realtime visuele aanwezigheid naar Gemini's conversationele AI" door realtime videogeneratie te combineren met de bestaande spraakstack. Het bedrijf beschrijft precieze lipsynchronisatie, natuurlijke expressies en vlotte beurtwisselingen, en geeft twee implementatievoorbeelden: klantenservice en interactieve rondleidingen. Dan volgt de belangrijkste zin voor iedereen die een build plant — "Vanaf vandaag is Gemini 3.8 Live met Live Avatar beschikbaar in Gemini Enterprise."
Dat is het hele beschikbaarheidsverhaal. Live Avatar is geen Gemini API-model-ID. De audiolijst met modellen van de API bevat nog steeds gemini-3.8-live en gemini-3.8-live-extended-thinking en geen avatarrij, en de tariefkaart bevat geen regel voor avatar. De functie komt terecht in Gemini Enterprise, wat betekent dat het publiek voor de aankondiging bestaat uit zakelijke kopers en de ontwikkelaars die namens hen integreren, niet de individuele ontwikkelaar die vandaag met een sleutel de Live API aanroept.
Twee beweringen in het bericht zijn het waard om precies te citeren, want beide zijn stelliger dan de gebruikelijke taal bij een lancering. De eerste: Live Avatar "beschikt over native meertalige spraak-naar-spraak-synchronisatie" en "kan naadloos schakelen tussen 97 talen zonder de videokwaliteit aan te tasten of visuele drift te introduceren." Het getal 97 is hetzelfde aantal talen dat de lancering van 15 september claimde voor de onderliggende live-dialoogmodellen, dus dit is de bestaande meertalige claim die opnieuw wordt geformuleerd met een nieuwe beperking eraan vast — de lip-sync en de gezichtsanimatie moeten bijblijven wanneer de taal midden in een zin verandert. De tweede: alle output is voorzien van een watermerk met SynthID, "direct in de audio- en video-output verweven." Beide sporen, niet alleen de stem.
De werkelijk nieuwe capaciteit is degene in het midden.
Lees voorbij de visuals en de interessantste alinea is die over tool calls. Google zegt dat Live Avatar wordt ondersteund door "asynchrone tool calling" die "tool calls kan activeren en gegevens op de achtergrond kan ophalen terwijl de actieve dialoog doorgaat, complexe taken kan afhandelen en tegelijk een ononderbroken gespreksstroom kan waarborgen." Het uitgewerkte voorbeeld is het inchecken van een hotelgast, waarbij het model op de achtergrond tools aanroept en blijft praten.
Dat is een echt architectonisch verschil met de request-responsvorm waarop de meeste spraakintegraties zijn gebouwd, en het is het onderdeel waaraan een prijskaartje hangt. Asynchrone uitvoering betekent dat het model werk verricht dat het transcript niet laat zien. In een tekstpipeline zou je de toolaanroep als een beurt zien. Hier gebeurt die onder een gesprek dat nog gaande is, wat dezelfde vragen oproept als elke gelijktijdige uitvoering: wat gebeurt er als de toolaanroep midden in een zin stilzwijgend mislukt, en hoe weet de beller dat? Het bericht van Google zegt het niet, en de modelkaart is de plek waar je het moet zoeken. Beschouw de bewering over een "ononderbroken gespreksflow" als door de leverancier gerapporteerd en als niet getest door enige derde partij die wij kunnen vinden.
Vooraf ingestelde avatars, en de allowlist die de interessante helft beperkt
Het verhaal rond aanpassing kent twee niveaus en slechts één daarvan is algemeen beschikbaar. Elke enterprise-implementatie krijgt "een bibliotheek met diverse, vooraf ingestelde avatars." Aangepaste avatars — gegenereerd "op basis van een hoogwaardige referentieafbeelding" terwijl "de gelijkenis met de referentie, de merkstijl of de karakteridentiteit behouden blijft" — bevinden zich achter een poort, en Google zegt het ronduit: "Het maken van aangepaste avatars is momenteel alleen beschikbaar via enterprise-allowlisting."
Dus de mogelijkheid die de meeste teams echt zullen willen, degene waarmee een avatar kan overeenkomen met een merk of een personage met een naam, is degene die je niet zelf kunt gebruiken. Als je plan afhangt van een synthetische presentator die op je mascotte lijkt, wacht je op een allowlist-beslissing en niet op een modelrelease. Dat is een inkoopkwestie, geen technische kwestie, en het is precies het soort ding dat ongemerkt een kwartaal vertraging oplevert.

Waar het ligt ten opzichte van de rest van de regel
Live Avatar kwam niet terecht in een lege productfamilie, en de positie die het inneemt is het gemakkelijkst te zien naast de zustermodellen die in dezelfde twee weken verschenen.
• Wordt geleverd als — Gemini 3.8 Live met Live Avatar is een enterprise-capability binnen Gemini Enterprise, terwijl Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking Gemini API-endpoints zijn met model-ID's en gepubliceerde tarieven per minuut
• Aanroepbaar door ontwikkelaars — Live Avatar nee, geen model-ID en geen regel op de tariefkaart vs de twee Live-endpoints ja, gemini-3.8-live en gemini-3.8-live-extended-thinking
• Uitvoer — Live Avatar audio plus gesynchroniseerde video vs de Live-endpoints alleen audio
• Taalclaim — Live Avatar 97 talen met lip-sync en continue expressie vs de Live-endpoints 97 talen met automatische wisseling midden in het gesprek
• Watermerk — Live Avatar SynthID op zowel de audio- als de videotrack vs de Live-endpoints SynthID op gegenereerde audio
De twee Live-endpoints zelf zijn het goed gedocumenteerde paar. Onafhankelijke metingen plaatsen ze ver uit elkaar op sommige assen en dicht bij elkaar op andere: op de Artificial Analysis Speech to Speech Index staat Gemini 3.8 Live Extended Thinking (High) op 82,6 tegenover Gemini 3.8 Live op 76,0, een verschil dat vooral op redeneerkwaliteit is gebaseerd en niet op gespreksdynamiek, waar de volgorde omslaat. Googles eigen cijfers zetten ze op 68,6% en 30,1% bij τ-Voice-taakvoltooiing en op 98% en 92% bij Big Bench Audio. Live Avatar erft welke van die twee je er ook onder aanroept, en erft ook de prijsstelling daarvan, omdat de avatar een presentatielaag is over dezelfde gesprekslus.

Wat dit niet verandert
Het maakt de modellen niet beter. Live Avatar is een presentatie- en orkestratielaag: de kwaliteitscijfers voor Gemini 3.8 Live zijn nog steeds wat ze op 15 september waren, en wie de sterkere van de twee varianten nodig heeft, moet nog steeds Extended Thinking kiezen en de latentie ervan accepteren. Het voegt geen video toe aan de API. En het verandert niets aan de prijs van het praten met het model, die nog steeds wordt gefactureerd volgens de audiotarieven per minuut van de Live API — $0,005 per minuut audio-in en $0,018 per minuut audio-uit — waarbij de videogeneratie van de avatar niet openbaar geprijsd is omdat deze niet afzonderlijk wordt verkocht.
Wat het wél verandert, is de set producten die kunnen worden gebouwd zonder een aparte renderinglaag. Een supportagent die voorheen sprak en een leeg paneel op het scherm achterliet, kan nu een gezicht tonen terwijl hij werkt, en het werk dat hij op de achtergrond doet, is niet langer zichtbaar als dode lucht. Dat is een betekenisvolle verandering aan de vorm van een interface en een bescheiden verandering aan het onderliggende model. Beide kunnen tegelijk waar zijn.

Wat om in de gaten te houden, en één routeringsopmerking
Drie dingen zouden dit van een aankondiging naar een beslissing om te bouwen tillen. Allowlisting voor aangepaste avatars zou moeten worden opengesteld, want vooraf ingestelde avatars zijn een demo en aangepaste avatars zijn een product. Het videospoor zou een prijs moeten krijgen, want niemand kan unit economics modelleren op basis van een uitvoer zonder prijs. En een avatar-endpoint zou moeten verschijnen in de modellenlijst van de API, want dat is het verschil tussen een enterprisefunctie en iets dat een ontwikkelaar vanavond kan aanroepen.
Van onze kant is één ding het waard om precies te stellen, omdat het gemakkelijk is om het tegenovergestelde aan te nemen: OrcaRouter routeert noch de Gemini 3.8 Live-endpoints noch Live Avatar, en niets hier mag worden gelezen als een bewering dat het dat wel doet. Wat wij wél aanbieden, is de rest van Google's 3.8-lijn — google/gemini-3.8-flash daaronder — naast een catalogus van meer dan 200 modellen via één enkele sleutel tegen de lijstprijs van de provider, zonder opslag. Als Live Avatar je architectuur richting een agent stuurt die moet redeneren over wat de klant zei, dan is de redeneerhelft van die stack de helft die je vandaag kunt consolideren.
