Ett genererat hero-kort för ”Gemini 3.8 Live med Live Avatar” på en vit bakgrund med mjuka gradientaccenter i blått och cyan. Tre staplade kort visar ”15 sept. 2026 — Gemini 3.8 Live och 3.8 Live Extended Thinking släpps på Live API”, ”24 sept. 2026 — Live Avatar annonseras, Gemini Enterprise” och ”I dag — avatar är en företagsfunktion, inte ett modell-ID”. En sidfotsrad lyder ”Datum enligt Google DeepMind.” OrcaRouter-logotypen är komponerad i det nedre högra hörnet.
Guides & Insights

Gemini 3.8 Live med Live Avatar: Google ger sin röstmodell ett ansikte

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Gemini 3.8 Live och Gemini 3.8 Live Extended Thinking lanserades den 15 september 2026 – de två nativa live-dialogslutpunkterna som Goog​le öppnade i leverantörens API, en optimerad för latens och en för eftertänksamhet. Den 24 september tillkännagav företaget Gemini 3.8 Live with Live Avatar, som kombinerar videogenerering i nästan realtid med samma talslinga så att modellen har ett ansikte medan den talar. Inget med de två modell-ID:na förändrades. Det som förändrades är hur samtalet får se ut, och – med större konsekvenser – vad modellen får göra med samtalet medan det fortfarande pågår.

Vad som faktiskt levererades den 24 september

DeepMind-inlägget är kort och specifikt, och det är värt att skilja på vad det hävdar och vad det innebär. Live Avatar ger, med Googles egna ord, ”Geminis konversations-AI en nästan realtidsmässig visuell närvaro” genom att kombinera realtidsvideogenerering med den befintliga talstacken. Företaget beskriver exakt läppsynk, naturliga uttryck och flytande turtagning, och ger två exempel på driftsättning: kundservice och interaktiva genomgångar. Sedan kommer meningen som spelar störst roll för alla som planerar att bygga något – ”Från och med idag är Gemini 3.8 Live with Live Avatar tillgängligt i Gemini Enterprise.”

Det är hela tillgänglighetshistorien. Live Avatar är inte ett Gemini API-modell-ID. API:ets ljudmodelllista innehåller fortfarande gemini-3.8-live och gemini-3.8-live-extended-thinking och ingen avatar-rad, och prislistan har ingen avatar-radpost. Funktionen finns i Gemini Enterprise, vilket innebär att målgruppen för tillkännagivandet är företagsköpare och utvecklarna som integrerar på deras vägnar, inte den enskilda utvecklaren som anropar Live API med en nyckel i dag.

Två av inläggets påståenden förtjänar att citeras exakt, eftersom båda är starkare än det vanliga lanseringsspråket. Det första: Live Avatar "har inbyggd flerspråkig tal-till-tal-synkronisering" och "kan sömlöst växla mellan 97 språk utan att försämra videokvaliteten eller införa visuell drift." Siffran 97 är samma antal språk som lanseringen den 15 september angav för de underliggande modellerna för live-dialog, så detta är det befintliga flerspråkiga påståendet omformulerat med ett nytt villkor kopplat till sig – läppsynken och ansiktsanimeringen måste hänga med när språket ändras mitt i en mening. Det andra: all utdata vattenmärks med SynthID, "invävt direkt i ljud- och videoutdata." Båda spåren, inte bara rösten.

Den genuint nya förmågan är den i mitten

Bortse från det visuella, och det mest intressanta stycket är det om verktygsanrop. Google säger att Live Avatar backas upp av "asynkrona verktygsanrop" som kan "utlösa verktygsanrop och hämta data i bakgrunden medan dialogen fortsätter aktivt, hantera komplexa uppgifter samtidigt som ett oavbrutet samtalsflöde säkerställs." Det genomarbetade exemplet är en hotellgästincheckning där modellen anropar verktyg i bakgrunden och fortsätter prata.

Det är en verklig arkitektonisk skillnad från den request-response-form som de flesta röstintegrationer är byggda kring, och det är den del som har en kostnad kopplad till sig. Asynkron exekvering innebär att modellen utför arbete som transkriptionen inte visar. I en textpipeline skulle du se verktygsanropet som en tur. Här sker det under en konversation som fortfarande pågår, vilket väcker samma frågor som all samtidig exekvering väcker: vad händer om verktygsanropet misslyckas tyst mitt i en mening, och hur ska anroparen få veta? Googles inlägg säger inget om det, och modellkortet är platsen att leta efter det. Betrakta påståendet om "oavbrutet samtalsflöde" som uppgivet av leverantören och otestat av någon tredje part som vi kan hitta.

Förinställda avatarer, och tillåtlistan som begränsar den intressanta halvan

Anpassningsmöjligheterna har två nivåer och endast en av dem är allmänt tillgänglig. Varje företagsdriftsättning får "ett bibliotek med olika förinställda avatarer." Anpassade avatarer – genererade "från en högkvalitativ referensbild" samtidigt som de "bevarar referensens likhet, varumärkesstil eller karaktärens identitet" – ligger bakom en spärr, och Google säger det rakt ut: "Skapande av anpassade avatarer är för närvarande endast tillgängligt via allowlisting för företag."

Så den funktion som de flesta team faktiskt vill ha, den som låter en avatar matcha ett varumärke eller en namngiven karaktär, är den du inte kan sköta på egen hand. Om din plan bygger på en syntetisk presentatör som ser ut som din maskot, väntar du på ett beslut om en tillåtelselista och inte på en modelllansering. Det är ett upphandlingsfaktum, inte ett tekniskt sådant, och det är den typen av sak som tyst skjuter upp ett kvartal.

A screenshot of the Google DeepMind blog post 'Introducing Gemini 3.8 Live with Live Avatar', captured in English on 25 September 2026, showing the 24 September 2026 date, the authors listed as Shuo-yiin Chang and CJ Zheng on behalf of the Gemini Audio Team, the lede 'Building on the momentum of last week's Gemini 3.8 Live launch', the sentence 'Starting today, Gemini 3.8 Live with Live Avatar is available in Gemini Enterprise', and the section heading 'More natural and multimodal conversations'.

Var den sitter i förhållande till resten av raden

Live Avatar kom inte in i en tom produktfamilj, och den position som den intar är enklast att se i förhållande till de syskonprodukter som släpptes under samma tvåveckorsperiod.

• Levereras som — Gemini 3.8 Live med Live Avatar är en företagsfunktion i Gemini Enterprise, medan Gemini 3.8 Live och Gemini 3.8 Live Extended Thinking är Gemini API-slutpunkter med modell-ID:n och publicerade minutpriser
• Kan anropas av utvecklare — Live Avatar: nej, inget modell-ID och ingen rad i prislistan, medan de två Live-slutpunkterna: ja, gemini-3.8-live och gemini-3.8-live-extended-thinking
• Utdata — Live Avatar: ljud plus synkroniserad video, medan Live-slutpunkterna: endast ljud
• Språkpåstående — Live Avatar: 97 språk med läppsynk och uttryckskontinuitet, medan Live-slutpunkterna: 97 språk med automatisk växling mitt i samtalet
• Vattenstämpel — Live Avatar: SynthID på både ljud- och videospåret, medan Live-slutpunkterna: SynthID på genererat ljud

De två Live-slutpunkterna är i sig det väldokumenterade paret. Oberoende mätningar placerar dem långt ifrån varandra på vissa axlar och nära varandra på andra: på Artificial Analysis Speech to Speech Index ligger Gemini 3.8 Live Extended Thinking (High) på 82,6 mot Gemini 3.8 Live på 76,0, en klyfta som mest bygger på resonemangskvalitet snarare än samtalsdynamik, där ordningen växlar. Googles egna siffror har dem på 68,6 % och 30,1 % för slutförande av τ-Voice-uppgifter och 98 % och 92 % på Big Bench Audio. Live Avatar ärver vilken av dessa du än anropar under den, och ärver även deras prissättning, eftersom avataren är ett presentationslager ovanpå samma samtalsloop.

A screenshot of the Artificial Analysis Speech to Speech leaderboard, captured in English on 25 September 2026, showing the AA Speech to Speech Index speed and cost-per-hour-of-input-audio panel. The top index values read 82.6, 81.5, 81.3, 80.1, 76.0, 73.9 and 71.5, with a cost axis running to roughly $10.75 per hour. The bar labels are set vertically and are not legible at capture size.

Vad detta inte förändrar

Det gör inte modellerna bättre. Live Avatar är ett presentations- och orkestreringslager: kvalitetssiffrorna för Gemini 3.8 Live är desamma som den 15 september, och den som behöver den starkare av de två varianterna måste fortfarande välja Extended Thinking och acceptera dess latens. Det lägger inte in video i API:et. Och det ändrar inte priset för att tala med modellen, som fortfarande faktureras enligt Live API:ets ljudpriser per minut – 0,005 USD per minut för ljud in och 0,018 USD per minut för ljud ut – medan avatarens videogenerering inte har något offentligt pris eftersom den inte säljs separat.

Det den däremot förändrar är uppsättningen produkter som kan byggas utan ett separat renderingslager. En supportagent som tidigare talade och lämnade en tom panel på skärmen kan nu visa ett ansikte medan den arbetar, och arbetet den utför i bakgrunden syns inte längre som dödtid. Det är en betydelsefull förändring av ett gränssnitts form och en blygsam förändring av den underliggande modellen. Båda dessa kan vara sanna samtidigt.

A generated summary card for Gemini 3.8 Live with Live Avatar on a white background with soft blue-and-cyan gradient accents. Four rows read 'Announced: 24 September 2026', 'Underlying models: gemini-3.8-live and gemini-3.8-live-extended-thinking, unchanged', 'Availability: Gemini Enterprise; custom avatars by enterprise allowlist', and 'Watermark: SynthID on audio and video'. A footer line reads 'Per Google DeepMind, 24 September 2026; vendor-reported and not independently benchmarked.' The OrcaRouter logo is composited in the bottom-right corner.

Vad du bör hålla utkik efter, och en notering om routing

Tre saker skulle flytta detta från ett tillkännagivande till ett byggbeslut. Tillåtelselistning av anpassade avatarer skulle behöva öppnas upp, eftersom förinställda avatarer är en demo och anpassade avatarer är en produkt. Videospåret skulle behöva få ett pris, eftersom ingen kan modellera enhetsekonomi på en oprissatt utdata. Och en avatar-endpoint skulle behöva dyka upp i API:ets modellista, eftersom det är skillnaden mellan en företagsfunktion och något en utvecklare kan anropa i kväll.

På vår egen sida är en sak värd att uttrycka exakt, eftersom det är lätt att anta motsatsen: OrcaRouter dirigerar inte Gemini 3.8 Live-slutpunkterna eller Live Avatar, och inget här bör läsas som ett påstående att den gör det. Det vi däremot tillhandahåller är resten av Googles 3.8-serie — google/gemini-3.8-flash bland dem — tillsammans med en katalog med fler än 200 modeller från en enda nyckel till leverantörens listpris utan påslag. Om Live Avatar skickar din arkitektur mot en agent som måste resonera kring vad kunden sade, är den resonerande halvan av den stacken den halva du kan konsolidera idag.