
Gemini 3.8 Live z Live Avatar: Google nadaje twarz swojemu modelowi głosowemu
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 36 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 181 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking zadebiutowały 15 września 2026 — dwa natywne endpointy dialogu na żywo, które Google udostępnił w API dostawcy: jeden zoptymalizowany pod kątem opóźnień, a drugi pod kątem namysłu. 24 września firma ogłosiła Gemini 3.8 Live with Live Avatar, który łączy generowanie wideo niemal w czasie rzeczywistym z tą samą pętlą mowy, dzięki czemu model ma twarz, gdy mówi. Nic nie zmieniło się w identyfikatorach tych dwóch modeli. Zmieniło się to, jak rozmowa może wyglądać, oraz — co ma większe konsekwencje — co model może robić z rozmową, gdy ta wciąż trwa.
Co tak naprawdę zostało wydane 24 września?
Post DeepMind jest krótki i konkretny, a warto oddzielić to, co twierdzi, od tego, co oznacza. Live Avatar, jak ujmuje to sam Google, „wnosi niemal rzeczywistą obecność wizualną do konwersacyjnej AI Gemini”, łącząc generowanie wideo w czasie rzeczywistym z istniejącym stosem mowy. Firma opisuje precyzyjne dopasowanie ruchu warg, naturalne wyrazy twarzy i płynne przechodzenie między wypowiedziami, a także podaje dwa przykłady wdrożeń: obsługę klienta i interaktywne przewodniki. Potem pojawia się zdanie, które ma największe znaczenie dla każdego, kto planuje budowę — „Od dzisiaj Gemini 3.8 Live z Live Avatar jest dostępny w Gemini Enterprise”.
To cała historia dostępności. Live Avatar nie jest identyfikatorem modelu Gemini API. Lista modeli audio API nadal zawiera gemini-3.8-live i gemini-3.8-live-extended-thinking i brak wiersza dla avatara, a cennik nie zawiera pozycji dla avatara. Funkcja trafia do Gemini Enterprise, co oznacza, że odbiorcami ogłoszenia są nabywcy korporacyjni i deweloperzy, którzy integrują ją w ich imieniu, a nie pojedynczy deweloper wywołujący dziś Live API za pomocą klucza.
Dwa twierdzenia z tego posta warto przytoczyć dokładnie, ponieważ oba są mocniejsze niż typowy język premierowy. Po pierwsze: Live Avatar „oferuje natywną wielojęzyczną synchronizację mowy na mowę” i „może płynnie przechodzić między 97 językami bez pogarszania wierności wideo lub wprowadzania dryfu wizualnego”. Liczba 97 to ta sama liczba języków, którą przy premierze 15 września ogłoszono dla bazowych modeli dialogu na żywo, więc jest to istniejące twierdzenie o wielojęzyczności powtórzone z nowym ograniczeniem — synchronizacja ruchu warg i animacja twarzy muszą nadążać, gdy język zmienia się w połowie zdania. Po drugie: wszystkie dane wyjściowe są oznaczone znakiem wodnym SynthID, „wplecionym bezpośrednio w wyjściowy dźwięk i obraz”. Oba strumienie, nie tylko głos.
Naprawdę nową możliwością jest ta pośrodku.
Pomijając warstwę wizualną, najciekawszy akapit dotyczy wywołań narzędzi. Google twierdzi, że Live Avatar opiera się na „asynchronicznym wywoływaniu narzędzi”, które potrafi „inicjować wywołania narzędzi i pobierać dane w tle, kontynuując aktywny dialog, obsługując złożone zadania i zapewniając nieprzerwany tok rozmowy”. Przykładem praktycznym jest zameldowanie gościa w hotelu, podczas którego model wywołuje narzędzia w tle i mówi dalej.
To rzeczywista różnica architektoniczna względem modelu żądanie-odpowiedź, wokół którego zbudowana jest większość integracji głosowych, i to właśnie ta część wiąże się z kosztem. Wykonywanie asynchroniczne oznacza, że model wykonuje pracę, której transkrypcja nie pokazuje. W potoku tekstowym zobaczyłbyś wywołanie narzędzia jako turę. Tutaj dzieje się to pod rozmową, która wciąż trwa, co rodzi te same pytania, jakie rodzi każde współbieżne wykonanie: co się stanie, jeśli wywołanie narzędzia zawiedzie po cichu w połowie zdania, i jak dowie się o tym dzwoniący? Post Google'a tego nie mówi, a karta modelu jest miejscem, gdzie należy tego szukać. Traktuj twierdzenie o „nieprzerwanym przepływie rozmowy” jako zgłoszone przez dostawcę i nietestowane przez żadną stronę trzecią, którą udało nam się znaleźć.
Gotowe awatary i lista dozwolonych, która ogranicza tę ciekawszą połowę
Personalizacja ma dwa poziomy i tylko jeden z nich jest ogólnie dostępny. Każde wdrożenie korporacyjne otrzymuje „bibliotekę różnorodnych, gotowych awatarów”. Niestandardowe awatary — generowane „na podstawie wysokiej jakości obrazu referencyjnego” przy jednoczesnym „zachowaniu podobieństwa do referencji, stylu marki lub tożsamości postaci” — są za dodatkową barierą, a Google mówi to wprost: „Tworzenie niestandardowych awatarów jest obecnie dostępne wyłącznie w ramach korporacyjnego allowlistingu”.
Więc zdolność, której większość zespołów naprawdę będzie chciała — ta, która pozwala awatarowi dopasować się do marki lub nazwanej postaci — jest tą, której nie można uzyskać samoobsługowo. Jeśli Twój plan zależy od syntetycznego prezentera, który wygląda jak wasza maskotka, czekasz na decyzję o umieszczeniu na liście dozwolonych, a nie na wydanie modelu. To fakt zakupowy, a nie techniczny, i to właśnie tego typu rzecz po cichu przesuwa się o kwartał.

Gdzie znajduje się względem reszty wiersza
Live Avatar nie trafił do pustej rodziny produktów, a zajmowaną przez niego pozycję najłatwiej dostrzec na tle siostrzanych produktów, które zadebiutowały w tym samym dwutygodniowym okresie.
• Dostępność — Gemini 3.8 Live z Live Avatar to funkcja klasy enterprise w ramach Gemini Enterprise, a Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking to punkty końcowe Gemini API z identyfikatorami modeli i publikowanymi stawkami za minutę
• Możliwość wywoływania przez programistów — Live Avatar nie, brak identyfikatora modelu i brak pozycji w cenniku, a dwa punkty końcowe Live tak, gemini-3.8-live i gemini-3.8-live-extended-thinking
• Dane wyjściowe — Live Avatar: dźwięk i zsynchronizowany obraz, a punkty końcowe Live: tylko dźwięk
• Deklaracja językowa — Live Avatar: 97 języków z synchronizacją ust i ciągłością ekspresji, a punkty końcowe Live: 97 języków z automatycznym przełączaniem w trakcie rozmowy
• Znak wodny — Live Avatar: SynthID zarówno w ścieżce audio, jak i wideo, a punkty końcowe Live: SynthID w wygenerowanym dźwięku
Te dwa endpointy Live to dobrze udokumentowana para. Niezależne pomiary pokazują, że na niektórych osiach dzieli je duży dystans, a na innych są blisko siebie: w Artificial Analysis Speech to Speech Index Gemini 3.8 Live Extended Thinking (High) osiąga 82,6 w porównaniu z 76,0 dla Gemini 3.8 Live — różnica ta wynika głównie z jakości rozumowania, a nie z dynamiki konwersacyjnej, w której kolejność się odwraca. Własne dane Google podają dla nich 68,6% i 30,1% w ukończeniu zadań τ-Voice oraz 98% i 92% w Big Bench Audio. Live Avatar dziedziczy ten z nich, który wywołasz pod spodem, a także dziedziczy ich cennik, ponieważ awatar jest warstwą prezentacji nad tą samą pętlą konwersacji.

Czego to nie zmienia
To nie sprawia, że modele stają się lepsze. Live Avatar to warstwa prezentacji i orkiestracji: liczby dotyczące jakości dla Gemini 3.8 Live są takie, jakie były 15 września, a każdy, kto potrzebuje silniejszego z dwóch wariantów, nadal musi wybrać Extended Thinking i zaakceptować jego opóźnienie. To nie umieszcza wideo w API. Nie zmienia też ceny rozmowy z modelem, która nadal jest rozliczana według minutowych stawek za dźwięk w Live API — 0,005 USD za minutę dźwięku wejściowego i 0,018 USD za minutę dźwięku wyjściowego — przy czym generowanie wideo awatara nie ma publicznie podanej ceny, ponieważ nie jest sprzedawane osobno.
To, co faktycznie zmienia, to zestaw produktów, które można zbudować bez osobnej warstwy renderowania. Agent wsparcia, który wcześniej mówił i pozostawiał na ekranie pusty panel, może teraz utrzymywać twarz, gdy pracuje, a praca, którą wykonuje w tle, nie jest już widoczna jako martwa cisza. To znacząca zmiana w kształcie interfejsu i niewielka zmiana w modelu leżącym u podstaw. Obie te rzeczy mogą być prawdziwe jednocześnie.

Co obejrzeć i jedna uwaga dotycząca routingu
Trzy rzeczy przeniosłyby to z ogłoszenia do decyzji o budowie. Allowlisting niestandardowych awatarów musiałby zostać otwarty, bo gotowe awatary to demo, a niestandardowe awatary to produkt. Ścieżka wideo musiałaby otrzymać cenę, bo nikt nie jest w stanie modelować ekonomiki jednostkowej na wyniku bez ceny. A endpoint awatara musiałby pojawić się na liście modeli API, bo to właśnie różnica między funkcją enterprise a czymś, co deweloper może wywołać jeszcze dziś wieczorem.
Po naszej stronie jedna rzecz zasługuje na precyzyjne stwierdzenie, ponieważ łatwo założyć inaczej: OrcaRouter nie kieruje ruchem do punktów końcowych Gemini 3.8 Live ani Live Avatar, i nic tutaj nie powinno być odczytywane jako twierdzenie, że tak robi. To, co rzeczywiście oferujemy, to reszta linii 3.8 Google'a — google/gemini-3.8-flash wśród nich — obok katalogu ponad 200 modeli z jednego klucza w cenie katalogowej dostawcy bez narzutu. Jeśli Live Avatar kieruje twoją architekturę w stronę agenta, który musi rozumować o tym, co powiedział klient, połowa tego stosu odpowiedzialna za rozumowanie jest tą połową, którą możesz dziś skonsolidować.
