Сгенерированная hero-карточка для «Gemini 3.8 Live with Live Avatar» на белом фоне с мягкими сине-голубыми градиентными акцентами. На трёх расположенных друг над другом карточках написано: «15 сентября 2026 — Gemini 3.8 Live и 3.8 Live Extended Thinking выпускаются в Live API», «24 сентября 2026 — анонсирован Live Avatar, Gemini Enterprise» и «Сегодня — аватар — это корпоративная возможность, а не идентификатор модели». В нижнем колонтитуле указано: «Даты согласно Google DeepMind». Логотип OrcaRouter скомпонован в правом нижнем углу.
Guides & Insights

Gemini 3.8 Live с Live Avatar: Google даёт своей голосовой модели лицо

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking вышли 15 сентября 2026 года — два нативных эндпоинта живого диалога, которые Google открыла в API вендора: один оптимизирован для низкой задержки, другой — для обдумывания. 24 сентября компания анонсировала Gemini 3.8 Live с Live Avatar, который сочетает генерацию видео почти в реальном времени с тем же речевым циклом, чтобы у модели было лицо, пока она говорит. Ничего в двух идентификаторах моделей не изменилось. Изменилось то, как теперь может выглядеть разговор, и — что важнее — то, что модель может делать с разговором, пока он ещё идёт.

Что на самом деле вышло 24 сентября

Пост DeepMind короткий и конкретный, и стоит отделить то, что в нём утверждается, от того, что это означает. Live Avatar, по словам самой Google, «придаёт разговорному ИИ Gemini почти реальное визуальное присутствие», сочетая генерацию видео в реальном времени с существующим речевым стеком. Компания описывает точную синхронизацию губ, естественные выражения лица и плавное переключение реплик и приводит два примера развёртывания: обслуживание клиентов и интерактивные пошаговые демонстрации. Затем идёт предложение, которое важнее всего для всех, кто планирует разработку, — «Начиная с сегодняшнего дня Gemini 3.8 Live с Live Avatar доступен в Gemini Enterprise».

Вот и вся история с доступностью. Live Avatar — это не идентификатор модели в Gemini API. Список аудиомоделей API по-прежнему содержит gemini-3.8-live и gemini-3.8-live-extended-thinking, и ни одной строки с аватаром, а в тарифной карте нет отдельной строки для аватара. Эта функция появляется внутри Gemini Enterprise, а значит, аудитория этого анонса — корпоративные покупатели и разработчики, которые интегрируют решения в их интересах, а не отдельный разработчик, который сегодня вызывает Live API с ключом.

Два утверждения из этого поста стоит процитировать точно, потому что оба звучат сильнее, чем обычные формулировки при запуске. Первое: Live Avatar «поддерживает нативную многоязычную синхронизацию речи в речь» и «может бесшовно переключаться между 97 языками, не ухудшая качество видео и не вызывая визуального дрейфа». Число 97 — это то же количество языков, которое 15 сентября при запуске заявлялось для лежащих в основе моделей живого диалога, так что это уже существующее утверждение о многоязычности, пересказанное с новым ограничением: синхронизация губ и лицевая анимация должны успевать за сменой языка посреди предложения. Второе: весь вывод помечается водяным знаком SynthID, «встроенным непосредственно в аудио- и видеовыход». Обе дорожки, а не только голос.

По-настоящему новая возможность — это та, что в середине.

Если отвлечься от визуальной части, самый интересный абзац — тот, что о вызовах инструментов. Google говорит, что в основе Live Avatar лежит «асинхронный вызов инструментов», который может «запускать вызовы инструментов и получать данные в фоновом режиме, продолжая активный диалог, обрабатывая сложные задачи и обеспечивая непрерывный поток беседы». Разобранный пример — регистрация гостя в отеле, где модель вызывает инструменты в фоновом режиме и продолжает говорить.

Это настоящее архитектурное отличие от схемы «запрос — ответ», вокруг которой построено большинство голосовых интеграций, и именно с этой частью связаны затраты. Асинхронное выполнение означает, что модель выполняет работу, не отражённую в транскрипте. В текстовом конвейере вызов инструмента был бы виден как отдельный ход. Здесь же он происходит внутри разговора, который всё ещё продолжается, а это порождает те же вопросы, что и любое параллельное выполнение: что произойдёт, если вызов инструмента молча завершится ошибкой посреди фразы, и как об этом узнает вызывающая сторона? В публикации Google об этом не говорится, и искать это следует в карточке модели. Считайте, что утверждение о «непрерывном потоке разговора» исходит от вендора и не проверено ни одной третьей стороной из тех, что нам удалось найти.

Предустановленные аватары и список разрешённых, который ограничивает интересную половину

История с кастомизацией делится на два уровня, и общедоступен только один из них. Каждое корпоративное развёртывание получает «библиотеку разнообразных предустановленных аватаров». Пользовательские аватары — создаваемые «из высококачественного референсного изображения» с «сохранением сходства с референсом, фирменного стиля или идентичности персонажа» — находятся за закрытыми дверями, и Google прямо заявляет об этом: «Создание пользовательских аватаров в настоящее время доступно только через корпоративный allowlisting».

Итак, возможность, которая действительно нужна большинству команд, — та, что позволяет аватару соответствовать бренду или конкретному персонажу, — это как раз то, что нельзя подключить самостоятельно. Если ваш план зависит от синтетического ведущего, который выглядит как ваш маскот, вы ждёте решения о включении в список разрешённых, а не выпуска модели. Это факт из области закупок, а не техническая деталь, и именно такие вещи незаметно сдвигают сроки на квартал.

A screenshot of the Google DeepMind blog post 'Introducing Gemini 3.8 Live with Live Avatar', captured in English on 25 September 2026, showing the 24 September 2026 date, the authors listed as Shuo-yiin Chang and CJ Zheng on behalf of the Gemini Audio Team, the lede 'Building on the momentum of last week's Gemini 3.8 Live launch', the sentence 'Starting today, Gemini 3.8 Live with Live Avatar is available in Gemini Enterprise', and the section heading 'More natural and multimodal conversations'.

Где он располагается относительно остальной части строки

Live Avatar появился не в пустом продуктовом семействе, и занимаемое им положение проще всего увидеть на фоне собратьев, вышедших в те же две недели.

• Формат поставки — Gemini 3.8 Live с Live Avatar — это корпоративная возможность внутри Gemini Enterprise, тогда как Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking — это конечные точки Gemini API с идентификаторами моделей и опубликованными поминутными тарифами
• Доступность для разработчиков — Live Avatar: нет, ни идентификатора модели, ни строки в тарифной сетке, тогда как две конечные точки Live: да, gemini-3.8-live и gemini-3.8-live-extended-thinking
• Вывод — Live Avatar: аудио плюс синхронизированное видео, тогда как конечные точки Live: только аудио
• Заявленные языки — Live Avatar: 97 языков с синхронизацией губ и непрерывностью выражений, тогда как конечные точки Live: 97 языков с автоматическим переключением в середине разговора
• Водяной знак — Live Avatar: SynthID как на аудиодорожке, так и на видеодорожке, тогда как конечные точки Live: SynthID на сгенерированном аудио

Сами два эндпоинта Live — это хорошо задокументированная пара. Независимые измерения показывают, что по одним осям они сильно расходятся, а по другим близки: в Artificial Analysis Speech to Speech Index у Gemini 3.8 Live Extended Thinking (High) — 82,6 против 76,0 у Gemini 3.8 Live, причём разрыв в основном связан с качеством рассуждений, а не с динамикой разговора, где порядок меняется на обратный. Собственные данные Goog​le дают им 68,6% и 30,1% по выполнению задач τ-Voice и 98% и 92% по Big Bench Audio. Live Avatar наследует тот из них, который вы вызываете под ним, а также наследует их цены, потому что аватар — это слой представления поверх того же цикла разговора.

A screenshot of the Artificial Analysis Speech to Speech leaderboard, captured in English on 25 September 2026, showing the AA Speech to Speech Index speed and cost-per-hour-of-input-audio panel. The top index values read 82.6, 81.5, 81.3, 80.1, 76.0, 73.9 and 71.5, with a cost axis running to roughly $10.75 per hour. The bar labels are set vertically and are not legible at capture size.

Что это не меняет

Это не делает модели лучше. Live Avatar — это слой представления и оркестрации: показатели качества для Gemini 3.8 Live остаются теми же, что были 15 сентября, и всем, кому нужен более сильный из двух вариантов, по-прежнему приходится выбирать Extended Thinking и мириться с его задержкой. Это не добавляет видео в API. И это не меняет цену общения с моделью, которая по-прежнему тарифицируется по поминутным тарифам Live API на аудио — $0.005 за минуту входящего аудио и $0.018 за минуту исходящего аудио, — при этом генерация видео аватара не имеет публично объявленной цены, поскольку она не продаётся отдельно.

Что оно действительно меняет — так это набор продуктов, которые можно создавать без отдельного слоя рендеринга. Агент поддержки, который раньше говорил и оставлял на экране пустую панель, теперь может удерживать лицо, пока работает, и работа, которую он выполняет в фоне, больше не выглядит как мёртвая пауза. Это значимое изменение для формы интерфейса и скромное изменение для лежащей в основе модели. И то и другое может быть верно одновременно.

A generated summary card for Gemini 3.8 Live with Live Avatar on a white background with soft blue-and-cyan gradient accents. Four rows read 'Announced: 24 September 2026', 'Underlying models: gemini-3.8-live and gemini-3.8-live-extended-thinking, unchanged', 'Availability: Gemini Enterprise; custom avatars by enterprise allowlist', and 'Watermark: SynthID on audio and video'. A footer line reads 'Per Google DeepMind, 24 September 2026; vendor-reported and not independently benchmarked.' The OrcaRouter logo is composited in the bottom-right corner.

Что посмотреть, и одно примечание по маршрутизации

Три вещи перевели бы это из анонса в решение о разработке. Возможность добавлять пользовательские аватары в белый список должна была бы стать общедоступной, потому что предустановленные аватары — это демо, а пользовательские аватары — это продукт. Видеодорожка должна была бы получить цену, потому что никто не может построить юнит-экономику на результате без цены. И эндпоинт аватара должен был бы появиться в списке моделей API, потому что в этом разница между корпоративной функцией и тем, что разработчик может вызвать уже сегодня вечером.

С нашей стороны стоит точно оговорить одну вещь, поскольку легко предположить обратное: OrcaRouter не маршрутизирует эндпоинты Gemini 3.8 Live и Live Avatar, и ничто здесь не должно восприниматься как утверждение, будто он это делает. Что мы действительно предоставляем — так это остальную часть линейки 3.8 от Goog​le, google/gemini-3.8-flash в том числе, — а также каталог из более чем 200 моделей с одного ключа по цене провайдера без наценки. Если из-за Live Avatar ваша архитектура движется к агенту, которому приходится рассуждать о том, что сказал клиент, то именно эту половину стека — половину рассуждений — вы и можете консолидировать уже сегодня.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube