
Gemini 3.8 Live с Live Avatar: Google даёт своей голосовой модели лицо
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 36 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 181 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking вышли 15 сентября 2026 года — два нативных эндпоинта живого диалога, которые Google открыла в API вендора: один оптимизирован для низкой задержки, другой — для обдумывания. 24 сентября компания анонсировала Gemini 3.8 Live с Live Avatar, который сочетает генерацию видео почти в реальном времени с тем же речевым циклом, чтобы у модели было лицо, пока она говорит. Ничего в двух идентификаторах моделей не изменилось. Изменилось то, как теперь может выглядеть разговор, и — что важнее — то, что модель может делать с разговором, пока он ещё идёт.
Что на самом деле вышло 24 сентября
Пост DeepMind короткий и конкретный, и стоит отделить то, что в нём утверждается, от того, что это означает. Live Avatar, по словам самой Google, «придаёт разговорному ИИ Gemini почти реальное визуальное присутствие», сочетая генерацию видео в реальном времени с существующим речевым стеком. Компания описывает точную синхронизацию губ, естественные выражения лица и плавное переключение реплик и приводит два примера развёртывания: обслуживание клиентов и интерактивные пошаговые демонстрации. Затем идёт предложение, которое важнее всего для всех, кто планирует разработку, — «Начиная с сегодняшнего дня Gemini 3.8 Live с Live Avatar доступен в Gemini Enterprise».
Вот и вся история с доступностью. Live Avatar — это не идентификатор модели в Gemini API. Список аудиомоделей API по-прежнему содержит gemini-3.8-live и gemini-3.8-live-extended-thinking, и ни одной строки с аватаром, а в тарифной карте нет отдельной строки для аватара. Эта функция появляется внутри Gemini Enterprise, а значит, аудитория этого анонса — корпоративные покупатели и разработчики, которые интегрируют решения в их интересах, а не отдельный разработчик, который сегодня вызывает Live API с ключом.
Два утверждения из этого поста стоит процитировать точно, потому что оба звучат сильнее, чем обычные формулировки при запуске. Первое: Live Avatar «поддерживает нативную многоязычную синхронизацию речи в речь» и «может бесшовно переключаться между 97 языками, не ухудшая качество видео и не вызывая визуального дрейфа». Число 97 — это то же количество языков, которое 15 сентября при запуске заявлялось для лежащих в основе моделей живого диалога, так что это уже существующее утверждение о многоязычности, пересказанное с новым ограничением: синхронизация губ и лицевая анимация должны успевать за сменой языка посреди предложения. Второе: весь вывод помечается водяным знаком SynthID, «встроенным непосредственно в аудио- и видеовыход». Обе дорожки, а не только голос.
По-настоящему новая возможность — это та, что в середине.
Если отвлечься от визуальной части, самый интересный абзац — тот, что о вызовах инструментов. Google говорит, что в основе Live Avatar лежит «асинхронный вызов инструментов», который может «запускать вызовы инструментов и получать данные в фоновом режиме, продолжая активный диалог, обрабатывая сложные задачи и обеспечивая непрерывный поток беседы». Разобранный пример — регистрация гостя в отеле, где модель вызывает инструменты в фоновом режиме и продолжает говорить.
Это настоящее архитектурное отличие от схемы «запрос — ответ», вокруг которой построено большинство голосовых интеграций, и именно с этой частью связаны затраты. Асинхронное выполнение означает, что модель выполняет работу, не отражённую в транскрипте. В текстовом конвейере вызов инструмента был бы виден как отдельный ход. Здесь же он происходит внутри разговора, который всё ещё продолжается, а это порождает те же вопросы, что и любое параллельное выполнение: что произойдёт, если вызов инструмента молча завершится ошибкой посреди фразы, и как об этом узнает вызывающая сторона? В публикации Google об этом не говорится, и искать это следует в карточке модели. Считайте, что утверждение о «непрерывном потоке разговора» исходит от вендора и не проверено ни одной третьей стороной из тех, что нам удалось найти.
Предустановленные аватары и список разрешённых, который ограничивает интересную половину
История с кастомизацией делится на два уровня, и общедоступен только один из них. Каждое корпоративное развёртывание получает «библиотеку разнообразных предустановленных аватаров». Пользовательские аватары — создаваемые «из высококачественного референсного изображения» с «сохранением сходства с референсом, фирменного стиля или идентичности персонажа» — находятся за закрытыми дверями, и Google прямо заявляет об этом: «Создание пользовательских аватаров в настоящее время доступно только через корпоративный allowlisting».
Итак, возможность, которая действительно нужна большинству команд, — та, что позволяет аватару соответствовать бренду или конкретному персонажу, — это как раз то, что нельзя подключить самостоятельно. Если ваш план зависит от синтетического ведущего, который выглядит как ваш маскот, вы ждёте решения о включении в список разрешённых, а не выпуска модели. Это факт из области закупок, а не техническая деталь, и именно такие вещи незаметно сдвигают сроки на квартал.

Где он располагается относительно остальной части строки
Live Avatar появился не в пустом продуктовом семействе, и занимаемое им положение проще всего увидеть на фоне собратьев, вышедших в те же две недели.
• Формат поставки — Gemini 3.8 Live с Live Avatar — это корпоративная возможность внутри Gemini Enterprise, тогда как Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking — это конечные точки Gemini API с идентификаторами моделей и опубликованными поминутными тарифами
• Доступность для разработчиков — Live Avatar: нет, ни идентификатора модели, ни строки в тарифной сетке, тогда как две конечные точки Live: да, gemini-3.8-live и gemini-3.8-live-extended-thinking
• Вывод — Live Avatar: аудио плюс синхронизированное видео, тогда как конечные точки Live: только аудио
• Заявленные языки — Live Avatar: 97 языков с синхронизацией губ и непрерывностью выражений, тогда как конечные точки Live: 97 языков с автоматическим переключением в середине разговора
• Водяной знак — Live Avatar: SynthID как на аудиодорожке, так и на видеодорожке, тогда как конечные точки Live: SynthID на сгенерированном аудио
Сами два эндпоинта Live — это хорошо задокументированная пара. Независимые измерения показывают, что по одним осям они сильно расходятся, а по другим близки: в Artificial Analysis Speech to Speech Index у Gemini 3.8 Live Extended Thinking (High) — 82,6 против 76,0 у Gemini 3.8 Live, причём разрыв в основном связан с качеством рассуждений, а не с динамикой разговора, где порядок меняется на обратный. Собственные данные Google дают им 68,6% и 30,1% по выполнению задач τ-Voice и 98% и 92% по Big Bench Audio. Live Avatar наследует тот из них, который вы вызываете под ним, а также наследует их цены, потому что аватар — это слой представления поверх того же цикла разговора.

Что это не меняет
Это не делает модели лучше. Live Avatar — это слой представления и оркестрации: показатели качества для Gemini 3.8 Live остаются теми же, что были 15 сентября, и всем, кому нужен более сильный из двух вариантов, по-прежнему приходится выбирать Extended Thinking и мириться с его задержкой. Это не добавляет видео в API. И это не меняет цену общения с моделью, которая по-прежнему тарифицируется по поминутным тарифам Live API на аудио — $0.005 за минуту входящего аудио и $0.018 за минуту исходящего аудио, — при этом генерация видео аватара не имеет публично объявленной цены, поскольку она не продаётся отдельно.
Что оно действительно меняет — так это набор продуктов, которые можно создавать без отдельного слоя рендеринга. Агент поддержки, который раньше говорил и оставлял на экране пустую панель, теперь может удерживать лицо, пока работает, и работа, которую он выполняет в фоне, больше не выглядит как мёртвая пауза. Это значимое изменение для формы интерфейса и скромное изменение для лежащей в основе модели. И то и другое может быть верно одновременно.

Что посмотреть, и одно примечание по маршрутизации
Три вещи перевели бы это из анонса в решение о разработке. Возможность добавлять пользовательские аватары в белый список должна была бы стать общедоступной, потому что предустановленные аватары — это демо, а пользовательские аватары — это продукт. Видеодорожка должна была бы получить цену, потому что никто не может построить юнит-экономику на результате без цены. И эндпоинт аватара должен был бы появиться в списке моделей API, потому что в этом разница между корпоративной функцией и тем, что разработчик может вызвать уже сегодня вечером.
С нашей стороны стоит точно оговорить одну вещь, поскольку легко предположить обратное: OrcaRouter не маршрутизирует эндпоинты Gemini 3.8 Live и Live Avatar, и ничто здесь не должно восприниматься как утверждение, будто он это делает. Что мы действительно предоставляем — так это остальную часть линейки 3.8 от Google, google/gemini-3.8-flash в том числе, — а также каталог из более чем 200 моделей с одного ключа по цене провайдера без наценки. Если из-за Live Avatar ваша архитектура движется к агенту, которому приходится рассуждать о том, что сказал клиент, то именно эту половину стека — половину рассуждений — вы и можете консолидировать уже сегодня.
