Сгенерированная hero-карточка для «Gemini 3.8 Flash TTS говорит „привет“» на белом фоне с мягкими сине-голубыми градиентными акцентами. Широкая скруглённая карточка содержит значок звуковой волны рядом с надписями «30 студийных голосов», «130 языков» и «за аудиотокен», а вторая карточка справа содержит надпись «Flash-Lite TTS — 101 язык». В нижней строке указано: «Gemini API, 23 сентября 2026 г. Данные поставщика». Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

Gemini 3.8 Flash TTS говорит «привет»: Google разделяет свою линейку синтеза речи на две и снижает цену

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

23 сентября 2026 года вендор выпустил две речевые модели, и анонс написан так, будто главное в нём — качество голоса. Это не так. Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS — первые модели преобразования текста в речь, которые вендор разместил в Gemini Developer API по цене ниже, чем у модели предварительной версии, которую они заменяют, — и для всех, кто до сих пор платил за символ где-то ещё, именно эта часть меняет статью бюджета. Тариф на аудиовыход у Gemini 3.8 Flash TTS составляет $9,00 за миллион токенов до конца 2026 года. Аудио тарифицируется из расчёта 25 токенов в секунду, что даёт примерно 0,02 цента за секунду сгенерированной речи. Модель, которую она заменяет, Gemini 3.1 Flash TTS Preview, стоила $20,00 за миллион аудиотокенов.

Вторая половина истории — теперь моделей две, а не одна. Google разделил линейку: Flash TTS включает полный набор языков и более высокий тариф на аудио, а Flash-Lite TTS — более короткий список языков и более дешёвый тариф. Это иная конфигурация по сравнению со схемой с одной preview-моделью, которая была в API с апреля, и она говорит о том, как Google видит рынок: небольшое число приложений, которым нужны 130 языков и клонирование голоса, и гораздо большее число тех, кому нужен приличный английский голос для бота поддержки и больше ничего.

Что на самом деле вышло 23 сентября?

На момент анонса обе модели общедоступны в Gemini API и в AI Studio — без ограничения списком ожидания. Имена в API — gemini-3.8-flash-tts и gemini-3.8-flash-lite-tts.

• Flash TTS — 130 языков, язык автоматически определяется по тексту, 30 предустановленных студийных голосов, включая Kore и Puck.

• Flash-Lite TTS — 101 язык, тот же интерфейс для разработки голоса, позиционируется как уровень для больших объёмов.

• И то и другое — голосовой дизайн по описанию на естественном языке, построчные указания по подаче, постановка сцены с двумя говорящими и невербальные сигналы, вписанные прямо в сценарий.

• Вывод — WAV 24 кГц, моно, 16-битный знаковый PCM на унарной конечной точке; PCM без заголовка (audio/l16) на потоковой конечной точке; audio/mulaw и audio/alaw также принимаются, с настраиваемой частотой дискретизации.

Тарифную сетку — в расчёте на миллион токенов — стоит изучить целиком, потому что уровни различаются не только главной цифрой:

• Flash TTS Standard — 0,50 $ за ввод текста / 9,00 $ за вывод аудио, с повышением до 1,00 $ / 18,00 $ после 31 декабря 2026 г.

• Flash TTS Batch и Flex — $0.25 / $4.50.

• Flash TTS Priority — $0.90 / $16.20.

• Flash-Lite TTS Standard — $0.50 / $6.00, с повышением до $1.00 / $12.00 после 31 декабря 2026 года.

• Flash-Lite TTS Batch и Flex — $0,25 / $3,00.

• Flash-Lite TTS Priority — $0.90 / $10.80.

Gemini 3.1 Flash TTS Preview, для сравнения — $1.00 / $20.00, пакетно $0.50 / $10.00.

На что стоит обратить внимание — так это на период акции. Google установил цену на обе новые модели вдвое ниже до конца года и опубликовал показатели после окончания акции в той же таблице. Всем, кто рассчитывает стоимость за тысячу минут, следует использовать январское значение, а не сентябрьское.

A generated scoreboard for Gemini 3.8 Flash TTS with six rows — Arena Elo 1,260 at rank 2, audio out $9.00 per 1M tokens, 130 languages on Flash against 101 on Flash-Lite, 30 prebuilt studio voices plus voice design, cloning from a 30-second sample with SynthID, and GA availability on the Gemini API — over the footer 'Price per Google rate card; Elo per Artificial Analysis Provider Voice Arena, Sept 2026.'

Дизайн голоса — это по-настоящему новая возможность.

Готовые голоса — это уже обязательный минимум. Что Google добавила в 3.8 — это способ описать голос словами и получить его, а также способ клонировать его по короткому образцу с прикреплённой проверкой согласия.

Дизайн голоса принимает запрос на естественном языке — темп, тембр, акцент, то, на что иначе вы бы потратили целый день на прослушивания, — и возвращает пригодный для использования голос без эталонной записи. Репликация голоса работает наоборот: вы предоставляете 30-секундный образец, система проверяет согласие, а полученный голос помечается водяным знаком SynthID и учётными данными C2PA на сгенерированном аудио. Ремикшинг голоса, который позволяет смешивать или изменять существующий пользовательский голос, указан как «скоро», а не как уже выпущенный.

Пользовательские голоса бывают двух видов, и ведут они себя достаточно по-разному, так что в продакшене это различие важно. Пользовательские голоса с состоянием хранятся в рамках проекта, их количество ограничено 200 на проект, а срок жизни составляет один год. Голоса без состояния адресуются по идентификатору voicekey_... и истекают через семь дней. Если ваше приложение создаёт отдельный голос для каждого клиента, ограничение и TTL — это те два числа, которые определяют, нужен ли вам собственный слой хранения.

Средства управления подачей — это вторая половина «нового». Вы можете направлять реплику так, как режиссировали бы актёра, — темп, акценты, эмоциональная окраска — вместо того чтобы просто выбрать голос и надеяться. Сцены с двумя говорящими можно поставить в рамках одного вызова. А невербальные вокализации — это полноценные элементы сценария: <laughs>, <sigh> и <gasp> в виде встроенных реплик, плюс |mhm| и |yeah| для тех коротких поддакиваний, из-за которых синтетический разговор звучит как разговор. Утверждается, что при чтении длинных текстов голос говорящего сохраняется с минимальным дрейфом, — а это тот сбой, который проявляется первым, когда вы генерируете 40-минутную главу аудиокниги.

Бенчмарки и кто их проводил

Материалы запуска Google опираются на две внешние оценки и набор позиций в аренах. Все они заявлены вендором — Google цитирует их, а лежащие в основе прогоны не опубликованы — поэтому относитесь к ним как к заявлениям, а не к измерениям.

A screenshot of Google's blog post 'Gemini 3.8 text-to-speech says hello', captured in English and dated Sep 23, 2026, showing the header credited to Leland Rechis and Alan Cowen, the 'Introducing Gemini 3.8 Flash TTS and 3.8 Flash-Lite TTS' hero card, and the opening bullets describing the two models.

• Бенчмарк Hume AI Voice Design — Gemini 3.8 Flash TTS занял первое место с показателем 71,4 и первое место по моделированию акцента с 60,8.

• Общий индекс качества Hume — Flash TTS на первом месте, Flash-Lite TTS на втором.

• Слепое предпочтение в Speech Arena — верхние строчки заняли японский, бразильский португальский, вьетнамский, современный стандартный арабский, мексиканский испанский и хинди.

• В сравнении с Gemini 3.1 Flash TTS — Google заявляет о прогрессе в согласованности длинных текстов и управлении сценарием с двумя говорящими, а это ровно те две вещи, для которых и созданы функции управления подачей.

Об одном документированном расхождении стоит упомянуть отдельно, потому что оно собьёт с толку любого, кто сравнивает источники. В посте блога описывается библиотека из более чем 2 000 голосов, готовых к использованию в продакшене. В документации для разработчиков говорится о «сотнях» голосов в Extended Voice Library наряду с 30 предустановленными студийными голосами. В сторонних публикациях приводились цифры ещё на порядок выше. Извне эти данные не согласуются — честная интерпретация такова: набор, который вы получаете по умолчанию, состоит из 30 голосов, Extended Voice Library больше и описан расплывчато, а большие числа относятся к каталогу, включающему голоса, созданные пользователями. Если количество голосов имеет решающее значение для вашего решения, протестируйте конкретный нужный вам голос, а не полагайтесь ни на одну из этих трёх цифр.

Что это значит, если вы строите на этом

Практическое изменение состоит в том, что синтез речи перешёл из узкоспециализированной статьи расходов в нечто, что можно включить в ту же модель затрат, что и ваши языковые токены. При 25 токенах в секунду час сгенерированного аудио — это 90 000 аудиотокенов, что по промо-тарифу Flash-Lite составляет около 54 центов. Это достаточно дёшево, чтобы интересный вопрос перестал быть «можем ли мы позволить себе синтетический голос» и стал «какой из двух уровней нужен этой поверхности».

Второе практическое изменение заключается в том, что совершенно новая TTS-модель — это именно то, что хочется попробовать, не ставя на кон производственный путь. Именно поэтому новую модель стоит поместить за маршрутизатор, а не подключать напрямую: OrcaRouter предоставляет более 200 моделей по одному ключу по прайсовой цене провайдера без наценки, а его автоматическое переключение при сбое означает, что новый речевой эндпоинт, который нестабильно работает под нагрузкой, переключается на модель, которой вы уже доверяете, вместо того чтобы сбрасывать вызов. Мы не размещаем у себя эндпоинты Gemini 3.8 TTS — они предоставляются собственным API Google — но текстовый слой под голосом и резервный путь при сбое вызова синтеза — это именно то, для чего на самом деле нужен маршрутизатор.

Чего всё ещё не хватает

В запуске отсутствуют три вещи, и каждая из них — реальное ограничение, а не придирка.

Опубликованной независимой оценки не существует. Цифры Google по Hume — это вендор, ссылающийся на бенчмарк третьей стороны, что лучше, чем ничего, и хуже, чем аудит. Пока Artificial Analysis или аналогичная организация не опубликует собственный прогон на тех же моделях, любое заявление о качестве в этой статье следует воспринимать как утверждение.

Варианта с открытыми весами нет. Обе модели закрытые и доступны только через API, что относит их к другой категории по сравнению с открытыми речевыми моделями, которые появлялись на той же арене. Если для вашего развёртывания требуется самостоятельно запускать модель, этот выпуск не для вас.

И промо-цены заканчиваются. Тариф Flash TTS в январе 2027 года вдвое выше сентябрьского, и любой бизнес-кейс, построенный на цифрах запуска, придётся переделать в первом квартале. Это не критика — публикация обеих цифр заранее честнее, чем поступает большинство, — но именно эта цифра должна быть в таблице.

Google не сообщила, будет ли Gemini 3.1 Flash TTS Preview объявлена устаревшей, а лишь то, что Flash-Lite TTS позиционируется как её основная замена. Всем, кто всё ещё использует предварительную модель, следует планировать миграцию, а не ждать уведомления об отключении.

A generated summary card titled 'Gemini 3.8 TTS: what changed in five lines', listing the split into Flash TTS and Flash-Lite TTS, the audio-out cut to $9.00 per 1M tokens, voice design and 30-second cloning, 130 languages on Flash against 101 on Flash-Lite, and half price until December 31, 2026.