
Gemini 3.8 Flash TTS говорит «привет»: Google разделяет свою линейку синтеза речи на две и снижает цену
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
23 сентября 2026 года вендор выпустил две речевые модели, и анонс написан так, будто главное в нём — качество голоса. Это не так. Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS — первые модели преобразования текста в речь, которые вендор разместил в Gemini Developer API по цене ниже, чем у модели предварительной версии, которую они заменяют, — и для всех, кто до сих пор платил за символ где-то ещё, именно эта часть меняет статью бюджета. Тариф на аудиовыход у Gemini 3.8 Flash TTS составляет $9,00 за миллион токенов до конца 2026 года. Аудио тарифицируется из расчёта 25 токенов в секунду, что даёт примерно 0,02 цента за секунду сгенерированной речи. Модель, которую она заменяет, Gemini 3.1 Flash TTS Preview, стоила $20,00 за миллион аудиотокенов.
Вторая половина истории — теперь моделей две, а не одна. Google разделил линейку: Flash TTS включает полный набор языков и более высокий тариф на аудио, а Flash-Lite TTS — более короткий список языков и более дешёвый тариф. Это иная конфигурация по сравнению со схемой с одной preview-моделью, которая была в API с апреля, и она говорит о том, как Google видит рынок: небольшое число приложений, которым нужны 130 языков и клонирование голоса, и гораздо большее число тех, кому нужен приличный английский голос для бота поддержки и больше ничего.
Что на самом деле вышло 23 сентября?
На момент анонса обе модели общедоступны в Gemini API и в AI Studio — без ограничения списком ожидания. Имена в API — gemini-3.8-flash-tts и gemini-3.8-flash-lite-tts.
• Flash TTS — 130 языков, язык автоматически определяется по тексту, 30 предустановленных студийных голосов, включая Kore и Puck.
• Flash-Lite TTS — 101 язык, тот же интерфейс для разработки голоса, позиционируется как уровень для больших объёмов.
• И то и другое — голосовой дизайн по описанию на естественном языке, построчные указания по подаче, постановка сцены с двумя говорящими и невербальные сигналы, вписанные прямо в сценарий.
• Вывод — WAV 24 кГц, моно, 16-битный знаковый PCM на унарной конечной точке; PCM без заголовка (audio/l16) на потоковой конечной точке; audio/mulaw и audio/alaw также принимаются, с настраиваемой частотой дискретизации.
Тарифную сетку — в расчёте на миллион токенов — стоит изучить целиком, потому что уровни различаются не только главной цифрой:
• Flash TTS Standard — 0,50 $ за ввод текста / 9,00 $ за вывод аудио, с повышением до 1,00 $ / 18,00 $ после 31 декабря 2026 г.
• Flash TTS Batch и Flex — $0.25 / $4.50.
• Flash TTS Priority — $0.90 / $16.20.
• Flash-Lite TTS Standard — $0.50 / $6.00, с повышением до $1.00 / $12.00 после 31 декабря 2026 года.
• Flash-Lite TTS Batch и Flex — $0,25 / $3,00.
• Flash-Lite TTS Priority — $0.90 / $10.80.
• Gemini 3.1 Flash TTS Preview, для сравнения — $1.00 / $20.00, пакетно $0.50 / $10.00.
На что стоит обратить внимание — так это на период акции. Google установил цену на обе новые модели вдвое ниже до конца года и опубликовал показатели после окончания акции в той же таблице. Всем, кто рассчитывает стоимость за тысячу минут, следует использовать январское значение, а не сентябрьское.

Дизайн голоса — это по-настоящему новая возможность.
Готовые голоса — это уже обязательный минимум. Что Google добавила в 3.8 — это способ описать голос словами и получить его, а также способ клонировать его по короткому образцу с прикреплённой проверкой согласия.
Дизайн голоса принимает запрос на естественном языке — темп, тембр, акцент, то, на что иначе вы бы потратили целый день на прослушивания, — и возвращает пригодный для использования голос без эталонной записи. Репликация голоса работает наоборот: вы предоставляете 30-секундный образец, система проверяет согласие, а полученный голос помечается водяным знаком SynthID и учётными данными C2PA на сгенерированном аудио. Ремикшинг голоса, который позволяет смешивать или изменять существующий пользовательский голос, указан как «скоро», а не как уже выпущенный.
Пользовательские голоса бывают двух видов, и ведут они себя достаточно по-разному, так что в продакшене это различие важно. Пользовательские голоса с состоянием хранятся в рамках проекта, их количество ограничено 200 на проект, а срок жизни составляет один год. Голоса без состояния адресуются по идентификатору voicekey_... и истекают через семь дней. Если ваше приложение создаёт отдельный голос для каждого клиента, ограничение и TTL — это те два числа, которые определяют, нужен ли вам собственный слой хранения.
Средства управления подачей — это вторая половина «нового». Вы можете направлять реплику так, как режиссировали бы актёра, — темп, акценты, эмоциональная окраска — вместо того чтобы просто выбрать голос и надеяться. Сцены с двумя говорящими можно поставить в рамках одного вызова. А невербальные вокализации — это полноценные элементы сценария: <laughs>, <sigh> и <gasp> в виде встроенных реплик, плюс |mhm| и |yeah| для тех коротких поддакиваний, из-за которых синтетический разговор звучит как разговор. Утверждается, что при чтении длинных текстов голос говорящего сохраняется с минимальным дрейфом, — а это тот сбой, который проявляется первым, когда вы генерируете 40-минутную главу аудиокниги.
Бенчмарки и кто их проводил
Материалы запуска Google опираются на две внешние оценки и набор позиций в аренах. Все они заявлены вендором — Google цитирует их, а лежащие в основе прогоны не опубликованы — поэтому относитесь к ним как к заявлениям, а не к измерениям.

• Бенчмарк Hume AI Voice Design — Gemini 3.8 Flash TTS занял первое место с показателем 71,4 и первое место по моделированию акцента с 60,8.
• Общий индекс качества Hume — Flash TTS на первом месте, Flash-Lite TTS на втором.
• Слепое предпочтение в Speech Arena — верхние строчки заняли японский, бразильский португальский, вьетнамский, современный стандартный арабский, мексиканский испанский и хинди.
• В сравнении с Gemini 3.1 Flash TTS — Google заявляет о прогрессе в согласованности длинных текстов и управлении сценарием с двумя говорящими, а это ровно те две вещи, для которых и созданы функции управления подачей.
Об одном документированном расхождении стоит упомянуть отдельно, потому что оно собьёт с толку любого, кто сравнивает источники. В посте блога описывается библиотека из более чем 2 000 голосов, готовых к использованию в продакшене. В документации для разработчиков говорится о «сотнях» голосов в Extended Voice Library наряду с 30 предустановленными студийными голосами. В сторонних публикациях приводились цифры ещё на порядок выше. Извне эти данные не согласуются — честная интерпретация такова: набор, который вы получаете по умолчанию, состоит из 30 голосов, Extended Voice Library больше и описан расплывчато, а большие числа относятся к каталогу, включающему голоса, созданные пользователями. Если количество голосов имеет решающее значение для вашего решения, протестируйте конкретный нужный вам голос, а не полагайтесь ни на одну из этих трёх цифр.
Что это значит, если вы строите на этом
Практическое изменение состоит в том, что синтез речи перешёл из узкоспециализированной статьи расходов в нечто, что можно включить в ту же модель затрат, что и ваши языковые токены. При 25 токенах в секунду час сгенерированного аудио — это 90 000 аудиотокенов, что по промо-тарифу Flash-Lite составляет около 54 центов. Это достаточно дёшево, чтобы интересный вопрос перестал быть «можем ли мы позволить себе синтетический голос» и стал «какой из двух уровней нужен этой поверхности».
Второе практическое изменение заключается в том, что совершенно новая TTS-модель — это именно то, что хочется попробовать, не ставя на кон производственный путь. Именно поэтому новую модель стоит поместить за маршрутизатор, а не подключать напрямую: OrcaRouter предоставляет более 200 моделей по одному ключу по прайсовой цене провайдера без наценки, а его автоматическое переключение при сбое означает, что новый речевой эндпоинт, который нестабильно работает под нагрузкой, переключается на модель, которой вы уже доверяете, вместо того чтобы сбрасывать вызов. Мы не размещаем у себя эндпоинты Gemini 3.8 TTS — они предоставляются собственным API Google — но текстовый слой под голосом и резервный путь при сбое вызова синтеза — это именно то, для чего на самом деле нужен маршрутизатор.
Чего всё ещё не хватает
В запуске отсутствуют три вещи, и каждая из них — реальное ограничение, а не придирка.
Опубликованной независимой оценки не существует. Цифры Google по Hume — это вендор, ссылающийся на бенчмарк третьей стороны, что лучше, чем ничего, и хуже, чем аудит. Пока Artificial Analysis или аналогичная организация не опубликует собственный прогон на тех же моделях, любое заявление о качестве в этой статье следует воспринимать как утверждение.
Варианта с открытыми весами нет. Обе модели закрытые и доступны только через API, что относит их к другой категории по сравнению с открытыми речевыми моделями, которые появлялись на той же арене. Если для вашего развёртывания требуется самостоятельно запускать модель, этот выпуск не для вас.
И промо-цены заканчиваются. Тариф Flash TTS в январе 2027 года вдвое выше сентябрьского, и любой бизнес-кейс, построенный на цифрах запуска, придётся переделать в первом квартале. Это не критика — публикация обеих цифр заранее честнее, чем поступает большинство, — но именно эта цифра должна быть в таблице.
Google не сообщила, будет ли Gemini 3.1 Flash TTS Preview объявлена устаревшей, а лишь то, что Flash-Lite TTS позиционируется как её основная замена. Всем, кто всё ещё использует предварительную модель, следует планировать миграцию, а не ждать уведомления об отключении.

