
Создание и развертывание пользовательского аудио с помощью Gemini 3.8 Flash TTS: дизайн голоса, клонирование и двое часов, которые решают
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 506 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 184 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS позволяют создать голос по письменному описанию, а не выбирать его из списка, и оба стали общедоступны в Gemini API 23 сентября 2026 года. Главная тема, которую все повторяют, — это дизайн голоса. Но то, что стоит учесть при планировании, — это что происходит с созданным голосом потом, потому что поставщик даёт два способа сохранить его и назначает каждому разный срок жизни. Выберите не тот — и голос, от которого зависит ваш продукт, истечёт через неделю.
Это и есть тот пробел в освещении запуска, который существует на данный момент. В анонсах объясняется, что можно создать голос с помощью промпта, а в некоторых из них упоминается клонирование по 30-секундному образцу. Ни в одном из них не разбирается модель хранения, а именно она определяет, воспроизводим ли речевой конвейер из конфигурационного файла или его приходится повторно развёртывать по расписанию. В этой статье рассматривается весь путь — проектирование, хранение, вызов и оплата — с ценами и квотами в том виде, как их публикует Google.
Что вышло 23 сентября
Две модели, одна схема API. Идентификаторы — gemini-3.8-flash-tts и gemini-3.8-flash-lite-tts, и документация Google прямо указывает, что обе используют «в точности одну и ту же схему API и формат запросов» — переключение между ними — это изменение одного параметра, а не переписывание.
• Ввод — только текст. Обе модели принимают текст и возвращают аудио; они не мультимодальны и не генерируют текст обратно.
• Выходные данные — WAV, 24 кГц, моно, 16-битный знаковый PCM на унарной конечной точке; PCM без заголовка (audio/l16) на потоковой конечной точке; audio/mulaw и audio/alaw принимаются с настраиваемой частотой дискретизации.
• Языки — 130 в Flash TTS, 101 в Flash-Lite TTS, автоматически определяются по тексту, а не указываются в запросе.
• Голоса — 30 отобранных студийных голосов, перечисленных в документации (среди них Kore и Puck), Расширенная библиотека голосов из «сотен» дополнительных, доступных для запроса через эндпоинт voices, а также два способа создания, описанных ниже.
• Режиссура — построчное управление подачей, сцены с двумя говорящими, поставленные по одному сценарию, и невербальные сигналы, такие как <laughs>, <sigh> и |mhm|, вписанные прямо в транскрипт.
Эти два уровня существуют потому, что рабочие нагрузки разошлись. Flash TTS позиционируется для максимальной акустической достоверности и сложной актёрской игры; Flash-Lite TTS описывается словами самой Google как «рабочая лошадка», призванная заменить gemini-3.1-flash-tts-preview, и нацелена на массовый дубляж, функции чтения вслух и каскады голосовых агентов. Оба уровня заменяют одну preview-модель, которая была в API с апреля 2026 года, поэтому если вы использовали preview, миграция — это выбор уровня, а не обновление версии.

Разработка голоса — это промпт, и это меняет этап проверки.
Интерфейс создания — это действительно новая вещь в этом поколении. Созданный по промпту голос строится из описания на естественном языке — роль, акцент, вокальный характер — и возвращает идентификатор, который вы затем используете повторно. В API это вызов создания голоса с store: true и входными данными в виде промпта; в собственных примерах Google описания варьируются от энергичного мельбурнского диджея до японского дракона. После создания голос указывается в запросе на синтез речи по его идентификатору, и инструкции по стилю для каждого запроса могут быть минимальными или пустыми, поскольку характер уже заложен в голос.
Практическое следствие — это изменение рабочего процесса, а не просто функция. Кастинг голоса раньше был переговорами о лицензии или бронированием студии, что означало, что выбор голоса происходил один раз, на раннем этапе, и переживал проверку, потому что его изменение было дорогостоящим. Когда голос — это абзац текста, кастинг становится дизайн-токеном — чем-то, что продакт-менеджер может попросить перегенерировать во вторник. Команды, которые помещают строку описания в систему контроля версий и рассматривают сгенерированный ID голоса как артефакт сборки, получат согласованный вывод в разных средах. Команды, которые создают голоса вручную в AI Studio, — нет, и сбой будет выглядеть как необъяснимое различие между аудио на стейджинге и в продакшене.
Двое часов
Это тот раздел, который пропускают посты о запуске. Google позволяет хранить спроектированный или воспроизведённый голос в одном из двух состояний, а срок их действия истекает с совершенно разной скоростью.
• Сохранённые голоса — созданные при включённом хранении, они находятся в вашем проекте, и на них распространяется квота в 200 голосов на проект со сроком жизни один год.
• Ключи без сохранения состояния — при репликации голоса может возвращаться управляемый клиентом ключ (форма voicekey_…) вместо сохранённого идентификатора, и срок жизни этого ключа составляет семь дней.
Если читать их вместе, эта пара — проектная инструкция. Сохранённый голос — это годовое обязательство и жёсткий потолок в 200 на проект, что щедро для продукта с фиксированным составом и бесполезно для всего, что создаёт новый голос для каждого клиента. Ключ без состояния — противоположность: нет давления квоты, но ключ приходится перевыпускать еженедельно, а значит, вашему приложению нужен путь обновления, а инфраструктуре — хранить учётные данные, которые ротируются. Ни то, ни другое не неправильно. Выбор без осознания того, какой именно вариант вы выбрали, — вот как голосовой агент умолкает на восьмой день.
С репликацией связаны ещё два свойства, и о них стоит знать, прежде чем что-либо обещать юридической команде. Создание реплицированного голоса требует записи устного согласия от владельца голоса, которая должна совпадать с эталонным диктором, — проверка на слух, а не галочка в чекбоксе. А результат несёт в себе сведения о происхождении: каждый клип помечен водяным знаком SynthID, а реплицированные голоса дополнительно несут учётные данные о контенте C2PA. Путь проектирования намеренно сделан более трудным для злоупотреблений, и оба барьера носят структурный характер, а не являются декларациями о политике.
Одно расхождение, на которое стоит указать, а не пытаться устранить. В таблице поддерживаемых моделей Google дизайн голоса и репликация голоса указаны как доступные в обеих моделях 3.8 TTS. В большинстве публикаций о запуске репликация описывается как относящаяся именно к Flash TTS. Если репликация важна для вашего выбора между уровнями, сверьтесь с документацией для того уровня, который вы собираетесь использовать, а не полагайтесь на любое из этих кратких описаний.
Сколько стоит час аудио
Google тарифицирует речь в токенах, а не в символах или секундах, и коэффициент пересчёта опубликован: аудио измеряется по 25 токенов за секунду выходного сигнала, что составляет 90 000 токенов в час. Благодаря этому арифметика получается необычно простой, и именно это число стоит закладывать в бюджет, а не ставку за миллион.
• Flash TTS standard — $0,50 за миллион входных текстовых токенов, $9,00 за миллион выходных аудиотокенов до 31 декабря 2026 года, затем — $1,00 и $18,00. Batch и Flex — $0,25 и $4,50; Priority — $0,90 и $16,20.
• Flash-Lite TTS стандартный — $0,50 и $6,00 до той же даты, затем $1,00 и $12,00. Batch и Flex — $0,25 и $3,00; Priority — $0,90 и $10,80.
• В секундах — Flash TTS обходится примерно в $0,81 за час сгенерированного аудио в течение промо-периода и около $1,62 после него; Flash-Lite TTS — примерно $0,54, а затем $1,08.
• В сравнении с моделью, которую она заменяет — gemini-3.1-flash-tts-preview стоит $1.00 и $20.00 за миллион, поэтому строка аудиовыхода снизилась на 55 процентов для Flash TTS и на 70 процентов для Flash-Lite TTS.
Не стройте планы, отталкиваясь от промо-ставки. Google публикует оба столбца в одной и той же таблице, а значит, январская ставка — не слух, который предстоит обнаружить позже: она уже сегодня есть в тарифной карточке, и любая оценка за тысячу минут, построенная исходя из $0.81, должна выдержать удвоение.
Одно независимое число и несколько, которые таковыми не являются.
Объявление Google начинается с результатов бенчмарков, и воспринимать их следует ровно такими, какие они есть. Компания утверждает, что Flash TTS занял первое место в Voice Design Benchmark от Hume AI с результатом 71,4, лидировал в моделировании акцентов с 60,8, а Flash TTS и Flash-Lite TTS заняли первое и второе места в Overall Quality Index от Hume, с сильными позициями по слепым предпочтениям на Voice Arena для японского, бразильского португальского, вьетнамского, современного стандартного арабского, мексиканского испанского и хинди. Все данные — со слов вендора, ни один из запусков не опубликован.
В этом списке есть деталь, заслуживающая внимания. Алан Коуэн, указанный как один из авторов анонса Google, — основатель Hume AI, лаборатории, чей Voice Design Benchmark даёт главную цифру. Это не делает цифру неверной, и бенчмарк Hume — настоящий, но эти две вещи не независимы друг от друга, и читателю, который оценивает 71,4, стоит знать это, прежде чем повторять её как подтверждение от третьей стороны.
Независимо собранный показатель представлен на Provider Voice Arena от Artificial Analysis, зафиксированный для этой статьи 24 сентября 2026 года: Gemini 3.8 Flash TTS занимает второе место с Elo 1 260 и интервалом в 17 пунктов по 1 999 образцам, уступая Cartesia Sonic 3.6 с 1 273. Gemini 3.8 Flash-Lite TTS находится на шестом месте с 1 235. Заменяемая модель, Gemini 3.1 Flash TTS, занимает десятое место с 1 199 по 3 430 образцам. Предпочтение слепых слушателей, а не собственная оценка лаборатории — и единственный показатель качества здесь, который Google не заказывал.

Где это запускать, а где пока нет
Обе модели уже доступны сегодня в Gemini API и Google AI Studio, без листа ожидания. Потребительские и корпоративные поверхности пока находятся на стадии подготовки, а не выпущены: Flash TTS появится в Gemini Notebook, а Flash-Lite TTS — в Google Vids; доступ к Gemini Enterprise описывается как «скоро», а голосовой ремиксинг — настройка тембра, высоты тона, темпа и акцента для существующего голоса — указан как будущая функция, а не текущая. Если ваш план зависит от ремиксинга, то его пока не существует.
С нашей стороны — начнём с честности: эндпоинты Gemini 3.8 TTS отсутствуют в таблице маршрутизации OrcaRouter. А поколение, которое они заменяют, — присутствует: google/gemini-3.1-flash-tts-previewесть в каталоге по тем же $1.00 и $20.00 за миллион токенов, которые публикует Google, потому что прайс-лист провайдера транслируется без наценки, и он отвечает на том же эндпоинте /v1/audio/speech, на который уже нацелен ваш SDK с совместимостью с OpenAI. Для речевой нагрузки это важнее, чем может показаться, потому что на самом деле вы покупаете стабильный эндпоинт, который ваше приложение может вызывать, пока стоящие за ним модели меняются. В вашем коде хранится строка с названием модели; в каталоге хранится маршрутизация. Когда 31 декабря промо-окно Google закроется и Flash TTS подорожает вдвое, цена маршрутизируемой модели изменится в тот же день, а не при следующем продлении контракта, — а вышедшая из строя модель переключится на резервную, вместо того чтобы увлечь за собой вашу очередь озвучки.

Если вы оцениваете это поколение перед тем, как сделать окончательный выбор, дешёвый эксперимент состоит из двух этапов. Прогоните один и тот же сценарий через Flash TTS и Flash-Lite TTS, поскольку схема идентична, а разница заключается в одном параметре, — затем примите решение, опираясь на собственное аудио, а не на график бенчмарка, и проверьте на Artificial Analysis, сохраняется ли разрыв в качестве с учётом его погрешностей, прежде чем платить надбавку. Для крупноформатного проекта озвучки надбавка — это реальные деньги; а для бота поддержки, читающего номер телефона вслух, она явно не даёт ничего, что слушатель мог бы услышать.
