Сгенерированная hero-карточка для «Создавайте и развёртывайте собственное аудио» с подзаголовком «Gemini 3.8 Flash TTS» на белом фоне с мягкими сине-голубыми градиентными акцентами. Три пронумерованные карточки гласят: «1 Создайте голос по промпту», «2 Храните его год или используйте семидневный ключ» и «3 Вызовите /v1/audio/speech», над строкой нижнего колонтитула: «Gemini API, 23 сентября 2026 г. Данные производителя.» Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

Создание и развертывание пользовательского аудио с помощью Gemini 3.8 Flash TTS: дизайн голоса, клонирование и двое часов, которые решают

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS позволяют создать голос по письменному описанию, а не выбирать его из списка, и оба стали общедоступны в Gemini API 23 сентября 2026 года. Главная тема, которую все повторяют, — это дизайн голоса. Но то, что стоит учесть при планировании, — это что происходит с созданным голосом потом, потому что поставщик даёт два способа сохранить его и назначает каждому разный срок жизни. Выберите не тот — и голос, от которого зависит ваш продукт, истечёт через неделю.

Это и есть тот пробел в освещении запуска, который существует на данный момент. В анонсах объясняется, что можно создать голос с помощью промпта, а в некоторых из них упоминается клонирование по 30-секундному образцу. Ни в одном из них не разбирается модель хранения, а именно она определяет, воспроизводим ли речевой конвейер из конфигурационного файла или его приходится повторно развёртывать по расписанию. В этой статье рассматривается весь путь — проектирование, хранение, вызов и оплата — с ценами и квотами в том виде, как их публикует Google.

Что вышло 23 сентября

Две модели, одна схема API. Идентификаторы — gemini-3.8-flash-tts и gemini-3.8-flash-lite-tts, и документация Google прямо указывает, что обе используют «в точности одну и ту же схему API и формат запросов» — переключение между ними — это изменение одного параметра, а не переписывание.

• Ввод — только текст. Обе модели принимают текст и возвращают аудио; они не мультимодальны и не генерируют текст обратно.

• Выходные данные — WAV, 24 кГц, моно, 16-битный знаковый PCM на унарной конечной точке; PCM без заголовка (audio/l16) на потоковой конечной точке; audio/mulaw и audio/alaw принимаются с настраиваемой частотой дискретизации.

• Языки — 130 в Flash TTS, 101 в Flash-Lite TTS, автоматически определяются по тексту, а не указываются в запросе.

• Голоса — 30 отобранных студийных голосов, перечисленных в документации (среди них Kore и Puck), Расширенная библиотека голосов из «сотен» дополнительных, доступных для запроса через эндпоинт voices, а также два способа создания, описанных ниже.

• Режиссура — построчное управление подачей, сцены с двумя говорящими, поставленные по одному сценарию, и невербальные сигналы, такие как <laughs>, <sigh> и |mhm|, вписанные прямо в транскрипт.

Эти два уровня существуют потому, что рабочие нагрузки разошлись. Flash TTS позиционируется для максимальной акустической достоверности и сложной актёрской игры; Flash-Lite TTS описывается словами самой Google как «рабочая лошадка», призванная заменить gemini-3.1-flash-tts-preview, и нацелена на массовый дубляж, функции чтения вслух и каскады голосовых агентов. Оба уровня заменяют одну preview-модель, которая была в API с апреля 2026 года, поэтому если вы использовали preview, миграция — это выбор уровня, а не обновление версии.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English on 24 September 2026, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) and Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts), and Python sample code that passes a speaker_config with the Kore voice to the interactions endpoint.

Разработка голоса — это промпт, и это меняет этап проверки.

Интерфейс создания — это действительно новая вещь в этом поколении. Созданный по промпту голос строится из описания на естественном языке — роль, акцент, вокальный характер — и возвращает идентификатор, который вы затем используете повторно. В API это вызов создания голоса с store: true и входными данными в виде промпта; в собственных примерах Google описания варьируются от энергичного мельбурнского диджея до японского дракона. После создания голос указывается в запросе на синтез речи по его идентификатору, и инструкции по стилю для каждого запроса могут быть минимальными или пустыми, поскольку характер уже заложен в голос.

Практическое следствие — это изменение рабочего процесса, а не просто функция. Кастинг голоса раньше был переговорами о лицензии или бронированием студии, что означало, что выбор голоса происходил один раз, на раннем этапе, и переживал проверку, потому что его изменение было дорогостоящим. Когда голос — это абзац текста, кастинг становится дизайн-токеном — чем-то, что продакт-менеджер может попросить перегенерировать во вторник. Команды, которые помещают строку описания в систему контроля версий и рассматривают сгенерированный ID голоса как артефакт сборки, получат согласованный вывод в разных средах. Команды, которые создают голоса вручную в AI Studio, — нет, и сбой будет выглядеть как необъяснимое различие между аудио на стейджинге и в продакшене.

Двое часов

Это тот раздел, который пропускают посты о запуске. Google позволяет хранить спроектированный или воспроизведённый голос в одном из двух состояний, а срок их действия истекает с совершенно разной скоростью.

• Сохранённые голоса — созданные при включённом хранении, они находятся в вашем проекте, и на них распространяется квота в 200 голосов на проект со сроком жизни один год.

• Ключи без сохранения состояния — при репликации голоса может возвращаться управляемый клиентом ключ (форма voicekey_…) вместо сохранённого идентификатора, и срок жизни этого ключа составляет семь дней.

Если читать их вместе, эта пара — проектная инструкция. Сохранённый голос — это годовое обязательство и жёсткий потолок в 200 на проект, что щедро для продукта с фиксированным составом и бесполезно для всего, что создаёт новый голос для каждого клиента. Ключ без состояния — противоположность: нет давления квоты, но ключ приходится перевыпускать еженедельно, а значит, вашему приложению нужен путь обновления, а инфраструктуре — хранить учётные данные, которые ротируются. Ни то, ни другое не неправильно. Выбор без осознания того, какой именно вариант вы выбрали, — вот как голосовой агент умолкает на восьмой день.

С репликацией связаны ещё два свойства, и о них стоит знать, прежде чем что-либо обещать юридической команде. Создание реплицированного голоса требует записи устного согласия от владельца голоса, которая должна совпадать с эталонным диктором, — проверка на слух, а не галочка в чекбоксе. А результат несёт в себе сведения о происхождении: каждый клип помечен водяным знаком SynthID, а реплицированные голоса дополнительно несут учётные данные о контенте C2PA. Путь проектирования намеренно сделан более трудным для злоупотреблений, и оба барьера носят структурный характер, а не являются декларациями о политике.

Одно расхождение, на которое стоит указать, а не пытаться устранить. В таблице поддерживаемых моделей Google дизайн голоса и репликация голоса указаны как доступные в обеих моделях 3.8 TTS. В большинстве публикаций о запуске репликация описывается как относящаяся именно к Flash TTS. Если репликация важна для вашего выбора между уровнями, сверьтесь с документацией для того уровня, который вы собираетесь использовать, а не полагайтесь на любое из этих кратких описаний.

Сколько стоит час аудио

Google тарифицирует речь в токенах, а не в символах или секундах, и коэффициент пересчёта опубликован: аудио измеряется по 25 токенов за секунду выходного сигнала, что составляет 90 000 токенов в час. Благодаря этому арифметика получается необычно простой, и именно это число стоит закладывать в бюджет, а не ставку за миллион.

• Flash TTS standard — $0,50 за миллион входных текстовых токенов, $9,00 за миллион выходных аудиотокенов до 31 декабря 2026 года, затем — $1,00 и $18,00. Batch и Flex — $0,25 и $4,50; Priority — $0,90 и $16,20.

• Flash-Lite TTS стандартный — $0,50 и $6,00 до той же даты, затем $1,00 и $12,00. Batch и Flex — $0,25 и $3,00; Priority — $0,90 и $10,80.

• В секундах — Flash TTS обходится примерно в $0,81 за час сгенерированного аудио в течение промо-периода и около $1,62 после него; Flash-Lite TTS — примерно $0,54, а затем $1,08.

• В сравнении с моделью, которую она заменяет — gemini-3.1-flash-tts-preview стоит $1.00 и $20.00 за миллион, поэтому строка аудиовыхода снизилась на 55 процентов для Flash TTS и на 70 процентов для Flash-Lite TTS.

Не стройте планы, отталкиваясь от промо-ставки. Google публикует оба столбца в одной и той же таблице, а значит, январская ставка — не слух, который предстоит обнаружить позже: она уже сегодня есть в тарифной карточке, и любая оценка за тысячу минут, построенная исходя из $0.81, должна выдержать удвоение.

Одно независимое число и несколько, которые таковыми не являются.

Объявление Google начинается с результатов бенчмарков, и воспринимать их следует ровно такими, какие они есть. Компания утверждает, что Flash TTS занял первое место в Voice Design Benchmark от Hume AI с результатом 71,4, лидировал в моделировании акцентов с 60,8, а Flash TTS и Flash-Lite TTS заняли первое и второе места в Overall Quality Index от Hume, с сильными позициями по слепым предпочтениям на Voice Arena для японского, бразильского португальского, вьетнамского, современного стандартного арабского, мексиканского испанского и хинди. Все данные — со слов вендора, ни один из запусков не опубликован.

В этом списке есть деталь, заслуживающая внимания. Алан Коуэн, указанный как один из авторов анонса Google, — основатель Hume AI, лаборатории, чей Voice Design Benchmark даёт главную цифру. Это не делает цифру неверной, и бенчмарк Hume — настоящий, но эти две вещи не независимы друг от друга, и читателю, который оценивает 71,4, стоит знать это, прежде чем повторять её как подтверждение от третьей стороны.

Независимо собранный показатель представлен на Provider Voice Arena от Artificial Analysis, зафиксированный для этой статьи 24 сентября 2026 года: Gemini 3.8 Flash TTS занимает второе место с Elo 1 260 и интервалом в 17 пунктов по 1 999 образцам, уступая Cartesia Sonic 3.6 с 1 273. Gemini 3.8 Flash-Lite TTS находится на шестом месте с 1 235. Заменяемая модель, Gemini 3.1 Flash TTS, занимает десятое место с 1 199 по 3 430 образцам. Предпочтение слепых слушателей, а не собственная оценка лаборатории — и единственный показатель качества здесь, который Google не заказывал.

A generated scoreboard card titled 'Gemini 3.8 Flash TTS — the scoreboard' with six rows: Arena Elo 1,260 at rank 2 over 1,999 samples; audio out $9.00 per 1M tokens to 31 December 2026; 130 languages on Flash TTS against 101 on Flash-Lite TTS; 30 studio voices plus prompt-based design; stored voices capped at 200 per project with a one-year lifetime; and a stateless voicekey with a seven-day lifetime. The footer reads 'Elo per Artificial Analysis, 24 Sept 2026; price and quotas per Google. Google's Hume AI results are vendor-reported.'

Где это запускать, а где пока нет

Обе модели уже доступны сегодня в Gemini API и Google AI Studio, без листа ожидания. Потребительские и корпоративные поверхности пока находятся на стадии подготовки, а не выпущены: Flash TTS появится в Gemini Notebook, а Flash-Lite TTS — в Google Vids; доступ к Gemini Enterprise описывается как «скоро», а голосовой ремиксинг — настройка тембра, высоты тона, темпа и акцента для существующего голоса — указан как будущая функция, а не текущая. Если ваш план зависит от ремиксинга, то его пока не существует.

С нашей стороны — начнём с честности: эндпоинты Gemini 3.8 TTS отсутствуют в таблице маршрутизации OrcaRouter. А поколение, которое они заменяют, — присутствует: google/gemini-3.1-flash-tts-previewесть в каталоге по тем же $1.00 и $20.00 за миллион токенов, которые публикует Google, потому что прайс-лист провайдера транслируется без наценки, и он отвечает на том же эндпоинте /v1/audio/speech, на который уже нацелен ваш SDK с совместимостью с OpenAI. Для речевой нагрузки это важнее, чем может показаться, потому что на самом деле вы покупаете стабильный эндпоинт, который ваше приложение может вызывать, пока стоящие за ним модели меняются. В вашем коде хранится строка с названием модели; в каталоге хранится маршрутизация. Когда 31 декабря промо-окно Google закроется и Flash TTS подорожает вдвое, цена маршрутизируемой модели изменится в тот же день, а не при следующем продлении контракта, — а вышедшая из строя модель переключится на резервную, вместо того чтобы увлечь за собой вашу очередь озвучки.

A screenshot of the OrcaRouter model page for google/gemini-3.1-flash-tts-preview, captured in English on 24 September 2026, showing the model described as Google's text-to-speech model accessed via OrcaRouter, an input price of $1.00 and output price of $20.00 per 1M tokens, a p50 time-to-first-token of 6.61 seconds and p95 of 10.00 seconds over seven days, an OpenAI-compatible base URL of https://api.orcarouter.ai/v1, and a /v1/audio/speech endpoint.

Если вы оцениваете это поколение перед тем, как сделать окончательный выбор, дешёвый эксперимент состоит из двух этапов. Прогоните один и тот же сценарий через Flash TTS и Flash-Lite TTS, поскольку схема идентична, а разница заключается в одном параметре, — затем примите решение, опираясь на собственное аудио, а не на график бенчмарка, и проверьте на Artificial Analysis, сохраняется ли разрыв в качестве с учётом его погрешностей, прежде чем платить надбавку. Для крупноформатного проекта озвучки надбавка — это реальные деньги; а для бота поддержки, читающего номер телефона вслух, она явно не даёт ничего, что слушатель мог бы услышать.