
Gemini 3.8 TTS: два пеликана, две модели и цена, которая удваивается в январе
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
Самый быстрый способ понять, что вендор выпустил 23 сентября 2026 года, — посмотреть демо, которое распространялось вместе с релизом: два пеликана спорят, стоит ли переезжать на пирс Пасифика, по одному голосу на птицу, реплики расписаны по очереди. Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS — это две модели из того демо, обе общедоступны в Gemini API, и пеликаны вовсе не трюк. Они — первое в этом поколении, чего предыдущие речевые модели Gemini не умели совсем: два говорящих, одна генерация, сценарий, который управляет тем, кто что говорит.
Цена — это другая половина истории, и именно здесь две модели расходятся. Flash TTS берёт $0.50 за миллион текстовых токенов на входе и $9.00 за миллион аудиотокенов на выходе до 31 декабря 2026 года, затем $18.00; Flash-Lite TTS берёт $0.50 и $6.00 по тому же графику, затем $12.00. Это собственные тарифы Google. В пересчёте Artificial Analysis на миллион символов, чтобы их можно было поставить на одну доску с остальными, они выходят на $16.50 и $11.00 — примерно на треть дешевле для модели Lite, и оба намного ниже того, что берёт верхушка этой доски.
Так что интересный вопрос не в том, хороши ли модели. Он в том, на какой из двух вам следует строить, потому что разрыв между ними — не тот разрыв, о котором можно было бы догадаться по названиям.
Что на самом деле содержит анонс от 23 сентября
Две модели, а не одна, и Google прямо говорит, что это разделение, а не маленькая и большая версии одного и того же. В объявлении названы пять мест, где они появятся — Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook и Google Vids — а идентификаторы API просты: gemini-3.8-flash-tts и gemini-3.8-flash-lite-tts.

Список возможностей длиннее, чем предполагает заголовок. Судя по анонсу Google и документации Gemini API по генерации речи:
• Дизайн голоса — вы описываете голос словами и получаете обратно пользовательский ID голоса, вместо выбора из фиксированного списка.
• Репликация голоса — 30-секундный образец создаёт голосовой идентификатор, и именно этот путь большинство команд действительно используют для фирменного голоса или голоса диктора.
• Диалог двух говорящих — случай с пеликаном. Сценарий содержит реплики говорящих, а не единый блок прозы.
• Стилизация на уровне реплики — в документации описана аннотация speech_metadata, которая привязывает указание к конкретной реплике, а не ко всему запросу.
• Готовые голоса, а также Extended Voice Library, доступная по запросу GET /v1beta/voices.
• Три аудиокодировки — WAV по умолчанию; mulaw и alaw доступны для пайплайнов, ориентированных на телефонию.
• Только текст на входе, только аудио на выходе. Документация говорит об этом прямо: модели TTS не принимают никаких других входных модальностей и не выдают никаких других результатов, а в отдельном разделе «Ограничения» перечислены сами ограничения.
В анонсе нет ни одной из цифр, которые нужны специалисту по планированию мощностей. Ограничения скорости, квоты и срок хранения созданного голоса живут в документации и на странице с ценами, а не в посте о запуске, — и это обычная причина того, что неделя запуска проходит гладко для демонстраций и плохо для продакшена.

Пеликаны — это и есть настоящие новости
Одноголосый TTS уже два года как в целом решённая задача. Не хватало модели, которая удерживала бы две идентичности раздельно на протяжении длинного сценария без дрейфа, и именно это на самом деле проверяет демо — не то, звучит ли голос по-человечески, а то, остаётся ли спикер A спикером A спустя четыре минуты.
Из этого следуют две вещи, и именно они объясняют, почему это важно не только для подкастных игрушек.
Первое — меняется единица работы. При модели с одним говорящим двадцатиминутный диалог — это двадцать минут аудио, которое вы сшиваете из двух независимых прогонов, и каждый стык — место, где просодия сбрасывается. При модели с двумя говорящими это один вызов, один контекст, и модель может реагировать на предыдущую реплику. Это разница в качестве, которую не вернуть постобработкой.
Второе — формат скрипта становится интерфейсом. Если ваш конвейер уже выдаёт что-то в форме SSML — аннотацию для каждой фразы, — это поколение почти готово к подключению без доработок. Если ваш конвейер передаёт модели сплошную стену текста и надеется, теперь у вас есть причина перестроить его, потому что стилизация, которая раньше была неявной, теперь должна быть выражена явно. Это тот же компромисс, который остальная отрасль делает разными способами, и это та ось, по которой эти две модели Google конкурируют со всем остальным на рынке.
Сколько стоит час аудио с двумя пеликанами
Математику с токенами стоит проделать один раз, потому что показатель за миллион аудиотокенов — это не показатель за час, и эта разница удивила людей.
Аудиотокены создаются с фиксированной скоростью в секунду выходного аудио, поэтому стоимость масштабируется с длиной готового аудио, а не с длиной сценария. Возьмите собственную ставку Google для Flash TTS — $9.00 за миллион выходных аудиотокенов — и расчёт для часового готового материала укладывается в однозначные доллары на стандартном уровне, при этом модель Lite — две трети от этого. Цены Batch и Flex — $0.25 за вход и $4.50 за выход для Flash TTS против $0.25 и $3.00 для Flash-Lite TTS — ещё больше снижают её для всего, что не нужно генерировать по запросу. Priority — $0.90 и $16.00 — предназначен для той работы, которой действительно нужна генерация по запросу.
Три практических следствия:
• Перегенерировать абзац дёшево; перегенерировать серию — это уже решение. При таких расценках дорогая часть речевого конвейера перестаёт быть инференсом и снова становится человеком, который утверждает дубль.
• Ставка за ввод текста — это шум. $0.50 за миллион текстовых токенов для сценария в несколько тысяч слов — это ошибка округления по сравнению с аудиочастью. Не оптимизируйте сценарий под длину.
• Ценовой обрыв 31 декабря реален и удваивает тариф на аудио. Если вы планируете запуск в 2027 году, закладывайте в бюджет цифру после промоакции, а не стартовую, иначе в январе придётся пересматривать план.
Число, которое независимо, и те, которые нет.
Одна цифра в этом запуске пришла не из Google. Согласно данным Artificial Analysis Provider Voice Arena, зафиксированным 24 сентября 2026 года, Gemini 3.8 Flash TTS занимает 2-е место с Elo 1 260 по 1 999 образцам и 8 голосам арены, а Gemini 3.8 Flash-Lite TTS занимает 6-е место с 1 235 по 2 000 образцам. Оба находятся внутри доверительных интервалов друг друга при ±16 и ±17, так что таблица показывает, что они статистически неразличимы по предпочтениям, — а это по-настоящему полезный результат, потому что он означает, что более дешёвый вариант не хуже для слушателей на измеримую величину.
Всё остальное — это собственное утверждение Google, и так к нему и следует относиться: язык выразительности, количество языков, качество воспроизведения. Арена даёт вам рейтинг предпочтений и ничего больше. Она не говорит вам, как каждая из моделей справляется с 40-минутным сценарием без дрейфа, как она ведёт себя с именем собственным, которое никогда не видела, или что происходит со спроектированным голосом через неделю.

Модель Lite также служит лучшим аргументом в пользу того, что эта пара — настоящее разделение, а не маркетинговый уровень. Разрыв в 25 пунктов Elo, который укладывается в пределы погрешности, на фоне разрыва в цене в 33% — это форма решения, которое чувствительные к цене пайплайны должны почти всегда принимать в пользу Lite, — и форма решения, которое чувствительные к задержке пайплайны должны принимать в противоположном направлении, поскольку эти две модели различаются и по времени, и по стоимости.
Где это запускать, и честная версия этого ответа
OrcaRouter не размещает конечные точки Gemini 3.8 TTS. Об этом стоит сказать прямо, а не намекать на обратное, потому что полезное, что мы можем сказать об этих двух моделях, — это не то, что мы их обслуживаем (мы их не обслуживаем), а то, что снижение цены вендором, подобное изменению от 31 декабря, — именно такое событие, которое делает маршрутизацию оправданной.
OrcaRouter предоставляет более 200 моделей через один API-ключ по прайс-листу провайдера без наценки, так что вы платите ровно по тарифу вендора, и изменения в нем вступают в силу на нашей стороне в тот же день, а не в следующем расчетном периоде. Для речевого конвейера в процессе миграции, уровень отказоустойчивости важнее каталога: вы можете направить путь запроса на модель, которая еще оценивается, не ставя на карту производственный маршрут, потому что неудачный вызов может переключиться на что-то уже проверенное. DSL маршрутизации объединяет несколько моделей в один вызов для случаев, когда ни один голос не является достаточно хорошим, а объединение моделей отвечает на запрос с помощью панели, когда ответ важнее задержки.
Что касается самих моделей Gemini 3.8 TTS, вызывать их следует через собственный API Google и те интерфейсы, которые Google назвал 23 сентября. То, что эта пара делает с вашей архитектурой — один вызов для двух говорящих, стилизация как аннотация, голос, который можно описать, а не выбрать, — это та часть, которая переживёт стартовую скидку.
Что посмотреть дальше
Три вещи определят, станет ли это поколение качественным скачком или просто функцией.
Первое — дрейф. Никто не публиковал развёрнутую оценку того, сохраняет ли двухголосый путь идентичность на протяжении полного часа, и пока кто-нибудь этого не сделает, демо с pelican остаётся демо. Второе — время жизни голоса. Спроектированный голос, который истекает через неделю, — это прототип; голос, который можно заново вывести из сохранённой конфигурации, — это продукт, и ответ зависит от того, какой из двух идентификаторов вы сохраняете. Третье — что произойдёт после 31 декабря, когда закончится промо-тариф и почасовая стоимость речевого пайплайна за ночь удвоится.
Ни одно из них не видно в посте о запуске. Все три видны в документации — а именно на этом месте те, кто освещает запуск, перестают читать.
