Быстрая, экономичная модель синтеза речи от Google для генерации аудио в реальном времени, доступная через OrcaRouter.
google/gemini-3.1-flash-tts-preview — это модель преобразования текста в речь от Google, часть семейства Gemini Flash. Она принимает текстовый ввод и генерирует звуковой вывод речи. Модель…
Основная возможность — преобразование письменного текста в естественно звучащую речь. Модель разработана для скорости, используя архитектуру Flash для снижения задержки. Модель поддерживает несколько языков и голосов? Поддержка языков и голосов данной конкретной предварительной версии не описана в предоставленных фактах; вам следует обратиться к документации Google для получения актуальных сведений о голосовых опциях. Модель может обрабатывать различные текстовые входные данные, включая пунктуацию, числа и аббревиатуры, создавая речевой вывод, отражающий желаемый ритм и тон.
Оптимальные случаи использования включают любые приложения, где критична генерация речи с низкой задержкой: голосовые помощники в реальном времени, живое дублирование переводов, интерактивные чат-боты с голосовым выводом и автоматизированные телефонные системы. Также она отлично подходит для пакетной обработки, когда нужно быстро сгенерировать много коротких аудиоклипов. Создатели контента могут использовать её для динамических озвучек в видеоиграх или аудиокнигах. Поскольку стоимость вывода высока по сравнению с вводом, наиболее экономично это тогда, когда выходной аудиофайл является кратким.
Если ваш вариант использования включает генерацию очень длинного аудио (например, часы речи) или не требует низкой задержки, рассмотрите пакетную TTS модель с более низкой стоимостью вывода за токен. Для приложений, где преобладает объем ввода (например, много коротких запросов), дешевая стоимость ввода делает эту Flash модель привлекательной. Для сценариев, требующих очень высокого качества вывода — например, эмоционально выразительных персонажей — вы можете рассмотреть премиальные TTS модели от Google или других поставщиков. Всегда отслеживайте общий объем токенов и требования к задержке.
Будучи моделью Gemini Flash, этот вариант TTS оптимизирован для низкой задержки. Конкретные показатели задержки (например, время до первого аудиопакета) не указаны в доступных данных. На практике модели Flash часто отвечают в пределах сотен миллисекунд на короткие входные данные. Задержка может варьироваться в зависимости от длины вывода, условий сети и одновременной нагрузки запросов. Маршрутизация OrcaRouter может добавить минимальные накладные расходы. Для приложений реального времени тестируйте с ожидаемой длительностью аудио под нагрузкой.
Сильные стороны включают низкую стоимость ввода ($1.00/1M токенов), быструю генерацию и надежную инфраструктуру Google. Статус предварительного просмотра означает, что качество модели и доступность могут измениться. Ограничением является высокая стоимость вывода ($20.00/1M токенов) по сравнению с текстовыми моделями. Кроме того, качество выходного аудио — такое как естественность, разнообразие акцентов и просодия — здесь не оценивается. Вам следует оценить качество голоса модели для вашей конкретной области (например, технический жаргон, эмоциональный диапазон) перед развертыванием в производстве.
Оценки бенчмарков для google/gemini-3.1-flash-tts-preview не предоставлены в доступных данных. TTS-модели часто оцениваются по таким метрикам, как средняя оценка мнений (MOS) за естественность, частота ошибок в словах (WER) за разборчивость и процентили задержки. Без конкретных цифр вам следует провести собственную оценку, используя репрезентативные промпты, чтобы оценить качество и скорость относительно ваших требований. OrcaRouter не добавляет и не изменяет производительность модели.
Имеющиеся данные не указывают поддерживаемые языки или возможности акцентов для этого предварительного просмотра TTS. Более широкие модели TTS от Google обычно поддерживают несколько языков, но охват этого конкретного варианта неизвестен. Вам следует протестировать на многоязычном тексте, чтобы подтвердить качество вывода. Для английского языка производительность, вероятно, будет надежной, учитывая инвестиции Google. Для менее распространенных языков рассмотрите возможность обращения напрямую в Google или тестирования с образцом текста через API OrcaRouter.
Ценообразование соответствует официальным тарифам Google без наценки со стороны OrcaRouter. Входные токены (текст) стоят $1.00 за 1 миллион токенов. Выходные токены (аудио) стоят $20.00 за 1 миллион токенов. Выходные токены генерируются на единицу аудио; точное соотношение токенов и времени не указано. Вы оплачиваете как входные, так и выходные токены, использованные в каждом запросе. Дополнительные комиссии платформы или требования к минимальным расходам отсутствуют. Оплата производится через существующие способы оплаты OrcaRouter.
Входные токены в 20 раз дешевле выходных. Это стимулирует отправлять более длинные текстовые подсказки (в пределах лимитов токенов) для создания пропорционально более длинного аудиовыхода, так как стоимость входа остается низкой. Например, создание 1-минутного аудиоклипа может потреблять много выходных токенов по цене $20 за 1М, в то время как текстовая подсказка может стоить всего несколько центов. Оптимизируйте, делая вывод кратким, когда это возможно. Если ваш сценарий использования генерирует очень длинное аудио, стоимость вывода за запрос может быстро накапливаться.
Доступные факты не упоминают о программах кэширования или скидок для этой модели на OrcaRouter. Ценообразование OrcaRouter является транзитным по тарифам провайдера. Возможно, вам стоит уточнить в OrcaRouter возможность оптовых скидок или зарезервированной мощности, которые могут применяться к разным моделям. Поскольку стоимость выходных токенов высока, кэширование сгенерированных аудиосегментов для повторного использования (например, типовых ответов) может значительно снизить общие затраты.
Сравнения напрямую не предоставляются. Однако Google's Flash TTS позиционируется как экономически эффективный вариант для использования в реальном времени с низкой стоимостью ввода. Другие TTS-модели (например, OpenAI TTS, ElevenLabs) могут иметь иные структуры ценообразования — часто взимается плата за символ или за секунду аудио. Ценообразование этой модели за токен на выходе может быть более дорогим для очень длинного аудио, но дешевле для коротких, всплесковых генераций. Оцените ожидаемые объёмы токенов в сравнении с другими предложениями в каталоге OrcaRouter.
Используйте любой клиент, совместимый с OpenAI. Установите базовый URL на https://api.orcarouter.ai/v1, API ключ из вашей учетной записи OrcaRouter и идентификатор модели "google/gemini-3.1-flash-tts-preview". Отправьте запрос на завершение чата с сообщением пользователя, содержащим текст для озвучивания. Ответ будет включать аудиоконтент (вероятно, в виде закодированного в base64 фрагмента или URL). Точный формат вывода зависит от реализации модели от Google. Обратитесь к документации OrcaRouter для получения информации о поддержке потоковой передачи и разборе ответов.
Применяются стандартные параметры завершения чата: модель, сообщения (с ролью и содержимым) и, опционально, temperature или top_p для вариативности вывода (хотя для TTS это менее актуально). Для выбора голоса модель Google может поддерживать дополнительный параметр (например, имя голоса). В доступных фактах не указаны конкретные параметры TTS. Возможно, потребуется передать дополнительные поля, такие как "voice" или "language", в теле запроса. Обратитесь к документации API Google для предварительной версии модели для получения точных опций.
Для моделей TTS обычно поддерживается потоковое аудио, при котором аудио-чанки отправляются по мере их генерации. Предоставленные факты не подтверждают поддержку потоковой передачи для этой предварительной модели. Если потоковая передача включена, вы можете использовать параметр stream, установленный в true в вашем API-запросе, и обрабатывать чанки по мере их поступления. OrcaRouter поддерживает потоковую передачу для совместимых моделей. Проверьте с помощью простого запроса, возвращается ли аудио инкрементально или как полный блок.
Если вы уже используете API, совместимый с OpenAI, измените базовый URL на https://api.orcarouter.ai/v1 и обновите идентификатор модели. Обновите параметры запроса в соответствии со спецификациями Google TTS (например, имя голоса). Возможно, потребуется настроить обработку аудиовыхода, если формат отличается (например, MP3 vs WAV). Протестируйте на примерах запросов, чтобы проверить качество. Поскольку ценообразование без наценки, ваши затраты могут измениться в зависимости от использования токенов. Специальные инструменты для миграции не требуются.
OpenAI предлагает TTS-модели (tts-1, tts-1-hd) с посекундной тарификацией (~$0.015 за 1000 символов). В отличие от них, модель Google использует токенную систему ценообразования, которая может быть более экономичной для коротких входных данных, но дороже для длинных выходных. TTS от OpenAI поддерживает несколько голосов и языков; конкретные возможности предварительной версии Google пока не полностью известны. Задержка: как Flash, так и модели OpenAI спроектированы для низкой задержки. Качество субъективно; вам стоит протестировать на своем контенте, чтобы сравнить естественность и просодию.
Google также предоставляет премиум-модели TTS (например, WaveNet, Studio) через свой API Cloud Text-to-Speech. Эти модели обычно взимают плату за каждый символ отправленного текста, что может быть дешевле для очень длинных аудио, но имеет более высокую стоимость за запрос. Flash TTS работает быстрее и имеет более простое ценообразование на вход (за токен), но может иметь меньше вариантов голосов. Для высококачественной, эмоционально насыщенной речи может подойти премиум-модель. Для скорости и низкой стоимости за вход выгоднее вариант Flash.
Если вам нужен ответ в реальном времени и короткие входные тексты (множество мелких запросов), эта модель Flash с низкой стоимостью ввода и быстрой генерацией — идеальный выбор. Для генерации очень длинного аудио (например, полных аудиокниг) модель, взимающая плату за символ ввода (например, стандартный TTS от Google), может оказаться дешевле, так как стоимость выходных токенов отсутствует. Также учитывайте разнообразие голосов и поддержку языков: если вам требуется множество различных голосов, проверьте, поддерживает ли эта предварительная версия такую функцию. Протестируйте оба варианта на своей рабочей нагрузке, прежде чем принимать решение.
Совместимо с OpenAI — оставьте свой SDK
https://api.orcarouter.ai/v1voice| Ввод / 1M токенов | $1.00 |
| Вывод / 1M токенов | $20.00 |
| Валюта | USD |
Оценка по прайс-листу
Только оценка — фактическое число токенов зависит от токенизатора провайдера.
GET /api/public/models/google/gemini-3.1-flash-tts-previewОткрыть @misc{orcarouter_gemini_3_1_flash_tts_preview,
title = {google/gemini-3.1-flash-tts-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview}
}google. (n.d.). google/gemini-3.1-flash-tts-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview