Google Gemini 2.5 Pro предварительная версия с TTS, доступ через OrcaRouter без наценки.
google/gemini-2.5-pro-preview-tts — это предварительная модель преобразования текста в речь от Google, построенная на основе Gemini 2.5 Pro. Она преобразует текстовый ввод в речевой аудиовыход.…
Основная возможность google/gemini-2.5-pro-preview-tts заключается в преобразовании письменного текста в произносимую речь. Он построен на Google Gemini 2.5 Pro, что предполагает сильное понимание языка, обеспечивающее естественную фразировку, правильную интонацию и чёткое произношение. Модель принимает только текстовый ввод, поэтому с точки зрения ввода она не мультимодальна. Она не обрабатывает аудиоввод, изображения или видео. Результат, скорее всего, представляет собой аудио в стандартном цифровом формате. Как TTS-модель, она может работать с несколькими языками, но конкретная поддержка языков для этой предварительной версии не раскрыта. Она оптимизирована для генерации речи, а не для других возможностей Gemini 2.5 Pro, таких как рассуждение или генерация кода.
Модель отлично подходит для приложений, требующих преобразования письменного текста в естественно звучащую речь. Лучшие варианты использования включают голосовых помощников, где помощник зачитывает ответы вслух, автоматическое озвучивание аудиокниг и подкастов, функции доступности, которые зачитывают текст на экране для слабовидящих пользователей, и системы обслуживания клиентов, предоставляющие голосовые ответы. Её также можно использовать для приложений по изучению языков, где моделируется правильное произношение, или для генерации голосового контента из RSS-каналов или статей. Из-за статуса предварительной версии рекомендуется тщательно протестировать её для вашего конкретного языка, области или стилистических требований перед принятием решения о масштабном развертывании.
Хотя google/gemini-2.5-pro-preview-tts обеспечивает премиальное качество TTS, он может быть избыточным для простых звуковых сигналов или уведомлений, а также для приложений, где критична низкая задержка, но время обработки модели превышает возможности выделенных TTS-чипов. Если вам нужна лишь базовая монотонная речь или очень большой объем при строгих бюджетных ограничениях, более легкая TTS-модель (например, от других провайдеров на OrcaRouter) с меньшей стоимостью за токен может оказаться предпочтительнее. Кроме того, если ваш сценарий требует потоковой передачи в реальном времени с минимальной задержкой, оцените, соответствует ли предварительная модель Gemini вашим требованиям по скорости, так как более крупные модели могут увеличить задержку при выдаче первого токена.
На момент предварительного выпуска модели Google не опубликовал конкретных показателей производительности для варианта gemini-2.5-pro-preview-tts. Базовая модель Gemini 2.5 Pro продемонстрировала высокую производительность в задачах понимания языка и рассуждения, но показатели качества речи варианта TTS (например, средняя оценка мнений, частота ошибок слов) не были опубликованы публично. Без официальных тестов OrcaRouter рекомендует оценивать модель на собственном наборе текстовых входных данных, измеряя субъективное качество аудио, задержку и надежность под нагрузкой. Для принятия решений в производственной среде проведите собственные A/B-сравнения с другими TTS-сервисами.
Конкретные показатели задержки для google/gemini-2.5-pro-preview-tts не были публично раскрыты. Как модель TTS, основанная на архитектуре большой языковой модели, она может демонстрировать более высокую задержку по сравнению со специализированными нейросетевыми TTS-моделями, оптимизированными для потоковой передачи в реальном времени. Факторы, влияющие на скорость, включают длину входного текста, время внутренней обработки модели и сетевой обход до конечных точек OrcaRouter. Для приложений, где критична низкая задержка (например, диалоговый ИИ), протестируйте эту модель с типичной длиной входных данных, чтобы оценить её пригодность. Рассмотрите возможность использования потоковой или фрагментированной генерации текста, если API это поддерживает.
Strengths: Built on Google's advanced Gemini 2.5 Pro architecture, it likely produces highly natural, expressive speech with good prosody and pronunciation. Access via OrcaRouter's OpenAI-compatible API simplifies integration. No markup on provider pricing makes it cost-predictable. Limitations: Input modality is text-only; it cannot process audio or other modalities. Being a preview, it may have undiscovered edge cases or inconsistent quality. The context window size is unknown, restricting the length of text that can be converted in a single request. Output format details are not provided. It is not designed for tasks like speech recognition or voice cloning.
Цены на google/gemini-2.5-pro-preview-tts основываются на использовании токенов: $1.00 за 1 миллион входных токенов и $20.00 за 1 миллион выходных токенов. Входные токены включают текстовый запрос и любые инструкции. Выходные токены представляют сгенерированное аудио. OrcaRouter выставляет счета по точной ставке провайдера без наценки, то есть вы платите только то, что взимает Google, плюс любые применимые налоги. Нет минимальных обязательств или ежемесячных платежей. Использование измеряется по каждому запросу и суммируется в вашем счете OrcaRouter. Поскольку количество выходных токенов TTS может быть большим (аудио более плотное по токенам, чем текст), стоимость вывода является основным расходом.
Цена выходных токенов ($20 за 1M) значительно выше, чем цена входных токенов ($1 за 1M). Это типично для генеративных моделей, поскольку выходные токены требуют больше вычислительных ресурсов. Для text-to-speech аудиовыход представляется в виде последовательности токенов, и преобразование текста в речь включает генерацию длинной последовательности аудиотокенов. Общая стоимость конкретной задачи зависит от длины выходного аудио относительно входного текста. Если вам нужно генерировать длинные отрезки речи (например, полную аудиокнигу), затраты могут накапливаться. Для коротких запросов (например, одного предложения) затраты минимальны. Отслеживайте использование токенов, чтобы прогнозировать затраты.
Нет, OrcaRouter не добавляет никакой наценки к тарифам провайдера для google/gemini-2.5-pro-preview-tts. Указанные цены: $1.00 за 1M входных токенов и $20.00 за 1M выходных токенов — это именно то, что взимает Google. OrcaRouter передает их вам напрямую. Это согласуется с моделью ценообразования OrcaRouter для многих моделей, где платформа выступает в качестве прозрачного прокси. Вы платите только за потребленные токены. Любые дополнительные функции, такие как кэширование или премиум-поддержка, могут взиматься отдельно, но базовая стоимость за токен не имеет наценки.
Для использования google/gemini-2.5-pro-preview-tts отправляйте запросы к совместимому с OpenAI API OrcaRouter по базовому URL https://api.orcarouter.ai/v1. В вызовах API используйте ID модели 'google/gemini-2.5-pro-preview-tts'. Формат запроса соответствует стандартной структуре чат-завершений OpenAI с полем 'model', массивом 'messages', содержащим ваш текстовый запрос (с ролью system и/или user), а также стандартными параметрами, такими как temperature и max_tokens. Ответ будет содержать сгенерированные аудиотокены, которые ваш клиент может декодировать для воспроизведения речи. Аутентификация осуществляется с помощью API-ключа, предоставляемого OrcaRouter.
API поддерживает стандартные параметры, совместимые с OpenAI, включая 'model', 'messages' (массив объектов с role и content), 'temperature' (для управления вариативностью аудиовыхода), 'max_tokens' (для ограничения длины генерируемого аудио) и 'top_p'. Как TTS-модель, могут быть дополнительные параметры для стиля голоса или скорости, но они не задокументированы в доступных фактах. Обратитесь к документации API OrcaRouter для получения последних поддерживаемых полей. Параметр 'response_format' может позволять указать кодировку аудио (например, wav или mp3). Если это не поддерживается по умолчанию, вам может потребоваться декодировать возвращаемый поток токенов.
Если вы в настоящее время используете другой сервис TTS (например, Google Cloud Text-to-Speech, Amazon Polly), миграция на google/gemini-2.5-pro-preview-tts через OrcaRouter включает обновление вашего API-эндпоинта и формата запросов. OrcaRouter использует совместимые с OpenAI эндпоинты, поэтому вам потребуется перейти с SDK конкретного провайдера на SDK, совместимый с OpenAI. Замените ваш текущий базовый URL на https://api.orcarouter.ai/v1, используйте идентификатор модели 'google/gemini-2.5-pro-preview-tts' и адаптируйте тела ваших запросов в соответствии со схемой чат-комплетий. Возможно, вам потребуется изменить способ обработки ответа: вместо получения аудиофайлов напрямую вы будете получать токенизированный вывод, который нужно декодировать. Протестируйте с образцами входных данных.
Аутентификация выполняется путем включения ключа API в заголовок Authorization (формат: Bearer YOUR_API_KEY). Вы получаете ключ API из своей учетной записи OrcaRouter. Лимиты запросов устанавливаются OrcaRouter на основе вашего тарифа; они не совпадают с лимитами Google. Для использования с высоким объемом запросов свяжитесь с OrcaRouter для корректировки лимитов. Предварительная модель может иметь дополнительные ограничения со стороны Google – если вы сталкиваетесь с ошибками, такими как 'model not available', проверьте, что ваш тариф OrcaRouter включает эту модель. Для этой модели не указаны конкретные лимиты запросов, но рекомендуются стандартные лучшие практики (повторные попытки с экспоненциальной отсрочкой).
google/gemini-2.5-pro-preview-tts — это специализированная вариация семейства Gemini 2.5 Pro, адаптированная для синтеза речи. Другие модели Gemini 2.5 Pro являются универсальными и работают с текстом, изображениями, аудио и видео; они не поддерживают непосредственную генерацию речевого вывода. Данная TTS-вариация исключает мультимодальный ввод и фокусируется на генерации аудио из текста. Вероятно, она использует ту же базовую языковую модель для проходии и темпа, но не подходит для рассуждений, программирования или мультимодального анализа. Если вам нужны возможности TTS без отказа от мультимодального ввода, следует комбинировать стандартную модель Gemini с отдельным TTS-конвейером. Предварительная версия TTS предлагает более упрощённый конвейер.
OrcaRouter предоставляет доступ к TTS-моделям от различных провайдеров. Эта модель от Google основана на архитектуре большой языковой модели, что может обеспечивать более естественную и контекстно-осознанную речь по сравнению с более старыми конкатенативными или параметрическими TTS-системами. Однако она может быть медленнее и дороже за токен по сравнению со специализированными нейронными TTS-моделями, разработанными для низкой задержки и высокой пропускной способности. Многие популярные TTS-сервисы взимают плату за символ или за секунду аудио, а не за токен, что затрудняет прямое сравнение стоимости. Для производственных развертываний, требующих чрезвычайно низкой стоимости, могут быть предпочтительнее специализированные TTS-модели. Модель Google лучше всего подходит для случаев использования, где наивысшее качество вывода оправдывает более высокую стоимость выходных токенов.
Выберите эту модель, если вам нужно качество речи самого высокого уровня от новейшей архитектуры Gemini от Google и вы хотите получить к ней доступ через стандартный API, совместимый с OpenAI, без управления учетными данными Google Cloud. Ценообразование с нулевой наценкой обеспечивает прозрачность. Она идеально подходит для приложений, где естественность имеет решающее значение, таких как разговорный ИИ или повествовательный контент. Статус предварительной версии позволяет проводить ранние эксперименты для оценки ее качества в вашей области. Однако, если вам требуется потоковая передача в реальном времени с задержкой менее 100 мс, возможно, лучше подойдет выделенная модель TTS для потоковой передачи. Кроме того, если ваш бюджет ограничен, проверьте потребление выходных токенов для типичных сценариев использования, чтобы убедиться, что стоимость приемлема.
Совместимо с OpenAI — оставьте свой SDK
https://api.orcarouter.ai/v1voice| Ввод / 1M токенов | $1.00 |
| Вывод / 1M токенов | $20.00 |
| Валюта | USD |
Оценка по прайс-листу
Только оценка — фактическое число токенов зависит от токенизатора провайдера.
О чём говорят разработчики на этой неделе
GET /api/public/models/google/gemini-2.5-pro-preview-ttsОткрыть @misc{orcarouter_gemini_2_5_pro_preview_tts,
title = {google/gemini-2.5-pro-preview-tts API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts}
}google. (n.d.). google/gemini-2.5-pro-preview-tts API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts