
Gemini 3.8 TTS против VoxCPM2: арендовать голос или запустить собственный — в реальных цифрах
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
В таблице лидеров нет строки, в которой Gemini 3.8 Flash TTS и VoxCPM2 стоят рядом, и это отсутствие — самый полезный факт в этом сравнении. Gemini 3.8 Flash TTS — это хостинговый эндпоинт с Elo 1 260 на 2-м месте в Artificial Analysis Provider Voice Arena и опубликованным прайс-листом в токенах. VoxCPM2 — это чекпойнт OpenBMB — 2 миллиарда параметров, Apache 2.0, выпущен в апреле 2026 года — который не хостит ни один провайдер инференса. Его нельзя арендовать. Вы запускаете его сами.
Итак, вопрос не в том, какая модель звучит лучше. А в том, что лучше подходит для вашей рабочей нагрузки: платить за каждый символ за использование чужих GPU или владеть GPU и платить за них независимо от того, работают они или нет. Это вопрос арифметики, и, в отличие от большинства сравнений моделей, у него есть ответ, который можно вычислить ещё до того, как вы примете решение.

Одно из них вы арендуете, другое — эксплуатируете.
Начните с того, что каждый из них фактически вам даёт.
• Доступ — Gemini 3.8 Flash TTS существует только в виде API, вызывается через Gemini API и сервисы Google, названные в анонсе от 23 сентября 2026 года. У VoxCPM2 нет собственного эндпоинта, используемого в производственной эксплуатации, и нет провайдера инференса, который бы её обслуживал; сам чекпойнт и есть продукт.
• Лицензия — VoxCPM2 распространяется под Apache 2.0, которая разрешает коммерческое использование без отдельного соглашения. Это по-настоящему разрешительная лицензия, и она не является стандартом для открытых речевых весов: многие из них распространяются на условиях только для исследований, которые направляют коммерческое использование обратно через хостируемый API.
• Размер — VoxCPM2 содержит 2 млрд параметров и при пониженной точности помещается примерно в 8 ГБ видеопамяти для разработки, а пиковое потребление при обслуживании составляет около 22 ГБ на карте с 24 ГБ. Google не опубликовала данные о количестве параметров ни для одной из моделей Gemini 3.8 TTS.
• Создание голоса — Gemini 3.8 Flash TTS выполняет дизайн голоса по письменному описанию, репликацию голоса по 30-секундному образцу и диалог двух говорящих за один вызов. VoxCPM2 — одноголосная модель синтеза речи; разговор — это два запуска, сшитых вместе.
• Независимая оценка — у Flash TTS она есть. VoxCPM2 не фигурирует среди строк рейтинга на Provider Voice Arena по состоянию на 24 сентября 2026 года. Отсутствие в таблице — не приговор качеству: обычно это значит, что модель никто не заявил, — но это действительно значит, что нет сторонней оценки предпочтений, которую можно было бы учесть.

Этот последний довод работает в обе стороны, и его стоит назвать прямо, а не затушёвывать: если перед принятием решения вам нужен независимый сигнал качества, то только один из этих двух его даёт.
Число, которое решает всё: коэффициент реального времени
Самостоятельный хостинг речевой модели превращает счёт за символ в счёт за GPU-час, а обменный курс между этими двумя единицами — это коэффициент реального времени модели — сколько секунд вычислений требуется для создания одной секунды аудио.
Опубликованные показатели VoxCPM2 — 0,30 в обычном PyTorch и 0,13 под Nano-VLLM. Читайте их как пропускную способность, а не задержку: при 0,13 один GPU-час реального времени даёт примерно 7,7 часа готового аудио. При 0,30 тот же GPU-час даёт ближе к 3,3 часа. Это собственные цифры из карточки модели, измеренные OpenBMB, и они являются самым важным входным параметром для любого решения «создавать или покупать» в данном случае.
Из них следуют три вещи.
• Стек обслуживания важнее модели. Переход с обычного PyTorch на Nano-VLLM более чем удваивает пропускную способность на идентичном оборудовании. Любая модель затрат, построенная на показателе 0,30, завышает стоимость собственного хостинга примерно в 2,3 раза.
• Всё решает загрузка. Арендованный GPU, простаивающий 90% времени, не будет дешевле API ни при какой цене. Точка безубыточности появляется только тогда, когда вы держите карту занятой.
• Пакетная обработка снова меняет арифметику. Коэффициент реального времени измеряется для каждого потока; сервер, обрабатывающий одновременные запросы, распределяет фиксированные затраты между ними — и это как раз тот режим, где самостоятельный хостинг начинает выигрывать.
Сколько стоит час аудио, в обе стороны
Поместите обе модели выставления счетов на одну ось. Один час готового аудио — это 3 600 секунд на выходе.
Что касается арендуемого варианта, Google выставляет счёт в токенах, а не в символах: $0,50 за миллион входных текстовых токенов и $9,00 за миллион выходных аудиотокенов до 31 декабря 2026 года, затем $18,00; Flash-Lite TTS — $0,50 и $6,00, затем $12,00. Batch и Flex стоят $0,25 и $4,50 для Flash TTS против $0,25 и $3,00 для Flash-Lite TTS, а Priority — $0,90 и $16,00. Artificial Analysis нормализует стандартные тарифы до $16,50 и $11,00 за миллион символов; это пересчёт самого рейтинга, а не цитата от Google, и именно эту цифру следует использовать при сравнении с моделью, которая выставляет счёт в символах.
На стороне собственной инфраструктуры вообще нет ставки за символ. Стоимость — это GPU-час, умноженный на столько часов, сколько вам нужно при указанной выше пропускной способности, плюс стек обслуживания, плюс люди, которые поддерживают его работу. Преимущество VoxCPM2 в том, что предельная стоимость тысячного часа такая же, как и первого, — а недостаток в том, что предельная стоимость первого часа — это GPU.
Вот почему это решение на удивление однозначное:
• При объёме ниже определённого порога API выигрывает, и с большим отрывом. Вы платите менее десяти долларов за час аудио против капитальных затрат, а промо-тариф Google делает этот разрыв ещё шире вплоть до 1 января 2027 года.
• Выше этого объёма — на оборудовании, которое у вас уже есть и которое можно держать занятым, — чекпойнт Apache 2.0 безоговорочно побеждает; и, в отличие от чекпойнта с исследовательской лицензией, ничто в лицензии не мешает вам поставлять его.
• А если честно, то вы покупаете не экономию, а возможность выбора. Самостоятельный хостинг даёт возможность зафиксировать версию, хранить аудио на собственной инфраструктуре и перестать беспокоиться об изменении тарифов поставщика.
Где каждый из них — правильный ответ
Выбирайте Gemini 3.8 Flash TTS, если вам нужен более документированный продукт. У него есть независимая оценка, опубликованная цена, диалог двух говорящих за один вызов, проектирование и воспроизведение голоса, а также никакой операционной поверхности, кроме API-ключа. Его собрат Flash-Lite TTS даёт вторую ценовую точку в том же интерфейсе по нормализованной цене $11.00 за миллион символов. Взамен вы получаете тариф, который удваивается 1 января 2027 года, и отсутствие возможности запускать модель где-либо.
Выбирайте VoxCPM2, когда суть именно в операционной работе. Apache 2.0 означает, что коммерческое использование разрешено безоговорочно, размер 2B означает, что достаточно одного ускорителя, а коэффициент реального времени 0,13 под Nano-VLLM означает, что скромная карта выдаёт несколько часов аудио за час реального времени. Вы соглашаетесь с тем, что никто другой не будет запускать это за вас: ни хостингового эндпоинта, ни строки в арене, ни тарифной карты поставщика, и каждая гарантия качества, которую вы получаете, — это та, которую вы создаёте и измеряете сами.

Ни одна из этих моделей не размещается на OrcaRouter, и об этом стоит сказать прямо, а не намекать на обратное. Место для вызова Gemini 3.8 Flash TTS — это собственный API Google и поверхности, названные Google; VoxCPM2 — это контрольная точка, которую вы развёртываете. Что OrcaRouter покрывает — это слой над этим решением — более 200 моделей за одним ключом по цене из прайс-листа провайдера без наценки, так что изменение цены поставщиком отражается на нашей стороне в тот же день, а не в следующем расчётном цикле, автоматическое переключение при сбое так что модель, находящаяся на оценке, не обязана быть зависимостью в продакшене, и DSL маршрутизации, который объединяет несколько моделей в один вызов, когда одного голоса недостаточно для всей задачи.
Что посмотреть дальше
Две вещи существенно изменили бы это сравнение, и ни одна из них пока не произошла.
Первый — это кто-то, кто хостит VoxCPM2. Его отсутствие на рынке инференса — главная причина, по которой две модели сравнивают по экономике, а не по качеству: если провайдер его подхватит, арифметика «аренда против владения» перестанет быть решающим фактором, и отсутствующая строка в арене станет тем, что вы захотите заполнить.
Второе — январское изменение тарифов на стороне Google. По промо-тарифу API достаточно дёшев, чтобы большинству рабочих нагрузок не стоило разворачивать что-либо самостоятельно; после окончания промо-периода разрыв сокращается настолько, что команде с уже имеющимися GPU-мощностями и стабильным объёмом стоит заново всё просчитать, а не предполагать, что API по-прежнему выгоднее.
Пока не произойдёт одно из этих изменений, решающий фактор — не таблица лидеров. А то, сколько часов аудио в месяц вы производите, и занята ли карта.
