Сгенерированная hero-карточка для «Gemini 3.8 TTS vs VoxCPM2» на белом фоне с мягкими сине-голубыми градиентными акцентами. Левая карточка «Gemini 3.8 Flash TTS» содержит конечную точку API, Elo 1 260 на 2-м месте и $16,50 за 1 млн нормализованных символов; правая карточка «VoxCPM2» содержит Apache 2.0, 2 млрд параметров, примерно 8 ГБ видеопамяти для запуска, коэффициент реального времени 0,30 в чистом PyTorch и отсутствие хостингового эндпоинта. В нижнем колонтитуле написано: «Elo по данным Artificial Analysis Provider Voice Arena, сент. 2026 г.; показатели VoxCPM2 согласно его карточке модели». Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

Gemini 3.8 TTS против VoxCPM2: арендовать голос или запустить собственный — в реальных цифрах

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

В таблице лидеров нет строки, в которой Gemini 3.8 Flash TTS и VoxCPM2 стоят рядом, и это отсутствие — самый полезный факт в этом сравнении. Gemini 3.8 Flash TTS — это хостинговый эндпоинт с Elo 1 260 на 2-м месте в Artificial Analysis Provider Voice Arena и опубликованным прайс-листом в токенах. VoxCPM2 — это чекпойнт OpenBMB — 2 миллиарда параметров, Apache 2.0, выпущен в апреле 2026 года — который не хостит ни один провайдер инференса. Его нельзя арендовать. Вы запускаете его сами.

Итак, вопрос не в том, какая модель звучит лучше. А в том, что лучше подходит для вашей рабочей нагрузки: платить за каждый символ за использование чужих GPU или владеть GPU и платить за них независимо от того, работают они или нет. Это вопрос арифметики, и, в отличие от большинства сравнений моделей, у него есть ответ, который можно вычислить ещё до того, как вы примете решение.

A generated comparison scoreboard for Gemini 3.8 Flash TTS and VoxCPM2, showing access (a hosted API against self-hosted only), size (undisclosed against 2B parameters), licence (vendor terms against Apache 2.0), price ($16.50 per 1M characters against a GPU-hour cost), throughput (not applicable against a real-time factor of 0.13 to 0.30) and independent Elo (1,260 against none).

Одно из них вы арендуете, другое — эксплуатируете.

Начните с того, что каждый из них фактически вам даёт.

• Доступ — Gemini 3.8 Flash TTS существует только в виде API, вызывается через Gemini API и сервисы Google, названные в анонсе от 23 сентября 2026 года. У VoxCPM2 нет собственного эндпоинта, используемого в производственной эксплуатации, и нет провайдера инференса, который бы её обслуживал; сам чекпойнт и есть продукт.

• Лицензия — VoxCPM2 распространяется под Apache 2.0, которая разрешает коммерческое использование без отдельного соглашения. Это по-настоящему разрешительная лицензия, и она не является стандартом для открытых речевых весов: многие из них распространяются на условиях только для исследований, которые направляют коммерческое использование обратно через хостируемый API.

• Размер — VoxCPM2 содержит 2 млрд параметров и при пониженной точности помещается примерно в 8 ГБ видеопамяти для разработки, а пиковое потребление при обслуживании составляет около 22 ГБ на карте с 24 ГБ. Google не опубликовала данные о количестве параметров ни для одной из моделей Gemini 3.8 TTS.

• Создание голоса — Gemini 3.8 Flash TTS выполняет дизайн голоса по письменному описанию, репликацию голоса по 30-секундному образцу и диалог двух говорящих за один вызов. VoxCPM2 — одноголосная модель синтеза речи; разговор — это два запуска, сшитых вместе.

• Независимая оценка — у Flash TTS она есть. VoxCPM2 не фигурирует среди строк рейтинга на Provider Voice Arena по состоянию на 24 сентября 2026 года. Отсутствие в таблице — не приговор качеству: обычно это значит, что модель никто не заявил, — но это действительно значит, что нет сторонней оценки предпочтений, которую можно было бы учесть.

A screenshot of the Hugging Face model card for OpenBMB/VoxCPM2, showing the Apache 2.0 licence, the 2 billion parameter checkpoint size, the 30-language coverage, 48 kHz output and the 2 million hours of training audio recorded on the card.

Этот последний довод работает в обе стороны, и его стоит назвать прямо, а не затушёвывать: если перед принятием решения вам нужен независимый сигнал качества, то только один из этих двух его даёт.

Число, которое решает всё: коэффициент реального времени

Самостоятельный хостинг речевой модели превращает счёт за символ в счёт за GPU-час, а обменный курс между этими двумя единицами — это коэффициент реального времени модели — сколько секунд вычислений требуется для создания одной секунды аудио.

Опубликованные показатели VoxCPM2 — 0,30 в обычном PyTorch и 0,13 под Nano-VLLM. Читайте их как пропускную способность, а не задержку: при 0,13 один GPU-час реального времени даёт примерно 7,7 часа готового аудио. При 0,30 тот же GPU-час даёт ближе к 3,3 часа. Это собственные цифры из карточки модели, измеренные OpenBMB, и они являются самым важным входным параметром для любого решения «создавать или покупать» в данном случае.

Из них следуют три вещи.

• Стек обслуживания важнее модели. Переход с обычного PyTorch на Nano-VLLM более чем удваивает пропускную способность на идентичном оборудовании. Любая модель затрат, построенная на показателе 0,30, завышает стоимость собственного хостинга примерно в 2,3 раза.

• Всё решает загрузка. Арендованный GPU, простаивающий 90% времени, не будет дешевле API ни при какой цене. Точка безубыточности появляется только тогда, когда вы держите карту занятой.

• Пакетная обработка снова меняет арифметику. Коэффициент реального времени измеряется для каждого потока; сервер, обрабатывающий одновременные запросы, распределяет фиксированные затраты между ними — и это как раз тот режим, где самостоятельный хостинг начинает выигрывать.

Сколько стоит час аудио, в обе стороны

Поместите обе модели выставления счетов на одну ось. Один час готового аудио — это 3 600 секунд на выходе.

Что касается арендуемого варианта, Google выставляет счёт в токенах, а не в символах: $0,50 за миллион входных текстовых токенов и $9,00 за миллион выходных аудиотокенов до 31 декабря 2026 года, затем $18,00; Flash-Lite TTS — $0,50 и $6,00, затем $12,00. Batch и Flex стоят $0,25 и $4,50 для Flash TTS против $0,25 и $3,00 для Flash-Lite TTS, а Priority — $0,90 и $16,00. Artificial Analysis нормализует стандартные тарифы до $16,50 и $11,00 за миллион символов; это пересчёт самого рейтинга, а не цитата от Google, и именно эту цифру следует использовать при сравнении с моделью, которая выставляет счёт в символах.

На стороне собственной инфраструктуры вообще нет ставки за символ. Стоимость — это GPU-час, умноженный на столько часов, сколько вам нужно при указанной выше пропускной способности, плюс стек обслуживания, плюс люди, которые поддерживают его работу. Преимущество VoxCPM2 в том, что предельная стоимость тысячного часа такая же, как и первого, — а недостаток в том, что предельная стоимость первого часа — это GPU.

Вот почему это решение на удивление однозначное:

• При объёме ниже определённого порога API выигрывает, и с большим отрывом. Вы платите менее десяти долларов за час аудио против капитальных затрат, а промо-тариф Google делает этот разрыв ещё шире вплоть до 1 января 2027 года.

• Выше этого объёма — на оборудовании, которое у вас уже есть и которое можно держать занятым, — чекпойнт Apache 2.0 безоговорочно побеждает; и, в отличие от чекпойнта с исследовательской лицензией, ничто в лицензии не мешает вам поставлять его.

• А если честно, то вы покупаете не экономию, а возможность выбора. Самостоятельный хостинг даёт возможность зафиксировать версию, хранить аудио на собственной инфраструктуре и перестать беспокоиться об изменении тарифов поставщика.

Где каждый из них — правильный ответ

Выбирайте Gemini 3.8 Flash TTS, если вам нужен более документированный продукт. У него есть независимая оценка, опубликованная цена, диалог двух говорящих за один вызов, проектирование и воспроизведение голоса, а также никакой операционной поверхности, кроме API-ключа. Его собрат Flash-Lite TTS даёт вторую ценовую точку в том же интерфейсе по нормализованной цене $11.00 за миллион символов. Взамен вы получаете тариф, который удваивается 1 января 2027 года, и отсутствие возможности запускать модель где-либо.

Выбирайте VoxCPM2, когда суть именно в операционной работе. Apache 2.0 означает, что коммерческое использование разрешено безоговорочно, размер 2B означает, что достаточно одного ускорителя, а коэффициент реального времени 0,13 под Nano-VLLM означает, что скромная карта выдаёт несколько часов аудио за час реального времени. Вы соглашаетесь с тем, что никто другой не будет запускать это за вас: ни хостингового эндпоинта, ни строки в арене, ни тарифной карты поставщика, и каждая гарантия качества, которую вы получаете, — это та, которую вы создаёте и измеряете сами.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and 8 arena voices, with Gemini 3.8 Flash-Lite TTS at rank 6 and no VoxCPM2 row on the board.

Ни одна из этих моделей не размещается на OrcaRouter, и об этом стоит сказать прямо, а не намекать на обратное. Место для вызова Gemini 3.8 Flash TTS — это собственный API Google и поверхности, названные Google; VoxCPM2 — это контрольная точка, которую вы развёртываете. Что OrcaRouter покрывает — это слой над этим решением — более 200 моделей за одним ключом по цене из прайс-листа провайдера без наценки, так что изменение цены поставщиком отражается на нашей стороне в тот же день, а не в следующем расчётном цикле, автоматическое переключение при сбое так что модель, находящаяся на оценке, не обязана быть зависимостью в продакшене, и DSL маршрутизации, который объединяет несколько моделей в один вызов, когда одного голоса недостаточно для всей задачи.

Что посмотреть дальше

Две вещи существенно изменили бы это сравнение, и ни одна из них пока не произошла.

Первый — это кто-то, кто хостит VoxCPM2. Его отсутствие на рынке инференса — главная причина, по которой две модели сравнивают по экономике, а не по качеству: если провайдер его подхватит, арифметика «аренда против владения» перестанет быть решающим фактором, и отсутствующая строка в арене станет тем, что вы захотите заполнить.

Второе — январское изменение тарифов на стороне Google. По промо-тарифу API достаточно дёшев, чтобы большинству рабочих нагрузок не стоило разворачивать что-либо самостоятельно; после окончания промо-периода разрыв сокращается настолько, что команде с уже имеющимися GPU-мощностями и стабильным объёмом стоит заново всё просчитать, а не предполагать, что API по-прежнему выгоднее.

Пока не произойдёт одно из этих изменений, решающий фактор — не таблица лидеров. А то, сколько часов аудио в месяц вы производите, и занята ли карта.