VoxCPM2-1
Engineering & Research

VoxCPM2: 900 000 загрузок в месяц, а Transformers до сих пор не могут его загрузить

Автор

Jim Song

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Метаданные Hugging Face для VoxCPM2 указывают в качестве библиотеки voxcpm — а не transformers. Одно это поле объясняет странный пробел в мире open-source речевых технологий прямо сейчас: модель синтеза речи OpenBMB с 2 млрд параметров набрала 900 282 загрузки за последние тридцать дней, породила 25 публичных файнтюнов, 10 квантованных версий, 7 адаптеров и более 100 Spaces, и при этом её до сих пор нельзя загрузить с помощью библиотеки, через которую загружается почти любая другая модель на этом сайте. Pull request, призванный исправить это, был открыт 4 августа 2026 года и остаётся открытым до сих пор.

Этот разрыв стоит понять до того, как выйдет исправление, потому что он определяет, во сколько вам обойдётся интеграция этой модели на этой неделе по сравнению со следующим кварталом. И за этим стоит более интересный вопрос: действительно ли VoxCPM2 настолько опережает остальных, как следует из публикаций. Всё нижеследующее взято из трёх первоисточников: openbmb/VoxCPM2 и метаданные репозитория, README OpenBMB/VoxCPM на GitHub и технический отчёт VoxCPM2 (arXiv:2606.06928, подан 5 июня 2026 года). Все приведённые в этой статье показатели бенчмарков принадлежат OpenBMB и получены самой OpenBMB, причём — как говорится в самой статье о её основной сравнительной таблице — конкурирующие цифры в ней скопированы из других работ, а не получены повторным прогоном в сопоставимых условиях. Насколько нам удалось выяснить, ни одна независимая лаборатория не опубликовала воспроизведение ни одного из этих результатов.

Технические характеристики — на одном экране

VoxCPM2 был выпущен в апреле 2026 года (репозиторий на Hugging Face был создан 3 апреля, последнее обновление — 16 апреля) как третье поколение линейки VoxCPM. По сравнению со своим непосредственным предшественником:

Размер — 2B параметров против 0.8B backbone у VoxCPM1.5 и 0.6B backbone у VoxCPM-0.5B.

Языки — 30 плюс 9 китайских диалектов, тогда как в обеих более ранних версиях были только китайский и английский.

Аудио — принимает опорный сигнал 16 кГц, выдаёт 48 кГц, тогда как у VoxCPM1.5 на входе и выходе симметричная частота 44,1 кГц.

Базовая модель — MiniCPM-4-1B (28 слоёв, ширина 2048) в качестве текстово-семантической языковой модели, по сравнению с MiniCPM-4-0.5B (24 слоя, ширина 1024).

Бюджет последовательности — 8192 токена при скорости токенов языковой модели 6,25 Гц, что составляет примерно 20 минут аудио в одном контексте.

Стоимость секунды речи — коэффициент реального времени 0.30 в обычном PyTorch и 0.13 через Nano-vLLM на одной RTX 4090, при примерно 8 ГБ видеопамяти. VoxCPM1.5 достиг 0.15 при 0.8B и 6 ГБ.

Лицензия — Apache-2.0 на веса, код дообучения и инструменты инференса. Никаких барьеров, никаких оговорок о допустимом использовании, коммерческое использование разрешено.

Обучающие данные — «более 2 миллионов часов» многоязычной речи, без указания корпуса и происхождения.

Прочитайте строку RTF дважды, потому что она работает в обратную сторону. VoxCPM2 примерно вдвое медленнее на секунду генерируемого аудио, чем модель 0.8B, которую она заменяет, и требует на треть больше VRAM. Модель 2B не добавила пропускной способности; она добавила языки и контроль, и ценой за это стала задержка. Если вы запускаете агента в реальном времени, именно этот компромисс нужно оценить в первую очередь.

Что на самом деле меняет PR #47756

Сегодня запуск VoxCPM2 означает установку собственного пакета OpenBMB — pip install voxcpm, Python 3.10–3.12, PyTorch 2.5 или новее, CUDA 12 или новее — и загрузку модели через VoxCPM.from_pretrained вызов, который не имеет ничего общего с API Transformers. Всё, что строится поверх этого решения, — самодельное: свой батчинг, своя серверная обвязка, своя обработка пяти режимов генерации.

Текущая работа изменит это. Issue #47695, «Добавить нативную поддержку OpenBMB VoxCPM2», был заведён 31 июля. PR #47756, «Поддержка VoxCPM2», появился следом 4 августа и в последний раз обновлялся 5 августа. Он несёт метку «New model» и добавляет модульную конфигурацию и реализацию модели, собственный токенизатор и процессор, кодирование и декодирование AudioVAE со стримингом, обусловливание по референсному голосу, продолжение по аудио-промпту, регистрации в auto-классах и элемент конвейера text-to-waveform — при этом сообщается об успешном прохождении 64 тестов модели. Он построен поверх PR #47736, который добавляет сам MiniCPM4; текстовый бэкбон должен попасть в основную ветку раньше, чем речевая модель, которая его оборачивает.

VoxCPM2-2

Два обстоятельства заслуживают внимания, и оба говорят не в пользу оптимизма. Во-первых, все три пункта — issue и оба pull request — были открыты одним и тем же индивидуальным контрибьютором из сообщества, а не OpenBMB и не мейнтейнером Hugging Face. За этим не стоит обязательств со стороны вендора, а значит, нет и сроков, на которые можно рассчитывать. Во-вторых, стек из двух PR с 203 коммитами, затрагивающими новую модальность, — это не быстрое ревью. PR с новыми моделями в Transformers обычно занимают недели итераций с мейнтейнерами, а в этом на данный момент всего четыре комментария.

Практический вывод: если нативный класс Transformers является несущим для вашей архитектуры — потому что вы стандартизировались на AutoModel, или потому что ваш серверный слой понимает только Transformers — VoxCPM2 не готов для вас, и даты нет. Если вы можете жить внутри voxcpm-пакета, модель полностью пригодна для использования уже сегодня, и экосистема явно проголосовала за то, что это терпимо: 900 282 загрузки произошли при полном отсутствии нативной поддержки. Существует также средний путь, который большинство обзоров упускает. OpenBMB поставляет интеграцию vLLM-Omni, предоставляющую совместимый с OpenAI /v1/audio/speech конечную точку, а также сборку llama.cpp-omni с весами GGUF, которая работает на CPU, Metal, CUDA или Vulkan вообще без зависимости от Python. Если на самом деле вам нужен был от Transformers стандартный интерфейс обслуживания, а не сам класс, то он уже существует.

"Без токенизатора" не означает "неквантизованный"

Фраза в каждом заголовке об этой модели — та, которую чаще всего читают неправильно. В VoxCPM2 нет внешнего дискретного аудиокодека — между языковой моделью и формой волны не находится выученный словарь речевых токенов, как в линейках CosyVoice или Moshi. Это утверждение, и оно верно.

{{1}}В модели всё ещё присутствует квантование.{{/1}} Магистраль использует дифференцируемое полудискретное узкое место на основе Finite Scalar Quantization, и в статье его роль описана явно: {{2}}текстово-семантическая языковая модель порождает скрытые состояния, FSQ покомпонентно скалярно квантует их в «семантический скелет»,{{/2}} {{3}}резидуальная акустическая языковая модель восстанавливает мелкие детали, отброшенные FSQ,{{/3}} а {{4}}локальный диффузионный трансформер превращает оба потока обусловливания в следующий непрерывный латентный патч с помощью flow matching.{{/4}} Четыре стадии, обозначенные сокращениями LocEnc, TSLM, RALM и LocDiT, — это ровно та самая цепочка.

Различие, которое важно на практике, — это не «квантованное против неквантованного». Важно то, что узкое место обучается сквозным образом вместе со всем окружением, а не замораживается заранее как отдельный кодек с собственной функцией потерь. Именно это устраняет обычный режим отказа, когда языковая модель учится предсказывать токены, которые кодек не может точно декодировать. VoxCPM2 расширил это FSQ-узкое место с 256 до 512 измерений и заменил прежнее поэлементное суммирование, подаваемое в остаточную модель, обучаемой конкатенацией-проекцией — небольшие изменения, и среди немногих в отчёте, подкреплённые заявленным механизмом, а не разницей в бенчмарках.

Выходной сигнал 48 кГц частично выдуман, и это задумано.

«48 кГц студийного качества» — самая цитируемая характеристика модели и одновременно самая неправильно понимаемая. AudioVAE V2 асимметричен: энкодер работает на частоте 16 кГц, декодер восстанавливает сигнал на 48 кГц. В статье это называется «неявным суперразрешением», что честно отражает суть.

Следуйте за последствием. Энкодер с частотой 16 кГц имеет потолок Найквиста 8 кГц, поэтому ничто выше 8 кГц в вашем эталонном аудио никогда не достигает модели. Каждый бит энергии в двух верхних октавах выходного сигнала — воздух в голосе, сибилянты, яркость краёв тарелок — генерируется декодером из правдоподобного априорного распределения, а не переносится из голоса, который вы клонировали. Для большинства задач озвучки и работы с агентами это незаметно или является улучшением, потому что хорошее обученное априорное распределение лучше жёсткой полки на 8 кГц. Для тех, чья работа — точность воспроизведения конкретного записанного голоса, это факт, который нужно учитывать при проектировании, и это не то, что выявит прослушивание на колонках вашего ноутбука.

Обоснование в статье — самый убедительный инженерный аргумент во всём отчёте, и его стоит повторить, потому что это не маркетинг: сохранение энкодера на 16 кГц позволяет OpenBMB целиком использовать исходный обучающий корпус VoxCPM с частотой 16 кГц, устраняет скрытое рассогласование между источниками, записанными с разной частотой дискретизации, и позволяет избежать взрывного роста длины последовательности, который более высокая входная частота навязала бы авторегрессионному циклу. Повышение частоты только декодера даёт верность выходного сигнала, не требуя платы за это в дорогой части модели. Это хороший компромисс, выбранный осознанно. Это также означает, что пользователи VoxCPM1.5 переходят с энкодера 44,1 кГц на энкодер 16 кГц — понижение на входе, упакованное в повышение на выходе. Собственная таблица реконструкции OpenBMB показывает суть этого: кодек VoxCPM1.5 по-прежнему даёт лучшую полнодиапазонную мел-дистанцию среди трёх поколений — 1.139 против 1.335 у AudioVAE V2, — потому что он работает нативно на высокой частоте дискретизации, а не восстанавливает сигнал до неё.

Читая табло OpenBMB так, как это написал OpenBMB

Конкурентоспособный, а не первый

На бенчмарке Seed-TTS-Eval, стандартном тесте нулевого клонирования голоса, VoxCPM2 показывает 1,84% частоту ошибок в словах (WER) с 75,3% схожести голоса на английском наборе данных, 0,97% частоту ошибок в символах (CER) с 79,5% схожести на китайском наборе и 8,13% CER с 75,3% схожести на сложном китайском поднаборе. В самой статье этот результат охарактеризован словом «конкурентоспособный», и таблица подтверждает именно это, а не более громкие формулировки, циркулирующие вокруг.

VoxCPM2-3

Среди систем с открытым исходным кодом в той же таблице Fish Audio S2 показывает лучший показатель ошибок на всех трёх подмножествах (0.99 / 0.54 / 5.99). Qwen3-TTS превосходит её по WER на английском (1.23). А LongCat-Audio-DiT обходит её сразу в пяти из шести позиций — 1.50 WER и 78.6 сходства на английском, 81.8 сходства на китайском, 6.04 CER и 79.7 сходства на сложном китайском. Где VoxCPM2 действительно выделяется — так это в балансе: это одна из очень немногих систем, которая одновременно находится у верхней границы по сходству и показывает достойную разборчивость, и единственная в этом списке, кто также занимается дизайном голоса на естественном языке. Но «самая передовая технология» — это не то, что демонстрирует её собственная основная таблица, и честная оценка заключается в том, что перед нами сильный универсал, а не лидер бенчмарков.

В 3.3 раза больше параметров почти не повысили разборчивость.

Самая полезная строка в этой таблице — та, которую никто не цитирует. VoxCPM-0.5B, первое поколение 0.6B от сентября 2025 года, показывает 1,85% WER для английского и 0,93% CER для китайского. VoxCPM2 с 2B показывает 1,84% и 0,97%. В пределах шума для английского и немного хуже для китайского.

Что дополнительные параметры дают на самом деле, видно в колонках схожести и больше нигде: английский SIM вырос с 72,9 до 75,3, китайский — с 77,2 до 79,5. Всё остальное, что даёт 2B, целиком остаётся за рамками этого бенчмарка — ещё 28 языков, дизайн голоса по текстовому описанию, клонирование с управляемым стилем, выход 48 кГц. Это немало, и это честный аргумент в пользу апгрейда. Но если ваша задача — клонирование английской или китайской речи и вы выбираете по частоте ошибок, VoxCPM2 не даёт вам ничего, чего уже не давала бы модель 0.6B, при тройном объёме весов и двойной задержке. Любопытно, что VoxCPM1.5 — худшая из трёх на этом бенчмарке (2,12 / 1,18), из-за чего прогрессия семейства выглядит не как лестница, а как три разных продукта.

Одна модель, две оценки, разница на порядок

Именно здесь требуется осторожность, поскольку два многоязычных результата в этом отчёте резко противоречат друг другу, и оба цитируются так, будто окончательно решают вопрос.

Ключевой показатель — средняя частота ошибок 1,68% на 30 языках. Эти данные получены из тестового набора, созданного самой OpenBMB — 500 высказываний на каждый язык — и оценённого с помощью Gemini 3.1 Flash Lite в качестве распознавателя. На нём VoxCPM2 показывает: английский — 0,42, китайский — 0,92, хинди — 0,79, арабский — 1,23.

В отчете также прогоняется MiniMax-MLS-Test — сторонний набор из 24 языков, оценённый с помощью Whisper-large-v3. Та же модель. Там VoxCPM2 показывает по хинди 19.70 и по арабскому 13.05 — в двадцать пять и в десять раз хуже соответственно, чем указано в его собственном бенчмарке, на языках, которые он официально поддерживает. Также в этой колонке: кантонский 38.58, чешский 24.13, румынский 21.58, украинский 6.32.

Три вещи примиряют большую часть этого, и их стоит разграничить, поскольку широко распространённая версия этой истории передаёт их неверно:

Чешский, румынский и украинский не являются поддерживаемыми языками. Проверьте собственные языковые теги репозитория: 30 кодов, и среди них нет ни cs, ни ro, ни uk. Критиковать VoxCPM2 за 24% WER на чешском — значит критиковать его за язык, который он никогда не заявлял. Кантонский, вполне возможно, подпадает под «9 китайских диалектов», но все системы в этом столбце показывают на нём более 30%, что указывает на распознаватель, а не на какую-либо из моделей.

Арабский и хинди поддерживаются — и это главный вывод. Это два языка, для которых OpenBMB заявляет о покрытии, и две его оценки различаются на порядок величины. В самой статье говорится, что эти языки имеют «относительно ограниченный объём данных» в обучающем корпусе и что «часть более высокого WER может быть связана с ограниченной точностью распознавателя». Это разумная гипотеза, но она не проверена. Если вы выпускаете продукт с распознаванием арабской или хинди-речи, опубликованный диапазон для этой модели составляет от 0,79% до 19,70%, и ни одна из границ независимо не подтверждена. Заложите день на собственные измерения; не рассчитывайте ни на одно из этих чисел.

Метрики даже не в одних и тех же единицах.Хинди оценивается по коэффициенту ошибок на символ на внутреннем наборе данных и по коэффициенту ошибок на слово на MiniMax-MLS. Это несопоставимые величины, что является ещё одной причиной, по которой разрыв в 25 раз — это не однозначное обвинение — и ещё одной причиной, по которой среднее значение 1.68% не следует рассматривать как сопоставимый показатель.

То же предостережение относится к утверждению, несущему основную числовую нагрузку в освещении этой модели: что VoxCPM2 превосходит ElevenLabs по сходству голоса — 85,4% против 61,3% по английскому языку, побеждая в 22 из 24 языков. Именно это и говорит таблица. Это также таблица, которую статья собирает частично из ранее опубликованных результатов, и в ней столбец разборчивости ElevenLabs содержит 73,94% WER для тайского, 73,42% для вьетнамского и 16,03% для китайского. Это не цифры работающего коммерческого продукта; это признак несоответствия в оценке или конфигурации. Таблица, сломанная в одном столбце, не становится заслуживающей доверия в другом только потому, что результат льстит модели, о которой вы читаете.

Пять режимов из одной основы — и рецепт, который двигает ваши показатели

Самая чистая идея в архитектуре заключается в том, что у VoxCPM2 нет отдельных моделей или головок для своих возможностей. Все пять режимов используют одни и те же параметры, просто входная последовательность организована по-разному, поэтому одного контрольного checkpoint'а на 2B достаточно для того, что обычно требует целый небольшой флот моделей.

Базовый TTS — текст на входе, аудио на выходе.

Дизайн голоса — описание в скобках просто добавляется в начало текста, так что «(усталый мужчина средних лет, хриплый, говорящий медленно)» и сама строка обрабатываются одной и той же языковой моделью без дополнительного модуля. Никакого референсного аудио вообще.

Референсное клонирование — изолированный референсный фрагмент определяет личность диктора, транскрипция не требуется.

Управляемое клонирование — референсный клип плюс описание стиля, так что можно клонировать голос, а затем попросить его звучать торопливо или забавно.

Клонирование с продолжением — референс-клип, сопоставленный с его транскрипцией, используемый как аудио-префикс, который модель продолжает; это режим наивысшей точности.

В отчете зарыт один регулятор, о котором большинство обзоров умалчивают, и именно он скорее всего изменит ваши результаты. Два пути кондиционирования — изолированный референс и префикс продолжения — можно использовать по отдельности или вместе, и они работают в ущерб друг другу. В собственной абляции OpenBMB совместное использование обоих дает наилучшее сходство с диктором во всех подмножествах. Отказ от префикса продолжения и передача только изолированного референса дает наилучшую разборчивость на сложных китайских текстах — 6,85% CER против 7,44%, но при этом жертвует примерно пятью пунктами сходства. Объяснение в статье разумно: без временного аудиопрефикса, фиксирующего просодию, у модели больше свободы выбрать подачу, которая справляется с трудным текстом.

Итак, значение по умолчанию — это выбор, а не потолок. Для сопоставления голоса нужны оба пути; сложный или необычный текст требует только эталонного режима. Один честный нюанс: абсолютные цифры в той таблице абляции не согласуются с основной таблицей для рецепта, который, по словам статьи, использовался повсюду, что в препринте скорее всего является оплошностью в учёте, чем чем-то зловещим, — но это третья причина относиться к каждому числу здесь как к направлению для тестирования, а не как к значению для цитирования.

Голосовой дизайн: более послушный, чем естественный

Голосовой дизайн — та особенность, которая делает этот релиз интересным, а не просто инкрементальным, и именно в ней собственные показатели вендора наиболее ярко раскрывают реальный компромисс.

В InstructTTSEval VoxCPM2 набирает 84.2 по спецификации акустических параметров, 83.2 по директивам описательного стиля и 71.4 по ролевой игре для английского — последний показатель лучший в таблице, опережая Qwen3-TTS-1.7B-VD с 68.4 и Gemini-TTS-Pro с 67.2. По китайскому языку результаты слабее, и порядок меняется: 85.2 / 71.5 / 60.8 против 89.0 / 90.1 / 75.5 у Gemini-TTS-Pro. Таким образом, самое сильное утверждение, которое можно сделать, — что VoxCPM2 лидирует в английской ролевой игре, но уступает закрытой передовой системе почти во всём остальном, что касается следования инструкциям.

Человеческая панель прослушивания — 50 слушателей, рандомизированное и двойное слепое исследование, согласно отчёту, — уточняет картину. В управляемой генерации VoxCPM2 получает 4,50 за следование инструкциям против 4,41 у Qwen3-TTS-VD, но уступает в естественности: 4,48 против 4,61. При простом zero-shot клонировании она выигрывает по сходству голоса (4,74 против 4,69) и сравнивается или немного отстаёт по естественности (4,78 против 4,80 у Qwen3-TTS, доверительные интервалы пересекаются).

Закономерность достаточно устойчива, чтобы строить планы с её учётом: VoxCPM2 делает то, что вы ему говорите, и при этом звучит чуть менее по-человечески, тогда как Qwen3-TTS звучит немного лучше и следует инструкциям чуть менее точно. Какой из них подходит, целиком зависит от того, в чём ценность вашего продукта: в точном контроле или в лёгкой подаче. OpenBMB сам отмечает это следствие в разделе ограничений, и это как раз то, что поставщики обычно умалчивают: дизайн голоса и управляемое клонирование «могут давать нестабильные результаты от запуска к запуску», и получение нужного голоса может потребовать нескольких попыток. Встройте в свой конвейер механизм повтора, а если голос важен — этап прослушивания человеком.

Сколько стоит эксплуатация и когда аренда — правильный выбор

Нигде нет размещённого VoxCPM2. Боковая панель самого Hugging Face прямо говорит об этом: «Эта модель не развёрнута ни одним поставщиком инференса» — и это относится и к нам: OrcaRouter не обслуживает VoxCPM2, и никакое желание не изменит того, что 2B TTS-модель без инференс-партнёра — это либо веса, которые вы размещаете сами, либо ничего.

Что превращает вопрос стоимости в вопрос о GPU, и арифметика здесь простая. При коэффициенте реального времени Nano-vLLM 0.13 на одной RTX 4090 один GPU-час даёт примерно 7.7 часов аудио, поэтому ваша стоимость за час аудио — это почасовая ставка одной карты на 24 ГБ, делённая примерно на 7.7. В обычном PyTorch при RTF 0.30 этот показатель падает до примерно 3.3 часов аудио на GPU-час. Обе цифры получены OpenBMB, измерены на их оборудовании и на их текстах, и на ваших данных они изменятся: размер батча, сложность текста и число повторов, которые требует ваш контроль качества, — всё это множители, не содержащиеся в числе RTF. Процент повторов — вот о чём забывают: модель, которая, по словам вендора, может потребовать нескольких попыток, чтобы попасть в целевой голос, стоит не столько, сколько следует из её RTF.

VoxCPM2-4

Сравнение, которое люди хотят видеть на этом этапе, — это сравнение с арендованным API, и честный ответ таков: эти два варианта не конвертируются один в один. openai/tts-1-hd тарифицируется по $30.00 за миллион токенов на входе и на выходе — это цена из прайс-листа провайдера, переданная напрямую через OrcaRouter, поскольку мы берём 0% наценки, поэтому сумма на странице нашей модели — это сумма, которую взимает OpenAI. Но токены — это не секунды, и ни один опубликованный тариф не конвертирует одно в другое достаточно надёжно, чтобы на его основе можно было строить расчётные таблицы. Любой, кто показывает вам чистое почасовое сравнение между самостоятельно размещённой TTS-моделью с открытыми весами и API с оплатой по токенам, сделал предположение, которое он вам не озвучил.

Что действительно стоит сказать, так это где проходит архитектурная граница. Размещение VoxCPM2 у себя имеет смысл, когда нужен конкретный клонированный голос, когда объём аудио достаточно стабилен, чтобы держать GPU загруженным, когда данные не могут покидать вашу инфраструктуру или когда вы планируете дообучать его через LoRA, — и он поддерживает дообучение на 5–10 минутах целевого аудио, что действительно дёшево. Аренда имеет смысл при скачкообразной нагрузке, когда некому обслуживать GPU или когда голос взаимозаменяем. Большинство реальных голосовых продуктов — это две системы, а не одна: слой синтеза и языковая модель, выполняющая рассуждения. Часть, отвечающая за рассуждения, — это то, что стоит вынести за один ключ с автоматическим переключением между провайдерами, чтобы смена модели была изменением строки, а не закупочным циклом; именно под это и заточен OrcaRouter, охватывающий более 200 моделей. Синтезирующая часть, когда это конкретный голос, которым вы владеете и который дообучаете, принадлежит вашему собственному оборудованию. VoxCPM2 полностью относится ко второй категории, и тот факт, что никто не предоставляет его как сервис, — следствие того, чем он является, а не упущение.

Чего OpenBMB говорит вам не ожидать

Раздел об ограничениях необычно откровенен для релиза с таким импульсом, и он достаточно короток, чтобы к нему отнестись серьёзно.

Качество клонирования — это поверхность для злоупотреблений. В карточке модели об этом сказано прямо: модель создаёт речь, достаточно реалистичную для выдачи себя за другого человека и мошенничества, а аудио, созданное ИИ, должно быть помечено. Apache-2.0 вообще не накладывает на это никаких ограничений — в отличие от лицензий на несколько конкурирующих голосовых моделей с открытыми весами, здесь нет положения о допустимом использовании, за которым можно спрятаться. Политику согласия и раскрытия информации вы пишете сами.

Вариативность от запуска к запуску ожидаема на двух контрольных функциях, а не баг, который нужно заводить.

Эти 30 языков — реальная граница. Всё, что выходит за их пределы, может работать, но не проверено; ожидайте доработки.

Согласованность управления стилем описывается как всё ещё находящаяся в разработке людьми, которые её создали.

И те пробелы, которые карта не называет: вообще никакого раскрытия информации об обучающем корпусе — так что лицензия Apache-2.0 на веса решает вопрос кода, но не вопрос происхождения данных. Никакой независимой оценки ни одной цифры в этой статье. Никакой опубликованной задержки в миллисекундах — RTF это коэффициент пропускной способности, а голосовой агент живёт или умирает по времени до первого аудио, которого в отчёте нет нигде.

Три вопроса, которые карточка модели не решает

Стоит ли мне переходить с VoxCPM1.5 или VoxCPM-0.5B?

Только для новых возможностей, и только после измерений. Если вам нужны языки помимо китайского и английского, дизайн голоса или клонирование с управляемым стилем, апгрейд — в этом весь смысл, и в рамках семейства альтернативы нет. Если вы сегодня используете клонирование на английском или китайском и довольны результатом, аргументация слаба сама по себе: тот же бенчмарк показывает, что VoxCPM-0.5B сравним с VoxCPM2 по частоте ошибок, а вы расплачивались бы вдвое большей задержкой и на треть большим объёмом VRAM ради примерно 2,4 пункта сходства диктора. Есть ещё одна деталь миграции, которую легко упустить: если вы подавали VoxCPM1.5 эталонное аудио с частотой 44,1 кГц, энкодер VoxCPM2 принимает 16 кГц, поэтому ваш конвейер эталонных данных меняется, а верхние частоты исходного материала перестают иметь значение.

Можно ли вообще выпустить коммерческий голосовой продукт на этом?

С юридической точки зрения лицензия настолько разрешительна, насколько это вообще возможно: Apache-2.0, без гейта, без ограничений на использование, коммерческое использование явно разрешено, покрыты и веса, и код дообучения. Открытый вопрос не в тексте лицензии, а в том, чего за ней не хватает. OpenBMB не называет обучающий корпус, а значит, никто не может сказать вам, чьи голоса в этих 2 миллионах часов. Для модели, чья главная особенность — воспроизведение голоса конкретного человека, это вопрос к вашему юристу, а не к карточке модели — и это тот же вопрос, от которого сейчас увиливает каждая голосовая модель с открытыми весами. На практике более серьёзные блокеры — операционные: пока нет нативного класса Transformers, нигде нет размещённого эндпоинта, вариативность контрольных параметров от запуска к запуску и отсутствие показателя времени до первого аудио, если вы создаёте что-то разговорное.

Достаточно ли этого, чтобы заменить платного поставщика TTS?

Для английского и китайского озвучивания, заранее записанного контента и любых задач, где вы контролируете конкретный голос и можете выполнять работу пакетами: да, судя по имеющимся данным, а лицензия делает попытку почти бесплатной. Для диалоговых агентов реального времени: измерьте время до первого аудио самостоятельно, прежде чем принимать решение, потому что никто его не публиковал, и RTF вам этого не скажет. Для арабского, хинди или любого языка из «длинного хвоста»: две оценки самого вендора расходятся на порядок величины, поэтому считайте модель непроверенной там, независимо от того, какую цифру вы видели. И для всего, где неправильное произношение — это бизнес-инцидент, а не неприятность, учтите, что VoxCPM2 не является лидером по разборчивости даже в собственной таблице — Fish Audio S2 и LongCat-Audio-DiT опережают его в этом, и они тоже с открытыми весами.

Что посмотреть

Два события с разными сроками. Ближайшее — это PR #47756 и PR MiniCPM4 под ним. Если их смержат, VoxCPM2 станет AutoModel-вызовом, и стоимость интеграции для всех, кто принял Transformers как стандарт, упадёт почти до нуля в одночасье — и учитывая, что 900 282 загрузки в месяц уже происходят сложным путём, это значимая разблокировка. Если они застрянут, ответом для этих команд останется «используйте пакет OpenBMB или эндпоинт vLLM-Omni», и у контрибьютора сообщества, ведущего оба PR, не будет рычагов, чтобы это изменить.

{{1}}Более медленный из них — это вопрос о том, опубликует ли кто-нибудь за пределами OpenBMB хоть какие-то цифры.{{/1}} {{2}}Через четыре месяца после релиза, при 900 000 ежемесячных загрузок, 25 файнтюнах и более чем 100 Spaces, построенных на её основе, все фигурирующие показатели производительности по-прежнему восходят к одному техническому отчёту, написанному людьми, которые обучали модель.{{/2}} {{3}}Это не упрёк в адрес OpenBMB — они задокументировали свою работу тщательнее и честнее, чем большинство: отчёт сам раскрывает выбор распознавателей, слабые места по объёму данных и нестабильность самой модели.{{/3}} {{4}}Это упрёк всем остальным.{{/4}} {{5}}Самое ценное, что кто-либо в сообществе открытых речевых технологий мог бы опубликовать в этом месяце, — это прогон VoxCPM2, Qwen3-TTS, Fish Audio S2 и LongCat-Audio-DiT на Seed-TTS-Eval и MiniMax-MLS с оценкой Whisper в идентичных условиях.{{/5}} {{6}}Пока такого не существует, честное резюме о VoxCPM2 таково: это самая функциональная голосовая модель с открытыми весами в расчёте на чекпойнт из всех, что кто-либо выпускал, но не самая точная, и обе половины этого утверждения держатся на слове вендора.{{/6}}

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube