Сгенерированная hero-карточка для ElevenLabs Eleven v4 vs VoxCPM2 с двумя: ElevenLabs Eleven v4 — эндпоинт с Elo 1 319, рангом 1 и $80.00 за 1 млн символов; VoxCPM2 — чекпоинт Apache-2.0 с 2 млрд параметров, выходом 48 кГц и без строки в арене. Нижний колонтитул: «Ранг и цена Eleven v4 согласно Artificial Analysis, сентябрь 2026 г.; характеристики VoxCPM2 согласно карточке модели OpenBMB». Логотип OrcaRouter расположен в правом нижнем углу.
Guides & Insights

Eleven v4 vs VoxCPM2: Ранжированная модель против чекпойнта, который нельзя арендовать

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Самый полезный факт в этом сравнении — это строка, которой не существует. ElevenLabs Eleven v4 занимает 1-е место в Provider Voice Arena от Artificial Analysis с рейтингом Elo 1 319 по 1 674 появлениям, при цене $80,00 за миллион символов. VoxCPM2 — чекпойнт от OpenBMB, выпущенный в апреле 2026 года, — не фигурирует ни на одной из речевых досок: ни в рейтинге, ни вне рейтинга, ни как предварительная запись. Это не приговор качеству. Это означает, что какое бы число вы ни надеялись сравнить с 1 319, его никто не получил, и сравнение придётся строить на чём-то ином, нежели предпочтения. Остаются владение, дообучение и вопрос лицензирования, который размещённая конечная точка не позволяет задать.

Что на самом деле даёт вам каждая сторона

Это разные классы продуктов, и различие между ними не косметическое.

• Доступ — Eleven v4 — это размещённый на сервере эндпоинт, доступ к которому осуществляется через собственный API ElevenLabs, с оплатой за символ. VoxCPM2 — это чекпойнт на Hugging Face под названием openbmb/VoxCPM2; вы скачиваете его и запускаете самостоятельно, и нет собственного эндпоинта, к которому можно обратиться.

• Лицензия — VoxCPM2 распространяется под Apache 2.0, которая явно разрешает коммерческое использование. Eleven v4 — это коммерческий API, условия которого принадлежат ElevenLabs. Эта разница важна, если ваша юридическая проверка спрашивает, можете ли вы дообучать, распространять или поставлять веса; в случае с чекпойнтом ответ зафиксирован и статичен.

• Размер и аппаратное обеспечение — VoxCPM2 — это 2 млрд параметров на базе MiniCPM-4, и в карточке указано примерно 8 ГБ видеопамяти при bfloat16, при максимальной длине последовательности 8 192 токена. ElevenLabs не публикует сведений о количестве параметров для Eleven v4, а аппаратные требования размещённой модели — не то, чем вы управляете.

• Цепочка вывода — VoxCPM2 принимает эталонный аудиосигнал с частотой 16 кГц и выдаёт 48 кГц благодаря встроенному суперразрешению AudioVAE V2, без внешнего апсемплера в тракте. Хостинговый TTS отдаёт вам поток с той частотой, которую выбрал поставщик.

• Независимая оценка — у Eleven v4 она есть, и это первое место. У VoxCPM2 её нет. Отсутствие — это не низкая оценка; это модель без оценки, и о них двоих никогда не следует говорить в одном предложении так, будто второе — это число.

A generated scoreboard comparing ElevenLabs Eleven v4 and VoxCPM2 across six dimensions: arena rank (1, Elo 1,319 against not on the board), price ($80.00 per 1M characters against no per-character rate), licence (vendor API terms against Apache 2.0 for commercial use), voice creation (clone from 10 s of audio against voice design and cloning), languages (90-plus against 30) and operations (none, it is hosted, against your own GPU at about 8 GB). Footer: 'Eleven v4 figures per Artificial Analysis and vendor docs; VoxCPM2 figures per the OpenBMB model card.' The OrcaRouter logo sits in the bottom-right corner.

Число, которое заменяет пропущенное Эло

Если вы не можете сравнить предпочтения, сравните то, что можно вычислить, а для самостоятельно размещённой модели это пропускная способность. В карточке VoxCPM2 указан коэффициент реального времени около 0,30 в стандартном PyTorch на RTX 4090, снижающийся примерно до 0,13 при использовании Nano-VLLM. Коэффициент реального времени — это секунды вычислений на секунду аудио, так что эти две цифры означают, что один GPU-час даёт примерно 3,3 часа готовой речи в первом случае и около 7,7 часа во втором.

A screenshot of the Hugging Face model card for openbmb/VoxCPM2, tagged Text-to-Speech, VoxCPM, Safetensors, 30 languages, multilingual, voice-cloning, voice-design, diffusion and audio, with License: apache-2.0. The summary reads: 'VoxCPM2 is a tokenizer-free, diffusion autoregressive Text-to-Speech model - 2B parameters, 30 languages, 48kHz audio output, trained on over 2 million hours of multilingual speech data.' Highlights list 30-language multilingual input with no language tag, voice design from a natural-language description with no reference audio, controllable cloning from a short clip with optional style guidance, 48 kHz studio-quality output via AudioVAE V2's built-in super-resolution, context-aware synthesis, real-time streaming with an RTF as low as about 0.3 on an NVIDIA RTX 4090 and about 0.13 accelerated by Nano-VLLM, and an Apache-2.0 licence free for commercial use. The sidebar shows 341,299 downloads last month, 2B params, BF16, and a note under Inference Providers that the model is not deployed by any inference provider.

Сразу следуют два вывода. Стек обслуживания важнее модели: один и тот же чекпойнт на одной и той же карте более чем удваивает свою производительность при замене движка вывода, поэтому любая модель затрат, использующая цифру 0,30, завышает стоимость вашего самохостинга примерно в 2,3 раза. А загрузка — это вся игра: простаивающая карта не обыграет API с оплатой за символ ни при какой цене, потому что счёт за API зависит от того, что вы говорите, а счёт за карту — от того, когда вы её купили.

Именно поэтому честная версия этого решения — не «что звучит лучше». Она звучит так: «сколько часов аудио вы производите в месяц и занято ли оборудование». Ниже объёма, при котором карта остаётся загруженной, выигрывает API, и с явным преимуществом. Выше него, на оборудовании, которое у вас уже есть, предельные издержки чекпоинта за тысячный час равны его издержкам за первый час — и это структурное преимущество, с которым не сравнится ни одна тарифная сетка.

Возможность, которую хостируемый эндпоинт вам не продаст

Здесь сравнение перестаёт быть зеркальным отражением, потому что есть одна вещь, которую VoxCPM2 умеет, а Eleven v4 принципиально не может: её можно дообучить. В карточке модели описаны как полный SFT, так и тонкая настройка LoRA на всего пяти–десяти минутах аудио, с прилагаемым скриптом обучения и конфигурацией для каждого.

Это меняет облик голосовой программы. Размещённый API даёт вам фиксированную модель плюс любое клонирование, которое предоставляет поставщик: десять секунд эталонного аудио в случае Eleven v4 для мгновенных клонов, а выше — профессиональный уровень. Контрольная точка с настраиваемым LoRA даёт вам модель, которая никогда не видела чужих данных и поведение которой можно зафиксировать по версии. Для фирменного голоса, регулируемой предметной области или языка, с которым голосовой состав поставщика справляется плохо, это решение иной категории, а не более дешёвое.

Компромисс здесь очевиден, и о нём стоит проговорить: с VoxCPM2 вы принимаете, что модель никогда не оценивалась третьей стороной, что гарантии качества — это то, что вы выстраиваете и измеряете сами, и что ограничение длины последовательности в 8 192 токена и предупреждение самой карточки — что дизайн голоса и управление стилем варьируются от запуска к запуску и что рекомендуется от одной до трёх генераций — теперь ваша проблема контроля качества.

Что Eleven v4 даёт вам такого, чего не может дать чекпоинт

Если же посмотреть с другой стороны, преимущества хостинговой модели проявляются в календаре релизов, а не в спецификации.

• Измеренный рейтинг — первое место в таблице, за оценкой которой стоит 1 674 образца, и интервал примерно ±19 пунктов вокруг неё. Что бы эта таблица ни измеряла, она не зависит от обоих вендоров и является единственным сторонним сигналом качества в этом сравнении.

• Управление исполнением в тексте — встроенные аудиотеги, такие как [laughs], [whispers] и [said angrily in French accent], а также подсказки по подаче на естественном языке и улучшенная поддержка Международного фонетического алфавита. Чтобы добиться смены настроения от самостоятельно размещённой модели, нужна повторная генерация или дообучение; здесь это токен в сценарии.

• Охват, который вам не нужно проверять, — более 90 языков против 30 у VoxCPM2, с той оговоркой, что список чекпоинта явный и поименованный (включая китайские диалекты), а «более 90» у вендора — это количество без списка.

• Никакой операционной поверхности — ни GPU, ни стека обслуживания, ни дрейфа версий, а также промо-тариф $0,022 за 1000 символов до 12 октября, после чего — $0,08 по прайс-листу.

A screenshot of Artificial Analysis' Eleven v4 model page, titled Eleven v4 Quality Elo, Speed & Price Analysis, credited to ElevenLabs and the ElevenLabs family with an Elo of 1318.77. The page presents Quality, Pricing and 1M Throughput views over the Provider Voice Arena Preference Elo, and the model selector reads '27 of 96 models'.

Ни то, ни другое не наше, и в этом суть этого раздела.

OrcaRouter не размещает ни одну из этих моделей. В нашем каталоге нет ни эндпоинта ElevenLabs, ни эндпоинта VoxCPM2, и честный ответ с точки зрения маршрутизации таков: доступ к Eleven v4 осуществляется через собственный API ElevenLabs, тогда как VoxCPM2 — это то, что вы разворачиваете на собственном оборудовании. Мы не станем намекать на обратное, чтобы сделать сравнение более аккуратным.

Где один ключ действительно помогает — так это в решении перед решением. Причина, по которой разговоры о собственном хостинге заходят в тупик, в том, что альтернатива никогда не оценивается: API — это один вызов, а чекпойнт — это стек обслуживания, поэтому API побеждает по умолчанию, а не по арифметике. Вклад OrcaRouter в том, что хостинговую половину этого сравнения дёшево протестировать — более 200 моделей за одним API-ключом с прейскурантными ценами провайдеров, передаваемыми по цене 0% наценки, так что хостинговый вариант оценивается по его реальной ставке, а не по расчётной, с автоматическим переключением при сбое, если вы поставите кандидата за живой путь до того, как закончите принимать решение.

Как решить за один проход

Выбирайте Eleven v4, если голос должен быть хорош с первого дубля и вы хотите сделать всё на этой неделе. Вы получаете первое место в независимом рейтинге, документированный синтаксис режиссуры, самое широкое задокументированное число языков в этом сравнении и никакой инфраструктуры. С 13 октября вы платите $0.08 за 1000 символов и принимаете, что не можете дообучить её, зафиксировать версию или хранить аудио на своём железе.

Выбирайте VoxCPM2, если модель должна быть вашей. Apache 2.0, 2 млрд параметров примерно на 8 ГБ видеопамяти, вывод 48 кГц без апсемплера в цепочке и путь тонкой настройки, для которого достаточно пяти–десяти минут аудио, — это возможности, которых хостинговый эндпоинт не предложит ни за какие деньги, а отсутствие строки в арене — их цена. Прогоните показатели пропускной способности на собственной карте, прежде чем окончательно выбрать, потому что коэффициенты реального времени 0,30 и 0,13 — это собственные измерения из карточки модели, и ваш сервинг-стек не воспроизведёт их в точности.

И если честный ответ таков, что вы не знаете свой месячный объём аудио, то именно эту цифру и нужно выяснить. Она определяет это сравнение. Ни одна панель вам этого не скажет.