
Eleven v4 vs VoxCPM2: Ранжированная модель против чекпойнта, который нельзя арендовать
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 982 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 197 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
Самый полезный факт в этом сравнении — это строка, которой не существует. ElevenLabs Eleven v4 занимает 1-е место в Provider Voice Arena от Artificial Analysis с рейтингом Elo 1 319 по 1 674 появлениям, при цене $80,00 за миллион символов. VoxCPM2 — чекпойнт от OpenBMB, выпущенный в апреле 2026 года, — не фигурирует ни на одной из речевых досок: ни в рейтинге, ни вне рейтинга, ни как предварительная запись. Это не приговор качеству. Это означает, что какое бы число вы ни надеялись сравнить с 1 319, его никто не получил, и сравнение придётся строить на чём-то ином, нежели предпочтения. Остаются владение, дообучение и вопрос лицензирования, который размещённая конечная точка не позволяет задать.
Что на самом деле даёт вам каждая сторона
Это разные классы продуктов, и различие между ними не косметическое.
• Доступ — Eleven v4 — это размещённый на сервере эндпоинт, доступ к которому осуществляется через собственный API ElevenLabs, с оплатой за символ. VoxCPM2 — это чекпойнт на Hugging Face под названием openbmb/VoxCPM2; вы скачиваете его и запускаете самостоятельно, и нет собственного эндпоинта, к которому можно обратиться.
• Лицензия — VoxCPM2 распространяется под Apache 2.0, которая явно разрешает коммерческое использование. Eleven v4 — это коммерческий API, условия которого принадлежат ElevenLabs. Эта разница важна, если ваша юридическая проверка спрашивает, можете ли вы дообучать, распространять или поставлять веса; в случае с чекпойнтом ответ зафиксирован и статичен.
• Размер и аппаратное обеспечение — VoxCPM2 — это 2 млрд параметров на базе MiniCPM-4, и в карточке указано примерно 8 ГБ видеопамяти при bfloat16, при максимальной длине последовательности 8 192 токена. ElevenLabs не публикует сведений о количестве параметров для Eleven v4, а аппаратные требования размещённой модели — не то, чем вы управляете.
• Цепочка вывода — VoxCPM2 принимает эталонный аудиосигнал с частотой 16 кГц и выдаёт 48 кГц благодаря встроенному суперразрешению AudioVAE V2, без внешнего апсемплера в тракте. Хостинговый TTS отдаёт вам поток с той частотой, которую выбрал поставщик.
• Независимая оценка — у Eleven v4 она есть, и это первое место. У VoxCPM2 её нет. Отсутствие — это не низкая оценка; это модель без оценки, и о них двоих никогда не следует говорить в одном предложении так, будто второе — это число.

Число, которое заменяет пропущенное Эло
Если вы не можете сравнить предпочтения, сравните то, что можно вычислить, а для самостоятельно размещённой модели это пропускная способность. В карточке VoxCPM2 указан коэффициент реального времени около 0,30 в стандартном PyTorch на RTX 4090, снижающийся примерно до 0,13 при использовании Nano-VLLM. Коэффициент реального времени — это секунды вычислений на секунду аудио, так что эти две цифры означают, что один GPU-час даёт примерно 3,3 часа готовой речи в первом случае и около 7,7 часа во втором.

Сразу следуют два вывода. Стек обслуживания важнее модели: один и тот же чекпойнт на одной и той же карте более чем удваивает свою производительность при замене движка вывода, поэтому любая модель затрат, использующая цифру 0,30, завышает стоимость вашего самохостинга примерно в 2,3 раза. А загрузка — это вся игра: простаивающая карта не обыграет API с оплатой за символ ни при какой цене, потому что счёт за API зависит от того, что вы говорите, а счёт за карту — от того, когда вы её купили.
Именно поэтому честная версия этого решения — не «что звучит лучше». Она звучит так: «сколько часов аудио вы производите в месяц и занято ли оборудование». Ниже объёма, при котором карта остаётся загруженной, выигрывает API, и с явным преимуществом. Выше него, на оборудовании, которое у вас уже есть, предельные издержки чекпоинта за тысячный час равны его издержкам за первый час — и это структурное преимущество, с которым не сравнится ни одна тарифная сетка.
Возможность, которую хостируемый эндпоинт вам не продаст
Здесь сравнение перестаёт быть зеркальным отражением, потому что есть одна вещь, которую VoxCPM2 умеет, а Eleven v4 принципиально не может: её можно дообучить. В карточке модели описаны как полный SFT, так и тонкая настройка LoRA на всего пяти–десяти минутах аудио, с прилагаемым скриптом обучения и конфигурацией для каждого.
Это меняет облик голосовой программы. Размещённый API даёт вам фиксированную модель плюс любое клонирование, которое предоставляет поставщик: десять секунд эталонного аудио в случае Eleven v4 для мгновенных клонов, а выше — профессиональный уровень. Контрольная точка с настраиваемым LoRA даёт вам модель, которая никогда не видела чужих данных и поведение которой можно зафиксировать по версии. Для фирменного голоса, регулируемой предметной области или языка, с которым голосовой состав поставщика справляется плохо, это решение иной категории, а не более дешёвое.
Компромисс здесь очевиден, и о нём стоит проговорить: с VoxCPM2 вы принимаете, что модель никогда не оценивалась третьей стороной, что гарантии качества — это то, что вы выстраиваете и измеряете сами, и что ограничение длины последовательности в 8 192 токена и предупреждение самой карточки — что дизайн голоса и управление стилем варьируются от запуска к запуску и что рекомендуется от одной до трёх генераций — теперь ваша проблема контроля качества.
Что Eleven v4 даёт вам такого, чего не может дать чекпоинт
Если же посмотреть с другой стороны, преимущества хостинговой модели проявляются в календаре релизов, а не в спецификации.
• Измеренный рейтинг — первое место в таблице, за оценкой которой стоит 1 674 образца, и интервал примерно ±19 пунктов вокруг неё. Что бы эта таблица ни измеряла, она не зависит от обоих вендоров и является единственным сторонним сигналом качества в этом сравнении.
• Управление исполнением в тексте — встроенные аудиотеги, такие как [laughs], [whispers] и [said angrily in French accent], а также подсказки по подаче на естественном языке и улучшенная поддержка Международного фонетического алфавита. Чтобы добиться смены настроения от самостоятельно размещённой модели, нужна повторная генерация или дообучение; здесь это токен в сценарии.
• Охват, который вам не нужно проверять, — более 90 языков против 30 у VoxCPM2, с той оговоркой, что список чекпоинта явный и поименованный (включая китайские диалекты), а «более 90» у вендора — это количество без списка.
• Никакой операционной поверхности — ни GPU, ни стека обслуживания, ни дрейфа версий, а также промо-тариф $0,022 за 1000 символов до 12 октября, после чего — $0,08 по прайс-листу.

Ни то, ни другое не наше, и в этом суть этого раздела.
OrcaRouter не размещает ни одну из этих моделей. В нашем каталоге нет ни эндпоинта ElevenLabs, ни эндпоинта VoxCPM2, и честный ответ с точки зрения маршрутизации таков: доступ к Eleven v4 осуществляется через собственный API ElevenLabs, тогда как VoxCPM2 — это то, что вы разворачиваете на собственном оборудовании. Мы не станем намекать на обратное, чтобы сделать сравнение более аккуратным.
Где один ключ действительно помогает — так это в решении перед решением. Причина, по которой разговоры о собственном хостинге заходят в тупик, в том, что альтернатива никогда не оценивается: API — это один вызов, а чекпойнт — это стек обслуживания, поэтому API побеждает по умолчанию, а не по арифметике. Вклад OrcaRouter в том, что хостинговую половину этого сравнения дёшево протестировать — более 200 моделей за одним API-ключом с прейскурантными ценами провайдеров, передаваемыми по цене 0% наценки, так что хостинговый вариант оценивается по его реальной ставке, а не по расчётной, с автоматическим переключением при сбое, если вы поставите кандидата за живой путь до того, как закончите принимать решение.
Как решить за один проход
Выбирайте Eleven v4, если голос должен быть хорош с первого дубля и вы хотите сделать всё на этой неделе. Вы получаете первое место в независимом рейтинге, документированный синтаксис режиссуры, самое широкое задокументированное число языков в этом сравнении и никакой инфраструктуры. С 13 октября вы платите $0.08 за 1000 символов и принимаете, что не можете дообучить её, зафиксировать версию или хранить аудио на своём железе.
Выбирайте VoxCPM2, если модель должна быть вашей. Apache 2.0, 2 млрд параметров примерно на 8 ГБ видеопамяти, вывод 48 кГц без апсемплера в цепочке и путь тонкой настройки, для которого достаточно пяти–десяти минут аудио, — это возможности, которых хостинговый эндпоинт не предложит ни за какие деньги, а отсутствие строки в арене — их цена. Прогоните показатели пропускной способности на собственной карте, прежде чем окончательно выбрать, потому что коэффициенты реального времени 0,30 и 0,13 — это собственные измерения из карточки модели, и ваш сервинг-стек не воспроизведёт их в точности.
И если честный ответ таков, что вы не знаете свой месячный объём аудио, то именно эту цифру и нужно выяснить. Она определяет это сравнение. Ни одна панель вам этого не скажет.
