Титульная карточка для «GPT-Live-1 vs VoxCPM2» с подзаголовком «Арендованный разговор или GPU, которым владеете вы», с бейджем «Один — полный дуплекс, другой — синтез речи: разные задачи» и тремя карточками: «GPT-Live-1 — $0,05 за голосовую минуту, только API, ничего устанавливать не нужно», «VoxCPM2 — Apache-2.0, 2 млрд параметров, ~8 ГБ VRAM, ни один провайдер инференса его не разворачивает» и «Пропускная способность при самостоятельном хостинге — около 7,7 часов аудио на GPU-час при RTF 0.13, 393 079 загрузок за последние 30 дней», над нижней полосой с надписью «Показатели VoxCPM2 по данным OpenBMB; голосовые характеристики GPT-Live-1 по данным OpenAI и не воспроизведены.» Логотип OrcaRouter скомпонован в правом нижнем углу.
Engineering & Research

GPT-Live-1 против VoxCPM2: один стоит $0,05 в минуту, а другой требует GPU на 24 ГБ

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Самый чистый способ сравнить GPT-Live-1 с VoxCPM2 — это заметить, что они лишь кажутся конкурентами, пока вы не назовёте цифру по оборудованию. GPT-Live-1 — это полнодуплексная голосовая модель OpenAI, доступная в API с 10 сентября 2026 года по цене $0.05 за минуту голоса, и при этом ничего не нужно устанавливать. VoxCPM2 — это открытая по весам модель преобразования текста в речь от OpenBMB с 2 миллиардами параметров, выпущенная под лицензией Apache 2.0 в апреле 2026 года, которая работает примерно на 8 ГБ видеопамяти и не развёрнута ни одним провайдером инференса — так что если она вам нужна, машина ваша. Одна — это разговор, который вы арендуете посекундно; другая — это синтезатор, которым вы управляете. Вопрос не в том, какая из них лучше, а в том, какую из них ваша рабочая нагрузка действительно способна поглотить.

A two-column scoreboard titled 'GPT-Live-1 vs VoxCPM2 - the scoreboard'. Left column GPT-Live-1: 'Job: full-duplex conversation', 'Access: hosted API, no weights', 'Price: $0.05 per voice minute', 'Independent score: 69.8% on the AA Speech to Speech Index', 'Hardware you need: none', 'Catch: delegated reasoning bills separately'. Right column VoxCPM2: 'Job: text-to-speech', 'Access: Apache-2.0 weights, self-host only', 'Price: $0 per call plus a GPU', 'Independent score: none, OpenBMB benchmarks only and contested by third-party runs', 'Hardware you need: ~8 GB VRAM, 22 GB peak when serving', 'Catch: no inference provider deploys it'. Footer: 'GPT-Live-1 voice figures OpenAI-reported; VoxCPM2 figures are the model card's own.'

Две модели, две задачи, по одной честной строке спецификации у каждой

• Функция — GPT-Live-1 ведёт разговор: он одновременно слушает и говорит, соблюдает очерёдность реплик, обрабатывает перебивания и поддакивания, а также возвращает транскрипты. VoxCPM2 превращает текст в речь. Он никогда ничего не слышит.

• Доступ — GPT-Live-1 размещена и закрыта, доступна по одному ID модели через эндпоинт Live Sessions; опубликованный пример интеграции работает через WebRTC. VoxCPM2 — скачиваемый чекпоинт на Hugging Face и ModelScope, Apache 2.0, бесплатно для коммерческого использования.

• Цена — GPT-Live-1 стоит $0,05 за минуту голоса, тарификация посекундная, а бэкенд делегирования тарифицируется отдельно. VoxCPM2 — $0 за вызов плюс GPU, и весь ценовой моделью является хостинг с открытым исходным кодом.

• Ресурсы — GPT-Live-1 не требует вашего оборудования. VoxCPM2 требует примерно 8 ГБ видеопамяти (6–8 ГБ при Q4), Python 3.10+, PyTorch 2.5+ и CUDA 12+.

• Бенчмарки — все голосовые показатели GPT-Live-1 принадлежат Ope​nAI и не воспроизведены независимо; единственный независимый рейтинг ставит его на седьмое место из одиннадцати. Опубликованные цифры VoxCPM2 принадлежат OpenBMB, а независимые измерения, имеющиеся по его заявлениям о многоязычности, указывают на обратное.

Вопрос о 24 ГБ: цена

Показатели сервинга VoxCPM2 — это то, что решает, является ли самостоятельный хостинг хобби или архитектурой. На одной RTX 4090 модель работает с коэффициентом реального времени около 0,30 в обычном PyTorch и около 0,13 на пути Nano-VLLM — то есть примерно 7,7 часа сгенерированного аудио на час времени GPU в более быстрой конфигурации. Это цифры из самой карточки модели, а не внешнее измерение; независимый рецепт сервинга, проверенный на 4090 с CUDA 12.9, сообщает коэффициенты реального времени в установившемся режиме около 0,120 для zero-shot-синтеза и 0,139 для клонирования, при пиковом потреблении памяти GPU около 22 ГБ из 24 ГБ. Оба набора — это установившийся режим, а не холодный старт: первый запрос в новом процессе гораздо медленнее, и именно эту цифру приводят, когда говорят, что модель непригодна для использования.

Поставьте это рядом с API. GPT-Live-1 по $0.05 за минуту — это $3.00 за час непрерывного разговора. Карта на 24 ГБ, арендованная на открытом рынке, обходится в несколько долларов в час, а владение ею при учёте загрузки амортизируется до примерно такой же суммы. Так что сравнение приходит туда же, куда обычно приходят такие сравнения, с одной неудобной асимметрией: счёт за GPU приходит независимо от того, разговаривает ли кто-нибудь с вашим продуктом, а счёт за API падает до нуля в тихий день и вырастает до пятизначных сумм в загруженный. Пакетный синтез фиксированного каталога идеально подходит для GPU. Постоянно включённая телефонная линия идеально подходит для счётчика.

Что умеет VoxCPM2 такого, чего не умеет больше ничто открытое

Причина, по которой VoxCPM2 заслуживает такого внимания, не в том, что она выигрывает в бенчмарках — в основном нет, — а в том, что она создаёт голос по текстовому описанию, вообще не имея эталонного аудио. Это действительно новая возможность в открытых весах, и она меняет рабочий процесс для всех, кому нужен ещё не существующий голос: прослушать его в прозе, итеративно доработать в прозе и только потом решить, клонировать ли его. А вокруг этого — 30 языков плюс девять китайских диалектов, вывод в 48 кГц благодаря встроенному этапу суперразрешения и дообучение на всего 5–10 минутах аудио.

База доказательств тоньше, чем список возможностей. В собственном отчёте OpenBMB указана частота ошибок в словах для английского 1,84% и частота ошибок в иероглифах для китайского 0,97%, а также средняя ошибка 1,68% по 30 языкам, измеренная на собственном наборе из 500 высказываний на каждый язык и оценённая моделью другого вендора. Там, где существует независимый тест, разрыв велик: на многоязычном тестовом наборе MiniM​ax, оценённом с помощью Whisper-large-v3, хинди оказывается на уровне 19,70, а арабский — 13,05 — в разы хуже самостоятельно заявленных показателей. OpenBMB также предупреждает, что голосовой дизайн и управление стилем дают нестабильные результаты от запуска к запуску, и предлагает генерировать от одного до трёх раз, чтобы получить желаемый результат, — что является тихим способом сказать, что стоимость одного пригодного результата за вызов — это не один вызов.

Налог на интеграцию, который никто не включает в сравнение

Одна невзрачная деталь решает, займёт ли VoxCPM2 неделю работы или месяц. Его репозиторий на Hugging Face помечен тегом voxcpm, а не transformers, что означает, что библиотека, с помощью которой загружается почти всё остальное на том сайте, не может загрузить эту модель. Запрос на включение, исправляющий это, был открыт 4 августа 2026 года и на момент нашей последней проверки ещё не был принят. Запросы на включение, чтобы добавить его в другие стеки обслуживания, были приняты, и востребованность не вызывает сомнений: 393 079 загрузок за последние тридцать дней по состоянию на этот снимок, с 27 адаптерами, 30 файнтюнами, 12 квантованиями и 100 Spaces, построенными на основе чекпойнта.

A screenshot of the Hugging Face model card for openbmb/VoxCPM2, captured September 2026: 'VoxCPM2 is a tokenizer-free, diffusion autoregressive Text-to-Speech model - 2B parameters, 30 languages, 48kHz audio output, trained on over 2 million hours of multilingual speech data', with 1.6k likes, 4.95k followers, 393,079 downloads last month, 2B params in BF16, 27 adapter models, 30 finetunes, 12 quantisations, and an Inference Providers panel reading 'This model isn't deployed by any Inference Provider.'

Эквивалентная плата за GPT-Live-1 — это переписывание транспорта. Его сессии строятся вокруг постоянного соединения, а не аудиоэндпоинта, работающего по схеме запрос-ответ, а двухсчётчиковая тарификация означает, что каждый делегированный вызов reasoning, вызов инструмента и веб-поиск оплачиваются по собственным тарифам бэкенд-модели вдобавок к минуте голоса. Командам, переходящим с realtime-интеграции с тарификацией по токенам, следует закладывать этот переход как инженерную задачу, а не как замену ID модели.

Где слой маршрутизации действительно помогает

OrcaRouter не предоставляет ни GPT-Live-1, ни VoxCPM2, и об этом стоит сказать прямо, а не позволять остальной части этого раздела подразумевать обратное. Голосовой слой GPT-Live-1 находится за собственным эндпоинтом OpenAI; у VoxCPM2 вообще нет провайдера, который бы его хостил. Ни то, ни другое нельзя вызвать с помощью нашего ключа.

Причина, по которой вопрос о маршрутизации всё ещё возникает, заключается в том, что обе модели находятся на краю пайплайна, середина которого — текст. Развёртывание VoxCPM2 обычно отвечает на запросы чего-то ещё — генератора сценариев, этапа перевода, нормализатора текста, диалоговой модели, которая решает, что будет произнесено дальше, — а это обычные вызовы моделей. Сессия GPT-Live-1 делегирует своё мышление бэкенд-модели, указанной в конфигурации сессии, и в собственной документации Ope​nAI этот бэкенд — GPT-5.6 Terra, доступная через OrcaRouter по прайс-листовой цене Ope​nAI. Делегирование на стороне клиента идёт ещё дальше, позволяя вашему приложению самому предоставлять бэкенд, а значит, модель, стоящая за голосом, может быть любым эндпоинтом, который вы контролируете. Примерно 190 моделей от одиннадцати вышестоящих провайдеров стоят за одним ключом по прайс-листовой цене без наценки — так что когда провайдер снижает цену, снижение действует здесь в тот же день, а не при продлении — с автоматическим переключением при сбое между провайдерами и DSL маршрутизации для объединения нескольких моделей в один вызов. Дешёвая страховка для той половины стека, которая меняется чаще всего.

Одно предостережение стоит вынести в этот раздел, а не прятать внутри него, потому что именно эта деталь делает часть этого сравнения, касающуюся GPT-Live-1, менее однозначной, чем предполагают вендорские бенчмарки. В независимом индексе Artificial Analysis Speech to Speech Index GPT-Live-1 набирает 69,8% — седьмое место из одиннадцати, позади GPT-Realtime-2.1 с 73,9% и Gr​ok Voice Think Fast 2.0 с 79,0%. Эта модель — самый дешёвый вариант в том рейтинге в расчёте на час входного аудио: $4,42, и она не лучшая. Предусмотрите в бюджете возможность того, что голосовой слой, который вы выберете в качестве стандарта, окажется не тем, который вы в итоге оставите.

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%, with a cost chart placing GPT-Live-1 at $4.42 and GPT-Realtime-2.1 at $10.75 per hour of input audio.

Какой именно и для чего

Берите VoxCPM2, если текст существует раньше, чем аудио. Озвучивание, аудиокниги, дубляж, доступность, реплики игровых персонажей, продукт, которому нужен голос, который ещё никто не записал, — и особенно любая задача, где объём большой, предсказуемый и оправдывает фиксированные капитальные затраты. Примите, что запускать её придётся самостоятельно, что инструментарий вокруг неё всё ещё устаканивается и что заявления о многоязычном качестве заслуживают вашего собственного теста на слух, прежде чем они дойдут до клиента.

Берите GPT-Live-1, если на другом конце человек. Голосовые агенты, телефонная поддержка, сценарии первичного приёма — всё, где модель должна решать в реальном времени, закончил ли человек говорить. Платите поминутную ставку за привилегию не владеть проблемой, а делегированный бэкенд закладывайте отдельной строкой бюджета, потому что именно от него зависит, станет звонок дешёвым или дорогим.

Ошибка — рассматривать их как альтернативы в сравнительном тестировании. Для большинства команд, которым нужно и то и другое, это два слоя одного и того же продукта, и единственный по-настоящему неправильный ответ — выбрать вариант с самостоятельным хостингом, потому что в лицензии написано «бесплатно», не посчитав стоимость GPU, который делает это правдой.