Титульная карточка с надписью «GPT-Live-1 vs NVIDIA Nemotron VoiceChat 11B», подзаголовком «Поминутный счёт или GPU на 80 ГБ» и строкой «$0,05 в минуту против одного 80-гигабайтного ускорителя», над двумя панелями: левая изображает контур облака с измерительным циферблатом и значком монеты, правая — серверную плату-ускоритель со значком чипа и надписью «80 GB VRAM», с логотипом OrcaRouter, наложенным в углу.
Guides & Insights

GPT-Live-1 против NVIDIA Nemotron VoiceChat 11B: оплата за минуту или 80-ГБ GPU

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Выбор между GPT-Live-1 и NVIDIA Nemotron VoiceChat 11B — это не выбор между двумя голосовыми моделями. Это выбор между двумя бизнес-моделями, которые рядятся в голосовые модели. GPT-Live-1 — это хостинговый API, который OpenAI открыла для доступа разработчиков 10 сентября 2026 года, с оплатой $0,05 за минуту аудио, при этом ваше оборудование не задействовано. NVIDIA Nemotron VoiceChat 11B — опубликованная как NVIDIA-NemotronLabs-VoiceChat-11B, с контейнером NGC от 21 июля 2026 года и чекпойнтом Hugging Face в придачу — это полнодуплексная речевая модель с открытыми весами на 11 миллиардов параметров, которая не запустится ни на чём, кроме GPU с 80 ГБ. Одна из них стоит вам денег за каждую минуту разговора; другая стоит вам денег независимо от того, звонит кто-нибудь или нет.

Точка безубыточности проще, чем предполагают презентации вендоров.

Начните с одной цифры, с которой согласны обе стороны. GPT-Live-1 по $0.05 за минуту — это $3.00 за час непрерывной открытой линии. Это цена одного постоянно активного голосового разговора.

Теперь оцените стоимость альтернативы. Nemotron VoiceChat 11B требует GPU как минимум с 80 ГБ видеопамяти — карту класса A100, H100, H200, B100, B200 или RTX 6000, под Linux. Аренда одной из таких карт на открытом рынке обходится в несколько долларов в час, а владение ею амортизируется до сопоставимой суммы, если учесть загрузку. Так что одна постоянно активная голосовая линия — это примерно то на то и выходит: арендованная GPU стоит примерно столько же, сколько API, ещё до того, как вы заплатили за что-либо, что будет на ней работать.

Это неверное сравнение, и именно на нём останавливается большинство материалов о выборе между собственной разработкой и покупкой готового решения. Правильное сравнение — в расчёте на одну GPU, а не на строку, и оно зависит от цифры, которую NVIDIA не публиковала.

• GPT-Live-1 на аккаунте уровня Tier 1 — 25 одновременных сессий, что составляет $1,25 в минуту, или $75 в час, когда все 25 линий активны

• Nemotron VoiceChat 11B на одном 80-гигабайтном GPU — сколько бы одновременных сессий ни вмещала в 80 ГБ гибридная модель Mamba/Transformer на 11B, примерно по стоимости аренды этой карты

Модель на 11B на ускорителе с 80 ГБ — это огромный запас, а 80 ГБ — это требование, которое на практике даёт очень большую ёмкость для батчинга. Если одна карта выдерживает хотя бы шесть одновременных диалогов, самостоятельный хостинг при полной нагрузке обходится кардинально дешевле, чем API. Если же всего полтора — то нет. Пока кто-нибудь не измерит параллелизм на реальном трафике, честная позиция такова: точка безубыточности, скорее всего, окажется в пользу самостоятельного хостинга при больших объёмах, и ни один из вендоров не дал вам цифры, которая это доказывала бы.

A two-column comparison scoreboard titled 'GPT-Live-1 vs NVIDIA Nemotron VoiceChat 11B - the scoreboard'. The GPT-Live-1 column lists Shape hosted API; Cost $0.05 / minute; Turn-taking 0.8 s, vendor-reported; Voices 12; Tool calling delegated to backend model; Ops burden none, vendor runs it. The Nemotron VoiceChat 11B column lists Shape open weights; Cost one 80 GB GPU, billed while idle; Turn-taking 448 ms on Full-Duplex-Bench 1.0; Voices 1 fixed voice, Aria; Tool calling in-session, separate output channel; Ops burden you run the GPU on Linux. A footer reads 'Nemotron turn-taking figure is a published benchmark; GPT-Live-1 latency is OpenAI's own and unreproduced.'

Там, где открытая модель действительно лучше, а не просто дешевле

Сравнение задержки заслуживает более тщательного рассмотрения, чем сравнение цены, потому что по этому параметру у открытой модели более убедительные доказательства.

• Задержка смены реплик — Nemotron VoiceChat 11B сообщает о 448 мс для плавной смены реплик на Full-Duplex-Bench 1.0, с задержкой прерывания и уступки 480 мс и коэффициентом перехвата при прерывании пользователем 1,00. У GPT-Live-1 этот показатель составляет 0,8 секунды, снизившись с 1,4, по данным OpenAI.

Сопоставьте эти два числа, учитывая приложенные источники, и картина переворачивается. Цифры NVIDIA взяты из опубликованного, публично описанного набора бенчмарков. Цифры Ope​nAI получены от самой Ope​nAI, которая сравнивает свою новую модель с собственным предыдущим поколением, и не были независимо воспроизведены. Судя по имеющимся данным, модель с открытыми весами измеримо быстрее в том, что делает голосового агента похожим на человека, а хостируемая модель быстрее только согласно своим собственным пресс-материалам.

NVIDIA также заявляет о первом в своём роде достижении: Nemotron VoiceChat 11B описывается как первая открытая полнодуплексная модель, поддерживающая вызов инструментов в реальном времени во время разговора, с использованием отдельного выходного канала и предустановленных фраз удержания, чтобы агент мог продолжать говорить, пока ждёт ответа от внешнего API. Карточка модели включает три аудиосэмпла, приглашающих вас послушать именно это — естественное чередование реплик, описываемое как примерно 450 мс на ответ, перехват инициативы (barge-in), когда модель мгновенно уступает, и вызовы инструментов вживую прямо посреди разговора. Эти сэмплы принадлежат вендору и подтверждают показатель в 448 мс, а не независимо его проверяют, но по крайней мере это аудиодоказательства, привязанные к скачиваемому чекпоинту, а не число в анонсирующем посте. Это та же архитектурная проблема, которую GPT-Live-1 решает с помощью делегирования, но здесь на неё отвечают иначе — открытая модель сама удерживает линию; хостируемая модель передаёт задачу отдельной модели рассуждений и позволяет голосовому слою поддерживать разговор.

Сходства так же поучительны, как и различия. Оба работают в режиме полного дуплекса: слушают, пока говорят, а не по очереди. Оба поддерживают прерывание и перебивание. Оба обучались на речи в таком масштабе, что старые каскадные конвейеры ASR-then-LLM-then-TTS выглядят как три отдельных продукта, скреплённых вместе, — чекпойнт NVIDIA повидал примерно 550 000 часов речи.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-VoiceChat-11B, showing the openmdw-1.1 license tag, a model size of 11B params, 3,630 downloads last month, an inference-providers row stating the model isn't deployed by any Inference Provider, a model tree descending from NVIDIA-Nemotron-Nano-12B-v2-Base, three audio samples labelled natural turn-taking at roughly 450 ms response, barge-in where the model yields instantly, and tool calling live, and the description that NVIDIA NemotronLabs VoiceChat is an 11B end-to-end real-time speech full duplex model and the first open full-duplex model to support tool calling.

Чем вы жертвуете, и это не только деньги.

Первое, от чего вы отказываетесь с открытой моделью, — это голос. Выпущенный чекпойнт использует один фиксированный голос под названием Aria и не поддерживает клонирование голоса или библиотеку голосов. GPT-Live-1 поставляется с двенадцатью голосами, охватывающими разные акценты, диалекты и языки, и Ope​nAI специально переработал их для этой модели. Если голос вашего продукта является частью его идентичности или если вам нужно обслуживать несколько рынков с агентами, звучащими по-разному, из одного развёртывания, это само по себе почти дисквалифицирует — и это ограничение меньше всего заметно при сравнении характеристик, потому что выглядит как количество функций, а не как продуктовое решение.

Второе, от чего приходится отказываться, — это верхний предел контекста. Модель несёт заданное при обучении ограничение на длину высказывания около 142 секунд, а также практическое ограничение на удержание более чем примерно двух минут аудиоконтекста. Двадцатиминутный телефонный разговор для этого чекпоинта — не один непрерывный контекст; это последовательность сегментов, которой должна управлять окружающая система. Хостируемые модели обычно берут этот учёт на себя.

Третье — это то, что вам разрешено с ним делать. Карточка модели Hugging Face содержит лицензию openmdw-1.1, тогда как в некоторых публикациях о выпуске он описывался как предназначенный только для исследовательского использования, а на странице контейнера NGC компоненты представлены как готовые к коммерческому или некоммерческому использованию. Три источника, три разных толкования, и только текст лицензии имеет решающее значение. Такое расхождение — как раз из тех вещей, которые всплывают при юридической проверке за три недели до запуска. Устраните его до начала разработки, а не после.

Четвёртое — эксплуатация. GPU на 80 ГБ — не та статья расходов, которую можно отключить в тихое воскресенье: даже при нулевом трафике вы платите за карту, и вы отвечаете за кривую масштабирования, обновления драйверов, планирование мощностей и график дежурств для аудиотракта в реальном времени, где разрыв соединения означает потерянного клиента. К тому же нет хостингового запасного варианта, на который можно опереться, пока вы всё это выстраиваете, — в строке «провайдер инференса» карточки Hugging Face прямо указано, что модель не развёрнута ни одним провайдером инференса, так что нет поминутной версии этого чекпоинта, на которой можно было бы прототипировать. Вы либо разворачиваете его самостоятельно, либо не используете. Эта работа незаметна в поминутном сравнении и очень заметна в плане найма.

Гибрид, который большинству команд действительно стоит рассмотреть

Постановка вопроса, которая делает это решение разрешимым, состоит в том, что две модели не обязательно должны представлять собой бинарный выбор. Голосовой агент обычно имеет голосовой слой и слой рассуждений, и именно в слое рассуждений заключена гибкость.

GPT-Live-1 устроен именно так по замыслу. Его голосовой слой поддерживает разговор, пока мышление делегируется через Responses API обычной текстовой модели — собственный опубликованный пример WebRTC от OpenAI подключает этот бэкенд к GPT-5.6 Terra. Эта половина вашего стека — обычный вызов API с оплатой за токены и реальным выбором поставщиков. GPT-5.6 Terra обслуживается через OrcaRouter по цене 2,00 доллара за миллион входных токенов и 12,00 доллара за миллион выходных, с контекстом в 1 млн токенов и с доступными как /v1/chat/completions, так и /v1/responses, наряду с примерно 190 другими моделями, доступными по одному ключу.

Это важно для проекта с самостоятельным хостингом именно потому, что меняет профиль риска. Если вы развернете Nemotron VoiceChat 11B и он не выдержит ваш трафик, голосовая половина — невозвратные затраты на GPU — но половину, отвечающую за рассуждения, можно переместить, переключить при сбое или разделить между дешевой моделью для рутинных реплик и мощной для эскалаций, вообще не трогая аудиотракт. Автоматическое переключение при сбое между вышестоящими провайдерами — это разница между плохим днем и плохим кварталом, когда зависимость от единственного источника выходит из строя.

Чётко отметьте, что где доступно, а что нет: ни GPT-Live-1, ни Nemotron VoiceChat 11B не обслуживаются через OrcaRouter. Оба происходят из собственного источника — в одном случае это конечная точка Live Sessions от OpenAI, в другом — ваш собственный GPU. Рычаг маршрутизации целиком находится ниже по потоку от аудио.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

Что взять за основу

• Выберите GPT-Live-1, если вы хотите выпустить продукт в этом квартале, если вам нужно более одного голоса, если ваши разговоры регулярно длятся дольше двух минут непрерывного контекста или если объём ещё не достаточно высок, чтобы оправдать GPU, который тарифицируется, пока простаивает.

• Выберите NVIDIA Nemotron VoiceChat 11B, если вы уже используете 80-гигабайтные GPU, если вам нужна смена реплик менее чем за 500 мс, подтверждённая фактами, а не утверждениями, если вам нужно, чтобы аудио оставалось внутри вашей собственной инфраструктуры по причинам резидентности данных, или если у вас такой объём звонков, при котором поминутный счётчик API — самая крупная строка в счёте.

• Прототипируйте на API и проведите бенчмарк чекпоинта. Решение упирается в одну неопубликованную цифру — число одновременных сессий на одну карту объёмом 80 ГБ — и единственный способ её получить — измерить её на собственном профиле трафика. Это неделя работы, и это разница между обоснованным инфраструктурным решением и догадкой, замаскированной под решение.