
GPT-Live-1 против NVIDIA Nemotron VoiceChat 11B: оплата за минуту или 80-ГБ GPU
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 за 1 млн токенов
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
Выбор между GPT-Live-1 и NVIDIA Nemotron VoiceChat 11B — это не выбор между двумя голосовыми моделями. Это выбор между двумя бизнес-моделями, которые рядятся в голосовые модели. GPT-Live-1 — это хостинговый API, который OpenAI открыла для доступа разработчиков 10 сентября 2026 года, с оплатой $0,05 за минуту аудио, при этом ваше оборудование не задействовано. NVIDIA Nemotron VoiceChat 11B — опубликованная как NVIDIA-NemotronLabs-VoiceChat-11B, с контейнером NGC от 21 июля 2026 года и чекпойнтом Hugging Face в придачу — это полнодуплексная речевая модель с открытыми весами на 11 миллиардов параметров, которая не запустится ни на чём, кроме GPU с 80 ГБ. Одна из них стоит вам денег за каждую минуту разговора; другая стоит вам денег независимо от того, звонит кто-нибудь или нет.
Точка безубыточности проще, чем предполагают презентации вендоров.
Начните с одной цифры, с которой согласны обе стороны. GPT-Live-1 по $0.05 за минуту — это $3.00 за час непрерывной открытой линии. Это цена одного постоянно активного голосового разговора.
Теперь оцените стоимость альтернативы. Nemotron VoiceChat 11B требует GPU как минимум с 80 ГБ видеопамяти — карту класса A100, H100, H200, B100, B200 или RTX 6000, под Linux. Аренда одной из таких карт на открытом рынке обходится в несколько долларов в час, а владение ею амортизируется до сопоставимой суммы, если учесть загрузку. Так что одна постоянно активная голосовая линия — это примерно то на то и выходит: арендованная GPU стоит примерно столько же, сколько API, ещё до того, как вы заплатили за что-либо, что будет на ней работать.
Это неверное сравнение, и именно на нём останавливается большинство материалов о выборе между собственной разработкой и покупкой готового решения. Правильное сравнение — в расчёте на одну GPU, а не на строку, и оно зависит от цифры, которую NVIDIA не публиковала.
• GPT-Live-1 на аккаунте уровня Tier 1 — 25 одновременных сессий, что составляет $1,25 в минуту, или $75 в час, когда все 25 линий активны
• Nemotron VoiceChat 11B на одном 80-гигабайтном GPU — сколько бы одновременных сессий ни вмещала в 80 ГБ гибридная модель Mamba/Transformer на 11B, примерно по стоимости аренды этой карты
Модель на 11B на ускорителе с 80 ГБ — это огромный запас, а 80 ГБ — это требование, которое на практике даёт очень большую ёмкость для батчинга. Если одна карта выдерживает хотя бы шесть одновременных диалогов, самостоятельный хостинг при полной нагрузке обходится кардинально дешевле, чем API. Если же всего полтора — то нет. Пока кто-нибудь не измерит параллелизм на реальном трафике, честная позиция такова: точка безубыточности, скорее всего, окажется в пользу самостоятельного хостинга при больших объёмах, и ни один из вендоров не дал вам цифры, которая это доказывала бы.

Там, где открытая модель действительно лучше, а не просто дешевле
Сравнение задержки заслуживает более тщательного рассмотрения, чем сравнение цены, потому что по этому параметру у открытой модели более убедительные доказательства.
• Задержка смены реплик — Nemotron VoiceChat 11B сообщает о 448 мс для плавной смены реплик на Full-Duplex-Bench 1.0, с задержкой прерывания и уступки 480 мс и коэффициентом перехвата при прерывании пользователем 1,00. У GPT-Live-1 этот показатель составляет 0,8 секунды, снизившись с 1,4, по данным OpenAI.
Сопоставьте эти два числа, учитывая приложенные источники, и картина переворачивается. Цифры NVIDIA взяты из опубликованного, публично описанного набора бенчмарков. Цифры OpenAI получены от самой OpenAI, которая сравнивает свою новую модель с собственным предыдущим поколением, и не были независимо воспроизведены. Судя по имеющимся данным, модель с открытыми весами измеримо быстрее в том, что делает голосового агента похожим на человека, а хостируемая модель быстрее только согласно своим собственным пресс-материалам.
NVIDIA также заявляет о первом в своём роде достижении: Nemotron VoiceChat 11B описывается как первая открытая полнодуплексная модель, поддерживающая вызов инструментов в реальном времени во время разговора, с использованием отдельного выходного канала и предустановленных фраз удержания, чтобы агент мог продолжать говорить, пока ждёт ответа от внешнего API. Карточка модели включает три аудиосэмпла, приглашающих вас послушать именно это — естественное чередование реплик, описываемое как примерно 450 мс на ответ, перехват инициативы (barge-in), когда модель мгновенно уступает, и вызовы инструментов вживую прямо посреди разговора. Эти сэмплы принадлежат вендору и подтверждают показатель в 448 мс, а не независимо его проверяют, но по крайней мере это аудиодоказательства, привязанные к скачиваемому чекпоинту, а не число в анонсирующем посте. Это та же архитектурная проблема, которую GPT-Live-1 решает с помощью делегирования, но здесь на неё отвечают иначе — открытая модель сама удерживает линию; хостируемая модель передаёт задачу отдельной модели рассуждений и позволяет голосовому слою поддерживать разговор.
Сходства так же поучительны, как и различия. Оба работают в режиме полного дуплекса: слушают, пока говорят, а не по очереди. Оба поддерживают прерывание и перебивание. Оба обучались на речи в таком масштабе, что старые каскадные конвейеры ASR-then-LLM-then-TTS выглядят как три отдельных продукта, скреплённых вместе, — чекпойнт NVIDIA повидал примерно 550 000 часов речи.

Чем вы жертвуете, и это не только деньги.
Первое, от чего вы отказываетесь с открытой моделью, — это голос. Выпущенный чекпойнт использует один фиксированный голос под названием Aria и не поддерживает клонирование голоса или библиотеку голосов. GPT-Live-1 поставляется с двенадцатью голосами, охватывающими разные акценты, диалекты и языки, и OpenAI специально переработал их для этой модели. Если голос вашего продукта является частью его идентичности или если вам нужно обслуживать несколько рынков с агентами, звучащими по-разному, из одного развёртывания, это само по себе почти дисквалифицирует — и это ограничение меньше всего заметно при сравнении характеристик, потому что выглядит как количество функций, а не как продуктовое решение.
Второе, от чего приходится отказываться, — это верхний предел контекста. Модель несёт заданное при обучении ограничение на длину высказывания около 142 секунд, а также практическое ограничение на удержание более чем примерно двух минут аудиоконтекста. Двадцатиминутный телефонный разговор для этого чекпоинта — не один непрерывный контекст; это последовательность сегментов, которой должна управлять окружающая система. Хостируемые модели обычно берут этот учёт на себя.
Третье — это то, что вам разрешено с ним делать. Карточка модели Hugging Face содержит лицензию openmdw-1.1, тогда как в некоторых публикациях о выпуске он описывался как предназначенный только для исследовательского использования, а на странице контейнера NGC компоненты представлены как готовые к коммерческому или некоммерческому использованию. Три источника, три разных толкования, и только текст лицензии имеет решающее значение. Такое расхождение — как раз из тех вещей, которые всплывают при юридической проверке за три недели до запуска. Устраните его до начала разработки, а не после.
Четвёртое — эксплуатация. GPU на 80 ГБ — не та статья расходов, которую можно отключить в тихое воскресенье: даже при нулевом трафике вы платите за карту, и вы отвечаете за кривую масштабирования, обновления драйверов, планирование мощностей и график дежурств для аудиотракта в реальном времени, где разрыв соединения означает потерянного клиента. К тому же нет хостингового запасного варианта, на который можно опереться, пока вы всё это выстраиваете, — в строке «провайдер инференса» карточки Hugging Face прямо указано, что модель не развёрнута ни одним провайдером инференса, так что нет поминутной версии этого чекпоинта, на которой можно было бы прототипировать. Вы либо разворачиваете его самостоятельно, либо не используете. Эта работа незаметна в поминутном сравнении и очень заметна в плане найма.
Гибрид, который большинству команд действительно стоит рассмотреть
Постановка вопроса, которая делает это решение разрешимым, состоит в том, что две модели не обязательно должны представлять собой бинарный выбор. Голосовой агент обычно имеет голосовой слой и слой рассуждений, и именно в слое рассуждений заключена гибкость.
GPT-Live-1 устроен именно так по замыслу. Его голосовой слой поддерживает разговор, пока мышление делегируется через Responses API обычной текстовой модели — собственный опубликованный пример WebRTC от OpenAI подключает этот бэкенд к GPT-5.6 Terra. Эта половина вашего стека — обычный вызов API с оплатой за токены и реальным выбором поставщиков. GPT-5.6 Terra обслуживается через OrcaRouter по цене 2,00 доллара за миллион входных токенов и 12,00 доллара за миллион выходных, с контекстом в 1 млн токенов и с доступными как /v1/chat/completions, так и /v1/responses, наряду с примерно 190 другими моделями, доступными по одному ключу.
Это важно для проекта с самостоятельным хостингом именно потому, что меняет профиль риска. Если вы развернете Nemotron VoiceChat 11B и он не выдержит ваш трафик, голосовая половина — невозвратные затраты на GPU — но половину, отвечающую за рассуждения, можно переместить, переключить при сбое или разделить между дешевой моделью для рутинных реплик и мощной для эскалаций, вообще не трогая аудиотракт. Автоматическое переключение при сбое между вышестоящими провайдерами — это разница между плохим днем и плохим кварталом, когда зависимость от единственного источника выходит из строя.
Чётко отметьте, что где доступно, а что нет: ни GPT-Live-1, ни Nemotron VoiceChat 11B не обслуживаются через OrcaRouter. Оба происходят из собственного источника — в одном случае это конечная точка Live Sessions от OpenAI, в другом — ваш собственный GPU. Рычаг маршрутизации целиком находится ниже по потоку от аудио.

Что взять за основу
• Выберите GPT-Live-1, если вы хотите выпустить продукт в этом квартале, если вам нужно более одного голоса, если ваши разговоры регулярно длятся дольше двух минут непрерывного контекста или если объём ещё не достаточно высок, чтобы оправдать GPU, который тарифицируется, пока простаивает.
• Выберите NVIDIA Nemotron VoiceChat 11B, если вы уже используете 80-гигабайтные GPU, если вам нужна смена реплик менее чем за 500 мс, подтверждённая фактами, а не утверждениями, если вам нужно, чтобы аудио оставалось внутри вашей собственной инфраструктуры по причинам резидентности данных, или если у вас такой объём звонков, при котором поминутный счётчик API — самая крупная строка в счёте.
• Прототипируйте на API и проведите бенчмарк чекпоинта. Решение упирается в одну неопубликованную цифру — число одновременных сессий на одну карту объёмом 80 ГБ — и единственный способ её получить — измерить её на собственном профиле трафика. Это неделя работы, и это разница между обоснованным инфраструктурным решением и догадкой, замаскированной под решение.
