
NVIDIA NemotronLabs VoiceChat 11B: полнодуплексная голосовая модель, которую NVIDIA выпустила без анонса
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
В одном и том же репозитории Hugging Face находятся две карточки модели, и они противоречат друг другу. Та, что отображается на странице, называет модель NVIDIA NemotronLabs VoiceChat 11B, указывает дату выпуска 3 августа 2026 года и перечисляет 11B параметров. Вторая, файл с названием overview.md, который никто не видит, пока не откроешь вкладку Files, называет ту же модель 12B, датирует выпуск 16 июля, содержит раздел с бенчмарками, которого нет в публичной карточке, и по-прежнему содержит слово TODO на месте, где должно быть описание результатов. Ни одна из карточек не сопровождалась анонсом, пресс-релизом, техническим отчётом или твитом от NVIDIA.
Впрочем, это не заглушка. Это чекпойнт объёмом 44 ГБ, который одновременно слушает и говорит: единый стек, который принимает аудио с микрофона и выдаёт синтезированную речь на выходе, без обычной цепочки распознавания речи → языковая модель → синтез речи. Он построен на основе Nemotron Nano 9B v2, умеет вызывать инструменты в середине предложения, не прекращая говорить, и, по заявлению NVIDIA, это первая открытая полнодуплексная модель, способная на такое.
Всё нижеследующее читается напрямую из этого репозитория — две карточки, config.json и индекс тензора внутри файла весов, который мы разобрали сами, чтобы разрешить вопрос 11B против 12B. Все показатели производительности, которые NVIDIA публикует для этой модели, принадлежат самой NVIDIA, измерены NVIDIA и не воспроизведены независимо. В открытом доступе существует ровно одно независимое измерение этой линейки — от Artificial Analysis, и оно зарегистрировано под другим именем и с другим числом параметров — что оказывается самым интересным в этом релизе.
Что на самом деле находится в репозитории
Репозиторий создан 29 июля 2026 года и последний раз обновлён 4 августа. Он содержит семнадцать файлов: две конкурирующие карточки моделей, лицензию, config.json, один файл объёмом 44,4 ГБ, model.safetensors, схему архитектуры, каталог токенизатора RNN-T, четыре краткие заметки о политике в отношении предвзятости, безопасности, конфиденциальности и объяснимости, а также три .wav файла — демонстрацию чередования реплик (turn-taking), демонстрацию прерывания (barge-in) и демонстрацию вызова инструментов (tool-calling) — встроенные в верхней части карточки в виде аудиоплееров, чтобы вы могли услышать модель, прежде чем прочитать о ней.
Кое-чего не хватает, и это важнее, чем список файлов.
• Для этой модели нет научной статьи. В карточке указаны пять источников: VoiceBench, Full-Duplex-Bench 1.0, Full-Duplex-Bench v3, SALM-Duplex, Audio Flamingo 3, а также препринт PersonaPlex от самой NVIDIA. Ни один из них не является техническим отчётом NemotronLabs VoiceChat. Архитектура описана примерно в трёх абзацах и на одной схеме — и это всё, что публично известно о том, как модель была построена.
• Вызвать её невозможно. На странице Hugging Face прямо указано, что модель «не развёрнута ни одним инференс-провайдером». Размещённого эндпоинта нет ни от NVIDIA, ни от кого-либо ещё. Единственная открытая ветка обсуждения в репозитории — это пользователь, просящий NVIDIA добавить handler.py, чтобы чекпойнт можно было развернуть на Hugging Face Inference Endpoints; этот пользователь пытался запустить модель простым способом и обнаружил, что такого способа нет.
• Здесь нет ни pipeline_tag, ни library_name. Именно поэтому на странице нет виджета инференса и метки задачи; это симптом более глубокой проблемы: config.json — это не конфиг Transformers. Это 32-килобайтный NeMo-тренировочный конфиг, содержащий блок AdamW, планировщик скорости обучения, бины бакетов даталоадера и валидационный сплит. Вы не можете направить AutoModel.from_pretrained на это. Вы клонируете конкретную ветку репозитория NVIDIA Speech — nemotron-labs-voicechat — создаёте окружение conda, зафиксированное на Python 3.12, PyTorch 2.10 и Transformers 4.56, компилируете causal-conv1d и mamba-ssm без изоляции сборки и запускаете их скрипт.
Счётчик загрузок отражает всё это. 107 лайков против 80 загрузок в первый месяц существования модели — это признак релиза, который люди добавили в закладки, но не запускали.

Мы посчитали параметры, и 11B побеждает
Файл safetensors содержит JSON-заголовок, перечисляющий каждый тензор, его форму и тип данных, так что количество параметров — не вопрос мнения. Мы извлекли заголовок и просуммировали: 11 095 миллионов параметров в 1 626 тензорах float32, которые занимают 44,38 ГБ. Значит, отображаемая карточка верна, а overview.md устарел — это модель на 11B, а цифра 12B — пережиток.
Дерево моделей Hugging Face объясняет, откуда могла взяться 12B. Прослеживаемая родословная идёт так: Nemotron Nano 12B v2 Base, затем Nemotron Nano 12B v2, затем Nemotron Nano 9B v2, и только потом эта модель. В собственном семействе текстовых бэкбонов NVIDIA есть и 12B, и 9B, причём 9B — это прореженный потомок 12B, а VoiceChat построен на 9B. Карточка модели, составленная раньше в этой цепочке, естественно, несла бы большее число.
Заголовок также четко разделяется по двум половинам архитектуры:
• Сторона понимания — 10.098B. Из них 7.714B — стек трансформера Nemotron Nano v2, 0.609B — речевой энкодер, а три отдельные матрицы 131,072 × 4,480 занимают по 0.587B каждая.
• Говорящая сторона — 0.997B. Это 28-слойная основа синтеза речи с шириной 1152 и объёмом 0.595B, выходной блок на основе смеси гауссиан объёмом 0.159B и нейронный аудиокодек, чей энкодер и декодер составляют по 0.092B.
Из dtype вытекают два практических следствия. Первое: загрузка на 44 ГБ — это не большая модель, а обычная модель в float32; если привести её к bfloat16, веса составят примерно 22 ГБ. Второе: заявленный NVIDIA минимум — GPU на 80 ГБ — следствие этого выбора, а не размера модели, и тот, у кого есть карта на 48 ГБ и кто готов сам сконвертировать чекпойнт, не выглядит явно отрезанным — хотя никто ещё не публиковал подтверждённого запуска при таком объёме памяти, так что воспринимайте это как арифметику, а не как обещание.
Как оно одновременно слушает и говорит.
«Full duplex» — в этом весь смысл релиза, и конфиг показывает, как он приобретается. Три проектных решения выполняют эту работу.
• Речевой энкодер не может заглядывать вперёд. Это 24-слойный Conformer с 8 головками внимания, чей контекст внимания установлен на [70, 0] — семьдесят кадров левого контекста и ноль кадров правого контекста. Обычный распознаватель заглядывает в аудио после текущего момента, чтобы устранить неоднозначность того, что он только что услышал; этому же запрещено так делать, что стоит точности, но даёт возможность выдать решение в тот момент, когда поступает кадр.
• Всё квантуется до 80 мс. Длина фрейма в конфиге — 0,08 секунды, что соответствует размеру фрагмента в 80 мс, который NVIDIA описывала ранее для этого направления работы. Каждые 80 мс модель решает, продолжать ли слушать или начать говорить. Именно этот ритм делает прерывание мгновенным, а не вежливым.
• Вызовы инструментов исходят из их собственного «рта».Вспомните те три матрицы одинаковой формы со словарём на 131 072 токена. Одна — входная эмбеддинг-матрица, другая — обычная языковая голова модели, а третья называется function_head. «Отдельный выходной канал для скриптов вызова инструментов» в описании карточки — это буквально третья выходная проекция шириной в 587 миллионов параметров, работающая параллельно с генерацией речи. Именно поэтому архитектурно модель может отправлять вызов инструмента, не прерывая разговор, и это реальное дизайнерское решение, а не условность промпта.
На следующем этапе декодер text-to-speech предсказывает коды для кодека с остаточным векторным квантованием с 31 квантователем и коэффициентами понижения частоты дискретизации 7, 7 и 9 — это сокращение в 441 раз, снижающее частоту аудиотокенов до 50 кадров в секунду при выходной частоте 22,05 кГц. На вход подаётся сигнал с частотой 16 кГц. В чекпоинте также присутствуют RNN-T декодер и joint-сеть, поэтому среди заявленных выходных данных модели есть транскрипция речи пользователя наряду с её собственным текстом и аудио: транскрипция — это настоящая распознающая головка, а не побочный продукт. Голос по умолчанию называется Aria, а трёхсекундный референсный клип определяет говорящего.
Стоит отметить ещё одну деталь конфигурации, поскольку она подтверждает заявленное ограничение: тренировочный даталоадер ограничивает длительность реплик до 142,39 секунды. Предупреждение в карточке модели о том, что модель поддерживает не более двух минут аудиоконтекста, видно в пайплайне данных, который её создал.
Оценки и кто их на самом деле измерял
Главные заявления NVIDIA касаются задержки и рейтинга. На Full-Duplex-Bench 1.0 она сообщает о 448 мс на плавный захват реплики и 480 мс на уступку при прерывании, с коэффициентом перехвата 0,82 при плавной смене реплик и 1,0 при прерывании пользователем, а также оценкой судьи GPT-4o 4,33 за обработку прерываний. Она заявляет #2 среди открытых full-duplex моделей на VoiceBench и #2 среди открытых моделей на Full-Duplex-Bench. Все это собственные запуски NVIDIA.
Сопоставьте их с внешним миром — и откроются два разрыва.
• Что касается речевых рассуждений, показатель вендора завышен примерно на восемь пунктов. Необработанный overview.md сообщает о 37.0% на Big Bench Audio. Artificial Analysis независимо измерила эту линейку на 29.2%. Тот же бенчмарк, та же линейка, разрыв достаточно велик, чтобы изменить позицию модели в рейтинге.
• На VoiceBench цифра производителя слишком скромная. Карточка указывает #2 среди открытых full-duplex моделей; публичный лидерборд VoiceBench оценивает эту модель в 58.10, что является лучшим показателем в категории открытых full-duplex моделей, опережая Freeze-Omni с 55.20 и Moshi с 29.51. Собственная черновая карточка NVIDIA указывает 55.1 — ниже числа, которое сейчас указано в лидерборде.
Есть и более мелкая странность: собственная сравнительная таблица NVIDIA оценивает конкурентов более щедро, чем Artificial Analysis. В черновой карточке Freeze-Omni получает 33,4%, а PersonaPlex 7B — 19,1% в Big Bench Audio; Artificial Analysis даёт 33,9% и 12,6%. Порядок среди соперников в обоих случаях сохраняется, что обнадёживает, но это напоминание о том, что инструменты производителя и независимый инструмент не возвращают одинаковые цифры даже для третьих сторон.

График делает честный заголовок неизбежным. Среди открытых полнодуплексных моделей это настоящий шаг вперёд — он более чем вдвое превосходит PersonaPlex в рассуждениях на основе устной речи и оставляет Moshi совершенно в другой категории. В сравнении с тем, что можно купить, он даже близко не стоит: Step-Audio R1.1 — 96%, голосовой агент Grok 4.5 и Gemini 2.5 Flash (Thinking) — 92%, Nova 2.0 Sonic — 87%. Это примерно трёхкратный разрыв в рассуждениях по устному вводу.
Самый наглядный способ увидеть, во что сегодня обходится полный дуплекс, — заглянуть в собственный каталог NVIDIA. В VoiceBench NVIDIA Nemotron 3 Nano Omni 30B A3B — более крупная модель, не являющаяся полнодуплексной, — набирает 89,39 балла против 58,10 у VoiceChat. Обработка прерываний и смена реплик менее чем за 500 мс стоят примерно тридцать пунктов качества ассистента, по крайней мере в этом поколении. Если вашему продукту не нужна модель, которую можно прервать на полуслове, вы платите немало за функцию, которой не воспользуетесь.
Вызов инструментов — главная тема, а также самое слабое место.
Утверждение, на котором держится релиз, — «первая открытая full-duplex модель с поддержкой вызова инструментов», но цифры под ним неоднородны. В разговорном варианте BFCL-v3 NVIDIA сообщает о среднем результате 56,1%: 58,5% для простых, 62,5% для множественных, 42,5% для параллельных, 27,5% для параллельных множественных и 89,6% за корректный отказ от нерелевантных вызовов. На Full-Duplex-Bench v3 разброс ещё резче.
• Выбор инструмента — 82,5%. Выбор правильной функции из списка — то, что NVIDIA справедливо описывает как конкурентоспособное по сравнению с передовыми моделями.
• Точность аргументов — 44.2%. Корректное заполнение параметров этой функции на основе того, что сказал пользователь.
• Pass@1 — 33%. Выполнить весь вызов правильно с первой попытки.
Модель, которая знает, какой инструмент ей нужен, на две трети надёжнее, чем умеет заполнять аргументы для этого инструмента, — это модель, которая с уверенностью посмотрит прогноз погоды не для того города. В текстовом агенте вы поймали бы это с помощью слоя валидации и повтора; в живом голосовом вызове повтор слышен, и в карточке указано, что модель не должна повторять неудачный вызов вообще — ей предписано сообщить пользователю, что у API проблема.
Эксплуатационные ограничения, связанные с этим, жесткие, и NVIDIA перечисляет их без прикрас: максимум пять инструментов за сессию, после чего качество ухудшается; нет надежных одновременных вызовов нескольких инструментов; у пользователя нет возможности прервать выполнение инструмента; а в смешанной беседе система склонна отвечать на основе собственных знаний, вместо того чтобы вызывать нужный инструмент. Долгие ответы инструментов заставляют агента простаивать — именно это и призвана замаскировать функция «сообщения об ожидании»: вы заранее пишете фразу, которую агент произносит в момент запуска вызова, чтобы тишина была чем-то заполнена.
Одна особенность, которая будет стоить кому-то полдня: системные промпты и ответы инструментов должны содержать только ASCII. Никаких длинных тире, никаких фигурных кавычек, никаких значков градуса, никаких эмодзи. Вывод инструментов должен быть сведён к простым, пригодным для речи ASCII-предложениям, прежде чем он попадёт в модель, а это означает, что JSON API-ответ нельзя передавать в сыром виде.
Сколько стоит запуск, и лицензия, которая вас ограничивает
Начнём с оборудования. Документация NVIDIA требует GPU как минимум с 80 ГБ памяти, что указывает на H100 или H200, а протестированная конфигурация — это H100 с vLLM. Аренда H100 по требованию стоит примерно $2–3 в час в распространённых облачных GPU-платформах, поэтому постоянно работающий инстанс обойдётся примерно в $1 500–2 200 в месяц, прежде чем вы напишете код приложения, наймёте кого-то для его поддержки или обслужите второй параллельный диалог.
Теперь сравнение. Artificial Analysis нормализует цены на хостинговые сервисы «речь-в-речь» до стоимости часа входного аудио, и текущий диапазон простирается примерно от $1,42/час на дешёвом конце до $10,75/час для самого дорогого премиального тарифа, при этом хорошо зарекомендовавший себя вариант среднего сегмента, такой как Grok Voice Think Fast 2.0, обходится в $4,80/час — то есть $0,08 за минуту аудио.

Прочитайте эти два абзаца вместе, и аргумент в пользу самостоятельного размещения окажется слабее, чем кажется. Выделенный H100 обходится дешевле, чем хостинг-эндпоинт средней ценовой категории, только если вы обеспечиваете его действительно постоянную загрузку, и он дороже, чем дешёвый сегмент рынка хостинга, практически независимо от уровня использования — при этом вы также берёте на себя инженерные работы, дежурства и модель, которая набирает 29,2% там, где хостинговые варианты достигают 87–96%.
И вот стена. Лицензия — это OpenMDW License Agreement v1.1, а в карточке модели в блоке цитаты указано, что модель «предназначена только для исследовательских целей». Код в ветке GitHub имеет лицензию Apache-2.0; веса — нет. Вы можете скачать это, изучить, дообучить, протестировать и написать об этом. Вы не можете поставить это клиентам. Поэтому все приведённые выше экономические аргументы для компании, пытающейся выпустить голосовой продукт, не имеют практического значения — вопрос никогда не заключался в том, сработают ли расчёты на GPU.
Это также объясняет, почему мы прямо скажем очевидное: NemotronLabs VoiceChat 11B нельзя вызвать через OrcaRouter, потому что его нельзя вызвать ни через что. Что один ключ действительно даёт — так это базовый уровень, с которым его следует сравнивать: размещённые голосовые и аудиомодели находятся за единым API с нулевой наценкой, то есть мы без изменений передаём прейскурантную цену провайдера, поэтому когда вендор снижает свой тариф на аудио, вы платите меньшую сумму в тот же день, а не после истечения контрактного цикла. Если вы оцениваете стоимость голосового агента, эта цифра за минуту — то число, которое должен побить GPU на 80 ГБ, и его стоит точно знать, прежде чем вкладываться в стойку.
Проблема с названием: 11B, 12B, NemotronLabs, Nemotron 3
Именно здесь большая часть раннего освещения пошла не так, поэтому стоит быть осторожным в отношении того, что установлено, а что нет.
Четыре собственные площадки NVIDIA описывают эту работу под тремя разными названиями. Hugging Face публикует «NVIDIA NemotronLabs VoiceChat 11B» с открытыми весами и лицензией только для исследований. Блог разработчиков NVIDIA в марте 2026 года описал «Nemotron 3 VoiceChat» как полнодуплексную модель с 12 млрд параметров в раннем доступе, нацеленную на суб-300-мс сквозную задержку на 80-мс фрагментах, с программой раннего доступа, предлагающей эталонные контейнеры, результаты бенчмарков и путь дообучения, и обещающей «открытые, проверяемые веса для корпоративного развертывания». Публичный лидерборд VoiceBench и Artificial Analysis оба указывают их как «Nemotron 3 VoiceChat (V1)», 12B.
Что известно: описания архитектуры совпадают компонент за компонентом — кодировщик Fast Conformer, основа Nemotron Nano v2 9B, декодер синтеза речи от NVIDIA, отдельный канал вызова инструментов, кадры по 80 мс, единый унифицированный стек. Неотображаемая карточка в репозитории Hugging Face использует цифру 12B, которую используют и другие поверхности. Это та же линия работы, и сторонние записи почти наверняка измеряют это семейство.
Что не подтверждено: то, что контрольная точка, которую можно скачать сегодня, побитово совпадает с тем, что оценивали Artificial Analysis и VoiceBench, или с тем, что выдаёт программа раннего доступа. Две детали говорят против такого предположения. Количество параметров различается: измерено 11,095B против 12B заявленных. И целевые показатели задержки резко различаются — в блоге для корпоративных клиентов обещают сквозную задержку менее 300 мс, тогда как на опубликованной карточке указаны 448 мс и 480 мс в Full-Duplex-Bench. Это могут быть разные точки измерения одной и той же модели или разные модели. NVIDIA не сказала, потому что NVIDIA вообще ничего не сказала об этом релизе.
Практический вывод: если вы приводите какую-либо цифру для этой модели, указывайте, из какого источника она взята. Публикации, приписывающие показатель Artificial Analysis в 29,2% карточке модели на Hugging Face, а показатель NVIDIA в 37,0% — независимому тесту, смешивают две вещи, которые сама NVIDIA держит в отдельных документах с разным количеством параметров.
Где это ломается
Раздел об ограничениях в черновой карточке необычно откровенен, а ветка GitHub добавляет ещё больше. Собрано:
• Только английский, и в репозитории нет плана по многоязычности.
• Двухминутная память. Разговор за пределами двухминутного аудиоокна может не сохраняться — жёсткий потолок для звонков в поддержку или для всего, что должно помнить, о чём договорились четыре минуты назад.
• Глупее собственной основы. NVIDIA заявляет, что она может уступать Nemotron Nano 9B v2 в знаниях, следовании инструкциям и безопасности, поскольку она была настроена на естественность разговора. Она не была явно обучена рассуждениям или согласованию; многошаговые рассуждения и арифметика называются слабыми местами.
• Нет надежного бэк-каналинга. «mm-hm», которое сигнализирует, что человек всё ещё слушает, не обрабатывается систематически.
• Он прервёт вас на полуслове. В заметках к ветке перечислены прерывание пользователя на паузе в середине предложения и «неконтролируемое продолжение / разговор с самим собой» среди известных режимов отказа — прямая цена энкодера с нулевым правым контекстом.
• Только тихие помещения. Категорически не подходит для шумных или реверберирующих сред, особенно там, где присутствует фоновая речь. Это исключает большинство залов колл-центров и большинство автомобилей.
Кому на самом деле стоит скачать это
Исследователи, работающие над моделированием дуплексной речи, получают здесь больше всего пользы, и им стоит перейти: открытый чекпоинт 11B с работающим каналом вызова инструментов, обученный на примерно 550 000 часах смешанного реального и синтетического аудио, является гораздо лучшей отправной точкой, чем повторная реализация по статье SALM-Duplex. Исследовательская лицензия не является ограничением для этой работы.
Командам, разрабатывающим голосовых агентов, стоит прочитать карточку и пропустить загрузку. Всё, что вы вынесете из чекпоинта на 44 ГБ в float32, который всё равно не сможете задеплоить, не изменит вашу архитектуру, а честный урок бенчмарков в том, что сквозной полный дуплекс пока не конкурентоспособен с хорошей хостинговой моделью по тому, что пользователи замечают больше всего, — а именно, понял ли их ассистент. А пока разумный ход — строить поверх хостингового эндпоинта и держать замену дешёвой: один ключ на 200+ моделей с автоматическим фейловером означает, что инцидент у провайдера не оборвёт вашу телефонную линию посреди звонка, а переход на открытую полнодуплексную модель позже станет сменой конфигурации, а не переписыванием кода.
Предприятиям, для которых это особенно важно, следует подать заявку на ранний доступ к Nemotron 3 VoiceChat, а не строить решение на основе весов Hugging Face. Именно в этой программе действуют развёртываемая лицензия, эталонные контейнеры и заявленное время ответа менее 300 мс. Публичная контрольная точка — это исследовательская предварительная версия той же идеи, опубликованная без юридического оформления, которое позволило бы использовать её на практике.
Три вопроса, которые этот репозиторий будет продолжать получать
Могу ли я использовать его в коммерческих целях, если значительно его дообучу? Нет. OpenMDW v1.1, а также заявление на карточке модели «только для исследовательских целей» регулируют веса и всё, что из них получено; лицензия Apache-2.0 в ветке GitHub покрывает код инференса, а не чекпойнт. Дообучение не отмывает лицензию. Если вам нужны коммерческие права, программа раннего доступа — это тот путь, который NVIDIA для этого и предусмотрела.
Это та же модель, что и в лидерборде? Семья та же, почти наверняка; идентичность артефакта не подтверждена. Записи в лидерборде и Artificial Analysis значатся как «Nemotron 3 VoiceChat (V1)» с размером 12B, загружаемый чекпоинт по измерениям составляет 11.095B, а NVIDIA не опубликовала ничего, что приводило бы эти цифры в соответствие. Используйте цифры лидерборда как наилучшую доступную независимую оценку происхождения модели, а не как проверенное измерение файла на Hugging Face.
Будет ли это работать на чём-то меньшем, чем карта на 80 ГБ? Вероятно, да, если потрудиться, но никто не публиковал доказательств. Веса хранятся в float32, так что преобразование в bfloat16 должно уменьшить объём параметров с примерно 44 ГБ до примерно 22 ГБ, что оставляет реальный запас на карте объёмом 48 ГБ ещё до учёта KV-кэша, кодека и потоковых буферов. Но поддерживаемый путь — это vLLM на H100 с 80 ГБ, контейнер развёртывания рассчитан на это, и единственная протестированная конфигурация, о которой сообщает NVIDIA, — именно она. Закладывайте время, а не только видеопамять.
Что посмотреть
Три вещи изменили бы оценку этого релиза. Технический отчет или хотя бы карточка, которая перестанет противоречить самой себе, рассказали бы нам, является ли чекпоинт 11B тем артефактом, который измеряли лидерборды. Независимое воспроизведение задержки — кто-то за пределами NVIDIA, подтверждающий на собственном оборудовании те самые 448 мс на смену реплик, — превратило бы самый привлекательный аргумент релиза из маркетинга в факт. А коммерческая лицензия или хостируемый эндпоинт от кого угодно превратили бы это из курьеза, привязанного к статье, в реальный вариант для многих команд, которые с радостью пожертвовали бы некоторым качеством рассуждений ради голосового агента, которого можно прерывать.
Пока ни одно из них не станет реальностью, точное описание узко, но действительно примечательно: NVIDIA опубликовала сильнейший открытый полнодуплексный голосовой чекпойнт из когда-либо измеренных, предоставила ему первый рабочий канал вызова инструментов в этой категории, лицензировала его так, что никто не может его выпустить, и не упомянула, что всё это произошло.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
