«Главная карточка заголовка новостной статьи 'NVIDIA-Nemotron-Labs-Teacher-General-Reasoning' с текстом 'Модель-учитель логических рассуждений на 550B параметров, стоящая за Nemotron 3 Ultra, теперь имеет открытые веса', иконкой коробки открытых весов, глифом чипа GPU, тегами движков vLLM / SGLang / TensorRT-LLM, значком даты 'Выпущено 14 августа 2026 года' и логотипом OrcaRouter, размещённым в правом нижнем углу.»
Engineering & Research

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning: модель-учитель рассуждений на 550B параметров, лежащая в основе Nemotron 3 Ultra, только что открыла свои веса

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

14 августа 2026 года NVIDIA опубликовала на Hugging Face модель NVIDIA-Nemotron-Labs-Teacher-General-Reasoning — модель рассуждений с 550 миллиардами параметров, которая до вчерашнего дня существовала только внутри тренировочного конвейера её флагманской модели Nemotron 3 Ultra. Это «учитель общего рассуждения» из рецепта Multi-Teacher On-Policy Distillation (MOPD), который NVIDIA использовала для обучения студента Ultra с архитектурой 550B-A55B. Релиз важен по простой причине: в техническом отчёте Nemotron 3 Ultra, опубликованном NVIDIA в июне, рецепт обучения прямо утверждал, что чекпоинты отдельных учителей не будут открыты. Теперь этот учитель открыт — включая веса, токенизатор, чат-шаблон и конфигурации для развёртывания, под коммерчески дружелюбной лицензией OpenMDW-1.1. В тот же день вышла родственная модель NVIDIA-Nemotron-Labs-Teacher-STEM, что выглядит не как разовая публикация, а скорее как начало выхода всей панели учителей.

Что такое модель-учитель на самом деле

MOPD — это метод пост-обучения, который даёт Nemotron 3 Ultra его агентные рассуждения. Вместо дистилляции одного большого учителя в ученика, NVIDIA обучила более десяти узкоспециализированных учителей — для рассуждений, исследований, юридического анализа, разработки программного обеспечения, использования инструментов и других областей, — а затем позволила ученику генерировать свои собственные траектории и использовала каждого учителя для оценки этих траекторий в его области экспертизы. Поскольку оценка происходит на собственных on-policy выходах ученика, а не на фиксированном офлайн-наборе данных, обучающий сигнал остаётся согласованным с тем, что ученик фактически производит во время инференса. NVIDIA называет этот цикл коэволюцией: новые раунды учителей инициализируются из обновлённых чекпоинтов ученика, так что обе стороны продолжают улучшаться.

Эта контрольная точка — участник этой панели, отвечающий за общие рассуждения. Она получена из дообученного студента Nemotron 3 Ultra с помощью дополнительного раунда интенсивного по рассуждениям SFT и обучения с подкреплением, а карточка модели описывает её как оптимизированную для длинных и качественных цепочек рассуждений при решении самых сложных многошаговых задач из области математики, логики и абстрактного мышления, включая формальные доказательства и соревновательное программирование. Внутри MOPD она выполняет сразу несколько ролей: одна контрольная точка — много ролей: генерация цепочек рассуждений, математическое оценивание и проверка эквивалентности, которая оценивает свободные короткие ответы по сравнению с эталоном. NVIDIA также поставляет её отдельно, поскольку сама по себе она является сильной моделью для рассуждений — она предназначена для генерации длинных цепочек рассуждений, решения сложных задач и работы в качестве учителя или оценщика в вашем собственном конвейере дистилляции.

Спецификации за один проход

• Параметры — 550B всего / 55B активных, разреженный LatentMoE

• Архитектура — гибрид Mamba2-Transformer с латентной смесью экспертов и многотокенным предсказанием (MTP)

• Контекстное окно — до 1 млн токенов; по умолчанию 256K в эталонных конфигурациях сервинга

• Языки — 10: английский, французский, испанский, итальянский, немецкий, японский, хинди, корейский, бразильский португальский, китайский

• Лицензия — OpenMDW-1.1, разрешено коммерческое и некоммерческое использование

• Минимальное оборудование — 4×B200 (веса NVFP4); также поддерживаются GB200/GB300 и H100-class

Архитектура относится к тому же семейству, что и сам Nemotron 3 Ultra: конфигурация 550B-A55B с чередующимися слоями Mamba-2 и MoE, выборочными слоями внимания и головками MTP для нативного спекулятивного декодирования. Учитель — это не меньший ученик, а иначе обученный вариант того же стека, специализирующийся на долгосрочных рассуждениях, а не на общей агентной работе.

A single-column scoreboard for NVIDIA-Nemotron-Labs-Teacher-General-Reasoning listing 550B total / 55B active parameters, LatentMoE Mamba2-Transformer hybrid + MTP architecture, up to 1M token context, 10 languages, OpenMDW-1.1 commercial license, and vLLM / SGLang / TensorRT-LLM serving, with a footer noting the specs are per NVIDIA's model card and no independent benchmarks exist yet, and the OrcaRouter logo composited in the corner.

Почему важно открывать исходный код учителя

Контрольные точки учителя — самый редкий вид открытого выпуска моделей. Компании постоянно публикуют студентов — модели, которые вы разворачиваете, — и наборы данных; но почти никогда не публикуют модели, которые оценивали работы студентов. Именно поэтому строку в июньском отчёте о том, что контрольные точки каждого учителя не будут выпущены, восприняли как закрытие двери для воспроизведения конвейера MOPD целиком. Этот выпуск приоткрывает эту дверь, по крайней мере для учителя рассуждений.

Для команд, создающих собственные модели рассуждений, это конкретная ценность. Сигнал вознаграждения, сформировавший рассуждения Nemotron 3 Ultra, был частично создан этой контрольной точкой, и теперь его можно изучать напрямую, использовать в качестве судьи или применять для генерации длинных цепочек рассуждений для данных SFT. В сочетании с уже открытыми данными пост-обучения (nvidia/nemotron-post-training-v3) и опубликованными рецептами обучения это сокращает разрыв между «NVIDIA обучила отличную модель» и «мы можем обучить подобную».

A screenshot of the Hugging Face model page for nvidia/NVIDIA-Nemotron-Labs-Teacher-General-Reasoning showing the model card summary: 550B total / 55B active parameters, LatentMoE hybrid Mamba-2 + MoE + Attention with MTP architecture, up to 1M token context, minimum GPU requirements, supported languages, the openmdw-1.1 license tag, and the files and versions listing.

Циферблат мышления

Одна отличительная особенность переходит из семейства Nemotron 3: рассуждение — это переключатель, а не поведение по умолчанию. Шаблон чата принимает enable_thinking=true/false, опцию medium_effort и потолок токенов reasoning_budget, так что вызывающая сторона может принудительно включить глубокое долгосрочное рассуждение, когда задача этого требует, и получать прямые ответы — быстрее и дешевле, — когда не требует. Для модели-учителя это важнее, чем кажется: запуски дистилляции хотят дешёвых проходов оценки на простых примерах и дорогих трасс рассуждений на сложных, а единая контрольная точка, поддерживающая оба режима, устраняет необходимость менять модели в середине конвейера.

его запуск

Это не модель, которую можно вызывать небрежно. Минимальная разумная конфигурация для обслуживания — 4×B200 с весами NVFP4 и KV-кэшем fp8; эталонные конфигурации также охватывают многоузловые системы GB200/GB300 и машины класса H100. NVIDIA публикует руководства по настройке для трех движков — vLLM (0.22), SGLang (0.5.13) и TensorRT-LLM (1.3.0rc17) — все они предоставляют API, совместимый с OpenAI, на порту 8000, с использованием спекулятивного декодирования MTP или EAGLE и бэкенда flashinfer для Mamba. Контекст на 1M токенов требует явного флага разрешения в каждом движке (`VLLM_ALLOW_LONG_MAX_MODEL_LEN=1` и аналогичных); потолок по умолчанию — 256K.

На момент написания модель не развернута ни одним провайдером инференса на Hugging Face, и NVIDIA не анонсировала хостинг NIM — {{1}}это релиз только с весами{{/1}}. Поэтому модель предназначена для лабораторий, {{2}}которые уже эксплуатируют крупные GPU-кластеры{{/2}}, или для команд, {{3}}чьему пайплайну дистилляции нужен точный сигнал учителя{{/3}}. Когда модель появится на управляемом API, {{4}}математика ценообразования проста{{/4}}: это MoE с 55B активных параметров, {{5}}и любой хостинг-провайдер возьмёт столько, сколько стоят GPU{{/5}}. На маршрутизирующем слое, работающем с нулевой наценкой, {{6}}вы платите по прайсу провайдера без дополнительной платформенной комиссии{{/6}} — и тот же ключ, {{7}}который открывает доступ к этой модели{{/7}}, открывает доступ и к фронтирным моделям, {{8}}с которыми вы сравниваете её трейсы{{/8}}, с автоматическим переключением, {{9}}если хост отвалится{{/9}}. Именно для этого и нужен такой роутер, как OrcaRouter; {{10}}сам учитель — это часть, которую вы хостите самостоятельно{{/10}}.

Честные оговорки

Это чекпойнт возрастом 24 часа, и в карточке модели нет ни одного бенчмарк-показателя. Это не упущение в данном описании — это состояние релиза. NVIDIA опубликовала детали архитектуры и обучения, но не опубликовала таблицу с оценками, и ни одна независимая лаборатория ещё не успела прогнать модель. Ближайшая точка отсчёта — заявленные вендором цифры для студента: Nemotron 3 Ultra сообщает о 71.9 на SWE-Bench Verified, 86.8 на MMLU-Pro, 89.0 на LiveCodeBench v6 и примерно 95 на RULER при контексте в 1M. Эти цифры описывают студента Ultra, а не этого учителя, и это собственные данные NVIDIA. Любому, кто планирует запуск дистилляции на этом чекпойнте, следует считать качество его рассуждений неподтверждённым, пока не появятся независимые результаты.

В карточку заложены ещё две оговорки. Корпус пост-обучения сильно смещён в сторону английского — около 8,6 миллиона примеров на английском против примерно 138 000 для каждого из остальных девяти языков — поэтому не следует рассчитывать на многоязычное качество рассуждений, исходя из метки «10 языков». Кроме того, сама карточка указывает на перекос репрезентации в базовых обучающих данных и рекомендует проводить аудиты на предвзятость перед дальнейшим использованием.

Кому это важно

Здесь реальную выгоду получают три группы. Исследователи дистилляции наконец имеют реального учителя MOPD для изучения, а не просто рецепт, описывающий его. Лаборатории, обучающие собственные модели рассуждений, получают генератор траекторий с длинным горизонтом и оценщик, которые вышли из той же пост-обучающей линии, что и модель, с которой они пытаются сравняться. И любой, кто запускает on-policy RL, может использовать его так же, как это сделала NVIDIA — как оценщик для самых сложных задач, с включённым мышлением только там, где оно окупается.

Если вы не относитесь ни к одной из этих групп, этот релиз мало что меняет для вас сегодня: модель большая, непроверенная и только для самостоятельного хостинга, и самый быстрый способ отреагировать на лежащий в основе тренд — появление большего количества открытых учителей рассуждений — это держать модельный слой вашего конвейера заменяемым за единым интерфейсом, а не привязанным к какому-то одному чекпойнту.

A flow diagram titled 'How Multi-Teacher On-Policy Distillation works' showing a Student (Nemotron 3 Ultra) node sending rollouts to a Teacher panel of 10+ domain specialist cards, one highlighted as the General Reasoning teacher released Aug 14, 2026, with reward signals flowing back to the student, and the OrcaRouter logo composited in the corner.

Что посмотреть дальше

Три вещи покажут, разовый ли это случай или выход линейки. Во-первых, последуют ли родственные модели-учителя тем же путём — NVIDIA-Nemotron-Labs-Teacher-STEM уже появилась в тот же день, так что вопрос в том, какие отраслевые специалисты появятся следующими и будут ли они взвешены так же. Во-вторых, начнёт ли NVIDIA NIM или управляемый хостинг обслуживать их, что превратит выпуск только для лабораторий в то, что остальная индустрия действительно сможет вызывать. В-третьих, появятся ли независимые бенчмарки — появление в Artificial Analysis или прогон в LMArena станет первой реальной проверкой того, соответствует ли качество рассуждений учителя качеству ученика, которого он обучил.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube