
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning: модель-учитель рассуждений на 550B параметров, лежащая в основе Nemotron 3 Ultra, только что открыла свои веса
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
14 августа 2026 года NVIDIA опубликовала на Hugging Face модель NVIDIA-Nemotron-Labs-Teacher-General-Reasoning — модель рассуждений с 550 миллиардами параметров, которая до вчерашнего дня существовала только внутри тренировочного конвейера её флагманской модели Nemotron 3 Ultra. Это «учитель общего рассуждения» из рецепта Multi-Teacher On-Policy Distillation (MOPD), который NVIDIA использовала для обучения студента Ultra с архитектурой 550B-A55B. Релиз важен по простой причине: в техническом отчёте Nemotron 3 Ultra, опубликованном NVIDIA в июне, рецепт обучения прямо утверждал, что чекпоинты отдельных учителей не будут открыты. Теперь этот учитель открыт — включая веса, токенизатор, чат-шаблон и конфигурации для развёртывания, под коммерчески дружелюбной лицензией OpenMDW-1.1. В тот же день вышла родственная модель NVIDIA-Nemotron-Labs-Teacher-STEM, что выглядит не как разовая публикация, а скорее как начало выхода всей панели учителей.
Что такое модель-учитель на самом деле
MOPD — это метод пост-обучения, который даёт Nemotron 3 Ultra его агентные рассуждения. Вместо дистилляции одного большого учителя в ученика, NVIDIA обучила более десяти узкоспециализированных учителей — для рассуждений, исследований, юридического анализа, разработки программного обеспечения, использования инструментов и других областей, — а затем позволила ученику генерировать свои собственные траектории и использовала каждого учителя для оценки этих траекторий в его области экспертизы. Поскольку оценка происходит на собственных on-policy выходах ученика, а не на фиксированном офлайн-наборе данных, обучающий сигнал остаётся согласованным с тем, что ученик фактически производит во время инференса. NVIDIA называет этот цикл коэволюцией: новые раунды учителей инициализируются из обновлённых чекпоинтов ученика, так что обе стороны продолжают улучшаться.
Эта контрольная точка — участник этой панели, отвечающий за общие рассуждения. Она получена из дообученного студента Nemotron 3 Ultra с помощью дополнительного раунда интенсивного по рассуждениям SFT и обучения с подкреплением, а карточка модели описывает её как оптимизированную для длинных и качественных цепочек рассуждений при решении самых сложных многошаговых задач из области математики, логики и абстрактного мышления, включая формальные доказательства и соревновательное программирование. Внутри MOPD она выполняет сразу несколько ролей: одна контрольная точка — много ролей: генерация цепочек рассуждений, математическое оценивание и проверка эквивалентности, которая оценивает свободные короткие ответы по сравнению с эталоном. NVIDIA также поставляет её отдельно, поскольку сама по себе она является сильной моделью для рассуждений — она предназначена для генерации длинных цепочек рассуждений, решения сложных задач и работы в качестве учителя или оценщика в вашем собственном конвейере дистилляции.
Спецификации за один проход
• Параметры — 550B всего / 55B активных, разреженный LatentMoE
• Архитектура — гибрид Mamba2-Transformer с латентной смесью экспертов и многотокенным предсказанием (MTP)
• Контекстное окно — до 1 млн токенов; по умолчанию 256K в эталонных конфигурациях сервинга
• Языки — 10: английский, французский, испанский, итальянский, немецкий, японский, хинди, корейский, бразильский португальский, китайский
• Лицензия — OpenMDW-1.1, разрешено коммерческое и некоммерческое использование
• Минимальное оборудование — 4×B200 (веса NVFP4); также поддерживаются GB200/GB300 и H100-class
Архитектура относится к тому же семейству, что и сам Nemotron 3 Ultra: конфигурация 550B-A55B с чередующимися слоями Mamba-2 и MoE, выборочными слоями внимания и головками MTP для нативного спекулятивного декодирования. Учитель — это не меньший ученик, а иначе обученный вариант того же стека, специализирующийся на долгосрочных рассуждениях, а не на общей агентной работе.

Почему важно открывать исходный код учителя
Контрольные точки учителя — самый редкий вид открытого выпуска моделей. Компании постоянно публикуют студентов — модели, которые вы разворачиваете, — и наборы данных; но почти никогда не публикуют модели, которые оценивали работы студентов. Именно поэтому строку в июньском отчёте о том, что контрольные точки каждого учителя не будут выпущены, восприняли как закрытие двери для воспроизведения конвейера MOPD целиком. Этот выпуск приоткрывает эту дверь, по крайней мере для учителя рассуждений.
Для команд, создающих собственные модели рассуждений, это конкретная ценность. Сигнал вознаграждения, сформировавший рассуждения Nemotron 3 Ultra, был частично создан этой контрольной точкой, и теперь его можно изучать напрямую, использовать в качестве судьи или применять для генерации длинных цепочек рассуждений для данных SFT. В сочетании с уже открытыми данными пост-обучения (nvidia/nemotron-post-training-v3) и опубликованными рецептами обучения это сокращает разрыв между «NVIDIA обучила отличную модель» и «мы можем обучить подобную».

Циферблат мышления
Одна отличительная особенность переходит из семейства Nemotron 3: рассуждение — это переключатель, а не поведение по умолчанию. Шаблон чата принимает enable_thinking=true/false, опцию medium_effort и потолок токенов reasoning_budget, так что вызывающая сторона может принудительно включить глубокое долгосрочное рассуждение, когда задача этого требует, и получать прямые ответы — быстрее и дешевле, — когда не требует. Для модели-учителя это важнее, чем кажется: запуски дистилляции хотят дешёвых проходов оценки на простых примерах и дорогих трасс рассуждений на сложных, а единая контрольная точка, поддерживающая оба режима, устраняет необходимость менять модели в середине конвейера.
его запуск
Это не модель, которую можно вызывать небрежно. Минимальная разумная конфигурация для обслуживания — 4×B200 с весами NVFP4 и KV-кэшем fp8; эталонные конфигурации также охватывают многоузловые системы GB200/GB300 и машины класса H100. NVIDIA публикует руководства по настройке для трех движков — vLLM (0.22), SGLang (0.5.13) и TensorRT-LLM (1.3.0rc17) — все они предоставляют API, совместимый с OpenAI, на порту 8000, с использованием спекулятивного декодирования MTP или EAGLE и бэкенда flashinfer для Mamba. Контекст на 1M токенов требует явного флага разрешения в каждом движке (`VLLM_ALLOW_LONG_MAX_MODEL_LEN=1` и аналогичных); потолок по умолчанию — 256K.
На момент написания модель не развернута ни одним провайдером инференса на Hugging Face, и NVIDIA не анонсировала хостинг NIM — {{1}}это релиз только с весами{{/1}}. Поэтому модель предназначена для лабораторий, {{2}}которые уже эксплуатируют крупные GPU-кластеры{{/2}}, или для команд, {{3}}чьему пайплайну дистилляции нужен точный сигнал учителя{{/3}}. Когда модель появится на управляемом API, {{4}}математика ценообразования проста{{/4}}: это MoE с 55B активных параметров, {{5}}и любой хостинг-провайдер возьмёт столько, сколько стоят GPU{{/5}}. На маршрутизирующем слое, работающем с нулевой наценкой, {{6}}вы платите по прайсу провайдера без дополнительной платформенной комиссии{{/6}} — и тот же ключ, {{7}}который открывает доступ к этой модели{{/7}}, открывает доступ и к фронтирным моделям, {{8}}с которыми вы сравниваете её трейсы{{/8}}, с автоматическим переключением, {{9}}если хост отвалится{{/9}}. Именно для этого и нужен такой роутер, как OrcaRouter; {{10}}сам учитель — это часть, которую вы хостите самостоятельно{{/10}}.
Честные оговорки
Это чекпойнт возрастом 24 часа, и в карточке модели нет ни одного бенчмарк-показателя. Это не упущение в данном описании — это состояние релиза. NVIDIA опубликовала детали архитектуры и обучения, но не опубликовала таблицу с оценками, и ни одна независимая лаборатория ещё не успела прогнать модель. Ближайшая точка отсчёта — заявленные вендором цифры для студента: Nemotron 3 Ultra сообщает о 71.9 на SWE-Bench Verified, 86.8 на MMLU-Pro, 89.0 на LiveCodeBench v6 и примерно 95 на RULER при контексте в 1M. Эти цифры описывают студента Ultra, а не этого учителя, и это собственные данные NVIDIA. Любому, кто планирует запуск дистилляции на этом чекпойнте, следует считать качество его рассуждений неподтверждённым, пока не появятся независимые результаты.
В карточку заложены ещё две оговорки. Корпус пост-обучения сильно смещён в сторону английского — около 8,6 миллиона примеров на английском против примерно 138 000 для каждого из остальных девяти языков — поэтому не следует рассчитывать на многоязычное качество рассуждений, исходя из метки «10 языков». Кроме того, сама карточка указывает на перекос репрезентации в базовых обучающих данных и рекомендует проводить аудиты на предвзятость перед дальнейшим использованием.
Кому это важно
Здесь реальную выгоду получают три группы. Исследователи дистилляции наконец имеют реального учителя MOPD для изучения, а не просто рецепт, описывающий его. Лаборатории, обучающие собственные модели рассуждений, получают генератор траекторий с длинным горизонтом и оценщик, которые вышли из той же пост-обучающей линии, что и модель, с которой они пытаются сравняться. И любой, кто запускает on-policy RL, может использовать его так же, как это сделала NVIDIA — как оценщик для самых сложных задач, с включённым мышлением только там, где оно окупается.
Если вы не относитесь ни к одной из этих групп, этот релиз мало что меняет для вас сегодня: модель большая, непроверенная и только для самостоятельного хостинга, и самый быстрый способ отреагировать на лежащий в основе тренд — появление большего количества открытых учителей рассуждений — это держать модельный слой вашего конвейера заменяемым за единым интерфейсом, а не привязанным к какому-то одному чекпойнту.

Что посмотреть дальше
Три вещи покажут, разовый ли это случай или выход линейки. Во-первых, последуют ли родственные модели-учителя тем же путём — NVIDIA-Nemotron-Labs-Teacher-STEM уже появилась в тот же день, так что вопрос в том, какие отраслевые специалисты появятся следующими и будут ли они взвешены так же. Во-вторых, начнёт ли NVIDIA NIM или управляемый хостинг обслуживать их, что превратит выпуск только для лабораторий в то, что остальная индустрия действительно сможет вызывать. В-третьих, появятся ли независимые бенчмарки — появление в Artificial Analysis или прогон в LMArena станет первой реальной проверкой того, соответствует ли качество рассуждений учителя качеству ученика, которого он обучил.
