
Nemotron-3-Labs-Ultra-Math-RL: NVIDIA тихо выложила в открытый доступ RL-чекпойнт, лежащий в основе её выступления на IMO 2026
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0455Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0247Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0247Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0157Интеллект82Кодинг
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2646Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1849Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1541Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1251Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0547Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0347Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2140Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Интеллект49Кодинг
NVIDIA выложила Nemotron-3-Labs-Ultra-Math-RL на Hugging Face 2–3 сентября 2026 года, без поста в блоге, без анонса в X и без пресс-релиза — карточка модели просто появляется, датированная 3 сентября, и объясняет всё одной строкой: это контрольная точка обучения с подкреплением, называемая «Nemotron-3-Ultra-RL» в сопроводительном техническом отчёте NVIDIA, которая была «развёрнута в составе ансамблевой системы, показавшей результат уровня золотой медали на Международной математической олимпиаде 2026 года». Официальный результат этой системы — 30 из 42 баллов, что выше золотого порога в 29 баллов, — широко освещался ещё в конце июля, когда базовая модель, чьи веса были открыты с июня. Что тогда нельзя было скачать, так это пара дообученных специализированных моделей, которые на самом деле и использовались в соревновании. Одна из них сейчас находится в публичном репозитории Hugging Face с нулевым количеством лайков и почти нулевым числом загрузок.
Это история тихого релиза, поэтому стоит точно указать, что известно, а что нет. Из репозитория и отчёта можно узнать: архитектуру чекпойнта, его рецепт обучения, роль, которую он сыграл в подаче заявки на IMO 2026, а также наборы данных и бенчмарк, которые NVIDIA выпустила вместе с ним. Пока не подтверждены: какие-либо анонсы вендоров, независимые сторонние бенчмарки этого чекпойнта и какой-либо размещённый API — это релиз весов для самостоятельного хостинга по лицензии OpenMDW-1.1, и для его запуска потребуется поднять около 1,5 ТБ HBM класса Blackwell.
Что на самом деле выпустили на этой неделе
Репозиторий nvidia/Nemotron-3-Labs-Ultra-Math-RL был создан на Hugging Face 2 сентября 2026 года (19:11 UTC) и последний раз изменён 8 сентября. Он входит в состав скоординированного выпуска, объединённого под nvidia/nemotron-labs-imo-2026, который содержит:
• Два конкурсных чекпойнта с пост-обучением — Nemotron-3-Labs-Ultra-Math-RL (рассматриваемый здесь) и его дообученный с учителем вариант Nemotron-3-Labs-Ultra-Math-SFT, оба в рамках OpenMDW-1.1.
• Два обучающих корпуса, лежащие в их основе, — Nemotron-Math-Proofs-v3-SFT и Nemotron-Math-Proofs-v3-RL, оба под лицензией CC-BY-4.0.
• Nemotron-IMO-Bench — новый оценочный бенчмарк из 200 непубликовавшихся задач олимпиадного уровня (50 по алгебре, 50 по комбинаторике, 50 по геометрии, 50 по теории чисел), каждая из которых снабжена вручную подготовленным эталонным доказательством. Бенчмарк создан совместно с математиком Титу Андрееску специально так, чтобы эти задачи не могли присутствовать ни в одном обучающем наборе данных.
• Базовый контрольный пункт NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16, от которого все они дообучались.
Описание коллекции указывает на технический отчет, который связывает всё воедино: «An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics» (PDF в репозитории NVIDIA NeMo-Skills датирован 8 сентября 2026 года). Вместе с контрольными точками NVIDIA выпустила конвейер логического вывода, представленные доказательства, рецепт RL-обучения и полный расчет вычислительных затрат на соревновательный прогон. Позиционирование явно в духе воспроизводимой науки: это NVIDIA заявляет — вот всё, что нужно, чтобы воссоздать систему.
Что такое Nemotron-3-Labs-Ultra-Math-RL
Архитектурно это не новая базовая модель — это дообучение общедоступной модели NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16, гибридного Mamba2–Transformer чекпоинта с латентной смесью экспертов (Latent Mixture-of-Experts), который NVIDIA впервые выпустила 4 июня 2026 года. Чекпоинт Math-RL сохраняет эту архитектуру и масштаб: суммарно 550 млрд параметров (55 млрд активных), мультитокеновое предсказание и поддержку контекстных окон до 1 млн токенов. Что меняет RL-обучение — так это специализация, и она намеренно узкая:
• Цель — решать сложные олимпиадные задачи по математикеивыступать в роли судьи, проверяющего доказательства: модель обучена строить строгое решение, самостоятельно оценивать его по рубрике 0 / 0.5 / 1 и выявлять ошибки в доказательствах.
• Это не универсальный чат-бот — карточка и отчёт описывают специализированного работника для конвейера поиска доказательств, а не ассистента, следующего инструкциям.
• Лицензия — OpenMDW-1.1, разрешительная открытая модель-лицензия NVIDIA, допускающая коммерческое и некоммерческое использование, как и базовая модель, а также более ранние релизы учительских моделей Nemotron Labs.
• Развертывание — нигде не указана цена размещенной модели; вы скачиваете safetensors и развертываете самостоятельно. Эталонная конфигурация NVIDIA — один узел с 8× B200 (~1.5 ТБ совокупной HBM-памяти), с вариантами на нескольких узлах на базе H100/H200/GB200/GB300. Рекомендуемая среда выполнения — vLLM; в карточке указаны парсер для рассуждений, парсер вызовов инструментов Qwen3-Coder, настройки кэша Mamba SSM и спекулятивное декодирование MTP на 5 токенов.

Почему этот контрольный пункт важен: он находился внутри системы IMO 2026
Результат IMO 2026 — это причина, по которой на эту модель вообще кто-то смотрит, поэтому важное различие состоит вот в чём: 30/42 — это результат системы, а не отдельной модели. Решение NVIDIA представляло собой двухэтапный пайплайн с несколькими чекпоинтами, и в нём Nemotron-3-Labs-Ultra-Math-RL был компонентом, выполнявшим две задачи.
Согласно отчёту, на первом этапе выполнялся итеративный поиск с генерацией, проверкой и уточнением — до восьми раундов на задачу. В первом раунде было взято 384 попытки доказательства: по 16 от восьми различных промптов со стратегиями решения, из каждой из трёх контрольных точек — модели общего доступа, SFT-специалиста и RL-специалиста. Во время поиска проверка использовала контрольные точки RL и SFT как панель из двух моделей: по восемь независимых суждений от каждой, и доказательство принималось только в том случае, если все 16 суждений оценили его в 1. На более позднем этапе с высокими вычислительными затратами все финалисты были переоценены всеми тремя контрольными точками (по 16 суждений в стиле IMO каждое, по шкале от 0 до 7), после чего было выбрано единственное решение для каждой задачи.
Официальный результат, как сообщается в статье и как уже писали в конце июля: 30 из 42 баллов за работу IMO 2026, что выше порога в 29 баллов для золотой медали; за задачи 1, 2, 4 и 5 — полные баллы, за задачи 3 и 6 — по одному баллу, причём оценку выставляли официальные проверяющие IMO. Согласно собственному учёту ресурсов NVIDIA, все шесть представленных доказательств были найдены примерно за 707 млн сгенерированных токенов и 1 464 GPU-часа GB200; после завершения выполнявшихся на тот момент раундов полный прогон составил около 2,31 млрд токенов и 4 800 GPU-часов GB200.
Два внутренних показателя из отчёта дают представление о том, почему контрольная точка RL заслужила своё место в ансамбле. На наборе для разработки NVIDIA из 30 задач, оценённом независимым жюри в составе GPT-5.5, Gemini 3.1 Pro и Claude Opus 4.8 по процедуре в стиле MathArena, специалист RL оказался лучшим сквозным конвейером среди отдельных контрольных точек (180 из возможных 210 баллов жюри против 165 у специалиста SFT и 162 у базовой модели), хотя контрольная точка SFT решила больше задач в первом раунде. А на аудиторском наборе из 300 доказательств развёрнутая панель верификации RL+SFT снизила долю ложных принятий — ошибки, которая завершает поиск на недействительном доказательстве, — примерно до 1,1% по сравнению с 12,4% у одной лишь контрольной точки RL и 31,6% у базовой модели. Смысл отчёта в том, что два селективных специалиста ловят ошибки друг друга при действии правила единогласия.
Это собственные абляции NVIDIA на её собственном наборе для разработки, приведённые в статье NVIDIA; их стоит воспринимать как сообщённые вендором свидетельства о том, почему такая конструкция работает, а не как независимые оценки. Сам набор для разработки насчитывает всего 30 задач, и ни одна внешняя лаборатория ещё не запускала этот чекпойнт.
Рецепт RL, кратко
Обучающие данные и метод полностью открыты — это и есть настоящая новость для всех, кто занимается исследованиями RL для математических рассуждений. Основные моменты из отчёта:
• Данные — задачи взяты из подмножества AoPS набора Nemotron-Math-Proofs-v1, отфильтрованы до тех, которые базовая модель Ultra решает за одну-три из четырёх попыток (по оценке DeepSeek-V3.2-Speciale) — сложные, но посильные учебные задачи. Этот фильтр даёт 9 597 промптов для генерации доказательств, выпущенных как Nemotron-Math-Proofs-v3-RL.
• Вознаграждение — следует схеме DeepSeekMath-V2, но отбрасывает слагаемое вознаграждения за самоанализ; сигнал судьи поступает от сервиса проверки доказательств во время обучения.
• Алгоритм — асинхронное RL, построенное на NeMo-RL, по духу близкое к PipelineRL: фиксированный пул промптов, постоянно находящихся в обработке; завершённые последовательности подаются в тренер по мере заполнения батчей; усечённый importance sampling; а также маскирование низковероятностных токенов на положительных примерах, когда энтропия растёт. В конфигурации использовался контекст на 131 072 токена и примерно 128 узлов-тренеров, 128 инференс-узлов и 16 узлов-судей, каждый из которых — 4× GB200.
Для сравнения, родственная контрольная точка SFT представляла собой длинноконтекстную supervised fine-tune на той же базовой модели, выполненную на качественно отфильтрованном корпусе из 414 890 трасс доказательств, уточнений, верификации и мета-верификации, охватывающих 15 818 задач, и обученную на 512 GPU GB200.

Что еще неизвестно
Честное обращение с источниками здесь обоюдоострое, и читатель, решающий, стоит ли обращать внимание на этот релиз, должен учитывать четыре оговорки:
• Анонса нет. На момент написания NVIDIA официально не анонсировала эту коллекцию; она появилась на Hugging Face. PDF технического отчёта датирован 8 сентября, так что письменный рецепт фактически тоже публикуется на этой неделе.
• Независимых бенчмарков нет.Все показатели производительности, связанные с этой контрольной точкой — абляции на dev-наборе, аудит верификатора, системный балл IMO 2026 — взяты из собственного отчёта NVIDIA. Сам балл IMO имеет наиболее надёжное происхождение из всего набора, поскольку он был оценён в условиях официального соревнования, но это результат на уровне системы, и вклад контрольной точки в него не был воспроизведён ни одной внешней лабораторией.
• Ни облачного API, ни указанной цены. Это релиз для самостоятельного размещения. Любому, кто хочет обращаться к нему, нужно железо. Июльские публикации о том, что «NVIDIA Nemotron 3 Ultra завоевал золото на IMO 2026», легко истолковать превратно — как «скачай это — и оно решает олимпиадные задачи». Честная формулировка: «скачай компоненты системы, которая это сделала».
• Золотая подача. Собственная формулировка NVIDIA — «достижение порога золотой медали», и в статье аккуратно отмечено, что модель была частью ансамбля. Любое утверждение, будто эта отдельная контрольная точка сама по себе находится на «уровне золотой медали», следует считать необоснованным.
Для кого это
Этот релиз предназначен для конкретного читателя: лаборатории или исследователя, работающего над математическими рассуждениями, генерацией доказательств или обучением с подкреплением с проверяемыми вознаграждениями, которому нужна эталонная реализация системы, преодолевшей порог золотой медали олимпиады на естественном языке — без формального верификатора, без инструментов, без интернета. Для такого читателя ценность представляет весь пакет: веса, корпуса для SFT и RL, промпты в формате NeMo-Gym, пайплайн инференса, представленные доказательства и учёт вычислительных затрат, показывающий, сколько в действительности стоит один конкурсный прогон в GPU-часах.
Для всех остальных практический вывод таков: поиск доказательств олимпиадного уровня избыточен для большинства реальных математических задач. Задачи уровня AIME и аналогичных соревнований, а также практически вся прикладная математика в коде, без труда решаются гораздо меньшими моделями — а это важно, ведь чекпойнт на 550B параметров не разворачивают ради пакетного задания. Меньшие открытые математические модели и передовые API-модели доступны через единый API в OrcaRouter по ценам из прайс-листов провайдеров (без наценки с нашей стороны, поэтому снижение цены вендором вступает в силу в тот же день), с автоматическим переключением при сбое, если вы хотите опробовать непроверенную модель, не рискуя продакшном. Начните с этого; переходите на self-hosted 550B только тогда, когда задачи действительно требуют поиска доказательств уровня frontier-моделей.
Открытый вопрос, за которым стоит следить, — получит ли этот тихий релиз официальное объявление и формальное примечание к выпуску, и попробует ли кто-то за пределами NVIDIA прогнать рецепт целиком и сообщить независимый результат IMO-Bench. Этот бенчмарк — 200 свежих, неопубликованных олимпиадных задач — пожалуй, самый полезный артефакт в коллекции: это как раз тот вид устойчивого к загрязнению оценивания, которого так не хватало отрасли. Если рецепт воспроизводим, то этот тихий аплоад на Hugging Face на этой неделе окажется одним из самых значимых релизов открытых моделей за год. Если нет, коллекция всё равно останется подробным и честным описанием того, что на самом деле потребовал один прогон цикла generate–verify–refine в масштабе frontier-моделей.

Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
