Hero-карточка для сравнительной статьи «NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max» с заголовком «Неделя, когда открытые веса стали серьёзными»: слева — иконка академической шапочки в открытой коробке, справа — иконка глобуса с чипом, бейдж MODEL COMPARISON и логотип OrcaRouter, размещённый в правом нижнем углу.
Guides & Insights

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning против Qwen3.8-Max: неделя, когда открытые веса стали серьёзными

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

У открытых весов выдалась неделя. Примерно 12 августа 2026 года Alibaba выпустила первую открытую модель Qwen Max-класса — Qwen3.8 Max, флагмана с 2,4 триллиона параметров, опубликованного как Qwen3.8-2.4T-A95B на Hugging Face и ModelScope. Два дня спустя, 14 августа, NVIDIA опубликовала NVIDIA-Nemotron-Labs-Teacher-General-Reasoning — модель-учителя для рассуждений с 550 миллиардами параметров и 55 миллиардами активных параметров из тренировочного конвейера Nemotron 3 Ultra — также на Hugging Face. Обе — огромные, только что открытые чекпоинты от лабораторий мирового уровня, и на этом сходство заканчивается. Qwen3.8 Max открыт, чтобы вы могли запустить передовую модель самостоятельно; NVIDIA-Nemotron-Labs-Teacher-General-Reasoning открыт, чтобы вы могли с её помощью обучать свои модели. Сравнивать их — значит на самом деле спрашивать, какая вы команда, но тот факт, что обе появились в течение 72 часов, — сигнал о том, куда движется индустрия.

Что на самом деле содержит каждый релиз

Qwen3.8 Max — это модель, которую можно развернуть. Она представляет собой разреженную модель смеси экспертов с общим количеством параметров 2,4 триллиона, при этом на каждый токен активируются около 95 миллиардов параметров из 512 экспертов; модель построена на гибридной архитектуре семейства Qwen3.5. В форме с открытыми весами она работает только с текстом, имеет собственный контекст на 262K токенов (расширяемый более чем до 1M), и — что важно — мышление обязательно: модель выдает контент рассуждений между тегами <think>, и его нельзя отключить. Хостинговая версия API, запущенная Alibaba 3 августа, добавляет ввод изображений и видео, контекст по умолчанию в 1M токенов и опциональное мышление. Лицензия на открытые веса — специальная Qwen3.8 Max License: она разрешительная, но содержит условия, зависящие от выручки, для очень крупных коммерческих развертываний. Если у вас есть многузловое оборудование, вы можете запустить модель уровня frontier на собственной инфраструктуре.

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning — это учитель для этапа обучения. Он является одним из более чем десяти доменно-специализированных учителей, созданных по рецепту Multi-Teacher On-Policy Distillation (MOPD), лежащему в основе Nemotron 3 Ultra, и получен из пост-обученного студента Ultra за счёт дополнительного этапа SFT, ориентированного на рассуждения, и этапа обучения с подкреплением. Его роль в этом конвейере — генерировать длинные цепочки рассуждений для самых сложных задач по математике, логике и абстрактному мышлению, а также выступать судьёй, оценивающим ответы в свободной форме. Он распространяется под коммерчески дружественной лицензией OpenMDW-1.1 с раскрытыми данными пост-обучения и не содержит ни одного бенчмарк-показателя — вместо этого NVIDIA ссылается на график точности и технический отчёт Ultra. Его потребители — прогоны дистилляции, а не производственный трафик.

Qwen3.8 Max — первый открытый флагман класса Max

Релиз Alibaba важен, потому что модели класса Max от Qwe​n исторически были доступны только через API. Qwen3.8 Max ломает эту тенденцию: веса можно скачать, и модель действительно находится на передовом рубеже — Artificial Analysis даёт ей индекс интеллекта 58 и агентный индекс 58, что ставит её в один ряд с лучшими закрытыми универсальными моделями в агентных сценариях. Заявленные производителем сильные стороны впечатляют: 93,0 на PaperBench (впереди GPT-5.6 Sol и Fable 5), 92,6 на GPQA Diamond, 86,1 на OSWorld-Verified. Её слабые места столь же реальны — 67,7 на SWE-bench Pro и 43,6 на Humanity's Last Exam отстают от лидеров, а независимое тестирование показало, что она дорога в пересчёте на выполненную задачу: в среднем 64 шага на задачу в агентных прогонах. В API Alibaba она стоит $2,00 за миллион входных токенов, $6,00 за миллион выходных и $0,25 за миллион кэшированных входных — на 20% ниже предварительной цены.

Учитель: инфраструктура обучения с карточкой модели

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning не конкурирует ни по одному из этих показателей, потому что не публиковала никаких. Вместо этого она предлагает ту же гибридную архитектуру LatentMoE Mamba-2 + Transformer, что и у ученика Ultra, до 1 млн токенов контекста и регулятор рассуждений — enable_thinking true/false, режим medium_effort и жёсткий потолок reasoning_budget, — которые нужны конвейеру дистилляции, чтобы тратить глубокие рассуждения на сложные примеры и пропускать их на лёгких. Минимальное оборудование — 4×B200 (или 8×H100), обслуживание через vLLM, SGLang или TensorRT-LLM, а контрольная точка представляет собой загрузку объёмом 1,12 терабайта. Она не развёрнута ни одним провайдером инференса, и NVIDIA не анонсировала хостинг NIM. Это релиз только с весами, ориентированный на лаборатории, которые уже эксплуатируют крупные парки GPU.

Характеристики бок о бок

• Назначение — Учитель: специалист по рассуждениям на этапе обучения и судья. Qwen3.8 Max: развёртываемый передовой флагман.

• Масштаб — Учитель: 550B всего / 55B активных, LatentMoE с MTP. Qwen3.8 Max: 2.4T всего / ~95B активных, 512 экспертов, Qwen3.5 гибрид.

• Контекст — Teacher: до 1M токенов, 256K по умолчанию. Qwen3.8 Max: 262K нативного контекста с открытыми весами, расширяемый за пределы 1M; API-версия: 1M по умолчанию.

• Веса — Учитель: OpenMDW-1.1, выпущена 14 августа 2026. Qwen3.8 Max: Qwen3.8 Max License, выпущена ~12 августа 2026.

• Независимые доказательства — Учитель: пока нет. Qwen3.8 Max: AA Intelligence Index 58, Agentic Index 58, Coding Index 71.8.

• Мышление — Учитель: переключатель enable_thinking, medium_effort, верхний предел reasoning_budget. Qwen3.8 Max: обязательно включено в открытых весах, нельзя отключить.

• Цена — Teacher: нет публичной цены, самостоятельный хостинг (капзатраты). Qwen3.8 Max: $2.00 / $6.00 за миллион токенов, $0.25 за кэшированный ввод.

A two-column scoreboard for NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max. Left column (Nemotron Teacher): training-time reasoning teacher, 55B active (550B total), up to 1M context, OpenMDW-1.1 weights, no independent score yet, self-hosted capex. Right column (Qwen3.8-Max): deployable frontier, 95B active (2.4T total), 262K native context extendable past 1M, Qwen3.8-Max License weights, AA Intelligence Index 58, $2.00/$6.00 per million tokens. Footer notes Qwen figures per Alibaba (vendor-reported) + Artificial Analysis and teacher specs unaudited. OrcaRouter logo composited bottom-right.A screenshot of the Hugging Face model page for nvidia/NVIDIA-Nemotron-Labs-Teacher-General-Reasoning showing the model card: 550B total / 55B active parameters, LatentMoE hybrid Mamba-2 + MoE + Attention with MTP, up to 1M token context, 10 languages, the OpenMDW-1.1 license tag, and the files and versions listing.

Асимметрия доказательств — это вся суть.

Qwen3.8 Max протестирован, а учитель — нет. Это отчасти объясняется возрастом — Qwen3.8 Max вышел 3 августа и уже две недели участвует в таблицах лидеров, тогда как учитель вышел вчера, — а отчасти замыслом, поскольку карточка учителя никогда не предназначалась для соревнования по баллам. Но эта асимметрия имеет реальное значение для сравнения: каждая конкретная цифра на этой странице, у которой указан источник, относится к Qwen3.8 Max, а каждая цифра, привязанная к учителю, — это спецификация архитектуры. Качество рассуждений учителя никто за пределами NVIDIA не проверял, а его показатели уровня семейства (заявленные производителем для студента Ultra: SWE-Bench Verified 71.9, MMLU-Pro 86.8, LiveCodeBench v6 89.0) описывают другую модель. Любому, кто принимает решение на основе вопроса «какая модель набирает больше баллов», придётся дождаться независимых прогонов учителя — и именно этот пробел должны закрыть следующие несколько недель.

Два мыслящих циферблата, настроенные по-разному.

Самый интересный технический контраст между этими двумя релизами проявляется, когда просишь их рассуждать. Qwen3.8 Max в форме с открытыми весами не оставляет выбора: мышление всегда включено, а трассировка рассуждений — часть каждого ответа. Это отлично для качества ответов и прозрачности, но дорого для массовой генерации. Учительская модель трактует рассуждение как регулятор: enable_thinking включает его, medium_effort ограничивает его, а верхний предел reasoning_budget задаёт потолок. Для пайплайна дистилляции разница решающая — генерация миллионов трассировок рассуждений моделью с всегда включённым мышлением умножает счёт за токены, тогда как переключатель учительской модели позволяет платить за глубокое рассуждение только там, где этого требует сложный пример. Это не конкурирующие философии проектирования; это два инструмента, оптимизированных для противоположных концов одной и той же проблемы, и каждый — правильный инструмент для своего конца.

A screenshot of the OrcaRouter model page for Qwen3.8-Max (Qwen) showing the model header, the qwen/qwen3.8-max slug, and the pricing, performance, and public-benchmarks tabs.

Суть

Если вы хотите запустить передовую модель на собственном оборудовании — или вызывать её по разумной цене — Qwen3.8 Max — это релиз, который имеет значение, и он доступен на OrcaRouter по прейскуранту Alibaba, с нулевой наценкой, так что снижение цены, объявленное Alibaba при запуске, действует у нас с того же дня. Если вы хотите обучать или дистиллировать модель рассуждений — или проверять сигнал, который сформировал Nemotron 3 Ultra — NVIDIA-Nemotron-Labs-Teacher-General-Reasoning — это релиз, который имеет значение, и пока он доступен только для самостоятельного размещения. Более важная история в том, что оба вышли в одну неделю: открытые веса только что перешли от «достаточно открыты, чтобы посмотреть» к «достаточно открыты, чтобы строить на них» — в двух разных точках цепочки поставки моделей. Команды, которые сохраняют свой модельный слой заменяемым за единым интерфейсом — самостоятельное обучение с одной стороны, управляемый инференс передовых моделей с другой — находятся в положении, позволяющем использовать и то и другое.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube