
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning: Nemotron 3 Ultra 뒤에 있는 550B 추론 교사가 방금 오픈 웨이트로 공개되었습니다
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658지능72코딩
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianNEWQwen3.8 27B2026-08-1552지능68코딩
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
2026년 8월 14일, NVIDIA는 Hugging Face에 NVIDIA-Nemotron-Labs-Teacher-General-Reasoning을 게시했다. 이는 550B 파라미터 추론 모델로, 어제까지만 해도 플래그십 Nemotron 3 Ultra의 훈련 파이프라인 내부에만 존재했다. 이 모델은 NVIDIA가 550B-A55B Ultra 학생 모델을 훈련하는 데 사용한 MOPD(Multi-Teacher On-Policy Distillation) 레시피의 '일반 추론' 티처(teacher)이다. 이번 공개가 중요한 이유는 간단하다. NVIDIA가 6월에 발표한 Nemotron 3 Ultra 기술 보고서에서 훈련 레시피는 개별 티처 체크포인트를 오픈소스로 공개하지 않겠다고 명확히 밝혔기 때문이다. 이제 이 모델은 가중치, 토크나이저, 채팅 템플릿, 서빙 설정을 포함해 상업적으로 사용하기 좋은 OpenMDW-1.1 라이선스로 공개되었다. 같은 날 형제 모델인 NVIDIA-Nemotron-Labs-Teacher-STEM도 공개되었는데, 이는 일회성 출시라기보다는 티처 패널이 공개되기 시작했다는 신호로 읽힌다.
교사 모델이 실제로 무엇인지
MOPD는 Nemotron 3 Ultra에 에이전트적 추론 능력을 부여하는 사후 훈련 기법이다. NVIDIA는 단일 대형 교사 모델을 학생 모델로 증류하는 대신, 추론, 연구, 법률 분석, 소프트웨어 엔지니어링, 도구 사용 등 여러 분야에 특화된 10개 이상의 교사 모델을 훈련시킨 다음, 학생 모델이 자체 롤아웃을 생성하게 하고 각 교사가 자신의 전문 분야에서 해당 롤아웃을 평가하게 했다. 평가가 고정된 오프라인 데이터셋이 아닌 학생 자신의 온폴리시 출력에 대해 이루어지기 때문에, 훈련 신호는 추론 시점에 학생이 실제로 생성하는 결과와 일관되게 유지된다. NVIDIA는 이 루프를 공진화라고 부른다. 새로운 교사 라운드는 업데이트된 학생 체크포인트에서 초기화되므로 양쪽 모두 계속해서 개선된다.
이 체크포인트는 해당 패널의 일반 추론 담당 멤버입니다. 이는 사후 훈련된 Nemotron 3 Ultra 학생 모델에 추론 집약적 SFT와 강화 학습을 추가로 한 차례 적용하여 생성되었으며, 모델 카드에 따르면 수학, 논리, 추상 추론 전반에 걸친 가장 어려운 다단계 문제 — 형식 증명과 경쟁적 코딩을 포함 — 에 대해 확장된 고품질 추론 트레이스를 제공하도록 최적화되어 있습니다. MOPD 내부에서 이 체크포인트는 한 번에 여러 역할을 수행합니다. 하나의 체크포인트가 다양한 역할을 맡는 것입니다: 추론 트레이스 생성, 수학 채점, 그리고 참조 답안과 자유 형식 단답형을 비교 평가하는 동등성 판정자 역할을 합니다. NVIDIA는 또한 이 모델을 독립형으로 제공하는데, 그 자체로 강력한 추론 모델이기 때문입니다 — 장기 지평 추론 트레이스 생성, 어려운 문제 해결, 그리고 자체 증류 파이프라인 내에서 교사 또는 채점자 역할을 수행하도록 설계되었습니다.
스펙을 한 번에
• 파라미터 — 총 550B / 활성 55B, 스파스 LatentMoE
• 아키텍처 — Mamba2-Transformer 하이브리드 잠재 혼합 전문가 및 다중 토큰 예측(MTP)
• 컨텍스트 윈도우 — 최대 1M 토큰; 기준 서빙 구성에서 기본값 256K
• 언어 — 10개: 영어, 프랑스어, 스페인어, 이탈리아어, 독일어, 일본어, 힌디어, 한국어, 브라질 포르투갈어, 중국어
• 라이선스 — OpenMDW-1.1, 상업적 및 비상업적 사용이 허용됩니다
• 최소 하드웨어 — 4×B200 (NVFP4 가중치); GB200/GB300 및 H100급도 지원됩니다.
아키텍처는 Nemotron 3 Ultra 자체와 동일한 계열입니다: 인터리브된 Mamba-2 및 MoE 레이어, 선택적 어텐션 레이어, 네이티브 추측 디코딩을 위한 MTP 헤드를 갖춘 550B-A55B 형태입니다. 티처는 더 작은 스튜던트가 아니라, 동일한 스택을 다르게 훈련한 변형으로, 일반적인 에이전트 작업보다는 장기 추론에 특화되어 있습니다.

교사를 오픈소스화하는 것이 중요한 이유
교사 체크포인트는 공개 모델 릴리스 중 가장 희귀한 종류입니다. 기업들은 학생 모델, 즉 배포하는 모델과 데이터셋을 항상 공개하지만, 학생들의 작업을 평가한 모델을 공개하는 경우는 거의 없습니다. 그렇기 때문에 6월 보고서에서 교사별 체크포인트를 공개하지 않겠다는 문구는 MOPD 파이프라인을 처음부터 끝까지 재현하는 문을 닫는 것으로 읽혔습니다. 이번 릴리스는 적어도 추론 교사에 대해서는 그 문을 열어젖힙니다.
자체 추론 모델을 구축하는 팀에게 이는 실질적인 가치입니다. Nemotron 3 Ultra의 추론을 형성한 보상 신호는 부분적으로 이 체크포인트에서 비롯되었으며, 이제 이를 직접 연구하거나, judge로 실행하거나, SFT 데이터용 장기 추론 궤적을 생성하는 데 사용할 수 있습니다. 이미 공개된 포스트 트레이닝 데이터(nvidia/nemotron-post-training-v3)와 공개된 학습 레시피를 결합하면, 'NVIDIA가 훌륭한 모델을 훈련했다'는 것과 '우리도 그와 같은 모델을 훈련할 수 있다'는 것 사이의 격차를 좁혀줍니다.

사고 다이얼
Nemotron 3 제품군에서 이어지는 한 가지 독특한 기능은 추론이 기본값이 아니라 스위치라는 점입니다. 채팅 템플릿은 enable_thinking=true/false, medium_effort 옵션, reasoning_budget 토큰 상한을 수용하므로, 호출자는 문제가 필요로 할 때 깊은 장기 추론을 강제하고, 그렇지 않을 때는 더 빠르고 저렴한 직접 답변을 얻을 수 있습니다. 교사 모델에게 이는 보기보다 중요합니다. 증류 실행은 쉬운 샘플에는 저비용 평가 패스를, 어려운 샘플에는 고비용 추론 트레이스를 원하며, 두 모드를 모두 지원하는 단일 체크포인트는 파이프라인 중간에 모델을 교체할 필요를 없애줍니다.
그것을 실행하기
이것은 아무렇게나 호출할 모델이 아닙니다. 현실적으로 의미 있는 최소 서빙 구성은 NVFP4 가중치와 fp8 KV 캐시를 사용하는 4×B200입니다. 참조 구성에는 멀티노드 GB200/GB300 및 H100급 박스도 포함됩니다. NVIDIA는 vLLM(0.22), SGLang(0.5.13), TensorRT-LLM(1.3.0rc17) 등 세 가지 엔진에 대한 쿠킹 가이드를 게시하며, 모두 포트 8000에서 OpenAI 호환 API를 노출하고 MTP 또는 EAGLE 추측 디코딩과 flashinfer Mamba 백엔드를 지원합니다. 1M 토큰 컨텍스트를 사용하려면 각 엔진에서 명시적 허용 플래그(VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 및 이와 동등한 플래그)가 필요하며, 기본 상한은 256K입니다.
이 글을 작성하는 시점에, 이 모델은 Hugging Face에서 어떤 추론 제공업체도 배포하지 않았고 NVIDIA도 NIM 호스팅을 발표하지 않았습니다. 즉, 가중치만 공개된 릴리스입니다. 따라서 이 모델은 이미 대규모 GPU 플리트를 운영하는 연구소나, 증류 파이프라인이 특히 정확한 티처 신호를 필요로 하는 팀을 위한 모델입니다. 이 모델이 관리형 API에 올라오면 가격 계산은 간단합니다. 55B 활성 파라미터의 MoE 모델이므로, 호스팅하는 곳은 GPU 비용만큼 청구합니다. 0% 마크업으로 작동하는 라우팅 레이어에서는 제공업체의 정가만 지불하면 되고, 그 위에 플랫폼 수수료가 없습니다. 이 모델에 접근하는 동일한 키로, 이 모델의 트레이스를 비교하게 될 프런티어 모델에도 접근할 수 있으며, 호스트가 중단되면 자동 장애 조치가 이루어집니다. 그것이 바로 OrcaRouter 같은 라우터가 하는 역할입니다. 티처 모델 자체는 자체 호스팅해야 하는 부분입니다.
솔직한 경고
이것은 24시간이 지난 체크포인트이며, 모델 카드에는 벤치마크 수치가 전혀 포함되어 있지 않습니다. 이것은 이 문서의 누락이 아니라 릴리스의 현 상태입니다. NVIDIA는 아키텍처와 학습 세부 사항을 공개했지만 평가 표는 게시하지 않았으며, 독립 연구소에서 아직 실행할 시간이 없었습니다. 가장 가까운 참고 자료는 공급업체가 보고한 학생 모델의 수치입니다: Nemotron 3 Ultra는 SWE-Bench Verified에서 71.9, MMLU-Pro에서 86.8, LiveCodeBench v6에서 89.0, 1M 컨텍스트에서 RULER 기준 약 95를 보고합니다. 이는 이 교사 모델이 아니라 Ultra 학생 모델에 대한 것이며, NVIDIA 자체 수치입니다. 이 체크포인트에서 증류(distillation) 실행을 계획하는 사람은 독립적인 점수가 나올 때까지 그 추론 품질을 검증되지 않은 것으로 간주해야 합니다.
카드에는 두 가지 추가 주의사항이 담겨 있다. 사후 훈련 코퍼스는 영어 비중이 압도적으로 높아, 약 860만 개의 영어 샘플에 비해 나머지 9개 언어는 각각 약 13만 8,000개에 불과하다. 따라서 10개 언어 태그만으로 다국어 추론 품질을 단정해서는 안 된다. 또한 카드 자체가 기본 훈련 데이터의 표현 편향을 지적하며, 다운스트림 사용 전에 편향 감사를 권고한다.
누가 신경 써야 할까요?
여기서 세 그룹이 실질적인 가치를 얻습니다. 증류 연구자들은 마침내 해부할 실제 MOPD 교사를 갖게 되었고, 단지 그것을 설명하는 레시피만 있는 것이 아닙니다. 자체 추론 모델을 훈련하는 연구소는 매칭하려는 모델과 동일한 사후 훈련 계보에서 나온 장기 지평 추적 생성기와 판정기를 얻습니다. 그리고 온폴리시 RL을 실행하는 누구든지 NVIDIA가 했던 방식으로 사용할 수 있습니다. 즉, 가장 어려운 문제에 대한 스코어러로, 생각 기능은 그 비용이 정당화되는 곳에서만 켜는 것입니다.
이들 그룹 중 어느 곳에도 속하지 않는다면, 이번 릴리스는 오늘 여러분에게 큰 변화를 주지 않습니다. 모델이 크고 검증되지 않았으며 자체 호스팅만 가능하기 때문입니다. 그리고 이면의 추세(더 많은 오픈 추론 교사가 등장하는 것)에 대응하는 가장 빠른 방법은 파이프라인의 모델 계층을 단일 체크포인트에 고정하기보다 하나의 인터페이스 뒤에서 교체 가능하게 유지하는 것입니다.

다음에 볼 콘텐츠
세 가지가 이것이 일회성인지, 아니면 패널이 나오는 것인지를 알려줄 것이다. 첫째, 형제 교사 모델들이 같은 경로를 따르는지 여부 — NVIDIA-Nemotron-Labs-Teacher-STEM이 이미 같은 날 출시되었으므로, 다음에 어떤 도메인 전문가들이 나오고 그것들이 같은 방식으로 가중치가 적용되는지가 관건이다. 둘째, NVIDIA NIM이나 관리형 호스트가 이를 서빙하기 시작하는지 여부 — 그렇게 되면 연구소 전용 릴리스가 나머지 업계가 실제로 호출할 수 있는 무언가로 바뀐다. 셋째, 독립적인 벤치마크가 등장하는지 여부 — Artificial Analysis 항목이나 LMArena 실행은 교사 모델의 추론 품질이 그것이 훈련시킨 학생 모델과 일치하는지에 대한 첫 번째 실제 검증이 될 것이다.
