비교 기사 'NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max'를 위한 히어로 타이틀 카드로, '오픈 가중치가 진지해진 한 주'라는 문구가 있고, 왼쪽에는 열린 상자 졸업모자 아이콘, 오른쪽에는 지구본과 칩 아이콘, MODEL COMPARISON 배지, 그리고 OrcaRouter 로고가 오른쪽 하단에 합성되어 있습니다.
Guides & Insights

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max: 오픈 웨이트가 진지해진 한 주

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

오픈 웨이트에게는 정말 뜻깊은 한 주였다. 2026년 8월 12일경, 알리바바는 사상 최초로 오픈 웨이트(open-weight) Max급 Qwe​n을 공개했다. 2.4조 개 파라미터를 가진 플래그십 모델인 Qwen3.8 Max가 그것이며, Hugging Face와 ModelScope에 Qwen3.8-2.4T-A95B로 게시되었다. 이틀 뒤인 8월 14일, NVIDIA는 Nemotron 3 Ultra 훈련 파이프라인에서 비롯된 550B 파라미터, 55B 활성(active) 추론 교사(teacher) 모델인 NVIDIA-Nemotron-Labs-Teacher-General-Reasoning을 역시 Hugging Face에 공개했다. 둘 다 프런티어 연구소에서 갓 공개된 거대한 체크포인트라는 점은 같지만, 닮은 점은 거기까지다. Qwen3.8 Max는 프런티어 모델을 직접 실행해 볼 수 있게 오픈된 것이고, NVIDIA-Nemotron-Labs-Teacher-General-Reasoning은 그것으로 훈련할 수 있게 오픈된 것이다. 이 둘을 비교하는 일은 곧 당신이 어떤 팀인지를 묻는 일이다. 그러나 두 모델이 72시간 안에 나란히 등장했다는 사실 자체가 업계의 흐름이 어디를 향하고 있는지를 보여주는 신호다.

각 릴리스에 실제로 포함된 내용

Qwen3.8 Max는 배포 가능한 모델입니다. 총 2.4조 개의 파라미터를 가진 스파스 전문가 혼합(sparse mixture-of-experts) 모델로, Qwen3.5 계열 하이브리드 아키텍처를 기반으로 하며 512개의 전문가 중 토큰당 약 950억 개의 파라미터가 활성화됩니다. 오픈 가중치 형태에서는 텍스트 전용이며 기본 컨텍스트는 262K 토큰(1M 이상으로 확장 가능)입니다. 특히 주목할 점은 추론이 필수라는 것입니다. 모델은 <think> 태그 사이에 추론 콘텐츠를 생성하며 이를 끌 수 없습니다. 알리바바가 8월 3일에 출시한 호스팅 API 버전은 이미지 및 비디오 입력, 1M 기본 컨텍스트, 선택적 추론 기능을 추가했습니다. 오픈 가중치 라이선스는 맞춤형 Qwen3.8 Max 라이선스로, 허용적이지만 매우 대규모 상업적 배포에는 매출 기반 조건이 적용됩니다. 멀티노드 하드웨어를 보유하고 있다면 자체 인프라에서 프런티어급 모델을 실행할 수 있습니다.

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning은 학습 시점(training-time)용 모델입니다. 이 모델은 Nemotron 3 Ultra의 기반이 되는 Multi-Teacher On-Policy Distillation(MOPD) 레시피에 포함된 10개 이상의 도메인 특화 티처(teacher) 중 하나로, 사후 학습(post-trained)된 Ultra 학생 모델에 추가적인 추론 특화 SFT와 강화학습 단계를 거쳐 파생되었습니다. 해당 파이프라인에서 이 모델의 역할은 가장 어려운 수학, 논리, 추상 추론 문제에 대해 긴 추론 궤적(trajectory)을 생성하고, 자유 형식 답변을 채점하는 심사자(judge) 역할을 수행하는 것입니다. 이 모델은 공개된 사후 학습 데이터와 함께 상업적으로 친화적인 OpenMDW-1.1 라이선스로 배포되며, 벤치마크 수치는 전혀 포함하지 않습니다. NVIDIA는 대신 정확도 그래프와 Ultra 기술 보고서를 제시합니다. 이 모델의 사용처는 증류(distillation) 실행이지, 프로덕션 트래픽이 아닙니다.

Qwen3.8 Max, 최초의 오픈 Max급 플래그십

Alibaba의 이번 출시가 중요한 이유는 Max급 Qwen 모델이 역사적으로 API 전용이었기 때문이다. Qwen3.8 Max는 이를 깨뜨린다: 가중치를 다운로드할 수 있으며, 이 모델은 진정한 프런티어급이다 — Artificial Analysis는 Intelligence Index 58과 Agentic Index 58을 부여했으며, 에이전트 환경에서 최고 수준의 비공개 범용 모델들과 동률을 이룬다. 벤더가 보고한 강점도 뛰어나다: PaperBench에서 93.0(GPT-5.6 Sol 및 Fable 5를 앞섬), GPQA Diamond에서 92.6, OSWorld-Verified에서 86.1. 약점도 마찬가지로 실재한다 — SWE-bench Pro에서 67.7, Humanity's Last Exam에서 43.6으로 선두권에 뒤처지며, 독립 테스트에서는 완료된 작업당 비용이 높은 것으로 나타났고, 에이전트 실행에서 작업당 평균 64턴을 사용했다. Alibaba의 API에서는 입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $6.00, 캐시된 입력 토큰 100만 개당 $0.25에 책정되어 있으며, 이는 프리뷰 가격 대비 20% 인하된 수준이다.

교사: 모델 카드가 포함된 학습 인프라

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning은 그러한 수치들 중 어느 것에도 경쟁하지 않습니다. 아직 어떤 수치도 공개하지 않았기 때문입니다. 그 대신 이 모델이 제공하는 것은 Ultra 학생 모델과 동일한 LatentMoE Mamba-2 + Transformer 하이브리드 아키텍처, 최대 1M 토큰의 컨텍스트, 그리고 추론 다이얼(enable_thinking true/false, medium_effort 모드, hard reasoning_budget 상한)입니다. 이는 증류 파이프라인이 어려운 샘플에는 깊은 추론을 적용하고 쉬운 샘플에서는 추론을 건너뛰는 데 필요한 기능입니다. 최소 하드웨어는 4×B200(또는 8×H100)이며, vLLM, SGLang 또는 TensorRT-LLM을 통해 서빙할 수 있습니다. 체크포인트는 1.12테라바이트 크기로 다운로드됩니다. 현재 어떤 추론 제공업체도 이 모델을 배포하지 않았으며, NVIDIA는 NIM 호스팅도 발표하지 않았습니다. 이는 이미 대규모 GPU 팜을 운영하는 연구소를 대상으로 한 가중치 전용(weights-only) 릴리스입니다.

사양, 나란히

• 목적 — Teacher: 훈련 시간 추론 전문가이자 심사자. Qwen3.8 Max: 배포 가능한 최첨단 플래그십.

• 규모 — Teacher: 총 550B / 활성 55B, MTP를 포함한 LatentMoE. Qwen3.8 Max: 총 2.4T / 활성 약 95B, 512개 전문가, Qwen3.5 하이브리드.

• 컨텍스트 — Teacher: 최대 100만 토큰, 기본 256K. Qwen3.8 Max: 262K 네이티브 오픈 가중치 컨텍스트, 100만 이상 확장 가능; API 버전은 기본 100만.

• 가중치 — 교사: OpenMDW-1.1, 2026년 8월 14일 출시. Qwen3.8 Max: Qwen3.8 Max License, ~2026년 8월 12일 출시.

• 독립적 증거 — 교사: 아직 없음. Qwen3.8 Max: AA Intelligence Index 58, Agentic Index 58, Coding Index 71.8.

• 추론 — Teacher: enable_thinking 토글, medium_effort, reasoning_budget 상한. Qwen3.8 Max: 오픈 가중치에서 필수 활성화, 비활성화 불가.

• 가격 — Teacher: 정가 없음, 자체 호스팅 자본 지출. Qwen3.8 Max: 백만 토큰당 $2.00 / $6.00, 캐시된 입력 $0.25.

A two-column scoreboard for NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max. Left column (Nemotron Teacher): training-time reasoning teacher, 55B active (550B total), up to 1M context, OpenMDW-1.1 weights, no independent score yet, self-hosted capex. Right column (Qwen3.8-Max): deployable frontier, 95B active (2.4T total), 262K native context extendable past 1M, Qwen3.8-Max License weights, AA Intelligence Index 58, $2.00/$6.00 per million tokens. Footer notes Qwen figures per Alibaba (vendor-reported) + Artificial Analysis and teacher specs unaudited. OrcaRouter logo composited bottom-right.A screenshot of the Hugging Face model page for nvidia/NVIDIA-Nemotron-Labs-Teacher-General-Reasoning showing the model card: 550B total / 55B active parameters, LatentMoE hybrid Mamba-2 + MoE + Attention with MTP, up to 1M token context, 10 languages, the OpenMDW-1.1 license tag, and the files and versions listing.

증거 비대칭이 전부입니다

Qwen3.8 Max는 테스트를 거쳤지만, teacher는 그렇지 않습니다. 이는 부분적으로는 출시 시점의 차이 때문입니다 — Qwen3.8 Max는 8월 3일에 출시되어 2주 동안 리더보드 런을 기록한 반면, teacher는 어제 출시되었습니다 — 그리고 부분적으로는 의도 때문인데, teacher의 모델 카드는 애초에 점수 경쟁을 목표로 한 것이 아니었기 때문입니다. 하지만 이러한 비대칭성은 비교에 실질적인 결과를 가져옵니다. 이 페이지에서 출처가 표시된 모든 구체적인 수치는 Qwen3.8 Max에 속하며, teacher에 귀속되는 모든 수치는 아키텍처 사양입니다. teacher의 추론 품질은 NVIDIA 외부의 누구에게도 검증되지 않았고, 패밀리 수준의 수치(Ultra 학생의 공급업체 보고 기준 SWE-Bench Verified 71.9, MMLU-Pro 86.8, LiveCodeBench v6 89.0)는 다른 모델을 설명합니다. "어느 쪽의 점수가 더 높은가"를 기준으로 결정을 내리려는 사람은 teacher에 대한 독립적인 실행을 기다려야 하며, 이는 바로 향후 몇 주 안에 해소되어야 할 격차입니다.

서로 다르게 설정된 두 개의 생각 다이얼

이 두 릴리스 사이에서 가장 흥미로운 기술적 대비는 추론을 요청했을 때 어떤 일이 벌어지느냐입니다. 오픈 가중치 형태의 Qwen3.8 Max는 선택의 여지가 없습니다. 사고는 항상 켜져 있고 추론 과정은 모든 답변의 일부입니다. 이는 답변 품질과 투명성에는 훌륭하지만 대량 생성에는 비용이 많이 듭니다. 교사 모델은 추론을 다이얼처럼 취급합니다. enable_thinking이 그것을 켜고 끄고, medium_effort가 그것을 조절하며, reasoning_budget 상한선이 그것을 제한합니다. 증류 파이프라인에게 이 차이는 결정적입니다. 항상 사고가 켜진 모델로 수백만 개의 추론 과정을 생성하면 토큰 비용이 배가되지만, 교사 모델의 스위치는 어려운 샘플이 요구하는 곳에서만 깊은 추론 비용을 지불할 수 있게 해줍니다. 이들은 경쟁하는 설계 철학이 아니라, 같은 문제의 양끝을 위해 최적화된 두 도구이며, 각각은 자신의 끝에서 올바른 도구입니다.

A screenshot of the OrcaRouter model page for Qwen3.8-Max (Qwen) showing the model header, the qwen/qwen3.8-max slug, and the pricing, performance, and public-benchmarks tabs.

요점

자체 하드웨어에서 프런티어 모델을 실행하거나 — 합리적인 가격으로 하나를 호출하려 한다면 — 주목해야 할 릴리스는 Qwen3.8 Max입니다. Qwen3.8 Max는 OrcaRouter에서 알리바바의 정가로 제공되며, 0% 마크업으로 전달되므로 알리바바가 출시 시 발표한 가격 인하가 당일 우리 쪽에도 적용됩니다. 추론 모델을 훈련하거나 증류하려 하거나 — 또는 Nemotron 3 Ultra를 형성한 신호를 감사하려 한다면 — 주목해야 할 릴리스는 NVIDIA-Nemotron-Labs-Teacher-General-Reasoning이며, 현재는 자체 호스팅 전용입니다. 더 큰 이야기는 둘 다 같은 주에 등장했다는 것입니다. 오픈 가중치는 이제 "살펴보기엔 충분히 개방된" 수준에서 "구축하기엔 충분히 개방된" 수준으로 이동했으며, 모델 공급망의 서로 다른 두 지점에서 그렇게 되었습니다. 모델 계층을 단일 인터페이스 뒤에서 교체 가능하게 유지하는 팀 — 한쪽에는 자체 호스팅 훈련, 다른 쪽에는 관리형 프런티어 추론 — 이 두 가지를 모두 활용할 수 있는 위치에 있습니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트