Thẻ tiêu đề hero cho bài báo 'NVIDIA-Nemotron-Labs-Teacher-General-Reasoning' với dòng chữ 'Giáo viên suy luận 550B đứng sau Nemotron 3 Ultra giờ đã mở trọng số', kèm biểu tượng hộp trọng số mở, glyph chip GPU, thẻ engine vLLM / SGLang / TensorRT-LLM, huy hiệu ngày 'Phát hành ngày 14 tháng 8 năm 2026' và logo OrcaRouter được ghép ở góc dưới bên phải.
Engineering & Research

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning: Mô hình giáo viên lập luận 550B đứng sau Nemotron 3 Ultra vừa được mở trọng số

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Vào ngày 14 tháng 8 năm 2026, NVIDIA đã công bố NVIDIA-Nemotron-Labs-Teacher-General-Reasoning trên Hugging Face — một mô hình lập luận 550B tham số mà cho đến hôm qua chỉ tồn tại trong quy trình huấn luyện của mô hình chủ lực Nemotron 3 Ultra. Đây là mô hình giáo viên "general reasoning" từ quy trình Multi-Teacher On-Policy Distillation (MOPD) mà NVIDIA đã dùng để huấn luyện mô hình học viên Ultra 550B-A55B, và việc phát hành này quan trọng vì một lý do đơn giản: trong báo cáo kỹ thuật Nemotron 3 Ultra mà NVIDIA công bố vào tháng 6, quy trình huấn luyện đã nói rõ rằng các checkpoint riêng cho từng giáo viên sẽ không được mã nguồn mở. Còn bây giờ, bản này được phát hành — bao gồm weights, tokenizer, chat template và cấu hình serving — theo giấy phép OpenMDW-1.1 thân thiện với thương mại. Một mô hình anh em, NVIDIA-Nemotron-Labs-Teacher-STEM, cũng được phát hành cùng ngày, khiến điều này trông không giống một sự kiện đơn lẻ mà giống như một loạt mô hình giáo viên đang bắt đầu được công bố.

Bản chất thực sự của mô hình giáo viên là gì

{{1}}MOPD{{/1}} là kỹ thuật hậu huấn luyện mang lại khả năng suy luận tác nhân cho {{2}}Nemotron 3 Ultra{{/2}}. Thay vì chưng cất một mô hình giáo viên lớn duy nhất thành mô hình học sinh, NVIDIA đã huấn luyện hơn mười mô hình giáo viên chuyên sâu theo từng lĩnh vực — gồm suy luận, nghiên cứu, phân tích pháp lý, kỹ thuật phần mềm, sử dụng công cụ và các lĩnh vực khác — sau đó để mô hình học sinh tự tạo các rollout của riêng mình rồi dùng từng giáo viên chấm điểm các rollout đó trong đúng lĩnh vực chuyên môn của mình. Vì việc chấm điểm diễn ra trên các đầu ra on-policy của chính mô hình học sinh thay vì trên một tập dữ liệu ngoại tuyến cố định, tín hiệu huấn luyện luôn bám sát những gì mô hình học sinh thực sự tạo ra tại thời điểm suy luận. NVIDIA gọi vòng lặp này là {{3}}đồng tiến hóa{{/3}}: các vòng giáo viên mới được khởi tạo từ các checkpoint đã cập nhật của mô hình học sinh, nhờ đó cả hai phía đều ngày càng tiến bộ.

Checkpoint này là thành viên suy luận tổng quát của hội đồng đó. Nó được tạo ra từ mô hình học sinh Nemotron 3 Ultra sau huấn luyện thông qua một vòng SFT và học tăng cường chuyên sâu về suy luận, và thẻ mô hình mô tả nó được tối ưu hóa cho các chuỗi suy luận dài, chất lượng cao trên những bài toán đa bước khó nhất về toán học, logic và suy luận trừu tượng — bao gồm chứng minh hình thức và lập trình cạnh tranh. Bên trong MOPD, nó đảm nhiệm nhiều vai trò cùng lúc, một checkpoint, nhiều vai trò: tạo chuỗi suy luận, chấm điểm toán học, và giám khảo tương đương chấm các câu trả lời ngắn dạng tự do so với một tham chiếu. NVIDIA cũng phát hành riêng nó vì bản thân nó là một bộ suy luận mạnh — nhằm tạo chuỗi suy luận dài hạn, giải quyết các vấn đề khó, và đóng vai trò giáo viên hoặc giám khảo trong quy trình chưng cất (distillation) của riêng bạn.

Thông số kỹ thuật trong một lần

• Tham số — 550B tổng cộng / 55B hoạt động, sparse LatentMoE

• Kiến trúc — Lai ghép Mamba2-Transformer: hỗn hợp chuyên gia tiềm ẩn với Dự đoán đa token (MTP)

• Cửa sổ ngữ cảnh — tối đa 1M token; mặc định 256K trong cấu hình phục vụ tham chiếu

• Ngôn ngữ — 10: Tiếng Anh, Tiếng Pháp, Tiếng Tây Ban Nha, Tiếng Ý, Tiếng Đức, Tiếng Nhật, Tiếng Hindi, Tiếng Hàn, Tiếng Bồ Đào Nha (Brazil), Tiếng Trung

• Giấy phép — OpenMDW-1.1, cho phép sử dụng thương mại và phi thương mại

• Phần cứng tối thiểu — 4×B200 (trọng số NVFP4); GB200/GB300 và dòng H100 cũng được hỗ trợ

Kiến trúc này cùng phân nhánh với chính Nemotron 3 Ultra: dạng 550B-A55B với các lớp Mamba-2 và MoE xen kẽ, các lớp attention chọn lọc, và các đầu MTP để hỗ trợ giải mã suy đoán nguyên bản. Mô hình giáo viên không phải là một mô hình học trò nhỏ hơn — mà là một biến thể được huấn luyện khác biệt của cùng một kiến trúc, chuyên sâu về suy luận tầm xa thay vì các tác vụ tác nhân thông thường.

A single-column scoreboard for NVIDIA-Nemotron-Labs-Teacher-General-Reasoning listing 550B total / 55B active parameters, LatentMoE Mamba2-Transformer hybrid + MTP architecture, up to 1M token context, 10 languages, OpenMDW-1.1 commercial license, and vLLM / SGLang / TensorRT-LLM serving, with a footer noting the specs are per NVIDIA's model card and no independent benchmarks exist yet, and the OrcaRouter logo composited in the corner.

Tại sao việc mở mã nguồn một giáo viên lại quan trọng?

Các checkpoint của giáo viên là loại phát hành mô hình mở hiếm gặp nhất. Các công ty công bố học sinh — các mô hình bạn triển khai — và bộ dữ liệu mọi lúc; họ gần như không bao giờ công bố các mô hình đã chấm điểm bài làm của học sinh. Đó là lý do tại sao dòng trong báo cáo tháng Sáu rằng các checkpoint riêng cho từng giáo viên sẽ không được phát hành lại được hiểu là đóng cánh cửa để tái tạo quy trình MOPD từ đầu đến cuối. Bản phát hành này hé mở cánh cửa đó, ít nhất là đối với giáo viên lý luận.

Đối với các nhóm đang tự xây dựng mô hình lập luận (reasoning model) của riêng mình, đó là giá trị cụ thể. Tín hiệu phần thưởng đã định hình khả năng lập luận của Nemotron 3 Ultra một phần được tạo ra bởi checkpoint này, và giờ đây nó có thể được nghiên cứu trực tiếp, sử dụng làm bộ đánh giá, hoặc dùng để tạo ra các chuỗi lập luận dài hạn cho dữ liệu SFT. Kết hợp với dữ liệu hậu huấn luyện đã được công khai (nvidia/nemotron-post-training-v3) và các công thức huấn luyện đã được xuất bản, điều này thu hẹp khoảng cách giữa "NVIDIA đã huấn luyện một mô hình tuyệt vời" và "chúng ta có thể huấn luyện một mô hình như vậy".

A screenshot of the Hugging Face model page for nvidia/NVIDIA-Nemotron-Labs-Teacher-General-Reasoning showing the model card summary: 550B total / 55B active parameters, LatentMoE hybrid Mamba-2 + MoE + Attention with MTP architecture, up to 1M token context, minimum GPU requirements, supported languages, the openmdw-1.1 license tag, and the files and versions listing.

Núm xoay suy nghĩ

{{1}}Một đặc điểm nổi bật được kế thừa từ dòng Nemotron 3: suy luận là một tùy chọn, không phải mặc định.{{/1}} {{2}}Chat template chấp nhận enable_thinking=true/false, tùy chọn medium_effort và trần token reasoning_budget, nhờ đó người gọi có thể ép buộc suy luận sâu, dài hạn khi bài toán cần đến, và nhận câu trả lời trực tiếp — nhanh hơn và rẻ hơn — khi không cần.{{/2}} {{3}}Đối với một teacher model, điều này quan trọng hơn vẻ bề ngoài: các lần chạy distillation cần các lượt chấm điểm giá rẻ trên các mẫu dễ và các vết suy luận đắt tiền trên các mẫu khó, và một checkpoint duy nhất hỗ trợ cả hai chế độ sẽ loại bỏ nhu cầu hoán đổi model giữa chừng trong pipeline.{{/3}}

Đang chạy nó

Đây không phải là một mô hình bạn có thể gọi một cách tùy tiện. Cấu hình phục vụ tối thiểu hợp lý là 4×B200 với trọng số NVFP4 và bộ đệm khóa-giá trị fp8; các cấu hình tham chiếu cũng bao gồm các hệ thống đa nút GB200/GB300 và các máy chủ lớp H100. NVIDIA công bố các hướng dẫn nấu ăn cho ba engine — vLLM (0.22), SGLang (0.5.13) và TensorRT-LLM (1.3.0rc17) — tất cả đều phơi bày API tương thích OpenAI trên cổng 8000, với kỹ thuật suy luận đầu cơ MTP hoặc EAGLE và backend Mamba flashinfer. Bối cảnh 1M token yêu cầu một cờ cho phép tường minh trong mỗi engine (VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 và các tương đương); trần mặc định là 256K.

Tại thời điểm viết bài, mô hình chưa được bất kỳ nhà cung cấp suy luận nào trên Hugging Face triển khai và NVIDIA cũng chưa công bố việc lưu trữ NIM — đây là bản phát hành chỉ có trọng số. Điều đó khiến mô hình này phù hợp cho các phòng thí nghiệm đã vận hành các cụm GPU lớn, hoặc cho các đội ngũ có quy trình chưng cất cần chính xác tín hiệu giáo viên. Khi mô hình được đưa lên một API được quản lý, phép tính giá rất đơn giản: đây là một MoE có 55B tham số hoạt động, và bất kỳ ai lưu trữ nó sẽ tính phí theo đúng chi phí GPU. Trên một lớp định tuyến hoạt động với mức phụ phí 0%, bạn trả giá niêm yết của nhà cung cấp mà không có phí nền tảng cộng thêm — và cùng một khóa truy cập đến mô hình này cũng truy cập được các mô hình tiên phong mà bạn so sánh các dấu vết của nó, với khả năng chuyển đổi dự phòng tự động nếu một máy chủ ngừng hoạt động. Đó là phần mà một bộ định tuyến như OrcaRouter đảm nhận; còn bản thân mô hình giáo viên là phần bạn tự lưu trữ.

Những lời cảnh báo trung thực

{{1}}Đây là một checkpoint mới được 24 giờ tuổi, và thẻ mô hình không chứa một con số benchmark nào. Đó không phải là sự thiếu sót trong bài viết này — mà là hiện trạng của bản phát hành.{{/1}} {{2}}NVIDIA đã công bố chi tiết kiến trúc và huấn luyện nhưng không có bảng đánh giá nào, và chưa có phòng thí nghiệm độc lập nào có thời gian chạy thử nó.{{/2}} {{3}}Điểm tham chiếu gần nhất là các con số do nhà cung cấp báo cáo cho bản student: Nemotron 3 Ultra đạt 71.9 trên SWE-Bench Verified, 86.8 trên MMLU-Pro, 89.0 trên LiveCodeBench v6, và khoảng 95 trên RULER ở ngữ cảnh 1M.{{/3}} {{4}}Những con số đó mô tả bản student Ultra, không phải bản teacher này, và chúng là số liệu của chính NVIDIA.{{/4}} {{5}}Bất kỳ ai dự định chạy distillation trên checkpoint này nên coi chất lượng suy luận của nó là chưa được xác minh cho đến khi có điểm số độc lập xuất hiện.{{/5}}

Hai lưu ý nữa đã được ghi ngay trong thẻ. Kho ngữ liệu hậu huấn luyện nghiêng nặng về tiếng Anh — khoảng 8,6 triệu mẫu tiếng Anh so với khoảng 138.000 mẫu cho mỗi ngôn ngữ trong số chín ngôn ngữ còn lại — vì vậy không nên suy ra chất lượng suy luận đa ngôn ngữ từ nhãn 10 ngôn ngữ. Ngoài ra, bản thân thẻ cũng nêu rõ tình trạng lệch đại diện trong dữ liệu huấn luyện gốc và khuyến nghị kiểm toán thiên kiến trước khi sử dụng hạ nguồn.

Ai nên quan tâm

Ba nhóm đối tượng thực sự được hưởng lợi ở đây. Các nhà nghiên cứu distillation cuối cùng đã có một giáo viên MOPD thực thụ để mổ xẻ, chứ không phải chỉ là một công thức mô tả nó. Các phòng thí nghiệm tự huấn luyện mô hình suy luận của riêng mình sẽ có được một trình tạo dấu vết tầm xa và một bộ đánh giá cùng xuất phát từ dòng dõi hậu huấn luyện với mô hình họ đang cố gắng bắt kịp. Và bất kỳ ai chạy on-policy RL đều có thể dùng nó theo cách NVIDIA đã làm — như một bộ chấm điểm cho những bài toán khó nhất, chỉ bật chế độ suy luận ở những nơi nó thực sự đáng giá.

Nếu bạn không thuộc nhóm nào trong số đó, bản phát hành này thay đổi rất ít đối với bạn hôm nay: mô hình này lớn, chưa được kiểm chứng và chỉ có thể tự lưu trữ, và cách nhanh nhất để hành động theo xu hướng tiềm ẩn — ngày càng có nhiều giáo viên suy luận mở xuất hiện — là giữ cho lớp mô hình trong đường ống của bạn có thể hoán đổi được đằng sau một giao diện duy nhất, thay vì gắn chặt vào bất kỳ điểm kiểm tra đơn lẻ nào.

A flow diagram titled 'How Multi-Teacher On-Policy Distillation works' showing a Student (Nemotron 3 Ultra) node sending rollouts to a Teacher panel of 10+ domain specialist cards, one highlighted as the General Reasoning teacher released Aug 14, 2026, with reward signals flowing back to the student, and the OrcaRouter logo composited in the corner.

Xem gì tiếp theo

Ba điều sẽ cho biết đây là một sự kiện cá biệt hay cả một loạt mô hình sắp ra mắt. Thứ nhất, liệu các mô hình giáo viên anh em có đi theo cùng một hướng hay không — {{1}}NVIDIA-Nemotron-Labs-Teacher-STEM{{/1}} đã ra mắt cùng ngày, vì vậy câu hỏi đặt ra là các chuyên gia theo lĩnh vực nào sẽ xuất hiện tiếp theo và liệu chúng có được định trọng số theo cùng cách hay không. Thứ hai, liệu {{2}}NVIDIA NIM{{/2}} hay một máy chủ được quản lý có bắt đầu phục vụ chúng hay không, điều này sẽ biến bản phát hành chỉ dành cho phòng thí nghiệm thành thứ mà phần còn lại của ngành thực sự có thể gọi tới. Thứ ba, liệu các bài benchmark độc lập có xuất hiện hay không — một mục trên {{3}}Artificial Analysis{{/3}} hay một lượt chạy trên LMArena sẽ là kiểm chứng thực sự đầu tiên về việc chất lượng suy luận của giáo viên có khớp với học sinh mà nó đào tạo hay không.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube