Thẻ tiêu đề chính cho Nemotron-3-Labs-Ultra-Math-RL, với phụ đề 'Điểm kiểm tra RL IMO 2026, âm thầm được mở mã nguồn', kèm các chip thông số ghi '550B tổng / 55B hoạt động', 'Giấy phép OpenMDW-1.1', 'Phát hành tháng 9/2026'.
Engineering & Research

Nemotron-3-Labs-Ultra-Math-RL: NVIDIA âm thầm mở mã nguồn checkpoint RL đứng sau chiến dịch IMO 2026 của mình

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

NVIDIA dropped Nemotron-3-Labs-Ultra-Math-RL on Hugging Face on September 2–3, 2026, with no blog post, no X announcement and no press release — the model card simply appears, dated September 3, and explains itself in one line: it is the reinforcement-learning checkpoint, referred to as "Nemotron-3-Ultra-RL" in NVIDIA's accompanying technical report, that was "deployed as part of an ensemble system that achieved a gold-medal level score at the International Mathematical Olympiad 2026." That system's official score — 30 out of 42 points, above the 29-point gold threshold — was widely reported back in late July, when the base model's weights had been public since June. What was not downloadable then was the pair of post-trained specialists the competition run actually used. One of them is now sitting in a public Hugging Face repo with zero likes and a near-zero download count.

Đây là một câu chuyện phát hành thầm lặng, nên cần phải chính xác về điều gì có thể biết và điều gì không. Có thể biết từ repository và báo cáo: kiến trúc của checkpoint, công thức huấn luyện, vai trò của nó trong bài dự thi IMO 2026, cùng các tập dữ liệu và chuẩn đánh giá mà NVIDIA phát hành kèm theo. Chưa được xác nhận: bất kỳ thông báo nào từ nhà cung cấp, bất kỳ chuẩn đánh giá độc lập nào từ bên thứ ba cho checkpoint này, và bất kỳ API lưu trữ nào — đây là bản phát hành trọng số tự lưu trữ theo giấy phép OpenMDW-1.1, và chạy nó đồng nghĩa với việc phải dựng lên khoảng 1,5 TB HBM lớp Blackwell.

Những gì thực sự được phát hành trong tuần này

Kho lưu trữ nvidia/Nemotron-3-Labs-Ultra-Math-RL được tạo trên Hugging Face vào ngày 2 tháng 9 năm 2026 (19:11 UTC) và được sửa đổi lần cuối vào ngày 8 tháng 9. Đây là một hạng mục trong bản phát hành phối hợp được tập hợp dưới tên nvidia/nemotron-labs-imo-2026, bao gồm:

• Hai checkpoint cạnh tranh sau huấn luyện — Nemotron-3-Labs-Ultra-Math-RL (chủ đề này) và phiên bản anh em được tinh chỉnh có giám sát của nó Nemotron-3-Labs-Ultra-Math-SFT, cả hai đều thuộc OpenMDW-1.1.

• Hai kho ngữ liệu huấn luyện đằng sau chúng — Nemotron-Math-Proofs-v3-SFT và Nemotron-Math-Proofs-v3-RL, cả hai đều là CC-BY-4.0.

• Nemotron-IMO-Bench, một chuẩn đánh giá mới gồm 200 bài toán cấp độ olympiad chưa được công bố (50 đại số, 50 tổ hợp, 50 hình học, 50 lý thuyết số), mỗi bài đều đi kèm với một chứng minh tham khảo do con người tuyển chọn, được tạo ra cùng với nhà toán học Titu Andreescu với mục đích cụ thể để các bài toán này không thể xuất hiện trong bất kỳ bộ dữ liệu huấn luyện nào.

• Điểm kiểm tra cơ sở NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 mà tất cả chúng đều được tinh chỉnh từ đó.

Phần mô tả bộ sưu tập chỉ đến báo cáo kỹ thuật gắn kết toàn bộ: "An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics" (bản PDF trong kho NeMo-Skills của NVIDIA ghi ngày 8 tháng 9 năm 2026). Bên cạnh các checkpoint, NVIDIA đã công bố đường ống suy luận, các chứng minh đã nộp, công thức huấn luyện RL, và một bảng hạch toán tài nguyên tính toán đầy đủ cho đợt thi. Cách trình bày rõ ràng mang tính khoa học tái lập được: đây là NVIDIA đang nói rằng, mọi thứ cần thiết để xây dựng lại hệ thống đều có ở đây.

Nemotron-3-Labs-Ultra-Math-RL là gì

Về mặt kiến trúc, đây không phải là một mô hình nền tảng mới — mà là bản tinh chỉnh từ phiên bản phát hành chung NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16, checkpoint lai Mamba2–Transformer với kiến trúc Latent Mixture-of-Experts mà NVIDIA lần đầu phát hành vào ngày 4 tháng 6 năm 2026. Checkpoint Math-RL giữ nguyên kiến trúc và quy mô đó: 550B tổng tham số với 55B tham số kích hoạt, dự đoán đa token và hỗ trợ cửa sổ ngữ cảnh lên tới 1M token. Điều mà quá trình huấn luyện RL thay đổi là tính chuyên biệt hóa, và nó được giới hạn một cách có chủ đích:

• Mục đích — giải các bài toán khó trong các kỳ thi toán đóng vai trò giám khảo chứng minh: mô hình được huấn luyện để tạo ra một lời giải chặt chẽ, tự đánh giá lời giải đó theo thang điểm 0 / 0.5 / 1, và xác định các lỗi sai trong các chứng minh.

Đây không phải là một chatbot thông thường — thẻ và báo cáo mô tả một bộ phận chuyên biệt cho quy trình tìm kiếm chứng minh, chứ không phải một trợ lý tuân theo hướng dẫn.

• Giấy phép — OpenMDW-1.1, giấy phép mô hình mở linh hoạt của NVIDIA, cho phép sử dụng thương mại và phi thương mại, tương tự như mô hình cơ sở và các bản phát hành teacher trước đó của Nemotron Labs.

Triển khai — không có giá niêm yết dịch vụ lưu trữ ở bất kỳ đâu; bạn tải safetensors về và tự lưu trữ. Cấu hình tham chiếu của NVIDIA là một nút đơn gồm 8× B200 (~1,5 TB HBM tổng hợp), với các tùy chọn đa nút trên H100/H200/GB200/GB300. vLLM là runtime được khuyến nghị, với trình phân tích suy luận, trình phân tích gọi công cụ Qwen3-Coder, cài đặt bộ đệm Mamba SSM và giải mã suy đoán MTP trên 5 token — tất cả đều được nêu rõ trong thẻ.

Single-column scoreboard for Nemotron-3-Labs-Ultra-Math-RL: Released Sep 2026 quiet drop; Base Nemotron-3-Ultra-550B-A55B; 550B total / 55B active; IMO 2026 system 30/42 with gold cutoff 29; RL data 9,597 proof prompts; License OpenMDW-1.1. Footer: the IMO 2026 score is NVIDIA's system result, not this checkpoint alone; no independent scores yet.

Tại sao điểm kiểm tra này quan trọng: nó nằm trong hệ thống IMO 2026.

Kết quả IMO 2026 chính là lý do khiến người ta chú ý đến mô hình này, vậy nên điểm khác biệt quan trọng là: 30/42 là điểm của hệ thống, không phải điểm của một mô hình đơn lẻ. Bài dự thi của NVIDIA là một pipeline hai giai đoạn với nhiều checkpoint, trong đó Nemotron-3-Labs-Ultra-Math-RL là một thành phần đảm nhận hai nhiệm vụ.

Theo báo cáo, giai đoạn đầu tiên đã chạy tìm kiếm lặp theo quy trình sinh–xác minh–tinh chỉnh (generate–verify–refine) cho tối đa tám vòng mỗi bài toán. Vòng một lấy mẫu 384 nỗ lực chứng minh — mỗi prompt 16 nỗ lực, từ tám prompt chiến lược giải khác nhau, cho từng checkpoint trong ba checkpoint: mô hình khả dụng tổng quát, chuyên gia SFT và chuyên gia RL. Việc xác minh tại thời điểm tìm kiếm sử dụng các checkpoint RL và SFT như một hội đồng hai mô hình: tám đánh giá độc lập từ mỗi mô hình, và một chứng minh chỉ được chấp nhận nếu cả 16 đánh giá đều cho điểm 1. Một giai đoạn tính toán cao sau đó chấm lại mọi bài lọt vào chung kết với cả ba checkpoint (16 đánh giá kiểu IMO mỗi bài, trên thang 0–7) và chọn một bài nộp duy nhất cho mỗi bài toán.

Kết quả chính thức, như được ghi trong bài báo và khớp với các bài đưa tin cuối tháng 7: 30/42 điểm trong đề thi IMO 2026, cao hơn ngưỡng 29 điểm để giành huy chương vàng, đạt điểm tuyệt đối ở các bài 1, 2, 4 và 5, và một điểm ở mỗi bài 3 và 6, do các giám khảo chính thức của IMO chấm. Bảng hạch toán tài nguyên của NVIDIA cho thấy cả sáu lời giải được nộp đều được tìm ra trong khoảng 707 triệu token sinh ra và 1.464 giờ GPU GB200; việc chạy nốt các vòng còn dang dở đã đưa tổng thời gian chạy lên khoảng 2,31 tỷ token và 4.800 giờ GPU GB200.

Hai số liệu nội bộ trong báo cáo cho thấy vì sao checkpoint RL xứng đáng có mặt trong ensemble. Trên tập phát triển 30 bài toán của NVIDIA, được chấm điểm bởi một hội đồng giám khảo độc lập gồm GPT-5.5, Gemini 3.1 Pro và Claude Opus 4.8 theo quy trình kiểu MathArena, chuyên gia RL là pipeline end-to-end một-checkpoint tốt nhất (180 trên 210 điểm của hội đồng, so với 165 của chuyên gia SFT và 162 của mô hình cơ sở), dù checkpoint SFT giải được nhiều bài hơn ở vòng một. Còn trên tập kiểm toán 300 chứng minh, hội đồng xác minh RL+SFT được triển khai đã đưa tỷ lệ chấp nhận sai — lỗi khiến quá trình tìm kiếm dừng lại trên một chứng minh không hợp lệ — xuống còn khoảng 1,1%, so với 12,4% khi chỉ riêng checkpoint RL đánh giá và 31,6% đối với mô hình cơ sở. Luận điểm của báo cáo là hai chuyên gia chọn lọc này phát hiện lỗi của nhau theo quy tắc nhất trí.

Đây là các thử nghiệm ablation do chính NVIDIA thực hiện trên bộ dữ liệu phát triển của chính NVIDIA, được công bố trong bài báo của NVIDIA — nên được coi là bằng chứng do nhà cung cấp báo cáo, cho thấy vì sao thiết kế này hoạt động hiệu quả, chứ không phải là điểm số độc lập. Bản thân bộ dữ liệu phát triển chỉ có 30 bài toán và chưa có phòng thí nghiệm bên ngoài nào chạy checkpoint này.

Công thức RL, tóm tắt

Dữ liệu huấn luyện và phương pháp được mở hoàn toàn, đây mới là tin tức thực sự cho bất kỳ ai đang nghiên cứu RL suy luận toán học. Những điểm nổi bật từ báo cáo:

• Dữ liệu — các bài toán được lấy từ tập con AoPS của Nemotron-Math-Proofs-v1, được lọc ra những bài mà mô hình Ultra cơ sở giải được trong một đến ba trong bốn lần thử (theo đánh giá của DeepSeek-V3.2-Speciale) — các bài toán trong chương trình học khó nhưng có thể xử lý được. Bộ lọc đó tạo ra 9.597 lời nhắc sinh chứng minh, được phát hành với tên Nemotron-Math-Proofs-v3-RL.

Phần thưởng — tuân theo thiết kế của DeepSeekMath-V2 nhưng loại bỏ thành phần thưởng tự phân tích; tín hiệu đánh giá đến từ một dịch vụ thẩm định chứng minh trong quá trình huấn luyện.

Thuật toán — RL không đồng bộ được xây dựng trên NeMo-RL, về ý tưởng tương tự PipelineRL: một nhóm prompt cố định được giữ luôn ở trạng thái đang xử lý, các chuỗi hoàn thành được nạp vào trainer khi từng batch được lấp đầy, lấy mẫu quan trọng cắt ngắn (truncated importance sampling), và các token có xác suất thấp bị mask trên các mẫu tích cực khi entropy tăng. Cấu hình dùng ngữ cảnh 131.072 token, khoảng 128 node trainer, 128 node inference và 16 node judge, mỗi node gồm 4× GB200.

Ngược lại, checkpoint SFT anh em là một phiên bản tinh chỉnh có giám sát ngữ cảnh dài từ cùng một mô hình cơ sở, được huấn luyện trên một kho ngữ liệu đã được lọc chất lượng gồm 414,890 bản ghi chứng minh, hoàn thiện, kiểm chứng và siêu kiểm chứng, bao phủ 15,818 bài toán, chạy trên 512 GPU GB200.

Screenshot of NVIDIA's NeMo-Skills GitHub repository at recipes/nemotron-imo-tts, showing the released contents: configs, imo-proofs, nemotron_imo_tts, prompts, scripts, README.md, paper.pdf and run.py.

Điều chưa được biết đến

Việc trích dẫn nguồn trung thực ở đây có hai mặt, và độc giả khi quyết định có nên quan tâm đến bản phát hành này hay không nên ghi nhớ bốn điều cần lưu ý:

Không có thông báo nào. Tính đến thời điểm viết bài, NVIDIA vẫn chưa chính thức công bố bộ sưu tập; nó đã xuất hiện trên Hugging Face. Bản PDF của báo cáo kỹ thuật được đề ngày 8 tháng 9, nên công thức dạng văn bản thực chất cũng đang được phát hành trong tuần này.

Không có benchmark độc lập nào. Mọi con số hiệu năng gắn với checkpoint này — các phép thử ablation trên tập dev, cuộc kiểm định verifier, điểm hệ thống IMO 2026 — đều lấy từ báo cáo của chính NVIDIA. Bản thân điểm IMO là kết quả có nguồn gốc tin cậy nhất trong nhóm vì nó được chấm trong điều kiện thi chính thức, nhưng đó là kết quả ở cấp độ hệ thống, và phần đóng góp của checkpoint vào kết quả đó chưa được bất kỳ phòng thí nghiệm bên ngoài nào tái lập.

Không có API được lưu trữ sẵn, không có giá niêm yết. Đây là bản phát hành tự lưu trữ. Bất kỳ ai muốn gọi nó đều cần phần cứng. Các bài đưa tin từ tháng 7 về việc "NVIDIA Nemotron 3 Ultra đạt huy chương vàng tại IMO 2026" có thể dễ dàng bị hiểu nhầm là "tải cái này về là giải được các bài toán olympiad" — cách nói trung thực là "tải về các thành phần của hệ thống đã làm được điều đó".

Cách gọi "huy chương vàng".Chính NVIDIA cũng chỉ dùng từ ngữ "đạt ngưỡng huy chương vàng", và bài báo thận trọng nêu rõ mô hình là một phần của ensemble (tổ hợp mô hình). Hãy coi mọi tuyên bố rằng riêng checkpoint này đã "đạt cấp độ huy chương vàng" là không có căn cứ.

Đối tượng sử dụng

Bản phát hành này hướng tới một nhóm độc giả cụ thể: một phòng thí nghiệm hoặc nhà nghiên cứu làm việc về lập luận toán học, sinh chứng minh, hoặc RL với phần thưởng có thể kiểm chứng được, những người muốn có một bộ triển khai tham chiếu của một hệ thống đã vượt qua ngưỡng huy chương vàng olympiad bằng ngôn ngữ tự nhiên — không có bộ chứng minh hình thức, không có công cụ, không có internet. Với đối tượng đó, giá trị nằm ở toàn bộ gói: trọng số, kho ngữ liệu SFT và RL, các prompt được định dạng theo NeMo-Gym, đường ống suy luận, các chứng minh đã nộp, và bảng hạch toán chi phí tính toán cho biết một lần chạy thi đấu thực sự tiêu tốn bao nhiêu giờ GPU.

Đối với tất cả những người còn lại, lưu ý thiết thực là việc tìm kiếm chứng minh ở cấp độ olympiad là quá mức cần thiết cho hầu hết các khối lượng công việc toán học thực tế. Các bài toán ở cấp độ AIME và các kỳ thi, cùng với gần như toàn bộ công việc toán ứng dụng trong code, được xử lý dễ dàng bởi các mô hình nhỏ hơn nhiều — điều này quan trọng vì một checkpoint 550B không phải thứ bạn khởi động lên cho một tác vụ hàng loạt. Các mô hình toán mở nhỏ hơn và các mô hình API frontier đều truy cập được qua một API duy nhất trên OrcaRouter với đúng giá niêm yết của nhà cung cấp (phía chúng tôi không cộng thêm phí, nên khi nhà cung cấp giảm giá, mức giá mới sẽ có hiệu lực ngay trong ngày), kèm tính năng tự động chuyển đổi dự phòng nếu bạn muốn dùng thử một mô hình chưa được kiểm chứng mà không phải đặt cược cả một quy trình sản xuất vào nó. Hãy bắt đầu từ đó; chỉ tự triển khai một mô hình 550B khi khối lượng công việc thực sự đòi hỏi khả năng tìm kiếm chứng minh ở tầm cỡ frontier.

Câu hỏi mở cần theo dõi là liệu bản phát hành thầm lặng này có nhận được thông báo chính thức và ghi chú phát hành trang trọng hay không, và liệu có ai bên ngoài NVIDIA chạy thử quy trình từ đầu đến cuối và báo cáo điểm IMO-Bench độc lập hay không. Điểm chuẩn đó — 200 bài toán olympiad mới, chưa từng công bố — được cho là tài sản hữu ích nhất trong bộ sưu tập: nó đúng là loại đánh giá kháng nhiễm (contamination-resistant) mà lĩnh vực này đang thiếu. Nếu quy trình tái lập được, bản tải lên Hugging Face thầm lặng tuần này sẽ hóa ra là một trong những bản phát hành mô hình mở có hệ quả nhất trong năm. Nếu không, bộ sưu tập vẫn là một tường thuật chi tiết, trung thực về những gì một lần chạy generate–verify–refine ở quy mô tiên phong thực sự đòi hỏi.

Screenshot of the Hugging Face collection page 'Nemotron Labs IMO 2026' listing the six released artifacts: the Nemotron-3-Labs-Ultra-Math-SFT and Nemotron-3-Labs-Ultra-Math-RL checkpoints, the NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 base model, the Nemotron-Math-Proofs-v3-SFT and Nemotron-Math-Proofs-v3-RL datasets, and the Nemotron-IMO-Bench benchmark.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày