Một thẻ tiêu đề anh hùng cho bài viết so sánh 'NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max' với dòng chữ 'Tuần lễ các mô hình mở trở nên nghiêm túc', có biểu tượng chiếc mũ tốt nghiệp trong hộp mở ở bên trái, biểu tượng quả địa cầu và chip ở bên phải, huy hiệu SO SÁNH MÔ HÌNH, và logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max: Tuần trọng số mở trở nên đáng gờm

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Open weights vừa trải qua một tuần đáng chú ý. Vào khoảng ngày 12 tháng 8 năm 2026, Alibaba đã phát hành mô hình Qwe​n hạng Max open-weight đầu tiên từ trước đến nay — Qwen3.8 Max, một mô hình chủ lực 2,4 nghìn tỷ tham số, được công bố với tên gọi Qwen3.8-2.4T-A95B trên Hugging Face và ModelScope. Hai ngày sau, vào ngày 14 tháng 8, NVIDIA đã công bố NVIDIA-Nemotron-Labs-Teacher-General-Reasoning, một mô hình giáo viên suy luận 550B tham số với 55B tham số kích hoạt từ quy trình huấn luyện Nemotron 3 Ultra, cũng trên Hugging Face. Cả hai đều là những checkpoint khổng lồ vừa được mở từ các phòng thí nghiệm tiên phong, và sự tương đồng chỉ dừng lại ở đó. Qwen3.8 Max được mở để bạn có thể tự chạy một mô hình tiên phong; NVIDIA-Nemotron-Labs-Teacher-General-Reasoning được mở để bạn có thể huấn luyện với nó. So sánh chúng thực chất là câu hỏi bạn thuộc kiểu đội ngũ nào — nhưng việc cả hai ra mắt trong vòng 72 giờ là một tín hiệu về hướng đi của ngành.

Mỗi bản phát hành thực sự chứa những gì

{{1}}Qwen3.8 Max là phiên bản có thể triển khai.{{/1}} {{2}}Đây là mô hình mixture-of-experts thưa với tổng cộng 2,4 nghìn tỷ tham số, khoảng 95 tỷ tham số kích hoạt cho mỗi token trên 512 expert, được xây dựng trên kiến trúc lai thuộc dòng Qwen3.5.{{/2}} {{3}}Ở dạng open-weights, mô hình chỉ hỗ trợ văn bản với ngữ cảnh gốc 262K token (có thể mở rộng vượt quá 1M),{{/3}} và — đáng chú ý — tính năng suy luận là bắt buộc: mô hình tạo ra nội dung lý luận giữa các thẻ <think> và không thể tắt được. {{4}}Phiên bản API lưu trữ mà Alibaba ra mắt vào ngày 3 tháng 8 bổ sung đầu vào hình ảnh và video, ngữ cảnh mặc định 1M và chế độ suy luận tùy chọn.{{/4}} {{5}}Giấy phép open-weights là Giấy phép Qwen3.8 Max tùy chỉnh, có tính cho phép nhưng kèm các điều kiện dựa trên doanh thu đối với các triển khai thương mại quy mô rất lớn.{{/5}} {{6}}Nếu bạn có phần cứng đa nút, bạn có thể chạy một mô hình đẳng cấp tiên phong trên cơ sở hạ tầng của riêng mình.{{/6}}

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning là mô hình dành cho giai đoạn huấn luyện. Nó là một trong hơn mười giáo viên chuyên sâu theo lĩnh vực từ công thức Multi-Teacher On-Policy Distillation (MOPD) đứng sau Nemotron 3 Ultra, được phái sinh từ mô hình học sinh Ultra sau huấn luyện thông qua một giai đoạn SFT chuyên về suy luận và học tăng cường bổ sung. Vai trò của nó trong quy trình đó là tạo ra các chuỗi suy luận dài cho những bài toán khó nhất về toán học, logic và suy luận trừu tượng, đồng thời đóng vai trò giám khảo chấm điểm các câu trả lời tự do. Mô hình được phát hành theo giấy phép OpenMDW-1.1 thân thiện với thương mại cùng dữ liệu hậu huấn luyện được công bố, và không mang bất kỳ số liệu benchmark nào — NVIDIA thay vào đó dẫn đến biểu đồ độ chính xác và báo cáo kỹ thuật Ultra. Khách hàng của nó là các phiên chưng cất (distillation), không phải lưu lượng sản xuất.

Qwen3.8 Max, flagship mở đầu tiên trong phân khúc Max

Việc Alibaba phát hành có ý nghĩa quan trọng vì các mô hình Qwen hạng Max trước đây chỉ có qua API. Qwen3.8 Max phá vỡ điều đó: trọng số có thể tải xuống và mô hình thực sự ở trình độ tiên phong — Artificial Analysis chấm cho nó chỉ số Intelligence Index là 58 và chỉ số Agentic Index là 58, ngang bằng với các mô hình đa năng nguồn đóng hàng đầu trong các bài đánh giá agentic. Các điểm mạnh do nhà cung cấp công bố rất ấn tượng: 93.0 trên PaperBench (vượt qua GPT-5.6 Sol và Fable 5), 92.6 trên GPQA Diamond, 86.1 trên OSWorld-Verified. Điểm yếu cũng không kém phần thực tế — 67.7 trên SWE-bench Pro và 43.6 trên Humanity's Last Exam xếp sau các mô hình dẫn đầu, và thử nghiệm độc lập cho thấy chi phí cho mỗi nhiệm vụ hoàn thành khá tốn kém, trung bình 64 lượt tương tác cho mỗi nhiệm vụ trong các lần chạy agentic. Trên API của Alibaba, mô hình có giá 2,00 USD cho mỗi triệu token đầu vào, 6,00 USD cho mỗi triệu token đầu ra và 0,25 USD cho mỗi triệu token đầu vào được lưu cache, giảm 20% so với giá preview trước đó.

Giáo viên: cơ sở hạ tầng huấn luyện với thẻ mô hình

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning không cạnh tranh ở bất kỳ con số nào trong số đó vì nó chưa công bố con số nào. Thứ nó cung cấp thay vào đó là cùng kiến trúc lai LatentMoE Mamba-2 + Transformer như bản student Ultra, lên đến 1 triệu token ngữ cảnh, cùng một núm xoay suy luận — enable_thinking true/false, chế độ medium_effort và trần reasoning_budget cứng — mà một quy trình distillation cần để dành suy luận sâu cho các mẫu khó và bỏ qua nó với các mẫu dễ. Phần cứng tối thiểu là 4×B200 (hoặc 8×H100), phục vụ qua vLLM, SGLang hoặc TensorRT-LLM, và checkpoint là một bản tải xuống dung lượng 1,12 terabyte. Mô hình này không được bất kỳ nhà cung cấp suy luận nào triển khai, và NVIDIA cũng chưa công bố dịch vụ lưu trữ NIM. Đây là bản phát hành chỉ gồm trọng số, nhắm tới các phòng thí nghiệm vốn đã vận hành những cụm GPU lớn.

So sánh thông số kỹ thuật

• Mục đích — Giáo viên: chuyên gia suy luận và giám khảo trong quá trình huấn luyện. Qwen3.8 Max: soái hạm tiên phong có thể triển khai.

• Quy mô — Teacher: 550B tổng / 55B hoạt động, LatentMoE với MTP. Qwen3.8 Max: 2.4T tổng / ~95B hoạt động, 512 expert, Qwen3.5 hybrid.

• Ngữ cảnh — Teacher: lên đến 1M token, mặc định 256K. Qwen3.8 Max: ngữ cảnh open-weights gốc 262K, có thể mở rộng trên 1M; phiên bản API mặc định 1M.

• Trọng số — Giáo viên: OpenMDW-1.1, phát hành ngày 14 tháng 8 năm 2026. Qwen3.8 Max: Giấy phép Qwen3.8 Max, phát hành ~ngày 12 tháng 8 năm 2026.

• Bằng chứng độc lập — Giáo viên: chưa có. Qwen3.8 Max: Chỉ số Trí tuệ AA 58, Chỉ số Tác nhân 58, Chỉ số Lập trình 71.8.

• Suy nghĩ — Teacher: công tắc enable_thinking, medium_effort, trần reasoning_budget. Qwen3.8 Max: bắt buộc bật trong trọng số mở, không thể tắt.

• Giá — Teacher: không có giá niêm yết, chi phí vốn tự lưu trữ. Qwen3.8 Max: $2.00 / $6.00 mỗi triệu token, $0.25 cho đầu vào đã lưu cache.

A two-column scoreboard for NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max. Left column (Nemotron Teacher): training-time reasoning teacher, 55B active (550B total), up to 1M context, OpenMDW-1.1 weights, no independent score yet, self-hosted capex. Right column (Qwen3.8-Max): deployable frontier, 95B active (2.4T total), 262K native context extendable past 1M, Qwen3.8-Max License weights, AA Intelligence Index 58, $2.00/$6.00 per million tokens. Footer notes Qwen figures per Alibaba (vendor-reported) + Artificial Analysis and teacher specs unaudited. OrcaRouter logo composited bottom-right.A screenshot of the Hugging Face model page for nvidia/NVIDIA-Nemotron-Labs-Teacher-General-Reasoning showing the model card: 550B total / 55B active parameters, LatentMoE hybrid Mamba-2 + MoE + Attention with MTP, up to 1M token context, 10 languages, the OpenMDW-1.1 license tag, and the files and versions listing.

Sự bất đối xứng về bằng chứng chính là toàn bộ câu chuyện.

Qwen3.8 Max đã được kiểm thử; mô hình giáo viên thì chưa. Điều đó một phần là do tuổi đời — Qwen3.8 Max ra mắt ngày 3 tháng 8 và đã có hai tuần chạy trên bảng xếp hạng, còn mô hình giáo viên mới được phát hành hôm qua — và một phần là do chủ ý, vì thẻ mô hình của giáo viên chưa bao giờ nhằm mục đích cạnh tranh điểm số. Nhưng sự bất đối xứng này có hệ quả thực sự đối với việc so sánh: mọi con số cụ thể trên trang này có nguồn gắn kèm đều thuộc về Qwen3.8 Max, còn mọi con số gắn với mô hình giáo viên đều là thông số kiến trúc. Chất lượng suy luận của mô hình giáo viên chưa được ai bên ngoài NVIDIA xác minh, và các số liệu cấp độ dòng mô hình của nó (SWE-Bench Verified 71.9, MMLU-Pro 86.8, LiveCodeBench v6 89.0, do nhà cung cấp của mô hình học sinh Ultra báo cáo) mô tả một mô hình khác. Bất kỳ ai đưa ra quyết định dựa trên việc "mô hình nào đạt điểm cao hơn" đều phải chờ các lần chạy độc lập của mô hình giáo viên — và đó chính xác là khoảng trống mà vài tuần tới nên lấp đầy.

Hai núm xoay tư duy, đặt khác nhau.

Sự tương phản kỹ thuật thú vị nhất giữa hai bản phát hành này là điều xảy ra khi bạn yêu cầu chúng suy luận. Qwen3.8 Max ở dạng open-weights không có lựa chọn nào khác: chế độ suy nghĩ luôn bật và dấu vết suy luận hiện diện trong mọi câu trả lời. Điều đó rất tốt cho chất lượng câu trả lời và tính minh bạch, nhưng lại tốn kém khi tạo sinh hàng loạt. Mô hình giáo viên coi suy luận như một núm điều chỉnh: enable_thinking bật/tắt nó, medium_effort tiết chế nó, và trần reasoning_budget giới hạn nó. Đối với một đường ống chưng cất, sự khác biệt này mang tính quyết định — tạo ra hàng triệu dấu vết suy luận bằng một mô hình luôn bật chế độ suy nghĩ sẽ nhân hóa đơn token của bạn lên nhiều lần, còn công tắc của mô hình giáo viên cho phép bạn chỉ trả tiền cho suy luận sâu đúng khi một mẫu khó yêu cầu. Đây không phải là những triết lý thiết kế đối lập nhau; chúng là hai công cụ được tối ưu hóa cho hai đầu đối diện của cùng một bài toán, và mỗi công cụ là lựa chọn đúng đắn cho mục đích của nó.

A screenshot of the OrcaRouter model page for Qwen3.8-Max (Qwen) showing the model header, the qwen/qwen3.8-max slug, and the pricing, performance, and public-benchmarks tabs.

Điểm mấu chốt

Nếu bạn muốn chạy một mô hình tiên phong trên phần cứng của riêng mình — hoặc gọi một mô hình với mức giá hợp lý — Qwen3.8 Max là bản phát hành quan trọng, và nó có mặt trên OrcaRouter với giá niêm yết của Alibaba, chuyển tiếp với mức tăng 0%, nên mức giảm giá mà Alibaba công bố khi ra mắt có hiệu lực tại phía chúng tôi ngay trong ngày. Nếu bạn muốn huấn luyện hoặc chưng cất một mô hình suy luận — hoặc kiểm định tín hiệu đã định hình Nemotron 3 Ultra — NVIDIA-Nemotron-Labs-Teacher-General-Reasoning là bản phát hành quan trọng, và hiện tại nó chỉ có thể tự lưu trữ. Câu chuyện lớn hơn là cả hai đã ra mắt trong cùng một tuần: trọng số mở vừa chuyển từ "đủ mở để xem" sang "đủ mở để xây dựng", tại hai điểm khác nhau trong chuỗi cung ứng mô hình. Các đội ngũ duy trì lớp mô hình có thể hoán đổi phía sau một giao diện — tự lưu trữ huấn luyện ở một phía, suy luận tiên phong được quản lý ở phía kia — là những đội có vị thế để sử dụng cả hai.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày