
Rò rỉ Nemotron 4: Câu trả lời trọng số mở 1 nghìn tỷ tham số của NVIDIA cho biên giới mới
- metaMỚIMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenMỚIQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekMỚIDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMỚIMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 2278 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0856Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0642Trí tuệ59Lập trình
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Trí tuệ42Lập trình
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Trí tuệ39Lập trình
- anthropicAnthropic: Claude Sonnet 52026-06-3055Trí tuệ72Lập trình
- klingKling: Kling 3.0 Turbo2026-06-1757Trí tuệ52Lập trình57Toán
1 nghìn tỷ tham số. Đó là mức sàn được báo cáo cho mô hình Nemotron 4 lớn nhất, mô hình chủ lực của dòng trọng số mở tiếp theo của NVIDIA — và con số này chỉ nghe có vẻ lớn cho đến khi bạn đặt nó cạnh những gì đã ra mắt. Trong tháng qua, Moonshot AI đã phát hành Kimi K3 với tổng cộng 2,8 nghìn tỷ tham số, Alibaba trình làng Qwen3.8-Max với 2,4 nghìn tỷ, còn mô hình chủ lực hiện tại của chính NVIDIA, Nemotron 3 Ultra, đang ở mức 550 tỷ. The Information đưa tin vào ngày 11 tháng 8 năm 2026 — dẫn lời nhiều nhân viên làm việc trong dự án — rằng Nemotron 4 là câu trả lời của NVIDIA: một dòng trọng số mở có mô hình lớn nhất dự kiến khởi điểm ở khoảng 1 nghìn tỷ tham số, gấp khoảng đôi Nemotron 3 Ultra.
Chưa có gì ở đây được phát hành cả. NVIDIA đã xác nhận họ đang xây dựng dòng Nemotron 4, nhưng chưa xác nhận mục tiêu tham số, ngân sách, mốc thời gian, hay chi tiết liên minh mà The Information gán cho các nhân viên giấu tên. Hãy coi mọi con số trong bài này là "được báo cáo," không phải "được xác nhận." Ý nghĩa của một bài viết về rò rỉ là để tách phần lõi nhỏ đã xác nhận khỏi vùng hào quang rộng lớn chỉ mới được báo cáo — và để cho bạn biết phần nào thực sự quan trọng khi bảng thông số chính thức được công bố.
Bản rò rỉ một dòng, được giải mã
Đầu tiên, về cái tên, vì nó sẽ khiến bạn bối rối trong kết quả tìm kiếm: NVIDIA đã phát hành một mô hình có tên Nemotron-4-340B vào tháng 6 năm 2024. Nemotron 4 mới là một dòng khác, lớn hơn — kế nhiệm dòng Nemotron 3 (Nano, Super, Ultra) đã ra mắt trong năm nay — tái sử dụng tên "Nemotron 4" cho thế hệ tiếp theo. Bài viết này nói về phiên bản mới.
Những gì The Information thực sự đưa tin: NVIDIA đang phát triển Nemotron 4 như một dòng mô hình mã nguồn mở nhắm tới vị trí dẫn đầu bảng xếp hạng open-weight, và mô hình chủ lực dự kiến sẽ có "ít nhất 1 nghìn tỷ tham số." NVIDIA chưa ấn định ngày phát hành, chưa bắt đầu đợt huấn luyện cuối cùng — một quy trình mà các nhân viên dự đoán sẽ kéo dài nhiều tháng — và mới chỉ chốt dữ liệu tiền huấn luyện cùng kiến trúc; thông số kỹ thuật vẫn đang thay đổi. Hai nhân viên cho biết dòng mô hình này có thể sẵn sàng sớm nhất là cuối mùa thu; những người khác dự đoán muộn hơn.
Bản báo cáo tương tự cũng đính kèm một ngân sách: khoảng 28 tỷ USD cho các thỏa thuận dịch vụ đám mây kéo dài nhiều năm đến đầu năm 2031, gấp khoảng ba lần con số NVIDIA công bố một năm trước đó, trong đó khoảng 7 tỷ USD sẽ được giải ngân trong năm tài chính hiện tại. Báo cáo cũng lưu ý rằng bài nghiên cứu của sản phẩm chủ lực trước đó đã liệt kê 570 tác giả và Nemotron 4 có nhiều người tham gia hơn — một cựu nhân viên nói với The Information rằng "mọi người đều muốn được tham gia." Toàn bộ những điều này đều không được NVIDIA công bố.

Tại sao con số kích thước lại là phần ít thú vị nhất
Câu chuyện dễ thấy là "NVIDIA đang tiến tới mô hình nghìn tỷ tham số." Câu chuyện ít rõ ràng hơn là biên giới mô hình trọng số mở đã đến đó trước. Kimi K3 mở trọng số vào ngày 27 tháng 7 với tổng cộng 2,8 nghìn tỷ tham số — khoảng 104 tỷ tham số hoạt động trên mỗi token trong cấu hình mixture-of-experts — còn Qwen3.8-Max của Alibaba, công bố ngày 19 tháng 7, là mô hình tổng 2,4 nghìn tỷ tham số với khoảng 95 tỷ tham số hoạt động. So với đó, một mô hình chủ lực Nemotron 4 ở mức "ít nhất 1 nghìn tỷ" sẽ gấp đôi Nemotron 3 Ultra nhưng vẫn xếp sau các nhà dẫn đầu về quy mô, và cả hai nhà dẫn đầu đó đều là của Trung Quốc.

Điều đó khiến tổng số tham số trở thành góc nhìn sai hoàn toàn. Trong mô hình mixture-of-experts, thứ quyết định chi phí và tốc độ là số tham số kích hoạt trên mỗi token, chứ không phải con số tổng gây chú ý. Một Nemotron 4 với tổng 1 nghìn tỷ tham số có thể có khoảng 100 tỷ tham số kích hoạt — ngang hàng với phân khúc của Kimi K3 và Qwen3.8-Max — hoặc chỉ bằng một nửa con số đó. Con số được tiết lộ tiếp theo mới là con số quan trọng, và nó vẫn chưa được rò rỉ.

Hướng ngược lại cũng đáng chú ý không kém: DeepSeek V4-Flash, ra mắt ngày 31 tháng 7 theo giấy phép MIT, lại đi theo hướng hoàn toàn ngược lại — tổng cộng 284 tỷ tham số, định vị ở mức giá thay vì quy mô, với chi phí ước tính khoảng 0,14 USD cho mỗi triệu token đầu vào. Thị trường đang đền đáp cả hai thái cực. Quy mô không phải là chiến lược; nó chỉ là một chiến lược.
Vị thế của NVIDIA giải thích cho động thái này. The Information đưa tin Nemotron 3 Ultra xếp thứ hai trong số các mô hình open-weights của Mỹ — sau Inkling của Thinking Machines — và nằm ngoài nhóm dẫn đầu trên bảng xếp hạng mô hình mở toàn cầu. Nemotron 4 là nỗ lực để quay trở lại cuộc đua tiên phong, và chính các lãnh đạo của NVIDIA coi đây là một bước đi về chủ quyền: Phó chủ tịch mảng AI tạo sinh Kari Briski cho biết NVIDIA đầu tư vào Nemotron vì "mọi công ty và mọi quốc gia cần các mô hình mã nguồn mở tiên phong dễ tiếp cận để tăng cường an toàn và an ninh, thúc đẩy đổi mới, và cung cấp một nền tảng đáng tin cậy từ thế hệ này sang thế hệ khác." Jensen Huang cũng đưa ra lập luận tương tự trên X, cho rằng các mô hình mở "tăng cường an toàn và an ninh mạng, thúc đẩy đổi mới và phổ biến, đồng thời hỗ trợ chủ quyền." Xung đột cấu trúc là có thật — NVIDIA được cho là sở hữu cổ phần trị giá khoảng 30 tỷ USD trong OpenAI — nhưng ván cược là các mô hình mở sẽ mở rộng miếng bánh GPU thay vì làm nó thu nhỏ lại. Như CEO của LMArena, Anastasios Angelopoulos, đã nói: "Dù công ty nào tạo ra một mô hình mã nguồn mở tuyệt vời, NVIDIA vẫn thắng."
Liên minh Nemotron là phe đáng chú ý.
Nemotron 4 không phải là một dự án đơn lẻ, và đó chính là chi tiết mà hầu hết các bài đưa tin bỏ sót. Tại GTC vào ngày 16 tháng 3 năm 2026, NVIDIA đã công bố Nemotron Coalition — tám thành viên sáng lập: Black Forest Labs, Cursor, LangChain, Mistral AI, Perplexity, Reflection AI, Sarvam, và Thinking Machines Lab — được tổ chức để góp chung nghiên cứu, dữ liệu và sức mạnh tính toán cho "các mô hình mở tiên phong." Dự án đầu tiên của liên minh là một mô hình nền tảng do Mistral AI và NVIDIA đồng phát triển, được huấn luyện trên NVIDIA DGX Cloud, mà liên minh cho biết sẽ được mã nguồn mở hóa và sẽ làm nền tảng cho dòng sản phẩm Nemotron 4.
The Information bổ sung thêm các chi tiết cụ thể: Reflection, Cursor, Thinking Machines và Mistral là những đơn vị đóng góp được xác nhận; Prime Intellect đã đóng góp 300.000 môi trường mô phỏng để huấn luyện; Cognition đã thảo luận về việc cung cấp dữ liệu huấn luyện mã nguồn. CEO của Prime Intellect, Vincent Weisser, coi liên minh này là hành động tập thể chống lại thứ mà ông gọi là thế độc quyền của một mô hình "tựa thần thánh". Về mặt vận hành, điều này có nghĩa là: Nemotron 4 có thể ra mắt như một nền tảng liên minh mà mỗi thành viên sẽ tự huấn luyện tiếp cho sản phẩm của riêng mình, thay vì là một checkpoint của một nhà cung cấp duy nhất. Điều đó sẽ khiến "mô hình NVIDIA mã nguồn mở" trở thành cách phân loại sai — phần nền tảng gốc mới là thứ đáng chú ý.
Đã xác nhận, đã báo cáo, không xác định
• Đã xác nhận — NVIDIA đang phát triển dòng Nemotron 4 (tuyên bố của công ty). Liên minh Nemotron tồn tại và đang xây dựng mô hình nền tảng mở cùng Mistral AI (NVIDIA, tháng 3 năm 2026).
• Đã được báo cáo, chưa xác nhận — mục tiêu hàng đầu "ít nhất 1 nghìn tỷ"; mốc thời gian cuối mùa thu; cam kết điện toán đám mây ~28 tỷ USD với ~7 tỷ USD trong năm tài chính này; thành viên liên minh nào đóng góp những gì.
• Chưa rõ — số lượng tham số hoạt động, độ dài ngữ cảnh, sự kết hợp phương thức, điều khoản cấp phép, giá cả, checkpoint nào được ra mắt trước, và liệu mô hình gốc do Mistral đồng phát triển có thực sự trở thành nền tảng của dòng sản phẩm hay không.
Dòng thời gian và những gì cần theo dõi
Chưa có ngày phát hành. Đợt huấn luyện cuối cùng vẫn chưa bắt đầu; các nhân viên mô tả nó kéo dài nhiều tháng, và ước tính dao động từ {{1}}"cuối mùa thu"{{/1}} ({{2}}hai nguồn tin{{/2}}) đến muộn hơn. NVIDIA vẫn tiếp tục phát triển dòng sản phẩm trong lúc chờ đợi: hãng đã phát hành Nemotron 3.5 Lightning, một tác tử xử lý với 31,6 tỷ tham số, ra mắt ngày 11 tháng 8 — cùng ngày báo cáo về Nemotron 4 được công bố — cùng với NeMo Switchyard, phần mềm định tuyến mã nguồn mở của riêng NVIDIA. Nói cách khác, NVIDIA đang tích cực cải tiến dòng sản phẩm trong khi mẫu chủ lực vẫn còn đang trên bàn thiết kế.
Nên xem gì, theo thứ tự quan trọng gần đúng:
• Tham số kích hoạt — tổng số là con số chính; số lượng kích hoạt quyết định chi phí và tốc độ. Một MoE tổng ~1T với ~100B kích hoạt sẽ thay đổi toàn bộ bức tranh so với một MoE ~50B kích hoạt.
• Điểm số độc lập — không tồn tại đánh giá từ bên thứ ba cho một mô hình chưa được huấn luyện. Hãy theo dõi Artificial Analysis Intelligence Index khi một checkpoint được lưu trữ xuất hiện.
• Điều khoản cấp phép — Nemotron 3 Ultra được phát hành theo OpenMDW-1.1, một giấy phép cho phép nhưng không phải MIT hay Apache 2.0. Việc Nemotron 4 sẽ tiếp nối hay thắt chặt điều khoản này vẫn chưa được quyết định, và đối với một công ty xây dựng dựa trên các trọng số, điều đó quyết định tất cả.
• Kích thước nào ra mắt trước — Nemotron 3 đã ra mắt như một dòng sản phẩm (Nano, Super, Ultra). Hãy mong đợi nhiều kích thước Nemotron 4, và những bản nhỏ sẽ đến trước bản cao cấp nhất.
Nền tảng Mistral — liệu mô hình cơ sở của liên minh có thực sự trở thành nền tảng của cả gia đình hay không chính là câu hỏi cấu trúc đằng sau mọi cuộc thảo luận về tham số.
• Giá cả — không có gì được lưu trữ, nên không có gì được định giá. Khi một đối tác lưu trữ niêm yết Nemotron 4, mức giá chuyển qua chính là số tiền bạn thực sự sẽ trả.
Ý nghĩa đối với tầng suy luận của bạn
Bạn không thể gọi Nemotron 4 ngay hôm nay — không ai có thể — nên câu hỏi thực tế là bao nhiêu phần trong stack của bạn nên thay đổi để phù hợp với một mô hình mà thông số kỹ thuật vẫn đang thay đổi. Câu trả lời giống như với bất kỳ mô hình tiên phong nào chưa phát hành: giữ tầng suy luận không phụ thuộc vào mô hình. Nếu bạn định tuyến qua một API duy nhất hỗ trợ hơn 200 mô hình, thì một dòng Nemotron mới chỉ là một thay đổi cấu hình, không phải viết lại toàn bộ. OrcaRouter chuyển tiếp giá niêm yết của nhà cung cấp với mức phụ phí 0%, nên bất kể nhà cung cấp nào cuối cùng tính phí cho Nemotron 4, bạn trả đúng số đó, và mức giảm giá từ nhà cung cấp sẽ được áp dụng ngay trong ngày. Tự động chuyển đổi dự phòng là công cụ dành cho bản phát hành đầu tiên chưa được kiểm chứng: hướng lưu lượng ban đầu đến mô hình mới, quay về phương án thay thế ổn định khi nó bị treo hoặc báo lỗi, và chỉ nâng cấp lên môi trường production sau khi nó đã chứng minh được giá trị với khối lượng công việc của bạn. Không điều nào trong số đó đòi hỏi bạn phải đặt cược toàn bộ đường production vào một thông tin rò rỉ — đó chính xác là tư thế đúng đắn khi bảng thông số kỹ thuật còn tạm thời đến vậy.
Câu hỏi thường gặp
Khi nào Nemotron 4 sẽ được phát hành?
Chưa có ngày cụ thể nào được ấn định. Các nhân viên nói với The Information rằng đợt huấn luyện cuối cùng vẫn chưa bắt đầu và sẽ mất nhiều tháng; hai người cho rằng cuối thu 2026 là khả thi, còn những người khác dự đoán muộn hơn. Hãy coi "cuối thu" là một ước tính lạc quan từ nội bộ dự án, không phải là một lộ trình.
Nemotron 4 có phải là mã nguồn mở không?
Ý định đã nêu của NVIDIA là trọng số mở, và dự án đầu tiên của Nemotron Coalition — {{1}}mô hình nền do Mistral đồng phát triển{{/1}} — được cam kết sẽ mở mã nguồn. Nhưng "trọng số mở" không phải là "{{2}}mã nguồn mở{{/2}}": Nemotron 3 Ultra được phân phối theo giấy phép OpenMDW-1.1, {{3}}tự do hơn các điều khoản cũ của NVIDIA nhưng vẫn không phải MIT hoặc Apache 2.0{{/3}}. Giấy phép cụ thể của Nemotron 4 vẫn chưa được công bố.
Cụm từ "at least 1 trillion parameters" có phải là một thông số kỹ thuật thực sự không?
Đây là mục tiêu do nhân viên cung cấp, được The Information đưa tin, không phải thông số kỹ thuật đã được xác nhận, và chính báo cáo đó cũng cho biết con số có thể thay đổi. Ngay cả ở mức tổng 1 nghìn tỷ, nó vẫn kém Kimi K3 (2,8 nghìn tỷ) và Qwen3.8-Max (2,4 nghìn tỷ) về kích thước thô; số lượng tham số hoạt động — vốn chưa bị rò rỉ — mới là con số quyết định chi phí và tốc độ.
Tôi có nên đợi Nemotron 4 trước khi chọn một mô hình không?
Không. Trong trường hợp tốt nhất, nó vẫn còn vài tháng nữa mới ra mắt và chưa được kiểm chứng. Hãy chọn mô hình tốt nhất hiện có cho công việc ngay bây giờ và giữ lớp định tuyến linh hoạt; khi Nemotron 4 thực sự được phát hành, hãy đánh giá nó theo cách bạn vẫn đánh giá bất kỳ mô hình mới nào — tham số hoạt động, điểm chuẩn độc lập, giấy phép và giá cả — thay vì dựa trên con số tổng được quảng bá.
Kết luận
Gia đình là có thật; các con số chỉ là ước tính. NVIDIA đã xác nhận họ đang xây dựng Nemotron 4, và cấu trúc liên minh xung quanh nó là phần thú vị nhất của câu chuyện — nhưng mọi con số nổi bật trong rò rỉ, từ mức sàn 1 nghìn tỷ đến mốc thời gian cuối thu và ngân sách 28 tỷ USD, đều đến từ các nhân viên giấu tên và có thể thay đổi. Biên giới trọng số mở đã vượt qua mốc nghìn tỷ tham số, dẫn đầu bởi các phòng thí nghiệm Trung Quốc, và phản ứng của NVIDIA là một mô hình nền liên minh cộng với một lời hứa. Đối với một độc giả đang chọn mô hình ngày hôm nay, điều đó có nghĩa một điều: đừng lên kế hoạch dựa vào rò rỉ. Giữ tầng suy luận linh hoạt, đánh giá bất cứ thứ gì được phát hành dựa trên số liệu thực tế của nó, và để định tuyến làm đúng việc của nó — thử cái mới mà không đặt cược toàn bộ lộ trình sản xuất vào nó.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
