
NVIDIA PixelUMM đã phát hành mà không hề có thông báo — Trọng số vừa được tung ra
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 223 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Cách dễ nhất để phát hiện rằng NVIDIA đã xây dựng một mô hình đa phương thức hợp nhất mới là nhận ra rằng không ai nói cho bạn biết. Kho lưu trữ nvidia/PixelUMM xuất hiện trên Hugging Face lúc 21:40 UTC ngày 1 tháng 10 năm 2026, mang theo một checkpoint 15,2 tỷ tham số với toàn bộ ngăn xếp học được của nó nằm trên nền Qwen3-8B làm xương sống — và không có bài đăng blog nào, không có thông cáo báo chí, không có slide keynote và không có luồng ra mắt nào đi kèm. Tìm kiếm cái tên này không cho ra kết quả nào trên blog của chính NVIDIA. Thay vào đó, thứ tồn tại là một kho GitHub, một trang dự án mà URL của chính nó vẫn ghi "preview", một bản thảo trước arXiv mang số 2609.38597, và một checkpoint được chia thành 128 tệp với một chỉ mục ẩn mà trình tải từ chối chạy nếu không có. PixelUMM là thật và có thể tải xuống ngay hôm nay. Liệu NVIDIA có coi nó là đã phát hành hay không là câu hỏi mà công ty chưa trả lời.
Khoảng trống đó — giữa một tạo tác đã tồn tại và một nhà cung cấp chưa hề nói gì — chính là toàn bộ câu chuyện ở đây, và đáng để nói cho chính xác mỗi sự kiện nằm ở phía nào của khoảng trống ấy. Mọi thứ dưới đây đều đến từ kho lưu trữ, thẻ mô hình và bài báo mà chính các tác giả đã công bố. Không có gì đến từ một thông báo, bởi vì đã không có thông báo nào.
Cái gì đã xuất hiện, và khi nào
Chuỗi nội dung kéo dài khoảng bốn tuần, và mỗi phần đều ra mắt một cách âm thầm.
• 4 tháng 9 năm 2026 — nv-tlabs/PixelUMM được tạo trên GitHub theo giấy phép kho lưu trữ Apache-2.0, được mô tả đơn giản là "Encoder-Free Unified Image and Video Understanding and Generation". Nó chỉ có một commit khởi tạo duy nhất cho đến cuối tháng 9.
• 28–29 tháng 9 năm 2026 — commit đầu tiên của kho lưu trữ được đưa lên, và arXiv ấn định cho bản thảo trước mã arXiv:2609.38597, ghi ngày 29 tháng 9, với danh sách tác giả đến từ NVIDIA và Đại học Waterloo: Cong Wei, Xuanchi Ren, Bryan Chu, Weiming Ren, Huan Ling, Jiahui Huang, Laura Leal-Taixé, Sanja Fidler, Wenhu Chen, Zian Wang và Jay Zhangjie Wu.
• 1 tháng 10 năm 2026, 21:32 UTC — một commit cuối cùng vào kho lưu trữ mang tiêu đề "docs: add PixelUMM paper citation".
• 1 tháng 10 năm 2026, 21:40 UTC — kho mô hình Hugging Face được tạo, tám phút sau, và được điền bằng các phân mảnh checkpoint.
Trang dự án được lưu trữ tại một đường dẫn mà đọc nguyên văn là pixelumm-project-page-preview, và bài báo không có dòng ghi hội nghị nào — không CVPR, không NeurIPS, không "accepted to". Ghép lại với nhau, chuỗi sự việc này trông như một nhóm nghiên cứu đang đẩy một sản phẩm bài báo lên trực tuyến và để cho việc tải lên HF đóng vai trò thông báo. Đó là một nhận xét về bằng chứng, chứ không phải một khẳng định về ý định: NVIDIA hoàn toàn có thể đã lên kế hoạch ra mắt vào thời điểm sau đó, và không có gì ở đây loại trừ khả năng ấy.

PixelUMM thực sự là gì
Luận đề thiết kế được nêu ngay ở dòng đầu tiên của thẻ mô hình: không VAE, không bộ mã hóa thị giác. Trong khi một mô hình hợp nhất thông thường mang hai giao diện thị giác — một vision transformer tạo ra các đặc trưng ngữ nghĩa để hiểu, và một variational autoencoder tạo ra các latent tái dựng để sinh — thì PixelUMM không mang giao diện nào. Ảnh được cắt thành các patch pixel 16×16; video được cắt thành các tubelet không-thời gian 4 khung hình; cả hai đều đi đến backbone chỉ thông qua các phép chiếu tuyến tính một lớp. Pixel thô đi vào; pixel thô đi ra.
• Kiến trúc — Transformer chỉ có decoder với embedding patch từ pixel thô và đầu sinh lặp, được mô tả trong bài báo như một Mixture-of-Transformers chia sẻ attention với các tham số riêng theo loại.
• Mô hình chính — Qwen3-8B, được ghim vào bản sửa đổi b968826d9c46dd6066d109eabc6255188de91218. Chỉ cần các tệp cấu hình và tokenizer của nó; checkpoint mang trọng số ngôn ngữ đã học của riêng nó.
• Tham số — 15.199.672.064 (khoảng 15,2 tỷ), được ghi là "8B MoT" trong các bảng đánh giá của chính bài báo, nơi ký hiệu kích thước đếm riêng phần backbone và generation expert.
• Mục tiêu — dự đoán văn bản tự hồi quy và khớp luồng trong không gian điểm ảnh được huấn luyện đồng thời, đó là điều cho phép một tập trọng số vừa trả lời câu hỏi về một hình ảnh vừa vẽ ra một hình ảnh mới.
• Tác vụ — văn bản sang hình ảnh, văn bản sang video ở 96 khung hình / 24 fps / 4 giây, văn bản được điều kiện hóa bằng hình ảnh, và văn bản được điều kiện hóa bằng video.
Phần thực nghiệm của bài báo có một điểm khác thường đáng để lưu ý. Tám trong số các mục của nó là những nghiên cứu về các lựa chọn thiết kế thay vì vị trí trên bảng xếp hạng — kích thước patch ảnh, kích thước patch video, hiện tượng artifact của patch, động lực huấn luyện trong không gian pixel so với không gian VAE, kích thước mô hình, mở rộng quy mô tính toán, điều kiện hóa ngữ cảnh đa phương thức, và các giao diện hiểu video. Đó là một bài báo được viết bởi những người đang cố gắng trả lời liệu cách tiếp cận này có hiệu quả hay không, chứ không phải một bài báo nhằm giành chiến thắng trên một bảng xếp hạng.
Những con số này là của chính các tác giả.
Mọi số liệu dưới đây đều do chính các tác giả PixelUMM báo cáo trong bản tiền in của họ. Không có tái lập độc lập, không có Elo đấu trường, và không có đánh giá từ bên thứ ba, vì mô hình này nhiều nhất mới sáu tuần tuổi và ra đời trước bất kỳ hệ thống đánh giá bên ngoài nào. Hãy coi đây là những tuyên bố kèm một liên kết tải xuống, chứ không phải hiệu năng đã được kiểm chứng.
• Hiểu hình ảnh — MMMU 41.67, MMStar 53.99, AI2D 80.12, DocVQA 90.42, ChartQA 82.96, OCRBench 78.00, BLINK 53.46, MMMU-Pro 27.63, theo giao thức LMMS-Eval chính thức (64.750 lượt sinh trên 21 tác vụ).
• Hiểu video — MVBench 70.53, Video-MME 57.33 không có phụ đề, LongVideoBench 59.61, LVBench 40.41.
• Tạo hình ảnh — GenEval tổng thể 0.83 khi có công cụ viết lại prompt bằng LLM, 0.77 khi không có; DPG-Bench tổng thể 85.74.
• Tạo video — điểm chất lượng VBench Phần 1 là 84,10, điểm ngữ nghĩa 79,80; tổng điểm VBench Phần 2 là 83,24.
Cách diễn giải trung thực là đây là những con số cạnh tranh trong cùng phân khúc, chứ không phải dẫn đầu danh mục, và bài báo cũng tự nói như vậy: bài báo lưu ý rằng vì dữ liệu huấn luyện khác nhau giữa các mô hình, kết quả “không thể xác lập kiến trúc nào là vượt trội”. So với Qwen3-VL-8B, khoảng cách hiểu hình ảnh là lớn trên MMMU (41,67 so với 69,60) và trên MMMU-Pro, nơi các tác giả báo cáo không có số liệu đối chiếu. So với Qwen-Image 20B, khoảng cách GenEval là 0,83 đến 0,87. Theo chính các con số của mình, PixelUMM không phải là một mô hình state-of-the-art. Theo chính các con số của mình, nó là một mô hình 15B với một kiến trúc thực sự khác thường, nằm trong cùng dải hiệu năng với các hệ thống chuyên biệt quanh nó.
Lợi thế sắc bén nhất nằm ở giấy phép, không phải ở benchmark
Kho lưu trữ dùng giấy phép Apache-2.0 và thẻ mô hình công bố rõ điều đó. Checkpoint là một sản phẩm khác với các điều khoản khác, và đây chính là chi tiết dễ khiến một nhóm bị mắc lỗi nhất. Trọng số được phát hành theo NVIDIA One-Way Noncommercial License, với việc sử dụng chỉ giới hạn cho nghiên cứu phi thương mại hoặc đánh giá — một sự cấp phép chặt chẽ hơn đáng kể so với phần mã nằm ngay cạnh nó. Một tệp nguồn trong kho lưu trữ, modeling/pixelumm/modeling_utils.py, còn giữ thêm một thông báo CC BY-NC 4.0 bắt nguồn từ DiT.
Đối với một nhóm nghiên cứu, một nhóm đánh giá hay bất kỳ ai đang công bố một bài báo, đây là một giấy phép hoàn toàn dùng được. Đối với một nhóm sản phẩm đang làm nguyên mẫu cho một tính năng nội bộ, đó là thứ đầu tiên cần đưa cho bộ phận pháp lý xem xét, và câu trả lời có thể là không. Một mô hình bạn không thể tung ra là một loại tài sản khác với một mô hình bạn có thể tung ra, và không mức độ tương đương benchmark nào có thể thay đổi điều đó.

Những gì cần để chạy nó
Đây không phải là bản tải về trong một cuối tuần. Tài liệu môi trường yêu cầu Linux x86-64, Python 3.12, bộ công cụ phát triển CUDA 13.0, GPU NVIDIA và FlashAttention được build từ mã nguồn với bộ công cụ đó — một image CUDA chỉ có runtime sẽ không đáp ứng được. Bản thân checkpoint không phải là tệp model.safetensors: nó là 128 phân mảnh .distcp với tổng dung lượng khoảng 30 GB cùng một chỉ mục .metadata ẩn, và trình nạp yêu cầu mọi phân mảnh được tham chiếu và chỉ mục đó đều phải có mặt.
Hai chi tiết khác định hình những gì bạn thực sự có thể làm với nó. Thứ nhất, text-to-video chạy các guardrail của Cosmos theo mặc định, và chúng cần quyền truy cập vào kho lưu trữ bị hạn chế nvidia/Cosmos-1.0-Guardrail cùng với một môi trường Python thứ hai có phiên bản major khác của Transformers — chỉ đăng nhập thôi thì không mở khóa được các trọng số. Thứ hai, ví dụ huấn luyện đồ chơi bốn bước, công thức huấn luyện duy nhất được công bố, theo tài liệu là cần bảy GPU với ít nhất 48 GiB mỗi GPU và khoảng 61 GB dung lượng đĩa trống cho đầu ra. Tinh chỉnh trên một máy trạm không phải là hướng đi dự kiến; suy luận trên một card hiện đại duy nhất mới là.
Kho lưu trữ cung cấp bốn checkpoint. S8-F22-R05 là mặc định và là checkpoint được dùng cho đánh giá trong bài báo, bao quát cả bốn tác vụ. S8-F18-R01 đã thực hiện thêm 10.000 bước fine-tuning ở 480p và 720p và nhìn chung cho kết quả text-to-video tốt hơn một chút, nhưng nó không thể hiểu video. S8-F19-R03 và S8-F21-R02 là các giai đoạn trung gian. Việc lựa chọn giữa chúng là một quyết định thực sự, không phải là chi tiết nhỏ.
Điều gì chưa được xác nhận
Một danh sách ngắn, và nó còn quan trọng hơn danh sách dài ở trên.
• Không có thông báo nào từ NVIDIA. Không có thông cáo báo chí và cũng không có bài đăng nào trên blog của chính công ty về mô hình này tại thời điểm viết bài. Việc phát hành âm thầm có thể là chủ ý — các sản phẩm nghiên cứu thường được tung ra theo cách này — hoặc đơn giản là một buổi ra mắt vẫn chưa diễn ra.
• Không có đánh giá độc lập. Mọi con số trong bài viết này đều do chính các tác giả cung cấp. Không có nội dung nào được chạy lại bên ngoài NVIDIA và Waterloo.
• Không có tuyến được host nào ở bất kỳ đâu. Hiện tại bạn không thể gọi PixelUMM qua API, và điều đó bao gồm cả OrcaRouter — chúng tôi không định tuyến nó, và không thể, bởi vì một checkpoint được cấp phép phi thương mại không phải là thứ mà một nền tảng phục vụ thương mại có thể cung cấp. Bất cứ ai nói với bạn điều ngược lại đều đang mô tả một thiết lập tự host.
• Không có quan điểm được nêu rõ về việc cấp phép trong tương lai. Các điều khoản phi thương mại là các điều khoản như khi được phát hành. Liệu chúng có được nới lỏng hay không thì chưa rõ và, với lịch sử của NVIDIA về các checkpoint nghiên cứu, đây không phải là điều để lên kế hoạch dựa vào.

Điều gì cần chú ý tiếp theo
Ba sự kiện sẽ biến PixelUMM từ một sản phẩm nghiên cứu thành thứ mà một đối tượng rộng hơn có thể sử dụng. Việc thứ nhất là thay đổi giấy phép đối với checkpoint — chỉ riêng tệp đó là toàn bộ rào cản giữa "thú vị" và "dùng được trong một sản phẩm". Việc thứ hai là một đợt ra mắt chính thức từ NVIDIA, đi kèm với một cách định vị mà kho lưu trữ không thể cung cấp: mô hình dùng để làm gì, và liệu đó là một hướng sản phẩm hay một bài báo. Việc thứ ba là lần tái lập độc lập đầu tiên, nhiều khả năng là một lần chạy lại GenEval hoặc MVBench bởi ai đó có một cụm GPU nhàn rỗi, và đó là thời điểm các con số của nhóm tác giả không còn là những con số duy nhất.
Cho đến lúc đó, thái độ đúng đắn là thái độ mà bằng chứng ủng hộ. PixelUMM tồn tại, mã nguồn và bài báo được công khai và có thể đọc được, các trọng số tải xuống được, và chưa có tuyên bố hiệu năng nào được kiểm chứng bởi bất kỳ ai ngoài nhóm đã đưa ra chúng. Đó không phải là lời chỉ trích công trình — đó chỉ là diện mạo của một bản công bố nghiên cứu sáu tuần tuổi. Đây cũng chính là tình huống mà một lớp định tuyến sẽ chứng tỏ được giá trị của nó về sau, nếu giấy phép có nới lỏng: một khóa duy nhất dùng cho các mô hình bạn đã tin cậy, giá niêm yết được chuyển tiếp với mức chênh lệch 0%, và tính năng chuyển đổi dự phòng cho phép bạn hướng một phần lưu lượng vào một thứ chưa được chứng minh mà không đặt cược đường đi sản xuất vào nó. Tuy nhiên, hiện tại, bản tóm tắt trung thực thì đơn giản hơn. NVIDIA đã xây dựng một thứ khác thường, công bố nó một cách kỹ lưỡng và không nói với ai. Kho mã nguồn chính là thông báo.
