Thẻ tiêu đề được tạo theo phong cách thương hiệu OrcaRouter với nội dung “PixelUMM vs InternLumina-U2”, cùng bốn ô thống kê: “41.67 / 57.33” (MMMU và Video-MME của PixelUMM), “0.81 / 51.26” (GenEval và Video-MME của InternLumina-U2), “Apache-2.0” (mã nguồn và cả hai checkpoint của InternLumina-U2) và “1-way NC” (giấy phép checkpoint PixelUMM). Một dòng chân trang ghi “Các số liệu do nhà cung cấp báo cáo; không có lần chạy lại độc lập cho mô hình nào.”. Logo OrcaRouter được ghép vào dải đệm ở phía dưới cùng bên phải.
Guides & Insights

PixelUMM vs InternLumina-U2: Hai bản beta không dùng encoder, và sự khác biệt duy nhất định đoạt tất cả

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai mô hình, đều công khai, đều được thiết kế theo cách khác thường, và chỉ một trong số đó là thứ bạn có thể xây dựng sản phẩm dựa trên nó. PixelUMM là mô hình hợp nhất không dùng encoder của NVIDIA — 15,2 tỷ tham số trên nền Qwen3-8B, đọc và ghi pixel thô thông qua các patch 16×16 và tubelet 4 khung hình, không có VAE và không có bộ mã hóa thị giác ở bất kỳ đâu trong toàn bộ ngăn xếp. InternLumina-U2 là mô hình khuếch tán mixture-of-experts 16B của Phòng thí nghiệm AI Thượng Hải, nén mọi đầu vào thị giác thành tám mã rời rạc bổ trợ lẫn nhau thông qua một tokenizer có tên AToken. Cả hai đều đặt cược rằng giao diện thị giác chính là điểm nghẽn. Canh bạc quan trọng hơn nằm ở các tệp giấy phép: InternLumina-U2 phát hành trọng số theo Apache-2.0, còn PixelUMM phát hành checkpoint theo giấy phép phi thương mại. Nếu bạn đang cân nhắc giữa chúng cho bất kỳ mục đích thương mại nào, thì câu đó chính là toàn bộ sự so sánh và phần còn lại của trang này chỉ là bối cảnh cho nó.

Cả hai bộ số liệu dưới đây đều đến từ chính các phòng thí nghiệm. Không mô hình nào có đánh giá độc lập, Elo đấu trường hay bản tái tạo của bên thứ ba. Không mô hình nào được cung cấp qua bất kỳ API được lưu trữ nào. Điều khác biệt là bạn được phép làm gì với tạo tác sau khi tải xuống, và mỗi bản phát hành thực sự đang ở giai đoạn hoàn thiện nào.

Vị trí hiện tại của mỗi người

Các mốc thời gian phát hành đã dịch chuyển với tốc độ khác nhau và cả hai đều âm thầm.

• PixelUMM — Kho lưu trữ GitHub được tạo ngày 4 tháng 9 năm 2026; bản preprint arXiv 2609.38597 đề ngày 29 tháng 9 năm 2026; kho mô hình Hugging Face được tạo ngày 1 tháng 10 năm 2026 lúc 21:40 UTC. Không có bài đăng trên blog, thông cáo báo chí hay luồng thảo luận ra mắt nào của NVIDIA xuất hiện cho nó.

• InternLumina-U2 — Kho lưu trữ GitHub được tạo ngày 1 tháng 9 năm 2026; bản sơ khai Hugging Face được đăng ký cùng ngày; trọng số checkpoint được huấn luyện bằng Ascend được thêm vào ngày 10 tháng 9 năm 2026; trọng số checkpoint NVIDIA/CUDA được thêm vào ngày 24 tháng 9 năm 2026. Bảy phân mảnh cho mỗi ngăn xếp, cả hai đều có thể tải xuống hôm nay.

InternLumina-U2 của đầu tháng Chín — chỉ có mã, trọng số thì "sắp ra mắt", kho mô hình trống rỗng — không còn là InternLumina-U2 hiện tại nữa. Bất cứ ai đã đọc về nó vào đầu tháng và kết luận rằng các trọng số bị thiếu nên kiểm tra lại; cả checkpoint cho Huawei Ascend lẫn NVIDIA/CUDA đều đã được đăng, theo giấy phép Apache-2.0, cùng với tokenizer, config, chat template và mã mô hình hóa từ xa đi kèm.

A headless-browser capture of the Hugging Face model card for the InternLumina-U2 repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters alongside the file listing for the checkpoint shards.

Hai câu trả lời cho cùng một câu hỏi

Cả hai mô hình đều bắt đầu từ cùng một vấn đề: việc mang theo một bộ mã hóa thị giác để hiểu và một VAE để tạo sinh đồng nghĩa với việc biểu diễn mỗi hình ảnh hai lần, gần như nhân đôi ngữ cảnh thị giác và buộc quy trình huấn luyện phải duy trì hai giao diện.

Câu trả lời của PixelUMM là loại bỏ cả hai. Điểm ảnh thô đi thẳng vào qua các phép chiếu tuyến tính một lớp — một patch 16×16 cho mỗi vị trí ảnh, một tubelet 4 khung hình cho mỗi vị trí video — và backbone là một Transformer chỉ gồm decoder với thiết kế Mixture-of-Transformers kết hợp attention chia sẻ cùng các tham số riêng cho từng tác vụ. Văn bản được dự đoán theo kiểu tự hồi quy; điểm ảnh được dự đoán bằng flow matching. Bài báo dành tám mục cho các nghiên cứu thiết kế — kích thước patch, các artifact của patch, động lực học trong không gian điểm ảnh so với không gian VAE, khả năng mở rộng theo lượng tính toán — điều đó cho thấy câu hỏi thực sự của nhóm là liệu paradigm này có còn đứng vững hay không.

Câu trả lời của InternLumina-U2 là giữ một giao diện rời rạc nhưng khiến mỗi token mang nhiều thông tin hơn hẳn. Bộ tokenizer AToken mô tả mọi vị trí thị giác bằng tám codebook bổ trợ cho nhau, bao quát kết cấu, văn bản nhúng và hình học; tám embedding được nối lại theo từng vị trí rồi chiếu thành một token backbone. Quá trình giải mã diễn ra theo chiều ngược lại, với khử nhiễu song song theo không gian và một đầu tự hồi quy đa codebook dự đoán tám mã theo thứ tự. Backbone là một LLM khuếch tán thưa thuộc dòng LLaDA-2.0, tổng cộng 16B với 1B hoạt động.

• Giao diện thị giác — PixelUMM: các bản vá pixel thô và tubelet, hoàn toàn không có tokenizer. InternLumina-U2: token rời rạc hoàn toàn từ tám codebook của AToken, không có latent liên tục.

• Backbone — PixelUMM: Qwen3-8B (tổng 15.2B), bộ giải mã dense duy nhất với các chuyên gia hiểu và tạo sinh. InternLumina-U2: mô hình ngôn ngữ khuếch tán MoE thưa 16B tổng / 1B hoạt động.

• Phương pháp sinh — PixelUMM: khớp luồng trong không gian điểm ảnh kết hợp văn bản tự hồi quy. InternLumina-U2: khử nhiễu khuếch tán có mặt nạ trên các mã rời rạc.

• Nhiệm vụ đã nhận — PixelUMM: văn bản-thành-hình ảnh, văn bản-thành-video, hình ảnh-thành-văn bản, video-thành-văn bản. InternLumina-U2: những khả năng trên cùng với chỉnh sửa hình ảnh và hiểu không gian 3D.

• Định dạng trọng số — PixelUMM: 128 .distcp phân mảnh (~30 GB) đằng sau một chỉ mục .metadata ẩn. InternLumina-U2: bảy .safetensors phân mảnh cho mỗi ngăn xếp phần cứng, bố cục Hugging Face tiêu chuẩn.

A generated scoreboard card titled “PixelUMM vs InternLumina-U2 — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: visual interface, backbone, generation method, video understanding, weight format and licence. PixelUMM's column shows raw pixel patches and tubelets, a Qwen3-8B backbone at 15.2B, pixel-space flow matching, Video-MME 57.33 with MVBench 70.53, 128 distributed-checkpoint shards, and a noncommercial checkpoint licence; InternLumina-U2's column shows eight-codebook discrete AToken tokens, a 16B-A1B sparse MoE diffusion backbone, masked diffusion denoising, Video-MME 51.26 with MVBench 59.74, seven safetensors shards per hardware stack, and Apache-2.0. A footer notes that the figures are vendor-reported with no independent rerun.

Bảng điểm, cùng với nguồn gốc của nó được đính kèm.

Hãy đọc mỗi hàng như một tuyên bố của chính phòng thí nghiệm. Phần của PixelUMM đến từ bản tiền in của nó; phần của InternLumina-U2 là mô tả của chính phòng thí nghiệm về chúng là “sơ bộ, một phần”, với các bảng so sánh đầy đủ được dời lại cho một báo cáo kỹ thuật vẫn chưa xuất hiện.

• MMMU (suy luận hình ảnh) — PixelUMM 41.67 (của chính các tác giả). InternLumina-U2: chưa được công bố.

• ChartQA — PixelUMM 82.96. InternLumina-U2 86.52.

• DocVQA — PixelUMM 90.42. InternLumina-U2: không được báo cáo.

• Video-MME (không có phụ đề) — PixelUMM 57.33. InternLumina-U2 51.26.

• MVBench — PixelUMM 70.53. InternLumina-U2 59.74.

• GenEval tổng thể — PixelUMM 0.83 khi dùng trình viết lại prompt LLM, 0.77 khi không dùng. InternLumina-U2 0.81.

• DPG-Bench tổng thể — PixelUMM 85,74. InternLumina-U2 87,10.

• Tạo video — PixelUMM VBench Phần 1 chất lượng 84.10 / ngữ nghĩa 79.80, Phần 2 tổng 83.24. InternLumina-U2: không được báo cáo.

• Hiểu 3D — PixelUMM: không có tác vụ như vậy. InternLumina-U2 báo cáo 3D MM-Vet 41,8.

Sự so sánh là không đồng đều vì hai phòng thí nghiệm công bố các bảng khác nhau, không phải vì một bên đang thắng. PixelUMM có một phần tạo video đầy đủ và không có chỉnh sửa hoặc 3D; InternLumina-U2 tuyên bố có sáu nhóm tác vụ và báo cáo một bảng không đầy đủ cho các nhóm đó. Các số liệu liên phòng thí nghiệm trên cùng một tên chuẩn đánh giá không phải là cùng một phép đo — cách chia, lời nhắc và cách lấy mẫu khác nhau — vì vậy hãy coi các hàng ChartQA và GenEval là xấp xỉ ngang nhau và dừng lại ở đó.

Cấp phép là điểm mà ở đó thế hòa không còn nữa.

Đây là phần mà không bảng benchmark nào thể hiện. Kho PixelUMM là Apache-2.0 và thẻ ghi rõ điều đó, một cách nổi bật. Checkpoint là một artifact riêng biệt thuộc NVIDIA One-Way Noncommercial License, chỉ giới hạn cho nghiên cứu hoặc đánh giá phi thương mại, và một tệp nguồn còn giữ thông báo CC BY-NC 4.0 kế thừa từ DiT. Dùng cho nghiên cứu: ổn. Tính năng sản phẩm nội bộ: một cuộc trao đổi với bộ phận pháp lý, và có thể là một cuộc ngắn.

InternLumina-U2 theo Apache-2.0 từ đầu đến cuối, cả mã nguồn lẫn cả hai checkpoint, không có điều khoản loại trừ phi thương mại riêng. Đối với một đội cần phát hành sản phẩm, đó không phải là một lợi thế nhỏ — mà là toàn bộ quyết định. Cả hai mô hình đều có độ trưởng thành ở mức nghiên cứu. Chỉ một trong hai mô hình là không bị hạn chế sử dụng.

Nên thực sự thử cái nào, và làm thế nào?

Nếu công việc của bạn là hiểu video hoặc bạn muốn một mô hình tạo video và hình ảnh từ một bộ trọng số, PixelUMM là sản phẩm hoàn chỉnh hơn và bài báo của nó là tài liệu đọc hữu ích hơn — nhưng đây là một dự án nghiên cứu với giấy phép phi thương mại, nên nó thuộc về môi trường đánh giá, chứ không phải trong một pipeline. Nếu công việc của bạn là độ bao phủ về biểu đồ, tài liệu và tạo hình ảnh, hoặc bạn cần chỉnh sửa và 3D, InternLumina-U2 bao quát nhiều phạm vi hơn và không có giới hạn giấy phép; cái giá của nó là backbone diffusion 16B-A1B và tokenizer AToken đồng nghĩa với việc phải làm kỹ thuật phục vụ thực sự, và các số liệu được công bố của nó được nêu rõ là chưa đầy đủ.

Tính đến thời điểm viết bài này, cả hai đều không có trên bất kỳ API được lưu trữ nào, và điều đó bao gồm cả OrcaRouter — chúng tôi không định tuyến mô hình nào trong hai mô hình đó. Khi điều đó thay đổi, lập luận để tiếp cận chúng thông qua một lớp định tuyến thay vì tích hợp trực tiếp cũng chính là lập luận áp dụng cho bất kỳ mô hình mới được mở nào: một khóa cho hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển nguyên qua với mức markup 0%, và failover tự động để một mô hình hóa ra tệ hơn mức bảng của nhà cung cấp gợi ý có thể bị hạ cấp bằng cách thay đổi một tuyến thay vì viết lại một triển khai. Cho đến lúc đó, lời khuyên trung thực là lời khuyên nhàm chán — hãy tải xuống bất kỳ mô hình nào mà giấy phép của nó cho phép trường hợp sử dụng của bạn, tự chạy đánh giá trên dữ liệu của riêng bạn, và đừng lập kế hoạch dựa trên số liệu của bất kỳ phòng thí nghiệm nào trong hai cho đến khi ai đó bên ngoài phòng thí nghiệm chạy lại chúng.

Điều gì sẽ làm thay đổi câu trả lời

Ba điều, theo thứ tự tác động. Một giấy phép thương mại cho checkpoint của PixelUMM sẽ khiến việc so sánh thực sự sít sao và sẽ đưa nó từ chỗ "đọc bài báo" sang "đánh giá các trọng số". Một báo cáo kỹ thuật từ Shanghai AI Laboratory mang đầy đủ các bảng so sánh sẽ biến những con số một phần của InternLumina-U2 thành thứ có thể kiểm chứng, và cũng sẽ tiết lộ bao nhiêu trong độ rộng sáu tác vụ là ngang bằng so với ở độ sâu token. Và lần tái lập độc lập đầu tiên của một trong hai mô hình — một lần chạy lại GenEval hoặc MVBench bởi một nhóm không có lợi ích gì trong kết quả — chính là khoảnh khắc một trong hai thứ này không còn là một bảng của nhà cung cấp nữa. Cho đến lúc đó, một cái là kiến trúc khác thường mà bạn chỉ có thể nghiên cứu, còn cái kia là kiến trúc khác thường mà bạn có thể triển khai.