
PixelUMM vs Microsoft Mage-VL: Một bên xóa bỏ bộ token hóa thị giác, bên kia viết lại nó
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 223 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Cả hai PixelUMM và Microsoft Mage-VL đều được xây dựng bởi những đội ngũ tin rằng cách mà thị giác được biến thành token là nút thắt sai — và họ đã sửa nó theo hai hướng ngược nhau. Mage-VL, mô hình streaming bản địa codec của Microsoft, vẫn giữ tokenizer và khiến nó quyết liệt hơn nhiều: nó bám theo cấu trúc của các codec video hiện đại, giữ mọi anchor frame và chỉ những patch predicted-frame nơi codec tiêu tốn bit, đồng thời báo cáo cắt giảm hơn 75% token thị giác trong khi đạt tốc độ thực tế nhanh hơn tới 3,5× so với lấy mẫu khung hình đồng nhất. PixelUMM, mô hình thống nhất không dùng encoder của NVIDIA, loại bỏ hoàn toàn tokenizer — mọi patch 16×16 của pixel thô đều đi vào backbone thông qua một phép chiếu tuyến tính duy nhất, không hề có VAE và không hề có vision transformer ở bất kỳ đâu. Một bên nén mạnh hơn. Bên kia từ chối nén hoàn toàn. Và chỉ một trong hai có thể tạo sinh bất cứ thứ gì.
Sự khác biệt cuối cùng đó chính là điều khiến cặp đôi này thú vị hơn một cuộc đối đầu thông số kỹ thuật. Mage-VL là một kẻ quan sát — một mô hình nhận thức dạng luồng với cổng chủ động quyết định khi nào nên lên tiếng. PixelUMM là một trình đọc cũng biết vẽ: cùng một bộ trọng số trả lời các câu hỏi về một hình ảnh và tạo video mới từ một lời nhắc văn bản. Chúng là hai câu trả lời không tương thích cho câu hỏi “một mô hình thị giác hợp nhất nên là gì”, và những con số của mỗi phòng thí nghiệm là của riêng nó.
Nơi nén xảy ra
Tiền đề của Mage-VL là một nghịch lý Moravec thời hiện đại: các mô hình thị giác-ngôn ngữ mạnh ở suy luận ngoại tuyến khó nhưng lại chậm và ngốn tài nguyên tính toán ở nhận thức thời gian thực đơn giản. Giải pháp của nó là căn chỉnh codec. Thay vì giải mã một luồng thành các khung được lấy mẫu đồng đều và đẩy một lưới dày đặc qua một ViT đóng băng đã tiền huấn luyện trên web, Mage-VL tách một luồng thành các khung neo (I) và khung dự đoán (P), giữ lại toàn bộ các patch của khung neo, và chỉ giữ lại những patch của khung dự đoán mang chuyển động thực hoặc chi tiết mới. Bộ mã hóa, Mage-ViT, được huấn luyện từ đầu trên lưới patch 16×16 với mã hóa vị trí quay 3D và hoàn toàn không phụ thuộc codec — cùng một giao diện chấp nhận vector chuyển động và năng lượng phần dư của H.264/AVC hoặc HEVC, hoặc bản đồ tốc độ học được của một codec nơ-ron, mà không cần thay đổi kiến trúc hay huấn luyện lại.
Tiền đề của PixelUMM là bản thân bộ mã hóa mới là vấn đề, chứ không phải hiệu quả của nó. Bài báo của nó lập luận rằng các mô hình như BAGEL mang hai giao diện thị giác — một ViT cho đặc trưng ngữ nghĩa và một VAE cho các latent tái tạo — điều này gần như nhân đôi ngữ cảnh thị giác trên mỗi ảnh điều kiện và buộc các pipeline tiền huấn luyện thị giác-ngôn ngữ phải được xây dựng lại quanh một luồng thứ hai. PixelUMM xóa bỏ cả hai: ảnh trở thành các patch không gian 16×16, video trở thành các tubelet không-thời gian 4 khung hình, và pixel thô đi đến một Transformer chỉ-giải-mã thông qua các phép chiếu tuyến tính một lớp. Hiểu là văn bản tự hồi quy; sinh là khớp luồng trong không gian điểm ảnh.
• Chiến lược nén — Mage-VL: theo thời gian, dẫn xuất từ codec; giữ nguyên các anchor, làm thưa các khung hình dự đoán. PixelUMM: không; giữ nguyên mọi patch của pixel thô.
• Những gì được huấn luyện từ đầu — Mage-VL: toàn bộ hệ thống thị giác, trên khoảng 100M hình ảnh và video không có nhãn. PixelUMM: các bộ nhúng pixel và bộ giải mã, nằm trên xương sống ngôn ngữ Qwen3-8B.
• Backbone — Mage-VL: Qwen3-4B-Instruct-2507, thành phần tiền huấn luyện duy nhất, nằm sau một bộ chiếu MLP hai lớp. PixelUMM: Qwen3-8B, tổng cộng khoảng 15,2B tham số.
• Hành vi truyền phát — Mage-VL: một cổng nhận thức chấm điểm từng cửa sổ trượt và giữ im lặng cho đến khi một sự kiện đáng phản hồi hoàn tất, chỉ khi đó mới gọi đến mô hình đầy đủ. PixelUMM: không có chế độ truyền phát; các yêu cầu là lệnh gọi sinh hoặc hiểu.

Mỗi thứ làm được gì, và không làm được gì
Mage-VL là một checkpoint duy nhất đồng thời cung cấp khả năng hiểu hình ảnh và video cùng cổng streaming chủ động — chính các trọng số đó vừa trả lời các câu hỏi ngoại tuyến vừa điều khiển phần bình luận được kích hoạt theo sự kiện. Nó đóng gói bộ xử lý codec, gói codec nơ-ron và cổng.microsoft/Mage-ViT, là bộ mã hóa thị giác độc lập từ giai đoạn tiền huấn luyện từ đầu, được cung cấp như một front end cắm-là-chạy cho các quá trình huấn luyện đa phương thức khác. Điều mà Mage-VL không làm là tạo sinh. Nó đọc.
PixelUMM bao gồm text-to-image, text-to-video ở 96 khung hình và 24 fps, cùng text được điều kiện hóa bằng hình ảnh và video. Nó phát hành bốn checkpoint — S8-F22-R05 làm mặc định bao quát cả bốn tác vụ, S8-F18-R01 được tinh chỉnh để làm text-to-video tốt hơn ở 480p và 720p nhưng không thể hiểu video, cùng hai giai đoạn trung gian. Điều nó không làm được là streaming, chỉnh sửa hay 3D. Nếu bạn cần một mô hình theo dõi luồng trực tiếp và lên tiếng khi có sự kiện xảy ra, thì PixelUMM hoàn toàn sai hình dạng, và không cột benchmark nào sẽ nói cho bạn điều đó.
Khoảng cách chấp nhận là tín hiệu trung thực đầu tiên
Hai bản phát hành không có độ chín muồi như nhau, và các bộ đếm lượt tải nói lên điều đó rõ ràng hơn bất kỳ bài đăng ra mắt nào.
• Mage-VL — được công bố trên Hugging Face vào ngày 25 tháng 7 năm 2026 theo giấy phép Apache-2.0, kèm theo một báo cáo kỹ thuật đồng hành và một mã định danh arXiv. Đến đầu tháng 10, nó đã ghi nhận khoảng 13.800 lượt tải xuống và 414 lượt thích, cùng một hệ sinh thái nhỏ gồm các công trình cộng đồng đã phát triển xung quanh nó.
• PixelUMM — được công bố trên Hugging Face vào ngày 1 tháng 10 năm 2026 theo giấy phép checkpoint phi thương mại. Số lượt tải xuống của nó bằng không và số lượt thích là ba vào thời điểm bài viết này được viết. Nó mới chỉ vài ngày tuổi.
Vẫn chưa có thông báo nào từ cả hai phòng thí nghiệm cho bản phát hành tương ứng — Mage-VL được phát hành vào tháng 7 mà không có, và PixelUMM được phát hành vào tháng 10 cũng không có. Sự đối xứng đó là có thật, nhưng sẽ là sai lầm nếu coi hai thứ này là những sản phẩm tương đương. Mage-VL đã có mười tuần được cộng đồng chú ý; PixelUMM mới có vài ngày. Một mô hình mà chưa ai ngoài phòng thí nghiệm chạy thử là một câu chuyện khác với một mô hình đã được vài nghìn người tải về, và chỉ một trong hai mô hình này nằm ở nhóm thứ hai.

Bảng điểm, kèm nguồn gốc
Mọi số liệu đều là của chính phòng thí nghiệm đang phát triển. Số liệu của Mage-VL đến từ thẻ và báo cáo kỹ thuật của Microsoft; còn của PixelUMM đến từ bản preprint của nó. Cả hai đều chưa được tái lập độc lập.
• Token thị giác — Mage-VL: được báo cáo giảm hơn 75% so với việc lấy mẫu khung dày đặc. PixelUMM: không giảm; lập luận đưa ra là các patch thô loại bỏ lớp mã hóa thứ hai thay vì thu nhỏ lớp mã hóa thứ nhất.
• Tốc độ thực tế — Mage-VL: nhanh hơn tới 3,5 lần so với việc lấy mẫu khung hình đồng đều ở mức độ chính xác tương đương, theo báo cáo của Microsoft. PixelUMM: bài báo không đưa ra tuyên bố so sánh nào về tốc độ.
• Chất lượng bộ mã hóa — Mage-VL: Mage-ViT đạt 99,33% trên CIFAR-10 và 85,69% trên ImageNet với ngân sách 256 token, từ khoảng 100M dữ liệu đa phương tiện không gắn nhãn. PixelUMM: không có phép đánh giá chuẩn tương đương cho bộ mã hóa, vì không tồn tại bộ mã hóa nào để đánh giá.
• Hiểu video — Mage-VL: được báo cáo là đạt mức cải thiện so với Qwen3-VL-4B trên mọi bài đánh giá về video và temporal-grounding mà nó công bố, bao gồm +22.5 trên QVHighlight và +17.1 trên ActivityNet. PixelUMM: MVBench 70.53, Video-MME 57.33 khi không có phụ đề, LongVideoBench 59.61, LVBench 40.41.
• Hiểu hình ảnh — Mage-VL: ngang bằng với Qwen3-VL-4B trên ảnh tĩnh, theo báo cáo của Microsoft. PixelUMM: MMMU 41,67, AI2D 80,12, DocVQA 90,42, ChartQA 82,96.
• Sinh tạo — Mage-VL: không có. PixelUMM: GenEval tổng thể 0.83 với bộ viết lại prompt, DPG-Bench 85.74, chất lượng VBench Phần 1 84.10.
• Truyền phát — Mage-VL: cơ chế gating sự kiện chủ động với các chỉ số TimVal, F1, ROC-AUC và PR-AUC hàng đầu được báo cáo trên luồng dữ liệu SoccerNet. PixelUMM: không được hỗ trợ.
• Giấy phép — Mage-VL: Apache-2.0, mã nguồn và trọng số. PixelUMM: mã nguồn Apache-2.0, Giấy phép Phi thương mại Một chiều của NVIDIA áp dụng cho checkpoint.
Hai cột không trùng lặp đủ để xếp hạng. Mage-VL báo cáo một encoder hiệu quả đánh bại một đối thủ cùng quy mô; PixelUMM báo cáo một mô hình 15B nằm trong cùng dải với các hệ thống chuyên biệt xung quanh nó, và nói thẳng trong bài báo của chính mình rằng dữ liệu huấn luyện khác nhau khiến các kết quả "không thể xác định kiến trúc nào vượt trội".
Sự phân chia thực tế
Chọn theo công việc, không theo điểm số. Nếu bạn đang xây dựng nhận thức video thời gian thực — một trình giám sát theo dõi luồng và đưa ra bình luận khi có sự kiện xảy ra, với chi phí token là ràng buộc quyết định — thì Mage-VL là mô hình duy nhất trong hai mô hình làm được điều đó, nó theo giấy phép Apache-2.0, và quy mô lớp 4B của nó nghĩa là một nút duy nhất có thể phục vụ nó. Nếu bạn cần một mô hình đọc được ảnh và video đồng thời tạo ra chúng, thì PixelUMM là mô hình duy nhất trong hai mô hình làm được điều đó, nhưng nó là một sản phẩm nghiên cứu dưới giấy phép phi thương mại, trọng số của nó gồm 128 phân mảnh checkpoint phân tán đằng sau một chỉ mục ẩn, và text-to-video chạy các guardrails Cosmos theo mặc định với một môi trường Python riêng cho cổng kiểm soát.
Đối với một nhóm cần cả hai khả năng, lập luận để tiếp cận chúng thông qua một lớp định tuyến thay vì hai tích hợp trực tiếp là khá rõ ràng, mặc dù hiện tại cả hai đều chưa được host: một khóa duy nhất, giá niêm yết của nhà cung cấp được chuyển qua với mức chênh lệch 0%, và các quy tắc chuyển đổi dự phòng cho phép bạn đưa một mô hình Apache-2.0 mới được mở lên trước một phần lưu lượng trong khi mô hình đã được chứng minh giữ phần còn lại. OrcaRouter được xây dựng cho dạng vấn đề đó — và để nói rõ, hiện tại chúng tôi không định tuyến cả PixelUMM lẫn Mage-VL, vì vậy đây là mô tả về quy trình làm việc, không phải một danh sách.
Điều gì sẽ giải quyết được nó?
Hai sự kiện mới đáng quan tâm. Thứ nhất là một lần chạy lại độc lập các con số encoder của Mage-ViT hoặc kết quả video của Mage-VL bởi một người không có lợi ích liên quan — mười tuần tải xuống vẫn chưa tạo ra được lần nào. Thứ hai là bất kỳ thay đổi nào đối với giấy phép checkpoint của PixelUMM, yếu tố duy nhất hiện đang phân chia một sản phẩm nghiên cứu với một thứ có thể triển khai được. Cho đến khi một trong hai điều đó xảy ra, điều hữu ích bạn có thể nói về cặp này là Microsoft đặt cược vào việc làm cho giao diện thị giác rẻ hơn và NVIDIA đặt cược vào việc loại bỏ nó, và cả hai canh bạc đều chưa được bất kỳ ai ngoài phòng thí nghiệm đưa ra chúng đánh giá.
