Thẻ tiêu đề hero cho phần so sánh 'InternLumina-U2 vs Microsoft Mage-VL' với phụ đề 'Hai phòng thí nghiệm thầm lặng, hai ván cược vào token thị giác thông minh hơn' và ba chip thống kê — 'InternLumina-U2: 16B-A1B diffusion MoE', 'Microsoft Mage-VL: ~5B VLM codec-native', 'Cả hai do nhà cung cấp công bố, chưa được tái lập' — với logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

InternLumina-U2 vs Microsoft Mage-VL: Hai phòng lab âm thầm đặt cược rằng token thị giác nên mang nhiều thông tin hơn

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Microsoft Mage-VL và InternLumina-U2 đều được phát hành theo cách mà các phòng nghiên cứu thường làm khi họ chưa chắc chắn sản phẩm đã sẵn sàng: lặng lẽ. Microsoft công bố mã nguồn và trọng số Mage-VL trên Hugging Face vào ngày 25 tháng 7 năm 2026 mà không có thông báo nào; tổ chức InternLM của Phòng thí nghiệm Trí tuệ Nhân tạo Thượng Hải công bố mã nguồn suy luận của InternLumina-U2 trên GitHub vào ngày 1 tháng 9 năm 2026, cũng không kèm thông báo nào. Cách nhau năm tuần, hai trong số những phòng thí nghiệm lớn nhất thế giới đã tung ra các mô hình có chung một niềm tin thầm lặng — rằng cách chúng ta chuyển hình ảnh thành token chính là nút thắt cổ chai — rồi để lại cho cộng đồng tự khám phá. Một trong số đó bạn có thể tải về và chạy ngay hôm nay, dù còn vụng về. Chiếc còn lại bạn không thể chạy được, vì trọng số của nó chưa tồn tại. Đây là bản đồ trung thực về hai mô hình này, và về lý do vì sao "cả hai đều do nhà cung cấp tự báo cáo, cả hai đều chưa được kiểm chứng" không phải là câu nói giống nhau đối với cả hai.

Năm tuần, hai ván cược vào hiệu quả biểu diễn

Mạch xuyên suốt ở đây là thực chất, không chỉ là lời nói suông. Mage-VL là một mô hình video thuần codec: thay vì giải mã một luồng dữ liệu thành các khung hình được lấy mẫu đều rồi đẩy một lưới patch dày đặc qua một bộ biến đổi thị giác (vision transformer) đã được tiền huấn luyện trên dữ liệu web và đóng băng, nó đi theo cấu trúc của các codec video hiện đại — tách luồng dữ liệu thành các khung hình neo cùng với dữ liệu chuyển động nén nằm giữa chúng — và nạp trực tiếp biểu diễn tinh gọn đó. Lợi ích mà Microsoft ghi nhận được là giảm mạnh số lượng token thị giác và làm cho đường dẫn nhận thức theo luồng nhanh hơn đáng kể; công ty mô tả đây là cách khắc phục một dạng nghịch lý Moravec trong các mô hình ngôn ngữ video, khi những tác vụ nhận thức thời gian thực nhỏ lại tốn chi phí tính toán ngang với các bài toán suy luận ngoại tuyến khó. Mage-VL là một kẻ quan sát: nó tiêu thụ video một cách hiệu quả và trả lời các câu hỏi về những gì nó nhìn thấy, gần như theo thời gian thực.

InternLumina-U2 là một canh bạc vào cùng một nút thắt cổ chai nhưng từ hướng ngược lại. Trong khi Mage-VL nén video bằng cách bám theo codec, InternLumina-U2 nén mọi đầu vào thị giác bằng cách mô tả từng vị trí bằng tám mã rời rạc bổ sung thay vì một mã duy nhất, sử dụng một bộ tokenizer mà phòng thí nghiệm gọi là AToken. Đặt cược ở đây là một codebook duy nhất sẽ giới hạn lượng thông tin mà một token thị giác có thể mang, do đó một từ vựng đa codebook cho phép một mô hình khuếch tán 16B tham số làm cả việc hiểu và sinh nội dung qua cùng một giao diện — đọc biểu đồ, trả lời câu hỏi video, mô tả tài sản 3D, sinh hình ảnh từ văn bản, chỉnh sửa hình ảnh theo chỉ dẫn — mà không cần một ngăn xếp sinh riêng. Mage-VL muốn nhận thức các luồng dữ liệu với chi phí thấp; InternLumina-U2 muốn nhận thức và vẽ bằng một bộ trọng số duy nhất.

Bảng tỷ số

Số liệu của cả hai mẫu đều do nhà cung cấp công bố và chưa được kiểm chứng độc lập, vì vậy bảng điểm ghi rõ nguồn gốc của từng hàng dữ liệu.

• Shape — Mage-VL: một mô hình ngôn ngữ–thị giác gốc codec, nhỏ gọn (khoảng 5B tham số ở định dạng BF16), được xây dựng quanh backbone văn bản Qwen và được huấn luyện cho khả năng hiểu hình ảnh và video. InternLumina-U2: mô hình MoE 16B tham số với 1B tham số hoạt động (16B-A1B), một LLM khuếch tán thưa đảm nhận các tác vụ hiểu, sinh và chỉnh sửa.

• Biểu diễn thị giác — Mage-VL: token gốc codec tuân theo cấu trúc codec video (anchor và motion); được báo cáo giảm hơn 75% token thị giác trên video phát trực tuyến. InternLumina-U2: token tám-codebook hoàn toàn rời rạc từ bộ token hóa AToken.

• Chức năng — Mage-VL: xử lý đầu vào hình ảnh và video, trả lời bằng văn bản; được xây dựng cho nhận thức theo luồng. InternLumina-U2: tuyên bố hỗ trợ hiểu văn bản, hiểu hình ảnh, tạo ảnh từ văn bản, chỉnh sửa ảnh, hiểu video và hiểu 3D.

• Trọng số — Mage-VL: công khai trên Hugging Face từ 25 tháng 7 năm 2026 (microsoft/Mage-VL, Apache-2.0). InternLumina-U2: không công khai — repo Hugging Face chỉ là một stub trống, trọng số được ghi chú "sắp ra mắt."

• Các con số nổi bật — Mage-VL: Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, tất cả đều do Microsoft công bố. InternLumina-U2: ChartQA 86.52, MathVision 33.22, VideoMME 51.26, GenEval 0.81, tất cả do phòng thí nghiệm công bố, sơ bộ và một phần.

• Thực tế phục vụ — Mage-VL: có thể tải xuống, nhưng không có luồng vLLM hoặc SGLang chuẩn; mã nguồn yêu cầu trust_remote_code, và hiện không có nhà cung cấp suy luận nào triển khai nó. InternLumina-U2: không ai có thể phục vụ được — các trọng số không tồn tại công khai, và thậm chí trình điều khiển suy luận được phát hành cũng yêu cầu các tệp checkpoint không có trong kho lưu trữ.

A comparison scoreboard for InternLumina-U2 and Microsoft Mage-VL: InternLumina-U2 with Shape 16B-A1B sparse MoE, Visual rep. 8-codebook discrete (AToken), Weights not public 'coming soon', Job understand/generate/edit, Headline ChartQA 86.5 GenEval 0.81, Serving none — weights absent; Microsoft Mage-VL with Shape ~5B codec-native VLM, Visual rep. codec-native stream tokens, Weights public since Jul 25 2026, Job watch video answer in text, Headline Video-MME 64.0 (reported), Serving trust_remote_code DIY, with a footer noting both sets of figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

"Có sẵn nhưng bất tiện" không giống với "không có sẵn"

Đây là sự khác biệt quan trọng nhất nếu bạn thực sự muốn xây dựng một thứ gì đó. Mage-VL là thật theo đúng nghĩa được tính đến đầu tiên: trọng số nằm trên Hugging Face, thẻ mô hình đã được tải xuống rất nhiều từ cuối tháng 7 đến nay, và quanh nó đã mọc lên một hệ sinh thái nhỏ gồm các phiên bản lượng tử hóa từ cộng đồng. "Thật" không có nghĩa là "dễ." Thẻ mô hình hiển thị nhãn custom-code, bộ mã hóa thị giác không phải là ViT đóng băng tiêu chuẩn mà các serving stack hiện có vẫn giả định, và chính repo của Microsoft cũng cho thấy hệ quả thực tiễn: muốn chạy được thì phải trust_remote_code, và không có dịch vụ triển khai trọn gói từ bất kỳ nhà cung cấp nào. Nhưng một nhóm đầy quyết tâm với một chiếc GPU có thể tải nó về, trỏ nó vào một luồng video, rồi xem thử luận điểm codec-native có đúng với dữ liệu của họ hay không. Đó là một khác biệt khổng lồ so với InternLumina-U2, nơi cùng một câu khẳng định lại kết thúc khác hẳn: một nhóm đầy quyết tâm có thể đọc mã suy luận, nhưng rồi dừng lại ở đó, vì không có trọng số nào để tải.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page, the multi-codebook diffusion description, and the per-task inference scripts that make up the public release.

Thẻ Hugging Face của microsoft/Mage-VL, được chụp ngày 27 tháng 8 năm 2026 — mô tả phát trực tuyến gốc codec, giấy phép Apache-2.0, thẻ arxiv và phần nhà cung cấp suy luận cho thấy hiện không có nhà cung cấp nào triển khai mô hình này.

Sự bất đối xứng trong các điểm chuẩn cũng đi theo cùng một hướng. Số liệu của cả hai mô hình đều là tuyên bố từ nhà cung cấp, chưa có lần chạy lại độc lập nào. Nhưng các tuyên bố của Mage-VL ít nhất nằm trên một tệp dữ liệu có thể tải về, nghĩa là khoảng cách giữa tuyên bố và xác minh chỉ là chuyện ai đó chạy thử nó. Các tuyên bố của InternLumina-U2 lại nằm trên một hạng mục trong lộ trình phát triển — "bảng so sánh đầy đủ sẽ xuất hiện trong báo cáo kỹ thuật sắp tới" — và không có tệp dữ liệu nào tồn tại để có thể xác minh chúng. Bảng dữ liệu một phần của chính phòng thí nghiệm còn cho thấy mô hình này xếp sau ít nhất một đối thủ mà họ tuyên bố vượt qua (GenEval 0,81 so với 0,89 của LLaDA2.0-Uni), một lời nhắc hữu ích để đọc nhãn "sơ bộ, một phần" của họ theo đúng nghĩa đen.

Nơi họ có thể sáng tác thay vì cạnh tranh

Cách hữu dụng nhất để hiểu hai mô hình này là xem chúng như những bậc thang liền kề trên cùng một chiếc thang, chứ không phải đối thủ cạnh tranh cho cùng một vai trò. {{1}}Một bộ giám sát codec-native như Mage-VL đáng chú ý chính vì nó đủ rẻ để chạy liên tục — thứ theo dõi từng khung hình của một luồng video và chỉ chuyển tiếp khi có thứ gì đó đáng để một mô hình lớn hơn chú ý xuất hiện.{{/1}} {{2}}Mô hình lớn hơn mà nó chuyển tiếp tới, về nguyên tắc, có thể là một mô hình thống nhất thuộc loại InternLumina-U2 tự nhận: cổng chốt luôn bật quyết định cần nhìn vào đâu, và mô hình sâu thực sự đọc biểu đồ, bám theo khung cảnh 3D, hoặc tạo ra hình ảnh đã chỉnh sửa.{{/2}} {{3}}Cả hai đều chưa được kiểm chứng — Mage-VL chưa kiểm chứng nhưng chạy được, InternLumina-U2 chưa kiểm chứng và chưa phát hành — nên cách nói thẳng thắn là một sự kết hợp bạn có thể xây dựng một khi mỗi phía đã được xác thực độc lập, chứ không phải một cuộc đối đầu trực diện bạn có thể chạy ngay hôm nay.{{/3}}

A screenshot of the Hugging Face model page for microsoft/Mage-VL (captured August 27 2026), showing the codec-native streaming description, the Apache-2.0 license, the arxiv tag, and an inference-provider section showing no provider currently deploys the model.

Kho lưu trữ GitHub InternLM/InternLumina-U2, được lưu lại vào ngày 2 tháng 9 năm 2026 — trang đích của kho hiển thị mô tả về phương pháp khuếch tán đa mã sách (multi-codebook diffusion), huy hiệu giấy phép Apache-2.0 và các tập lệnh điểm vào suy luận (inference entry-point scripts) tạo nên bản phát hành công khai trong khi các trọng số (weights) vẫn nằm ngoài cây thư mục.

Lớp định tuyến làm gì với các điểm kiểm tra chưa được xác minh

Cả hai mô hình này đều không được lưu trữ trên OrcaRouter, và chúng tôi sẽ không ám chỉ điều ngược lại — Mage-VL không có đường serving chuẩn ở bất kỳ đâu, còn InternLumina-U2 không có trọng số. Điều mà DSL định tuyến thực sự hữu ích trong tình huống này là thể hiện sự kết hợp nói trên thành một lời gọi duy nhất thay vì một đoạn mã kết dính tùy biến: một mô hình nhận thức giá rẻ, luôn bật, cấp dữ liệu cho một mô hình sâu hơn, được nối chuỗi để mô hình đắt tiền chỉ chạy khi mô hình rẻ báo rằng có gì đó đã thay đổi. Và với vấn đề checkpoint chưa được kiểm chứng — vốn là toàn bộ rủi ro của cả hai mô hình này — cơ chế tự động chuyển dự phòng (automatic failover) là phương tiện giúp một nhóm dùng thử một mô hình như Mage-VL trên một luồng thực tế mà không đặt cược cả luồng đó vào nó: ngay lần đầu checkpoint mới bị treo, trả về rác, hoặc ném lỗi, lời gọi được chuyển xuống một mô hình đã được kiểm chứng, và không một kỹ sư nào phải bị đánh thức dậy để gạt công tắc. Một API duy nhất cho hơn 200 mô hình, giá niêm yết của nhà cung cấp được truyền thẳng qua với mức markup 0%, và sản phẩm mới được thử nghiệm phía sau một tấm lưới an toàn thay vì trực tiếp trước production.

Điểm mấu chốt

Nếu bạn muốn kiểm chứng luận điểm codec-native-video ngày hôm nay, chỉ có Mage-VL tồn tại — và "tồn tại" đi kèm với những dè dặt về mã tùy chỉnh và cách tự phục vụ. Nếu bạn muốn kiểm chứng luận điểm mô hình hợp nhất đa codebook, bạn không thể, vì InternLumina-U2 vẫn chỉ là một bản đặc tả đang chờ trọng số của nó; điều bạn có thể làm là đọc kiến trúc của nó ngay bây giờ để sẵn sàng vào thời điểm stub trên Hugging Face được lấp đầy. Hãy coi mô hình của Microsoft như một hiện vật vụng về nhưng có thật, và mô hình của Shanghai AI Lab như một lời hứa được ghi chép đầy đủ, và hãy nhớ rằng trong cuộc so tài này, "do nhà cung cấp báo cáo và chưa được tái tạo" áp dụng cho cả hai — nó chỉ mang ý nghĩa khác nhau khi có một tệp bạn có thể tải xuống.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube