Một thẻ tiêu đề được tạo theo phong cách của OrcaRouter với dòng chữ “PixelUMM vs North Micro Vision Instruct”, cùng bốn ô thống kê: “2.4B” (tổng số tham số của North Micro Vision Instruct), “~180k” (lượt tải xuống Hugging Face của nó tính đến đầu tháng 10), “0.921 / 90.42” (DocVQA của nó dưới dạng phân số độ chính xác so với tỷ lệ phần trăm của PixelUMM) và “Apache-2.0” (giấy phép mã và trọng số của nó, so với checkpoint phi thương mại của PixelUMM). Một dòng chân trang ghi “Số liệu do nhà cung cấp báo cáo; không có lần chạy lại độc lập nào cho cả hai mô hình.”. Logo OrcaRouter được ghép vào dải đệm ở góc dưới cùng bên phải.
Guides & Insights

PixelUMM vs North Micro Vision Instruct: Một mô hình nghiên cứu phi thương mại đối đầu với trình đọc 2,4B bạn có thể triển khai

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đặt North Micro Vision Instruct và PixelUMM cạnh nhau và sự khác biệt về kích thước gần như là một điều gây xao nhãng: 2,4 tỷ tham số cho mô hình đọc ở độ phân giải gốc của Cohere so với 15,2 tỷ tham số cho mô hình hợp nhất của NVIDIA. Trục đáng chú ý nằm ở bộ mã hóa. North Micro Vision Instruct được xây dựng theo cách thông thường — một bộ mã hóa thị giác 400M được khởi tạo từ SigLIP 2 SO400M, nạp vào một mô hình ngôn ngữ 2B, được gói trong bộ từ vựng 262.144 token và phát hành theo Apache-2.0. PixelUMM được xây dựng dựa trên lập luận rằng chính cách sắp xếp này là nút thắt cổ chai, và xóa bỏ bộ mã hóa: các patch pixel thô 16×16 đi vào xương sống Qwen3-8B thông qua các phép chiếu tuyến tính một lớp, và cùng những trọng số đó tạo ra video cũng như trả lời các câu hỏi về nó. Một bên là một thiết bị đọc chuyên dụng mà bạn có thể tải xuống và triển khai ngay hôm nay. Bên kia là một luận đề nghiên cứu với một liên kết tải xuống và một giấy phép khiến nó không thể được dùng trong sản phẩm.

Số liệu của cả hai mô hình dưới đây đều do chính phòng thí nghiệm của họ công bố. Không mô hình nào đã được tái lập một cách độc lập, và hai bên công bố những bộ kiểm chuẩn khác nhau, nên mức độ trùng lặp thực ra hẹp hơn vẻ ngoài của nó.

Lập luận cho kiến trúc nhàm chán

North Micro Vision Instruct được công bố trên Hugging Face vào ngày 10 tháng 8 năm 2026, đã có tám tuần để tích lũy người dùng, và đến đầu tháng Mười đã đạt khoảng 180.000 lượt tải xuống và 150 lượt thích — lượng chú ý lớn hơn một bậc so với kho lưu trữ mới được vài ngày của PixelUMM. Điểm nhấn của nó rất cụ thể và không hào nhoáng: hầu hết mô hình thị giác đều giảm kích thước ảnh về một lưới cố định và làm mất đi những chi tiết tinh tế mà tài liệu dựa vào, nên mô hình này xử lý ảnh ở độ phân giải gốc, bảo toàn tỷ lệ khung hình và văn bản nhỏ.

• Tham số — Tổng cộng 2,4B: một mô hình ngôn ngữ 2B cộng với bộ mã hóa thị giác 400M được huấn luyện tùy chỉnh từ SigLIP 2 SO400M.

• Bối cảnh — một xương sống ngôn ngữ 128K token, nhưng phạm vi hoạt động đa phương thức đã được xác thực chỉ khoảng 8K token. Thẻ nêu rõ rằng các ngữ cảnh đa phương thức dài hơn dựa vào ngoại suy và chưa được đánh giá theo chuẩn.

• Đầu vào và đầu ra — đầu vào là văn bản và hình ảnh xen kẽ, đầu ra là văn bản. Đa ngôn ngữ trên hơn mười một ngôn ngữ. Không tạo sinh dưới bất kỳ hình thức nào.

• Điểm số được báo cáo — DocVQA 0.921, ChartQA 0.808, OCRBench 0.792, tất cả đều do Cohere báo cáo và chưa được tái lập. MMMU 0.329, điều mà thẻ mô hình không hề che giấu: đây là một chuyên gia đọc hiểu, chứ không phải một chuyên gia tổng quát về suy luận.

• Triển khai — Transformers 5.16.0 và một bộ tăng tốc, một GPU hiện đại duy nhất ở mức 2,4B với bfloat16, Flash Attention 2 là tùy chọn chứ không bắt buộc.

Không có gì về thiết kế đó là mới lạ. Đó cũng là lý do nó có thể được tải xuống, tinh chỉnh và đưa vào xử lý các tài liệu thực tế ngay trong tuần này.

A headless-browser capture of the Hugging Face model card for the North Micro Vision Instruct repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

Lập luận chống lại nó, do phía bên kia đưa ra

Bài preprint của PixelUMM mở đầu bằng việc gọi tên cái giá của kiến trúc đó. Một vision transformer đóng băng được tiền huấn luyện trên web cung cấp các đặc trưng ngữ nghĩa để hiểu; một VAE riêng cung cấp các latent hướng tái tạo để sinh; việc mang cả hai gần như nhân đôi ngữ cảnh thị giác trên mỗi ảnh điều kiện và buộc các pipeline tiền huấn luyện thị giác-ngôn ngữ phải được xây dựng lại quanh một luồng thứ hai. North Micro Vision Instruct tránh việc nhân đôi đó chỉ bằng cách từ chối hoàn toàn nhiệm vụ thứ hai — nó không sinh, nên nó cần một giao diện, không phải hai.

PixelUMM đưa lập luận đến kết luận cuối cùng của nó. Không encoder, không VAE, không tokenizer: các patch pixel 16×16 cho hình ảnh, các tubelet không-thời gian 4 khung cho video, cả hai đều đi tới một Transformer chỉ-decoder thông qua các phép chiếu tuyến tính một lớp, với việc hiểu bằng văn bản tự hồi quy và sinh bằng flow matching trong không gian pixel. Tám phần thực nghiệm của nó là các nghiên cứu về những lựa chọn thiết kế hơn là các chiến thắng trên bảng xếp hạng — kích thước patch, artifact của patch, động lực huấn luyện trong không gian pixel so với không gian VAE, mở rộng tính toán — một bài báo đặt câu hỏi liệu mô thức này có đứng vững không, chứ không phải một bài báo tuyên bố nó đã thắng rồi.

• Nhánh thị giác — North Micro Vision Instruct: bộ mã hóa thị giác 400M đã được huấn luyện trước ở độ phân giải gốc. PixelUMM: không có bộ mã hóa; các patch thô đi qua một phép chiếu tuyến tính.

• Nó có thể làm gì — North Micro Vision Instruct: đọc hình ảnh và tài liệu, trả lời bằng văn bản, định vị và chú thích. PixelUMM: đọc hình ảnh và video, và tạo hình ảnh và video 4 giây từ văn bản.

• Quy mô — 2,4B dense so với khoảng 15,2B tổng cộng trên backbone Qwen3-8B, được trình bày là "8B MoT" trong các bảng của chính bài báo.

• Giấy phép — Apache-2.0 trên mã nguồn và trọng số so với Apache-2.0 trên mã nguồn cùng với NVIDIA One-Way Noncommercial License trên checkpoint.

A generated scoreboard card titled “PixelUMM vs North Micro Vision Instruct — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: parameters, visual path, inputs and outputs, DocVQA, MMMU and licence. North Micro Vision Instruct's column shows 2.4B total, a 400M SigLIP 2 SO400M vision encoder at native resolution, interleaved text and images in with text out, DocVQA 0.921, MMMU 0.329 and Apache-2.0; PixelUMM's column shows about 15.2B total, no encoder with raw patches through a linear projection, image and video reading plus image and video generation, DocVQA 90.42, MMMU 41.67 and a noncommercial checkpoint licence. A footer notes that the figures are vendor-reported with no independent rerun.

Đọc hai bảng điểm một cách trung thực

Hai mô hình công bố những chuẩn đánh giá khác nhau, và ở những điểm chúng trùng nhau thì thang đo lại khác.

• DocVQA — North Micro Vision Instruct đạt 0,921 dưới dạng phân số độ chính xác. PixelUMM đạt 90,42 dưới dạng phần trăm. Cùng một tên benchmark, nhưng khác cách chia tập dữ liệu và thiết lập prompt, và chỉ một trong hai bên lấy khả năng xử lý độ phân giải gốc làm lý do.

• ChartQA — North Micro Vision Instruct 0.808. PixelUMM 82.96. Một lần nữa, đại khái vẫn cùng một dải khi bạn ngừng so sánh các chuỗi thô.

• OCRBench — North Micro Vision Instruct 0.792. PixelUMM 78.00.

• MMMU — North Micro Vision Instruct 0.329, PixelUMM 41.67. Cả hai đều thấp theo tiêu chuẩn của các mô hình ngôn ngữ-thị giác lớn, và cả hai phòng thí nghiệm đều báo cáo chúng mà không tô vẽ.

• Chỉ riêng PixelUMM — MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, GenEval 0.83 với trình viết lại prompt, chất lượng VBench Phần 1 đạt 84.10.

• North Micro Vision Instruct-only — các tác vụ grounding, tạo chú thích và đa hình ảnh; tài liệu ghi nhận việc không có khả năng gọi công cụ và rõ ràng không có hành vi agentic.

Điều đáng chú ý ở sự trùng lặp này là mức độ tiệm cận của một mô hình chuyên biệt 2,4B với một mô hình tổng quát 15,2B trong việc đọc tài liệu và biểu đồ. Đó không phải là bằng chứng cho thấy phương pháp không dùng encoder thất bại — mà là bằng chứng cho thấy đọc tài liệu là một tác vụ mà một encoder gọn nhẹ với độ phân giải gốc rất phù hợp, và kiến trúc của PixelUMM đang nhắm đến một luận điểm khác. Bài báo của chính PixelUMM cũng thừa nhận điểm này trong một câu đáng trích dẫn: vì dữ liệu huấn luyện khác nhau giữa các mô hình, kết quả của nó “không thể xác lập kiến trúc nào là tốt hơn”.

Nơi quyết định thực sự được đưa ra

Nếu bạn có tài liệu, biểu đồ, biểu mẫu hoặc ảnh chụp màn hình và bạn cần câu trả lời trong tháng này, North Micro Vision Instruct là lựa chọn thực tế và không có gì gần bằng: Apache-2.0, 2.4B, một đường tải Transformers tiêu chuẩn, không có môi trường guardrail, không có chỉ mục checkpoint phân tán, không có ngăn xếp Python thứ hai. Tinh chỉnh nó trên phân phối tài liệu của riêng bạn và bạn có một chuyên gia. Hạn chế là phạm vi — hãy hướng nó vào một tác vụ suy luận và con số MMMU sẽ tìm đến bạn.

Những gì PixelUMM mang lại là độ bao phủ rộng và một câu hỏi nghiên cứu. Nó đọc và tạo sinh, cả hình ảnh lẫn video, chỉ từ một bộ trọng số duy nhất, và đây là thứ thú vị hơn hẳn để đọc. Nhưng checkpoint của nó nằm dưới một giấy phép phi thương mại, trọng số của nó là 128 phân mảnh checkpoint phân tán nằm sau một chỉ mục metadata ẩn, tổng cộng khoảng 30 GB, nó đòi hỏi bộ công cụ CUDA 13 với FlashAttention được biên dịch từ mã nguồn, và đường ống text-to-video của nó chạy các guardrail của Cosmos, vốn cần một repository gated và một môi trường riêng. Đó là một bàn thí nghiệm, chứ không phải một bản triển khai.

Khía cạnh định tuyến sẽ đến sau, nếu nó có đến. Cả hai mô hình đều không khả dụng qua bất kỳ API được lưu trữ nào hiện nay — OrcaRouter không định tuyến mô hình nào trong hai — và cả hai sẽ không khả dụng cho đến khi giấy phép của chúng cho phép điều đó. Khi một mô hình như North Micro Vision Instruct thực sự xuất hiện phía sau một endpoint dùng chung, lý do để ưu tiên cách đó hơn tích hợp trực tiếp là lý do thông thường: một khóa cho hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển tiếp với mức phụ trội 0%, cơ chế chuyển đổi dự phòng giáng cấp một mô hình hoạt động kém hơn so với thẻ mô hình của nó, và không cần đàm phán hợp đồng thứ hai khi bạn muốn thử nghiệm A/B một mô hình thay thế. Đó là mô tả về quy trình làm việc, không phải là tuyên bố về tính khả dụng.

Bài kiểm tra duy nhất có thể phân biệt họ

Chạy cả hai trên cùng một bộ tài liệu ở cùng độ phân giải và chấm điểm các trường hợp văn bản nhỏ, rồi đảo một biến: loại bỏ bộ mã hóa thị giác khỏi phép so sánh bằng cách đưa cho PixelUMM đầu vào ở độ phân giải gốc của nó. Nếu mô hình không có bộ mã hóa vẫn trụ vững trên văn bản dày đặc với chi phí tham số chỉ bằng một phần nhỏ, thì đó là bằng chứng mạnh nhất có thể cho luận điểm — và đó là một phép kiểm tra mà bất kỳ ai có một card dự phòng đều có thể chạy, vì cả hai checkpoint đều tải xuống được. Cho đến khi có ai đó làm vậy, tóm tắt thực dụng vẫn đứng vững: một reader nhỏ Apache-2.0 là thứ bạn triển khai, còn một generalist lớn phi thương mại là thứ bạn nghiên cứu.