Thẻ tiêu đề hero cho phần so sánh 'InternLumina-U2 vs North Micro Vision Instruct' với phụ đề 'Trình đọc tài liệu bạn có thể chạy hôm nay vs mô hình 16B vẫn chưa sẵn sàng' và ba chip thống kê — 'North Micro: 2.4B, chạy được hôm nay', 'InternLumina-U2: 16B, chưa có trọng số', 'ChartQA 0.808 vs 86.52 (cả hai đều được báo cáo)' — với logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

InternLumina-U2 vs North Micro Vision Instruct: Một trình đọc tài liệu bạn có thể chạy ngay hôm nay so với mô hình 16B vẫn chưa sẵn sàng

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Nếu {{1}}tuần này{{/1}} bạn cần một mô hình đọc được tài liệu, ảnh chụp màn hình và biểu đồ, thì bài so sánh này có một câu trả lời thực dụng ngắn gọn: North Micro Vision Instruct là mô hình trọng số mở 2,4 tỷ tham số của Cohere, phát hành theo giấy phép Apache-2.0, tải về được kể từ ngày 10 tháng 8 năm 2026, và đủ giỏi trong các tác vụ tài liệu đến mức đáng để bạn dùng thử trên chính tài liệu của mình ngay hôm nay. InternLumina-U2 là mô hình khuếch tán 16 tỷ tham số của Phòng thí nghiệm trí tuệ nhân tạo Thượng Hải — một thiết kế tham vọng hơn hẳn khi cũng tuyên bố hiểu được biểu đồ và tài liệu, trong số khoảng nửa tá tác vụ khác — nhưng trọng số của nó không được công khai, kho lưu trữ Hugging Face của nó trống rỗng, và hiện chưa ai ở bất kỳ đâu có thể chạy được nó. Câu trả lời dài hơn bàn về điều xảy ra khi hai mô hình Apache-2.0 đưa ra những tuyên bố trùng lặp về khả năng đọc, nhưng chỉ một trong hai là thứ bạn thực sự có thể cầm trong tay.

Số 2.4B thực sự tồn tại

North Micro Vision Instruct là chuyên gia thị giác trong dòng North của Cohere: tổng cộng khoảng 2,4 tỷ tham số — một mô hình nhỏ gọn được xây dựng để đọc ở độ phân giải gốc. Ý tưởng thiết kế là khi hầu hết các mô hình thị giác đều thu nhỏ ảnh về một lưới cố định và làm mất đi các chi tiết nhỏ vốn làm nên nội dung tài liệu, thì North Micro Vision Instruct chấp nhận ảnh ở độ phân giải gốc, lên tới khoảng một trang A4 ở 200 dpi, giữ nguyên tỷ lệ khung hình và chữ nhỏ. Các con số mà Cohere công bố rất mạnh so với phân khúc kích thước này: DocVQA 0,921, ChartQA 0,808, OCRBench 0,792 — tất cả đều do Cohere tự báo cáo và chưa được tái lập độc lập — cùng với ngữ cảnh đa phương thức đã được xác thực khoảng 8K token và điểm yếu được ghi nhận rõ tại MMMU (0,329); điều này nhắc lại rằng đây là chuyên gia đọc hiểu, không phải một mô hình suy luận đa năng. Mô hình không có API lưu trữ riêng, cũng không có một đường lưu trữ chuẩn nào; giải pháp thực tế là tự lưu trữ một mô hình 2,4B tham số — vốn đủ nhỏ để chạy trên một GPU máy trạm hiện đại. Sự đón nhận của cộng đồng diễn ra đều đặn — model card trên Hugging Face cho thấy hàng chục nghìn lượt tải xuống mỗi tháng vào cuối tháng 8.

16B chính là một lời hứa

InternLumina-U2 là một loại artifact hoàn toàn khác. Thứ mà Shanghai AI Laboratory công bố vào ngày 1 tháng 9 năm 2026 là mã suy luận và kiến trúc, chứ không phải một mô hình: một mô hình ngôn ngữ lớn khuếch tán hỗn hợp chuyên gia thưa, với tổng 16B tham số nhưng chỉ 1B tham số hoạt động, được xây dựng xoay quanh một biểu diễn thị giác hoàn toàn rời rạc gồm tám codebook. Trong sáu nhóm tác vụ mà tập lệnh điều khiển của repo bao phủ — văn bản, hiểu hình ảnh, văn bản thành hình ảnh, chỉnh sửa hình ảnh, hiểu video, hiểu 3D — nhánh hiểu hình ảnh bao gồm một cách tường minh các biểu đồ và tài liệu có mật độ thông tin cao. Bảng sơ bộ trên trang dự án liệt kê các số liệu về biểu đồ và tài liệu mà phòng thí nghiệm báo cáo trong cùng khoảng điểm mà chuyên gia tuyên bố: ChartQA 86.52, CharXiv-DQ 83.65, cùng với HallusionBench 62.15 và MathVision 33.22. Trang này gọi các kết quả là "sơ bộ, một phần", báo cáo kỹ thuật chứa các bảng đầy đủ được đánh dấu là sắp ra mắt, và — điều quyết định — không có trọng số nào để bất kỳ ai có thể kiểm chứng.

Bảng tỷ số

Mọi số liệu bên dưới đều do nhà cung cấp báo cáo. Kết quả của North Micro Vision Instruct là đánh giá của chính Cohere; kết quả của InternLumina-U2 là bảng một phần sơ bộ từ phòng thí nghiệm của họ.

• Kích thước và hình dạng — North Micro Vision Instruct: mô hình dense ~2,4B, bộ đọc ở độ phân giải gốc. InternLumina-U2: MoE thưa tổng 16B / 1B kích hoạt, mô hình khuếch tán rời rạc đa codebook.

• Chức năng — North Micro Vision Instruct: đọc hình ảnh, tài liệu, biểu đồ và màn hình giao diện UI; trả lời dạng văn bản, có nguồn dẫn. InternLumina-U2: tuyên bố đọc và tạo sinh — hiểu hình ảnh/video/3D, tạo và chỉnh sửa hình ảnh.

• Trọng số — North Micro Vision Instruct: công khai từ ngày 10 tháng 8 năm 2026 (CohereLabs/North-Micro-Vision-Instruct, Apache-2.0). InternLumina-U2: không công khai; trang stub trên Hugging Face trống, trọng số được đánh dấu là "sắp ra mắt".

• Điểm số đọc tiêu đề — North Micro Vision Instruct: DocVQA 0,921, ChartQA 0,808, OCRBench 0,792 (do Cohere báo cáo). InternLumina-U2: ChartQA 86,52, CharXiv-DQ 83,65, HallusionBench 62,15 (do phòng thí nghiệm báo cáo, sơ bộ).

• Ngữ cảnh tài liệu — North Micro Vision Instruct: độ phân giải gốc lên tới ~A4 ở 200 dpi, ngữ cảnh đa phương thức đã xác thực ~8K. InternLumina-U2: biểu đồ dày đặc và hình ảnh tự nhiên được xử lý qua bộ mã hóa đa codebook AToken; ngữ cảnh chưa được xác định cụ thể.

• Điểm yếu đã biết — North Micro Vision Instruct: MMMU 0.329, không hỗ trợ gọi công cụ — chỉ là trình đọc, không phải trình suy luận hay tác nhân. InternLumina-U2: trong bảng đối chiếu một phần của chính nó, xếp sau ít nhất một đối thủ được nêu tên ở GenEval (0.81 so với 0.89); mọi thứ đều chưa được xác minh.

• Cách chạy nó — North Micro Vision Instruct: tự lưu trữ một mô hình 2.4B; hỗ trợ vLLM vẫn đang được bổ sung khi bài viết này được viết. InternLumina-U2: không ai có thể chạy được nó — không có trọng số, và driver được phát hành cần có thư mục checkpoint và các tệp tokenizer không có trong repo.

A comparison scoreboard for InternLumina-U2 and North Micro Vision Instruct: InternLumina-U2 with Size 16B-A1B diffusion MoE, Weights not public 'coming soon', Reading scores ChartQA 86.52 (reported), Weak spot GenEval 0.81 trails rival, Context not yet specified, Run it no one can today; North Micro Vision Instruct with Size ~2.4B dense reader, Weights public since Aug 10 2026, Reading scores ChartQA 0.808 DocVQA 0.921, Weak spot MMMU 0.329 no tools, Context native-res ~A4 8K ctx, Run it self-host one GPU, with a footer noting all figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

Cùng một chuẩn mực, hai nhận thức luận rất khác nhau

ChartQA là cách rõ ràng nhất để thấy sự khác biệt giữa hai tuyên bố. Cả hai mô hình đều báo cáo một con số ChartQA; North Micro Vision Instruct báo cáo 0,808 dưới dạng phân số độ chính xác, còn InternLumina-U2 báo cáo 86,52 dưới dạng phần trăm — cùng một benchmark, về cơ bản là cùng một kết quả trong dải từ giữa 80 đến cuối 80 theo các thang đo khác nhau, sai khác chút ít do các bộ tách dữ liệu đánh giá và cách thiết lập prompt khác nhau khiến cho việc so sánh ChartQA giữa các bài báo trở nên khó tin cậy ngay cả khi cả hai mô hình đều tồn tại. Điểm khác biệt về mặt nhận thức luận mới là điều quan trọng: con số 0,808 của North Micro Vision Instruct gắn liền với một artifact có thể tải xuống, nên bất kỳ đội ngũ nào có GPU và một bộ biểu đồ đều có thể tái tạo hoặc bác bỏ con số đó ngay trong tuần này. Con số 86,52 của InternLumina-U2 gắn liền với một lộ trình phát triển. Một con số mà bạn không thể kiểm chứng là một con số mà bạn không nên xây dựng dựa trên — và đó chính xác là vị thế mà chính phòng thí nghiệm đó thừa nhận khi dán nhãn "sơ bộ" cho bảng số liệu của mình.

A screenshot of the Hugging Face model page for CohereLabs/North-Micro-Vision-Instruct (captured August 27 2026), showing the 2.4B native-resolution vision-language description, the Apache-2.0 license, and the model-size and download figures.

Thẻ Hugging Face CohereLabs/North-Micro-Vision-Instruct, được chụp lại vào ngày 27 tháng 8 năm 2026 — phần mô tả mô hình thị giác–ngôn ngữ 2.4B ở độ phân giải gốc, giấy phép Apache-2.0 và các điểm chuẩn đọc tài liệu do Cohere báo cáo.

Đọc, so với đọc và vẽ.

Chênh lệch về triết lý kiến trúc đáng giá hơn chênh lệch về benchmark. {{1}}North Micro Vision Instruct là một chuyên gia có phạm vi hẹp{{/1}}: nó đọc, và nó làm đúng một việc đó đủ rẻ để bạn có thể chạy nó trên mọi trang, mọi ảnh chụp màn hình, mọi hóa đơn trong một pipeline mà không phải dõi theo hóa đơn GPU của mình. {{2}}Độ rẻ đó chính là tính năng{{/2}} — trí tuệ xử lý tài liệu ở quy mô lớn là bài toán về chi phí không kém gì bài toán về độ chính xác. {{3}}InternLumina-U2 là một ván cược ngược lại{{/3}}: một mô hình sparse khổng lồ cố gộp việc đọc với việc tạo ảnh, chỉnh sửa ảnh, hiểu video và hiểu 3D vào một giao diện token rời rạc dùng chung, {{4}}dựa trên giả thuyết rằng khả năng hiểu và khả năng sinh sẽ củng cố lẫn nhau{{/4}}. {{5}}Nếu nó hiệu quả, nó sẽ là một lớp công cụ khác hẳn{{/5}} — nhưng {{6}}cụm từ “nếu nó hiệu quả” đang phải gánh vác rất nhiều{{/6}}, và một mô hình diffusion MoE 16B-A1B với tokenizer tùy chỉnh cùng bước tiền xử lý 3D dựng bằng Blender sẽ không bao giờ là bộ đọc luôn bật với chi phí thấp như một chuyên gia 2.4B. {{7}}Chúng thực chất không phải là những thứ có thể thay thế cho nhau.{{/7}} {{8}}Chúng là một công cụ bạn có thể triển khai ngay hôm nay và một hướng nghiên cứu bạn có thể chuẩn bị cho tương lai.{{/8}}

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page with the 'Omni-Visual Understanding, Image Generation and Editing' description and the per-task inference scripts.

Kho lưu trữ GitHub InternLM/InternLumina-U2, được chụp lại vào ngày 2 tháng 9 năm 2026 — trang đích của kho lưu trữ có mô tả "Omni-Visual Understanding, Image Generation and Editing" cùng các tập lệnh suy luận theo từng tác vụ; trong số đó, luồng hiểu hình ảnh là phần nhắm đến hình ảnh tự nhiên và biểu đồ dày đặc.

Điều này có nghĩa là gì nếu bạn đang xây dựng một quy trình xử lý tài liệu

Cả hai mô hình đều không được lưu trữ trên OrcaRouter — North Micro Vision Instruct là mô hình tự lưu trữ (self-host) không có API lưu trữ (hosted API), còn InternLumina-U2 không có trọng số (weights) để bất kỳ ai có thể lưu trữ — vì vậy góc độ định tuyến ở đây không phải là “gọi cả hai qua cùng một key ngay hôm nay.” Đó là mẫu (pattern) bạn sẽ dùng vào ngày một trong hai mô hình đó thay đổi: pipeline xử lý tài liệu gần như luôn ghép một bộ đọc giá rẻ với một bộ suy luận lớn hơn, và giá trị của lớp định tuyến nằm ở việc thể hiện sự ghép cặp ấy như một lời gọi duy nhất, đồng thời giữ cho việc chuyển tiếp với phụ phí 0% luôn minh bạch trên các mô hình lưu trữ bạn thực sự dùng. Khi một checkpoint Apache-2.0 như InternLumina-U2 cuối cùng ra mắt, động thái khôn ngoan không phải là phá bỏ một hệ thống xử lý tài liệu đang chạy tốt — mà là đưa tân binh vào một đường thử nghiệm nằm sau cơ chế chuyển đổi dự phòng tự động (automatic failover), để nó giành được lưu lượng production bằng cách vượt qua thử thách, và ngay khi nó thất bại trên một biểu đồ thực tế, lời gọi sẽ tự động chuyển về mô hình đã chứng minh được năng lực. Một API duy nhất bao trùm 200+ mô hình là cơ chế; failover là lưới an toàn; chuyên gia bạn có thể chạy hôm nay chính là thứ trả hóa đơn trong khi lời hứa 16B vẫn đang được thực hiện.

Bản án

For document and chart reading in the here and now, {{1}}North Micro Vision Instruct{{/1}} is the only one of the two that exists in a usable sense — small, Apache-2.0, downloadable, with strong vendor-reported scores you can actually go check. {{2}}InternLumina-U2{{/2}} is the more interesting long-term artifact, because it is trying to make reading one skill among six in a single unified model, and if that works it changes what "vision model" means. {{3}}Watch its empty Hugging Face repo the way you would watch a launch countdown: the day safetensors files appear, the promise becomes a model, and the comparison becomes a real one.{{/3}} Until then, {{4}}do not let a vendor-reported 86.52 on a chart benchmark outrank a downloadable 0.808 in your decision-making.{{/4}}

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube