
North Micro Vision Instruct: Giải thích về Mô hình Ngôn ngữ Thị giác Tài liệu 2.4B thầm lặng của Cohere
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 144 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
CohereLabs/North-Micro-Vision-Instruct — gọi tắt là "North Micro Vision" — là một mô hình ngôn ngữ-thị giác 2,4 tỷ tham số được phát hành một cách lặng lẽ: trọng số xuất hiện trên Hugging Face vào ngày 10 tháng 8 năm 2026, thông báo của Cohere theo sau vào ngày 12 tháng 8, và một ngày sau đó vẫn chưa có API lưu trữ, chưa có bảng giá, và chưa có mục nào trên bảng xếp hạng của bên thứ ba. North Micro Vision được xây dựng cho một công việc duy nhất — đọc tài liệu ở độ phân giải gốc, giống như cách một người nheo mắt nhìn trang A4 được quét thay vì cách một mô hình chú thích hình ảnh liếc qua hình thu nhỏ — và thẻ mô hình của nó thẳng thắn một cách bất thường về những gì nó không có: không gọi công cụ, không vòng lặp suy luận, lời nhắc hệ thống không được khuyến khích sử dụng. Đây là bài viết tổng hợp những gì chúng ta biết cho đến nay, vì vậy mọi con số bên dưới đều được ghi nhãn: điều mà chính kho lưu trữ xác lập, điều mà Cohere tuyên bố nhưng chưa ai tái lập, và điều mà bài đánh giá duy nhất của bên thứ ba được công bố cho đến nay bổ sung thêm.
Điều mà Cohere thực sự đã phát hành
{{1}}Mọi thứ trong phần này được đọc trực tiếp từ kho lưu trữ:{{/1}} {{2}}config.json{{/2}}{{3}}, tệp README và thẻ mô hình.{{/3}} {{4}}Đây là các nguồn chính của Cohere,{{/4}} {{5}}và đối với hầu hết những gì được biết về mô hình{{/5}} {{6}}chúng là những nguồn duy nhất.{{/6}}
• Kích thước — Tổng cộng 2,4B tham số: bộ mã hóa thị giác ~400M cộng với mô hình ngôn ngữ "North Micro LLM" 2B, ở định dạng bfloat16, khoảng 4,97 GB trọng số
• Giấy phép — Apache 2.0, cho phép sử dụng thương mại, trọng số và tokenizer đều mở
• Vision encoder — được huấn luyện tùy chỉnh cho độ phân giải gốc, khởi tạo từ SigLIP 2 SO400M
Mô hình ngôn ngữ — LLM North Micro 2B nội bộ theo kiến trúc Command A+: ba lớp chú ý cửa sổ trượt xen kẽ với một lớp chú ý toàn cục, chú ý truy vấn nhóm (16 đầu truy vấn trên 8 đầu KV), embedding dùng chung, từ vựng 262,144 token.
• Projector — "DeepStack": các patch embedding từ nhiều lớp vision-encoder được tiêm vào các lớp ngôn ngữ đầu thay vì được chèn trước một lần, nhờ đó văn bản nhỏ và hình dạng bảng được bảo toàn.
• Độ phân giải — đầu vào ở độ phân giải gốc với tỷ lệ khung hình được giữ nguyên, lên tới khoảng 1654 × 2339 pixel, tương đương một trang A4 ở khoảng 200 DPI
• Ngữ cảnh — 128K ngữ cảnh văn bản trên nền tảng ngôn ngữ; 8K ngữ cảnh đa phương thức đã được xác thực (chi tiết bên dưới)
• Ngôn ngữ — 11 ngôn ngữ được hỗ trợ: Tiếng Anh, Tiếng Trung, Tiếng Đức, Tiếng Pháp, Tiếng Tây Ban Nha, Tiếng Ý, Tiếng Bồ Đào Nha, Tiếng Hindi, Tiếng Nhật, Tiếng Hàn, Tiếng Ả Rập
Hậu tố "Instruct" rất quan trọng. Đây là checkpoint được tinh chỉnh theo hướng dẫn — một mô hình trò chuyện và hỏi đáp trực quan — và tại thời điểm viết bài, đây là checkpoint duy nhất. Cây mô hình đã liệt kê mười một bản lượng tử hóa từ cộng đồng và ba bản tinh chỉnh, nhưng không có biến thể nền tảng riêng nào được công bố dưới một tên khác.
Tại sao kiến trúc đáng cả một đoạn văn
Hầu hết các VLM 2-3B thu nhỏ hình ảnh của bạn về một lưới cố định và làm mất đi phần chữ nhỏ. Cược của North Micro Vision thì ngược lại: giữ nguyên độ phân giải, chấp nhận tốn token. Bộ mã hóa thị giác sử dụng RoPE 2D kết hợp với embedding vị trí 1D được học, và bộ chiếu DeepStack đưa embedding patch vào nhiều tầng ngôn ngữ thay vì chỉ chèn vào một vị trí đầu — chính nhờ vậy mà một bảng dày đặc hay chú thích cuối trang vẫn sống sót. Mã hóa vị trí là mRoPE xen kẽ, nên số lượng token thị giác tỷ lệ với độ phân giải của ảnh thay vì bị giới hạn bởi một giá trị định sẵn.
Sự lựa chọn đó chính là toàn bộ sản phẩm — và nó có một cái giá. Phân tích ra mắt của RohitAI ước tính một trang A4 nguyên bản ở độ phân giải tối đa tương đương khoảng 3.800 vị trí thị giác đã được hợp nhất. Hãy đọc con số đó cùng với lưu ý về ngữ cảnh dưới đây: 3.800 token thị giác cộng với một lời nhắc có thể lấp đầy một phần lớn cửa sổ đa phương thức đã được kiểm chứng trước khi bạn kịp đặt câu hỏi.
Thẻ benchmark, đọc một cách trung thực

Mọi số liệu trong phần này đều do nhà cung cấp báo cáo. Chưa có số liệu nào được phòng thí nghiệm độc lập tái tạo lại, và mô hình vẫn chưa xuất hiện trên bất kỳ bảng xếp hạng công khai nào. Trên giấy tờ, thành tích thực sự rất ấn tượng ở những điểm mà Cohere chỉ ra:
• DocVQA — 0.921 (trả lời câu hỏi trực quan trên tài liệu)
• ChartQA — 0.808 (đọc biểu đồ)
• OCRBench — 0.792 (OCR trong thực tế)
• RefCOCO grounding — 0,732 trung bình P@1 (chỉ vào vật thể)
• MMMU — 0.329 (kiến thức đa phương thức cấp đại học — điểm yếu, như dự kiến ở kích thước này)
• IFEval — 0.749 (tuân theo hướng dẫn)
Cách trình bày ra mắt của Cohere khẳng định North Micro Vision vượt trội hơn Gemma 4 E2B và Ministral 3 3B "trên một loạt các điểm chuẩn hiểu hình ảnh," với thế mạnh tập trung vào hiểu tài liệu và QA trực quan. Đó là tuyên bố của Cohere về mô hình của Cohere — hãy coi nó đúng như vậy. Một điểm bất thường: việc so sánh của Cohere với dòng sản phẩm của Liquid sử dụng checkpoint 1.6B, không phải bản 3B, vì vậy không có so sánh hợp lệ nào giữa North và LFM2.5-VL-3B trong thẻ thông tin mặc dù hai mô hình sẽ cạnh tranh cùng một ngân sách tài liệu biên.
Bài đánh giá từ bên thứ ba duy nhất được công bố cho đến nay — bài chạy của một blogger đơn lẻ, không phải một bộ thử nghiệm phòng lab — bổ sung bức tranh mà thẻ sản phẩm bỏ sót. Báo cáo cho thấy North Micro Vision đánh bại Ministral 3 3B Instruct trên năm trong bảy hạng mục tài liệu, biểu đồ và OCR, khớp với cách nhà cung cấp định khung câu chuyện. Nhưng báo cáo cũng cho thấy Qwen3.5-2B đánh bại North Micro Vision trên sáu trong bảy hạng mục đó và trên mọi hạng mục general-VQA, suy luận, đếm, ảo giác và tri thức văn bản được công bố; chiến thắng duy nhất của North Micro Vision trước Qwen3.5-2B trong tập này là AI2D. Và English OCRBench v2 đạt 0.367, so với con số OCRBench 0.792 trong tiêu đề — nhắc nhở rằng điểm OCR phụ thuộc rất nhiều vào split và mức độ khó bạn chạy. Một lần chạy không phải là phán quyết cuối cùng, nhưng đó là bằng chứng đầu tiên rằng đối thủ thực sự của North Micro Vision ở kích thước này là dòng Qwen 3.5, chứ không phải các mô hình mà Cohere chọn để so chuẩn.
Một cửa sổ ngữ cảnh, hai con số
Thẻ này liệt kê 128K ngữ cảnh văn bản và 8K ngữ cảnh đa phương thức đã được xác thực, và khoảng cách giữa hai con số này đang thực sự tạo ra khác biệt. Con số 128K chỉ thuộc về phần lõi ngôn ngữ; các prompt kết hợp hình ảnh-văn bản vượt quá 8K token chưa bao giờ được huấn luyện hoặc xác thực, vì vậy bất cứ thứ gì vượt qua giới hạn đó chỉ là phép ngoại suy. Với một trang A4 dày đặc chiếm khoảng 3.800 vị trí thị giác, bạn có thể chạm tới cửa sổ 8K đó bằng một tài liệu và một câu hỏi ngắn. Hệ quả thực tế: hãy thiết kế pipeline của bạn theo hướng cắt các trang thành từng vùng — bảng dữ liệu, khối chữ ký, một hóa đơn đơn lẻ — thay vì đưa toàn bộ trang vào và mong đợi một chuỗi trao đổi dài về chúng.
Những điều mà thẻ mô hình bảo bạn không nên làm
North Micro Vision là một lớp nhận thức, không phải một agent, và Cohere nói rõ điều đó một cách đáng khen. Thẻ mô tả cho biết mô hình này không phải là mô hình suy luận, có khả năng toán học và lập trình hạn chế, không hỗ trợ gọi công cụ hay quy trình tác tử, và không nên thay thế một trợ lý tổng quát lớn hơn. Nó đi xa hơn hầu hết các thẻ mô tả khác: khuyến nghị không sử dụng lời nhắc hệ thống, vì mô hình không được huấn luyện với chúng. Cũng không có điểm tin cậy đã hiệu chuẩn. Thiết kế mà điều này gợi ý là một sự phân tách: North Micro Vision đọc và trích xuất, một lược đồ quản lý cấu trúc, các quy tắc quản lý các bất biến, một mô hình mạnh hơn xử lý các yêu cầu mơ hồ, và con người phê duyệt mọi thứ có hệ quả. Hãy coi văn bản trên trang là dữ liệu, không bao giờ là chính sách — một chỉ dẫn được quét nằm trong tài liệu chính là một dạng tiêm lời nhắc trực quan mà sự phân tách này bảo vệ.

Cách chạy nó hôm nay

Hướng dẫn khởi động nhanh trung thực về những trở ngại của chính nó: thẻ mô hình yêu cầu Transformers 5.16.0, phiên bản này không phải là bản phát hành ổn định mới nhất trên PyPI tại thời điểm ra mắt, vì vậy những người dùng đầu tiên phải cài đặt từ mã nguồn. Hỗ trợ vLLM công khai được liệt kê là "sắp ra mắt"; Cohere đã đánh giá bằng bản dựng vLLM nội bộ. Hỗ trợ hệ sinh thái ngay từ ngày đầu nhìn chung tốt: công thức NVIDIA NeMo AutoModel cho triển khai ở biên (edge) và GPU, công thức Axolotl QLoRA và tinh chỉnh toàn phần, cùng các bản lượng tử hóa MLX từ cộng đồng cho Apple Silicon — bản 4-bit có dung lượng khoảng 2,17 GB. Một cạm bẫy triển khai đáng nêu tên: hãy đặt max_pixels một cách tường minh, vì sequence_len không giới hạn số token hình ảnh, và nếu không đặt, bạn có thể vượt quá cửa sổ đa phương thức đã được xác thực mà không hề chủ ý.
North Micro Vision không có trên OrcaRouter, và theo model card của chính nó, mô hình này cũng không có trên bất kỳ nhà cung cấp suy luận nào — đây là câu chuyện tự lưu trữ, chấm hết. Đó chính là lý do tại sao lớp định tuyến lại quan trọng trong câu tiếp theo: ngay khi bất kỳ nhà cung cấp nào dựng lên một endpoint cho nó, một bộ định tuyến sẽ cho phép bạn đặt một mô hình Apache-2.0 mới ra mắt vài ngày bên cạnh những mô hình bạn vốn đã gọi trong sản xuất — một API duy nhất, không hợp đồng mới, giá niêm yết của nhà cung cấp được truyền thẳng với mức phụ phí 0%, cùng khả năng tự động chuyển đổi dự phòng (failover) để một mô hình chưa được kiểm chứng có thể nhận lưu lượng thực tế trong khi một mô hình đã được kiểm chứng sẽ tiếp nhận những lời gọi mà nó làm hỏng. Cho đến khi endpoint đó tồn tại, phép so sánh bạn thực sự có thể chạy hôm nay là phép so sánh giữa checkpoint này và các mô hình tài liệu được lưu trữ mà bạn đã trả phí, đặt cạnh nhau trên chính các trang của bạn.
Ai nên di chuyển, và ai nên chờ đợi
Hãy chuyển sang nếu bạn có một công việc trích xuất tài liệu có phạm vi rõ ràng — hóa đơn, sao kê ngân hàng, hợp đồng, biểu mẫu có cấu trúc — và có các yêu cầu về cư trú dữ liệu hoặc kiểm toán khiến cho một API được lưu trữ trở nên kém hấp dẫn. Apache 2.0, khả năng thích ứng miền QLoRA với chi phí thấp và bộ mã hóa độ phân giải gốc là một sự kết hợp thực sự hiếm có cho khối lượng công việc đó, và những hạn chế do chính model card nêu ra đủ rõ ràng để bạn sẽ không bị bất ngờ. Hãy chờ nếu bạn cần một endpoint được lưu trữ, giá theo token hoặc hành vi tác tử — hiện chưa có thứ nào trong số đó. Và hãy chờ trước khi coi bất kỳ điểm chuẩn nào ở trên là đã ngã ngũ: mọi con số tiêu đề đều là của Cohere, một lần đánh giá bên ngoài duy nhất vẽ ra một bức tranh gây tranh cãi hơn ở vị trí dẫn đầu của phân khúc mô hình nhỏ, và model mới ra mắt chưa đầy một tuần. Điều cần theo dõi là câu chuyện về khả năng phục vụ — ngày mà Transformers tiêu chuẩn và một bản phát hành vLLM công khai đều hỗ trợ model này, North Micro Vision sẽ không còn là một kho mã bạn phải vật lộn mà trở thành một model bạn có thể chỉ đơn giản trỏ vào tài liệu của mình.
