Kartu judul untuk North Micro Vision Instruct yang menampilkan 'North Micro Vision Instruct' dengan subjudul 'VLM dokumen Apache-2.0 2.4B milik Cohere' dan sebuah chip yang mencatat bahwa produk tersebut dirilis pada 12 Agustus 2026, di atas tiga ikon garis untuk pemindaian dokumen, pembacaan grafik, dan penentuan kotak pembatas.
Guides & Insights

North Micro Vision Instruct: VLM Dokumen 2.4B Cohere yang Rilis Senyap, Dijelaskan

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

CohereLabs/North-Micro-Vision-Instruct — "North Micro Vision" untuk singkatnya — adalah model visi-bahasa dengan 2,4 miliar parameter yang diluncurkan secara senyap: bobotnya muncul di Hugging Face pada 10 Agustus 2026, pengumuman Cohere menyusul pada 12 Agustus, dan sehari kemudian masih belum ada API yang dihosting, belum ada daftar harga, dan belum ada entri papan peringkat pihak ketiga. North Micro Vision dibuat untuk satu tugas — membaca dokumen pada resolusi asli, seperti cara seseorang menyipitkan mata pada halaman A4 yang dipindai, bukan seperti cara model keterangan melirik gambar mini — dan kartu modelnya luar biasa terus terang tentang apa yang bukan: tanpa pemanggilan alat, tanpa loop penalaran, prompt sistem secara aktif tidak disarankan. Ini adalah tulisan tentang apa yang kita ketahui sejauh ini, jadi setiap angka di bawah ini diberi label: apa yang ditetapkan repositori itu sendiri, apa yang diklaim Cohere tetapi belum ada yang mereproduksi, dan apa yang ditambahkan oleh satu tinjauan pihak ketiga yang diterbitkan sejauh ini.

Apa yang sebenarnya Cohere rilis

Semua yang ada di bagian ini dibaca langsung dari repositori: config.json, README, dan kartu model. Ini adalah sumber utama Cohere, dan untuk sebagian besar hal yang diketahui tentang model ini, ini adalah satu-satunya sumber.

• Ukuran — total parameter 2,4B: encoder visi ~400M ditambah model bahasa "North Micro LLM" 2B, dalam bfloat16, sekitar 4,97 GB bobot

• Lisensi — Apache 2.0, permisif untuk penggunaan komersial, bobot dan tokenizer terbuka

• Vision encoder — dilatih khusus untuk resolusi native, diinisialisasi dari SigLIP 2 SO400M

• Model bahasa — LLM North Micro 2B internal yang mengikuti arsitektur Command A+: tiga lapisan attention sliding-window yang diselingi dengan satu lapisan attention global, attention grouped-query (16 kepala kueri untuk 8 kepala KV), embedding terikat, kosakata 262.144 token

• Proyektor — "DeepStack": embedding patch dari beberapa lapisan vision-encoder disuntikkan ke lapisan bahasa awal, bukan ditambahkan di depan sekaligus, yang merupakan cara teks kecil dan geometri tabel tetap bertahan.

• Resolusi — input beresolusi asli dengan rasio aspek dipertahankan, hingga sekitar 1654 × 2339 piksel, yang merupakan satu halaman A4 pada sekitar 200 DPI

Konteks — 128K konteks teks pada fondasi bahasa; 8K konteks multimodal tervalidasi (detail di bawah)

• Bahasa — 11 didukung: Inggris, Tionghoa, Jerman, Prancis, Spanyol, Italia, Portugis, Hindi, Jepang, Korea, Arab

Akhiran "Instruct" itu penting. Ini adalah checkpoint yang disetel dengan instruksi — model obrolan dan QA visual — dan hingga tulisan ini dibuat, ini adalah satu-satunya checkpoint. Pohon model sudah mencantumkan sebelas kuantisasi komunitas dan tiga fine-tune, tetapi tidak ada varian dasar terpisah yang diterbitkan dengan nama berbeda.

Mengapa arsitektur ini layak mendapat satu paragraf.

Kebanyakan VLM 2-3B menurunkan skala citra Anda ke grid tetap dan kehilangan teks kecil. Taruhan North Micro Vision justru sebaliknya: pertahankan resolusinya, habiskan tokennya. Encoder visi menggunakan 2D RoPE plus posisional embedding 1D yang dipelajari, dan proyektor DeepStack memasukkan patch embedding ke beberapa lapisan bahasa, bukan sekadar prepend tunggal—begitulah cara tabel yang padat atau catatan kaki tetap bertahan. Encoding posisional menggunakan mRoPE interleaved, sehingga jumlah token visual mengikuti resolusi citra, bukan dibatasi oleh preset.

Pilihan itu adalah keseluruhan produk — dan ada harganya. Analisis peluncuran RohitAI memperkirakan halaman A4 asli pada resolusi maksimum menghasilkan sekitar 3.800 posisi visual yang digabung. Baca angka itu di samping peringatan konteks di bawah ini: 3.800 token visual ditambah prompt dapat mengisi sebagian besar jendela multimodal yang tervalidasi sebelum Anda mengajukan pertanyaan.

Kartu benchmark, dibaca dengan jujur

A single-column scoreboard for North Micro Vision Instruct listing six rows: Size 2.4B (2B LM + 400M vision), License Apache 2.0, DocVQA 0.921, ChartQA 0.808, Multimodal context 8K validated, Tool calling none, with a footer noting the benchmarks are vendor-reported and not independently reproduced.

Setiap angka di bagian ini dilaporkan oleh vendor. Tidak ada satu pun yang direproduksi oleh laboratorium independen, dan model tersebut belum muncul di papan peringkat publik mana pun. Di atas kertas, catatannya benar-benar kuat di bagian yang ditunjukkan Cohere:

• DocVQA — 0,921 (penjawaban pertanyaan visual dokumen)

• ChartQA — 0.808 (pembacaan grafik)

• OCRBench — 0.792 (OCR di dunia nyata)

• Grounding RefCOCO — 0.732 rata-rata P@1 (menunjuk objek)

• MMMU — 0.329 (pengetahuan multimodal tingkat perguruan tinggi — titik lemahnya, sesuai ekspektasi pada ukuran ini)

• IFEval — 0,749 (pengikutan instruksi)

Pembingkaian peluncuran Cohere mengklaim bahwa North Micro Vision mengungguli Gemma 4 E2B dan Ministral 3 3B "pada serangkaian tolok ukur pemahaman visual," dengan kekuatan yang terkonsentrasi pada pemahaman dokumen dan QA visual. Itu adalah klaim Cohere tentang model Cohere — perlakukan demikian. Satu hal yang janggal: Perbandingan Cohere terhadap keluarga Liquid menggunakan checkpoint 1.6B, bukan yang 3B, sehingga tidak ada perbandingan valid North-vs-LFM2.5-VL-3B di kartu tersebut meskipun kedua model akan bersaing untuk anggaran dokumen edge yang sama.

Tinjauan pihak ketiga satu-satunya yang dipublikasikan sejauh ini — hasil uji seorang blogger, bukan rangkaian pengujian lab — melengkapi gambaran yang tidak disertakan dalam kartu produk. Laporan tersebut menyebut North Micro Vision mengalahkan Ministral 3 3B Instruct pada lima dari tujuh baris pengujian dokumen, bagan, dan OCR, yang sejalan dengan narasi vendor. Namun, laporan itu juga menyebut Qwen3.5-2B mengalahkan North Micro Vision pada enam dari tujuh baris tersebut dan pada semua baris general-VQA, penalaran, penghitungan, halusinasi, dan pengetahuan teks yang diungkapkan; satu-satunya kemenangan North Micro Vision atas Qwen3.5-2B dalam kumpulan tersebut adalah AI2D. Adapun English OCRBench v2 menghasilkan 0,367, berbanding dengan OCRBench 0,792 yang menjadi angka andalan — pengingat bahwa skor OCR sangat bergantung pada bagian data dan tingkat kesulitan yang digunakan. Satu kali pengujian bukanlah vonis, tetapi ini adalah bukti pertama bahwa pesaing sesungguhnya North Micro Vision pada ukuran ini adalah keluarga Qwen 3.5, bukan model-model yang dipilih Cohere sebagai pembanding.

Satu jendela konteks, dua angka

Kartu tersebut mencantumkan 128K konteks teks dan 8K konteks multimodal yang tervalidasi, dan kesenjangan antara keduanya melakukan kerja nyata. Angka 128K hanya milik backbone bahasa saja; prompt gambar-plus-teks di atas 8K token tidak pernah dilatih atau divalidasi, jadi apa pun di luar batas itu hanyalah ekstrapolasi. Dengan satu halaman A4 padat yang memakan sekitar 3.800 posisi visual, Anda dapat mencapai jendela 8K itu dengan satu dokumen dan pertanyaan singkat. Konsekuensi praktisnya: rencanakan pipeline Anda di sekitar pemotongan halaman menjadi region — tabel, blok tanda tangan, satu faktur — daripada memasukkan seluruh halaman dan mengharapkan percakapan bolak-balik yang panjang atas halaman-halaman tersebut.

Apa yang kartu model katakan agar tidak Anda lakukan

North Micro Vision adalah lapisan persepsi, bukan agen, dan Cohere dengan terang-terangan yang menyegarkan menjelaskannya. Kartu model tersebut mengatakan bahwa model ini bukan model penalaran, memiliki kemampuan matematika dan kode yang terbatas, tidak mendukung pemanggilan alat atau alur kerja agen, dan tidak boleh menggantikan asisten umum yang lebih besar. Ini melangkah lebih jauh daripada kebanyakan kartu model: kartu ini menyarankan untuk tidak menggunakan prompt sistem, karena model ini tidak dilatih dengan prompt tersebut. Tidak ada juga skor kepercayaan yang terkalibrasi. Desain yang tersirat dari ini adalah pembagian: North Micro Vision membaca dan mengekstrak, skema memiliki struktur, aturan memiliki invarian, model yang lebih kuat menangani panggilan yang ambigu, dan manusia menyetujui segala sesuatu yang berdampak penting. Perlakukan teks di halaman sebagai data, jangan pernah sebagai kebijakan — instruksi pindaian yang terkubur dalam dokumen adalah jenis injeksi prompt visual yang justru ingin ditangkal oleh pembagian ini.

A four-step document pipeline diagram reading Scan, North Micro Vision — perception, Schema + rules, and Stronger model — decisions, connected by arrows, with a footer reading 'Keep perception and decisions separate.'

Cara menjalankannya hari ini

The Hugging Face model card for CohereLabs/North-Micro-Vision-Instruct, showing the Image-Text-to-Text pipeline badge, Apache 2.0 license, 11 languages, the model tree, and the opening description of a 2.4B-parameter open-weight vision-language model with native-resolution image support, noting it is not deployed by any inference provider.

Panduan memulai cepat ini jujur tentang kesulitannya sendiri: kartu model memerlukan Transformers 5.16.0, yang bukan merupakan rilis stabil PyPI terbaru pada hari peluncurannya, sehingga pengguna awal harus menginstal dari sumber. Dukungan vLLM publik tercantum sebagai "segera hadir"; Cohere melakukan evaluasi dengan build vLLM internal. Selain itu, dukungan ekosistem pada hari pertama sudah baik: resep NVIDIA NeMo AutoModel untuk penyebaran di perangkat edge dan GPU, resep QLoRA dan fine-tuning penuh Axolotl, serta kuantisasi MLX komunitas untuk Apple Silicon — build 4-bitnya sekitar 2,17 GB. Ada satu perangkap penyebaran yang perlu disebut: atur max_pixels secara eksplisit, karena sequence_len tidak membatasi token gambar, dan tanpa itu Anda bisa secara tidak sengaja melampaui jendela multimodal yang telah divalidasi.

North Micro Vision tidak ada di OrcaRouter, dan menurut kartunya sendiri, ia tidak ada di penyedia inferensi mana pun — ini adalah kisah self-host, titik. Justru itulah mengapa lapisan routing menjadi penting dalam kalimat berikutnya: saat penyedia mana pun menyediakan endpoint untuknya, router adalah yang memungkinkan Anda menempatkan model Apache-2.0 yang baru berusia beberapa hari di samping model yang sudah Anda panggil di produksi — satu API, tanpa kontrak baru, harga daftar penyedia diteruskan dengan markup 0%, dan failover otomatis sehingga model yang belum terbukti dapat menangani lalu lintas nyata sementara model yang sudah terbukti menangkap panggilan yang gagal. Hingga endpoint itu ada, perbandingan yang benar-benar dapat Anda jalankan hari ini adalah antara checkpoint ini dan model dokumen terhosting yang sudah Anda bayar, berdampingan di halaman Anda sendiri.

Siapa yang harus bergerak, dan siapa yang harus menunggu.

Bergeraklah jika Anda memiliki pekerjaan ekstraksi dokumen yang lingkupnya terbatas — faktur, laporan bank, kontrak, formulir terstruktur — dan persyaratan residensi data atau audit yang membuat API yang dihosting menjadi tidak menarik. Apache 2.0, adaptasi domain QLoRA yang murah, dan encoder resolusi native adalah kombinasi yang benar-benar tidak biasa untuk beban kerja itu, dan keterbatasan kartu itu sendiri cukup jelas sehingga Anda tidak akan terkejut. Tunggulah jika Anda membutuhkan endpoint yang dihosting, harga per-token, atau perilaku agentik — semuanya belum ada. Dan tunggulah sebelum menganggap tolok ukur di atas sebagai final: setiap angka utama adalah milik Cohere, satu-satunya pengujian eksternal menggambarkan gambaran yang lebih diperdebatkan di puncak kelas model kecil, dan model ini baru dirilis kurang dari seminggu. Hal yang perlu diperhatikan adalah kisah penyajiannya — saat Transformers bawaan dan rilis vLLM publik sama-sama mendukungnya, North Micro Vision tidak lagi menjadi repo yang harus Anda perjuangkan dan menjadi model yang cukup Anda arahkan ke dokumen-dokumen Anda.