Kartu judul yang dihasilkan dengan gaya khas OrcaRouter, bertuliskan “PixelUMM vs North Micro Vision Instruct”, dengan empat kotak statistik: “2.4B” (total parameter North Micro Vision Instruct), “~180k” (unduhan Hugging Face-nya hingga awal Oktober), “0.921 / 90.42” (DocVQA-nya sebagai pecahan akurasi terhadap persentase PixelUMM) dan “Apache-2.0” (lisensi kode dan bobotnya, dibandingkan checkpoint nonkomersial PixelUMM). Baris footer berbunyi “Angka yang dilaporkan vendor; tidak ada pengujian ulang independen untuk kedua model.”. Logo OrcaRouter dikompositkan ke dalam strip berpadding di kanan bawah.
Guides & Insights

PixelUMM vs North Micro Vision Instruct: Model Riset Nonkomersial Berhadapan dengan Reader 2,4B yang Dapat Anda Rilis

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Letakkan North Micro Vision Instruct dan PixelUMMberdampingan dan perbedaan ukurannya hampir menjadi pengalih perhatian: 2,4 miliar parameter untuk pembaca resolusi asli Cohere versus 15,2 miliar untuk model terpadu NVIDIA. Aspek yang menarik adalah encoder. North Micro Vision Instruct dibangun dengan cara konvensional — encoder visi 400M yang diinisialisasi dari SigLIP 2 SO400M, memberi masukan ke model bahasa 2B, dibungkus dalam kosakata 262.144 token dan dirilis di bawah Apache-2.0. PixelUMM dibangun atas argumen bahwa susunan yang tepat inilah yang menjadi hambatan, dan menghapus encoder: tambalan piksel 16×16 mentah masuk ke tulang punggung Qwen3-8B melalui proyeksi linear satu lapis, dan bobot yang sama menghasilkan video sekaligus menjawab pertanyaan tentangnya. Yang satu adalah perangkat pembaca khusus yang dapat Anda unduh dan terapkan hari ini. Yang lainnya adalah tesis penelitian dengan tautan unduhan dan lisensi yang mencegahnya digunakan dalam produk.

Angka kedua model di bawah ini berasal dari lab mereka sendiri. Tidak ada satu pun yang telah direproduksi secara independen, dan keduanya menerbitkan rangkaian benchmark yang berbeda, sehingga tumpang tindihnya lebih sempit daripada yang terlihat.

Argumen untuk arsitektur yang membosankan

North Micro Vision Instruct diterbitkan di Hugging Face pada 10 Agustus 2026, telah diberi waktu delapan minggu untuk mengumpulkan pengguna, dan pada awal Oktober telah menunjukkan sekitar 180.000 unduhan dan 150 suka — perhatian sekitar sepuluh kali lebih besar daripada repositori PixelUMM yang baru berumur beberapa hari. Nilai jualnya spesifik dan tidak glamor: sebagian besar model visi memperkecil gambar ke grid tetap dan kehilangan detail halus yang menjadi tumpuan dokumen, jadi model ini memproses gambar pada resolusi asli, mempertahankan rasio aspek dan teks kecil.

• Parameter — total 2,4B: model bahasa 2B plus encoder visi 400M yang dilatih khusus dari SigLIP 2 SO400M.

• Konteks — tulang punggung bahasa 128K token, tetapi rentang operasi multimodal yang tervalidasi sekitar 8K token. Kartu tersebut secara eksplisit menyatakan bahwa konteks multimodal yang lebih panjang mengandalkan ekstrapolasi dan belum diuji benchmark.

• Masukan dan keluaran — masukan berupa teks dan gambar yang berselang-seling, keluaran berupa teks. Multibahasa dalam lebih dari sebelas bahasa. Tidak ada pembuatan dalam bentuk apa pun.

• Skor yang dilaporkan — DocVQA 0.921, ChartQA 0.808, OCRBench 0.792, semuanya dilaporkan oleh Cohere dan tidak direproduksi. MMMU 0.329, yang tidak disembunyikan oleh kartu ini: ini adalah spesialis membaca, bukan generalis penalaran.

• Penerapan — Transformers 5.16.0 dan sebuah akselerator, satu GPU modern pada 2,4B dalam bfloat16, Flash Attention 2 bersifat opsional, bukan wajib.

Tidak ada yang baru dalam desain itu. Itu juga alasan desain tersebut dapat diunduh, disesuaikan secara halus, dan dihadapkan pada dokumen nyata minggu ini.

A headless-browser capture of the Hugging Face model card for the North Micro Vision Instruct repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

Argumen yang menentangnya, yang diajukan oleh pihak lain.

Preprint PixelUMM dibuka dengan menyebutkan biaya arsitektur tersebut. Vision transformer yang dibekukan dan telah dilatih sebelumnya dengan web menyediakan fitur semantik untuk pemahaman; VAE terpisah menyediakan laten yang berorientasi rekonstruksi untuk generasi; membawa keduanya secara kasar menggandakan konteks visual per gambar pengondisian dan memaksa pipeline pra-pelatihan visi-bahasa untuk dibangun ulang di sekitar aliran kedua. North Micro Vision Instruct menghindari penggandaan hanya dengan menolak pekerjaan kedua sepenuhnya — ia tidak menghasilkan, jadi ia membutuhkan satu antarmuka, bukan dua.

PixelUMM membawa argumennya sampai ke kesimpulan akhir. Tanpa encoder, tanpa VAE, tanpa tokenizer: patch piksel 16×16 untuk gambar, tubelet spatiotemporal 4 bingkai untuk video, keduanya mencapai Transformer decoder-only melalui proyeksi linear satu lapis, dengan pemahaman melalui teks autoregresif dan generasi melalui flow matching ruang piksel. Delapan bagian empirisnya adalah kajian atas pilihan desain, bukan kemenangan papan peringkat — ukuran patch, artefak patch, dinamika pelatihan ruang piksel versus ruang VAE, penskalaan komputasi — yang merupakan makalah yang menanyakan apakah paradigma ini bertahan, bukan makalah yang mengklaim paradigma ini sudah menang.

• Jalur visual — North Micro Vision Instruct: encoder visi terlatih 400M pada resolusi asli. PixelUMM: tanpa encoder; patch mentah melalui proyeksi linear.

• Apa yang dapat dilakukannya — North Micro Vision Instruct: membaca gambar dan dokumen, menjawab dalam bentuk teks, menentukan posisi objek dan membuat takarir. PixelUMM: membaca gambar dan video, serta menghasilkan gambar dan video 4 detik dari teks.

• Skala — 2,4B dense dibandingkan sekitar 15,2B total pada backbone Qwen3-8B, ditulis sebagai "8B MoT" dalam tabel-tabel makalah itu sendiri.

• Lisensi — Apache-2.0 pada kode dan bobot versus Apache-2.0 pada kode dengan NVIDIA One-Way Noncommercial License pada checkpoint.

A generated scoreboard card titled “PixelUMM vs North Micro Vision Instruct — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: parameters, visual path, inputs and outputs, DocVQA, MMMU and licence. North Micro Vision Instruct's column shows 2.4B total, a 400M SigLIP 2 SO400M vision encoder at native resolution, interleaved text and images in with text out, DocVQA 0.921, MMMU 0.329 and Apache-2.0; PixelUMM's column shows about 15.2B total, no encoder with raw patches through a linear projection, image and video reading plus image and video generation, DocVQA 90.42, MMMU 41.67 and a noncommercial checkpoint licence. A footer notes that the figures are vendor-reported with no independent rerun.

Membaca kedua papan skor itu dengan jujur

Kedua model tersebut menerbitkan tolok ukur yang berbeda, dan pada bagian yang tumpang tindih, skalanya pun berbeda.

• DocVQA — North Micro Vision Instruct 0.921 sebagai pecahan akurasi. PixelUMM 90.42 sebagai persentase. Nama tolok ukur yang sama, split dan penyiapan prompt yang berbeda, dan hanya satu dari keduanya yang mengklaim penanganan resolusi native sebagai alasannya.

• ChartQA — North Micro Vision Instruct 0.808. PixelUMM 82.96. Sekali lagi kira-kira rentang yang sama begitu Anda berhenti membandingkan string mentahnya.

• OCRBench — North Micro Vision Instruct 0.792. PixelUMM 78.00.

• MMMU — North Micro Vision Instruct 0.329, PixelUMM 41.67. Keduanya rendah menurut standar model penglihatan-bahasa besar, dan kedua laboratorium melaporkannya tanpa hiasan.

• hanya PixelUMM — MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, GenEval 0.83 dengan penulis ulang prompt, kualitas VBench Bagian 1 84.10.

• North Micro Vision Instruct-only — tugas grounding, captioning, dan multi-gambar; tidak adanya pemanggilan alat yang terdokumentasi dan secara eksplisit tanpa perilaku agentik.

Hal yang mencolok dari tumpang tindih ini adalah betapa dekatnya spesialis 2,4B dengan generalis 15,2B dalam membaca dokumen dan grafik. Itu bukan bukti bahwa pendekatan tanpa encoder gagal — melainkan bukti bahwa membaca dokumen adalah tugas yang sangat cocok untuk encoder resolusi asli yang ringkas, dan arsitektur PixelUMM ditujukan untuk argumen yang berbeda. Makalah PixelUMM sendiri mengakui hal itu dalam satu kalimat yang layak dikutip: karena data pelatihan berbeda antar model, hasilnya "tidak dapat menetapkan arsitektur mana yang lebih unggul".

Ke mana keputusan itu sebenarnya bermuara

Jika Anda memiliki dokumen, bagan, formulir, atau tangkapan layar dan Anda membutuhkan jawaban bulan ini, North Micro Vision Instruct adalah pilihan praktis dan tidak ada yang bisa menandinginya: Apache-2.0, 2.4B, jalur pemuatan Transformers standar, tanpa lingkungan guardrail, tanpa indeks checkpoint terdistribusi, tanpa tumpukan Python kedua. Lakukan fine-tune pada distribusi dokumen Anda sendiri dan Anda akan memiliki spesialis. Kendalanya adalah cakupan — arahkan pada tugas penalaran dan angka MMMU akan menemukan Anda.

Yang ditawarkan PixelUMM adalah keluasan dan sebuah pertanyaan penelitian. Ia membaca dan menghasilkan, gambar maupun video, dari satu set bobot, dan ini adalah bacaan yang jauh lebih menarik. Namun checkpoint-nya berada di bawah lisensi nonkomersial, bobotnya berupa 128 pecahan checkpoint terdistribusi di balik indeks metadata tersembunyi dengan total sekitar 30 GB, ia menginginkan toolkit CUDA 13 dengan FlashAttention yang dikompilasi dari sumber, dan jalur teks-ke-video-nya menjalankan guardrail Cosmos yang memerlukan repositori bergerbang dan lingkungan terpisah. Itu bangku laboratorium, bukan deployment.

Aspek perutean akan datang nanti, jika memang benar-benar datang. Tidak satu pun dari kedua model itu tersedia melalui API yang dihosting mana pun saat ini — OrcaRouter tidak merutekan satu pun — dan keduanya tidak akan tersedia sampai lisensi mereka mengizinkannya. Ketika model seperti North Micro Vision Instruct benar-benar muncul di balik endpoint bersama, alasan untuk lebih memilihnya daripada integrasi langsung adalah alasan yang biasa: satu kunci untuk 200+ model, harga daftar dari penyedia diteruskan pada markup 0%, failover yang menurunkan peringkat model yang kinerjanya di bawah kartu modelnya, dan tidak ada kontrak kedua yang perlu dinegosiasikan saat Anda ingin melakukan uji A/B pada penggantinya. Itu adalah deskripsi alur kerja, bukan klaim tentang ketersediaan.

Satu-satunya ujian yang akan memisahkan mereka

Jalankan keduanya pada kumpulan dokumen yang sama dengan resolusi yang sama dan nilai kasus teks kecil, lalu balik satu variabel: keluarkan encoder visi dari perbandingan dengan memberi PixelUMM input beresolusi aslinya. Jika model tanpa encoder tetap bertahan pada teks padat dengan sebagian kecil dari biaya parameter, itu adalah bukti terkuat yang mungkin untuk tesis tersebut — dan itu adalah uji yang dapat dijalankan siapa pun yang punya kartu cadangan, karena kedua checkpoint dapat diunduh. Sampai seseorang melakukannya, ringkasan pragmatisnya tetap berlaku: pembaca Apache-2.0 kecil adalah yang Anda terapkan, dan generalis nonkomersial besar adalah yang Anda pelajari.