
PixelUMM vs North Micro Vision Instruct: Model Riset Nonkomersial Berhadapan dengan Reader 2,4B yang Dapat Anda Rilis
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 223 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Letakkan North Micro Vision Instruct dan PixelUMMberdampingan dan perbedaan ukurannya hampir menjadi pengalih perhatian: 2,4 miliar parameter untuk pembaca resolusi asli Cohere versus 15,2 miliar untuk model terpadu NVIDIA. Aspek yang menarik adalah encoder. North Micro Vision Instruct dibangun dengan cara konvensional — encoder visi 400M yang diinisialisasi dari SigLIP 2 SO400M, memberi masukan ke model bahasa 2B, dibungkus dalam kosakata 262.144 token dan dirilis di bawah Apache-2.0. PixelUMM dibangun atas argumen bahwa susunan yang tepat inilah yang menjadi hambatan, dan menghapus encoder: tambalan piksel 16×16 mentah masuk ke tulang punggung Qwen3-8B melalui proyeksi linear satu lapis, dan bobot yang sama menghasilkan video sekaligus menjawab pertanyaan tentangnya. Yang satu adalah perangkat pembaca khusus yang dapat Anda unduh dan terapkan hari ini. Yang lainnya adalah tesis penelitian dengan tautan unduhan dan lisensi yang mencegahnya digunakan dalam produk.
Angka kedua model di bawah ini berasal dari lab mereka sendiri. Tidak ada satu pun yang telah direproduksi secara independen, dan keduanya menerbitkan rangkaian benchmark yang berbeda, sehingga tumpang tindihnya lebih sempit daripada yang terlihat.
Argumen untuk arsitektur yang membosankan
North Micro Vision Instruct diterbitkan di Hugging Face pada 10 Agustus 2026, telah diberi waktu delapan minggu untuk mengumpulkan pengguna, dan pada awal Oktober telah menunjukkan sekitar 180.000 unduhan dan 150 suka — perhatian sekitar sepuluh kali lebih besar daripada repositori PixelUMM yang baru berumur beberapa hari. Nilai jualnya spesifik dan tidak glamor: sebagian besar model visi memperkecil gambar ke grid tetap dan kehilangan detail halus yang menjadi tumpuan dokumen, jadi model ini memproses gambar pada resolusi asli, mempertahankan rasio aspek dan teks kecil.
• Parameter — total 2,4B: model bahasa 2B plus encoder visi 400M yang dilatih khusus dari SigLIP 2 SO400M.
• Konteks — tulang punggung bahasa 128K token, tetapi rentang operasi multimodal yang tervalidasi sekitar 8K token. Kartu tersebut secara eksplisit menyatakan bahwa konteks multimodal yang lebih panjang mengandalkan ekstrapolasi dan belum diuji benchmark.
• Masukan dan keluaran — masukan berupa teks dan gambar yang berselang-seling, keluaran berupa teks. Multibahasa dalam lebih dari sebelas bahasa. Tidak ada pembuatan dalam bentuk apa pun.
• Skor yang dilaporkan — DocVQA 0.921, ChartQA 0.808, OCRBench 0.792, semuanya dilaporkan oleh Cohere dan tidak direproduksi. MMMU 0.329, yang tidak disembunyikan oleh kartu ini: ini adalah spesialis membaca, bukan generalis penalaran.
• Penerapan — Transformers 5.16.0 dan sebuah akselerator, satu GPU modern pada 2,4B dalam bfloat16, Flash Attention 2 bersifat opsional, bukan wajib.
Tidak ada yang baru dalam desain itu. Itu juga alasan desain tersebut dapat diunduh, disesuaikan secara halus, dan dihadapkan pada dokumen nyata minggu ini.

Argumen yang menentangnya, yang diajukan oleh pihak lain.
Preprint PixelUMM dibuka dengan menyebutkan biaya arsitektur tersebut. Vision transformer yang dibekukan dan telah dilatih sebelumnya dengan web menyediakan fitur semantik untuk pemahaman; VAE terpisah menyediakan laten yang berorientasi rekonstruksi untuk generasi; membawa keduanya secara kasar menggandakan konteks visual per gambar pengondisian dan memaksa pipeline pra-pelatihan visi-bahasa untuk dibangun ulang di sekitar aliran kedua. North Micro Vision Instruct menghindari penggandaan hanya dengan menolak pekerjaan kedua sepenuhnya — ia tidak menghasilkan, jadi ia membutuhkan satu antarmuka, bukan dua.
PixelUMM membawa argumennya sampai ke kesimpulan akhir. Tanpa encoder, tanpa VAE, tanpa tokenizer: patch piksel 16×16 untuk gambar, tubelet spatiotemporal 4 bingkai untuk video, keduanya mencapai Transformer decoder-only melalui proyeksi linear satu lapis, dengan pemahaman melalui teks autoregresif dan generasi melalui flow matching ruang piksel. Delapan bagian empirisnya adalah kajian atas pilihan desain, bukan kemenangan papan peringkat — ukuran patch, artefak patch, dinamika pelatihan ruang piksel versus ruang VAE, penskalaan komputasi — yang merupakan makalah yang menanyakan apakah paradigma ini bertahan, bukan makalah yang mengklaim paradigma ini sudah menang.
• Jalur visual — North Micro Vision Instruct: encoder visi terlatih 400M pada resolusi asli. PixelUMM: tanpa encoder; patch mentah melalui proyeksi linear.
• Apa yang dapat dilakukannya — North Micro Vision Instruct: membaca gambar dan dokumen, menjawab dalam bentuk teks, menentukan posisi objek dan membuat takarir. PixelUMM: membaca gambar dan video, serta menghasilkan gambar dan video 4 detik dari teks.
• Skala — 2,4B dense dibandingkan sekitar 15,2B total pada backbone Qwen3-8B, ditulis sebagai "8B MoT" dalam tabel-tabel makalah itu sendiri.
• Lisensi — Apache-2.0 pada kode dan bobot versus Apache-2.0 pada kode dengan NVIDIA One-Way Noncommercial License pada checkpoint.

Membaca kedua papan skor itu dengan jujur
Kedua model tersebut menerbitkan tolok ukur yang berbeda, dan pada bagian yang tumpang tindih, skalanya pun berbeda.
• DocVQA — North Micro Vision Instruct 0.921 sebagai pecahan akurasi. PixelUMM 90.42 sebagai persentase. Nama tolok ukur yang sama, split dan penyiapan prompt yang berbeda, dan hanya satu dari keduanya yang mengklaim penanganan resolusi native sebagai alasannya.
• ChartQA — North Micro Vision Instruct 0.808. PixelUMM 82.96. Sekali lagi kira-kira rentang yang sama begitu Anda berhenti membandingkan string mentahnya.
• OCRBench — North Micro Vision Instruct 0.792. PixelUMM 78.00.
• MMMU — North Micro Vision Instruct 0.329, PixelUMM 41.67. Keduanya rendah menurut standar model penglihatan-bahasa besar, dan kedua laboratorium melaporkannya tanpa hiasan.
• hanya PixelUMM — MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, GenEval 0.83 dengan penulis ulang prompt, kualitas VBench Bagian 1 84.10.
• North Micro Vision Instruct-only — tugas grounding, captioning, dan multi-gambar; tidak adanya pemanggilan alat yang terdokumentasi dan secara eksplisit tanpa perilaku agentik.
Hal yang mencolok dari tumpang tindih ini adalah betapa dekatnya spesialis 2,4B dengan generalis 15,2B dalam membaca dokumen dan grafik. Itu bukan bukti bahwa pendekatan tanpa encoder gagal — melainkan bukti bahwa membaca dokumen adalah tugas yang sangat cocok untuk encoder resolusi asli yang ringkas, dan arsitektur PixelUMM ditujukan untuk argumen yang berbeda. Makalah PixelUMM sendiri mengakui hal itu dalam satu kalimat yang layak dikutip: karena data pelatihan berbeda antar model, hasilnya "tidak dapat menetapkan arsitektur mana yang lebih unggul".
Ke mana keputusan itu sebenarnya bermuara
Jika Anda memiliki dokumen, bagan, formulir, atau tangkapan layar dan Anda membutuhkan jawaban bulan ini, North Micro Vision Instruct adalah pilihan praktis dan tidak ada yang bisa menandinginya: Apache-2.0, 2.4B, jalur pemuatan Transformers standar, tanpa lingkungan guardrail, tanpa indeks checkpoint terdistribusi, tanpa tumpukan Python kedua. Lakukan fine-tune pada distribusi dokumen Anda sendiri dan Anda akan memiliki spesialis. Kendalanya adalah cakupan — arahkan pada tugas penalaran dan angka MMMU akan menemukan Anda.
Yang ditawarkan PixelUMM adalah keluasan dan sebuah pertanyaan penelitian. Ia membaca dan menghasilkan, gambar maupun video, dari satu set bobot, dan ini adalah bacaan yang jauh lebih menarik. Namun checkpoint-nya berada di bawah lisensi nonkomersial, bobotnya berupa 128 pecahan checkpoint terdistribusi di balik indeks metadata tersembunyi dengan total sekitar 30 GB, ia menginginkan toolkit CUDA 13 dengan FlashAttention yang dikompilasi dari sumber, dan jalur teks-ke-video-nya menjalankan guardrail Cosmos yang memerlukan repositori bergerbang dan lingkungan terpisah. Itu bangku laboratorium, bukan deployment.
Aspek perutean akan datang nanti, jika memang benar-benar datang. Tidak satu pun dari kedua model itu tersedia melalui API yang dihosting mana pun saat ini — OrcaRouter tidak merutekan satu pun — dan keduanya tidak akan tersedia sampai lisensi mereka mengizinkannya. Ketika model seperti North Micro Vision Instruct benar-benar muncul di balik endpoint bersama, alasan untuk lebih memilihnya daripada integrasi langsung adalah alasan yang biasa: satu kunci untuk 200+ model, harga daftar dari penyedia diteruskan pada markup 0%, failover yang menurunkan peringkat model yang kinerjanya di bawah kartu modelnya, dan tidak ada kontrak kedua yang perlu dinegosiasikan saat Anda ingin melakukan uji A/B pada penggantinya. Itu adalah deskripsi alur kerja, bukan klaim tentang ketersediaan.
Satu-satunya ujian yang akan memisahkan mereka
Jalankan keduanya pada kumpulan dokumen yang sama dengan resolusi yang sama dan nilai kasus teks kecil, lalu balik satu variabel: keluarkan encoder visi dari perbandingan dengan memberi PixelUMM input beresolusi aslinya. Jika model tanpa encoder tetap bertahan pada teks padat dengan sebagian kecil dari biaya parameter, itu adalah bukti terkuat yang mungkin untuk tesis tersebut — dan itu adalah uji yang dapat dijalankan siapa pun yang punya kartu cadangan, karena kedua checkpoint dapat diunduh. Sampai seseorang melakukannya, ringkasan pragmatisnya tetap berlaku: pembaca Apache-2.0 kecil adalah yang Anda terapkan, dan generalis nonkomersial besar adalah yang Anda pelajari.
