
InternLumina-U2 vs North Micro Vision Instruct: Pembaca Dokumen yang Dapat Anda Jalankan Hari Ini vs Model 16B yang Belum Siap
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2658Kecerdasan72Koding
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
Jika Anda membutuhkan model yang dapat membaca dokumen, tangkapan layar, dan grafik minggu ini, perbandingan ini memiliki jawaban praktis yang singkat: North Micro Vision Instruct adalah model open-weight berkekuatan 2,4 miliar parameter dari Cohere, dirilis di bawah lisensi Apache-2.0, dapat diunduh sejak 10 Agustus 2026, dan cukup baik dalam tugas dokumen sehingga layak untuk diarahkan ke file Anda sendiri hari ini. InternLumina-U2 adalah model difusi berkekuatan 16 miliar parameter dari Shanghai AI Laboratory — desain yang jauh lebih ambisius yang juga mengklaim pemahaman grafik dan dokumen, di antara setengah lusin tugas lainnya — tetapi bobotnya tidak publik, repositori Hugging Face-nya hanyalah stub kosong, dan belum ada siapa pun di mana pun yang dapat menjalankannya. Jawaban yang lebih panjang adalah tentang apa yang terjadi ketika dua model Apache-2.0 membuat klaim yang tumpang tindih tentang membaca, tetapi hanya satu di antaranya yang benar-benar dapat Anda pegang di tangan.
2.4B yang benar-benar ada
North Micro Vision Instruct adalah spesialis visi dalam keluarga North milik Cohere: total sekitar 2,4 miliar parameter, model ringkas yang dirancang untuk membaca pada resolusi native. Inti desainnya adalah sebagian besar model visi mengecilkan gambar ke grid tetap dan kehilangan detail halus yang menjadi tumpuan dokumen — sehingga North Micro Vision Instruct menerima gambar pada resolusi native hingga sekitar satu halaman A4 pada 200 dpi, dengan rasio aspek dan teks kecil tetap terjaga. Angka yang dilaporkan Cohere cukup kuat untuk kelas ukurannya: DocVQA 0,921, ChartQA 0,808, OCRBench 0,792, semuanya dilaporkan oleh Cohere dan belum direproduksi, dengan konteks multimodal tervalidasi sekitar 8 ribu token serta titik lemah yang terdokumentasi pada MMMU (0,329) — pengingat bahwa model ini adalah spesialis membaca, bukan generalis penalaran. Model ini tidak memiliki API hosted sendiri maupun jalur hosted standar; kisah praktisnya adalah self-hosting model 2,4 miliar parameter, yang cukup kecil untuk dijalankan pada satu GPU workstation modern. Adopsi komunitas berjalan stabil — kartu Hugging Face menunjukkan puluhan ribu unduhan per bulan pada akhir Agustus.
16B yang merupakan sebuah janji
InternLumina-U2 adalah artefak yang berbeda. Yang diterbitkan Shanghai AI Laboratory pada 1 September 2026 adalah kode inferensi dan arsitektur, bukan model: sebuah LLM difusi sparse mixture-of-experts, dengan total 16 miliar parameter dan 1 miliar aktif, dibangun di sekitar representasi visual delapan-codebook yang sepenuhnya diskret. Di antara enam keluarga tugas yang dicakup skrip driver repositori—teks, pemahaman gambar, teks-ke-gambar, penyuntingan gambar, pemahaman video, pemahaman 3D—pemahaman gambar secara eksplisit mencakup bagan dan dokumen padat. Tabel pendahuluan di halaman proyek mencantumkan angka bagan dan dokumen yang dilaporkan lab dalam kisaran yang sama dengan klaim spesialis: ChartQA 86,52, CharXiv-DQ 83,65, serta HallusionBench 62,15 dan MathVision 33,22. Halaman tersebut menyebut hasilnya "pendahuluan, parsial," laporan teknis yang akan memuat tabel lengkap ditandai segera hadir, dan—fakta yang menentukan—tidak ada bobot yang bisa digunakan siapa pun untuk memeriksanya.
Papan skor
Setiap angka di bawah ini dilaporkan oleh vendor. Angka North Micro Vision Instruct adalah evaluasi milik Cohere sendiri; angka InternLumina-U2 adalah tabel parsial awal dari laboratorium tersebut.
• Ukuran dan bentuk — North Micro Vision Instruct: ~2.4B padat, pembaca resolusi asli. InternLumina-U2: total 16B / 1B aktif sparse MoE, model difusi multi-codebook diskrit.
• Apa yang dilakukannya — North Micro Vision Instruct: membaca gambar, dokumen, bagan, dan layar UI; menjawab dalam teks, dengan grounding. InternLumina-U2: mengklaim membaca plus pembuatan — memahami gambar/video/3D, menghasilkan dan menyunting gambar.
• Bobot — North Micro Vision Instruct: publik sejak 10 Agustus 2026 (CohereLabs/North-Micro-Vision-Instruct, Apache-2.0). InternLumina-U2: tidak publik; stub Hugging Face kosong, bobot ditandai "segera hadir."
• Skor pembacaan utama — North Micro Vision Instruct: DocVQA 0.921, ChartQA 0.808, OCRBench 0.792 (dilaporkan Cohere). InternLumina-U2: ChartQA 86.52, CharXiv-DQ 83.65, HallusionBench 62.15 (laporan lab, sementara).
• Konteks dokumen — North Micro Vision Instruct: resolusi asli hingga ~A4 pada 200 dpi, konteks multimodal tervalidasi ~8K. InternLumina-U2: bagan padat dan gambar alami ditangani melalui encoder multi-codebook AToken; konteks belum ditentukan.
• Kelemahan yang diketahui — North Micro Vision Instruct: MMMU 0,329, tanpa pemanggilan alat — pembaca, bukan penalar atau agen. InternLumina-U2: tertinggal dari setidaknya satu pesaing yang disebutkan pada GenEval (0,81 vs 0,89) dalam tabel parsialnya sendiri; semuanya belum terverifikasi.
• Cara menjalankannya — North Micro Vision Instruct: host sendiri model 2.4B; dukungan vLLM masih dalam proses saat tulisan ini dibuat. InternLumina-U2: tidak ada yang bisa menjalankannya — tidak ada bobot, dan driver yang dirilis membutuhkan direktori checkpoint dan file tokenizer yang tidak ada di repositori.

Tolok ukur yang sama, dua epistemik yang sangat berbeda
ChartQA adalah cara paling jernih untuk melihat perbedaan antara kedua klaim tersebut. Kedua model melaporkan angka ChartQA; North Micro Vision Instruct melaporkan 0,808 sebagai pecahan akurasi, dan InternLumina-U2 melaporkan 86,52 sebagai persentase — tolok ukur yang sama, pada dasarnya hasil yang sama dalam kisaran 80-an atas hingga 80-an tengah pada skala berbeda, terlepas dari perbedaan pembagian evaluasi dan pengaturan prompt yang membuat perbandingan ChartQA lintas makalah berbahaya bahkan ketika kedua model itu ada. Perbedaan epistemik itulah yang penting: angka 0,808 milik North Micro Vision Instruct terkait dengan artefak yang dapat diunduh, sehingga tim mana pun dengan GPU dan seperangkat grafik dapat mereproduksi atau menyangkalnya minggu ini. Angka 86,52 milik InternLumina-U2 terkait dengan peta jalan. Angka yang tidak dapat Anda periksa adalah angka yang tidak seharusnya Anda jadikan dasar — yang justru merupakan posisi yang diakui sendiri oleh lab tersebut dengan memberi label pendahuluan pada tabelnya.

Kartu Hugging Face CohereLabs/North-Micro-Vision-Instruct, ditangkap pada 27 Agustus 2026 — deskripsi visi-bahasa resolusi asli 2.4B, lisensi Apache-2.0, dan benchmark pembacaan dokumen yang dilaporkan Cohere.
Membaca, versus membaca dan menggambar.
Kesenjangan filosofi arsitektur lebih berarti daripada kesenjangan tolok ukur. North Micro Vision Instruct adalah spesialis sempit: ia membaca, dan melakukan satu tugas itu dengan biaya yang cukup terjangkau sehingga Anda bisa menjalankannya di setiap halaman, setiap tangkapan layar, setiap faktur dalam sebuah pipeline tanpa mengkhawatirkan tagihan GPU Anda. Kemurahan itulah justru fiturnya — intelijen dokumen dalam skala besar adalah masalah biaya sekaligus masalah akurasi. InternLumina-U2 adalah taruhan yang sebaliknya: model sparse raksasa yang mencoba menyatukan kemampuan membaca dengan pembuatan gambar, penyuntingan gambar, pemahaman video, dan pemahaman 3D ke dalam satu antarmuka token diskret bersama, dengan teori bahwa pemahaman dan pembuatan saling memperkuat. Jika berhasil, ia adalah kelas alat yang berbeda — tetapi "jika berhasil" itu mengandung banyak syarat, dan diffusion MoE 16B-A1B dengan tokenizer khusus serta prapemrosesan 3D hasil render Blender tidak akan pernah menjadi pembaca selalu-aktif semurah spesialis 2.4B. Keduanya sebenarnya bukan pengganti. Ini adalah alat yang bisa Anda gunakan hari ini dan arah riset yang bisa Anda persiapkan.

Repositori GitHub InternLM/InternLumina-U2, ditangkap pada 2 September 2026 — halaman arahan repositori dengan deskripsi "Omni-Visual Understanding, Image Generation and Editing" dan skrip inferensi per tugas; di antara skrip-skrip tersebut, jalur pemahaman gambar adalah yang menargetkan gambar alami dan diagram padat.
Apa artinya jika Anda membangun pipeline dokumen.
Tidak satu pun dari kedua model tersebut dihosting di OrcaRouter — North Micro Vision Instruct adalah model self-host tanpa API terhosting, dan InternLumina-U2 belum memiliki weights yang bisa dihosting oleh siapa pun — jadi aspek routing di sini bukanlah "memanggil keduanya lewat satu kunci hari ini", melainkan pola yang akan Anda gunakan begitu salah satu dari keduanya berubah: pipeline dokumen hampir selalu memasangkan pembaca yang murah dengan penalar yang lebih besar, dan nilai lapisan routing adalah mengekspresikan pasangan tersebut sebagai satu panggilan sekaligus menjaga pass-through markup 0% tetap transparan pada model-model terhosting yang memang Anda gunakan. Ketika checkpoint berlisensi Apache-2.0 seperti InternLumina-U2 akhirnya hadir, langkah yang masuk akal bukanlah membongkar stack dokumen yang sudah berfungsi — melainkan menempatkan pendatang baru tersebut di jalur pengujian di belakang failover otomatis, sehingga ia memperoleh lalu lintas produksi dengan bertahan menghadapinya; begitu ia gagal menangani bagan nyata, panggilan akan kembali ke model yang sudah membuktikan diri. Satu API yang mencakup 200+ model adalah mekanismenya; failover adalah jaring pengaman; spesialis yang bisa Anda jalankan hari ini adalah yang membayar tagihan selagi janji 16B itu masih ditepati.
Putusan
Untuk pembacaan dokumen dan bagan di masa sekarang ini, North Micro Vision Instruct adalah satu-satunya dari keduanya yang benar-benar dapat digunakan secara nyata — berukuran kecil, berlisensi Apache-2.0, dapat diunduh, dengan skor kuat yang dilaporkan vendor dan benar-benar bisa Anda periksa sendiri. InternLumina-U2 adalah artefak jangka panjang yang lebih menarik, karena ia berupaya menjadikan membaca sebagai satu dari enam keterampilan dalam satu model terpadu, dan jika itu berhasil, makna "model visi" akan berubah. Amati repo Hugging Face-nya yang masih kosong sebagaimana Anda mengamati hitung mundur peluncuran: pada hari file safetensors muncul, janji itu menjadi model, dan perbandingan itu menjadi nyata. Sampai saat itu tiba, jangan biarkan skor 86,52 yang dilaporkan vendor pada tolok ukur bagan mengungguli skor 0,808 yang dapat diunduh dalam pengambilan keputusan Anda.
