
MiniCPM-V 4.7 vs North Micro Vision Instruct: Cohere Merilis Model 2,4B yang Terdokumentasi; OpenBMB Merilis 70 GB Kosong
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
MiniCPM-V 4.7 dan North Micro Vision Instruct sama-sama merupakan jawaban laboratorium kecil untuk arahan yang sama — model visi-bahasa ringkas yang dapat Anda fine-tune dan deploy sendiri — tetapi hanya satu di antaranya yang selesai. North Micro Vision Instruct dari Cohere hadir pada 10 Agustus 2026 sebagai model resolusi native berparameter 2,4 miliar di bawah Apache-2.0, dengan posting blog teknis yang menjelaskan arsitekturnya dan kartu model yang mencantumkan peruntukannya. MiniCPM-V 4.7 hadir pada 6 Oktober 2026 sebagai checkpoint sparse mixture-of-experts berparameter 35,2 miliar dengan enam belas shard, tanpa README, tanpa kolom lisensi, dan tanpa benchmark apa pun. Perbandingan yang menarik bukanlah "mana yang lebih pintar." Melainkan bahwa kedua rilis tersebut mewakili sikap yang berlawanan terhadap komunitas yang harus menggunakannya.
Dua rilis tersebut, dan apa yang disertakan pada masing-masing
North Micro Vision Instruct adalah model visi-bahasa berbobot terbuka 2,4B dari CohereLabs, dirilis di bawah Apache-2.0. Model ini secara eksplisit diposisikan sebagai model ringkas untuk pembuatan prototipe, fine-tuning khusus tugas, dan pekerjaan multimodal terspesialisasi. Fitur utamanya adalah pemrosesan gambar beresolusi native yang mempertahankan rasio aspek dan detail visual halus alih-alih melakukan resampling ke kisi tetap, dan kartu modelnya mengklaim kemampuan pada VQA, captioning, grounding, OCR, bagan, dan dokumen. Model ini mendukung beberapa gambar per percakapan dan sebelas bahasa — Inggris, Jerman, Prancis, Spanyol, Italia, Portugis, Hindi, Jepang, Korea, Tionghoa, dan Arab. Bobot model adalah 2.484.847.856 parameter dalam BF16, dan sejak rilis, komunitas MLX telah menghasilkan konversi 4-bit, 5-bit, 6-bit, 8-bit, mxfp8, mxfp4, nvfp4, dan bf16, yang merupakan gambaran rilis model kecil yang sehat setelah beberapa bulan. Model ini memiliki sekitar 166.500 unduhan dan 150 suka.
MiniCPM-V 4.7 adalah openbmb/MiniCPM-V-4.7-35B-A3B: 35.212.875.824 parameter dalam BF16, 70,4 GB di enam belas pecahan safetensors, kelas MiniCPMV4_7ForConditionalGeneration, disimpan oleh Transformers 5.2.0 dan diunggah pada 6 Oktober 2026.

Tulang punggung teksnya adalah MoE sparse turunan Qwen3.5 — 256 pakar, 8 dipilih per token — dengan 40 lapisan yang menjalankan pola atensi three-linear-to-one-full tetap, konteks 256K, dan menara visi 27 lapisan internal pada downsampling 16×. Tidak ada kartu model. Repositori tersebut memiliki tiga suka dan tanpa unduhan.
Berdampingan, tentang enam hal yang paling penting
• Parameter — North Micro Vision Instruct: 2,48B padat, setiap parameter aktif per token. MiniCPM-V 4.7: total 35,2B, sparse 8-dari-256. Bukan angka yang sebanding.
• Lisensi — North Micro Vision Instruct: Apache-2.0, ditandai dan dinyatakan. MiniCPM-V 4.7: tidak ada yang dinyatakan, yang secara default berarti semua hak dilindungi.
• Cakupan fine-tuning — North Micro Vision Instruct: dirancang secara eksplisit sebagai basis untuk fine-tuning spesifik tugas, dengan kuantisasi komunitas yang sudah tersedia. MiniCPM-V 4.7: checkpoint BF16 berukuran 70 GB tanpa kuantisasi dan tanpa resep pelatihan yang dinyatakan.
• Penanganan resolusi — North Micro Vision Instruct: resolusi native, mempertahankan rasio aspek. MiniCPM-V 4.7: downsample_mode: "16x" dengan max_slice_nums: 9, jalur resolusi tinggi berbasis slicer.
• Cakupan bahasa — North Micro Vision Instruct: sebelas bahasa tercantum pada kartu. MiniCPM-V 4.7: tidak disebutkan di mana pun.
• Konteks — North Micro Vision Instruct: disesuaikan untuk kelas deployment 2,4B-nya. MiniCPM-V 4.7: max_position_embeddings: 262144, 256K.
• Bukti kualitas — North Micro Vision Instruct: kartu yang diterbitkan, postingan blog teknis, konversi komunitas dan adopsi besar-besaran. MiniCPM-V 4.7: tidak ada yang bisa dikutip.

Asimetri yang membuat perbandingan ini berat sebelah
Ada jenis artikel perbandingan tertentu yang akan mudah ditulis di sini: ambil angka MiniCPM-V 4.6 dari GitHub OpenBMB, catat bahwa angka itu mengalahkan kelas setara model-model kecil, lalu menyiratkan bahwa 4.7 mewarisinya. Itu tidak jujur, dan alasannya layak dinyatakan secara tepat. MiniCPM-V 4.7 bukan versi yang lebih besar dari 4.6. Model ini meninggalkan backbone dense 1.3B Qwen3.5-0.8B dan beralih ke Qwen-MoE sparse 35B, mengubah pola attention menjadi 3:1 linear-ke-full, dan mengganti default kompresi vision menjadi 16x. Setiap hal tersebut merupakan perubahan pada bagian model yang menentukan akurasi. Silsilah keluarga bukan tolok ukur.
Arah lain dari ketidakjujuran lebih halus: memperlakukan tidak adanya kartu sebagai bukti adanya masalah. Bukan begitu. OpenBMB telah merilis sembilan generasi MiniCPM-V sejak 2024, beberapa di antaranya benar-benar unggul untuk ukurannya, dan jendela dua belas menit antara pembuatan repositori dan commit terakhir adalah seperti apa artefak yang disiapkan lalu diterbitkan, bukan seperti apa artefak yang rusak. Pembacaan yang benar untuk MiniCPM-V 4.7 adalah "tidak diketahui," dan tidak diketahui adalah hal yang berbeda dari "buruk."
Sisi Cohere memiliki persyaratan kejujurannya sendiri.

Klaim kualitas Kartu North Micro Vision adalah pengukuran Cohere sendiri, dan tinjauan teknis mendalamnya ditulis oleh tim yang sama. Fakta bahwa komunitas membuat enam belas kuantisasi MLX dalam beberapa hari adalah bukti adopsi, bukan bukti akurasi — orang mengonversi model yang mudah dikonversi, dan rilis 2.4B Apache-2.0 yang bersih mudah dikonversi. Jumlah unduhan maupun sebaran kuantisasi tidak boleh dibaca sebagai skor.
Untuk apa masing-masing sebenarnya
North Micro Vision Instruct adalah target fine-tuning. Itulah keseluruhan ringkas desainnya, yang dinyatakan dalam kata-kata kartunya sendiri: fondasi ringkas untuk pembuatan prototipe dan aplikasi khusus. Jika Anda memiliki tugas sempit seperti penguraian dokumen, ekstraksi bagan, atau pemberian keterangan multibahasa serta beberapa ribu contoh berlabel, model 2,4B Apache-2.0 dengan input resolusi native dan kuantisasi delapan-bit-plus adalah tempat awal yang masuk akal, dan Anda dapat memindahkannya ke perangkat edge atau satu GPU kelas menengah saat model itu berfungsi.
MiniCPM-V 4.7, jika ternyata bisa digunakan, bukan itu. Pada 70 GB tanpa kuantisasi, ini adalah model server, dan fitur pembedanya — jendela 256K serta perhatian linear yang menjaga cache KV tetap datar — mengarah pada beban kerja multimodal konteks panjang: transkrip video berdurasi berjam-jam, kumpulan dokumen besar, analisis multi-giliran yang diperluas dengan gambar dalam riwayat. Itu adalah beban kerja nyata, dan arsitektur ini adalah taruhan yang masuk akal untuk itu. Taruhan itu saja belum dinilai.
Ada nuansa tentang dua strategi kompresi yang perlu diingat. Resolusi asli dan downsampling 16× tidak sekadar lebih baik dan lebih buruk. Encoder beresolusi asli menghabiskan token untuk mempertahankan detail halus, yang dibutuhkan OCR dan grounding. Downsample 16× menghabiskan lebih sedikit token dan berisiko kehilangan justru detail tersebut. Mana yang tepat bergantung pada apakah tugas Anda membaca formulir yang padat atau mendeskripsikan pemandangan, dan mode 4x/16x yang dapat diganti pada MiniCPM-V 4.6 ada justru karena jawabannya berubah menurut tugas. Apakah 4.7 mempertahankan tombol pengalih itu kembali adalah salah satu hal yang tidak disebutkan oleh konfigurasi.
Di mana router cocok, dan di mana tidak
Kedua model ini adalah bobot yang Anda host sendiri. Baik North Micro Vision Instruct maupun MiniCPM-V 4.7 bukanlah model yang dihosting di OrcaRouter, dan tidak ada apa pun di sini yang boleh ditafsirkan sebagai klaim bahwa model tersebut dihosting. Pertanyaan perutean muncul satu langkah kemudian, ketika model kecil yang dihosting sendiri mengerjakan pekerjaan rutin dan sesuatu yang lebih besar harus menangani kasus-kasus yang gagal ditanganinya. Peralihan itulah gunanya router dengan satu kunci — lebih dari 200 model di berbagai penyedia, masing-masing pada harga daftarnya tanpa markup tambahan dari pihak kami, dengan failover otomatis saat salah satu penyedia mengalami penurunan — dan ada baiknya antarmuka ini sudah diselesaikan sebelum Anda membutuhkannya, karena hari ketika evaluasi 4.7 Anda berhasil adalah hari ketika Anda menginginkan endpoint kedua tanpa kontrak kedua.
Putusan itu, dan apa yang akan mengubahnya
Cohere merilis sebuah model. OpenBMB merilis sebuah checkpoint. Pada setiap sumbu yang dapat ditindaklanjuti oleh pembaca — lisensi, kejelasan lisensi, perilaku yang terdokumentasi, kesiapan fine-tuning, kuantisasi, cakupan bahasa — North Micro Vision Instruct adalah jawabannya hari ini, dan tidak ada yang mendekati. Itu bukan klaim tentang kemampuan, karena tidak ada perbandingan kemampuan yang mungkin dilakukan. MiniCPM-V 4.7 memiliki jumlah parameter sekitar sepuluh kali lipat dari model yang dibandingkan dengannya dan tidak menerbitkan apa pun untuk membenarkan atau membantah ukuran itu. Sikap yang jujur adalah memperlakukannya sebagai tertunda: sebuah artefak nyata dari lab dengan rekam jejak nyata, berada di repositori dengan satu file yang hilang yang akan mengubah segalanya — README.
