Kartu judul hero yang dihasilkan untuk 'MiniCPM-V 4.7 vs Microsoft Mage-VL' dengan subjudul 'Dua cara untuk memangkas biaya melihat video', kartu kiri bertuliskan 'Mage-VL: sparsitas token native codec, 75% lebih sedikit token visual', kartu kanan bertuliskan 'MiniCPM-V 4.7: atensi linear, cache KV datar di atas 256K' dan pil bertuliskan 'Kompres input, atau kompres state', dengan logo OrcaRouter di sudut kanan bawah.
Guides & Insights

MiniCPM-V 4.7 vs Microsoft Mage-VL: Dua Pertaruhan yang Sangat Berbeda tentang Berapa Biaya per Frame yang Wajar untuk Sebuah Model Visi

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

MiniCPM-V 4.7 dan Microsoft Mage-VL keduanya merupakan model visi-bahasa yang mengklaim dapat menghemat token Anda, dan keduanya mencapainya melalui jalur yang berlawanan. Mage-VL, yang dirilis oleh Microsoft pada 25 Juli 2026, menyerang sisi video: model ini meminjam struktur codec video, mempertahankan setiap patch frame jangkar dan hanya patch frame prediksi yang membawa gerakan nyata, serta mengklaim pengurangan token visual lebih dari 75% dengan percepatan wall-clock hingga 3,5× dibandingkan pengambilan sampel frame seragam. MiniCPM-V 4.7, yang diunggah oleh OpenBMB pada 6 Oktober 2026, menyerang sisi urutan: MoE sparse berparameter 35,2 miliar dengan 30 dari 40 lapisannya berada pada jalur atensi linear, yang membuat cache KV tumbuh lambat di sepanjang konteks 256K. Satu model memampatkan apa yang dilihatnya. Model lainnya memampatkan apa yang diingatnya. Dan hanya satu di antaranya yang disertai sesuatu yang dapat Anda evaluasi.

Apa itu masing-masing

Microsoft Mage-VL adalah model fondasi multimodal codec-native, proactive-streaming berskala 4B, dirilis di bawah Apache-2.0 dengan laporan teknis dan bagian evaluasi yang substansial. Model ini dibangun secara sengaja untuk melawan apa yang disebut para penulisnya sebagai paradoks Moravec untuk VLM — kuat dalam penalaran offline, lambat dalam persepsi waktu nyata. Encoder visual, Mage-ViT, dilatih sepenuhnya dari awal pada sekitar 100 juta gambar dan video tanpa label, bukan diinisialisasi dari ViT yang telah dilatih sebelumnya di web, dan satu-satunya komponen yang telah dilatih sebelumnya dalam stack ini adalah backbone bahasa Qwen3-4B-Instruct-2507. Checkpoint lengkapnya adalah model terpadu tunggal yang melakukan pemahaman gambar, penalaran video offline, dan komentar streaming yang dipicu peristiwa tanpa varian terpisah, dan rilis pendamping microsoft/Mage-ViT menyediakan encoder itu sendiri. Rilis ini telah mengumpulkan sekitar 10.600 unduhan dan 420 suka sejak dirilis.

MiniCPM-V 4.7 adalah openbmb/MiniCPM-V-4.7-35B-A3B, checkpoint BF16 dengan 35.212.875.824 parameter dalam enam belas shard dengan total 70,4 GB, ditulis oleh Transformers 5.2.0 dan diunggah pada 6 Oktober 2026 tanpa kartu model.

A generated two-column comparison scoreboard titled 'MiniCPM-V 4.7 vs Microsoft Mage-VL — the scoreboard'. Left column 'MiniCPM-V 4.7' lists Parameters 35.2B sparse, Licence none declared, Token savings linear attention, Context 256K, Vision 16x downsample, Evidence no card no benchmarks. Right column 'Mage-VL' lists Parameters 4.74B dense, Licence Apache-2.0, Token savings 75% fewer visual tokens, Context up to 768 frame windows, Vision from-scratch Codec-ViT, Evidence full card with tables. The footer reads 'Mage-VL figures vendor-reported; MiniCPM-V 4.7 figures read from config.json.'

Konfigurasi teksnya diberi tag qwen3_5_moe_text dengan 256 ahli dan 8 aktif per token; layer_types array-nya menjalankan tiga lapisan linear-attention untuk setiap satu lapisan full-attention di seluruh 40 lapisan; menara visinya adalah internal minicpmv4_7_vision pada 27 lapisan dengan downsampling 16× dan hingga sembilan irisan gambar. Konteksnya 256K. Repositori ini memiliki nol unduhan, tiga suka, tanpa benchmark, dan tanpa lisensi.

Enam baris yang dapat diperiksa pembaca

Enam dimensi yang sama, kedua sisi. Jika suatu angka tidak ada, celahnya dibiarkan terlihat.

• Parameter — Mage-VL: 4,74B, padat, semua aktif per token. MiniCPM-V 4.7: 35,2B total, jarang, 8 dari 256 ahli per token. Angka MiniCPM tidak sebanding dengan yang padat.

• Lisensi — Mage-VL: Apache-2.0, dinyatakan di kartu dan tag repositori. MiniCPM-V 4.7: tidak ada yang dinyatakan.

• Dari mana penghematan token berasal — Mage-VL: sparsitas token visual di encoder, selaras codec, diklaim pengurangan lebih dari 75%. MiniCPM-V 4.7: perhatian linear di decoder, yang memperkecil pertumbuhan KV-cache pada sekuens panjang tetapi tidak mengurangi token yang Anda suapkan ke dalamnya.

• Konteks — Mage-VL: dilatih melalui tahap konteks panjang pada 350K video sebagai jendela codec bergulir hingga 384 atau 768 frame. MiniCPM-V 4.7: max_position_embeddings: 262144.

• Asal-usul encoder visi — Mage-VL: dari nol, dilatih pada ~100 juta frame tanpa label; kartu tersebut melaporkan 85,69% ImageNet dengan 256 token dan peningkatan monotonik seiring anggaran token. MiniCPM-V 4.7: tower lineage yang digunakan kembali dari desain MiniCPM-V 4.6 pada bentuk 1152-hidden, 27-layer yang sama, dengan default downsample 16x.

• Bukti — Mage-VL: kartu skor lengkap dengan DocVQA 95,14, InfoVQA 80,33, OCRBench 81,80, ChartQAPro 32,57, MMStar 67,32, CV-Bench-3D 94,75 dan selisih CrossPoint +53,1 dibandingkan Qwen3-VL-4B, semuanya dilaporkan vendor terhadap backbone yang dipadankan. MiniCPM-V 4.7: tidak ada.

• Perilaku streaming — Mage-VL: gerbang kognisi yang memberi skor pada setiap jendela bergulir dan tetap diam hingga suatu peristiwa selesai, dilatih pada ~3,3 juta sampel streaming. MiniCPM-V 4.7: tidak dijelaskan di mana pun.

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tags safetensors, minicpmv4_7 and region:us, and the file listing with no README or licence field.

Bagian yang semua orang salah pahami tentang angka-angka Mage-VL

Tabel benchmark kartu Mage-VL kuat, dan yang paling kuat juga paling mudah salah dibaca. Baris-baris perbandingan mempertemukan Mage-VL-4B dengan Qwen3-VL-4B, Phi-4-Multimodal-Instruct, dan Phi-4-Reasoning-Vision, dan peningkatan yang menonjol — +22.5 pada QVHighlight, +24.5 pada VideoEval-Pro, +53.1 pada CrossPoint — nyata dalam arti bahwa angka-angka itu muncul di tabel vendor. Angka-angka itu juga merupakan pengukuran vendor sendiri, yang dihasilkan oleh tim yang melatih model tersebut, pada harness yang sama. Tidak ada pihak independen yang mereproduksinya. Hal itu normal untuk model berusia empat bulan dan bukanlah poin negatif untuknya, tetapi itu berarti kata kerja yang tepat adalah "reports," bukan "scores."

Ada dua hal yang patut diapresiasi di luar tabel. Pertama, desain backbone yang dipadankan — mempertahankan dekoder Qwen3-4B tetap dan hanya mengganti ViT — adalah bukti yang lebih bersih daripada posisi papan peringkat, karena mengisolasi tumpukan visual, bukan keseluruhan sistem. Kedua, korpus pelatihan untuk Mage-ViT berjumlah sekitar 100 juta bingkai tanpa label, dibandingkan dengan miliaran pasangan gambar-teks yang digunakan encoder yang dipralatih web, sehingga menyamai perilaku kelas SigLIP2-at-10B pada diskriminasi klaster adalah klaim yang spesifik dan dapat diperiksa tentang efisiensi data, bukan sesumbar umum.

MiniCPM-V 4.7 tidak memiliki semua ini. Bukan versi yang lebih lemah — tidak ada sama sekali.

A screenshot of the Hugging Face model page for microsoft/Mage-VL (captured 7 October 2026) showing the model header, the mage_vl and video-understanding tags, the Apache-2.0 licence badge, the project page and GitHub links, and the opening of the Mage-VL card describing it as a codec-native, proactive-streaming multimodal foundation model at a 4B scale.

Tidak ada tabel, baik dari vendor maupun dari sumber lainnya, dan file konfigurasi yang mendeskripsikan arsitektur itu secara eksplisit mengecualikan dirinya dari menyatakan apa pun tentang akurasi.

Arsitektur: dua jawaban untuk pertanyaan yang sama

Kedua model berupaya menjawab "bagaimana membuat inferensi multimodal menjadi murah," dan kontrasnya informatif karena kedua jawaban itu saling melengkapi alih-alih bersaing.

Mage-VL mengurangi input. 16×16Grid patch-nya dibagi antara frame anchor dan frame yang diprediksi, dan frame yang diprediksi hanya menyumbang patch di mana codec mengalokasikan bit — yaitu tempat terjadinya gerakan dan detail baru. Hasilnya adalah aliran token dengan panjang variabel per frame, itulah sebabnya stack memerlukan proyektor yang dapat menyerahkan urutan variabel ke decoder kausal, dan mengapa antarmuka yang sama dapat menerima vektor gerak H.264/HEVC atau peta laju yang dipelajari oleh codec neural tanpa pelatihan ulang. Lalu pengodean rotary 3D menjaga posisi spasiotemporal tetap koheren di seluruh sparsitas. Anggaran token adalah kuantitas yang dikelola.

MiniCPM-V 4.7 mengurangi state. Lapisan linear-attention-nya mempertahankan state berulang berukuran tetap alih-alih cache key-value yang terus bertambah, sehingga biaya memori percakapan panjang berhenti meningkat secara linear seiring jumlah token. Anggaran sekuensnya adalah kuantitas yang dikelola, dan konteks 256K adalah hasilnya. Yang patut dicatat, konfigurasi MiniCPM-V 4.7 mengiklankan downsample visual 16x — ia juga memampatkan input — tetapi bungkam tentang apakah ia mempertahankan mode 4x yang dapat dialihkan yang diungkapkan MiniCPM-V 4.6.

Sederhananya: trik Mage-VL membuahkan hasil pada video yang sebagian besar framenya nyaris identik dengan frame di sekitarnya. Trik MiniCPM-V 4.7 membuahkan hasil pada dokumen panjang dan sesi multi-giliran yang panjang tempat token menumpuk. Pipeline yang menyerap siaran langsung lalu melakukan percakapan panjang tentangnya akan mendapat manfaat dari keduanya, dan belum ada model yang mengerjakan tugas model lainnya.

Menyajikannya ke dalam alur kerja nyata

Mage-VL praktis untuk dicoba hari ini: satu checkpoint, arsitektur yang terdokumentasi, Apache-2.0, dan kartu yang memberi tahu Anda apa saja yang dibundel repositori. Model ini sudah dirilis sejak Juli dan perkakas di sekitarnya sudah punya waktu untuk mapan.

MiniCPM-V 4.7 tidak praktis untuk dicoba hari ini, karena alasan-alasan yang membosankan. 70 GB dalam BF16 tanpa kuantisasi berarti memori akselerator yang kemungkinan besar tidak Anda miliki dalam keadaan menganggur, dan lisensi yang tidak ada berarti pertanyaan apakah Anda boleh menggunakannya sama sekali masih terbuka. Jalur kode kustomnya memerlukan trust_remote_code, dan apakah kombinasi MoE-plus-linear-attention memiliki kernel di stack serving Anda belum teruji.

Yang berlaku untuk keduanya adalah bahwa model visi yang di-hosting sendiri merupakan salah satu komponen dari sistem yang juga harus memanggil model-model frontier. Itulah alasan untuk menempatkan separuh bagian yang di-hosting di balik satu router, bukan kontrak kedua dan SDK kedua: OrcaRouter menjangkau lebih dari 200 model dengan satu kunci, meneruskan harga daftar setiap penyedia tanpa markup yang kami tambahkan, dan melakukan failover secara otomatis saat penyedia mengalami degradasi. Baik Mage-VL maupun MiniCPM-V 4.7 bukanlah model yang di-hosting di layanan tersebut — keduanya adalah bobot yang Anda layani sendiri — jadi anggap ini sebagai perpipaan di sisi jauh dari serah terima, bukan sebagai saluran ketersediaan untuk salah satu model.

Vonis

Mage-VL adalah model yang sudah selesai, berlisensi, dan telah diuji tolok ukur dengan filosofi desain yang spesifik dan beralasan kuat, dan argumen untuknya bertumpu pada streaming video serta penalaran spasial, di mana encoder codec-native-nya melakukan sesuatu yang secara struktural berbeda dari yang lain. MiniCPM-V 4.7 adalah checkpoint yang lebih besar, tanpa lisensi, dan belum diukur, yang filosofi desainnya mudah dipahami tetapi perilakunya masih kosong. Untuk semua hal yang bisa ditindaklanjuti pembaca hari ini, Mage-VL menang secara default — bukan karena ia lebih baik, tetapi karena ia satu-satunya dari keduanya yang bisa dinilai sama sekali. Tinjau kembali perbandingan ini saat README MiniCPM-V 4.7 muncul; jika hari itu membawa tolok ukur dan lisensi, pertanyaan menariknya adalah apakah MoE linear-attention berkonteks 256K mengalahkan encoder sparsitas codec-native pada video panjang, dan itu adalah pertarungan yang benar-benar terbuka.