Kartu judul yang dihasilkan dalam gaya khas OrcaRouter bertuliskan “PixelUMM vs Microsoft Mage-VL”, dengan empat kotak statistik: “>75%” (pengurangan token visual yang dilaporkan Mage-VL), “3.5×” (percepatan waktu dinding yang dilaporkannya dibandingkan pengambilan sampel bingkai seragam), “15.2B vs 4B” (total PixelUMM dibandingkan tulang punggung Qwen3-4B milik Mage-VL) dan “0 / 1” (kemampuan generasi nol Mage-VL dibandingkan satu model PixelUMM yang mencakup gambar dan video). Baris footer bertuliskan “Angka dari kedua lab itu sendiri; tidak ada pengujian ulang independen untuk model mana pun.”. Logo OrcaRouter dikompositkan ke dalam strip berpadding di bagian kanan bawah.
Guides & Insights

PixelUMM vs Microsoft Mage-VL: Yang Satu Menghapus Tokenizer Visual, yang Lain Menulis Ulangnya

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Baik PixelUMM maupun Microsoft Mage-VL dibangun oleh tim-tim yang yakin bahwa cara visi diubah menjadi token adalah hambatan yang salah — dan mereka memperbaikinya ke arah yang berlawanan. Mage-VL, model streaming native codec milik Microsoft, mempertahankan tokenizer dan membuatnya jauh lebih agresif: model ini mengikuti struktur codec video modern, mempertahankan setiap frame anchor dan hanya patch frame prediksi di tempat codec menghabiskan bit, dan melaporkan pemangkasan token visual lebih dari 75% sekaligus memperoleh percepatan wall-clock hingga 3,5× dibandingkan pengambilan sampel frame yang seragam. PixelUMM, model terpadu tanpa encoder milik NVIDIA, menghapus tokenizer sepenuhnya — setiap patch 16×16 dari piksel mentah mencapai backbone melalui satu proyeksi linear, tanpa VAE dan tanpa vision transformer di mana pun. Yang satu mengompresi lebih keras. Yang lain menolak mengompresi sama sekali. Dan hanya salah satunya yang dapat menghasilkan apa pun.

Perbedaan terakhir itulah yang membuat pasangan ini lebih menarik daripada adu spesifikasi. Mage-VL adalah pengawas — model persepsi streaming dengan gerbang proaktif yang memutuskan kapan harus berbicara. PixelUMM adalah pembaca yang juga menggambar: bobot yang sama menjawab pertanyaan tentang sebuah gambar dan menghasilkan video baru dari prompt teks. Keduanya adalah dua jawaban yang tidak kompatibel atas "seperti apa seharusnya model visi terpadu", dan angka tiap lab adalah miliknya sendiri.

Di mana kompresi terjadi

Premis Mage-VL adalah paradoks Moravec modern: model vision-language kuat dalam penalaran offline yang sulit, tetapi lambat dan haus komputasi pada persepsi real-time yang sederhana. Solusinya adalah penyelarasan codec. Alih-alih mendekode stream menjadi frame yang disampel secara seragam dan mendorong grid padat melalui ViT yang dibekukan dan dipralatih web, Mage-VL memisahkan stream menjadi frame anchor (I) dan frame prediksi (P), mempertahankan semua patch anchor, dan hanya menyimpan patch frame prediksi yang membawa gerakan nyata atau detail baru. Encoder-nya, Mage-ViT, dilatih dari awal pada grid patch 16×16 dengan pengodean posisi rotari 3D dan secara eksplisit agnostik terhadap codec — antarmuka yang sama menerima vektor gerak dan energi residual H.264/AVC atau HEVC, atau peta laju yang dipelajari dari codec neural, tanpa perubahan arsitektur atau pelatihan ulang.

Premis PixelUMM adalah bahwa encoder itu sendiri adalah masalahnya, bukan efisiensinya. Makalahnya berargumen bahwa model seperti BAGEL membawa dua antarmuka visual — ViT untuk fitur semantik dan VAE untuk laten rekonstruksi — yang secara kasar menggandakan konteks visual per gambar pengondisian dan memaksa pipeline prapelatihan bahasa-visi dibangun ulang di sekitar aliran kedua. PixelUMM menghapus keduanya: gambar menjadi patch spasial 16×16, video menjadi tubelet spasiotemporal 4-frame, dan piksel mentah mencapai Transformer decoder-only melalui proyeksi linear satu lapis. Pemahaman adalah teks autoregresif; generasi adalah flow matching di ruang piksel.

• Strategi kompresi — Mage-VL: temporal, berasal dari codec; pertahankan anchor, jarangkan frame yang diprediksi. PixelUMM: tidak ada; pertahankan setiap patch piksel mentah.

• Apa yang dilatih dari awal — Mage-VL: seluruh tumpukan visual, pada sekitar 100 juta gambar dan video tanpa label. PixelUMM: embedder dan dekoder piksel, di atas tulang punggung bahasa Qwen3-8B.

• Backbone — Mage-VL: Qwen3-4B-Instruct-2507, satu-satunya komponen yang telah dilatih sebelumnya (pretrained), di balik proyektor MLP dua lapis. PixelUMM: Qwen3-8B, sekitar 15,2B parameter secara total.

• Perilaku streaming — Mage-VL: gerbang kognisi menilai setiap jendela bergulir dan tetap diam hingga peristiwa yang layak ditanggapi selesai, baru kemudian memanggil model penuh. PixelUMM: tidak ada mode streaming; permintaan adalah panggilan generasi atau pemahaman.

A headless-browser capture of the Hugging Face model card for the Microsoft Mage-VL repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

Apa yang masing-masing lakukan, dan apa yang tidak

Mage-VL adalah satu checkpoint tunggal yang secara bersamaan menyediakan pemahaman gambar dan video serta gerbang streaming proaktif — bobot yang sama menjawab pertanyaan offline dan menggerakkan komentar yang dipicu peristiwa. Paket ini menggabungkan prosesor codec, paket codec neural, dan gerbang tersebut. Rilis kedua, microsoft/Mage-ViT, adalah encoder visual mandiri dari tahap prapelatihan dari awal, yang ditawarkan sebagai front end drop-in untuk pelatihan multimodal lainnya. Yang tidak dilakukan Mage-VL adalah menghasilkan. Ia membaca.

PixelUMM mencakup text-to-image, text-to-video pada 96 frame dan 24 fps, serta teks yang dikondisikan oleh gambar dan video. Ini hadir dengan empat checkpoint — S8-F22-R05 sebagai default yang mencakup keempat tugas, S8-F18-R01 yang disetel untuk text-to-video yang lebih baik pada 480p dan 720p tetapi tidak mampu melakukan pemahaman video, dan dua tahap perantara. Yang tidak dapat dilakukannya adalah streaming, pengeditan, atau 3D. Jika Anda memerlukan model yang mengamati feed langsung dan berbicara saat sesuatu terjadi, PixelUMM sama sekali bukan bentuk yang tepat, dan tidak ada kolom benchmark yang akan memberi tahu Anda hal itu.

Kesenjangan adopsi adalah sinyal jujur pertama.

Kedua rilis tersebut tidak sama matangnya, dan penghitung unduhan mengatakan hal itu lebih jelas daripada postingan peluncuran mana pun.

• Mage-VL — diterbitkan di Hugging Face pada 25 Juli 2026 di bawah Apache-2.0, disertai laporan teknis pendamping dan pengenal arXiv. Pada awal Oktober, model ini telah mencatat sekitar 13.800 unduhan dan 414 suka, dan sebuah ekosistem kecil karya komunitas telah tumbuh di sekitarnya.

• PixelUMM — dipublikasikan di Hugging Face pada 1 Oktober 2026 di bawah lisensi checkpoint nonkomersial. Jumlah unduhannya nol dan jumlah sukaannya tiga saat ini ditulis. Ini baru berumur beberapa hari.

Masih belum ada pengumuman dari kedua laboratorium untuk rilis masing-masing — Mage-VL dirilis pada Juli tanpa pengumuman, dan PixelUMM dirilis pada Oktober tanpa pengumuman. Simetri itu nyata, tetapi akan menjadi kesalahan untuk menafsirkannya sebagai keduanya merupakan artefak yang setara. Mage-VL telah mendapatkan perhatian komunitas selama sepuluh minggu; PixelUMM baru beberapa hari. Model yang belum pernah dijalankan oleh siapa pun di luar laboratorium adalah proposisi yang berbeda dari model yang telah diunduh oleh beberapa ribu orang, dan hanya satu dari keduanya yang berada dalam kategori kedua.

A generated scoreboard card titled “PixelUMM vs Microsoft Mage-VL — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: visual tokenizer, backbone, trained from scratch, streaming, generation and licence. Mage-VL's column shows a codec-native sparse token grid, a Qwen3-4B-Instruct-2507 backbone, a Mage-ViT pretrained from scratch on about 100M unlabeled media, proactive streaming with a cognition gate, no generation, and Apache-2.0; PixelUMM's column shows no tokenizer at all, a Qwen3-8B backbone at 15.2B total, pixel embedders and decoders trained on top of it, no streaming mode, text-to-image and text-to-video plus understanding, and a noncommercial checkpoint licence. A footer notes that the figures are vendor-reported with no independent rerun.

Papan skor, dengan provenans

Setiap angka adalah milik lab pengembangnya sendiri. Angka Mage-VL berasal dari kartu dan laporan teknis Microsoft; PixelUMM dari pracetaknya. Keduanya belum direproduksi secara independen.

• Token visual — Mage-VL: dilaporkan terjadi pengurangan lebih dari 75% dibandingkan pengambilan sampel frame secara padat. PixelUMM: tidak ada pengurangan; argumennya adalah bahwa patch mentah menghilangkan pengodean kedua alih-alih menyusutkan pengodean pertama.

• Kecepatan wall-clock — Mage-VL: hingga 3,5× lebih cepat daripada pengambilan sampel frame seragam pada akurasi yang setara, menurut laporan Microsoft. PixelUMM: tidak ada klaim kecepatan komparatif dalam makalah.

• Kualitas encoder — Mage-VL: Mage-ViT melaporkan 99,33% pada CIFAR-10 dan 85,69% pada ImageNet dengan anggaran 256 token, dari sekitar 100 juta media tanpa label. PixelUMM: tidak ada tolok ukur encoder yang setara, karena tidak ada encoder yang dapat diukur.

• Pemahaman video — Mage-VL: melaporkan peningkatan dibandingkan Qwen3-VL-4B pada setiap tolok ukur video dan temporal-grounding yang dilaporkannya, termasuk +22,5 pada QVHighlight dan +17,1 pada ActivityNet. PixelUMM: MVBench 70,53, Video-MME 57,33 tanpa subtitle, LongVideoBench 59,61, LVBench 40,41.

• Pemahaman gambar — Mage-VL: setara dengan Qwen3-VL-4B pada gambar statis, menurut laporan Microsoft. PixelUMM: MMMU 41,67, AI2D 80,12, DocVQA 90,42, ChartQA 82,96.

• Generasi — Mage-VL: tidak ada. PixelUMM: GenEval keseluruhan 0.83 dengan penulis ulang prompt, DPG-Bench 85.74, VBench Bagian 1 kualitas 84.10.

• Streaming — Mage-VL: penggatingan peristiwa proaktif dengan TimVal teratas yang dilaporkan, F1, ROC-AUC, dan PR-AUC pada streaming SoccerNet. PixelUMM: tidak didukung.

• Lisensi — Mage-VL: Apache-2.0, kode dan bobot. PixelUMM: kode Apache-2.0, Lisensi Nonkomersial Satu Arah NVIDIA pada checkpoint.

Kedua kolom tersebut tidak cukup tumpang tindih untuk menentukan peringkat. Mage-VL melaporkan encoder efisien yang mengalahkan pesaing pada skala yang sama; PixelUMM melaporkan model 15B yang berada dalam rentang yang sama dengan sistem-sistem spesialis di sekitarnya, dan menyatakan secara terus terang dalam makalahnya sendiri bahwa data pelatihan yang berbeda berarti hasilnya "tidak dapat menetapkan arsitektur mana yang lebih unggul".

Perpecahan praktis

Pilih berdasarkan pekerjaan, bukan skor. Jika Anda membangun persepsi video waktu nyata — monitor yang mengamati stream dan berkomentar saat sesuatu terjadi, dengan biaya token sebagai kendala yang mengikat — Mage-VL adalah satu-satunya dari keduanya yang melakukannya, lisensinya Apache-2.0, dan skala kelas 4B-nya berarti satu node dapat melayaninya. Jika Anda membutuhkan satu model yang membaca gambar dan video serta menghasilkannya juga, PixelUMM adalah satu-satunya dari keduanya yang melakukannya, tetapi ia adalah artefak riset dengan lisensi nonkomersial, bobotnya adalah 128 pecahan checkpoint terdistribusi di balik indeks tersembunyi, dan text-to-video menjalankan guardrail Cosmos secara bawaan dengan lingkungan Python terpisah untuk gerbang tersebut.

Bagi tim yang membutuhkan kedua kemampuan tersebut, argumen untuk mencapainya melalui satu lapisan routing alih-alih dua integrasi langsung cukup jelas meskipun keduanya belum di-hosting saat ini: satu kunci, harga daftar penyedia yang diteruskan dengan markup 0%, dan aturan failover yang memungkinkan Anda menempatkan model Apache-2.0 yang baru dibuka di depan sebagian trafik sementara model yang sudah terbukti menangani sisanya. OrcaRouter dibangun untuk bentuk masalah seperti itu — dan supaya jelas, kami tidak merutekan PixelUMM maupun Mage-VL saat ini, jadi ini adalah deskripsi alur kerja, bukan daftar.

Apa yang bisa menyelesaikannya

Dua peristiwa yang penting. Yang pertama adalah pengujian ulang independen atas angka encoder Mage-ViT atau hasil video Mage-VL oleh seseorang yang tidak memiliki kepentingan terhadapnya — sepuluh minggu unduhan belum menghasilkan satu pun. Yang kedua adalah perubahan apa pun pada lisensi checkpoint PixelUMM, satu-satunya fakta yang saat ini membedakan antara artefak riset dan sesuatu yang dapat di-deploy. Sampai salah satunya terjadi, hal berguna yang bisa Anda katakan tentang pasangan ini adalah bahwa Microsoft bertaruh pada membuat antarmuka visual lebih murah dan NVIDIA bertaruh pada menghapusnya, dan tidak ada taruhan yang telah dinilai oleh siapa pun di luar lab yang memasangnya.