
InternLumina-U2 vs Microsoft Mage-VL: Dua Lab Diam-diam Bertaruh bahwa Token Visual Seharusnya Membawa Lebih Banyak
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2658Kecerdasan72Koding
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
Microsoft Mage-VL dan InternLumina-U2 sama-sama dirilis dengan cara laboratorium riset merilis sesuatu ketika mereka belum yakin hasilnya sudah menjadi produk: secara senyap. Microsoft menerbitkan bobot dan kode Mage-VL di Hugging Face pada 25 Juli 2026 tanpa pengumuman apa pun; organisasi InternLM dari Shanghai AI Laboratory menerbitkan kode inferensi InternLumina-U2 di GitHub pada 1 September 2026 juga tanpa pengumuman. Dalam rentang lima minggu, dua laboratorium terbesar di dunia merilis model yang berbagi keyakinan hening — bahwa cara kita mengubah penglihatan menjadi token adalah hambatan utamanya — lalu membiarkannya untuk ditemukan oleh komunitas. Salah satunya dapat Anda unduh dan jalankan hari ini, meski dengan cara yang kaku. Yang lainnya tidak dapat Anda jalankan sama sekali, karena bobotnya belum ada. Inilah peta jujur dari keduanya, dan mengapa "sama-sama dilaporkan vendor, sama-sama belum terbukti" bukan kalimat yang sama bagi keduanya.
Lima minggu, dua taruhan pada efisiensi representasi.
Benang merahnya nyata, bukan sekadar retorika. Mage-VL adalah model video native-codec: alih-alih mendekode aliran menjadi bingkai-bingkai dengan sampling seragam dan mendorong grid padat patch melalui vision transformer yang telah dilatih sebelumnya di web, model ini mengikuti struktur codec video modern—memisahkan aliran menjadi bingkai jangkar dan data gerak terkompresi di antara keduanya, lalu memproses representasi ringkas tersebut secara langsung. Keuntungan yang dilaporkan Microsoft adalah pengurangan besar pada token visual dan jalur persepsi streaming yang jauh lebih cepat—perusahaan tersebut membingkainya sebagai perbaikan atas semacam paradoks Moravec untuk model bahasa video, di mana tugas persepsi real-time kecil memakan komputasi sebanyak penalaran offline yang sulit. Mage-VL adalah pengamat: ia mengonsumsi video secara efisien dan menjawab pertanyaan tentang apa yang dilihatnya, hampir secara real-time.
InternLumina-U2 adalah taruhan pada hambatan yang sama dari arah yang berlawanan. Jika Mage-VL mengompresi video dengan mengikuti codec, InternLumina-U2 mengompresi setiap masukan visual dengan mendeskripsikan setiap posisi menggunakan delapan kode diskret yang saling melengkapi, bukan satu, melalui tokenizer yang disebut AToken oleh laboratorium tersebut. Taruhannya adalah bahwa satu codebook membatasi seberapa banyak informasi yang dapat dibawa oleh satu token visual, sehingga kosakata multi-codebook memungkinkan satu model difusi berparameter 16B untuk melakukan pemahaman dan pembuatan melalui antarmuka yang sama — membaca bagan, menjawab pertanyaan video, mendeskripsikan aset 3D, menghasilkan gambar dari teks, mengeditnya berdasarkan instruksi — tanpa tumpukan pembuatan terpisah. Mage-VL ingin memahami aliran video secara efisien; InternLumina-U2 ingin memahami dan menggambar dengan satu set bobot.
Papan skor
Angka kedua model dilaporkan oleh vendor dan belum direproduksi, sehingga papan skor menandai setiap baris dengan sumber asalnya.
• Bentuk — Mage-VL: model visi-bahasa asli codec yang ringkas (sekitar 5B parameter dalam BF16) yang dibungkus di sekitar tulang punggung teks Qwen, dilatih untuk pemahaman gambar dan video. InternLumina-U2: MoE dengan parameter 16B dan 1B aktif (16B-A1B), LLM difusi jarang yang mencakup pemahaman, pembuatan, dan penyuntingan.
• Representasi visual — Mage-VL: token native-codec yang mengikuti struktur codec video (jangkar plus gerakan); dilaporkan pengurangan token visual >75% pada video streaming. InternLumina-U2: token delapan-codebook yang sepenuhnya diskret dari tokenizer AToken.
• Apa yang dilakukannya — Mage-VL: melihat input gambar dan video, menjawab dalam teks; dirancang untuk persepsi streaming. InternLumina-U2: mengklaim pemahaman teks, pemahaman gambar, teks-ke-gambar, penyuntingan gambar, pemahaman video, dan pemahaman 3D.
• Bobot — Mage-VL: publik di Hugging Face sejak 25 Juli 2026 (microsoft/Mage-VL, Apache-2.0). InternLumina-U2: tidak dipublikasikan — repositori Hugging Face adalah stub kosong, bobot ditandai "segera hadir."
• Angka utama — Mage-VL: Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, semuanya dilaporkan Microsoft. InternLumina-U2: ChartQA 86.52, MathVision 33.22, VideoMME 51.26, GenEval 0.81, semuanya dilaporkan lab, bersifat pendahuluan dan sebagian.
Realitas penyajian — Mage-VL: dapat diunduh, tetapi tidak ada jalur vLLM atau SGLang standar; kode tersebut memerlukan trust_remote_code, dan belum ada penyedia inferensi yang menyebarkannya saat ini. InternLumina-U2: tidak dapat dilayani oleh siapa pun — bobotnya tidak tersedia untuk publik, dan bahkan driver inferensi yang dirilis pun mengharapkan file checkpoint yang tidak ada di repositori.

"Tersedia tetapi canggung" tidak sama dengan "tidak tersedia"
Inilah perbedaan yang paling penting jika Anda benar-benar mencoba membangun sesuatu. Mage-VL nyata dalam cara yang paling utama: bobotnya tersedia di Hugging Face, kartu modelnya telah mengalami lalu lintas unduhan yang deras sejak akhir Juli, dan sebuah ekosistem kecil kuantisasi komunitas telah bermunculan di sekitarnya. “Nyata” bukan berarti “mudah.” Kartu model menampilkan tag kode kustom, encoder visualnya bukan ViT beku standar yang diasumsikan oleh stack serving yang ada, dan repositori Microsoft sendiri membawa konsekuensi praktis — menjalankannya berarti trust_remote_code dan tidak ada penyebaran penyedia siap pakai. Tetapi tim yang gigih dengan GPU dapat memuatnya, mengarahkannya ke aliran video, dan melihat apakah tesis codec-native berlaku untuk data mereka. Itu adalah perbedaan yang sangat besar dari InternLumina-U2, di mana kalimat yang sama berakhir dengan cara yang berbeda: tim yang gigih dapat membaca kode inferensi, lalu berhenti, karena tidak ada bobot yang bisa dimuat.

Kartu Hugging Face microsoft/Mage-VL, ditangkap pada 27 Agustus 2026 — deskripsi streaming native-codec, lisensi Apache-2.0, tag arxiv, dan bagian penyedia inferensi yang menunjukkan tidak ada penyedia yang saat ini menerapkan model tersebut.
Ketidakseimbangan tolok ukur mengikuti garis yang sama. Angka-angka kedua model hanyalah klaim vendor tanpa pengujian ulang independen. Namun klaim Mage-VL setidaknya didasarkan pada artefak yang dapat diunduh, yang berarti jarak antara klaim dan verifikasi hanyalah soal seseorang menjalankannya. Klaim InternLumina-U2 didasarkan pada item peta jalan — "tabel perbandingan lengkap akan muncul dalam laporan teknis mendatang" — dan tidak ada artefak yang dapat memverifikasinya. Tabel parsial lab itu sendiri bahkan menunjukkan model tersebut tertinggal dari setidaknya satu pesaing yang diklaim dapat diungguli (GenEval 0,81 berbanding LLaDA2.0-Uni 0,89), yang merupakan pengingat yang berguna untuk membaca label "pendahuluan, parsial" secara harfiah.
Di mana mereka bisa berkarya daripada berkompetisi.
Cara paling berguna untuk memandang keduanya adalah {{1}}sebagai anak tangga yang bersebelahan pada sebuah tangga, bukan sebagai pesaing untuk pekerjaan yang sama{{/1}}. Pemantau native-codec seperti Mage-VL menarik {{2}}justru karena biayanya cukup murah untuk dijalankan terus-menerus{{/2}} — {{3}}entitas yang mengawasi setiap bingkai dari sebuah aliran dan hanya mengeskalasi ketika muncul sesuatu yang layak mendapat perhatian model yang lebih besar{{/3}}. Model yang lebih besar yang menerima eskalasi itu, pada prinsipnya, dapat berupa model terpadu seperti yang diklaim InternLumina-U2: {{4}}gerbang yang selalu aktif yang memutuskan apa yang perlu dilihat, dan model mendalam yang benar-benar membaca grafik, mengikuti pemandangan 3D, atau menghasilkan gambar hasil suntingan{{/4}}. Keduanya belum terbukti — Mage-VL {{5}}belum terbukti tetapi dapat dijalankan{{/5}}, InternLumina-U2 {{5}}belum terbukti dan belum dirilis{{/5}} — jadi penggambaran yang jujur adalah {{6}}komposisi yang dapat Anda susun setelah masing-masing sisi divalidasi secara independen, bukan adu langsung yang dapat Anda jalankan hari ini{{/6}}.

Repositori GitHub InternLM/InternLumina-U2, ditangkap pada 2 September 2026 — laman beranda repositori yang menampilkan deskripsi difusi multi-codebook, lencana lisensi Apache-2.0, serta skrip titik masuk inferensi yang membentuk rilis publik sementara bobot tetap tidak disertakan dalam pohon repositori.
Apa yang dilakukan lapisan perutean terhadap titik pemeriksaan yang belum terbukti
Tidak satu pun dari model-model ini dihosting di OrcaRouter, dan kami tidak akan menyiratkan hal lain — Mage-VL tidak memiliki jalur serving standar di mana pun, dan InternLumina-U2 tidak memiliki bobot. Yang benar-benar berguna dari routing DSL dalam situasi ini adalah mengekspresikan komposisi di atas sebagai satu panggilan, bukan sebagai kode perekat yang dibuat khusus: model persepsi murah yang selalu aktif memberi masukan ke model yang lebih dalam, dirantai sehingga model mahal hanya berjalan ketika model murah mengatakan ada yang berubah. Dan untuk masalah checkpoint yang belum terbukti — yang merupakan seluruh profil risiko dari keduanya — failover otomatis adalah mekanisme yang memungkinkan tim mencoba model seperti Mage-VL di jalur nyata tanpa mempertaruhkan jalur tersebut pada model itu: saat pertama kali checkpoint baru macet, mengembalikan sampah, atau melempar error, panggilan akan jatuh ke model yang sudah terbukti, dan tidak ada engineer yang perlu dibangunkan untuk membalik sakelar. Satu API di lebih dari 200 model, harga daftar penyedia diteruskan tanpa markup 0%, dan hal baru tersebut diuji di balik jaring pengaman, bukan di depan production.
Intinya
Jika Anda ingin menguji tesis codec-native-video hari ini, hanya Mage-VL yang ada — dan "ada" {{1}}hadir dengan catatan tentang kode khusus dan peladenan DIY{{/1}}. Jika Anda ingin menguji tesis model-terpadu multi-codebook, {{2}}Anda tidak bisa{{/2}}, karena InternLumina-U2 {{3}}masih berupa spesifikasi yang menunggu bobotnya{{/3}}; yang bisa Anda lakukan adalah membaca arsitekturnya sekarang agar Anda siap begitu {{4}}stub di Hugging Face terisi{{/4}}. Perlakukan model Microsoft sebagai artefak yang canggung tetapi nyata, {{5}}dan model Shanghai AI Lab sebagai janji yang terdokumentasi baik{{/5}}, serta ingat bahwa dalam perbandingan ini, {{6}}"dilaporkan vendor dan belum direproduksi"{{/6}} berlaku untuk keduanya — itu hanya berarti sesuatu yang berbeda ketika ada file yang bisa Anda unduh.
