Kartu judul yang dihasilkan dalam gaya khas OrcaRouter bertuliskan “PixelUMM vs InternLumina-U2”, dengan empat ubin statistik: “41.67 / 57.33” (MMMU dan Video-MME PixelUMM), “0.81 / 51.26” (GenEval dan Video-MME InternLumina-U2), “Apache-2.0” (kode dan kedua checkpoint InternLumina-U2) dan “1-way NC” (lisensi checkpoint PixelUMM). Baris footer bertuliskan “Angka yang dilaporkan vendor; tidak ada pengujian ulang independen untuk model mana pun.”. Logo OrcaRouter dikompositkan ke strip berpadding di kanan bawah.
Guides & Insights

PixelUMM vs InternLumina-U2: Dua Beta Tanpa Encoder, dan Satu-satunya Perbedaan yang Menentukannya

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Dua model, keduanya publik, keduanya dirancang secara tidak biasa, dan hanya salah satunya yang dapat Anda jadikan dasar untuk membangun produk. PixelUMM adalah model terpadu tanpa encoder milik NVIDIA — 15,2 miliar parameter pada tulang punggung Qwen3-8B, membaca dan menulis piksel mentah melalui patch 16×16 dan tubelet 4 frame, tanpa VAE dan tanpa encoder visi di mana pun dalam stack. InternLumina-U2 adalah model difusi campuran-pakar 16B milik Shanghai AI Laboratory yang memampatkan setiap input visual menjadi delapan kode diskret komplementer melalui tokenizer bernama AToken. Keduanya bertaruh bahwa antarmuka visual adalah hambatan. Taruhan yang lebih penting adalah yang ada di berkas lisensi: InternLumina-U2 merilis bobot Apache-2.0, PixelUMM merilis checkpoint di bawah lisensi nonkomersial. Jika Anda memilih di antara keduanya untuk apa pun yang komersial, kalimat itu adalah keseluruhan perbandingannya dan sisa halaman ini adalah konteksnya.

Kedua kumpulan angka di bawah ini berasal dari laboratorium itu sendiri. Tidak ada model yang memiliki evaluasi independen, Elo arena, atau reproduksi pihak ketiga. Tidak satu pun dilayani oleh API yang dihosting. Yang berbeda adalah apa yang boleh Anda lakukan dengan artefak tersebut setelah Anda mengunduhnya, dan seberapa jauh setiap rilis sebenarnya telah berkembang.

Di mana masing-masing berada saat ini

Jadwal rilis telah bergerak dengan kecepatan yang berbeda dan keduanya secara diam-diam.

• PixelUMM — Repositori GitHub dibuat 4 September 2026; pracetak arXiv 2609.38597 bertanggal 29 September 2026; repositori model Hugging Face dibuat 1 Oktober 2026 pukul 21:40 UTC. Tidak ada posting blog, siaran pers, atau utas peluncuran NVIDIA yang muncul untuknya.

• InternLumina-U2 — Repositori GitHub dibuat 1 September 2026; stub Hugging Face didaftarkan pada hari yang sama; bobot checkpoint yang dilatih Ascend ditambahkan 10 September 2026; bobot checkpoint NVIDIA/CUDA ditambahkan 24 September 2026. Tujuh shard per stack, keduanya dapat diunduh hari ini.

InternLumina-U2 yang ada pada awal September — hanya kode, bobot "segera hadir", repositori model yang kosong — bukanlah InternLumina-U2 yang ada sekarang. Siapa pun yang membacanya di awal bulan dan menyimpulkan bahwa bobotnya hilang harus memeriksa ulang; baik checkpoint Huawei Ascend maupun NVIDIA/CUDA sudah tersedia, di bawah Apache-2.0, dengan tokenizer, konfigurasi, templat obrolan, dan kode pemodelan jarak jauh di sampingnya.

A headless-browser capture of the Hugging Face model card for the InternLumina-U2 repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters alongside the file listing for the checkpoint shards.

Dua jawaban untuk pertanyaan yang sama

Kedua model berangkat dari keluhan yang sama: membawa encoder visi untuk pemahaman dan VAE untuk generasi berarti merepresentasikan setiap gambar dua kali, kira-kira menggandakan konteks visual dan memaksa pipeline pelatihan untuk mempertahankan dua antarmuka.

Jawaban PixelUMM adalah menghapus keduanya. Piksel mentah langsung masuk melalui proyeksi linear satu lapis — patch 16×16 per posisi gambar, tubelet 4 bingkai per posisi video — dan tulang punggungnya adalah Transformer dekoder-saja yang desain Mixture-of-Transformers-nya memadukan atensi bersama dengan parameter khusus tugas. Teks diprediksi secara autoregresif; piksel diprediksi dengan flow matching. Makalah ini menghabiskan delapan bagian untuk studi desain — ukuran patch, artefak patch, dinamika ruang piksel versus ruang VAE, penskalaan komputasi — yang memberi tahu Anda bahwa pertanyaan sebenarnya tim adalah apakah paradigma ini tetap berlaku sama sekali.

Jawaban InternLumina-U2 adalah mempertahankan antarmuka diskret tetapi membuat setiap token membawa jauh lebih banyak. Tokenizer AToken mendeskripsikan setiap posisi visual dengan delapan codebook pelengkap yang mencakup tekstur, teks tersemat, dan geometri; delapan embedding digabungkan per posisi dan diproyeksikan menjadi satu token backbone. Dekode berjalan sebaliknya, dengan denoising paralel secara spasial dan head autoregresif multi-codebook yang memprediksi delapan kode secara berurutan. Backbone-nya adalah LLM difusi sparse dari garis keturunan LLaDA-2.0, total 16B dengan 1B aktif.

• Antarmuka visual — PixelUMM: patch piksel mentah dan tubelet, tanpa tokenizer sama sekali. InternLumina-U2: token sepenuhnya diskret delapan-codebook dari AToken, tanpa laten kontinu.

• Backbone — PixelUMM: Qwen3-8B (total 15,2B), dekoder padat tunggal dengan pakar pemahaman dan generasi. InternLumina-U2: model bahasa difusi MoE sparse dengan total 16B / 1B aktif.

• Metode generasi — PixelUMM: pencocokan aliran ruang piksel plus teks autoregresif. InternLumina-U2: denoising difusi bertopeng atas kode diskret.

• Tugas yang diklaim — PixelUMM: teks-ke-gambar, teks-ke-video, gambar-ke-teks, video-ke-teks. InternLumina-U2: semuanya ditambah penyuntingan gambar dan pemahaman 3D.

• Format bobot — PixelUMM: 128 shard .distcp (~30 GB) di balik indeks .metadata tersembunyi. InternLumina-U2: tujuh shard .safetensors per tumpukan perangkat keras, tata letak standar Hugging Face.

A generated scoreboard card titled “PixelUMM vs InternLumina-U2 — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: visual interface, backbone, generation method, video understanding, weight format and licence. PixelUMM's column shows raw pixel patches and tubelets, a Qwen3-8B backbone at 15.2B, pixel-space flow matching, Video-MME 57.33 with MVBench 70.53, 128 distributed-checkpoint shards, and a noncommercial checkpoint licence; InternLumina-U2's column shows eight-codebook discrete AToken tokens, a 16B-A1B sparse MoE diffusion backbone, masked diffusion denoising, Video-MME 51.26 with MVBench 59.74, seven safetensors shards per hardware stack, and Apache-2.0. A footer notes that the figures are vendor-reported with no independent rerun.

Papan skor, dengan asal-usulnya terlampir

Baca setiap baris sebagai klaim lab itu sendiri. Klaim PixelUMM berasal dari prapublikasinya; klaim InternLumina-U2 adalah deskripsi lab itu sendiri yang menyebutnya sebagai "preliminer, parsial", dengan tabel perbandingan lengkap yang ditunda sampai laporan teknis yang belum terbit.

• MMMU (penalaran gambar) — PixelUMM 41.67 (milik penulis sendiri). InternLumina-U2: tidak dilaporkan.

• ChartQA — PixelUMM 82,96. InternLumina-U2 86,52.

• DocVQA — PixelUMM 90,42. InternLumina-U2: tidak dilaporkan.

• Video-MME (tanpa subtitel) — PixelUMM 57.33. InternLumina-U2 51.26.

• MVBench — PixelUMM 70,53. InternLumina-U2 59,74.

• GenEval secara keseluruhan — PixelUMM 0.83 dengan penulis ulang prompt LLM, 0.77 tanpa itu. InternLumina-U2 0.81.

• DPG-Bench secara keseluruhan — PixelUMM 85.74. InternLumina-U2 87.10.

• Pembuatan video — PixelUMM VBench Bagian 1 kualitas 84.10 / semantik 79.80, Bagian 2 total 83.24. InternLumina-U2: tidak dilaporkan.

• Pemahaman 3D — PixelUMM: tidak ada tugas seperti itu. InternLumina-U2 melaporkan 3D MM-Vet 41.8.

Perbandingannya tidak seimbang karena kedua lab menerbitkan tabel yang berbeda, bukan karena salah satunya lebih unggul. PixelUMM memiliki bagian pembuatan video yang lengkap dan tidak memiliki penyuntingan atau 3D; InternLumina-U2 mengklaim enam keluarga tugas dan melaporkan tabel parsial di seluruh keluarga tersebut. Angka lintas lab pada nama benchmark yang sama bukanlah pengukuran yang sama — pembagian data, prompt, dan pengambilan sampel berbeda — jadi anggap baris ChartQA dan GenEval kurang lebih setara dan berhenti sampai di situ.

Pemberian lisensi adalah titik ketika ini tidak lagi menjadi seri.

Inilah bagian yang tidak ditunjukkan oleh tabel benchmark mana pun. Repositori PixelUMM berlisensi Apache-2.0 dan model card-nya menyatakan hal itu secara mencolok. Checkpoint adalah artefak terpisah di bawah NVIDIA One-Way Noncommercial License, yang dibatasi untuk riset atau evaluasi nonkomersial, dan satu file sumber juga tetap memuat pemberitahuan CC BY-NC 4.0 yang diwarisi dari DiT. Penggunaan untuk riset: tidak masalah. Fitur produk internal: perlu percakapan dengan tim legal, dan mungkin hanya singkat.

InternLumina-U2 sepenuhnya Apache-2.0, baik kode maupun kedua checkpoint-nya, tanpa ketentuan nonkomersial terpisah. Bagi tim yang perlu merilis produk, itu bukan keunggulan kecil — itu adalah keseluruhan keputusan. Kedua model berada pada kematangan tingkat riset. Hanya satu di antaranya yang penggunaannya tidak dibatasi.

Yang mana yang sebenarnya harus dicoba, dan bagaimana

Jika pekerjaan Anda adalah pemahaman video atau Anda menginginkan model yang menghasilkan video dan gambar dari satu set bobot, PixelUMM adalah artefak yang lebih lengkap dan makalahnya lebih berguna untuk dibaca — tetapi ini adalah proyek riset dengan lisensi nonkomersial, jadi tempatnya di bangku evaluasi, bukan di dalam pipeline. Jika pekerjaan Anda adalah keluasan pembuatan bagan, dokumen, dan gambar, atau Anda memerlukan penyuntingan dan 3D, InternLumina-U2 mencakup lebih banyak hal dan tidak memiliki batas lisensi; biayanya adalah bahwa tulang punggung difusi 16B-A1B dan tokenizer AToken berarti rekayasa penyajian yang nyata, dan angka-angka yang dipublikasikan secara eksplisit bersifat parsial.

Tidak satu pun dari keduanya ada di API terhosting mana pun pada saat penulisan ini, dan itu termasuk OrcaRouter — kami tidak merutekan model mana pun dari keduanya. Ketika itu berubah, argumen untuk menjangkau keduanya melalui lapisan routing alih-alih integrasi langsung adalah argumen yang sama yang berlaku untuk model yang baru dibuka: satu kunci untuk 200+ model, harga daftar penyedia diteruskan pada markup 0%, dan failover otomatis sehingga model yang ternyata lebih buruk daripada yang disiratkan tabel vendornya dapat diturunkan dengan mengubah rute alih-alih menulis ulang deployment. Sampai saat itu, saran yang jujur adalah yang membosankan — unduh lisensi mana pun yang mengizinkan kasus penggunaan Anda, jalankan evaluasi Anda sendiri pada data Anda sendiri, dan jangan merencanakan berdasarkan angka dari lab mana pun sampai seseorang di luar lab menjalankan ulang angka-angka tersebut.

Apa yang bisa mengubah jawabannya

Tiga hal, dalam urutan dampak. Lisensi komersial untuk checkpoint PixelUMM akan membuat perbandingannya benar-benar ketat dan akan menggesernya dari "baca papernya" menjadi "evaluasi bobotnya". Laporan teknis dari Shanghai AI Laboratory yang memuat tabel perbandingan lengkap akan mengubah angka parsial InternLumina-U2 menjadi sesuatu yang dapat diperiksa, dan juga akan mengungkap seberapa besar dari keluasan enam tugas yang berada pada tingkat setara versus pada kedalaman token. Dan reproduksi independen pertama untuk salah satu model — GenEval atau MVBench yang dijalankan ulang oleh tim yang tidak memiliki kepentingan pada hasilnya — adalah momen ketika salah satu dari ini berhenti menjadi tabel vendor. Sampai saat itu, yang satu adalah arsitektur tak biasa yang hanya bisa Anda pelajari, dan yang lain adalah arsitektur tak biasa yang bisa Anda rilis.