
NVIDIA PixelUMM Dirilis Tanpa Pengumuman — Bobotnya Baru Saja Tiba
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 223 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Cara termudah untuk mengetahui bahwa NVIDIA membangun model multimodal terpadu baru adalah dengan menyadari bahwa tidak ada yang memberi tahu Anda. nvidia/PixelUMM merupakan repositori yang muncul di Hugging Face pada 21.40 UTC, 1 Oktober 2026, membawa checkpoint berparameter 15,2 miliar yang seluruh tumpukan pembelajarannya berada di atas tulang punggung Qwen3-8B — dan tidak ada postingan blog, siaran pers, slide keynote, maupun utas peluncuran yang menyertainya. Pencarian untuk nama itu tidak menemukan apa pun di blog NVIDIA sendiri. Yang ada sebagai gantinya adalah repositori GitHub, halaman proyek yang URL-nya sendiri masih bertuliskan "preview", pracetak arXiv bernomor 2609.38597, dan checkpoint yang terbagi ke dalam 128 file dengan indeks tersembunyi yang membuat loader menolak menjalankannya tanpa indeks itu. PixelUMM nyata dan dapat diunduh hari ini. Apakah NVIDIA menganggapnya sudah dirilis adalah pertanyaan yang belum dijawab perusahaan.
Celah itu — antara artefak yang ada dan vendor yang tidak mengatakan apa pun — adalah inti dari seluruh cerita ini, dan penting untuk tepat mengenai di sisi mana setiap fakta berada. Semua yang berikut berasal dari repositori, kartu model, dan makalah yang diterbitkan sendiri oleh para penulis. Tidak ada yang berasal dari pengumuman, karena memang tidak ada pengumuman.
Apa yang muncul, dan kapan
Rangkaian ini berlangsung sekitar empat minggu, dan setiap bagiannya hadir dengan tenang.
• 4 September 2026 — nv-tlabs/PixelUMM dibuat di GitHub di bawah lisensi repositori Apache-2.0, dijelaskan secara sederhana sebagai "Pemahaman dan Generasi Gambar serta Video Terpadu Tanpa Encoder". Repositori ini hanya memiliki satu commit awal hingga akhir September.
• 28–29 September 2026 — commit awal repositori ini masuk, dan arXiv menetapkan pracetak arXiv:2609.38597, bertanggal 29 September, yang mencantumkan penulis dari NVIDIA dan University of Waterloo: Cong Wei, Xuanchi Ren, Bryan Chu, Weiming Ren, Huan Ling, Jiahui Huang, Laura Leal-Taixé, Sanja Fidler, Wenhu Chen, Zian Wang dan Jay Zhangjie Wu.
• 1 Oktober 2026, 21:32 UTC — sebuah commit terakhir ke repositori berjudul "docs: add PixelUMM paper citation".
• 1 Oktober 2026, 21.40 UTC — repositori model Hugging Face dibuat, delapan menit kemudian, dan terisi dengan shard checkpoint.
Halaman proyek ini dihosting di jalur yang secara harfiah berbunyi pixelumm-project-page-preview, dan makalahnya tidak mencantumkan baris venue — tidak ada CVPR, tidak ada NeurIPS, tidak ada "accepted to". Jika digabungkan, rangkaian ini terbaca seperti tim riset yang meluncurkan artefak makalah secara langsung dan membiarkan unggahan HF menjadi pengumumannya. Itu adalah observasi tentang bukti, bukan klaim tentang niat: NVIDIA mungkin saja punya peluncuran yang direncanakan nanti, dan tidak ada apa pun di sini yang menutup kemungkinan itu.

Apa sebenarnya PixelUMM
Tesis desainnya dinyatakan di baris pertama kartu model: tanpa VAE, tanpa vision encoder. Jika model terpadu konvensional membawa dua antarmuka visual — vision transformer yang menghasilkan fitur semantik untuk pemahaman, dan variational autoencoder yang menghasilkan laten rekonstruksi untuk generasi — PixelUMM tidak membawa satu pun. Gambar dipotong menjadi patch piksel 16×16; video dipotong menjadi tubelet spatiotemporal 4-frame; keduanya mencapai backbone hanya melalui proyeksi linear satu lapis. Piksel mentah masuk; piksel mentah keluar.
• Arsitektur — Transformer decoder-only dengan penyematan patch piksel mentah dan head generasi piksel iteratif, dijelaskan dalam makalah sebagai Mixture-of-Transformers yang memasangkan atensi bersama dengan parameter khusus tugas.
• Backbone — Qwen3-8B, dipatok ke revisi b968826d9c46dd6066d109eabc6255188de91218. Hanya file config dan tokenizer-nya yang diperlukan; checkpoint tersebut membawa bobot bahasa yang telah dipelajarinya sendiri.
• Parameter — 15.199.672.064 (sekitar 15,2B), ditampilkan sebagai "8B MoT" dalam tabel benchmark milik makalah itu sendiri, di mana notasi ukurannya menghitung backbone dan generation expert secara terpisah.
• Tujuan — prediksi teks autoregresif dan pencocokan aliran ruang piksel yang dilatih secara bersama-sama, yang memungkinkan satu set bobot untuk menjawab pertanyaan tentang gambar sekaligus menggambar gambar baru.
• Tugas — teks-ke-gambar, teks-ke-video pada 96 frame / 24 fps / 4 detik, teks yang dikondisikan gambar, dan teks yang dikondisikan video.
Bagian empiris makalah ini tidak biasa dalam arti yang layak diperhatikan. Delapan dari bagiannya adalah studi tentang pilihan desain, bukan posisi di papan peringkat — ukuran patch gambar, ukuran patch video, artefak patch, dinamika pelatihan ruang piksel versus ruang VAE, ukuran model, penskalaan komputasi, pengondisian konteks multimodal, dan antarmuka pemahaman video. Itu adalah makalah yang ditulis oleh orang-orang yang berusaha menjawab apakah pendekatan ini berhasil, bukan makalah yang berusaha memenangkan sebuah tabel.
Angka-angka itu milik penulis sendiri.
Setiap angka di bawah ini dilaporkan oleh penulis PixelUMM dalam pracetak mereka sendiri. Tidak ada reproduksi independen, tidak ada Elo arena, dan tidak ada evaluasi pihak ketiga, karena model ini paling lama berusia enam minggu dan muncul sebelum adanya perangkat evaluasi eksternal apa pun. Anggap ini sebagai klaim yang disertai tautan unduhan, bukan sebagai performa yang telah diverifikasi.
• Pemahaman gambar — MMMU 41,67, MMStar 53,99, AI2D 80,12, DocVQA 90,42, ChartQA 82,96, OCRBench 78,00, BLINK 53,46, MMMU-Pro 27,63, pada protokol resmi LMMS-Eval (64.750 generasi di 21 tugas).
• Pemahaman video — MVBench 70.53, Video-MME 57.33 tanpa subtitle, LongVideoBench 59.61, LVBench 40.41.
• Pembuatan gambar — GenEval keseluruhan 0,83 dengan penulis ulang prompt LLM, 0,77 tanpanya; DPG-Bench keseluruhan 85,74.
• Pembuatan video — skor kualitas VBench Bagian 1 84.10, skor semantik 79.80; total VBench Bagian 2 83.24.
Pembacaan yang jujur adalah bahwa ini adalah angka-angka yang kompetitif di dalam kelasnya, bukan yang memimpin kategori, dan makalah itu sendiri mengatakan demikian: makalah mencatat bahwa karena data pelatihan berbeda di antara model, hasilnya "tidak dapat menetapkan arsitektur mana yang lebih unggul". Dibandingkan Qwen3-VL-8B, kesenjangan pemahaman gambar besar pada MMMU (41,67 versus 69,60) dan pada MMMU-Pro, tempat penulis tidak melaporkan angka pembanding. Dibandingkan Qwen-Image 20B, kesenjangan GenEval adalah 0,83 hingga 0,87. Berdasarkan angkanya sendiri, yang bukan merupakan PixelUMM adalah model mutakhir. Berdasarkan angkanya sendiri, yang merupakan PixelUMM adalah model 15B dengan arsitektur yang benar-benar tidak biasa yang berada dalam rentang yang sama dengan sistem spesialis di sekitarnya.
Keunggulan paling tajam adalah lisensi, bukan tolok ukur.
Repositori ini berlisensi Apache-2.0 dan kartu model menyatakannya secara terang-terangan. Checkpoint adalah artefak yang berbeda dengan ketentuan yang berbeda, dan inilah detail yang paling mungkin membuat tim lengah. Bobot dirilis di bawah NVIDIA One-Way Noncommercial License, yang penggunaannya terbatas untuk riset atau evaluasi nonkomersial — pemberian hak yang jauh lebih ketat daripada kode yang ada di sampingnya. Satu berkas sumber di repositori, modeling/pixelumm/modeling_utils.py, juga mempertahankan pemberitahuan CC BY-NC 4.0 yang berasal dari DiT.
Bagi kelompok riset, tim evaluasi, atau siapa pun yang menerbitkan makalah, ini adalah lisensi yang sepenuhnya bisa digunakan. Bagi tim produk yang membuat prototipe fitur internal, ini adalah hal pertama yang perlu diajukan ke bagian hukum, dan jawabannya bisa saja tidak. Model yang tidak bisa Anda rilis adalah jenis aset yang berbeda dari model yang bisa Anda rilis, dan tidak ada tingkat paritas benchmark yang dapat mengubah itu.

Apa yang diperlukan untuk menjalankannya
Ini bukan unduhan akhir pekan. Dokumentasi lingkungan meminta Linux x86-64, Python 3.12, toolkit pengembangan CUDA 13.0, GPU NVIDIA, dan FlashAttention yang dibangun dari sumber terhadap toolkit tersebut — image CUDA yang hanya runtime tidak akan cukup. Checkpoint itu sendiri bukan file model.safetensors: ia adalah 128 shard .distcp dengan total sekitar 30 GB ditambah indeks .metadata tersembunyi, dan loader mengharuskan setiap shard yang direferensikan dan indeks tersebut ada.
Dua detail tambahan menentukan apa yang sebenarnya dapat Anda lakukan dengannya. Pertama, text-to-video menjalankan Cosmos guardrails secara default, dan itu memerlukan akses ke repositori nvidia/Cosmos-1.0-Guardrail yang dibatasi aksesnya plus lingkungan Python kedua dengan versi major Transformers yang berbeda — login saja tidak membuka bobotnya. Kedua, contoh pelatihan mainan empat langkah, satu-satunya resep pelatihan yang dipublikasikan, menurut dokumentasinya membutuhkan tujuh GPU dengan masing-masing setidaknya 48 GiB dan sekitar 61 GB ruang disk kosong untuk outputnya. Fine-tuning di workstation bukanlah jalur yang dituju; inferensi pada satu kartu modern adalah jalurnya.
Repositori ini menyertakan empat checkpoint. S8-F22-R05 adalah default dan yang digunakan untuk evaluasi makalah, mencakup keempat tugas. S8-F18-R01 menjalani 10.000 langkah fine-tuning tambahan pada 480p dan 720p dan secara umum memberikan hasil text-to-video yang sedikit lebih baik, tetapi tidak dapat melakukan pemahaman video. S8-F19-R03 dan S8-F21-R02 adalah tahap perantara. Memilih di antara keduanya adalah keputusan nyata, bukan sekadar detail.
Apa yang tidak dikonfirmasi
Daftar singkat, dan ini lebih penting daripada daftar panjang di atas.
• Tidak ada pengumuman dari NVIDIA. Tidak ada siaran pers dan tidak ada unggahan di blog perusahaan itu sendiri yang muncul untuk model ini pada saat penulisan. Perilisan yang senyap ini mungkin memang disengaja — artefak riset sering dirilis dengan cara seperti ini — atau peluncurannya mungkin memang belum terjadi.
• Tidak ada evaluasi independen. Setiap angka dalam artikel ini adalah milik penulis sendiri. Tidak ada yang dijalankan ulang di luar NVIDIA dan Waterloo.
• Tidak ada rute yang dihosting di mana pun. Anda tidak dapat memanggil PixelUMM melalui API saat ini, dan itu termasuk OrcaRouter — kami tidak menyediakan rute untuknya, dan tidak bisa, karena checkpoint berlisensi nonkomersial bukanlah sesuatu yang dapat ditawarkan oleh platform penyajian komersial. Siapa pun yang mengatakan sebaliknya sedang menggambarkan pengaturan yang dihosting sendiri.
• Tidak ada posisi yang dinyatakan mengenai lisensi di masa mendatang. Ketentuan nonkomersial adalah ketentuan sebagaimana dirilis. Apakah ketentuan tersebut akan dilonggarkan tidak diketahui, dan mengingat rekam jejak NVIDIA dengan checkpoint penelitian, hal itu bukan sesuatu yang bisa dijadikan dasar perencanaan.

Apa yang perlu diperhatikan selanjutnya
Tiga peristiwa akan mengubah PixelUMM dari artefak riset menjadi sesuatu yang dapat digunakan oleh khalayak yang lebih luas. Yang pertama adalah perubahan lisensi pada checkpoint — file tunggal itu adalah seluruh penghalang antara "menarik" dan "dapat digunakan dalam produk". Yang kedua adalah peluncuran resmi NVIDIA, yang akan disertai pembingkaian yang tidak dapat disediakan oleh repositori: untuk apa model ini, dan apakah ini arah produk atau sebuah makalah. Yang ketiga adalah reproduksi independen pertama, kemungkinan besar berupa pengulangan GenEval atau MVBench oleh seseorang yang memiliki klaster GPU cadangan, yang merupakan momen ketika angka-angka para penulis berhenti menjadi satu-satunya angka.
Sampai saat itu, sikap yang benar adalah sikap yang didukung bukti. PixelUMM ada, kode dan makalahnya publik dan dapat dibaca, bobotnya dapat diunduh, dan tidak ada satu pun klaim performa yang telah diperiksa oleh siapa pun di luar tim yang membuatnya. Itu bukan kritik terhadap karya tersebut — memang seperti itulah bentuk sebuah hasil riset yang baru berusia enam minggu. Ini juga persis situasi ketika lapisan routing membuktikan manfaatnya nanti, jika lisensinya kelak melonggar: satu kunci untuk model-model yang sudah Anda percaya, harga daftar diteruskan dengan markup 0%, dan failover yang memungkinkan Anda mengarahkan sebagian trafik ke sesuatu yang belum terbukti tanpa mempertaruhkan jalur produksi padanya. Namun, untuk saat ini, ringkasan yang jujur lebih sederhana. NVIDIA membangun sesuatu yang tidak biasa, mempublikasikannya secara menyeluruh, dan tidak memberi tahu siapa pun. Repositori itulah pengumumannya.
