
InternLumina-U2 Pratinjau: Satu Model Difusi 16B untuk Gambar, Video, dan 3D — Bobot Masih Menyusul
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2658Kecerdasan72Koding
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
Pada 04:03 UTC tanggal 1 September 2026, Shanghai AI Laboratory membuat repositori GitHub InternLumina-U2. Tiga belas menit kemudian, organisasi yang sama mendaftarkan repositori dengan nama yang identik di Hugging Face. Tidak ada unggahan peluncuran, tidak ada kartu model, dan tidak ada pengumuman apa pun — hanya kode inferensi untuk InternLumina-U2, sebuah model mixture-of-experts dengan 16B parameter (1B aktif) yang oleh laboratorium itu disebut sebagai satu model yang mencakup pemahaman gambar, pembuatan gambar dari teks, penyuntingan gambar, pemahaman video, dan pemahaman 3D melalui satu antarmuka token diskret. Kodenya nyata dan publik; modelnya sendiri belum — belum tersedia. Bobotnya ditandai "coming soon", repositori Hugging Face hanyalah placeholder kosong, dan laporan teknis yang dijanjikan belum muncul. Meskipun demikian, apa yang dirilis secara senyap pada 1 September itu adalah gambaran publik paling lengkap tentang model ini yang ada di mana pun.
Jika ini pertama kalinya Anda mendengar tentang InternLumina-U2, justru itu tujuannya. Tidak ada yang diumumkan mengenai perilisan ini, dan tampaknya liputan independen belum ada — tulisan-tulisan sinyal awal justru merupakan tempat pertama model seperti ini mencuat, sebelum unggahan peluncuran dan terkadang sebelum weights-nya. Semua yang di bawah ini diambil dari repositori GitHub, halaman proyek, dan stub Hugging Face yang diterbitkan sendiri oleh lab tersebut pada 1 September, serta apa pun di luar sumber-sumber itu secara eksplisit dilabeli sebagai inferensi.
Apa yang sebenarnya dirilis pada 1 September
Repositori GitHub InternLM/InternLumina-U2 dibuat pada 1 September 2026 dan pada hari itu terdapat tiga commit — commit inisial, commit yang menandai tautan model sebagai "coming soon" dan hasil benchmark sebagai "preliminary", serta perbaikan navigasi. Repositori ini berlisensi Apache-2.0 dan memuat README berjudul "Intern Lumina U2: A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing", versi bahasa Inggris dan Mandarin, kerangka inferensi lengkap, serta peta jalan. Satu keunikan yang perlu diperhatikan: entri berita repositori itu sendiri diberi cap "[2026-08]", padahal commit inisial dan kedua stempel waktu repositori bertanggal 1 September 2026 — anggap awal September sebagai tanggal rilis yang sebenarnya, bukan Agustus. Repositori di bawah ini adalah seluruh rilis publik: setiap berkas yang terlihat dalam pohon repositori adalah bagian dari yang dirilis, dan belum ada apa-apa lagi di tempat lain.

• GitHub — InternLM/InternLumina-U2, dibuat pada 2026-09-01 di bawah lisensi Apache-2.0, dengan kode inferensi untuk teks, teks-ke-gambar, pemahaman gambar, pengeditan gambar, pemahaman video, dan pemahaman 3D.
• Hugging Face — internlm/InternLumina-U2, dibuat 2026-09-01, saat ini hanya berisi file .gitattributes dan README sepanjang 28 byte yang seluruh isinya adalah header lisensi Apache-2.0. Tidak ada weights, tidak ada config, tidak ada file tokenizer.
• Halaman proyek — internlm.github.io/InternLumina-U2, dengan gambar arsitektur, tabel benchmark awal, dan demo placeholder; laporan teknisnya ditandai "segera hadir".
Kode inferensi disusun sebagai satu skrip pengendali dengan satu bagian untuk setiap tugas: pembuatan teks biasa, teks-ke-gambar hingga 1024×1024 dengan CFG dan timesteps yang dapat dikonfigurasi, pemahaman gambar atas gambar natural dan bagan padat, penyuntingan gambar berbasis instruksi dengan mode dual-CFG opsional, pemahaman video atas 64 bingkai yang disampling, serta pemahaman 3D atas aset GLB/GLTF yang dirender menjadi 64 tampilan warna-dan-kedalaman melalui pipeline Blender yang disertakan sebelum tokenisasi. Luasnya cakupan tugas tersebut merupakan inti tesis desain model ini, dan patut direnungkan sejenak sebelum menyelami arsitekturnya.
Satu model, enam tugas, satu kosakata token
InternLumina-U2 termasuk dalam lini riset yang bergerak cepat dengan keyakinan bahwa bahasa dan visi seharusnya berbagi satu antarmuka token diskret tunggal, alih-alih hidup dalam tumpukan pemahaman dan pembangkitan yang terpisah. Karya awal lab itu sendiri dalam arah ini — Lumina-DiMOO, model difusi diskret terpadu yang ditampilkan di WAIC 2025 — dikutip bersama LLaDA2.0-Uni, Show-o2, dan MMaDA sebagai sistem perintis yang menjadi landasan InternLumina-U2 dan yang diklaim akan dilampauinya. Keyakinan spesifik yang diusung InternLumina-U2 adalah bahwa hambatan bagi model-model terpadu ini bukanlah arsitekturnya, melainkan kosakata visualnya: satu codebook membatasi seberapa banyak informasi yang dapat dibawa oleh satu token visual, sementara hibrida diskret–kontinu yang memisahkan pemahaman dan pembangkitan ke dalam representasi berbeda tetap memaksa model untuk memelihara dua tumpukan.
Jawaban InternLumina-U2 adalah pemodelan multi-codebook yang sepenuhnya diskrit. Sisi visual menggunakan tokenizer AToken dari Apple, yang merepresentasikan setiap posisi visual dengan delapan codebook yang saling melengkapi — sebuah upaya untuk mempertahankan tekstur lokal, teks tersemat, geometri, dan detail frekuensi tinggi tanpa menambah panjang sekuens. Pada sisi masukan, masing-masing dari delapan codebook memiliki embedding sendiri, dan delapan embedding per-posisi digabungkan lalu diproyeksikan menjadi satu token backbone. Pada sisi keluaran, prediksi bersifat paralel secara spasial tetapi autoregresif pada kedalaman codebook: backbone difusi menghilangkan noise dari banyak posisi spasial yang di-mask secara paralel, dan kepala autoregresif multi-codebook kemudian memprediksi delapan kode dari setiap posisi secara berurutan.
• Scale — total parameter 16B, 1B aktif (16B-A1B), sebuah MoE sparse.
• Tulang punggung bahasa — model bahasa difusi MoE LLaDA-2.0, yang objektif blok-difusinya diperluas ke tugas-tugas visual melalui pelatihan multi-tugas bersama (deskripsi vendor).
• Representasi visual — token diskrit penuh 8-codebook dari tokenizer AToken milik Apple.
• Perangkat Keras — diadaptasi untuk GPU NVIDIA dan NPU Huawei Ascend pada pelatihan, evaluasi, dan inferensi, dengan keselarasan numerik tingkat operator antarbackend.

Jika klaim-klaim tersebut benar, apa yang diperoleh darinya dalam praktik adalah mimpi tertua di bidang multimodal: satu set bobot yang dapat membaca gambar, mengeditnya, menggambar yang baru dari teks, menjawab pertanyaan tentang video, dan mendeskripsikan aset 3D — dengan pemahaman dan generasi yang saling memperkuat melalui antarmuka yang sama, alih-alih dirangkai dari model-model spesialis. Itu juga klaim yang paling pantas disikapi secara skeptis, karena itulah yang paling sulit diwujudkan.
Angka-angka, sebagaimana adanya.
Setiap tolok ukur yang dimiliki InternLumina-U2 adalah laporan vendor, bersifat pendahuluan, dan parsial. README dan halaman proyek menyatakannya sendiri: "Hasil pendahuluan dan parsial. Tabel perbandingan lengkap akan muncul dalam laporan teknis yang akan datang." Tidak ada evaluasi independen, karena bobot-bobotnya tidak publik. Perlakukan angka-angka di bawah ini sebagai klaim lab itu sendiri, bukan skor terverifikasi.
• Pemahaman grafik / dokumen — ChartQA 86.52, CharXiv-DQ 83.65 (dilaporkan vendor).
• Penalaran matematika visual — MathVision 33.22, DynaMath 56.37; lab menyatakan bahwa model ini mengungguli InternVL3-8B yang hanya untuk pemahaman pada keduanya.
• Ketahanan terhadap halusinasi — HallusionBench 62,15.
• Pemahaman video — VideoMME 51.26, MVBench 59.74, MLVU 57.03 (halaman proyek).
• Pemahaman 3D — 3D MM-Vet 41.8.
• Teks-ke-gambar — DPG-Bench 87.10, TIIF-Bench Pendek/Panjang 84.60/85.95, GenEval 0.81 (halaman proyek).
• Pengeditan gambar — ImgEdit 3.83.
Kisah perbandingan adalah bagian di mana pembaca yang jujur harus memperlambat. README mengklaim InternLumina-U2 melampaui model terpadu seperti InternVL-U, LLaDA2.0-Uni, Show-o2, dan Lumina-DiMOO pada tolok ukur pemahaman dan generasi yang terperinci — tetapi tabel di halaman proyek itu sendiri menunjukkan InternLumina-U2 pada GenEval 0,81 dibandingkan dengan LLaDA2.0-Uni yang mencapai 0,89, sehingga model tersebut tertinggal dari setidaknya satu pesaing pada setidaknya satu metrik generasi utama. Memilih beberapa angka yang menguntungkan dari tabel yang tidak lengkap justru merupakan hal yang dirancang untuk dilunakkan oleh catatan "tabel perbandingan lengkap di laporan teknis". Angka-angka tersebut hanyalah sinyal arah dari laboratorium, tidak lebih.
Apa yang nyata versus apa yang dijanjikan
Cakupan rilis ini luar biasa eksplisit, dan hal itu penting bagi siapa pun yang memutuskan apakah mereka dapat mencobanya hari ini. Yang dikirim: kode inferensi. Yang tidak dikirim: bobot model, kode pelatihan (dijanjikan dalam repositori terpisah), tumpukan pelatihan-dan-inferensi Ascend, dan laporan teknis. Repositori Hugging Face yang pada akhirnya akan menampung model tersebut masih berupa stub — tangkapan layar di bawah ini adalah seluruh isi halaman saat ini yang akan ditemui pembaca ketika mereka mengeklik tautan "Model (coming soon)" di README.

Bahkan kode yang telah dirilis pun belum dapat menghasilkan keluaran apa pun. Driver inferensi mengharapkan direktori checkpoint Hugging Face yang terpisah dan bobot tokenizer AToken pada jalur tertentu — keduanya tidak tersedia di repositori — sehingga yang dapat diunduh saat ini hanyalah spesifikasi tentang bagaimana model akan dijalankan, bukan model yang berfungsi. Dan ketika bobot tersebut akhirnya tiba, self-hosting tidak akan menjadi sekadar pekerjaan pip-install yang rutin. Model ini menggunakan API generate block-diffusion, bukan antarmuka generate Transformers standar; tokenizer AToken memerlukan FlashAttention; kode membutuhkan GPU yang terlihat pada saat impor; driver utamanya bersifat single-process; dan pipeline 3D mengharapkan Blender 4.5 untuk encoding aset. Itu adalah proyek deployment yang nyata, bukan eksperimen akhir pekan — dan justru hambatan semacam inilah yang keberadaan lapisan routing dirancang untuk menyerap bagi sebagian besar tim.
Ketika bobot-bobotnya mendarat, perlakukan sebagai model yang belum terbukti.
{{1}}Tidak ada yang dapat menjalankan InternLumina-U2 hari ini, dan tidak ada penyedia yang dapat menyediakannya, karena bobotnya belum dipublikasikan.{{/1}} {{2}}Hal itu akan berubah pada suatu saat nanti — lisensi Apache-2.0 dan pola open-source agresif dari lab tersebut pada 2026 (dorongan ArchSpace untuk "open everything", InternVL3.5, model-model sains Intern-S2) membuat rilis bobot lebih mungkin terjadi daripada sekadar hipotetis.{{/2}} {{3}}Ketika hal itu terjadi, langkah rasional pertama bukanlah mempertaruhkan pipeline produksi pada model difusi yang baru dirilis dengan kebutuhan serving yang tidak lazim dan tanpa evaluasi independen sama sekali.{{/3}} {{4}}Langkah itu adalah menjalankannya secara berdampingan dengan model yang sudah Anda percayai, pada jalur pengujian, dengan failover otomatis ke model yang sudah terbukti begitu model baru itu mulai bermasalah.{{/4}} {{5}}Untuk itulah lapisan routing dibuat: satu API untuk 200+ model, harga yang tertera dari penyedia diteruskan dengan markup 0%, dan failover yang mengubah "mencoba hal baru" menjadi aturan routing, bukan migrasi.{{/5}} {{6}}OrcaRouter dirancang seperti itu — dan agar jelas, kami tidak merutekan InternLumina-U2 dan memang tidak dapat melakukannya, karena bobotnya belum dirilis.{{/6}} {{7}}Bagian ini membahas alur kerja untuk ketika bobot tersebut sudah dirilis, bukan klaim bahwa model ini tersedia di mana pun saat ini.{{/7}}
Tontonan Berikutnya
Empat peristiwa akan membawa InternLumina-U2 dari pratinjau menjadi kenyataan, kira-kira menurut urutan kemungkinan. Pertama, saat repositori Hugging Face terisi — file safetensors, sebuah konfigurasi, dan bobot tokenizer AToken yang muncul dalam stub tersebut — itulah momen ketika model itu benar-benar ada. Kedua, laporan teknis, yang seharusnya memuat tabel perbandingan lengkap dan akan mengubah angka-angka vendor yang parsial di atas menjadi sesuatu yang dapat diperiksa. Ketiga, repositori kode pelatihan dan stack Ascend, yang penting bagi siapa pun yang ingin melakukan fine-tuning atau menjalankan model ini di perangkat keras non-NVIDIA. Keempat, evaluasi independen pertama — Elo arena, run ChartQA atau GenEval yang direproduksi — yang menguji janji "satu model, enam pekerjaan" tanpa bias seleksi dari lab itu sendiri. Kode yang publik pada 1 September berarti arsitekturnya sudah dapat diketahui; tidak adanya bobot berarti segala hal tentang kualitas aktual masih berupa klaim. Pantau repositori model, bukan feed pengumuman — bagian-bagian yang menarik sudah publik, dan modelnya sendiri mungkin tidak akan lama lagi.
