Kartu judul hero untuk perbandingan 'InternLumina-U2 vs Qwen2.5 Omni' dengan subjudul 'Model omni yang dikirim Alibaba vs yang masih dijanjikan' dan tiga chip statistik — 'Qwen2.5 Omni: 17 bulan dalam produksi', 'InternLumina-U2: satu hari kode', 'Apache-2.0 di kedua sisi' — dengan logo OrcaRouter di sudut kanan bawah.
Guides & Insights

InternLumina-U2 vs Qwen2.5 Omni: Model Omni yang Dikirim Alibaba vs yang Masih Dijanjikan Shanghai AI Lab

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

InternLumina-U2 dan Qwen2.5 Omni sama-sama merupakan jawaban atas ambisi yang sama — satu model yang menangani setiap modalitas, bukan sekumpulan spesialis — yang berasal dari dua generasi berbeda. Qwen2.5 Omni adalah jawaban yang benar-benar dirilis: model open-weight dengan 7 miliar parameter yang diluncurkan pada Maret 2025, berusia tujuh belas bulan pada saat tulisan ini dibuat, yang menerima teks, gambar, audio, dan video sebagai masukan serta membalasnya dalam bentuk teks atau ucapan streaming alami. InternLumina-U2 adalah jawaban Shanghai AI Laboratory, diterbitkan sebagai kode inferensi pada 1 September 2026: model difusi sparse dengan 16 miliar parameter yang mengklaim mampu memahami gambar, video, dan 3D, serta menghasilkan dan menyunting gambar melalui satu antarmuka token diskret bersama. Satu generasi dari ide omni ini telah berada dalam produksi selama satu setengah tahun; yang lainnya baru berumur sehari dan tidak dapat dijalankan oleh siapa pun, karena bobotnya belum ada. Kesenjangan di antara keduanya adalah perbedaan antara janji yang ditepati dan janji yang dibuat.

Omni yang dirilis: Qwen2.5 Omni

Qwen2.5 Omni layak dianggap serius sebagai baseline karena ia adalah salah satu model open-source langka yang benar-benar memenuhi janji "memahami segala hal, menjawab dalam bentuk apa pun". Arsitektur Thinker-Talker-nya memasangkan pemikir teks dengan talker yang menghasilkan ucapan, menggunakan penyandian posisi multimodal yang selaras waktu sehingga audio dan video tetap sinkron; masukan mencakup teks, gambar, audio, dan video, dan keluaran dapat berupa teks plus suara dalam satu giliran, dengan empat suara bawaan. Batasannya terdokumentasi sejelas kemampuannya: konteksnya 32K token, tidak ada pemanggilan fungsi dan tidak ada keluaran terstruktur, dan ia adalah seorang percakapan omni, bukan agen. Hal yang tidak bisa dilakukannya perlu digarisbawahi untuk perbandingan ini — ia memahami gambar, audio, dan video, tetapi tidak menghasilkannya. Kata "omni" dalam Qwen2.5 Omni berarti omni-persepsi dengan sintesis ucapan di sisi keluaran; piksel masuk, dan kata-kata keluar.

Rekam jejaknya nyata. Model tersebut telah diunduh ratusan ribu kali, memiliki API yang dihosting melalui platform pengembangnya sendiri dan beberapa platform pihak ketiga, serta telah menghabiskan tujuh belas bulan mengumpulkan kuantisasi, perangkat komunitas, dan harga yang diketahui — daftar agregator menempatkan teks sekitar $0,09 per juta token input dan $0,34 per juta token output, dengan audio ditagih secara terpisah. Tujuh belas bulan cukup lama sehingga kelebihan dan keterbatasannya sama-sama terpetakan dengan baik. Itulah yang dibeli oleh kematangan: bukan kesempurnaan, melainkan prediktabilitas.

Sang omni yang dijanjikan: InternLumina-U2

InternLumina-U2 berusaha melangkah lebih jauh daripada Qwen2.5 Omni, dan langkah itulah tepatnya tempat kesulitan berada. Tesis desainnya adalah bahwa persepsi dan generasi harus berbagi satu antarmuka token diskrit: alih-alih model bahasa yang memahami video dan model difusi terpisah yang menggambar, satu backbone MoE difusi yang jarang — total 16B, 1B aktif — akan membaca gambar, bagan, video, atau aset 3D sekaligus menulis gambar baru atau hasil edit, menggunakan kosakata visual delapan-codebook yang sepenuhnya diskrit sehingga setiap posisi visual membawa cukup informasi untuk mendukung kedua arah tersebut. Itu adalah klaim yang secara material lebih besar daripada klaim Qwen2.5 Omni. Satu hal adalah merutekan setiap modalitas masukan ke dalam teks dan ucapan; hal lain adalah membuat satu set bobot menghasilkan piksel dengan kelancaran yang sama seperti saat ia bernalar tentang piksel tersebut.

Hal ini juga, saat ini, merupakan klaim yang tidak dapat diperiksa. Laboratorium itu menerbitkan kode inferensi, halaman proyek dengan tabel benchmark "awal, parsial", dan stub Hugging Face yang kosong; bobot, kode pelatihan, laporan teknis, dan stack Ascend-NPU semuanya ditandai "segera hadir". Tidak ada evaluasi independen karena tidak ada yang dapat dievaluasi. Arsitektur Qwen2.5 Omni dapat diperiksa pada minggu perilisannya karena bobotnya ikut dirilis; arsitektur InternLumina-U2 dapat dibaca hari ini dan kualitasnya masih merupakan janji vendor.

Papan skor

Karena salah satu model ini memiliki riwayat tujuh belas bulan dan yang lainnya baru sehari kodenya, baris-baris tersebut membawa asal-usul daripada berpura-pura bahwa kolom-kolomnya simetris.

• Usia — Qwen2.5 Omni: dirilis Maret 2025, tujuh belas bulan beredar, ratusan ribu unduhan. InternLumina-U2: kode inferensi dipublikasikan 1 September 2026, nol unduhan, nol penjalanan independen.

Bentuk — Qwen2.5 Omni: ~7B end-to-end, Thinker-Talker dengan penyandian posisi multimodal yang selaras waktu. InternLumina-U2: total 16B / 1B aktif sparse MoE diffusion LLM dengan tokenizer visual diskrit delapan codebook.

— Masukan — keduanya menerima teks dan gambar; Qwen2.5 Omni juga menerima audio dan video untuk chat omni; InternLumina-U2 juga mengklaim pemahaman video atas 64 bingkai sampel dan pemahaman 3D atas tampilan GLB/GLTF yang dirender Blender.

• Output — Qwen2.5 Omni: teks dan ucapan streaming, empat suara. InternLumina-U2: mengklaim teks, text-to-image hingga 1024×1024, dan pengeditan gambar berbasis instruksi.

• Frontier generasi — Qwen2.5 Omni: menghasilkan kata dan suara, bukan piksel. InternLumina-U2: mencoba pembuatan dan penyuntingan piksel di dalam model token diskret yang sama yang membaca.

• Bobot dan lisensi — keduanya merupakan bobot terbuka berlisensi Apache-2.0 pada prinsipnya; bobot Qwen2.5 Omni dapat diunduh hari ini, sementara bobot InternLumina-U2 belum tersedia untuk publik.

• Penyajian — Qwen2.5 Omni: API yang di-hosting plus self-host (deployment presisi penuh yang berat); dikenal dengan konteks 32K, tanpa pemanggilan fungsi. InternLumina-U2: tidak dapat disajikan — driver yang dirilis mengharapkan checkpoint yang tidak ada.

• Angka utama — Qwen2.5 Omni: sudah lama menempati papan peringkat OmniBench (skor sekitar 0,561 di papan saat ini); InternLumina-U2: ChartQA 86,52, MathVision 33,22, GenEval 0,81 — semuanya dilaporkan vendor, bersifat sementara dan belum lengkap.

A comparison scoreboard for InternLumina-U2 and Qwen2.5 Omni: InternLumina-U2 with Age 1 day code only, Size 16B-A1B diffusion MoE, Input image/video/3D (claims), Output text image gen & edits, Weights not yet public, Frontier reads AND draws; Qwen2.5 Omni with Age 17 months in production, Size ~7B Thinker-Talker, Input text/image/audio/video, Output text & streaming speech, Weights public since Mar 2025, Frontier reads speaks no pixels, with a footer noting InternLumina figures are vendor-reported and Qwen figures are Alibaba-reported, and the OrcaRouter logo in the bottom-right corner.

Mengapa kesenjangan generasi adalah cerita yang sebenarnya

Abaikan soal usia dan perbedaan substantifnya adalah batas yang dicapai setiap model. Qwen2.5 Omni memilih versi omni yang praktis: memahami secara luas, menjawab dalam bahasa atau suara, dan menyerahkan sintesis gambar serta video kepada model generasi khusus di bagian lain dari tumpukan tersebut. Pembagian kerja semacam itu adalah cara hampir semua sistem multimodal produksi pada 2026 dibangun, dan itulah sebabnya Qwen2.5 Omni bisa dirilis pada 2025 dan tetap berguna pada 2026 — ia mengerjakan bagiannya dengan baik dan terintegrasi dengan sisanya. InternLumina-U2 adalah taruhan bahwa pembagian kerja itulah masalahnya: bahwa model yang dipaksa merepresentasikan semuanya — persepsi dan generasi — dalam satu kosakata diskret bersama akan mempelajari pemahaman visi yang lebih dalam daripada model yang hanya harus mendeskripsikannya. Taruhan itu, jika berhasil, adalah hasil yang lebih penting. Jika tidak, InternLumina-U2 berakhir sebagai Qwen2.5 Omni yang lebih lambat dan lebih boros dengan generator gambar yang ditempel secara canggung ke dalam bobot yang sama. Seluruh kontes — dan ini adalah kontes antara desain yang sudah dirilis dan sebuah hipotesis, bukan antara dua model yang bisa dijalankan — adalah apakah arsitektur yang lebih sulit itu mampu membenarkan dirinya sendiri.

A screenshot of the Hugging Face model page for Qwen/Qwen2.5-Omni-7B (captured August 27 2026), showing the Thinker-Talker overview, the Apache-2.0 license, and the model's text, image, audio and video modality tags.

Kartu Hugging Face Qwen/Qwen2.5-Omni-7B, diambil pada 27 Agustus 2026 — ringkasan Thinker-Talker, lisensi Apache-2.0, dan tag modalitas teks, gambar, audio, dan video model.

Apa yang sebenarnya Anda dapatkan dari satu setengah tahun unduhan

Kematangan bukanlah sekadar kesan; ia adalah daftar hal yang Anda ketahui. Dengan Qwen2.5 Omni, Anda tahu bahwa konteks 32K adalah batasan ketat dan dapat merekayasa solusi di sekitarnya. Anda tahu tidak ada jalur pemanggilan fungsi dan tidak akan berpura-pura sebaliknya. Anda tahu kira-kira berapa biaya deployment, baik melalui API yang di-host maupun di GPU Anda sendiri, karena model tersebut telah diberi harga dan dijalankan oleh cukup banyak orang sehingga angkanya telah stabil. Anda tahu posisi OmniBench itu nyata karena papan peringkat independen telah melacaknya selama lebih dari setahun. Dengan InternLumina-U2, tidak ada satu pun kata kerja tersebut yang berlaku — Anda tidak tahu, Anda tidak mungkin tahu, karena tidak ada artefaknya. Ketika sebuah model baru berumur satu hari dan tidak berbobot, setiap klaim tentangnya adalah pernyataan niat. Asimetri itu bukanlah kritik terhadap sains; itu adalah sikap epistemik yang tepat bagi siapa pun yang memilih apa yang akan dibangun di atasnya.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page with the multi-codebook diffusion description and the inference scripts that make the architecture public while weights stay out of the tree.

Repositori GitHub InternLM/InternLumina-U2, cuplikan 2 September 2026 — halaman arahan repositori yang memublikasikan arsitektur tersebut — deskripsi, lisensi, dan skrip inferensi — sementara bobotnya sendiri tidak ada dalam pohon direktori.

Keputusan perutean, yang dibingkai secara jujur.

Kami akan menyatakan ketersediaannya secara gamblang: OrcaRouter tidak menghosting InternLumina-U2, karena belum ada bobot untuk dihosting siapa pun, dan saat ini kami juga tidak menyediakan Qwen2.5 Omni — model tersebut berjalan melalui API milik pengembangnya sendiri dan platform pihak ketiga. Jadi pelajaran tentang routing di sini adalah tentang sikap, bukan tentang memanggil kedua model ini melalui satu kunci API saat ini. Pola yang bertahan lama adalah pola yang pada akhirnya ditemui setiap keputusan antara model matang versus pendatang baru: pertahankan model yang sudah terbukti di jalur utama, di mana satu API untuk 200+ model dan penerusan biaya dengan markup 0% berarti Anda membayar harga sesuai daftar penyedia dan tidak lebih; arahkan pendatang baru yang belum teruji ke jalur pengujian dengan failover otomatis sehingga saat pertama kali model tersebut macet, melenceng, atau memberikan respons yang tidak masuk akal, panggilan akan dialihkan ke model dengan rekam jejak tujuh belas bulan tersebut. Dengan begitu, Anda dapat mengevaluasi arsitektur baru yang ambisius seperti InternLumina-U2 pada hari bobotnya tersedia — tanpa mempertaruhkan jalur produksi yang selama ini Anda andalkan.

Putusan

Qwen2.5 Omni adalah model omni yang dapat Anda andalkan hari ini: sudah dirilis, dapat diunduh, terdokumentasi, dengan batasan yang diketahui dan harga yang pasti. InternLumina-U2 adalah model omni yang patut diperhatikan: sebuah lompatan arsitektural sejati yang melampaui persepsi menuju penciptaan, berlisensi Apache-2.0, dengan kode yang terbuka untuk publik dan bobot yang belum dirilis. Jika taruhan multi-codebook dari lab tersebut terbukti dalam pengujian independen, InternLumina-U2 bukan sekadar akan menjadi pesaing Qwen2.5 Omni, melainkan generasi berikutnya dari gagasan yang sama. Jika tidak, generalis berusia tujuh belas bulan yang benar-benar dirilis itu akan tetap ada, melakukan pekerjaan yang selama ini telah dilakukannya. Pantau stub Hugging Face; vonisnya menunggu file safetensors, bukan artikel ini.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube