Kartu hero yang dihasilkan berjudul 'Qwen3.8-Omni-Flash vs InternLumina U2' di bawah eyebrow 'Indra sewaan vs bobot milik sendiri', dengan subjudul 'API media panjang tertutup melawan model difusi 16B yang dapat Anda unduh.' dan empat chip: 'Bobot: tertutup vs Apache 2.0', 'Menghasilkan gambar: hanya satu sisi', 'Konteks: 1M vs tidak diungkapkan', 'Dapat dirutekan di sini: tidak keduanya'. Logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

Qwen3.8-Omni-Flash vs InternLumina U2: Indera yang Disewa vs Bobot yang Dimiliki

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Cara yang berguna untuk membandingkan Qwen3.8-Omni-Flash dan InternLumina U2 bukan berdasarkan baris tolok ukur, karena keduanya tidak muncul pada baris yang sama. Melainkan dengan menanyakan siapa yang diizinkan menjalankannya. Milik vendor Qwen3.8-Omni-Flash, terbuka untuk pelanggan API sejak 18 September 2026, adalah model tertutup di platform vendor sendiri: satu juta token konteks, hingga satu jam audio dan video berkelanjutan per panggilan, keluaran hanya teks, dan tanpa bobot. Dari Shanghai AI Laboratory, InternLumina U2 adalah model difusi mixture-of-experts 16B-A1B di bawah Apache 2.0 yang checkpoint Ascend-nya dapat diunduh dari Hugging Face sekarang juga, dengan checkpoint NVIDIA dan laporan teknisnya masih terdaftar sebagai akan datang. Yang satu adalah layanan yang Anda sewa per token. Yang lain adalah berkas yang dapat Anda pegang, dengan catatan tentang perangkat keras apa yang saat ini menjalankannya. Perbedaan itulah yang menentukan lebih banyak penerapan nyata daripada skor apa pun di tabel masing-masing vendor.

Apa Sebenarnya InternLumina U2

Arsitekturnya adalah bagian yang menarik dan ini sungguh tidak biasa. InternLumina U2 adalah MoE sparse dengan total 16 miliar parameter dan 1 miliar parameter aktif, dan ini merupakan model bahasa difusi, bukan model autoregresif — ia menyempurnakan seluruh urutan secara paralel alih-alih mengeluarkan token dari kiri ke kanan. Representasi visualnya sepenuhnya diskret: delapan codebook token visual yang dibangun di atas AToken milik Apple, yang memungkinkan satu model baik membaca gambar maupun menghasilkan gambar tanpa decoder terpisah yang dipasang di ujungnya. Penjawaban pertanyaan teks, pembuatan gambar dari teks, pemahaman gambar, penyuntingan gambar, pemahaman video, dan pemahaman 3D semuanya adalah model yang sama yang melakukan jenis pekerjaan yang sama pada kosakata yang sama.

• Ukuran dan bentuk — InternLumina U2 total 16B, 1B aktif, MoE sparse; jumlah parameter Qwen3.8-Omni-Flash tidak diungkapkan.

• Pembuatan — {{1}}InternLumina U2{{/1}} menghasilkan dan menyunting gambar serta menangani pemahaman 3D; {{2}}Qwen3.8-Omni-Flash{{/2}} tidak menghasilkan media sama sekali dan mengembalikan teks.

• Decoding — InternLumina U2 adalah LLM difusi yang melakukan decoding secara paralel; Qwen3.8-Omni-Flash bersifat autoregresif.

• Konteks dan durasi — Qwen3.8-Omni-Flash membawa jendela 1M token dan hingga satu jam audio-video berkelanjutan dalam satu panggilan; materi terbitan InternLumina U2 tidak menjelaskan semua itu, dan audio berdurasi panjang tidak termasuk dalam kemampuan yang terdaftar.

• Bobot — InternLumina U2 berlisensi Apache 2.0 dengan checkpoint Ascend telah dipublikasikan dan checkpoint NVIDIA masih tertunda; Qwen3.8-Omni-Flash tidak memiliki bobot dan tidak ada rencana yang diumumkan untuk itu.

• Cara Anda memperolehnya — InternLumina U2 merupakan unduhan dari Hugging Face dengan kode inferensi di GitHub; Qwen3.8-Omni-Flash adalah panggilan API ke Alibaba Cloud Model Studio atau platform Qianwen.

• Skor independen — tidak ada untuk keduanya. Kartu milik InternLumina U2 sendiri memberi label pada tabel benchmark-nya sebagai "hasil awal, sebagian"; skor Qwen semuanya diukur terhadap pendahulunya sendiri dan tidak direproduksi.

A generated two-column scoreboard titled 'Qwen3.8-Omni-Flash vs InternLumina U2 - the scoreboard'. Six shared dimension labels, left column Qwen3.8-Omni-Flash: 'Weights: not released', 'Size: undisclosed', 'Context: 1M tokens', 'Output: text only', 'Generates images: no', 'Access: vendor API only'; right column InternLumina U2: 'Weights: Apache 2.0 on Ascend', 'Size: 16B total, 1B active', 'Context: not published', 'Output: text and images', 'Generates images: yes', 'Access: download from Hugging Face'. The footer reads 'Qwen figures vendor-reported; InternLumina card says preliminary, partial results.' The OrcaRouter logo is composited in the bottom-right corner.

Pertanyaan soal bobot telah bergeser sejak liputan pratinjau.

Jika Anda membaca tulisan kami sebelumnya tentang InternLumina U2 saat kode itu pertama muncul, situasi telah berubah ke satu arah dan tetap sama di arah lain, dan kedua bagian itu penting. Repositori Hugging Face tidak lagi berupa stub: folder ascend/ sekarang berisi tujuh shard safetensors plus konfigurasi, tokenizer, dan kode pemodelan, yang berarti model ini benar-benar dapat diunduh dan dijalankan oleh siapa pun dengan perangkat keras yang tepat. Folder nvidia/ masih ditandai akan segera hadir, laporan teknisnya masih akan datang, dan bagian benchmark repositori itu sendiri masih menyatakan "hasil awal, parsial." Jadi pernyataan yang akurat saat ini bukanlah "bobotnya sudah keluar" atau "bobotnya hilang" — melainkan bahwa checkpoint dari satu tumpukan perangkat keras telah diterbitkan dan yang lain belum, yang merupakan kendala nyata bagi siapa pun yang klaster-nya NVIDIA.

Dua hal lain telah bergerak diam-diam. Repositori GitHub terus menerima commit jauh setelah rilis awal 1 September, jadi kode yang dirilis dipelihara, bukan dibiarkan mangkrak. Dan penghitung unduhan di repositori Hugging Face masih menunjukkan nol, yang lebih banyak mengatakan tentang audiensnya daripada tentang modelnya: model difusi 16B-A1B dengan checkpoint yang mengutamakan Ascend ditujukan untuk laboratorium, bukan untuk tim produk yang mencari endpoint yang dihosting pada kuartal ini.

Di mana keduanya benar-benar tumpang tindih, dan di mana tidak

Pemahaman gambar adalah titik temuannya, dan cakupannya lebih sempit daripada yang terlihat. Kedua model dapat melihat gambar dan menjawab pertanyaan tentangnya, yang merupakan keseluruhan tugas bagi Qwen3.8-Omni-Flash dan salah satu dari enam tugas bagi InternLumina U2. Segala hal di luar itu menyimpang jauh. InternLumina U2 kemudian dapat mengedit gambar tersebut atau menghasilkan gambar baru dari prompt, dalam model yang sama, menggunakan kosakata visual yang sama seperti yang digunakan untuk membacanya. Qwen3.8-Omni-Flash tidak dapat menghasilkan satu piksel pun, tetapi ia akan menerima audio dan video selama satu jam dalam satu panggilan dan memberi tahu Anda siapa yang berbicara, kapan, dan apa yang diputuskan — yang tidak diklaim sama sekali oleh materi terbitan InternLumina U2.

Tumpang tindih yang kurang penting daripada yang orang duga adalah video. Keduanya digambarkan menangani video, tetapi keduanya melakukan hal yang berbeda dengannya: yang satu memahami rekaman panjang sebagai dokumen, yang lain menangani video sebagai modalitas visual bersama 3D. Tim yang membutuhkan rekaman berdurasi satu jam untuk diringkas tidak terlayani oleh yang kedua, dan tim yang membutuhkan sebuah bingkai untuk dihasilkan tidak terlayani oleh yang pertama.

A headless screenshot of the Hugging Face model page for InternLumina-U2 showing the Apache 2.0 licence badge, the tags for diffusion, multimodal, image-generation, image-editing and vision-language, the model card heading 'A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing', and the 'Technical Report (Coming Soon)' note.

Biaya, kendali, dan apa yang sebenarnya Anda beli

Perbandingan harga ini tidak sebanding secara jenis. Qwen3.8-Omni-Flash menagih per token — $0,15 per juta input, $0,016 untuk cache, $0,47 output pada daftar internasional, dengan daftar harga Tiongkok daratan terpisah yang tidak dapat dibandingkan — dan tajuk peluncurannya adalah pemotongan lebih dari 98% yang dilaporkan vendor terhadap biaya input audio satu jam, dihitung dengan memberi harga pada sampel dua menit dan mengalikannya dengan tiga puluh, dengan video disampel pada 720p dan satu frame per detik. InternLumina U2 tidak menagih apa pun, karena tidak ada yang perlu ditagih: biayanya adalah perangkat keras dan waktu Anda, dan kartu model itu sendiri tidak mempublikasikan angka throughput yang memungkinkan Anda mengubahnya menjadi angka per token.

Itulah pertukarannya dalam satu baris. API memberi Anda kemampuan yang tidak dapat Anda host sendiri dan biaya per jam yang berskala dengan penggunaan; bobot terbuka memberi Anda biaya tetap dan kendali penuh atas jalur data, dengan konsekuensi berupa tumpukan inferensi yang harus Anda bangun dan sekumpulan checkpoint yang saat ini berarti perangkat keras Ascend. Untuk beban kerja teregulasi di mana media tidak boleh meninggalkan gedung, yang kedua bukan sekadar preferensi — itu satu-satunya opsi di halaman ini. Bagi tim yang membutuhkan analisis audio panjang bulan ini, yang pertama adalah satu-satunya opsi di halaman ini.

OrcaRouter tidak menghosting kedua model itu saat ini, dan kami lebih memilih mengatakannya secara terang-terangan daripada menyiratkan jalur perutean yang tidak ada: Qwen3.8-Omni-Flashhanya berjalan di platform milik Alibaba sendiri, dan InternLumina U2adalah berkas unduhan, bukan endpoint. Yang kami jalankan adalah sisa lini Qwen3.8 — Qwen3.8-Flashdan Qwen3.8-Max — melalui satu APIpada harga daftar penyedia dengan markup 0%, yang merupakan cara praktis untuk mempertahankan baseline yang berfungsi bagi sisi model tertutup dalam perbandingan ini sementara sisi open-weight masih membereskan checkpoint NVIDIA-nya.

A headless screenshot of the OrcaRouter model page for Qwen3.8 Flash at www.orcarouter.ai/models/qwen/qwen3.8-flash, showing the model header, the code sample, the input modalities and capabilities, the published pricing and the p50 TTFT figure.

Mana yang sebenarnya harus Anda pilih

Pilih InternLumina U2 jika Anda memerlukan satu model yang membaca, menghasilkan, dan mengedit gambar dan Anda bersedia memiliki stack inferensi — dan jika akselerator Anda adalah Ascend, atau Anda dapat menunggu checkpoint NVIDIA. Di antara keduanya, hanya model ini yang dapat membuat gambar, dan satu-satunya yang dapat Anda jalankan tanpa mengirim data ke vendor. Anggap angka benchmark-nya sebagai belum terbukti sampai laporan teknisnya terbit, karena kartu model mengatakan persis hal itu.

Pilih Qwen3.8-Omni-Flash jika masalah Anda adalah audio dan video berjam-jam alih-alih piksel keluaran — kecerdasan rapat, analisis rekaman panjang, pekerjaan agentik yang padat audio dalam bahasa Mandarin dan Inggris — dan jika Anda dapat menerima ketergantungan satu sumber dan keluaran hanya teks. Profil biayanya kuat pada jam audio masukan dan jauh lebih lemah pada total tagihan, tolok ukurnya dilaporkan vendor dan belum direproduksi, dan pengujian pihak ketiga pertama yang muncul menempatkannya pada persentil ke-28 dalam penalaran, pada sampel yang cukup kecil sehingga seharusnya memicu pengujian alih-alih keputusan.

Jika Anda membutuhkan keduanya, keduanya saling melengkapi, bukan alternatif: model gambar berbobot terbuka yang Anda hosting sendiri dan model media panjang tertutup yang Anda panggil. Tidak ada satu pun yang dapat dirutekan melalui kami saat ini. Hal yang perlu diperhatikan di satu sisi adalah checkpoint NVIDIA dan laporan teknisnya; di sisi lain, evaluasi independen pertama, yang belum ada dan yang merupakan kesenjangan tunggal terbesar dalam semua tulisan tentang Qwen3.8-Omni-Flash sejauh ini.