
InternLumina-U2 vs Gemini Omni 1.1 Flash: Model yang Belum Bisa Kamu Jalankan vs yang Kamu Bayar per Detik
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2658Kecerdasan72Koding
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
Jika tenggat waktu Anda minggu ini, perbandingan ini memiliki jawaban satu kalimat. Gemini Omni 1.1 Flash adalah model generasi video Google yang tersedia secara umum — Anda memanggilnya melalui API, model itu mengembalikan klip dengan audio tersinkronisasi, dan Anda membayar per detik keluaran. InternLumina-U2 adalah model riset Apache-2.0 yang diterbitkan secara senyap oleh Shanghai AI Laboratory — Anda dapat mengunduh kode inferensinya, tetapi tidak dengan bobotnya, yang masih diberi tanda "segera hadir" oleh laboratorium tersebut. Satu adalah produk yang bisa Anda beli sekarang; yang lain adalah taruhan berbentuk makalah yang sama sekali tidak bisa Anda jalankan. Pertanyaan yang menarik adalah mengapa ada orang menempatkan keduanya dalam satu kalimat sejak awal, dan apa yang masing-masing katakan tentang arah pekerjaan multimodal terbuka pada akhir 2026.
Semua hal di bawah ini diberi label berdasarkan sumbernya. Detail InternLumina-U2 berasal dari repositori GitHub dan halaman proyek yang diterbitkan laboratorium tersebut pada 1 September 2026 — hari yang sama ketika stub Hugging Face yang kosong muncul — dan setiap angka tolok ukurnya dilaporkan vendor, masih bersifat pendahuluan, dan belum direproduksi. Detail Gemini Omni 1.1 Flash berasal dari materi rilis Google sendiri dan halaman harga untuk model yang tersedia secara umum pada 27 Agustus 2026.
Dua jawaban untuk pertanyaan "multimodal" yang sama.
Kedua model berada di bawah payung longgar "satu model, banyak modalitas," dan label bersama itulah satu-satunya alasan keduanya dibandingkan. Di baliknya, mereka hampir tidak memiliki kesamaan apa pun. Gemini Omni 1.1 Flash adalah layanan pembuatan konten video-first yang tertutup dan terhosting: beri masukan teks, gambar, klip referensi pendek, atau audio, dan ia akan menghasilkan video 720p hingga sepuluh detik dengan ucapan, musik, dan efek suara yang sudah menyatu di dalamnya, yang dapat diperpanjang dalam kelipatan sepuluh detik hingga menjadi adegan berdurasi empat puluh detik. Ia menelaah klip yang sudah Anda miliki — proses perpanjangan kini memeriksa hingga sepuluh detik konteks sebelumnya, bukan satu detik seperti versi lama — serta mendukung kontrol bingkai pertama/terakhir sehingga Anda dapat mengunci awal dan akhir bidikan lalu membiarkan model mengisi bagian tengahnya. Ini adalah alat untuk membuat gambar bergerak, yang dijual per detik.
InternLumina-U2 adalah taruhan ke arah yang berlawanan: sebuah model sparse mixture-of-experts tunggal dengan total 16B parameter dan 1B parameter aktif, yang mengklaim mampu memahami gambar, video, dan aset 3D serta menghasilkan dan mengedit gambar melalui satu antarmuka token diskret bersama. Sisi visualnya sepenuhnya diskret — delapan codebook komplementer dari tokenizer yang oleh lab tersebut disebut AToken, sehingga setiap posisi visual dideskripsikan oleh delapan kode, bukan satu — dan sisi bahasanya adalah backbone difusi yang oleh lab tersebut diperluas dari LLaDA-2.0. Gagasannya adalah bahwa pemahaman dan generasi harus saling memperkuat dalam satu set bobot tunggal, alih-alih dirangkai dari model-model spesialis. Apakah hal itu berhasil, saat ini belum dapat dijawab: modelnya tidak dapat dijalankan di mana pun karena bobot-bobotnya tidak tersedia untuk publik.
Papan skor, seadanya.
Papan skor yang jujur untuk pasangan ini harus mencantumkan asal-usul di setiap baris, karena satu kolom adalah produk yang sudah dipasarkan dengan harga yang dipublikasikan, sementara kolom lainnya adalah klaim penelitian yang belum dirilis tanpa harga sama sekali.
• Apa itu — Gemini Omni 1.1 Flash: model pembuatan dan penyuntingan video yang dihosting (ID model gemini-omni-1.1-flash), GA 27 Agustus 2026. InternLumina-U2: LLM difusi sains terbuka untuk pemahaman omni-visual, pembuatan dan penyuntingan gambar, kode dirilis 1 September 2026.
• Weights — Gemini Omni 1.1 Flash: tidak ada, tertutup dan hanya tersedia via hosting. InternLumina-U2: belum ada juga, tetapi dilisensikan Apache-2.0 dan secara eksplisit ditandai "segera hadir."
• Output yang Anda dapatkan — Gemini Omni 1.1 Flash: klip 720p 10 detik dengan audio, dapat diperpanjang hingga 40 detik; upscale 1080p dan 4K; teks di sampingnya. InternLumina-U2: belum ada apa-apa — kode inferensi dan peta jalan.
• Input yang didukung — Gemini Omni 1.1 Flash: teks, gambar, video (hingga ~131K token input; tiga klip 10 detik per prompt), audio. InternLumina-U2: diklaim mendukung teks, gambar alami, grafik padat, video lebih dari 64 frame sampel, serta aset 3D GLB/GLTF yang dirender menjadi 64 tampilan warna dan kedalaman.
Cara menjalankannya — Gemini Omni 1.1 Flash: API Gemini Google melalui API Interactions yang stateful; akses konsumen melalui Google Flow untuk pelanggan AI Plus, Pro, dan Ultra. InternLumina-U2: hanya self-host, dan hanya setelah bobot dirilis; kode tersebut membutuhkan direktori checkpoint terpisah, bobot tokenizer AToken, FlashAttention, dan Blender 4.5 untuk jalur 3D.
• Berapa biayanya — Gemini Omni 1.1 Flash: $0,03/detik untuk draf 360p, $0,10/detik untuk 720p, $0,15/detik untuk 1080p, $0,30/detik untuk 4K, dengan tarif token $1,50 per juta input dan $9,00 per juta output teks. InternLumina-U2: berapa pun biaya GPU Anda sendiri, begitu produknya tersedia.

Kedua kolom tidak mengukur sumbu yang sama. Sisi Gemini telah diberi harga, dilayani, dan langsung berguna; sisi InternLumina adalah spesifikasi dari model yang belum menjadi model.
Bagian yang benar-benar terkini: GA Gemini Omni 1.1 Flash
Gemini Omni 1.1 Flash menjadi penting dengan sendirinya minggu ini karena ini adalah momen ketika lini video omni Google berhenti menjadi sekadar pratinjau. Endpoint pratinjau Gemini Omni Flash sebelumnya dijadwalkan dimatikan pada 30 September 2026, dan model GA ini adalah pengganti yang dituju para pengembang. Daftar peningkatannya konkret: perpanjangan scene berdurasi empat puluh detik yang dibangun dari penambahan sepuluh detik, kontrol keyframe yang memungkinkan Anda menentukan frame pertama dan terakhir lalu model akan menghasilkan footage penghubung di antaranya, klip referensi hingga tiga detik untuk menjaga konsistensi karakter atau latar, serta tier draf 360p yang dibanderol sepertiga dari harga 720p dan berjalan hingga 60% lebih cepat untuk iterasi prompt sebelum render final yang mahal. Jika Anda membangun pipeline video, tabel harga — $0.10 untuk satu detik 720p, $1.01 untuk klip sepuluh detik, sekitar $4 untuk scene 720p berdurasi empat puluh detik yang dibangun dari empat panggilan ekstensi — adalah angka yang mengubah model biaya Anda.
Tidak ada satu pun dari itu yang menjadikannya pesaing InternLumina-U2 dalam pengertian operasional apa pun. Gemini Omni 1.1 Flash menghasilkan gerakan; InternLumina-U2, jika klaimnya bertahan setelah bersentuhan dengan bobot model, akan memahami gerakan dan menghasilkan gambar diam. Tim yang membutuhkan video produk pada kuartal ini tidak memilih di antara keduanya — model Gemini adalah satu-satunya dari pasangan itu yang benar-benar dapat dipanggil, dan tersedia melalui API Google sendiri serta beberapa platform pihak ketiga.

Dokumentasi "Models" API Gemini di situs developer AI Google, diabadikan pada 2 September 2026 — halaman yang memuat daftar keluarga Gemini saat ini, dengan lini Gemini Omni di navigasi sidebar.
Bagian yang sama sekali tidak terkini: InternLumina-U2
Rilis InternLumina-U2 pada 1 September adalah jenis rilis yang paling senyap: tiga commit ke repositori GitHub, satu halaman proyek, stub Hugging Face sebesar 28 byte yang seluruh isinya berupa header lisensi Apache-2.0, dan tanpa pengumuman apa pun. Yang benar-benar publik hanyalah harness inferensi dan arsitekturnya, dan keduanya layak dibaca cermat justru karena belum ada yang mampu menguji modelnya secara langsung. Repo tersebut menunjukkan sebuah driver dengan satu titik masuk per tugas — teks, text-to-image hingga 1024×1024, pemahaman gambar atas gambar natural dan bagan yang padat, penyuntingan gambar berbasis instruksi dengan mode dual-CFG opsional, pemahaman video atas 64 frame hasil sampling, serta pemahaman 3D atas tampilan GLB/GLTF yang dirender Blender. Taruhan desainnya adalah bahwa kosakata visual diskret multi-codebook memungkinkan satu backbone menangani semuanya tanpa memperbesar panjang sekuens — yaitu naluri yang sama, 'token visual harus membawa lebih banyak informasi', yang mendorong model video codec-native; naluri itu kini diterapkan pada antarmuka terpadu untuk memahami sekaligus membangkitkan.

Repositori GitHub InternLM/InternLumina-U2, ditangkap pada 2 September 2026 — halaman utama repositori berlisensi Apache-2.0 dengan deskripsi "Multi-Codebook Diffusion Large Language Model", tiga commit, dan skrip inferensi per-tugas yang merupakan seluruh rilis publik sejauh ini.
Tabel tolok ukur di halaman proyek dilabeli "hasil awal dan parsial" oleh laboratoriumnya sendiri, dan angka-angka di sana berbicara dua arah: skor unggul untuk bagan dan dokumen (ChartQA 86,52, CharXiv-DQ 83,65, dilaporkan vendor) berdampingan dengan GenEval 0,81 yang kalah dari 0,89 milik setidaknya satu model yang diklaim dapat dilampaui lab tersebut. Tidak ada evaluasi independen karena tidak ada model untuk dievaluasi. Segala hal tentang kualitas sebenarnya tetap sekadar klaim sampai berkas safetensors muncul di stub Hugging Face yang kosong itu.
Apa yang dilakukan lapisan routing ketika hanya ada satu sisi
Ini adalah salah satu perbandingan di mana sudut routing sebenarnya soal waktu, bukan pilihan. Kami tidak akan berpura-pura OrcaRouter melayani InternLumina-U2 — tidak ada yang bisa, bobotnya belum dirilis — dan Gemini Omni 1.1 Flash juga tidak ada di katalog kami; Anda mengaksesnya melalui API Google sendiri. Fungsi sebenarnya dari lapisan routing di celah ini adalah menjaga opsi Anda tetap terbuka tanpa membangun ulang pipeline dua kali. Model pass-through adalah mekanismenya: ketika model vendor yang dihosting benar-benar masuk ke katalog, harga daftar penyedia diteruskan dengan markup 0%, sehingga tarif per detik yang diterbitkan vendor adalah tarif per detik yang Anda bayar melalui satu kunci, bukan kontrak per penyedia. Dan ketika rilis bobot Apache-2.0 seperti InternLumina-U2 akhirnya tiba, langkah rasionalnya bukanlah membongkar stack video Anda yang sudah berfungsi — melainkan menjalankan model baru di jalur pengujian di belakang failover otomatis, sehingga saat pertama kali model difusi yang belum teruji berulah, panggilan akan kembali ke model yang sudah Anda percaya tanpa perubahan kode. Cobalah hal baru di tempat yang tidak dapat merugikan Anda; rute-kan hal yang membayar tagihan.
Putusan
Jika Anda membutuhkan video bulan ini, keputusan sudah diambil untuk Anda: Gemini Omni 1.1 Flash nyata, sudah dipatok harganya, dan tersedia secara umum, sedangkan InternLumina-U2 belum bisa dipanggil oleh siapa pun. Jika Anda mengamati ke mana arah penelitian multimodal terbuka, InternLumina-U2 adalah artefak yang lebih menarik — sebuah taruhan langka yang sepenuhnya diskret dan multi-codebook dari laboratorium besar, berlisensi Apache-2.0, dengan arsitektur yang sudah publik dan bobot (weights) yang kemungkinan besar tidak lama lagi menyusul. Perlakukan repositori itu sebagai pratinjau arah penelitian, perlakukan model video GA sebagai alat yang bisa Anda bangun di atasnya hari ini, dan jangan biarkan label "multimodal" yang sama meyakinkan Anda bahwa keduanya bersaing untuk pekerjaan yang sama.
