
Qwen3.8-Omni-Flash vs Gemini Omni 1.1 Flash: Satu Menonton Video, Satu Membuatnya
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Jawaban singkat: keduanya bukan pengganti satu sama lain, dan perbandingannya baru masuk akal setelah Anda berhenti memperlakukan "omni" sebagai sebuah kategori. Qwen3.8-Omni-Flash, yang dibuka vendor untuk pelanggan API pada 18 September 2026, menerima teks, gambar, audio, dan video lalu mengembalikan teks — ini model untuk membaca satu jam rekaman rapat atau video dan memberi tahu Anda apa yang terjadi. Gemini Omni 1.1 Flash, yang dirilis vendor pada 27 Agustus 2026, menerima prompt teks atau gambar dan mengembalikan video dengan audio yang tersinkronisasi — ini model untuk membuat rekaman tersebut. Yang satu mengonsumsi media, yang lain memproduksinya. Jika pipeline Anda membutuhkan keduanya, Anda membutuhkan keduanya, dan pertanyaan yang jujur bukanlah mana yang menang, melainkan mana yang sebenarnya Anda butuhkan.
Tak satu pun dari kedua model itu bersifat open-weight, tak satu pun dapat dirutekan melalui OrcaRouter, dan keduanya dihargai berdasarkan sumbu yang tidak dapat dikonversikan satu sama lain — token di satu sisi, detik video yang dihasilkan di sisi lain. Wilayah tempat keduanya benar-benar tumpang tindih lebih sempit daripada yang disiratkan oleh pembingkaian “omni vs omni”, dan tumpang tindih itu layak dipastikan sebelum aritmetika harga, karena aritmetika harga adalah tempat keduanya paling sering dibandingkan secara keliru.
Kekeliruan kategori yang perlu dijelaskan terlebih dahulu
Materi peluncuran Alibaba membandingkan Qwen3.8-Omni-Flash dengan Gemini 3.8 Flash, dan banyak sekali liputan setelahnya meringkasnya menjadi "mengalahkan Gemini." Itu adalah model Google yang berbeda dari Gemini Omni 1.1 Flash, dan keduanya bukan titik acuan yang bisa dipertukarkan: Gemini 3.8 Flash adalah model multimodal serbaguna, sedangkan Gemini Omni 1.1 Flash adalah model pembuatan video dengan daftar harga tersendiri dan permukaan API tersendiri. Setiap angka Qwen-versus-Gemini yang beredar dari peluncuran itu — WildClawBench-MM 71,0 berbanding 58,9, SpotSoundBench 67,2 berbanding 39,7, AgenticVBench 36,8 berbanding 45,0 — adalah terhadap Gemini 3.8 Flash, bukan terhadap model video Omni, dan bagaimanapun juga tidak ada satu pun yang independen. Jika Anda sampai di sini dengan membawa papan skor yang menempatkan kedua model dalam artikel ini pada sumbu yang sama, hampir pasti itu model Google yang salah di kolom sebelah kanan.
Apa yang sebenarnya dilakukan masing-masing
• Apa yang dapat diterimanya — Qwen3.8-Omni-Flash menerima teks, gambar, audio, dan video, termasuk audio spasial stereo dan empat kanal; Gemini Omni 1.1 Flash menerima prompt teks dan gambar plus hingga tiga detik video referensi.
• Apa yang dikembalikannya — Qwen3.8-Omni-Flash hanya mengembalikan teks; Gemini Omni 1.1 Flash mengembalikan video dengan audio yang tersinkronisasi secara native, dalam adegan yang dapat diperpanjang hingga 40 detik dengan kelipatan sepuluh detik.
• Permukaan kontrol — Qwen3.8-Omni-Flash mengekspos konteks, sampling, dan mode agentik yang memutuskan sendiri apa yang harus dilihat; Gemini Omni 1.1 Flash mengekspos kontrol frame pertama dan frame terakhir, lookback sepuluh detik untuk kontinuitas, dan tier drafting 360p yang menurut Google sekitar sepertiga biayanya dan sekitar 60% lebih cepat.
• Resolusi dan hasil akhir — Qwen3.8-Omni-Flash tidak memiliki resolusi keluaran karena tidak menghasilkan media; Gemini Omni 1.1 Flash menghasilkan pada 720p, 1080p, dan 4K.
• Konteks dan durasi — Qwen3.8-Omni-Flash membawa satu juta token dan hingga satu jam audio-video berkelanjutan dalam satu panggilan; Gemini Omni 1.1 Flash dibatasi oleh klip yang dihasilkannya, bukan oleh jendela masukan.
• Cara Anda membayar — Qwen3.8-Omni-Flash ditagih per token: $0,15 per juta input, $0,016 yang di-cache, $0,47 output pada daftar internasional; Gemini Omni 1.1 Flash ditagih per detik video yang dihasilkan, dengan tarif resmi Google sebesar $0,10 per detik untuk 720p.
• Keterbukaan — tertutup di kedua sisi. Tidak ada bobot untuk kedua model, dan keduanya tidak tersedia untuk dirutekan melalui API kami saat ini.

Tumpang tindihnya adalah pemahaman video, dan hal itu asimetris.
Satu-satunya tempat seorang pembeli dapat secara wajar menempatkan keduanya berdampingan adalah pipeline yang harus memahami materi video sekaligus menghasilkannya — misalnya, asisten penyuntingan yang membaca rekaman panjang, menemukan momen yang layak dipertahankan, dan menghasilkan potongan. Pada sisi pemahaman, Qwen3.8-Omni-Flash dibangun tepat untuk ini: satu jam audio dan video berkelanjutan per panggilan, pemisahan pembicara, dan mode agentik yang meningkatkan akurasi pada OmniVideoBench milik vendor dari 63,4 menjadi 67,8 sekaligus memangkas token per kueri dari 145.736 menjadi 79.117. Pada sisi produksi, Gemini Omni 1.1 Flash adalah model yang dapat menghasilkan klip yang dihasilkan dengan audio tersinkronisasi, sedangkan model Qwen sama sekali tidak dapat menghasilkan satu bingkai video pun.
Asimetri ini juga berlaku sebaliknya, dan justru lebih mudah terlewatkan. Kemampuan pemahaman sebuah model generasi video bersifat instrumental — model itu perlu memahami cukup banyak adegan untuk menjaga konsistensi sebuah shot selama perpanjangan sepuluh detik, yang merupakan persyaratan berbeda dari menjawab pertanyaan tentang apa yang dikatakan pada jam ketiga sebuah rapat. Model Google memiliki rekam jejak yang lebih panjang dalam kualitas generasi dan lebih pendek dalam analisis bentuk panjang; model Alibaba sebaliknya. Jika tugas Anda adalah "temukan tiga menit yang penting dalam rekaman ini," model generasi bukanlah alatnya. Jika tugas Anda adalah "hasilkan klip tiga puluh detik yang sesuai dengan brief ini," model pemahaman juga bukan alatnya.
Mengapa perbandingan harga terus salah
Tarif per detik dan tarif per token tidak dapat dikonversi, dan upaya untuk mengonversinya menghasilkan dua kesalahan yang mendominasi perbandingan ini. Yang pertama adalah membandingkan klip utuh yang dihasilkan dengan tarif input per token lalu menyimpulkan bahwa model video tersebut ratusan kali lebih mahal — yang itu benar tetapi tidak bermakna, karena keduanya tidak menjual hal yang sama. Yang kedua adalah hanya membandingkan harga input dan melewatkan bahwa potongan audio 98% Alibaba berlaku untuk jam audio input, sementara tarif Google berlaku untuk detik video output, sehingga kedua "potongan" itu bahkan tidak berada di sisi meteran yang sama.
Yang bisa dikatakan dengan jujur adalah ini. Berdasarkan metodologi Alibaba sendiri — sampel dua menit dikalikan tiga puluh, video 720p dan satu bingkai per detik — satu jam input audio dan video gabungan ke Qwen3.8-Omni-Flash dihargai sekitar $0,20, turun dari $3,27 dibanding generasi sebelumnya. Menghasilkan empat puluh detik video 720p dengan Gemini Omni 1.1 Flash pada harga terbitan Google $0,10 per detik memerlukan biaya $4,00, dan menyusun empat puluh detik yang sama pada 360p mendekati $1,20 berdasarkan kerangka biaya sepertiga Google. Kedua kumpulan angka itu dilaporkan vendor dan tidak satu pun telah direproduksi secara independen. Kesimpulan yang berguna bukanlah angka mana yang lebih kecil, melainkan bahwa menganalisis satu jam rekaman dan menghasilkan empat puluh detik rekaman berada dalam orde besaran yang sama — inilah alasan sebenarnya mengapa pipeline produksi yang melakukan keduanya membutuhkan model biaya, bukan pemenang.
Itu juga argumen untuk menaruh keduanya pada satu kunci alih-alih dua kontrak. Tidak ada satu pun model omni yang dapat dirutekan melalui OrcaRouter saat ini: Qwen3.8-Omni-Flash hanya berjalan di platform milik Alibaba sendiri, dan Google belum membuka Omni video API untuk perutean pihak ketiga, sehingga kami tidak menghosting keduanya dan tidak akan berpura-pura. Yang tersedia di katalog kami adalah saudara dari masing-masing keluarga — Qwen3.8-Flash dan Gemini 3.8 Flash — keduanya dapat dipanggil hari ini melalui satu endpoint pada harga daftar penyedia dengan markup 0%, yang membuat uji A/B terhadap angka milik masing-masing vendor menjadi soal perubahan konfigurasi, bukan integrasi kedua.

Di mana masing-masing unggul, dinyatakan secara lugas
Qwen3.8-Omni-Flash menang pada apa pun yang diukur dalam jam input: transkripsi rapat dan diarisasi, peringkasan rekaman panjang, penggunaan alat agentik yang sarat audio, dan biaya per jam media yang diproses. Hasil audio yang dilaporkan vendor kuat dan kelemahannya ada pada hal yang memang bukan sasaran model ini — papan-papan berat penalaran, tempat uji coba pihak ketiga pertama menempatkannya di persentil ke-28 untuk penalaran dengan angka kecepatan di persentil ke-21, pada sampel yang cukup kecil sehingga angka-angka itu harus diperlakukan sebagai dorongan untuk menguji, bukan sebagai putusan.
Gemini Omni 1.1 Flash unggul dalam hal output: pembuatan shot dengan audio yang tersinkronisasi, kesinambungan di seluruh adegan yang panjang, kontrol tingkat frame, dan hasil akhir 4K yang mungkin memang dibutuhkan oleh pipeline pengiriman. Keunggulannya bukanlah skor benchmark — melainkan bahwa model lain sama sekali tidak bisa mengerjakan tugas itu. Titik lemahnya adalah apa pun yang mengharuskan penahanan konteks selama satu jam, karena model ini memang tidak dirancang untuk itu.
Keputusan, dan hal yang perlu diperhatikan
Jika Anda memilih di antara keduanya, pertanyaannya adalah separuh pipeline mana yang belum terlayani. Tim yang sudah menghasilkan video dan perlu memahami rekaman panjang harus menguji Qwen3.8-Omni-Flash pada audionya sendiri minggu ini; tim yang menganalisis media dan perlu memproduksinya harus menguji Gemini Omni 1.1 Flash. Tim yang membutuhkan keduanya sedang menghadapi dua vendor, dua model penagihan, dan dua integrasi, yaitu situasi ketika lapisan perutean tunggal berhenti menjadi kemudahan dan mulai menjadi hal yang menjaga model biaya tetap terbaca.
Dua hal akan mengubah pembacaan ini. Evaluasi independen terhadap Qwen3.8-Omni-Flash akan menggantikan setiap angka vendor di atas dengan angka yang sebanding — belum ada yang seperti itu, dan ketiadaannya merupakan celah tunggal terbesar dalam perbandingan ini. Dan tarif yang dipublikasikan untuk output 1080p dan 4K dari Google akan membuat perhitungan kelas atas dapat diperiksa; saat ini angka-angka tersebut hanya beredar sebagai estimasi pasar, bukan sebagai daftar resmi Google sendiri.

Satu catatan penutup tentang framing. "Omni" tidak lagi berarti apa pun yang presisi — istilah itu kini mencakup model yang membaca satu jam audio rapat dan model yang merender klip empat puluh detik dengan suara, dan memperlakukan kata itu sebagai kategori adalah cara pembeli akhirnya membandingkan tarif per token dengan tarif per detik lalu menarik kesimpulan darinya. Model-model itu saling melengkapi dengan tumpang tindih yang sempit, dan sikap yang tepat terhadap keduanya, lima hari dan empat minggu setelah peluncurannya masing-masing, adalah sama: ukur keduanya pada materi Anda sendiri, dan biarkan jalur kedua tetap terbuka.
Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
