
Grok Imagine Image 2.0 vs Flux 3: Editor yang Sudah Dirilis vs Janji Multimodal
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ini adalah adu langsung di mana hanya satu sisi yang benar-benar dapat dipanggil, dan versi jujur dari judul itu adalah perbandingan itu sendiri. Grok Imagine Image 2.0, model citra yang mengutamakan penyuntingan dari xAI, dirilis di aplikasi Grok pada 7 Agustus 2026 — pada minggu yang sama model ini masuk ke Text-to-Image Arena publik di posisi kedua dengan Elo 1.320 (sementara), hanya di belakang GPT Image 2 dengan 1.380. Flux 3, model fondasi multimodal terpadu milik Black Forest Labs yang diumumkan pada 23 Juli, melatih prediksi gambar, video, audio, dan aksi robot dalam satu set bobot — tetapi layanan gambarnya masih belum memiliki endpoint publik, harga, maupun demo yang dirilis hingga hari ini, 8 Agustus. Satu model dapat Anda panggil sore ini; model lainnya adalah rilis gambar yang telah dinantikan semua orang sejak akhir Juli, tetapi belum dapat dijalankan oleh siapa pun. Asimetri itulah inti ceritanya, dan itu menentukan seperti apa perbandingan yang adil itu.

Papan skor
Pada dimensi yang sebenarnya diaktifkan oleh pasangan ini, inilah posisi masing-masing pihak saat ini. Angka Grok Imagine Image 2.0 berasal dari papan Arena publik dan dokumentasi xAI sendiri; status gambar Flux 3 sesuai dengan pengumuman Black Forest Labs tanggal 23 Juli dan dokumen BFL saat ini, dan setiap klaim peta jalan di sisi Flux 3 dilaporkan oleh vendor dan belum diverifikasi hingga endpoint tersebut ada.
• Ketersediaan — Grok Imagine Image 2.0 telah tersedia di aplikasi Grok (web, iOS, Android) sejak 7 Agustus vs tier gambar Flux 3 yang diumumkan pada 23 Juli, masih belum dirilis.
{{1}}Arena Teks-ke-Gambar — Grok Imagine Image 2.0 {{2}}#2 dengan Elo 1.320{{3}}, ditandai sebagai pendahuluan{{4}}, di papan publik{{5}} melawan Flux 3 image{{6}}, belum memiliki peringkat dan belum masuk{{7}}.
• Penyuntingan — Grok Imagine Image 2.0 hadir dengan Magic Wand, segmentasi, penghapusan latar belakang, dan input multi-referensi, sedangkan gambar Flux 3 menjanjikan penyuntingan "lintas gaya dan rasio aspek," tanpa demo yang dirilis.
• Teks dalam gambar — Grok Imagine Image 2.0 mengklaim tipografi yang direncanakan desainer dan teks kecil yang lebih tajam vs Flux 3 yang menjanjikan rendering teks multibahasa di dalam gambar.
• Harga — Grok Imagine Image 2.0 $0.02–$0.05 per gambar di API xAI dibandingkan Flux 3 image yang belum dipatok harga; hanya tier video ($0.06–$0.54/detik) yang ditagihkan saat ini.
• API — API developer Grok Imagine Image 2.0 terbuka, dengan ID model Image 2.0 yang masih belum dikonfirmasi, sedangkan untuk Flux 3 image tidak ada endpoint yang tersedia.
Mengapa pertandingan ini tidak bisa menjadi adu tembak biasa
Perbandingan model gambar yang normal mengirimkan prompt yang sama ke kedua endpoint dan membandingkan perbedaan keluarannya. Anda tidak dapat menjalankannya di sini, karena hanya ada satu endpoint. Grok Imagine Image 2.0 dapat dipanggil melalui aplikasi milik xAI sendiri dan API developer — API developer tersebut telah aktif sejak generasi Maret dari model gambar dasar, dan ID model API khusus untuk Image 2.0 masih belum dikonfirmasi, sebuah poin yang penting bagi siapa pun yang berencana membangun di atasnya. Flux 3 image tidak dapat dipanggil di mana pun: dokumentasi BFL sendiri saat ini hanya menampilkan "Video dengan audio tersinkronisasi, kini tersedia," dengan catatan bahwa "lebih banyak modalitas akan hadir dengan format permintaan yang sama begitu dirilis." Jadi perbandingan langsung yang jujur adalah tentang apa yang masing-masing pihak telah kirimkan, apa yang telah dijanjikan, dan apa yang dapat Anda bangun hari ini. Itu adalah perbandingan yang nyata; hanya saja bukan perbandingan benchmark.

Perangkat alat pengeditan adalah bidang di mana Image 2.0 sudah lebih unggul.
Grok Imagine Image 2.0 hadir dengan pengeditan sebagai fitur kelas utama, bukan fitur susulan. Magic Wand hanya mengedit area yang Anda pilih, membiarkan bagian lain dari bingkai tidak tersentuh; segmentasi memungkinkan Anda mewarnai ulang atau mengganti area presisi hingga material satu objek; penghapusan latar belakang mengekspor subjek pada kanvas transparan untuk digunakan kembali di tempat lain; dan masukan multi-referensi menerima hingga lima gambar dalam satu pembangkitan, sehingga mengomposit beberapa subjek tidak memerlukan potong-dan-tempel manual. Smart Resize menyusun ulang pada sembilan rasio aspek, dari spanduk tinggi 1:2 hingga spanduk lebar 2:1, mengisi bingkai secara otomatis saat dimensi berubah. Model ini dilatih khusus untuk fotografi, desain grafis, dan ilustrasi, serta hadir dengan templat bawaan untuk bidikan produk, potret kepala, daftar e-commerce, aset game, dan poster pemasaran — posisi yang diarahkan langsung pada alur kerja komersial penghasil hasil akhir.
Tingkatan gambar Flux 3, menurut materi peluncuran BFL, menjanjikan pengeditan "across styles and aspect ratios" dan satu model yang menangani gambar diam dan gerakan secara bersamaan. Belum ada demo yang dirilis, tidak ada galeri sampel, dan tidak ada endpoint untuk diuji. Pada dimensi pengeditan, ini belum mendekati sekarang: satu sudah dirilis dan terukur, yang lain adalah klaim peta jalan.
Keduanya memburu titik lemah yang sama: teks di dalam gambar
Teks dalam gambar yang mudah dibaca adalah masalah tersulit yang belum terpecahkan dalam pembuatan gambar, dan kedua vendor mengincarnya dalam waktu dua minggu yang sama. xAI menyebutkan bahwa Grok Imagine Image 2.0 merencanakan tata letak dan tipografi "seperti yang dilakukan seorang desainer," dengan teks kecil yang lebih tajam pada grafis padat dan lebih sedikit kata, logo, serta label yang rusak. Perbaikan yang dinyatakan BFL untuk tingkatan gambar Flux 3 mencakup "perenderan teks multibahasa di dalam gambar" — jawaban langsung atas mode kegagalan yang sama dan salah satu klaim konkret dalam pengumuman Juli. Kedua kemampuan tersebut belum di-benchmark secara independen; keduanya hanyalah klaim vendor. Perbedaan praktisnya adalah klaim Image 2.0 dapat diuji hari ini dengan prompt Anda sendiri, sedangkan Flux 3 sama sekali tidak dapat diuji.
Harga, ketika hanya satu sisi yang memiliki harga
Grok Imagine Image 2.0 adalah bayar-per-gambar di API xAI: grok-imagine-image seharga $0.02 per gambar dan grok-imagine-image-quality seharga $0.05 per gambar, dengan batas 5 permintaan per detik, dan pengeditan dikenakan biaya untuk gambar input dan output yang dihasilkan. Di aplikasi konsumen, ia berada di balik langganan SuperGrok sebesar $30 per bulan, dengan tier gratis yang telah dihapus pada awal tahun ini — itulah sebabnya API, bukan aplikasinya, menjadi acuan harga bagi siapa pun yang membangun dengannya.

Tingkatan gambar Flux 3 tidak memiliki harga karena tidak memiliki endpoint. Satu-satunya angka BFL yang dipublikasikan adalah untuk tingkatan video — $0,06 per detik untuk draf, $0,17/detik HD, dan $0,29/detik FHD untuk text-to-video dan image-to-video, kira-kira dua kali lipat untuk video-to-video — yang setidaknya menandakan bahwa BFL mematok harga keluarga Flux 3 di segmen premium pasar. Ketika tingkatan gambar diluncurkan, harga per gambar yang jauh di atas batas bawah $0,02 milik xAI tidak akan mengejutkan, tetapi itu hanyalah inferensi, bukan fakta; pernyataan yang akurat adalah bahwa BFL sama sekali tidak memberikan harga untuk gambar.
Apa yang dibawa Flux 3 yang tidak bisa dilakukan Image 2.0
Argumen untuk Flux 3 tidak pernah tentang foto diam masa kini. BFL melatih satu set bobot untuk gambar, video, audio, dan aksi robot, sehingga "model gambar" adalah model yang sama yang kemudian menghasilkan ucapan dan efek yang tersinkronisasi, menganimasikan keyframe yang diberikan menjadi klip 20 detik, dan — dalam jangka panjang — memprediksi perilaku robot. Jika pipeline Anda membutuhkan identitas subjek untuk bertahan dari gambar diam menjadi karya bergerak, atau menginginkan satu bentuk permintaan yang mencakup semua modalitas, itu adalah taruhan arsitektural yang tidak diambil oleh produk penyuntingan foto seperti Grok Imagine Image 2.0.
Penyeimbangnya adalah bahwa Grok Imagine Image 2.0 adalah produk nyata dengan peringkat Arena yang nyata — meskipun masih awal — saat ini, dan Flux 3 image adalah janji yang telah melihat produk saudaranya dirilis: FLUX 3 Video resmi tersedia pada 4-5 Agustus, sementara tingkatan gambar masih dalam "beberapa minggu mendatang." Ambisi multimodal bukanlah tujuan akhir.
Siapa yang harus memilih yang mana?
Jika Anda membutuhkan pengeditan gambar produksi pada kuartal ini — penghapusan latar belakang, pengeditan area, komposisi multi-referensi — Grok Imagine Image 2.0 adalah satu-satunya dari keduanya yang benar-benar dapat Anda adopsi, dan harganya $0,02–$0,05 per gambar membuat pengujian sistematis terhadap prompt Anda sendiri cukup murah untuk sekadar dijalankan. Jika Anda merencanakan pipeline yang mencakup gambar diam, gerak, dan audio dari satu model, dan Anda mampu menunggu, Flux 3 image adalah taruhan yang lebih menarik — tetapi itu adalah taruhan yang belum dirilis, tanpa tanggal pasti selain "beberapa minggu mendatang" dan tanpa harga.
Tidak ada satu pun dari kedua model yang berada di OrcaRouter hari ini: xAI mendistribusikan Image 2.0 melalui aplikasi dan API pengembangnya sendiri, dan BFL mengirimkannya melalui API sendiri, dan belum ada satu pun yang mendarat di host pihak ketiga. Ketika hal itu terjadi, keduanya layak dijalankan melalui satu lapisan perutean — A/B per gambar pada prompt Anda sendiri, failover otomatis ke generator yang terbukti selama salah satu model masih baru, dan markup 0% yang diteruskan sehingga daftar harga yang Anda lihat adalah harga list penyedia, dengan potongan apa pun masuk pada hari yang sama. Itulah cara Anda mengadopsi model yang baru berumur dua hari dan model yang belum dirilis tanpa mempertaruhkan jalur produksi pada salah satu dari keduanya.
Intinya
Grok Imagine Image 2.0 vs Flux 3 saat ini bukanlah perlombaan yang ketat, karena ini bukan perlombaan — satu pesaing sudah berada di lintasan. Image 2.0 menyertakan toolkit pengeditan yang mumpuni dengan harga per gambar, dengan peringkat Arena yang nyata namun masih awal, dan peringkat pengeditan yang dikutip xAI, belum dikonfirmasi secara independen. Flux 3 image adalah arsitektur yang lebih ambisius, masih belum dirilis, tanpa harga dan tanpa demo. Jika Anda membutuhkan gambar hari ini, pilihannya sudah jelas. Jika Anda bertaruh pada ke mana arah generasi gambar, perhatikan tier gambar Flux 3 — dan anggap setiap klaim peta jalan belum terverifikasi sampai endpoint-nya ada.
