Kartu judul hero untuk Grok Imagine Image 2.0 vs Flux 3 dengan teks 'Grok Imagine Image 2.0 vs Flux 3' dan subjudul 'Satu sudah live di #2 di Arena. Yang lainnya masih akan datang.' Serta ilustrasi datar bingkai foto yang terbelah antara hasil editan yang sudah jadi dan kerangka yang belum selesai, dengan lencana VS kecil.
Guides & Insights

Grok Imagine Image 2.0 vs Flux 3: Editor yang Sudah Dirilis vs Janji Multimodal

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ini adalah adu langsung di mana hanya satu sisi yang benar-benar dapat dipanggil, dan versi jujur dari judul itu adalah perbandingan itu sendiri. Grok Imagine Image 2.0, model citra yang mengutamakan penyuntingan dari xAI, dirilis di aplikasi Grok pada 7 Agustus 2026 — pada minggu yang sama model ini masuk ke Text-to-Image Arena publik di posisi kedua dengan Elo 1.320 (sementara), hanya di belakang GPT Image 2 dengan 1.380. Flux 3, model fondasi multimodal terpadu milik Black Forest Labs yang diumumkan pada 23 Juli, melatih prediksi gambar, video, audio, dan aksi robot dalam satu set bobot — tetapi layanan gambarnya masih belum memiliki endpoint publik, harga, maupun demo yang dirilis hingga hari ini, 8 Agustus. Satu model dapat Anda panggil sore ini; model lainnya adalah rilis gambar yang telah dinantikan semua orang sejak akhir Juli, tetapi belum dapat dijalankan oleh siapa pun. Asimetri itulah inti ceritanya, dan itu menentukan seperti apa perbandingan yang adil itu.

Two-column comparison scoreboard for Grok Imagine Image 2.0 and Flux 3: availability 'live now, Aug 7 2026' vs 'announced, not shipped'; Text-to-Image Arena '#2, Elo 1,320 (preliminary)' vs 'no ranking yet'; editing 'Magic Wand + segmentation, shipped' vs 'promised across styles & ratios'; in-image text 'designer-planned typography' vs 'multilingual text promised'; price '$0.02-$0.05 per image' vs 'unpriced'; API 'open; 2.0 model ID unconfirmed' vs 'no endpoint yet'. Footer reads 'Grok figures per arena.ai + xAI docs; Flux 3 status per BFL docs, August 2026.'

Papan skor

Pada dimensi yang sebenarnya diaktifkan oleh pasangan ini, inilah posisi masing-masing pihak saat ini. Angka Grok Imagine Image 2.0 berasal dari papan Arena publik dan dokumentasi xAI sendiri; status gambar Flux 3 sesuai dengan pengumuman Black Forest Labs tanggal 23 Juli dan dokumen BFL saat ini, dan setiap klaim peta jalan di sisi Flux 3 dilaporkan oleh vendor dan belum diverifikasi hingga endpoint tersebut ada.

• Ketersediaan — Grok Imagine Image 2.0 telah tersedia di aplikasi Grok (web, iOS, Android) sejak 7 Agustus vs tier gambar Flux 3 yang diumumkan pada 23 Juli, masih belum dirilis.

{{1}}Arena Teks-ke-Gambar — Grok Imagine Image 2.0 {{2}}#2 dengan Elo 1.320{{3}}, ditandai sebagai pendahuluan{{4}}, di papan publik{{5}} melawan Flux 3 image{{6}}, belum memiliki peringkat dan belum masuk{{7}}.

• Penyuntingan — Grok Imagine Image 2.0 hadir dengan Magic Wand, segmentasi, penghapusan latar belakang, dan input multi-referensi, sedangkan gambar Flux 3 menjanjikan penyuntingan "lintas gaya dan rasio aspek," tanpa demo yang dirilis.

• Teks dalam gambar — Grok Imagine Image 2.0 mengklaim tipografi yang direncanakan desainer dan teks kecil yang lebih tajam vs Flux 3 yang menjanjikan rendering teks multibahasa di dalam gambar.

• Harga — Grok Imagine Image 2.0 $0.02–$0.05 per gambar di API xAI dibandingkan Flux 3 image yang belum dipatok harga; hanya tier video ($0.06–$0.54/detik) yang ditagihkan saat ini.

• API — API developer Grok Imagine Image 2.0 terbuka, dengan ID model Image 2.0 yang masih belum dikonfirmasi, sedangkan untuk Flux 3 image tidak ada endpoint yang tersedia.

Mengapa pertandingan ini tidak bisa menjadi adu tembak biasa

Perbandingan model gambar yang normal mengirimkan prompt yang sama ke kedua endpoint dan membandingkan perbedaan keluarannya. Anda tidak dapat menjalankannya di sini, karena hanya ada satu endpoint. Grok Imagine Image 2.0 dapat dipanggil melalui aplikasi milik x​AI sendiri dan API developer — API developer tersebut telah aktif sejak generasi Maret dari model gambar dasar, dan ID model API khusus untuk Image 2.0 masih belum dikonfirmasi, sebuah poin yang penting bagi siapa pun yang berencana membangun di atasnya. Flux 3 image tidak dapat dipanggil di mana pun: dokumentasi BFL sendiri saat ini hanya menampilkan "Video dengan audio tersinkronisasi, kini tersedia," dengan catatan bahwa "lebih banyak modalitas akan hadir dengan format permintaan yang sama begitu dirilis." Jadi perbandingan langsung yang jujur adalah tentang apa yang masing-masing pihak telah kirimkan, apa yang telah dijanjikan, dan apa yang dapat Anda bangun hari ini. Itu adalah perbandingan yang nyata; hanya saja bukan perbandingan benchmark.

Screenshot of Black Forest Labs' FLUX 3 documentation as of August 2026, showing the heading 'FLUX 3 — one model, multiple modalities,' the line that FLUX 3 generates video with synchronized audio and that more modalities ship on the same request shape as they land, specs of up to 20 seconds at FHD 24 fps, and a left navigation that still lists FLUX.2 Image Editing and FLUX.2 Text to Image under image tools.

Perangkat alat pengeditan adalah bidang di mana Image 2.0 sudah lebih unggul.

Grok Imagine Image 2.0 hadir dengan pengeditan sebagai fitur kelas utama, bukan fitur susulan. Magic Wand hanya mengedit area yang Anda pilih, membiarkan bagian lain dari bingkai tidak tersentuh; segmentasi memungkinkan Anda mewarnai ulang atau mengganti area presisi hingga material satu objek; penghapusan latar belakang mengekspor subjek pada kanvas transparan untuk digunakan kembali di tempat lain; dan masukan multi-referensi menerima hingga lima gambar dalam satu pembangkitan, sehingga mengomposit beberapa subjek tidak memerlukan potong-dan-tempel manual. Smart Resize menyusun ulang pada sembilan rasio aspek, dari spanduk tinggi 1:2 hingga spanduk lebar 2:1, mengisi bingkai secara otomatis saat dimensi berubah. Model ini dilatih khusus untuk fotografi, desain grafis, dan ilustrasi, serta hadir dengan templat bawaan untuk bidikan produk, potret kepala, daftar e-commerce, aset game, dan poster pemasaran — posisi yang diarahkan langsung pada alur kerja komersial penghasil hasil akhir.

Tingkatan gambar Flux 3, menurut materi peluncuran BFL, menjanjikan pengeditan "across styles and aspect ratios" dan satu model yang menangani gambar diam dan gerakan secara bersamaan. Belum ada demo yang dirilis, tidak ada galeri sampel, dan tidak ada endpoint untuk diuji. Pada dimensi pengeditan, ini belum mendekati sekarang: satu sudah dirilis dan terukur, yang lain adalah klaim peta jalan.

Keduanya memburu titik lemah yang sama: teks di dalam gambar

Teks dalam gambar yang mudah dibaca adalah masalah tersulit yang belum terpecahkan dalam pembuatan gambar, dan kedua vendor mengincarnya dalam waktu dua minggu yang sama. xAI menyebutkan bahwa Grok Imagine Image 2.0 merencanakan tata letak dan tipografi "seperti yang dilakukan seorang desainer," dengan teks kecil yang lebih tajam pada grafis padat dan lebih sedikit kata, logo, serta label yang rusak. Perbaikan yang dinyatakan BFL untuk tingkatan gambar Flux 3 mencakup "perenderan teks multibahasa di dalam gambar" — jawaban langsung atas mode kegagalan yang sama dan salah satu klaim konkret dalam pengumuman Juli. Kedua kemampuan tersebut belum di-benchmark secara independen; keduanya hanyalah klaim vendor. Perbedaan praktisnya adalah klaim Image 2.0 dapat diuji hari ini dengan prompt Anda sendiri, sedangkan Flux 3 sama sekali tidak dapat diuji.

Harga, ketika hanya satu sisi yang memiliki harga

Grok Imagine Image 2.0 adalah bayar-per-gambar di API xAI: grok-imagine-image seharga $0.02 per gambar dan grok-imagine-image-quality seharga $0.05 per gambar, dengan batas 5 permintaan per detik, dan pengeditan dikenakan biaya untuk gambar input dan output yang dihasilkan. Di aplikasi konsumen, ia berada di balik langganan SuperGrok sebesar $30 per bulan, dengan tier gratis yang telah dihapus pada awal tahun ini — itulah sebabnya API, bukan aplikasinya, menjadi acuan harga bagi siapa pun yang membangun dengannya.

Screenshot of xAI's official grok-imagine-image model documentation showing the pricing card at $0.02 per generated image, the note that you are charged for each image generated and also when an image is used as input, the alias grok-imagine-image-2026-03-02 for the March 2026 base model, and a 5 requests-per-second rate limit.

Tingkatan gambar Flux 3 tidak memiliki harga karena tidak memiliki endpoint. Satu-satunya angka BFL yang dipublikasikan adalah untuk tingkatan video — $0,06 per detik untuk draf, $0,17/detik HD, dan $0,29/detik FHD untuk text-to-video dan image-to-video, kira-kira dua kali lipat untuk video-to-video — yang setidaknya menandakan bahwa BFL mematok harga keluarga Flux 3 di segmen premium pasar. Ketika tingkatan gambar diluncurkan, harga per gambar yang jauh di atas batas bawah $0,02 milik xAI tidak akan mengejutkan, tetapi itu hanyalah inferensi, bukan fakta; pernyataan yang akurat adalah bahwa BFL sama sekali tidak memberikan harga untuk gambar.

Apa yang dibawa Flux 3 yang tidak bisa dilakukan Image 2.0

Argumen untuk Flux 3 tidak pernah tentang foto diam masa kini. BFL melatih satu set bobot untuk gambar, video, audio, dan aksi robot, sehingga "model gambar" adalah model yang sama yang kemudian menghasilkan ucapan dan efek yang tersinkronisasi, menganimasikan keyframe yang diberikan menjadi klip 20 detik, dan — dalam jangka panjang — memprediksi perilaku robot. Jika pipeline Anda membutuhkan identitas subjek untuk bertahan dari gambar diam menjadi karya bergerak, atau menginginkan satu bentuk permintaan yang mencakup semua modalitas, itu adalah taruhan arsitektural yang tidak diambil oleh produk penyuntingan foto seperti Grok Imagine Image 2.0.

Penyeimbangnya adalah bahwa Grok Imagine Image 2.0 adalah produk nyata dengan peringkat Arena yang nyata — meskipun masih awal — saat ini, dan Flux 3 image adalah janji yang telah melihat produk saudaranya dirilis: FLUX 3 Video resmi tersedia pada 4-5 Agustus, sementara tingkatan gambar masih dalam "beberapa minggu mendatang." Ambisi multimodal bukanlah tujuan akhir.

Siapa yang harus memilih yang mana?

Jika Anda membutuhkan pengeditan gambar produksi pada kuartal ini — penghapusan latar belakang, pengeditan area, komposisi multi-referensi — Grok Imagine Image 2.0 adalah satu-satunya dari keduanya yang benar-benar dapat Anda adopsi, dan harganya $0,02–$0,05 per gambar membuat pengujian sistematis terhadap prompt Anda sendiri cukup murah untuk sekadar dijalankan. Jika Anda merencanakan pipeline yang mencakup gambar diam, gerak, dan audio dari satu model, dan Anda mampu menunggu, Flux 3 image adalah taruhan yang lebih menarik — tetapi itu adalah taruhan yang belum dirilis, tanpa tanggal pasti selain "beberapa minggu mendatang" dan tanpa harga.

Tidak ada satu pun dari kedua model yang berada di OrcaRouter hari ini: x​AI mendistribusikan Image 2.0 melalui aplikasi dan API pengembangnya sendiri, dan BFL mengirimkannya melalui API sendiri, dan belum ada satu pun yang mendarat di host pihak ketiga. Ketika hal itu terjadi, keduanya layak dijalankan melalui satu lapisan perutean — A/B per gambar pada prompt Anda sendiri, failover otomatis ke generator yang terbukti selama salah satu model masih baru, dan markup 0% yang diteruskan sehingga daftar harga yang Anda lihat adalah harga list penyedia, dengan potongan apa pun masuk pada hari yang sama. Itulah cara Anda mengadopsi model yang baru berumur dua hari dan model yang belum dirilis tanpa mempertaruhkan jalur produksi pada salah satu dari keduanya.

Intinya

Grok Imagine Image 2.0 vs Flux 3 saat ini bukanlah perlombaan yang ketat, karena ini bukan perlombaan — satu pesaing sudah berada di lintasan. Image 2.0 menyertakan toolkit pengeditan yang mumpuni dengan harga per gambar, dengan peringkat Arena yang nyata namun masih awal, dan peringkat pengeditan yang dikutip xAI, belum dikonfirmasi secara independen. Flux 3 image adalah arsitektur yang lebih ambisius, masih belum dirilis, tanpa harga dan tanpa demo. Jika Anda membutuhkan gambar hari ini, pilihannya sudah jelas. Jika Anda bertaruh pada ke mana arah generasi gambar, perhatikan tier gambar Flux 3 — dan anggap setiap klaim peta jalan belum terverifikasi sampai endpoint-nya ada.