
Qwen-Image 2.1 vs MAI-Image-2.5-Pro: 6.100 Suara Buta Melawan Nol
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Salah satu dari dua model ini telah diberi peringkat oleh sekitar 6.100 perbandingan manusia secara buta. Yang lain belum diberi peringkat oleh siapa pun di luar laboratoriumnya sendiri. MAI-Image-2.5-Pro, model gambar premium Microsoft, berada di peringkat pertama di arena penyuntingan gambar Artificial Analysis dengan Elo 1.272 — hasil dengan suara terbanyak dalam kategori tersebut. Qwen-Image 2.1, yang dirilis sebagai sumber terbuka oleh tim Qwen-Image pada 20 September 2026, tidak memiliki skor independen sama sekali, dan tidak akan memilikinya sampai cukup banyak orang menjalankannya secara publik untuk menghasilkan suara. Kesenjangan itulah subjek sebenarnya dari perbandingan ini, karena itulah satu-satunya perbedaan antara kedua model yang bukan klaim vendor. Segala hal lainnya — arsitektur, resolusi, harga — dapat diketahui tetapi belum terbukti, dan kedua model cukup berdekatan di atas kertas sehingga kesenjangan pengukuran itulah yang seharusnya mendorong keputusan.
Apa yang sebenarnya dikatakan oleh suara-suara itu, dan apa yang tidak
Artificial Analysis menjalankan perbandingan berpasangan secara buta: dua model menerima prompt yang sama, pemilih memilih keluaran yang lebih baik, dan skor Elo muncul dari hasilnya. Ini bukan instrumen yang sempurna, tetapi ini adalah hal yang paling mendekati papan skor bersama yang dimiliki kategori ini, dan ukuran sampel sama pentingnya dengan angkanya.
• MAI-Image-2.5-Pro — pengeditan gambar #1 dengan Elo 1.272 berdasarkan sekitar 6.100 perbandingan. Dalam teks ke gambar, ia menempati peringkat #7 dengan Elo 1.292, di belakang GPT Image 2 (high) pada 1.369, Reve 2.1 pada 1.322, Nano Banana 2 pada 1.320, GPT Image 1.5 (high) pada 1.310 dan MAI-Image-2.5 pada 1.304.
• Qwen-Image 2.1 — tidak ada entri di kedua papan peringkat. Bukan skor rendah; tidak ada skor sama sekali. Rilis ini baru berusia satu hari pada saat penulisan.
Bentuk angka-angka itu layak dibaca dengan cermat, karena bentuknya bukan seperti yang disiratkan oleh pemasaran. Model Microsoft benar-benar peringkat pertama dalam penyuntingan dan benar-benar peringkat ketujuh dalam generasi. Itu adalah posisi yang spesifik dan dapat dipertahankan — spesialis penyuntingan yang memimpin kategorinya — dan itu berbeda dari menjadi model gambar terbaik, yang memang bukan statusnya. Sementara itu, model yang mengalahkannya pada text-to-image adalah GPT Image 2 (high), yang juga bukan model OpenAI terbaru di bidang ini. Papan peringkat independen memberi imbalan pada model yang paling banyak diukur, dan dalam pertandingan ini, yang dimaksud jelas adalah model Microsoft.
Satu-satunya spesifikasi di mana model terbuka menang secara mutlak
Ada perbedaan konkret dan non-subjektif antara keduanya, yaitu resolusi.
• Qwen-Image 2.1menghasilkan secara native pada 2K, dengan 2048×2048 sebagai default yang didokumentasikan pada 40 langkah inferensi, tujuh preset rasio aspek, dan output RGBA dengan saluran alfa sungguhan, bukan matte.
• MAI-Image-2.5-Pro membatasi output pada 1.048.576 piksel — sekitar satu megapiksel. Angka spesifikasi utamanya ada di tempat lain: 32.000 token input teks, jendela konteks 131k, dan 4.096 token output, yang merupakan pernyataan tentang seberapa banyak instruksi yang dapat diserapnya, bukan seberapa banyak gambar yang dapat dihasilkannya.
Untuk sebagian besar pekerjaan media sosial dan produk, batas satu megapiksel bukanlah kendala. Untuk cetak, untuk pengomposisian format besar, untuk apa pun yang mengharuskan hasil pangkasannya tetap bertahan, batas itu menjadi kendala. Inilah satu-satunya dimensi dalam seluruh perbandingan ini di mana Anda bisa menunjuk sebuah angka dan mengatakan bahwa model terbuka lebih unggul — dan perhatikan bahwa itu adalah fakta arsitektural dari kartu model, bukan klaim kualitas. Qwen-Image 2.1 akan merender pada 2048×2048, terlepas dari apakah hasilnya layak dilihat atau tidak.
Harga, dan di situlah perbandingannya menjadi tidak nyaman.
MAI-Image-2.5-Pro dibanderol sebagai model premium dan angkanya tidak main-main: $5 per juta token input teks, $8 per juta token input gambar, dan $106 per juta token output gambar. Pada output 1024 piksel, itu setara dengan sekitar $108,50 per seribu gambar. Sebagai perbandingan, angka itu sekitar 2,3× biaya MAI-Image-2.5 dan kurang lebih 5,4× MAI-Image-2.5-Flash, jadi Microsoft sengaja mensegmentasi lini produknya sendiri alih-alih menetapkan harga tier Pro sebagai peningkatan bertahap.
Qwen-Image 2.1 tidak memiliki harga hosted, karena tidak ada endpoint hosted — ini adalah unduhan bobot di bawah lisensi riset. Biayanya adalah waktu GPU Anda, dan kendalanya adalah Anda tidak dapat menjual secara legal apa yang dihasilkannya. Membandingkan $108.50 per seribu gambar dengan "bobot gratis" sama dengan membandingkan layanan dengan mesin, dan versi jujur dari perbandingan itu adalah: harga berbayar per pemakaian memberi Anda model yang terukur, didukung, dan berlisensi komersial, sedangkan bobotnya memberi Anda unduhan 33 GB dan file lisensi yang menyatakan hanya non-komersial.
Trade-off itulah tepatnya di mana lapisan routing layak mendapat tempatnya. OrcaRouter menyediakan 200+ model di balik satu endpoint yang kompatibel dengan OpenAI pada harga daftar penyedia tanpa markup, dengan failover otomatis antar penyedia — jadi tim yang ingin mengevaluasi model terbuka yang belum terukur tidak perlu memindahkan produksi ke atasnya untuk melakukannya, dan karena harga daftar diteruskan apa adanya, setiap perubahan harga vendor pada model yang dirutekan akan ditanggung di sisi kami pada hari yang sama, bukan pada perpanjangan kontrak berikutnya. Baik MAI-Image-2.5-Pro maupun Qwen-Image 2.1 tidak termasuk dalam model yang kami rutekan saat ini, dan artikel ini tidak akan menyiratkan sebaliknya. Lini gambar yang kami sediakan adalah keluarga GPT-Image dari OpenAI, tier Imagen 4 dan pratinjau gambar Gemini dari Google, serta endpoint gambar Grok Imagine dari xAI.

Di mana klaim vendor berada, dan seberapa besar bobot yang harus diberikan padanya.
Kedua vendor menerbitkan angka yang belum direproduksi oleh pihak ketiga mana pun, dan keduanya harus dibaca dengan skeptisisme yang sama di kedua arah.
• Klaim Microsoft — akurasi rendering teks 96,8% di seluruh bahasa Inggris, Mandarin, Jepang, Korea, dan Spanyol; kepatuhan terhadap prompt 27% lebih baik daripada GPT-Image-1.5; konsistensi karakter multi-gambar 94%; dan biaya GPU hingga 84–89% lebih rendah dalam skenario internal Microsoft tertentu. Yang terakhir inilah yang perlu diwaspadai: ini menggambarkan konfigurasi penyajian Microsoft sendiri, bukan sesuatu yang dapat diverifikasi oleh pelanggan.
• Klaim Alibaba — posting blog Qwen-Image 2.1 memuat bagan perbandingan Qwen-Image-Bench, dan angka-angka di dalamnya berasal dari vendor itu sendiri. Ada juga angka yang beredar dalam liputan pihak ketiga yang menggambarkan model tersebut sebagai transformer 20 lapis, yang bertentangan dengan DiT aliran tunggal 32 lapis pada kartu model; kartu model adalah sumber utama dan angka 32 lapis adalah yang harus digunakan.
Perbedaan antara kedua situasi itu bukanlah kejujuran dari vendor mana pun. Perbedaannya adalah bahwa model Microsoft telah diukur secara independen sedangkan model Alibaba belum, sehingga klaim Microsoft dapat diperiksa dengan sesuatu dan klaim Alibaba belum dapat diperiksa dengan apa pun.
Untuk apa masing-masing
Jika dibaca bersama, hal-hal ini tidak memperebutkan slot yang sama.
• MAI-Image-2.5-Pro adalah instrumen penyuntingan. Ia memimpin papan peringkat penyuntingan dengan basis suara yang besar, ia menerima instruksi panjang (32k token masukan teks, konteks 131k), ia berlisensi komersial, dan kini tersedia sebagai pratinjau publik di Microsoft Foundry dan MAI Playground. Jika pekerjaan Anda adalah koreksi gambar secara iteratif dan Anda perlu mengetahui sebelum berkomitmen bahwa ini adalah yang terbaik yang tersedia untuk pekerjaan itu, inilah jawaban yang terukur, dan biayanya sekitar $108,50 per seribu gambar.
• Qwen-Image 2.1 adalah artefak riset terbuka. Ia menghasilkan gambar yang lebih besar, ia menyertakan checkpoint penulisan ulang prompt yang dapat diperiksa bersama model gambar, ia menerima hingga 10 gambar referensi dengan penyuntingan lokal melalui lingkaran, anotasi yang dilukis, atau mask, dan ia gratis untuk diunduh serta ilegal untuk dijual. Jika pekerjaan Anda adalah evaluasi, pembandingan tolok ukur, atau membangun di atas bobot yang dapat Anda baca, ia adalah objek yang lebih menarik — dan Anda melakukan pekerjaan itu tanpa papan peringkat yang memberi tahu apakah ia bagus atau tidak.
Ada pula asimetri waktu yang layak disebutkan. MAI-Image-2.6 masuk pratinjau privat pada 19 Agustus 2026, yang berarti model di puncak papan penyuntingan sudah tertinggal satu generasi dari apa yang sedang disiapkan Microsoft untuk dirilis. Sebaliknya, Qwen-Image 2.1 baru berada di hari pertama, dengan program akses awal yang meminta para pengujinya untuk menerbitkan paling lambat 29 September. Kedua papan skor dalam perbandingan ini akan terlihat berbeda dalam sebulan.


Apa yang bisa menyelesaikannya
Satu hal: Qwen-Image 2.1 muncul di papan peringkat. Segala hal dalam artikel ini yang bukan batas resolusi atau harga adalah klaim dari salah satu lab atau lab lainnya, dan seluruh alasan MAI-Image-2.5-Pro dapat direkomendasikan dengan serius adalah bahwa 6.100 orang yang tidak bekerja untuk Microsoft melihat keluarannya bersebelahan dengan sesuatu yang lain dan lebih menyukainya. Itulah standar yang belum dipenuhi oleh model terbuka, dan standar yang seharusnya menjadi tolok ukurnya.
Sampai saat itu, pembacaan praktisnya sederhana. Jika Anda membutuhkan model pengeditan hari ini, dengan lisensi komersial, dengan papan skor di belakangnya, jawabannya adalah milik Microsoft dan biayanya sekitar $108.50 per seribu gambar. Jika Anda ingin mencari tahu apakah model open-weights 7B dengan keluaran 2K native dan penulis ulang prompt yang dapat diperiksa lebih baik, Anda harus melakukan pengukurannya sendiri — dan hal paling berguna yang dapat Anda lakukan dengan hasilnya adalah menerbitkannya, karena seluruh kategori saat ini kekurangan satu titik data.
