
Ming-Image-0.1-Design vs GPT Image 2.5: Angka Milik Lab Sendiri Melawan Papan Suara Orang Asing
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
Tempatkan Ming-Image-0.1-Design dan GPT Image 2.5 dalam satu kalimat dan perbandingan yang jelas adalah kualitas. Perbandingan yang berguna adalah asal-usul. GPT Image 2.5 memegang posisi pertama dan kedua di papan UI/UX Design Artificial Analysis yang live, pada 1.227 dan 1.218 Elo, masing-masing berdasarkan 1.287 dan 1.303 suara manusia dalam uji buta — yaitu, peringkat yang dihasilkan oleh orang-orang yang tidak membangun model tersebut dan tidak diberi tahu keluaran mana milik siapa. Ming-Image-0.1-Design hanya memiliki satu skor yang melekat padanya, 1.082 Elo, dan skor itu muncul pada grafik papan peringkat yang disertakan di dalam repositori Hugging Face milik inclusionAI sendiri, pada papan yang tidak dapat kami temukan di mana pun selain itu, untuk model dengan nol unduhan. Salah satu dari angka-angka ini adalah bukti. Yang lain adalah klaim dengan jenis huruf. Kesenjangan itu, bukan 145 Elo di antara keduanya, adalah yang seharusnya membentuk keputusan tentang model mana pun di antara keduanya.
Dua angka yang berdampingan, dan jebakan dalam membandingkannya
Angka-angkanya cukup berdekatan untuk tampak sebanding, tetapi cukup berbeda jenisnya sehingga sebenarnya tidak sebanding. Berikut himpunannya, dinyatakan secara tepat.
• GPT Image 2.5, di papan peringkat langsung — peringkat pertama dengan 1.227,0 Elo untuk konfigurasi Flare (maks), peringkat kedua dengan 1.218,1 untuk Sunburst (maks), dengan jumlah sampel 1.287 dan 1.303 serta harga terlacak $210,72 per 1.000 gambar. Model tersebut terdaftar di papan itu sebagai dirilis pada 8 September 2026.
• Ming-Image-0.1-Design, pada kartunya sendiri — peringkat pertama dengan 1.082 Elo, di depan Ideogram 4.0 (Quality) pada 1.052 dan varian FLUX.2 dev antara 994 dan 1.000, pada grafik berjudul "Papan Peringkat Text to Image: UI/UX Design" dengan footer "Skor Elo dari suara preferensi buta di Image Arena kami". Tidak ada jumlah sampel yang ditampilkan. Tidak ada metodologi yang diterbitkan. Papan itu sendiri tidak ada di web publik sejauh yang dapat kami temukan.
• Jebakan — Elo dihitung per papan. Sebuah skor hanya bermakna bila dibandingkan dengan skor lain di papan yang sama; itulah sebabnya rilis FLUX.2 yang sama menunjukkan 1.026 di papan text-to-image umum dan 1.065 di tampilan kategori UI/UX Design. Kurangi 1.082 dari 1.227, dan Anda belum mengukur selisih kualitas antara dua model. Anda telah mengurangkan sebuah angka dari angka yang berbeda.

Apa yang membuat pemungutan suara buta menjadi pemungutan suara buta
Artificial Analysis menerbitkan cukup banyak metodenya untuk dapat diperiksa. Arena gambarnya memasangkan dua generasi dari model anonim, meminta pemilih memilih pemenang, dan mengubah hasilnya menjadi peringkat Elo — jumlah sampel di papan peringkat adalah banyaknya perbandingan semacam itu yang telah diakumulasi setiap model. Struktur itulah yang membuat skor resisten terhadap para pembuat model itu sendiri: orang-orang yang melatih GPT Image 2.5 tidak terlibat dalam prosesnya, dan sebuah model tidak dapat diperingkatkan pertama hanya karena model itulah yang lebih disukai pembuatnya. Ini bukan instrumen yang sempurna — kumpulan pemilihnya bersifat swaseleksi dan prompt-nya bukan rangkaian tolok ukur yang terkontrol — tetapi ini adalah instrumen yang dipegang oleh pihak selain vendor.
Grafik di dalam repositori Ming-Image-0.1-Design meminjam format itu tanpa bagian-bagian yang membuatnya dapat diverifikasi. "Voting preferensi buta" adalah klaimnya. "Our Image Arena" adalah operatornya, dan operatornya adalah inclusionAI. Tidak ada jumlah suara yang dipublikasikan, tidak ada distribusi prompt yang terlihat, dan tidak ada cara untuk memeriksa pemasangannya. Sangat mungkin bahwa evaluasi di balik grafik itu jujur dan ketat — tim model tersebut yang tahu. Hal itu juga sepenuhnya tidak dapat diperiksa dari luar, dan itulah satu-satunya hal yang penting jika Anda adalah orang yang memutuskan apakah akan membangun di atasnya.
Layak ditambahkan, karena ini bertentangan dengan narasi yang mudah: Ming-Image-0.1-Design sama sekali tidak ada di papan Artificial Analysis yang live. Bukan di kategori UI/UX Design, bukan di papan text-to-image umum, bukan di tampilan open-weights. Ketidakhadirannya bukan bukti bahwa model ini lebih buruk — model dengan nol unduhan dan tanpa endpoint yang dihosting tidak punya cara untuk mengumpulkan suara. Itu adalah bukti bahwa belum ada angka independen, yang merupakan pernyataan berbeda.
Harga adalah bagian yang tidak ambigu
Dari segi biaya, kedua model itu tidak bisa dibandingkan dan tidak ada yang perlu diperdebatkan.
• GPT Image 2.5 adalah endpoint komersial. Artificial Analysis mencatatnya pada $210,72 per 1.000 gambar dalam kategori UI/UX — sekitar 21 sen per gambar, yang menempatkannya di puncak rentang harga di bidang ini. Sebagai konteks pada papan yang sama, Grok Imagine Image 2.0 tercatat pada $60 per 1.000, MAI-Image-2.6 pada $38,9, dan Muse Image pada $10.
• Ming-Image-0.1-Design tidak punya harga karena tidak punya endpoint. Bobotnya berlisensi MIT dan gratis diunduh; menjalankannya memakan biaya sebesar biaya satu GPU CUDA 80 GiB per jam. Konfigurasi tervalidasi pada kartu model adalah satu kartu kelas tersebut, pada resolusi 2048 x 2048 dan 12 langkah sampling.
• Tidak ada angka yang stabil. Kedua vendor merevisi tarif, dan perbandingan per gambar yang ditulis hari ini memiliki masa berlaku yang diukur dalam hitungan minggu. Inilah satu hal di mana sisi ekonomi OrcaRouter layak dinyatakan secara gamblang: kami meneruskan harga daftar penyedia pada markup 0%, sehingga perubahan tarif vendor langsung berlaku di sisi kami pada hari yang sama alih-alih setelah siklus penetapan harga ulang milik kami sendiri — yang penting ketika selisih antara dua kandidat adalah 21 sen berbanding 6 sen per gambar dan keduanya bisa berubah.
Apa yang sebenarnya bisa Anda panggil, hari ini, dan di mana posisi kita di dalamnya
Ketersediaan adalah titik ketika perbandingan ini berhenti menjadi eksperimen pemikiran.
GPT Image 2.5 adalah produk nyata dengan API nyata di baliknya, yang dijual oleh OpenAI dengan ketentuannya sendiri. Produk ini tidak dapat dirutekan melalui OrcaRouter — katalog kami tidak memuat entri GPT Image 2.5 per 23 September 2026 — dan kami tidak akan menjelaskan rute yang tidak kami miliki. Yang memang dimuat katalog dari lini yang sama adalah generasi sebelumnya, openai/gpt-image-2 dengan harga $8.00 per juta token masukan dan $30.00 per juta token keluaran, bersama openai/gpt-image-1.5, dan semuanya berada di belakang kunci yang sama seperti semua hal lain yang kami rutekan.
Ming-Image-0.1-Design tidak dapat dirutekan ke mana pun. Repositori tersebut menonaktifkan inferensi, Hugging Face melaporkan tidak ada penerapan penyedia inferensi, dan Quick Start mengarah ke repositori GitHub pendamping yang mengembalikan 404. Tidak ada model inclusionAI jenis apa pun di katalog kami. Satu-satunya cara untuk menjalankannya adalah mengunduh shard dan menyajikannya sendiri.
Jadi bentuk pilihannya adalah: satu opsi yang bisa Anda beli hari ini dengan harga pasar tertinggi, dan satu opsi yang bisa Anda jalankan hari ini dengan biaya sebuah GPU dan waktu rekayasa Anda sendiri, tanpa bukti independen bahwa performanya baik. Siapa pun yang mengatakan kepada Anda bahwa Ming-Image-0.1-Design adalah alternatif yang lebih murah untuk GPT Image 2.5 belum memperhitungkan biaya opsi kedua.

Cara mempertahankan keduanya tanpa bertaruh pada salah satunya
Nasihat praktis di sini lebih sempit cakupannya daripada sebuah putusan, karena kedua model tersebut belum menjadi pengganti satu sama lain.
Jika Anda memerlukan pembuatan gambar dengan kualitas UI atau desain untuk produksi, GPT Image 2.5 adalah pilihan yang dapat dipertahankan dan harga adalah hal yang perlu dinegosiasikan dengan diri sendiri, bukan kualitasnya — ia memimpin papan peringkat independen dengan selisih yang cukup lebar sehingga peringkatnya tidak dipertanyakan. Jika Anda ingin tahu apakah Ming-Image-0.1-Design bagus, Anda punya dua opsi dan hanya satu yang bebas dari dugaan: tarik bobot MIT ke kartu 80 GiB dan jalankan set evaluasi Anda sendiri, atau tunggu orang lain melakukannya. Sementara itu, jangan anggap 1.082 sebagai hasil. Dan jika kebutuhan sebenarnya Anda adalah opsionalitas, bukan salah satu model secara spesifik, disiplin yang berbuah adalah menjaga panggilan pembuatan di balik satu antarmuka — satu kunci untuk lebih dari 200 model, perubahan ID model alih-alih penulisan ulang, failover otomatis saat endpoint bermasalah — sehingga mana pun di antara keduanya yang merilis angka independen lebih dulu, mengadopsinya cukup dengan satu baris konfigurasi, bukan sprint.
Satu catatan penutup tentang apa yang akan mengubah tulisan ini. Baris Ming-Image-0.1-Design yang muncul di papan Artificial Analysis UI/UX Design, dengan jumlah sampel di sebelahnya, akan mengubah angka 1,082 milik vendor dari sebuah klaim menjadi titik data — dan itu akan menjadi pertama kalinya siapa pun di luar inclusionAI mengatakan sesuatu yang terukur tentang model tersebut. Itulah peristiwa yang perlu ditunggu, dan itu adalah hal yang lebih berguna untuk dipantau daripada penghitung unduhan.

