Kartu judul hero untuk "Ming-Image-0.1-Design vs Qwen-Image 3.0" dengan subjudul "Siapa yang menunjukkan kepada Anda bagaimana teks itu digambar.", membandingkan Ming-Image-0.1-Design (6,15B parameter, lisensi MIT, bobot yang dapat Anda baca, diterbitkan 17 September 2026) dengan Qwen-Image 3.0 (model hosted tertutup, jumlah parameter tidak dipublikasikan, tanpa lisensi atau laporan, GA 5 Agustus 2026), dengan logo OrcaRouter di pojok kanan bawah.
Guides & Insights

Ming-Image-0.1-Design vs Qwen-Image 3.0: Siapa yang Menunjukkan kepada Anda Bagaimana Teks Digambar

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Hal yang paling menarik tentang Ming-Image-0.1-Design tidak ada di kartu modelnya. Itu ada dalam sebuah commit pada framework inferensi. Sekitar waktu unggahan senyap model itu ke Hugging Face pada 17 September 2026, vLLM-Omni menggabungkan perubahan berjudul feat: tambahkan dukungan byte5 untuk Ming yang menghubungkan encoder glyph ByT5 ke dalam pipeline baru ming_flash_omni — komponen khusus yang seluruh tugasnya adalah melihat karakter yang Anda minta untuk dirender, bukan gambar yang Anda minta. Itulah jenis detail yang hanya bisa Anda temukan dengan membaca kode, dan itulah detail persis yang Qwen-Image 3.0 — model gambar hosted tertutup milik vendor, dirilis pada 21 Juli 2026 dan mencapai ketersediaan umum pada 5 Agustus — tidak membiarkan siapa pun membacanya sama sekali. Kedua model ditujukan untuk pekerjaan desain di mana tipografi yang terbaca adalah bagian tersulitnya. Hanya satu dari keduanya yang akan memberi tahu Anda bagaimana ia melakukannya.

Apa yang masing-masing dari mereka katakan tentang teks

Kisah rendering teks Qwen-Image 3.0 sepenuhnya merupakan klaim peluncuran, dan di atas kertas klaim itu terdengar bagus. Materi Alibaba menjelaskan prompt hingga sekitar 4.500 token, teks yang terbaca hingga sekitar 10 piksel, cakupan 12 bahasa di lebih dari 20 font, output hingga 2048×2048 dan hingga enam gambar per panggilan, yang disediakan dalam edisi Pro dan Standard melalui satu API hosted. Tidak ada rilis bobot, tidak ada lisensi yang dinyatakan, tidak ada model card, tidak ada laporan teknis, dan tidak ada tabel benchmark yang dipublikasikan untuk memverifikasi semua itu. Angka parameter MMDiT ~20B yang banyak diulang hanya dilaporkan, bukan dikonfirmasi.

Kisah Ming-Image-0.1-Design adalah sebuah repositori. 6,154,901,056 parameter, lisensi MIT, sebuah diffusers tag pipeline, semua bobot dalam BF16 safetensors, sekitar 71.5 GB di seluruh connector/, mllm/, mlp/, scheduler/, transformer/ dan vae/. Inferensi yang disarankan adalah 2048×2048 pada 12 langkah sampling dengan guidance 1.0 pada satu GPU CUDA 80 GiB, atau 1024 untuk kecepatan, dengan vLLM-Omni yang disebutkan untuk deployment dan model vision-language terpisah yang disebutkan untuk peningkatan prompt. Kartu ini mendeskripsikannya sebagai model text-to-image untuk UI, infografis, poster, dan desain visual kaya teks lainnya, dengan output RGBA untuk latar belakang transparan.

Dua paragraf itu bukan jenis pernyataan yang sama, dan ada baiknya kita bersikap terus terang tentang alasannya. Yang satu adalah deskripsi produk yang ditulis oleh orang-orang yang menjualnya. Yang lainnya adalah deskripsi artefak yang dapat diunduh dan diperiksa oleh siapa pun.

Encoder glyph adalah bagian yang menjelaskan kategori tersebut.

Perenderan teks pada model gambar biasanya gagal dengan cara yang spesifik: model menghasilkan sesuatu yang tampak seperti tulisan tanpa benar-benar menjadi tulisan. Bentuk hurufnya masuk akal dan katanya salah. Alasannya bersifat arsitektural sebelum apa pun — sebagian besar model gambar tidak memiliki komponen yang melihat karakter sebagai karakter, sehingga tipografi direkonstruksi dari statistik visual dengan cara yang sama seperti rumput.

Commit vLLM-Omni menarik justru karena hal itu menunjuk pada hal tersebut. File-file yang ditambahkan — byte5_encoder.py, pipeline_ming.py, t5_block_mapper.py dan sebuah pemroses input tahap — menggambarkan jalur di mana encoder tingkat byte ByT5 membaca teks yang seharusnya muncul dalam gambar, kosakata tokenizer diperluas dengan penanda font dan warna, dan fitur yang dihasilkan ditambahkan sepanjang dimensi urutan dengan sisi negatif menerima nol. Detail terakhir itulah petunjuk bahwa ini adalah keputusan desain yang nyata, bukan sekadar pemipaan: jika cabang negatif membawa fitur glyph yang sama, classifier-free guidance akan ditarik ke arah merender teks dan menjauh dari prompt, sehingga nol tersebut ada untuk mencegah kedua tujuan itu saling bertentangan. Encoder hanya dimuat ketika checkpoint benar-benar berisi subfolder byte5/.

Dua catatan kejujuran. Ini adalah commit kerangka inferensi pihak ketiga, bukan pernyataan Ant Group, dan tafsir tentang apa arti file-file itu adalah milik kami, bukan milik vendor. Dan ini menguatkan maksud desain, bukan hasil: keberadaan enkoder glyph konsisten dengan rendering teks yang baik, dan itu bukan bukti bahwa rendering teksnya baik. Satu-satunya bukti kualitas yang independen adalah satu posisi papan peringkat, yang dibahas di bawah.

A pipeline diagram titled "How the glyph encoder enters the pipeline", showing prompt text passing through a tokenizer extended with font and colour markers into a ByT5 glyph encoder whose features are appended along the sequence dimension, with the negative branch receiving zeros so guidance is not pulled away from rendered text, and the result emerging as an RGBA image.

Perbedaannya dengan Qwen-Image 3.0 bukanlah bahwa model Alibaba ini merender teks dengan buruk — tidak ada orang di luar Alibaba yang dapat mengatakan seberapa baik model itu merender teks, dan itulah intinya. Perbedaannya adalah bahwa pertanyaan "bagaimana model ini menggambar huruf" memiliki jawaban untuk salah satu model ini dan klaim pemasaran untuk model lainnya, serta kesenjangan antara jawaban dan klaim adalah tempat keputusan rekayasa dibuat.

Satu-satunya angka, dan papan yang tidak memuatnya

Ming-Image-0.1-Design berada di peringkat pertama pada Papan Peringkat Text to Image Artificial Analysis untuk Desain UI/UX, tampilan open-weights, dengan Elo 1.082 — di atas Ideogram 4.0 (Quality) pada 1.052, Ideogram 4.0 pada 1.015, HunyuanImage 3.0 Instruct pada 1.005, FLUX.2 [dev] pada 1.000, FLUX.2 [dev] Flash pada 999 dan FLUX.2 [dev] Turbo pada 994. Salinan papan tersebut adalah salinan yang direproduksi pada kartu model itu sendiri, dan salinan itu mencantumkan merek Artificial Analysis; belum ada pihak yang secara independen mereproduksi skor tersebut.

The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.

Ini adalah papan untuk model dengan bobot terbuka, jadi Qwen-Image 3.0 tidak memiliki entri dan ketidakhadirannya tidak mengatakan apa pun tentang kualitasnya. Yang justru disampaikannya bersifat struktural: papan preferensi buta hanya dapat memeringkat model yang bobotnya publik. Hal itu memberi rilis terbuka posisi yang terukur berbulan-bulan sebelum memiliki produk, dan memberi rilis tertutup angka pemasaran dan tidak lebih. Klaim Qwen-Image 3.0 — keterbacaan 10 piksel, prompt 4.500 token, lebih dari 20 font — sama sekali tidak memiliki pengukuran independen di baliknya.

A two-column scoreboard titled "Ming-Image-0.1-Design vs Qwen-Image 3.0 - the scoreboard". Left column Ming-Image-0.1-Design: Weights downloadable, 6.15B; Licence MIT; Text rendering glyph encoder visible; Independent score Elo 1,082; Price self-host; Internals readable. Right column Qwen-Image 3.0: Weights none; Licence not published; Text rendering 10px claim, vendor-reported; Independent score none; Price about $0.04 per image; Internals black box. Footer reads "Qwen-Image 3.0 claims vendor-reported; Ming score per the Artificial Analysis board on its model card.", with the OrcaRouter logo bottom-right.

Bagaimana Anda sebenarnya akan menguji ini, dan berapa biaya untuk mencobanya

Jika tipografi yang mudah terbaca adalah alasan Anda membaca ini, ujiannya bukan papan peringkat. Ujian itu adalah jenis huruf Anda sendiri, bahasa Anda sendiri, dan string Anda sendiri, yang dijalankan melalui kedua kandidat dan dibaca oleh seseorang. Ujian tersebut memerlukan salah satu dari model ini untuk dapat diakses dan murah, dan model lainnya untuk dapat diunduh, dan keduanya diberi harga berdasarkan prinsip yang saling berlawanan.

• Qwen-Image 3.0 — sekitar $0,04 per gambar pada edisi Pro dan sekitar $0,03 pada Standard, dengan harga konsumen domestik mulai sekitar ¥0,18 per gambar. Itu adalah angka peluncuran dan belum diaudit. Anda dapat menjalankan matriks prompt sore ini dan membayar per panggilan.

• Ming-Image-0.1-Design — tidak ada harga yang dipublikasikan, karena tidak ada endpoint yang dihosting. Biayanya adalah unduhan 71,5 GB, kartu 80 GiB, dan waktu Anda sendiri, sedangkan manfaatnya adalah Anda dapat mengarahkan pengujian yang sama ke jalur encoder glif dan melihat apakah komponen itulah yang melakukan pekerjaan.

Inilah situasi yang menjadi alasan lapisan routing dibangun, dan penting untuk tepat mengenai bagian mana darinya yang berlaku. Baik Qwen-Image 3.0 maupun Ming-Image-0.1-Design tidak ada di platform kami, jadi lapisan routing tidak dapat menempatkan salah satunya di balik kunci hari ini. Yang dapat dilakukannya adalah menjaga perbandingan tetap jujur saat Anda menjalankannya: OrcaRouter menempatkan 200+ model di balik satu endpoint yang kompatibel dengan OpenAI dengan harga daftar penyedia tanpa markup, dengan failover otomatis antar penyedia, sehingga model yang sudah Anda percayai dapat mempertahankan jalur produksi — dan biayanya tetap terikat pada harga daftar penyedia, sehingga perubahan tarif vendor berdampak di sisi kami pada hari yang sama — sementara model desain yang belum terukur dievaluasi di sampingnya, bukan di depannya.

Dua rilis terbuka, satu tertutup, dan sebuah pola

Patut dicatat apa yang dibuktikan oleh rilis Ming, di luar dirinya sendiri. Ant Group menerbitkan model desain dengan 6,15 miliar parameter di bawah lisensi MIT tanpa pengumuman, bersama model kedua untuk dekomposisi lapisan di bawah lisensi yang sama. Alibaba menerbitkan model hosted tertutup tanpa lisensi, tanpa kartu, dan tanpa laporan, yang ditujukan untuk kelas pekerjaan yang sama, dan menetapkan harganya per gambar.

Itu adalah dua taruhan berbeda tentang di mana nilai dalam model desain berada. Yang satu mengatakan model adalah produk dan bobot adalah saluran distribusinya. Yang lain mengatakan model adalah layanan dan bobot adalah hal yang Anda simpan. Kedua taruhan bisa benar di pasar yang sama, dan keduanya menghasilkan jawaban yang sangat berbeda untuk satu-satunya pertanyaan yang penting saat evaluasi: dapatkah saya mengetahui cara kerja ini sebelum saya bergantung padanya?

• Jika Anda perlu mengetahui bagaimana teks dirender, dan mengapa terkadang tidak — Ming-Image-0.1-Design adalah satu-satunya dari keduanya yang memungkinkan Anda melihat, dan lisensi MIT berarti Anda dapat bertindak berdasarkan apa yang Anda temukan.

• Jika Anda membutuhkan endpoint produksi hari ini dengan harga per gambar dan tanpa infrastruktur — Qwen-Image 3.0 adalah satu-satunya dari keduanya yang menawarkannya, dan bagian internalnya termasuk dalam harga tersebut.

• Jika Anda memerlukan bukti independen sebelum berkomitmen — keduanya tidak memiliki cukup bukti. Yang satu hanya punya satu posisi papan peringkat yang belum direproduksi; yang lain punya lembar klaim vendor tanpa angka yang dilampirkan.

Yang perlu diperhatikan adalah apakah pola itu bertahan. Rilis MIT yang tanpa pengumuman dengan encoder glyph di dalamnya adalah pernyataan tentang bagaimana para penulisnya mengharapkan model itu digunakan — diperiksa, dijalankan secara lokal, dimodifikasi. Jika rilis berikutnya dari tim yang sama diumumkan, di-benchmark, dan di-hosting, itu hanya sekali. Jika itu repositori tenang lainnya, kategori model desain memiliki pesaing terbuka kedua di dalamnya, dan separuh pasar yang tertutup memiliki masalah harga yang tidak dimilikinya pada Juli.