
Qwen-Image 2.1 vs LLaDA-Image-Turbo: Dua Model Gambar Terbuka, Dua Lisensi yang Sangat Berbeda
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Dua model gambar dengan bobot terbuka muncul dalam rentang tiga minggu yang sama. Tim Qwen-Image menerbitkan Qwen-Image 2.1 pada 20 September 2026 — bobot, berkas lisensi, kartu model, dan postingan blog, semuanya pada hari yang sama, dengan hampir tanpa persiapan sebelumnya. Enam belas hari sebelumnya, pada 4 September 2026, inclusionAI (laboratorium riset Ant Group) menerbitkan LLaDA-Image-Turbo tanpa postingan peluncuran, tanpa siaran pers, dan tanpa pengumuman apa pun. Keduanya dapat diunduh hari ini. Tidak ada satu pun yang memiliki skor benchmark independen. Dan perbedaan yang benar-benar akan menentukan mana yang dapat Anda gunakan bukanlah pada kartu model mana pun — melainkan pada dokumen resminya. Qwen-Image 2.1 dirilis di bawah lisensi riset yang melarang penggunaan komersial sepenuhnya. LLaDA-Image-Turbo dirilis tanpa lisensi yang dideklarasikan di repositori mana pun sama sekali.
Pertanyaan lisensi datang lebih dulu, karena hanya itu yang memiliki jawaban yang jelas.
Mulai dari sini, karena segala hal lain dalam perbandingan ini bersifat sementara, dan ini tidak.
• Qwen-Image 2.1 dirilis di bawah Perjanjian Lisensi Riset Qwen, tertanggal 20 September 2026, yang memberikan hak "HANYA UNTUK TUJUAN NON-KOMERSIAL" dan menyatakan bahwa penggunaan komersial memerlukan lisensi terpisah yang diminta dari vendor. Itu merupakan perubahan yang signifikan dari lini Qwen-Image sebelumnya, yang dirilis di bawah Apache 2.0. Ini tidak ambigu: Anda dapat membacanya, mengevaluasinya, melakukan benchmark terhadapnya, dan menulis tentangnya. Anda tidak dapat memasukkannya ke dalam produk.
• LLaDA-Image-Turbotidak mendeklarasikan lisensi sama sekali. Bukan yang permisif, bukan yang restriktif, bukan placeholder. Repositori tanpa lisensi bukanlah "bebas digunakan" dalam pengertian hukum apa pun — secara default, semua hak dilindungi, yang merupakan posisi lebih ketat daripada lisensi riset Qwen, bukan yang lebih longgar. Jika Anda berencana membangun di atasnya, itu adalah pertanyaan untuk lab, bukan untuk README.
Ironinya layak dikatakan terang-terangan: model yang hadir dengan lisensi formal yang membatasi adalah model yang bisa Anda jadikan dasar perencanaan hari ini, karena Anda tahu persis posisi Anda. Model tanpa lisensi adalah model yang tidak bisa Anda jadikan dasar perencanaan.

Apa sebenarnya kedua model itu
Jika lisensinya diabaikan, ini adalah dua desain yang benar-benar berbeda, dibangun untuk alasan yang berbeda.
• Arsitektur — Qwen-Image 2.1 adalah transformer difusi single-stream 32 lapis dengan 7B parameter pada komponen pembuatan visual, encoder teks Qwen3-VL 8B, dan VAE RGBA 64 kanal dengan kompresi spasial 16×, sekitar 33 GB untuk keseluruhan bundel. LLaDA-Image-Turbo adalah model generasi-dan-pengeditan terpadu 6B — satu set bobot yang mengerjakan kedua tugas tersebut, bukan model dasar plus jalur pengeditan terpisah.
• Langkah inferensi — Qwen-Image 2.1 secara default menggunakan 2048×2048 pada 40 langkah dengan flow matching dan penjadwalan diskret Euler. LLaDA-Image-Turbo disuling melalui Twin-DMD menjadi 2–4 langkah, dengan 4 yang direkomendasikan, dan berjalan pada skala guidance 1,0 sedangkan model Base 5,0.
• Opsi presisi — Qwen-Image 2.1 merilis dukungan kuantisasi FP8 melalui jalur vLLM-Omni-nya. LLaDA-Image-Turbo menyediakan checkpoint BF16 dan FP8 sebagai unduhan terpisah.
• Pengondisian referensi — Qwen-Image 2.1 menerima hingga 10 gambar referensi, mendukung pengeditan lokal dengan lingkaran, anotasi yang digambar, atau mask terpisah, dan menghasilkan RGBA native dengan pengeditan lapisan transparan. Kartu LLaDA-Image-Turbo tidak mencantumkan batas maksimum gambar referensi.
• Perhatian — Qwen-Image 2.1 menggunakan attention block-causal: mask kausal tingkat token untuk teks dan mask bidireksional tingkat chunk untuk pembuatan gambar, dengan penggunaan ulang cache KV prefix saat checkpoint membawa causal_condition: true. Kartu LLaDA-Image-Turbo tidak menjelaskan skema masking-nya secara sedetail itu.
• Lisensi — hanya untuk penelitian dan eksplisit, versus tidak dideklarasikan.
Perhatikan makna jumlah langkah bersama dengan jumlah parameter. Qwen-Image 2.1 adalah model yang lebih besar yang dijalankan untuk sepuluh kali lebih banyak langkah; LLaDA-Image-Turbo adalah model yang lebih kecil yang didistilasi menjadi hanya beberapa langkah. Keduanya adalah taruhan yang berlawanan tentang di mana biaya pembuatan gambar berada, dan jawaban yang tepat sepenuhnya bergantung pada apakah hambatan Anda adalah GPU-detik per gambar atau plafon dari seperti apa sebuah gambar bisa dihasilkan.
Ekonomi kecepatan: 40 langkah versus 4
Nama Turbo benar-benar berperan di sini. Distilasi Twin-DMD meruntuhkan lintasan difusi menjadi beberapa lompatan besar, itulah sebabnya LLaDA-Image-Turbo dapat dijalankan pada 4 langkah sementara model Base-nya menghendaki jadwal konvensional. Pada guidance 1.0, model ini juga melewati classifier-free guidance, yang biasanya menggandakan jumlah forward pass per langkah — jadi selisih efektifnya lebih besar daripada yang disiratkan oleh 40-versus-4 saja.
Yang Anda dapatkan dari itu adalah throughput dan prediktabilitas. Model 6B pada empat langkah adalah jenis model yang muat di satu kartu konsumen dan menghasilkan gambar draf cukup cepat untuk berada di dalam loop interaktif. Qwen-Image 2.1 pada 40 langkah dan 2048×2048 adalah konfigurasi yang mengutamakan kualitas; rekomendasi kartu model itu sendiri untuk perangkat keras terbatas adalah CPU offload melalui pipe.enable_model_cpu_offload(), yang merupakan jalan keluar darurat alih-alih solusi.
Penyeimbangnya adalah bahwa distilasi merupakan kompresi kemampuan, dan tidak ada apa pun di sini yang telah diukur oleh siapa pun di luar dua laboratorium tersebut. Satu-satunya titik data independen yang ada untuk salah satu dari kedua model tersebut adalah ulasan hands-on akses awal terhadap Qwen-Image 2.1 dari seorang penguji dalam program Qwen Ambassador, yang menjalankan bobot akhir melalui antarmuka ModelScope Studio dan melaporkan sekitar 10–15 detik untuk text-to-image serta 18–23 detik untuk pengeditan. Itu hanya satu peninjau, pada UI akses awal, tanpa timer yang ditampilkan — sinyal yang berguna, bukan tolok ukur. LLaDA-Image-Turbo sama sekali tidak memiliki laporan hands-on yang sebanding di publik.

Pengeditan adalah aspek di mana kedua desain paling berbeda.
Kedua model melakukan text-to-image dan pengeditan, tetapi cara mereka mencapainya berbeda, dan perbedaannya terlihat pada mekanisme internalnya, bukan pada outputnya.
Qwen-Image 2.1 memperlakukan kemampuan mengikuti instruksi sebagai komponen terpisah yang dapat diperiksa. Di samping model gambar, rilis ini menyertakan dua checkpoint penulisan ulang prompt — Qwen/Qwen-Image-2.1-PE-T2I dan Qwen/Qwen-Image-2.1-PE-I2I, masing-masing merupakan Qwen3.5-VL 9B yang di-fine-tune pada sekitar 18,8 GB — yang menerima instruksi samar dan menulis ulangnya menjadi arahan yang tidak ambigu sebelum model difusi melihatnya. Varian I2I selalu memiliki gambar masukan, sehingga selalu merupakan tugas penyuntingan dan tidak pernah pembuatan dari nol. Yang krusial, penulis ulang ini disertai system_prompt.txt yang dapat Anda baca dan ganti, dan isinya luar biasa eksplisit soal bahasa: bahasa deskripsi mengikuti instruksi Anda, sedangkan bahasa teks yang dilukis ke dalam gambar ditentukan oleh urutan prioritas yang ketat yang mempertahankan bahasa label yang sudah ada pada gambar masukan bahkan ketika Anda memberi prompt dalam bahasa yang berbeda.
Itu adalah rekayasa kecil dengan dampak yang luas. Jika Anda memproduksi citra produk untuk pasar yang teks kemasannya penting, "penulis ulang mempertahankan bahasa label yang ada" dan "penulis ulang dengan membantu menerjemahkan semuanya ke bahasa Inggris" adalah perbedaan antara aset yang dapat digunakan dan aset yang ditolak — dan karena ia berada di dalam system prompt, bukan di dalam kotak hitam yang dihosting, Anda dapat melakukan diff terhadapnya dan mengubahnya.
LLaDA-Image-Turbo mengambil pertukaran yang berlawanan: satu model 6B, satu set bobot, generasi dan penyuntingan berbagi segalanya. Lebih sedikit komponen bergerak, lebih sedikit yang perlu dikonfigurasi, dan tidak ada yang perlu diperiksa atau ditimpa. Kartunya mengutip angka Qwen-Image-Bench sebesar 53,53 untuk bahasa Inggris dan 53,38 untuk bahasa Tionghoa dengan klaim SOTA sumber terbuka — dilaporkan vendor, belum direproduksi, dan perhatikan bahwa tolok ukur yang dimenangkannya dinamai menurut model yang secara implisit menjadi pesaingnya.
Apa yang sebenarnya akan Anda gunakan untuk menjalankannya
Dukungan ekosistem pada hari peluncuran adalah bagian paling tidak glamor dari sebuah rilis dan bagian yang menentukan apakah Anda menghabiskan waktu satu sore atau akhir pekan.
• Qwen-Image 2.1 dirilis secara luas: sebuah QwenImage21Pipeline digabungkan ke Diffusers pada hari nol; dukungan ComfyUI native dengan templat alur kerja text-to-image dan image-edit; vLLM-Omni dengan eksekusi bertahap, caching KV prefix, decode CUDA Graph, kuantisasi FP8, dan paralelisme tensor/Ulysses; pull request dukungan SGLang native yang masuk pada 17 September — tiga hari sebelum bobotnya — mencakup DiT, VAE RGBA, pengondisian Qwen3-VL dan input multi-referensi, divalidasi pada H200, B200, RTX PRO 6000, RTX 5090 dan RTX 4090; serta akselerasi hari nol melalui LightX2V dengan AMD Radeon via ROCm dan dukungan multi-chip melalui FlagOS.
• LLaDA-Image-Turbo mendapat dukungan ComfyUI pada 7 September 2026, tiga hari setelah bobotnya, plus distribusi Diffusers dan Safetensors. Itu jalur nyata untuk menjalankannya, tetapi jalurnya lebih tipis, dan tidak ada pekerjaan penyajian pra-rilis yang setara yang bisa dijadikan rujukan.
Pull request SGLang pra-rilis adalah petunjuk untuk Qwen-Image 2.1. Dukungan framework yang hadir sebelum bobotnya berarti seseorang sedang menguji jalur serving terhadap checkpoint, bukan menulisnya dari kartu model setelahnya.

Jalur hosted yang Anda simpan bersama eksperimen
Tidak satu pun dari model-model ini dapat dirutekan melalui OrcaRouter pada saat penulisan ini, dan artikel ini tidak akan menyiratkan sebaliknya — keduanya merupakan opsi self-host, satu dengan lisensi yang tidak memungkinkan penggunaan di produksi dan satu lagi tanpa lisensi sama sekali. Yang penting bagi tim yang mengevaluasinya adalah bahwa evaluasi tersebut tidak harus berada di jalur kritis.
OrcaRouter menempatkan 200+ model di balik satu endpoint yang kompatibel dengan OpenAI pada harga daftar penyedia tanpa markup, dengan failover otomatis antar penyedia dan DSL routing yang memungkinkan Anda menyusun beberapa model menjadi satu panggilan. Bentuk praktisnya untuk keputusan ini adalah rute di mana model yang sudah Anda percayai menangani lalu lintas produksi sementara checkpoint yang di-host sendiri diuji di sampingnya — dan karena harga daftar diteruskan apa adanya alih-alih ditandai naik, perubahan harga vendor pada model mana pun yang dirutekan langsung berlaku di sisi kami pada hari yang sama alih-alih menunggu amendemen kontrak. Model gambar yang kami rutekan saat ini adalah keluarga GPT-Image dari OpenAI, tingkatan Imagen 4 dan pratinjau gambar Gemini dari Google, serta endpoint gambar Grok Imagine dari xAI. Jika Anda akan menghabiskan waktu seminggu untuk menyiapkan transformer difusi 33 GB guna mengetahui apakah ia mengalahkan model terkelola, model terkelola adalah kelompok kontrol, dan ada baiknya kelompok kontrol itu sudah tersedia di sebuah kunci.
Apa yang akan mengubah perbandingan ini?
Tiga hal, sesuai urutan seberapa besar pengaruhnya.
Pertama, skor benchmark independen untuk masing-masing model. Keduanya belum memilikinya, dan sampai itu berubah, setiap klaim kualitas di kedua pihak hanyalah lab yang menilai pekerjaan rumahnya sendiri. Kedua, lisensi: varian permisif dari Qwen-Image 2.1 akan menjadikannya default yang jelas untuk pekerjaan gambar terbuka pada 7B, dan lisensi apa pun yang dinyatakan pada LLaDA-Image-Turbo setidaknya akan membuatnya dapat direncanakan. Ketiga, penguji akses awal dari program ModelScope Qwen tanggal 17 September diminta menerbitkan sampel atau ulasan paling lambat 29 September — delapan hari dari sekarang. Saat itulah ini berhenti menjadi perbandingan dua kartu model dan mulai menjadi perbandingan yang nyata. Sampai saat itu, ringkasan yang jujur adalah bahwa Qwen-Image 2.1 adalah model yang tampak lebih mampu yang tidak dapat Anda komersialkan, LLaDA-Image-Turbo adalah yang lebih cepat yang sama sekali tidak dapat Anda gunakan tanpa percakapan, dan file lisensi adalah satu-satunya bagian dari kedua rilis yang sepenuhnya sudah final.
