
Qwen-Image 2.1 Dirilis dengan Tenang: Menelusuri Qwen/Qwen-Image-2.1-PE-I2I
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Pada 20 September 2026, tim Qwen-Image merilis Qwen-Image 2.1 di Hugging Face dan ModelScope — bobot, berkas lisensi, kartu model, dan sebuah pos blog, semuanya dalam hari yang sama, dengan hampir tanpa masa persiapan sebelumnya. Angka utama yang disorot adalah 7B parameter pada komponen pembuatan visual. Bagian yang hampir belum dibuka siapa pun adalah Qwen/Qwen-Image-2.1-PE-I2I, salah satu dari dua checkpoint penulisan ulang prompt yang dirilis bersama model gambar. Ini bukan model gambarnya. Ini adalah komponen yang menentukan apa arti instruksi Anda sebelum model gambar melihatnya — dan dalam rilis ini, ia adalah komponen yang secara diam-diam menetapkan bahasa keluaran Anda.
Apa yang sebenarnya dimaksud dengan "dirilis secara senyap" di sini
Pilihan katanya penting, karena mudah untuk berlebihan ke arah mana pun. Qwen-Image 2.1 tidak dibocorkan, dan bukan tanpa pengumuman. Ada posting blog vendor bertanggal 20 September 2026, repositori GitHub dengan bagian berita bertanggal hari yang sama, dan unduhan bobot yang sudah aktif. Yang tidak didapatkannya adalah masa persiapan: satu-satunya sinyal awal adalah catatan 17 September yang menawarkan 50 slot akses awal melalui ModelScope, dengan penguji terpilih diminta menerbitkan sampel atau ulasan paling lambat 29 September. Tiga hari kemudian, bobotnya menjadi publik. Tanpa keynote, tanpa embargo benchmark, tanpa siklus pers.
Itu adalah jenis rilis yang spesifik, dan layak diberi nama secara tepat. Vendor mengumumkannya. Vendor tidak mempromosikannya. Bagi siapa pun yang memutuskan apakah akan membangun di atasnya, konsekuensi praktisnya adalah bahwa belum ada evaluasi independen yang bisa dijadikan sandaran — hanya materi vendor sendiri dan apa pun yang diterbitkan oleh penguji akses awal selama seminggu ke depan. Anggap setiap klaim kualitas dalam artikel ini berasal dari model card dan postingan blog sampai seseorang di luar Alibaba menjalankannya di publik.
Mengapa checkpoint PE-I2I adalah yang menarik
Rilis Qwen-Image 2.1 berisi tiga komponen yang dapat diunduh, bukan satu:
• Qwen/Qwen-Image-2.1 — model gambarnya sendiri. DiT single-stream 32 lapis dengan 7B parameter pada komponen generasi visual, encoder teks Qwen3-VL 8B, dan VAE RGBA 64 kanal dengan kompresi spasial 16×. Sekitar 33 GB untuk ketiga komponen tersebut.
• Qwen/Qwen-Image-2.1-PE-T2I — penulis ulang prompt untuk teks ke gambar. Qwen3.5-VL 9B yang disetel halus, sekitar 18,8 GB.
• Qwen/Qwen-Image-2.1-PE-I2I — penulis ulang prompt untuk pengeditan gambar ke gambar. Juga merupakan Qwen3.5-VL 9B yang telah di-fine-tune, juga sekitar 18,8 GB, diunggah ke Hugging Face pada 08:46 UTC tanggal 20 September.
"PE" adalah peningkatan prompt. Varian I2I mengambil instruksi penyuntingan yang kabur plus satu atau beberapa gambar masukan dan menulis ulangnya menjadi direktif penyuntingan yang presisi dan tidak ambigu untuk model difusi hilir. Deskripsi repositori itu sendiri blak-blakan soal bentuk masukannya: gambar masukan selalu ada, jadi ini selalu tugas penyuntingan gambar dan bukan text-to-image dari nol. Kode penulisan ulang berada di prompt_rewrite/ folder yang melayani kedua checkpoint — --task t2i atau --task edit — dengan jalur transformers, jalur vLLM, serve.sh plus client.py untuk layanan yang berjalan terus, dan pe_core.py untuk logika bersama.
Inilah sebabnya hal itu lebih penting daripada yang terdengar. Model gambar tidak tahu apa yang Anda maksud. Model hanya punya gambaran tentang apa yang secara literal dikatakan oleh prompt Anda, yang diberi bobot oleh apa pun yang dilakukan encoder teks terhadapnya. Penulis ulang yang berada di depannya adalah tempat ambiguitas diselesaikan — atau diselesaikan salah, secara konsisten, di setiap gambar yang Anda hasilkan. Dalam model generasi dan penyuntingan terpadu dengan hingga 10 gambar referensi, langkah penyelesaian itu memiliki lebih banyak hal yang bisa salah daripada biasanya.
Prompt sistem adalah tempat keputusan bahasa berada
Repositori PE-I2I menyertakan system_prompt.txt bersama bobotnya, dan repositori ini luar biasa eksplisit tentang satu hal: bahasa. Saat membacanya secara langsung, penulis ulang diinstruksikan untuk membuat dua keputusan bahasa yang terpisah, dan menjaga keduanya tetap terpisah.
• Bahasa deskripsi. Prosa yang ditulis oleh penulis ulang untuk mendeskripsikan suntingan mengikuti bahasa instruksi pengguna — instruksi dalam bahasa Mandarin, deskripsi dalam bahasa Mandarin; instruksi dalam bahasa Inggris, deskripsi dalam bahasa Inggris; instruksi dalam bahasa Jepang, Korea, Prancis, Thai, atau bahasa lainnya akan mendapatkan deskripsi dalam bahasa Inggris.
• Bahasa teks yang dirender. Teks yang benar-benar akan dilukiskan ke dalam gambar keluaran, yang diapit tanda kutip ganda, ditentukan oleh urutan prioritas yang ketat: pertama, jika pengguna menyebutkan teks persisnya atau bahasa target, patuhi itu secara literal; kedua, jika gambar masukan sudah berisi teks, cocokkan bahasa dominan dari teks yang ada tersebut — bahkan ketika instruksi ditulis dalam bahasa yang berbeda; ketiga, jika tidak ada teks dalam gambar dan tidak ada bahasa yang disebutkan, gunakan bahasa instruksi itu sendiri, dan secara khusus jangan memaksakannya ke bahasa Inggris.
Prompt tersebut memperkuat aturan kedua dengan contoh yang telah dikerjakan — sebuah gambar yang sebagian besar berbahasa Thai, diedit dengan instruksi berbahasa Inggris yang tidak menyebutkan bahasa tertentu, harus menghasilkan teks Thai — dan menambahkan dua batasan: teks yang dihasilkan harus monolingual, bukan pasangan Tionghoa/Inggris, dan genre visual "spec sheet" atau "storyboard" dicapai melalui tata letak dan tipografi, bukan dengan mengalihkan label yang dihasilkan ke bahasa Inggris.
Ini adalah rekayasa kecil dengan radius ledakan yang besar. Jika Anda menghasilkan citra produk untuk pasar yang teks kemasannya penting, perbedaan antara "penulis ulang mempertahankan bahasa label yang ada" dan "penulis ulang dengan 'membantu' menerjemahkan semuanya ke bahasa Inggris" adalah perbedaan antara aset yang dapat digunakan dan aset yang ditolak. Dan karena perilaku ini ditentukan dalam prompt sistem yang disertakan dalam repositori, Anda dapat membacanya, melakukan diff terhadapnya, dan menimpanya — yang tidak dapat Anda katakan tentang langkah yang sama di dalam model hosted tertutup.
Apa yang dikonfirmasi, dan apa yang tidak
Sangat tepat mengenai batas di sini adalah inti dari tulisan 'apa yang kita ketahui'.
• Dikonfirmasi dari repositori dan kartu model — angka DiT aliran tunggal 7B / 32 lapis; encoder teks Qwen3-VL 8B; VAE RGBA 64 kanal pada kompresi spasial 16×; atensi block-causal dengan mask causal tingkat token untuk teks dan mask bidirectional tingkat chunk untuk pembuatan gambar; penggunaan ulang cache KV prefix, yang menurut kartu aktif ketika checkpoint membawa causal_condition: true (benar); flow matching dengan penjadwalan diskret Euler; output native 2K dengan 2048×2048 sebagai default pada 40 langkah inferensi; tujuh praset rasio aspek yang didokumentasikan; dukungan hingga 10 gambar referensi; pengeditan lokal dengan lingkaran, anotasi yang dilukis, atau mask terpisah; dan pembuatan RGBA, pengeditan lapisan transparan, serta ekstraksi subjek dari foto RGB.
• Terkonfirmasi soal lisensinya, dan inilah sisi tajamnya — rilis ini berada di bawah Qwen Research License Agreement, bertanggal 20 September 2026, yang memberikan hak "FOR NON-COMMERCIAL PURPOSES ONLY" dan menyatakan bahwa penggunaan komersial memerlukan lisensi terpisah yang diminta dari vendor. Ini adalah perubahan material dari lini Qwen-Image sebelumnya, yang dirilis di bawah Apache 2.0. Baca file lisensinya sebelum Anda membangun produk berdasarkan ini, bukan setelahnya.
• Belum dikonfirmasi — belum ada skor tolok ukur independen. Postingan blog tersebut merujuk pada bagan perbandingan Qwen-Image-Bench, tetapi angka-angka di dalamnya berasal dari vendor itu sendiri dan belum direproduksi oleh pihak ketiga mana pun pada saat penulisan. Tidak ada harga endpoint terkelola yang dipublikasikan untuk Qwen-Image 2.1, dan tidak ada ketentuan yang dinyatakan untuk lisensi komersialnya. Dan belum ada kabar apakah varian dengan lisensi permisif akan menyusul.
Satu-satunya titik data independen yang ada adalah ulasan akses awal langsung dari seorang penguji yang mendapat akses melalui program Qwen Ambassador dan menjalankan bobot rilis final melalui antarmuka ModelScope Studio. Ulasan tersebut melaporkan waktu pembuatan sekitar 10–15 detik untuk teks-ke-gambar dan 18–23 detik untuk penyuntingan, performa yang kuat pada preset posisi kamera dan penetapan peran multi-karakter, serta mode kegagalan spesifik yang perlu diketahui: konsistensi multi-referensi menurun mulai dari sekitar tiga gambar masukan, dengan penempatan ekor kuda samping runtuh menjadi ekor kuda tengah pada sudut profil. Itu satu pengulas, pada UI akses awal, tanpa penunjuk waktu yang ditampilkan. Ini sinyal yang berguna. Ini bukan tolok ukur.

Dukungan framework sejak hari pertama, yang jadi kabar baik yang tenang
Di mana sebuah model tersedia pada hari peluncurannya memberi tahu Anda lebih banyak tentang apakah Anda benar-benar dapat menggunakannya dibandingkan kartu modelnya, dan Qwen-Image 2.1 hadir secara luas:
• Diffusers — sebuah QwenImage21Pipeline digabungkan pada hari pertama, dan repositori model membawa tag diffusers:QwenImage21Pipeline.
• ComfyUI — dukungan native sejak hari pertama dengan templat alur kerja text-to-image dan pengeditan gambar, plus repositori bobot yang kompatibel dengan Comfy secara terpisah.
• vLLM-Omni — eksekusi bertahap, cache KV prefiks, dekode CUDA Graph, kuantisasi FP8, dan paralelisme tensor/Ulysses.
• SGLang — sebuah pull request dukungan native mendarat 17 September, tiga hari sebelum bobot, mencakup DiT, VAE RGBA, pengondisian Qwen3-VL, beberapa gambar referensi, dan input/output RGBA, yang divalidasi pada H200, B200, RTX PRO 6000, RTX 5090 dan RTX 4090.
• LightX2V — akselerasi sejak hari pertama, plus AMD Radeon melalui ROCm dan dukungan multi-chip lewat FlagOS.
Pull request SGLang pra-rilis adalah petunjuknya. Dukungan framework yang hadir sebelum bobotnya berarti jalur serving sedang diuji terhadap checkpoint, bukan ditulis dari kartu model setelahnya. Untuk komponen 7B dengan encoder teks 17,5 GB di sampingnya, itulah perbedaan antara menghabiskan sepanjang akhir pekan untuk yak-shaving dan satu sore saja.
Untuk GPU yang terbatas, kartu model merekomendasikan offload CPU — pipe.enable_model_cpu_offload() — yang merupakan solusi darurat standar alih-alih perbaikan. Unduhan 33 GB didominasi oleh text encoder, bukan DiT; diffusion transformer itu sendiri adalah bagian yang lebih kecil dari bundel, sekitar 14 GB.

Bacaan praktis
Jika Anda ingin mencoba Qwen-Image 2.1 hari ini, posisi jujurnya adalah Anda bisa, secara lokal, di bawah lisensi riset, tanpa tolok ukur independen dan tanpa hak komersial. Itu pertukaran yang masuk akal untuk evaluasi dan buruk untuk pipeline produksi, dan jarak antara keduanya persis ditentukan oleh berkas lisensi.
Bagi tim yang melakukan benchmark model gambar tanpa ingin mengikat jalur produksi ke checkpoint yang sudah berumur beberapa hari, lapisan routing adalah tempat risiko itu dikendalikan. OrcaRouter menghadirkan 200+ model di balik satu endpoint yang kompatibel dengan OpenAI dengan harga daftar penyedia tanpa markup, dengan failover otomatis antarpenyedia, sehingga model yang belum terbukti dapat berada di belakang sebuah rute bersama model yang sudah Anda percayai, bukan menggantikannya — dan karena harga daftar diteruskan apa adanya, pemotongan harga vendor pada model yang dirutekan apa pun langsung berlaku pada hari yang sama alih-alih menunggu perubahan kontrak. Qwen-Image 2.1 bukan termasuk model yang kami rutekan pada saat penulisan ini, dan artikel ini tidak akan menyiratkan sebaliknya. Yang kami rutekan adalah lini gambar di sekitarnya — keluarga GPT-Image dari OpenAI, tier Imagen 4 Google dan pratinjau gambar Gemini, serta endpoint gambar Grok Imagine dari xAI — yang darinya jalur failover akan berasal saat Anda mengevaluasi pendatang baru itu di perangkat keras Anda sendiri.
Pertanyaan terbuka adalah pertanyaan yang tidak dapat dijawab oleh repositori itu. Alibaba merilis model gambar 7B dengan bobot terbuka di bawah lisensi hanya untuk riset, pada tahun yang sama ketika mereka merilis Qwen-Image 3.0 sebagai model tertutup yang dihosting tanpa bobot sama sekali. Dua rilis, dua taruhan yang berlawanan, berselang empat bulan. Mana di antara keduanya yang akan menentukan bentuk model gambar Qwen berikutnya — dan apakah lisensi riset itu akan pernah berubah menjadi sesuatu yang bisa digunakan bisnis — itulah yang perlu dicermati. Bobotnya sekarang ada di Hugging Face, dan siapa pun bisa membaca sendiri file lisensinya.

