Kartu hero yang dihasilkan untuk artikel 'Qwen-Image 2.1 vs Qwen-Image 3.0' yang menampilkan dua kartu model bersudut tumpul berlabel 'Qwen-Image 2.1' dan 'Qwen-Image 3.0' dengan penanda tanggal 20 Sep 2026 dan 21 Jul 2026, ikon unduh pada salah satunya dan ikon cloud pada yang lain, serta pita bertuliskan 'Angka yang lebih rendah adalah model yang lebih baru'.
Guides & Insights

Qwen-Image 2.1 vs Qwen-Image 3.0: Angka yang Lebih Rendah Adalah Model yang Lebih Baru

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Mulai dari hal yang membingungkan semua orang. Qwen-Image 2.1 lebih baru daripada Qwen-Image 3.0. Vendor tersebut merilis Qwen-Image 3.0 pada 21 Juli 2026 dan membawanya ke ketersediaan umum pada 5 Agustus. Mereka merilis Qwen-Image 2.1 pada 20 September 2026 — tujuh minggu setelahnya, dan satu versi minor lebih rendah. Penomoran itu bukan sebuah urutan; itu adalah dua lini produk berbeda yang berbagi nama, dan fakta tunggal paling berguna tentang keduanya adalah bahwa keduanya mengambil posisi berlawanan pada pertanyaan yang menentukan apakah Anda dapat membangun di atasnya. Qwen-Image 3.0 bersifat tertutup dan dihosting, tanpa bobot, tanpa lisensi, dan tanpa laporan teknis. Qwen-Image 2.1 adalah bobot terbuka, dapat diunduh hari ini, di bawah lisensi riset yang hanya mengizinkan penggunaan non-komersial.

Dua produk yang kebetulan memiliki nama yang sama

Keluarga Qwen-Image kini telah mengambil tiga posisi lisensi yang berbeda dalam empat belas bulan, dan memaparkannya menghilangkan sebagian besar kebingungan:

Qwen-Image 1.0 dan 2.0 — bobot terbuka Apache 2.0 di Hugging Face dan ModelScope, laporan teknis pada hari peluncuran, dapat di-host sendiri, dapat di-fine-tune, dapat dikuantisasi.

Qwen-Image 3.0 — tertutup. Tidak ada bobot, tidak ada lisensi yang dinyatakan, tidak ada kartu model, tidak ada laporan teknis, tidak ada tabel benchmark yang dipublikasikan. Hanya dapat diakses melalui API yang dihosting, dalam edisi Pro dan Standard.

Qwen-Image 2.1 — bobot terbuka lagi, tetapi di bawah Perjanjian Lisensi Penelitian Qwen tertanggal 20 September 2026, yang memberikan hak "HANYA UNTUK TUJUAN NON-KOMERSIAL" dan mengarahkan penggunaan komersial ke lisensi yang dinegosiasikan secara terpisah.

Baca itu sebagai pola, bukan garis waktu, dan bentuknya menjadi jelas: Alibaba tidak lagi memperlakukan "open" sebagai biner. Qwen-Image 2.1 bukanlah rilis permisif seperti 1.0 dan 2.0, juga bukan rilis tertutup seperti 3.0. Ini adalah posisi ketiga — bobot yang dapat Anda periksa, jalankan, dan modifikasi, dengan gerbang komersial yang dipasang di depannya.

Apa sebenarnya setiap model itu

Qwen-Image 2.1 — model terpadu untuk pembuatan gambar dari teks dan penyuntingan gambar dengan 7B parameter pada komponen pembuatan visualnya, dibangun sebagai DiT aliran tunggal 32 lapis. Encoder teks Qwen3-VL 8B dan VAE RGBA 64 saluran dengan kompresi spasial 16× berada di sampingnya; unduhan lengkapnya sekitar 33 GB, dengan encoder teks menyumbang lebih dari separuhnya. Atensi block-causal dengan mask causal tingkat token untuk teks dan mask bidirectional tingkat chunk untuk pembuatan gambar, plus penggunaan ulang cache KV prefix untuk penyuntingan multi-gambar. Native 2K, default 2048×2048 pada 40 langkah, dengan tujuh preset rasio aspek.

Qwen-Image 3.0 — model tertutup yang dihosting dalam edisi Pro dan Standard, menghadirkan pembuatan dan pengeditan gambar melalui satu API. Materi peluncuran Alibaba mengklaim prompt hingga sekitar 4.500 token, teks yang dapat dibaca hingga sekitar 10 piksel, dan cakupan 12 bahasa di lebih dari 20 font, dengan output hingga 2048×2048 dan hingga enam gambar per panggilan. Jumlah parameter tidak dipublikasikan; angka ~20B MMDiT yang banyak dikutip hanya dilaporkan, bukan dikonfirmasi.

Perbedaan arsitektural yang paling penting dalam praktik bukanlah ukuran — melainkan di mana model dijalankan dan apa yang dapat Anda lakukan terhadapnya. Qwen-Image 2.1 hadir sebagai file yang dapat Anda periksa, kuantisasi, fine-tune pada data privat, dan jalankan di perangkat keras Anda sendiri, dengan pull request dukungan SGLang yang di-merge tiga hari sebelum bobotnya bahkan tiba. Qwen-Image 3.0 hadir sebagai endpoint. Anda tidak dapat mengkuantisasinya, Anda tidak dapat melakukan fine-tune padanya, dan Anda tidak dapat menjalankannya di mana pun selain tempat Alibaba menjalankannya.

Penyuntingan adalah titik ketika keduanya paling jauh berbeda.

Kedua model melakukan generasi dan pengeditan dalam satu sistem, jadi perbandingan yang menarik terletak pada detail pengeditannya — dan di sini, model yang lebih baru dan lebih kecil justru lebih mumpuni secara teori.

Gambar referensi — Qwen-Image 2.1 menerima hingga 10 referensi masukan. Dokumentasi Pro Qwen-Image 3.0 menjelaskan dukungan untuk 1–3 gambar masukan.

Kontrol pengeditan lokal — Qwen-Image 2.1 mendukung lingkaran, anotasi yang dilukis, dan mask terpisah yang disediakan sebagai input tersendiri sehingga gambar asli tetap tanpa tanda. Jalur pengeditan yang didokumentasikan Qwen-Image 3.0 mencakup penulisan ulang lokal, perluasan konten, transfer gaya, dan pembuatan multi-sudut kamera, tanpa alur kerja berbasis mask yang dipublikasikan.

Transparansi — Qwen-Image 2.1 secara native menghasilkan dan mengedit gambar RGBA, mengedit teks di dalam lapisan transparan, dan mengekstraksi subjek dari foto RGB ke lapisan transparan. Pengumuman Qwen-Image 3.0 tidak memuat klaim transparansi.

Penulisan ulang prompt — Qwen-Image 2.1 menghadirkan dua checkpoint penulisan ulang khusus, keduanya merupakan model Qwen3.5-VL 9B yang telah di-fine-tune, satu untuk text-to-image dan satu untuk penyuntingan, dengan kode penulisan ulang serta system prompt yang dipublikasikan. Penanganan prompt Qwen-Image 3.0 adalah kotak hitam di balik API.

Ekosistem — Qwen-Image 2.1 memiliki dukungan sejak hari pertama di Diffusers, ComfyUI, vLLM-Omni, SGLang dan LightX2V, plus jalur AMD ROCm dan FlagOS. Qwen-Image 3.0 memiliki API.

Baris terakhir itu bukan sekadar hiasan retoris. Bagi tim yang pipeline-nya berada di ComfyUI atau yang stack inferensinya adalah vLLM, perbedaan antara model dengan kelas pipeline yang telah digabungkan dan model dengan endpoint HTTP adalah perbedaan antara tugas integrasi dan penulisan ulang.

A generated two-column comparison scoreboard titled 'Qwen-Image 2.1 vs Qwen-Image 3.0 — the scoreboard'. Left column 'Qwen-Image 2.1': rows reading Released: 20 Sep 2026; Licence: research, non-commercial; Access: 33 GB open download; Reference images: up to 10; Transparency: native RGBA; Published price: none. Right column 'Qwen-Image 3.0': rows reading Released: 21 Jul 2026, GA 5 Aug; Licence: not published; Access: closed hosted API; Reference images: 1 to 3; Transparency: none claimed; Published price: ~$0.04 Pro, $0.03 Std. Footer reads 'Qwen-Image 2.1 specs per vendor model card, unaudited; Qwen-Image 3.0 pricing is vendor list, unaudited.'

Harga, dan hal yang tidak bisa ditangkap oleh harga

Qwen-Image 3.0 memiliki satu-satunya harga yang dipublikasikan dari keduanya: di cloud penyedia, Pro terdaftar sekitar $0,04 per gambar dan Standard sekitar $0,03, dengan harga konsumen domestik mulai sekitar ¥0,18. Itu adalah angka peluncuran dan belum diaudit secara independen. Qwen-Image 2.1 tidak memiliki tarif hosted yang dipublikasikan sama sekali — ini adalah unduhan, dan biayanya bergantung pada biaya waktu GPU Anda sendiri.

Kedua hal itu tidak dapat dibandingkan, dan berpura-pura sebaliknya adalah kesalahan yang paling umum dalam perbandingan ini. Harga per gambar mencakup model, infrastruktur penyajian, penskalaan, dan waktu aktif pihak lain. Unduhan bobot tidak mencakup satu pun dari itu. Pertanyaan yang tepat bukanlah angka mana yang lebih kecil; melainkan apakah Anda memiliki kapasitas operasional untuk menjalankan stack model 33 GB, dan apakah lisensi di sisi yang murah mengizinkan apa yang Anda rencanakan untuk dilakukan dengannya.

Yang membawa lisensi kembali ke pusat perbandingan, tempatnya yang semestinya. Ketentuan Qwen-Image 3.0 tidak dipublikasikan, yang menjadi masalah tersendiri untuk pekerjaan yang diatur regulasi atau agensi — tidak ada dokumen yang bisa dikutip. Ketentuan Qwen-Image 2.1 telah diterbitkan, dan ketentuannya menyatakan non-komersial. Di antara lisensi yang tidak jelas dan lisensi yang jelas membatasi, yang jelas membatasi lebih mudah untuk direncanakan, karena setidaknya Anda tahu percakapan apa yang perlu dilakukan.

A screenshot of the Qwen vendor blog page for Qwen-Image 3.0, captured September 20 2026, showing the launch announcement, the Pro and Standard edition descriptions, the claimed prompt-length and text-rendering figures, and the per-image list pricing.

Mana yang harus Anda pilih

Anda membutuhkan citra produksi yang padat teks dan ingin orang lain yang menjalankannya — Qwen-Image 3.0 adalah pilihan yang tepat, dengan catatan bahwa angka rendering teks utamanya merupakan klaim vendor dan pengujian independen yang ada menyebutkan teks berukuran kecil masih rusak dalam beberapa kasus.

Anda perlu menjalankan modelnya sendiri, menyetelnya secara khusus, atau menyimpan data di perangkat keras Anda sendiri — Qwen-Image 2.1 adalah satu-satunya pilihan di antara keduanya, dan lisensi riset adalah harga masuknya.

Anda memerlukan aset transparan, cutout produk, atau lebih dari tiga gambar referensi — Qwen-Image 2.1, berdasarkan spesifikasi yang dipublikasikan, adalah alat yang lebih kuat, dan tidak ada yang mendekati dalam hal jumlah referensi.

Anda memerlukan hak komersial dan lisensi yang permisif — tidak satu pun dari ini adalah model Anda. Qwen-Image 3.0 sama sekali tidak memiliki ketentuan yang dipublikasikan, dan Qwen-Image 2.1 memerlukan lisensi komersial yang dinegosiasikan. Rilis Apache-2.0 dalam keluarga ini adalah Qwen-Image 1.0 dan 2.0 yang lebih awal.

Baris terakhir itulah yang layak direnungkan, karena ia menggambarkan kumpulan yang menyusut. Lisensi yang sudah diberikan tidak berubah secara retroaktif, jadi rilis Qwen-Image Apache-2.0 tetap dapat digunakan dengan ketentuan aslinya. Namun, jika Anda merencanakan pipeline gambar komersial dengan asumsi bahwa Qwen-Image terbaru akan dilisensikan secara permisif, tiga rilis terakhir adalah bukti yang menentang asumsi tersebut.

Menjalankan salah satunya tanpa mempertaruhkan pipeline pada itu.

Kedua model ini, karena alasan yang berbeda, sulit ditempatkan di belakang jalur produksi saat ini — satu karena lisensi, satu karena kotak hitam dan jumlah parameter yang tidak dipublikasikan. Itulah tepatnya situasi yang menjadi alasan sebuah lapisan perutean dibuat. OrcaRouter menampilkan 200+ model di belakang satu endpoint yang kompatibel dengan OpenAI dengan harga daftar penyedia tanpa markup, dengan failover otomatis antar penyedia dan DSL perutean yang memungkinkan Anda menyusun beberapa model menjadi satu panggilan, sehingga model baru atau yang canggung dapat berada di samping model yang sudah terbukti, bukan di depannya. Fusi model membawa ide yang sama lebih jauh, menjalankan panel model bersama-sama dan memungkinkan Anda membandingkannya pada prompt Anda sendiri alih-alih pada bagan peluncuran.

Baik Qwen-Image 2.1 maupun Qwen-Image 3.0 tidak termasuk dalam model yang kami arahkan saat ini, dan artikel ini tidak akan menyatakan sebaliknya. Model gambar yang memang kami arahkan — lini GPT-Image dari OpenAI, tingkat Imagen 4 dari Google dan pratinjau gambar Gemini, serta endpoint gambar Grok Imagine dari xAI — itulah yang sebenarnya akan menjadi dasar pembangunan jalur failover saat Anda mengevaluasi pasangan Qwen sesuai kriteria Anda sendiri.

Apa yang perlu diperhatikan lebih sempit daripada kelihatannya. Alibaba kini telah menunjukkan bahwa mereka akan merilis bobot terbuka, model tertutup yang dihosting, dan unduhan berlisensi riset dalam keluarga yang sama pada kuartal yang sama. Rilis berikutnya tidak akan memberi tahu Anda pola mana yang menang. Berkas lisensinya yang akan memberi tahu.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 20 2026, showing the 2026/09/20 date, the headline 'Compact, Efficient, and Unified Image Creation', the 'Now open weights' hero banner, GitHub, Hugging Face and ModelScope buttons, and the 7B parameter figure.