Kartu hero yang membandingkan Qwen-Image-2.1-Turbo dengan Qwen-Image-2.1, menampilkan 8 langkah denoising versus 40, arsitektur DiT 7B 32-lapis yang identik, tujuh preset resolusi yang sama, Lisensi Qwen Research non-komersial yang sama, dan jadwal sampling tersimpan yang tidak ditimpa oleh num_inference_steps
Engineering & Research

Qwen-Image-2.1-Turbo vs Qwen-Image-2.1: Apa yang Sebenarnya Berubah Antara Checkpoint Dasar dan Versi yang Dipercepat

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Komponen generasi visual 7B yang sama. 32 lapisan DiT single-stream yang sama. Tujuh preset resolusi yang sama, permukaan generasi-dan-pengeditan terpadu yang sama, lisensi non-komersial yang sama, kelas pipeline yang sama untuk memuatnya. Qwen-Image-2.1-Turbo dan Qwen-Image-2.1 bukanlah dua model yang Anda pilih berdasarkan kemampuan — checkpoint Turbo adalah fine-tune dari basisnya, dan repositori mengatakan demikian dalam metadatanya sendiri. Yang membedakan keduanya adalah lintasan sampling tunggal, dan cara lintasan itu disimpan. Yang satu menjalankan empat puluh langkah. Yang lainnya menjalankan delapan, dan menolak diberi tahu sebaliknya saat pemanggilan. Segala hal yang menarik tentang pasangan ini ada pada kalimat kedua itu.

Mulai dengan bagian yang identik

Sebelum perbedaannya, kesamaannya layak dipetakan, karena cakupannya lebih luas daripada yang disiratkan oleh label "Turbo" dan itulah yang membuat penggantian itu menarik.

• Arsitektur. Kartu Turbo menyatakan bahwa ia "menggunakan arsitektur generasi visual 7B yang sama" dengan Qwen-Image-2.1. Proyek tersebut mendeskripsikan komponen itu sebagai 7B parameter di 32 lapisan Single-Stream DiT. Tidak ada apa pun di repositori Turbo yang mengumumkan backbone yang lebih kecil, dipangkas, atau diarsitekturkan ulang.

• Kemampuannya. Kedua checkpoint dijelaskan sebagai melakukan pembuatan gambar dari teks dan pengeditan gambar. Turbo mewarisi tampilan model dasar alih-alih menyatakannya kembali: kartu model dasar mendokumentasikan transparansi RGBA native, hingga 10 gambar referensi, dan pengeditan lokal yang ditentukan oleh lingkaran, anotasi yang dilukis, atau mask terpisah, dengan preservasi identitas untuk orang dan produk.

Screenshot of the Hugging Face model card for Qwen/Qwen-Image-2.1, captured in English, showing the Qwen organisation, 3.14k likes, the Text-to-image (diffusers), Diffusers, Safetensors and QwenImage21Pipeline tags, and the introduction text stating that Qwen-Image-2.1 is a unified text-to-image generation and image editing model with 7B parameters in its visual generation component and 32 Single-Stream DiT layers

• Resolusi.Kartu Turbo menyatakan untuk "menggunakan preset resolusi yang sama seperti Qwen-Image-2.1" lalu mencantumkannya: 1:1 pada 2048 × 2048, 4:3 pada 2400 × 1792, 3:4 pada 1792 × 2400, 3:2 pada 2528 × 1696, 2:3 pada 1696 × 2528, 16:9 pada 2752 × 1536 dan 9:16 pada 1536 × 2752. Kartu model dasar mencantumkan tabel yang identik. Kedua kartu menggunakan tingkat resolusi 2048 untuk contohnya.

• Jalur pemuatan. Keduanya dimuat melalui QwenImage21Pipeline di Diffusers. Panduan memulai cepat kartu Turbo adalah panduan memulai cepat kartu dasar dengan nama checkpoint diubah dan bfloat16 ditulis sebagai dtype, bukan torch_dtype.

• Dokumennya. Keduanya dilisensikan di bawah Perjanjian Lisensi Riset Qwen-Image-2.1, keduanya mencantumkan license: other dengan license_name: qwen-research, dan keduanya memiliki file LICENSE yang berada di repositori di samping bobotnya.

Jika Anda sudah memasang Qwen-Image-2.1, maka cakupan migrasinya benar-benar kecil. Itulah tepatnya mengapa satu argumen yang tidak berperilaku seperti yang Anda harapkan layak untuk direnungkan.

Jadwal telah berpindah keluar dari kode Anda dan masuk ke checkpoint

Pada model dasar, jumlah langkah ditentukan oleh Anda. Contoh text-to-image pada kartu Qwen-Image-2.1, contoh penyuntingannya, dan contoh transparansi RGBA-nya semuanya meneruskan num_inference_steps=40, dan angka itu adalah argumen saat pemanggilan dengan cara Diffusers yang biasa. Tidak ada apa pun di kartu itu yang memberi tahu Anda bahwa checkpoint tersebut punya opini tentang jadwalnya.

Pada Turbo, jadwal tersebut adalah metadata checkpoint. Kartu tersebut menyatakan bahwa checkpoint "menyertakan jadwal sampling yang direkomendasikan, sehingga siap digunakan tanpa perlu mengonfigurasi penjadwal secara manual," lalu, di bagian sampling, menjabarkan apa artinya dalam praktik: "Jadwal sampling 8 langkah yang direkomendasikan disimpan bersama checkpoint dan dimuat secara otomatis. Menetapkan num_inference_steps saja tidak menimpanya."

Ada dua hal yang menyusul, dan keduanya mudah disalahpahami ke arah yang berlawanan.

Hal pertama adalah bahwa delapan bukan nilai bawaan yang bisa Anda setel naik. Jika Anda ingin tahu seperti apa Turbo pada dua belas langkah atau dua puluh, kartu itu memberi tahu Anda bahwa satu-satunya jalur adalah argumen sigmas eksplisit saat pemanggilan — lalu menutup pintu pada eksperimen tersebut dengan mencatat bahwa jadwal lain "belum dievaluasi untuk checkpoint ini." Itu adalah vendor yang memberi tahu Anda bahwa konfigurasi delapan langkah adalah yang mereka dukung, dan bahwa apa pun selain itu adalah wilayah yang belum dijelajahi yang Anda masuki sendirian. Itu adalah kalimat yang luar biasa jujur dan harus dibaca sebagai batas, bukan sebagai undangan.

Yang kedua adalah jebakan reproduksi tanpa pesan error yang menyertainya. Ambil contoh dari model dasar, ubah string repositori menjadi checkpoint Turbo, biarkan num_inference_steps=40 tetap di tempatnya, dan kode akan berjalan. Kode itu tidak akan memperingatkan Anda. Kode itu akan menghasilkan gambar menggunakan jadwal delapan langkah yang tersimpan, dan hasilnya bukan keluaran yang ditampilkan oleh showcase Turbo, karena angka empat puluh tidak pernah dibaca. Inilah mode kegagalan di mana tidak ada yang terlihat rusak — proses render selesai, gambarnya masuk akal, dan satu-satunya cara Anda mengetahuinya adalah jika Anda sengaja mencari perbedaannya. Ada dependensi kedua yang terkubur bersamanya: checkpoint tersebut memerlukan build Diffusers yang memahami sampling sigma yang dikonfigurasi oleh pipeline, yang ditambahkan dalam PR #14950, yang pada saat penulisan ini berada di pohon sumber Diffusers, bukan di rilis bertag. Instalasi yang dinyatakan adalah build PyTorch yang kompatibel dengan CUDA plus sumber Diffusers, transformers>=5.17.0, accelerate, dan pillow.

Apa yang membayar untuk 32 langkah yang tidak kamu ambil?

Kartu ini menyebutkan dua mekanisme, dan keduanya penting untuk diketahui karena keduanya menjelaskan apa yang diasumsikan oleh checkpoint Turbo tentang cara Anda memanggilnya.

• CFG 1 secara default. "Generasi menggunakan CFG=1 secara default." Pada skala panduan tanpa pengklasifikasi sebesar satu, model tidak menjalankan lintasan kedua, tanpa syarat, yang biasanya diperlukan oleh CFG — yang merupakan sebagian besar dari bagaimana sebuah trajektori dipersingkat tanpa sekadar dipotong. Ini juga berarti kebiasaan model dasar dalam menyetel skala panduan tidak berpindah; tidak ada yang perlu disetel di sini, dan kartu tersebut tidak menawarkan rekomendasi panduan untuk disetel.

• Cache KV prefiks. Kartu Turbo menyatakan "cache KV prefiks menggunakan kembali konteks teks dan gambar referensi di seluruh langkah denoising." Ini adalah mekanisme warisan, bukan sesuatu yang baru untuk checkpoint yang dipercepat: pengumuman Qwen-Image-2.1 mencantumkan penggunaan kembali cache KV prefiks sebagai salah satu dari empat peningkatan utama model dasar, bersama atensi granularitas campuran, dan integrasi serving hari pertama untuk model dasar — entri vLLM-Omni dan SGLang dalam daftar berita proyek — menyebutkan cache KV prefiks secara eksplisit di antara fitur yang mereka dukung. Dalam loop empat puluh langkah, penggunaan kembali itu merupakan optimasi. Dalam loop delapan langkah, hal itu lebih penting secara proporsional, karena setiap langkah yang di-cache mewakili porsi yang lebih besar dari total pekerjaan.

Apa yang tidak disebutkan oleh kartu tersebut adalah teknik distilasi apa pun. Kartu model dasar Qwen-Image-2.1 dan README proyek menjelaskan arsitektur dan kemampuan; kartu Turbo menjelaskan mekanisme. Jika Anda mencoba bernalar tentang berapa biaya delapan langkah dalam hal kualitas, repositori tidak memberi Anda metode untuk bernalar — hanya jadwal dan sekumpulan gambar pameran.

Jumlah langkah bukanlah tolok ukur

Inilah bagian dari perbandingan yang jawaban jujurnya adalah tidak ada perbandingan, dan ada baiknya kita bersikap terus terang tentang alasannya.

• Checkpoint Turbo tidak memiliki skor yang dipublikasikan. Kartunya tidak memuat angka evaluasi apa pun. Tidak ada hasil Qwen-Image-Bench untuk Turbo, tidak ada perbandingan berdampingan dengan checkpoint dasar, tidak ada ablasi atas jumlah langkah, dan tidak ada tabel yang menunjukkan di mana kualitas mulai mendatar.

• Skor checkpoint dasar dilaporkan oleh vendor. Satu-satunya angka utama pada lini Qwen-Image-2.1 adalah hasil Qwen-Image-Bench milik model dasar itu sendiri, yang dilaporkan vendor terhadap checkpoint dasar. Ini bukan pengukuran checkpoint Turbo dan tidak boleh dialihkan kepadanya — akselerasi justru merupakan hal yang wajar menggeser angka semacam itu, dan vendor tidak menyebutkan seberapa besar pergeserannya.

• Tidak ada kartu yang melaporkan waktu atau memori. Tidak ada angka latensi, tidak ada angka throughput, dan tidak ada jejak memori untuk kedua checkpoint, dan tidak ada kartu yang menyebutkan perangkat keras yang digunakan contoh-contohnya. Kartu model dasar setidaknya mendokumentasikan bagian optimasi memori; kartu Turbo mendokumentasikan instalasi, pembuatan, pengeditan, pengambilan sampel, dan rasio aspek, lalu berhenti di situ.

Jadi, argumen untuk Turbo dibandingkan checkpoint dasar saat ini adalah argumen tentang maksud desain, bukan tentang hasil. Delapan langkah pada arsitektur yang sama dan tingkat resolusi 2048 yang sama seharusnya jauh lebih murah per gambar. “Jauh” benar-benar berperan penting dalam kalimat itu, dan satu-satunya cara untuk menggantinya dengan angka adalah menjalankan kedua checkpoint pada beban kerja Anda sendiri, yang merupakan satu-satunya cara untuk mengetahui apa yang dilakukan lintasan yang dipersingkat terhadap gambar-gambar tertentu yang Anda pedulikan.

Tidak ada hal lain yang berpindah, termasuk lisensi

Dua hal yang mungkin secara wajar diharapkan sudah berubah oleh pembaca, namun ternyata tidak.

Yang pertama adalah ekosistem. Ketika Qwen-Image-2.1 dirilis pada 20 September 2026, daftar berita proyek mencatat lima integrasi hari-nol terpisah pada hari yang sama: dukungan Diffusers melalui PR #14804, dukungan ComfyUI native dengan templat alur kerja yang dipublikasikan untuk text-to-image dan penyuntingan, dukungan vLLM-Omni dengan eksekusi bertahap dan decode CUDA Graph serta kuantisasi FP8 dan paralelisme tensor, dukungan SGLang dengan Cache-DiT dan component offload, dan akselerasi dari proyek LightX2V. Entri bertanggal 9 Oktober 2026 yang membahas Qwen-Image-2.1-Turbo mencatat checkpoint itu sendiri dan catatan bahwa API Pro dan Turbo sudah aktif di Alibaba Cloud Model Studio. Tidak ada daftar framework hari-nol untuk Turbo, dan setiap entri framework dalam daftar berita masih merujuk ke model dasar. Checkpoint Turbo dimuat melalui kelas pipeline yang sudah ada; dukungan untuk jadwal tersimpannya adalah satu bagian baru, dan itu hadir melalui sumber Diffusers, bukan rilis bertag.

Yang kedua adalah lisensi. Turbo membawa Qwen Research License Agreement, persis seperti yang dilakukan model dasarnya. Akselerasi tidak disertai pengecualian komersial, tingkatan terpisah, atau pelonggaran ketentuan — pembatasan nonkomersial berlaku pada fine-tune sama seperti pada model dasarnya. Metadata repositori itu sendiri dan file lisensi di samping bobot-bobotnya adalah buktinya; bagian lisensi pada kartu itu hanyalah satu kalimat yang menunjuk ke perjanjian yang sama. Jika alasan delapan langkah penting bagimu adalah karena itu membuat model cukup murah untuk dimasukkan ke dalam produk, lisensi jelas menghalangi, dan pihak vendor — bukan repositori ini — yang harus mempertanggungjawabkannya.

Endpoint yang dihosting, dan di mana OrcaRouter cocok

OrcaRouter tidak merutekan Qwen-Image-2.1-Turbo maupun Qwen-Image-2.1. Keduanya tidak ada dalam katalog kami, dan tidak ada apa pun di sini yang merupakan tawaran untuk melayani salah satu dari keduanya. Jika Anda menginginkannya, rute Anda adalah API yang dihosting vendor sendiri, beberapa platform pihak ketiga, atau bobot dengan build Diffusers yang cukup baru untuk menangani jadwal sampling tersimpan dari checkpoint Turbo.

Di mana OrcaRouter relevan untuk perbandingan khusus ini adalah pertukaran yang Anda lakukan ketika menghosting sendiri checkpoint tidak lagi menjadi jawaban yang tepat. Berpindah dari model open-weights yang Anda jalankan sendiri ke endpoint gambar terkelola bukan sekadar perubahan model — ini adalah perubahan mode kegagalan. Proses lokal gagal dengan cara yang dapat Anda lihat; endpoint terkelola gagal dengan cara yang bergantung pada penyedia mana yang menjawab, dan pada apa yang terjadi ketika salah satunya menurun di tengah permintaan. OrcaRouter menempatkan 200+ model di belakang satu endpoint yang kompatibel dengan OpenAI dan meneruskan harga daftar penyedia tanpa markup, sehingga penurunan harga vendor muncul di sisi kami pada hari yang sama alih-alih menunggu proses penetapan harga ulang. Selain itu, ini menambahkan failover otomatis antar penyedia, DSL perutean untuk menentukan model dan penyedia mana yang boleh digunakan suatu permintaan, dan fusi model untuk menggabungkan beberapa model ke dalam satu panggilan. Model gambar yang kami hadapi adalah keluarga OpenAI GPT-Image, tingkatan Google Imagen 4 termasuk varian fast dan ultra, endpoint pratinjau gambar Google Gemini, dan endpoint gambar xAI Grok Imagine.

Secara konkret: jika Anda memilih di antara dua checkpoint Qwen, itu adalah keputusan self-hosting, dan alasan untuk memilih salah satu daripada yang lain adalah perilaku jadwal dan jumlah langkah. Jika yang sebenarnya Anda butuhkan adalah gambar di produksi tanpa memiliki GPU sendiri, itu adalah keputusan yang berada dalam posisi kami untuk bantu, dan itu keputusan yang berbeda.

Versi singkatnya

• Pilih Qwen-Image-2.1 jika Anda menginginkan checkpoint yang perilaku sampling-nya sesuai dengan dokumentasinya, jika Anda perlu memvariasikan jumlah langkah atau mengeksplorasi jadwal, atau jika Anda menginginkan rilis yang hadir dengan dukungan day-zero di Diffusers, ComfyUI, vLLM-Omni, SGLang, dan LightX2V.

• Pilih Qwen-Image-2.1-Turbo jika Anda menginginkan arsitektur yang sama dan kemampuan yang sama dengan lintasan yang jauh lebih pendek, serta bersedia menganggap delapan langkah sebagai nilai tetap, dan memasang Diffusers dari sumber untuk memuatnya.

Checklist card headed 'Identical across both checkpoints' listing the 7B visual generation component, 32 single-stream DiT layers, seven resolution presets, text-to-image and image editing, the QwenImage21Pipeline load path, and the non-commercial Qwen Research Licence, with a chip reading 'The only differences are the sampling schedule and the step count'

• Lisensi yang sama berlaku dalam kedua kasus, dan jangan harapkan angka kualitas yang dipublikasikan untuk checkpoint yang dipercepat untuk dibandingkan dengan basis. Pengurangan langkah itu nyata dan terdokumentasi. Berapa besar kualitas gambar yang dikorbankan tidak terdokumentasi di mana pun, dan sebanyak apa pun Anda membaca kedua kartu itu tidak akan memberi tahu Anda — jawaban itu hanya ada di perangkat keras Anda sendiri, terhadap prompt Anda sendiri.