Wygenerowana karta hero do artykułu „Qwen-Image 2.1 vs Qwen-Image 3.0”, przedstawiająca dwie zaokrąglone karty modeli oznaczone „Qwen-Image 2.1” i „Qwen-Image 3.0” ze znacznikami dat 20 wrz 2026 i 21 lip 2026, ikonę pobierania na jednej i ikonę chmury na drugiej oraz wstążkę z napisem „Niższa liczba oznacza nowszy model”.
Guides & Insights

Qwen-Image 2.1 vs Qwen-Image 3.0: niższy numer to nowszy model

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Zacznijmy od rzeczy, na której wszyscy się potykają. Qwen-Image 2.1 jest nowszy niż Qwen-Image 3.0. Dostawca wydał Qwen-Image 3.0 21 lipca 2026 r. i wprowadził go do ogólnej dostępności 5 sierpnia. Wydał Qwen-Image 2.1 20 września 2026 r. — siedem tygodni później i o jedną wersję minor niższą. Numeracja nie jest sekwencją; to dwie różne linie produktowe dzielące nazwę, a najprzydatniejszym faktem o każdej z nich jest to, że zajmują przeciwstawne stanowiska w kwestii, która decyduje o tym, czy można na nich budować. Qwen-Image 3.0 jest zamknięty i hostowany, bez wag, bez licencji i bez raportu technicznego. Qwen-Image 2.1 ma otwarte wagi, można go pobrać już dziś, na licencji badawczej, która pozwala wyłącznie na użycie niekomercyjne.

Dwa produkty, które przypadkowo mają tę samą nazwę.

Rodzina Qwen-Image zajęła już trzy odrębne stanowiska licencyjne w ciągu czternastu miesięcy, a ich przedstawienie usuwa większość zamieszania:

Qwen-Image 1.0 i 2.0 — otwarte wagi na licencji Apache 2.0 w Hugging Face i ModelScope, raporty techniczne w dniu premiery, możliwość hostowania na własnym serwerze, dostrajania i kwantyzacji.

Qwen-Image 3.0 — zamknięty. Brak wag, brak określonej licencji, brak karty modelu, brak raportu technicznego, brak opublikowanej tabeli wyników. Dostępny wyłącznie poprzez hostowane API, w wersjach Pro i Standard.

Qwen-Image 2.1 — znowu otwarte wagi, ale na podstawie Umowy licencyjnej Qwen Research z dnia 20 września 2026 r., która przyznaje prawa „WYŁĄCZNIE DO CELÓW NIEKOMERCYJNYCH” i kieruje użycie komercyjne do odrębnie negocjowanej licencji.

Czytaj to jako wzorzec, a nie os czasu, a kształt stanie się jasny: Alibaba nie traktuje już „open” jako wartości binarnej. Qwen-Image 2.1 nie jest ani permisywnym wydaniem, jakim były 1.0 i 2.0, ani zamkniętym wydaniem, jakim było 3.0. To trzecia pozycja — wagi, które możesz przejrzeć, uruchomić i modyfikować, z komercyjną bramką przykręconą z przodu.

Czym tak naprawdę jest każdy model

Qwen-Image 2.1 — ujednolicony model do generowania obrazów z tekstu i edycji obrazów, z 7B parametrami w komponencie generowania wizualnego, zbudowany jako 32-warstwowy jednoprzepływowy DiT. Obok niego znajdują się enkoder tekstu Qwen3-VL 8B oraz 64-kanałowy VAE RGBA przy 16× kompresji przestrzennej; pełne pobranie to około 33 GB, przy czym enkoder tekstu odpowiada za ponad połowę. Uwaga blokowo-przyczynowa z maską przyczynową na poziomie tokenów dla tekstu i dwukierunkową maską na poziomie fragmentów dla generowania obrazu, a także ponowne wykorzystanie pamięci podręcznej KV prefiksu do edycji wielu obrazów. Natywnie 2K, domyślnie 2048×2048 przy 40 krokach, z siedmioma presetami proporcji obrazu.

Qwen-Image 3.0 — zamknięty model hostowany w edycjach Pro i Standard, oferujący generowanie i edycję obrazów przez jedno API. Materiały premierowe Alibaby twierdzą, że prompty mogą mieć do około 4500 tokenów, czytelny tekst do około 10 pikseli oraz obsługę 12 języków w ponad 20 czcionkach, z wynikiem do 2048×2048 i maksymalnie sześcioma obrazami na wywołanie. Nie opublikowano liczby parametrów; szeroko powtarzana wartość ~20B MMDiT jest podawana, a nie potwierdzona.

Różnica architektoniczna, która ma największe znaczenie w praktyce, to nie rozmiar — ale to, gdzie model działa i co można z nim zrobić. Qwen-Image 2.1 pojawia się jako pliki, które można sprawdzić, skwantyzować, dostroić na prywatnych danych i uruchomić na własnym sprzęcie, z pull requestem wspierającym SGLang, zmergowanym trzy dni przed tym, jak wagi w ogóle się pojawiły. Qwen-Image 3.0 pojawia się jako endpoint. Nie można go skwantyzować, nie można go dostroić i nie można go uruchomić nigdzie indziej niż tam, gdzie uruchamia go Alibaba.

Edycja to miejsce, w którym oba rozchodzą się najmocniej

Oba modele realizują generowanie i edycję w jednym systemie, więc interesujące porównanie dotyczy szczegółów edycji — a tutaj nowszy, mniejszy model jest na papierze tym bardziej zdolnym.

Obrazy referencyjne — Qwen-Image 2.1 obsługuje do 10 referencji wejściowych. Dokumentacja wersji Pro Qwen-Image 3.0 opisuje obsługę od 1 do 3 obrazów wejściowych.

Lokalna kontrola edycji — Qwen-Image 2.1 obsługuje okręgi, namalowane adnotacje oraz osobną maskę dostarczaną jako własne dane wejściowe, dzięki czemu oryginalny obraz pozostaje bez naniesionych oznaczeń. Udokumentowana ścieżka edycji w Qwen-Image 3.0 obejmuje lokalne przepisywanie, rozszerzanie treści, transfer stylu i generowanie z wielu kątów kamery, bez opublikowanego przepływu pracy opartego na masce.

Przezroczystość — Qwen-Image 2.1 natywnie generuje i edytuje obrazy RGBA, edytuje tekst w warstwie przezroczystej oraz wyodrębnia obiekt ze zdjęcia RGB do warstwy przezroczystej. Zapowiedź Qwen-Image 3.0 nie zawiera żadnej wzmianki o przezroczystości.

Przepisywanie promptów — Qwen-Image 2.1 dostarcza dwa dedykowane checkpointy do przepisywania, oba będące dostrojonymi modelami Qwen3.5-VL 9B — jeden do generowania obrazów na podstawie tekstu, a drugi do edycji — wraz z opublikowanym kodem przepisywania i promptem systemowym. Obsługa promptów w Qwen-Image 3.0 to czarna skrzynka ukryta za API.

Ekosystem — Qwen-Image 2.1 ma wsparcie od dnia zerowego w Diffusers, ComfyUI, vLLM-Omni, SGLang i LightX2V, a także ścieżki AMD ROCm i FlagOS. Qwen-Image 3.0 ma API.

Ta ostatnia linia nie jest retorycznym ozdobnikiem. Dla zespołu, którego pipeline działa w ComfyUI lub którego stos wnioskowania to vLLM, różnica między modelem ze scaloną klasą pipeline a modelem z endpointem HTTP to różnica między zadaniem integracyjnym a przepisaniem.

A generated two-column comparison scoreboard titled 'Qwen-Image 2.1 vs Qwen-Image 3.0 — the scoreboard'. Left column 'Qwen-Image 2.1': rows reading Released: 20 Sep 2026; Licence: research, non-commercial; Access: 33 GB open download; Reference images: up to 10; Transparency: native RGBA; Published price: none. Right column 'Qwen-Image 3.0': rows reading Released: 21 Jul 2026, GA 5 Aug; Licence: not published; Access: closed hosted API; Reference images: 1 to 3; Transparency: none claimed; Published price: ~$0.04 Pro, $0.03 Std. Footer reads 'Qwen-Image 2.1 specs per vendor model card, unaudited; Qwen-Image 3.0 pricing is vendor list, unaudited.'

Cena i to, czego cena nie obejmuje

Qwen-Image 3.0 ma jedyną opublikowaną cenę z tych dwóch: w chmurze dostawcy Pro jest wyceniane na około 0,04 USD za obraz, a Standard na około 0,03 USD, przy czym ceny detaliczne na rynku krajowym zaczynają się od około ¥0,18. Są to wartości z premiery i nie zostały poddane niezależnemu audytowi. Qwen-Image 2.1 nie ma w ogóle opublikowanej stawki za hosting — można go pobrać, a koszt zależy wyłącznie od tego, ile kosztuje czas Twojego własnego GPU.

Te dwie pozycje nie są porównywalne, a udawanie, że jest inaczej, to najczęstszy błąd w tym zestawieniu. Cena za obraz obejmuje model, infrastrukturę serwującą, skalowanie i czyjś czas działania. Pobranie wag nie obejmuje niczego z tego. Właściwe pytanie nie brzmi, która liczba jest mniejsza; brzmi ono, czy masz zdolności operacyjne do uruchomienia stosu modelu o rozmiarze 33 GB i czy licencja po tańszej stronie pozwala na to, co planujesz z nim zrobić.

Co przywraca licencję do centrum porównania, gdzie jej miejsce. Warunki Qwen-Image 3.0 nie są opublikowane, co samo w sobie jest problemem w pracy regulowanej lub agencyjnej — nie ma dokumentu, na który można się powołać. Warunki Qwen-Image 2.1 opublikowane i mówią: niekomercyjne. Między niejasną licencją a wyraźnie restrykcyjną, ta wyraźnie restrykcyjna jest łatwiejsza do zaplanowania, bo przynajmniej wiesz, jaką rozmowę trzeba przeprowadzić.

A screenshot of the Qwen vendor blog page for Qwen-Image 3.0, captured September 20 2026, showing the launch announcement, the Pro and Standard edition descriptions, the claimed prompt-length and text-rendering figures, and the per-image list pricing.

Po który z nich powinieneś sięgnąć

Potrzebujesz grafiki produkcyjnej z dużą ilością tekstu i chcesz, żeby ktoś inny się tym zajmował — Qwen-Image 3.0 jest właściwym wyborem, z zastrzeżeniem, że jego kluczowe dane dotyczące renderowania tekstu to twierdzenia dostawcy, a istniejące niezależne testy wskazują, że tekst małą czcionką wciąż bywa zniekształcany w niektórych przypadkach.

Musisz samodzielnie uruchomić model, dostroić go lub przechowywać dane na własnym sprzęcie — Qwen-Image 2.1 jest jedyną opcją z tych dwóch, a licencja badawcza jest ceną wejścia.

Potrzebujesz przezroczystych zasobów, wyciętych produktów lub więcej niż trzech obrazów referencyjnych — Qwen-Image 2.1, według opublikowanych specyfikacji, jest silniejszym narzędziem, a pod względem liczby obrazów referencyjnych przewaga jest wyraźna.

Potrzebujesz praw komercyjnych i permisywnego licencjonowania — żadne z nich nie dotyczy Twojego modelu. Qwen-Image 3.0 nie ma w ogóle opublikowanych warunków, a Qwen-Image 2.1 wymaga wynegocjowanej licencji komercyjnej. Wydania Apache-2.0 w tej rodzinie to wcześniejsze Qwen-Image 1.0 i 2.0.

Ten ostatni wiersz wart jest dłuższego zastanowienia, bo opisuje kurczący się zbiór. Udzielona już licencja nie zmienia się wstecz, więc wydania Qwen-Image na licencji Apache-2.0 pozostają użyteczne na pierwotnych warunkach. Jeśli jednak planujesz komercyjny pipeline do obrazów w oparciu o założenie, że najnowszy Qwen-Image będzie objęty licencją permisywną, ostatnie trzy wydania są dowodem przeciw temu założeniu.

Uruchamianie któregokolwiek z nich bez stawiania na tym całego pipeline'u

Oba te modele są, z różnych powodów, trudne do umieszczenia dziś za ścieżką produkcyjną — jeden z powodu licencji, drugi z powodu czarnej skrzynki i niepublikowanej liczby parametrów. To dokładnie ta sytuacja, do której stworzona jest warstwa routingu. OrcaRouter udostępnia ponad 200 modeli za jednym punktem końcowym zgodnym z OpenAI, w cenie katalogowej dostawcy bez marży, z automatycznym przełączaniem awaryjnym między dostawcami oraz DSL routingu, który pozwala połączyć kilka modeli w jedno wywołanie, dzięki czemu nowy lub niewygodny model może stać obok sprawdzonego, a nie przed nim. Fuzja modeli posuwa ten pomysł dalej: uruchamia panel modeli razem i pozwala porównać je na własnych promptach, a nie na wykresie z premiery.

Ani Qwen-Image 2.1, ani Qwen-Image 3.0 nie należą do modeli, które obecnie trasujemy, i ten artykuł nie będzie sugerować inaczej. Modele obrazowe, które rzeczywiście trasujemy — linia GPT-Image od OpenAI, warianty Imagen 4 i podglądy obrazów Gemini od Google oraz punkt końcowy obrazów Grok Imagine od xAI — to z nich zostałaby faktycznie zbudowana ścieżka przełączenia awaryjnego, podczas gdy samodzielnie oceniasz parę Qwen na własnych warunkach.

To, na co warto patrzeć, jest węższe, niż się wydaje. Alibaba udowodniła już, że w tym samym kwartale, w ramach tej samej rodziny, dostarczy otwarte wagi, zamknięte modele hostowane oraz pliki do pobrania na licencji badawczej. Kolejne wydanie nie powie ci, który wzorzec zwyciężył. Powie ci to plik licencji.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 20 2026, showing the 2026/09/20 date, the headline 'Compact, Efficient, and Unified Image Creation', the 'Now open weights' hero banner, GitHub, Hugging Face and ModelScope buttons, and the 7B parameter figure.