
Qwen-Image 2.1 vs Qwen-Image 3.0: niższy numer to nowszy model
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Zacznijmy od rzeczy, na której wszyscy się potykają. Qwen-Image 2.1 jest nowszy niż Qwen-Image 3.0. Dostawca wydał Qwen-Image 3.0 21 lipca 2026 r. i wprowadził go do ogólnej dostępności 5 sierpnia. Wydał Qwen-Image 2.1 20 września 2026 r. — siedem tygodni później i o jedną wersję minor niższą. Numeracja nie jest sekwencją; to dwie różne linie produktowe dzielące nazwę, a najprzydatniejszym faktem o każdej z nich jest to, że zajmują przeciwstawne stanowiska w kwestii, która decyduje o tym, czy można na nich budować. Qwen-Image 3.0 jest zamknięty i hostowany, bez wag, bez licencji i bez raportu technicznego. Qwen-Image 2.1 ma otwarte wagi, można go pobrać już dziś, na licencji badawczej, która pozwala wyłącznie na użycie niekomercyjne.
Dwa produkty, które przypadkowo mają tę samą nazwę.
Rodzina Qwen-Image zajęła już trzy odrębne stanowiska licencyjne w ciągu czternastu miesięcy, a ich przedstawienie usuwa większość zamieszania:
• Qwen-Image 1.0 i 2.0 — otwarte wagi na licencji Apache 2.0 w Hugging Face i ModelScope, raporty techniczne w dniu premiery, możliwość hostowania na własnym serwerze, dostrajania i kwantyzacji.
• Qwen-Image 3.0 — zamknięty. Brak wag, brak określonej licencji, brak karty modelu, brak raportu technicznego, brak opublikowanej tabeli wyników. Dostępny wyłącznie poprzez hostowane API, w wersjach Pro i Standard.
• Qwen-Image 2.1 — znowu otwarte wagi, ale na podstawie Umowy licencyjnej Qwen Research z dnia 20 września 2026 r., która przyznaje prawa „WYŁĄCZNIE DO CELÓW NIEKOMERCYJNYCH” i kieruje użycie komercyjne do odrębnie negocjowanej licencji.
Czytaj to jako wzorzec, a nie os czasu, a kształt stanie się jasny: Alibaba nie traktuje już „open” jako wartości binarnej. Qwen-Image 2.1 nie jest ani permisywnym wydaniem, jakim były 1.0 i 2.0, ani zamkniętym wydaniem, jakim było 3.0. To trzecia pozycja — wagi, które możesz przejrzeć, uruchomić i modyfikować, z komercyjną bramką przykręconą z przodu.
Czym tak naprawdę jest każdy model
• Qwen-Image 2.1 — ujednolicony model do generowania obrazów z tekstu i edycji obrazów, z 7B parametrami w komponencie generowania wizualnego, zbudowany jako 32-warstwowy jednoprzepływowy DiT. Obok niego znajdują się enkoder tekstu Qwen3-VL 8B oraz 64-kanałowy VAE RGBA przy 16× kompresji przestrzennej; pełne pobranie to około 33 GB, przy czym enkoder tekstu odpowiada za ponad połowę. Uwaga blokowo-przyczynowa z maską przyczynową na poziomie tokenów dla tekstu i dwukierunkową maską na poziomie fragmentów dla generowania obrazu, a także ponowne wykorzystanie pamięci podręcznej KV prefiksu do edycji wielu obrazów. Natywnie 2K, domyślnie 2048×2048 przy 40 krokach, z siedmioma presetami proporcji obrazu.
• Qwen-Image 3.0 — zamknięty model hostowany w edycjach Pro i Standard, oferujący generowanie i edycję obrazów przez jedno API. Materiały premierowe Alibaby twierdzą, że prompty mogą mieć do około 4500 tokenów, czytelny tekst do około 10 pikseli oraz obsługę 12 języków w ponad 20 czcionkach, z wynikiem do 2048×2048 i maksymalnie sześcioma obrazami na wywołanie. Nie opublikowano liczby parametrów; szeroko powtarzana wartość ~20B MMDiT jest podawana, a nie potwierdzona.
Różnica architektoniczna, która ma największe znaczenie w praktyce, to nie rozmiar — ale to, gdzie model działa i co można z nim zrobić. Qwen-Image 2.1 pojawia się jako pliki, które można sprawdzić, skwantyzować, dostroić na prywatnych danych i uruchomić na własnym sprzęcie, z pull requestem wspierającym SGLang, zmergowanym trzy dni przed tym, jak wagi w ogóle się pojawiły. Qwen-Image 3.0 pojawia się jako endpoint. Nie można go skwantyzować, nie można go dostroić i nie można go uruchomić nigdzie indziej niż tam, gdzie uruchamia go Alibaba.
Edycja to miejsce, w którym oba rozchodzą się najmocniej
Oba modele realizują generowanie i edycję w jednym systemie, więc interesujące porównanie dotyczy szczegółów edycji — a tutaj nowszy, mniejszy model jest na papierze tym bardziej zdolnym.
• Obrazy referencyjne — Qwen-Image 2.1 obsługuje do 10 referencji wejściowych. Dokumentacja wersji Pro Qwen-Image 3.0 opisuje obsługę od 1 do 3 obrazów wejściowych.
• Lokalna kontrola edycji — Qwen-Image 2.1 obsługuje okręgi, namalowane adnotacje oraz osobną maskę dostarczaną jako własne dane wejściowe, dzięki czemu oryginalny obraz pozostaje bez naniesionych oznaczeń. Udokumentowana ścieżka edycji w Qwen-Image 3.0 obejmuje lokalne przepisywanie, rozszerzanie treści, transfer stylu i generowanie z wielu kątów kamery, bez opublikowanego przepływu pracy opartego na masce.
• Przezroczystość — Qwen-Image 2.1 natywnie generuje i edytuje obrazy RGBA, edytuje tekst w warstwie przezroczystej oraz wyodrębnia obiekt ze zdjęcia RGB do warstwy przezroczystej. Zapowiedź Qwen-Image 3.0 nie zawiera żadnej wzmianki o przezroczystości.
• Przepisywanie promptów — Qwen-Image 2.1 dostarcza dwa dedykowane checkpointy do przepisywania, oba będące dostrojonymi modelami Qwen3.5-VL 9B — jeden do generowania obrazów na podstawie tekstu, a drugi do edycji — wraz z opublikowanym kodem przepisywania i promptem systemowym. Obsługa promptów w Qwen-Image 3.0 to czarna skrzynka ukryta za API.
• Ekosystem — Qwen-Image 2.1 ma wsparcie od dnia zerowego w Diffusers, ComfyUI, vLLM-Omni, SGLang i LightX2V, a także ścieżki AMD ROCm i FlagOS. Qwen-Image 3.0 ma API.
Ta ostatnia linia nie jest retorycznym ozdobnikiem. Dla zespołu, którego pipeline działa w ComfyUI lub którego stos wnioskowania to vLLM, różnica między modelem ze scaloną klasą pipeline a modelem z endpointem HTTP to różnica między zadaniem integracyjnym a przepisaniem.

Cena i to, czego cena nie obejmuje
Qwen-Image 3.0 ma jedyną opublikowaną cenę z tych dwóch: w chmurze dostawcy Pro jest wyceniane na około 0,04 USD za obraz, a Standard na około 0,03 USD, przy czym ceny detaliczne na rynku krajowym zaczynają się od około ¥0,18. Są to wartości z premiery i nie zostały poddane niezależnemu audytowi. Qwen-Image 2.1 nie ma w ogóle opublikowanej stawki za hosting — można go pobrać, a koszt zależy wyłącznie od tego, ile kosztuje czas Twojego własnego GPU.
Te dwie pozycje nie są porównywalne, a udawanie, że jest inaczej, to najczęstszy błąd w tym zestawieniu. Cena za obraz obejmuje model, infrastrukturę serwującą, skalowanie i czyjś czas działania. Pobranie wag nie obejmuje niczego z tego. Właściwe pytanie nie brzmi, która liczba jest mniejsza; brzmi ono, czy masz zdolności operacyjne do uruchomienia stosu modelu o rozmiarze 33 GB i czy licencja po tańszej stronie pozwala na to, co planujesz z nim zrobić.
Co przywraca licencję do centrum porównania, gdzie jej miejsce. Warunki Qwen-Image 3.0 nie są opublikowane, co samo w sobie jest problemem w pracy regulowanej lub agencyjnej — nie ma dokumentu, na który można się powołać. Warunki Qwen-Image 2.1 są opublikowane i mówią: niekomercyjne. Między niejasną licencją a wyraźnie restrykcyjną, ta wyraźnie restrykcyjna jest łatwiejsza do zaplanowania, bo przynajmniej wiesz, jaką rozmowę trzeba przeprowadzić.

Po który z nich powinieneś sięgnąć
• Potrzebujesz grafiki produkcyjnej z dużą ilością tekstu i chcesz, żeby ktoś inny się tym zajmował — Qwen-Image 3.0 jest właściwym wyborem, z zastrzeżeniem, że jego kluczowe dane dotyczące renderowania tekstu to twierdzenia dostawcy, a istniejące niezależne testy wskazują, że tekst małą czcionką wciąż bywa zniekształcany w niektórych przypadkach.
• Musisz samodzielnie uruchomić model, dostroić go lub przechowywać dane na własnym sprzęcie — Qwen-Image 2.1 jest jedyną opcją z tych dwóch, a licencja badawcza jest ceną wejścia.
• Potrzebujesz przezroczystych zasobów, wyciętych produktów lub więcej niż trzech obrazów referencyjnych — Qwen-Image 2.1, według opublikowanych specyfikacji, jest silniejszym narzędziem, a pod względem liczby obrazów referencyjnych przewaga jest wyraźna.
• Potrzebujesz praw komercyjnych i permisywnego licencjonowania — żadne z nich nie dotyczy Twojego modelu. Qwen-Image 3.0 nie ma w ogóle opublikowanych warunków, a Qwen-Image 2.1 wymaga wynegocjowanej licencji komercyjnej. Wydania Apache-2.0 w tej rodzinie to wcześniejsze Qwen-Image 1.0 i 2.0.
Ten ostatni wiersz wart jest dłuższego zastanowienia, bo opisuje kurczący się zbiór. Udzielona już licencja nie zmienia się wstecz, więc wydania Qwen-Image na licencji Apache-2.0 pozostają użyteczne na pierwotnych warunkach. Jeśli jednak planujesz komercyjny pipeline do obrazów w oparciu o założenie, że najnowszy Qwen-Image będzie objęty licencją permisywną, ostatnie trzy wydania są dowodem przeciw temu założeniu.
Uruchamianie któregokolwiek z nich bez stawiania na tym całego pipeline'u
Oba te modele są, z różnych powodów, trudne do umieszczenia dziś za ścieżką produkcyjną — jeden z powodu licencji, drugi z powodu czarnej skrzynki i niepublikowanej liczby parametrów. To dokładnie ta sytuacja, do której stworzona jest warstwa routingu. OrcaRouter udostępnia ponad 200 modeli za jednym punktem końcowym zgodnym z OpenAI, w cenie katalogowej dostawcy bez marży, z automatycznym przełączaniem awaryjnym między dostawcami oraz DSL routingu, który pozwala połączyć kilka modeli w jedno wywołanie, dzięki czemu nowy lub niewygodny model może stać obok sprawdzonego, a nie przed nim. Fuzja modeli posuwa ten pomysł dalej: uruchamia panel modeli razem i pozwala porównać je na własnych promptach, a nie na wykresie z premiery.
Ani Qwen-Image 2.1, ani Qwen-Image 3.0 nie należą do modeli, które obecnie trasujemy, i ten artykuł nie będzie sugerować inaczej. Modele obrazowe, które rzeczywiście trasujemy — linia GPT-Image od OpenAI, warianty Imagen 4 i podglądy obrazów Gemini od Google oraz punkt końcowy obrazów Grok Imagine od xAI — to z nich zostałaby faktycznie zbudowana ścieżka przełączenia awaryjnego, podczas gdy samodzielnie oceniasz parę Qwen na własnych warunkach.
To, na co warto patrzeć, jest węższe, niż się wydaje. Alibaba udowodniła już, że w tym samym kwartale, w ramach tej samej rodziny, dostarczy otwarte wagi, zamknięte modele hostowane oraz pliki do pobrania na licencji badawczej. Kolejne wydanie nie powie ci, który wzorzec zwyciężył. Powie ci to plik licencji.

