
Qwen-Image 2.1 wydane po cichu: zaglądamy do wnętrza Qwen/Qwen-Image-2.1-PE-I2I
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
20 września 2026 r. zespół Qwen-Image opublikował Qwen-Image 2.1 na Hugging Face i ModelScope — wagi, plik licencji, kartę modelu i wpis na blogu, wszystko tego samego dnia, niemal bez żadnego wyprzedzenia. Najważniejsza liczba to 7B parametrów w komponencie generowania obrazu. Część, której prawie nikt jeszcze nie otworzył, to Qwen/Qwen-Image-2.1-PE-I2I, jeden z dwóch checkpointów do przepisywania promptów, które trafiły razem z modelem obrazowym. To nie jest model obrazowy. To element, który decyduje, co oznacza twoja instrukcja, zanim model obrazowy w ogóle ją zobaczy — a w tym wydaniu to właśnie ten komponent po cichu ustawia język, w którym wracają twoje wyniki.
Co właściwie oznacza tutaj „cicho wypuszczone”
Dobór słów ma znaczenie, ponieważ łatwo przesadzić w którąkolwiek stronę. Qwen-Image 2.1 nie wyciekł i nie pojawił się bez zapowiedzi. Istnieje wpis na blogu dostawcy z 20 września 2026 r., repozytorium GitHub z sekcją aktualności z tego samego dnia oraz aktywne pobieranie wag. Nie miał jednak rozbiegu: jedynym sygnałem z wyprzedzeniem była notatka z 17 września oferująca 50 miejsc wczesnego dostępu za pośrednictwem ModelScope, a wybrani testerzy mieli opublikować próbkę lub recenzję do 29 września. Trzy dni później wagi były publicznie dostępne. Żadnego wystąpienia głównego, żadnego embarga na benchmarki, żadnego cyklu prasowego.
To szczególny rodzaj wydania i warto nazwać go precyzyjnie. Dostawca je ogłosił. Dostawca go nie promował. Dla każdego, kto zastanawia się, czy na nim budować, praktyczna konsekwencja jest taka, że nie ma jeszcze niezależnej oceny, na której można by się oprzeć — tylko materiały samego dostawcy i to, co w ciągu najbliższego tygodnia opublikują testerzy z wczesnym dostępem. Wszelkie twierdzenia o jakości w tym artykule traktuj jako pochodzące z karty modelu i wpisu na blogu, dopóki ktoś spoza Alibaby nie uruchomi go publicznie.
Dlaczego punkt kontrolny PE-I2I jest tym interesującym
Wydanie Qwen-Image 2.1 zawiera trzy elementy do pobrania, a nie jeden:
• Qwen/Qwen-Image-2.1 — sam model obrazu. 32-warstwowy jednoprzepływowy DiT z 7 mld parametrów w komponencie generowania obrazu, enkoder tekstu Qwen3-VL 8B oraz 64-kanałowy VAE RGBA z 16× kompresją przestrzenną. Łącznie około 33 GB w trzech komponentach.
• Qwen/Qwen-Image-2.1-PE-T2I — narzędzie do przepisywania promptów w generowaniu obrazów z tekstu. Dostrojony model Qwen3.5-VL 9B, około 18,8 GB.
• Qwen/Qwen-Image-2.1-PE-I2I — narzędzie do przepisywania promptów na potrzeby edycji obrazu na obraz. To także dostrojony Qwen3.5-VL 9B, również około 18,8 GB, przesłany do Hugging Face o 08:46 UTC 20 września.
"PE" oznacza wzmocnienie promptu. Wariant I2I przyjmuje niejasną instrukcję edycji oraz jeden lub więcej obrazów wejściowych i przepisuje ją na precyzyjną, jednoznaczną dyrektywę edycji dla docelowego modelu dyfuzyjnego. Opis samego repozytorium mówi wprost o kształcie danych wejściowych: obraz wejściowy jest zawsze obecny, więc zawsze jest to zadanie edycji obrazu, a nigdy tekst-na-obraz od zera. Kod przepisujący znajduje się w prompt_rewrite/ folderze, który obsługuje oba checkpointy — --task t2i lub --task edit — ze ścieżką transformers, ścieżką vLLM, serve.sh oraz client.py dla działającej usługi, a pe_core.py dla wspólnej logiki.
Oto dlaczego ma to większe znaczenie, niż się wydaje. Model obrazu nie ma pojęcia, co miałeś na myśli. Ma pojęcie o tym, co dosłownie mówi Twój prompt, ważone przez to, co zrobi z nim enkoder tekstu. Przepisywacz stojący przed nim to miejsce, w którym niejednoznaczność zostaje rozwiązana — albo zostaje rozwiązana błędnie, konsekwentnie, w każdym obrazie, który generujesz. W zunifikowanym modelu generowania i edycji z maksymalnie 10 obrazami referencyjnymi ten etap rozstrzygania ma więcej okazji do błędu niż zwykle.
To w podpowiedzi systemowej zapada decyzja o języku.
Repozytorium PE-I2I dostarcza system_prompt.txt wraz z wagami, a on jest wyjątkowo jednoznaczny w jednej kwestii: języka. Czytając go bezpośrednio, można zauważyć, że przepisywacz otrzymuje instrukcję, by podejmować dwie odrębne decyzje językowe i trzymać je osobno.
• Język opisu. Tekst, który pisze przepisywacz, aby opisać edycję, jest zgodny z językiem instrukcji użytkownika — instrukcja po chińsku, opis po chińsku; instrukcja po angielsku, opis po angielsku; instrukcja w języku japońskim, koreańskim, francuskim, tajskim lub jakimkolwiek innym otrzymuje opis w języku angielskim.
• Język renderowanego tekstu. Tekst, który faktycznie zostanie namalowany na obrazie wyjściowym, zawarty w podwójnych cudzysłowach, jest ustalany według ścisłej kolejności priorytetów: po pierwsze, jeśli użytkownik poda dokładny tekst lub język docelowy, należy zastosować to dosłownie; po drugie, jeśli obraz wejściowy już zawiera tekst, należy dopasować dominujący język tego istniejącego tekstu — nawet gdy instrukcja jest napisana w innym języku; po trzecie, jeśli w obrazie nie ma tekstu i nie podano języka, należy użyć języka samej instrukcji, a konkretnie nie wymuszać języka angielskiego.
Polecenie wzmacnia drugą regułę za pomocą rozwiązanego przykładu — obraz, który jest w większości tajski, edytowany angielską instrukcją, która nie wskazuje języka, musi renderować tekst tajski — i dodaje dwa ograniczenia: renderowany tekst musi być jednojęzyczny, a nie stanowić pary chińsko-angielskiej, oraz wizualny gatunek „spec sheet” lub „storyboard” osiąga się poprzez układ i typografię, nigdy przez przełączanie renderowanych etykiet na angielski.
To niewielki fragment inżynierii o dużym zasięgu rażenia. Jeśli generujesz wizualizacje produktów na rynek, na którym tekst na opakowaniu ma znaczenie, różnica między „narzędzie do przepisywania zachowuje istniejący język etykiety” a „narzędzie do przepisywania pomocnie tłumaczy wszystko na angielski” to różnica między użytecznym zasobem a odrzuconym. A ponieważ to zachowanie jest określone w prompcie systemowym dostarczanym w repozytorium, możesz go przeczytać, porównać i nadpisać — czego nie można powiedzieć o tym samym kroku w zamkniętym modelu hostowanym.
Co jest potwierdzone, a co nie
Precyzyjne określenie granicy w tym miejscu jest całą istotą tekstu o tym, co wiemy.
• Potwierdzone na podstawie repozytorium i karty modelu — wartość 7B / 32 warstwy dla jednostrumieniowego DiT; enkoder tekstowy Qwen3-VL 8B; 64-kanałowy VAE RGBA przy 16× kompresji przestrzennej; uwaga blokowo-przyczynowa z maską przyczynową na poziomie tokenów dla tekstu oraz dwukierunkową maską na poziomie chunków dla generowania obrazu; ponowne wykorzystanie pamięci podręcznej KV prefiksu, które — jak podaje karta modelu — aktywuje się, gdy punkt kontrolny zawiera causal_condition: true (a zawiera); dopasowanie przepływu z dyskretnym harmonogramem Eulera; natywne wyjście 2K z domyślnym 2048×2048 przy 40 krokach wnioskowania; siedem udokumentowanych ustawień proporcji; obsługa do 10 obrazów referencyjnych; edycja lokalna za pomocą okręgu, namalowanej adnotacji lub osobnej maski; oraz generowanie RGBA, edycja przezroczystej warstwy i wyodrębnianie obiektu ze zdjęć RGB.
• Potwierdzone w kwestii licencji, i to jest ta ostra krawędź — wydanie objęte jest Umową Licencyjną Qwen Research, datowaną na 20 września 2026 r., która przyznaje prawa „WYŁĄCZNIE DO CELÓW NIEKOMERCYJNYCH" i stwierdza, że użycie komercyjne wymaga odrębnej licencji, o którą trzeba wystąpić do dostawcy. To istotna zmiana względem wcześniejszej linii Qwen-Image, która była wydana na licencji Apache 2.0. Przeczytaj plik licencji, zanim zbudujesz na tym produkt, a nie po fakcie.
• Niepotwierdzone — nie istnieją jeszcze niezależne wyniki testów porównawczych. Wpis na blogu odwołuje się do wykresu porównawczego Qwen-Image-Bench, ale zawarte w nim liczby pochodzą od samego dostawcy i w momencie pisania nie zostały odtworzone przez żadną stronę trzecią. Nie opublikowano ceny hostowanego endpointu dla Qwen-Image 2.1 ani nie podano warunków licencji komercyjnej. Nie wiadomo też jeszcze, czy pojawi się wariant objęty liberalną licencją.
Jedynym istniejącym niezależnym punktem danych jest praktyczna recenzja z wczesnego dostępu od testera, który miał dostęp w ramach programu Qwen Ambassador i przepuścił finalne wagi wydania przez interfejs ModelScope Studio. W recenzji tej podano czasy generowania wynoszące około 10–15 sekund dla tekstu na obraz i 18–23 sekund dla edycji, dobre wyniki w przypadku presetów pozycji kamery i przypisywania ról wielu postaci oraz jeden konkretny tryb awarii, o którym warto wiedzieć: spójność wielu referencji pogarszała się począwszy od około trzech obrazów wejściowych, a umiejscowienie kucyka z boku zapadało się do kucyka pośrodku przy ujęciach z profilu. To jeden recenzent, na interfejsie wczesnego dostępu, bez pokazywanego timera. To użyteczny sygnał. To nie jest benchmark.

Wsparcie dla frameworków od dnia zerowego, co jest cichą dobrą wiadomością
To, gdzie model pojawia się w dniu premiery, mówi ci więcej o tym, czy faktycznie możesz z niego korzystać, niż karta modelu, a Qwen-Image 2.1 pojawił się szeroko:
• Diffusers — QwenImage21Pipeline został scalony w dniu zerowym, a repozytorium modelu nosi diffusers:QwenImage21Pipeline tag.
• ComfyUI — natywne wsparcie już od dnia zerowego, z szablonami przepływów pracy do generowania obrazów z tekstu i edycji obrazów, a także oddzielnym repozytorium wag zgodnym z Comfy.
• vLLM-Omni — wykonanie krokowe, buforowanie KV prefiksu, dekodowanie z grafem CUDA, kwantyzacja FP8 oraz równoległość tensorowa/Ulysses.
• SGLang — pull request dodający natywne wsparcie został scalony 17 września, trzy dni przed wagami, obejmujący DiT, VAE RGBA, warunkowanie Qwen3-VL, wiele obrazów referencyjnych oraz wejście/wyjście RGBA, zweryfikowany na H200, B200, RTX PRO 6000, RTX 5090 i RTX 4090.
• LightX2V — akceleracja od dnia zerowego, a także AMD Radeon przez ROCm i obsługa wielu układów dzięki FlagOS.
Przedpremierowy pull request do SGLang zdradza wszystko. Wsparcie frameworka, które pojawia się przed wagami, oznacza, że ścieżka serwowania była testowana na checkpointcie, a nie napisana później na podstawie karty modelu. W przypadku komponentu 7B z towarzyszącym mu enkoderem tekstu o rozmiarze 17,5 GB to różnica między weekendem yak-shavingu a jednym popołudniem.
W przypadku GPU o ograniczonych zasobach karta modelu zaleca odciążenie na CPU — pipe.enable_model_cpu_offload() — co jest standardowym wyjściem awaryjnym, a nie rozwiązaniem. W pobieranych 33 GB dominuje enkoder tekstu, a nie DiT; sam transformer dyfuzyjny to mniejsza połowa pakietu, wynosząca około 14 GB.

Praktyczna lektura
Jeśli chcesz dziś wypróbować Qwen-Image 2.1, szczera odpowiedź jest taka, że możesz to zrobić lokalnie, na licencji badawczej, bez niezależnych benchmarków i bez praw komercyjnych. To rozsądny kompromis w przypadku ewaluacji, a zły w przypadku potoku produkcyjnego — a różnicę między tymi dwoma przypadkami rozstrzyga dokładnie plik licencji.
Dla zespołów testujących modele obrazu, które nie chcą wiązać ścieżki produkcyjnej z kilkudniowym checkpointem, warstwa routingu jest miejscem, w którym to ryzyko zostaje ograniczone. OrcaRouter udostępnia ponad 200 modeli za jednym punktem końcowym zgodnym z OpenAI, w cenie katalogowej dostawcy i z zerową marżą, z automatycznym przełączaniem awaryjnym między dostawcami, dzięki czemu niesprawdzony model może znaleźć się za jedną trasą obok modelu, któremu już ufasz, zamiast go zastępować — a ponieważ cena katalogowa jest przekazywana dalej, obniżka ceny wprowadzona przez dostawcę dowolnego routowanego modelu obowiązuje tego samego dnia, zamiast czekać na zmianę umowy. Qwen-Image 2.1 nie należy do modeli, które routujemy w momencie pisania tego tekstu, i ten artykuł nie zamierza sugerować inaczej. Routujemy natomiast otaczającą linię modeli obrazu — rodzinę GPT-Image od OpenAI, poziomy Imagen 4 od Google i podglądy obrazów Gemini oraz punkt końcowy obrazów Grok Imagine od xAI — i to właśnie stamtąd pochodziłaby ścieżka przełączania awaryjnego, gdy oceniasz nowego gracza na własnym sprzęcie.
Otwarte pytanie to takie, na które repozytorium nie potrafi odpowiedzieć. Alibaba wypuściła 7B model do generowania obrazów z otwartymi wagami na licencji wyłącznie do celów badawczych, w tym samym roku, w którym wypuściła Qwen-Image 3.0 jako zamknięty model hostowany, bez żadnych wag. Dwie premiery, dwa przeciwstawne zakłady, cztery miesiące odstępu. Który z tych dwóch kształtów przyjmie następny model Qwen do generowania obrazów — i czy licencja badawcza kiedykolwiek zmieni się w coś, czego może użyć biznes — to warto obserwować. Wagi są teraz na Hugging Face, a każdy może sam przeczytać plik licencji.

