
Qwen-Image 2.1 vs LLaDA-Image-Turbo: Dwa otwarte modele obrazowe, dwie bardzo różne licencje
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Dwa modele obrazu z otwartymi wagami pojawiły się w ciągu tych samych trzech tygodni. Zespół Qwen-Image opublikował Qwen-Image 2.1 20 września 2026 r. — wagi, plik licencji, kartę modelu i wpis na blogu, wszystko tego samego dnia, z niemal zerowym wyprzedzeniem. Szesnaście dni wcześniej, 4 września 2026 r., inclusionAI (laboratorium badawcze Ant Group) opublikowało LLaDA-Image-Turbo bez wpisu o premierze, bez komunikatu prasowego i bez jakiejkolwiek zapowiedzi. Oba można dziś pobrać. Żaden z nich nie ma ani jednego niezależnego wyniku benchmarku. A różnica, która faktycznie zdecyduje o tym, którego z nich możesz użyć, nie tkwi w karcie żadnego z modeli — tkwi w dokumentacji licencyjnej. Qwen-Image 2.1 jest udostępniany na licencji badawczej, która całkowicie zabrania użytku komercyjnego. LLaDA-Image-Turbo jest udostępniany bez zadeklarowanej licencji w żadnym ze swoich repozytoriów.
Kwestia licencji jest na pierwszym miejscu, ponieważ jako jedyna ma jasną odpowiedź.
Zacznij tutaj, ponieważ wszystko inne w tym porównaniu jest tymczasowe, a to nie.
• Qwen-Image 2.1jest udostępniany na podstawie umowy licencyjnej Qwen Research License Agreement z dnia 20 września 2026 r., która przyznaje prawa „WYŁĄCZNIE DO CELÓW NIEKOMERCYJNYCH” i stanowi, że użycie komercyjne wymaga odrębnej licencji, o którą należy zwrócić się do dostawcy. To istotna zmiana w stosunku do wcześniejszej serii Qwen-Image, która była dostarczana na licencji Apache 2.0. To jednoznaczne: możesz go czytać, oceniać, poddawać testom porównawczym i pisać o nim. Nie możesz umieścić go w produkcie.
• LLaDA-Image-Turbonie deklaruje żadnej licencji. Ani permisywnej, ani restrykcyjnej, ani zastępczej. Repozytorium bez licencji nie jest „wolne do użytku” w żadnym sensie prawnym — domyślnie ma wszelkie prawa zastrzeżone, co jest stanowiskiem surowszym niż licencja badawcza Qwena, a nie łagodniejszym. Jeśli planujesz na tym budować, to pytanie do laboratorium, a nie do README.
Warto powiedzieć to wprost: ironia polega na tym, że model, który pojawił się z formalną, restrykcyjną licencją, jest tym, na którym możesz dziś opierać swoje plany, ponieważ dokładnie wiesz, na czym stoisz. Model bez licencji jest tym, na którym nie możesz opierać planów.

Czym właściwie są te dwa modele
Pomijając kwestie licencyjne, to dwa naprawdę różne projekty, zbudowane z różnych powodów.
• Architektura — Qwen-Image 2.1 to 32-warstwowy jednostrumieniowy transformer dyfuzyjny z 7 mld parametrów w komponencie generowania wizualnego, enkoderem tekstowym Qwen3-VL 8B i 64-kanałowym VAE RGBA przy 16-krotnej kompresji przestrzennej, około 33 GB w całym pakiecie. LLaDA-Image-Turbo to zunifikowany model generowania i edycji o 6 mld parametrów — jeden zestaw wag wykonujący oba zadania, a nie model bazowy plus osobna ścieżka edycji.
• Kroki wnioskowania — Qwen-Image 2.1 domyślnie używa rozdzielczości 2048×2048 przy 40 krokach z dopasowywaniem przepływu i dyskretnym harmonogramem Eulera. LLaDA-Image-Turbo jest destylowany przez Twin-DMD do 2–4 kroków, przy czym zalecane są 4, i działa przy skali guidance 1,0 w porównaniu ze skalą 5,0 w modelu Base.
• Opcje precyzji — Qwen-Image 2.1 udostępnia obsługę kwantyzacji FP8 poprzez swoją ścieżkę vLLM-Omni. LLaDA-Image-Turbo dostarcza zarówno checkpointy BF16, jak i FP8 jako osobne pliki do pobrania.
• Warunkowanie referencyjne — Qwen-Image 2.1 przyjmuje do 10 obrazów referencyjnych, obsługuje edycje lokalne za pomocą okręgu, rysowanej adnotacji lub osobnej maski i generuje natywne RGBA z edycją warstwy przezroczystej. Karta LLaDA-Image-Turbo nie podaje limitu liczby obrazów referencyjnych.
• Uwaga — Qwen-Image 2.1 stosuje uwagę o przyczynowości blokowej: maskę przyczynową na poziomie tokenów dla tekstu oraz dwukierunkową maskę na poziomie bloków dla generowania obrazu, z ponownym wykorzystaniem pamięci podręcznej KV prefiksu, gdy punkt kontrolny zawiera causal_condition: true. Karta LLaDA-Image-Turbo nie opisuje swojego schematu maskowania z takim samym poziomem szczegółowości.
• Licencja — wyłącznie do celów badawczych i wyraźna, w przeciwieństwie do niezadeklarowanej.
Zwróć uwagę, co oznaczają liczby kroków w połączeniu z liczbami parametrów. Qwen-Image 2.1 to większy model uruchamiany przez dziesięć razy więcej kroków; LLaDA-Image-Turbo to mniejszy model zdestylowany do garstki kroków. To przeciwstawne zakłady co do tego, gdzie leży koszt generowania obrazu, a właściwa odpowiedź zależy w całości od tego, czy wąskim gardłem są dla ciebie sekundy GPU na obraz, czy górna granica tego, jak obraz może wyglądać.
Ekonomia szybkości: 40 kroków kontra 4
Nazwa Turbo naprawdę robi tu robotę. Destylacja Twin-DMD zwija trajektorię dyfuzji w kilka dużych skoków, dlatego LLaDA-Image-Turbo można uruchomić w 4 krokach, podczas gdy jego model Base oczekuje konwencjonalnego harmonogramu. Przy guidance 1.0 pomija też classifier-free guidance, które normalnie podwaja liczbę przebiegów w przód na krok — więc efektywna różnica jest większa, niż sugeruje samo 40 kontra 4.
Co to daje, to przepustowość i przewidywalność. Model 6B przy czterech krokach to coś, co zmieści się na pojedynczej karcie konsumenckiej i generuje wstępny obraz wystarczająco szybko, by zmieścić się w pętli interaktywnej. Qwen-Image 2.1 przy 40 krokach i rozmiarze 2048×2048 to konfiguracja nastawiona przede wszystkim na jakość; zalecenie samej karty modelu dla ograniczonego sprzętu to odciążenie CPU przez pipe.enable_model_cpu_offload(), co jest raczej furtką niż rozwiązaniem.
Przeciwwagą jest to, że destylacja to kompresja możliwości, a nic tutaj nie zostało zmierzone przez nikogo spoza tych dwóch laboratoriów. Jedynym niezależnym punktem danych, jaki istnieje dla któregokolwiek z tych modeli, jest praktyczna recenzja wczesnego dostępu Qwen-Image 2.1 od testera z programu Qwen Ambassador, który uruchomił końcowe wagi przez interfejs ModelScope Studio i zgłosił około 10–15 sekund dla generowania obrazu z tekstu oraz 18–23 sekund dla edycji. To jeden recenzent, na interfejsie wczesnego dostępu, bez pokazanego timera — użyteczny sygnał, a nie benchmark. LLaDA-Image-Turbo nie ma publicznie żadnego porównywalnego raportu z praktycznych testów.

Edycja to obszar, w którym oba projekty różnią się najbardziej.
Oba modele potrafią generować obrazy na podstawie tekstu i je edytować, ale robią to w różny sposób, a różnica ujawnia się raczej w samej maszynerii niż w wynikach.
Qwen-Image 2.1 traktuje podążanie za instrukcjami jako osobny, możliwy do zbadania komponent. Obok modelu obrazowego wydanie zawiera dwa checkpointy przepisywania promptów — Qwen/Qwen-Image-2.1-PE-T2I oraz Qwen/Qwen-Image-2.1-PE-I2I, z których każdy to dostrojony Qwen3.5-VL 9B o rozmiarze około 18,8 GB — które biorą niejasną instrukcję i przepisują ją na jednoznaczne polecenie, zanim zobaczy je model dyfuzyjny. Wariant I2I zawsze ma obraz wejściowy, więc zawsze jest zadaniem edycji, a nigdy generowaniem od zera. Co kluczowe, rewriter jest dostarczany z plikiem system_prompt.txt, który możesz odczytać i nadpisać, i jest on wyjątkowo jednoznaczny w kwestii języka: język opisu podąża za twoją instrukcją, natomiast o języku tekstu namalowanego na obrazie decyduje ścisły porządek priorytetów, który zachowuje istniejący język etykiet obrazu wejściowego, nawet gdy podajesz prompt w innym języku.
To niewielki fragment inżynierii o dużym zasięgu rażenia. Jeśli tworzysz grafiki produktowe dla rynku, na którym tekst na opakowaniu ma znaczenie, „przepisywacz zachowuje język istniejącej etykiety” i „przepisywacz pomocnie tłumaczy wszystko na angielski” to różnica między użytecznym zasobem a odrzuconym — a ponieważ znajduje się w prompcie systemowym, a nie w hostowanej czarnej skrzynce, możesz zrobić jego diff i go zmienić.
LLaDA-Image-Turbo przyjmuje odwrotny kompromis: jeden model 6B, jeden zestaw wag, generowanie i edycja współdzielą wszystko. Mniej ruchomych części, mniej do konfiguracji i nic do sprawdzania ani nadpisywania. Karta modelu podaje wyniki Qwen-Image-Bench: 53,53 dla języka angielskiego i 53,38 dla chińskiego, z twierdzeniem o statusie open-source-SOTA — raportowane przez dostawcę, nieodtworzone, i zwróć uwagę, że benchmark, w którym wygrywa, nosi nazwę modelu, z którym w domyśle konkuruje.
Na czym właściwie byś je uruchomił
Wsparcie ekosystemu w dniu premiery to najmniej efektowna część wydania i jednocześnie ta, która decyduje, czy spędzisz nad nim popołudnie, czy cały weekend.
• Qwen-Image 2.1 został szeroko udostępniony: QwenImage21Pipeline zmergowano do Diffusers w dniu zero; natywne wsparcie ComfyUI z szablonami przepływów pracy do generowania obrazów z tekstu i edycji obrazów; vLLM-Omni z wykonywaniem krok po kroku, buforowaniem prefiksu KV, dekodowaniem CUDA Graph, kwantyzacją FP8 oraz równoległością tensor/Ulysses; natywny pull request dodający wsparcie SGLang, który został scalony 17 września — trzy dni przed wagami — obejmujący DiT, RGBA VAE, warunkowanie Qwen3-VL i wejście z wieloma referencjami, zweryfikowany na H200, B200, RTX PRO 6000, RTX 5090 i RTX 4090; oraz akcelerację od dnia zero poprzez LightX2V z AMD Radeon poprzez ROCm i wsparcie wielu układów poprzez FlagOS.
• LLaDA-Image-Turbo otrzymał wsparcie ComfyUI 7 września 2026 r., trzy dni po wagach, a także dystrybucję w Diffusers i Safetensors. To realna ścieżka do jego uruchomienia, ale jest ona uboższa, i nie ma odpowiednika prac nad serwowaniem przed wydaniem, na które można by wskazać.
Przedpremierowy pull request do SGLang jest wskazówką dotyczącą Qwen-Image 2.1. Wsparcie frameworka, które pojawia się przed wagami, oznacza, że ktoś testował ścieżkę serwowania na checkpointcie, a nie pisał jej później na podstawie karty modelu.

Hostowana ścieżka, którą przechowujesz razem z eksperymentem
Żaden z tych modeli nie daje się w momencie pisania tego tekstu trasować przez OrcaRouter i ten artykuł nie zamierza sugerować inaczej — oba są propozycjami do samodzielnego hostowania, jeden na licencji, która wyklucza użycie produkcyjne, a drugi w ogóle bez licencji. Dla zespołu, który je ocenia, liczy się to, że ocena nie musi leżeć na ścieżce krytycznej.
OrcaRouter udostępnia ponad 200 modeli za jednym endpointem zgodnym z OpenAI, w cenie katalogowej dostawcy i bez marży, z automatycznym przełączaniem awaryjnym między dostawcami oraz DSL routingu, który pozwala łączyć kilka modeli w jedno wywołanie. Praktyczny wymiar tego w kontekście tej decyzji to trasa, w której model, któremu już ufasz, obsługuje ruch produkcyjny, a obok niego testowany jest checkpoint hostowany samodzielnie — a ponieważ cena katalogowa jest przekazywana dalej, a nie zawyżana, zmiana ceny dostawcy dowolnego modelu w trasie jest u nas widoczna tego samego dnia, zamiast czekania na aneks do umowy. Modele obrazu, które dziś kierujemy, to rodzina GPT-Image od OpenAI, poziomy Imagen 4 i podglądy obrazów Gemini od Google oraz endpoint obrazów Grok Imagine od xAI. Jeśli zamierzasz spędzić tydzień na stawianiu 33 GB transformera dyfuzyjnego, żeby sprawdzić, czy przebije model hostowany, model hostowany jest grupą kontrolną, a warto mieć grupę kontrolną już na kluczu.
Co zmieniłoby to porównanie
Trzy rzeczy, w kolejności od tego, jak bardzo by miały znaczenie.
Po pierwsze, niezależny wynik benchmarku dla któregokolwiek z modeli. Żaden go nie ma, a dopóki się to nie zmieni, wszelkie twierdzenia o jakości po obu stronach to laboratorium oceniające własne zadanie domowe. Po drugie, licencja: permisywny wariant Qwen-Image 2.1 uczyniłby go oczywistym domyślnym wyborem do otwartej pracy nad obrazami przy 7B, a jakakolwiek zadeklarowana licencja w LLaDA-Image-Turbo przynajmniej pozwoliłaby go zaplanować. Po trzecie, testerzy wczesnego dostępu z programu ModelScope Qwen z 17 września mieli opublikować próbki lub recenzje do 29 września — czyli osiem dni od teraz. To moment, w którym przestaje to być porównanie dwóch kart modeli, a zaczyna być prawdziwym porównaniem. Do tego czasu uczciwe podsumowanie wygląda tak: Qwen-Image 2.1 to model sprawiający wrażenie bardziej zdolnego, którego nie można komercjalizować, LLaDA-Image-Turbo to szybszy z nich, którego nie da się w ogóle użyć bez rozmowy, a plik licencji to jedyna część obu wydań, która jest w pełni ustalona.
