Wygenerowana karta hero do artykułu „Qwen-Image 2.1 vs FLUX 3”, przedstawiająca dwukolumnową grafikę porównawczą z ikoną kłódki pomiędzy dwiema zaokrąglonymi kartami modeli oznaczonymi „Qwen-Image 2.1” i „FLUX 3” oraz wstęgę z napisem „Jeden możesz uruchomić, ale nie możesz sprzedać; drugi mógłbyś sprzedać, ale nie możesz go uruchomić”.
Guides & Insights

Qwen-Image 2.1 vs FLUX 3: Dwa modele obrazów, których nie da się tak do końca użyć

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Qwen-Image 2.1 i FLUX 3 to dwa najciekawsze wydania modeli obrazowych drugiej połowy 2026 roku i żadnego z nich nie da się ot tak użyć. Qwen-Image 2.1, który zespół Qwen-Image udostępnił jako open source 20 września 2026 roku, to ujednolicony model o 7 mld parametrów do generowania i edycji, który możesz pobrać jeszcze dziś po południu, ale nie możesz go legalnie wykorzystać w produkcie komercyjnym. FLUX 3, którego premierę Black Forest Labs ogłosiło 23 lipca 2026 roku, to ujednolicony multimodalny model bazowy, którego warstwa obrazowa — ta część, którą faktycznie chciałoby się porównać — dwa miesiące po ogłoszeniu wciąż nie ma publicznego endpointu, identyfikatora modelu, ceny ani benchmarków. Porównanie nie polega więc na tym, „który jest lepszy”. Chodzi o to, które z tych dwóch przeszkód można obejść.

Dwa różne rodzaje niedostępności

Kuszące jest zakwalifikowanie obu jako „jeszcze niegotowe” i przejście dalej. To ukryłoby jedyną decyzję, która się liczy, bo oba te blokery mają przeciwne kształty.

Blokadą Qwen-Image 2.1 jest kwestia prawna — i to jedna linia w pliku, którą możesz przeczytać, zanim cokolwiek pobierzesz. Wagi są na Hugging Face i ModelScope, karta modelu jest napisana, kod inferencji opublikowany, a cztery niezależne frameworki serwujące miały scalone wsparcie przed dniem premiery lub w dniu premiery. Nic technicznego nie stoi między tobą a działającym modelem. Między tobą a wdrożeniem go stoi Qwen Research License Agreement z dnia 20 września 2026 r., którego klauzula udzielania praw zezwala na użycie „WYŁĄCZNIE DO CELÓW NIEKOMERCYJNYCH” i kieruje każdego, kto chce uzyskać prawa komercyjne, by zwrócił się o odrębną licencję do dostawcy.

Blokada FLUX 3 ma charakter fizyczny. Nie ma endpointu obrazowego do wywołania, identyfikatora modelu do przekazania ani karty cenowej, względem której można planować budżet. Własna strona BFL z cennikiem obejmuje poziomy FLUX 3 Video oraz starszą linię obrazów FLUX.2; nie obejmuje poziomu obrazowego FLUX 3, ponieważ nie ma czego wyceniać. Dostęp do modelu obrazowego odbywa się wyłącznie na zgłoszenie, a nie przez przycisk rozpoczęcia: własna strona FLUX 3 firmy BFL wymienia poziom obrazowy jako „wkrótce”, a to poziom action nosi etykietę wczesnego dostępu.

Więc jeden z nich to model, który możesz uruchomić dziś wieczorem, ale nie możesz go sprzedać, a drugi to model, który mógłbyś sprzedać, ale nie możesz go uruchomić. To, który z nich jest dla ciebie bardziej przydatny, zależy w całości od tego, po której stronie tego zdania stoisz — wewnętrzny zespół badawczy i komercyjny zespół produktowy powinny dojść do przeciwnych wniosków z tych samych dwóch faktów.

Odczyt wymiar po wymiarze

Status — wagi, licencja i karta modelu Qwen-Image 2.1 opublikowane 20 września 2026 r., wraz z wpisem na blogu dostawcy tego samego dnia. FLUX 3 ogłoszono 23 lipca 2026 r.; wdrożono wyłącznie warstwę wideo, która osiągnęła ogólną dostępność 4 sierpnia 2026 r.

Co faktycznie możesz dziś wywołać — Qwen-Image 2.1 działa lokalnie przez Diffusers, ComfyUI, vLLM-Omni, SGLang i LightX2V albo przez własne API dostawcy oraz kilka platform firm trzecich. FLUX 3 określa swoją warstwę obrazową jako „wkrótce", bez żadnego endpointu do wywołania, i oferuje płatny, ogólnie dostępny endpoint wideo.

Architektura — Qwen-Image 2.1 to 32-warstwowy DiT z pojedynczym strumieniem, mający 7B parametrów w komponencie generowania wizualnego, enkoder tekstowy Qwen3-VL 8B oraz VAE RGBA z 64 kanałami przy 16× kompresji przestrzennej. FLUX 3 to pojedynczy, zunifikowany model przepływu trenowany łącznie na obrazie, wideo i dźwięku, zbudowany na samonadzorowanej metodzie dopasowywania przepływu, którą BFL nazywa Self-Flow, z poziomem predykcji działań opracowanym równolegle z Mimic Robotics.

Natywna przezroczystość — Qwen-Image 2.1 generuje i edytuje obrazy RGBA, edytuje tekst wewnątrz przezroczystych warstw oraz wyodrębnia obiekty ze zdjęć RGB do przezroczystych warstw, włączając w to możliwość, którą Alibaba udostępniła osobno jako Qwen-Image-Layered w grudniu 2025 r. BFL nie opublikowało żadnych deklaracji dotyczących przezroczystości dla FLUX 3 Image.

Obrazy referencyjne — Qwen-Image 2.1 przyjmuje do 10 referencji wejściowych, z lokalną edycją za pomocą okręgu, namalowanej adnotacji lub osobnej maski. Dla FLUX 3 Image nie opublikowano żadnych danych liczbowych.

Rozdzielczość — Qwen-Image 2.1 jest natywnie 2K, domyślnie 2048×2048 przy 40 krokach wnioskowania, z siedmioma udokumentowanymi ustawieniami proporcji. Rozdzielczości FLUX 3 Image opisano w ogłoszeniu jedynie jako „szerokie”, nie podając żadnych szczegółów.

Cena — brak opublikowanej ceny dla żadnego z nich. Qwen-Image 2.1 nie ma w momencie pisania podanej stawki za hosting; FLUX 3 Image nie ma cennika, ponieważ nie ma endpointu. Jedyne ceny FLUX 3, jakie istnieją, dotyczą wideo: 0,06 USD za sekundę w wersji draft, 0,17 USD za sekundę w HD i 0,29 USD za sekundę w FHD.

Licencja — Umowa licencyjna Qwen Research, tylko do użytku niekomercyjnego, użycie komercyjne na osobny wniosek. Warunki licencji FLUX 3 dla poziomu obrazowego nie zostały w ogóle opublikowane.

Jedna asymetria zasługuje na osobną linijkę, bo jest pułapką w tym zestawieniu. FLUX 3 rzeczywiście ma opublikowane wyniki benchmarków — wewnętrzne Elo na poziomie 1135 dla generowania wideo z tekstu oraz wskaźniki zwycięstw w preferencjach ludzi raportowane wobec modeli Grok Imagine Video, Seedance 2.0, Gemini Omni Flash, Runway Gen-4.5 i Luma Ray 3.2. Każda z tych liczb opisuje kategorię wideo. Żadna z nich nie przekłada się na generowanie obrazów, a samo BFL nie opublikowało żadnych benchmarków ani wskaźników zwycięstw dla obrazów. Cytowanie Elo FLUX 3 dla wideo jako dowodu na jakość generowania obrazów przez FLUX 3 to najłatwiejszy błąd, jaki można popełnić w tym porównaniu.

A generated two-column comparison scoreboard titled 'Qwen-Image 2.1 vs FLUX 3 — the scoreboard'. Left column 'Qwen-Image 2.1': rows reading Status: released 20 Sep 2026; Callable today: local, five frameworks; Architecture: 7B, 32-layer DiT; Transparency: native RGBA; Reference images: up to 10; Price: none published; Licence: research, non-commercial. Right column 'FLUX 3': rows reading Status: announced 23 Jul 2026; Callable today: video only; Architecture: unified flow model; Transparency: none claimed; Reference images: not published; Price: video $0.06-$0.29 per second; Licence: not published for image. Footer reads 'Qwen-Image 2.1 figures per the vendor model card, unaudited; FLUX 3 image tier has published no figures at all.'

Co każda strona może faktycznie pokazać

Zestaw dowody obok siebie, a asymetria odwraca się w porównaniu z poprzednią sekcją.

FLUX 3 ma produkt, który został wydany, wyceniony i jest ogólnie dostępny — tylko nie ten z tytułu tego artykułu. FLUX 3 Video generuje klipy o długości do 20 sekund ze zsynchronizowanym dźwiękiem w jednym przebiegu, obsługuje text-to-video, image-to-video, video-to-video, keyframe-to-video i generatywną kontynuację, a testują go już Canva, Burda, Magnific, Krea i Picsart. To prawdziwy, wdrożony system z prawdziwą listą klientów. Warstwa obrazowa to część, która nie nadeszła, a pierwotna zapowiedź BFL, że pojawi się „w nadchodzących tygodniach”, przekroczyła już dwa pełne miesiące bez publicznego endpointu.

Qwen-Image 2.1 ma odwrotny profil. Twierdzenia o jego jakości pochodzą z firmowego wykresu porównawczego Qwen-Image-Bench, a żadna strona trzecia ich nie odtworzyła. Ale sam produkt jest w twoich rękach: 33 GB wag, układ repozytorium w stylu Apache z plikiem licencyjnym, który uczciwie mówi, że służy wyłącznie do badań, oraz ścieżka serwowania od dnia zerowego w pięciu frameworkach. Jest też jedna recenzja z wczesnego dostępu z praktycznymi testami, od testera, który uruchomił finalne wagi przez interfejs ModelScope Studio i zgłosił około 10–15 sekund dla zamiany tekstu na obraz i 18–23 sekund dla edycji, mocne działanie presetów aparatu i przypisywania ról wielu postaci oraz spójność wielu referencji zaczynającą się pogarszać od około trzech obrazów wejściowych. Jeden recenzent, brak pomiaru czasu, brak opublikowanego zestawu promptów. Kierunkowo przydatne, formalnie niezweryfikowane.

Uczciwe podsumowanie dowodów: Qwen-Image 2.1 ma uruchamialny model i brak niezależnych danych o jakości; FLUX 3 Image ma twierdzenia dostawcy oraz ani uruchamialnego modelu, ani żadnych danych obrazowych. Jeśli Twoje pytanie brzmi: „na którym z nich powinienem oprzeć pipeline?”, odpowiedź na dziś brzmi: na żadnym, a powód jest inny.

A screenshot of the Black Forest Labs FLUX 3 model page, captured September 20 2026, showing the FLUX 3 family overview with the Video tier marked as generally available and the Image tier listed as coming soon, alongside the FLUX 3 Video per-second pricing tiers.

Gdzie właściwie jest obejście

Dla zespołu komercyjnego blokada dotycząca Qwen-Image 2.1 ma kształt, wokół którego można planować. Licencja jest jednoznaczna, kontakt w sprawie licencji komercyjnej jest wskazany w repozytorium, a model jest na tyle mały — 7B w komponencie generującym — że koszt jego oceny na własnym sprzęcie mierzy się w jednym popołudniu, a nie w kwartale. Najpierw oceń, potem negocjuj, a w międzyczasie nie umieszczaj wersji badawczej na żadnej ścieżce mającej kontakt z klientem. To zwykły problem zakupowy.

Blokada FLUX 3 Image nie jest problemem z pozyskaniem, ponieważ nie ma czego pozyskiwać. Możesz dołączyć do kolejki wczesnego dostępu i wyglądać pojawienia się endpointu — i to są wszystkie dostępne działania. Jeśli potrzebujesz dziś generowania obrazów z rodziny FLUX w środowisku produkcyjnym, opcje możliwe do wywołania to starsze linie FLUX.2 oraz FLUX Pro/Dev, które mają ustaloną cenę i są dostępne — i które należą do innej generacji modelu niż ta, o której mówi ten artykuł.

Dla zespołu, który chce przetestować oba kandydatów, nie zobowiązując żadnego z nich do ścieżki produkcyjnej, to jest właśnie przypadek, dla którego istnieje warstwa routingu. OrcaRouter umieszcza ponad 200 modeli za jednym punktem końcowym zgodnym z OpenAI, w cenie katalogowej dostawcy i bez marży, z automatycznym przełączaniem awaryjnym między dostawcami, więc niesprawdzony lub niewydany model znajduje się za trasą obok czegoś, czemu już ufasz, zamiast zastępować to — a ponieważ cena katalogowa jest przekazywana dalej, każda zmiana ceny dostawcy dla modelu obsługiwanego przez routing obowiązuje tego samego dnia. Ani Qwen-Image 2.1, ani FLUX 3 Image nie można routować w chwili pisania tego tekstu i nie zamierzamy udawać, że jest inaczej; to, co routujemy, to linia modeli obrazowych wokół nich, w tym rodzina GPT-Image od OpenAI, warianty Imagen 4 od Google i podglądy obrazów Gemini oraz punkt końcowy obrazów Grok Imagine od xAI. To są modele, które mogą udźwignąć obciążenie, podczas gdy te dwa się klarują.

Jeszcze jedna rzecz warta obserwacji, szczególnie po stronie Qwen. Alibaba wydała Qwen-Image 1.0 i 2.0 jako otwarte wagi na licencji Apache-2.0, następnie wydała Qwen-Image 3.0 w lipcu 2026 jako w pełni zamknięty model hostowany, bez wag, bez licencji i bez raportu technicznego, a potem wydała Qwen-Image 2.1 we wrześniu jako otwarte wagi na licencji wyłącznie do badań. Kierunek zmian nie jest linią prostą, a warunki licencji przy następnym wydaniu są prawdziwie otwartym pytaniem, a nie bezpiecznym założeniem w którąkolwiek stronę.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 20 2026, showing the 2026/09/20 date, the headline 'Compact, Efficient, and Unified Image Creation', the 'Now open weights' hero banner, GitHub, Hugging Face and ModelScope buttons, and the 7B parameter figure.

Werdykt, taki jaki jest

Jeśli jesteś badaczem lub zespołem ds. wewnętrznej oceny, Qwen-Image 2.1 jest obecnie zdecydowanie bardziej przydatny z tych dwóch — można go pobrać, ma dokumentację, jest wspierany przez frameworki i uczciwie informuje o swoich warunkach. Jeśli jesteś zespołem komercyjnym, oba są zablokowane, ale te blokady nie są równoważne: jedna to umowa, w sprawie której można rozpocząć rozmowę, druga to produkt, który jeszcze nie istnieje.

Jeśli w tym miesiącu musisz wdrożyć generowanie obrazów, żadne z nich nie jest odpowiedzią, a użytecznym pytaniem jest, który z modeli, które możesz wywołać, zbliży cię najbardziej. To ćwiczenie z zakresu benchmarkingu i warto je przeprowadzić na własnych promptach, a nie na czyimkolwiek wykresie z premiery — łącznie z wykresem dostawcy i z tym tutaj.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie