Wygenerowana karta główna z nagłówkiem Qwen-Image-2.1 vs GPT-Image-2.5, przedstawiająca kartę oznaczoną Qwen-Image-2.1 z ikoną pobierania i tekstem 33 GB wag obok karty oznaczonej GPT-Image-2.5 z ikoną licznika i tekstem rozliczane za tokeny, z podpisem: jedną pobierasz, drugą rozliczasz.
Guides & Insights

Qwen-Image-2.1 vs GPT-Image-2.5: Różnica to jedna liczba, i to nie jakość

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Postaw Qwen-Image-2.1 i GPT-Image-2.5obok siebie pod względem specyfikacji, a wyglądają jak rodzeństwo: oba to zunifikowane modele obrazów do generowania i edycji, oba dają wyjście z przezroczystym tłem, oba ukazały się w ciągu ostatnich pięciu tygodni, oba potrafią tworzyć nieruchome obrazy klasy 2K. Różnica, która rozstrzyga o wyborze między nimi, to jedna liczba — i nie jest to wynik benchmarku. Qwen-Image-2.1 można bezpłatnie pobrać, ale nie da się go sprzedać. GPT-Image-2.5 nie da się pobrać, ale bez trudu można go sprzedać. Wszystko inne — architektura, opóźnienia, implementacja przezroczystości — jest tego konsekwencją. Qwen-Image-2.1 został udostępniony jako open source 20 września 2026 r.; GPT-Image-2.5 ogłoszono 8 września 2026 r. wraz z już działającymi modelami API.

Dwa sposoby na zwiększenie przejrzystości, w odstępie miesiąca

To, że oba modele uzyskały przejrzyste dane wyjściowe w odstępie kilku tygodni od siebie, jest zbiegiem okoliczności wartym zrozumienia, ponieważ te dwie implementacje nie są równoważne.

Qwen-Image-2.1 umieszcza kanał alfa wewnątrz modelu. Odszumia w 64-kanałowej przestrzeni utajonej RGBA z 16× kompresją przestrzenną, więc kanał alfa jest pełnoprawnym składnikiem tego, co generuje sampler. Nie ma etapu segmentacji ani przebiegu matowania. Obok tego występuje nietypowy dodatek: ponieważ model może na podstawie promptu zdecydować, czy wygenerować RGB, czy obraz z kanałem alfa, może też wyodrębnić obiekt ze zwykłego zdjęcia i zwrócić przezroczystą warstwę zamiast binarnej maski.

GPT-Image-2.5 obiera drogę parametrów. API OpenAI przyjmuje ustawienie background o wartości auto, opaque lub transparent, a model reaguje odpowiednio. To przełącznik możliwości na hostowanym endpointcie, a nie właściwość przestrzeni ukrytej, i ma tę zaletę, że nie trzeba o tym myśleć: ustawiasz flagę, dostajesz wycięcie, idziesz dalej. Kompromis polega na tym, że dostajesz to, co daje endpoint, w rozdzielczości i po koszcie, które ustala endpoint.

To, który z nich jest lepszy, pozostaje naprawdę nierozstrzygnięte. W momencie pisania nie istniało publiczne porównanie krawędzi alfa Qwen-Image-2.1 z dedykowanym modelem do mattingu, a jedynym opublikowanym testem po stronie Qwen jest test funkcjonalny — przezroczysty plik wyjściowy PNG przeszedł pomyślnie, kanał alfa został zachowany w pełnym zakresie 0–255, RGBA PSNR wyniósł 60,69 dB w pojedynczej próbce. To sprawdzenie poprawności, a nie werdykt o jakości. Mówi tylko, że kanał jest prawdziwy.

Co tak naprawdę możesz zmierzyć

Parametry — komponent generujący Qwen-Image-2.1 to 7-miliardowy, 32-warstwowy jednonurtowy transformator dyfuzyjny, połączony z 8-miliardowym enkoderem tekstu Qwen3-VL; łącznie około 33 GB wag, z czego na DiT przypada około 14 GB. OpenAI nie publikuje liczby parametrów dla GPT-Image-2.5.
Rozdzielczość — Qwen-Image-2.1 generuje natywnie obrazy do 2048×2048 przy 40 krokach wnioskowania, z siedmioma presetami proporcji. GPT-Image-2.5 przyjmuje rozmiary do 3840×2160 i 2160×3840, przy czym każdy bok jest ograniczony do 3840 px i wymagane są wielokrotności 16.
Obrazy referencyjne — Qwen-Image-2.1 przyjmuje ich do 10 na potrzeby kompozycji wielu obiektów i wirtualnej przymierzalni. Modele obrazowe OpenAI przyjmują dane referencyjne do edycji, ale praktyczny limit i zachowanie wierności różnią się w zależności od modelu i poziomu jakości.
Opóźnienie — SGLang-Diffusion podaje 2,748 s dla generacji 1024×1024 przy 40 krokach na pojedynczym B200 oraz 4,74 s na 24-gigabajtowym RTX 4090 z jądrami Cache-DiT i INT8, tylko na etapie odszumiania. OpenAI podaje, że wariant Flare modelu GPT-Image-2.5 charakteryzuje się nawet o 50% niższym opóźnieniem niż GPT-Image-2, a jeden z partnerów wdrożeniowych zmierzył 2–4× — dane pochodzą odpowiednio od dostawcy i od partnera, a nie z kontrolowanego porównania.
Cena — Qwen-Image-2.1 nie ma ceny hostowanej, ponieważ nie istnieje hostowany punkt końcowy; koszt to Twój własny czas pracy GPU. GPT-Image-2.5 rozliczany jest według tych samych stawek za tokeny co GPT-Image-2: 8,00 USD za 1 mln tokenów wejściowych obrazu, 30,00 USD za 1 mln tokenów wyjściowych obrazu, 5,00 USD za 1 mln tokenów wejściowych tekstu.
Licencja — Qwen-Image-2.1 jest udostępniany na podstawie Umowy Licencyjnej Qwen Research z dnia 20 września 2026 r., wyłącznie do użytku niekomercyjnego. GPT-Image-2.5 to komercyjne API z pochodzeniem C2PA i niewidocznym znakiem wodnym na wynikach.

Jeden wiersz na tej liście jest cieńszy, niż wygląda. OpenAI nie publikuje cen za obraz dla GPT-Image-2.5, a jedynie stawki za tokeny, a zużycie tokenów obrazu zmienia się wraz z rozdzielczością i poziomem jakości. Pomiary zewnętrzne wskazują zakres od około 0,0059 USD do 0,712 USD za obraz w rozdzielczościach 1K, 2K i 4K przy ustawieniach niskich, średnich i wysokich oraz proporcji 1:1 — przydatne jako rząd wielkości, a nie jako wycena. Jeśli prognozujesz, oprzyj szacunek na liczbie tokenów i własnym rozkładzie promptów, a nie na wartości na obraz zmierzonej przez kogoś innego.

A generated two-column scoreboard titled Qwen-Image-2.1 vs GPT-Image-2.5 - the scoreboard. Left column Qwen-Image-2.1 rows: Generation component 7B DiT; Transparency native RGBA; Resolution 2048 x 2048 native; Reference images up to 10; Price self-hosted GPU time; Licence non-commercial research only. Right column GPT-Image-2.5 rows: Generation component undisclosed; Transparency API parameter; Resolution up to 3840 x 2160; Reference images per the editing API; Price 8 and 30 dollars per 1M tokens; Licence commercial, C2PA and watermark. Footer: Qwen figures per the vendor model card, unaudited; OpenAI figures per the vendor API reference.

Dwa koszty, których nikt nie stawia w tej samej kolumnie

Powód, dla którego to porównanie wymyka się prostej odpowiedzi, jest taki, że oba modele rozliczają cię w różnych walutach, a kurs wymiany zależy od twojej sytuacji.

GPT-Image-2.5 rozlicza się za token, co oznacza, że licznik jest widoczny, przewidywalny i skaluje się liniowo wraz z wolumenem. To autentyczna zaleta w przypadku produktu o znanym ruchu: można wpisać go do budżetu, a obniżka ceny od dostawcy tego samego dnia zmienia Twoje koszty. To jednak także podatek od eksploracji, ponieważ dziesiąta iteracja promptu kosztuje tyle samo co pierwsza. input_fidelity czyni to jeszcze bardziej odczuwalnym, niż sugerują stawki z nagłówka — API może automatycznie zastosować wysoką wierność do danych wejściowych w postaci obrazu, co pochłania więcej tokenów wejściowych, niż wynikałoby to z pobieżnego czytania cennika, więc pętle edycji kosztują więcej niż cytowane przez ludzi stawki za obraz.

Qwen-Image-2.1 odwraca obie te właściwości. Koszt krańcowy setnego wygenerowania to prąd. To czyni go lepszym narzędziem do iteracji, do wsadowego uzupełniania danych i do wszystkiego, gdzie prompt wciąż jest odkrywany. Czego nie daje, to liczby do arkusza finansowego — płacisz za GPU niezależnie od tego, czy jest zajęte, czy bezczynne — i nie daje prawa do sprzedaży wyników. Qwen Research License Agreement zezwala na niekomercyjne badania i ocenę oraz stanowi, że wdrożenie komercyjne wymaga odrębnej licencji od Hangzhou Tongyi Laboratory Technology. Nie ma opublikowanej ceny tej licencji ani określonych warunków. To nie przypis; w przypadku komercyjnego potoku to cała decyzja.

Uruchamianie obu bez drugiej umowy

Realistyczna odpowiedź dla większości zespołów to nie „albo-albo”, lecz jedno i drugie. GPT-Image-2.5 obsługuje ścieżkę produkcyjną, w której wynik trafia do klienta, a licznik za token jest osobną pozycją. Qwen-Image-2.1 obsługuje ścieżkę eksploracji, w której potrzebujesz dwustu wariantów zdjęcia produktu z przezroczystym tłem, a żaden dostawca nie sprzeda ci takiej ilości w rozsądnej cenie.

Problem w tym, że te dwie rzeczy docierają zupełnie różnymi drogami. Jedna to klucz API. Druga to pobranie 33 GB, środowisko Python i GPU, które posiadasz. OrcaRouter obejmuje tę hostowaną połowę: ponad 200 modeli za jednym endpointem zgodnym z OpenAI, ceny katalogowe dostawców przekazywane dalej z zerową marżą, automatyczne przełączanie awaryjne między dostawcami, DSL routingu do wyrażania fallbacków oraz fuzja modeli do łączenia kilku modeli w jedno wywołanie. Precyzja w kwestii tego modelu ma znaczenie — obecnie nie routujemy GPT-Image-2.5; nasze trasy obrazów OpenAI to GPT-Image-2, GPT-Image-1.5 i GPT-Image-1-mini, wszystkie w cenie katalogowej OpenAI, a w dniu, w którym dostawca upstream doda identyfikatory gpt-image-2.5, ten sam klucz wywoła je bez zmian w kodzie. Nie routujemy też żadnego modelu Qwen-Image w żadnej wersji, więc Qwen-Image-2.1 w ogóle nie jest trasą po naszej stronie. To, co daje ci w międzyczasie cennik pass-through, to fakt, że gdy OpenAI zmieni stawkę, liczba po naszej stronie zmienia się razem z nią, a nie z opóźnieniem.

Werdykt, wyrażony jako warunek, a nie jako zwycięzca.

Jeśli wynik ma być sprzedawany, nie ma tu nawet porównania: GPT-Image-2.5 to jedyny z tych dwóch, do którego użycia masz licencję, a licznik tokenów to cena, jaką za to płacisz. Jeśli wynik służy badaniom, narzędziom wewnętrznym lub ocenie, Qwen-Image-2.1 jest mocniejszym instrumentem — natywne 2K, alfa na wyjściu samplera, dziesięć obrazów referencyjnych i zerowy koszt krańcowy po opłaceniu sprzętu. Jeśli potrzebujesz obu, uruchom oba, a licencję traktuj jako granicę, która decyduje, do którego potoku trafia dane zadanie.

Dwie rzeczy mogłyby to zmienić. Opublikowany komercyjny term sheet dla Qwen-Image-2.1 zniwelowałby lukę w wierszu licencji, która obecnie odgrywa główną rolę w tym porównaniu. A niezależny wpis w rankingu obrazów dla Qwen-Image-2.1 powiedziałby nam, czy wynik dostawcy w Qwen-Image-Bench — 60,28, przed Nano Banana 2.0 z 59,82 i GPT Image 1.5 z 59,65, pierwszy wśród modeli otwartych — broni się poza laboratorium, które go stworzyło. Żaden z nich jeszcze nie istnieje. Dopóki nie powstaną, uczciwa rekomendacja to kierować się licencją i licznikiem, a nie tablicą wyników.

A screenshot of OrcaRouter's own model page for openai/gpt-image-2, captured September 21 2026, showing the model description as OpenAI's token-billed image model reached through the Images API, the /v1/images/generations endpoint, and the published list rates of $8.00 per 1M image input tokens and $30.00 per 1M image output tokens.A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.