Karta hero dla porównania między Qwen-Image 2.1, modelem z otwartymi wagami bez niezależnego wyniku, a MAI-Image-2.5-Pro, liderem według pomiarów areny edycji obrazów Artificial Analysis z wynikiem Elo 1 272
Guides & Insights

Qwen-Image 2.1 vs MAI-Image-2.5-Pro: 6100 ślepych głosów przeciwko zeru

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Jeden z tych dwóch modeli został oceniony na podstawie około 6100 porównań wykonanych metodą ślepą przez ludzi. Drugiego nie ocenił nikt spoza jego własnego laboratorium. MAI-Image-2.5-Pro, flagowy model graficzny firmy Microsoft, zajmuje pierwsze miejsce w rankingu Artificial Analysis image editing arena z wynikiem Elo 1272 — to rezultat z największą liczbą głosów w tej kategorii. Qwen-Image 2.1, którego zespół Qwen-Image udostępnił na zasadach open source 20 września 2026 roku, nie ma żadnego niezależnego wyniku i nie będzie go miał, dopóki wystarczająco wiele osób nie uruchomi go publicznie, by wygenerować głosy. To właśnie ta luka jest właściwym tematem tego porównania, ponieważ to jedyna różnica między tymi dwoma modelami, która nie jest twierdzeniem dostawcy. Wszystko inne — architektura, rozdzielczość, cena — jest możliwe do poznania, ale nieudowodnione, a oba modele są na papierze tak zbliżone, że to luka pomiarowa powinna decydować o wyborze.

Co głosy faktycznie mówią, a czego nie

Artificial Analysis przeprowadza ślepe porównania parami: dwa modele otrzymują ten sam prompt, głosujący wybierają lepsze wyjście, a z wyników wynika Elo. Nie jest to doskonałe narzędzie, ale to najbliższa rzecz, jaką ta kategoria ma do wspólnej tablicy wyników, a wielkość próby ma znaczenie tak samo jak liczba.

MAI-Image-2.5-Pro — edycja obrazów #1 przy Elo 1 272 na podstawie około 6 100 porównań. W przypadku tekstu na obraz znajduje się na #7 z Elo 1 292, za GPT Image 2 (high) z 1 369, Reve 2.1 z 1 322, Nano Banana 2 z 1 320, GPT Image 1.5 (high) z 1 310 i MAI-Image-2.5 z 1 304.

Qwen-Image 2.1 — brak wpisu na żadnej z list. To nie niski wynik; to brak wyniku. W chwili pisania wydanie ma jeden dzień.

Kształt tych liczb wart jest uważnego odczytania, ponieważ nie jest to kształt, który sugeruje marketing. Model Microsoftu jest naprawdę pierwszy w edycji i naprawdę siódmy w generowaniu. To konkretna, możliwa do obrony pozycja — specjalista od edycji, który przewodzi swojej kategorii — i to coś innego niż bycie najlepszym modelem obrazowym, którym nie jest. Tymczasem model, który pokonuje go w generowaniu obrazów z tekstu, to GPT Image 2 (high), który również nie jest najnowszym modelem OpenAI w tej dziedzinie. Niezależne rankingi nagradzają model, który był mierzony najczęściej, a w tym zestawieniu jest nim jednoznacznie ten od Microsoftu.

Jedyna specyfikacja, w której otwarty model wygrywa bezapelacyjnie

Między tymi dwoma istnieje konkretna, niesubiektywna różnica, a jest nią rozdzielczość.

Qwen-Image 2.1generuje natywnie w 2K, przy czym 2048×2048 to udokumentowany domyślny rozmiar przy 40 krokach wnioskowania, z siedmioma ustawieniami wstępnymi proporcji obrazu oraz wyjściem RGBA z prawdziwym kanałem alfa, a nie maską.

MAI-Image-2.5-Pro ogranicza wyjście do 1 048 576 pikseli — około jednego megapiksela. Jego kluczowe liczby ze specyfikacji są gdzie indziej: 32 000 tokenów wejściowych tekstu, okno kontekstowe 131 tys. i 4096 tokenów wyjściowych, co mówi o tym, ile instrukcji może przyswoić, a nie ile obrazu może wyemitować.

W przypadku większości zastosowań w mediach społecznościowych i prac produktowych limit jednego megapiksela nie jest ograniczeniem. W przypadku druku, komponowania wielkoformatowego, wszystkiego, gdzie przycięcie musi przetrwać — jest nim. To jedyny wymiar w całym porównaniu, w którym można wskazać liczbę i powiedzieć, że otwarty model ma przewagę — i zauważyć, że jest to fakt architektoniczny z karty modelu, a nie twierdzenie o jakości. Qwen-Image 2.1 będzie renderować w rozdzielczości 2048×2048, niezależnie od tego, czy wyrenderuje cokolwiek wartego obejrzenia.

Cena, i właśnie tutaj porównanie staje się niezręczne.

MAI-Image-2.5-Pro jest wyceniany jako model premium, a liczby nie pozostawiają wątpliwości: 5 USD za milion tokenów wejściowych tekstu, 8 USD za milion tokenów wejściowych obrazu i 106 USD za milion tokenów wyjściowych obrazu. Przy wyjściu o rozdzielczości 1024 pikseli przekłada się to na około 108,50 USD za tysiąc obrazów. Dla porównania to około 2,3-krotności kosztu MAI-Image-2.5 i około 5,4-krotności MAI-Image-2.5-Flash, więc Microsoft celowo podzielił własną linię na segmenty, zamiast wyceniać poziom Pro jako stopniowe ulepszenie.

Qwen-Image 2.1 nie ma ceny za hosting, ponieważ nie istnieje hostowany endpoint — to wagi do pobrania na licencji badawczej. Jego kosztem jest czas twojego GPU, a jego ograniczeniem jest to, że nie możesz legalnie sprzedawać tego, co generuje. Porównywanie 108,50 USD za tysiąc obrazów z „darmowymi wagami” to porównywanie usługi z maszyną, a uczciwa wersja tego porównania brzmi: cena rozliczana za użycie daje ci zmierzony, wspierany, komercyjnie licencjonowany model, a wagi dają ci pobranie 33 GB i plik licencji, który mówi: tylko niekomercyjnie.

Właśnie w tym miejscu warstwa routingu ma swoje uzasadnienie. OrcaRouter udostępnia ponad 200 modeli za jednym punktem końcowym zgodnym z OpenAI, w cenie katalogowej dostawcy i bez żadnej marży, z automatycznym przełączaniem awaryjnym między dostawcami — więc zespół, który chce ocenić nieprzetestowany otwarty model, nie musi w tym celu przenosić na niego środowiska produkcyjnego, a ponieważ cena katalogowa jest przekazywana dalej, każda zmiana ceny u dostawcy modelu objętego routingiem trafia na naszą stronę tego samego dnia, a nie dopiero przy kolejnym odnowieniu umowy. Ani MAI-Image-2.5-Pro, ani Qwen-Image 2.1 nie należą do modeli, które dziś routujemy, i ten tekst nie zamierza sugerować inaczej. Rodziną obrazową, którą faktycznie udostępniamy, jest rodzina GPT-Image od OpenAI, warianty Imagen 4 i podglądy obrazów Gemini od Google oraz endpoint obrazowy Grok Imagine od xAI.

Two-column scoreboard for Qwen-Image 2.1 and MAI-Image-2.5-Pro: Qwen-Image 2.1 rows read Released 20 Sept 2026 / Licence research-only, non-commercial / Editing score none / Text-to-image score none / Output 2048x2048 native, RGBA / Price self-host, no hosted endpoint; MAI-Image-2.5-Pro rows read Announced 23 July 2026 / Licence commercial, via Microsoft / Editing score AA #1, Elo 1,272, about 6,100 votes / Text-to-image score AA #7, Elo 1,292 / Output capped at 1,048,576 pixels / Price about $108.50 per 1,000 images; footer reads 'MAI figures per Artificial Analysis; Qwen-Image 2.1 has no independent score yet.'

Jakie miejsce zajmują deklaracje dostawców i ile wagi im przypisywać

Obaj dostawcy publikują liczby, których nie odtworzyła żadna strona trzecia, i należy je czytać z takim samym sceptycyzmem w obie strony.

Roszczenia Microsoftu — 96,8% dokładności renderowania tekstu w językach angielskim, chińskim, japońskim, koreańskim i hiszpańskim; o 27% lepsze trzymanie się podpowiedzi niż GPT-Image-1.5; 94% spójności postaci przy wielu obrazach; oraz do 84–89% niższy koszt GPU w określonych scenariuszach wewnętrznych Microsoftu. Na tym ostatnim trzeba się skupić: opisuje on własną konfigurację serwowania Microsoftu, a nie cokolwiek, co klient może zweryfikować.

Twierdzenia Alibaby — wpis na blogu dotyczący Qwen-Image 2.1 zawiera wykres porównawczy Qwen-Image-Bench, a podane w nim liczby pochodzą od samego dostawcy. W materiałach firm trzecich krąży również liczba opisująca model jako 20-warstwowy transformer, co stoi w sprzeczności z informacją w karcie modelu o 32-warstwowym jednonurtowym DiT; karta modelu jest źródłem pierwotnym i to właśnie wartość 32 warstw należy przyjąć.

Różnica między obiema sytuacjami nie polega na uczciwości któregokolwiek z dostawców. Polega na tym, że model Microsoftu został niezależnie zmierzony, a model Alibaby nie, więc twierdzenia Microsoftu można zweryfikować względem czegoś, a twierdzeń Alibaby nie można jeszcze zweryfikować względem niczego.

Do czego służy każdy z nich

Czytane razem, nie konkurują o to samo miejsce.

MAI-Image-2.5-Pro to narzędzie do edycji. Prowadzi w rankingu edycji przy dużej bazie głosów, przyjmuje długą instrukcję (32 tys. tokenów tekstu wejściowego, 131 tys. kontekstu), ma licencję komercyjną i jest już dostępny jako publiczna wersja zapoznawcza w Microsoft Foundry oraz MAI Playground. Jeśli Twoja praca polega na iteracyjnej korekcie obrazów i chcesz wiedzieć przed podjęciem decyzji, że to najlepsze dostępne rozwiązanie do tego zadania, oto zmierzona odpowiedź — a kosztuje około 108,50 USD za tysiąc obrazów.

Qwen-Image 2.1 to otwarty artefakt badawczy. Renderuje większe obrazy, dostarcza razem z modelem obrazu checkpoint do przepisywania promptów, który można poddać inspekcji, przyjmuje do 10 obrazów referencyjnych wraz z edycjami lokalnymi za pomocą okręgu, namalowanej adnotacji lub maski, a do tego można go pobrać bezpłatnie i nielegalne jest jego sprzedawanie. Jeśli twoja praca to ewaluacja, benchmarkowanie albo budowanie na wagach, które możesz przeczytać, jest to ciekawszy obiekt — a wykonujesz tę pracę bez tabeli wyników, która powiedziałaby ci, czy jest cokolwiek warta.

Jest też pewna asymetria czasowa, którą warto odnotować. MAI-Image-2.6 wszedł w fazę prywatnych podglądów 19 sierpnia 2026 r., co oznacza, że model na szczycie tabeli edycji jest już o jedną generację za tym, co Microsoft przygotowuje do wydania. Qwen-Image 2.1 natomiast jest na pierwszym dniu, z programem wczesnego dostępu, w którym poproszono testerów o publikację do 29 września. Obie tablice wyników w tym porównaniu będą wyglądać inaczej w ciągu miesiąca.

Screenshot of the Artificial Analysis text-to-image leaderboard captured September 9 2026, showing GPT Image 2 (high) first at Elo 1,178 with MAI-Image-2.5-Pro listed at No. 7 with Elo 1,292, and no Qwen-Image 2.1 entry anywhere on the boardScreenshot of the Qwen vendor blog page for Qwen-Image-2.1, captured in English, headlined 'Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation', dated 2026/09/20, with download links to GitHub, Hugging Face and ModelScope and the four headline improvements listed as compact and efficient, native transparency with unified creation and editing, versatile editing with up to 10 reference images, and realistic textures

Co by to rozstrzygnęło

Jedna rzecz: Qwen-Image 2.1 pojawiający się na liście rankingowej. Wszystko w tym artykule, co nie jest limitem rozdzielczości lub ceną, jest twierdzeniem jednego bądź drugiego laboratorium, a jedynym powodem, dla którego można z poważną miną polecać MAI-Image-2.5-Pro, jest to, że 6100 osób, które nie pracowały dla Microsoftu, obejrzało jego wyniki obok czegoś innego i uznało je za lepsze. To jest standard, którego model otwarty nie spełnił, i standard, któremu powinien podlegać.

Do tego czasu praktyczny wniosek jest prosty. Jeśli potrzebujesz dziś modelu do edycji, na licencji komercyjnej, z tabelą wyników za nim, odpowiedzią jest rozwiązanie Microsoftu i kosztuje około 108,50 USD za tysiąc obrazów. Jeśli chcesz się przekonać, czy model 7B o otwartych wagach z natywnym wyjściem 2K i możliwym do zbadania przepisywaczem promptów jest lepszy, musisz samodzielnie przeprowadzić pomiary — a najbardziej użyteczną rzeczą, jaką możesz zrobić z wynikiem, jest jego opublikowanie, ponieważ całej tej kategorii brakuje obecnie jednego punktu danych.