Karta tytułowa do porównania Ming-Image-0.1-Design i Qwen-Image 2.1, z podtytułem, że o wyborze decydują licencja i rachunek za sprzęt, przy czym na jednej karcie widnieje bardziej elastyczna licencja, a na drugiej bardziej restrykcyjna licencja.
Guides & Insights

Ming-Image-0.1-Design vs Qwen-Image 2.1: Licencja to prawdziwa różnica

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dwa otwarte modele obrazowe pojawiły się we wrześniu 2026 roku w odstępie trzech dni i, sądząc po karcie specyfikacji, wyglądają na ten sam zakup. Ming-Image-0.1-Design, stworzony przez zespół inclusionAI należący do Ant Group, udostępnił swoje wagi na Hugging Face 17 września na licencji MIT. Qwen-Image 2.1, od zespołu Qwen z Alibaba, pojawił się 20 września na licencji Qwen Research License Agreement. Oba generują natywne RGBA, oba deklarują wyjście 2K i oba są skierowane do tego samego nabywcy: zespołu, który chce generowania obrazów, które może samodzielnie hostować, analizować i modyfikować. Dwie rzeczy, które faktycznie je odróżniają, to te dwie, w których karta specyfikacji sprawdza się najgorzej — co prawnie wolno ci zrobić z wynikiem i ile krzemu potrzeba, by wytworzyć jeden.

To nie jest retoryczne ujęcie. Dla jednego z tych modeli licencja to twarda blokada użycia komercyjnego; dla drugiego to nie problem. A liczba parametrów, którą każdy dostawca podaje na pudełku, zaniża rozmiar pobierania trzykrotnie lub czterokrotnie. Te dwa fakty rozstrzygają o zakupie na długo przed jakimkolwiek benchmarkiem — a same benchmarki, jak się okazuje, w ogóle nie dają się porównać.

Co tak naprawdę zawiera każde repozytorium

Żaden z modeli nie jest pojedynczą siecią. Oba są potokami, a to w potoku tkwi rozmiar:

• Generator — Ming-Image-0.1-Design dostarcza transformer projektowy o 6,15 mld parametrów (12,31 GB w BF16); Qwen-Image 2.1 dostarcza jednostrumieniowy DiT o 7,1 mld parametrów z 32 warstwami, uwagą blokowo-przyczynową i nieujawnioną liczbą aktywnych parametrów (około 14,2 GB).

• Strona tekstowa — Ming-Image-0.1-Design łączy swój transformer z multimodalnym LLM o 17,01 mld parametrów (34,02 GB) oraz łącznikiem o 3,09 mld parametrów (6,17 GB); Qwen-Image 2.1 wykorzystuje enkoder tekstowy Qwen3-VL 8B (około 17,5 GB).

• Łączna liczba parametrów — 26,44 mld dla Ming-Image-0.1-Design w porównaniu z około 15–16 mld dla Qwen-Image 2.1. Należy zauważyć, że liczba w nagłówku żadnego z dostawców nie jest liczbą łączną: „6B” i „7B” opisują wyłącznie generator.

• Rozmiar repozytorium — 52,88 GB dla Ming-Image-0.1-Design (49,25 GiB z tego to wagi); około 33 GB dla Qwen-Image 2.1.

• Przezroczystość — oba modele wyprowadzają natywne RGBA bezpośrednio z modelu, a nie poprzez późniejszy etap mattingu. Ming-Image-0.1-Design używa własnego VAE RGBA; Qwen-Image 2.1 używa 64-kanałowego VAE RGBA z 16× kompresją przestrzenną.

• Domyślne generowanie — Ming-Image-0.1-Design jest zwalidowany przy 2048×2048, 12 krokach, BF16, CFG 1.0; Qwen-Image 2.1 domyślnie generuje 2048×2048 w 40 krokach z siedmioma presetami proporcji.

• Licencja — MIT dla Ming-Image-0.1-Design; Umowa licencyjna Qwen Research, niekomercyjna, dla Qwen-Image 2.1.

Etykieta „6B" robi kawał roboty

Repozytorium Ant Group nosi tytuł sugerujący model o 6 miliardach parametrów, a transformer naprawdę ma 6,15B. Ale wagi, które pobierasz, mają 49,25 GiB, repozytorium ma 52,88 GB, a konfiguracja zweryfikowana przez dostawcę — 2048×2048 w BF16 z pełnym stosem tekstowym w pamięci — jest przewidziana dla jednego GPU CUDA o 80 GiB. To nie jest błąd zaokrąglenia na karcie 48 GB; to karta, której nie możesz użyć. Akcelerator 48 GB nie pomieści tego potoku, a dwa takie też nie — bez gimnastyki z offloadem, której dostawca nie dokumentuje.

Qwen-Image 2.1 to łagodniejszy pod względem wymagań plik do pobrania, z tym zastrzeżeniem, że Alibaba nie publikuje żadnych oficjalnych danych na temat VRAM. Jedyną wskazówką na karcie modelu jest zalecenie włączenia CPU offload na słabszych kartach. To, co zmierzono od premiery, jest bardziej użyteczne niż to, co opublikowano: pipeline int8 zużywa łącznie około 16 GiB i mieści się w całości na karcie 24 GB, natomiast w przypadku pełnego przebiegu BF16 podawano wartości od około 17 GB z CPU offload do mniej więcej 40 GiB szczytowo przy 1024×1024, w zależności od tego, jak umieszczony jest enkoder tekstu. Podawane opóźnienie dla pojedynczego obrazu waha się od kilku sekund na B200 do poniżej dziesięciu na aktualnej karcie roboczej. Każdą z tych liczb traktuj jako pomiar społeczności, a nie specyfikację — różnią się one w zależności od strategii offloadu bardziej, niż same modele różnią się od siebie.

Praktyczne podsumowanie: Qwen-Image 2.1 to model klasy 3090, jeśli jesteś gotów na offload; Ming-Image-0.1-Design to model klasy centrum danych, dla którego nie ma mniejszej konfiguracji.

Licencja jest rozwidleniem drogi

To jest część, która faktycznie zatrzyma projekt, i to jest część, którą dwa wydania traktują najbardziej odmiennie.

Ming-Image-0.1-Design objęty jest licencją MIT. Wydawaj go w płatnym produkcie, dostrajaj go, redystrybuuj wagi, utrzymuj swoje zmiany w zamkniętym kodzie — nic z tego nie wymaga rozmowy z Ant Group.

Qwen-Image 2.1 nie. Obowiązuje ją Umowa licencyjna Qwen Research z dnia 20 września 2026 r., która licencjonuje wagi wyłącznie do celów badawczych i ewaluacyjnych. Komercyjne wykorzystanie wymaga odrębnej umowy z Alibaba, a cena tej umowy nie została opublikowana. Utwory pochodne i redystrybucje muszą zawierać licencję, oznaczenie „Built with Qwen” lub „Improved using Qwen” oraz informację o prawach autorskich Hangzhou Tongyi Laboratory, a „Qwen” nie może być główną nazwą modelu pochodnego. Licencja podlega prawu chińskiemu, z jurysdykcją w Hangzhou.

W dalszym uzupełnieniu samego dostawcy jest jeden punkt, który naprawdę rozjaśnia sprawę: Alibaba oświadczyła, że wygenerowane obrazy nie wchodzą w skład licencjonowanych „Materiałów”, więc zachowujesz prawa do tego, co tworzy model. Ograniczenie dotyczy wag i modelu, a nie twojego wyniku. To znaczące wyłączenie i warto je dokładnie przeczytać, ponieważ proste podsumowanie — „obrazy są twoje, model nie” — jest prawidłowe.

To także zmiana kierunku. Wcześniejsze wydania Qwen-Image, w tym oryginalny Qwen-Image oraz kompilacje 2511 i 2512, pozostają na licencji Apache 2.0 i są dozwolone komercyjnie. Zespół, który w zeszłym roku wybrał Qwen-Image ze względu na licencję i w tym miesiącu aktualizuje do 2.1, dziedziczy ograniczenie wyłącznie do badań, na które nigdy się nie zgodził. Jeśli warunkiem są permisywne warunki, Qwen-Image 2.1 nie jest nowszą wersją tego, co było — to inna umowa.

Do czego każde z nich jest stworzone

Podział licencji odzwierciedla różnicę w intencji i to właśnie ta różnica powinna decydować o wyborze, gdy obie są dla ciebie legalnymi opcjami.

Ming-Image-0.1-Design to narzędzie projektowe. Stos tekstowy istnieje po to, aby rozwinąć krótkie zlecenie w ustrukturyzowany prompt o długości 8K, a dostawca dostarcza wokół niego „skille” — Design Skill, który tworzy wizualny szkic w około 15 sekund, oraz PPT Skill nastawiony na wyniki w formie slajdów. Towarzyszące mu repozytorium, Ming-Image-0.1-Design-Layer, przyjmuje spłaszczony projekt i zwraca go jako osobne warstwy, co jest tu jedyną możliwością, której nie oferuje nic innego na otwartym polu. inclusionAI podaje, że model Layer działa około 4,3× szybciej niż otwarty model warstwowy 20B przy tym samym zadaniu (183 sekundy wobec 795) — dane zgłoszone przez dostawcę, nieodtworzone, a obiekt porównania nie został nazwany wystarczająco precyzyjnie, by można go było zweryfikować.

Qwen-Image 2.1 to generator i edytor. Jeden checkpoint obsługuje zarówno generowanie obrazu z tekstu, jak i edycję na podstawie instrukcji, przyjmuje do 10 obrazów referencyjnych do jednej edycji i obsługuje edycje lokalne, które nie zmieniają reszty kadru. Został wydany ze wsparciem już w dniu premiery w ComfyUI, Diffusers, vLLM-Omni, SGLang-Diffusion i LightX2V — czyli historia serwowania, której Ming-Image-0.1-Design jeszcze nie ma, ponieważ jego własny przewodnik po serwowaniu wskazuje na vLLM-Omni.

Odczytaj to jako rozwidlenie, a nie ranking. Jeśli zadanie brzmi „wygenerować warstwowy, edytowalny zasób projektowy na podstawie briefu”, Ming-Image-0.1-Design jest jedynym z tych dwóch, który to robi. Jeśli zadanie brzmi „wygenerować, a następnie iteracyjnie edytować na podstawie referencji”, Qwen-Image 2.1 robi to w jednym modelu, a Ming-Image-0.1-Design nie robi tego wcale.

Benchmarki nie są porównywalne, i to jest szczera odpowiedź.

Obaj dostawcy mają liczby. Żadnej z tych liczb nie można umieścić obok drugiej, a każdy artykuł, który tak robi, wymyśla wynik.

Dowodem Ming-Image-0.1-Design jest ranking Artificial Analysis: pierwsze miejsce w Text-to-Image Leaderboard filtrowanym do otwartych wag w kategorii UI/UX Design, przy Elo wynoszącym 1082, przed Ideogram 4.0 Quality z wynikiem 1052, Ideogram 4.0 z 1015, HunyuanImage 3.0 Instruct z 1005 i FLUX.2 [dev] z 1000. Dostawca podaje również wskaźniki wygranych na poziomie 67,4% w zakresie układu, 67,0% w przypadku złożonej kompozycji i 66,7% w renderowaniu tekstu oraz pierwsze miejsce w 12 metrykach w Crello. Ranking jest narzędziem strony trzeciej, co czyni Elo silniejszym z dwóch rodzajów dowodów w tym przypadku; wskaźniki wygranych i dominacja w Crello są raportowane przez dostawcę i należy je odczytywać jako twierdzenia.

Artificial Analysis Text-to-Image Leaderboard filtered to open weights on the UI/UX Design board, showing Ming-Image-0.1-Design first at Elo 1,082 above Ideogram 4.0 Quality at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and FLUX.2 dev at 1,000.

Dowodem Qwen-Image 2.1 jest Qwen-Image-Bench, benchmark zbudowany przez zespół Qwen, w którym model uzyskuje wynik 60,28 i prowadzi wśród rozwiązań open source, wyprzedzając Nano Banana 2.0 z wynikiem 59,82 oraz GPT Image 1.5 z wynikiem 59,65. Materiał źródłowy zaznacza, że benchmark został stworzony przez Qwen, a trzy najlepsze wyniki mieszczą się w granicach jednego punktu od siebie — różnica ta z zapasem mieści się w granicach szumu benchmarku, którego autor również jest w nim konkurentem.

Więc: zewnętrzne Elo na podzbiorze projektowania UI/UX kontra ogólny wynik stworzony przez dostawcę. Różne narzędzia, różne zadania, różni sędziowie. Nikt nie opublikował bezpośredniego starcia tych dwóch modeli ze sobą, a przy dostępnych dowodach nikt nie może. Użyteczna interpretacja jest wąska i warta wyraźnego powiedzenia — Ming-Image-0.1-Design ma zewnętrzne potwierdzenie konkretnie w pracy projektowej, Qwen-Image 2.1 ma zgłaszaną przez dostawcę moc w ogólnym generowaniu i edycji, a pokrycie między tymi dwoma twierdzeniami jest mniejsze, niż sugerują liczby z nagłówków.

Umieszczenie któregokolwiek z nich na urządzeniu końcowym

Żaden z tych modeli nie znajduje się dziś w katalogu OrcaRouter. Ming-Image-0.1-Design i Qwen-Image 2.1 są obecnie propozycjami self-hostingu: wagi można pobrać, a przewodniki dotyczące serwowania są prawdziwe, ale GPU stawiasz samodzielnie, a w przypadku Ming jest to GPU o pamięci 80 GiB. Wymieniamy je tutaj jako wydania open-weight, a nie jako trasy.

Zanim zainwestujesz w sprzęt, warto wiedzieć, ile kosztuje Cię to samo obciążenie w formie wywołania. Nasze modele obrazów z routingiem obejmują google/gemini-2.5-flash-image, google/gemini-3-pro-image-preview, google/gemini-3.1-flash-image-preview, trzy warianty Imagen 4.0 (fast, standard i ultra), grok/grok-imagine-image oraz rodzinę GPT-Image — openai/gpt-image-1, openai/gpt-image-1-mini, openai/gpt-image-1.5 i openai/gpt-image-2. Uruchomienie briefu projektowego na jednym z nich przez tydzień pokaże Ci — za ułamek kosztu karty 80 GiB — czy warstwowy wynik Ming-Image-0.1-Design to funkcja, której naprawdę potrzebujesz, i robi to, zanim przekonasz się, czy przeszkodą będzie licencja, czy VRAM. Kiedy już przeniesiesz model self-hostowany do ścieżki produkcyjnej, ten sam endpoint jest miejscem, w którym działa routing — jeden klucz na ponad 200 modeli, automatyczne przełączanie awaryjne między dostawcami i 0% narzutu, więc obniżka ceny od dostawcy obowiązuje u nas tego samego dnia, w którym zostanie ogłoszona.

The OrcaRouter model page for openai/gpt-image-2, one of the image models actually routable, showing the OpenAI-compatible base URL, the /v1/images/generations endpoint and per-million-token input and output pricing.

Kto powinien wybrać, które

Wybierz Ming-Image-0.1-Design, jeśli produktem końcowym jest zasób projektowy, a nie obraz: wyjście warstwowe, strukturalne rozszerzanie podpowiedzi, generowanie w formie slajdów oraz licencja, która pozwala sprzedawać wszystko, co z tym stworzysz. Zaplanuj budżet na poważną kartę i zaakceptuj, że otaczający go ekosystem usług jest uboższy niż po stronie Qwen. Jest też bardziej użyteczny z tych dwóch, jeśli musisz przedstawić klientowi liczbę, ponieważ jego najsilniejszy dowód to jedyna liczba od strony trzeciej w tym porównaniu.

Wybierz Qwen-Image 2.1, jeśli przepływ pracy polega na generowaniu, a następnie edycji, jeśli potrzebujesz warunkowania na obrazie referencyjnym lub jeśli chcesz uruchomić go na sprzęcie, który już posiadasz. Jest mniejszy, lepiej wspierany w dniu zero, a jego licencja jest odpowiednia do pracy badawczej i ewaluacyjnej, którą większość osób faktycznie wykonuje najpierw. Staje się złym wyborem w momencie, gdy wynik ma charakter komercyjny, a przegląd prawny jest realny, ponieważ jedyną drogą do licencji komercyjnej jest bezpośrednia umowa z firmą Alibaba i nie ma opublikowanej ceny, na podstawie której można planować.

Nie wybieraj jeszcze żadnego z nich, jeśli tym, czego potrzebujesz, jest generowanie obrazów w środowisku produkcyjnym w tym miesiącu. Oba te rozwiązania to wagi, a wagi są zobowiązaniem sprzętowym i prawnym, zanim staną się możliwością. Na pytanie projektowe — czy warstwowe wyjście zmienia to, co mój zespół może dostarczyć — można najpierw odpowiedzieć na hostowanym punkcie końcowym, i to ta odpowiedź powinna rozstrzygnąć, czy karta 80 GiB zostanie kupiona.

Co obejrzeć

Trzy rzeczy wpłyną na to porównanie. Czy Ming-Image-0.1-Design otrzyma ścieżkę serwowania wykraczającą poza własny przewodnik vLLM-Omni, bo właśnie to jest obecnie luka między nim a listą pięciu frameworków dostępnych od dnia zerowego w Qwen-Image 2.1. Czy Alibaba przypisze cenę do komercyjnej licencji Qwen, bo nieprzypisana cena to największa pojedyncza niewiadoma w tym zestawieniu. I czy ktokolwiek — laboratorium, niezależny ewaluator albo dostawca, który nie ma nic do stracenia — uruchomi te dwa przeciwko sobie na tych samych promptach. Dopóki to nie nastąpi, najbliższą rzeczą do uczciwego porównania nie jest żaden wynik. Jest nią linia licencji, a Ming-Image-0.1-Design wygrywa ją bezapelacyjnie.

Scoreboard comparing Ming-Image-0.1-Design and Qwen-Image 2.1 across weights release date, licence, generator size, total parameters, repository size, validated hardware, default generation, output format and headline benchmark, with a footer separating third-party from vendor-reported figures.