Główna karta tytułowa dla „Ming-Image-0.1-Design vs Qwen-Image 3.0” z podtytułem „Kto pokazuje, jak rysowany jest tekst.”, kontrastująca Ming-Image-0.1-Design (6,15 mld parametrów, licencja MIT, wagi, które możesz odczytać, opublikowana 17 września 2026) z Qwen-Image 3.0 (zamknięty model hostowany, liczba parametrów nieujawniona, brak licencji lub raportu, premiera 5 sierpnia 2026), z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Ming-Image-0.1-Design vs Qwen-Image 3.0: Kto pokazuje, jak tekst jest rysowany

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Najciekawsza rzecz w Ming-Image-0.1-Design nie znajduje się na karcie modelu. Znajduje się w commicie do frameworka wnioskowania. Gdzieś w okolicach cichego przesłania modelu do Hugging Face 17 września 2026 r. vLLM-Omni scalił zmianę zatytułowaną feat: dodaj obsługę byte5 dla Ming która podłącza enkoder glifów ByT5 do nowego ming_flash_omni pipeline'u — dedykowanego komponentu, którego całym zadaniem jest patrzenie na znaki, o których wyrenderowanie poproszono, a nie na obraz, o który poproszono. To rodzaj szczegółu, który można znaleźć tylko czytając kod, i to dokładnie ten szczegół, którego Qwen-Image 3.0 — zamknięty, hostowany model obrazowy dostawcy, wydany 21 lipca 2026 r. i wprowadzony do ogólnej dostępności 5 sierpnia — nie pozwala nikomu w ogóle odczytać. Oba modele są ukierunkowane na pracę projektową, w której czytelna typografia jest trudną częścią. Tylko jeden z nich powie ci, jak to robi.

Co każdy z nich mówi o tekście

Historia renderowania tekstu w Qwen-Image 3.0 to w całości twierdzenie premierowe i na papierze wygląda dobrze. Materiały Alibaby opisują prompty do około 4500 tokenów, czytelny tekst do około 10 pikseli, pokrycie 12 języków w ponad 20 czcionkach, wynik do 2048×2048 i do sześciu obrazów na wywołanie, udostępniane w edycjach Pro i Standard przez jedno hostowane API. Nie ma wydania wag, podanej licencji, karty modelu, raportu technicznego ani opublikowanej tabeli benchmarków, z którymi można by to wszystko zweryfikować. Szeroko powtarzana wartość ~20B parametrów MMDiT jest podawana, a nie potwierdzona.

Historia Ming-Image-0.1-Design to repozytorium. 6 154 901 056 parametrów, licencja MIT, diffusers tag potoku, wszystkie wagi w BF16 safetensors, około 71,5 GB w connector/, mllm/, mlp/, scheduler/, transformer/ i vae/. Zalecane wnioskowanie to 2048×2048 przy 12 krokach próbkowania ze skalą guidance równą 1,0 na jednym GPU CUDA o pamięci 80 GiB albo 1024 dla szybkości, z vLLM-Omni wskazanym do wdrożenia i osobnym modelem wizyjno-językowym wskazanym do ulepszania promptów. Karta opisuje go jako model typu tekst-na-obraz dla UI, infografik, plakatów i innych projektów wizualnych bogatych w tekst, z wyjściem RGBA dla przezroczystych teł.

Te dwa akapity nie są tym samym rodzajem stwierdzenia i warto powiedzieć wprost, dlaczego. Jeden to opis produktu napisany przez ludzi, którzy go sprzedają. Drugi to opis artefaktu, który każdy może pobrać i sprawdzić.

Koder glifów to część, która wyjaśnia kategorię.

Renderowanie tekstu w modelach obrazu zwykle zawodzi w konkretny sposób: model generuje coś, co wygląda jak pismo, nie będąc pismem. Kształty liter są wiarygodne, a słowo jest błędne. Przyczyna jest architektoniczna, zanim jest czymkolwiek innym — większość modeli obrazu nie ma komponentu, który widzi znaki jako znaki, więc tekst jest rekonstruowany ze statystyk wizualnych tak samo jak trawa.

Commit vLLM-Omni jest interesujący właśnie dlatego, że na to wskazuje. Dodane pliki — byte5_encoder.py, pipeline_ming.py, t5_block_mapper.py oraz procesor wejściowy etapu — opisują ścieżkę, w której enkoder bajtowy ByT5 odczytuje tekst, który powinien pojawić się na obrazie, słownik tokenizatora jest rozszerzany o znaczniki czcionki i koloru, a wynikowe cechy są dołączane wzdłuż wymiaru sekwencji, przy czym strona negatywna otrzymuje zera. Ten ostatni szczegół jest oznaką, że to prawdziwa decyzja projektowa, a nie zwykła infrastruktura: gdyby gałąź negatywna niosła te same cechy glifów, mechanizm classifier-free guidance byłby przyciągany w stronę renderowania tekstu i odciągany od promptu, więc zera istnieją po to, aby te dwa cele nie walczyły ze sobą. Enkoder ładuje się tylko wtedy, gdy checkpoint faktycznie zawiera byte5/ podfolder.

Dwie uwagi w duchu uczciwości. To commit w frameworku do wnioskowania strony trzeciej, a nie oświadczenie Ant Group, a interpretacja tego, co oznaczają te pliki, jest nasza, a nie dostawcy. A to potwierdza zamysł projektowy, a nie wynik: obecność kodera glifów jest spójna z dobrym renderowaniem tekstu, ale nie jest dowodem, że renderowanie tekstu jest dobre. Jedynym niezależnym dowodem jakości jest pojedyncza pozycja w tabeli liderów, omówiona poniżej.

A pipeline diagram titled "How the glyph encoder enters the pipeline", showing prompt text passing through a tokenizer extended with font and colour markers into a ByT5 glyph encoder whose features are appended along the sequence dimension, with the negative branch receiving zeros so guidance is not pulled away from rendered text, and the result emerging as an RGBA image.

Kontrast z Qwen-Image 3.0 nie polega na tym, że model Alibaby źle renderuje tekst — nikt spoza Alibaby nie może powiedzieć, jak dobrze renderuje tekst, i o to właśnie chodzi. Polega on na tym, że pytanie „jak ten model rysuje litery” ma odpowiedź w przypadku jednego z tych modeli, a w przypadku drugiego obietnicę marketingową, a luka między odpowiedzią a obietnicą to miejsce, w którym podejmuje się decyzje inżynierskie.

Ten jeden numer i tablica, na której go nie ma

Ming-Image-0.1-Design zajmuje pierwsze miejsce w rankingu Artificial Analysis Text to Image Leaderboard dla projektowania UI/UX, w widoku otwartych wag, z wynikiem Elo 1,082 — przed Ideogram 4.0 (Quality) z 1,052, Ideogram 4.0 z 1,015, HunyuanImage 3.0 Instruct z 1,005, FLUX.2 [dev] z 1,000, FLUX.2 [dev] Flash z 999 i FLUX.2 [dev] Turbo z 994. Kopia tego rankingu to ta odtworzona na karcie samego modelu i nosi branding Artificial Analysis; nikt nie odtworzył tego wyniku niezależnie.

The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.

To ranking dla modeli z otwartymi wagami, więc Qwen-Image 3.0 nie ma w nim wpisu, a jego nieobecność nic nie mówi o jego jakości. To, co jednak mówi, ma charakter strukturalny: ranking preferencji w ciemno może klasyfikować tylko modele, których wagi są publiczne. To daje otwartemu wydaniu mierzalną pozycję na miesiące przed tym, zanim ma produkt, a zamkniętemu wydaniu daje marketingową liczbę i nic więcej. Twierdzenia Qwen-Image 3.0 — czytelność przy 10 pikselach, prompty o długości 4500 tokenów, ponad 20 czcionek — nie mają za sobą w ogóle żadnego niezależnego pomiaru.

A two-column scoreboard titled "Ming-Image-0.1-Design vs Qwen-Image 3.0 - the scoreboard". Left column Ming-Image-0.1-Design: Weights downloadable, 6.15B; Licence MIT; Text rendering glyph encoder visible; Independent score Elo 1,082; Price self-host; Internals readable. Right column Qwen-Image 3.0: Weights none; Licence not published; Text rendering 10px claim, vendor-reported; Independent score none; Price about $0.04 per image; Internals black box. Footer reads "Qwen-Image 3.0 claims vendor-reported; Ming score per the Artificial Analysis board on its model card.", with the OrcaRouter logo bottom-right.

Jak faktycznie można by to przetestować i ile kosztuje próba

Jeśli czytelny krój pisma jest powodem, dla którego to czytasz, testem nie jest ranking. To twój własny krój pisma, twój własny język i twoje własne ciągi znaków, przepuszczone przez obu kandydatów i odczytane przez człowieka. Ten test wymaga, by jeden z tych modeli był dostępny i tani, a drugi — możliwy do pobrania, a ich ceny opierają się na przeciwnych zasadach.

• Qwen-Image 3.0 — około 0,04 USD za obraz w edycji Pro i około 0,03 USD w wersji Standard, a ceny dla konsumentów na rynku krajowym zaczynają się od około ¥0,18 za obraz. To wartości z momentu premiery i nie zostały poddane audytowi. Możesz uruchomić matrycę promptów jeszcze dziś po południu i płacić za każde wywołanie.

• Ming-Image-0.1-Design — brak opublikowanej ceny, ponieważ nie ma hostowanego endpointu. Koszt to pobranie 71,5 GB, karta 80 GiB i Twój własny czas, a korzyść polega na tym, że możesz skierować ten sam test na ścieżkę kodera glifów i sprawdzić, czy to właśnie ten komponent wykonuje tę pracę.

To jest sytuacja, do której stworzono warstwę routingu, i warto precyzyjnie określić, która jej część ma tu zastosowanie. Ani Qwen-Image 3.0, ani Ming-Image-0.1-Design nie znajduje się na naszej platformie, więc warstwa routingu nie może dziś wystawić żadnego z nich za kluczem. Może natomiast zadbać o to, by porównanie pozostało rzetelne podczas jego przeprowadzania: OrcaRouter udostępnia ponad 200 modeli za jednym punktem końcowym zgodnym z OpenAI, w cenie katalogowej dostawcy i bez żadnej marży, z automatycznym przełączaniem awaryjnym między dostawcami, dzięki czemu model, któremu już ufasz, może utrzymać ścieżkę produkcyjną — a jego koszt pozostaje powiązany z ceną katalogową dostawcy, więc zmiana stawek przez dostawcę trafia na naszą stronę tego samego dnia — podczas gdy niezmierzony model projektowy jest oceniany obok niego, a nie przed nim.

Dwa otwarte wydania, jedno zamknięte i pewien wzorzec

Warto zauważyć, czego — poza nim samym — dowodem jest wydanie Ming. Ant Group opublikowała 6,15-miliardowy model projektowy na licencji MIT, bez żadnej zapowiedzi, wraz z drugim modelem do dekompozycji warstw na tej samej licencji. Alibaba opublikowała zamknięty model hostowany bez licencji, bez karty modelu i bez raportu, przeznaczony do tego samego rodzaju zadań, i ustaliła cenę za każdy obraz.

To dwa różne zakłady o to, gdzie w modelach projektowych ulokowana jest wartość. Jeden mówi, że model jest produktem, a wagi są kanałem dystrybucji. Drugi mówi, że model jest usługą, a wagi są tym, co zatrzymujesz. Oba zakłady mogą być słuszne na tym samym rynku i dają bardzo różne odpowiedzi na jedyne pytanie, które ma znaczenie w momencie oceny: czy mogę dowiedzieć się, jak to działa, zanim zacznę od tego zależeć?

• Jeśli musisz wiedzieć, jak renderowany jest tekst i dlaczego czasami nie jest — Ming-Image-0.1-Design jest jedynym z tych dwóch, który pozwala ci zajrzeć, a licencja MIT oznacza, że możesz działać na podstawie tego, co odkryjesz.

• Jeśli potrzebujesz dziś produkcyjnego endpointu z ceną za obraz i bez infrastruktury — Qwen-Image 3.0 jest jedynym z tych dwóch, który go oferuje, a jego wewnętrzne mechanizmy są częścią ceny.

• Jeśli potrzebujesz niezależnych dowodów, zanim podejmiesz decyzję — żaden z nich nie ma ich wystarczająco dużo. Jeden ma pojedynczą, niepowtórzoną pozycję w rankingu; drugi ma arkusz twierdzeń dostawcy bez dołączonych liczb.

Na co zwrócić uwagę, to czy ten wzorzec się utrzyma. Niezapowiedziane wydanie na licencji MIT z koderem glifów jest deklaracją, jak jego autorzy oczekują, że model będzie używany — sprawdzany, uruchamiany lokalnie, modyfikowany. Jeśli następne wydanie od tego samego zespołu zostanie zapowiedziane, poddane benchmarkom i hostowane, to był jednorazowy przypadek. Jeśli będzie to kolejne ciche repozytorium, kategoria modeli projektowych ma drugiego otwartego konkurenta, a zamknięta połowa rynku ma problem cenowy, którego nie miała w lipcu.