Ett hero-titelkort för "Ming-Image-0.1-Design vs Qwen-Image 3.0" med underrubriken "Vem visar dig hur texten ritas upp.", som ställer Ming-Image-0.1-Design (6,15B parametrar, MIT-licens, vikter du kan läsa, publicerad 17 sep 2026) mot Qwen-Image 3.0 (sluten hostad modell, antal parametrar ej publicerat, ingen licens eller rapport, GA 5 aug 2026), med OrcaRouter-logotypen i nedre högra hörnet.
Guides & Insights

Ming-Image-0.1-Design vs Qwen-Image 3.0: Vem visar dig hur texten ritas?

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det mest intressanta med Ming-Image-0.1-Design finns inte på dess modellkort. Det finns i en commit till ett inferensramverk. Någon gång kring modellens tysta uppladdning till Hugging Face den 17 september 2026 sammanslog vLLM-Omni en ändring med titeln feat: lägg till byte5-stöd för Ming som kopplar in en ByT5-glyfkodare i en ny ming_flash_omni-pipeline — en dedikerad komponent vars hela uppgift är att titta på tecknen du bad att få renderade, inte på bilden du bad om. Det är den typen av detalj som man bara kan hitta genom att läsa kod, och det är exakt den detalj som Qwen-Image 3.0 — leverantörens stängda hostade bildmodell, som släpptes den 21 juli 2026 och blev allmänt tillgänglig den 5 augusti — inte låter någon läsa alls. Båda modellerna är inriktade på designarbete där läsbar typografi är den svåra delen. Bara en av dem berättar hur den gör det.

Vad var och en av dem säger om text

Qwen-Image 3.0:s textåtergivning är helt och hållet ett lanseringspåstående, och det är ett bra sådant på papperet. Alibabas material beskriver prompter på upp till ungefär 4 500 token, läsbar text ned till omkring 10 pixlar, täckning av 12 språk över fler än 20 typsnitt, utdata upp till 2048×2048 och upp till sex bilder per anrop, levererat i Pro- och Standard-utgåvor via ett och samma hostade API. Det finns ingen släppt viktuppsättning, ingen angiven licens, inget model card, ingen teknisk rapport och ingen publicerad benchmarktabell att kontrollera något av det mot. Den vitt spridda siffran på cirka 20B MMDiT-parametrar är rapporterad snarare än bekräftad.

Ming-Image-0.1-Designs story är ett arkiv. 6 154 901 056 parametrar, MIT-licens, en diffusers pipeline-tagg, alla vikter i BF16 safetensors, ungefär 71,5 GB fördelat på connector/, mllm/, mlp/, scheduler/, transformer/ och vae/. Rekommenderad inferens är 2048×2048 vid 12 samplingssteg med guidance på 1,0 på en 80 GiB CUDA-GPU, eller 1024 för snabbhet, med vLLM-Omni angiven för driftsättning och en separat visionsspråkmodell angiven för promptförbättring. Modellkortet beskriver den som en text-till-bild-modell för UI, infografik, affischer och annan textrik visuell design, med RGBA-utdata för transparenta bakgrunder.

De två styckena är inte samma sorts påstående, och det är värt att vara rättfram om varför. Det ena är en produktbeskrivning skriven av dem som säljer den. Det andra är en beskrivning av en artefakt som vem som helst kan ladda ner och kontrollera.

Glyfkodaren är den del som förklarar kategorin.

Textrendering i bildmodeller misslyckas vanligtvis på ett specifikt sätt: modellen genererar något som ser ut som skrift utan att vara skrift. Bokstavsformerna är trovärdiga och ordet är fel. Orsaken är arkitektonisk innan den är något annat — de flesta bildmodeller har ingen komponent som ser tecken som tecken, så texten rekonstrueras från visuella statistiska data på samma sätt som gräs.

vLLM-Omni-commiten är intressant just för att den pekar på det. De tillagda filerna — byte5_encoder.py, pipeline_ming.py, t5_block_mapper.py och en processor för stegindata — beskriver en väg där en ByT5-kodare på bytenivå läser texten som ska visas i bilden, tokeniserarens vokabulär utökas med typsnitts- och färgmarkörer, och de resulterande särdragen läggs till längs sekvensdimensionen medan den negativa sidan får nollor. Den sista detaljen är det som skvallrar om att detta är ett verkligt designbeslut snarare än plumbing: om den negativa grenen bar samma glyfsärdrag skulle classifier-free guidance dras mot att rendera texten och bort från prompten, så nollorna finns för att hindra de två målsättningarna från att slåss mot varandra. Kodaren laddas bara när checkpointen faktiskt innehåller en byte5/ undermapp.

Två noteringar om ärlighet. Detta är en commit i ett tredjeparts inferensramverk, inte ett uttalande från Ant Group, och tolkningen av vad dessa filer betyder är vår snarare än leverantörens. Och den styrker en designavsikt, inte ett resultat: att en glyfkodare finns är förenligt med bra textrendering, och det är inte bevis för att textrenderingen är bra. Det enda oberoende beviset på kvalitet är en enda placering på en leaderboard, som diskuteras nedan.

A pipeline diagram titled "How the glyph encoder enters the pipeline", showing prompt text passing through a tokenizer extended with font and colour markers into a ByT5 glyph encoder whose features are appended along the sequence dimension, with the negative branch receiving zeros so guidance is not pulled away from rendered text, and the result emerging as an RGBA image.

Kontrasten mot Qwen-Image 3.0 är inte att Alibabas modell återger text dåligt – ingen utanför Alibaba kan säga hur bra den återger text, och det är själva poängen. Den ligger i att frågan ”hur ritar den här modellen bokstäver” har ett svar för en av dessa modeller och ett marknadsföringspåstående för den andra, och gapet mellan ett svar och ett påstående är där ingenjörsbeslut fattas.

Det enda numret, och tavlan det inte finns på

Ming-Image-0.1-Design är rankad etta på Artificial Analysis Text to Image Leaderboard för UI/UX-design, open-weights-vyn, med en Elo på 1 082 – före Ideogram 4.0 (Quality) på 1 052, Ideogram 4.0 på 1 015, HunyuanImage 3.0 Instruct på 1 005, FLUX.2 [dev] på 1 000, FLUX.2 [dev] Flash på 999 och FLUX.2 [dev] Turbo på 994. Kopian av den resultattavlan är den som återges på modellens eget kort, och den bär Artificial Analysis varumärkesprofil; ingen har oberoende reproducerat poängen.

The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.

Det är en resultattavla för öppna vikter, så Qwen-Image 3.0 har ingen post och dess frånvaro säger inget om dess kvalitet. Vad den däremot säger är strukturellt: en blindpreferenstavla kan bara rangordna modeller vars vikter är offentliga. Det ger en öppen lansering en mätbar position månader innan den har en produkt, och det ger en stängd lansering en marknadsföringssiffra och inget annat. Qwen-Image 3.0:s påståenden – läsbarhet på 10 pixlar, promptar på 4 500 token, över 20 teckensnitt – har ingen oberoende mätning bakom sig alls.

A two-column scoreboard titled "Ming-Image-0.1-Design vs Qwen-Image 3.0 - the scoreboard". Left column Ming-Image-0.1-Design: Weights downloadable, 6.15B; Licence MIT; Text rendering glyph encoder visible; Independent score Elo 1,082; Price self-host; Internals readable. Right column Qwen-Image 3.0: Weights none; Licence not published; Text rendering 10px claim, vendor-reported; Independent score none; Price about $0.04 per image; Internals black box. Footer reads "Qwen-Image 3.0 claims vendor-reported; Ming score per the Artificial Analysis board on its model card.", with the OrcaRouter logo bottom-right.

Hur du faktiskt skulle testa detta, och vad det kostar att försöka

Om läsbar typografi är anledningen till att du läser detta, är testet inte en topplista. Det är ditt eget typsnitt, ditt eget språk och dina egna strängar, körda genom båda kandidaterna och lästa av en person. Det testet kräver att en av dessa modeller är tillgänglig och billig, och att den andra går att ladda ner, och de är prissatta enligt motsatta principer.

• Qwen-Image 3.0 — omkring 0,04 USD per bild i Pro-utgåvan och omkring 0,03 i Standard, med inhemsk konsumentprissättning som börjar nära ¥0,18 per bild. Det är lanseringssiffror och har inte granskats. Du kan köra en promptmatris i eftermiddag och betala per anrop.

• Ming-Image-0.1-Design — inget publicerat pris, eftersom det inte finns någon hostad slutpunkt. Kostnaden är en nedladdning på 71,5 GB, ett 80 GiB-kort och din egen tid, och fördelen är att du kan rikta samma test mot glyph-encoder-vägen och se om det är komponenten som utför arbetet.

Det här är situationen som ett routinglager är byggt för, och det är värt att vara precis om vilken del av det som gäller. Varken Qwen-Image 3.0 eller Ming-Image-0.1-Design finns på vår plattform, så ett routinglager kan inte lägga någon av dem bakom en nyckel i dag. Det det kan göra är att hålla jämförelsen ärlig medan du kör den: OrcaRouter exponerar 200+ modeller bakom en OpenAI-kompatibel endpoint till leverantörens listpris utan påslag, med automatisk failover mellan leverantörer, så att modellen du redan litar på kan hålla produktionsvägen — och dess kostnad förblir knuten till leverantörens listpris, så en ändring av leverantörens taxa landar hos oss samma dag — medan en ännu inte uppmätt designmodell utvärderas bredvid den i stället för före den.

Två öppna releaser, en stängd och ett mönster

Det är värt att notera vad Ming-lanseringen vittnar om, bortom sig själv. Ant Group publicerade en designmodell med 6,15 miljarder parametrar under en MIT-licens utan något tillkännagivande, tillsammans med en andra modell för lagerdekomposition under samma licens. Alibaba publicerade en sluten hostad modell utan licens, utan modellkort och utan rapport, inriktad på samma typ av arbete, och prissatte den per bild.

Det där är två olika satsningar på var värdet i designmodeller ligger. Den ena säger att modellen är produkten och vikterna är distributionskanalen. Den andra säger att modellen är en tjänst och vikterna är det du behåller. Båda satsningarna kan vara rätt på samma marknad, och de ger väldigt olika svar på den enda fråga som spelar roll vid utvärdering: kan jag ta reda på hur det här fungerar innan jag blir beroende av det?

• Om du behöver veta hur text renderas, och varför den ibland inte gör det — är Ming-Image-0.1-Design den enda av de två som låter dig titta, och MIT-licensen innebär att du kan agera utifrån det du hittar.

• Om du behöver en produktionsendpoint idag med ett pris per bild och ingen infrastruktur — är Qwen-Image 3.0 den enda av de två som erbjuder en, och dess interna delar ingår i priset.

• Om du behöver oberoende bevis innan du bestämmer dig — ingen av dem har tillräckligt av det. Den ena har en enda icke reproducerad placering på en topplista; den andra har ett dokument med leverantörspåståenden utan några siffror.

Det man bör hålla ögonen på är om mönstret håller. Ett oannonserat MIT-släpp med en glyf-kodare i sig säger något om hur dess upphovspersoner förväntar sig att modellen ska användas — granskas, köras lokalt, modifieras. Om nästa släpp från samma team annonseras, benchmarkas och hostas var det en engångsföreteelse. Om det är ännu ett tystlåtet repository har designmodellkategorin en andra öppen konkurrent, och den slutna halvan av marknaden har ett prisproblem som den inte hade i juli.