Hero-titelkort med texten 'Ming-Image-0.1-Design toppar resultattavlan för UI-design med öppna vikter', underrubrik 'Högst rankade modellen med öppna vikter i Artificial Analysis UI/UX Design-delmängden, med 1 084 Elo', med ett kort med troféikon märkt 'Topprankad modell med öppna vikter' och ett kort med skärmikon märkt 'Ledande inom UI/UX-design'. OrcaRouter-logotypen är inkomponerad i nedre högra hörnet.
Guides & Insights

Ming-Image-0.1-Design toppar Open-Weights UI Design Board — och siffran stämmer

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Påståendet som cirkulerar med Ming-Image-0.1-Design är att inclusionAI:s 6B-modell är den bästa text-till-bild-modellen med öppna vikter för UI- och UX-arbete, och ligger först i vyn för öppna vikter på Artificial Analysis UI/UX Design-topplistan med 1 082 Elo. Skärmbilder av leverantörers topplistor är vanligtvis den svagaste typen av bevis, så det första som är värt att göra är att läsa den live-uppdaterade listan. Per den 24 september 2026 håller det, med en viktig reservation som skärmbilden inte förmedlar: 1 082 är ett utsnitt för ett användningsfall, inte hela topplistan, och på den fullständiga Text to Image-topplistan ligger samma modell på plats 45 med ett Elo på 995.

Båda siffrorna är verkliga, de kommer från samma arena och de beskriver samma vikter. Det som skiljer dem åt är vilka promptar rösterna avlades på.

Vad live-tavlan faktiskt säger

Artificial Analysis kör en blind parvis arena och filtrerar sedan samma röstpool till användningsfallssegment. Segmentet UI/UX Design är det som spelar roll för en modell byggd för dashboards, appskärmar, affischer och infografik, och det är där Ming-Image-0.1-Design gör sitt bästa arbete:

• Övergripande text-till-bild-topplista — Ming-Image-0.1-Design på #45, Elo 995, 95 % KI ±8, 21 342 prover, listad i september 2026, 30,00 USD per 1 000 bilder, flaggad som Open Weights

• UI/UX-designsegment — Ming-Image-0.1-Design på #16, Elo 1 084, 2 100 prover i segmentet

• Det högst placerade bidraget med öppna vikter i det segmentet — Ming-Image-0.1-Design; de nästa modellerna med öppna vikter bakom det är Ideogram 4.0 (Quality) på #22 och 1 047, Ideogram 4.0 på #31 och 1 018, samt HunyuanImage 3.0 Instruct på #40 och 1 005

• I toppen av UI/UX-delen — GPT Image 2.5 Flare (max) på 1 226, GPT Image 2.5 Sunburst (max) på 1 215, GPT Image 2 (high) på 1 204, Grok Imagine Image 2.0 på 1 183

• Jämfört med leverantörens egen skärmbild – inclusionAI publicerade 1 082 för Ming mot Ideogram 4.0 (Quality) på 1 052 och FLUX.2 [dev] på 1 000; det aktuella live-segmentet visar nu 1 084, 1 047 respektive 1 000

Så rubriken är korrekt utifrån sina egna premisser. Ming-Image-0.1-Design är den högst rankade modellen med öppna vikter i UI/UX Design-segmentet, och det är den enda modellen med öppna vikter bland de tjugo främsta i det segmentet. Den ligger också 142 Elo efter ledaren i det segmentet, och den ligger i mitten av fältet när prompten inte är en designprompt. En modell som vinner på dashboards och hamnar på 995 totalt är en specialist, inte en allroundare, och de två siffrorna är bara motsägelsefulla om man läser den ena som hela historien.

De 21 342 stickprov på hela resultattavlan är också värda att notera för vad de inte är. Det är ett stort röstantal, vilket är anledningen till att konfidensintervallet är snävt på ±8 Elo, men antalet stickprov är inte detsamma som att metoden är oberoende. Arenan bygger på blind mänsklig preferens, så ingen på inclusionAI skrev poängen – den delen är äkta. Det poängen mäter är "vilken av dessa två bilder föredrog en röstare", och röstare som ombeds bedöma en UI-skärmbild tenderar att belöna läsbar text och en sammanhängande layout. Det är precis den axel som den här modellen tränades på.

Screenshot of the Artificial Analysis Text to Image Leaderboard captured 24 September 2026, cropped to the lower rows. Ming-Image-0.1-Design is row 45, creator InclusionAI, with an Elo of 995, row range 39-50, 21,342 samples, a September 2026 release and $30.0 per 1k imgs, carrying the Open Weights badge. Neighbouring rows include P-Image-Ideogram (High) at 44 and 995, Cosmos3-Super-Text2Image (agentic) at 46 and 994, and Ideogram 4.0 at row 38 and 1,004, also Open Weights.

Vad Ming-Image-0.1-Design är

Ming-Image-0.1-Design är en text-till-bild-modell från inclusionAI, AI-labbet kopplat till Ant Group, släppt under MIT-licensen med vikter publicerade den 17 september 2026 och det fullständiga utgivningspaketet som kommer den 22 september. Den genererar utifrån enbart en prompt – ingen referensbild krävs – och den är inriktad på texttung grafisk design snarare än fotografi: UI-mockuper, dashboards, infografik, affischer och allt där renderad text måste förbli läsbar i den storlek den ska läsas.

Den dokumenterade inferenskonfigurationen är specifik och ovanligt billig per steg:

• Upplösning – 2048 x 2048 rekommenderas, eller 1024 x 1024 för snabbare generering, med mellanliggande storlekar justerade till en av dessa två kategorier

• Samplingssteg — 12

• Vägledning — CFG-skala 1,0

• Precision — BF16

• Hårdvara — en CUDA-GPU med 80 GiB VRAM, beskriven som den validerade konfigurationen

Tolv steg vid en vägledningsskala på 1,0 är kännetecknet för en destillerad eller vägledningsfri sampler. Det är vad som gör en utdata på 2048 pixlar överkomlig vid ett stegantal som de flesta diffusionsmodeller inte skulle försöka sig på, och det är huvudanledningen till att den här modellen är intressant för alla som kör bildgenerering i stor omfattning i stället för en bild i taget.

Den andra strukturella funktionen är transparens. Ming-Image-0.1-Design kan skicka ut inbyggd RGBA, så en transparent bakgrund kommer från samplern i stället för från en matting-pass, när prompten börjar med en av de dokumenterade transparensfraserna. En kompletterande modell, Ming-Image-0.1-Design-Layer, går längre: den tar en tillplattad design plus en lagerplan och returnerar separata RGBA-PNG-filer — text, kort, huvudmotiv, bakgrund — som kan sättas samman igen till originalet. Det är skillnaden mellan en designmodell och en bildmodell. En platt PNG är en bild av en layout; separata lager är en layout som du fortfarande kan redigera.

Screenshot of the inclusionAI/Ming-Image-0.1-Design model card on Hugging Face, captured 24 September 2026. The header shows 188 likes, 3,067 followers, tags including text-to-image, difusers, safetensors, image-generation, graphic-design, text-rendering and License: mit, and a safetensors panel reading Model size 6B params, Tensor type BF16. The card's UI/UX Design leaderboard image is embedded in the body, showing Ming-Image-0.1-Design first at 1,082 above Ideogram 4.0 (Quality) at 1,052 and FLUX.2 [dev] at 1,000. The right rail states 'This model isn't deployed by any Inference Provider', and the Quick Start block shows the infer.py command with --resolution 2048 and a note that prompt enhancement can use Ling-3.0-flash-VL or qwen3.8-27B.

6B-etiketten och 26B-nedladdningen

"6B" är korrekt om den del som de flesta menar och missvisande om den del som avgör om du kan köra den. Diffusion-transformatorn har 6,15B parametrar. Paketet du faktiskt laddar ner är ungefär 52,88 GB, eftersom den multimodala textkodaren har 17,01B parametrar och connectorn tillför 3,09B – totalt cirka 26B parametrar i BF16. Layer-modellens transformator är dubbelt så stor som basmodellens, på 12,31B, och dess paket är återigen större, på ungefär 65,20 GB.

Detta är viktigt av två praktiska skäl. För det första handlar kravet på 80 GiB VRAM inte om 6B-transformatorn; det handlar om allt som måste vara kvar i minnet tillsammans med den. För det andra måste varje jämförelse mot en modell som beskrivs som "6B" kontrollera vilken 6B som avses. En 6B-diffusionstransformator med en 20B-textkodare är ett helt annat driftsättningsproblem än en 6B-modell i sin helhet.

Hanteringen av promptar är det andra som kortet gör explicit i stället för att dölja: det rekommenderade receptet kör först ett omskrivningssteg, med hjälp av en vision-language-modell för att expandera en kort prompt till en strukturerad JSON-layoutbeskrivning i Figma-stil med koordinater, hierarki, färgspecifikationer och ordagrann text. Modellkorten anger Ling-3.0-flash-VL eller Qwen3.8-27B för den uppgiften. Med andra ord är den pipeline som leverantören benchmarkar en pipeline med två modeller. Om du anropar Ming-Image-0.1-Design med en enradig prompt och utan omskrivningssteg kör du inte den konfiguration som gav 1 084 i UI/UX-delen.

Var detta lämnar en designpipeline

Den ärliga sammanfattningen av Ming-Image-0.1-Design är att den löser ett specifikt och dyrt problem — att generera texttäta layouter som klarar att man tittar på dem — och den gör det i toppen av fältet för öppna vikter på den enda resultattavlan som mäter det problemet. Den leder inte den övergripande resultattavlan för bilder, den tar inte bort behovet av en VLM framför den, och den kräver en rejäl GPU.

Det den förändrar är mitten av ett designarbetsflöde. Om din pipeline för närvarande genererar en platt bild och sedan betalar en människa eller en segmenteringsmodell för att skära isär den, tar en modell som matar ut RGBA inbyggt och en följeslagare som matar ut 2–9 namngivna lager bort ett steg. Det är värt mer än en Elo-kolumn, och det är den delen som ingen topplista mäter.

För team som vill testa det utan att binda upp sig till infrastruktur är uppdelningen värd att vara noggrann med. Ming-Image-0.1-Design är en nedladdning med MIT-licens, så den körs på din hårdvara eller inte alls – OrcaRouter dirigerar ingen inclusionAI-modell av någon version, och att påstå något annat vore ett påstående vi inte kan stå för. Det ett routningslager faktiskt ger dig är den omgivande ytan: en OpenAI-kompatibel slutpunkt över 200+ modeller, automatisk redundans över leverantörer, och leverantörslistpris som förs vidare med 0 % påslag, så en prisändring hos en leverantör på någon modell du faktiskt anropar gäller hos oss samma dag. Om du sätter upp en designpipeline och vill A/B-testa den här modellen mot en hostad modell du redan litar på, körs den jämförelsen med en nyckel i stället för två avtal.

A rendered summary card headed 'The two numbers' and titled 'One model, two readings', listing five figures: Overall Text to Image board #45, Elo 995, 95% CI 8, 21,342 samples; UI/UX Design slice #16, Elo 1,084, 2,100 samples in the slice; open-weights standing in that slice #1, next is Ideogram 4.0 (Quality) at #22 and 1,047; leader of the same slice GPT Image 2.5 Flare (max), Elo 1,226, a 142-point gap; board-listed API pricing $30.00 per 1,000 images, flagged Open Weights.

Vad skulle förändra bilden

Tre saker skulle flytta Ming-Image-0.1-Design från en stark specialist med öppna vikter till ett standardval. En första oberoende reproduktion av Crello-siffrorna för Layer-modellen – modellkortet rapporterar ett RGB L1-fel på 0,0574 och alpha soft IoU på 0,8923 vid 1024, och ingen extern grupp har kört dem. En hostad endpoint som tar bort 80 GiB-kravet. Och en andra användningsfallsdel där modellen presterar lika bra som i UI/UX Design, eftersom en modell som bara vinner på en delmängd av en enda resultattavla är en modell vars generalitet fortfarande är obevisad.

Fram till dess är den korrekta meningen den snäva: på Artificial Analysis UI/UX Design-delmängden, avläst 24 september 2026, är inclusionAI:s Ming-Image-0.1-Design den högst rankade text-till-bild-modellen med öppna vikter, med 1 084 Elo på 2 100 röster — och på samma arenas fullständiga resultattavla ligger den på 45:e plats med 995. Båda dessa är modellen. Ingen av dem är ett lanseringsanspråk, eftersom den här modellen inte hade någon lansering; den hade ett arkiv.