
Ming-Image-0.1-Design führt das Open-Weights UI Design Board an – und die Zahl stimmt.
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 177 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1323 tok/s
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
Die Behauptung, die mit Ming-Image-0.1-Design kursiert, lautet, dass inclusionAIs 6B-Modell das beste Text-zu-Bild-Modell mit offenen Gewichten für UI- und UX-Arbeit ist und mit 1.082 Elo auf Platz eins der Ansicht für offene Gewichte des Artificial Analysis UI/UX Design Leaderboards steht. Screenshots von Hersteller-Leaderboards sind in der Regel die schwächste Art von Belegen, daher lohnt es sich, zuerst das Live-Board zu lesen. Stand 24. September 2026 hält das stand – mit einer wichtigen Einschränkung, die der Screenshot nicht mitliefert: 1.082 ist ein Use-Case-Ausschnitt, nicht das Board, und auf dem vollständigen Text to Image Leaderboard liegt dasselbe Modell auf Rang 45 mit einem Elo von 995.
Beide Zahlen sind echt, sie stammen aus derselben Arena, und sie beschreiben dieselben Gewichte. Was sie unterscheidet, ist, bei welchen Prompts die Stimmen abgegeben wurden.
Was das Live-Board tatsächlich anzeigt
Artificial Analysis betreibt eine blinde paarweise Arena und filtert dann denselben Stimmenpool in Anwendungsfall-Slices. Der UI/UX-Design-Slice ist derjenige, der für ein Modell zählt, das für Dashboards, App-Screens, Poster und Infografiken entwickelt wurde, und hier leistet Ming-Image-0.1-Design seine beste Arbeit:
• Gesamtrangliste Text zu Bild — Ming-Image-0.1-Design auf Platz 45, Elo 995, 95%-KI ±8, 21.342 Stichproben, gelistet im September 2026, 30,00 $ pro 1.000 Bilder, als Open Weights gekennzeichnet
• UI/UX-Design-Slice — Ming-Image-0.1-Design auf Platz 16, Elo 1.084, 2.100 Samples im Slice
• Am höchsten platzierter Open-Weights-Eintrag in diesem Ausschnitt — Ming-Image-0.1-Design; die nächsten Open-Weights-Modelle dahinter sind Ideogram 4.0 (Quality) auf #22 mit 1.047, Ideogram 4.0 auf #31 mit 1.018 und HunyuanImage 3.0 Instruct auf #40 mit 1.005
Spitze des UI/UX-Segments — GPT Image 2.5 Flare (max) mit 1.226, GPT Image 2.5 Sunburst (max) mit 1.215, GPT Image 2 (high) mit 1.204, Grok Imagine Image 2.0 mit 1.183
• Im Vergleich zum eigenen Screenshot des Anbieters — inclusionAI veröffentlichte 1.082 für Ming gegenüber Ideogram 4.0 (Quality) mit 1.052 und FLUX.2 [dev] mit 1.000; der Live-Ausschnitt zeigt jetzt 1.084, 1.047 bzw. 1.000
Die Schlagzeile ist also für sich genommen korrekt. Ming-Image-0.1-Design ist das am höchsten bewertete Open-Weights-Modell im UI/UX-Design-Bereich und das einzige Open-Weights-Modell in dessen Top 20. Es liegt außerdem 142 Elo hinter dem Spitzenreiter dieses Bereichs und befindet sich im Mittelfeld, wenn der Prompt kein Design-Prompt ist. Ein Modell, das bei Dashboards gewinnt und im Gesamtergebnis bei 995 landet, ist ein Spezialist, kein Allrounder, und die beiden Werte widersprechen sich nur, wenn man einen von ihnen als die ganze Geschichte liest.
Die 21.342 Stichproben auf dem vollständigen Board sind auch bemerkenswert für das, was sie nicht sind. Das ist eine große Stimmenzahl, weshalb das Konfidenzintervall mit ±8 Elo eng ist, aber die Stichprobenanzahl ist nicht dasselbe wie die Unabhängigkeit der Methode. Die Arena ist blinde menschliche Präferenz, also hat niemand bei inclusionAI die Punktzahl geschrieben – dieser Teil ist echt. Was die Punktzahl misst, ist „Welches dieser beiden Bilder hat eine abstimmende Person bevorzugt“, und Personen, die gebeten werden, einen UI-Screenshot zu beurteilen, neigen dazu, lesbaren Text und ein kohärentes Layout zu belohnen. Genau das ist die Achse, auf der dieses Modell trainiert wurde.

Was Ming-Image-0.1-Design ist
Ming-Image-0.1-Design ist ein Text-zu-Bild-Modell von inclusionAI, dem KI-Labor, das mit Ant Group verbunden ist, veröffentlicht unter der MIT-Lizenz, wobei die Gewichte am 17. September 2026 veröffentlicht wurden und das vollständige Release-Paket am 22. September erscheint. Es generiert allein aus einem Prompt – kein Referenzbild erforderlich – und richtet sich eher an textlastiges Grafikdesign als an Fotografie: UI-Mockups, Dashboards, Infografiken, Poster und alles, bei dem gerenderter Text in der Größe, in der er gelesen wird, lesbar bleiben muss.
Die dokumentierte Inferenzkonfiguration ist konkret und ungewöhnlich günstig pro Schritt:
• Auflösung — 2048 x 2048 empfohlen oder 1024 x 1024 für eine schnellere Generierung, wobei Zwischengrößen auf eine dieser beiden Größenklassen gerundet werden
• Sampling-Schritte — 12
• Führung — CFG-Skala 1.0
• Präzision — BF16
• Hardware — eine CUDA-GPU mit 80 GiB VRAM, beschrieben als die validierte Konfiguration
Zwölf Schritte bei einer Guidance-Skala von 1,0 sind das Kennzeichen eines destillierten oder guidance-freien Samplers. Genau das macht eine 2048-Pixel-Ausgabe bei einer Schrittzahl bezahlbar, die die meisten Diffusionsmodelle nicht versuchen würden, und es ist der Hauptgrund, warum dieses Modell für alle interessant ist, die Bildgenerierung in großem Umfang betreiben statt immer nur ein Bild auf einmal.
Das andere strukturelle Merkmal ist Transparenz. Ming-Image-0.1-Design kann natives RGBA ausgeben, sodass ein transparenter Hintergrund direkt aus dem Sampler kommt und nicht aus einem Matting-Durchlauf, wenn der Prompt mit einer der dokumentierten Transparenzphrasen beginnt. Ein Begleitmodell, Ming-Image-0.1-Design-Layer, geht noch weiter: Es nimmt ein flach zusammengeführtes Design plus einen Ebenenplan entgegen und gibt separate RGBA-PNGs zurück – Text, Karten, Hauptmotiv, Hintergrund –, die sich wieder zum Original zusammensetzen lassen. Das ist der Unterschied zwischen einem Designmodell und einem Bildmodell. Ein flaches PNG ist ein Bild eines Layouts; separate Ebenen sind ein Layout, das man noch bearbeiten kann.
![Screenshot of the inclusionAI/Ming-Image-0.1-Design model card on Hugging Face, captured 24 September 2026. The header shows 188 likes, 3,067 followers, tags including text-to-image, difusers, safetensors, image-generation, graphic-design, text-rendering and License: mit, and a safetensors panel reading Model size 6B params, Tensor type BF16. The card's UI/UX Design leaderboard image is embedded in the body, showing Ming-Image-0.1-Design first at 1,082 above Ideogram 4.0 (Quality) at 1,052 and FLUX.2 [dev] at 1,000. The right rail states 'This model isn't deployed by any Inference Provider', and the Quick Start block shows the infer.py command with --resolution 2048 and a note that prompt enhancement can use Ling-3.0-flash-VL or qwen3.8-27B.](https://cms.orcarouter.ai/api/media/file/3-1273.png)
Das 6B-Label und der 26B-Download
„6B“ ist zutreffend für den Teil, den die meisten meinen, und irreführend für den Teil, der entscheidet, ob man es ausführen kann. Der Diffusionstransformer hat 6,15 Mrd. Parameter. Das Paket, das man tatsächlich herunterlädt, ist etwa 52,88 GB groß, weil der multimodale Textencoder 17,01 Mrd. Parameter hat und der Connector 3,09 Mrd. hinzufügt – insgesamt etwa 26 Mrd. Parameter bei BF16. Der Transformer des Layer-Modells ist mit 12,31 Mrd. doppelt so groß wie der des Basismodells, und sein Paket ist mit ungefähr 65,20 GB noch größer.
Das ist aus zwei praktischen Gründen wichtig. Erstens betrifft die 80-GiB-VRAM-Anforderung nicht den 6B-Transformer; sie betrifft alles, was daneben resident sein muss. Zweitens muss bei jedem Vergleich mit einem als „6B“ beschriebenen Modell geprüft werden, welches 6B gemeint ist. Ein 6B-Diffusions-Transformer mit einem 20B-Textencoder ist ein ganz anderes Deployment-Problem als ein durchgängiges 6B-Modell.
Der Umgang mit Prompts ist der andere Punkt, den die Karte explizit macht, statt ihn zu verbergen: Das empfohlene Rezept führt zuerst einen Rewriting-Schritt aus, bei dem ein Vision-Language-Modell einen kurzen Prompt zu einer strukturierten JSON-Layoutbeschreibung im Figma-Stil mit Koordinaten, Hierarchie, Farbspezifikationen und wörtlichem Text erweitert. Die Model Cards nennen Ling-3.0-flash-VL oder Qwen3.8-27B für diese Aufgabe. Mit anderen Worten: Die Pipeline, für die der Anbieter Benchmarks durchführt, ist eine Zwei-Modell-Pipeline. Wenn Sie Ming-Image-0.1-Design mit einem einzeiligen Prompt und ohne Rewriting-Schritt aufrufen, verwenden Sie nicht die Konfiguration, die im UI/UX-Slice 1.084 erzielt hat.
Was das für eine Design-Pipeline bedeutet
Die ehrliche Zusammenfassung von Ming-Image-0.1-Design ist, dass es ein spezifisches und teures Problem löst – das Generieren textdichter Layouts, die es überstehen, angesehen zu werden – und das an der Spitze des Open-Weights-Felds auf dem einen Board, das dieses Problem misst. Es führt nicht das allgemeine Image-Board an, es macht einen VLM davor nicht überflüssig, und es verlangt nach einer ernsthaften GPU.
Was es verändert, ist die Mitte eines Design-Workflows. Wenn Ihre Pipeline derzeit ein flaches Bild erzeugt und dann einen Menschen oder ein Segmentierungsmodell dafür bezahlt, es auseinanderzuschneiden, entfernt ein Modell, das RGBA nativ ausgibt, zusammen mit einem Begleiter, der 2–9 benannte Ebenen ausgibt, eine Stufe. Das ist mehr wert als eine Elo-Spalte, und es ist der Teil, den kein Leaderboard misst.
Für Teams, die es testen wollen, ohne sich auf Infrastruktur festzulegen, lohnt es sich, bei dieser Unterscheidung präzise zu sein. Ming-Image-0.1-Design ist ein MIT-lizenzierter Download, läuft also auf Ihrer Hardware – oder überhaupt nicht. OrcaRouter leitet kein inclusionAI-Modell irgendeiner Version weiter, und etwas anderes zu behaupten wäre ein Versprechen, das wir nicht einhalten können. Was eine Routing-Schicht Ihnen tatsächlich bietet, ist die umgebende Oberfläche: einen OpenAI-kompatiblen Endpunkt über 200+ Modelle hinweg, automatisches Failover über Anbieter hinweg und die Listenpreise der Anbieter ohne Aufschlag (0 % Marge), sodass eine Preisänderung eines Anbieters bei jedem Modell, das Sie tatsächlich aufrufen, bei uns noch am selben Tag live ist. Wenn Sie eine Design-Pipeline aufsetzen und dieses Modell per A/B-Test gegen ein gehostetes vergleichen möchten, dem Sie bereits vertrauen, läuft dieser Vergleich über einen Schlüssel statt über zwei Verträge.

Was würde das Bild verändern?
Drei Dinge würden Ming-Image-0.1-Design von einem starken Open-Weights-Spezialisten zu einem Standard machen. Eine erste unabhängige Reproduktion der Crello-Werte des Layer-Modells – die Modellkarte gibt bei 1024 einen RGB-L1-Fehler von 0,0574 und einen Alpha-Soft-IoU von 0,8923 an, und keine externe Gruppe hat sie durchgeführt. Ein gehosteter Endpunkt, der die 80-GiB-Anforderung beseitigt. Und ein zweiter Use-Case-Slice, in dem das Modell genauso gut abschneidet wie im UI/UX-Design, denn ein Modell, das nur in einem Slice eines einzigen Boards gewinnt, ist ein Modell, dessen Allgemeingültigkeit noch unbewiesen ist.
Bis dahin ist der zutreffende Satz der eng gefasste: Im UI/UX-Design-Slice von Artificial Analysis, Stand 24. September 2026, ist inclusionAIs Ming-Image-0.1-Design das am höchsten bewertete Open-Weights-Text-zu-Bild-Modell, mit 1.084 Elo bei 2.100 Stimmen – und auf der vollständigen Rangliste derselben Arena liegt es mit 995 auf Platz 45. Beides davon ist das Modell. Keines von beiden ist eine Launch-Behauptung, denn dieses Modell hatte keinen Launch; es hatte ein Repository.
