Titelkarte für einen Vergleich von Ming-Image-0.1-Design und Qwen-Image 2.1, mit dem Untertitel, dass die Lizenz und die Hardwarekosten die Wahl entscheiden, wobei auf einer Karte „flexiblere Lizenz“ und auf der anderen „restriktivere Lizenz“ steht.
Guides & Insights

Ming-Image-0.1-Design vs. Qwen-Image 2.1: Die Lizenz ist der eigentliche Unterschied

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Zwei offene Bildmodelle erschienen im September 2026 mit nur drei Tagen Abstand zueinander, und liest man ihre Datenblätter, wirken sie wie derselbe Kauf. Ming-Image-0.1-Design, entwickelt vom inclusionAI-Team von Ant Group, stellte seine Gewichte am 17. September unter einer MIT-Lizenz auf Hugging Face bereit. Qwen-Image 2.1, vom Qwen-Team bei Alibaba, folgte am 20. September unter dem Qwen Research License Agreement. Beide geben natives RGBA aus, beide beanspruchen 2K-Ausgabe, und beide richten sich an denselben Käufer: ein Team, das Bildgenerierung selbst hosten, prüfen und verändern möchte. Die beiden Dinge, die sie tatsächlich unterscheiden, sind genau die zwei, die ein Datenblatt am schlechtesten zeigt — was man mit dem Ergebnis rechtlich tun darf und wie viel Silizium es braucht, um eines zu erzeugen.

Das ist keine rhetorische Rahmung. Für eines dieser Modelle ist die Lizenz ein hartes Ausschlusskriterium für die kommerzielle Nutzung; für das andere ist sie kein Thema. Und die Parameterzahl, die jeder Anbieter auf die Verpackung druckt, gibt den Download um den Faktor drei oder vier zu niedrig an. Diese beiden Fakten entscheiden über den Kauf lange bevor irgendein Benchmark dies tut – und die Benchmarks lassen sich, nebenbei bemerkt, überhaupt nicht vergleichen.

Was jedes Repository tatsächlich enthält

Keines der Modelle ist ein einziges Netzwerk. Beide sind Pipelines, und die Pipeline ist der Ort, an dem die Größe sitzt:

• Generator — Ming-Image-0.1-Design liefert einen Design-Transformer mit 6,15B Parametern (12,31 GB in BF16); Qwen-Image 2.1 liefert einen 7,1B Single-Stream-DiT mit 32 Schichten, block-kausaler Aufmerksamkeit und einer nicht genannten Anzahl aktiver Parameter (etwa 14,2 GB).

• Textseite — Ming-Image-0.1-Design kombiniert seinen Transformer mit einem multimodalen LLM mit 17,01 Mrd. Parametern (34,02 GB) und einem Connector mit 3,09 Mrd. Parametern (6,17 GB); Qwen-Image 2.1 verwendet einen Qwen3-VL-8B-Textencoder (etwa 17,5 GB).

• Gesamtparameter — 26,44 Mrd. für Ming-Image-0.1-Design gegenüber etwa 15–16 Mrd. für Qwen-Image 2.1. Beachten Sie, dass die prominent angegebene Zahl bei keinem der Anbieter die Gesamtzahl ist: „6B“ und „7B“ beschreiben beide nur den Generator.

• Repository-Größe — 52,88 GB für Ming-Image-0.1-Design (49,25 GiB davon entfallen auf Gewichte); rund 33 GB für Qwen-Image 2.1.

Transparenz — beide geben natives RGBA direkt aus dem Modell aus statt über einen nachträglichen Matting-Schritt. Ming-Image-0.1-Design verwendet einen eigenen RGBA-VAE; Qwen-Image 2.1 verwendet einen 64-Kanal-RGBA-VAE mit 16-facher räumlicher Komprimierung.

• Standardgenerierung — Ming-Image-0.1-Design ist für 2048×2048, 12 Schritte, BF16, CFG 1.0 validiert; Qwen-Image 2.1 verwendet standardmäßig 2048×2048 über 40 Schritte mit sieben Voreinstellungen für Seitenverhältnisse.

• Lizenz — MIT für Ming-Image-0.1-Design; die Qwen Research License Agreement, nicht kommerziell, für Qwen-Image 2.1.

Das Label „6B" muss einiges leisten.

Der Titel des Repositorys von Ant Group dreht sich um ein Modell mit 6 Milliarden Parametern, und der Transformer hat tatsächlich 6,15 Mrd. Parameter. Doch die Gewichte, die Sie herunterladen, sind 49,25 GiB groß, das Repository ist 52,88 GB groß, und die vom Anbieter validierte Konfiguration – 2048×2048 bei BF16 mit vollständig residentem Text-Stack – ist ausgelegt für eine 80-GiB-CUDA-GPU. Das ist kein Rundungsfehler auf einer 48-GB-Karte; es ist eine Karte, die Sie nicht verwenden können. Ein 48-GB-Beschleuniger wird die Pipeline nicht fassen, und zwei davon ebenso wenig ohne Offload-Akrobatik, die der Anbieter nicht dokumentiert.

Qwen-Image 2.1 ist der gutmütigere Download – mit der Einschränkung, dass Alibaba überhaupt keine offiziellen VRAM-Angaben veröffentlicht. Die einzige Empfehlung auf der Modellkarte ist, auf kleineren Karten CPU-Offload zu aktivieren. Was seit dem Start gemessen wurde, ist nützlicher als das, was veröffentlicht wurde: Eine int8-Pipeline läuft insgesamt mit etwa 16 GiB und passt vollständig in eine 24-GB-Karte, während für einen vollständigen BF16-Lauf je nach Platzierung des Text-Encoders alles von etwa 17 GB mit CPU-Offload bis zu rund 40 GiB Spitzenlast bei 1024×1024 berichtet wurde. Die gemeldete Latenz für ein einzelnes Bild reicht von wenigen Sekunden auf einer B200 bis unter zehn auf einer aktuellen Workstation-Karte. Betrachten Sie jede dieser Zahlen als Community-Messung und nicht als Spezifikation – sie schwanken je nach Offload-Strategie stärker, als sich die Modelle voneinander unterscheiden.

Die praktische Zusammenfassung: Qwen-Image 2.1 ist ein Modell der 3090-Klasse, wenn man bereit ist, auszulagern; Ming-Image-0.1-Design ist ein Modell der Rechenzentrumsklasse, für das es keine kleinere Konfiguration gibt.

Die Lizenz ist die Weggabelung

Dies ist der Teil, der ein Projekt tatsächlich stoppen wird, und genau diesen Teil behandeln die beiden Releases am unterschiedlichsten.

Ming-Image-0.1-Design steht unter MIT. Es in einem bezahlten Produkt einzusetzen, es feinabzustimmen, die Gewichte weiterzuverbreiten, deine Änderungen geschlossen zu halten — nichts davon erfordert ein Gespräch mit Ant Group.

Qwen-Image 2.1 ist es nicht. Es trägt die Qwen Research License Agreement vom 20. September 2026, die die Gewichte ausschließlich für Forschung und Evaluierung lizenziert. Für die kommerzielle Nutzung ist eine separate Vereinbarung mit Alibaba erforderlich, und für diese Vereinbarung wird kein Preis veröffentlicht. Derivate und Weiterverbreitungen müssen die Lizenz, einen Hinweis „Built with Qwen“ oder „Improved using Qwen“ und die Copyright-Zeile des Hangzhou Tongyi Laboratory tragen, und „Qwen“ darf nicht der primäre Name eines abgeleiteten Modells sein. Die Lizenz unterliegt chinesischem Recht mit Gerichtsstand in Hangzhou.

Es gibt einen wirklich klärenden Punkt in der eigenen Folgekommunikation des Anbieters: Alibaba hat erklärt, dass generierte Bilder nicht Teil der lizenzierten „Materialien“ sind, sodass Sie die Rechte an dem behalten, was das Modell erzeugt. Die Beschränkung gilt für die Gewichte und das Modell, nicht für Ihre Ausgabe. Das ist eine bedeutsame Ausnahmeregelung, und es lohnt sich, sie genau zu lesen, denn die einfache Zusammenfassung – „Die Bilder gehören Ihnen, das Modell nicht“ – ist die richtige.

Es ist außerdem ein Richtungswechsel. Frühere Qwen-Image-Veröffentlichungen, einschließlich des ursprünglichen Qwen-Image sowie der Builds 2511 und 2512, bleiben Apache 2.0 und kommerziell permissiv. Ein Team, das letztes Jahr Qwen-Image wegen seiner Lizenz gewählt hat und diesen Monat auf 2.1 aktualisiert, übernimmt eine reine Forschungsbeschränkung, der es nie zugestimmt hat. Wenn permissive Bedingungen die Voraussetzung sind, ist Qwen-Image 2.1 nicht die neuere Version dessen, was Sie hatten – es ist eine andere Vereinbarung.

Wofür jedes einzelne gebaut ist

Die Lizenzaufteilung spiegelt einen Unterschied in der Absicht wider, und es ist dieser Unterschied, der die Wahl bestimmen sollte, wenn beide für Sie rechtlich zulässige Optionen sind.

Ming-Image-0.1-Design ist ein Design-Werkzeug. Der Text-Stack existiert, um aus einem kurzen Briefing einen strukturierten 8K-Prompt zu machen, und der Anbieter liefert „Skills“ drumherum — einen Design Skill, der in rund 15 Sekunden einen visuellen Entwurf erzeugt, und einen PPT Skill, der auf folienförmige Ausgaben abzielt. Das zugehörige Repository, Ming-Image-0.1-Design-Layer, nimmt ein flachgelegtes Design entgegen und gibt es als separate Ebenen zurück — die einzige Fähigkeit hier, die sonst niemand im offenen Feld bietet. inclusionAI berichtet, dass das Layer-Modell bei derselben Aufgabe etwa 4,3× schneller läuft als ein offenes 20B-Layer-Modell (183 Sekunden gegenüber 795) — vom Anbieter berichtet, nicht reproduziert, und das Vergleichsziel ist nicht präzise genug benannt, um es überprüfen zu können.

Qwen-Image 2.1 ist ein Generator und Editor. Ein einziger Checkpoint übernimmt sowohl Text-zu-Bild als auch instruktionsbasierte Bearbeitung, akzeptiert bis zu 10 Referenzbilder für eine einzelne Bearbeitung und unterstützt lokale Bearbeitungen, die den Rest des Bildes unangetastet lassen. Es wurde mit Day-Zero-Unterstützung in ComfyUI, Diffusers, vLLM-Omni, SGLang-Diffusion und LightX2V ausgeliefert — eine Serving-Story, die Ming-Image-0.1-Design noch nicht hat, da sein eigener Serving-Leitfaden auf vLLM-Omni verweist.

Lies das als Fork und nicht als Ranking. Wenn die Aufgabe darin besteht, aus einem Briefing ein mehrschichtiges, bearbeitbares Design-Asset zu erstellen, ist Ming-Image-0.1-Design das einzige der beiden, das das leistet. Wenn die Aufgabe darin besteht, zu generieren und dann iterativ anhand von Referenzen zu bearbeiten, leistet Qwen-Image 2.1 das in einem einzigen Modell, und Ming-Image-0.1-Design leistet das überhaupt nicht.

Die Benchmarks sind nicht vergleichbar, und das ist die ehrliche Antwort.

Beide Anbieter haben Zahlen. Keine der beiden Zahlen kann neben die andere gestellt werden, und jeder Artikel, der dies tut, erfindet ein Ergebnis.

Die Evidenz von Ming-Image-0.1-Design ist ein Artificial-Analysis-Board: erster Platz im Text-to-Image-Leaderboard, gefiltert auf offene Gewichte für UI/UX-Design, bei einem Elo von 1.082, vor Ideogram 4.0 Quality mit 1.052, Ideogram 4.0 mit 1.015, HunyuanImage 3.0 Instruct mit 1.005 und FLUX.2 [dev] mit 1.000. Der Anbieter meldet außerdem Gewinnraten von 67,4 % für Layout, 67,0 % für komplexe Komposition und 66,7 % für Textwiedergabe sowie den ersten Platz über 12 Metriken auf Crello. Das Leaderboard ist ein Drittanbieter-Instrument, was das Elo zur stärkeren der beiden Evidenzarten hier macht; die Gewinnraten und der Crello-Sweep sind Anbieterangaben und sollten als Behauptungen gelesen werden.

Artificial Analysis Text-to-Image Leaderboard filtered to open weights on the UI/UX Design board, showing Ming-Image-0.1-Design first at Elo 1,082 above Ideogram 4.0 Quality at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and FLUX.2 dev at 1,000.

Der Beleg für Qwen-Image 2.1 ist Qwen-Image-Bench, ein Benchmark, den das Qwen-Team selbst entwickelt hat, auf dem es 60,28 Punkte erzielt und damit das Open-Source-Feld anführt – vor Nano Banana 2.0 mit 59,82 und GPT Image 1.5 mit 59,65. Das Quellmaterial weist den Benchmark als einen von Qwen entwickelten aus, und die drei Bestplatzierten liegen innerhalb eines Punktes voneinander – eine Lücke, die bequem innerhalb der Schwankungsbreite eines Benchmarks liegt, dessen Urheber zugleich Mitbewerber darin ist.

Also: eine Elo-Wertung von Drittanbietern auf einer UI/UX-Design-Teilmenge gegen eine herstellereigene allgemeine Bewertung. Unterschiedliche Instrumente, unterschiedliche Aufgaben, unterschiedliche Bewerter. Niemand hat einen direkten Vergleichslauf dieser beiden Modelle gegeneinander veröffentlicht, und nach der verfügbaren Evidenz kann das auch niemand. Die sinnvolle Lesart ist eng und es lohnt sich, sie klar auszusprechen – Ming-Image-0.1-Design hat Drittanbieter-Bestätigung speziell für Designarbeit, Qwen-Image 2.1 hat vom Anbieter gemeldete Stärke bei allgemeiner Generierung und Bearbeitung, und die Überschneidung zwischen diesen beiden Aussagen ist kleiner, als die Schlagzeilenzahlen nahelegen.

Eines von beiden auf einen Endpoint zu bringen

Keines der beiden Modelle befindet sich heute im Katalog von OrcaRouter. Ming-Image-0.1-Design und Qwen-Image 2.1 sind derzeit beide Self-Hosting-Optionen: Die Gewichte sind herunterladbar und die Serving-Anleitungen sind echt, aber man richtet die GPU selbst ein, und im Fall von Ming handelt es sich bei dieser GPU um eine mit 80 GiB. Wir führen sie hier als Open-Weight-Releases auf, nicht als Routen.

Was man wissen sollte, bevor man sich auf Hardware festlegt, ist, was dieselbe Arbeitslast als Call kostet. Zu unseren gerouteten Bildmodellen gehören google/gemini-2.5-flash-image, google/gemini-3-pro-image-preview, google/gemini-3.1-flash-image-preview, die drei Stufen von Imagen 4.0 (fast, standard und ultra), grok/grok-imagine-image und die GPT-Image-Familie — openai/gpt-image-1, openai/gpt-image-1-mini, openai/gpt-image-1.5 und openai/gpt-image-2. Ein Design-Brief eine Woche lang gegen eines davon laufen zu lassen, zeigt Ihnen, ob die Layer-Ausgabe von Ming-Image-0.1-Design eine Fähigkeit ist, die Sie tatsächlich brauchen — zu einem Bruchteil der Kosten der 80-GiB-Karte — und zwar bevor Sie herausfinden, ob die Lizenz oder der VRAM zum Blocker werden würde. Wenn Sie ein selbst gehostetes Modell tatsächlich in einen Produktionspfad überführen, liegt am selben Endpoint auch das Routing — ein Schlüssel für über 200 Modelle, automatischer Failover zwischen Anbietern und 0 % Aufschlag, sodass eine Preissenkung eines Anbieters bei uns am selben Tag live ist, an dem sie angekündigt wird.

The OrcaRouter model page for openai/gpt-image-2, one of the image models actually routable, showing the OpenAI-compatible base URL, the /v1/images/generations endpoint and per-million-token input and output pricing.

Wer sollte welche auswählen?

Wähle Ming-Image-0.1-Design wenn das Ergebnis ein Design-Asset und kein Bild ist: Ausgabe mit Ebenen, strukturierte Prompt-Erweiterung, Generierung in Folienform und eine Lizenz, die es dir erlaubt, alles zu verkaufen, was du damit erstellst. Plane eine leistungsstarke Karte ein und akzeptiere, dass das Serving-Ökosystem darum herum dünner ist als auf der Qwen-Seite. Außerdem ist es das nützlichere der beiden, wenn du einem Kunden eine Zahl vorlegen musst, denn sein stärkster Beleg ist die einzige Zahl eines Dritten in diesem Vergleich.

Wählen Sie Qwen-Image 2.1, wenn der Workflow im Generieren und anschließenden Bearbeiten besteht, wenn Sie Referenzbild-Konditionierung benötigen oder wenn Sie auf Hardware ausführen möchten, die Sie bereits besitzen. Es ist kleiner, am ersten Tag besser unterstützt, und seine Lizenz ist für die Forschungs- und Evaluierungsarbeit in Ordnung, die die meisten Leute tatsächlich zuerst machen. Es wird zur falschen Wahl, sobald der Output kommerziell ist und die rechtliche Prüfung konkret wird, denn der einzige Weg zu einer kommerziellen Lizenz ist eine direkte Vereinbarung mit Alibaba, und es gibt keinen veröffentlichten Preis, mit dem man planen kann.

Wähle noch keines von beiden, wenn du diesen Monat Bildgenerierung in Produktion brauchst. Beides sind Gewichte, und Gewichte sind eine Hardware- und rechtliche Verpflichtung, bevor sie eine Fähigkeit sind. Die Designfrage – verändert geschichtete Ausgabe, was mein Team ausliefern kann – lässt sich zuerst auf einem gehosteten Endpunkt beantworten, und diese Antwort sollte entscheiden, ob die 80-GiB-Karte gekauft wird.

Was zu sehen

Drei Dinge werden diesen Vergleich verändern. Ob Ming-Image-0.1-Design einen Serving-Pfad über den eigenen vLLM-Omni-Leitfaden hinaus bekommt, denn genau das ist derzeit die Lücke zwischen ihm und der Fünf-Framework-Day-Zero-Liste von Qwen-Image 2.1. Ob Alibaba einen Preis an die kommerzielle Qwen-Lizenz knüpft, denn ein nicht festgelegter Preis ist die größte einzelne Unbekannte in dieser Paarung. Und ob irgendjemand — ein Labor, ein unabhängiger Evaluator oder ein Anbieter, der nichts zu verlieren hat — diese beiden mit denselben Prompts gegeneinander antreten lässt. Bis es dazu kommt, ist das, was einem fairen Vergleich am nächsten kommt, überhaupt kein Score. Es ist die Zeile zur Lizenz, und Ming-Image-0.1-Design gewinnt diese eindeutig.

Scoreboard comparing Ming-Image-0.1-Design and Qwen-Image 2.1 across weights release date, licence, generator size, total parameters, repository size, validated hardware, default generation, output format and headline benchmark, with a footer separating third-party from vendor-reported figures.