Eine Hero-Titelkarte für „Ming-Image-0.1-Design vs Qwen-Image 3.0“ mit dem Untertitel „Wer zeigt dir, wie der Text gezeichnet wird?“, die Ming-Image-0.1-Design (6,15B Parameter, MIT-Lizenz, Gewichte, die du lesen kannst, veröffentlicht am 17. Sept. 2026) mit Qwen-Image 3.0 (geschlossenes gehostetes Modell, Parameteranzahl unveröffentlicht, weder Lizenz noch Bericht, allgemein verfügbar am 5. Aug. 2026) gegenüberstellt, mit dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Ming-Image-0.1-Design vs. Qwen-Image 3.0: Wer zeigt Ihnen, wie der Text gezeichnet wird

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Das Interessanteste an Ming-Image-0.1-Design steht nicht auf seiner Model Card. Es steht in einem Commit zu einem Inferenz-Framework. Etwa zur Zeit des stillen Uploads des Modells auf Hugging Face am 17. September 2026 hat vLLM-Omni eine Änderung mit dem Titel feat: add byte5 support for Ming zusammengeführt, die einen ByT5-Glyph-Encoder in eine neue ming_flash_omni-Pipeline einbindet — eine eigene Komponente, deren einzige Aufgabe darin besteht, die Zeichen zu betrachten, deren Rendering angefordert wurde, und nicht das Bild, das angefordert wurde. Das ist die Art von Detail, die man nur durch Lesen von Code findet, und es ist genau das Detail, das Qwen-Image 3.0 — das geschlossene gehostete Bildmodell des Anbieters, ausgeliefert am 21. Juli 2026 und am 5. August in die allgemeine Verfügbarkeit überführt — überhaupt nicht lesen lässt. Beide Modelle zielen auf Designarbeit ab, bei der gut lesbare Schrift das Schwierige ist. Nur eines von ihnen verrät, wie es das macht.

Was jeder von ihnen über Text sagt

Die Text-Rendering-Story von Qwen-Image 3.0 ist voll und ganz eine Launch-Behauptung, und auf dem Papier ist sie eine gute. Alibabas Material beschreibt Prompts mit bis zu etwa 4.500 Tokens, lesbaren Text bis hinunter zu etwa 10 Pixeln, Abdeckung von 12 Sprachen über mehr als 20 Schriftarten, Ausgabe bis zu 2048×2048 und bis zu sechs Bilder pro Aufruf, bereitgestellt in Pro- und Standard-Editionen über eine einzelne gehostete API. Es gibt keine Veröffentlichung von Gewichten, keine angegebene Lizenz, keine Model Card, keinen technischen Bericht und keine veröffentlichte Benchmark-Tabelle, anhand derer sich irgendetwas davon überprüfen ließe. Die weithin wiederholte Angabe von ~20 Mrd. MMDiT-Parametern wird eher berichtet als bestätigt.

Die Geschichte von Ming-Image-0.1-Design ist ein Repository. 6.154.901.056 Parameter, MIT-Lizenz, eine diffusers Pipeline-Tag, alle Gewichte in BF16 safetensors, ungefähr 71,5 GB verteilt auf connector/, mllm/, mlp/, scheduler/, transformer/ und vae/. Empfohlene Inferenz ist 2048×2048 bei 12 Sampling-Schritten mit Guidance bei 1,0 auf einer 80-GiB-CUDA-GPU, oder 1024 für Geschwindigkeit, wobei vLLM-Omni für das Deployment und ein separates Vision-Language-Modell für die Prompt-Verbesserung genannt werden. Die Karte beschreibt es als ein Text-zu-Bild-Modell für UI, Infografiken, Poster und andere textreiche visuelle Gestaltung, mit RGBA-Ausgabe für transparente Hintergründe.

Diese beiden Absätze sind nicht die gleiche Art von Aussage, und es lohnt sich, deutlich zu sagen, warum. Der eine ist eine Produktbeschreibung, die von den Leuten geschrieben wurde, die es verkaufen. Der andere ist die Beschreibung eines Artefakts, das jeder herunterladen und überprüfen kann.

Der Glyphen-Encoder ist der Teil, der die Kategorie erklärt.

Die Textwiedergabe in Bildmodellen scheitert üblicherweise auf eine ganz bestimmte Weise: Das Modell erzeugt etwas, das wie Schrift aussieht, ohne Schrift zu sein. Die Buchstabenformen sind plausibel, und das Wort ist falsch. Der Grund ist zuallererst architektonisch — die meisten Bildmodelle haben keine Komponente, die Zeichen als Zeichen wahrnimmt, daher wird Schrift aus visuellen Statistiken rekonstruiert, genauso wie Gras.

Der vLLM-Omni-Commit ist gerade deshalb interessant, weil er genau darauf hindeutet. Die hinzugefügten Dateien — byte5_encoder.py, pipeline_ming.py, t5_block_mapper.py und ein Stage-Input-Prozessor — beschreiben einen Pfad, in dem ein ByT5-Byte-Level-Encoder den Text liest, der im Bild erscheinen soll, das Tokenizer-Vokabular um Schriftart- und Farbmarker erweitert wird und die resultierenden Merkmale entlang der Sequenzdimension angehängt werden, wobei die negative Seite Nullen erhält. Dieses letzte Detail verrät, dass es sich um eine echte Designentscheidung und nicht um bloße Verkabelung handelt: Wenn der negative Zweig dieselben Glyphenmerkmale tragen würde, würde Classifier-Free Guidance in Richtung der Darstellung des Textes und weg vom Prompt gezogen, daher existieren die Nullen, um zu verhindern, dass die beiden Ziele gegeneinander kämpfen. Der Encoder wird nur geladen, wenn der Checkpoint tatsächlich einen byte5/ Unterordner.

Zwei Hinweise zur Ehrlichkeit. Dies ist ein Commit eines Drittanbieter-Inferenz-Frameworks, keine Stellungnahme von Ant Group, und die Auslegung dessen, was diese Dateien bedeuten, ist unsere und nicht die des Anbieters. Und er untermauert eine Designabsicht, kein Ergebnis: Ein vorhandener Glyph-Encoder ist mit guter Textdarstellung vereinbar und kein Beleg dafür, dass die Textdarstellung gut ist. Der einzige unabhängige Qualitätsbeleg ist eine einzelne Leaderboard-Platzierung, die unten erörtert wird.

A pipeline diagram titled "How the glyph encoder enters the pipeline", showing prompt text passing through a tokenizer extended with font and colour markers into a ByT5 glyph encoder whose features are appended along the sequence dimension, with the negative branch receiving zeros so guidance is not pulled away from rendered text, and the result emerging as an RGBA image.

Der Kontrast zu Qwen-Image 3.0 besteht nicht darin, dass Alibabas Modell Text schlecht rendert – niemand außerhalb von Alibaba kann sagen, wie gut es Text rendert, und genau das ist der Punkt. Er besteht darin, dass die Frage „Wie zeichnet dieses Modell Buchstaben?“ für eines dieser Modelle eine Antwort hat und für das andere eine Marketingbehauptung, und die Lücke zwischen einer Antwort und einer Behauptung ist der Ort, an dem Engineering-Entscheidungen getroffen werden.

Die eine Zahl und die Tafel, auf der sie nicht steht

Ming-Image-0.1-Design belegt den ersten Platz im Artificial Analysis Text to Image Leaderboard für UI/UX Design, Open-Weights-Ansicht, mit einer Elo von 1.082 – vor Ideogram 4.0 (Quality) mit 1.052, Ideogram 4.0 mit 1.015, HunyuanImage 3.0 Instruct mit 1.005, FLUX.2 [dev] mit 1.000, FLUX.2 [dev] Flash mit 999 und FLUX.2 [dev] Turbo mit 994. Die Kopie dieser Rangliste ist diejenige, die auf der eigenen Modellkarte wiedergegeben wird, und sie trägt das Branding von Artificial Analysis; niemand hat die Punktzahl unabhängig reproduziert.

The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.

Es ist ein Board für offene Gewichte, daher hat Qwen-Image 3.0 keinen Eintrag, und sein Fehlen sagt nichts über seine Qualität aus. Was es aber sagt, ist struktureller Natur: Ein Blind-Preference-Board kann nur Modelle ranken, deren Gewichte öffentlich sind. Das gibt einem offenen Release eine messbare Position Monate, bevor es ein Produkt hat, und einem geschlossenen Release eine Marketingzahl und sonst nichts. Die Behauptungen von Qwen-Image 3.0 — Lesbarkeit bei 10 Pixeln, Prompts mit 4.500 Token, über 20 Schriftarten — haben überhaupt keine unabhängige Messung hinter sich.

A two-column scoreboard titled "Ming-Image-0.1-Design vs Qwen-Image 3.0 - the scoreboard". Left column Ming-Image-0.1-Design: Weights downloadable, 6.15B; Licence MIT; Text rendering glyph encoder visible; Independent score Elo 1,082; Price self-host; Internals readable. Right column Qwen-Image 3.0: Weights none; Licence not published; Text rendering 10px claim, vendor-reported; Independent score none; Price about $0.04 per image; Internals black box. Footer reads "Qwen-Image 3.0 claims vendor-reported; Ming score per the Artificial Analysis board on its model card.", with the OrcaRouter logo bottom-right.

Wie du das tatsächlich testen würdest und was ein Versuch kostet

Wenn lesbare Schrift der Grund ist, warum Sie dies lesen, dann ist der Test keine Rangliste. Es ist Ihre eigene Schriftart, Ihre eigene Sprache und Ihre eigenen Strings, durch beide Kandidaten laufen gelassen und von einem Menschen gelesen. Für diesen Test muss eines dieser Modelle erreichbar und günstig und das andere herunterladbar sein, und sie werden nach entgegengesetzten Prinzipien bepreist.

• Qwen-Image 3.0 — rund 0,04 US-Dollar pro Bild in der Pro-Edition und rund 0,03 US-Dollar in der Standard-Edition, wobei die Preise für inländische Endkunden bei etwa 0,18 ¥ pro Bild beginnen. Das sind Einführungswerte, die nicht geprüft wurden. Sie können heute Nachmittag eine Prompt-Matrix laufen lassen und pro Aufruf bezahlen.

• Ming-Image-0.1-Design — kein veröffentlichter Preis, da es keinen gehosteten Endpunkt gibt. Der Preis dafür ist ein 71,5 GB großer Download, eine 80-GiB-Karte und Ihre eigene Zeit, und der Nutzen ist, dass Sie denselben Test auf den Glyph-Encoder-Pfad richten und sehen können, ob es diese Komponente ist, die die Arbeit leistet.

Das ist genau die Situation, für die eine Routing-Schicht gebaut ist, und es lohnt sich, präzise zu sein, welcher Teil davon zutrifft. Weder Qwen-Image 3.0 noch Ming-Image-0.1-Design ist auf unserer Plattform, daher kann eine Routing-Schicht heute keinen der beiden hinter einen Schlüssel stellen. Was sie tun kann, ist, den Vergleich ehrlich zu halten, während du ihn durchführst: OrcaRouter stellt 200+ Modelle hinter einem einzigen OpenAI-kompatiblen Endpunkt zum Listenpreis des Anbieters ohne Aufschlag bereit, mit automatischem Failover über Anbieter hinweg, sodass das Modell, dem du bereits vertraust, den Produktionspfad halten kann — und seine Kosten an den Listenpreis des Anbieters gebunden bleiben, sodass eine Preisänderung des Anbieters noch am selben Tag bei uns ankommt —, während ein nicht gemessenes Designmodell daneben statt davor bewertet wird.

Zwei offene Releases, ein geschlossenes und ein Muster

Es lohnt sich festzuhalten, wovon die Ming-Veröffentlichung über sich selbst hinaus Zeugnis ablegt. Ant Group veröffentlichte ohne Ankündigung ein Designmodell mit 6,15 Milliarden Parametern unter MIT-Lizenz, zusammen mit einem zweiten Modell zur Schichtzerlegung unter derselben Lizenz. Alibaba veröffentlichte ein geschlossenes gehostetes Modell ohne Lizenz, ohne Modellkarte und ohne Bericht, das auf dieselbe Art von Arbeit abzielt und pro Bild bepreist wurde.

Das sind zwei verschiedene Wetten darauf, wo der Wert in Designmodellen liegt. Die eine besagt, das Modell sei das Produkt und die Gewichte seien der Vertriebskanal. Die andere besagt, das Modell sei eine Dienstleistung und die Gewichte seien das, was man behält. Beide Wetten können auf demselben Markt richtig sein, und sie liefern sehr unterschiedliche Antworten auf die einzige Frage, die zum Zeitpunkt der Bewertung zählt: Kann ich herausfinden, wie das funktioniert, bevor ich darauf angewiesen bin?

• Wenn Sie wissen müssen, wie Text gerendert wird und warum manchmal nicht, ist Ming-Image-0.1-Design die einzige der beiden, die Ihnen einen Blick ermöglicht, und die MIT-Lizenz bedeutet, dass Sie auf Grundlage dessen, was Sie finden, handeln können.

• Wenn Sie heute einen Produktions-Endpunkt mit einem Preis pro Bild und ohne Infrastruktur benötigen — Qwen-Image 3.0 ist der einzige der beiden, der einen anbietet, und seine Interna sind Teil des Preises.

• Wenn Sie unabhängige Belege brauchen, bevor Sie sich festlegen – keiner von beiden hat genug davon. Der eine hat eine einzige, nicht reproduzierte Platzierung in einer Rangliste; der andere hat ein Anbieter-Angabenblatt, dem keine Zahlen beigefügt sind.

Beobachten muss man, ob das Muster Bestand hat. Eine nicht angekündigte MIT-Veröffentlichung mit einem Glyph-Encoder darin ist eine Aussage darüber, wie ihre Autoren erwarten, dass das Modell genutzt wird – untersucht, lokal ausgeführt, modifiziert. Wenn die nächste Veröffentlichung desselben Teams angekündigt, gebenchmarkt und gehostet wird, war das ein Einzelfall. Wenn es ein weiteres stilles Repository ist, hat die Design-Modell-Kategorie einen zweiten offenen Wettbewerber, und die geschlossene Hälfte des Marktes hat ein Preisproblem, das sie im Juli nicht hatte.