Hero-Karte für den Vergleich zwischen Qwen-Image 2.1, einem Open-Weights-Modell ohne unabhängige Bewertung, und MAI-Image-2.5-Pro, dem gemessenen Spitzenreiter der Artificial Analysis Arena für Bildbearbeitung bei Elo 1.272
Guides & Insights

Qwen-Image 2.1 vs. MAI-Image-2.5-Pro: 6.100 Blindstimmen gegen null

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Eines dieser beiden Modelle wurde durch ungefähr 6.100 blinde menschliche Vergleiche bewertet. Das andere wurde von niemandem außerhalb seines eigenen Labors bewertet. MAI-Image-2.5-Pro, Microsofts Premium-Bildmodell, steht mit einer Elo von 1.272 auf Platz eins der Artificial-Analysis-Arena für Bildbearbeitung – das Ergebnis mit den meisten Stimmen in dieser Kategorie. Qwen-Image 2.1, das das Qwen-Image-Team am 20. September 2026 quelloffen veröffentlicht hat, hat überhaupt keinen unabhängigen Score und wird auch keinen bekommen, bis genügend Leute es öffentlich ausführen, um Stimmen zu generieren. Diese Lücke ist das eigentliche Thema dieses Vergleichs, denn sie ist der einzige Unterschied zwischen den beiden Modellen, der keine Herstellerbehauptung ist. Alles andere – die Architektur, die Auflösung, der Preis – ist bekannt, aber unbewiesen, und die beiden Modelle liegen auf dem Papier nah genug beieinander, dass die Messlücke die Entscheidung bestimmen sollte.

Was die Stimmen tatsächlich sagen – und was nicht

Artificial Analysis führt blinde Paarvergleiche durch: Zwei Modelle erhalten denselben Prompt, die Abstimmenden wählen die bessere Ausgabe, und aus den Ergebnissen ergibt sich die Elo-Zahl. Es ist kein perfektes Instrument, aber es kommt einem gemeinsamen Punktestand in dieser Kategorie am nächsten, und die Stichprobengröße zählt genauso viel wie die Zahl.

MAI-Image-2.5-Pro — Bildbearbeitung auf Platz 1 mit Elo 1.272 bei ungefähr 6.100 Vergleichen. Bei Text-zu-Bild liegt es mit Elo 1.292 auf Platz 7, hinter GPT Image 2 (high) mit 1.369, Reve 2.1 mit 1.322, Nano Banana 2 mit 1.320, GPT Image 1.5 (high) mit 1.310 und MAI-Image-2.5 mit 1.304.

Qwen-Image 2.1 — kein Eintrag auf keiner der beiden Ranglisten. Keine niedrige Punktzahl; keine Punktzahl. Die Veröffentlichung ist zum Zeitpunkt des Verfassens einen Tag alt.

Die Form dieser Zahlen ist es wert, sorgfältig gelesen zu werden, denn sie entspricht nicht der Form, die das Marketing suggeriert. Microsofts Modell ist beim Editing tatsächlich auf Platz eins und bei der Generierung tatsächlich auf Platz sieben. Das ist eine konkrete, verteidigungsfähige Position – ein Editing-Spezialist, der seine Kategorie anführt – und es ist etwas anderes, als das beste Bildmodell zu sein, was es nicht ist. Das Modell, das es bei Text-to-Image schlägt, ist GPT Image 2 (high), das ebenfalls nicht das neueste OpenAI-Modell in diesem Bereich ist. Unabhängige Ranglisten belohnen das Modell, das am häufigsten gemessen wurde, und in diesem Duell ist das eindeutig das von Microsoft.

Die eine Spezifikation, bei der das offene Modell klar gewinnt

Es gibt einen konkreten, nicht-subjektiven Unterschied zwischen diesen beiden, und er ist die Auflösung.

Qwen-Image 2.1generiert nativ in 2K, mit 2048×2048 als dokumentiertem Standard bei 40 Inferenzschritten, sieben Voreinstellungen für Seitenverhältnisse und RGBA-Ausgabe mit einem echten Alphakanal statt einer Matte.

MAI-Image-2.5-Pro begrenzt die Ausgabe auf 1.048.576 Pixel – etwa ein Megapixel. Seine Spitzenwerte in den technischen Daten liegen woanders: 32.000 Text-Eingabe-Token, ein Kontextfenster von 131k und 4.096 Ausgabe-Token – eine Aussage darüber, wie viele Anweisungen es aufnehmen kann, nicht darüber, wie viel Bild es ausgeben kann.

Für die meisten Social-Media- und Produktarbeiten ist eine Obergrenze von einem Megapixel keine Einschränkung. Für den Druck, für das Compositing im Großformat, für alles, wo ein Beschnitt Bestand haben muss, ist sie es. Das ist die einzige Dimension im gesamten Vergleich, in der man auf eine Zahl zeigen und sagen kann, das offene Modell liege vorne — und wohlgemerkt: Das ist eine architektonische Tatsache aus der Modellkarte, keine Qualitätsaussage. Qwen-Image 2.1 rendert mit 2048×2048, egal, ob dabei etwas Sehenswertes herauskommt.

Der Preis, und genau hier wird der Vergleich unangenehm.

MAI-Image-2.5-Pro ist als Premiummodell bepreist, und die Zahlen sind alles andere als subtil: 5 US-Dollar pro Million Text-Eingabe-Tokens, 8 US-Dollar pro Million Bild-Eingabe-Tokens und 106 US-Dollar pro Million Bild-Ausgabe-Tokens. Bei einer Ausgabe mit 1024 Pixeln ergibt das ungefähr 108,50 US-Dollar pro tausend Bilder. Zum Vergleich: Das ist etwa das 2,3-Fache der Kosten von MAI-Image-2.5 und ungefähr das 5,4-Fache von MAI-Image-2.5-Flash, sodass Microsoft seine eigene Produktlinie bewusst segmentiert hat, statt die Pro-Stufe als inkrementelles Upgrade zu bepreisen.

Qwen-Image 2.1 hat keinen Hosting-Preis, denn es gibt keinen gehosteten Endpunkt – es ist ein Download von Gewichten unter einer Forschungslizenz. Seine Kosten sind deine GPU-Zeit, und seine Einschränkung ist, dass du das, was es erzeugt, nicht legal verkaufen kannst. 108,50 $ pro tausend Bilder mit „kostenlosen Gewichten“ zu vergleichen, heißt, einen Dienst mit einer Maschine zu vergleichen, und die ehrliche Version dieses Vergleichs lautet: Der nutzungsabhängige Preis verschafft dir ein gemessenes, unterstütztes, kommerziell lizenziertes Modell, und die Gewichte verschaffen dir einen 33-GB-Download und eine Lizenzdatei, in der steht: nur nichtkommerziell.

Genau hier verdient sich eine Routing-Schicht ihren Platz. OrcaRouter stellt 200+ Modelle hinter einem einzigen OpenAI-kompatiblen Endpoint zum Listenpreis des Anbieters ohne Aufschlag bereit, mit automatischem Failover über Anbieter hinweg — sodass ein Team, das ein nicht vermessenes offenes Modell evaluieren möchte, die Produktion nicht darauf umstellen muss, und da der Listenpreis durchgereicht wird, landet jede Preisänderung eines Anbieters bei einem gerouteten Modell noch am selben Tag auf unserer Seite statt erst bei der nächsten Vertragsverlängerung. Weder MAI-Image-2.5-Pro noch Qwen-Image 2.1 gehört zu den Modellen, die wir heute routen, und dieser Beitrag wird nichts anderes nahelegen. Die Bildlinie, die wir tatsächlich anbieten, ist OpenAIs GPT-Image-Familie, Googles Imagen-4-Stufen und Gemini-Bildvorschauen sowie xAIs Grok-Imagine-Bildendpoint.

Two-column scoreboard for Qwen-Image 2.1 and MAI-Image-2.5-Pro: Qwen-Image 2.1 rows read Released 20 Sept 2026 / Licence research-only, non-commercial / Editing score none / Text-to-image score none / Output 2048x2048 native, RGBA / Price self-host, no hosted endpoint; MAI-Image-2.5-Pro rows read Announced 23 July 2026 / Licence commercial, via Microsoft / Editing score AA #1, Elo 1,272, about 6,100 votes / Text-to-image score AA #7, Elo 1,292 / Output capped at 1,048,576 pixels / Price about $108.50 per 1,000 images; footer reads 'MAI figures per Artificial Analysis; Qwen-Image 2.1 has no independent score yet.'

Wo die Herstellerangaben stehen und wie viel Gewicht man ihnen beimessen sollte

Beide Anbieter veröffentlichen Zahlen, die kein Dritter reproduziert hat, und sie sollten in beide Richtungen mit derselben Skepsis gelesen werden.

Microsofts Behauptungen — 96,8 % Genauigkeit bei der Textwiedergabe über Englisch, Chinesisch, Japanisch, Koreanisch und Spanisch hinweg; 27 % bessere Prompt-Treue als GPT-Image-1.5; 94 % Figurenkonsistenz über mehrere Bilder hinweg; und bis zu 84–89 % niedrigere GPU-Kosten in bestimmten Microsoft-internen Szenarien. Beim letzten Punkt ist Vorsicht angebracht: Er beschreibt Microsofts eigene Serving-Konfiguration, nicht etwas, das ein Kunde überprüfen kann.

Alibabas Angaben — der Blogbeitrag zu Qwen-Image 2.1 enthält ein Vergleichsdiagramm zum Qwen-Image-Bench, und die darin genannten Zahlen stammen vom Anbieter selbst. Außerdem kursiert in der Berichterstattung Dritter eine Angabe, die das Modell als 20-schichtigen Transformer beschreibt, was der 32-schichtigen Single-Stream-DiT der Model Card widerspricht; die Model Card ist die primäre Quelle, und die Angabe mit 32 Schichten ist die zu verwendende.

Der Unterschied zwischen den beiden Situationen liegt nicht in der Ehrlichkeit des einen oder anderen Anbieters. Er liegt darin, dass Microsofts Modell unabhängig gemessen wurde und Alibabas nicht, sodass Microsofts Behauptungen an etwas überprüft werden können und Alibabas Behauptungen noch an nichts überprüft werden können.

Wofür jedes einzelne da ist

Zusammengelesen konkurrieren diese nicht um denselben Platz.

MAI-Image-2.5-Pro ist das Bearbeitungsinstrument. Es führt das Bearbeitungs-Board auf einer großen Abstimmungsbasis an, es akzeptiert eine lange Anweisung (32k Text-Eingabe-Tokens, 131k Kontext), es ist kommerziell lizenziert und jetzt als öffentliche Vorschau auf Microsoft Foundry und im MAI Playground verfügbar. Wenn Ihre Arbeit iterative Bildkorrektur ist und Sie vor Ihrer Entscheidung wissen müssen, dass es die beste verfügbare Lösung für diese Aufgabe ist, ist dies die gemessene Antwort, und es kostet etwa 108,50 $ pro tausend Bilder.

Qwen-Image 2.1 ist das offene Forschungsartefakt. Es rendert größer, es liefert einen inspizierbaren Checkpoint zur Prompt-Umschreibung zusammen mit dem Bildmodell, es akzeptiert bis zu 10 Referenzbilder mit lokalen Bearbeitungen per Kreis, gemalter Annotation oder Maske, und es ist kostenlos zum Herunterladen und illegal zu verkaufen mit. Wenn Ihre Arbeit Evaluation, Benchmarking oder das Aufbauen auf Gewichten ist, die Sie lesen können, ist es das interessantere Objekt – und Sie leisten diese Arbeit ohne ein Leaderboard, das Ihnen sagt, ob es überhaupt gut ist.

Es gibt außerdem eine zeitliche Asymmetrie, die es wert ist, benannt zu werden. MAI-Image-2.6 ging am 19. August 2026 in die private Vorschau, was bedeutet, dass das Modell an der Spitze des Editing-Boards bereits eine Generation hinter dem zurückliegt, was Microsoft auszuliefern vorbereitet. Qwen-Image 2.1 hingegen steht am ersten Tag, mit einem Early-Access-Programm, das seine Tester aufforderte, bis zum 29. September zu veröffentlichen. Beide Scoreboards in diesem Vergleich werden binnen eines Monats anders aussehen.

Screenshot of the Artificial Analysis text-to-image leaderboard captured September 9 2026, showing GPT Image 2 (high) first at Elo 1,178 with MAI-Image-2.5-Pro listed at No. 7 with Elo 1,292, and no Qwen-Image 2.1 entry anywhere on the boardScreenshot of the Qwen vendor blog page for Qwen-Image-2.1, captured in English, headlined 'Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation', dated 2026/09/20, with download links to GitHub, Hugging Face and ModelScope and the four headline improvements listed as compact and efficient, native transparency with unified creation and editing, versatile editing with up to 10 reference images, and realistic textures

Was würde es klären

Eines noch: Qwen-Image 2.1 erscheint auf einem Leaderboard. Alles in diesem Artikel, das nicht die Auflösungsobergrenze oder der Preis ist, ist eine Behauptung des einen oder des anderen Labors, und der ganze Grund, warum MAI-Image-2.5-Pro mit ernster Miene empfohlen werden kann, ist, dass 6.100 Leute, die nicht für Microsoft gearbeitet haben, sich seine Ausgabe neben etwas anderem angesehen und sie bevorzugt haben. Das ist der Maßstab, den das offene Modell nicht erfüllt hat, und der Maßstab, an dem es gemessen werden sollte.

Bis dahin ist die praktische Einschätzung einfach. Wenn Sie heute ein Bearbeitungsmodell brauchen, unter einer kommerziellen Lizenz, mit einer Bestenliste dahinter, ist die Antwort Microsofts, und es kostet etwa 108,50 US-Dollar pro tausend Bilder. Wenn Sie herausfinden wollen, ob ein 7B-Open-Weights-Modell mit nativer 2K-Ausgabe und einem überprüfbaren Prompt-Rewriter besser ist, müssen Sie selbst messen – und das Nützlichste, was Sie mit dem Ergebnis tun können, ist, es zu veröffentlichen, denn der gesamten Kategorie fehlt derzeit ein Datenpunkt.