
Qwen-Image-2.1 führt beide Bild-Arenas an: Was das #1-Open-Source-Label verbirgt
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Das Team hinter Qwen-Image-2.1 dankte der Arena für die Anerkennung, und die Anerkennung ist echt. Qwen-Image-2.1 ist das Modell mit der höchsten Punktzahl auf beiden Arena-Bild-Boards, die die Boards nicht als Proprietary kennzeichnen: 1.367 bei Image Edit und 1.228 bei Text-to-Image, im Snapshot vom 22. September 2026. Jede Zeile darüber trägt auf beiden Boards ein Proprietary-Tag. Drei Fakten, die die Ankündigung nicht enthält, sind ebenso überprüfbar wie die Behauptung selbst – der Gesamtrang, den diese Punktzahlen erkaufen, die Preliminary-Kennzeichnung, mit der beide Zeilen daherkommen, und ein Lizenz-String mit dem Wortlaut qwen-research statt des Apache 2.0 seiner früheren Bildmodelle. Die Behauptung übersteht den Kontakt mit den Boards. Sie sagt nur weniger, als die Schlagzeile impliziert.
Die beiden Boards Seite an Seite lesen
Arena-Punktezahlen sind Bewertungen im Elo-Stil, die auf blinden paarweisen Abstimmungen basieren: Eine Person sieht zwei Ausgaben, weiß nicht, welches Modell welche erzeugt hat, und wählt aus. Das ist eine kategorial andere Evidenzklasse als ein Anbieter-Benchmark, weshalb eine Behauptung, die darauf beruht, es wert ist, überprüft statt wiederholt zu werden. Beide Ranglisten wurden am 22. September 2026 erfasst, und beide wurden Zeile für Zeile gelesen statt aus der Ranglistengrafik überflogen.

Das Image-Edit-Board listet 56 Modelle und 29.902.508 Stimmen. Qwen-Image-2.1 belegt Rang 16 mit einer Punktzahl von 1.367, einem Konfidenzintervall von ±9 und 4.841 Stimmen. Die fünfzehn Zeilen darüber – von gpt-image-2.5-sunburst mit 1.526 bis hinunter zu gpt-image-1.5-high-fidelity mit 1.370 – sind alle Proprietär. Dasselbe gilt für die beiden Zeilen direkt darunter, reve-2.0 mit 1.358 und uni-1.1-max mit 1.334.

Das Text-to-Image-Board listet am selben Tag 79 Modelle und 6.258.152 Stimmen auf. Qwen-Image-2.1 belegt Rang 17 mit 1.228, einem Konfidenzintervall von ±11 und 2.843 Stimmen. Dasselbe Muster: Die sechzehn Zeilen darüber sind Proprietary, und die erste Nicht-Proprietary-Zeile darunter ist ideogram-4.0-quality mit 1.204, gekennzeichnet als Ideogram Open Model.
Zwei Details aus diesen Zeilen lohnt es sich hervorzuheben, denn sie laufen der Art und Weise zuwider, in der die Behauptung üblicherweise wiederholt wird.
• Rang und Punktzahl erzählen unterschiedliche Geschichten — 1.367 ist die beste nicht-proprietäre Zahl auf dem Bildbearbeitungs-Board und zugleich der sechzehnte Platz, 159 Punkte hinter dem Führenden und 3 Punkte vom fünfzehnten Platz entfernt.
• Auf einem Board gewinnt Alibabas eigenes geschlossenes Modell — qwen-image-3.0-pro, als proprietär gekennzeichnet, liegt bei Text-to-Image bei 1.254, sechsundzwanzig Punkte über den 1.228 von qwen-image-2.1. Auf dem Bearbeitungs-Board schlägt das offene Modell das frühere proprietäre qwen-image-2.0-pro-2026-06-22 bei 1.304. Der hauseigene Champion ist nicht auf beiden Boards dasselbe Modell.
• Der Abstand zum nächsten offenen Modell ist auf dem einen Board groß und auf dem anderen gering — auf Image Edit ist die nächste nicht-proprietäre Zeile hunyuan-image-3.0-instruct bei 1.302, fünfundsechzig Punkte dahinter; bei Text-to-Image ist es ideogram-4.0-quality bei 1.204, vierundzwanzig Punkte dahinter.
Der Lizenz-String übernimmt mehr Arbeit als das Ranking
Jede Arena-Zeile trägt eine Organisations- und Lizenzbezeichnung. Die von Qwen-Image-2.1 lautet Alibaba · qwen-research auf beiden Boards. Das ist nicht die Apache-2.0-Kennzeichnung der früheren Bildmodelle von Alibaba: qwen-image-edit mit 1.241 und qwen-image-edit-2511 mit 1.235 auf dem Editing-Board sind beide als Apache 2.0 gekennzeichnet, ebenso wie qwen-image-2512 mit 1.125 und qwen-image mit 1.057 bei Text-to-Image. Der Blogbeitrag des Anbieters schließt denselben Kreis und veröffentlicht die Gewichte unter der Qwen Research License Agreement vom 20. September 2026, die Forschung und Evaluierung, aber keine kommerzielle Nutzung erlaubt.
Die ehrliche Lesart von „#1 Open-Source-Modell“ ist also enger, als sie klingt. Nach der eigenen Zweiteilung des Boards – proprietär oder nicht – steht Qwen-Image-2.1 an erster Stelle. Nach der OSI-Definition von Open Source, die keine Nutzungsfeldbeschränkung akzeptiert, ist es überhaupt nicht Open Source, und das gilt auch für die meisten Modelle, mit denen es verglichen wird: dieselben Boards führen Zeilen mit der Bezeichnung flux-non-commercial-license, tencent-hunyuan-community, krea-2-community-license und Ideogram Open Model. Der „Open Source“-Filter der Arena ist ein grober Schalter zwischen proprietär und nicht proprietär. Er ist nützlich. Er ist keine Lizenzprüfung.
Diese Unterscheidung ist hier wichtiger als die Zwei-Punkte-Abstände, denn sie ist das Einzige, was sich mit einer weiteren Woche an Stimmen nicht ändern kann. Wenn Sie heute ein permissiv lizenziertes Bildmodell aus dieser Familie möchten, sind die Apache-2.0-Zeilen qwen-image-edit und qwen-image-edit-2511 – beide älter und beide mehr als einhundertzwanzig Punkte niedriger auf derselben Bearbeitungs-Rangliste (1.241 und 1.235 gegenüber 1.367). Das bestbewertete offen gekennzeichnete Qwen-Bildmodell und das kommerziell nutzbare Qwen-Bildmodell sind nicht derselbe Download.
Vorläufig bedeutet, dass sich die Zahl noch ändern kann.
Beide Zeilen von Qwen-Image-2.1 tragen die Preliminary-Markierung des Leaderboards, die die Arena vergibt, wenn eine Zeile noch nicht genügend Stimmen gesammelt hat, um die Punktzahl als gesichert zu betrachten. Die Stimmenzahlen sind der Grund: 4.841 Stimmen gegenüber einer Gesamtsumme des Leaderboards von 29.902.508 bei Image Edit und 2.843 gegenüber 6.258.152 bei Text-to-Image. Im Vergleich dazu tragen die umliegenden Zeilen deutlich mehr – gpt-image-1.5-high-fidelity hat 589.013 Stimmen auf dem Editing-Leaderboard, und qwen-image-2.0-pro-2026-06-22 hat 307.705 auf dem Text-to-Image-Leaderboard.
Ein ±9- und ein ±11-Konfidenzintervall bei einem drei Tage alten Modell sind kein Warnzeichen; so sieht eine neue Veröffentlichung aus. Aber es bedeutet, dass sich die konkrete Reihenfolge an der Spitze der offenen Kategorie verschieben kann, während Stimmen eingehen, insbesondere bei Text-to-Image, wo der Vorsprung gegenüber der nächsten offenen Zeile 24 Punkte beträgt.
Was das Modell ist, auf dem eigenen Datenblatt des Anbieters
Alibabas eigene Beschreibung beschreibt ein einheitliches Text-zu-Bild- und Bearbeitungsmodell mit einer 7B-Parameter-Komponente zur visuellen Generierung, die aus 32 Single-Stream-DiT-Schichten aufgebaut ist, native Generierung und Bearbeitung transparenter Bilder, Unterstützung für bis zu 10 Referenzbilder und eine native Ausgabeobergrenze von 2048×2048 – der Download der vollständigen Pipeline umfasst etwa 33 GB. Die Transparenzunterstützung ist der am wenigsten verbreitete Punkt auf dieser Liste; das Editing-Board der Arena misst sie nicht offensichtlich, daher ist ein Rang auf diesem Board kein Beleg – weder dafür noch dagegen – für genau diese Fähigkeit.
Der wichtigste Benchmark des Anbieters ist Qwen-Image-Bench, bei dem das Modell mit 60,28 angegeben wird, vor Nano Banana 2.0 mit 59,82 und GPT Image 1.5 mit 59,65. Das ist eine vom Anbieter durchgeführte Evaluierung ohne Reproduktion durch Dritte, und die Vorsprünge liegen unter einem Punkt – eine Spanne, die einen Wechsel des Prompt-Sets nicht überstehen würde. Es lohnt sich, es klar zu sagen: Die oben genannten Arena-Zahlen sind die Stimmen anderer Leute, und die Qwen-Image-Bench-Zahlen sind Alibabas eigene. Sie sind nicht dieselbe Art von Beleg und sollten nicht zu einem Gesamteindruck des Modells zusammengerechnet werden.
Deployment-Unterstützung kam mit dem Release statt danach: Day-zero-Integrationen für das Modell existieren in ComfyUI, SGLang, vLLM-Omni, LightX2V und der Diffusers-Bibliothek, was bedeutet, dass die praktische Frage für die meisten Teams nicht ist, ob das Modell bereitgestellt werden kann, sondern ob die Bereitstellungskosten passen.
Wie eine Behauptung wie diese ankommt, wenn du diese Woche eine Bild-API brauchst
Hier ist es wichtig, präzise bezüglich unserer eigenen Position zu sein. OrcaRouter routet Qwen-Image-2.1 nicht, ebenso wenig irgendein Qwen-Image-Modell irgendeiner Version. Wenn die Arena-Ergebnisse Sie überzeugt haben: Das Modell ist über die eigene API des Anbieters und mehrere Drittanbieter-Plattformen erreichbar – oder als selbst gehosteter Download –, nicht über uns. Wir haben keine Qwen-Bild-Route, die wir Ihnen verkaufen könnten, und der Rang auf dem Board ist kein Grund, etwas anderes vorzugeben.
Was wir routen, ist der übrige Teil des Image-Tiers, den diese Boards einordnen, und mehrere der Zeilen über Qwen-Image-2.1 sind darin enthalten. OpenAIs GPT-Image-2, GPT-Image-1.5 und GPT-Image-1-mini sind verfügbar, ebenso Googles Imagen-4-Tiers und die Gemini-Bildvorschau-Endpunkte sowie xAIs Grok-Imagine-Bildendpunkt. Diese Mischung ist die praktische Antwort auf eine Behauptung wie diese. Hätte die Arena ein offenes Modell direkt an die Spitze gesetzt, wäre das Umschalten eine einzeilige Codeänderung an einem einzigen Key. Das hat sie nicht getan – die Spitze beider Boards ist proprietär, und die interessante Entscheidung liegt zwischen einem Download unter Research-Lizenz und einem gehosteten Endpunkt, den man heute aufrufen kann.
Drei Eigenschaften der Plattform sind für diese Entscheidung wichtig. Das Routing läuft über einen einzigen OpenAI-kompatiblen Endpunkt über 200+ Modelle hinweg, sodass der Vergleich der gehosteten Zeilen untereinander weder einen zweiten Vertrag noch ein zweites SDK bedeutet. Der Listenpreis des Anbieters wird ohne Aufschlag durchgereicht, was bedeutet, dass eine Preisänderung eines Anbieters Ihre Rechnung am selben Tag erreicht, an dem sie angekündigt wird, statt erst bei der nächsten Vertragsverlängerung. Und automatisches Failover über Anbieter hinweg bedeutet, dass ein neues, dünn bewertetes Modell hinter einem etablierten in einer Fallback-Kette stehen kann, anstatt am dritten Tag zu einer Produktionsabhängigkeit zu werden – was ungefähr dem entspricht, wo Qwen-Image-2.1 gerade jetzt steht.
Die Behauptung ist wahr und dünner, als sie sich liest.
Was Alibaba gepostet hat, ist überprüfbar: In der Momentaufnahme vom 22. September 2026 beider Arena-Bild-Ranglisten ist Qwen-Image-2.1 das bestbewertete Modell, das nicht mit dem Tag Proprietary versehen ist. Was der Beitrag unterschlägt, ist alles, was diese Aussage einschränkt – Platz 16 und 17 in der Gesamtwertung, eine vorläufige Punktzahl auf Basis einiger tausend Stimmen und eine Research-Lizenz als Ersatz für die Open-Source-Lizenz, die die Formulierung nahelegt.

Nichts davon schmälert das Ergebnis. Drei Tage nach der Veröffentlichung der erste nicht-proprietäre Eintrag in beiden Bestenlisten zu sein, ist eine echte Veränderung der Position, an der die offene Kategorie steht – die permissiv lizenzierten Qwen-Bildmodelle, die vor ihm veröffentlicht wurden, liegen auf derselben Editing-Bestenliste um mehr als einhundertzwanzig Punkte zurück. Es ist nur nicht dieselbe Aussage wie „das beste Bildmodell, das Open Source ist“, und der Unterschied besteht in einer Lizenzzeile und einer Rangspalte, die man in etwa einer Minute prüfen kann.
