
Qwen-Image-2.1 ist das beste Open-Weights-Bildmodell auf beiden Artificial-Analysis-Boards.
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 223 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Alibaba's Qwen team released Qwen-Image-2.1 with open weights on 20 September 2026. Twelve days later, the independent scoreboards have caught up with it, and the result is more interesting than the launch. On the AA-Image-T2I v2.0 leaderboard, Qwen-Image-2.1 sits at rank 18 of 166 with an Elo of 1,034, from 5,286 blind comparisons. On AA-Image-Editing v2.0 it sits at rank 18 of 97 with an Elo of 1,074, from 5,536. Both of those rows are marked Open Weights on a board that marks every model individually. No other model carrying that marker on either board is placed above them. That is the whole finding: on the only two public image boards that score models by blind pairwise comparison, the released Qwen-Image-2.1 is the strongest set of downloadable weights in the field, and it is Qwen-Image-2.1 specifically, not a preview of it, that holds both positions.
Im Folgenden geht es darum, woher diese beiden Zahlen stammen, wie die Zeilen um sie herum aussehen und um die drei Details auf dem Board, die die meisten Berichte zum Launch ausgelassen haben – angefangen mit der Tatsache, dass das Board nirgendwo eine API für das Modell verzeichnet.
Wo die zwei Reihen sitzen
Artificial Analysis erstellt beide Ranglisten aus blinden Paarvergleichen: Zwei Modelle beantworten denselben Prompt, ein Bewerter wählt die bessere Ausgabe, und aus der Aggregation ergibt sich ein Elo-Wert. Die beiden Ranglisten teilen einen einheitlichen Stil und sonst nichts. Sie bewerten unterschiedliche Aufgaben, sie haben unterschiedliche Populationen, und ihre Elo-Werte sind nicht miteinander vergleichbar. Qwen-Image-2.1 landet zufällig in beiden auf demselben Rang, was ein Zufall zweier unterschiedlicher Verteilungen ist.
Text-zu-Bild, 166 Modelle auf dem Board:
• Die oberste Zeile der Rangliste ist GPT Image 2.5 Sunburst (max) mit 1.107 Elo aus 14.023 Auftritten – ein proprietäres Modell mit mehr als dem doppelten Stichprobenumfang von Qwen-Image-2.1.
Qwen-Image-2.1 liegt mit 1.034 Elo und einem 95%-Konfidenzintervall von 1.024 bis 1.044 bei 5.286 Auftritten auf Rang 18.
• Lesen Sie die Zeilenanzahlen, bevor Sie die Ränge lesen. Qwen-Image-2.1 steht in beiden Ranglisten auf Rang 18, doch diese Ränge stammen aus unterschiedlichen Grundgesamtheiten – 166 Modelle bei Text-zu-Bild, 97 bei der Bearbeitung – und die beiden Elo-Werte gehören zu zwei getrennten Skalen. Der identische Rang ist Arithmetik, kein Beleg dafür, dass die beiden Ranglisten in irgendeinem Punkt übereinstimmen.
• Alibaba's own two Pro-tier models are above it on this board: Qwen-Image-3.0-Pro at 1,089 Elo, rank 14, and Qwen-Image-3.0 at 1,075, rank 16. Neither carries the Open Weights marker. The board's September snapshot lists both as July 2026 releases, which is the version of the story where the newest Qwen image model is not the highest-scoring one — and on text-to-image it is not.
Bildbearbeitung, 97 Modelle auf dem Board:
• GPT Image 2.5 Sunburst (max) führt auch diese Rangliste an, mit 1.182 Elo aus 17.899 Auftritten.
• Qwen-Image-2.1 liegt auf Rang 18 mit 1.074 Elo, Intervall 1.065 bis 1.083, aus 5.536 Auftritten – eine etwas größere Stichprobe als seine Text-zu-Bild-Zeile, was Sinn ergibt für ein Modell, dessen Bearbeitungsseite die lautere Launch-Copy bekommen hat.
• Die umliegenden Zeilen sind dicht gedrängt. grok-imagine-image liegt einen Platz darunter bei 1.071 und Luma UNI 1 Max bei 1.069. Die nächstgelegene Zeile mit offenen Gewichten unterhalb davon auf dieser Rangliste ist HunyuanImage 3.0 Instruct mit 1.066 bei 5.221 Auftritten — 8 Elo dahinter. Sieben Zeilen liegen innerhalb von achtzehn Elo-Punkten.
Die Behauptung „Top-Open-Weights-Modell“ ehrlich lesen
Die Formulierung in der Schlagzeile leistet eine bestimmte Arbeit, und sie verdient es, überprüft statt wiederholt zu werden.
• Es ist ein Rang unter den markierten Einträgen, kein Gesamtrang. Qwen-Image-2.1 belegt insgesamt auf beiden Boards Platz 18. Das Label „Open Weights“ ist dafür verantwortlich, dass es auf jedem Board an erster Stelle steht, und das Label wird pro Modell nach dem eigenen Ermessen des jeweiligen Boards vergeben — 47 Text-zu-Bild-Zeilen tragen den Marker; auf dem Editing-Board, das 97 auflistet, tragen 36 Zeilen ihn.
• The marker describes weights, not terms. Qwen-Image-2.1 ships under the Qwen Research License Agreement dated 20 September 2026, which grants rights for non-commercial purposes only. The board's Open Weights label is accurate about downloadability and silent about what you may do with the download. Anyone reading "top open-weights image model" as "free to use in a product" has read the label past its meaning.
• Es ist eine Momentaufnahme, keine endgültige Rangliste. Die Rangliste verschiebt sich täglich, während Stimmen hinzukommen. Die Konfidenzintervalle von Qwen-Image-2.1 liegen bei ±10 Elo für Text-zu-Bild und ±9 für die Bearbeitung; die darunter liegenden Zeilen liegen auf überlappenden Intervallen. Betrachten Sie die Position als aktuell und nicht als dauerhaft.
Das Detail, das in der Launch-Berichterstattung fehlte: keine API
Beide Qwen-Image-2.1-Zeilen tragen einen expliziten „Keine API verfügbar“-Hinweis. Das ist ein echter Kostenfaktor für das Ranking, und es verrät etwas darüber, wer die 5.286 und 5.536 Stimmen erzeugt hat – wenn es keinen Endpunkt gibt, an den man einen Prompt richten kann, stammten die Vergleiche von Leuten, die die Gewichte selbst ausführten und Ausgaben einreichten. Unabhängiges Elo für ein ausschließlich selbst gehostetes Modell ist eine wirklich schwierigere Messung als Elo für etwas, das jeder aufrufen kann, und deshalb sind die Stichproben hier nur ein Drittel so groß wie die obersten Zeilen.
Für einen Entwickler ist die Form davon vertraut: Das stärkste herunterladbare Bildmodell im Feld ist nicht das, das man heute aufrufen kann. Praktisch gesehen teilt das die Arbeit auf. Entweder hostet man Qwen-Image-2.1 selbst auf eigener Hardware, oder man ruft eines der Modelle drumherum in diesem Board auf. Bei der zweiten Option zahlt sich Routing aus — eine API über 200+ Modelle mit durchgereichtem Listenpreis des Anbieters ohne Aufschlag, automatisches Failover, wenn ein Anbieter schwächelt, und eine Routing-DSL, um mehrere Modelle zu einem einzigen Aufruf zusammenzusetzen. OrcaRouter bietet Qwen-Image-2.1 heute nicht an; die Bildlinien auf der Plattform sind Googles Imagen-Stufen und Gemini-Bildvorschauen, xAIs Grok-Imagine-Bildendpunkt und OpenAIs GPT-Image-Familie. Auf diesem Board ist das die Zeile GPT Image 2.5 Sunburst ganz oben, und das ist eine legitime Antwort auf „Ich will die beste Punktzahl und ich will es heute Nachmittag aufrufen können."

Worauf auf dem Board zu achten ist
Drei Dinge werden diese Story voranbringen, und alle drei sind bereits auf den Boards sichtbar.
The first is whether an API appears. If Alibaba or a serving partner puts Qwen-Image-2.1 behind an endpoint, the No API available note disappears, vote volume should climb toward the size of the neighbouring rows, and the confidence interval tightens. A tighter interval on a 1,034 or a 1,074 is a much stronger claim than the current one.
The second is Alibaba's own stack. Qwen-Image-3.0-Pro at 1,089 and Qwen-Image-3.0 at 1,075 both outrank Qwen-Image-2.1 on text-to-image while carrying no Open Weights marker. If Qwen-Image-2.1 is meant to be the downloadable counterpart to that line rather than its successor, the interesting question is whether the gap narrows — and on the editing board it already has, where Qwen-Image-3.0-Pro leads Qwen-Image-2.1 by two Elo points.
Das Dritte ist die Lizenz. Jede Open-Weights-Zeile auf beiden Boards kommt gleichermaßen für das Label infrage, und die Lizenzen dahinter sind nicht im Entferntesten gleichwertig. Das Board wird Ihnen das nie sagen. Es ist die eine Spalte, die die Anzeigetafel nicht hat.

FAQ
Ist Qwen-Image-2.1 das beste Open-Weights-Bildmodell?
Auf diesen beiden Ranglisten, ja — sie ist die Zeile mit dem höchsten Elo, die auf beiden den Marker „Open Weights“ trägt, mit 1.034 bei Text-to-Image und 1.074 bei Editing. Insgesamt belegt sie auf jeder Platz 18 — und die 18 ist ein Rang innerhalb von 166 Zeilen auf der einen Rangliste und innerhalb von 97 auf der anderen, der für zwei Elo-Skalen steht, die nicht miteinander verglichen werden können. Die Behauptung gilt nur, wenn beide Qualifikatoren angehängt bleiben.
Warum zeigen die beiden Boards für dasselbe Modell unterschiedliche Elo-Werte an?
Sie bewerten unterschiedliche Aufgaben gegen unterschiedliche Modellpopulationen. Ein Text-zu-Bild-Elo und ein Bearbeitungs-Elo sind zwei getrennte Skalen; der Vergleich von 1.034 mit 1.074 misst die Bestenlisten, nicht das Modell.
Kann ich Qwen-Image-2.1 über eine API aufrufen?
Both board rows record No API available. The weights are downloadable from Alibaba's repositories, so the model runs — it just does not have a hosted endpoint that the board has credited with serving it.
Wenn du heute eine Zahl statt eines Downloads willst, ist die Spitze beider Ranglisten über die eigenen APIs der Anbieter abrufbar, und die GPT-Image-Reihe, Googles Imagen-Stufen und xAIs Grok Imagine sind die Bildmodelle, die OrcaRouter direkt bereitstellt. Behalte die Gewichtsdatei für das Experiment und den Endpunkt für die Deadline.
