
Qwen-Image-2.1 vs. Hy Image3.5: Die unabhängigen Boards stufen sie in entgegengesetzter Reihenfolge ein
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 223 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Setzt man Qwen-Image-2.1 und Hy Image3.5 auf den beiden Artificial-Analysis-Bild-Boards direkt gegeneinander, sind sich die Boards uneinig, welches der beiden besser ist. Bei Text-zu-Bild liegt Qwen-Image-2.1 mit 59 Elo vor Hy Image3.5 – 1.034 gegen 975, Rang 18 gegen Rang 66. Bei der Bildbearbeitung tauschen dieselben zwei Modelle die Plätze: Hy Image3.5 steht bei 1.088 Elo und Rang 14, Qwen-Image-2.1 bei 1.074 und Rang 18. Eine 14-Punkte-Lücke in die andere Richtung. Die beiden Modelle wurden zwei Tage auseinander veröffentlicht – Qwen-Image-2.1 mit offenen Gewichten am 20. September 2026, Hy Image3.5 in öffentlicher Vorschau am 22. September 2026 – und dies ist das erste Mal, dass eines der beiden einen Score auf demselben Instrument hat, was die Uneinigkeit eher lesenswert als bloß berichtenswert macht.
Der naheliegende Schritt ist zu sagen, das Redaktionsgremium sei laut, und weiterzugehen. Das ist zur Hälfte richtig. Die andere Hälfte ist, dass die beiden Zeilen nicht gleichermaßen solide sind, der Preis auf der einen nicht der Preis auf der anderen ist und eines dieser Modelle Rechte an den Gewichten besitzt, während das andere sie niemals besitzen wird.
Zwei Boards, zwei Aufträge
Artificial Analysis führt blinde Paarvergleiche durch — derselbe Prompt an zwei Modelle, ein Wähler kürt den Sieger, Elo summiert sich — und veröffentlicht für jede Aufgabe ein separates Board. Das Text-zu-Bild-Board enthält 166 Zeilen; das Bearbeitungs-Board enthält 97. Beide Zeilen für beide Modelle stammen aus dem Snapshot desselben Anbieters, es handelt sich also nicht um eine Versionsabweichung.
• Text-zu-Bild — Qwen-Image-2.1 mit 1.034 Elo (Intervall 1.024 bis 1.044) aus 5.286 Vergleichen, Rang 18 von 166. Hy Image3.5 mit 975 Elo (Intervall 966 bis 984) aus 5.334 Vergleichen, Rang 66 von 166. Die Intervalle überschneiden sich nicht. Eine Trennung von 59 Punkten bei Stichproben ähnlicher Größe ist eine echte Rangordnung, kein Rundungsartefakt.
• Bildbearbeitung — Hy Image3.5 bei 1.088 Elo (Intervall 1.079 bis 1.097) aus 5.550 Vergleichen, Rang 14 von 97. Qwen-Image-2.1 bei 1.074 Elo (Intervall 1.065 bis 1.083) aus 5.536 Vergleichen, Rang 18 von 97. Diese Intervalle überschneiden sich in einem Vier-Punkte-Band von 1.079 bis 1.083. Die Reihenfolge ist richtungsweisend, nicht gesichert.
• Die Stichprobengrößen liegen auf beiden Boards nah beieinander – 5.286 gegenüber 5.334 bei Text-zu-Bild, 5.536 gegenüber 5.550 beim Editing –, der Unterschied im Vertrauen ist also nicht darauf zurückzuführen, dass ein Modell zu wenige Stimmen erhalten hat.
• Das Board kennzeichnet die Modelle unterschiedlich, und das ist wichtig: Die Qwen-Image-2.1-Zeilen tragen den Open-Weights-Marker, die Hy Image3.5-Zeilen nicht.
Die ehrliche Lesart ist also asymmetrisch. Text-zu-Bild: Qwen-Image-2.1 gewinnt klar. Bearbeitung: Hy Image3.5 liegt wahrscheinlich vorn, mit einem Vorsprung, der innerhalb des Messrauschens liegt.
Woher die Asymmetrie kommt
Hy Image3.5s Editing-Stärke ist keine Überraschung, wenn man sich ansieht, womit Tencent es ausgeliefert hat. Die Vorschau ging mit bis zu fünf Referenzbildern pro Anfrage, Text-zu-Bild und Bild-zu-Bild im selben Modell sowie Multi-Turn-Editing an die Öffentlichkeit – der Editing-Bereich stand beim Launch im Fokus. Qwen-Image-2.1 wurde mit einem vereinheitlichten Stack für Generierung und Editing gebaut, der ebenfalls Referenzbilder verarbeitet, doch seine Leaderboard-Zeilen zeigen, dass die Editing-Seite zwei Elo unter Alibabas eigenem Qwen-Image-3.0-Pro abschließt – ein engeres Ergebnis, als die Launch-Darstellung nahelegte.
Auch die eigene Behauptung von Tencent ist nicht das, was das Board zeigt. Der Anbieter gibt für die Preview eine Blindbewertungs-Siegquote von rund 30 % gegenüber Hy Image3.0 an. Diese Zahl wurde von niemandem außerhalb von Tencent reproduziert, und das unabhängige Board bestätigt sie bei Text-zu-Bild nicht – dort liegt Hy Image3.5 preview mit 975 20 Elo unter dem Open-Weights-Modell HunyuanImage 3.0 Instruct mit 995. Bei der Bearbeitung fällt derselbe Vergleich zugunsten des Anbieters aus: Hy Image3.5 preview liegt mit 1.088 22 Elo über HunyuanImage 3.0 Instruct mit 1.066. Ein Fortschritt um eine Generation auf dem einen Board und ein Rückschritt auf dem anderen – in Tencent' eigener Modellnachfolge.

Die Preisachse, auf der die beiden überhaupt nicht vergleichbar sind
Hy Image3.5 preview ist eine API mit nutzungsbasierter Abrechnung. Tencent Cloud berechnet ¥0,15 für ein 2K-Bild am Mainland-Endpunkt und US$0,024 am internationalen Endpunkt, wobei nur die von der API zurückgegebenen Bilder abgerechnet werden. Die Preisspalte von Artificial Analysis verzeichnet $24,00 pro 1.000 Bilder, was derselbe Wert in den Einheiten ist, die das Board verwendet – und verglichen mit den $210,70, die die oberste Zeile des Text-to-Image-Boards für dieselben 1.000 Bilder ausweist, ist es weniger als ein Neuntel des Preises.
Qwen-Image-2.1 hat keine Preiszeile, weil es keinen Endpunkt hat. Beide seiner Ranglisteneinträge tragen einen ausdrücklichen Keine API verfügbar Hinweis. Dieses Modell kauft man nicht; man lädt es herunter, und man bezahlt dafür mit GPU-Stunden und mit der Lizenzfrage weiter unten. Die 5.286 und 5.536 Stimmen in seinen Einträgen stammen von Leuten, die die Gewichte selbst laufen lassen. Diese Tatsache verleiht dem Ranking zudem einen Vorbehalt, den man durchaus behalten sollte: Ein unabhängiges Elo für ein ausschließlich selbst gehostetes Modell misst eine andere Population als ein Elo für etwas, das jeder aufrufen kann.
Wenn der Plan ist, eines dieser beiden in ein Produkt zu integrieren, ist die praktische Aufteilung jetzt klar, und es ist dieselbe Aufteilung, die der Preis nahelegt: Das Modell mit dem besseren Editing-Score ist dasjenige, das Sie mieten, und das Modell mit dem besseren Text-zu-Bild-Score ist dasjenige, das Sie selbst betreiben. OrcaRouter ist die Mietseite davon – eine API über 200+ Modelle mit Listenpreisen der Anbieter, die ohne Aufschlag durchgereicht werden, automatischem Failover über Anbieter hinweg, und einer Routing-DSL, mit der sich mehrere Modelle zu einem Aufruf zusammenstellen lassen. Wir routen Hy Image3.5 preview oder Qwen-Image-2.1 nicht; die Bildproduktlinien auf der Plattform sind Googles Imagen-Stufen und Gemini-Bildvorschauen, xAIs Grok-Imagine-Bildendpunkt und OpenAIs GPT-Image-Familie. Keines dieser beiden ist allein aufgrund einer Leaderboard-Zeile eine erste Wahl aus dieser Liste, und genau deshalb ist die Lizenzfrage unten diejenige, die den Ausschlag gibt.
Die Achse, für die keines der beiden Boards eine Spalte hat

Qwen-Image-2.1 wird unter der Qwen Research License Agreement veröffentlicht, datiert auf den 20. September 2026, die Rechte nur für nichtkommerzielle Zwecke gewährt und für die kommerzielle Nutzung eine separate Lizenz vom Anbieter erfordert. Die Hugging Face-Repositories geben die Lizenz als Sonstige an — aus diesem Grund ist sie keine OSI-Lizenz und sollte nicht als solche verstanden werden. Der Open Weights-Marker auf beiden Board-Zeilen ist korrekt und sagt nichts darüber aus.
Hy Image3.5 preview hat keine Gewichte zum Lizenzieren. Tencent hat sie nicht veröffentlicht; die Preview wird von Tencent' eigener Plattform bereitgestellt, und es gibt keine herunterladbare Veröffentlichung dieser Generation. Was Sie erhalten, ist eine Preisliste, ein Limit für Referenzbilder und einen Dienst, den Sie starten und stoppen können. Nichts zu prüfen, nichts zu hosten, nichts zu verhandeln – und nichts, das Ihnen bleibt, wenn Tencent den Preis ändert oder die Preview einstellt.
Die Gegenüberstellung, die die Open-Weights-Frage tatsächlich klärt, ist Tencents eigener Vorgänger und nicht Qwens Modell. HunyuanImage 3.0 Instruct ist in beiden Bestenlisten mit dem Open-Weights-Marker vertreten – 1.066 bei der Bearbeitung, 995 bei Text-zu-Bild. Qwen-Image-2.1 schlägt es in beiden. Wenn die Anforderung also lautet „herunterladbare Gewichte, die ich auf meiner eigenen Hardware ausführen kann“, ist die beste Option in diesem Duell die von Alibaba, in beiden Bestenlisten, unter einer Lizenz, die den Verkauf der Ausgabe weiterhin verbietet.
Es gibt keine Variante, in der sich der Papierkram von selbst erledigt. Du kannst den besseren Editing-Score ohne Gewichte und mit nutzungsabhängiger Abrechnung haben oder den besseren Text-zu-Bild-Score mit Gewichten, die du nicht kommerziell verwerten darfst. Entscheide dich, mit welcher Einschränkung du leben kannst, und miss dann beide an deinen eigenen Prompts — die Editing-Lücke zwischen ihnen ist vier Punkte breit innerhalb überlappender Intervalle, und das ist die Art von Marge, die ein einzelnes zurückgehaltenes Prompt-Set auslöschen kann.
