
Qwen-Image-2.1 vs GPT-Image-2.5: Die Kluft ist eine einzige Zahl – und sie ist nicht die Qualität
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Stellt man Qwen-Image-2.1 und GPT-Image-2.5 bei den technischen Daten nebeneinander, wirken sie wie Geschwister: Beide sind einheitliche Bildmodelle für Generierung und Bearbeitung, beide geben Bilder mit transparentem Hintergrund aus, beide sind in den letzten fünf Wochen erschienen, beide können Standbilder der 2K-Klasse erzeugen. Der Unterschied, der die Wahl zwischen ihnen entscheidet, ist eine einzige Zahl – und es ist kein Benchmark-Ergebnis. Qwen-Image-2.1 ist kostenlos herunterzuladen und unmöglich zu verkaufen. GPT-Image-2.5 ist unmöglich herunterzuladen und mühelos zu verkaufen. Alles andere – die Architektur, die Latenz, die Implementierung der Transparenz – ist die Folge davon. Qwen-Image-2.1 wurde am 20. September 2026 als Open Source veröffentlicht; GPT-Image-2.5 wurde am 8. September 2026 angekündigt, als seine API-Modelle live gingen.
Zwei Wege, Transparenz zu schaffen, mit einem Monat Abstand
Dass beide Modelle im Abstand von nur wenigen Wochen transparente Ausgabe erhielten, ist ein Zufall, den es zu verstehen lohnt, denn die beiden Implementierungen sind nicht gleichwertig.
Qwen-Image-2.1 integriert Alpha direkt in das Modell. Es entrauscht in einem 64-Kanal-RGBA-Latent-Raum mit 16-facher räumlicher Kompression, sodass der Alphakanal eine vollwertige Komponente dessen ist, was der Sampler erzeugt. Es gibt keinen Segmentierungsschritt und keinen Matting-Pass. Daneben gibt es eine ungewöhnliche Zusatzfunktion: Da das Modell pro Prompt entscheiden kann, ob es RGB oder ein Bild mit Alphakanal ausgibt, kann es außerdem ein Motiv aus einem gewöhnlichen Foto herauslösen und statt einer binären Maske eine transparente Ebene zurückgeben.
GPT-Image-2.5 geht den Parameter-Weg. OpenAIs API akzeptiert eine background-Einstellung mit den Werten auto, opaque oder transparent, und das Modell reagiert entsprechend. Das ist ein Fähigkeits-Schalter an einem gehosteten Endpunkt und keine Eigenschaft des latenten Raums, und er hat den Vorteil, dass man nicht darüber nachdenken muss: Flag setzen, Freisteller bekommen, weitermachen. Der Preis dafür ist, dass man bekommt, was der Endpunkt liefert – in der Auflösung und zu den Kosten, die der Endpunkt festlegt.
Welche besser ist, ist wirklich ungeklärt. Zum Zeitpunkt des Verfassens gab es keinen öffentlichen Vergleich der Alpha-Kanten von Qwen-Image-2.1 mit einem dedizierten Matting-Modell, und die einzige veröffentlichte Prüfung auf der Qwen-Seite ist eine funktionale – transparente PNG-Ausgabe bestanden, Alpha über den gesamten Bereich 0–255 erhalten, RGBA-PSNR von 60,69 dB in einer einzelnen Stichprobe. Das ist eine Korrektheitsprüfung, kein Qualitätsurteil. Sie sagt einem, dass es den Kanal tatsächlich gibt.
Was Sie tatsächlich messen können
• Parameter — Die Generierungskomponente von Qwen-Image-2.1 ist ein 7B-32-Schichten-Single-Stream-Diffusion-Transformer, gepaart mit einem Qwen3-VL 8B Text-Encoder; insgesamt etwa 33 GB Gewichte, wovon der DiT etwa 14 GB ausmacht. OpenAI veröffentlicht keine Parameteranzahl für GPT-Image-2.5.
• Auflösung — Qwen-Image-2.1 gibt nativ bis zu 2048×2048 bei 40 Inferenzschritten mit sieben Seitenverhältnis-Voreinstellungen aus. GPT-Image-2.5 akzeptiert Größen bis 3840×2160 und 2160×3840, wobei jede Kante auf 3840 px begrenzt ist und Vielfache von 16 erforderlich sind.
• Referenzbilder — Qwen-Image-2.1 nimmt bis zu 10 für Multi-Subjekt-Komposition und virtuelles Anprobieren. Die Bildmodelle von OpenAI akzeptieren Referenzeingaben zum Bearbeiten, aber das praktische Limit und das Treueverhalten unterscheiden sich je nach Modell und Qualitätsstufe.
• Latenz — SGLang-Diffusion veröffentlicht 2,748 s für eine 1024×1024-Generierung mit 40 Schritten auf einer einzelnen B200 und 4,74 s auf einer 24 GB RTX 4090 mit Cache-DiT- und INT8-Kernels, nur Denoising. OpenAI berichtet für die Flare-Variante von GPT-Image-2.5 von bis zu 50 % geringerer Latenz als bei GPT-Image-2, wobei ein Launch-Partner 2–4× misst — jeweils vom Anbieter bzw. Partner berichtet, kein kontrollierter Vergleich.
• Preis — Qwen-Image-2.1 hat keinen gehosteten Preis, da es keinen gehosteten Endpunkt gibt; die Kosten sind Ihre eigene GPU-Zeit. GPT-Image-2.5 wird zu denselben Token-Sätzen wie GPT-Image-2 abgerechnet: 8,00 $ pro 1 Mio. Bild-Eingabe-Token, 30,00 $ pro 1 Mio. Bild-Ausgabe-Token, 5,00 $ pro 1 Mio. Text-Eingabe-Token.
• Lizenz — Qwen-Image-2.1 wird unter der Qwen Research License Agreement vom 20. September 2026 ausgeliefert, nur für nichtkommerzielle Nutzung. GPT-Image-2.5 ist eine kommerzielle API mit C2PA-Provenienz und einem unsichtbaren Wasserzeichen auf den Ausgaben.
Eine Zeile in dieser Liste ist dünner, als sie aussieht. OpenAI veröffentlicht für GPT-Image-2.5 keine Preise pro Bild, sondern nur Token-Sätze, und der Verbrauch von Bild-Tokens hängt von Auflösung und Qualitätsstufe ab. Messungen von Drittanbietern ergeben eine Spanne von ungefähr 0,0059 $ bis 0,712 $ pro Bild über 1K, 2K und 4K bei niedrigen, mittleren und hohen Einstellungen und einem Seitenverhältnis von 1:1 – nützlich als Größenordnung, nicht als verbindliches Angebot. Wenn Sie eine Prognose erstellen, bauen Sie die Schätzung auf Token-Zahlen und Ihrer eigenen Prompt-Verteilung auf, nicht auf einer Pro-Bild-Zahl, die jemand anderes gemessen hat.

Die zwei Kosten, die niemand in dieselbe Spalte packt
Der Grund, warum dieser Vergleich sich nicht einfach beantworten lässt, ist, dass die beiden Modelle Ihnen in unterschiedlichen Währungen in Rechnung stellen – und der Wechselkurs ist Ihre eigene Situation.
GPT-Image-2.5 rechnet pro Token ab, das heißt, der Zähler ist sichtbar, vorhersehbar und skaliert linear mit dem Volumen. Das ist ein echter Vorteil für ein Produkt mit bekanntem Traffic: Man kann es in ein Budget einplanen, und eine Preissenkung des Anbieters senkt die Kosten am selben Tag. Es ist zugleich eine Steuer auf die Exploration, denn die zehnte Iteration eines Prompts kostet genauso viel wie die erste. Das Verhalten von input_fidelity verschärft dies stärker, als die nominellen Tarife vermuten lassen — die API kann bei Bildeingaben automatisch hohe Wiedergabetreue anwenden, was mehr Input-Tokens verbraucht, als ein flüchtiger Blick auf die Preisliste nahelegt, sodass Bearbeitungsschleifen mehr kosten als die pro Bild genannten Zahlen.
Qwen-Image-2.1 kehrt beide Eigenschaften um. Die Grenzkosten der hundertsten Generierung sind Strom. Das macht es zum besseren Instrument für Iteration, für Batch-Backfills und für alles, bei dem der Prompt noch entdeckt wird. Was es Ihnen nicht liefert, ist eine Zahl für die Finanztabelle — Sie zahlen für eine GPU, ob sie beschäftigt oder im Leerlauf ist — und es gibt Ihnen nicht das Recht, die Ausgabe zu verkaufen. Die Qwen Research License Agreement erlaubt nicht-kommerzielle Forschung und Evaluierung und besagt, dass der kommerzielle Einsatz eine separate Lizenz von Hangzhou Tongyi Laboratory Technology erfordert. Für diese Lizenz gibt es keinen veröffentlichten Preis und keine festgelegten Bedingungen. Das ist keine Fußnote; für eine kommerzielle Pipeline ist es die gesamte Entscheidung.
Beide ohne einen zweiten Vertrag betreiben
Die realistische Antwort für die meisten Teams ist weder das eine noch das andere – sie ist beides. GPT-Image-2.5 deckt den Produktionsweg ab, bei dem die Ausgabe an einen Kunden geht und die Abrechnung pro Token eine eigene Position ist. Qwen-Image-2.1 deckt den Explorationsweg ab, bei dem Sie zweihundert Varianten eines transparenten Produktfotos benötigen und kein Anbieter Ihnen dieses Volumen zu einem vernünftigen Preis verkaufen wird.
Die Reibung besteht darin, dass die beiden auf völlig unterschiedlichen Wegen ankommen. Das eine ist ein API-Schlüssel. Das andere ist ein 33-GB-Download, eine Python-Umgebung und eine GPU, die Ihnen gehört. OrcaRouter deckt die gehostete Hälfte ab: 200+ Modelle hinter einem OpenAI-kompatiblen Endpunkt, Anbieter-Listenpreis ohne Aufschlag durchgereicht, automatisches Failover über Anbieter hinweg, eine Routing-DSL zum Ausdrücken von Fallbacks und Modellfusion zum Kombinieren mehrerer Modelle in einem Aufruf. Bei diesem Modell ist Präzision wichtig — wir routen GPT-Image-2.5 heute nicht; unsere OpenAI-Bildrouten sind GPT-Image-2, GPT-Image-1.5 und GPT-Image-1-mini, alle zum OpenAI-Listenpreis, und an dem Tag, an dem ein vorgelagerter Anbieter die gpt-image-2.5-Identifikatoren hinzufügt, ruft derselbe Schlüssel sie ohne Codeänderung auf. Wir routen auch kein Qwen-Image-Modell in irgendeiner Version, daher ist Qwen-Image-2.1 auf unserer Seite überhaupt keine Route. Was Ihnen die Weitergabe der Preise in der Zwischenzeit bringt, ist, dass sich die Zahl auf unserer Seite mitbewegt, wenn OpenAI einen Preis ändert, statt mit Verzögerung hinterherzuhinken.
Das Urteil, als Bedingung formuliert statt als Sieger
Wenn die Ausgabe verkauft werden soll, ist die Sache eindeutig: GPT-Image-2.5 ist das einzige der beiden, für das Sie eine Nutzungslizenz haben, und der Token-Zähler ist der Preis dafür. Wenn die Ausgabe für Forschung, interne Tools oder Evaluierung gedacht ist, ist Qwen-Image-2.1 das stärkere Instrument – natives 2K, Alpha direkt aus dem Sampler, zehn Referenzbilder und marginale Kosten von null, sobald die Hardware bezahlt ist. Wenn Sie beides brauchen, betreiben Sie beides, und betrachten Sie die Lizenz als die Grenze, die entscheidet, in welche Pipeline ein bestimmter Auftrag geht.
Zwei Dinge würden das ändern. Ein veröffentlichtes kommerzielles Term Sheet für Qwen-Image-2.1 würde die Lücke in der Lizenzzeile schließen, die derzeit in diesem Vergleich die Hauptarbeit leistet. Und ein unabhängiger Eintrag im Image-Leaderboard für Qwen-Image-2.1 würde uns zeigen, ob das Qwen-Image-Bench-Ergebnis des Anbieters – 60,28, vor Nano Banana 2.0 mit 59,82 und GPT Image 1.5 mit 59,65, an der Spitze der offenen Modelle – auch außerhalb des Labors Bestand hat, das es hervorgebracht hat. Beides gibt es noch nicht. Bis dahin lautet die ehrliche Empfehlung: nach der Lizenz und der Abrechnung entscheiden, nicht nach dem Punktestand.


