Hero-Karte mit der Aufschrift „Qwen-Image-2.1 vs. GPT Image 2" und dem Untertitel „Kostenlos herunterladen oder das gerankte mieten" sowie drei Zeilen: Qwen-Image-2.1 33 GB Download nicht kommerziell, GPT Image 2 nur API, Abrechnung pro Token, Transparenz RGBA-VAE vs. ein Request-Parameter, daneben ein Download-Pfeil- und ein Meter-Symbol.
Guides & Insights

Qwen-Image-2.1 vs. GPT Image 2: Kostenlos herunterladen oder das Beste mieten

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Qwen-Image-2.1 ist ein 33 GB großer Download, den man kostenlos ausführen und nicht verkaufen kann. GPT Image 2 ist eine API, die man überhaupt nicht herunterladen kann, wird pro Token abgerechnet, ist seit vier Monaten in Produktion und steht an der Spitze der unabhängigen Image-Leaderboards. Diese beiden Fakten sind der ganze Deal, und der interessante Teil ist, dass die Transparenzfunktion – das, was Qwen-Image-2.1 überhaupt erst einen Blick wert macht – bei beiden Systemen innerhalb eines Monats auf völlig unterschiedlichen Wegen ankam. Qwen-Image-2.1 erschien am 20. September 2026 mit Alpha, das in seinen latenten Raum eingebaut ist. GPT Image 2 erhielt am 20. August 2026 einen background: "transparent"-Parameter als API-Flag.

Zwei Wege zum selben Feature

Die transparente Ausgabe ist der Grund, warum die meisten am Ende diese beiden vergleichen, also fang dort an, denn die Implementierungen sind nicht gleichwertig und der Unterschied wiegt mehr als die Ausgabe.

Die Transparenz von Qwen-Image-2.1 ist architektonisch bedingt. Ein 64-Kanal-RGBA-VAE mit 16-facher räumlicher Kompression bedeutet, dass Alpha Teil des latenten Raums ist, in dem das Modell das Denoising durchführt. Derselbe Mechanismus ermöglicht Generierung mit Transparenz, Bearbeitung innerhalb eines Bildes, das bereits Transparenz aufweist, ohne es zu flatten, sowie Subjektextraktion aus einem gewöhnlichen RGB-Foto, die Alpha statt einer binären Maske zurückgibt. Es ist eine Fähigkeit mit drei Anwendungen, und die Darstellung des Anbieters selbst ist, dass kein separater Hintergrundentfernungs-Node, kein Matting-Modell und kein Kantenbereinigungspass nötig ist.

Die Transparenz von GPT Image 2 ist ein Anfrageparameter. Fügt man background: "transparent" zusammen mit output_format: "png" hinzu, erhält man ein Bild mit einem echten Alphakanal, und es funktioniert bei Text-zu-Bild, Bildbearbeitung und dem Bildgenerierungstool in der Responses API. Maskenbasiertes Inpainting und transparente Hintergründe lassen sich kombinieren. Es wurde in der Preview-Version veröffentlicht, daher lautet OpenAIs eigene Empfehlung, dass die Ergebnisse instabil sein können — und die Bearbeitung mit Transparenz wird als Neugestaltung oder Entfernung eines Hintergrunds beschrieben, nicht als präzises Freistellen von Konturen. Mindestens zwei Sekundärquellen behaupten, der Parameter sei nicht verfügbar und GPT Image 2 gebe überhaupt keine Transparenz aus; diese widersprechen der Berichterstattung zur Ankündigung, den Spiegeln der API-Dokumentation und Tests von Drittanbietern, also behandle sie als veraltet oder falsch und nicht als Gegensignal. Transparenz ändert die Token-Kosten nicht — bei gegebener Qualität und Größe verbrauchen ein transparentes und ein undurchsichtiges Bild dieselben Bild-Tokens.

Also erzeugen beide Alpha. Das eine tut es, weil das Modell so gebaut wurde; das andere, weil ein Parameter es beim Dienst anfordert. Was besser ist, hängt ganz davon ab, ob das Alpha eine Bearbeitungsschleife überstehen muss, und das lässt sich an einem Nachmittag testen.

Was der Vorsprung von GPT Image 2 dir einbringt

Vier Monate im Produktivbetrieb sind kein Marketingargument, sondern eine Reifegradlücke, und sie zeigt sich an Stellen, die langweilig und entscheidend sind.

Unabhängige Platzierung — GPT Image 2 steht an der Spitze der unabhängigen Bild-Leaderboards und das schon lange genug, dass dies eine belastbare Aussage ist und kein Ausreißer in der Launch-Woche. Qwen-Image-2.1 fehlte auf diesen Boards zum Zeitpunkt dieses Textes vollständig.
Dokumentierte Fehlermodi — ein Modell mit vier Monaten öffentlicher Nutzung verfügt über eine Sammlung bekannter Fehlerfälle, die man nachlesen kann, bevor man selbst darauf stößt. Ein Modell, das gestern veröffentlicht wurde, hat eine Hersteller-Scorecard und einen einzigen Integrationstest.
Operative Oberfläche — gestaffelte Ratenlimits, angegeben sowohl in Tokens pro Minute als auch in Bildern pro Minute (von 100.000 TPM und 5 IPM in der Einstiegsstufe bis zu 8.000.000 TPM und 250 IPM an der Spitze), plus Unterstützung für Batch-Endpunkte. Das ist der Unterschied zwischen einer Demo und einer Warteschlange, die man dimensionieren kann.
Qualitätszahlen von einem Dritten — die Leaderboard-Position ist unabhängig gemessen. Die einzige Zahl zu Qwen-Image-2.1 stammt aus dem eigenen Qwen-Image-Bench-Diagramm des Herstellers, wo sie 60,28 ergibt, gegenüber Nano Banana 2.0 mit 59,82 und GPT Image 1.5 mit 59,65. Herstellermaterial, nicht reproduziert.

Der einzige wirklich unabhängige Datenpunkt zu Qwen-Image-2.1 ist die funktionale Verifikation, die mit der SGLang-Integration veröffentlicht wurde: Transparente PNG-Ausgabe bestanden, Alpha blieb über den gesamten Bereich 0–255 erhalten, RGBA-PSNR maß 60,69 dB bei einer einzelnen Stichprobe, und FP8-Konfigurationen bestanden die Transparent-PNG-Generierung. Die SGLang-Autoren sagen ausdrücklich, dass dies eine Korrektheitsprüfung und keine allgemeine Qualitätsgarantie ist. Es ist der stärkste verfügbare Beleg dafür, dass der Alphakanal echt ist. Es sagt nichts darüber aus, ob die Bilder gut sind.

Die Rechnung, abgearbeitet

GPT Image 2 wird nach Tokens abgerechnet, was bedeutet, dass die Kosten eines Assets von Qualitätsstufe und Auflösung abhängen – auf eine Weise, die ein Preis pro Bild verbirgt. Veröffentlichte Listenpreise betragen 5,00 $ pro Million Text-Eingabe-Tokens, 8,00 $ pro Million Bild-Eingabe-Tokens und 30,00 $ pro Million Bild-Ausgabe-Tokens, wobei die Preise für zwischengespeicherte Tokens 1,25 $ bzw. 2,00 $ betragen. OpenAI veröffentlicht für dieses Modell keine statische Tabelle für Ausgabe-Tokens – die ältere Tabelle mit niedrigen, mittleren und hohen Token-Anzahlen ist ausdrücklich als nicht auf GPT Image 2 zutreffend gekennzeichnet – daher sind die folgenden Zahlen Messungen von Drittanbietern der Listenpreise bei einem Seitenverhältnis von 1:1, Text zu Bild:

1K-Ausgabe — niedrige Qualität 0,0059 $, mittel 0,053 $, hoch 0,211 $ pro Bild.
2K-Ausgabe — 0,012 $ niedrig, 0,107 $ mittel, 0,428 $ hoch.
4K-Ausgabe — 0,020 $ niedrig, 0,178 $ mittel, 0,712 $ hoch.

Der Abstand zwischen niedriger und hoher Qualität bei gleicher Auflösung beträgt rund den Faktor fünfunddreißig. Das ist die eigentliche Entscheidung innerhalb einer GPT Image 2-Pipeline: nicht welches Modell, sondern welche Qualitätsstufe die Prüfung zu den geringsten Kosten übersteht. Und sie interagiert mit der Bearbeitung auf eine Weise, die viele überrascht — input_fidelity lässt sich bei diesem Modell nicht anpassen, weil es jeden Bildeingang automatisch mit hoher Wiedergabetreue verarbeitet, sodass eine Bearbeitungsanfrage mit Referenzbildern mehr Bild-Eingabe-Tokens verbraucht, als man anhand der Ausgabegröße schätzen würde. Generieren-Prüfen-Bearbeiten-Schleifen sind hier daher teurer, als die Pro-Bild-Zahlen vermuten lassen.

Demgegenüber sind die Grenzkosten pro Bild bei Qwen-Image-2.1 der Stromverbrauch. Der Haken sind die Fixkosten und die Lizenz. Dreiunddreißig Gigabyte zum Herunterladen, ein DiT mit rund 14 GB, wobei der Rest auf den Qwen3-VL 8B Textencoder entfällt, CPU-Offload auf Karten mit begrenztem Speicher empfohlen, und das Ganze unter der Qwen Research License Agreement vom 20. September 2026 — nur nichtkommerziell, kommerzielle Rechte nur über eine separate Vereinbarung, und für diese sind weder Preis noch Bedingungen veröffentlicht.

A two-column board for Qwen-Image-2.1 and GPT Image 2 carrying both sides on one line per dimension: Weights, Licence, Transparency, Quality evidence, Pricing and Maturity. Footer separates vendor-reported figures from independently verified ones and notes that per-image API cost moves with quality tier and resolution.

Wo die Hosted-Option steht

Es gibt einen Mittelweg, der sowohl die GPU- als auch die Lizenzfrage umgeht, und es ist der, den die meisten Teams tatsächlich wählen. OrcaRouter routet OpenAIs GPT-Image-Familie neben Googles Imagen-4-Stufen und Gemini-Bildvorschauen sowie dem Bild-Endpunkt Grok Imagine von xAIüber 200 Modelle hinter einem einzigen OpenAI-kompatiblen Endpunkt, Anbieter-Listenpreis ohne Aufschlag durchgereicht, automatisches Failover über Anbieter hinweg, eine Routing-DSL und Modell-Fusion. Weil der Listenpreis durchgereicht und nicht mit einem Aufschlag versehen wird, ist eine Preissenkung eines Anbieters für ein geroutetes Modell noch am selben Tag aktiv, und weil das Failover automatisch erfolgt, wird ein Anbieter, der einen schlechten Nachmittag hat, nicht zu Ihrem Ausfall. Qwen-Image-2.1 gehört nicht zu den Modellen, die wir routen, und keine andere Qwen-Image-Version auch — es ist ein rein lokales Angebot — dies ist also keine Werbebotschaft für den Neuling. Es ist die ehrliche Antwort auf die Frage „Was verwende ich, während ich den Neuling evaluiere?“

Decision card titled 'The tiebreak' with two panels: 'Download it - Qwen-Image-2.1', free to run and non-commercial with alpha that is part of the latent space, and 'Rent it - GPT Image 2', independently ranked with a per-image cost from about $0.006 to $0.71 depending on tier and resolution.

Die Entscheidung, klar gesagt

Wähle GPT Image 2, wenn die Ausgabe kommerziell ist, wenn du eine unabhängig gemessene Qualitätsuntergrenze brauchst, wenn du Kosten pro Asset möchtest, die du vorhersehen und deckeln kannst, oder wenn die Sache diese Woche funktionieren muss, ohne einen Hardwarekauf. Akzeptiere, dass du mietest, dass du es nicht feinjustieren kannst, dass du es nicht offline betreiben kannst und dass die Kosten pro Bild linear mit dem Volumen skalieren – für immer.

Wähle Qwen-Image-2.1, wenn die Ausgabe Forschung, Evaluation oder persönliche Arbeit ist, wenn du gezielt Alpha willst, das einen Bearbeitungszyklus übersteht, statt Alpha, das ein Parameter einmal erzeugt hat, wenn du die Umschreibungslogik nachlesen möchtest – die ausgelieferten PE-T2I- und PE-I2I-Checkpoints sind feinabgestimmte Qwen3.5-VL 9B-Modelle mit einer lesbaren system_prompt.txt, was mehr ist, als du von jeder gehosteten Bild-API bekommst – oder wenn du einfach wissen willst, was ein offenes 7B-Bildmodell im September 2026 leisten kann, ohne pro Bild dafür zu bezahlen, es herauszufinden.

Wähle keines von beiden und leite es weiter, wenn das Deliverable kommerziell ist und die Deadline verbindlich ist. Das ist keine Ausrede; es ist die Option, bei der du keine Lizenzfrage klären musst, auf die du noch keine Antwort bekommen kannst.

Screenshot of the OrcaRouter catalogue page for the openai/gpt-image-2 model, showing the model listing, the $8.00 per 1M token input and $30.00 per 1M token output pricing cards, and the LM Arena image-edit Elo figure quoted in the model description.