Hero-Titelkarte für GPT-Image-2 vs. Flux 3, Überschrift „GPT-Image-2 vs. Flux 3“ mit Untertitel „Ein Live-Modell, eine Roadmap“, zwei Karten, die GPT-Image-2 mit einem Abzeichen „Öffentliche API seit Mai 2026“ und Flux 3 mit einem Abzeichen „Bild-Stufe: bald verfügbar“ zeigen, OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

GPT-Image-2 vs Flux 3: Vergleich eines Live-Modells mit einer Roadmap

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Dies ist kein normaler Modell-gegen-Modell-Beitrag, denn GPT-Image-2 und Flux 3 befinden sich nicht im gleichen Existenzzustand. GPT-Image-2 wurde am 21. April 2026 veröffentlicht, ist seit Anfang Mai über die API von Ope​nAI aufrufbar und hat diese Woche eine neue Fähigkeit erhalten – die Erzeugung von Bildern mit transparentem Hintergrund in der API, angekündigt am 20. August und ab sofort verfügbar. Flux 3 ist das multimodale Basismodell von Black Forest Labs, angekündigt am 23. Juli 2026, und die Bildstufe hat zum Zeitpunkt dieses Artikels immer noch keinen öffentlichen Endpunkt, keine Modell-ID und keine Preisliste. Mit einem gültigen Schlüssel kannst du das eine um 3 Uhr morgens abrufen; für das andere kannst du dich auf eine Warteliste setzen lassen. Der sinnvolle Vergleich ist also nicht „welches ist besser“ – sondern was das veröffentlichte Modell heute tatsächlich tut, was die Roadmap für das unveröffentlichte verspricht und wie ein Entwickler mit einem versprochenen Modell umgehen sollte, das immer wieder verschoben wird, während ein laufendes Modell sich ständig verbessert.

Eines davon hat einen Endpunkt.

Beginnen wir mit der Verfügbarkeit, denn sie entscheidet über alles andere. Black Forest Labs stellte Flux 3 am 23. Juli als ein einziges Modell vor, das gemeinsam auf Bild-, Video-, Audio- und Roboteraktionsvorhersage trainiert wurde und auf einem Flow-Matching-Ansatz basiert, den das Labor Self-Flow nennt. Berichten zufolge flossen über 95 % dieser Trainingsrechenleistung in die Videovorhersage, was sich an dem zeigt, was tatsächlich erschienen ist: Nur Flux 3 Video erreichte am 4. August die allgemeine Verfügbarkeit, mit einer kostenpflichtigen API. Die Modellseite der Bild-Stufe trägt weiterhin ein Etikett „Coming soon“ mit einem Bewerbungsformular, keinen „Loslegen“-Button – keinen Endpunkt, keine dokumentierten Parameter, keine Kosten pro Bild und keine Benchmark, die jemand ausführen kann.

GPT-Image-2 ist dagegen seit vier Monaten in Produktion. Ope​nAI hat den API-Zugriff Anfang Mai freigegeben, und die Kennung des Modells, gpt-image-2, ist stabil genug, dass ein festgelegter Snapshot, gpt-image-2-2026-04-21, daneben existiert. Es ist das aktuelle Nummer-eins-Modell für Text-zu-Bild auf beiden großen unabhängigen Ranglisten – 1.381 Elo auf Arenas Text-zu-Bild-Rangliste (die mittlere Version) und 1.369 Elo für die hohe Version auf Artificial Analysis – und es rendert mehrsprachigen Text einschließlich CJK, verankert die Generierung in der Websuche und erzeugt Ausgaben bis zu 4K. Vier Monate Produktionsbetrieb sind der Unterschied zwischen einer Behauptung und einer Erfolgsbilanz.

Die jüngste Änderung auf der GPT-Image-2-Seite

Das Ereignis, das diesen Vergleich aktuell macht, hat nichts mit Flux 3 zu tun. Am 20. August eröffnete OpenAI eine Vorschau mit transparentem Hintergrund für GPT-Image-2 in der Images-API: Setzt man den Hintergrund auf „transparent“, gibt der Endpunkt ein PNG oder WebP mit echtem Alphakanal zurück, freigestellt und bereit zum Compositing. Das ist eine Funktion, die genau auf die Produktionsarbeit zielt, die auch die Flux-3-Image-Roadmap bewirbt – Produktfotos, Icons, Marketing-Assets – und sie kam als Parameter an einem bereits live verfügbaren Endpunkt, nicht als neues Modell. Während die Welt also auf einen Flux-3-Image-Endpunkt wartet, der immer noch „coming soon“ sagt, hat der etablierte Anbieter gerade eine der Lücken geschlossen, die ihn aus Compositing-Pipelines fernhielten.

Die Funktion ist ausschließlich über die API verfügbar – es gibt keinen ChatGPT-Umschalter – und sie ist ein Parameter, kein neues Produkt. Beide Images-API-Endpunkte, Generierung und Bearbeitung, akzeptieren ein background-Feld mit den Werten „transparent", „opaque" und „auto" (der Standard, bei dem das Modell entscheidet). Der Alphakanal bleibt nur bei PNG- oder WebP-Ausgabe erhalten, daher gibt die Anfrage das Ausgabeformat explizit vor. Ope​nAIs eigene API-Referenz markiert die Unterstützung von Transparenz für gpt-image-2 und dessen Snapshot gpt-image-2-2026-04-21 weiterhin als „in der Vorschau" – das ist die Kennzeichnung des Anbieters, keine Ankündigung der allgemeinen Verfügbarkeit – und ihre Empfehlung lautet, den Prompt von jeder beschriebenen Hintergrundkulisse freizuhalten, damit das Modell den Transparenzwunsch tatsächlich erfüllt. Kein neuer Endpunkt, keine neue Modell-ID, keine separate Preisliste: Derselbe gpt-image-2-Aufruf, der zuvor ein opakes PNG zurückgab, liefert jetzt einen Freisteller.

Comparison scoreboard titled 'GPT-Image-2 vs Flux 3 - the scoreboard'. GPT-Image-2 column: Released Apr 21, 2026; Availability Public API since May; Arena T2I Elo 1,381 (#1); Text rendering multilingual incl. CJK; Transparent bg preview Aug 20; Max resolution 4K. Flux 3 column: Released announced Jul 23, 2026; Availability image tier coming soon; Arena T2I Elo none yet; Text rendering promised; Transparent bg not stated; Max resolution not specified. Footer: GPT-Image-2 figures per Arena and OpenAI list pricing; Flux 3 image claims are a vendor roadmap. OrcaRouter logo bottom-right.

Was das Flux-3-Bild verspricht und was tatsächlich ausgeliefert wird

Das Spec-Sheet der Flux-3-Bildstufe ist eine Anbieter-Roadmap, also behandeln Sie es als eine solche. Black Forest Labs hat Bildsynthese und -bearbeitung über Stile und Auflösungen hinweg versprochen, verbesserte Verarbeitung komplexer Prompts, hochpräzise mehrsprachige Textdarstellung, Zero-Shot-Stilübertragung von Referenzbildern, Figuren- und Markenkonsistenz ohne Fine-Tuning sowie nicht-destruktive Bearbeitung, die Textur und Beleuchtung erhält. Das sind die richtigen Versprechen – es sind genau die Funktionen, mit denen die aktuellen Marktführer konkurrieren – aber keine davon ist heute testbar, weil keine davon einen Endpunkt hat.

Was über BFL tatsächlich aufrufbar ist, sind die Videostufe und die ältere FLUX-Bildlinie. Flux 3 Video kostet 0,17 $ pro Sekunde in HD und 0,29 $ pro Sekunde in FHD für vollständige Renderings, mit einem Entwurfsmodus für 0,06 $ pro Sekunde. Seine eigenen gemeldeten Zahlen sind 1.135 Elo für Text-zu-Video und 1.051 für Bild-zu-Video sowie Präferenzsiege über Luma Ray 3.2, Runway Gen-4.5, Gr​ok Imagine Video und Kling v3 Pro — alles von den Anbietern gemeldet und nicht unabhängig reproduziert, und nichts davon überträgt sich ohnehin auf die Bildstufe. Für Standbilder bleibt das aktuelle BFL-Angebot die FLUX.2-Linie, die bei 1.226 Elo auf derselben Artificial-Analysis-Bestenliste liegt, auf der GPT-Image-2 mit 1.369 führt. Diese Lücke ist der praktische Kontext für „Flux 3 image is coming“: Die heutige BFL-Bild-API liegt etwa 140 Elo hinter der von Ope​nAI, und das versprochene Modell ist das, was BFL braucht, um sie zu schließen.

Screenshot of the Artificial Analysis Text-to-Image leaderboard (captured August 20, 2026) showing GPT Image 2 (high) in first place at 1,369 Elo and Black Forest Labs' current image entry FLUX.2 (max) at 1,226 Elo, with no Flux 3 image entry present, in English.

Preise: Es gibt nur eine echte Preiskarte.

Es gibt keinen Preis für Flux-3-Bilder, da es kein Flux-3-Bilderprodukt gibt. Die einzigen veröffentlichten Zahlen sind die Token-Raten von GPT-Image-2: 5 $ pro Million Text-Input-Tokens, 8 $ pro Million Bild-Input-Tokens und 30 $ pro Million Bild-Output-Tokens, wobei die Batch-API bei einer Bearbeitungszeit von bis zu 24 Stunden ungefähr die Hälfte kostet. OpenAI veröffentlicht keine Tokens pro Bild, daher sind die Preise pro Bild Umrechnungen, keine Angebote: etwa 0,006 $ für ein 1024×1024-Bild in niedriger Qualität, rund 0,05 $ für ein mittleres, rund 0,21 $ bei hoher Qualität und bis zu etwa 0,41 $ für ein hochauflösendes 4K-Rendering. Zum Vergleich: Das ist die eine Seite der Rechnung, die real ist; die Spalte für Flux-3-Bilder ist eine leere Zelle.

Screenshot of the OrcaRouter model page for openai/gpt-image-2 (captured August 20, 2026), showing the model description, input rate of $8.00 and output rate of $30.00 per million tokens, median latency, and community usage, in English.

Was ein Bauherr mit einem versprochenen Modell tun sollte

Die vernünftige Haltung, wenn das Modell eines Konkurrenten immer wieder abrutscht, ist, auf dem Bestehenden aufzubauen und die Zukunft zu einer Konfigurationsänderung zu machen statt zu einer Neuarchitektur. GPT-Image-2 ist heute über OrcaRouter routbar – ein API-Schlüssel, Ope​nAIs Listenpreis ohne Aufschlag durchgereicht, automatisches Failover über Anbieter hinweg – sodass eine Pipeline, die damit Assets erzeugt, später denselben Endpunkt auf die API von Flux 3 image zeigen lassen kann, sobald ein Endpunkt tatsächlich existiert, und einen Teil des Datenverkehrs mit der Routing-DSL dorthin lenken kann, ohne den aufrufenden Code zu ändern. Sie bekommen das ausgelieferte Modell jetzt, und wenn das versprochene eintrifft, bewerten Sie es anhand einer funktionierenden Basis statt anhand einer Pressemitteilung. Das Warten kostet Sie nichts; auf nichts aufzubauen, während Sie warten, kostet Sie alles.

Das Urteil ist bewusst einseitig. Wenn Sie in diesem Quartal Bildgenerierung benötigen, ist GPT-Image-2 die erste Wahl, und es steht außer Frage — es ist die unabhängige Nummer eins, es hat gerade die Ausgabe mit transparentem Hintergrund zur API hinzugefügt und verfügt über eine öffentliche API und einen stabilen Preis. Flux 3 image ist ein Grund, Black Forest Labs im Auge zu behalten, aber kein Grund, ein Projekt auf Eis zu legen. Verfolgen Sie den Beginn des Early Access und die ersten unabhängigen Benchmarks; sobald ein Endpunkt existiert, wird der Vergleich in diesem Beitrag zu einem Test, den Sie tatsächlich ausführen können.