
GPT-Image-2.5 vs. LLaDA-Image: Eine API für 30 $/Mio. Token gegen ein kostenloses 6B-Diffusionsmodell
- openaiNEUOpenAI: GPT-6 Astra2026-09-0455Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0247Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0247Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0157Intelligenz82Coding
- AlibabaNEUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.3 Flash2026-08-2646Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1849Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1541Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1251Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0547Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Intelligenz49Coding
Fragt man, was Bildgenerierung kosten sollte, und zwei Labs lieferten innerhalb einer Woche zwei gegensätzliche Antworten. Am 8. September 2026 veröffentlichte OpenAI GPT-Image-2.5 – das Modell hinter ChatGPT Images 2.5, das über die API als GPT-Image-2.5 Flare und GPT-Image-2.5 Sunburst verkauft wird – zu einem Token-Preis von 8 $ pro Million Bild-Input-Tokens und 30 $ pro Million Bild-Output-Tokens. Fünf Tage zuvor, am 4. September, veröffentlichte inclusionAI (das von Ant Group unterstützte Labor hinter der LLaDA-Sprachfamilie) leise LLaDA-Image, einen Bildgenerator und -editor auf Basis eines Diffusion-Transformers mit sechs Milliarden Parametern, dessen Gewichte kostenlos heruntergeladen werden können. Das eine ist das kommerziell mächtigste Bildmodell, das OpenAI je hinter eine Token-Abrechnung gestellt hat; das andere ist der Versuch zu beweisen, dass sich ein starkes Bildmodell mit einem offenen Trainingsrezept bauen und verschenken lässt. Ein Vergleich zwischen beiden ist weniger ein Kopf-an-Kopf-Rennen als eine Entscheidung darüber, welche Definition von Kosten man tatsächlich zahlt.
Bei fast allen Zahlen rund um GPT-Image-2.5 handelt es sich um Angaben des Herstellers, und keine davon wurde bislang unabhängig geprüft: OpenAI gibt an, dass Flare die Latenz um bis zu 50 % gegenüber GPT-Image-2 reduziert, und dass Tests des Agentenunternehmens Manus eine 2–4× schnellere Generierung gemessen haben. Doch zum Stand vom 9. September 2026 hat keines der beiden GPT-Image-2.5-Modelle einen Eintrag auf den Artificial-Analysis-Image-Leaderboards. Auch die Schlagzeilen-Kennzahl von LLaDA-Image ist nicht unabhängig reproduziert – inclusionAI meldet 53,53 Englisch / 53,38 Chinesisch auf dem Qwen-Image-Bench und damit zum Release den ersten Platz unter den Open-Weight-Modellen – und weil das Modell keine gehostete API hat, kann es auf reinen API-Leaderboards überhaupt nicht auftauchen. Beide Seiten dieses Vergleichs stützen sich also allein auf die Behauptungen ihrer Hersteller – das sollte man im Hinterkopf behalten, wenn man den Rest dieses Artikels liest.
Zwei Modelle, die kaum eine gemeinsame Kategorie haben.
GPT-Image-2.5 ist ein gehostetes, geschlossenes Bildmodell in derselben Produktlinie wie ChatGPT Images 2.0 vom April 2026. Es ist auf der Eingabeseite multimodal und erzeugt Bilder, die OpenAI zufolge in feinen Details schärfer, in Beleuchtung und Textur natürlicher und über mehrere Bearbeitungsrunden hinweg stabiler sind – der Sunburst-Endpunkt existiert speziell für bearbeitungsintensive Produktionsarbeiten, bei denen eine langsamere Generierung zugunsten einer präziseren Anweisungssteuerung akzeptabel ist, während Flare die schnelle Standardoption für die Generierung großer Mengen darstellt. Die Ausgaben reichen bis zu 2048×2048 und 3840×2160 Pixeln, transparente Hintergründe werden unterstützt, und jede Ausgabe trägt C2PA-Provenienzmetadaten sowie ein unsichtbares Wasserzeichen.
LLaDA-Image ist eine forschungsorientierte offene Veröffentlichung, die auf einer völlig anderen Wette basiert. Während GPT-Image-2.5 über die Infrastruktur von OpenAI bereitgestellt wird, ist LLaDA-Image eine Reihe von Gewichten, die man selbst ausführt: auf der Generierungsseite ein Diffusionstransformator (DiT) mit 6 Milliarden Parametern – das Modellkartenblatt verzeichnet etwa 7B Parameter, wenn man die Sprachseite mitzählt – gepaart mit LLaDA 2.0-mini, einem Diffusions-Sprachmodell mit Mixture-of-Experts (insgesamt 16B / 1B aktiv), als die „Verständnis“-Seite, die Textaufforderungen oder Bearbeitungsanweisungen in das Signal umwandelt, dem der DiT folgt. Die ungewöhnliche Behauptung im arXiv-Bericht (2609.03796) ist das Trainingsrezept: Mehr als 90 % von etwa 220 Millionen kumulativen Vor- und Zwischentrainingsbeispielen sind reine Bildbeispiele, wobei ein eingefrorenes Vision-Language-Modell aus unbeschrifteten Bildern Semantik als Selbstkonditionierungssignal extrahiert, sodass das Modell „erst zeichnen lernt, dann gehorcht“. Progressive Auflösung führt das Training von 256×256 über 512×512 bis zur 1024×1024-Feintuning-Phase, gefolgt von gemischtem Training für Text-zu-Bild und Bearbeitung sowie einer TwinFlow-Destillation mit wenigen Schritten, die die Variante LLaDA-Image-Turbo erzeugt.
Worin jedes Einzelne tatsächlich gut ist
Der Pitch von GPT-Image-2.5 ist Präzision und Kontrolle in kommerzieller Qualität. OpenAIs Ankündigung betont Referenztreue – eine Person, ein Haustier oder ein Produkt erkennbar zu halten, wenn man Schauplatz oder Stil ändert – sowie Bearbeitungen, die ausschließlich das ändern, worum man gebeten hat, und das über viele Bearbeitungsrunden in einem einzigen Gespräch hinweg. Die Darstellung von Text in Bildern wird ausdrücklich hervorgehoben, einschließlich der Beseitigung verstümmelter chinesischer Schriftzeichen, die frühere Bildmodelle plagten. Genau das sind die Fähigkeiten, auf die ein Produkt-, Marken- oder Werbeteam immer wieder angewiesen ist.
Die Kernaussage von LLaDA-Image ist ein einzelner Gewichtssatz, der zweisprachige Generierung und anweisungsgesteuerte Bearbeitung mit einem offenen Rezept ermöglicht. inclusionAI berichtet von nativer Textdarstellung in Chinesisch und Englisch, einem Bearbeitungspfad, der Referenzbilder über ein Dual-Path-Design einbindet, das unveränderte Inhalte bewahren soll, und — bei Qwen-Image-Bench — den besten Open-Weights-Ergebnissen zum Zeitpunkt der Veröffentlichung. Die offen genannten Einschränkungen der Veröffentlichung: Die wahrgenommene Bearbeitungsqualität bleibt weiterhin hinter spezialisierten Editoren zurück, und das Zählen von Objekten bleibt schwach. Es ist ein generalistisches offenes Modell, kein fertiges kommerzielles Produkt.

Die Rangliste ist bewusst kein Wettbewerb um Bildqualität — die beiden Modelle wurden nie derselben Bewertung unterzogen. Was sie zeigt, ist, wohin das Geld und die Kontrolle fließen.
Der Preis eines Bildes ist die Zahl, die dir keine der beiden Seiten nennen wird.
OpenAI veröffentlicht für GPT-Image-2.5 eine Token-Preistabelle, die mit der von GPT-Image-2 identisch ist: $8 pro Million Bild-Eingabe-Token, $30 pro Million Bild-Ausgabe-Token, gecachte Bild-Eingabe zu $2 und Text-Token werden separat mit $5 pro Million abgerechnet. Was OpenAI nicht veröffentlicht, ist, wie viele Token ein bestimmtes Bild verbraucht; das bedeutet, es gibt keinen offiziellen Preis pro Bild und keinen Kostenrechner. Beim von AA auf dessen Leaderboard gelisteten Preis für den Vorgänger – rund $211 pro 1.000 Bilder für GPT Image 2 bei „hoher“ Qualität – ist ein token-basiertes Flaggschiff bei großen Mengen ein teures Werkzeug, doch diese Zahl gilt für GPT-Image-2, nicht für 2.5, und die Kosten pro Bild des neuen Modells sind außerhalb von OpenAI tatsächlich unbekannt.
LLaDA-Image hat das umgekehrte Ehrlichkeitsproblem. Die Gewichte kosten nichts, und die Modellkarte trägt ein Apache-2.0-Label, aber der eigentliche Preis ist die Infrastruktur: Ein 6B-Diffusions-Transformer benötigt für die Base-Variante mit 50 Schritten eine leistungsstarke GPU, und die FP8-Checkpoints (etwa 49 GB in einem diffusers-Layout) sind für die meisten Nutzer die praktikable Option. Die 2–4-Schritte-Destillation von LLaDA-Image-Turbo ist das Zugeständnis an diese Realität. Die Community-Tools entwickeln sich rasant — ein SGLang-Pull-Request fügt Unterstützung für Text-zu-Bild, Bildbearbeitung, Sequenzparallelität und FP8 hinzu, und ein Node-Paket für ComfyUI von RebelAI unterstützt INT8- und GGUF-quantisierte lokale Inferenz — aber „kostenloses Modell“ bedeutet immer noch „du bist der Hosting-Anbieter.“ Für ein Team, das ohnehin GPU-Kapazitäten betreibt, gehen die Grenzkosten von LLaDA-Image gegen null; für alle anderen können die All-in-Kosten für den Betrieb des Modells die Rechnungen nutzungsbasierter APIs übersteigen, sobald man den Engineering-Aufwand einrechnet.
Der ehrliche Weg, wenn du beides willst
Für die meisten Teams ist das kein Entweder-oder. Eine Produktions-Pipeline kann für kundenorientierte, bearbeitungsintensive Aufgaben, die nicht ausfallen dürfen, eine gehostete API wie GPT-Image-2.5 nutzen und für Experimente, Offline-Batch-Jobs und alles, bei dem keine Prompts an einen Drittanbieter gesendet werden dürfen, ein offenes Modell wie LLaDA-Image vorhalten. Genau diese Aufteilung ist die Art von Problem, für die eine Routing-Schicht gebaut wurde: eine API, die die tatsächlich genutzten gehosteten Modelle erreicht und die Listenpreise der Anbieter ohne Aufschlag durchreicht – so kostet es später genauso viel, ein Open-Weight-Modell über eine gehostete Route auszuprobieren, wie direkt zum Anbieter zu gehen. Keines der beiden Modelle ist Stand 9. September 2026 im Katalog von OrcaRouter gelistet: GPT-Image-2.5 ist derzeit nur über die OpenAI-API erhältlich (die Vorgängergeneration GPT-Image-2 ist geroutet), und LLaDA-Image ist nur als Gewichte verfügbar, ohne gehostete Inferenz. Die Designabsicht bleibt unabhängig davon bestehen, was heute im Katalog steht.

Auf welchem sollten Sie aufbauen?
Wenn es bei Ihrer Arbeit um kommerzielle Bildgenerierung geht, bei der ein fehlgeschlagener Edit eine Kundenbeziehung kostet – etwa Produktaufnahmen, Kampagnen-Creatives, referenzkonsistentes Bildmaterial oder lange Multi-Turn-Edit-Sitzungen –, dann ist GPT-Image-2.5 das Modell, dessen gesamtes Design genau auf diese Aufgabe zugeschnitten ist, und der Sunburst-Endpunkt ist der Grund, dem Modell Aufmerksamkeit zu schenken, noch bevor unabhängige Scores vorliegen. Die Risiken liegen in der Intransparenz des Preises pro Bild und darin, dass jede Qualitätsbehauptung von OpenAI selbst stammt. Wenn es bei Ihrer Arbeit dagegen um Forschung, umfangreiches Experimentieren, zweisprachige Generierung auf Chinesisch und Englisch oder etwas geht, das in Ihrer eigenen Umgebung oder auf Ihren eigenen Daten laufen muss, dann ist LLaDA-Image das interessantere Release – wirklich offene Gewichte mit einem veröffentlichten Rezept, um den Preis, dass Sie Ihre eigene Infrastruktur betreiben und mit nicht reproduzierten Scores leben müssen. Die Modelle liegen bei der Veröffentlichung eine Woche und bei ihrem Betriebsmodell Welten auseinander; die richtige Wahl ist das Modell, dessen Kosten Sie tatsächlich tragen können.

