Hero-Titelkarte für Ideogram 4.5 vs. GPT Image 2.5, mit der Aufschrift „97 Elo Abstand beim Editing – und der Anbieter nannte den Gegner“, mit Chips für „Ideogram 4.5 – live ab 30. September 2026“, „GPT Image 2.5 Sunburst – live ab 8. September 2026“, „Ideogram 4.5 Edit Elo 1.064“, „Sunburst Edit Elo 1.182“. Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Guides & Insights

Ideogram 4.5 vs. GPT Image 2.5: Ideogram hat diesen Kampf selbst angezettelt

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die meisten Modellvergleiche werden von denjenigen zusammengestellt, die sie schreiben. Dieser wurde zusammengestellt von Ideogram. Die Startseite für Ideogram 4.5, seit dem 30. September 2026 live, enthält eine Demo zum Bearbeiten im direkten Vergleich und nennt ihre Gegner in der Bildunterschrift: „dieselben Bearbeitungen mit Ideogram 4.5 vs. GPT Image 2.5 Sunburst, Nano Banana Pro und Nano Banana 2.“ Dann stellt sie eine Behauptung darüber auf, was der Betrachter sehen wird – „Ausgaben von GPT Image und Nano Banana werden schon nach wenigen Bearbeitungen unbrauchbar, während Ideogram 4.5 Bearbeitung für Bearbeitung sauber bleibt.“

Das ist ungewöhnlich direkt. Ein Anbieter, der das Benchmark-Ziel auswählt und Ihnen das Ergebnis im Voraus mitteilt, verdient es, in einer Hinsicht ernst genommen und in einer anderen skeptisch betrachtet zu werden. GPT Image 2.5 ist das Stärkste auf den unabhängigen Ranglisten in beiden Bildkategorien, also ist es der richtige Gegner, den man ausgewählt hat. Und es ist ein Release mit zwei Kennungen – Flare und Sunburst, beide am 8. September 2026 veröffentlicht – mit öffentlichen Arena-Werten, die Ideogram 4.5 derzeit nicht erreicht. Die interessante Frage ist nicht, wer die Arena gewinnt. Sondern ob Ideograms Behauptung etwas misst, das die Arena nicht misst.

Wo beide Modelle genau stehen

• Ideogram 4.5 — veröffentlicht am 30. September 2026. Präzisions-Bearbeitungsmodell; Generieren plus Bearbeiten mit vier Rendering-Geschwindigkeiten; natives 2K; Bearbeitungen demonstriert bei Quellauflösung bis zu 4.016 × 6.016 (24,2 MP). Text-zu-Bild: 34. von 167 mit 1.014 ± 11 Elo (2.247 Stimmen); Bildbearbeitung: 23. mit 1.064 ± 11 Elo (2.382 Stimmen). 0,03–0,22 $ pro Bild je nach Geschwindigkeitseinstellung.

• GPT Image 2.5 Sunburst — am 8. September 2026 als die präzisionsorientierte Hälfte des aufgeteilten Bild-Upgrades von OpenAI veröffentlicht, API-Kennung gpt-image-2.5-sunburst. Text-zu-Bild Nr. 1 mit 1.197 ± 9 Elo (14.023 Stimmen); Bildbearbeitung Nr. 1 mit 1.182 ± 8 Elo (17.899 Stimmen). Preis: 210,70 $ pro 1.000 Bilder bei der Umrechnung des Boards.

• GPT Image 2.5 Flare – die schnelle Hälfte desselben Releases, Kennung gpt-image-2.5-flare. Nr. 2 auf beiden Ranglisten: 1.190 Text-zu-Bild, 1.162 Bearbeitung. Gleicher Preis: 210,70 $ pro 1.000.

Setzt man die beiden Editing-Werte nebeneinander, beträgt die Lücke 118 Elo — 1.182 gegen 1.064 — mit Konfidenzintervallen von ±8 und ±11. Die Intervalle überschneiden sich nicht. Auf dem Board, das die Präferenz für Single-Shot-Editing misst, gewinnt Sunburst, und zwar mit ungefähr siebeneinhalbmal so vielen Stimmen dahinter.

Was die Bestenliste misst und was nicht

Dies ist der Teil, der darüber entscheidet, ob Ideograms Behauptung den Kontakt mit den Beweisen übersteht.

Die Editing-Arena von Artificial Analysis beruht auf blinder paarweiser menschlicher Präferenz: Die Abstimmenden sehen dasselbe Quellbild und dieselbe Anweisung, erhalten zwei bearbeitete Ergebnisse ohne Kennzeichnungen und wählen das bessere aus. Sie ist eine starke Methode für die Frage, „welche dieser beiden Ausgaben eher so aussieht, wie es die Anweisung verlangt hat“.

Es kann nicht messen, wofür Ideogram wirbt. Wer eine einzelne Bearbeitung beurteilt, kann nicht sehen, ob das Modell still die Tapete verändert, ein Gesicht um zwei Millimeter verschoben oder das Korn im restlichen Bild neu gerendert hat. Der Fehler, den Ideogram zu beheben vorgibt, wird erst über eine Sequenz hinweg sichtbar – Runde vier, Runde sieben, Runde zehn – und keine Mainstream-Arena legt den Abstimmenden Sequenzen vor. Ein Wert von 1.064 Elo besagt, dass Ideograms einzelne Bearbeitungen gut sind. Er besagt überhaupt nichts darüber, ob sie gut bleiben.

Das ist für Ideogram ein zweischneidiges Schwert, und die ehrliche Version ist diese: Die Bestenliste bestätigt die Drift-Behauptung nicht und widerlegt sie auch nicht. Was sie widerlegt, ist die implizite stärkere Behauptung, die ein Leser von der Launch-Seite mitnehmen könnte – dass 4.5 der bessere Editor ist, Punkt. Gegenüber der Bestenliste ist es der niedriger platzierte Editor, und zwar mit einem Abstand, der größer ist als seine Fehlerbalken.

Screenshot of the Ideogram 4.5 model page showing the model-comparison section headed 'Compare models across multi-turn edits', with a side-by-side video widget captioned to show the same edits applied to Ideogram 4.5 alongside GPT Image 2.5 Sunburst, Nano Banana Pro and Nano Banana 2

Was der eine tut, das der andere nicht tut.

• Bearbeitung in Quellauflösung — die herausragende technische Behauptung von Ideogram 4.5. Auf der zugehörigen Seite wird eine Bearbeitung an einer 4.016 × 6.016 großen Quelle ohne Herunterskalierung gezeigt, mit dem Versprechen, dass die Bearbeitungsgrenze gut genug erhalten bleibt, um den Ausschnitt wieder in das Original einzufügen. Für Druckarbeiten ist das der Unterschied zwischen einem lieferbaren Ergebnis und einem Kompromiss.

• Breite der Parameteroberfläche — die von GPT Image 2.5. OpenAI fügte xhigh und max zur Qualitätsleiter hinzu und machte transparente Hintergründe zu einem erstklassigen Parameter, wobei background auf transparent, opaque oder auto gesetzt werden kann und die Ausgabe als PNG oder WebP erfolgt. Transparente Ausgabe war eine Lücke bei GPT Image 2 und wurde beim 2.5-Paar zum Hauptmerkmal.

• Schnellspur — Flare wurde speziell dafür entwickelt, der schnelle Standard zu sein. OpenAI behauptet bis zu 50 % niedrigere Latenz als die vorherige Generation; Sunburst ist bewusst langsamer und auf Bearbeitungen ausgerichtet, die einer genauen Prüfung standhalten müssen.

• Preisstruktur — Ideogram rechnet pro Bild nach Rendering-Geschwindigkeit ab ($0,03 bis $0,22). OpenAI rechnet nach Tokens ab, und zwar nach derselben Preisliste wie GPT Image 2 – 8 $ pro Million Image-Input-Tokens, 30 $ pro Million Image-Output-Tokens – weshalb die unabhängige Umrechnung pro Bild für ein hochwertiges 1024 × 1024 bei etwa $0,21 landet.

Die Preislinien kreuzen sich an einer ungünstigen Stelle. Bei den Einstellungen Low und Medium von Ideogram 4.5 ist es pro Bild dramatisch günstiger als das OpenAI-Paar. Bei High – wo die Drift-Demonstration angesiedelt ist und wo man eine 24-Megapixel-Quelle laufen lassen würde – liegen die beiden nahe bei derselben Zahl. Der Vergleich, den die meisten Käufer tatsächlich durchführen werden, ist hochwertiges Ideogram 4.5 gegen hochwertiges Sunburst, und bei diesem Vergleich ist der Preis ungefähr gleichauf – bei einem 118-Elo-Defizit auf dem gemessenen Board.

Was in Ordnung ist, wenn die Drift-Behauptung zutrifft. Das ist die gesamte Wette.

Screenshot of OrcaRouter's public model catalogue listing 206 models from 16 providers behind one API key, with the model cards and the three-step 'How to call any model' panel showing the OpenAI-compatible endpoint.Comparison scoreboard for Ideogram 4.5 and GPT Image 2.5 Sunburst. Left column 'Ideogram 4.5': live Sep 30 2026, editing rank 23 at 1,064 Elo from 2,382 votes, text-to-image rank 34 at 1,014 Elo, $0.03 to $0.22 per image, max edit resolution 4,016 by 6,016 pixels, open weights planned. Right column 'GPT Image 2.5 Sunburst': live Sep 8 2026, editing rank 1 at 1,182 Elo from 17,899 votes, text-to-image rank 1 at 1,197 Elo, $210.70 per 1,000 images, transparent background output, quality ladder through max. A footer reads 'All leaderboard figures per Artificial Analysis, October 2026; price conversions are the board's own.'

Der Unterschied bei der Barrierefreiheit, den niemand vermarktet

Eine praktische Asymmetrie verläuft in die entgegengesetzte Richtung zur Rangliste. Die beiden Kennungen von GPT Image 2.5 sind neuer als alles im Katalog von OrcaRouter — unsere OpenAI-Bildlinie ist heute GPT-Image-1.5 zu $8/$32 pro Million Tokens und GPT-Image-2 zu $8/$30, beide zum Listenpreis des Anbieters ohne Aufschlag abgerechnet. Das 2.5-Paar ist auf OpenAIs Preisliste zu denselben $8/$30 wie GPT-Image-2 erschienen, was bedeutet: Sobald sie routbar sind, landen sie zum selben Weitergabepreis statt bei einem neuen, und die Kostenfrage zwischen ihnen dreht sich dann um Token-Effizienz statt darum, welchen Anbieter Sie aufrufen.

Ideogram 4.5 ist über Ideograms eigene API und auf Partnerplattformen verfügbar. Es ist nicht in unserem Katalog. Das ist auf langweilige Weise wichtig für den Vergleich: Eines dieser beiden Modelle ist ein Drop-in für einen OpenAI-kompatiblen Client, das andere ist eine neue Integration. Wenn Sie GPT-Image-2 bereits über einen OpenAI-förmigen Endpunkt aufrufen, kostet der Versuch mit Sunburst nur eine Änderung der Modell-ID; der Versuch mit Ideogram 4.5 kostet einen zweiten Vertrag und einen zweiten Client, noch bevor Sie überhaupt zur Bewertung der Qualität kommen.

Eine Routing-Schicht beseitigt diesen Unterschied nicht – sie entfernt lediglich die Infrastruktur von der Seite, die bereits kompatibel ist, und ermöglicht es Ihnen, einen Teil des Datenverkehrs auf einen neuen Anbieter zu leiten, ohne einen Produktionspfad darauf festzulegen. Failover ist hier wichtiger als üblich, denn bei dem, was Sie testen würden, handelt es sich um ein Modell, für dessen zentrale Behauptung es keine unabhängige Überprüfung gibt und dessen Stichprobengrößen ein Fünftel derjenigen seines Konkurrenten betragen.

Wie man es klärt

Führe diesen Vergleich nicht mit einzelnen Bildern durch. Das ist die Methode der Arena und das falsche Instrument — es wird dir sagen, dass Sunburst gewinnt, was du bereits wusstest.

Wende es auf Sequenzen an. Nimm fünf oder zehn Bilder aus deiner eigenen Arbeit, schreibe dieselbe Kette aus sechs oder acht schrittweisen Bearbeitungen und führe die identische Kette auf Ideogram 4.5 (High) und auf Sunburst (max) aus. Vergleiche dann für jedes Modell Durchgang eins mit Durchgang acht – und zwar in den Regionen, von denen du nie wolltest, dass das Modell sie berührt. Zähle die Pixel, die sich verändert haben. Diese Zahl – die Divergenz unveränderter Regionen über eine Sequenz hinweg – ist das, womit Ideogram zu gewinnen behauptet, und meines Wissens veröffentlicht sie niemand für eines der beiden Modelle.

Dann bepreise beide Durchläufe pro fertiggestellter Sequenz. Zu diesem Zeitpunkt wirst du eine Antwort haben, die mehr als 118 Elo wert ist, weil es um deine Bilder gehen wird und nicht um die eines Abstimmungspanels.

Was dieses Matchup tatsächlich ist

Ideogram 4.5 hat nicht an einem Wettbewerb teilgenommen, den es auf den Ranglisten gewinnt, und es scheint das zu wissen – weshalb die Launch-Seite eher ein Verhalten vorführt, als einen Rang auszugeben. Das Verhalten, das sie vorführt, ist real genug, dass es sich lohnt, es zu testen, und spezifisch genug, um falsifizierbar zu sein: Entweder bleiben wiederholte Bearbeitungen stimmig oder nicht, und ein Test über zehn Runden mit deinen eigenen Dateien klärt das an einem Nachmittag.

Die vernünftige Lesart ist heute, dass GPT Image 2.5 Sunburst der bessere Editor ist – nach dem einzigen unabhängigen Maßstab, den es gibt, mit einem Vorsprung außerhalb der Fehlerbalken und mit weit mehr Evidenz hinter der Zahl – und dass Ideogram 4.5 eine engere, nicht gemessene Eigenschaft zu einem Preis verkauft, der bei niedrigen Einstellungen günstiger und bei der Einstellung, von der seine Behauptung abhängt, ungefähr gleich ist. Wenn Multi-Turn-Treue Ihr Produktionsengpass ist, ist der Test günstig, und das Modell hat ihn verdient. Wenn nicht, hat das Board bereits geantwortet.