Hero-Titelkarte für Grok Imagine Image 2.0 mit der Aufschrift „Grok Imagine Image 2.0 — #2 in der Text-zu-Bild-Arena, Präzisionsbearbeitung, jetzt live in Grok-Apps“, der Bildunterschrift „Angekündigt am 7. August 2026 von xAI“ und einem flachen Bearbeitungssymbol in Form eines Bilderrahmens mit Stift.
Guides & Insights

Grok Imagine Image 2.0: Nr. 4 bei Artificial Analysis, zu einem Drittel des Preises

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Grok Imagine Image 2.0 ist auf Platz 4 der Text-to-Image-Bestenliste von Artificial Analysis gelandet, und die Zahl, auf die es ankommt, ist nicht der Rang – es ist der Preis daneben. Das Modell steht bei 1.153,66 Elo, hinter drei Einträgen: GPT Image 2.5 Flare (max), GPT Image 2.5 Sunburst (max) und GPT Image 2 (high). Vor jedem Modell anderer Labore, einschließlich Microsofts MAI-Image-2.6 und des Nano Banana 2-Modells. Damit ist das Modell der höchstplatzierte Bildgenerator außerhalb dieses Trios und mit Abstand das günstigste unter den Top vier: Artificial Analysis berechnet dafür 60 US-Dollar pro 1.000 Bilder gegenüber rund 211 US-Dollar für die drei darüber liegenden Einträge. Das Modell selbst stammt vom 7. August 2026 – geändert hat sich, wo die unabhängige Rangliste es platziert, und was das für die „world #2“-Darstellung bedeutet, die der Hersteller zum Start verwendete.

Was die Platzierung #4 tatsächlich misst

Artificial Analysis' Text-to-Image-Leaderboard ist eine blinde Arena für menschliche Präferenzen: Abstimmende sehen Ausgaben zum selben Prompt ohne Modellbezeichnungen und wählen die bessere aus, und das daraus resultierende Elo wird unabhängig von jeglichem Anbieter veröffentlicht. Der Eintrag von Grok Imagine Image 2.0 steht auf Platz 4 mit 1.153,66 Elo und einem 95%-Konfidenzintervall von 1.141,66 bis 1.165,66. Nichts an dieser Zahl stammt von xAI. (Ein organisatorisches Detail, das man kennen sollte, wenn man die Tabelle liest: Artificial Analysis führt als Ersteller des Modells SpaceXAI auf.)

Die Preishälfte der Geschichte ist die interessantere Hälfte. Auf derselben Seite wird Qualität gegen Preis aufgetragen, mit einer Pareto-Linie, die die Modelle markiert, die das meiste Elo pro Dollar liefern, und laut den vom Board selbst veröffentlichten Zahlen ist Grok Imagine Image 2.0 das Modell mit der höchsten Punktzahl, das unter 100 $ pro 1.000 Bilder kostet. Das in der Qualität nächsthöhere Modell, GPT Image 2 (high), kostet 211 $ pro 1.000 – etwa dreieinhalb Mal so viel für rund 17 Elo mehr. Das ist eine Preis-Leistungs-Aussage, keine Aussage darüber, das beste Modell zu sein, und es ist die Version der Geschichte, die die unabhängigen Daten tatsächlich stützen.

Die Frontier-Position ist real, aber knapp, und es lohnt sich, das klar zu sagen. Microsofts MAI-Image-2.6 liegt einen Rang darunter bei 38,90 $ pro 1.000, und Metas Muse Image kostet 10 $ pro 1.000 bei 1.111 Elo. Die Elo-Intervalle auf diesem Board betragen etwa ±12 Punkte, daher liegen #4 und #5 – getrennt durch 6,5 Elo – innerhalb der Fehlerbalken des jeweils anderen. Betrachten Sie die Platzierung als „Top Five“, nicht als gesicherten Platz.

Der Aufstieg um 14 Plätze ist die Lücke zu der Stufe, die Grok Imagine Image 2.0 ersetzt hat. Die vorherige Qualitätsstufe von xAI, grok-imagine-image-quality, liegt mit 1.043,21 Elo auf #18 auf derselben Rangliste, und das ursprüngliche grok-imagine-image liegt mit 1.017,86 auf #29. Das sind rund 110 Elo und 14 Rangplätze zwischen dem Modell, das xAI jetzt als seinen Standard für Bilder dokumentiert, und dem, das es ablöst.

Wo der „Weltnummer 2"-Anspruch jetzt steht

Zum Marktstart verwies xAI auf einen #2-Platz sowohl in den Text-zu-Bild- als auch in den Bildbearbeitungs-Arena-Ranglisten, mit etwa 1.320 Elo und als vorläufig gekennzeichnet. Dabei handelte es sich um Zahlen, die xAI in der eigenen Ankündigung hervorgehoben hatte – nicht um eine von xAI in Auftrag gegebene unabhängige Bewertung –, und sie haben sich seitdem verändert: Der Schnappschuss vom 10. August führte das Modell mit 1.316 Elo auf Platz 3, hinter MAI-Image-2.6 und GPT Image 2. Der #2-Platz bei der Bildbearbeitung bleibt eine Angabe von xAI selbst.

Artificial Analysis ist ein anderes Leaderboard mit einer anderen Methode und einer anderen Gruppe von Abstimmenden, und es platziert das Modell jetzt auf Platz 4. Die beiden widersprechen sich nicht wirklich – sie erfassen menschliche Präferenzen unterschiedlich, und beide sind Momentaufnahmen von Ranglisten, die sich Woche für Woche verändern. Die ehrliche Zusammenfassung von sechs Wochen unabhängigen Rankings ist, dass Grok Imagine Image 2.0 durchweg unter den Top Five liegt und nie ganz die #2 ist, die xAI angekündigt hat.

Was Grok Imagine Image 2.0 tatsächlich liefert

xAI positioniert Grok Imagine Image 2.0 als Bearbeitungsumgebung statt als weiteren One-Shot-Generator. Der Funktionsumfang:

Magic Wand — Bearbeitungen auf Regionsebene, die den Rest des Frames unberührt lassen

Segmentierung — präzise Regionsauswahl für Farbkorrektur, Ersetzung oder Anpassung

Hintergrundentfernung — Export von Motiven mit transparentem Hintergrund

Multi-Bild-Eingabe — bis zu fünf Quellbilder pro Bearbeitung; die Dokumentation von xAI nennt inzwischen fünf, nachdem die API zum Start auf drei begrenzt war

Smart Resize — setzt ein Bild in 9 Seitenverhältnisse um (1:2 hoch bis 2:1 breit), wobei neue Bildinhalte generiert werden, statt zu beschneiden

Vorlagen — vordefinierte Workflows für Produktfotografie, Porträts, E-Commerce-Listings, Spiel-Assets und Marketing-Poster

Die API bietet Steuerungsoptionen, die die Consumer-App nicht an die Oberfläche bringt: Seitenverhältnis – einschließlich 21:9 und 5:2, beide neu in 2.0 –, Auflösung (standardmäßig 1K, optional 2K) sowie einen Qualitätsparameter mit den Werten low, medium oder auto. Auf der Consumer-Seite wird das Modell als standardmäßiger Quality Mode auf grok.com/imagine, iOS und Android ausgeliefert, und seit dem 13. August ist es außerdem auf Runways Plattform gelistet, wo es zu den Bild- und Videomodellen stieß, die Runway bereits hostet. Diese Auflistung ist eine Aussage von Anbieter und Partner statt einer unabhängigen Bewertung, doch sie war das erste Anzeichen für eine Distribution durch Dritte nach dem Launch.

Bei der Darstellung von Überschriftentext sagt xAI, dass das Modell „Typografie und Layout so plant, wie es ein Designer tun würde“, dichte mehrteilige Kompositionen intakt hält und kleinen Text gestochen scharf darstellt. Es bewahrt außerdem die Identität eines Motivs und die Einstellungen über mehrstufige iterative Bearbeitungen hinweg.

Was ein erster unabhängiger Test herausfand

Ein Vergleich mit sechs Prompts, einem einzigen Seed und ohne Cherry-Picking gegen gpt-image-2 ergab eine klare Zweiteilung, und nichts an der neuen Platzierung im Leaderboard ändert daran etwas.

Grok gewinnt: Fotorealismus und Identitätserhaltung. Die Handanatomie im Porträt war korrekt, mit Hautdetailtreue bis auf Poren-Ebene, Subsurface-Scattering und natürlichem Catchlight und Rim-Light. Bei einer geometrischen Rotationsaufgabe um 45 Grad hielt Grok die Gesichtsidentität über dem ArcFace-0.5-Schwellenwert, während gpt-image-2 stärker abwich.

Grok verliert: produktionskritische Bereiche. Bei der Anfrage nach einer Schlagzeile für ein Filmplakat in vereinfachtem Chinesisch gab es traditionelle chinesische Schriftzeichen aus — ein „hartes Ausschlusskriterium“ für Lokalisierungs- und Publishing-Pipelines. Eine Anfrage zur Aquarell-Stilfusion lieferte ein fotorealistisches Bild mit nur einem leichten malerischen Texturdurchgang — eine „Disqualifizierung auf Kategorie-Ebene“. Lokale Bearbeitungen schlossen alle drei Anfragen ab, konnten aber die Fensteransicht nicht bewahren und verankerten ein Highlight falsch.

Zusammenfassung: Grok Imagine Image 2.0 „führt bei Fotorealismus und Identität und liegt zurück bei Bearbeitungszuverlässigkeit, mehrsprachigem Text und echtem Stiltransfer." Ein Leaderboard mittelt Präferenzen über Tausende blinde Vergleiche; es kann dir nicht sagen, ob das Modell deine chinesische Überschrift richtig hinbekommt. Ein Test mit sechs Prompts ist ebenso wenig eine Beweisgrundlage – aber von den beiden ist der konkrete Fehler das handlungsrelevantere Signal für ein Team, das lokalisierte Assets ausliefert.

Die API und die Preiskalkulation

Die Entwickler-Story hat sich seit dem Launch geändert. grok-imagine-image-2.0 ist jetzt das Modell, das xAI für Bildgenerierung, Einzelbildbearbeitung und Multi-Bild-Bearbeitung dokumentiert, und es ist das, was die eigene Modellseite von xAI für Bilder empfiehlt. Die Zeile „Entwickler-API-Zugriff kommt bald“ aus der Launch-Ära ist von den Modell- und Preisseiten des Anbieters verschwunden.

• grok-imagine-image-2.0: ab $0,04 pro Bild, abgerechnet nach der tatsächlich bereitgestellten Qualität

• grok-imagine-image (1.0): 0,02 $ pro Bild, von der untenstehenden Änderung nicht betroffen

• grok-imagine-image-quality: $0.05 pro Bild, wird am 2. November 2026 eingestellt

Qualität ist der Hebel bei den Kosten. Auto – der Standard, wenn der Parameter ausgelassen wird – verwendet derzeit low für die Generierung und medium für die Bearbeitung, sodass eine Generierungsanfrage mit dem low-Tarif und eine Bearbeitung mit dem medium-Tarif abgerechnet wird. Wenn Sie low oder medium festlegen, wird die Rechnung vorhersehbar, statt davon abhängig zu sein, welchen Pfad der Dienst wählt.

Der letzte Aufzählungspunkt ist mit einer Frist verbunden. xAIs Migrationsleitfaden zufolge wird der Slug grok-imagine-image-quality am 2. November 2026 außer Betrieb genommen, nach einer 60-tägigen Vorankündigung, die am 2. September begann. Ab diesem Datum wird der Slug weiterhin aufgelöst, aber Anfragen werden von grok-imagine-image-2.0 bedient, wobei quality auf low gesetzt ist – eine Kompatibilitäts-Weiterleitung, keine harte Abschaltung. Da die low-Stufe bei jeder Auflösung 0,01 US-Dollar pro Bild günstiger ist als die alte quality-Stufe, werden Teams, die nichts ändern, eine Preissenkung und eine stillschweigende Änderung der Ausgabequalität feststellen. Die bewusste Migration – indem Sie grok-imagine-image-2.0 nennen und quality dort fixieren, wo stabile Ausgabe zählt – ist die Variante, die Sie wollen. Dieses Datum und das Weiterleitungsverhalten stammen aus xAIs eigener Dokumentation – vom Anbieter angegeben, nicht unabhängig getestet.

Gegenüber den OpenAI-Optionen ist der Vergleich ebenso sehr ein Unterschied im Preismodell wie ein Preisunterschied. gpt-image-2 wird nach Tokens abgerechnet – 8 $ pro Million Bild-Eingabe-Tokens und 30 $ pro Million Bild-Ausgabe-Tokens nach den von OpenAI veröffentlichten Preisen –, sodass die Kosten pro Bild mit Auflösung und Detailgrad schwanken. Der repräsentative Wert von Artificial Analysis – 211 $ pro 1.000 Bilder für GPT Image 2 (high) gegenüber 60 $ bei Grok – ist genau diese Schwankung, ausgedrückt als einzelne Zahl. Pauschale Preise pro Bild sind im großen Maßstab weitaus leichter zu prognostizieren, und das ist zum größten Teil der Grund, warum ein Modell auf dem vierten Platz überhaupt einen Blick wert ist.

Es ausprobieren, ohne die Pipeline aufs Spiel zu setzen

Die vernünftige Reaktion auf Grok Imagine Image 2.0 ist nach wie vor: „Probier es aus, aber leg dich noch nicht darauf fest.“ Seine Position liegt innerhalb überlappender Konfidenzintervalle, ein unabhängiger Test hat echte Schwächen bei lokalisiertem Text und Style-Transfer gemeldet, und xAI nimmt im November einen Slug darunter außer Betrieb. Genau das spricht für Routing statt dafür, eine direkte Integration fest zu verdrahten.

Auf OrcaRouter: grok-imagine-image — xAIs Bildmodell in unserem Katalog — liegt auf demselben OpenAI-kompatiblen Endpoint wie gpt-image-2, sodass der Wechsel zwischen xAI- und OpenAI-Bildmodellen eine Änderung des Modell-Strings ist: kein zweiter Vertrag, kein neues SDK. OrcaRouter gibt die Listenpreise der Anbieter ohne Aufschlag weiter, sodass eine Preissenkung eines Anbieters hier noch am selben Tag wirksam wird, und automatisches Failover kann Fehler, Rate Limits oder Ablehnungen an ein Fallback-Modell statt in deinen Produktionspfad senden. Eine ehrliche Einschränkung, unverändert gegenüber der ursprünglichen Bewertung: xAIs neueste Qualitätsstufe ist ein separater Eintrag, getrennt von dem Grok-Bildmodell, das bereits in unserem Katalog ist, also prüfe die aktuelle Modellliste, statt anzunehmen, dass eine bestimmte Grok-Variante heute routbar ist.

Was als Nächstes ansehen

1. Die Migration vom 2. November.Ob Teams explizit zu grok-imagine-image-2.0 wechseln oder auf die Weiterleitung und deren minderwertigen Standard abdriften, ist die größte Sache, die xAI bei diesem Modell noch falsch machen kann – und die Weiterleitung macht den Fehler unsichtbar, es sei denn, man liest das Feld model in seinen Antworten.

2. Ob #4 Bestand hat. Der Abstand zu MAI-Image-2.6 beträgt 6,5 Elo bei Intervallen von ±12 Punkten, sodass ein paar tausend zusätzliche Stimmen die Rangliste in beide Richtungen umordnen könnten. Der 110-Elo-Zugewinn gegenüber der vorherigen Stufe scheint von Dauer zu sein; der genaue Rang nicht.

3. Wie viel von der Consumer-Oberfläche die API erreicht. Generierung, Bearbeitung und Multi-Bild-Bearbeitung sind dokumentiert. Vorlagen und der benannte Smart-Resize-Workflow bleiben App-Funktionen, und in dieser Lücke lebt der verbleibende „Nur-Consumer“-Vorbehalt.

Unterm Strich: Grok Imagine Image 2.0 ist ein echtes, leistungsfähiges Modell, das nun unabhängig eingestuft wurde – auf Platz 4 in Artificial Analysis' Text to Image Leaderboard, der beste Nicht-OpenAI-Eintrag dort, rund 110 Elo vor der Stufe, die es ersetzt hat, und an der Preis-Qualitäts-Grenze des Boards mit 60 US-Dollar pro 1.000 Bilder gegenüber etwa 211 US-Dollar für die OpenAI-Modelle direkt darüber. Die Formulierung „weltweit Nr. 2“ war immer xAIs Momentaufnahme zum Launch, und die unabhängigen Boards haben das nie ganz so gesagt. Seine zwei klarsten unabhängigen Schwächen – die Einhaltung von vereinfachtem Chinesisch und die Zuverlässigkeit beim Stiltransfer – betreffen Funktionen, die Teams am häufigsten von einer Bild-API benötigen. Testen Sie es sofort für fotorealistische, identitätsbewahrende Arbeit; warten Sie damit bei Pipelines, die lokalisierten Text oder stilisierte Assets ausliefern, und wenn Sie bereits den auslaufenden Quality-Slug aufrufen, migrieren Sie vor dem 2. November.