
MAI-Image-2.5-Pro vs Grok Imagine Image 2.0: Zwei Wetten auf Bildgenerierung mit Fokus auf Bearbeitung
- z-aiNEUZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianNEUQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligenz68Coding
- qwenNEUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokNEUSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenz77Coding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenz77Coding
- grokxAI: Grok 4.52026-07-0856Intelligenz72Coding
Zwei der interessantesten Bildmodelle des Jahres sind sich in der großen Idee einig: Bearbeitung ist die Zukunft, Generierung ist Grundvoraussetzung. MAI-Image-2.5-Pro (Microsoft, öffentliche Vorschau auf Foundry seit 23. Juli) und Grok Imagine Image 2.0 (xAI, ausgeliefert am 7. August als Standard-„Qualitätsmodus“ in Grok-Apps) verkaufen sich beide in erster Linie als Editoren. Aber sie haben unterschiedliche Werkzeuge gebaut, um das zu beweisen. Microsofts Modell ist eine Qualitäts-Engine – chirurgische, konsistenzerhaltende Bearbeitungen, untermauert durch Platz 1 auf der Artificial Analysis Image Editing Arena. xAIs Modell ist eine Bearbeitungsumgebung – eine Suite von benutzerorientierten Werkzeugen (Magic Wand, Segmentierung, Hintergrundentfernung, Smart Resize), die um einen Generator herum aufgebaut ist, der auf der anderen großen Arena Platz 2 bis 3 belegt. Das eine wird an der Wiedergabetreue gemessen, das andere am Arbeitsablauf. Das ist der wahre Unterschied zwischen ihnen.
Die Bearbeitungs-Toolsets haben nicht dieselbe Form.
• MAI-Image-2.5-Pro — eine Engine, keine Werkzeugkiste. Du lieferst die Anweisung und das Bild; sie führt präzise, chirurgische Bearbeitungen durch — gezielten Objektersatz, Layout-Änderungen, Textupdates im Bild, Artefakt-Bereinigung — während Subjektidentität, Beleuchtung und Textur über alle Iterationen hinweg konsistent bleiben. Microsofts 94%-Anspruch auf Multi-Bild-Zeichenkonsistenz (herstellerberichtet) ist das ganze Verkaufsargument: eine Sache ändern, alles andere beibehalten.
• Grok Imagine Image 2.0 — eine Umgebung. Es umfasst Magic Wand (nur einen ausgewählten Bereich bearbeiten), Segmentation (präzise Bereiche umfärben oder ersetzen), Hintergrundentfernung, Multi-Referenz-Eingabe (bis zu 5 Bilder in den Consumer-Apps, 3 in der API), Smart Resize (ein Bild in neun Seitenverhältnisse neu komponieren) und Templates für Produktfotografie, Porträts, E-Commerce, Spiel-Assets und Marketing-Poster.
Lies dir diese Liste durch und die Positionierung wird klar: MAI-Image-2.5-Pro ist das Modell, an das ein Entwickler eine API richtet; Grok Imagine Image 2.0 ist das Modell, mit dem eine Person in einer UI sitzt und arbeitet. xAI nannte es beim Start eine „Bearbeitungsumgebung", und das Toolset ist genau das.
Wo jeder Einzelne rangiert
• MAI-Image-2.5-Pro — Platz 1 in der Artificial Analysis Image Editing Arena (Elo 1.272, ca. 6.100 blinde Stimmen); Platz 7 bei Text-zu-Bild (1.292 Elo). Unabhängige, auf Blindpräferenzen basierende Bewertung.
• Grok Imagine Image 2.0 — xAIs Startbehauptung war weltweit Platz 2 auf Arenas Text-zu-Bild-Rangliste hinter GPT Image 2; beim Snapshot vom 10. August lag es auf Platz 3 (Elo 1.316) hinter GPT Image 2 (1.381) und Microsofts neuerem MAI-Image-2.6 (1.336). Dieser Rang ist unabhängig und vorläufig, und die Darstellung von xAI als „No. 2 worldwide“ sollte als das bezeichnet werden, was sie ist: eine vom Anbieter aufgestellte Startbehauptung, die inzwischen von der Live-Rangliste revidiert wurde.
Keines der Modelle führt auf dem Heimatgebiet des anderen, und keines steht an der Spitze der Hauptwertung des anderen. Die klare Lesart: Das Microsoft-Modell dominiert die Bearbeitungswertung, das xAI-Modell dominiert das Tooling und liegt nahe der Spitze bei der Generierung.

Textdarstellung, das entscheidende Feature
Der Text im Bild ist der Bereich, in dem sich die beiden am stärksten unterscheiden und in dem die unabhängigen Belege nur für eine Seite sprechen. Microsoft gibt für MAI-Image-2.5-Pro eine Textwiedergabegenauigkeit von 96,8 % für Englisch, Chinesisch, Japanisch, Koreanisch und Spanisch an — Herstellerangaben, unbestätigt und mit einer Megapixel-Ausgabebegrenzung gepaart, aber eine tatsächlich angegebene Fähigkeit mit mehrsprachiger Abdeckung. Die unabhängigen Testergebnisse von Grok Imagine Image 2.0, veröffentlicht durch OrcaRouters eigene Bewertung des Modells gegenüber GPT Image 2, ergaben, dass CJK-Text unzuverlässig gerendert wird — in einem Test wurde für eine Filmplakat-Überschrift traditionelles Chinesisch gerendert, obwohl vereinfachtes Chinesisch gewünscht war, was lokalisierte Werbeaufträge praktisch disqualifiziert. Für jeden Workflow, bei dem ein lesbares Wort im Bild eine Rolle spielt, ist MAI-Image-2.5-Pro auf dem Papier die sicherere Wahl; die Textqualität von Grok muss erst an eigenem Material geprüft werden, bevor man ihr vertrauen kann.
Preis
• MAI-Image-2.5-Pro — token-basiert abgerechnet: 5 $ pro Million Text-Input, 8 $ pro Million Bild-Input, 106 $ pro Million Bild-Output-Tokens. Die Umrechnung von Artificial Analysis setzt ein 1024×1024-Bild bei etwa 108,50 $ pro 1.000.
• Grok Imagine Image 2.0 — fester Preis pro Bild, keine Tokens: $0.05 pro Bild bei 1K oder 2K für die Qualitätsstufe (`grok-imagine-image-quality`), $0.02 für die Standardstufe, wobei sowohl die Eingabe als auch die Ausgabe berechnet werden. Bei 1K sind das $50 pro 1.000 Qualitätsbilder — etwa die Hälfte des Preises pro 1k von MAI-Image-2.5-Pro, mit einem festen Preis, der nicht mit der Prompt-Länge schwankt.
Die Preisgestaltungsmodelle unterscheiden sich grundsätzlich. Microsofts Token-basierte Abrechnung bestraft lange Prompts und große Ausgaben; xAIs pauschaler Preis pro Bild ist vorhersehbar und unabhängig von der Prompt-Länge. Bei nennenswertem Volumen ist der Pauschalpreis einfacher zu prognostizieren, und das Preisschild der Qualitätsstufe ist günstiger als das von MAI-Image-2.5-Pro.

Verfügbarkeit und der Routing-Winkel
Beide sind erreichbar, jedoch durch verschiedene Türen. MAI-Image-2.5-Pro ist eine Microsoft-Foundry-Vorschau und im MAI-Playground verfügbar – Sie benötigen ein Microsoft-Konto und die Vorschau-Preisliste gilt. Grok Imagine Image 2.0 wurde am 7. August in den Consumer-Apps von xAI eingeführt, und seine Qualitätsstufe ist über die Imagine-API von xAI aufrufbar; seit Mitte August ist es auch über den OpenAI-kompatiblen Endpunkt von OrcaRouter verfügbar, wo die Standard- und die Qualitätsstufe hinter einem einzigen Schlüssel liegen, mit Weitergabe der Anbieterpreise ohne Aufschlag und automatischem Failover auf ein Fallback wie GPT Image 2.
Der praktische Unterschied, den das bewirkt: Die Einführung von Grok Imagine Image 2.0 in einer Produktions-Pipeline ist eine Änderung des Modell-Strings an einem Endpunkt, den Sie möglicherweise bereits verwenden, mit einem günstigen Festpreis und einem integrierten Fallback für die Fälle, in denen es scheitert — genau die Fehlerart, die die Routing-Ebene abfangen soll. Die Einführung von MAI-Image-2.5-Pro bedeutet, vorerst direkt mit Foundry einen Vertrag abzuschließen, und der ehrliche Routing-Hinweis ist derselbe wie vor einem Monat: Wenn die Vorschau von Microsoft über eine Drittanbieter-API breit aufrufbar wird, dann eröffnet sich dafür dasselbe Ein-Schlüssel-Muster.

Das Urteil
Wählen Sie MAI-Image-2.5-Pro wenn Ihre Aufgabe eine hochpräzise Bearbeitung eines vorhandenen Bildes ist und das Ergebnis Bestand haben muss – es ist der unabhängige Nr.-1-Editor auf Artificial Analysis, es erhebt einen echten Anspruch auf mehrsprachige Textdarstellung, und der Preis ist entsprechend angesetzt. Wählen Sie Grok Imagine Image 2.0 wenn Sie einen Bearbeitungsworkflow mit echten Werkzeugen wünschen, einen festen Preis, der leicht zu kalkulieren ist und etwa die Hälfte der Kosten pro Bild beträgt, und ein Modell, das Sie heute mit einer Fallback-Option einbinden können. Die ehrliche Formulierung ist nicht „welches ist besser“ – sondern welche Wette zu Ihrem Workflow passt: Microsoft setzt darauf, dass die Wiedergabetreue die Bearbeitung gewinnt, und xAI setzt darauf, dass das Werkzeug den Nutzer gewinnt. Beide Positionen sind vertretbar; was den Ausschlag gibt, sind Ihre Anforderungen an die Ausgabequalität und Ihre Toleranz für das Risiko bei der Textdarstellung.
