
MAI-Image-2.5-Pro sichert sich Platz #1 in der Bildbearbeitung: Was Microsofts unabhängiger Sieg tatsächlich beweist
- AlibabaNEUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.3 Flash2026-08-2658Intelligenz72Coding
- DeepSeekNEUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianNEUQwen3.8 27B2026-08-1552Intelligenz68Coding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
MAI-Image-2.5-Pro ist jetzt das bestbewertete Bildbearbeitungsmodell auf dem Leaderboard von Artificial Analysis – einem unabhängigen Board mit verdeckter Abstimmung – während es bei reiner Text-zu-Bild-Generierung nur auf Platz sieben liegt. Dieser Unterschied ist die Geschichte: Ein Modell, das seit weniger als einem Monat in der öffentlichen Vorschau ist und vollständig intern von Microsoft AI entwickelt wurde, übertrifft GPT Image 2, Reve 2.1, und sein eigenes Geschwistermodell MAI-Image-2.5 auf dem Bearbeitungs-Board, hinkt jedoch den meisten der gleichen Konkurrenten hinterher, wenn die Aufforderung „zeichne mir etwas aus dem Nichts.“ lautet. Liest man beide Zahlen zusammen, erhält man ein genaues Bild davon, was Microsoft ausgeliefert hat: ein Spezialist für die Veränderung vorhandener Bilder, kein Allzweck-Generator.
Die beiden Zahlen, nebeneinander
Mit Stand des Snapshots vom August 2026 setzt die Image-Editing-Arena von Artificial Analysis MAI-Image-2.5-Pro auf Platz 1 mit Elo 1.272, basierend auf rund 6.100 blinden Nutzervergleichen. Das Verfolgerfeld ist eng: Reve 2.1 bei 1.262, dann MAI-Image-2.5 und GPT Image 2 (high) gleichauf bei 1.256, GPT Image 1.5 (high) bei 1.250, Qwen-Image-3.0-Pro bei 1.249 und Gogles Nano Banana 2 bei 1.249. In der Text-to-Image-Arena liegt es bei Platz 7 mit Elo 1.292, hinter GPT Image 2 (high) mit 1.369, Reve 2.1 mit 1.322, Nano Banana 2 mit 1.320, GPT Image 1.5 (high) mit 1.310, MAI-Image-2.5 mit 1.304 und Nano Banana Pro mit 1.296.
• Bearbeitung: Nr. 1 — 1.272 Elo, ~6.100 Stichproben
• Text-zu-Bild: Nr. 7 — 1.292 Elo, ~11.500 Stichproben
• Abstand zu Nr. 2 beim Editieren: 10 Elo über Reve 2.1
• Abstand zu Nr. 1 bei Text-zu-Bild: 77 Elo hinter GPT Image 2 (hoch)
Was den Bearbeitungsrang wertvoller macht als eine Eitelkeitszahl, ist der Mechanismus. Die Artificial-Analysis-Arena ist blinde menschliche Präferenz: Wähler sehen dasselbe Eingabebild und dieselbe Anweisung, erhalten zwei bearbeitete Ergebnisse und wählen das stärkere. Kein Anbieter-Skript schreibt die Punktzahl. So ist der erste Platz dort das Nächste, was der Markt zu „den Leuten gefiel die Ausgabe dieses Editors am besten“ hat — und er ist ein jüngster Aufstieg, kein Strohfeuer am Starttag. Behandle die Richtung als solide und das genaue Elo als vorläufig; Ranglisten mit wenigen Stimmen bewegen sich.

Die Text-zu-Bild-Bestenliste, am selben Tag erfasst, ist dasselbe Modell in einem anderen Licht — nicht mehr führend, aber immer noch komfortabel in den Top Ten eines Feldes, das zwischen 1.290 und 1.370 Elo eng beieinanderliegt.

Was MAI-Image-2.5-Pro eigentlich ist
MAI-Image-2.5-Pro ist die Qualitätsstufe von Microsoft AI innerhalb der MAI-Image-2.5-Familie, die am 23. Juli 2026 zusammen mit MAI-Voice-2-Flash angekündigt und in die öffentliche Vorschau auf Microsoft Foundry (Azure AI Foundry) sowie in den kostenlosen MAI Playground aufgenommen wurde. Microsoft beschreibt es als sein bisher bildtreuestes Bildmodell, das auf Hero-Bilder, detaillierte Bearbeitung und präzise Textdarstellung in Bildern ausgelegt ist. Die Familie deckt nun die gesamte Kostenkurve ab: MAI-Image-2.5 für ausgewogene Arbeit, MAI-Image-2.5-Flash für hohe Volumen und die Pro-Stufe am Qualitätsende – mit einem neueren Geschwistermodell, MAI-Image-2.6, das sich bereits seit dem 19. August in privater Vorschau befindet.
Microsofts eigene Behauptungen zur Pro-Stufe, alle vom Anbieter gemeldet und noch keine unabhängig reproduziert:
• 96,8 % Textdarstellungsgenauigkeit — angegeben als Abdeckung von Chinesisch, Englisch, Japanisch, Koreanisch und Spanisch, obwohl dieselbe Dokumentation die Ausgabe auf etwa ein Megapixel begrenzt; daher ist die Formulierung „8K“ in der Angabe am besten als Marketing zu betrachten.
• 27% bessere Prompt-Befolgung als GPT-Image-1.5 bei Microsofts internen Evaluierungen.
• 94% Multi-Image-Charakterkonsistenz über Generationen hinweg.
• Bis zu 84–89 % niedrigere GPU-Kosten im Vergleich zu GPT-Modellen in bestimmten Microsoft-Szenarien (PowerPoint, OneDrive), keine allgemeine Zahl.
Das dokumentierte Datenblatt untermauert diese Behauptungen: Texteingabe von bis zu 32.000 Token, ein 131k-Kontextfenster, 4.096 Ausgabe-Token, JPEG/PNG-Bildeingabe und eine auf 1.048.576 Pixel begrenzte Ausgabe (entspricht 1024×1024). Für Käufer ist diese letzte Zahl entscheidend: Dies ist ein hochwertiger Editor, kein Druckauflösungsgenerator.
Wo die Qualität sichtbar wird
The Editing-Stärke, die das Leaderboard misst, entspricht dem, was Microsoft betont: präzise, chirurgische Bearbeitungen, die den Rest des Bildes konsistent halten. Gezielter Objektersatz, Layout-Änderungen, Textaktualisierungen im Bild und die Bereinigung von Artefakten wie Bewegungsunschärfe – die Klasse von Bearbeitungen, bei denen ältere Modelle die gesamte Szene neu generieren und das Motiv verlieren. In Kombination mit der Behauptung von 94 % Zeichenkonsistenz erhält man ein Modell, das für den kommerziell relevanten Workflow entwickelt wurde: ein vorhandenes Asset nehmen, eine Sache ändern, veröffentlichen.
Der #7-Rang im Text-zu-Bild-Bereich ist das ehrliche Gegengewicht. Aus einem leeren Prompt heraus ist MAI-Image-2.5-Pro gut, aber nicht der Spitzenreiter – 77 Elo hinter GPT Image 2 (hoch) ist eine echte Lücke auf einem blinden Brett. Microsoft erhebt derzeit nicht den Anspruch auf die Text-zu-Bild-Krone; es erhebt den Anspruch auf die Bearbeitungskrone, und die Daten stützen den engeren Anspruch weit besser als den breiteren.
Was es kostet
MAI-Image-2.5-Pro wird auf Foundry tokenbasiert abgerechnet: $5 pro Million Text-Input-Tokens, $8 pro Million Bild-Input-Tokens, $106 pro Million Bild-Output-Tokens. Microsoft veröffentlicht keine Tokens pro Bild, daher ist der Preis pro Bild ein Rechenwert, kein Angebot; anhand der Umrechnung von Artificial Analysis liegt ein 1024×1024-Bild bei etwa $108,50 pro 1.000 Bilder. Das ist ungefähr das 2,3-Fache des Schwestermodells MAI-Image-2.5 (~$48 pro 1k) und das 5,4-Fache von MAI-Image-2.5-Flash (~$20 pro 1k) — die Pro-Stufe ist eine bewusste Premium-Positionierung.
Preview-Preise sind keine GA-Preise; die Preview-Preistabelle kann sich vor der allgemeinen Verfügbarkeit ändern. Wenn das geschieht, ist eine Durchleitungs-Routing-Ebene der Weg, wie eine Preissenkung noch am selben Tag auf Ihrer Rechnung ankommt: Bei OrcaRouter wird der Listenpreis des Anbieters mit 0 % Aufschlag durchgereicht. Sobald MAI-Image-2.5-Pro also über eine aufrufbare Drittanbieter-API erreichbar ist, zahlen Sie exakt das, was Microsoft verlangt — keine Neuverhandlung, kein zweiter Vertrag.

Warum die #1 dem Unternehmen Microsoft gehört, nicht nur dem Modell
Das Bestenlisten-Ergebnis erscheint zu einem Zeitpunkt, an dem Microsoft sichtlich Bildmodelle von Drittanbietern durch eigene ersetzt. MAI-Image-2.5 ist bereits die Standard-Engine in Bing Image Creator und läuft in PowerPoint, OneDrive und Dynamics 365 Contact Center; die Pro-Stufe gehört derselben Familie an und ist auf Arbeiten mit höherer Wiedergabetreue ausgerichtet. Microsoft hat erklärt, dass die MAI-Modelle auf sauberen, nachvollziehbaren Daten trainiert werden – „ohne Destillation aus Drittanbietermodellen“ – eine direkte Antwort auf die Frage der OpenAI-Abhängigkeit. Und die Kostenangaben (bis zu 84 % geringere GPU-Kosten in PowerPoint, vom Anbieter gemeldet und szenariospezifisch) sind Teil derselben Geschichte: ein hauseigenes Modell, das pro Aufgabe günstiger ist als das Modell, das es ersetzt.
Nichts davon wäre einem skeptischen Käufer gegenüber ohne die unabhängige Bestenliste beweisbar, weshalb die #1 strategisch bedeutsam ist und nicht nur eine Punktzahl. Es ist der erste unabhängige Beleg dafür, dass Microsofts hauseigene Bildlinie bei der spezifischen Aufgabe, für die sie entwickelt wurde, das Feld schlägt.
Was als Nächstes ansehen
• Hält der Bearbeitungsvorsprung, wenn sich die Stimmen anhäufen? 1.272 Elo auf ~6.100 Stichproben ist ein Vorsprung, keine Garantie; Reve 2.1 liegt 10 Punkte zurück.
• Allgemeine Verfügbarkeit und die endgültige Preisliste — der Vorschau-Preis ist nicht der GA-Preis.
• Die Auflösungsgrenze. Eine 1-Megapixel-Grenze hält Pro von Druckarbeiten fern; wenn Microsoft sie aufhebt, ändert sich die Lage.
• MAI-Image-2.6 (private Vorschau, 19. August) — der nächste Schritt der Familie, auf der anderen Haupt-Arena auf Platz 2 für Text-zu-Bild.
• Unabhängige Bewertungen der Herstellerangaben — Textdarstellungsgenauigkeit und Zeichenkonsistenz sind außerhalb von Microsoft nicht verifiziert.
Die Erkenntnis aus der geteilten Rangliste ist nicht „Microsoft stellt jetzt das beste Bildmodell her.“ Sie ist enger gefasst und nützlicher: Microsoft stellt jetzt den am besten bewerteten Bildeditor auf einer unabhängigen Rangliste her, zu einem Premium-Preis, als Vorschauversion, mit einer festen Auflösungsobergrenze. Wenn Ihre Arbeit darin besteht, bestehende Bilder zu verändern – Hero-Shots, Produktbilder, Text im Bild – dann ist genau das das Modell, das man im Auge behalten sollte. Wenn Ihre Arbeit die Generierung auf einer leeren Leinwand ist, sagt die #7-Position, dass die bessere Wahl immer noch GPT Image 2 ist – und das ist die ehrliche Interpretation, die beide Zahlen Ihnen geben.
