Hero-Karte für MAI-Image-2.5-Pro, Microsofts qualitätsorientiertes Bildmodell, das seinen Platz #1 bei der Bildbearbeitung und Platz #7 bei Text-zu-Bild auf dem Artificial-Analysis-Leaderboard zeigt.
Guides & Insights

MAI-Image-2.5-Pro sichert sich Platz #1 in der Bildbearbeitung: Was Microsofts unabhängiger Sieg tatsächlich beweist

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

MAI-Image-2.5-Pro ist jetzt das bestbewertete Bildbearbeitungsmodell auf dem Leaderboard von Artificial Analysis – einem unabhängigen Board mit verdeckter Abstimmung – während es bei reiner Text-zu-Bild-Generierung nur auf Platz sieben liegt. Dieser Unterschied ist die Geschichte: Ein Modell, das seit weniger als einem Monat in der öffentlichen Vorschau ist und vollständig intern von Microsoft AI entwickelt wurde, übertrifft GPT Image 2, Reve 2.1, und sein eigenes Geschwistermodell MAI-Image-2.5 auf dem Bearbeitungs-Board, hinkt jedoch den meisten der gleichen Konkurrenten hinterher, wenn die Aufforderung „zeichne mir etwas aus dem Nichts.“ lautet. Liest man beide Zahlen zusammen, erhält man ein genaues Bild davon, was Microsoft ausgeliefert hat: ein Spezialist für die Veränderung vorhandener Bilder, kein Allzweck-Generator.

Die beiden Zahlen, nebeneinander

Mit Stand des Snapshots vom August 2026 setzt die Image-Editing-Arena von Artificial Analysis MAI-Image-2.5-Pro auf Platz 1 mit Elo 1.272, basierend auf rund 6.100 blinden Nutzervergleichen. Das Verfolgerfeld ist eng: Reve 2.1 bei 1.262, dann MAI-Image-2.5 und GPT Image 2 (high) gleichauf bei 1.256, GPT Image 1.5 (high) bei 1.250, Qwen-Image-3.0-Pro bei 1.249 und Go​gles Nano Banana 2 bei 1.249. In der Text-to-Image-Arena liegt es bei Platz 7 mit Elo 1.292, hinter GPT Image 2 (high) mit 1.369, Reve 2.1 mit 1.322, Nano Banana 2 mit 1.320, GPT Image 1.5 (high) mit 1.310, MAI-Image-2.5 mit 1.304 und Nano Banana Pro mit 1.296.

Bearbeitung: Nr. 1 — 1.272 Elo, ~6.100 Stichproben

Text-zu-Bild: Nr. 7 — 1.292 Elo, ~11.500 Stichproben

Abstand zu Nr. 2 beim Editieren: 10 Elo über Reve 2.1

Abstand zu Nr. 1 bei Text-zu-Bild: 77 Elo hinter GPT Image 2 (hoch)

Was den Bearbeitungsrang wertvoller macht als eine Eitelkeitszahl, ist der Mechanismus. Die Artificial-Analysis-Arena ist blinde menschliche Präferenz: Wähler sehen dasselbe Eingabebild und dieselbe Anweisung, erhalten zwei bearbeitete Ergebnisse und wählen das stärkere. Kein Anbieter-Skript schreibt die Punktzahl. So ist der erste Platz dort das Nächste, was der Markt zu „den Leuten gefiel die Ausgabe dieses Editors am besten“ hat — und er ist ein jüngster Aufstieg, kein Strohfeuer am Starttag. Behandle die Richtung als solide und das genaue Elo als vorläufig; Ranglisten mit wenigen Stimmen bewegen sich.

Screenshot of the Artificial Analysis Image Editing Leaderboard showing MAI-Image-2.5-Pro at No. 1 with Elo 1,272 and 6,133 samples, ahead of Reve 2.1 at 1,262, MAI-Image-2.5 at 1,256, and GPT Image 2 (high) at 1,256

Die Text-zu-Bild-Bestenliste, am selben Tag erfasst, ist dasselbe Modell in einem anderen Licht — nicht mehr führend, aber immer noch komfortabel in den Top Ten eines Feldes, das zwischen 1.290 und 1.370 Elo eng beieinanderliegt.

Screenshot of the Artificial Analysis Text to Image Leaderboard showing MAI-Image-2.5-Pro at No. 7 with Elo 1,292 behind GPT Image 2 (high), Reve 2.1, Nano Banana 2, GPT Image 1.5 (high), MAI-Image-2.5, and Nano Banana Pro

Was MAI-Image-2.5-Pro eigentlich ist

MAI-Image-2.5-Pro ist die Qualitätsstufe von Microsoft AI innerhalb der MAI-Image-2.5-Familie, die am 23. Juli 2026 zusammen mit MAI-Voice-2-Flash angekündigt und in die öffentliche Vorschau auf Microsoft Foundry (Azure AI Foundry) sowie in den kostenlosen MAI Playground aufgenommen wurde. Microsoft beschreibt es als sein bisher bildtreuestes Bildmodell, das auf Hero-Bilder, detaillierte Bearbeitung und präzise Textdarstellung in Bildern ausgelegt ist. Die Familie deckt nun die gesamte Kostenkurve ab: MAI-Image-2.5 für ausgewogene Arbeit, MAI-Image-2.5-Flash für hohe Volumen und die Pro-Stufe am Qualitätsende – mit einem neueren Geschwistermodell, MAI-Image-2.6, das sich bereits seit dem 19. August in privater Vorschau befindet.

Microsofts eigene Behauptungen zur Pro-Stufe, alle vom Anbieter gemeldet und noch keine unabhängig reproduziert:

96,8 % Textdarstellungsgenauigkeit — angegeben als Abdeckung von Chinesisch, Englisch, Japanisch, Koreanisch und Spanisch, obwohl dieselbe Dokumentation die Ausgabe auf etwa ein Megapixel begrenzt; daher ist die Formulierung „8K“ in der Angabe am besten als Marketing zu betrachten.

27% bessere Prompt-Befolgung als GPT-Image-1.5 bei Microsofts internen Evaluierungen.

94% Multi-Image-Charakterkonsistenz über Generationen hinweg.

Bis zu 84–89 % niedrigere GPU-Kosten im Vergleich zu G​PT-Modellen in bestimmten Microsoft-Szenarien (PowerPoint, OneDrive), keine allgemeine Zahl.

Das dokumentierte Datenblatt untermauert diese Behauptungen: Texteingabe von bis zu 32.000 Token, ein 131k-Kontextfenster, 4.096 Ausgabe-Token, JPEG/PNG-Bildeingabe und eine auf 1.048.576 Pixel begrenzte Ausgabe (entspricht 1024×1024). Für Käufer ist diese letzte Zahl entscheidend: Dies ist ein hochwertiger Editor, kein Druckauflösungsgenerator.

Wo die Qualität sichtbar wird

The Editing-Stärke, die das Leaderboard misst, entspricht dem, was Microsoft betont: präzise, chirurgische Bearbeitungen, die den Rest des Bildes konsistent halten. Gezielter Objektersatz, Layout-Änderungen, Textaktualisierungen im Bild und die Bereinigung von Artefakten wie Bewegungsunschärfe – die Klasse von Bearbeitungen, bei denen ältere Modelle die gesamte Szene neu generieren und das Motiv verlieren. In Kombination mit der Behauptung von 94 % Zeichenkonsistenz erhält man ein Modell, das für den kommerziell relevanten Workflow entwickelt wurde: ein vorhandenes Asset nehmen, eine Sache ändern, veröffentlichen.

Der #7-Rang im Text-zu-Bild-Bereich ist das ehrliche Gegengewicht. Aus einem leeren Prompt heraus ist MAI-Image-2.5-Pro gut, aber nicht der Spitzenreiter – 77 Elo hinter GPT Image 2 (hoch) ist eine echte Lücke auf einem blinden Brett. Microsoft erhebt derzeit nicht den Anspruch auf die Text-zu-Bild-Krone; es erhebt den Anspruch auf die Bearbeitungskrone, und die Daten stützen den engeren Anspruch weit besser als den breiteren.

Was es kostet

MAI-Image-2.5-Pro wird auf Foundry tokenbasiert abgerechnet: $5 pro Million Text-Input-Tokens, $8 pro Million Bild-Input-Tokens, $106 pro Million Bild-Output-Tokens. Microsoft veröffentlicht keine Tokens pro Bild, daher ist der Preis pro Bild ein Rechenwert, kein Angebot; anhand der Umrechnung von Artificial Analysis liegt ein 1024×1024-Bild bei etwa $108,50 pro 1.000 Bilder. Das ist ungefähr das 2,3-Fache des Schwestermodells MAI-Image-2.5 (~$48 pro 1k) und das 5,4-Fache von MAI-Image-2.5-Flash (~$20 pro 1k) — die Pro-Stufe ist eine bewusste Premium-Positionierung.

Preview-Preise sind keine GA-Preise; die Preview-Preistabelle kann sich vor der allgemeinen Verfügbarkeit ändern. Wenn das geschieht, ist eine Durchleitungs-Routing-Ebene der Weg, wie eine Preissenkung noch am selben Tag auf Ihrer Rechnung ankommt: Bei OrcaRouter wird der Listenpreis des Anbieters mit 0 % Aufschlag durchgereicht. Sobald MAI-Image-2.5-Pro also über eine aufrufbare Drittanbieter-API erreichbar ist, zahlen Sie exakt das, was Microsoft verlangt — keine Neuverhandlung, kein zweiter Vertrag.

Scoreboard for MAI-Image-2.5-Pro: image editing rank No. 1 at 1,272 Elo, text-to-image rank No. 7 at 1,292 Elo, price about USD 108.50 per 1k images, 32k text input tokens, 131k context window, ~1-megapixel output cap, preview status on Microsoft Foundry

Warum die #1 dem Unternehmen Microsoft gehört, nicht nur dem Modell

Das Bestenlisten-Ergebnis erscheint zu einem Zeitpunkt, an dem Microsoft sichtlich Bildmodelle von Drittanbietern durch eigene ersetzt. MAI-Image-2.5 ist bereits die Standard-Engine in Bing Image Creator und läuft in PowerPoint, OneDrive und Dynamics 365 Contact Center; die Pro-Stufe gehört derselben Familie an und ist auf Arbeiten mit höherer Wiedergabetreue ausgerichtet. Microsoft hat erklärt, dass die MAI-Modelle auf sauberen, nachvollziehbaren Daten trainiert werden – „ohne Destillation aus Drittanbietermodellen“ – eine direkte Antwort auf die Frage der OpenAI-Abhängigkeit. Und die Kostenangaben (bis zu 84 % geringere GPU-Kosten in PowerPoint, vom Anbieter gemeldet und szenariospezifisch) sind Teil derselben Geschichte: ein hauseigenes Modell, das pro Aufgabe günstiger ist als das Modell, das es ersetzt.

Nichts davon wäre einem skeptischen Käufer gegenüber ohne die unabhängige Bestenliste beweisbar, weshalb die #1 strategisch bedeutsam ist und nicht nur eine Punktzahl. Es ist der erste unabhängige Beleg dafür, dass Microsofts hauseigene Bildlinie bei der spezifischen Aufgabe, für die sie entwickelt wurde, das Feld schlägt.

Was als Nächstes ansehen

Hält der Bearbeitungsvorsprung, wenn sich die Stimmen anhäufen? 1.272 Elo auf ~6.100 Stichproben ist ein Vorsprung, keine Garantie; Reve 2.1 liegt 10 Punkte zurück.

Allgemeine Verfügbarkeit und die endgültige Preisliste — der Vorschau-Preis ist nicht der GA-Preis.

Die Auflösungsgrenze. Eine 1-Megapixel-Grenze hält Pro von Druckarbeiten fern; wenn Microsoft sie aufhebt, ändert sich die Lage.

MAI-Image-2.6 (private Vorschau, 19. August) — der nächste Schritt der Familie, auf der anderen Haupt-Arena auf Platz 2 für Text-zu-Bild.

Unabhängige Bewertungen der Herstellerangaben — Textdarstellungsgenauigkeit und Zeichenkonsistenz sind außerhalb von Microsoft nicht verifiziert.

Die Erkenntnis aus der geteilten Rangliste ist nicht „Microsoft stellt jetzt das beste Bildmodell her.“ Sie ist enger gefasst und nützlicher: Microsoft stellt jetzt den am besten bewerteten Bildeditor auf einer unabhängigen Rangliste her, zu einem Premium-Preis, als Vorschauversion, mit einer festen Auflösungsobergrenze. Wenn Ihre Arbeit darin besteht, bestehende Bilder zu verändern – Hero-Shots, Produktbilder, Text im Bild – dann ist genau das das Modell, das man im Auge behalten sollte. Wenn Ihre Arbeit die Generierung auf einer leeren Leinwand ist, sagt die #7-Position, dass die bessere Wahl immer noch GPT Image 2 ist – und das ist die ehrliche Interpretation, die beide Zahlen Ihnen geben.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube