
MAI-Image-2.5-Pro vs Bernini-Diffusers-v2: Eine gemessene Nr. 1 gegen eine ungemessene Open-Weights-Wette.
- z-aiNEUZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianNEUQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligenz68Coding
- qwenNEUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokNEUSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenz77Coding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenz77Coding
- grokxAI: Grok 4.52026-07-0856Intelligenz72Coding
Der Vergleich von MAI-Image-2.5-Pro mit Bernini-Diffusers-v2 ist nicht wirklich ein Vergleich zweier Bildmodelle. Dabei werden zwei verschiedene Antworten auf dieselbe Frage verglichen — „Wie bekomme ich eine gute Bearbeitung eines vorhandenen Bildes?" — wobei die eine Seite 6.100 blinde menschliche Stimmen hinter ihrer Nummer-1-Platzierung bei der Bildbearbeitung hat und die andere eine README. MAI-Image-2.5-Pro, Microsofts Bildmodell der Qualitätsstufe, ging am 23. Juli 2026 auf Microsoft Foundry in die öffentliche Vorschau und führt jetzt die Artificial Analysis Image Editing Arena an. Bernini-Diffusers-v2, ByteDances Framework der zweiten Generation für einheitliche Generierung, erschien am 13. August 2026 auf Hugging Face als Apache-2.0-Gewichte ohne Ankündigung und ohne einen Bildqualitäts-Benchmark, den irgendjemand außerhalb von ByteDance durchgeführt hat. Jeder praktische Unterschied in dieser Gegenüberstellung ergibt sich aus diesen beiden Tatsachen.
Eins rufst du auf, eins führst du aus.
• MAI-Image-2.5-Pro — ein gehostetes API-Modell in der öffentlichen Vorschau auf Azure AI Foundry und im MAI Playground. Proprietär, token-basiert abgerechnet, kein Fine-Tuning, kein Self-Hosting. Sie erhalten einen Endpunkt und zahlen pro Token; Microsoft betreibt die Infrastruktur.
• Bernini-Diffusers-v2 — Apache-2.0-Gewichte, die Sie von Hugging Face herunterladen und selbst ausführen. Der Stack ist ein Qwen2.5-VL-7B-Semantikplaner, der einen Wan2.2-basierten DiT-Renderer steuert, und die Hardware-Empfehlung im README lautet: Hopper-Klasse-GPUs (H100/H800/H200) mit Python 3.11.2 / PyTorch 2.5.1+cu124. Sie bringen den Cluster mit.
Das ist die Entscheidungsregel in einem Satz: Wenn Ihre Organisation den Stack besitzen möchte, ist Bernini eine Option; wenn Ihre Organisation eine Rechnung und ein SLA möchte, kommt nur MAI-Image-2.5-Pro überhaupt in Frage. Sie können einander nicht ersetzen.
Die Evidenzlücke ist die eigentliche Schlagzeile.
Die beiden Modelle stehen auf gegenüberliegenden Seiten des größten Qualitätsproblems in der Bild-KI: der Messung der Ausgabe. Die Bildbearbeitungsfähigkeit von MAI-Image-2.5-Pro wird unabhängig bewertet — Platz 1 in der Artificial Analysis Image Editing Arena bei Elo 1.272 aus ~6.100 blinden Vergleichen, vor Reve 2.1, GPT Image 2 und seinem eigenen Schwestermodell MAI-Image-2.5. Sein Rang bei Text-zu-Bild ist der siebte mit 1.292 Elo, was das ehrliche Gegengewicht darstellt: Es ist ein Spezialist für Bildbearbeitung, nicht der Spitzenreiter bei der leeren Leinwand. Diese Zahlen sind für jeden mit einem Browser überprüfbar.
Bernini-Diffusers-v2 hat keinen gleichwertigen öffentlichen Score. Das Modellkartenblatt berichtet EditVerse 8.02, OpenVE 3.96, OpenS2V 63.83 und VBench 84.46 – alle vom Anbieter gemeldet und allesamt Video-Metriken. Es gibt nichts auf der Karte, das ein Bildkäufer als Text-zu-Bild- oder Bildbearbeitungs-Leaderboard-Ergebnis erkennen würde. Die Karte behauptet zwar, Bernini erreiche „die erste Stufe“ der geschlossenen kommerziellen Modelle in ByteDances internem blinden paarweisen Vergleich – was genau die Art von Anbieter-Selbsteinschätzung ist, die einer unabhängigen Prüfung bedarf, bevor sie irgendetwas bedeutet.
• MAI-Image-2.5-Pro: Bildbearbeitungs-Elo 1.272 (unabhängig, ~6.100 Stimmen); Text-zu-Bild-Elo 1.292 (unabhängig, ~11.500 Stimmen)
• Bernini-Diffusers-v2:kein öffentlicher Bild-Benchmark; nur videoseitige Metriken, vom Anbieter gemeldet

Zwei verschiedene Theorien des Editierens
Beide Modelle basieren auf der Idee, dass Bearbeiten nicht bedeuten sollte, die Szene neu zu generieren. Aber sie erreichen das auf unterschiedliche Weise.
MAI-Image-2.5-Pro ist Microsofts Pitch „präzise, chirurgische Bearbeitungen mit Konsistenz“: ein Objekt ändern, den Text im Bild aktualisieren, die Bewegungsunschärfe entfernen und alles andere – Subjektidentität, Beleuchtung, Textur – stabil halten. Diese Konsistenz ist der Mechanismus hinter der behaupteten 94-prozentigen Zeichenkonsistenz über mehrere Bilder (vom Anbieter berichtet, unverifiziert). Das Produktziel ist ein Modell, das die gezielte Bearbeitung durchführt und dann aufhört.
Bernini-Diffusers-v2 ist eine Pipeline, die zuerst plant und dann rendert: Der Qwen2.5-VL-Planer zerlegt eine Anweisung in semantische Schritte — Wetter ändern, Stil tauschen, Objekt einfügen, Subjekt beibehalten — und der Renderer zeichnet das Ergebnis. Das Design zielt auf komplexe, mehrstufige Anweisungen ab, und dieselben Gewichte decken Text-zu-Bild-, Bild-zu-Bild- und Videoaufgaben ab (t2i, i2i, t2v, v2v, rv2v, r2v). Diese Breite ist der Vorteil; der ungemessene Preis ist, dass ein 7B-Planer ein echter Engpass für sehr subtile Änderungen ist, und niemand außerhalb von ByteDance hat quantifiziert, wie er mit ihnen umgeht.

Textdarstellung, das praktische Schlachtfeld
Text im Bild ist der Bereich, in dem ein moderner Bildeditor seinen Preis rechtfertigt – und hier ist die Asymmetrie eklatant. Die Hauptkompetenz von MAI-Image-2.5-Pro ist die präzise Textwiedergabe: Microsoft beansprucht eine Genauigkeit von 96,8 % für Englisch, Chinesisch, Japanisch, Koreanisch und Spanisch (vom Anbieter gemeldet; dieselben Dokumente begrenzen die Ausgabe auf fast ein Megapixel, also betrachten Sie die Zahl als Richtwert). Bernini-Diffusers-v2 hat keinerlei Textwiedergabe-Genauigkeit veröffentlicht. Für einen Workflow, der lokalisierte Anzeigen, Verpackungen oder alles andere mit lesbarem Text erzeugt, bietet der eine Kandidat eine messbare Angabe und der andere gar nichts.
Kosten und die Form der Rechnung
• MAI-Image-2.5-Pro — 5 $ pro Million Text-Input-Tokens, 8 $ pro Million Bild-Input-Tokens, 106 $ pro Million Bild-Output-Tokens. Die Kosten pro Bild sind nicht veröffentlicht; die Umrechnung von Artificial Analysis setzt ein 1024×1024-Bild bei etwa 108,50 $ pro 1.000 an. Vorabpreis, Änderungen bei GA vorbehalten.
• Bernini-Diffusers-v2 — die Gewichte sind kostenlos, aber Self-Hosting bedeutet H100-Klassen-Hardware (oder Cloud-Miete), den Betriebsaufwand, um es am Laufen zu halten, und deine eigene Skalierung. Die Kostenlogik funktioniert umgekehrt zum API-Modell: teuer für zehn Bilder am Tag, günstig bei ernsthaftem Volumen.
Für die meisten Teams ist die ehrliche Einordnung: Die Gesamtbetriebskosten von Bernini sind nur dann günstig, wenn man bereits eine GPU-Flotte betreibt und die Arbeitslast groß und konstant ist. Andernfalls ist eine verbrauchsabhängige API zu einem Premiumpreis der günstigere Fehlschlag.

Was ein Router hier kann und was nicht.
Keines der beiden Modelle ist heute über OrcaRouter routbar, aus gegensätzlichen Gründen: MAI-Image-2.5-Pro liegt hinter der direkten Vorschau von Microsoft Foundry, und Bernini-Diffusers-v2 ist überhaupt kein Endpoint – es sind Gewichte. Das ist für diesen Vergleich grundsätzlich von Bedeutung: Das Router-Muster gilt nur für die Hälfte dieses Vergleichs, die eine aufrufbare API ist. Wenn MAI-Image-2.5-Pro eine aufrufbare Drittanbieter-API erreicht, besteht der Weg, es zu übernehmen, ohne einen Produktionspfad auf Vorschau-Code zu setzen, darin, einen Teil des Traffics mit einem bewährten Modell als automatischem Failover dorthin zu routen – auf OrcaRouter ist das ein Endpoint, Provider-Preise ohne Aufschlag (0 % Marge) durchgereicht, und ein Fallback, der abfängt, was das Low-Vote-Ranking nicht sehen konnte. Die Seite der offenen Gewichte hat kein Äquivalent: Entweder du betreibst den Bernini-Stack selbst oder du nutzt ihn nicht.
Das Urteil
MAI-Image-2.5-Pro ist ein Premium-Editor mit messbarer Leistung, der gehostet wird: Platz #1 auf einer unabhängigen Bewertungstafel, ein echtes Text-Rendering-Versprechen und ein passender Preis. Bernini-Diffusers-v2 ist eine kostenlose, breite, im Bildbereich unbewiesene Open-Weights-Pipeline, die auch Videos kann – wirklich interessant, wenn man selbst hostet, wirklich nicht bewertbar, bis jemand eine öffentliche Bild-Evaluation durchführt. Wenn dein Workflow eine aufrufbare API und eine Zahl braucht, die du verteidigen kannst, ist die Wahl MAI-Image-2.5-Pro oder einer der anderen gehosteten Editoren, die es schlägt. Wenn dein Workflow Eigentum braucht und du die Hardware betreiben kannst, ist Bernini-Diffusers-v2 einen Test wert – aber kaufe es als Wette auf ungemessenes Potenzial, nicht als Konkurrent zu einer gemessenen #1.
