Hero-Karte für das Duell zwischen MAI-Image-2.5-Pro, einem Premium-Bildbearbeitungsmodell in der Microsoft-Foundry-Vorschau, und Bernini-Diffusers-v2, der Apache-2.0-Open-Weights-Pipeline von ByteDance.
Guides & Insights

MAI-Image-2.5-Pro vs Bernini-Diffusers-v2: Eine gemessene Nr. 1 gegen eine ungemessene Open-Weights-Wette.

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Der Vergleich von MAI-Image-2.5-Pro mit Bernini-Diffusers-v2 ist nicht wirklich ein Vergleich zweier Bildmodelle. Dabei werden zwei verschiedene Antworten auf dieselbe Frage verglichen — „Wie bekomme ich eine gute Bearbeitung eines vorhandenen Bildes?" — wobei die eine Seite 6.100 blinde menschliche Stimmen hinter ihrer Nummer-1-Platzierung bei der Bildbearbeitung hat und die andere eine README. MAI-Image-2.5-Pro, Microsofts Bildmodell der Qualitätsstufe, ging am 23. Juli 2026 auf Microsoft Foundry in die öffentliche Vorschau und führt jetzt die Artificial Analysis Image Editing Arena an. Bernini-Diffusers-v2, ByteDances Framework der zweiten Generation für einheitliche Generierung, erschien am 13. August 2026 auf Hugging Face als Apache-2.0-Gewichte ohne Ankündigung und ohne einen Bildqualitäts-Benchmark, den irgendjemand außerhalb von ByteDance durchgeführt hat. Jeder praktische Unterschied in dieser Gegenüberstellung ergibt sich aus diesen beiden Tatsachen.

Eins rufst du auf, eins führst du aus.

MAI-Image-2.5-Pro — ein gehostetes API-Modell in der öffentlichen Vorschau auf Azure AI Foundry und im MAI Playground. Proprietär, token-basiert abgerechnet, kein Fine-Tuning, kein Self-Hosting. Sie erhalten einen Endpunkt und zahlen pro Token; Microsoft betreibt die Infrastruktur.

Bernini-Diffusers-v2 — Apache-2.0-Gewichte, die Sie von Hugging Face herunterladen und selbst ausführen. Der Stack ist ein Qwen2.5-VL-7B-Semantikplaner, der einen Wan2.2-basierten DiT-Renderer steuert, und die Hardware-Empfehlung im README lautet: Hopper-Klasse-GPUs (H100/H800/H200) mit Python 3.11.2 / PyTorch 2.5.1+cu124. Sie bringen den Cluster mit.

Das ist die Entscheidungsregel in einem Satz: Wenn Ihre Organisation den Stack besitzen möchte, ist Bernini eine Option; wenn Ihre Organisation eine Rechnung und ein SLA möchte, kommt nur MAI-Image-2.5-Pro überhaupt in Frage. Sie können einander nicht ersetzen.

Die Evidenzlücke ist die eigentliche Schlagzeile.

Die beiden Modelle stehen auf gegenüberliegenden Seiten des größten Qualitätsproblems in der Bild-KI: der Messung der Ausgabe. Die Bildbearbeitungsfähigkeit von MAI-Image-2.5-Pro wird unabhängig bewertet — Platz 1 in der Artificial Analysis Image Editing Arena bei Elo 1.272 aus ~6.100 blinden Vergleichen, vor Reve 2.1, GPT Image 2 und seinem eigenen Schwestermodell MAI-Image-2.5. Sein Rang bei Text-zu-Bild ist der siebte mit 1.292 Elo, was das ehrliche Gegengewicht darstellt: Es ist ein Spezialist für Bildbearbeitung, nicht der Spitzenreiter bei der leeren Leinwand. Diese Zahlen sind für jeden mit einem Browser überprüfbar.

Bernini-Diffusers-v2 hat keinen gleichwertigen öffentlichen Score. Das Modellkartenblatt berichtet EditVerse 8.02, OpenVE 3.96, OpenS2V 63.83 und VBench 84.46 – alle vom Anbieter gemeldet und allesamt Video-Metriken. Es gibt nichts auf der Karte, das ein Bildkäufer als Text-zu-Bild- oder Bildbearbeitungs-Leaderboard-Ergebnis erkennen würde. Die Karte behauptet zwar, Bernini erreiche „die erste Stufe“ der geschlossenen kommerziellen Modelle in ByteDances internem blinden paarweisen Vergleich – was genau die Art von Anbieter-Selbsteinschätzung ist, die einer unabhängigen Prüfung bedarf, bevor sie irgendetwas bedeutet.

MAI-Image-2.5-Pro: Bildbearbeitungs-Elo 1.272 (unabhängig, ~6.100 Stimmen); Text-zu-Bild-Elo 1.292 (unabhängig, ~11.500 Stimmen)

Bernini-Diffusers-v2:kein öffentlicher Bild-Benchmark; nur videoseitige Metriken, vom Anbieter gemeldet

Comparison scoreboard for MAI-Image-2.5-Pro and Bernini-Diffusers-v2: editing rank No. 1 at 1,272 Elo versus no public image benchmark; availability Foundry preview versus Apache-2.0 self-host; text rendering 96.8% claimed versus unpublished; price USD 108.50 per 1k versus free weights plus your own compute; editing approach surgical edits versus plan-then-render; scope image-only versus unified image and video

Zwei verschiedene Theorien des Editierens

Beide Modelle basieren auf der Idee, dass Bearbeiten nicht bedeuten sollte, die Szene neu zu generieren. Aber sie erreichen das auf unterschiedliche Weise.

MAI-Image-2.5-Pro ist Microsofts Pitch „präzise, chirurgische Bearbeitungen mit Konsistenz“: ein Objekt ändern, den Text im Bild aktualisieren, die Bewegungsunschärfe entfernen und alles andere – Subjektidentität, Beleuchtung, Textur – stabil halten. Diese Konsistenz ist der Mechanismus hinter der behaupteten 94-prozentigen Zeichenkonsistenz über mehrere Bilder (vom Anbieter berichtet, unverifiziert). Das Produktziel ist ein Modell, das die gezielte Bearbeitung durchführt und dann aufhört.

Bernini-Diffusers-v2 ist eine Pipeline, die zuerst plant und dann rendert: Der Qwen2.5-VL-Planer zerlegt eine Anweisung in semantische Schritte — Wetter ändern, Stil tauschen, Objekt einfügen, Subjekt beibehalten — und der Renderer zeichnet das Ergebnis. Das Design zielt auf komplexe, mehrstufige Anweisungen ab, und dieselben Gewichte decken Text-zu-Bild-, Bild-zu-Bild- und Videoaufgaben ab (t2i, i2i, t2v, v2v, rv2v, r2v). Diese Breite ist der Vorteil; der ungemessene Preis ist, dass ein 7B-Planer ein echter Engpass für sehr subtile Änderungen ist, und niemand außerhalb von ByteDance hat quantifiziert, wie er mit ihnen umgeht.

Screenshot of the ByteDance/Bernini-Diffusers-v2 model card on Hugging Face showing the README, the Apache-2.0 license, and the benchmark table with video-side metrics

Textdarstellung, das praktische Schlachtfeld

Text im Bild ist der Bereich, in dem ein moderner Bildeditor seinen Preis rechtfertigt – und hier ist die Asymmetrie eklatant. Die Hauptkompetenz von MAI-Image-2.5-Pro ist die präzise Textwiedergabe: Microsoft beansprucht eine Genauigkeit von 96,8 % für Englisch, Chinesisch, Japanisch, Koreanisch und Spanisch (vom Anbieter gemeldet; dieselben Dokumente begrenzen die Ausgabe auf fast ein Megapixel, also betrachten Sie die Zahl als Richtwert). Bernini-Diffusers-v2 hat keinerlei Textwiedergabe-Genauigkeit veröffentlicht. Für einen Workflow, der lokalisierte Anzeigen, Verpackungen oder alles andere mit lesbarem Text erzeugt, bietet der eine Kandidat eine messbare Angabe und der andere gar nichts.

Kosten und die Form der Rechnung

MAI-Image-2.5-Pro — 5 $ pro Million Text-Input-Tokens, 8 $ pro Million Bild-Input-Tokens, 106 $ pro Million Bild-Output-Tokens. Die Kosten pro Bild sind nicht veröffentlicht; die Umrechnung von Artificial Analysis setzt ein 1024×1024-Bild bei etwa 108,50 $ pro 1.000 an. Vorabpreis, Änderungen bei GA vorbehalten.

Bernini-Diffusers-v2 — die Gewichte sind kostenlos, aber Self-Hosting bedeutet H100-Klassen-Hardware (oder Cloud-Miete), den Betriebsaufwand, um es am Laufen zu halten, und deine eigene Skalierung. Die Kostenlogik funktioniert umgekehrt zum API-Modell: teuer für zehn Bilder am Tag, günstig bei ernsthaftem Volumen.

Für die meisten Teams ist die ehrliche Einordnung: Die Gesamtbetriebskosten von Bernini sind nur dann günstig, wenn man bereits eine GPU-Flotte betreibt und die Arbeitslast groß und konstant ist. Andernfalls ist eine verbrauchsabhängige API zu einem Premiumpreis der günstigere Fehlschlag.

Screenshot of Microsoft's announcement of MAI-Image-2.5-Pro and MAI-Voice-2-Flash, the subject model's vendor page, showing the preview launch and family context

Was ein Router hier kann und was nicht.

Keines der beiden Modelle ist heute über OrcaRouter routbar, aus gegensätzlichen Gründen: MAI-Image-2.5-Pro liegt hinter der direkten Vorschau von Microsoft Foundry, und Bernini-Diffusers-v2 ist überhaupt kein Endpoint – es sind Gewichte. Das ist für diesen Vergleich grundsätzlich von Bedeutung: Das Router-Muster gilt nur für die Hälfte dieses Vergleichs, die eine aufrufbare API ist. Wenn MAI-Image-2.5-Pro eine aufrufbare Drittanbieter-API erreicht, besteht der Weg, es zu übernehmen, ohne einen Produktionspfad auf Vorschau-Code zu setzen, darin, einen Teil des Traffics mit einem bewährten Modell als automatischem Failover dorthin zu routen – auf OrcaRouter ist das ein Endpoint, Provider-Preise ohne Aufschlag (0 % Marge) durchgereicht, und ein Fallback, der abfängt, was das Low-Vote-Ranking nicht sehen konnte. Die Seite der offenen Gewichte hat kein Äquivalent: Entweder du betreibst den Bernini-Stack selbst oder du nutzt ihn nicht.

Das Urteil

MAI-Image-2.5-Pro ist ein Premium-Editor mit messbarer Leistung, der gehostet wird: Platz #1 auf einer unabhängigen Bewertungstafel, ein echtes Text-Rendering-Versprechen und ein passender Preis. Bernini-Diffusers-v2 ist eine kostenlose, breite, im Bildbereich unbewiesene Open-Weights-Pipeline, die auch Videos kann – wirklich interessant, wenn man selbst hostet, wirklich nicht bewertbar, bis jemand eine öffentliche Bild-Evaluation durchführt. Wenn dein Workflow eine aufrufbare API und eine Zahl braucht, die du verteidigen kannst, ist die Wahl MAI-Image-2.5-Pro oder einer der anderen gehosteten Editoren, die es schlägt. Wenn dein Workflow Eigentum braucht und du die Hardware betreiben kannst, ist Bernini-Diffusers-v2 einen Test wert – aber kaufe es als Wette auf ungemessenes Potenzial, nicht als Konkurrent zu einer gemessenen #1.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube