Karta hero dla pojedynku pomiędzy MAI-Image-2.5-Pro, modelem edycji premium w wersji zapoznawczej Microsoft Foundry, a Bernini-Diffusers-v2, potokiem open-weights na licencji Apache-2.0 firmy ByteDance.
Guides & Insights

MAI-Image-2.5-Pro vs Bernini-Diffusers-v2: Zmierzona #1 kontra niezmierzony zakład open-weights

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Porównanie MAI-Image-2.5-Pro z Bernini-Diffusers-v2 nie jest tak naprawdę porównywaniem dwóch modeli obrazowych. Porównuje ono dwie różne odpowiedzi na to samo pytanie — „jak uzyskać dobrą edycję istniejącego obrazu?” — gdzie jedna strona ma za sobą 6 100 ludzkich głosów w ślepym teście, które zapewniły jej #1 w rankingu edycji, a druga ma README. MAI-Image-2.5-Pro, wysokiej klasy model obrazowy firmy Microsoft, został udostępniony w publicznej wersji zapoznawczej na Microsoft Foundry 23 lipca 2026 roku i obecnie zajmuje pierwsze miejsce w Artificial Analysis Image Editing Arena. Bernini-Diffusers-v2, ujednolicony framework generacyjny drugiej generacji firmy ByteDance, pojawił się na Hugging Face 13 sierpnia 2026 roku w postaci wag na licencji Apache-2.0, bez ogłoszenia i bez żadnego benchmarku jakości obrazu uruchomionego przez kogokolwiek spoza ByteDance. Każda praktyczna różnica w tym zestawieniu wynika z tych dwóch faktów.

Na jedno dzwonisz, drugie uruchamiasz.

MAI-Image-2.5-Pro — hostowany model API w publicznej wersji zapoznawczej w Azure AI Foundry i MAI Playground. Zastrzeżony, rozliczany za tokeny, bez dostrajania ani samodzielnego hostowania. Otrzymujesz punkt końcowy i płacisz za token; infrastrukturą zarządza Microsoft.

Bernini-Diffusers-v2 — wagi Apache-2.0, które pobierasz z Hugging Face i uruchamiasz samodzielnie. Stack to semantyczny planer Qwen2.5-VL-7B napędzający renderer DiT oparty na Wan2.2, a zalecany w README sprzęt to karty graficzne klasy Hopper (H100/H800/H200) z Pythonem 3.11.2 / PyTorch 2.5.1+cu124. Klaster zapewniasz sobie sam.

Taka jest reguła decyzyjna w jednym zdaniu: jeśli Twoja organizacja chce posiadać cały stack, Bernini jest opcją; jeśli Twoja organizacja chce faktury i SLA, w grę wchodzi wyłącznie MAI-Image-2.5-Pro. To nie są wzajemne substytuty.

Prawdziwym nagłówkiem jest luka w dowodach.

Oba modele znajdują się po przeciwnych stronach największego problemu jakościowego w AI obrazowej: pomiaru wyników. Umiejętność edycji MAI-Image-2.5-Pro jest oceniana niezależnie — Nr 1 w Artificial Analysis Image Editing Arena z Elo 1272 na podstawie ~6100 ślepych porównań, przed Reve 2.1, GPT Image 2 i swoim siostrzanym modelem MAI-Image-2.5. Jego pozycja w rankingu text-to-image to siódme miejsce z wynikiem Elo 1292, co stanowi uczciwą przeciwwagę: jest specjalistą od edycji, a nie liderem od pustego płótna. Te liczby może sprawdzić każdy, kto ma przeglądarkę.

{{1}}Bernini-Diffusers-v2 nie ma żadnego równoważnego publicznego wyniku. Karta modelu podaje EditVerse 8.02, OpenVE 3.96, OpenS2V 63.83 oraz VBench 84.46 — wszystkie raportowane przez producenta i wszystkie dotyczące metryk wideo.{{/1}} {{2}}Na karcie nie ma niczego, co nabywca obrazów uznałby za wynik z rankingu text-to-image lub edycji obrazów.{{/2}} {{3}}Karta rzeczywiście twierdzi, że Bernini osiąga „pierwszy poziom" zamkniętych modeli komercyjnych w wewnętrznej ślepej arenie porównawczej ByteDance{{/3}} — {{4}}co jest dokładnie tym rodzajem samooceny producenta, która wymaga niezależnej weryfikacji, zanim zacznie cokolwiek znaczyć.{{/4}}

MAI-Image-2.5-Pro: edycja — Elo 1 272 (niezależne, ~6 100 głosów); tekst-obraz — Elo 1 292 (niezależne, ~11 500 głosów)

Bernini-Diffusers-v2: brak publicznego benchmarku obrazu; wyłącznie metryki wideo raportowane przez producenta

Comparison scoreboard for MAI-Image-2.5-Pro and Bernini-Diffusers-v2: editing rank No. 1 at 1,272 Elo versus no public image benchmark; availability Foundry preview versus Apache-2.0 self-host; text rendering 96.8% claimed versus unpublished; price USD 108.50 per 1k versus free weights plus your own compute; editing approach surgical edits versus plan-then-render; scope image-only versus unified image and video

Dwie różne teorie edycji

Oba modele są zbudowane wokół idei, że edycja nie powinna oznaczać ponownego generowania sceny. Ale osiągają to na różne sposoby.

MAI-Image-2.5-Pro to propozycja Microsoftu dotycząca „precyzyjnych, chirurgicznych edycji z zachowaniem spójności”: zmień jeden obiekt, zaktualizuj tekst w obrazie, usuń rozmycie ruchu i zachowaj wszystko inne — tożsamość obiektu, oświetlenie, teksturę — stabilnie. Ta spójność jest mechanizmem stojącym za deklarowanym (przez producenta, niezweryfikowanym) wynikiem 94% utrzymania spójności postaci na wielu obrazach. Celem produktu jest model, który wykonuje wąską edycję i na tym poprzestaje.

Bernini-Diffusers-v2 to potok planuj-następnie-renderuj: planer Qwen2.5-VL rozkłada instrukcję na kroki semantyczne — {{1}}zmień pogodę, zamień styl, wstaw obiekt, zachowaj podmiot{{/1}} — a renderer rysuje wynik. Projekt jest ukierunkowany na złożone, wieloetapowe instrukcje, a te same wagi obejmują zadania tekst-obraz, obraz-obraz i wideo ({{2}}t2i, i2i, t2v, v2v, rv2v, r2v{{/2}}). Ta rozpiętość to zaleta; niewymierzonym kosztem jest to, że planer 7B jest prawdziwym wąskim gardłem dla bardzo subtelnych edycji, a nikt poza ByteDance nie określił ilościowo, jak sobie z nimi radzi.

Screenshot of the ByteDance/Bernini-Diffusers-v2 model card on Hugging Face showing the README, the Apache-2.0 license, and the benchmark table with video-side metrics

Renderowanie tekstu, praktyczne pole bitwy

Tekst w obrazie to obszar, w którym nowoczesny edytor obrazów potwierdza swoją wartość, a tutaj asymetria jest rażąca. Sztandarową funkcją MAI-Image-2.5-Pro jest precyzyjne renderowanie tekstu — Microsoft deklaruje 96,8% dokładności dla angielskiego, chińskiego, japońskiego, koreańskiego i hiszpańskiego (dane deklarowane przez producenta; ta sama dokumentacja ogranicza rozdzielczość wyjścia do około jednego megapiksela, więc liczbę należy traktować orientacyjnie). Bernini-Diffusers-v2 nie opublikował żadnych danych o dokładności renderowania tekstu. W przypadku przepływu pracy, który tworzy zlokalizowane reklamy, opakowania lub cokolwiek, co zawiera czytelne słowo, jeden kandydat oferuje mierzalną deklarację, a drugi nie oferuje nic.

Koszt oraz kształt rachunku

MAI-Image-2.5-Pro — 5 dolarów za milion tokenów tekstu wejściowego, 8 dolarów za milion tokenów obrazu wejściowego, 106 dolarów za milion tokenów obrazu wyjściowego. Koszt pojedynczego obrazu nie jest publikowany; przeliczenie Artificial Analysis wskazuje, że obraz 1024×1024 to około 108,50 dolara za 1000. Cena w wersji zapoznawczej, może ulec zmianie w wersji ogólnodostępnej.

Bernini-Diffusers-v2 — wagi są darmowe, ale self-hosting oznacza sprzęt klasy H100 (lub wynajem w chmurze), obsługę, która utrzyma go w ruchu, i własne skalowanie. Ekonomia odwraca model API: drogo przy dziesięciu obrazach dziennie, tanio przy dużej skali.

Dla większości zespołów uczciwe ujęcie jest takie: całkowity koszt posiadania Berniniego jest korzystny tylko wtedy, gdy już prowadzisz flotę GPU, a obciążenie jest duże i stabilne. W przeciwnym razie taryfikowany interfejs API po preferencyjnej stawce jest tańszą porażką.

Screenshot of Microsoft's announcement of MAI-Image-2.5-Pro and MAI-Voice-2-Flash, the subject model's vendor page, showing the preview launch and family context

Co router może, a czego nie może tutaj zrobić

Żaden z modeli nie jest dziś routowalny przez OrcaRouter, z przeciwnych powodów: MAI-Image-2.5-Pro znajduje się za bezpośrednim podglądem Microsoft Foundry, a Bernini-Diffusers-v2 w ogóle nie jest endpointem — to wagi. Ma to znaczenie jako zasada w tym zestawieniu: wzorzec rutowania stosuje się tylko do tej połowy porównania, która jest wywoływalnym API. Gdy MAI-Image-2.5-Pro trafi do wywoływalnego API zewnętrznego dostawcy, sposobem na przyjęcie go bez stawiania ścieżki produkcyjnej na kodzie preview jest skierowanie do niego części ruchu, ze sprawdzonym modelem jako automatycznym failover — w OrcaRouter to jeden endpoint, ceny dostawcy przekazywane bez marży (0% narzutu) i fallback, który łapie to, czego nie dostrzegł ranking z niską liczbą głosów. Strona z otwartymi wagami nie ma odpowiednika: albo samodzielnie uruchamiasz stos Berniniego, albo w ogóle go nie używasz.

Werdykt

MAI-Image-2.5-Pro to edytor premium, mierzalny, hostowany: #1 w niezależnym rankingu edytorów, realna obietnica renderowania tekstu i cena, która temu odpowiada. Bernini-Diffusers-v2 to darmowy, szeroki, niesprawdzony w obrazie pipeline o otwartych wagach, który obsługuje również wideo — naprawdę interesujący, jeśli hostujesz samodzielnie, naprawdę niemożliwy do oceny, dopóki ktoś nie uruchomi publicznej ewaluacji obrazu. Jeśli Twój workflow potrzebuje wywoływalnego API i liczby, którą możesz obronić, wybór to MAI-Image-2.5-Pro lub jeden z innych hostowanych edytorów, które pokonuje. Jeśli Twój workflow wymaga własności i możesz uruchomić odpowiedni sprzęt, Bernini-Diffusers-v2 warto przetestować — ale kupuj go jako zakład na niezmierzone możliwości, a nie jako konkurenta dla mierzonego #1.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube