Карточка-герой для противостояния между MAI-Image-2.5-Pro, премиальной моделью редактирования в предварительной версии Microsoft Foundry, и Bernini-Diffusers-v2, конвейером ByteDance с открытыми весами под лицензией Apache-2.0.
Guides & Insights

MAI-Image-2.5-Pro против Bernini-Diffusers-v2: измеренный №1 против неизмеренной ставки на открытые веса

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Сравнивать MAI-Image-2.5-Pro с Bernini-Diffusers-v2 — это на самом деле не сравнение двух моделей генерации изображений. Это сравнение двух разных ответов на один и тот же вопрос — «как получить хорошее редактирование существующего изображения?» — где у одной стороны за первым местом в рейтинге редактирования — 6 100 голосов реальных людей, отданных в ходе слепого тестирования, а у другой — только README. MAI-Image-2.5-Pro, качественная модель генерации изображений от Microsoft, вышла в публичную предварительную версию на Microsoft Foundry 23 июля 2026 года и теперь возглавляет Artificial Analysis Image Editing Arena. Bernini-Diffusers-v2, унифицированный фреймворк генерации второго поколения от ByteDance, появился на Hugging Face 13 августа 2026 года в виде весов под лицензией Apache-2.0 — без анонса и без бенчмарка качества изображений, который кто-либо за пределами ByteDance запускал. Все практические различия в этом сравнении вытекают из этих двух фактов.

Один ты вызываешь, другой ты запускаешь

MAI-Image-2.5-Pro — размещенная API-модель в публичной предварительной версии на Azure AI Foundry и в MAI Playground. Проприетарная, с тарификацией по токенам, без тонкой настройки и самостоятельного хостинга. Вы получаете конечную точку и платите за каждый токен; инфраструктуру обслуживает Microsoft.

Bernini-Diffusers-v2 — веса Apache-2.0, которые вы скачиваете с Hugging Face и запускаете сами. Стек: семантический планировщик Qwen2.5-VL-7B, управляющий DiT-рендерером на основе Wan2.2, а в README рекомендуется оборудование класса Hopper (H100/H800/H200) с Python 3.11.2 / PyTorch 2.5.1+cu124. Кластер вы обеспечиваете сами.

Вот правило принятия решения в одной строке: если ваша организация хочет владеть стеком, Bernini — вариант; если ваша организация хочет счёт и SLA, то в расчёт принимается только MAI-Image-2.5-Pro. Они не являются заменой друг друга.

Разрыв в доказательствах — вот настоящий заголовок.

Обе модели находятся по разные стороны самой большой проблемы качества в ИИ-генерации изображений: измерение результата. Навык редактирования MAI-Image-2.5-Pro получил независимую оценку — № 1 на Artificial Analysis Image Editing Arena с рейтингом Elo 1 272 по результатам ~6 100 слепых сравнений, опережая Reve 2.1, GPT Image 2 и свою сестринскую модель MAI-Image-2.5. В генерации text-to-image MAI-Image-2.5-Pro занимает седьмое место с рейтингом Elo 1 292, что служит честным противовесом: это специализированный редактор, а не лидер «чистого холста». Эти цифры может проверить любой, у кого есть браузер.

Bernini-Diffusers-v2 не имеет эквивалентной публичной оценки. В карточке модели указаны EditVerse 8.02, OpenVE 3.96, OpenS2V 63.83 и VBench 84.46 — все значения предоставлены вендором, и все это метрики для видео. В карточке нет ничего, что покупатель изображений мог бы признать результатом лидерборда для text-to-image или редактирования изображений. В карточке также утверждается, что Bernini достигает «первого уровня» закрытых коммерческих моделей во внутреннем слепом попарном арене ByteDance — что является ровно той самооценкой вендора, которая требует независимой проверки, прежде чем что-либо значить.

MAI-Image-2.5-Pro:редактирование Elo 1 272 (независимо, ~6 100 голосов); текст-в-изображение Elo 1 292 (независимо, ~11 500 голосов)

Bernini-Diffusers-v2: нет публичного бенчмарка изображений; только метрики для видео, по данным вендора

Comparison scoreboard for MAI-Image-2.5-Pro and Bernini-Diffusers-v2: editing rank No. 1 at 1,272 Elo versus no public image benchmark; availability Foundry preview versus Apache-2.0 self-host; text rendering 96.8% claimed versus unpublished; price USD 108.50 per 1k versus free weights plus your own compute; editing approach surgical edits versus plan-then-render; scope image-only versus unified image and video

Две разные теории редактирования

Обе модели основаны на идее, что редактирование не должно означать повторную генерацию сцены. Но достигают они этого по-разному.

MAI-Image-2.5-Pro — это предложение Microsoft «точные, хирургические правки с сохранением согласованности»: изменить один объект, обновить текст в изображении, убрать смазанность движения и сохранить всё остальное — идентичность объекта, освещение, текстуру — стабильным. Эта согласованность и есть механизм, стоящий за заявлением о 94% согласованности персонажей на нескольких изображениях (заявлено производителем, не проверено). Цель продукта — модель, которая выполняет точечную правку и останавливается.

Bernini-Diffusers-v2 — это конвейер «сначала план, затем рендеринг»: планировщик Qwen2.5-VL разбивает инструкцию на семантические шаги — изменить погоду, заменить стиль, вставить объект, сохранить субъект — а рендерер рисует результат. Архитектура рассчитана на сложные многошаговые инструкции, и одни и те же веса покрывают задачи текст-в-изображение, изображение-в-изображение и видео (t2i, i2i, t2v, v2v, rv2v, r2v). В этом широта охвата — плюс; неизмеренная цена в том, что планировщик на 7B является реальным узким местом для очень тонких правок, и никто за пределами ByteDance не количественно оценил, как он с ними справляется.

Screenshot of the ByteDance/Bernini-Diffusers-v2 model card on Hugging Face showing the README, the Apache-2.0 license, and the benchmark table with video-side metrics

Рендеринг текста — практическое поле битвы

Текст в изображении — это то, на чём современный редактор изображений оправдывает свою цену, и здесь асимметрия разительна. Ключевая возможность MAI-Image-2.5-Pro — точный рендеринг текста: Microsoft заявляет о точности 96,8% для английского, китайского, японского, корейского и испанского языков (по заявлению производителя; в той же документации выходное разрешение ограничено примерно одним мегапикселем, так что это число стоит считать ориентировочным). Bernini-Diffusers-v2 не опубликовал никаких данных о точности рендеринга текста. Для рабочего процесса, который создаёт локализованную рекламу, упаковку или что-либо с читаемым словом, один кандидат предлагает измеримый показатель, а другой — ничего.

Стоимость и форма счета

MAI-Image-2.5-Pro — $5 за миллион текстовых токенов на входе, $8 за миллион токенов изображений на входе, $106 за миллион токенов изображений на выходе. Стоимость за изображение не публикуется; по пересчёту Artificial Analysis, изображение 1024×1024 стоит около $108,50 за 1 000. Предварительные цены, могут измениться к моменту GA.

Bernini-Diffusers-v2 — веса бесплатны, но самостоятельный хостинг означает оборудование класса H100 (или аренду в облаке), эксплуатацию для его поддержки и собственное масштабирование. Экономика переворачивает модель API: дорого при десяти изображениях в день, дёшево при серьёзных объёмах.

Для большинства команд честная формулировка такова: совокупная стоимость владения Bernini оправдана только в том случае, если вы уже эксплуатируете парк GPU, а нагрузка велика и стабильна. В противном случае API с посекундной тарификацией по повышенной ставке — более дешёвый вариант неудачи.

Screenshot of Microsoft's announcement of MAI-Image-2.5-Pro and MAI-Voice-2-Flash, the subject model's vendor page, showing the preview launch and family context

Что маршрутизатор может и не может делать здесь

Ни одна из моделей сегодня не маршрутизируется через OrcaRouter, по противоположным причинам: MAI-Image-2.5-Pro находится за прямым предварительным доступом Microsoft Foundry, а Bernini-Diffusers-v2 вообще не является конечной точкой — это веса. Это важно как принцип для данного сравнения: паттерн маршрутизатора применим только к той половине этого сравнения, которая является вызываемым API. Когда MAI-Image-2.5-Pro станет доступен через вызываемый сторонний API, способ внедрить его, не ставя производственный путь на предварительный код, — это направлять на него часть трафика с проверенной моделью в качестве автоматического резерва: на OrcaRouter это одна конечная точка, цены провайдера передаются без наценки (0%), и запасной вариант, который ловит то, что не смог увидеть лидерборд с низким числом голосов. У стороны с открытыми весами нет эквивалента: вы либо сами запускаете стек Bernini, либо не используете его.

Вердикт

MAI-Image-2.5-Pro — это премиальный, измеримый, хостируемый редактор: {{1}}#1 в независимом рейтинге редакторов{{/1}}, реальное заявление о рендеринге текста и соответствующая цена. Bernini-Diffusers-v2 — это бесплатный, универсальный, {{2}}непроверенный в изображениях{{/2}} конвейер с открытыми весами, который также работает с видео — {{3}}действительно интересен, если вы хостите его у себя, и действительно не поддается оценке, пока кто-то не запустит публичную оценку изображений{{/3}}. Если вашему рабочему процессу нужны {{4}}вызываемый API и показатель, который можно обосновать{{/4}}, выбор — {{5}}MAI-Image-2.5-Pro или один из других хостируемых редакторов, которые он превосходит{{/5}}. Если вашему рабочему процессу нужны {{6}}владение и возможность запуска на собственном оборудовании{{/6}}, {{7}}Bernini-Diffusers-v2 стоит протестировать{{/7}} — но покупайте его как {{8}}ставку на неизмеренный потенциал, а не как конкурента измеренному #1{{/8}}.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube