Главная карточка для сравнения между Qwen-Image 2.1 — моделью с открытыми весами, не имеющей независимой оценки, — и MAI-Image-2.5-Pro, измеренным лидером арены редактирования изображений Artificial Analysis с рейтингом Elo 1 272
Guides & Insights

Qwen-Image 2.1 против MAI-Image-2.5-Pro: 6 100 слепых голосов против нуля

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Одну из этих двух моделей оценили примерно в 6 100 слепых человеческих сравнениях. Другую не оценивал никто за пределами её собственной лаборатории. MAI-Image-2.5-Pro, премиальная модель Microsoft для работы с изображениями, занимает первое место на арене редактирования изображений Artificial Analysis с рейтингом Elo 1272 — это результат с наибольшим числом голосов в категории. Qwen-Image 2.1, которую команда Qwen-Image выложила в открытый доступ 20 сентября 2026 года, вообще не имеет независимой оценки и не получит её, пока достаточное число людей не запустит её публично, чтобы набрать голоса. Именно этот разрыв и есть настоящая тема данного сравнения, ведь это единственное различие между двумя моделями, которое не является заявлением производителя. Всё остальное — архитектура, разрешение, цена — можно узнать, но нельзя подтвердить, а на бумаге модели настолько близки, что решение должно определяться именно разрывом в измерениях.

Что на самом деле говорят голоса, а что — нет

Artificial Analysis проводит слепые попарные сравнения: две модели получают один и тот же промпт, голосующие выбирают лучший результат, а из результатов выводится Elo. Это не идеальный инструмент, но это самое близкое к общей таблице результатов, что есть в этой категории, и размер выборки значит не меньше, чем само число.

MAI-Image-2.5-Pro — №1 в редактировании изображений с Elo 1 272 по результатам примерно 6 100 сравнений. В генерации изображений по тексту он занимает 7-е место с Elo 1 292, уступая GPT Image 2 (high) с 1 369, Reve 2.1 с 1 322, Nano Banana 2 с 1 320, GPT Image 1.5 (high) с 1 310 и MAI-Image-2.5 с 1 304.

Qwen-Image 2.1 — отсутствует в обеих таблицах. Не низкий балл — балла нет вовсе. На момент написания релизу всего один день.

Форма этих цифр заслуживает внимательного прочтения, потому что она не такая, какую подразумевает маркетинг. Модель Microsoft действительно первая в редактировании и действительно седьмая в генерации. Это конкретная, обоснованная позиция — специалист по редактированию, лидирующий в своей категории — и это не то же самое, что быть лучшей моделью изображений, которой она не является. Тем временем модель, которая превосходит её в генерации изображений по тексту, — это GPT Image 2 (high), которая также не является новейшей моделью OpenAI в этой области. Независимые таблицы лидеров вознаграждают модель, которую измеряли чаще всего, и в этом противостоянии это однозначно модель Microsoft.

Единственная характеристика, по которой открытая модель безоговорочно выигрывает

Между этими двумя есть конкретное, не субъективное различие, и это — разрешение.

Qwen-Image 2.1генерирует нативно в 2K, при этом 2048×2048 является документированным значением по умолчанию при 40 шагах инференса, семь предустановок соотношения сторон и вывод RGBA с настоящим альфа-каналом, а не с матовой подложкой.

MAI-Image-2.5-Pro ограничивает вывод 1 048 576 пикселями — примерно одним мегапикселем. Его ключевые характеристики указаны в другом месте: 32 000 входных текстовых токенов, контекстное окно 131k и 4 096 выходных токенов — это говорит о том, сколько инструкций он способен воспринять, а не о том, сколько изображения он может выдать.

Для большинства задач в соцсетях и в работе с продуктом ограничение в один мегапиксель — не помеха. Для печати, для широкоформатного композитинга, для всего, где обрезка должна выдержать, — ещё как помеха. Это единственное измерение во всём сравнении, где можно ткнуть пальцем в число и сказать, что открытая модель впереди, — и заметьте: это архитектурный факт из карточки модели, а не заявление о качестве. Qwen-Image 2.1 выдаст 2048×2048 независимо от того, есть ли там вообще что-то, на что стоит смотреть.

Цена — вот где сравнение становится неудобным

MAI-Image-2.5-Pro позиционируется как премиальная модель, и цифры здесь весьма красноречивы: $5 за миллион входных текстовых токенов, $8 за миллион входных токенов изображений и $106 за миллион выходных токенов изображений. При выводе в 1024 пикселя это составляет примерно $108,50 за тысячу изображений. Для сравнения: это примерно в 2,3 раза дороже, чем MAI-Image-2.5, и примерно в 5,4 раза дороже, чем MAI-Image-2.5-Flash, так что Microsoft намеренно сегментировала собственную линейку, а не назначила цену за уровень Pro как за постепенное улучшение.

Qwen-Image 2.1 не имеет облачной цены, потому что нет облачного эндпоинта — это скачивание весов по исследовательской лицензии. Его стоимость — это ваше время на GPU, а его ограничение в том, что вы не можете законно продавать то, что он создаёт. Сравнивать $108.50 за тысячу изображений с «бесплатными весами» — это сравнивать сервис с машиной, и честная версия такого сравнения такова: оплата по счётчику покупает вам измеренную, поддерживаемую, коммерчески лицензированную модель, а веса покупают вам скачивание на 33 ГБ и файл лицензии, в котором сказано: только некоммерческое использование.

Именно здесь и оправдывает себя слой маршрутизации. OrcaRouter предоставляет более 200 моделей через одну совместимую с OpenAI конечную точку по прайс-листовой цене провайдера без наценки, с автоматическим переключением между провайдерами при сбоях — так что команде, которая хочет оценить ещё не измеренную открытую модель, для этого не нужно переводить на неё продакшен, и поскольку прайс-листовая цена передаётся как есть, любое изменение цены вендором на маршрутизируемую модель отражается на нашей стороне в тот же день, а не при следующем продлении контракта. Ни MAI-Image-2.5-Pro, ни Qwen-Image 2.1 не входят в число моделей, которые мы маршрутизируем сегодня, и эта статья не собирается утверждать обратное. Линейка изображений, которую мы действительно предоставляем, — это семейство GPT-Image от OpenAI, тарифы Imagen 4 и предпросмотры изображений Gemini от Google, а также конечная точка изображений Grok Imagine от xAI.

Two-column scoreboard for Qwen-Image 2.1 and MAI-Image-2.5-Pro: Qwen-Image 2.1 rows read Released 20 Sept 2026 / Licence research-only, non-commercial / Editing score none / Text-to-image score none / Output 2048x2048 native, RGBA / Price self-host, no hosted endpoint; MAI-Image-2.5-Pro rows read Announced 23 July 2026 / Licence commercial, via Microsoft / Editing score AA #1, Elo 1,272, about 6,100 votes / Text-to-image score AA #7, Elo 1,292 / Output capped at 1,048,576 pixels / Price about $108.50 per 1,000 images; footer reads 'MAI figures per Artificial Analysis; Qwen-Image 2.1 has no independent score yet.'

Где находятся заявления поставщика, и какой вес им придавать

Оба поставщика публикуют цифры, которые не воспроизвела ни одна третья сторона, и к ним следует относиться с одинаковым скептицизмом в обе стороны.

Заявления Microsoft — точность отрисовки текста 96,8% для английского, китайского, японского, корейского и испанского языков; на 27% лучшее следование промпту, чем у GPT-Image-1.5; 94% согласованности персонажей на нескольких изображениях; и до 84–89% снижения затрат на GPU в отдельных внутренних сценариях Microsoft. С последним стоит быть осторожным: он описывает собственную конфигурацию обслуживания Microsoft, а не то, что может проверить клиент.

Утверждения Alibaba — в блог-посте о Qwen-Image 2.1 приводится сравнительная диаграмма Qwen-Image-Bench, и цифры в ней взяты у самого производителя. В сторонних публикациях также ходит цифра, описывающая модель как 20-слойный трансформер, что противоречит указанному в карточке модели 32-слойному однопоточному DiT; карточка модели — это первоисточник, и использовать следует именно цифру в 32 слоя.

Разница между этими двумя ситуациями не в честности того или другого поставщика. Дело в том, что модель Microsoft была независимо измерена, а модель Alibaba — нет, поэтому утверждения Microsoft можно с чем-то сверить, а утверждения Alibaba пока не с чем сверить.

Для чего предназначен каждый

Если читать их вместе, они не конкурируют за один и тот же слот.

MAI-Image-2.5-Pro — это инструмент редактирования. Он лидирует в таблице редактирования на большой базе голосов, принимает длинную инструкцию (32 тыс. входных текстовых токенов, контекст 131 тыс.), имеет коммерческую лицензию и уже доступен в качестве публичной предварительной версии в Microsoft Foundry и MAI Playground. Если ваша работа — это итеративная коррекция изображений и вам нужно ещё до принятия обязательств знать, что этот инструмент лучший в своём деле, вот измеренный ответ, и он стоит около $108,50 за тысячу изображений.

Qwen-Image 2.1 — это открытый исследовательский артефакт. Он генерирует более крупные изображения, вместе с моделью изображений поставляется доступный для изучения чекпойнт переписывания промптов, принимает до 10 референсных изображений с локальными правками с помощью круга, нарисованной пометки или маски, а также его можно бесплатно скачать, но нельзя продавать. Если ваша работа — это оценка, бенчмаркинг или построение на весах, которые вы можете прочитать, то это более интересный объект — и вы выполняете эту работу без таблицы лидеров, которая сказала бы вам, хорош ли он.

Также стоит отметить асимметрию по срокам. MAI-Image-2.6 вышла в закрытое превью 19 августа 2026 года, а значит, модель на вершине таблицы редактирования уже на одно поколение отстаёт от того, что Microsoft готовится выпустить. Qwen-Image 2.1, напротив, находится в самом начале пути, а программа раннего доступа просила своих тестировщиков опубликовать результаты к 29 сентября. Обе таблицы результатов в этом сравнении уже через месяц будут выглядеть иначе.

Screenshot of the Artificial Analysis text-to-image leaderboard captured September 9 2026, showing GPT Image 2 (high) first at Elo 1,178 with MAI-Image-2.5-Pro listed at No. 7 with Elo 1,292, and no Qwen-Image 2.1 entry anywhere on the boardScreenshot of the Qwen vendor blog page for Qwen-Image-2.1, captured in English, headlined 'Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation', dated 2026/09/20, with download links to GitHub, Hugging Face and ModelScope and the four headline improvements listed as compact and efficient, native transparency with unified creation and editing, versatile editing with up to 10 reference images, and realistic textures

Что бы это уладило

Одно: появление Qwen-Image 2.1 в таблице лидеров. Всё в этой статье, что не является ограничением разрешения или ценой, — это заявление одной лаборатории или другой, и единственная причина, по которой MAI-Image-2.5-Pro можно с невозмутимым лицом рекомендовать, состоит в том, что 6 100 человек, не работавших в Microsoft, посмотрели на его результаты рядом с чем-то ещё и предпочли его. Это тот стандарт, которому открытая модель не соответствует, и тот, которому ей следует соответствовать.

До тех пор практический вывод прост. Если вам сегодня нужна модель для редактирования, по коммерческой лицензии, с подтверждёнными результатами, ответ — Microsoft, и она стоит около $108.50 за тысячу изображений. Если вы хотите выяснить, лучше ли 7B-модель с открытыми весами, с нативным выводом 2K и проверяемым переписчиком промптов, вам придётся измерить это самостоятельно — а самое полезное, что можно сделать с результатом, — опубликовать его, потому что всей категории сейчас не хватает одной точки данных.