Hero-карточка с заголовком «Ming-Image-0.1-Design возглавляет таблицу лидеров по UI-дизайну среди моделей с открытыми весами», подзаголовком «Самая высокооценённая модель с открытыми весами в срезе UI/UX Design от Artificial Analysis — 1 084 Elo», с карточкой со значком трофея и подписью «Лучшая модель с открытыми весами» и карточкой со значком экрана и подписью «Лидер в UI/UX Design». Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

Ming-Image-0.1-Design возглавляет рейтинг UI-дизайна среди моделей с открытыми весами — и цифра сходится.

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Утверждение, циркулирующее вместе с Ming-Image-0.1-Design, состоит в том, что 6B-модель от inclusionAI — лучшая text-to-image модель с открытыми весами для работы с UI и UX, занимающая первое место в представлении открытых весов лидерборда Artificial Analysis UI/UX Design с 1082 Elo. Скриншоты лидербордов от вендоров обычно — самый слабый вид доказательств, поэтому первое, что стоит сделать, — прочитать актуальный лидерборд. По состоянию на 24 сентября 2026 года это подтверждается, с одной важной оговоркой, которой нет на скриншоте: 1082 — это срез по варианту использования, а не сам лидерборд, и на полном лидерборде Text to Image та же модель занимает 45-е место с Elo 995.

Оба числа реальны, они взяты из одной и той же арены и описывают одни и те же веса. Разница между ними в том, на каких промптах были отданы голоса.

Что на самом деле показывает live-табло

Artificial Analysis проводит одну слепую попарную арену, а затем разбивает один и тот же пул голосов на срезы по вариантам использования. Срез UI/UX Design — это тот, который имеет значение для модели, созданной для дашбордов, экранов приложений, постеров и инфографики, и именно здесь Ming-Image-0.1-Design показывает свои лучшие результаты:

• Общий рейтинг Text to Image — Ming-Image-0.1-Design на 45-м месте, Elo 995, 95% ДИ ±8, 21 342 образца, добавлен в сентябре 2026 г., $30,00 за 1 000 изображений, помечен как Open Weights

• Срез UI/UX Design — Ming-Image-0.1-Design на #16, Elo 1 084, 2 100 образцов в срезе

Самая высокопоставленная запись с открытыми весами в этом сегменте — Ming-Image-0.1-Design; следующие за ней модели с открытыми весами — Ideogram 4.0 (Quality) на #22 с 1 047, Ideogram 4.0 на #31 с 1 018 и HunyuanImage 3.0 Instruct на #40 с 1 005.

• Топ среза UI/UX — GPT Image 2.5 Flare (max) с 1 226, GPT Image 2.5 Sunburst (max) с 1 215, GPT Image 2 (high) с 1 204, Grok Imagine Image 2.0 с 1 183

• В сравнении с собственным скриншотом вендора — inclusionAI опубликовала 1 082 для Ming против 1 052 у Ideogram 4.0 (Quality) и 1 000 у FLUX.2 [dev]; в актуальном срезе теперь указаны 1 084, 1 047 и 1 000 соответственно

Итак, заголовок точен сам по себе. Ming-Image-0.1-Design — модель с открытыми весами с самым высоким рейтингом в категории UI/UX Design, и единственная модель с открытыми весами в топ-20 этой категории. Она также отстаёт на 142 пункта Elo от лидера этой категории и находится в середине списка, когда запрос не является дизайнерским. Модель, которая выигрывает на дашбордах и набирает 995 в общем зачёте, — это специалист, а не универсал, и эти две цифры противоречат друг другу, только если воспринимать одну из них как всю картину.

То, что в полной таблице 21 342 образца, тоже стоит отметить — хотя бы ради того, чтобы понять, чем это не является. Это большое число голосов, поэтому доверительный интервал узкий — ±8 Elo, — однако количество образцов не означает независимости метода. Арена — это слепое человеческое предпочтение, поэтому никто в inclusionAI не писал оценку — эта часть подлинная. Оценка измеряет, «какое из этих двух изображений предпочёл голосующий», а голосующие, которых просят оценить скриншот UI, обычно отдают предпочтение разборчивому тексту и связной компоновке. Именно на этой оси и обучалась эта модель.

Screenshot of the Artificial Analysis Text to Image Leaderboard captured 24 September 2026, cropped to the lower rows. Ming-Image-0.1-Design is row 45, creator InclusionAI, with an Elo of 995, row range 39-50, 21,342 samples, a September 2026 release and $30.0 per 1k imgs, carrying the Open Weights badge. Neighbouring rows include P-Image-Ideogram (High) at 44 and 995, Cosmos3-Super-Text2Image (agentic) at 46 and 994, and Ideogram 4.0 at row 38 and 1,004, also Open Weights.

Что такое Ming-Image-0.1-Design

Ming-Image-0.1-Design — это модель текст-в-изображение от inclusionAI, лаборатории искусственного интеллекта, связанной с Ant Group. Она выпущена под лицензией MIT: веса опубликованы 17 сентября 2026 года, а полный релизный пакет вышел 22 сентября. Модель генерирует изображение только по промпту — опорное изображение не требуется — и ориентирована на насыщенный текстом графический дизайн, а не на фотографию: макеты UI, дашборды, инфографику, постеры и всё, где отрисованный текст должен оставаться читаемым в том размере, в котором его будут читать.

Задокументированная конфигурация инференса конкретна и необычно дешева на каждом шаге:

• Разрешение — рекомендуется 2048 x 2048 или 1024 x 1024 для более быстрой генерации, при этом промежуточные размеры приводятся к одному из этих двух вариантов

• Шаги сэмплирования — 12

• Управление — масштаб CFG 1.0

• Точность — BF16

• Аппаратное обеспечение — один графический процессор CUDA с 80 ГиБ видеопамяти, описанное как валидированная конфигурация.

Двенадцать шагов при значении guidance scale 1.0 — это характерная черта дистиллированного сэмплера или сэмплера без guidance. Именно это делает выходное изображение размером 2048 пикселей доступным при таком числе шагов, которое большинство диффузионных моделей даже не попыталось бы использовать, и это главная причина, по которой эта модель интересна всем, кто запускает генерацию изображений в больших объёмах, а не по одному изображению за раз.

Другая структурная особенность — прозрачность. Ming-Image-0.1-Design может выдавать нативный RGBA, поэтому прозрачный фон получается прямо из сэмплера, а не в результате прохода матирования, когда промпт начинается с одной из задокументированных фраз прозрачности. Сопутствующая модель Ming-Image-0.1-Design-Layer идёт дальше: она принимает сведённый дизайн вместе с планом слоёв и возвращает отдельные RGBA PNG — текст, карточки, основной объект, фон, — которые снова собираются в оригинал. В этом разница между дизайн-моделью и моделью изображений. Плоский PNG — это картинка макета; отдельные слои — это макет, который всё ещё можно редактировать.

Screenshot of the inclusionAI/Ming-Image-0.1-Design model card on Hugging Face, captured 24 September 2026. The header shows 188 likes, 3,067 followers, tags including text-to-image, difusers, safetensors, image-generation, graphic-design, text-rendering and License: mit, and a safetensors panel reading Model size 6B params, Tensor type BF16. The card's UI/UX Design leaderboard image is embedded in the body, showing Ming-Image-0.1-Design first at 1,082 above Ideogram 4.0 (Quality) at 1,052 and FLUX.2 [dev] at 1,000. The right rail states 'This model isn't deployed by any Inference Provider', and the Quick Start block shows the infer.py command with --resolution 2048 and a note that prompt enhancement can use Ling-3.0-flash-VL or qwen3.8-27B.

Метка 6B и скачивание 26B

«6B» точен в той части, которую подразумевает большинство, и вводит в заблуждение в той части, которая определяет, сможете ли вы его запустить. Диффузионный трансформер имеет 6.15B параметров. Пакет, который вы фактически скачиваете, составляет примерно 52.88 ГБ, потому что мультимодальный текстовый энкодер имеет 17.01B параметров, а коннектор добавляет 3.09B — в общей сложности около 26B параметров в формате BF16. Трансформер модели Layer вдвое больше, чем у базовой модели, и составляет 12.31B, а его пакет ещё больше — примерно 65.20 ГБ.

Это важно по двум практическим причинам. Во-первых, требование 80 GiB видеопамяти (VRAM) относится не к 6B-трансформеру, а ко всему, что должно постоянно находиться в памяти рядом с ним. Во-вторых, при любом сравнении с моделью, описываемой как «6B», нужно проверить, какой именно 6B имеется в виду. 6B-диффузионный трансформер с 20B текстовым энкодером — это совсем другая задача развёртывания, чем модель 6B от начала до конца.

Обработка промптов — это ещё одна вещь, которую карточка делает явной, а не скрывает: рекомендуемый рецепт сначала выполняет этап переписывания, используя визуально-языковую модель, чтобы расширить короткий промпт в структурированное описание макета в стиле Figma в формате JSON с координатами, иерархией, спецификациями цветов и дословным текстом. В карточках моделей для этой задачи указаны Ling-3.0-flash-VL или Qwen3.8-27B. Иными словами, конвейер, который тестирует вендор, — это конвейер из двух моделей. Если вы вызываете Ming-Image-0.1-Design с однострочным промптом и без этапа переписывания, вы не запускаете конфигурацию, которая набрала 1,084 в срезе UI/UX.

Что это значит для конвейера проектирования

Честное резюме Ming-Image-0.1-Design таково: она решает конкретную и дорогостоящую проблему — генерацию насыщенных текстом макетов, которые не разваливаются при рассмотрении, — и делает это на вершине направления открытых весов в единственном рейтинге, который измеряет эту проблему. Она не возглавляет общий рейтинг по изображениям, не устраняет необходимость в VLM перед ней и требует серьёзного GPU.

Что это меняет — так это середину рабочего процесса дизайна. Если ваш пайплайн сейчас генерирует плоское изображение, а затем платит человеку или модели сегментации за то, чтобы разрезать его на части, то модель, которая нативно выдаёт RGBA, и сопутствующий инструмент, который выдаёт 2–9 именованных слоёв, убирают один этап. Это стоит больше, чем колонка Elo, и именно эту часть не измеряет ни одна таблица лидеров.

Для команд, которые хотят протестировать её, не вкладываясь в инфраструктуру, стоит чётко обозначить это разделение. Ming-Image-0.1-Design — это загрузка под лицензией MIT, поэтому она работает на вашем оборудовании — или не работает вовсе: OrcaRouter не маршрутизирует ни одну модель inclusionAI ни одной версии, и утверждать обратное означало бы давать обещание, которое мы не можем выполнить. Что действительно даёт маршрутизирующий слой, так это окружающую обвязку: один OpenAI-совместимый эндпоинт для 200+ моделей, автоматическое переключение при сбоях между провайдерами и передачу прайсовой цены провайдера с наценкой 0%, так что изменение цены вендором на любую модель, к которой вы действительно обращаетесь, становится актуальным на нашей стороне в тот же день. Если вы выстраиваете дизайн-пайплайн и хотите сравнить по A/B эту модель с уже проверенной хостируемой, такое сравнение запускается по одному ключу, а не по двум контрактам.

A rendered summary card headed 'The two numbers' and titled 'One model, two readings', listing five figures: Overall Text to Image board #45, Elo 995, 95% CI 8, 21,342 samples; UI/UX Design slice #16, Elo 1,084, 2,100 samples in the slice; open-weights standing in that slice #1, next is Ideogram 4.0 (Quality) at #22 and 1,047; leader of the same slice GPT Image 2.5 Flare (max), Elo 1,226, a 142-point gap; board-listed API pricing $30.00 per 1,000 images, flagged Open Weights.

Что бы изменило картину?

Три вещи перевели бы Ming-Image-0.1-Design из сильной специализированной модели с открытыми весами в решение по умолчанию. Первое независимое воспроизведение показателей Crello модели Layer — в карточке сообщается об ошибке RGB L1 0,0574 и alpha soft IoU 0,8923 при 1024, и ни одна сторонняя группа их не запускала. Хостинговый эндпоинт, снимающий требование в 80 ГиБ. И второй срез сценариев использования, где модель показывает такие же результаты, как в UI/UX Design, потому что модель, которая выигрывает только на одном срезе одной таблицы лидеров, — это модель, обобщающая способность которой ещё не доказана.

До тех пор точная формулировка — узкая: в срезе UI/UX Design от Artificial Analysis, по состоянию на 24 сентября 2026 года, Ming-Image-0.1-Design от inclusionAI — самая высокорейтинговая модель преобразования текста в изображение с открытыми весами: 1 084 Elo при 2 100 голосах — а в полной таблице той же арены она занимает 45-е место с 995. И то и другое — это модель. Ни то, ни другое не является заявлением о запуске, потому что у этой модели не было запуска; у неё был репозиторий.