Титульная карточка для «Ming-Image-0.1-Design против Qwen-Image 3.0» с подзаголовком «Кто показывает, как рисуется текст», противопоставляющая Ming-Image-0.1-Design (6,15 млрд параметров, лицензия MIT, веса, которые можно прочитать, опубликована 17 сентября 2026 г.) и Qwen-Image 3.0 (закрытая хостируемая модель, количество параметров не опубликовано, нет лицензии или отчёта, общий доступ 5 августа 2026 г.), с логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

Ming-Image-0.1-Design против Qwen-Image 3.0: кто покажет вам, как рисуется текст

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Самое интересное в Ming-Image-0.1-Design — не на его карточке модели. Оно — в коммите к фреймворку для инференса. Примерно во время тихой загрузки модели на Hugging Face 17 сентября 2026 года vLLM-Omni влил изменение под названием feat: добавить поддержку byte5 для Ming, которое подключает глифовый энкодер ByT5 к новому ming_flash_omni пайплайну — выделенному компоненту, вся задача которого — смотреть на символы, которые вы попросили отрисовать, а не на картинку, которую вы попросили. Это та деталь, которую можно найти, только читая код, и именно та деталь, которую Qwen-Image 3.0 — закрытая хостируемая модель генерации изображений от вендора, выпущенная 21 июля 2026 года и ставшая общедоступной 5 августа, — вообще не позволяет никому прочитать. Обе модели нацелены на дизайнерскую работу, где разборчивый шрифт — самое сложное. Только одна из них расскажет вам, как она это делает.

Что каждый из них говорит о тексте

История с рендерингом текста у Qwen-Image 3.0 — это целиком заявление, сделанное при запуске, и на бумаге оно выглядит убедительно. В материалах Alibaba описываются промпты длиной примерно до 4500 токенов, разборчивый текст вплоть примерно до 10 пикселей, поддержка 12 языков и более 20 шрифтов, вывод размером до 2048×2048 и до шести изображений за один вызов, доступные в редакциях Pro и Standard через один размещённый API. Нет выпуска весов, не указана лицензия, нет карточки модели, нет технического отчёта и нет опубликованной таблицы бенчмарков, по которой можно было бы всё это проверить. Широко повторяемая цифра примерно 20 млрд параметров MMDiT сообщается, а не подтверждается.

История Ming-Image-0.1-Design — это репозиторий. 6 154 901 056 параметров, лицензия MIT, diffusers — это тег пайплайна, все веса в BF16 safetensors, примерно 71,5 ГБ в каталогах connector/, mllm/, mlp/, scheduler/, transformer/ и vae/. Рекомендуемый вывод — 2048×2048 при 12 шагах сэмплирования с guidance 1.0 на одном графическом процессоре CUDA с 80 ГиБ, или 1024 для скорости; для развёртывания указан vLLM-Omni, а для улучшения промпта — отдельная визуально-языковая модель. В карточке он описывается как модель текст-в-изображение для UI, инфографики, плакатов и другого визуального дизайна с большим объёмом текста, с выводом RGBA для прозрачного фона.

Эти два абзаца — не утверждения одного типа, и стоит прямо сказать, почему. Один — это описание продукта, написанное теми, кто его продаёт. Другой — описание артефакта, который любой может скачать и проверить.

Кодировщик глифов — это часть, которая объясняет категорию.

Отрисовка текста в моделях изображений обычно даёт сбой вполне определённым образом: модель генерирует нечто похожее на письменность, не являясь письменностью. Формы букв правдоподобны, а слово — неправильное. Причина прежде всего архитектурная — у большинства моделей изображений нет компонента, который воспринимает символы как символы, поэтому шрифт реконструируется по визуальной статистике так же, как трава.

Коммит vLLM-Omni интересен именно тем, что указывает на это. Добавленные файлы — byte5_encoder.py, pipeline_ming.py, t5_block_mapper.py и обработчик входных данных стадии — описывают путь, в котором байтовый энкодер ByT5 читает текст, который должен появиться на изображении, словарь токенизатора расширяется маркерами шрифта и цвета, а полученные признаки добавляются вдоль размерности последовательности, причём отрицательная сторона получает нули. Эта последняя деталь — признак того, что это настоящее проектное решение, а не просто техническая обвязка: если бы отрицательная ветвь несла те же глифовые признаки, guidance без классификатора смещался бы к отрисовке текста и уходил бы от промпта, поэтому нули существуют, чтобы две цели не боролись друг с другом. Энкодер загружается только тогда, когда контрольная точка действительно содержит byte5/ подпапку.

Две оговорки ради честности. Это коммит в сторонний фреймворк для инференса, а не заявление Ant Group, и трактовка того, что означают эти файлы, наша, а не вендора. И это подтверждает проектный замысел, а не результат: наличие кодировщика глифов согласуется с хорошим рендерингом текста, но не доказывает, что рендеринг текста хорош. Единственное независимое свидетельство качества — всего одна позиция в таблице лидеров, о которой говорится ниже.

A pipeline diagram titled "How the glyph encoder enters the pipeline", showing prompt text passing through a tokenizer extended with font and colour markers into a ByT5 glyph encoder whose features are appended along the sequence dimension, with the negative branch receiving zeros so guidance is not pulled away from rendered text, and the result emerging as an RGBA image.

Контраст с Qwen-Image 3.0 не в том, что модель Alibaba плохо отрисовывает текст, — никто за пределами Alibaba не может сказать, насколько хорошо она отрисовывает текст, и в этом-то и суть. Дело в том, что на вопрос «как эта модель рисует буквы» для одной из этих моделей есть ответ, а для другой — маркетинговое утверждение, и разрыв между ответом и утверждением — это то место, где принимаются инженерные решения.

То самое число, и доска, на которой его нет

Ming-Image-0.1-Design занимает первое место в Artificial Analysis Text to Image Leaderboard for UI/UX Design, в представлении открытых весов, с рейтингом Elo 1 082 — опережая Ideogram 4.0 (Quality) с 1 052, Ideogram 4.0 с 1 015, HunyuanImage 3.0 Instruct с 1 005, FLUX.2 [dev] с 1 000, FLUX.2 [dev] Flash с 999 и FLUX.2 [dev] Turbo с 994. Копия этой таблицы — та, что воспроизведена на собственной карточке модели, и на ней присутствует брендинг Artificial Analysis; никто независимо не воспроизводил этот результат.

The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.

Это рейтинг открытых весов, поэтому Qwen-Image 3.0 в нём не участвует, и его отсутствие ничего не говорит о качестве. Оно говорит о структурной особенности: рейтинг слепых предпочтений может ранжировать только те модели, чьи веса открыты. Это даёт открытому релизу измеримую позицию за месяцы до появления продукта, а закрытому релизу — маркетинговую цифру и ничего больше. За заявлениями Qwen-Image 3.0 — читаемость 10-пиксельного текста, промпты на 4 500 токенов, более 20 шрифтов — вообще нет независимых измерений.

A two-column scoreboard titled "Ming-Image-0.1-Design vs Qwen-Image 3.0 - the scoreboard". Left column Ming-Image-0.1-Design: Weights downloadable, 6.15B; Licence MIT; Text rendering glyph encoder visible; Independent score Elo 1,082; Price self-host; Internals readable. Right column Qwen-Image 3.0: Weights none; Licence not published; Text rendering 10px claim, vendor-reported; Independent score none; Price about $0.04 per image; Internals black box. Footer reads "Qwen-Image 3.0 claims vendor-reported; Ming score per the Artificial Analysis board on its model card.", with the OrcaRouter logo bottom-right.

Как бы вы на самом деле это проверили и сколько стоит попробовать

Если разборчивый шрифт — это то, ради чего вы это читаете, то тест — не таблица лидеров. Это ваш собственный шрифт, ваш собственный язык и ваши собственные строки, прогнанные через оба кандидата и прочитанные человеком. Такой тест требует, чтобы одна из этих моделей была доступна и дёшева, а другая — могла быть скачана, и цены на них строятся на противоположных принципах.

• Qwen-Image 3.0 — около $0,04 за изображение в редакции Pro и около $0,03 в Standard, при этом цены для местных потребителей начинаются примерно с ¥0,18 за изображение. Это стартовые цифры, и они не проходили аудит. Вы можете запустить матрицу промптов уже сегодня днём и платить за каждый вызов.

• Ming-Image-0.1-Design — опубликованной цены нет, потому что нет хостинговой конечной точки. Затраты — это загрузка объёмом 71,5 ГБ, карта на 80 GiB и ваше собственное время, а преимущество в том, что вы можете направить тот же тест на путь кодировщика глифов и увидеть, действительно ли работу выполняет именно этот компонент.

Именно для такой ситуации и создаётся слой маршрутизации, и стоит точно определить, какая его часть здесь применима. Ни Qwen-Image 3.0, ни Ming-Image-0.1-Design нет на нашей платформе, поэтому слой маршрутизации сегодня не может открыть доступ к ним по ключу. Но он может сохранить честность сравнения, пока вы его проводите: OrcaRouter объединяет более 200 моделей за одним OpenAI-совместимым эндпоинтом по прайсовой цене провайдеров без наценки, с автоматическим переключением между провайдерами при сбоях, так что модель, которой вы уже доверяете, может удерживать продакшн-путь — и её стоимость остаётся привязанной к прайсовой цене провайдера, поэтому изменение тарифа у вендора отражается на нашей стороне в тот же день — а неизмеренная дизайн-модель оценивается рядом с ней, а не впереди неё.

Два открытых релиза, один закрытый — и закономерность.

Стоит отметить, о чём свидетельствует релиз Ming — помимо самого себя. Ant Group опубликовала дизайн-модель на 6,15 млрд параметров под лицензией MIT без анонса, вместе со второй моделью для декомпозиции слоёв под той же лицензией. Alibaba опубликовала закрытую облачную модель без лицензии, без карточки и без отчёта, нацеленную на тот же класс задач, и назначила цену за изображение.

Это две разные ставки на то, где находится ценность в дизайн-моделях. Одна гласит: модель — это продукт, а веса — канал распространения. Другая гласит: модель — это сервис, а веса — то, что вы оставляете у себя. Обе ставки могут быть верны на одном и том же рынке, и они дают очень разные ответы на единственный вопрос, который имеет значение на этапе оценки: могу ли я выяснить, как это работает, прежде чем начать от этого зависеть?

• Если вам нужно знать, как отображается текст и почему иногда это не так, — Ming-Image-0.1-Design — единственный из двух, который позволяет посмотреть, а лицензия MIT означает, что вы можете действовать, исходя из того, что обнаружите.

• Если вам сегодня нужен продакшн-эндпоинт с ценой за изображение и без собственной инфраструктуры — Qwen-Image 3.0 — единственный из двух, кто его предлагает, и его внутреннее устройство входит в цену.

• Если вам нужно независимое подтверждение, прежде чем принять решение, — ни у одного из них его недостаточно. У одного есть единственная невоспроизведённая позиция в таблице лидеров; у другого — лист заявлений вендора, к которому не приложено ни одной цифры.

За чем стоит следить — это за тем, сохранится ли закономерность. Необъявленный релиз под лицензией MIT с глифовым энкодером в нём — это заявление о том, как его авторы ожидают использования модели: её будут изучать, запускать локально, модифицировать. Если следующий релиз от той же команды будет анонсирован, протестирован на бенчмарках и размещён на хостинге, значит, это был единичный случай. Если же это будет ещё один тихий репозиторий, то в категории дизайн-моделей появится второй открытый конкурент, и у закрытой половины рынка возникнет ценовая проблема, которой у неё не было в июле.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube