
Ming-Image-0.1-Design против Qwen-Image 3.0: кто покажет вам, как рисуется текст
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Самое интересное в Ming-Image-0.1-Design — не на его карточке модели. Оно — в коммите к фреймворку для инференса. Примерно во время тихой загрузки модели на Hugging Face 17 сентября 2026 года vLLM-Omni влил изменение под названием feat: добавить поддержку byte5 для Ming, которое подключает глифовый энкодер ByT5 к новому ming_flash_omni пайплайну — выделенному компоненту, вся задача которого — смотреть на символы, которые вы попросили отрисовать, а не на картинку, которую вы попросили. Это та деталь, которую можно найти, только читая код, и именно та деталь, которую Qwen-Image 3.0 — закрытая хостируемая модель генерации изображений от вендора, выпущенная 21 июля 2026 года и ставшая общедоступной 5 августа, — вообще не позволяет никому прочитать. Обе модели нацелены на дизайнерскую работу, где разборчивый шрифт — самое сложное. Только одна из них расскажет вам, как она это делает.
Что каждый из них говорит о тексте
История с рендерингом текста у Qwen-Image 3.0 — это целиком заявление, сделанное при запуске, и на бумаге оно выглядит убедительно. В материалах Alibaba описываются промпты длиной примерно до 4500 токенов, разборчивый текст вплоть примерно до 10 пикселей, поддержка 12 языков и более 20 шрифтов, вывод размером до 2048×2048 и до шести изображений за один вызов, доступные в редакциях Pro и Standard через один размещённый API. Нет выпуска весов, не указана лицензия, нет карточки модели, нет технического отчёта и нет опубликованной таблицы бенчмарков, по которой можно было бы всё это проверить. Широко повторяемая цифра примерно 20 млрд параметров MMDiT сообщается, а не подтверждается.
История Ming-Image-0.1-Design — это репозиторий. 6 154 901 056 параметров, лицензия MIT, diffusers — это тег пайплайна, все веса в BF16 safetensors, примерно 71,5 ГБ в каталогах connector/, mllm/, mlp/, scheduler/, transformer/ и vae/. Рекомендуемый вывод — 2048×2048 при 12 шагах сэмплирования с guidance 1.0 на одном графическом процессоре CUDA с 80 ГиБ, или 1024 для скорости; для развёртывания указан vLLM-Omni, а для улучшения промпта — отдельная визуально-языковая модель. В карточке он описывается как модель текст-в-изображение для UI, инфографики, плакатов и другого визуального дизайна с большим объёмом текста, с выводом RGBA для прозрачного фона.
Эти два абзаца — не утверждения одного типа, и стоит прямо сказать, почему. Один — это описание продукта, написанное теми, кто его продаёт. Другой — описание артефакта, который любой может скачать и проверить.
Кодировщик глифов — это часть, которая объясняет категорию.
Отрисовка текста в моделях изображений обычно даёт сбой вполне определённым образом: модель генерирует нечто похожее на письменность, не являясь письменностью. Формы букв правдоподобны, а слово — неправильное. Причина прежде всего архитектурная — у большинства моделей изображений нет компонента, который воспринимает символы как символы, поэтому шрифт реконструируется по визуальной статистике так же, как трава.
Коммит vLLM-Omni интересен именно тем, что указывает на это. Добавленные файлы — byte5_encoder.py, pipeline_ming.py, t5_block_mapper.py и обработчик входных данных стадии — описывают путь, в котором байтовый энкодер ByT5 читает текст, который должен появиться на изображении, словарь токенизатора расширяется маркерами шрифта и цвета, а полученные признаки добавляются вдоль размерности последовательности, причём отрицательная сторона получает нули. Эта последняя деталь — признак того, что это настоящее проектное решение, а не просто техническая обвязка: если бы отрицательная ветвь несла те же глифовые признаки, guidance без классификатора смещался бы к отрисовке текста и уходил бы от промпта, поэтому нули существуют, чтобы две цели не боролись друг с другом. Энкодер загружается только тогда, когда контрольная точка действительно содержит byte5/ подпапку.
Две оговорки ради честности. Это коммит в сторонний фреймворк для инференса, а не заявление Ant Group, и трактовка того, что означают эти файлы, наша, а не вендора. И это подтверждает проектный замысел, а не результат: наличие кодировщика глифов согласуется с хорошим рендерингом текста, но не доказывает, что рендеринг текста хорош. Единственное независимое свидетельство качества — всего одна позиция в таблице лидеров, о которой говорится ниже.

Контраст с Qwen-Image 3.0 не в том, что модель Alibaba плохо отрисовывает текст, — никто за пределами Alibaba не может сказать, насколько хорошо она отрисовывает текст, и в этом-то и суть. Дело в том, что на вопрос «как эта модель рисует буквы» для одной из этих моделей есть ответ, а для другой — маркетинговое утверждение, и разрыв между ответом и утверждением — это то место, где принимаются инженерные решения.
То самое число, и доска, на которой его нет
Ming-Image-0.1-Design занимает первое место в Artificial Analysis Text to Image Leaderboard for UI/UX Design, в представлении открытых весов, с рейтингом Elo 1 082 — опережая Ideogram 4.0 (Quality) с 1 052, Ideogram 4.0 с 1 015, HunyuanImage 3.0 Instruct с 1 005, FLUX.2 [dev] с 1 000, FLUX.2 [dev] Flash с 999 и FLUX.2 [dev] Turbo с 994. Копия этой таблицы — та, что воспроизведена на собственной карточке модели, и на ней присутствует брендинг Artificial Analysis; никто независимо не воспроизводил этот результат.
![The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.](https://cms.orcarouter.ai/api/media/file/3-1124.png)
Это рейтинг открытых весов, поэтому Qwen-Image 3.0 в нём не участвует, и его отсутствие ничего не говорит о качестве. Оно говорит о структурной особенности: рейтинг слепых предпочтений может ранжировать только те модели, чьи веса открыты. Это даёт открытому релизу измеримую позицию за месяцы до появления продукта, а закрытому релизу — маркетинговую цифру и ничего больше. За заявлениями Qwen-Image 3.0 — читаемость 10-пиксельного текста, промпты на 4 500 токенов, более 20 шрифтов — вообще нет независимых измерений.

Как бы вы на самом деле это проверили и сколько стоит попробовать
Если разборчивый шрифт — это то, ради чего вы это читаете, то тест — не таблица лидеров. Это ваш собственный шрифт, ваш собственный язык и ваши собственные строки, прогнанные через оба кандидата и прочитанные человеком. Такой тест требует, чтобы одна из этих моделей была доступна и дёшева, а другая — могла быть скачана, и цены на них строятся на противоположных принципах.
• Qwen-Image 3.0 — около $0,04 за изображение в редакции Pro и около $0,03 в Standard, при этом цены для местных потребителей начинаются примерно с ¥0,18 за изображение. Это стартовые цифры, и они не проходили аудит. Вы можете запустить матрицу промптов уже сегодня днём и платить за каждый вызов.
• Ming-Image-0.1-Design — опубликованной цены нет, потому что нет хостинговой конечной точки. Затраты — это загрузка объёмом 71,5 ГБ, карта на 80 GiB и ваше собственное время, а преимущество в том, что вы можете направить тот же тест на путь кодировщика глифов и увидеть, действительно ли работу выполняет именно этот компонент.
Именно для такой ситуации и создаётся слой маршрутизации, и стоит точно определить, какая его часть здесь применима. Ни Qwen-Image 3.0, ни Ming-Image-0.1-Design нет на нашей платформе, поэтому слой маршрутизации сегодня не может открыть доступ к ним по ключу. Но он может сохранить честность сравнения, пока вы его проводите: OrcaRouter объединяет более 200 моделей за одним OpenAI-совместимым эндпоинтом по прайсовой цене провайдеров без наценки, с автоматическим переключением между провайдерами при сбоях, так что модель, которой вы уже доверяете, может удерживать продакшн-путь — и её стоимость остаётся привязанной к прайсовой цене провайдера, поэтому изменение тарифа у вендора отражается на нашей стороне в тот же день — а неизмеренная дизайн-модель оценивается рядом с ней, а не впереди неё.
Два открытых релиза, один закрытый — и закономерность.
Стоит отметить, о чём свидетельствует релиз Ming — помимо самого себя. Ant Group опубликовала дизайн-модель на 6,15 млрд параметров под лицензией MIT без анонса, вместе со второй моделью для декомпозиции слоёв под той же лицензией. Alibaba опубликовала закрытую облачную модель без лицензии, без карточки и без отчёта, нацеленную на тот же класс задач, и назначила цену за изображение.
Это две разные ставки на то, где находится ценность в дизайн-моделях. Одна гласит: модель — это продукт, а веса — канал распространения. Другая гласит: модель — это сервис, а веса — то, что вы оставляете у себя. Обе ставки могут быть верны на одном и том же рынке, и они дают очень разные ответы на единственный вопрос, который имеет значение на этапе оценки: могу ли я выяснить, как это работает, прежде чем начать от этого зависеть?
• Если вам нужно знать, как отображается текст и почему иногда это не так, — Ming-Image-0.1-Design — единственный из двух, который позволяет посмотреть, а лицензия MIT означает, что вы можете действовать, исходя из того, что обнаружите.
• Если вам сегодня нужен продакшн-эндпоинт с ценой за изображение и без собственной инфраструктуры — Qwen-Image 3.0 — единственный из двух, кто его предлагает, и его внутреннее устройство входит в цену.
• Если вам нужно независимое подтверждение, прежде чем принять решение, — ни у одного из них его недостаточно. У одного есть единственная невоспроизведённая позиция в таблице лидеров; у другого — лист заявлений вендора, к которому не приложено ни одной цифры.
За чем стоит следить — это за тем, сохранится ли закономерность. Необъявленный релиз под лицензией MIT с глифовым энкодером в нём — это заявление о том, как его авторы ожидают использования модели: её будут изучать, запускать локально, модифицировать. Если следующий релиз от той же команды будет анонсирован, протестирован на бенчмарках и размещён на хостинге, значит, это был единичный случай. Если же это будет ещё один тихий репозиторий, то в категории дизайн-моделей появится второй открытый конкурент, и у закрытой половины рынка возникнет ценовая проблема, которой у неё не было в июле.
