Главная карточка для сравнения Qwen-Image 2.1 — открытых весов, доступных для скачивания по исследовательской лицензии, и Meta Muse Image — агентной модели, доступной через собственный API Meta по фиксированной цене один цент за изображение
Guides & Insights

Qwen-Image 2.1 против Meta Muse Image: модель, которую можно вызвать, против модели, которую можно оставить себе

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Существует версия этого сравнения, посвящённая качеству изображения, и её пока нельзя написать — во всяком случае, честно. Qwen-Image 2.1, которую команда Qwen-Image опубликовала 20 сентября 2026 года, не имеет никаких независимых оценок. Meta Muse Image, выпущенная Meta Superintelligence Labs 7 июля 2026 года как первая собственная модель Meta для изображений, была измерена — она занимает третье место в рейтинге редактирования изображений Artificial Analysis с Elo около 1 105, входит в первую пятёрку по генерации изображений из текста и находится на границе Парето «качество — цена» при цене 10 долларов за тысячу изображений. Но более полезный вопрос об этих двух моделях не в том, какая из них лучше. А в том, что вам разрешено делать с каждой из них, и эти ответы почти идеально инвертированы.

Доступ и возможность проверки — это две разные вещи, и никто не предлагает и то, и другое.

Meta Muse Image — это тот, что можно вызвать. С августа 2026 года он доступен через собственный Model API от Meta по фиксированной цене $0,01 за изображение — примерно $10 за тысячу — через OpenAI-совместимый эндпоинт, что является реальным изменением по сравнению с тем, как модель описывалась при запуске в июле, когда у разработчиков вообще не было к ней доступа. Такая фиксированная ставка необычна в категории, где почти всё остальное тарифицируется в токенах, и она делает прогнозирование затрат тривиальным: тысяча изображений — это десять долларов, независимо от того, простые они или сложные.

Qwen-Image 2.1 — это тот, который можно оставить себе. Это скачиваемый набор весов — примерно 33 ГБ, распределённых между диффузионным трансформером, текстовым энкодером и VAE — опубликованный по лицензионному соглашению Qwen Research License Agreement от 20 сентября 2026 года, которое предоставляет права «ТОЛЬКО ДЛЯ НЕКОММЕРЧЕСКИХ ЦЕЛЕЙ» и требует отдельной лицензии для коммерческого использования. Хостингового эндпоинта нет. Единого тарифа нет. И ничего не скрыто: вы можете изучить архитектуру, прочитать системный промпт переписывания промптов, сравнить его, переопределить его и запустить всё это на собственном оборудовании.

Так что речь не о противостоянии качества качеству. Это противопоставление измеряемой, тарифицируемой, коммерчески лицензированной модели, которой вы не владеете, бесплатной, неизмеряемой, некоммерческой модели, которой вы владеете полностью. Очень немногие команды могут встать на любую из этих сторон, ничем не пожертвовав.

Почему Muse — не совсем диффузионная модель в обычном смысле

То, что делает Meta Muse Image необычной, — это то, что она не только генерирует. Она работает в цикле: может искать в интернете, писать и запускать код и проверять собственный вывод, прежде чем вернуть изображение. Это собственное описание Meta, и именно поэтому модель интересна, а не просто конкурентоспособна — именно на агентных этапах устраняется неоднозначность промпта и запрос вроде «сделай мне диаграмму по цифрам за этот год» можно выполнить, а не приблизительно воспроизвести.

Это также причина, по которой её поведение труднее поддаётся анализу. Обычная модель изображений — это функция от промпта к пикселям. Агентная модель обладает траекторией, и эту траекторию нельзя прочитать в карточке модели. Заявленные производителем показатели — 94% согласованности персонажа при нескольких изображениях, до 10 референсных изображений, вывод размером до 1600 пикселей по длинной стороне — описывают диапазон возможностей, а не цикл.

Qwen-Image 2.1 решает ту же проблему неоднозначности противоположным способом: явно и открыто. Вместе с моделью изображений в релиз входят две контрольные точки для переписывания промптов — Qwen/Qwen-Image-2.1-PE-T2I и Qwen/Qwen-Image-2.1-PE-I2I, каждая — дообученная Qwen3.5-VL 9B размером около 18,8 ГБ, — которые берут расплывчатую инструкцию и переписывают её в точное указание, прежде чем её увидит диффузионная модель. У варианта I2I всегда есть входное изображение, поэтому это всегда задача редактирования. И что критически важно, поведение переписывателя задаётся в system_prompt.txt, поставляемом в репозитории, а значит, шаг, определяющий, что означает ваш промпт, — это то, что вы можете прочитать и изменить.

Агентный цикл Meta и переписыватель промптов Alibaba — оба являются ответом на фразу «модель не знает, что вы имели в виду». Один — это сервис, который решает за вас. Другой — это файл, который вы можете редактировать.

Как выглядят числа, когда они есть только с одной стороны

Meta Muse Image присутствует в обеих таблицах Artificial Analysis по изображениям. Она занимает третье место в редактировании изображений с рейтингом Elo около 1 105, уступая MAI-Image-2.6 с 1 122 и GPT Image 2 (high) с 1 117, а также входит в топ-5 по генерации изображений из текста с рейтингом Elo около 1 116. При цене $10 за тысячу изображений она находится на границе Парето «качество — цена», а это выгодное место: не лучшая модель в таблице, но одна из немногих, где доплата даёт измеримо больше.

У Qwen-Image 2.1 нет ничего из этого. У неё есть пост в блоге вендора с графиком Qwen-Image-Bench, который не воспроизвёл ни один сторонний участник, и один отчёт о практическом тестировании — тестировщик с ранним доступом из программы Qwen Ambassador, который прогнал финальные веса через интерфейс ModelScope Studio и сообщил о примерно 10–15 секундах для генерации изображения по тексту и 18–23 секундах для редактирования, при этом согласованность по нескольким референсам начинает ухудшаться примерно с трёх входных изображений. Один обозреватель, никакого таймера, никакого набора промптов. Это полезный сигнал, и это не бенчмарк, и честный способ относиться к нему — как к намёку на то, где модель может оказаться, а не как к доказательству того, где она находится.

В чём Qwen-Image 2.1 действительно впереди, так это не в качестве, а в возможностях на уровне пикселей: нативный вывод 2K при 2048×2048 по умолчанию, 40 шагов инференса, семь предустановок соотношения сторон, до 10 референсных изображений, локальное редактирование с помощью круга, нарисованной аннотации или отдельной маски, а также генерация RGBA с редактированием прозрачного слоя и извлечением объекта из RGB-фотографий. Модель Meta ограничена 1600 пикселями, а о её поддержке прозрачности не сообщается. Если вам нужен настоящий альфа-канал из коробки, это решение уже принято за вас.

Two-column scoreboard for Qwen-Image 2.1 and Meta Muse Image: Qwen-Image 2.1 rows read Access open weights download, self-host / Licence research-only, non-commercial / Editing score none / Output 2048x2048 native with RGBA / Prompt handling inspectable rewrite checkpoint / Price your own GPU time; Meta Muse Image rows read Access Meta Model API, OpenAI-compatible / Licence commercial, via Meta / Editing score AA #3, Elo about 1,105 / Output up to 1600px / Prompt handling agentic loop, searches and self-reviews / Price flat $0.01 per image; footer reads 'Meta figures per Artificial Analysis; Qwen-Image 2.1 has no independent score yet.'

Фиксированная ставка — вот о чём стоит задуматься.

Плата в один цент за изображение — это решение о ценообразовании, а не техническое, и оно меняет то, для чего модель предназначена. Ценообразование изображений с оплатой по токенам наказывает сложность: длинная инструкция с несколькими референсными изображениями стоит дороже короткой, а значит, стоимость изображения привязана к тому, насколько сложным оно было. При фиксированной ставке эта привязка исчезает, и вместе с ней меняется рациональное поведение: вы перестаёте оптимизировать промпты по длине и начинаете использовать модель так, как она была задумана, — с агентным циклом и референсными изображениями, делающими свою работу.

Это также тот тип ценообразования, который может предложить только компания, обслуживающая собственную модель, и об этом стоит упомянуть, когда вы выбираете провайдера. OrcaRouter предоставляет более 200 моделей через одну конечную точку, совместимую с OpenAI, по каталожной цене провайдера без наценки, с автоматическим переключением при сбое между провайдерами и DSL маршрутизации, который объединяет несколько моделей в один вызов. Здесь важна именно сквозная передача цен: поскольку мы взимаем каталожную цену провайдера, а не завышенную, изменение цен у вендора — появление фиксированной ставки, снижение ставки за токены — вступает в силу на нашей стороне в тот же день, а не после ожидания контракта. Ни Meta Muse Image, ни Qwen-Image 2.1 не входят в число моделей, которые мы маршрутизируем сегодня, и эта статья не собирается подразумевать обратное; изображенческие модели, которые мы действительно обслуживаем, — это семейство GPT-Image от OpenAI, тарифные уровни Imagen 4 от Google и предпросмотры изображений Gemini, а также конечная точка изображений Grok Imagine от xAI.

Контраст, который имеет значение для этого сравнения, состоит в том, что у одной из этих двух моделей вообще есть цена. Meta Muse Image стоит $0,01 за изображение — цена опубликована, и API можно вызвать уже сегодня днём. Qwen-Image 2.1 обходится в 33 ГБ загрузки, GPU, который у вас уже есть, и юридическую проверку лицензии, которая разрешает только некоммерческое использование.

Где они случайно сходятся

Обе модели принимают до 10 референсных изображений. Это не столько совпадение, сколько отрасль, остановившаяся на одном ответе: десяти достаточно для листа персонажа, набора продуктов или пакета стилевых референсов, а сверх этого кондиционирование перестаёт помогать и начинает мешать. Meta публикует для своей модели показатель согласованности персонажа при работе с несколькими изображениями на уровне 94%; Alibaba не публикует ничего аналогичного, а единственный независимый отчёт о практическом тестировании позволяет предположить, что согласованность начинает ухудшаться примерно на третьем референсном изображении. Две модели, заявляющие один и тот же диапазон при совершенно разных стоящих за этим доказательствах, — это всё сравнение в миниатюре.

Они также сходятся в проблеме, которую не решил ни один из них: ни один не даёт вам и то, и другое. Meta Muse Image нельзя скачать, изучить или запустить на собственном оборудовании, а его агентный цикл по самой своей конструкции представляет собой чёрный ящик. Qwen-Image 2.1 нельзя продать, нельзя вызвать, и пока его нельзя ни с чем сопоставить. Если ваше ограничение — дедлайн, один из них можно использовать уже сегодня. Если ваше ограничение — проверка на соответствие требованиям или необходимость точно понимать, что именно делает ваш конвейер, то другой.

Screenshot of the Artificial Analysis image-editing leaderboard captured September 9 2026, showing Meta Muse Image ranked third at Elo 1,105 behind MAI-Image-2.6 and GPT Image 2 (high), listed at $10.0 per 1,000 images on the quality-versus-price Pareto frontier, with no Qwen-Image 2.1 entry on the boardScreenshot of the Qwen vendor blog page for Qwen-Image-2.1, captured in English, headlined 'Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation', dated 2026/09/20, with download links to GitHub, Hugging Face and ModelScope and the four headline improvements listed as compact and efficient, native transparency with unified creation and editing, versatile editing with up to 10 reference images, and realistic textures

Выбирай по тому, что тебе нужно сделать дальше, а не по тому, что лучше.

Если вам нужно выпустить генерацию изображений в этом квартале по коммерческой лицензии с измеримой моделью за ней, ответ — Meta Muse Image, и $0.01 за изображение — это цифра, которую можно заложить в бюджет. Если вам нужно понять модель изображений из конца в конец — маскирование внимания, переписыватель промптов, VAE, лицензию, — Qwen-Image 2.1 — единственная из двух, которая это позволяет, и её отделяет исследовательская лицензия от того, чтобы стать непригодной для всего остального. Ни один из вариантов не является компромиссом по качеству, потому что вопрос качества всё ещё открыт с одной стороны. Он закроется, когда достаточно людей публично запустят Qwen-Image 2.1, чтобы она попала в лидерборд, а тестировщиков раннего доступа попросили опубликовать результаты к 29 сентября. Вот когда это сравнение станет настоящим.