
GPT-Image-2.5 против LLaDA-Image: API за $30/млн токенов против бесплатной диффузионной модели с 6B параметров
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0455Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0247Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0247Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0157Интеллект82Кодинг
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2646Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1849Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1541Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1251Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0547Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0347Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2140Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Интеллект49Кодинг
Спросите, сколько должна стоить генерация изображений, — и две лаборатории в течение недели друг за другом построили два противоположных ответа. 8 сентября 2026 года OpenAI выпустила GPT-Image-2.5 — модель, стоящую за ChatGPT Images 2.5, продаваемую через API как GPT-Image-2.5 Flare и GPT-Image-2.5 Sunburst, — с токен-тарифом $8 за миллион входных токенов изображения и $30 за миллион выходных токенов изображения. Пятью днями ранее, 4 сентября, inclusionAI (поддерживаемая Ant Group лаборатория, создавшая языковое семейство LLaDA) тихо выпустила LLaDA-Image — генератор и редактор изображений на диффузионном трансформере с шестью миллиардами параметров, чьи веса можно скачать бесплатно. Одна из них — самая коммерчески мощная модель изображений, которую OpenAI когда-либо ставила за токен-счётчик; другая — попытка доказать, что сильную модель изображений можно построить по открытому рецепту обучения и раздать бесплатно. Сравнивать их — это скорее не очное соревнование, а выбор того, какому определению стоимости вы на самом деле платите.
Почти все цифры на стороне GPT-Image-2.5 предоставлены самим вендором, и ни одна из них пока не получила независимой проверки: OpenAI утверждает, что Flare снижает задержку до 50% по сравнению с GPT-Image-2, а сторонние тесты агентной компании Manus показали ускорение генерации в 2–4 раза. Однако по состоянию на 9 сентября 2026 года ни одна из моделей GPT-Image-2.5 не имеет записи в рейтингах изображений на Artificial Analysis. Ключевой показатель LLaDA-Image также пока не воспроизведён независимо — inclusionAI сообщает о 53,53 по английскому и 53,38 по китайскому в Qwen-Image-Bench, что на момент релиза было первым результатом среди моделей с открытыми весами, — а поскольку у модели нет размещённого API, она вообще не может появиться в рейтингах, основанных только на API. Обе стороны этого сравнения опираются на заявления собственных создателей, и это стоит помнить на протяжении всего дальнейшего текста.
Две модели, которые едва ли можно отнести к одной категории.
GPT-Image-2.5 — это размещаемая закрытая модель генерации изображений, относящаяся к той же линейке, что и ChatGPT Images 2.0 от апреля 2026 года. Она мультимодальна на входе и создаёт изображения, которые, по утверждению OpenAI, отличаются более высокой чёткостью в мелких деталях, более естественным освещением и текстурой, а также большей стабильностью при многошаговом редактировании. Эндпоинт Sunburst существует специально для производственных задач с интенсивным редактированием, где допустима более медленная генерация в обмен на более точный контроль инструкций, тогда как Flare — это быстрый вариант по умолчанию для массовой генерации. Результаты могут иметь разрешение до 2048×2048 и 3840×2160, поддерживаются прозрачные фоны, а каждый результат содержит метаданные происхождения C2PA и невидимый водяной знак.
LLaDA-Image — это открытый релиз в исследовательском стиле, основанный на совершенно другой ставке. Тогда как GPT-Image-2.5 работает на инфраструктуре OpenAI, LLaDA-Image — это набор весов, которые вы запускаете сами: генеративная сторона — диффузионный трансформер (DiT) с 6 миллиардами параметров — согласно карточке модели, с учётом языковой стороны получается около 7 миллиардов параметров, — а в паре с ним идёт LLaDA 2.0-mini, диффузионная языковая модель со смесью экспертов (16B всего / 1B активных), которая выступает «понимающей» стороной и превращает текстовые запросы или инструкции по редактированию в сигнал, которому следует DiT. Необычное утверждение в статье на arXiv (2609.03796) касается рецепта обучения: более 90% из примерно 220 миллионов совокупных примеров предварительного и промежуточного обучения — это только изображения, при этом замороженная визуально-языковая модель извлекает семантику из немаркированных изображений как сигнал самокондиционирования, так что модель «сначала учится рисовать, а затем подчиняться». Прогрессивное разрешение ведёт обучение от 256×256 через 512×512 к тонкой настройке на 1024×1024, за которой следует смешанное обучение генерации и редактированию по тексту, а также дистилляция TwinFlow за несколько шагов, дающая вариант LLaDA-Image-Turbo.
В чём каждый из них на самом деле хорош
Основное преимущество GPT-Image-2.5 — это точность и контроль на коммерческом уровне качества. В анонсе OpenAI подчёркивается достоверность воспроизведения референса — сохранение узнаваемости человека, питомца или продукта при изменении окружения или стиля — а также редактирование, которое меняет только то, что вы просили изменить, и сохраняет это качество на протяжении множества раундов правок в одном диалоге. Отдельно отмечается рендеринг текста внутри изображений, включая устранение искажённых китайских иероглифов, которые донимали более ранние модели генерации изображений. Именно эти возможности требуются продуктовой, брендовой или рекламной команде снова и снова.
Концепция LLaDA-Image — это единый набор весов, который обеспечивает двуязычную генерацию и редактирование по инструкциям с открытым рецептом. В inclusionAI сообщают о нативном воспроизведении текста на китайском и английском, о конвейере редактирования, который внедряет референсные изображения через двухканальную схему, призванную сохранять неизменённый контент, а также — на Qwen-Image-Bench — о лучших на момент релиза результатах среди моделей с открытыми весами. Честные оговорки из релиза таковы: воспринимаемое качество редактирования всё ещё уступает специализированным редакторам, а подсчёт объектов остаётся слабым. Это универсальная открытая модель, а не готовый коммерческий продукт.

Табло намеренно не является соревнованием по качеству изображения — две модели никогда не проходили одну и ту же оценку. Оно показывает, куда направляются деньги и контроль.
Цена одного изображения — это число, которое не назовёт вам ни одна из сторон.
OpenAI публикует тарифную карту токенов для GPT-Image-2.5, идентичную той, что у GPT-Image-2: $8 за миллион входных токенов изображений, $30 за миллион выходных токенов изображений, кэшированный ввод изображений по $2, а текстовые токены тарифицируются отдельно по $5 за миллион. Чего она не публикует, так это сколько токенов потребляет конкретное изображение, а значит, нет ни официальной цены за изображение, ни калькулятора стоимости. При указанной AA цене на предшественника в его лидерборде — примерно $211 за 1000 изображений для GPT Image 2 в «высоком» качестве — флагман с тарификацией по токенам обходится дорого при больших объёмах, но эта цифра относится к GPT-Image-2, а не к 2.5, и стоимость одного изображения для новой модели по-настоящему неизвестна за пределами OpenAI.
LLaDA-Image сталкивается с противоположной проблемой честности. Веса ничего не стоят, а на карточке модели стоит метка Apache-2.0, но настоящая цена — это инфраструктура: диффузионному трансформеру на 6B параметров для базового варианта с 50 шагами нужен серьёзный GPU, а контрольные точки FP8 (около 49 ГБ в раскладке diffusers) — практичный выбор для большинства пользователей. Дистилляция LLaDA-Image-Turbo с 2–4 шагами — это уступка данной реальности. Инструменты сообщества развиваются быстро: pull request в SGLang добавляет генерацию изображений по тексту, редактирование, поддержку sequence-parallel и FP8, а пакет узлов ComfyUI от RebelAI поддерживает локальный вывод с INT8- и GGUF-квантизацией — но «бесплатная модель» по-прежнему означает «вы и есть хостинг-провайдер». Для команды, у которой уже есть мощности GPU, предельные издержки LLaDA-Image стремятся к нулю; для всех остальных полная стоимость её обслуживания может превысить счета за API с оплатой по факту, если учесть инженерное время.
Честный путь, если вы хотите и то, и другое.
Для большинства команд это не вопрос «или — или». Продакшен-пайплайн может использовать управляемый API вроде GPT-Image-2.5 для клиентских задач с интенсивным редактированием и высокими требованиями к надёжности, а открытую модель вроде LLaDA-Image — для экспериментов, офлайн-пакетных заданий и любых сценариев, в которых нельзя отправлять промпты стороннему сервису. Такое разделение — ровно тот тип задачи, для которого и создан слой маршрутизации: один API обращается к управляемым моделям, которые вы действительно используете, и передаёт цену провайдера по прайс-листу без наценки, так что позже попробовать модель с открытыми весами через облачный маршрут будет стоить столько же, сколько и прямое обращение к провайдеру. По состоянию на 9 сентября 2026 года ни одна из этих моделей не числится в каталоге OrcaRouter: для GPT-Image-2.5 сейчас доступен только OpenAI API (предыдущее поколение, GPT-Image-2, маршрутизируется), а LLaDA-Image существует только в виде весов, без размещённого инференса. Этот архитектурный замысел остаётся в силе независимо от сегодняшнего наполнения каталога.

На чём вам следует строить?
Если ваша работа — коммерческая генерация изображений, где неудачная правка стоит отношений с клиентом (предметные снимки, креативы для кампаний, изображения, консистентные с референсами, длительные многоэтапные сессии редактирования), то GPT-Image-2.5 — это модель, чья конструкция целиком заточена под такую задачу, а эндпоинт Sunburst — причина обратить на неё внимание ещё до появления независимых оценок. Риски — непрозрачность цены за изображение и то, что все заявления о качестве исходят от самой OpenAI. Если ваша работа — исследования, эксперименты с большими объёмами, китайско-английская двуязычная генерация или что-то, что должно работать в вашем собственном окружении и на ваших данных, то LLaDA-Image — более интересный релиз: по-настоящему открытые веса с опубликованной методикой, ценой чему — собственная инфраструктура и жизнь с невоспроизведёнными показателями. Модели вышли с разницей в неделю, но пропасть между ними — в операционной модели; правильный выбор — тот, который соответствует затратам, которые вы реально можете оплатить.

