Hero-карточка с заголовком для сравнения «GPT-Image-2.5 против LLaDA-Image» с подзаголовком «API по цене $30 за миллион токенов против бесплатной диффузионной модели на 6B параметров»: слева скруглённая карточка с надписью «GPT-Image-2.5 · ЗАКРЫТЫЙ ФЛАГМАНСКИЙ API — тарификация по токенам, облачный хостинг», справа скруглённая карточка с надписью «LLaDA-Image · ОТКРЫТЫЕ ВЕСА — самостоятельный хостинг, лицензия Apache-2.0», соединённые значком весов; логотип OrcaRouter — в правом нижнем углу.
Guides & Insights

GPT-Image-2.5 против LLaDA-Image: API за $30/млн токенов против бесплатной диффузионной модели с 6B параметров

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Спросите, сколько должна стоить генерация изображений, — и две лаборатории в течение недели друг за другом построили два противоположных ответа. 8 сентября 2026 года OpenAI выпустила GPT-Image-2.5 — модель, стоящую за ChatGPT Images 2.5, продаваемую через API как GPT-Image-2.5 Flare и GPT-Image-2.5 Sunburst, — с токен-тарифом $8 за миллион входных токенов изображения и $30 за миллион выходных токенов изображения. Пятью днями ранее, 4 сентября, inclusionAI (поддерживаемая Ant Group лаборатория, создавшая языковое семейство LLaDA) тихо выпустила LLaDA-Image — генератор и редактор изображений на диффузионном трансформере с шестью миллиардами параметров, чьи веса можно скачать бесплатно. Одна из них — самая коммерчески мощная модель изображений, которую OpenAI когда-либо ставила за токен-счётчик; другая — попытка доказать, что сильную модель изображений можно построить по открытому рецепту обучения и раздать бесплатно. Сравнивать их — это скорее не очное соревнование, а выбор того, какому определению стоимости вы на самом деле платите.

Почти все цифры на стороне GPT-Image-2.5 предоставлены самим вендором, и ни одна из них пока не получила независимой проверки: OpenAI утверждает, что Flare снижает задержку до 50% по сравнению с GPT-Image-2, а сторонние тесты агентной компании Manus показали ускорение генерации в 2–4 раза. Однако по состоянию на 9 сентября 2026 года ни одна из моделей GPT-Image-2.5 не имеет записи в рейтингах изображений на Artificial Analysis. Ключевой показатель LLaDA-Image также пока не воспроизведён независимо — inclusionAI сообщает о 53,53 по английскому и 53,38 по китайскому в Qwen-Image-Bench, что на момент релиза было первым результатом среди моделей с открытыми весами, — а поскольку у модели нет размещённого API, она вообще не может появиться в рейтингах, основанных только на API. Обе стороны этого сравнения опираются на заявления собственных создателей, и это стоит помнить на протяжении всего дальнейшего текста.

Две модели, которые едва ли можно отнести к одной категории.

GPT-Image-2.5 — это размещаемая закрытая модель генерации изображений, относящаяся к той же линейке, что и ChatGPT Images 2.0 от апреля 2026 года. Она мультимодальна на входе и создаёт изображения, которые, по утверждению OpenAI, отличаются более высокой чёткостью в мелких деталях, более естественным освещением и текстурой, а также большей стабильностью при многошаговом редактировании. Эндпоинт Sunburst существует специально для производственных задач с интенсивным редактированием, где допустима более медленная генерация в обмен на более точный контроль инструкций, тогда как Flare — это быстрый вариант по умолчанию для массовой генерации. Результаты могут иметь разрешение до 2048×2048 и 3840×2160, поддерживаются прозрачные фоны, а каждый результат содержит метаданные происхождения C2PA и невидимый водяной знак.

LLaDA-Image — это открытый релиз в исследовательском стиле, основанный на совершенно другой ставке. Тогда как GPT-Image-2.5 работает на инфраструктуре OpenAI, LLaDA-Image — это набор весов, которые вы запускаете сами: генеративная сторона — диффузионный трансформер (DiT) с 6 миллиардами параметров — согласно карточке модели, с учётом языковой стороны получается около 7 миллиардов параметров, — а в паре с ним идёт LLaDA 2.0-mini, диффузионная языковая модель со смесью экспертов (16B всего / 1B активных), которая выступает «понимающей» стороной и превращает текстовые запросы или инструкции по редактированию в сигнал, которому следует DiT. Необычное утверждение в статье на arXiv (2609.03796) касается рецепта обучения: более 90% из примерно 220 миллионов совокупных примеров предварительного и промежуточного обучения — это только изображения, при этом замороженная визуально-языковая модель извлекает семантику из немаркированных изображений как сигнал самокондиционирования, так что модель «сначала учится рисовать, а затем подчиняться». Прогрессивное разрешение ведёт обучение от 256×256 через 512×512 к тонкой настройке на 1024×1024, за которой следует смешанное обучение генерации и редактированию по тексту, а также дистилляция TwinFlow за несколько шагов, дающая вариант LLaDA-Image-Turbo.

В чём каждый из них на самом деле хорош

Основное преимущество GPT-Image-2.5 — это точность и контроль на коммерческом уровне качества. В анонсе OpenAI подчёркивается достоверность воспроизведения референса — сохранение узнаваемости человека, питомца или продукта при изменении окружения или стиля — а также редактирование, которое меняет только то, что вы просили изменить, и сохраняет это качество на протяжении множества раундов правок в одном диалоге. Отдельно отмечается рендеринг текста внутри изображений, включая устранение искажённых китайских иероглифов, которые донимали более ранние модели генерации изображений. Именно эти возможности требуются продуктовой, брендовой или рекламной команде снова и снова.

Концепция LLaDA-Image — это единый набор весов, который обеспечивает двуязычную генерацию и редактирование по инструкциям с открытым рецептом. В inclusionAI сообщают о нативном воспроизведении текста на китайском и английском, о конвейере редактирования, который внедряет референсные изображения через двухканальную схему, призванную сохранять неизменённый контент, а также — на Qwen-Image-Bench — о лучших на момент релиза результатах среди моделей с открытыми весами. Честные оговорки из релиза таковы: воспринимаемое качество редактирования всё ещё уступает специализированным редакторам, а подсчёт объектов остаётся слабым. Это универсальная открытая модель, а не готовый коммерческий продукт.

A two-column comparison scoreboard for 'GPT-Image-2.5 vs LLaDA-Image': GPT-Image-2.5 rows read Access closed API (Flare + Sunburst) / Price $8 in · $30 out per M tokens / Quality evidence OpenAI-reported, no AA entry yet / Editing multi-turn, Sunburst precision / Max resolution 3840x2160 / Serving hosted, Flare faster; LLaDA-Image rows read Access open weights (Apache-2.0 card) / Price $0 weights, you run it / Quality evidence Qwen-Image-Bench 53.53 EN · 53.38 ZH / Editing native instruction editing / Max resolution 1024x1024 / Serving self-host, Base or Turbo; footer 'Both vendor-reported as of Sept 9 2026; no shared benchmark.'; the OrcaRouter logo is bottom-right.

Табло намеренно не является соревнованием по качеству изображения — две модели никогда не проходили одну и ту же оценку. Оно показывает, куда направляются деньги и контроль.

Цена одного изображения — это число, которое не назовёт вам ни одна из сторон.

OpenAI публикует тарифную карту токенов для GPT-Image-2.5, идентичную той, что у GPT-Image-2: $8 за миллион входных токенов изображений, $30 за миллион выходных токенов изображений, кэшированный ввод изображений по $2, а текстовые токены тарифицируются отдельно по $5 за миллион. Чего она не публикует, так это сколько токенов потребляет конкретное изображение, а значит, нет ни официальной цены за изображение, ни калькулятора стоимости. При указанной AA цене на предшественника в его лидерборде — примерно $211 за 1000 изображений для GPT Image 2 в «высоком» качестве — флагман с тарификацией по токенам обходится дорого при больших объёмах, но эта цифра относится к GPT-Image-2, а не к 2.5, и стоимость одного изображения для новой модели по-настоящему неизвестна за пределами OpenAI.

LLaDA-Image сталкивается с противоположной проблемой честности. Веса ничего не стоят, а на карточке модели стоит метка Apache-2.0, но настоящая цена — это инфраструктура: диффузионному трансформеру на 6B параметров для базового варианта с 50 шагами нужен серьёзный GPU, а контрольные точки FP8 (около 49 ГБ в раскладке diffusers) — практичный выбор для большинства пользователей. Дистилляция LLaDA-Image-Turbo с 2–4 шагами — это уступка данной реальности. Инструменты сообщества развиваются быстро: pull request в SGLang добавляет генерацию изображений по тексту, редактирование, поддержку sequence-parallel и FP8, а пакет узлов ComfyUI от RebelAI поддерживает локальный вывод с INT8- и GGUF-квантизацией — но «бесплатная модель» по-прежнему означает «вы и есть хостинг-провайдер». Для команды, у которой уже есть мощности GPU, предельные издержки LLaDA-Image стремятся к нулю; для всех остальных полная стоимость её обслуживания может превысить счета за API с оплатой по факту, если учесть инженерное время.

Честный путь, если вы хотите и то, и другое.

Для большинства команд это не вопрос «или — или». Продакшен-пайплайн может использовать управляемый API вроде GPT-Image-2.5 для клиентских задач с интенсивным редактированием и высокими требованиями к надёжности, а открытую модель вроде LLaDA-Image — для экспериментов, офлайн-пакетных заданий и любых сценариев, в которых нельзя отправлять промпты стороннему сервису. Такое разделение — ровно тот тип задачи, для которого и создан слой маршрутизации: один API обращается к управляемым моделям, которые вы действительно используете, и передаёт цену провайдера по прайс-листу без наценки, так что позже попробовать модель с открытыми весами через облачный маршрут будет стоить столько же, сколько и прямое обращение к провайдеру. По состоянию на 9 сентября 2026 года ни одна из этих моделей не числится в каталоге OrcaRouter: для GPT-Image-2.5 сейчас доступен только OpenAI API (предыдущее поколение, GPT-Image-2, маршрутизируется), а LLaDA-Image существует только в виде весов, без размещённого инференса. Этот архитектурный замысел остаётся в силе независимо от сегодняшнего наполнения каталога.

Screenshot of the Artificial Analysis text-to-image leaderboard captured September 9 2026: GPT Image 2 (high) is ranked first at Elo 1,178, followed by MAI-Image-2.6, Reve 2.1, Nano Banana 2 (Gemini 3.1 Flash Image) and Meta Muse Image; GPT-Image-2.5 has no entry on the board yet.

На чём вам следует строить?

Если ваша работа — коммерческая генерация изображений, где неудачная правка стоит отношений с клиентом (предметные снимки, креативы для кампаний, изображения, консистентные с референсами, длительные многоэтапные сессии редактирования), то GPT-Image-2.5 — это модель, чья конструкция целиком заточена под такую задачу, а эндпоинт Sunburst — причина обратить на неё внимание ещё до появления независимых оценок. Риски — непрозрачность цены за изображение и то, что все заявления о качестве исходят от самой OpenAI. Если ваша работа — исследования, эксперименты с большими объёмами, китайско-английская двуязычная генерация или что-то, что должно работать в вашем собственном окружении и на ваших данных, то LLaDA-Image — более интересный релиз: по-настоящему открытые веса с опубликованной методикой, ценой чему — собственная инфраструктура и жизнь с невоспроизведёнными показателями. Модели вышли с разницей в неделю, но пропасть между ними — в операционной модели; правильный выбор — тот, который соответствует затратам, которые вы реально можете оплатить.

Screenshot of the Hugging Face model page for inclusionAI/LLaDA-Image captured September 9 2026, showing the model header, the text-to-image and image-editing pipeline tags, the License: apache-2.0 tag, 'Model size 7B params', BF16, 57 likes, and the opening of the model card 'LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes'.