Карточка заголовка главной секции для GPT-Image-2 против Flux 3: заголовок «GPT-Image-2 против Flux 3» с подзаголовком «Одна работающая модель, одна дорожная карта», две карточки, показывающие GPT-Image-2 с бейджем «Публичный API с мая 2026 года» и Flux 3 с бейджем «Уровень изображений: скоро», логотип OrcaRouter в правом нижнем углу.
Guides & Insights

GPT-Image-2 против Flux 3: сравнение действующей модели с дорожной картой

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Это не обычный пост о сравнении моделей, потому что GPT-Image-2 и Flux 3 находятся на разных стадиях существования. GPT-Image-2, выпущенная 21 апреля 2026 года, доступна для вызовов через API Ope​nAI с начала мая, а на этой неделе приобрела новую возможность — генерацию изображений с прозрачным фоном в API, анонсированную 20 августа и доступную сейчас. Flux 3 — это мультимодальная базовая модель Black Forest Labs, анонсированная 23 июля 2026 года, и у её подсистемы изображений до сих пор нет публичной конечной точки, идентификатора модели и прайс-карты на момент написания. Одну из них можно вызвать в три часа ночи с действующим ключом; для другой можно записаться в лист ожидания. Поэтому полезное сравнение — не «что лучше», а то, что выпущенная модель реально делает сегодня, что дорожная карта обещает для невыпущенной, и как разработчику следует относиться к обещанной модели, сроки которой постоянно сдвигаются, пока живая продолжает улучшаться.

Один из них имеет конечную точку.

Начнём с доступности, потому что она определяет всё остальное. Black Forest Labs представила Flux 3 23 июля как единую модель, обученную совместно на предсказании изображений, видео, аудио и действий робота и построенную на основе подхода flow matching, который лаборатория называет Self-Flow. Как сообщается, более 95% вычислительных мощностей, затраченных на обучение, пришлось на предсказание видео, и результат этого виден в реально выпущенном продукте: общей доступности достиг лишь Flux 3 Video — 4 августа, с платным API. Страница модели для изображений до сих пор помечена «скоро» и содержит форму заявки, а не кнопку «Начать работу» — ни эндпоинта, ни документированных параметров, ни цены за изображение, ни бенчмарка, который можно запустить.

GPT-Image-2, напротив, находится в продакшене уже четыре месяца. Ope​nAI открыл доступ к API в начале мая, и идентификатор модели, gpt-image-2, достаточно стабилен, чтобы с ним сосуществовал закреплённый снапшот, gpt-image-2-2026-04-21. Это текущая модель номер один для генерации изображений из текста на обеих крупных независимых площадках — 1 381 Elo в text-to-image лидерборде Arena (средняя сборка) и 1 369 Elo для высокой сборки на Artificial Analysis — а также она рендерит многоязычный текст, включая CJK, привязывает генерацию к веб-поиску и выдаёт изображения разрешением до 4K. Четыре месяца продакшен-трафика — это разница между заявлением и послужным списком.

Недавнее изменение на стороне GPT-Image-2

Событие, которое делает это сравнение своевременным, не имеет отношения к Flux 3. 20 августа OpenAI открыла предварительный просмотр с прозрачным фоном для GPT-Image-2 в Images API: установите для параметра background значение "transparent", и конечная точка вернёт PNG или WebP с настоящим альфа-каналом, вырезанным и готовым к композитингу. Это функция, направленная прямо на ту производственную работу, которую также обещает в своей дорожной карте модель изображений Flux 3 — предметная съёмка, иконки, маркетинговые материалы, — и она появилась как параметр в уже работающей конечной точке, а не в составе новой модели. Так что, пока мир ждёт конечную точку изображений Flux 3, которая всё ещё говорит «скоро», действующий игрок только что закрыл один из недостатков, из-за которого его не использовали в пайплайнах композитинга.

Возможность доступна только через API — переключателя ChatGPT нет — и это параметр, а не новый продукт. Обе конечные точки Images API, генерация и редактирование, принимают поле background со значениями "transparent", "opaque" и "auto" (по умолчанию, когда модель решает сама). Альфа-канал сохраняется только в выводе PNG или WebP, поэтому запрос явно задаёт формат вывода. В справочнике API OpenAI поддержка прозрачности для gpt-image-2 и его снимка gpt-image-2-2026-04-21 по-прежнему помечена как «in preview» — это ярлык вендора, а не объявление о выходе из беты — и рекомендуется формулировать запрос без какого-либо описанного фона, чтобы модель действительно выполнила запрос на прозрачность. Ни новой конечной точки, ни нового ID модели, ни отдельного прайс-листа: тот же вызов gpt-image-2, который возвращал непрозрачный PNG, теперь возвращает вырезанное изображение.

Comparison scoreboard titled 'GPT-Image-2 vs Flux 3 - the scoreboard'. GPT-Image-2 column: Released Apr 21, 2026; Availability Public API since May; Arena T2I Elo 1,381 (#1); Text rendering multilingual incl. CJK; Transparent bg preview Aug 20; Max resolution 4K. Flux 3 column: Released announced Jul 23, 2026; Availability image tier coming soon; Arena T2I Elo none yet; Text rendering promised; Transparent bg not stated; Max resolution not specified. Footer: GPT-Image-2 figures per Arena and OpenAI list pricing; Flux 3 image claims are a vendor roadmap. OrcaRouter logo bottom-right.

Что обещает Flux 3, и что на самом деле поставляется

Уровень изображений Flux 3 в спецификации — это дорожная карта вендора, так что относитесь к ней соответственно. Black Forest Labs пообещала синтез и редактирование изображений в разных стилях и разрешениях, улучшенную обработку сложных промптов, высокоточный многоязычный рендеринг текста, перенос стиля zero-shot по референсным изображениям, консистентность персонажей и бренда без дообучения, а также недеструктивное редактирование, сохраняющее текстуру и освещение. Это правильные обещания — именно те функции, за которые конкурируют нынешние лидеры рынка, — но ни одна из них сегодня не проверяема, потому что ни у одной нет эндпоинта.

Что на самом деле доступно через BFL — это видеомодели и старая линейка изображений FLUX. Flux 3 Video стоит $0,17 за секунду в HD и $0,29 за секунду в FHD для полного рендеринга, плюс черновой режим по $0,06 за секунду. Заявленные самой BFL показатели — 1135 Elo для text-to-video и 1051 для image-to-video, а также победы по предпочтениям над Luma Ray 3.2, Runway Gen-4.5, Gro​k Imagine Video и Kling v3 Pro. Всё это заявлено производителем, не воспроизведено независимо и к линейке изображений в любом случае не относится. Что касается статичных изображений, текущее предложение BFL — это по-прежнему линейка FLUX.2, которая занимает 1226 Elo в том же рейтинге Artificial Analysis, где GPT-Image-2 лидирует с 1369 Elo. Этот разрыв и есть практический контекст фразы «Flux 3 image is coming»: сегодняшний API изображений BFL отстаёт от API Ope​nAI примерно на 140 Elo, и именно обещанная модель нужна BFL, чтобы закрыть этот разрыв.

Screenshot of the Artificial Analysis Text-to-Image leaderboard (captured August 20, 2026) showing GPT Image 2 (high) in first place at 1,369 Elo and Black Forest Labs' current image entry FLUX.2 (max) at 1,226 Elo, with no Flux 3 image entry present, in English.

Цены: существует только одна настоящая ценовая карточка.

Цены на изображения Flux 3 нет, потому что продукта Flux 3 для изображений не существует. Единственные опубликованные цифры — это тарифы GPT-Image-2: $5 за миллион входных текстовых токенов, $8 за миллион входных токенов изображений и $30 за миллион выходных токенов изображений, при этом Batch API стоит примерно вдвое дешевле при обработке до 24 часов. OpenAI не публикует количество токенов на изображение, поэтому цифры в пересчёте на одно изображение — это конверсия, а не расценки: примерно $0.006 за изображение 1024×1024 низкого качества, около $0.05 за среднее, около $0.21 за высокое качество и до примерно $0.41 за рендеринг 4K. Для сравнения: это та сторона баланса, которая реальна; колонка изображений Flux 3 — пустая ячейка.

Screenshot of the OrcaRouter model page for openai/gpt-image-2 (captured August 20, 2026), showing the model description, input rate of $8.00 and output rate of $30.00 per million tokens, median latency, and community usage, in English.

Что должен делать строитель с обещанной моделью

Разумная позиция, когда модель конкурента постоянно задерживается, — строить на том, что уже существует, и превращать будущее в изменение конфигурации, а не в перестройку архитектуры. GPT-Image-2 уже сегодня можно направлять через OrcaRouter — один API-ключ, цена Ope​nAI по прайс-листу без наценки, автоматическое переключение между провайдерами — поэтому конвейер генерации ассетов на этой модели сможет позже направить тот же endpoint на API Flux 3 image в тот день, когда endpoint действительно появится, и направлять на него часть трафика с помощью routing DSL, не трогая вызывающий код. Вы получаете выпущенную модель сейчас, а когда обещанная выйдет, вы оцениваете её по рабочему эталону, а не по пресс-релизу. Ожидание вам ничего не стоит; строить на пустоте, пока вы ждёте, стоит вам всего.

Вердикт намеренно однобок. Если вам нужна генерация изображений в этом квартале, GPT-Image-2 — очевидный выбор, и второй вопрос не возникает: это независимый номер один, он только что добавил в API вывод изображений с прозрачным фоном, а ещё у него публичный API и стабильная цена. Flux 3 image — повод следить за Black Forest Labs, а не повод приостанавливать проект. Следите за открытием раннего доступа и первыми независимыми бенчмарками; как только появится эндпоинт, сравнение из этого поста станет тестом, который вы действительно сможете запустить.