Титульная карточка для FLUX 3 Image против Bernini-Diffusers-v2, противопоставляя «FLUX 3 Image — запуск 1 октября 2026, $0,048 за изображение в 1K, на api.bfl.ai» и «Bernini-Diffusers-v2 — веса Apache-2.0, только самостоятельный хостинг, нет хостируемого API», и отмечая, что OrcaRouter не маршрутизирует ни один из них. Логотип OrcaRouter находится в правом нижнем углу.
Guides & Insights

FLUX 3 Image vs Bernini-Diffusers-v2: платный эндпоинт против скачиваемого репозитория

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

FLUX 3 Image и Bernini-Diffusers-v2 — обе являются моделями изображений, которые можно полностью получить уже сегодня, и ни одна из них не является продуктом, который можно арендовать. FLUX 3 Image стала доступна 1 октября 2026 года по адресу api.bfl.ai/v1/flux-3-image с опубликованным прайс-листом и без опубликованной оценки. Bernini-Diffusers-v2 появилась на Hugging Face 13 августа 2026 года под Apache-2.0 с опубликованными оценками и без возможности вызвать её иначе, кроме как на собственных GPU. Одна поставляется со счётом. Другая — с закреплённой версией Python.

Это расхождение — и есть всё сравнение, и стоит быть точным в этом, потому что обычная формулировка «хостинг против открытых весов» здесь не подходит. Bernini — не модель с открытыми весами, которую можно просто вставить в существующий стек инференса. Это двухэтапная система — планировщик Qwen2.5-VL-7B перед диффузионным декодером Wan2.2-T2V-A14B — и её выпуск v2 — это исправление расписания обучения, а не новый уровень возможностей. FLUX 3 Image — это единая конечная точка с необычно большим объёмом управляющей поверхности, прикрученной к ней: пространственная привязка, координатная сетка 0–1000 и редактирование в пределах рамок, где вы указываете, какие области сохраняются. Разные по форме вещи.

Что каждый из них на самом деле из себя представляет

• FLUX 3 Image — Black Forest Labs' image tier of its unified FLUX 3 family, released October 1, 2026. One HTTP POST to https://api.bfl.ai/v1/flux-3-image with an x-key header; only prompt is required. The call returns a polling URL, and a finished 4K render can take several minutes. Generated samples are downloadable for one hour.

• Bernini-Diffusers-v2 — стек «планировщик + рендерер» от ByteDance, выложенный на Hugging Face 13 августа 2026 года без сопроводительного анонса. Репозиторий помечен тегом image-text-to-video и зависит от diffusers. Перечисленные задачи: текст-в-изображение, изображение-в-изображение, текст-в-видео, видео-в-видео, референс-в-видео и референс-в-изображение. Хостингового инференса и прайс-листа нет — путь для начала работы — hf download и приложение Gradio.

• Разрыв в дистрибуции — FLUX 3 Image — это платный сервис с оплатой по мере использования, к которому вы обращаетесь. Bernini — это репозиторий, который вы развёртываете. Прежде чем вообще имеет смысл задаваться вопросом о качестве, учтите: для одного из них требуется GPU класса Hopper, а для другого — кредитная карта.

Именно в лицензировании эти двое расходятся сильнее всего

Bernini-Diffusers-v2 распространяется под лицензией Apache-2.0 на уровне репозитория. Для пайплайна, развёрнутого на собственных серверах, это имеет огромное значение: никакого счётчика за каждое изображение, никакого согласования коммерческого договора, никакой отчётности об использовании. Вы платите за электроэнергию и время работы планировщика, и предельная стоимость десятитысячного изображения такая же, как и первого.

FLUX 3 Image не распространяется с открытыми весами, и Black Forest Labs прямо заявляет, что это временно. Коммерческие веса доступны уже сегодня по договорной лицензии BFL, а о публичном релизе с открытыми весами говорится, что он состоится в течение следующих недель. Это обещание, у которого есть форма, но нет даты, и это самое важное на этой странице, что нужно перепроверить, а не принимать на веру. Если вы выбираете стек для работы с изображениями на следующие два года, вопрос лицензии, вероятно, перевешивает вопрос Elo — но только если вы готовы самостоятельно эксплуатировать двухэтапный видеонативный диффузионный стек.

Поверхность управления: ограничивающие рамки против улучшения промпта

Это та часть сравнения, которая действительно интересна, потому что две модели решают задачу «заставить это попасть точно туда» совершенно разными способами.

FLUX 3 Image принимает массив JSON, добавляемый к промпту. Координаты задаются в сетке 0–1000 по обеим осям, и каждый бокс записывается как [top, left, bottom, right]. Вы передаёте таблицу элементов, каждый с id, bbox и desc, плюс общая подпись, которая ссылается на эти id по имени. В собственном примере BFL идентификаторы выглядят как animal_1 и silhouette_1; подпись обращается к ним напрямую. Над вызовом генерации есть grounding, включённый по умолчанию, который выполняет веб-поиск и поиск изображений перед генерацией.

FLUX 3 Image затем расширяет ту же систему координат на редактирование. Вместо отправки маски вы отправляете набор операций, ограниченных боксами: Сохранить (исходный бокс в тот же бокс, источник — ref_image_0), Переместить (исходный бокс в новый целевой бокс), Новый (без источника, целевой бокс создаётся из описания — добавить, заменить или перекрасить) и Удалить (исходный бокс в пустой целевой бокс). Несколько операций можно указать в одном запросе.

Оговорка имеет значение. В документации BFL сказано, что пиксели за пределами отредактированных областей «обычно остаются идентичными». Обычно. Это утверждение о сохранности с оговоркой, встроенной в формулировку, — честный способ выпускать такое утверждение, а также причина проверять его на собственных кадрах, а не доверять демонстрации.

У Bernini нет эквивалентного пользовательского языка координат. Его редактирование с опорой на референс улучшилось в v2 из-за изменения в обучении — модуль-коннектор прогревается на протяжении тысяч шагов до начала совместного обучения — и ByteDance сообщает, что это изменение проявляется как улучшение редактирования с опорой на референс и производительности OpenS2V. Это исправление качества внутри существующей архитектуры, а не новый интерфейс управления. Если ваш рабочий процесс зависит от того, чтобы указывать модели, какой прямоугольник не трогать, на этот вопрос отвечает только один из этих двух вариантов.

Screenshot of Black Forest Labs' FLUX 3 Image model page, headed 'Maximum control over every pixel', showing the bounding-box and region-editing feature list for the October 1, 2026 image release

Что числа подтверждают, а что не подтверждают

На странице Bernini-Diffusers-v2 приведена таблица из семи метрик, сравнивающая v2 с v1, и все цифры в ней заявлены вендором. Направление изменений смешанное, и об этом стоит сказать прямо:

• Рост — OpenS2V 63.83 (с 62.30), VBench 84.46 (с 84.37), Bernini-rv2v 3.55 (с 3.48).

• Без изменений — EditVerse 8.02, без изменений, и Bernini-v2v 3.49, без изменений.

• Недоступен — OpenVE 3.96, начиная с 4.03.

На странице также утверждается, что v2 находится в первом эшелоне среди ведущих закрытых коммерческих моделей во внутренней слепой попарной арене с участием людей. Это невозможно проверить извне ByteDance, и это следует воспринимать как маркетинговое заявление, а не как измерение. Три реальных сдвига — это перечисленные выше, и они основаны на самоотчёте той же лаборатории в сравнении с её собственной v1.

У FLUX 3 Image пока вообще нет никаких числовых показателей. Таблица Artificial Analysis для преобразования текста в изображение и её таблица редактирования были проверены 1 октября и 2026-10-02, и в них нет строки FLUX 3 Image — записи BFL в этих таблицах заканчиваются на линейке FLUX.2, где FLUX.2 [max] находится на 1021 Elo в таблице генерации и 996 в таблице редактирования. FLUX.2 [dev] служит опорной точкой для обеих таблиц ровно на 1000. Так что честное утверждение о качестве FLUX 3 Image прямо сейчас таково: никто за пределами Black Forest Labs не опубликовал для него оценку, а ближайшая доступная точка отсчёта — предыдущее поколение.

Эта асимметрия — практическая ловушка в данном сравнении. Цифры Bernini получены самим вендором, но они существуют и указывают направление. У FLUX 3 Image таких цифр нет. Отсутствие — не провал: модели всего день, — но это значит, что единственное доказательство заявленных возможностей редактирования FLUX 3 Image сейчас исходит от компании, которая его продаёт.

Ценовая сторона, которая вовсе не симметрична

FLUX 3 Image тарифицируется за изображение по уровню разрешения, и в тарифной сетке поставщика указаны пять таких уровней:

• 768sq — $0.041 по прайс-листу, $0.0205 в период запуска.

• 1K (по умолчанию) — $0.048 по прайсу, $0.024 по акции.

• 1,5K — $0,07 по прайс-листу, $0,035 по акции.

• 2K — $0.10 по прайс-листу, $0.05 по акции.

• 4K — $0.607 по прайс-листу, $0.3035 по акции.

Screenshot of Black Forest Labs' pricing page captured October 2, 2026, showing the FLUX 3 Image tab and its per-image rates by resolution tier, from 768sq through 4K

Референсные изображения и длина промпта включены без дополнительной платы, а отклонённые, неудачные или отмодерированные запросы не тарифицируются — что здесь важнее, чем обычно, потому что вызов в 4K медленный, и соблазн отказаться от запроса вполне реален. Стартовые цены действуют с 15:00 UTC 1 октября по 15:00 UTC 8 октября. Скачок цены по прайс-листу с 2K до 4K — это множитель 6.07, что гораздо круче, чем соотношение количества пикселей, поэтому выбранный вами уровень разрешения — главное решение по стоимости во всём API.

Уровни привязаны к бюджету пикселей, а не к фиксированному кадру. Пример вывода BFL — 5456 × 3072, примерно 16,8 мегапикселя, по сравнению с UHD 2160p, у которого 8,3 мегапикселя — поэтому «4K» здесь обозначает бюджет, а размеры выходных данных округляются до значений, кратных 16, а фактическое значение возвращается как output_mp.

Цена Bernini — ноль за изображение и не ноль в час. Восемь GPU для последовательно-параллельного инференса, рекомендуется кремний класса Hopper, Python 3.11.2 с PyTorch 2.7.1 и CUDA 12.6. Точка безубыточности по сравнению с $0,048 за изображение при 1K наступает где-то на тысячах изображений в месяц и полностью зависит от того, сколько вы платите за вычисления, — и это реальное число, а не риторическое. Если у вас уже есть инфраструктура для инференса, стоимость одного дополнительного изображения в Bernini близка к нулю. Если нет, эндпоинт FLUX 3 Image значительно дешевле, чем развертывание двухэтапного диффузионного стека.

Маршрутизация: ни одного из них нет в нашем каталоге

Стоит сказать прямо, потому что это как раз тот тип утверждения, который быстро устаревает. OrcaRouter не маршрутизирует FLUX 3 Image и не маршрутизирует Bernini-Diffusers-v2. Вызов FLUX 3 Image означает обращение напрямую к Black Forest Labs на их собственном эндпоинте. Вызов Bernini означает развернуть его самостоятельно.

В конвейере вроде этого OpenAI-совместимый роутер на самом деле нужен для всего, что происходит по обе стороны от вызова модели изображений. Этап генерации подписей или переписывания промпта, vision-модель, проверяющая рендер на соответствие брифу, видеомодель, анимирующая утверждённый кадр, небольшая текстовая модель, классифицирующая результат, — это те шаги, на которых возможность заменить провайдера одной строкой, на одном ключе, и автоматически переключать запросы при деградации одного из них устраняет значительную часть сопровождения. OrcaRouter передаёт цену провайдера по прайс-листу без наценки, поэтому когда поставщик снижает тариф, изменение вступает в силу в тот же день, вместо того чтобы ждать, пока реселлер пересмотрит цену, а DSL маршрутизации позволяет закрепить конкретную модель или задать порядок резервных вариантов, не трогая код приложения. Ничего из этого не делает FLUX 3 Image маршрутизируемым. Это просто означает, что остальной части конвейера не нужно знать, какая модель создала кадр.

Screenshot of the Artificial Analysis text-to-image leaderboard, showing FLUX.2 [max] at 1021 Elo and FLUX.2 [dev] fixed as the 1000 anchor, with no FLUX 3 Image entry anywhere on the board

Что взять за основу

Три вопроса чётко разграничивают их, и у них нет общего ответа.

Вам нужно контролировать, где что располагается? FLUX 3 Image — единственный из двух с координатным языком, и его операции редактирования в пределах рамки — оставить, переместить, добавить, удалить — представляют собой действительно иной интерфейс по сравнению с редактированием с помощью текстовых инструкций. Если ваша работа — это композитинг, макетирование или изображения продуктов, где области должны сохраняться, это решающий фактор, а оговорку «обычно остаются идентичными» нужно проверять, а не принимать на веру.

Нужно ли вам знать, насколько он хорош, прежде чем принять решение? У Bernini есть цифры, все — по данным поставщика, и неоднозначная динамика. У FLUX 3 Image их нет. Если вы не можете провести собственную оценку, вы выбираете между моделью, для которой есть измерения, и моделью, для которой их нет, а та, что с измерениями, — более старая архитектура.

Можете ли вы эксплуатировать двухступенчатый стек диффузии? Это и есть настоящий гейт для Bernini. Планировщик Qwen2.5-VL-7B, подающий данные в декодер Wan2.2-T2V-A14B, на GPU Hopper, с хуком-усилителем промптов, указывающим на OpenAI-совместимую конечную точку. Лицензия разрешительная, а счёт за вычисления — нет. Если вы не можете, вопрос теряет смысл, и ответ — $0.048 за изображение.

Единственное, что могло бы изменить эту страницу быстрее всего, — это открытие BFL весов FLUX 3 Image, которое, по словам компании, должно произойти через несколько недель. Это превратило бы лицензионную асимметрию из решающего фактора в незначительный и оставило бы разницу в средствах контроля в качестве собственно предмета сравнения. До тех пор точная сводка такова: это две хорошие модели с противоположными моделями распространения, и выбор делается по лицензированию и контролю задолго до того, как он делается по качеству.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube