
FLUX 3 Image vs Bernini-Diffusers-v2: платный эндпоинт против скачиваемого репозитория
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 223 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
FLUX 3 Image и Bernini-Diffusers-v2 — обе являются моделями изображений, которые можно полностью получить уже сегодня, и ни одна из них не является продуктом, который можно арендовать. FLUX 3 Image стала доступна 1 октября 2026 года по адресу api.bfl.ai/v1/flux-3-image с опубликованным прайс-листом и без опубликованной оценки. Bernini-Diffusers-v2 появилась на Hugging Face 13 августа 2026 года под Apache-2.0 с опубликованными оценками и без возможности вызвать её иначе, кроме как на собственных GPU. Одна поставляется со счётом. Другая — с закреплённой версией Python.
Это расхождение — и есть всё сравнение, и стоит быть точным в этом, потому что обычная формулировка «хостинг против открытых весов» здесь не подходит. Bernini — не модель с открытыми весами, которую можно просто вставить в существующий стек инференса. Это двухэтапная система — планировщик Qwen2.5-VL-7B перед диффузионным декодером Wan2.2-T2V-A14B — и её выпуск v2 — это исправление расписания обучения, а не новый уровень возможностей. FLUX 3 Image — это единая конечная точка с необычно большим объёмом управляющей поверхности, прикрученной к ней: пространственная привязка, координатная сетка 0–1000 и редактирование в пределах рамок, где вы указываете, какие области сохраняются. Разные по форме вещи.
Что каждый из них на самом деле из себя представляет
• FLUX 3 Image — Black Forest Labs' image tier of its unified FLUX 3 family, released October 1, 2026. One HTTP POST to https://api.bfl.ai/v1/flux-3-image with an x-key header; only prompt is required. The call returns a polling URL, and a finished 4K render can take several minutes. Generated samples are downloadable for one hour.
• Bernini-Diffusers-v2 — стек «планировщик + рендерер» от ByteDance, выложенный на Hugging Face 13 августа 2026 года без сопроводительного анонса. Репозиторий помечен тегом image-text-to-video и зависит от diffusers. Перечисленные задачи: текст-в-изображение, изображение-в-изображение, текст-в-видео, видео-в-видео, референс-в-видео и референс-в-изображение. Хостингового инференса и прайс-листа нет — путь для начала работы — hf download и приложение Gradio.
• Разрыв в дистрибуции — FLUX 3 Image — это платный сервис с оплатой по мере использования, к которому вы обращаетесь. Bernini — это репозиторий, который вы развёртываете. Прежде чем вообще имеет смысл задаваться вопросом о качестве, учтите: для одного из них требуется GPU класса Hopper, а для другого — кредитная карта.
Именно в лицензировании эти двое расходятся сильнее всего
Bernini-Diffusers-v2 распространяется под лицензией Apache-2.0 на уровне репозитория. Для пайплайна, развёрнутого на собственных серверах, это имеет огромное значение: никакого счётчика за каждое изображение, никакого согласования коммерческого договора, никакой отчётности об использовании. Вы платите за электроэнергию и время работы планировщика, и предельная стоимость десятитысячного изображения такая же, как и первого.
FLUX 3 Image не распространяется с открытыми весами, и Black Forest Labs прямо заявляет, что это временно. Коммерческие веса доступны уже сегодня по договорной лицензии BFL, а о публичном релизе с открытыми весами говорится, что он состоится в течение следующих недель. Это обещание, у которого есть форма, но нет даты, и это самое важное на этой странице, что нужно перепроверить, а не принимать на веру. Если вы выбираете стек для работы с изображениями на следующие два года, вопрос лицензии, вероятно, перевешивает вопрос Elo — но только если вы готовы самостоятельно эксплуатировать двухэтапный видеонативный диффузионный стек.
Поверхность управления: ограничивающие рамки против улучшения промпта
Это та часть сравнения, которая действительно интересна, потому что две модели решают задачу «заставить это попасть точно туда» совершенно разными способами.
FLUX 3 Image принимает массив JSON, добавляемый к промпту. Координаты задаются в сетке 0–1000 по обеим осям, и каждый бокс записывается как [top, left, bottom, right]. Вы передаёте таблицу элементов, каждый с id, bbox и desc, плюс общая подпись, которая ссылается на эти id по имени. В собственном примере BFL идентификаторы выглядят как animal_1 и silhouette_1; подпись обращается к ним напрямую. Над вызовом генерации есть grounding, включённый по умолчанию, который выполняет веб-поиск и поиск изображений перед генерацией.
FLUX 3 Image затем расширяет ту же систему координат на редактирование. Вместо отправки маски вы отправляете набор операций, ограниченных боксами: Сохранить (исходный бокс в тот же бокс, источник — ref_image_0), Переместить (исходный бокс в новый целевой бокс), Новый (без источника, целевой бокс создаётся из описания — добавить, заменить или перекрасить) и Удалить (исходный бокс в пустой целевой бокс). Несколько операций можно указать в одном запросе.
Оговорка имеет значение. В документации BFL сказано, что пиксели за пределами отредактированных областей «обычно остаются идентичными». Обычно. Это утверждение о сохранности с оговоркой, встроенной в формулировку, — честный способ выпускать такое утверждение, а также причина проверять его на собственных кадрах, а не доверять демонстрации.
У Bernini нет эквивалентного пользовательского языка координат. Его редактирование с опорой на референс улучшилось в v2 из-за изменения в обучении — модуль-коннектор прогревается на протяжении тысяч шагов до начала совместного обучения — и ByteDance сообщает, что это изменение проявляется как улучшение редактирования с опорой на референс и производительности OpenS2V. Это исправление качества внутри существующей архитектуры, а не новый интерфейс управления. Если ваш рабочий процесс зависит от того, чтобы указывать модели, какой прямоугольник не трогать, на этот вопрос отвечает только один из этих двух вариантов.

Что числа подтверждают, а что не подтверждают
На странице Bernini-Diffusers-v2 приведена таблица из семи метрик, сравнивающая v2 с v1, и все цифры в ней заявлены вендором. Направление изменений смешанное, и об этом стоит сказать прямо:
• Рост — OpenS2V 63.83 (с 62.30), VBench 84.46 (с 84.37), Bernini-rv2v 3.55 (с 3.48).
• Без изменений — EditVerse 8.02, без изменений, и Bernini-v2v 3.49, без изменений.
• Недоступен — OpenVE 3.96, начиная с 4.03.
На странице также утверждается, что v2 находится в первом эшелоне среди ведущих закрытых коммерческих моделей во внутренней слепой попарной арене с участием людей. Это невозможно проверить извне ByteDance, и это следует воспринимать как маркетинговое заявление, а не как измерение. Три реальных сдвига — это перечисленные выше, и они основаны на самоотчёте той же лаборатории в сравнении с её собственной v1.
У FLUX 3 Image пока вообще нет никаких числовых показателей. Таблица Artificial Analysis для преобразования текста в изображение и её таблица редактирования были проверены 1 октября и 2026-10-02, и в них нет строки FLUX 3 Image — записи BFL в этих таблицах заканчиваются на линейке FLUX.2, где FLUX.2 [max] находится на 1021 Elo в таблице генерации и 996 в таблице редактирования. FLUX.2 [dev] служит опорной точкой для обеих таблиц ровно на 1000. Так что честное утверждение о качестве FLUX 3 Image прямо сейчас таково: никто за пределами Black Forest Labs не опубликовал для него оценку, а ближайшая доступная точка отсчёта — предыдущее поколение.
Эта асимметрия — практическая ловушка в данном сравнении. Цифры Bernini получены самим вендором, но они существуют и указывают направление. У FLUX 3 Image таких цифр нет. Отсутствие — не провал: модели всего день, — но это значит, что единственное доказательство заявленных возможностей редактирования FLUX 3 Image сейчас исходит от компании, которая его продаёт.
Ценовая сторона, которая вовсе не симметрична
FLUX 3 Image тарифицируется за изображение по уровню разрешения, и в тарифной сетке поставщика указаны пять таких уровней:
• 768sq — $0.041 по прайс-листу, $0.0205 в период запуска.
• 1K (по умолчанию) — $0.048 по прайсу, $0.024 по акции.
• 1,5K — $0,07 по прайс-листу, $0,035 по акции.
• 2K — $0.10 по прайс-листу, $0.05 по акции.
• 4K — $0.607 по прайс-листу, $0.3035 по акции.

Референсные изображения и длина промпта включены без дополнительной платы, а отклонённые, неудачные или отмодерированные запросы не тарифицируются — что здесь важнее, чем обычно, потому что вызов в 4K медленный, и соблазн отказаться от запроса вполне реален. Стартовые цены действуют с 15:00 UTC 1 октября по 15:00 UTC 8 октября. Скачок цены по прайс-листу с 2K до 4K — это множитель 6.07, что гораздо круче, чем соотношение количества пикселей, поэтому выбранный вами уровень разрешения — главное решение по стоимости во всём API.
Уровни привязаны к бюджету пикселей, а не к фиксированному кадру. Пример вывода BFL — 5456 × 3072, примерно 16,8 мегапикселя, по сравнению с UHD 2160p, у которого 8,3 мегапикселя — поэтому «4K» здесь обозначает бюджет, а размеры выходных данных округляются до значений, кратных 16, а фактическое значение возвращается как output_mp.
Цена Bernini — ноль за изображение и не ноль в час. Восемь GPU для последовательно-параллельного инференса, рекомендуется кремний класса Hopper, Python 3.11.2 с PyTorch 2.7.1 и CUDA 12.6. Точка безубыточности по сравнению с $0,048 за изображение при 1K наступает где-то на тысячах изображений в месяц и полностью зависит от того, сколько вы платите за вычисления, — и это реальное число, а не риторическое. Если у вас уже есть инфраструктура для инференса, стоимость одного дополнительного изображения в Bernini близка к нулю. Если нет, эндпоинт FLUX 3 Image значительно дешевле, чем развертывание двухэтапного диффузионного стека.
Маршрутизация: ни одного из них нет в нашем каталоге
Стоит сказать прямо, потому что это как раз тот тип утверждения, который быстро устаревает. OrcaRouter не маршрутизирует FLUX 3 Image и не маршрутизирует Bernini-Diffusers-v2. Вызов FLUX 3 Image означает обращение напрямую к Black Forest Labs на их собственном эндпоинте. Вызов Bernini означает развернуть его самостоятельно.
В конвейере вроде этого OpenAI-совместимый роутер на самом деле нужен для всего, что происходит по обе стороны от вызова модели изображений. Этап генерации подписей или переписывания промпта, vision-модель, проверяющая рендер на соответствие брифу, видеомодель, анимирующая утверждённый кадр, небольшая текстовая модель, классифицирующая результат, — это те шаги, на которых возможность заменить провайдера одной строкой, на одном ключе, и автоматически переключать запросы при деградации одного из них устраняет значительную часть сопровождения. OrcaRouter передаёт цену провайдера по прайс-листу без наценки, поэтому когда поставщик снижает тариф, изменение вступает в силу в тот же день, вместо того чтобы ждать, пока реселлер пересмотрит цену, а DSL маршрутизации позволяет закрепить конкретную модель или задать порядок резервных вариантов, не трогая код приложения. Ничего из этого не делает FLUX 3 Image маршрутизируемым. Это просто означает, что остальной части конвейера не нужно знать, какая модель создала кадр.
![Screenshot of the Artificial Analysis text-to-image leaderboard, showing FLUX.2 [max] at 1021 Elo and FLUX.2 [dev] fixed as the 1000 anchor, with no FLUX 3 Image entry anywhere on the board](https://cms.orcarouter.ai/api/media/file/4-1497.png)
Что взять за основу
Три вопроса чётко разграничивают их, и у них нет общего ответа.
Вам нужно контролировать, где что располагается? FLUX 3 Image — единственный из двух с координатным языком, и его операции редактирования в пределах рамки — оставить, переместить, добавить, удалить — представляют собой действительно иной интерфейс по сравнению с редактированием с помощью текстовых инструкций. Если ваша работа — это композитинг, макетирование или изображения продуктов, где области должны сохраняться, это решающий фактор, а оговорку «обычно остаются идентичными» нужно проверять, а не принимать на веру.
Нужно ли вам знать, насколько он хорош, прежде чем принять решение? У Bernini есть цифры, все — по данным поставщика, и неоднозначная динамика. У FLUX 3 Image их нет. Если вы не можете провести собственную оценку, вы выбираете между моделью, для которой есть измерения, и моделью, для которой их нет, а та, что с измерениями, — более старая архитектура.
Можете ли вы эксплуатировать двухступенчатый стек диффузии? Это и есть настоящий гейт для Bernini. Планировщик Qwen2.5-VL-7B, подающий данные в декодер Wan2.2-T2V-A14B, на GPU Hopper, с хуком-усилителем промптов, указывающим на OpenAI-совместимую конечную точку. Лицензия разрешительная, а счёт за вычисления — нет. Если вы не можете, вопрос теряет смысл, и ответ — $0.048 за изображение.
Единственное, что могло бы изменить эту страницу быстрее всего, — это открытие BFL весов FLUX 3 Image, которое, по словам компании, должно произойти через несколько недель. Это превратило бы лицензионную асимметрию из решающего фактора в незначительный и оставило бы разницу в средствах контроля в качестве собственно предмета сравнения. До тех пор точная сводка такова: это две хорошие модели с противоположными моделями распространения, и выбор делается по лицензированию и контролю задолго до того, как он делается по качеству.
