Главная карточка для противостояния Bernini-Diffusers-v2 и Qwen Image 3.0, показывающая веса Apache-2.0, которые вы размещаете у себя, против закрытого API, отображающего текст вплоть до ~10px, под слоганом «Одно и то же описание задачи — противоположные ответы по контролю».
Guides & Insights

Bernini-Diffusers-v2 против Qwen Image 3.0: веса, которыми вы владеете, против API, который рендерит текст

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Две китайские лаборатории с разницей в три недели выпустили модели для работы с изображениями и оказались по разные стороны самого большого водораздела в этой категории. Qwen-Image-3.0, выпущенная командой Alibaba 21 июля 2026 года и открытая для международного API 4 августа, — это модель генерации изображений с закрытыми весами, к которой вы обращаетесь через HTTP. Bernini-Diffusers-v2, которую ByteDance выложила на Hugging Face 13 августа 2026 года без какого-либо анонса, — это открытые веса под лицензией Apache-2.0, которые можно скачать и запускать. Примерно та же задача — генерация и редактирование изображений — и противоположные ответы на вопрос о том, кто контролирует модель. Большая часть того, о чём пойдёт речь дальше, — следствие этого единственного решения, поэтому сравнение начинается именно с него, а не заканчивается им.

Веса делятся

Qwen-Image-3.0 — закрытые веса. На момент написания Alibaba не опубликовала ни веса, ни технический отчет для этой модели; вы используете ее через API на Alibaba Cloud Bailian или платформе Qwen. Выходные данные содержат метку происхождения AIGC. Что вы покупаете — это возможность без владения: ни самохостинга, ни тонкой настройки, ни офлайн-использования, ни заглядывания под капот.

Bernini-Diffusers-v2 — открытые веса. Apache-2.0, автономный каталог diffusers на Hugging Face и локальные скрипты инференса в репозитории bytedance/Bernini. Вы можете дообучить его, запускать в изолированной среде, хранить данные на собственном оборудовании и перестать платить за каждое изображение. Цена владения — самостоятельная эксплуатация: в README рекомендуются GPU класса Hopper и стек Python 3.11.2 / PyTorch 2.7.1+cu126.

Для команды, чьи изображения содержат конфиденциальный материал или чьи правила соответствия запрещают отправку данных стороннему API, это разделение само по себе решает спор.

Точность текста и макета

В чём Qwen-Image-3.0 действительно выделяется, так это в тексте. Его ключевые цифры из релизных материалов Alibaba:

• Окно запроса — до 4 500 токенов на входе, что в 4,5 раза больше, чем у предыдущего поколения, и именно это позволяет обрабатывать плотные брифы, такие как газетные первые полосы или сетка знаний из девяти панелей, за один вызовbr />• Мелкий текст — читаемое отображение вплоть до примерно 10px, включая математические обозначения, нижние и верхние индексы, а также многострочные формулыbr />• Языки — нативное отображение для 12 языков с 20+ шрифтами и 100+ художественными стилями, а также знакомство с распространёнными веб-, игровыми и программными интерфейсами

Bernini-Diffusers-v2 не делает сопоставимых заявлений о тексте и вёрстке на своей карточке. Его сильные стороны в другом — семантическое редактирование на основе планирования и видеопайплайн — и для брифа, который в первую очередь сводится к «точно отрендерить эту инфографику», Qwen-Image-3.0 — проверенный выбор, а Bernini — непроверенный.

Глубина редактирования

Qwen-Image-3.0 — генерация плюс редактирование, с арсеналом специализированных приёмов: реставрация старинной живописи, генерация панорам, превращение набросков в презентации и многокадровая раскадровка. Ставка — на практическую пользу: макеты, которые держат форму, детали, которые выглядят как настоящие, — а не на конкретную архитектуру редактирования.

Bernini-Diffusers-v2 — редактирование через семантический планировщик. Планировщик Qwen2.5-VL разбивает инструкцию на план того, что должно измениться, а рендерер на основе Wan2.2 отрисовывает его. Это убедительная архитектура для сложных многошаговых правок — «смените время года, замените автомобиль, сохраните кадрирование» — и она распространяется на видеозадачи (t2v, v2v, rv2v), к которым не прикасался ни один конкурент. Всё это заявлено вендором и публично не проверено.

Two-column comparison scoreboard for Bernini-Diffusers-v2 and Qwen Image 3.0: weights, price, prompt window, text rendering, editing strengths, and hosted API availabilityScreenshot of the ByteDance/Bernini-Diffusers-v2 model card on Hugging Face showing the News and Highlights sections, including the v2 training-recipe change, and the start of the model card table

Стоимость

Qwen-Image-3.0 — примерно $0,025 за 1K-изображение в международном API (около 0,18 юаня), с выходным разрешением до 2048×2048 и до шести изображений за один вызов. Её цена призвана составить серьёзную конкуренцию остальному рынку API-генерации изображений — это лишь малая доля того, сколько год назад стоили премиальные облачные модели генерации изображений.

Bernini-Diffusers-v2 — бесплатные веса, без платы за изображение, а вместо этого расходы на оборудование. Экономика меняется с объёмом: самостоятельный хостинг — плохой вариант для редких изображений и всё более хороший по мере того, как вы генерируете больше, потому что предельные затраты на ещё одно изображение стремятся к нулю.

Существует третья издержка, которая говорит в пользу моделей с открытыми весами и которую легко недооценить: издержки перехода. Закрытая API-модель привязывает вас к её ценам, лимитам запросов и дорожной карте; модель, которой вы владеете, можно заменить, пропатчить или дообучить без каких-либо переговоров.

На каком API вы строите?

Qwen-Image-3.0 доступно только через API, так что если вы строите на нём, вы обязуетесь платить за каждое изображение по счётчику на чужой инфраструктуре — и именно здесь сквозной проход OrcaRouter имеет значение. Цена, которую вы видите у нас, — это публичный прайс Alibaba с нулевой наценкой, а снижение цены вендора отражается в тот же день, так что экономика каждого изображения определяется вендором, а не наценкой реселлера сверху. Автоматическое переключение между провайдерами — вторая половина аргумента: если API для генерации изображений падает посреди кампании, это перестаёт иметь значение, когда ваши запросы маршрутизируются в обход него. Если же вы выбираете путь открытых весов с Bernini-Diffusers-v2, вы принимаете на себя бремя эксплуатации уже сегодня в обмен на нулевую плату за изображение, а когда хостинг-провайдер в итоге подхватит эти веса, тот же сквозной проход применится к тому, что провайдер будет взимать.

Decision card for the Bernini-Diffusers-v2 versus Qwen Image 3.0 matchup: Qwen Image 3.0 rents the capability as a text-accurate API at ~$0.025 per image with zero infrastructure; Bernini-Diffusers-v2 owns the model as Apache-2.0 weights that are self-hosted and fine-tunable but unverified

Вердикт

На бумаге Qwen-Image-3.0 — более сильная чисто имиджевая модель: проверенный рендеринг текста, огромное окно промпта, точность многоязычной вёрстки и конкурентоспособная цена API. Это безопасный выбор для продакшн-генерации изображений, когда бриф изобилует текстом, а процесс построен вокруг API. Bernini-Diffusers-v2 — модель, которой вы действительно можете владеть: веса Apache-2.0, самостоятельный хостинг, тонкая настройка, поддержка видео — но ценой самостоятельной эксплуатации и доверия таблице бенчмарков, которую никто не воспроизвёл. Выбирайте Qwen-Image-3.0 ради точности и нулевой инфраструктуры; выбирайте Bernini-Diffusers-v2 ради владения и контроля. Однострочное правило выбора: вы хотите арендовать возможность или владеть моделью?

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube