Bernini-Diffusers-v2 대 Qwen Image 3.0 매치업을 위한 히어로 카드로, 자체 호스팅하는 Apache-2.0 가중치와 약 10px까지 텍스트를 렌더링하는 폐쇄형 API를 대비시키며, '같은 작업 설명, 제어에 대한 상반된 답변'이라는 태그라인을 내건다.
Guides & Insights

Bernini-Diffusers-v2 대 Qwen Image 3.0: 직접 소유하는 가중치 vs 텍스트를 렌더링하는 API

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

중국의 두 연구소가 3주 이내에 잇따라 이미지 생성 모델을 출시했고, 이 카테고리의 가장 큰 분기점을 사이에 두고 정반대의 입장에 서게 되었다. Qwen-Image-3.0은 2026년 7월 21일 알리바바 팀이 출시하고 8월 4일에 국제 API로 개방한, HTTP로 호출하는 클로즈드 웨이트 이미지 모델입니다. Bernini-Diffusers-v2는 2026년 8월 13일 바이트댄스가 아무런 발표 없이 허깅페이스에 게시한, 다운로드하여 실행하는 아파치-2.0 오픈 웨이트 모델입니다. 대략적인 직무 설명(이미지 생성 및 편집)은 같지만, 모델을 통제하는 사람이 누구인가에 대한 답은 정반대입니다. 이어지는 내용의 대부분은 바로 그 한 가지 결정의 결과이므로, 이 비교가 끝나는 지점이 아니라 시작하는 지점입니다.

가중치들이 나뉜다.

Qwen-Image-3.0 — 비공개 가중치. 작성 시점 기준, Alibaba는 이 모델의 가중치나 기술 보고서를 공개하지 않았습니다. Alibaba Cloud Bailian 또는 Qwen 플랫폼의 API를 통해 사용할 수 있습니다. 출력물에는 AIGC 출처 라벨이 포함됩니다. 구매하는 것은 관리 권한 없는 기능입니다: 자체 호스팅 불가, 파인튜닝 불가, 오프라인 사용 불가, 내부 구조 확인 불가.

Bernini-Diffusers-v2 — 오픈 가중치 모델입니다. Apache-2.0 라이선스, Hugging Face의 독립적인 diffusers 디렉터리, 그리고 bytedance/Bernini 저장소의 로컬 추론 스크립트를 포함합니다. 파인튜닝하거나, 네트워크 차단 환경에서 실행하거나, 데이터를 자체 하드웨어에 보관하면서 이미지당 비용을 지불하지 않아도 됩니다. 다만 직접 운영해야 한다는 비용이 따릅니다. README에서는 Hopper급 GPU와 Python 3.11.2 / PyTorch 2.7.1+cu126 스택을 권장합니다.

이미지에 기밀 자료가 포함된 팀이나, 규정 준수 규칙상 데이터를 제3자 API로 보내는 것이 금지된 팀에게는 그 차이가 논쟁을 저절로 해결해 줍니다.

텍스트 및 레이아웃 충실도

Qwen-Image-3.0이 진정으로 차별화되는 부분은 텍스트입니다. 알리바바의 출시 자료에 따른 주요 수치는 다음과 같습니다:

• 프롬프트 창 — 최대 4,500 토큰의 입력, 이전 세대보다 4.5배 증가한 것으로, 신문 전면이나 9패널 지식 그리드 같은 조밀한 브리프를 한 번에 처리할 수 있게 해줍니다.br />• 작은 텍스트 — 약 10px까지 또렷하게 렌더링되며, 수학 표기, 아래첨자, 위첨자, 여러 줄 수식을 포함합니다.br />• 언어 — 기본 렌더링: 12개 언어를 지원하며, 20개 이상의 글꼴과 100개 이상의 아트 스타일, 그리고 일반적인 웹, 게임, 소프트웨어 인터페이스에 대한 이해를 갖추고 있습니다.

Bernini-Diffusers-v2는 카드에서 이에 필적할 만한 텍스트 및 레이아웃 관련 주장을 하지 않습니다. 그 강점은 다른 곳에 있습니다 — 계획 기반의 의미 편집과 비디오 파이프라인 — 그리고 주로 "이 인포그래픽을 정확하게 렌더링하라"는 브리프에 있어서, Qwen-Image-3.0이 입증된 선택이고 Bernini는 입증되지 않은 선택입니다.

편집 깊이

Qwen-Image-3.0 — 생성과 편집을 모두 지원하며, 고대 회화 복원, 파노라마 생성, 스케치-투-PPT, 멀티샷 스토리보드 등 전문 기능들을 갖추고 있습니다. 핵심은 특정 편집 아키텍처가 아니라 제작 실용성 — 견고한 레이아웃과 실제처럼 읽히는 디테일 — 입니다.

Bernini-Diffusers-v2 — 시맨틱 플래너를 통한 편집입니다. Qwen2.5-VL 플래너는 지시를 무엇을 변경해야 하는지에 대한 계획으로 분해하고, Wan2.2 기반 렌더러가 이를 그립니다. 이는 복잡한 다단계 편집 — '계절을 바꾸고, 차량을 교체하고, 프레이밍을 유지하세요' — 을 위한 매력적인 설계이며, 어느 경쟁사도 다루지 않는 비디오 작업(t2v, v2v, rv2v)으로 확장됩니다. 이 모든 것은 벤더가 보고한 것이며 공개적으로 검증되지 않았습니다.

Two-column comparison scoreboard for Bernini-Diffusers-v2 and Qwen Image 3.0: weights, price, prompt window, text rendering, editing strengths, and hosted API availabilityScreenshot of the ByteDance/Bernini-Diffusers-v2 model card on Hugging Face showing the News and Highlights sections, including the v2 training-recipe change, and the start of the model card table

비용

Qwen-Image-3.0 — 대략 1K 이미지당 $0.025 (국제 API 기준, 약 0.18위안)이며, 최대 2048×2048 출력과 호출당 최대 6개 이미지를 지원합니다. 이 가격은 API 이미지 시장의 다른 제품들과 치열하게 경쟁하도록 책정된 가격으로, 1년 전 프리미엄 호스팅 이미지 모델이 부과하던 가격의 극히 일부입니다.

Bernini-Diffusers-v2 — 무료 가중치, 이미지당 수수료 없음, 그 대신 하드웨어 비용이 든다. 경제성은 사용량에 따라 역전된다: 셀프 호스팅은 가끔 이미지를 생성할 때는 불리한 선택이지만, 많이 생성할수록 점점 더 유리해진다. 추가 이미지 한 장의 한계 비용이 0으로 수렴하기 때문이다.

오픈 가중치 쪽에 유리하면서 과소평가하기 쉬운 세 번째 비용이 있습니다: 바로 전환 비용입니다. 폐쇄형 API 모델은 가격, 속도 제한, 로드맵에 여러분을 묶어 둡니다. 반면 직접 소유한 모델은 아무것도 재협상하지 않고도 교체하거나 패치하거나 미세 조정할 수 있습니다.

어떤 API를 기반으로 구축하시나요?

Qwen-Image-3.0은 API 전용이므로, 이를 기반으로 구축한다면 타사 인프라에서 이미지당 과금 체계에 묶이게 됩니다. 바로 이 지점에서 OrcaRouter의 패스스루(pass-through)가 중요해집니다. 저희 쪽에 표시되는 가격은 알리바바(Alibaba)의 정가에 마크업 0%를 적용한 것이며, 공급업체의 가격 인하는 당일 반영되므로, 이미지당 비용 구조는 리셀러의 추가 마크업이 아니라 공급업체의 조건 그대로입니다. 이 주장의 나머지 절반은 공급업체 간 자동 장애 조치(failover)입니다. 캠페인 중에 이미지 API가 중단되더라도, 호출이 해당 API를 우회하도록 라우팅된다면 더 이상 문제가 되지 않습니다. 반대로 Bernini-Diffusers-v2와 함께 오픈 가중치(open-weights)의 길을 선택한다면, 지금은 운영(ops) 부담을 감수하는 대신 이미지당 수수료가 0원이 되며, 나중에 호스팅 제공업체가 해당 가중치를 채택하게 되면, 그 제공업체가 부과하는 요금에도 동일한 패스스루가 적용됩니다.

Decision card for the Bernini-Diffusers-v2 versus Qwen Image 3.0 matchup: Qwen Image 3.0 rents the capability as a text-accurate API at ~$0.025 per image with zero infrastructure; Bernini-Diffusers-v2 owns the model as Apache-2.0 weights that are self-hosted and fine-tunable but unverified

평결

서류상으로는 Qwen-Image-3.0이 더 강력한 순수 이미지 모델입니다. 검증된 텍스트 렌더링, 넓은 프롬프트 창, 다국어 레이아웃 정확성, 경쟁력 있는 API 가격을 갖추고 있습니다. 텍스트가 많은 브리프와 API 기반 워크플로우를 요구하는 프로덕션 이미지 생성에는 안전한 선택입니다. Bernini-Diffusers-v2는 실제로 소유할 수 있는 모델입니다. Apache-2.0 가중치, 자체 호스팅, 파인튜닝 가능, 비디오 지원 — 직접 운영하고 아무도 재현하지 못한 벤치마크 표를 신뢰해야 한다는 비용을 치르면 됩니다. 정확성과 인프라 부담 제로를 원한다면 Qwen-Image-3.0을, 관리권과 통제권을 원한다면 Bernini-Diffusers-v2를 선택하세요. 한 줄의 결정 규칙: 능력을 임대할 것인가, 모델을 소유할 것인가?

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube