FLUX 3 Image 대 Bernini-Diffusers-v2 타이틀 카드로, 'FLUX 3 Image - 2026년 10월 1일 라이브, 1K 기준 이미지당 $0.048, api.bfl.ai에서'와 'Bernini-Diffusers-v2 - Apache-2.0 가중치, 자체 호스팅 전용, 호스팅 API 없음'을 대조하고, OrcaRouter는 둘 다 라우팅하지 않는다는 점을 밝힌다. OrcaRouter 로고는 오른쪽 하단에 자리한다.
Guides & Insights

FLUX 3 Image vs Bernini-Diffusers-v2: 유료 엔드포인트 대 다운로드 가능한 리포지토리

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

FLUX 3 Image와 Bernini-Diffusers-v2는 둘 다 오늘 완전한 형태로 구할 수 있는 이미지 모델이며, 어느 쪽도 대여할 수 있는 제품이 아닙니다. FLUX 3 Image는 2026년 10월 1일 api.bfl.ai/v1/flux-3-image에서 공개된 요금표와 함께 출시되었지만 공개된 점수는 없습니다. Bernini-Diffusers-v2는 2026년 8월 13일 Apache-2.0 라이선스로 Hugging Face에 등장했으며, 공개된 점수는 있지만 자체 GPU 외에는 호출할 방법이 없습니다. 하나는 청구서와 함께 오고, 다른 하나는 Python 버전 핀과 함께 옵니다.

그 구분이 이 비교의 전부이며, 여기서는 흔한 "호스팅 vs 오픈 웨이트"라는 구도가 들어맞지 않으므로 이 점을 정확히 짚을 가치가 있다. Bernini는 기존 추론 스택에 바로 집어넣을 수 있는 오픈 웨이트 모델이 아니다. 이는 2단계 시스템으로, Qwen2.5-VL-7B 플래너가 Wan2.2-T2V-A14B 확산 디코더 앞에 놓인 구조이며, v2 릴리스는 새로운 역량 등급이 아니라 학습 스케줄 수정이다. FLUX 3 Image는 단일 엔드포인트인데, 여기에는 유난히 많은 제어 표면이 붙어 있다: 공간 그라운딩, 0–1000 좌표 그리드, 그리고 어떤 영역이 살아남을지 지정하는 박스 범위 편집. 서로 다른 형태의 것이다.

각각이 실제로 무엇인지

• FLUX 3 Image — Black Forest Labs' image tier of its unified FLUX 3 family, released October 1, 2026. One HTTP POST to https://api.bfl.ai/v1/flux-3-image with an x-key header; only prompt is required. The call returns a polling URL, and a finished 4K render can take several minutes. Generated samples are downloadable for one hour.

• Bernini-Diffusers-v2 — ByteDance의 플래너+렌더러 스택으로, 2026년 8월 13일 별도 발표 없이 Hugging Face에 푸시되었습니다. 저장소는 image-text-to-video 태그가 지정되어 있고 diffusers에 의존합니다. 나열된 작업: 텍스트-이미지, 이미지-이미지, 텍스트-비디오, 비디오-비디오, 레퍼런스-비디오 및 레퍼런스-이미지. 호스팅된 추론도, 가격표도 없습니다 — 시작 경로는 hf download와 Gradio 앱입니다.

• 배포 격차 — FLUX 3 Image는 호출하는 종량제 서비스입니다. Bernini는 직접 배포하는 리포지토리입니다. 품질에 관한 어떤 질문을 할 가치가 있기 전에, 이 중 하나는 Hopper급 GPU가 필요하고 다른 하나는 신용카드가 필요합니다.

라이선싱은 이 둘이 가장 극명하게 갈라지는 지점이다.

Bernini-Diffusers-v2는 저장소 수준에서 Apache-2.0입니다. 자체 호스팅 파이프라인에서는 이것이 엄청나게 중요합니다: 이미지당 사용량 측정기도, 협상된 상업적 계약도, 사용량 보고도 없습니다. 전기료와 스케줄러 시간에 대한 비용을 지불하면 되며, 1만 번째 이미지의 한계 비용은 첫 번째 이미지와 같습니다.

FLUX 3 Image는 오픈 웨이트가 아니며, Black Forest Labs는 이것이 일시적이라고 분명히 밝힙니다. 상업용 웨이트는 현재 협의된 BFL 라이선스로 이용할 수 있고, 공개 오픈 웨이트 릴리스는 앞으로 몇 주 안에 나올 예정이라고 설명됩니다. 그것은 윤곽은 있지만 날짜는 없는 약속이며, 이 페이지에서 가정하기보다 다시 확인해야 할 단 하나의 가장 중요한 사항입니다. 앞으로 2년간 사용할 이미지 스택을 선택하는 중이라면, 라이선스 문제가 아마 Elo 문제보다 더 중요할 것입니다 — 단, 2단계 비디오 네이티브 디퓨전 스택을 직접 운영할 준비가 되어 있는 경우에만 그렇습니다.

제어 방식: 바운딩 박스 vs 프롬프트 개선

이 부분이 이 맞대결에서 정말 흥미로운 지점인데, 두 모델이 "정확히 그곳으로 가게 만들기"를 완전히 다른 방식으로 풀어내기 때문이다.

FLUX 3 Image는 프롬프트에 덧붙여진 JSON 배열을 받습니다. 좌표는 두 축 모두 0–1000 그리드로 움직이며, 각 박스는 [top, left, bottom, right]로 표기됩니다. 여러분은 요소들의 표를 제공하는데, 각 요소에는 id, bbox, desc가 있고, 여기에 그 id들을 이름으로 인용하는 전역 캡션이 더해집니다. BFL의 자체 예시에서 id는 animal_1 및 silhouette_1처럼 읽히며, 캡션은 이들을 직접 가리킵니다. 생성 호출 위에는 grounding이 있는데, 기본적으로 켜져 있으며 생성 전에 웹 및 이미지 검색을 실행합니다.

FLUX 3 Image는 이어서 동일한 좌표계를 편집으로 확장합니다. 마스크를 보내는 대신, 박스 범위 작업 세트를 보냅니다: 유지 (소스 박스를 동일한 박스로, ref_image_0에서 가져옴), 이동 (소스 박스를 새 대상 박스로), 새로 만들기 (소스 없음, 설명에서 대상 박스 생성 — 추가, 교체 또는 색상 변경) 및 제거 (소스 박스를 null 대상으로). 여러 작업은 하나의 요청에 들어갑니다.

그 단서는 중요합니다. BFL의 문서에 따르면 편집된 박스 밖의 픽셀은 “대개 동일하게 유지됩니다.” 대개. 그것은 문구 안에 유보가 내장된 보존 주장이며, 그런 주장을 내놓는 정직한 방식이자 데모를 믿기보다 자신의 프레임에서 테스트해야 하는 이유이기도 합니다.

Bernini에는 사용자 대상 좌표 언어에 해당하는 것이 없다. v2에서 참조 기반 편집이 개선된 것은 학습 변경 때문이다. 즉, 공동 학습이 시작되기 전에 커넥터 모듈이 수천 스텝 동안 워밍업되며, ByteDance는 그 변경이 더 나은 참조 기반 편집과 OpenS2V 성능으로 나타난다고 보고한다. 이는 기존 아키텍처 내부의 품질 수정이지 새로운 제어 인터페이스가 아니다. 워크플로가 모델에게 어떤 사각형을 그대로 두어야 하는지 알려주는 데 의존한다면, 이 두 답변 중 하나만 그 질문에 답한다.

Screenshot of Black Forest Labs' FLUX 3 Image model page, headed 'Maximum control over every pixel', showing the bounding-box and region-editing feature list for the October 1, 2026 image release

숫자가 뒷받침하는 것과 그렇지 않은 것

Bernini-Diffusers-v2의 페이지에는 v2와 v1을 비교하는 7개 지표 표가 있으며, 그 표의 모든 수치는 공급업체가 보고한 것입니다. 방향은 엇갈리는데, 이 점은 분명히 짚고 넘어갈 만합니다:

• 상승 — OpenS2V 63.83 (62.30에서), VBench 84.46 (84.37에서), Bernini-rv2v 3.55 (3.48에서).

• 보합 — EditVerse 8.02, 변동 없음, Bernini-v2v 3.49, 변동 없음.

• 다운 — OpenVE 3.96, 4.03부터.

이 페이지는 또한 v2가 내부 블라인드 인간 페어와이즈 아레나에서 선도적인 폐쇄형 소스 상용 모델들 중 최상위 티어에 속한다고 밝힌다. 이는 ByteDance 외부에서는 검증할 수 없으며, 측정치가 아니라 마케팅 주장으로 읽어야 한다. 실제 세 가지 변화는 위에 나열된 것들이며, 이들은 같은 연구소 자체의 v1을 기준으로 스스로 보고한 것이다.

FLUX 3 Image는 아직 숫자가 전혀 없습니다. Artificial Analysis의 텍스트-투-이미지 보드와 편집 보드는 둘 다 10월 1일과 2026-10-02에 확인되었고 FLUX 3 Image 행이 없습니다. 해당 보드의 BFL 항목들은 FLUX.2 라인에서 멈추며, 여기서 FLUX.2 [max]는 생성 보드에서 1021 Elo, 편집 보드에서 996에 위치합니다. FLUX.2 [dev]는 두 보드 모두에서 정확히 1000으로 기준을 잡고 있습니다. 따라서 현재 FLUX 3 Image 품질에 대해 정직하게 말하자면, Black Forest Labs 외부의 누구도 그에 대한 점수를 공개하지 않았고, 가장 가까운 이용 가능한 참조점은 그 이전 세대입니다.

그 비대칭성은 이 비교에서 실질적인 함정입니다. Bernini의 수치는 공급업체가 직접 실행한 것이지만 존재하며 방향성을 보여줍니다. FLUX 3 Image의 수치는 없습니다. 부재가 실패는 아닙니다 — 그 모델은 출시된 지 하루밖에 되지 않았으니까요 — 하지만 이는 현재 FLUX 3 Image의 편집 주장을 뒷받침하는 유일한 증거가 그것을 판매하는 회사에서 나온다는 것을 의미합니다.

전혀 대칭적이지 않은 가격 측면

FLUX 3 Image는 해상도 등급별로 이미지당 가격이 책정되며, 공급업체의 요율표에는 다섯 가지 등급이 나열되어 있습니다:

• 768sq — 정가 $0.041, 출시 기간에는 $0.0205.

• 1K (기본값) — 정가 $0.048, 할인가 $0.024.

• 1.5K — 정가 $0.07, 할인가 $0.035.

• 2K — 정가 $0.10, 할인가 $0.05.

• 4K — 정가 $0.607, 할인가 $0.3035.

Screenshot of Black Forest Labs' pricing page captured October 2, 2026, showing the FLUX 3 Image tab and its per-image rates by resolution tier, from 768sq through 4K

참조 이미지와 프롬프트 길이는 추가 비용 없이 포함되며, 거부되거나 실패하거나 모더레이션된 요청에는 요금이 청구되지 않습니다 — 이는 여기서 평소보다 더 중요합니다. 4K 호출은 느리고 요청을 포기하고 싶은 유혹이 실재하기 때문입니다. 출시 가격은 10월 1일 15:00 UTC부터 10월 8일 15:00 UTC까지 적용됩니다. 2K에서 4K로의 정가 상승 폭은 6.07배로, 픽셀 수 비율보다 훨씬 가파릅니다. 따라서 선택하는 해상도 등급이 API 전체에서 가장 중요한 비용 결정입니다.

이 티어들은 고정된 프레임이 아니라 픽셀 예산을 추적합니다. BFL의 예시 출력은 5456 × 3072로, 약 16.8메가픽셀이며, 8.3메가픽셀의 UHD 2160p와 대비됩니다 — 따라서 여기서 "4K"는 예산을 가리키며, 출력 치수는 16의 배수로 반올림되고 실제 수치는 output_mp로 반환됩니다.

Bernini의 가격은 이미지당 0이고 시간당은 0이 아니다. 시퀀스 병렬 추론을 위한 GPU 8장, Hopper급 실리콘 권장, Python 3.11.2와 PyTorch 2.7.1 및 CUDA 12.6. 1K 해상도에서 이미지당 $0.048 대비 손익분기점은 월 수천 장의 이미지 어딘가에서 도달하며, 이는 전적으로 컴퓨트에 지불하는 비용에 달려 있다 — 그리고 그것은 수사적 표현이 아니라 실제 숫자다. 이미 추론 인프라를 운영하고 있다면, Bernini의 한계 이미지 비용은 거의 무료에 가깝다. 그렇지 않다면, FLUX 3 Image 엔드포인트는 2단계 확산 스택을 구축하는 것보다 훨씬 저렴하다.

라우팅: 이 중 어느 것도 저희 카탈로그에 없습니다

분명히 말해둘 만하다. 그런 주장은 금세 낡아버리기 때문이다. OrcaRouter는 FLUX 3 Image를 라우팅하지 않으며, Bernini-Diffusers-v2도 라우팅하지 않는다. FLUX 3 Image를 호출한다는 것은 Black Forest Labs의 자체 엔드포인트로 직접 호출한다는 뜻이다. Bernini를 호출한다는 것은 직접 배포해야 한다는 뜻이다.

이런 파이프라인에서 OpenAI 호환 라우터가 실제로 하는 일은 이미지 호출 양쪽의 모든 것입니다. 캡셔닝 또는 프롬프트 재작성 단계, 렌더가 브리프에 부합하는지 확인하는 비전 모델, 승인된 스틸을 애니메이션화하는 비디오 모델, 출력을 분류하는 작은 텍스트 모델 — 이런 단계에서는 제공자를 문자열 하나, 키 하나로 교체할 수 있고 하나가 성능 저하될 때 요청이 자동으로 페일오버되게 하는 것은 실제로 상당한 유지보수 부담을 덜어줍니다. OrcaRouter는 공급자 정가를 마크업 없이 그대로 전달합니다, 따라서 벤더가 요금을 인하하면 리셀러가 재가격을 책정하기를 기다리지 않고 같은 날 변경이 반영되며, 라우팅 DSL을 사용하면 애플리케이션 코드를 건드리지 않고 특정 모델을 고정하거나 폴백 순서를 정의할 수 있습니다. 그렇다고 해서 FLUX 3 Image가 라우팅 가능해지는 것은 아닙니다. 다만 파이프라인의 나머지 부분이 그 스틸을 생성한 모델이 무엇인지 신경 쓸 필요가 없다는 뜻입니다.

Screenshot of the Artificial Analysis text-to-image leaderboard, showing FLUX.2 [max] at 1021 Elo and FLUX.2 [dev] fixed as the 1000 anchor, with no FLUX 3 Image entry anywhere on the board

어느 것을 기반으로 해야 할까?

세 가지 질문이 이것들을 깔끔하게 구분하며, 그 질문들에는 공통된 답이 없습니다.

요소가 어디로 가는지 직접 제어해야 합니까? FLUX 3 Image는 둘 중 좌표 언어를 갖춘 유일한 모델이며, 박스 범위로 한정된 편집 작업 — 유지, 이동, 추가, 제거 — 은 텍스트 지시 기반 편집과는 확실히 다른 인터페이스입니다. 합성, 레이아웃, 또는 영역이 반드시 그대로 유지되어야 하는 제품 이미지 작업을 한다면 이는 결정적인 차이이며, "보통 동일하게 유지된다"는 유보적 표현은 가정할 것이 아니라 직접 테스트해야 할 대상입니다.

얼마나 좋은지 확인한 뒤에야 결정을 내려야 하나요?버니니(Bernini)에게는 숫자가 있고, 그것도 전부 벤더가 보고한 것이며, 나아가는 방향도 엇갈린다. FLUX 3 Image에는 아무것도 없다. 스스로 평가를 돌릴 수 없다면, 당신은 측정된 모델과 측정되지 않은 모델 사이에서 고르는 셈인데, 측정된 쪽이 더 오래된 아키텍처다.

2단계 디퓨전 스택을 운영할 수 있습니까? 그것이 Bernini의 진짜 관문입니다. Qwen2.5-VL-7B 플래너가 Wan2.2-T2V-A14B 디코더에 입력을 제공하고, Hopper GPU에서 실행되며, OpenAI 호환 엔드포인트를 가리키는 프롬프트 강화 훅이 있는 구성입니다. 라이선스는 허용적이지만 컴퓨팅 비용은 그렇지 않습니다. 그렇게 할 수 없다면 이 질문은 무의미하며, 이미지당 $0.048이 답입니다.

이 페이지의 판도를 가장 빠르게 바꿀 단 한 가지는 BFL이 FLUX 3 Image 가중치를 공개하는 것이며, 회사는 이것이 몇 주 남았다고 밝혔습니다. 그렇게 되면 라이선스 비대칭은 결정적 요인에서 완만한 요인으로 바뀌고, 실제 비교 대상으로는 제어 표면의 차이가 남습니다. 그때까지는 이 두 모델이 상반된 배포 모델을 가진 두 개의 좋은 모델이며, 선택은 품질보다 훨씬 앞서 라이선싱과 제어를 기준으로 이루어진다고 요약하는 것이 정확합니다.