GPT-Image-2 대 Flux 3 히어로 타이틀 카드, 헤드라인 'GPT-Image-2 대 Flux 3'과 부제목 'One live model, one roadmap', GPT-Image-2에는 '2026년 5월부터 공개 API' 배지가, Flux 3에는 '이미지 티어: 곧 출시' 배지가 표시된 두 개의 카드, 오른쪽 하단 모서리의 OrcaRouter 로고.
Guides & Insights

GPT-Image-2 vs Flux 3: 라이브 모델과 로드맵 비교

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이것은 일반적인 모델 대 모델 비교 게시물이 아닙니다. 왜냐하면 GPT-Image-2Flux 3는 동일한 존재 상태에 있지 않기 때문입니다. GPT-Image-2는 2026년 4월 21일에 출시되었으며, 5월 초부터 Ope​nAI의 API를 통해 호출할 수 있었고, 이번 주에는 새로운 기능—투명 배경 이미지 생성—이 API에 추가되었습니다(8월 20일에 발표되어 지금 사용 가능). Flux 3는 Black Forest Labs의 멀티모달 기반 모델로, 2026년 7월 23일에 발표되었으며, 이 글을 쓰는 시점에서 이미지 티어에는 여전히 공개 엔드포인트, 모델 ID, 가격표가 없습니다. 이 중 하나는 유효한 키만 있으면 새벽 3시에 호출할 수 있지만, 다른 하나는 대기자 명단에 등록만 할 수 있습니다. 따라서 유용한 비교는 "어느 것이 더 나은가"가 아니라, 출시된 모델이 오늘 실제로 무엇을 하는지, 로드맵이 출시되지 않은 모델에 대해 무엇을 약속하는지, 그리고 빌더가 출시된 모델이 계속 개선되는 동안 계속 지연되는 약속된 모델을 어떻게 대해야 하는지입니다.

이것들 중 하나에는 끝점이 있습니다.

가용성부터 이야기해야 한다. 가용성이 그 외의 모든 것을 결정하기 때문이다. Black Forest Labs는 7월 23일 Flux 3를 이미지, 비디오, 오디오, 로봇 동작 예측을 공동으로 학습한 단일 모델로 공개했다. 이 모델은 연구소가 Self-Flow라고 부르는 플로우 매칭(flow-matching) 기법을 기반으로 구축되었다. 보도에 따르면 해당 학습 컴퓨팅 자원의 95% 이상이 비디오 예측에 투입되었으며, 이는 실제 출시된 결과물에서도 드러난다. 유료 API와 함께 8월 4일 일반 공급(GA)에 도달한 것은 Flux 3 Video뿐이다. 이미지 등급의 모델 페이지에는 여전히 신청 양식과 함께 'coming soon' 라벨만 있을 뿐 시작(get-started) 버튼이 없다. 엔드포인트도, 문서화된 파라미터도, 이미지당 비용도, 누구나 실행할 수 있는 벤치마크도 존재하지 않는다.

반면, GPT-Image-2는 4개월째 프로덕션에서 운영 중입니다. OpenAI는 5월 초 API 액세스를 열었고, 모델 식별자 gpt-image-2는 고정 스냅샷인 gpt-image-2-2026-04-21이 함께 공존할 수 있을 정도로 안정적입니다. 이 모델은 두 주요 독립 평가 차트 모두에서 현재 1위 텍스트-이미지 생성 모델입니다 — Arena의 텍스트-이미지 리더보드(미디엄 빌드)에서 1,381 Elo, Artificial Analysis의 하이 빌드에서 1,369 Elo — 그리고 CJK를 포함한 다국어 텍스트를 렌더링하고, 웹 검색에 기반한 생성을 지원하며, 최대 4K 출력물을 생성합니다. 4개월간의 프로덕션 트래픽은 단순한 주장과 실제 검증된 실적 사이의 차이를 만들어 냅니다.

GPT-Image-2 쪽의 최근 변경 사항

이 대결을 시의적절하게 만드는 사건은 Flux 3와는 아무 관련이 없습니다. 8월 20일, OpenAI는 Images API에서 GPT-Image-2의 투명 배경 미리보기를 공개했습니다. background를 "transparent"로 설정하면 엔드포인트가 실제 알파 채널이 있는 PNG 또는 WebP를 반환하며, 배경이 잘라내진 채로 바로 합성할 수 있습니다. 이는 Flux 3 이미지의 로드맵이 판매 포인트로 내세우는 프로덕션 작업(제품 사진, 아이콘, 마케팅 자산)을 정면으로 겨냥한 기능이며, 새 모델이 아니라 이미 운영 중인 엔드포인트에 매개변수로 추가되었습니다. 그래서 모두가 여전히 "coming soon"이라고 표시된 Flux 3 이미지 엔드포인트를 기다리는 동안, 기존 업체는 자사가 합성 파이프라인에서 제외되던 격차 중 하나를 방금 메웠습니다.

이 기능은 API 전용입니다. ChatGPT 토글은 없으며, 신제품이 아닌 매개변수입니다. Images API의 생성(generation) 및 편집(edit) 두 엔드포인트 모두 background 필드를 허용하며, 값으로 "transparent", "opaque", "auto"(기본값, 모델이 결정)를 받습니다. 알파 채널은 PNG 또는 WebP 출력에서만 유지되므로 요청에서 출력 형식을 명시적으로 고정합니다. OpenAI 자체 API 참조 문서는 여전히 gpt-image-2 및 해당 gpt-image-2-2026-04-21 스냅샷의 투명 지원을 "미리 보기(in preview)"로 표시합니다. 이는 정식 출시 발표가 아닌 공급업체의 라벨이며, 모델이 투명 요청을 실제로 존중하도록 프롬프트에 배경 묘사를 포함하지 말라고 안내합니다. 새 엔드포인트도, 새 모델 ID도, 별도 가격표도 없습니다. 불투명 PNG를 반환하던 동일한 gpt-image-2 호출이 이제 컷아웃(cutout) 이미지를 반환합니다.

Comparison scoreboard titled 'GPT-Image-2 vs Flux 3 - the scoreboard'. GPT-Image-2 column: Released Apr 21, 2026; Availability Public API since May; Arena T2I Elo 1,381 (#1); Text rendering multilingual incl. CJK; Transparent bg preview Aug 20; Max resolution 4K. Flux 3 column: Released announced Jul 23, 2026; Availability image tier coming soon; Arena T2I Elo none yet; Text rendering promised; Transparent bg not stated; Max resolution not specified. Footer: GPT-Image-2 figures per Arena and OpenAI list pricing; Flux 3 image claims are a vendor roadmap. OrcaRouter logo bottom-right.

Flux 3 이미지가 약속하는 것과 실제로 출시되는 것

Flux 3 이미지 등급의 스펙 시트는 공급업체 로드맵이므로 그렇게 취급하세요. Black Forest Labs는 다양한 스타일과 해상도에 걸친 이미지 합성 및 편집, 복잡한 프롬프트 처리 개선, 정확도가 높은 다국어 텍스트 렌더링, 참조 이미지에서의 제로샷 스타일 전송, 파인튜닝 없이 캐릭터와 브랜드 일관성 유지, 텍스처와 조명을 보존하는 비파괴 편집을 약속했습니다. 그것들은 약속할 만한 올바른 것들입니다 — 현재 시장 선두주자들이 경쟁하는 바로 그 기능들이지만 — 오늘날 그중 어느 것도 테스트할 수 없습니다. 엔드포인트가 없기 때문입니다.

BFL에서 실제로 호출할 수 있는 것은 비디오 티어와 구형 FLUX 이미지 라인이다. Flux 3 Video는 HD에서 초당 $0.17, FHD에서 초당 $0.29에 전체 렌더링을 제공하며, 초당 $0.06의 드래프트 모드도 있다. 자체 보고 수치로는 텍스트-투-비디오 Elo 1,135, 이미지-투-비디오 Elo 1,051이며, Luma Ray 3.2, Runway Gen-4.5, Gr​ok Imagine Video, Kling v3 Pro에 대한 선호도 우위를 기록했다. 모두 벤더가 보고하고 재현되지 않은 수치이며, 어느 것도 이미지 티어에는 적용되지 않는다. 정지 이미지의 경우 현재 BFL 제공물은 FLUX.2 라인으로, GPT-Image-2가 1,369로 선두인 동일한 Artificial Analysis 보드에서 1,226 Elo를 기록하고 있다. 그 격차가 'Flux 3 이미지가 곧 나온다'는 말의 실질적 맥락이다. 오늘날 BFL 이미지 API는 Ope​nAI의 것보다 약 140 Elo 뒤처져 있으며, 약속된 모델이 바로 BFL이 그 격차를 좁히기 위해 필요한 것이다.

Screenshot of the Artificial Analysis Text-to-Image leaderboard (captured August 20, 2026) showing GPT Image 2 (high) in first place at 1,369 Elo and Black Forest Labs' current image entry FLUX.2 (max) at 1,226 Elo, with no Flux 3 image entry present, in English.

가격: 실제 가격 카드는 하나만 존재합니다.

Flux 3 이미지 제품이 없으므로 Flux 3 이미지 가격도 존재하지 않습니다. 공개된 수치는 GPT-Image-2의 토큰 요금뿐입니다: 텍스트 입력 토큰 100만 개당 $5, 이미지 입력 토큰 100만 개당 $8, 이미지 출력 토큰 100만 개당 $30이며, Batch API는 최대 24시간이 소요되는 경우 약 절반 가격으로 제공됩니다. Ope​nAI는 이미지당 토큰 수를 공개하지 않으므로 이미지당 수치는 견적이 아닌 환산치입니다: 저품질 1024×1024의 경우 약 $0.006, 중간 품질은 약 $0.05, 고품질은 약 $0.21, 4K 고해상도 렌더의 경우 최대 약 $0.41입니다. 비교하자면, 그것이 장부에서 실제로 채워진 쪽이고, Flux 3 이미지 열은 빈 칸입니다.

Screenshot of the OrcaRouter model page for openai/gpt-image-2 (captured August 20, 2026), showing the model description, input rate of $8.00 and output rate of $30.00 per million tokens, median latency, and community usage, in English.

빌더가 약속된 모델로 해야 할 일

경쟁사 모델의 출시가 계속 지연될 때 현명한 자세는 기존에 있는 것을 기반으로 구축하고, 미래를 재설계가 아닌 설정 변경으로 만드는 것이다. GPT-Image-2는 오늘 OrcaRouter를 통해 라우팅할 수 있다. API 키 하나로 OpenAI의 정가를 0% 마크업으로 그대로 전달하며, 공급자 간 자동 페일오버를 지원한다. 따라서 이 모델로 자산을 생성하는 파이프라인은 나중에 Flux 3 이미지 API 엔드포인트가 실제로 생기는 날, 동일한 엔드포인트를 그 API에 지정하고 라우팅 DSL로 트래픽 일부를 그쪽으로 보낼 수 있다. 호출 코드를 건드릴 필요가 없다. 지금은 이미 출시된 모델을 얻을 수 있고, 약속된 모델이 실제로 출시되면 보도자료가 아닌 실제 작동하는 베이스라인과 비교해 평가하면 된다. 기다리는 것 자체는 아무 비용이 들지 않는다. 하지만 기다리는 동안 아무것도 구축하지 않는 것은 모든 것을 잃게 만든다.

결론은 의도적으로 한쪽으로 기울어져 있다. 이번 분기에 이미지 생성이 필요하다면 GPT-Image-2가 선택지이며, 더 이상 의문의 여지가 없다. 독보적인 1위이고, 방금 API에 투명 배경 출력을 추가했으며, 공개 API와 안정적인 가격을 갖추고 있다. Flux 3 이미지는 프로젝트를 보류할 이유가 아니라 Black Forest Labs를 주목할 이유다. 초기 액세스 개통과 첫 독립 벤치마크를 추적하라. 엔드포인트가 생기는 순간, 이 글의 비교는 실제로 실행할 수 있는 테스트가 된다.