생성된 히어로 카드로, 헤드라인은 Qwen-Image-2.1 vs GPT-Image-2.5이며, Qwen-Image-2.1이라고 표시된 카드에는 다운로드 아이콘과 33 GB 가중치라는 텍스트가, GPT-Image-2.5라고 표시된 카드에는 계량 다이얼 아이콘과 토큰 과금이라는 텍스트가 나란히 표시되어 있고, 캡션은 하나는 다운로드, 하나는 계량입니다.
Guides & Insights

Qwen-Image-2.1 vs GPT-Image-2.5: 격차는 단 하나의 숫자이며, 그것은 품질이 아니다

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

스펙 상에서 나란히 놓고 보면, Qwen-Image-2.1GPT-Image-2.5는 마치 형제처럼 보인다. 둘 다 생성과 편집을 통합한 이미지 모델이고, 둘 다 투명 배경 출력을 지원하며, 둘 다 지난 5주 안에 출시되었고, 둘 다 2K급 정지 이미지를 만들어낼 수 있다. 이 둘 중 하나를 선택하게 만드는 차이는 단 하나의 숫자인데, 그것은 벤치마크 점수가 아니다. Qwen-Image-2.1은 무료로 다운로드할 수 있지만 판매하는 것은 불가능하다. GPT-Image-2.5는 다운로드하는 것이 불가능하지만 판매하는 것은 지극히 간단하다. 나머지 모든 것, 즉 아키텍처와 지연 시간, 투명도 구현 방식은 모두 그로부터 파생된 결과다. Qwen-Image-2.1은 2026년 9월 20일에 오픈소스로 공개되었다. GPT-Image-2.5는 2026년 9월 8일에 API 모델이 라이브된 상태로 발표되었다.

투명성을 높이는 두 가지 방법, 한 달 간격으로

두 모델이 서로 몇 주 차이를 두고 투명한 출력을 갖추게 된 것은 이해해 볼 가치가 있는 우연이다. 두 구현은 서로 동등하지 않기 때문이다.

Qwen-Image-2.1은 알파를 모델 내부에 넣습니다. 16배 공간 압축을 적용한 64채널 RGBA 잠재 공간에서 노이즈를 제거하므로, 알파 채널은 샘플러가 생성하는 결과물의 일급 구성 요소입니다. 분할 단계도, 매팅 패스도 없습니다. 여기에 더해 특이한 추가 기능이 있습니다. 모델이 프롬프트별로 RGB를 출력할지 알파 채널 이미지를 출력할지 스스로 결정할 수 있기 때문에, 일반 사진에서 피사체를 추출해 이진 마스크가 아니라 투명 레이어로 돌려줄 수도 있습니다.

GPT-Image-2.5는 파라미터 방식을 택한다. OpenAI의 API는 background 설정으로 auto, opaque, transparent를 받아들이고, 모델은 그에 따라 응답한다. 이는 잠재 공간의 속성이 아니라 호스팅된 엔드포인트에서의 기능 토글에 해당하며, 장점은 이에 대해 고민할 필요가 없다는 것이다. 플래그를 설정하고, 컷아웃을 얻고, 다음으로 넘어가면 된다. 대가는 엔드포인트가 정한 해상도와 비용으로, 엔드포인트가 주는 것을 그대로 받는다는 점이다.

어느 쪽이 더 나은지는 정말로 미해결이다. 작성 시점에 Qwen-Image-2.1의 알파 가장자리를 전용 매팅 모델과 비교한 공개 자료는 없었고, Qwen 쪽에서 공개된 유일한 검증은 기능적 검증이다 — 투명 PNG 출력 통과, 전체 0–255 범위에서 알파 유지, 단일 샘플에서 RGBA PSNR 60.69 dB. 이것은 정확성 검사이지 품질 판정이 아니다. 그것은 해당 채널이 실제로 존재한다는 것을 알려준다.

실제로 측정할 수 있는 것

파라미터 — Qwen-Image-2.1의 생성 구성 요소는 7B, 32계층 단일 스트림 디퓨전 트랜스포머이며, Qwen3-VL 8B 텍스트 인코더와 짝을 이룹니다. 총 가중치는 약 33GB이고, 그중 DiT가 약 14GB를 차지합니다. OpenAI는 GPT-Image-2.5의 파라미터 수를 공개하지 않습니다.
해상도 — Qwen-Image-2.1은 7가지 화면 비율 프리셋으로 40 추론 단계에서 최대 2048×2048까지 네이티브로 출력합니다. GPT-Image-2.5는 최대 3840×2160 및 2160×3840 크기를 지원하며, 각 변은 3840px로 제한되고 16의 배수여야 합니다.
참조 이미지 — Qwen-Image-2.1은 다중 피사체 구성과 가상 피팅을 위해 최대 10개를 입력으로 받습니다. OpenAI의 이미지 모델은 편집을 위한 참조 입력을 받지만, 실질적 한도와 충실도 양상은 모델 및 품질 등급에 따라 다릅니다.
지연 시간 — SGLang-Diffusion은 단일 B200에서 1024×1024, 40단계 생성에 2.748초를, Cache-DiT 및 INT8 커널을 사용한 24GB RTX 4090에서 4.74초를 공개합니다(디노이즈만 해당). OpenAI는 GPT-Image-2.5의 Flare 변형이 GPT-Image-2보다 지연 시간이 최대 50% 더 낮다고 보고하며, 한 출시 파트너는 2–4배를 측정했습니다 — 각각 공급업체 보고와 파트너 보고이며, 통제된 비교는 아닙니다.
가격 — Qwen-Image-2.1은 호스팅 엔드포인트가 없으므로 호스팅 가격도 없습니다. 비용은 자체 GPU 시간입니다. GPT-Image-2.5는 GPT-Image-2와 동일한 토큰 요율로 청구됩니다: 이미지 입력 토큰 100만 개당 $8.00, 이미지 출력 토큰 100만 개당 $30.00, 텍스트 입력 토큰 100만 개당 $5.00.
라이선스 — Qwen-Image-2.1은 2026년 9월 20일자 Qwen Research License Agreement에 따라 제공되며, 비상업적 용도로만 사용할 수 있습니다. GPT-Image-2.5는 C2PA 출처 정보와 출력물의 보이지 않는 워터마크를 갖춘 상용 API입니다.

그 목록의 한 행은 보기보다 근거가 얇습니다. OpenAI는 GPT-Image-2.5의 이미지당 가격을 공개하지 않고 토큰 요율만 공개하며, 이미지 토큰 소비량은 해상도와 품질 등급에 따라 달라집니다. 서드파티 측정값은 1:1 종횡비에서 낮음, 중간, 높음 설정의 1K, 2K, 4K 전반에 걸쳐 이미지당 대략 $0.0059에서 $0.712 사이의 범위를 제시합니다 — 이는 대략적인 규모 파악에 유용할 뿐, 견적으로 쓸 수는 없습니다. 예측을 하고 있다면, 다른 사람이 측정한 이미지당 수치가 아니라 토큰 수와 자신의 프롬프트 분포를 바탕으로 추정치를 세우세요.

A generated two-column scoreboard titled Qwen-Image-2.1 vs GPT-Image-2.5 - the scoreboard. Left column Qwen-Image-2.1 rows: Generation component 7B DiT; Transparency native RGBA; Resolution 2048 x 2048 native; Reference images up to 10; Price self-hosted GPU time; Licence non-commercial research only. Right column GPT-Image-2.5 rows: Generation component undisclosed; Transparency API parameter; Resolution up to 3840 x 2160; Reference images per the editing API; Price 8 and 30 dollars per 1M tokens; Licence commercial, C2PA and watermark. Footer: Qwen figures per the vendor model card, unaudited; OpenAI figures per the vendor API reference.

아무도 같은 열에 놓지 않는 두 가지 비용

이 비교가 단순한 답으로 정리되지 않는 이유는, 두 모델이 서로 다른 화폐로 청구서를 보내기 때문이며, 그 환율은 바로 당신 자신의 상황이기 때문입니다.

GPT-Image-2.5는 토큰당 과금하므로 요금계가 눈에 보이고 예측 가능하며 볼륨에 따라 선형적으로 확장됩니다. 트래픽이 알려진 제품에게 이는 진정한 장점입니다. 예산에 넣어둘 수 있고, 공급업체의 가격 인하가 같은 날 비용에 반영되니까요. 동시에 이는 탐색에 대한 세금이기도 합니다. 프롬프트의 열 번째 반복이 첫 번째와 같은 비용이 들기 때문입니다. input_fidelity 동작은 이것을 대표 요금만 보고 짐작하는 것보다 더 예리하게 만듭니다. API가 이미지 입력에 자동으로 높은 충실도를 적용할 수 있고, 이는 가격표를 가볍게 훑어볼 때 암시하는 것보다 더 많은 입력 토큰을 소비하므로, 편집 루프는 사람들이 흔히 인용하는 이미지당 수치보다 더 비쌉니다.

Qwen-Image-2.1은 두 속성을 모두 뒤집는다. 100번째 생성의 한계 비용은 전기다. 그 덕분에 반복 작업, 배치 백필, 그리고 프롬프트를 아직 탐색 중인 모든 작업에 더 나은 도구가 된다. 그것이 주지 않는 것은 재무 시트에 넣을 숫자다 — GPU가 바쁘든 유휴 상태든 비용을 지불하고 있다 — 그리고 출력물을 판매할 권리도 주지 않는다. Qwen Research License Agreement는 비상업적 연구 및 평가를 허용하며, 상업적 배포에는 Hangzhou Tongyi Laboratory Technology의 별도 라이선스가 필요하다고 명시한다. 그 라이선스의 공개된 가격도, 명시된 조건도 없다. 그것은 각주가 아니다. 상업적 파이프라인에서는 그것이 결정의 전부다.

두 번째 계약 없이 둘 다 실행하기

대부분의 팀에게 현실적인 답은 둘 중 하나가 아니라, 둘 다입니다. GPT-Image-2.5는 결과물이 고객에게 전달되고 토큰당 과금이 청구 항목이 되는 프로덕션 경로를 담당합니다. Qwen-Image-2.1은 투명 제품 샷의 변형 200개가 필요하지만 어느 벤더도 합리적인 가격에 그런 물량을 팔지 않을 탐색 경로를 담당합니다.

마찰은 두 가지가 완전히 다른 경로를 통해 온다는 점입니다. 하나는 API 키입니다. 다른 하나는 33GB 다운로드, Python 환경, 그리고 직접 소유한 GPU입니다. OrcaRouter는 호스팅된 절반을 담당합니다: 하나의 OpenAI 호환 엔드포인트 뒤에 200개 이상의 모델, 제공업체 정가가 마크업 없이 그대로 전달됨, 제공업체 전반에 걸친 자동 장애 조치, 대체 경로를 표현하기 위한 라우팅 DSL, 그리고 여러 모델을 하나의 호출로 결합하는 모델 퓨전. 이 모델에 대해 정확하게 말하는 것이 중요합니다 — 우리는 현재 GPT-Image-2.5를 라우팅하지 않습니다; 우리의 OpenAI 이미지 라우트는 GPT-Image-2, GPT-Image-1.5, GPT-Image-1-mini이며, 모두 OpenAI 정가입니다. 그리고 업스트림 제공업체가 gpt-image-2.5 식별자를 추가하는 날, 동일한 키로 코드 변경 없이 호출할 수 있습니다. 우리는 어떤 버전의 Qwen-Image 모델도 라우팅하지 않으므로, Qwen-Image-2.1은 우리 쪽에서 라우트가 아닙니다. 그동안 패스스루 가격이 제공하는 것은 OpenAI가 요금을 변경할 때 우리 쪽 숫자도 지연 없이 함께 움직인다는 점입니다.

승자가 아니라 조건으로 제시된 평결

결과물을 판매해야 한다면, 이건 접전이 아니다. GPT-Image-2.5는 둘 중 라이선스상 사용할 수 있는 유일한 모델이며, 토큰 미터기는 그에 대한 대가다. 결과물이 연구, 내부 툴링, 평가용이라면 Qwen-Image-2.1이 더 강력한 도구다 — 네이티브 2K, 샘플러에서 바로 나오는 알파, 참조 이미지 10장, 그리고 하드웨어 비용을 지불한 뒤에는 한계비용 제로. 둘 다 필요하면 둘 다 돌리고, 라이선스를 특정 작업이 어느 파이프라인으로 들어갈지 결정하는 경계로 취급하라.

이것을 바꿀 두 가지가 있습니다. Qwen-Image-2.1의 공개된 상업용 조건표가 나오면 현재 이 비교에서 가장 큰 역할을 하고 있는 라이선스 행의 격차가 사라질 것입니다. 그리고 Qwen-Image-2.1의 독립적인 이미지 리더보드 등재는 공급업체의 Qwen-Image-Bench 결과 — 60.28로, Nano Banana 2.0의 59.82와 GPT Image 1.5의 59.65를 앞서며 오픈 모델 중 1위 — 가 그것을 만든 연구소 밖에서도 유지되는지 알려줄 것입니다. 둘 다 아직 존재하지 않습니다. 그 전까지는 점수판이 아니라 라이선스와 미터를 기준으로 고르는 것이 정직한 권고입니다.

A screenshot of OrcaRouter's own model page for openai/gpt-image-2, captured September 21 2026, showing the model description as OpenAI's token-billed image model reached through the Images API, the /v1/images/generations endpoint, and the published list rates of $8.00 per 1M image input tokens and $30.00 per 1M image output tokens.A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.