기사 'Qwen-Image 2.1, 조용히 출시되다'를 위한 생성된 히어로 카드로, 'Qwen-Image 2.1'이라는 레이블과 7B 파라미터 표시가 있는 둥근 카드가 있고, 그 옆에 'PE-T2I'와 'PE-I2I'라는 레이블이 붙고 9B로 표시된 두 개의 더 작은 카드가 있으며, '조용히 출시됨, 예고 없이 출시된 것은 아님'이라고 적힌 리본이 표시됩니다.
Engineering & Research

Qwen-Image 2.1, 조용히 출시되다: Qwen/Qwen-Image-2.1-PE-I2I 속살 들여다보기

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 9월 20일, Qwen-Image 팀은 다음을 공개했습니다: Qwen-Image 2.1을 Hugging Face와 ModelScope에 — 가중치, 라이선스 파일, 모델 카드와 블로그 게시물까지 모두 같은 날 안에, 거의 사전 예고도 없이. 헤드라인 숫자는 시각 생성 구성 요소의 7B 파라미터입니다. 아직 거의 아무도 열어보지 않은 부분은 Qwen/Qwen-Image-2.1-PE-I2I입니다. 이미지 모델과 함께 출시된 두 개의 프롬프트 재작성 체크포인트 중 하나입니다. 이것은 이미지 모델이 아닙니다. 이것은 이미지 모델이 보기도 전에 사용자의 지시가 무엇을 의미하는지 결정하는 요소이며, 이번 릴리스에서는 출력이 돌아오는 언어를 조용히 설정하는 구성 요소입니다.

여기서 "조용히 출시됨"이 실제로 의미하는 것

표현이 중요하다. 어느 쪽으로든 과장하기 쉽기 때문이다. Qwen-Image 2.1은 유출된 것도 아니었고, 예고 없이 나온 것도 아니었다. 2026년 9월 20일자 벤더 블로그 게시물이 있고, 같은 날짜가 적힌 뉴스 섹션이 있는 GitHub 저장소가 있으며, 실제 가중치 다운로드도 제공되었다. 다만 사전 예열은 없었다. 유일한 사전 신호는 ModelScope를 통해 얼리 액세스 슬롯 50개를 제공한다는 9월 17일자 공지였고, 선정된 테스터들에게는 9월 29일까지 샘플이나 리뷰를 게시해 달라고 요청했다. 3일 후 가중치는 공개되었다. 기조연설도, 벤치마크 엠바고도, 언론 보도 주기도 없었다.

이것은 특정한 종류의 릴리스이며, 정확히 이름을 붙일 가치가 있습니다. 벤더가 이를 발표했습니다. 벤더가 이를 홍보하지는 않았습니다. 이 위에 구축할지 결정하려는 사람이라면 누구에게나, 실질적인 결과는 이렇습니다: 아직 기댈 수 있는 독립적인 평가가 없습니다 — 벤더 자체 자료와, 앞으로 일주일 동안 얼리 액세스 테스터들이 공개하는 내용뿐입니다. 누군가 Alibaba 외부에서 이를 공개적으로 실행하기 전까지는, 이 기사의 모든 품질 관련 주장은 모델 카드와 블로그 게시물에서 나온 것으로 간주하십시오.

PE-I2I 체크포인트가 흥미로운 이유

Qwen-Image 2.1 릴리스에는 하나가 아니라 다운로드 가능한 세 가지 구성 요소가 포함되어 있습니다:

Qwen/Qwen-Image-2.1 — 이미지 모델 자체입니다. 비주얼 생성 컴포넌트에 70억 개 파라미터를 갖춘 32레이어 단일 스트림 DiT, Qwen3-VL 8B 텍스트 인코더, 그리고 16× 공간 압축을 지원하는 64채널 RGBA VAE로 구성됩니다. 세 컴포넌트를 합치면 약 33GB입니다.

Qwen/Qwen-Image-2.1-PE-T2I — 텍스트-투-이미지용 프롬프트 재작성기입니다. 파인튜닝된 Qwen3.5-VL 9B, 약 18.8 GB.

Qwen/Qwen-Image-2.1-PE-I2I — 이미지-투-이미지 편집을 위한 프롬프트 재작성기입니다. 또한 파인튜닝된 Qwen3.5-VL 9B로, 역시 약 18.8 GB이며, 9월 20일 08:46 UTC에 Hugging Face에 업로드되었습니다.

"PE"는 프롬프트 향상입니다. I2I 변형은 모호한 편집 지시와 하나 이상의 입력 이미지를 받아, 이를 다운스트림 디퓨전 모델을 위한 정확하고 모호하지 않은 편집 지시문으로 재작성합니다. 리포지토리 자체 설명은 입력 형태에 대해 직설적입니다: 입력 이미지가 항상 존재하므로, 이는 항상 이미지 편집 작업이며 결코 무에서 시작하는 텍스트-투-이미지가 아닙니다. 재작성 코드는 prompt_rewrite/ 폴더에 있습니다. 이 폴더는 두 체크포인트인 --task t2i 또는 --task edit를 모두 처리하며, transformers 경로, vLLM 경로, 상시 서비스용 serve.shclient.py, 그리고 공유 로직용 pe_core.py를 갖추고 있습니다.

이것이 들리는 것보다 더 중요한 이유는 다음과 같습니다. 이미지 모델은 당신이 의도한 바를 전혀 모릅니다. 그것은 프롬프트가 문자 그대로 말하는 바에 대한 개념을 가지고 있으며, 텍스트 인코더가 그것을 어떻게 처리하느냐에 따라 가중치가 부여됩니다. 그 앞에 있는 리라이터는 모호성이 해결되는 곳 — 또는 해결되는, 잘못된 방식으로, 일관되게, 생성하는 모든 이미지에서 해결되는 곳입니다. 최대 10개의 참조 이미지를 사용하는 통합 생성 및 편집 모델에서는 그 해결 단계에 평소보다 더 많이 잘못될 여지가 있습니다.

시스템 프롬프트가 바로 언어 결정이 있는 곳입니다.

PE-I2I 저장소는 system_prompt.txt를 가중치와 함께 제공하는데, 한 가지 점에 관해서는 유난히 명시적이다: 바로 언어다. 그 파일을 직접 읽어 보면, 재작성기는 두 가지 별개의 언어 결정을 내리고, 그것들을 서로 분리해 유지하도록 지시받는다.

설명 언어. 재작성자가 편집 내용을 설명하기 위해 작성하는 산문은 사용자의 지시 언어를 따릅니다 — 중국어 지시에는 중국어 설명, 영어 지시에는 영어 설명, 일본어·한국어·프랑스어·태국어 또는 그 밖의 다른 언어로 된 지시에는 영어 설명이 제공됩니다.

렌더링된 텍스트 언어. 출력 이미지에 실제로 그려질 텍스트는 큰따옴표 안에 담겨 있으며, 엄격한 우선순위에 따라 결정됩니다: 첫째, 사용자가 정확한 텍스트나 대상 언어를 지정하면 이를 문자 그대로 따릅니다; 둘째, 입력 이미지에 이미 텍스트가 있으면 기존 텍스트의 주된 언어와 일치시킵니다 — 지침이 다른 언어로 작성되어 있더라도 마찬가지입니다; 셋째, 이미지에 텍스트가 없고 언어도 지정되지 않았다면 지침 자체의 언어를 사용하며, 특히 영어로 강제하지 않습니다.

그 프롬프트는 작업 예시를 통해 두 번째 규칙을 강화한다 — 대부분 태국어인 이미지를 언어를 명시하지 않은 영어 지시문으로 편집하면 태국어 텍스트를 렌더링해야 한다 — 그리고 두 가지 제약을 추가한다: 렌더링된 텍스트는 중국어/영어 쌍이 아니라 단일 언어여야 하며, "사양서(spec sheet)" 또는 "스토리보드(storyboard)" 시각 장르는 레이아웃과 타이포그래피를 통해 달성되는 것이지, 렌더링된 레이블을 영어로 바꾸는 방식으로 달성되는 것이 결코 아니다.

이것은 작은 엔지니어링 작업이지만 파급 효과가 큽니다. 포장 텍스트가 중요한 시장을 위해 제품 이미지를 생성하는 경우, "재작성기가 기존 라벨 언어를 보존한다"와 "재작성기가 친절하게 모든 것을 영어로 번역한다"의 차이는 사용 가능한 자산과 거부된 자산의 차이입니다. 그리고 이 동작은 리포지토리에 포함된 시스템 프롬프트에 명시되어 있기 때문에, 여러분은 그것을 읽고, 차이를 비교하고, 재정의할 수 있습니다 — 이는 폐쇄형 호스팅 모델 내부의 동일한 단계에 대해서는 말할 수 없는 일입니다.

무엇이 확인되었고, 무엇이 확인되지 않았는가

여기서 경계를 정확히 하는 것이 바로 ‘우리가 아는 것’을 정리한 글의 핵심이다.

리포지토리와 모델 카드에서 확인됨 — 7B / 32레이어 단일 스트림 DiT 수치; Qwen3-VL 8B 텍스트 인코더; 16× 공간 압축의 64채널 RGBA VAE; 텍스트에는 토큰 수준 인과 마스크를, 이미지 생성에는 청크 수준 양방향 마스크를 사용하는 블록 인과 어텐션; 카드에 따르면 체크포인트가 다음을 포함할 때 활성화된다고 하는 프리픽스 KV 캐시 재사용: causal_condition: true (실제로 포함함); 오일러 이산 스케줄링을 사용한 플로 매칭; 40 추론 스텝에서 2048×2048을 기본으로 하는 네이티브 2K 출력; 문서화된 7가지 종횡비 프리셋; 최대 10장의 참조 이미지 지원; 원, 페인트 주석 또는 별도 마스크를 통한 로컬 편집; 그리고 RGBA 생성, 투명 레이어 편집 및 RGB 사진에서의 피사체 추출.

라이선스에 대해 확인했고, 여기가 바로 위험한 지점입니다 — 이 릴리스는 2026년 9월 20일자 Qwen Research License Agreement에 따라 제공되며, 이 계약은 "비상업적 목적으로만" 권리를 부여하고 상업적 사용에는 공급업체로부터 별도의 라이선스를 요청해야 한다고 명시합니다. 이는 Apache 2.0으로 배포된 이전 Qwen-Image 라인과 비교할 때 중대한 변경입니다. 이를 바탕으로 제품을 만들기 전에, 만들고 나서가 아니라, 라이선스 파일을 읽으십시오.

확인되지 않음 — 아직 독립적인 벤치마크 점수가 존재하지 않습니다. 블로그 게시물은 Qwen-Image-Bench 비교 차트를 언급하지만, 그 안의 수치는 벤더 자체의 것이며 작성 시점 기준으로 제3자가 재현한 바 없습니다. Qwen-Image 2.1에 대해 공개된 호스팅 엔드포인트 가격이 없고, 상업용 라이선스에 대한 명시된 조건도 없습니다. 또한 허용적 라이선스를 가진 변형 제품이 뒤따를지에 대해서도 아직 언급이 없습니다.

존재하는 단 하나의 독립적인 데이터 포인트는 Qwen Ambassador 프로그램을 통해 접근 권한을 얻고 최종 릴리스 가중치를 ModelScope Studio 인터페이스로 실행한 테스터의 직접 사용 기반 얼리 액세스 리뷰입니다. 그 리뷰는 텍스트-투-이미지의 경우 대략 10–15초, 편집의 경우 18–23초의 생성 시간, 카메라 위치 프리셋과 다중 캐릭터 역할 할당에서의 강력한 성능, 그리고 알아둘 가치가 있는 특정 실패 모드를 보고했습니다: 다중 참조 일관성이 입력 이미지 약 세 장부터 저하되었고, 측면 각도에서 사이드 포니테일 배치가 중앙 포니테일로 무너졌습니다. 이는 얼리 액세스 UI에서 타이머 표시도 없이 진행된 단 한 명의 리뷰어입니다. 유용한 신호입니다. 벤치마크는 아닙니다.

A generated single-column spec scoreboard titled 'Qwen-Image 2.1 — the scoreboard' listing rows: Generation component 7B, 32-layer single-stream DiT; Text encoder Qwen3-VL 8B; Licence Qwen Research License, non-commercial only; Native output 2048 x 2048 at 40 steps; Reference images up to 10; Transparency native RGBA; Independent score none yet. Footer reads 'Figures per the Qwen vendor model card, unaudited; no third-party reproduction at the time of writing.'

데이제로 프레임워크 지원, 이것이 조용한 좋은 소식이다

{{1}}출시일{{/1}}에 모델이 어디에 자리 잡는지는 {{2}}모델 카드{{/2}}보다 그 모델을 실제로 쓸 수 있는지에 대해 더 많은 것을 알려준다. 그리고 Qwen-Image 2.1은 폭넓게 자리 잡았다:

DiffusersQwenImage21Pipeline은 출시 당일 병합되었으며, 모델 저장소에는 diffusers:QwenImage21Pipeline 태그가 있습니다.

ComfyUI — 텍스트-투-이미지 및 이미지 편집 워크플로 템플릿을 갖춘 네이티브 데이제로 지원과 별도의 Comfy 호환 가중치 저장소를 제공합니다.

vLLM-Omni — 단계별 실행, 프리픽스 KV 캐싱, CUDA Graph 디코딩, FP8 양자화, 텐서/Ulysses 병렬 처리.

SGLang — 네이티브 지원 풀 리퀘스트가 9월 17일에, 가중치 공개를 3일 앞두고 병합되었으며, DiT, RGBA VAE, Qwen3-VL 컨디셔닝, 여러 참조 이미지, RGBA 입력/출력을 포괄하고, H200, B200, RTX PRO 6000, RTX 5090 및 RTX 4090에서 검증되었습니다.

LightX2V — 출시 당일 가속 지원, ROCm을 통한 AMD Radeon, FlagOS를 통한 멀티칩 지원까지 제공합니다.

사전 공개된 SGLang 풀 리퀘스트가 바로 그 단서다. 가중치보다 먼저 병합되는 프레임워크 지원은 서빙 경로가 나중에 모델 카드로부터 작성된 것이 아니라 체크포인트를 상대로 테스트되고 있었음을 의미한다. 옆에 17.5 GB짜리 텍스트 인코더가 붙어 있는 7B 구성 요소라면, 그것은 주말 내내 야크 셰이빙을 하는 것과 오후 한나절의 차이다.

제한된 GPU의 경우, 모델 카드에서는 CPU 오프로드를 권장합니다 — pipe.enable_model_cpu_offload() — 이는 해결책이라기보다는 표준적인 탈출구입니다. 33GB 다운로드는 DiT가 아니라 텍스트 인코더가 대부분을 차지하며, 디퓨전 트랜스포머 자체는 약 14GB로 번들의 더 작은 절반에 불과합니다.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 20 2026, showing the 2026/09/20 date, the headline 'Compact, Efficient, and Unified Image Creation', the 'Now open weights' hero banner, GitHub, Hugging Face and ModelScope buttons, and the 7B parameter figure.

실용적인 읽을거리

오늘 Qwen-Image 2.1을 사용해 보고 싶다면, 솔직한 입장은 이렇습니다. 로컬에서, 연구 라이선스 아래에서 사용할 수 있지만, 독립적인 벤치마크도 없고 상업적 권리도 없습니다. 이는 평가에는 합리적인 거래이고 프로덕션 파이프라인에는 나쁜 거래이며, 그 둘 사이의 간극이 바로 라이선스 파일이 결정하는 것입니다.

며칠 된 체크포인트에 프로덕션 경로를 확정하고 싶지 않으면서 이미지 모델을 벤치마킹하려는 팀에게, 라우팅 계층은 바로 그 위험을 억제하는 곳이다. OrcaRouter는 200개 이상의 모델을 하나의 OpenAI 호환 엔드포인트 뒤에 배치하고, 공급자 정가에 마크업 없이 제공하며, 공급자 간 자동 장애 조치를 지원한다. 따라서 검증되지 않은 모델은 이미 신뢰하는 모델을 대체하는 대신 그 모델과 나란히 하나의 라우트 뒤에 둘 수 있다 — 그리고 정가가 그대로 전달되므로, 라우팅된 모든 모델에 대한 공급업체의 가격 인하는 계약 변경을 기다리지 않고 같은 날 바로 적용된다. Qwen-Image 2.1은 이 글을 작성하는 시점에 우리가 라우팅하는 모델에 포함되어 있지 않으며, 이 글은 그렇다고 암시하지도 않을 것이다. 우리가 실제로 라우팅하는 것은 그 주변의 이미지 라인 — OpenAIGPT-Image 제품군, Google의 Imagen 4 등급 및 Gemini 이미지 프리뷰, 그리고 xAI의 Grok Imagine 이미지 엔드포인트 — 이며, 이는 여러분이 자체 하드웨어에서 이 신규 모델을 평가하는 동안 장애 조치 경로가 나올 수 있는 곳이다.

풀리지 않은 질문은 저장소가 답할 수 없는 질문이다. Alibaba는 연구 전용 라이선스 아래 7B 오픈 웨이트 이미지 모델을 출시했고, 같은 해에 가중치가 전혀 없는 폐쇄형 호스팅 모델로 Qwen-Image 3.0을 출시했다. 두 번의 출시, 네 달 차이를 둔 정반대의 두 베팅. 이 둘 중 어느 쪽이 차기 Qwen 이미지 모델의 형태를 결정할지 — 그리고 연구 라이선스가 언젠가 기업이 사용할 수 있는 무언가로 전환될지 — 가 지켜볼 지점이다. 이제 가중치는 Hugging Face에 있으며, 누구나 라이선스 파일을 직접 읽어볼 수 있다.

A screenshot of the Hugging Face model card for Qwen/Qwen-Image-2.1, captured September 20 2026, showing the Like and Follow counts, the tags Text-to-Image, Diffusers, Safetensors, QwenImage21Pipeline, rgba, the qwen-research licence, 7B params, BF16 tensor type, and the notice that the model is not deployed by any inference provider.