Qwen-Image-2.1-Turbo를 위한 히어로 카드로, Qwen-Image-2.1의 8스텝 가속 체크포인트이며, 가중치와 함께 저장된 8스텝 스케줄, 기본값 CFG 1, 프리픽스 KV 캐시 재사용, 그리고 변경되지 않은 Qwen Research Licence를 보여줍니다
Engineering & Research

Qwen-Image-2.1-Turbo: 스케줄을 가중치로 옮긴 8단계 체크포인트

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

의 저장소는Qwen-Image-2.1-Turbo 2026년 10월 9일 Hugging Face에 나타났으며, 이에 대해 가장 흥미로운 점은 스텝 수가 아니다. bfloat16 가중치, 실행 가능한 코드가 담긴 모델 카드, 라이선스 파일, 8개의 쇼케이스 이미지, 그리고 릴리스를 알리는 Qwen-Image-2.1 프로젝트의 GitHub 뉴스 목록 한 줄이 있다. 자체 블로그 글도, 벤치마크 표도, 언론 보도 사이클도 없고, 약관에는 어떠한 변경도 없다. 그 약관은 Qwen-Image-2.1이 배포되는 조건이다. Turbo는 기본 모델 자체의 예제에서 사용하는 40단계가 아니라 8개의 디노이징 스텝으로 실행되는, 텍스트-투-이미지 생성 및 이미지 편집용 Qwen-Image-2.1의 가속 체크포인트다. 또한 조용히 샘플링 스케줄이 어디에서 오는지를 바꾸는데, 바로 그 부분이 코드를 깨뜨릴 것이다.

저장소에 실제로 무엇이 들어 있나요?

그 카드는 짧고 유난히 구체적이라, 확인된 것과 암시되는 것을 구분하기가 쉽다.

• 이것은 무엇인가: 이 카드는 Qwen-Image-2.1-Turbo를 "텍스트-이미지 생성과 8개의 디노이징 스텝을 사용한 이미지 편집을 위한 Qwen-Image-2.1의 가속 체크포인트"라고 설명합니다. 이는 새로운 아키텍처도 새로운 모델 패밀리도 아닙니다. 훨씬 짧은 샘플링 궤적을 중심으로 재포장된 동일한 7B 시각 생성 컴포넌트입니다.

• 로드 방식: Diffusers의 QwenImage21Pipeline을 통해 로드되며, 이는 베이스 모델이 사용하는 것과 동일한 파이프라인 클래스에서 체크포인트 이름만 바꾼 것입니다. 저장소 자체의 메타데이터에는 base_model: Qwen/Qwen-Image-2.1과 library_name: diffusers가 선언되어 있고, 두 번째 태그로 base_model:finetune:Qwen/Qwen-Image-2.1을 포함합니다. 이는 벤더가 이 모델을 형제 모델이 아니라 베이스 체크포인트를 파인튜닝한 것으로 설명하고 있음을 보여줍니다.

• 보존하는 사항: 동일한 7B 시각 생성 아키텍처, Qwen-Image-2.1과 동일한 일곱 가지 해상도 프리셋(정사각형 2048 × 2048, 4:3 비율 2400 × 1792, 3:4 비율 1792 × 2400, 3:2 비율 2528 × 1696, 2:3 비율 1696 × 2528, 16:9 비율 2752 × 1536 및 9:16 비율 1536 × 2752), 그리고 동일한 두 가지 기능 — 텍스트-이미지 생성 및 명령어 기반 이미지 편집. 이 카드의 쇼케이스는 카테고리별로 구성됩니다: 인물 사진, 인체 자세 및 동작, 투명 RGBA 생성, 타이포그래피 및 포스터 디자인, UI 및 정보 레이아웃, 단일 이미지 변환, 다중 참조 구성, 그리고 4-이미지 인테리어 구성.

• 포함하지 않은 것: 어떤 평가 수치도 없습니다. 카드에는 Turbo 체크포인트에 대한 Qwen-Image-Bench 점수가 없으며, 베이스 모델과의 비교도 없습니다. Qwen-Image-2.1 라인 어디에도 유일하게 존재하는 점수는 여전히 베이스 모델 자체의 Qwen-Image-Bench 결과뿐인데, 이는 이 체크포인트가 아니라 베이스 체크포인트에서 측정된 벤더 보고 수치입니다.

Screenshot of the Hugging Face model card for Qwen/Qwen-Image-2.1-Turbo, captured in English, showing the Text-to-Image, Diffusers, Safetensors and QwenImage21Pipeline tags, 25 likes, the qwen-research licence label, and the introduction text describing it as an accelerated checkpoint of Qwen-Image-2.1 for text-to-image generation and image editing with 8 denoising steps that loads directly with QwenImage21Pipeline in Diffusers

이제 스케줄은 가중치 속에 깃들어 있으며, 그것이 바로 진정한 변화다

카드에서 가장 중요한 문장이 바로 이것인데, 설치 안내 아래에 묻혀 있습니다: 체크포인트는 "권장 샘플링 스케줄을 포함하고 있으므로 스케줄러를 수동으로 구성할 필요 없이 바로 사용할 수 있습니다."

그다음, 샘플링 섹션에 분명히 명시된 결과: "권장되는 8단계 샘플링 스케줄은 체크포인트와 함께 저장되며 자동으로 로드됩니다. num_inference_steps만 설정한다고 해서 이를 덮어쓰지는 않습니다."

이 내용을 두 번 읽어 보세요. 대부분의 사람들이 머릿속에 지니고 있는 Diffusers 관례에서는 스텝 수가 호출 시점 인자입니다. 즉, 기본 모델에는 num_inference_steps=40을, 증류된 체크포인트에는 num_inference_steps=4를 전달하며, 파이프라인은 이에 맞는 스케줄을 구성합니다. Qwen-Image-2.1-Turbo는 그 관례를 깨뜨립니다. 8스텝 스케줄은 요청 매개변수가 아니라 체크포인트 메타데이터입니다. 다른 정수를 전달해도 파이프라인은 여전히 저장된 스케줄을 사용합니다. 모델 카드에 따르면 이를 재정의하는 유일한 방법은 호출 시점에 명시적인 sigmas 인자를 전달하는 것이며, 다른 스케줄은 "이 체크포인트에 대해 평가되지 않았습니다"라고 덧붙입니다.

실질적인 결과는 재현 함정이다. Qwen-Image-2.1 모델 카드에서 그대로 가져와 Turbo 리포지토리에 적용한 코드는 실행은 되고, 오류도 내지 않지만, Turbo 쇼케이스가 보여주는 출력을 만들어내지는 못한다. 또한 파이프라인에 구성된 샘플링 시그마를 이해하는 Diffusers 빌드도 필요하다 — 이 지원은 Diffusers PR #14950에서 추가되었는데, 이 글을 쓰는 시점에는 태그된 릴리스가 아니라 소스 트리에 들어 있다. 명시된 설치 구성은 CUDA 호환 PyTorch 빌드에 더해 git+https://github.com/huggingface/diffusers.git, transformers>=5.17.0, accelerate, pillow이다.

두 가지 추가 기본값은 사용자가 설정한 것이 아니라 카드에서 비롯됩니다: 생성은 기본적으로 CFG 1을 사용하고, 프리픽스 KV 캐싱은 "디노이징 단계 전반에 걸쳐 텍스트와 참조 이미지 컨텍스트를 재사용합니다." CFG 1은 classifier-free guidance 패스를 수행하지 않는다는 뜻으로, 이는 궤적이 붕괴하지 않으면서 단축되는 방식의 상당 부분을 차지합니다 — 또한 카드가 guidance-scale 권장 사항을 굳이 제시하지 않는 이유이기도 합니다. 프리픽스 KV 캐시는 기본 모델로부터 물려받은 것입니다: Qwen-Image-2.1이 텍스트와 참조 이미지 컨텍스트를 재사용하기 위해 사용하는 것과 동일한 메커니즘으로, 이는 디노이징 루프가 고작 여덟 번의 반복에 불과할 때 덜 중요해지는 것이 아니라 더 중요해집니다.

체인지로그에서 발표되고, 리포지토리로 제공됩니다.

이번 릴리스에 어울리는 프레이밍은 "출시"도, "유출"도 아니다. 그것은 뉴스 목록에 날짜가 적힌 한 줄이 있는, 체크인된 아티팩트다. Qwen-Image-2.1 프로젝트의 GitHub 뉴스 목록에는 2026.10.09 자 항목이 두 개 실려 있다. 하나는 Turbo 체크포인트에 관한 것이고, 다른 하나는 Qwen-Image-2.1 Pro와 Turbo API가 Alibaba Cloud Model Studio에서 "이제 공식적으로 라이브"라고 알리는 항목이다. 별도의 Turbo 블로그 게시물은 없다. 카드에 있는 블로그 링크는 2026년 9월 20일 자 Qwen-Image-2.1 블로그를 가리킨다.

그것을 세 주 전에 베이스 모델이 등장한 방식과 대조해 보세요. Qwen-Image-2.1의 뉴스 목록에는 가중치에 대한 날짜 표시된 항목이 있고, 같은 날 다섯 개가 더 있습니다: PR #14804를 통한 첫날부터의 Diffusers 지원, 첫날부터의 네이티브 ComfyUI 지원, 단계별 실행과 프리픽스 KV 캐싱, FP8 양자화, 텐서 병렬 처리를 갖춘 vLLM-Omni 지원, Cache-DiT와 CUDA 그래프를 갖춘 SGLang 지원, 그리고 LightX2V의 첫날 가속입니다. Turbo 체크포인트에는 그런 것이 하나도 없습니다. 그 생태계 항목들은 하나같이 Qwen-Image-2.1을 가리킵니다.

Screenshot of the GitHub repository page for QwenLM/Qwen-Image-2.1, captured in English, showing the file listing with the README and LICENSE and the most recent commit message reading 'docs: announce Qwen-Image-2.1-Turbo and API availability' committed 27 minutes ago

리포지토리 카운터는 장점보다는 성숙도에 대해 같은 이야기를 들려주며, 이는 판정이 아니라 스냅숏이다. 이 글을 쓰는 시점에서 Qwen-Image-2.1은 지난 한 달 동안 다운로드 122,311회와 좋아요 3,142개를 기록하는 반면, 출시된 지 몇 시간밖에 되지 않은 Qwen-Image-2.1-Turbo는 좋아요 33개를 기록한다. 다운로드는 후행 지표이며 Turbo 수치는 앞으로 변할 것이다. 오늘 이 수치가 알려주는 것은 아직 아무도 그것을 실행해 볼 시간이 없었다는 것뿐이다.

8단계가 알려주지 않는 것

걸음 수는 가장 눈에 띄는 수치이자, 이번 발표에서 가장 쓸모없는 숫자입니다. 그 이유는 세 가지이며, 분명히 짚고 넘어갈 만합니다.

• 스텝은 초가 아닙니다. 카드도 저장소도 Turbo 체크포인트의 처리량, 지연 시간, 메모리를 공개하지 않습니다. 7B bfloat16 모델에서 2048 × 2048로 8스텝을 실행하는 것은 더 작은 모델에서 8스텝을 실행하는 것과는 다른 작업량이며, 카드에는 어떤 하드웨어에서 측정했는지도 나와 있지 않은데, 이는 애초에 측정값 자체를 보고하지 않기 때문입니다.

• 아직 품질 기준점이 존재하지 않습니다. Turbo에 대해 공개된 점수도 없고, 기본 체크포인트와의 나란한 비교도 없으며, 둘 중 어느 것에 대한 독립적인 평가도 없습니다. 쇼케이스 이미지는 벤더가 권장 설정에서 선택한 출력물입니다. 이는 모델이 이미지를 생성한다는 증거일 뿐, 단계 축소를 위해 얼마나 많은 품질이 희생되었는지에 대한 증거가 아니며, 벤치마크를 대체할 수도 없습니다.

• 메모리 지침이 없습니다. 베이스 모델의 카드에는 메모리 최적화 섹션이 있습니다. Turbo 카드는 설치, 생성, 편집, 샘플링, 종횡비, 정지를 문서화합니다. 이 모델을 서빙할 계획이라면, 측정할 계획을 세우세요.

Summary card for Qwen-Image-2.1-Turbo with two columns: the left column headed 'Stated in the repository' listing 8 denoising steps, schedule saved with the checkpoint, CFG 1 by default, prefix KV caching across steps, the same seven resolution presets and the Qwen Research Licence; the right column headed 'Not stated anywhere' listing no quality score for this checkpoint, no speed or memory figure and no day-zero framework support

라이선스는 변경되지 않았으며, 이는 출시하는 모든 이에게 가장 중요한 소식입니다

Qwen-Image-2.1-Turbo는 Qwen Research License Agreement에 따라 라이선스가 부여됩니다. 저장소의 메타데이터에는 license: other, license_name: qwen-research, license_link: LICENSE라고 표기되어 있으며, 저장소에는 가중치와 함께 LICENSE 파일이 존재합니다. 모델 카드의 라이선스 섹션 자체는 한 문장으로, 해당 모델은 Qwen Research License Agreement에 따라 라이선스가 부여된다고 명시하고 있습니다.

가속화가 그 점을 바꾸지는 않습니다. 기본 모델에 대한 비상업적 연구 라이선스는 체크포인트가 더 빠르다고 해서 상업적 라이선스가 되지 않으며, Turbo 저장소는 동일한 조건 아래 별도로 받는 다운로드입니다. 8단계 생성에 대한 관심이 그것이 모델을 제품에 넣을 만큼 저렴하게 만들어 주기 때문이라면, 제약은 단계 수가 아니라 라이선스입니다. 그 질문은 벤더에 문의해야 하며, 이 저장소 어디에도 답이 없습니다.

호스팅 경로, 그리고 그 안에서 OrcaRouter가 차지하는 위치

OrcaRouter는 Qwen-Image-2.1-Turbo를 라우팅하지 않으며, Qwen-Image-2.1도 라우팅하지 않습니다. 둘 다 우리 카탈로그에 없으며, 이 글의 어떤 내용도 이들을 제공하겠다는 제안으로 해석되어서는 안 됩니다. 둘 중 하나를 원하신다면, 경로는 공급업체 자체 API와 여러 서드파티 플랫폼이거나, Turbo 체크포인트의 저장된 스케줄을 로드할 수 있을 만큼 새로운 Diffusers 빌드와 함께 사용하는 가중치 자체입니다.

우리가 전면에 내세우는 것은 호스팅 이미지 라인이며, 자체 호스팅 실험과 나란히 비교해 볼 수 있도록 그 라인에 무엇이 있는지 알아둘 가치가 있습니다. OrcaRouter는 200개 이상의 모델을 OpenAI 호환 단일 엔드포인트 뒤에 제공업체 정가 그대로, 마크업 없이 배치합니다 — 따라서 벤더가 가격을 인하하면 재가격 책정 작업을 기다릴 필요 없이 같은 날 우리 쪽에서 바로 반영됩니다. 제공업체의 성능이 저하될 때 자동 페일오버를 추가하고, 요청이 사용할 수 있는 모델과 제공업체를 표현하기 위한 라우팅 DSL, 그리고 여러 모델을 단일 호출로 구성하기 위한 모델 퓨전을 제공합니다. 우리가 라우팅하는 이미지 모델은 OpenAI GPT-Image 제품군, fast 및 ultra 변형을 포함한 Google의 Imagen 4 등급, Google의 Gemini 이미지 프리뷰 엔드포인트, 그리고 xAI Grok Imagine 이미지 엔드포인트입니다.

결정의 솔직한 형태: 검사하고 수정할 수 있는 8단계 7B 오픈 가중치 모델이 필요하다면 Turbo는 자체 호스팅 작업이며, 라이선스가 가장 먼저 해결해야 할 문제입니다. 이번 주에 프로덕션에서 이미지 엔드포인트가 필요하다면 그것은 다른 구매이며, 바로 우리가 판매하는 것입니다.

말할 수 있는 것과 말할 수 없는 것

• 저장소 자체에서 확인됨: 텍스트-투-이미지 생성과 이미지 편집을 8개의 디노이징 단계로 수행하는 Qwen-Image-2.1의 7B 가속 체크포인트; num_inference_steps가 재정의하지 않는 저장된 샘플링 스케줄; 기본적으로 CFG 1; 텍스트 및 참조 이미지 컨텍스트를 위한 prefix KV 캐싱; 기본 모델과 동일한 일곱 가지 해상도 프리셋; QwenImage21Pipeline 로드 경로; 프로젝트 자체 뉴스 목록의 2026년 10월 9일자 릴리스 항목; 그리고 기본 모델과 동일한 Qwen Research License Agreement.

• 어디에도 입증되지 않은 사항:Turbo 체크포인트에 대한 품질 측정, 속도나 메모리 측정, 그것이 파생된 기반 체크포인트에 대한 독립적 평가, 연구 라이선스를 넘어서는 상업적 조건에 관한 진술, 그리고 Qwen-Image-2.1이 출시와 함께 제공했던 것과 같은 day-zero 프레임워크 지원.

인용될 숫자는 여덟 단계입니다. 가중치로 옮겨진 스케줄은 첫 실행이 무엇인가를 재현할 수 있는지를 결정하는 세부 사항입니다.