
Qwen-Image 2.1 vs LLaDA-Image-Turbo: 두 개의 오픈 이미지 모델, 두 가지 매우 다른 라이선스
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
두 개의 오픈 가중치 이미지 모델이 같은 3주 안에 등장했습니다. Qwen-Image 팀은 2026년 9월 20일에 Qwen-Image 2.1을 공개했습니다. 가중치, 라이선스 파일, 모델 카드, 블로그 글까지 모두 같은 날에 나왔고, 그 전에 거의 아무런 예고도 없었습니다. 그보다 16일 전인 2026년 9월 4일, inclusionAI(앤트 그룹의 연구소)는 LLaDA-Image-Turbo를 공개했습니다. 런칭 글도, 보도자료도, 그 어떤 형태의 발표도 없이 말이죠. 둘 다 오늘 다운로드할 수 있습니다. 둘 다 독립적인 벤치마크 점수는 단 하나도 없습니다. 그리고 어느 쪽을 실제로 사용할 수 있을지를 결정하게 될 차이는 두 모델 카드 어디에도 없습니다. 그 차이는 서류에 있습니다. Qwen-Image 2.1은 상업적 사용을 완전히 금지하는 연구용 라이선스로 배포됩니다. LLaDA-Image-Turbo는 모든 리포지토리 어디에도 라이선스가 명시되어 있지 않은 채로 배포됩니다.
라이선스 문제가 먼저다. 그것만이 명확한 답을 가진 유일한 사안이기 때문이다.
이 비교에서 다른 모든 것은 잠정적이지만 이것은 그렇지 않기 때문에, 여기서 시작하세요.
• Qwen-Image 2.1은 2026년 9월 20일자 Qwen Research License Agreement에 따라 출시되었으며, 이 계약은 "비상업적 목적으로만" 권리를 부여하고 상업적 사용에는 벤더로부터 별도로 요청해야 하는 라이선스가 필요하다고 명시하고 있습니다. 이는 Apache 2.0으로 배포되었던 이전 Qwen-Image 제품군과 비교할 때 중대한 변화입니다. 이는 명확합니다. 읽고, 평가하고, 벤치마크하고, 이에 대해 글을 쓸 수는 있습니다. 하지만 제품에 넣을 수는 없습니다.
• LLaDA-Image-Turbo라이선스를 전혀 명시하지 않습니다. 허용형 라이선스도, 제한형 라이선스도, 자리 표시자도 아닙니다. 라이선스가 없는 저장소는 어떤 법적 의미에서도 "자유롭게 사용 가능"한 것이 아닙니다 — 기본적으로 모든 권리가 보유되며, 이는 Qwen의 연구 라이선스보다 더 엄격한 입장이지, 더 느슨한 입장이 아닙니다. 이를 기반으로 구축할 계획이라면, 그건 README가 아니라 연구소에 물어볼 문제입니다.
아이러니는 분명히 말할 가치가 있다: 공식적이고 제한적인 라이선스를 달고 등장한 모델이 오늘날 당신이 계획을 세울 수 있는 모델이다. 왜냐하면 당신이 정확히 어디에 서 있는지 알기 때문이다. 라이선스가 없는 모델은 그럴 수 없는 모델이다.

두 모델이 실제로 무엇인지
라이선스 문제를 걷어내고 보면, 이 둘은 각기 다른 이유로 만들어진, 진짜로 서로 다른 두 가지 설계다.
• 아키텍처 — Qwen-Image 2.1은 시각 생성 컴포넌트에 7B 파라미터를 갖춘 32계층 단일 스트림 확산 트랜스포머로, Qwen3-VL 8B 텍스트 인코더와 16× 공간 압축의 64채널 RGBA VAE를 사용하며, 번들 전체 용량은 약 33GB입니다. LLaDA-Image-Turbo는 6B 규모의 통합 생성·편집 모델로, 베이스 모델에 별도의 편집 경로를 더한 방식이 아니라 하나의 가중치 세트가 두 작업을 모두 수행합니다.
• 추론 스텝 — Qwen-Image 2.1은 flow matching과 Euler discrete 스케줄링을 사용하여 40스텝에서 2048×2048을 기본값으로 설정합니다. LLaDA-Image-Turbo는 Twin-DMD를 통해 2–4스텝으로 증류되었으며 4스텝을 권장하고, Base 모델의 5.0에 비해 guidance scale 1.0에서 실행됩니다.
• 정밀도 옵션 — Qwen-Image 2.1은 vLLM-Omni 경로를 통해 FP8 양자화 지원을 공개합니다. LLaDA-Image-Turbo는 BF16과 FP8 체크포인트를 각각 별도의 다운로드로 제공합니다.
• 레퍼런스 컨디셔닝 — Qwen-Image 2.1은 최대 10개의 레퍼런스 이미지를 입력받고, 원형 표시, 페인팅 주석 또는 별도 마스크를 통한 국소 편집을 지원하며, 투명 레이어 편집이 가능한 네이티브 RGBA를 생성합니다. LLaDA-Image-Turbo의 카드에는 레퍼런스 이미지 상한이 공개되어 있지 않습니다.
• 어텐션 — Qwen-Image 2.1은 블록 인과적 어텐션을 사용합니다. 즉, 텍스트에는 토큰 수준의 인과적 마스크를, 이미지 생성에는 청크 수준의 양방향 마스크를 적용하며, 체크포인트에 causal_condition: true가 포함된 경우에는 프리픽스 KV 캐시를 재사용합니다. LLaDA-Image-Turbo의 카드에는 마스킹 방식이 이처럼 자세히 설명되어 있지 않습니다.
• 라이선스 — 연구 전용 및 명시적, 미신고와 대비.
스텝 수가 파라미터 수와 함께 무엇을 의미하는지 주목하세요. Qwen-Image 2.1은 열 배나 많은 스텝으로 실행되는 더 큰 모델이고, LLaDA-Image-Turbo는 소수의 스텝으로 증류된 더 작은 모델입니다. 이는 이미지 생성 비용이 어디에 존재하는지에 대한 정반대의 베팅이며, 올바른 답은 여러분의 병목이 이미지당 GPU 초인지, 아니면 이미지가 어떤 모습일 수 있는지의 상한인지에 전적으로 달려 있습니다.
속도의 경제학: 4에 맞선 40걸음
Turbo라는 이름은 여기서 실제로 제 역할을 하고 있다. Twin-DMD 증류는 확산 궤적을 몇 번의 큰 도약으로 축소하는데, 이 덕분에 LLaDA-Image-Turbo는 Base 모델이 기존의 스케줄을 요구하는 상황에서도 4스텝으로 실행될 수 있다. guidance 1.0에서는 또한 일반적으로 스텝당 순전파 횟수를 두 배로 늘리는 classifier-free guidance를 생략하므로, 실질적인 격차는 40 대 4라는 숫자만 보여주는 것보다 더 크다.
그것으로 얻는 것은 처리량과 예측 가능성입니다. 4단계에서의 6B 모델은 단일 소비자용 카드에 들어가고 대화형 루프 안에 들어갈 만큼 빠르게 초안 이미지를 생성하는 유형입니다. 40단계, 2048×2048의 Qwen-Image 2.1은 품질 우선 구성입니다. 제약된 하드웨어에 대한 모델 카드 자체의 권장 사항은 다음을 통한 CPU 오프로드입니다: pipe.enable_model_cpu_offload(), 이는 해결책이라기보다 탈출구입니다.
이를 상쇄하는 요인은 증류가 역량의 압축이라는 점인데, 여기 있는 어떤 것도 두 연구소 밖의 누구에 의해서도 측정된 적이 없다. 두 모델 중 어느 쪽에 대해서든 존재하는 유일한 독립적 데이터 포인트는 Qwen Ambassador 프로그램의 한 테스터가 작성한 Qwen-Image 2.1의 얼리 액세스 직접 체험 리뷰로, 그는 최종 가중치를 ModelScope Studio 인터페이스를 통해 실행해 텍스트-투-이미지에 약 10~15초, 편집에 18~23초가 걸렸다고 보고했다. 이는 단 한 명의 리뷰어가, 얼리 액세스 UI에서, 타이머 표시도 없이 낸 결과다. 유용한 신호일 뿐, 벤치마크는 아니다. LLaDA-Image-Turbo는 공개된 곳에 이에 필적할 만한 직접 체험 보고가 전혀 없다.

편집은 두 디자인이 가장 크게 갈리는 지점입니다.
두 모델 모두 텍스트-투-이미지와 편집을 수행하지만, 거기에 도달하는 방식은 서로 다르며, 그 차이는 결과물이 아니라 내부 구조에서 드러납니다.
Qwen-Image 2.1은 지시 수행을 별도로 검사할 수 있는 구성 요소로 취급합니다. 이미지 모델과 함께, 이번 릴리스에는 두 개의 프롬프트 재작성 체크포인트가 포함되어 있습니다 — Qwen/Qwen-Image-2.1-PE-T2I 및 Qwen/Qwen-Image-2.1-PE-I2I. 각각 약 18.8GB의 파인튜닝된 Qwen3.5-VL 9B로, 모호한 지시를 받아 확산 모델이 보기 전에 명확한 지령문으로 재작성합니다. I2I 변형은 항상 입력 이미지가 있으므로 언제나 편집 작업이며, 무에서 생성하는 일은 결코 없습니다. 결정적으로, 이 재작성기는 여러분이 읽고 재정의할 수 있는 system_prompt.txt와 함께 제공되며, 언어에 관해 유난히 명시적입니다: 설명 언어는 여러분의 지시를 따르는 반면, 이미지에 그려지는 텍스트의 언어는 다른 언어로 프롬프트하더라도 입력 이미지의 기존 라벨 언어를 보존하는 엄격한 우선순위에 따라 결정됩니다.
그것은 영향 범위가 큰 작은 엔지니어링 조각입니다. 포장 텍스트가 중요한 시장을 위해 제품 이미지를 제작하고 있다면, “재작성기가 기존 라벨 언어를 유지한다”와 “재작성기가 친절하게 모든 것을 영어로 번역한다”는 사용 가능한 자산과 거부되는 자산의 차이입니다 — 그리고 그것은 호스팅된 블랙박스 내부가 아니라 시스템 프롬프트에 있기 때문에, 여러분은 그것을 diff하고 변경할 수 있습니다.
LLaDA-Image-Turbo는 정반대의 절충을 택한다: 6B 모델 하나, 가중치 한 세트, 생성과 편집이 모든 것을 공유한다. 움직이는 부품이 더 적고, 설정할 것도 더 적으며, 살펴보거나 재정의할 것도 없다. 이 모델의 카드는 Qwen-Image-Bench 수치로 영어 53.53, 중국어 53.38을 인용하며 오픈소스-SOTA 주장을 내세운다 — 벤더가 보고한 수치이며 재현되지 않았고, 또한 이 모델이 이기고 있는 벤치마크는 이 모델이 암묵적으로 경쟁하는 모델의 이름을 따서 명명되었다는 점에 주목하라.
당신이 실제로 그것들을 실행할 대상
출시 당일 생태계 지원은 릴리스에서 가장 화려하지 않은 부분이며, 오후 한나절로 끝날지 주말을 통째로 쓸지를 결정하는 부분이다.
• Qwen-Image 2.1이 폭넓게 출시되었습니다: QwenImage21Pipeline이 0일 차에 Diffusers에 병합되었고; 텍스트-투-이미지 및 이미지 편집 워크플로 템플릿을 갖춘 네이티브 ComfyUI 지원; 단계별 실행, 접두사 KV 캐싱, CUDA Graph 디코드, FP8 양자화 및 텐서/Ulysses 병렬 처리를 갖춘 vLLM-Omni; 9월 17일에 공개된 네이티브 SGLang 지원 풀 리퀘스트 — 3일 전에 가중치 — DiT, RGBA VAE, Qwen3-VL 조건 지정 및 다중 참조 입력을 포함하며, H200, B200, RTX PRO 6000, RTX 5090 및 RTX 4090에서 검증됨; 그리고 LightX2V를 통한 0일 차 가속과 ROCm을 통한 AMD Radeon 및 FlagOS를 통한 멀티 칩 지원.
• LLaDA-Image-Turbo는 2026년 9월 7일, 가중치가 공개된 지 사흘 후에 ComfyUI 지원을 받았으며, Diffusers 및 Safetensors 배포판도 함께 나왔습니다. 이는 실제로 실행해 볼 수 있는 경로이긴 하지만 더 얇은 경로이며, 이에 상응하는 사전 출시 서빙 작업을 가리킬 만한 것은 없습니다.
출시 전 SGLang 풀 리퀘스트가 Qwen-Image 2.1에 대한 단서다. 가중치보다 먼저 올라온 프레임워크 지원은 누군가 나중에 모델 카드를 보고 작성한 것이 아니라, 체크포인트를 상대로 서빙 경로를 테스트하고 있었다는 뜻이다.

실험과 함께 유지하는 호스팅 경로
이 글을 쓰는 시점에 이 모델들 중 어느 것도 OrcaRouter를 통해 라우팅할 수 없으며, 이 글은 그와 다른 내용을 암시하지 않을 것입니다 — 둘 다 자체 호스팅 제안으로, 하나는 프로덕션을 배제하는 라이선스 아래에 있고 다른 하나는 아예 라이선스가 없습니다. 이들을 평가하는 팀에게 중요한 점은 그 평가가 핵심 경로에 놓일 필요가 없다는 것입니다.
OrcaRouter는 200개 이상의 모델을 하나의 OpenAI 호환 엔드포인트 뒤에 배치하며, 공급자 정가 그대로 마진 없이 제공하고, 공급자 간 자동 페일오버와 여러 모델을 하나의 호출로 조합할 수 있는 라우팅 DSL을 갖추고 있습니다. 이 결정에서 그것이 갖는 실질적인 형태는, 이미 신뢰하는 모델이 프로덕션 트래픽을 처리하는 동안 자체 호스팅 체크포인트를 그 옆에서 테스트하는 라우트입니다 — 그리고 정가가 마크업 없이 그대로 전달되기 때문에, 라우팅되는 어느 모델이든 공급업체 가격이 바뀌면 계약 변경을 기다릴 필요 없이 같은 날 우리 쪽에 반영됩니다. 현재 저희가 라우팅하는 이미지 모델은 OpenAI의 GPT-Image 제품군, Google의 Imagen 4 티어와 Gemini 이미지 프리뷰, 그리고 xAI의 Grok Imagine 이미지 엔드포인트입니다. 33GB 확산 트랜스포머를 일주일 들여 세워서 호스팅 모델을 능가하는지 알아보려는 것이라면, 호스팅 모델이 대조군이며, 그 대조군을 이미 키에 올려 두는 것이 가치가 있습니다.
이 비교를 바꾸는 것은 무엇일까?
세 가지, 중요한 순서대로.
첫째, 두 모델 중 어느 쪽이든 독립적인 벤치마크 점수입니다. 둘 다 그런 점수가 없고, 그것이 바뀌기 전까지 양측의 모든 품질 주장은 연구소가 자기 숙제를 스스로 채점하는 것에 불과합니다. 둘째, 라이선스입니다. Qwen-Image 2.1의 허용적 변형이 있다면 7B에서 공개 이미지 작업의 확실한 기본값이 될 것이고, LLaDA-Image-Turbo에 어떤 형태로든 선언된 라이선스가 있기만 해도 적어도 계획을 세울 수는 있을 것입니다. 셋째, Qwen의 9월 17일 ModelScope 프로그램 얼리 액세스 테스터들은 9월 29일까지 샘플이나 리뷰를 공개하도록 요청받았습니다 — 지금으로부터 8일 뒤입니다. 그때가 되면 이것은 두 모델 카드 비교가 아니라 진짜 비교가 되기 시작합니다. 그때까지 솔직한 요약은 이렇습니다. Qwen-Image 2.1은 상용화할 수 없는, 더 유능해 보이는 모델이고, LLaDA-Image-Turbo는 대화 없이는 전혀 사용할 수 없는 더 빠른 모델이며, 라이선스 파일은 두 릴리스 중 완전히 확정된 유일한 부분입니다.
