
Qwen-Image-2.1, 두 이미지 아레나 모두 1위: '#1 오픈소스' 라벨이 숨기는 것
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen-Image-2.1을 만든 팀은 Arena의 인정에 감사를 표했고, 그 인정은 진짜다. Qwen-Image-2.1은 두 Arena 이미지 보드 모두에서 해당 보드가 독점으로 표시하지 않은 모델 가운데 최고 점수를 기록한 모델이다: 2026년 9월 22일 스냅샷 기준 Image Edit에서 1,367점, Text-to-Image에서 1,228점이다. 두 보드 모두에서 그보다 위에 있는 모든 행에는 독점 태그가 붙어 있다. 발표문이 담지 않은 세 가지 사실 역시 그 주장 자체만큼이나 확인 가능하다 — 그 점수로 얻게 되는 종합 순위, 잠정 플래그가 두 행 모두에 함께 붙는다는 점, 그리고 라이선스 qwen-research라는 문자열이 붙어 있으며, 이전 이미지 모델에 적용된 Apache 2.0이 아니다. 그 주장은 보드와 맞닥뜨려도 살아남는다. 다만 헤드라인이 시사하는 것보다 말해주는 바가 적을 뿐이다.
두 보드를 나란히 놓고 읽기
Arena 점수는 블라인드 쌍대 비교 투표로 만들어지는 Elo 방식 평점이다. 사람이 두 출력을 보고, 어느 모델이 어느 것을 생성했는지 모른 채 하나를 고른다. 이는 공급업체 벤치마크와는 범주적으로 다른 증거 유형이며, 그래서 그것에 근거한 주장은 그대로 반복하기보다 검증할 가치가 있다. 두 보드 모두 2026년 9월 22일에 캡처되었고, 두 보드 모두 순위 그래픽에서 대충 훑어본 것이 아니라 행별로 읽었다.

이미지 편집 보드에는 56개 모델과 29,902,508표가 나열되어 있습니다. Qwen-Image-2.1은 점수 1,367, 신뢰구간 ±9, 투표수 4,841로 16위에 있습니다. 그 위의 15개 행은 — 1,526점인 gpt-image-2.5-sunburst부터 1,370점인 gpt-image-1.5-high-fidelity까지 — 모두 독점 모델입니다. 바로 아래 두 행인 1,358점의 reve-2.0과 1,334점의 uni-1.1-max도 마찬가지입니다.

같은 날 Text-to-Image 보드에는 79개 모델과 6,258,152표가 나열되어 있습니다. Qwen-Image-2.1은 1,228점으로 17위이며, 신뢰구간은 ±11이고 투표 수는 2,843입니다. 같은 패턴입니다: 그 위의 열여섯 행은 Proprietary이고, 그 아래의 첫 번째 비-Proprietary 행은 1,204점의 ideogram-4.0-quality이며, Ideogram Open Model로 표기되어 있습니다.
그 행들에서 짚어낼 만한 두 가지 세부 사항이 있는데, 이는 그 주장이 일반적으로 반복되는 방식에 어긋나기 때문이다.
• 순위와 점수는 서로 다른 이야기를 들려준다 — 1,367은 이미지 편집 보드에서 Proprietary가 아닌 모델 중 최고 점수이자 16위로, 선두에 159점 뒤지고 15위와는 3점 차이다.
• 한 보드에서는 알리바바 자체의 폐쇄형 모델이 1위를 차지한다 — Proprietary로 태그된 qwen-image-3.0-pro는 Text-to-Image에서 1,254로, qwen-image-2.1의 1,228보다 26점 높다. 편집 보드에서는 오픈 모델이 1,304의 이전 proprietary 모델 qwen-image-2.0-pro-2026-06-22를 앞선다. 자체 챔피언은 두 보드에서 같은 모델이 아니다.
• 다음 오픈 모델과의 격차는 한 보드에서는 크고 다른 보드에서는 작다 — Image Edit에서 다음 Proprietary가 아닌 항목은 1,302의 hunyuan-image-3.0-instruct로 65점 뒤처져 있고, Text-to-Image에서는 1,204의 ideogram-4.0-quality로 24점 뒤처져 있다.
라이선스 문자열이 랭킹보다 더 많은 일을 하고 있습니다
모든 Arena 행에는 조직 및 라이선스 레이블이 있습니다. Qwen-Image-2.1의 레이블은Alibaba · qwen-research로 두 보드 모두에서 표시됩니다. 이는 Alibaba의 이전 이미지 모델에 있는 Apache 2.0 레이블이 아닙니다: 편집 보드에서 1,241점의 qwen-image-edit과 1,235점의 qwen-image-edit-2511은 모두 Apache 2.0으로 태그되어 있습니다. Text-to-Image에서 1,125점의 qwen-image-2512와 1,057점의 qwen-image도 마찬가지로 Apache 2.0으로 태그되어 있습니다. 공급업체의 블로그 게시물은 2026년 9월 20일자 Qwen Research License Agreement에 따라 가중치를 공개함으로써 같은 결론을 내립니다. 이 라이선스는 연구 및 평가를 허용하고 상업적 사용은 허용하지 않습니다.
따라서 “#1 오픈소스 모델”이라는 말을 정직하게 해석하면 들리는 것보다 범위가 좁다. 리더보드 자체의 양분법—독점이냐 아니냐—에서 Qwen-Image-2.1이 1위다. 사용 분야 제한을 인정하지 않는 OSI의 오픈소스 정의에서는 이 모델은 전혀 오픈소스가 아니며, 이 모델과 비교되는 대부분의 모델도 마찬가지다. 같은 리더보드들에는 다음과 같은 라벨이 붙은 행들이 있다: flux-non-commercial-license, tencent-hunyuan-community, krea-2-community-license 및 Ideogram Open Model. Arena의 '오픈 소스' 필터는 독점이냐 아니냐를 가르는 대략적인 스위치다. 유용한 스위치이긴 하다. 하지만 라이선스 검토는 아니다.
그 구분은 여기서 2점 차이보다 더 중요합니다. 왜냐하면 그것은 한 주 더 투표가 진행되어도 바뀔 수 없는 유일한 것이기 때문입니다. 오늘 이 계열에서 허용적 라이선스가 적용된 이미지 모델을 원한다면, Apache 2.0 항목은 qwen-image-edit와 qwen-image-edit-2511입니다 — 둘 다 더 오래되었고, 같은 편집 보드에서 둘 다 120점 넘게 낮습니다(1,367에 대해 1,241과 1,235). 가장 높은 점수를 받은 공개 라벨 Qwen 이미지 모델과 상업적으로 사용 가능한 Qwen 이미지 모델은 같은 다운로드가 아닙니다.
잠정치는 숫자가 아직 변동될 수 있다는 뜻입니다.
Qwen-Image-2.1의 두 행은 모두 보드의Preliminary 표시를 달고 있는데, 이는 해당 행이 점수를 확정된 것으로 간주할 만큼 충분한 투표를 축적하지 못했을 때 Arena가 적용하는 것입니다. 그 이유는 투표 수에 있습니다. Image Edit에서는 4,841표로 보드 총 투표수 29,902,508표에 대비되고, Text-to-Image에서는 2,843표로 6,258,152표에 대비됩니다. 이와 대조적으로, 그 주변의 행들은 훨씬 더 많은 표를 보유하고 있습니다. gpt-image-1.5-high-fidelity는 편집 보드에서 589,013표를, qwen-image-2.0-pro-2026-06-22는 Text-to-Image 보드에서 307,705표를 기록했습니다.
출시 3일 된 모델에 대한 ±9와 ±11의 신뢰구간은 경고 신호가 아닙니다. 그것은 새로운 릴리스의 모습일 뿐입니다. 하지만 이는 투표가 쌓이면서 오픈 티어 상단의 구체적인 순위가 바뀔 수 있다는 뜻입니다. 특히 Text-to-Image에서 다음 오픈 항목과의 격차가 24점인 경우에는 더욱 그렇습니다.
벤더 자체 스펙 시트상 모델이란 무엇인가
알리바바의 자체 문서에는 32개의 Single-Stream DiT 레이어로 구성된 7B 매개변수 시각 생성 컴포넌트를 갖춘 통합 텍스트-이미지 및 편집 모델, 투명 이미지의 네이티브 생성 및 편집, 최대 10개의 참조 이미지 지원, 2048×2048 네이티브 출력 상한이 설명되어 있습니다. 전체 파이프라인 다운로드는 약 33GB입니다. 투명성 지원은 그 목록에서 가장 흔치 않은 항목이며, Arena의 편집 보드는 이를 분명히 측정하고 있지 않으므로 보드 순위는 그 특정 기능에 대해 어느 쪽으로도 증거가 되지 않습니다.
업체의 대표 벤치마크는 Qwen-Image-Bench로, 이 모델은 60.28로 보고되며 59.82의 Nano Banana 2.0과 59.65의 GPT Image 1.5를 앞선다. 이는 제3자 재현이 없는 업체 자체 평가이며, 격차는 1점 미만이다. 프롬프트 세트를 바꾸면 유지되지 않을 정도의 차이다. 분명히 말할 필요가 있다. 위의 Arena 수치는 다른 사람들의 투표이고, Qwen-Image-Bench 수치는 알리바바 자체의 것이다. 이 둘은 같은 종류의 증거가 아니며, 모델에 대한 하나의 인상으로 평균 내서는 안 된다.
배포 지원은 릴리스 이후가 아니라 릴리스와 함께 제공되었다. 이 모델을 위한 출시 첫날부터의 통합이 ComfyUI, SGLang, vLLM-Omni, LightX2V 및 Diffusers 라이브러리에 마련되어 있다. 이는 대부분의 팀에게 실질적인 질문이 모델을 서빙할 수 있는지가 아니라 서빙 비용이 감당 가능한지라는 뜻이다.
이번 주에 이미지 API가 필요하다면, 이런 주장이 어디에 안착하는지
여기서는 우리 자신의 입장을 정확히 밝히는 것이 중요합니다. OrcaRouter는 Qwen-Image-2.1을 라우팅하지 않으며, 어떤 버전의 Qwen-Image 모델도 라우팅하지 않습니다. Arena 점수가 당신을 설득한 것이라면, 그 모델은 벤더 자체 API와 여러 서드파티 플랫폼을 통해, 또는 자체 호스팅 다운로드로 접근할 수 있습니다 — 우리를 통해서가 아닙니다. 우리가 판매할 Qwen 이미지 라우트는 없으며, 리더보드 순위가 그렇지 않은 것을 그런 척할 이유는 아닙니다.
우리가 라우팅하는 것은 그 보드들이 순위를 매기는 이미지 티어의 나머지이며, Qwen-Image-2.1 위에 있는 여러 행이 여기에 포함됩니다. OpenAI의 GPT-Image-2, GPT-Image-1.5, GPT-Image-1-mini를 사용할 수 있고, Google의 Imagen 4 티어와 Gemini 이미지 프리뷰 엔드포인트, xAI의 Grok Imagine 이미지 엔드포인트도 사용할 수 있습니다. 이런 조합이 이와 같은 주장에 대한 실질적인 답입니다. Arena가 오픈 모델을 처음부터 최상위에 올려두었다면, 전환은 단일 키에서 코드 한 줄만 바꾸면 되는 일이었을 것입니다. 그렇지 않았습니다 — 두 보드의 최상위는 독점 모델이고, 흥미로운 결정은 연구용 라이선스 다운로드와 오늘 바로 호출할 수 있는 호스팅 엔드포인트 사이에 있습니다.
그 결정에는 플랫폼의 세 가지 속성이 중요합니다. 라우팅은 200개 이상의 모델에 걸쳐 하나의 OpenAI 호환 엔드포인트에서 실행되므로, 호스팅된 행들을 서로 비교한다고 해서 두 번째 계약이나 두 번째 SDK가 필요한 것은 아닙니다. 공급자 정가는 마크업 없이 그대로 전달되므로, 벤더 가격 변경은 다음 계약 갱신 때가 아니라 발표된 당일에 청구서에 반영됩니다. 그리고 공급자 간 자동 페일오버 덕분에, 새롭고 아직 지지가 적은 모델은 출시 3일 차에 프로덕션 의존성이 되는 대신 폴백 체인에서 이미 자리 잡은 모델 뒤에 둘 수 있습니다. Qwen-Image-2.1이 바로 지금 대략 그 위치에 있습니다.
그 주장은 사실이며, 읽히는 것보다 더 얄팍하다.
Alibaba가 게시한 내용은 검증 가능하다: 2026년 9월 22일 두 Arena 이미지 보드의 스냅숏에서 Qwen-Image-2.1은 Proprietary 태그가 붙지 않은 모델 중 가장 높은 점수를 받은 모델이다. 그 게시물이 압축한 것은 그것을 한정하는 모든 요소다 — 전체 16위와 17위, 수천 표에 기반한 잠정 점수, 그리고 그 표현이 연상시키는 오픈소스 라이선스를 대신하는 연구용 라이선스.

이 중 어느 것도 결과를 작게 만들지는 않는다. 출시 사흘 만에 두 보드 모두에서 첫 비독점 항목이 되었다는 것은 오픈 등급이 어디에 자리하는지에 있어 실제적인 변화다 — 그보다 앞선 허용적 라이선스의 Qwen 이미지 모델들은 같은 편집 보드에서 120점 넘게 뒤처져 있다. 다만 이것은 "오픈 소스인 최고의 이미지 모델"이라는 말과 같은 진술은 아니며, 그 차이는 확인하는 데 약 1분이 걸리는 라이선스 한 줄과 순위 열이다.
