
Qwen-Image-2.1은 두 Artificial Analysis 리더보드 모두에서 최고의 오픈 웨이트 이미지 모델입니다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 223 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Alibaba의 Qwen 팀이 Qwen-Image-2.1을 2026년 9월 20일 오픈 웨이트로 공개했습니다. 12일 후, 독립적인 스코어보드들이 이를 따라잡았고, 그 결과는 출시 당시보다 더 흥미롭습니다. AA-Image-T2I v2.0 리더보드에서 Qwen-Image-2.1은 166개 중 18위, Elo 1,034를 기록했으며, 이는 5,286회의 블라인드 비교에서 나온 결과입니다. AA-Image-Editing v2.0에서는 97개 중 18위, Elo 1,074로, 5,536회의 비교에서 나왔습니다. 이 두 항목 모두 모든 모델을 개별적으로 표시하는 보드에서 오픈 웨이트로 표시되어 있습니다. 두 보드 어디에서도 해당 표시를 달고 있는 다른 모델이 이들보다 위에 있지 않습니다. 그것이 전체적인 발견입니다. 블라인드 쌍대 비교로 모델을 평가하는 유일한 두 공개 이미지 보드에서, 공개된 Qwen-Image-2.1은 이 분야에서 가장 강력한 다운로드 가능한 웨이트이며, 두 위치를 차지하고 있는 것은 미리보기 버전이 아니라 바로 Qwen-Image-2.1입니다.
다음은 그 두 숫자가 어디에서 나온 것인지, 그 숫자 주변의 행들이 어떤 모습인지, 그리고 대부분의 출시 보도가 놓친 보드 위의 세 가지 세부 사항입니다 — 그 보드가 해당 모델에 대해 어디에도 API를 기록하지 않는다는 사실부터 시작합니다.
{{1}}두 행{{/1}}이 앉아 있는 곳
Artificial Analysis는 두 리더보드 모두를 블라인드 쌍대 비교로 구축한다. 두 모델이 같은 프롬프트에 답하고, 투표자가 더 나은 출력을 고르면, 집계에서 Elo가 산출된다. 두 리더보드는 하우스 스타일만 공유할 뿐 그 외에는 아무것도 공유하지 않는다. 서로 다른 과제를 평가하고, 서로 다른 모집단을 가지며, Elo 값도 서로 비교할 수 없다. Qwen-Image-2.1이 두 리더보드에서 같은 순위에 오른 것은 서로 다른 두 분포가 우연히 일치한 것이다.
Text-to-image, 보드에 166개 모델:
• 순위표의 최상단은 14,023회 등장하여 Elo 1,107을 기록한 GPT Image 2.5 Sunburst (max)입니다 — Qwen-Image-2.1의 표본보다 두 배 이상 많은 비공개 모델입니다.
• Qwen-Image-2.1은 5,286회 등장을 바탕으로 1,034 Elo, 95% 신뢰구간 1,024~1,044로 18위에 올랐습니다.
• 순위보다 행 수(모델 수)를 먼저 확인하세요. Qwen-Image-2.1은 두 보드 모두에서 18위에 올라 있지만, 그 순위는 서로 다른 모집단에서 나온 것입니다. 텍스트-투-이미지에는 166개 모델, 편집에는 97개 모델이 있고, 두 Elo 값은 서로 별개의 척도에 속합니다. 순위가 동일한 것은 산술적 결과일 뿐, 두 보드가 무언가에 대해 일치한다는 증거는 아닙니다.
• Alibaba 자체의 두 Pro-tier 모델이 이 보드에서 그것보다 위에 있습니다: Qwen-Image-3.0-Pro는 Elo 1,089로 14위, Qwen-Image-3.0은 1,075로 16위입니다. 둘 다 Open Weights 마커를 달고 있지 않습니다. 보드의 9월 스냅샷은 둘 다 2026년 7월 릴리스로 기재하며, 이는 최신 Qwen 이미지 모델이 최고 점수를 받은 모델이 아니라는 이야기의 한 버전입니다 — 그리고 텍스트-투-이미지에서는 그 모델이 최고 점수가 아닙니다.
이미지 편집, 보드에 97개 모델:
• GPT Image 2.5 Sunburst (max)도 17,899회 등장에 1,182 Elo를 기록하며 이 순위표에서도 1위를 차지했습니다.
• Qwen-Image-2.1은 1,074 Elo로 18위이며, 구간은 1,065~1,083이고, 5,536회 등장했습니다 — 텍스트-투-이미지 항목보다 약간 더 큰 표본인데, 편집 쪽이 출시 당시 더 요란한 홍보 문구를 받은 모델이라는 점을 생각하면 이해가 됩니다.
• 주변 순위들이 빽빽합니다. grok-imagine-image가 한 순위 아래인 1,071에 있고, Luma UNI 1 Max가 1,069에 있습니다. 이 순위표에서 그 아래에 있는 가장 가까운 오픈 웨이트 항목은 HunyuanImage 3.0 Instruct로, 5,221회 등장에 1,066점 — Elo 8점 차이입니다. 일곱 개의 순위가 18 Elo 포인트 안에 있습니다.
"최고의 오픈 웨이트 모델"이라는 주장을 솔직하게 읽기
헤드라인에 있는 그 문구는 특정한 역할을 하고 있으며, 반복되기보다는 점검받아 마땅하다.
• 이는 마커 내에서의 순위이며, 전체 순위가 아닙니다. Qwen-Image-2.1은 두 보드 모두에서 전체 18위입니다. Open Weights 라벨이 각 보드에서 이 모델을 1위로 만드는 요소이며, 이 라벨은 보드 자체의 권한에 따라 모델별로 적용됩니다. 텍스트-투-이미지 보드에서는 47개 행이 이 마커를 달고 있고, 편집 보드에서는 97개 행 중 36개 행이 이 마커를 달고 있습니다.
• 그 표시는 약관이 아니라 가중치를 설명한다. Qwen-Image-2.1은 2026년 9월 20일자 Qwen Research License Agreement에 따라 제공되며, 이 계약은 비상업적 목적에 한해서만 권리를 부여한다. 이사회의 Open Weights 라벨은 다운로드 가능성에 관해서는 정확하지만, 다운로드한 것을 가지고 무엇을 할 수 있는지에 대해서는 아무 말도 하지 않는다. '최고의 오픈 가중치 이미지 모델'을 '제품에서 무료로 사용할 수 있음'으로 읽는 사람은 그 라벨을 그 의미 이상으로 읽은 것이다.
• 이것은 스냅샷이며, 확정된 순위가 아닙니다. 투표가 쌓이면서 보드는 매일 움직입니다. Qwen-Image-2.1의 신뢰 구간은 텍스트-투-이미지에서 ±10 Elo, 편집에서 ±9이며, 그 아래에 있는 순위들은 서로 겹치는 구간에 놓여 있습니다. 이 위치를 영구적인 것이 아니라 현재의 것으로 받아들이세요.
출시 보도에 빠져 있던 세부 사항: API 없음
Qwen-Image-2.1의 두 행 모두 명시적인 사용 가능한 API 없음 주석을 달고 있습니다. 이는 순위에 실질적인 부담으로 작용하며, 5,286표와 5,536표를 누가 생성했는지에 대한 단서를 제공합니다 — 프롬프트를 보낼 엔드포인트가 없다면, 그 비교는 가중치를 직접 실행하고 출력을 제출한 사람들에게서 나온 것입니다. 자체 호스팅 전용 모델에 대한 독립적인 Elo는 누구나 호출할 수 있는 대상에 대한 Elo보다 진정으로 더 어려운 측정이며, 이것이 여기 샘플이 상위 행들의 3분의 1 크기인 이유입니다.
개발자라면 이런 모양새가 익숙할 것이다. 이 분야에서 가장 강력한 다운로드 가능 이미지 모델은 오늘 당장 호출할 수 있는 모델이 아니다. 실무적으로 이는 작업을 둘로 갈라놓는다. Qwen-Image-2.1을 자체 하드웨어에서 직접 서빙하거나, 아니면 이 보드에 있는 주변 모델 중 하나를 호출하거나. 두 번째 선택지야말로 라우팅이 진가를 발휘하는 지점이다. 200개 이상의 모델을 아우르는 단일 API, 제공업체 정가를 마진 없이 그대로 전달, 제공업체 성능이 저하될 때 자동 페일오버, 그리고 여러 모델을 하나의 호출로 조합하기 위한 라우팅 DSL까지. OrcaRouter는 오늘날 Qwen-Image-2.1을 서빙하지 않는다. 이 플랫폼의 이미지 라인업은 Google의 Imagen 티어와 Gemini 이미지 프리뷰, xAI의 Grok Imagine 이미지 엔드포인트, 그리고 OpenAI의 GPT-Image 제품군이다. 이 보드에서 그것은 맨 위에 있는 GPT Image 2.5 Sunburst 행이며, "최고 점수를 원하고 오늘 오후에 바로 호출하고 싶다"는 요구에 대한 정당한 답이다.

보드에서 주목할 것
세 가지가 이 이야기를 진전시킬 것이며, 그 세 가지 모두는 이미 게시판에 보인다.
첫 번째는 API가 등장하는지 여부입니다. Alibaba 또는 서빙 파트너가 Qwen-Image-2.1을 엔드포인트 뒤에 배치하면, 사용 가능한 API 없음이라는 주석이 사라지고, 투표량은 인접 행들의 규모를 향해 증가해야 하며, 신뢰 구간은 좁아집니다. 1,034 또는 1,074에 대한 더 좁은 구간은 현재의 것보다 훨씬 더 강한 주장입니다.
두 번째는 Alibaba 자체 스택입니다. 1,089점의 Qwen-Image-3.0-Pro와 1,075점의 Qwen-Image-3.0은 모두 텍스트-투-이미지에서 Qwen-Image-2.1을 앞서지만, Open Weights 표시는 달고 있지 않습니다. Qwen-Image-2.1이 그 라인의 후속 모델이 아니라 다운로드 가능한 대응 모델이라면, 흥미로운 질문은 그 격차가 좁혀지느냐인데 — 그리고 편집 리더보드에서는 이미 좁혀졌습니다. Qwen-Image-3.0-Pro가 Qwen-Image-2.1을 Elo 2점 차로 앞서고 있으니까요.
세 번째는 라이선스입니다. 두 보드의 모든 Open Weights 행은 이 라벨을 받을 자격이 똑같이 있지만, 그 뒤에 있는 라이선스들은 전혀 동등하지 않습니다. 보드는 결코 그 사실을 알려주지 않습니다. 그것은 점수판에 없는 유일한 열입니다.

자주 묻는 질문
Qwen-Image-2.1이 최고의 오픈 웨이트 이미지 모델인가요?
이 두 보드에서는, 예 — 두 보드 모두에서 Open Weights 마커를 달고 있는 가장 높은 Elo 행이며, 텍스트-투-이미지에서는 1,034, 편집에서는 1,074입니다. 전체적으로는 각각 18위이고 — 그 18은 한 보드에서는 166개 행 안에서의 순위, 다른 보드에서는 97개 행 안에서의 순위이며, 서로 비교할 수 없는 두 Elo 척도를 대신합니다. 그 주장은 두 한정어가 모두 붙어 있을 때만 성립합니다.
같은 모델인데 왜 두 보드가 서로 다른 Elo 값을 표시하나요?
그들은 서로 다른 작업을 서로 다른 모델 집단에 대해 채점한다. 텍스트-투-이미지 Elo와 편집 Elo는 별개의 척도이므로, 1,034와 1,074를 비교하는 것은 모델이 아니라 보드를 측정하는 것이다.
Qwen-Image-2.1을 API로 호출할 수 있나요?
두 보드 행 모두 API 사용 불가(으)로 기록합니다. 가중치는 Alibaba의 저장소에서 다운로드할 수 있으므로 모델은 실행됩니다. 다만 보드가 이 모델을 서비스한 것으로 인정한 호스팅 엔드포인트가 없을 뿐입니다.
오늘 다운로드 대신 숫자를 원한다면, 두 리더보드의 최상위는 각 벤더 자체 API를 통해 호출할 수 있으며, GPT-Image 라인, Google의 Imagen 티어, xAI의 Grok Imagine은 OrcaRouter가 직접 전면에 제공하는 이미지 모델이다. 실험을 위해서는 가중치 파일을, 마감을 위해서는 엔드포인트를 남겨 두세요.
