Qwen 벤더 블로그 게시글의 헤더로, Qwen-Image-2.1을 발표하는 글에서 'Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation'이라는 제목이 'Now open weights'라는 문구와 Qwen 마크 위에 표시되어 있고, 페이지의 언어 전환기는 EN으로 설정되어 있다
Guides & Insights

Qwen-Image-2.1은 두 Artificial Analysis 리더보드 모두에서 최고의 오픈 웨이트 이미지 모델입니다

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Alibaba의 Qwen 팀이 Qwen-Image-2.1을 2026년 9월 20일 오픈 웨이트로 공개했습니다. 12일 후, 독립적인 스코어보드들이 이를 따라잡았고, 그 결과는 출시 당시보다 더 흥미롭습니다. AA-Image-T2I v2.0 리더보드에서 Qwen-Image-2.1은 166개 중 18위, Elo 1,034를 기록했으며, 이는 5,286회의 블라인드 비교에서 나온 결과입니다. AA-Image-Editing v2.0에서는 97개 중 18위, Elo 1,074로, 5,536회의 비교에서 나왔습니다. 이 두 항목 모두 모든 모델을 개별적으로 표시하는 보드에서 오픈 웨이트로 표시되어 있습니다. 두 보드 어디에서도 해당 표시를 달고 있는 다른 모델이 이들보다 위에 있지 않습니다. 그것이 전체적인 발견입니다. 블라인드 쌍대 비교로 모델을 평가하는 유일한 두 공개 이미지 보드에서, 공개된 Qwen-Image-2.1은 이 분야에서 가장 강력한 다운로드 가능한 웨이트이며, 두 위치를 차지하고 있는 것은 미리보기 버전이 아니라 바로 Qwen-Image-2.1입니다.

다음은 그 두 숫자가 어디에서 나온 것인지, 그 숫자 주변의 행들이 어떤 모습인지, 그리고 대부분의 출시 보도가 놓친 보드 위의 세 가지 세부 사항입니다 — 그 보드가 해당 모델에 대해 어디에도 API를 기록하지 않는다는 사실부터 시작합니다.

{{1}}두 행{{/1}}이 앉아 있는 곳

Artificial Analysis는 두 리더보드 모두를 블라인드 쌍대 비교로 구축한다. 두 모델이 같은 프롬프트에 답하고, 투표자가 더 나은 출력을 고르면, 집계에서 Elo가 산출된다. 두 리더보드는 하우스 스타일만 공유할 뿐 그 외에는 아무것도 공유하지 않는다. 서로 다른 과제를 평가하고, 서로 다른 모집단을 가지며, Elo 값도 서로 비교할 수 없다. Qwen-Image-2.1이 두 리더보드에서 같은 순위에 오른 것은 서로 다른 두 분포가 우연히 일치한 것이다.

Text-to-image, 보드에 166개 모델:

• 순위표의 최상단은 14,023회 등장하여 Elo 1,107을 기록한 GPT Image 2.5 Sunburst (max)입니다 — Qwen-Image-2.1의 표본보다 두 배 이상 많은 비공개 모델입니다.

• Qwen-Image-2.1은 5,286회 등장을 바탕으로 1,034 Elo, 95% 신뢰구간 1,024~1,044로 18위에 올랐습니다.

• 순위보다 행 수(모델 수)를 먼저 확인하세요. Qwen-Image-2.1은 두 보드 모두에서 18위에 올라 있지만, 그 순위는 서로 다른 모집단에서 나온 것입니다. 텍스트-투-이미지에는 166개 모델, 편집에는 97개 모델이 있고, 두 Elo 값은 서로 별개의 척도에 속합니다. 순위가 동일한 것은 산술적 결과일 뿐, 두 보드가 무언가에 대해 일치한다는 증거는 아닙니다.

• Aliba​ba 자체의 두 Pro-tier 모델이 이 보드에서 그것보다 위에 있습니다: Qwen-Image-3.0-Pro는 Elo 1,089로 14위, Qwen-Image-3.0은 1,075로 16위입니다. 둘 다 Open Weights 마커를 달고 있지 않습니다. 보드의 9월 스냅샷은 둘 다 2026년 7월 릴리스로 기재하며, 이는 최신 Qwe​n 이미지 모델이 최고 점수를 받은 모델이 아니라는 이야기의 한 버전입니다 — 그리고 텍스트-투-이미지에서는 그 모델이 최고 점수가 아닙니다.

이미지 편집, 보드에 97개 모델:

• GPT Image 2.5 Sunburst (max)도 17,899회 등장에 1,182 Elo를 기록하며 이 순위표에서도 1위를 차지했습니다.

• Qwen-Image-2.1은 1,074 Elo로 18위이며, 구간은 1,065~1,083이고, 5,536회 등장했습니다 — 텍스트-투-이미지 항목보다 약간 더 큰 표본인데, 편집 쪽이 출시 당시 더 요란한 홍보 문구를 받은 모델이라는 점을 생각하면 이해가 됩니다.

• 주변 순위들이 빽빽합니다. grok-imagine-image가 한 순위 아래인 1,071에 있고, Luma UNI 1 Max가 1,069에 있습니다. 이 순위표에서 그 아래에 있는 가장 가까운 오픈 웨이트 항목은 HunyuanImage 3.0 Instruct로, 5,221회 등장에 1,066점 — Elo 8점 차이입니다. 일곱 개의 순위가 18 Elo 포인트 안에 있습니다.

"최고의 오픈 웨이트 모델"이라는 주장을 솔직하게 읽기

헤드라인에 있는 그 문구는 특정한 역할을 하고 있으며, 반복되기보다는 점검받아 마땅하다.

• 이는 마커 내에서의 순위이며, 전체 순위가 아닙니다. Qwen-Image-2.1은 두 보드 모두에서 전체 18위입니다. Open Weights 라벨이 각 보드에서 이 모델을 1위로 만드는 요소이며, 이 라벨은 보드 자체의 권한에 따라 모델별로 적용됩니다. 텍스트-투-이미지 보드에서는 47개 행이 이 마커를 달고 있고, 편집 보드에서는 97개 행 중 36개 행이 이 마커를 달고 있습니다.

• 그 표시는 약관이 아니라 가중치를 설명한다. Qwen-Image-2.1은 2026년 9월 20일자 Qwe​n Research License Agreement에 따라 제공되며, 이 계약은 비상업적 목적에 한해서만 권리를 부여한다. 이사회의 Open Weights 라벨은 다운로드 가능성에 관해서는 정확하지만, 다운로드한 것을 가지고 무엇을 할 수 있는지에 대해서는 아무 말도 하지 않는다. '최고의 오픈 가중치 이미지 모델'을 '제품에서 무료로 사용할 수 있음'으로 읽는 사람은 그 라벨을 그 의미 이상으로 읽은 것이다.

• 이것은 스냅샷이며, 확정된 순위가 아닙니다. 투표가 쌓이면서 보드는 매일 움직입니다. Qwen-Image-2.1의 신뢰 구간은 텍스트-투-이미지에서 ±10 Elo, 편집에서 ±9이며, 그 아래에 있는 순위들은 서로 겹치는 구간에 놓여 있습니다. 이 위치를 영구적인 것이 아니라 현재의 것으로 받아들이세요.

출시 보도에 빠져 있던 세부 사항: API 없음

Qwen-Image-2.1의 두 행 모두 명시적인 사용 가능한 API 없음 주석을 달고 있습니다. 이는 순위에 실질적인 부담으로 작용하며, 5,286표와 5,536표를 누가 생성했는지에 대한 단서를 제공합니다 — 프롬프트를 보낼 엔드포인트가 없다면, 그 비교는 가중치를 직접 실행하고 출력을 제출한 사람들에게서 나온 것입니다. 자체 호스팅 전용 모델에 대한 독립적인 Elo는 누구나 호출할 수 있는 대상에 대한 Elo보다 진정으로 더 어려운 측정이며, 이것이 여기 샘플이 상위 행들의 3분의 1 크기인 이유입니다.

개발자라면 이런 모양새가 익숙할 것이다. 이 분야에서 가장 강력한 다운로드 가능 이미지 모델은 오늘 당장 호출할 수 있는 모델이 아니다. 실무적으로 이는 작업을 둘로 갈라놓는다. Qwen-Image-2.1을 자체 하드웨어에서 직접 서빙하거나, 아니면 이 보드에 있는 주변 모델 중 하나를 호출하거나. 두 번째 선택지야말로 라우팅이 진가를 발휘하는 지점이다. 200개 이상의 모델을 아우르는 단일 API, 제공업체 정가를 마진 없이 그대로 전달, 제공업체 성능이 저하될 때 자동 페일오버, 그리고 여러 모델을 하나의 호출로 조합하기 위한 라우팅 DSL까지. OrcaRouter는 오늘날 Qwen-Image-2.1을 서빙하지 않는다. 이 플랫폼의 이미지 라인업은 Google의 Imagen 티어와 Gemini 이미지 프리뷰, xAI의 Grok Imagine 이미지 엔드포인트, 그리고 OpenAI의 GPT-Image 제품군이다. 이 보드에서 그것은 맨 위에 있는 GPT Image 2.5 Sunburst 행이며, "최고 점수를 원하고 오늘 오후에 바로 호출하고 싶다"는 요구에 대한 정당한 답이다.

Screenshot of the Artificial Analysis text-to-image leaderboard, AA-Image-T2I v2.0, captured in English, listing GPT Image 2.5 Sunburst (max) first at 1,107 Elo from 14,023 samples, the Qwen-Image-3.0-Pro row at rank 14 with 1,089 Elo and 6,353 samples, and the Qwen-Image-2.1 row at rank 18 with 1,034 Elo from 5,286 samples

보드에서 주목할 것

세 가지가 이 이야기를 진전시킬 것이며, 그 세 가지 모두는 이미 게시판에 보인다.

첫 번째는 API가 등장하는지 여부입니다. Aliba​ba 또는 서빙 파트너가 Qwen-Image-2.1을 엔드포인트 뒤에 배치하면, 사용 가능한 API 없음이라는 주석이 사라지고, 투표량은 인접 행들의 규모를 향해 증가해야 하며, 신뢰 구간은 좁아집니다. 1,034 또는 1,074에 대한 더 좁은 구간은 현재의 것보다 훨씬 더 강한 주장입니다.

두 번째는 Alibaba 자체 스택입니다. 1,089점의 Qwen-Image-3.0-Pro와 1,075점의 Qwen-Image-3.0은 모두 텍스트-투-이미지에서 Qwen-Image-2.1을 앞서지만, Open Weights 표시는 달고 있지 않습니다. Qwen-Image-2.1이 그 라인의 후속 모델이 아니라 다운로드 가능한 대응 모델이라면, 흥미로운 질문은 그 격차가 좁혀지느냐인데 — 그리고 편집 리더보드에서는 이미 좁혀졌습니다. Qwen-Image-3.0-Pro가 Qwen-Image-2.1을 Elo 2점 차로 앞서고 있으니까요.

세 번째는 라이선스입니다. 두 보드의 모든 Open Weights 행은 이 라벨을 받을 자격이 똑같이 있지만, 그 뒤에 있는 라이선스들은 전혀 동등하지 않습니다. 보드는 결코 그 사실을 알려주지 않습니다. 그것은 점수판에 없는 유일한 열입니다.

Generated summary card for Qwen-Image-2.1 on the Artificial Analysis boards, listing text-to-image rank 18 of 166 at 1,034 Elo from 5,286 votes, editing rank 18 of 97 at 1,074 Elo from 5,536 votes, the note that it is the top Open Weights row on both boards, and the sourcing line that the figures are per Artificial Analysis

자주 묻는 질문

Qwen-Image-2.1이 최고의 오픈 웨이트 이미지 모델인가요?

이 두 보드에서는, 예 — 두 보드 모두에서 Open Weights 마커를 달고 있는 가장 높은 Elo 행이며, 텍스트-투-이미지에서는 1,034, 편집에서는 1,074입니다. 전체적으로는 각각 18위이고 — 그 18은 한 보드에서는 166개 행 안에서의 순위, 다른 보드에서는 97개 행 안에서의 순위이며, 서로 비교할 수 없는 두 Elo 척도를 대신합니다. 그 주장은 두 한정어가 모두 붙어 있을 때만 성립합니다.

같은 모델인데 왜 두 보드가 서로 다른 Elo 값을 표시하나요?

그들은 서로 다른 작업을 서로 다른 모델 집단에 대해 채점한다. 텍스트-투-이미지 Elo와 편집 Elo는 별개의 척도이므로, 1,034와 1,074를 비교하는 것은 모델이 아니라 보드를 측정하는 것이다.

Qwen-Image-2.1을 API로 호출할 수 있나요?

두 보드 행 모두 API 사용 불가(으)로 기록합니다. 가중치는 Aliba​ba의 저장소에서 다운로드할 수 있으므로 모델은 실행됩니다. 다만 보드가 이 모델을 서비스한 것으로 인정한 호스팅 엔드포인트가 없을 뿐입니다.

오늘 다운로드 대신 숫자를 원한다면, 두 리더보드의 최상위는 각 벤더 자체 API를 통해 호출할 수 있으며, GPT-Image 라인, Google의 Imagen 티어, xAI의 Grok Imagine은 OrcaRouter가 직접 전면에 제공하는 이미지 모델이다. 실험을 위해서는 가중치 파일을, 마감을 위해서는 엔드포인트를 남겨 두세요.