
Qwen-Image-2.1 vs Hy Image3.5: 독립 평가 위원회들은 이들을 정반대 순서로 순위를 매겼다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 223 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
맞붙여 보자:Qwen-Image-2.1과 Hy Image3.5를 두 개의 Artificial Analysis 이미지 보드에서 정면으로 비교하면, 보드들은 어느 쪽이 더 나은지에 대해 서로 엇갈린다. 텍스트-투-이미지에서는 Qwen-Image-2.1이 Hy Image3.5보다 59 Elo 앞선다 — 1,034 대 975, 순위 18 대 순위 66. 이미지 편집에서는 같은 두 모델이 자리를 바꾼다: Hy Image3.5가 1,088 Elo와 순위 14에 있고, Qwen-Image-2.1은 1,074와 순위 18이다. 반대 방향으로 14점 차이다. 두 모델은 이틀 차이로 공개되었다 — Qwen-Image-2.1은 2026년 9월 20일 오픈 웨이트로, Hy Image3.5는 2026년 9월 22일 공개 프리뷰로 — 그리고 이번이 둘 중 어느 하나가 같은 도구에서 점수를 받은 첫 사례이며, 바로 그 점이 이 불일치를 단순 보도가 아니라 읽을 가치가 있는 내용으로 만든다.
당연한 대응은 편집 위원회가 시끄럽다고 말하고 넘어가는 것이다. 그건 절반만 맞다. 나머지 절반은, 두 행이 똑같이 탄탄하지 않다는 점, 그중 하나의 가격이 다른 하나의 가격과 같지 않다는 점, 그리고 이 모델 중 하나는 가중치에 대한 권리를 보유하지만 다른 하나는 결코 그러지 못하리라는 점이다.
보드 두 개, 주문 두 건
Artificial Analysis는 블라인드 쌍별 비교를 실행합니다 — 두 모델에 같은 프롬프트를 주고, 투표자가 승자를 선택하며, Elo가 누적됩니다 — 그리고 작업별로 별도의 보드를 게시합니다. 텍스트-투-이미지 보드에는 166개의 행이 있고, 편집 보드에는 97개가 있습니다. 두 모델 모두의 두 행은 동일한 제공업체의 스냅샷에서 나온 것이므로, 이는 버전 불일치가 아닙니다.
• 텍스트-이미지 — Qwen-Image-2.1은 Elo 1,034(구간 1,024~1,044), 5,286회 비교 기준, 166개 중 18위입니다. Hy Image3.5는 Elo 975(구간 966~984), 5,334회 비교 기준, 166개 중 66위입니다. 두 구간은 겹치지 않습니다. 비슷한 크기의 표본에서 59점 차이는 반올림 오류가 아니라 실제 순위 차이입니다.
• 이미지 편집 — Hy Image3.5는 5,550회 비교에서 Elo 1,088(구간 1,079~1,097), 97개 중 14위. Qwen-Image-2.1은 5,536회 비교에서 Elo 1,074(구간 1,065~1,083), 97개 중 18위. 이 두 구간은 1,079~1,083의 4점 폭에서 겹친다. 순위는 방향성을 나타낼 뿐, 확립된 것은 아니다.
• 두 보드 모두 표본 크기가 비슷합니다 — 텍스트-투-이미지에서는 5,286 대 5,334, 편집에서는 5,536 대 5,550 — 따라서 신뢰도의 차이는 한 모델이 덜 투표된 문제가 아닙니다.
• 보드에서는 모델에 서로 다른 라벨을 붙이는데, 이는 중요합니다: Qwen-Image-2.1 행에는 Open Weights 마커가 있고, Hy Image3.5 행에는 없습니다.
그래서 솔직한 해석은 비대칭적이다. 텍스트-투-이미지: Qwen-Image-2.1이 확실히 앞선다. 편집: Hy Image3.5가 아마 앞서 있을 텐데, 그 차이는 측정의 노이즈 범위 안에 있다.
비대칭은 어디에서 비롯되는가
Hy Image3.5의 편집 강점은 Tencent가 함께 출시한 내용을 보면 놀랄 일이 아니다. 이 프리뷰는 요청당 최대 5개의 참조 이미지, 동일 모델 내 텍스트-투-이미지와 이미지-투-이미지, 그리고 멀티턴 편집을 공개하며 출시 시 편집 영역에 중점을 두었다. Qwen-Image-2.1은 참조 이미지도 처리하는 통합 생성-편집 스택으로 구축되었지만, 그 보드 행은 편집 측면이 Alibaba의 자체 Qwen-Image-3.0-Pro보다 2 Elo 낮게 마감되었음을 보여주며, 이는 출시 프레이밍이 암시한 것보다 더 좁은 결과이다.
텐센트 자체의 주장도 보드가 보여주는 것과는 다릅니다. 벤더는 이 프리뷰가 Hy Image3.0 대비 약 30%의 블라인드 평가 승률을 기록한다고 말합니다. 그 수치는 텐센트 외부의 누구도 재현하지 못했으며, 독립 보드도 텍스트-이미지에서는 이를 뒷받침하지 않습니다. 여기서 975점의 Hy Image3.5 프리뷰는 995점의 오픈 웨이트 HunyuanImage 3.0 Instruct보다 20 Elo {{2}}낮습니다{{/2}}.낮습니다편집에서는 같은 비교가 벤더 쪽 손을 들어줍니다. 1,088점의 Hy Image3.5 프리뷰는 1,066점의 HunyuanImage 3.0 Instruct보다 22 Elo 높습니다. 텐센트 자체의 세대 계승에서, 한 보드에서는 한 세대의 진전이 있고 다른 보드에서는 한 걸음 후퇴한 셈입니다.

가격 축, 여기서 둘은 전혀 비교할 수 없다
Hy Image3.5 preview는 종량제 API입니다. Tencent Cloud는 중국 본토 엔드포인트에서 2K 이미지 한 장당 ¥0.15를, 국제 엔드포인트에서는 US$0.024를 청구하며, API가 반환한 이미지에 대해서만 과금합니다. Artificial Analysis의 가격 열에는 이미지 1,000장당 $24.00가 기록되어 있는데, 이는 이 보드에서 사용하는 단위로 같은 수치입니다. 그리고 텍스트-이미지 보드 최상위 행이 같은 1,000장에 대해 제시하는 $210.70과 비교하면, 이는 그 가격의 9분의 1도 되지 않습니다.
Qwen-Image-2.1에는 가격 행이 없습니다. 엔드포인트가 없기 때문입니다. 보드의 두 행 모두 명시적인 사용 가능한 API 없음 주석을 달고 있습니다. 이 모델은 구매하는 것이 아니라 다운로드하는 것이며, 그 비용은 GPU 시간과 아래의 라이선스 문제로 치릅니다. 해당 행의 5,286표와 5,536표는 가중치를 직접 실행한 사람들에게서 나왔습니다. 이 사실은 순위에 지켜둘 만한 단서도 하나 더해 줍니다. 자체 호스팅 전용 모델에 대한 독립적인 Elo는 누구나 호출할 수 있는 대상에 대한 Elo와는 다른 모집단을 측정합니다.
이 둘 중 하나를 제품에 넣을 계획이라면, 실용적인 구분은 이제 명확하며, 이는 가격이 암시하는 구분과 같습니다. 편집 점수가 더 좋은 모델은 임대해서 쓰는 모델이고, 텍스트-투-이미지 점수가 더 좋은 모델은 직접 운영하는 모델입니다. OrcaRouter는 그중 임대 쪽에 해당합니다 — 200개 이상의 모델을 하나의 API로 제공하며 제공업체 정가를 마진 없이 그대로 전달하고, 제공업체 전반에 걸친 자동 장애 조치, 그리고 여러 모델을 하나의 호출로 구성하기 위한 라우팅 DSL을 제공합니다. 우리는 Hy Image3.5 preview나 Qwen-Image-2.1을 라우팅하지 않습니다. 플랫폼의 이미지 라인업은 Google의 Imagen 등급과 Gemini 이미지 프리뷰, xAI의 Grok Imagine 이미지 엔드포인트, OpenAI의 GPT-Image 제품군입니다. 이 둘 중 어느 것도 게시판의 한 줄만으로는 그 목록에서 첫 번째 선택이 되지 못하며, 바로 그래서 아래의 라이선스 질문이 이를 결정합니다.
어느 보드에도 열이 없는 축

Qwen-Image-2.1은 2026년 9월 20일자 Qwen Research License Agreement에 따라 배포되며, 이 계약은 비상업적 목적에 한해서만 권리를 부여하고 상업적 사용을 위해서는 공급업체로부터 별도의 라이선스를 받아야 합니다. 그런 이유로 Hugging Face 저장소는 해당 라이선스를 기타로 보고합니다 — 이는 OSI 라이선스가 아니며 그렇게 해석되어서도 안 됩니다. 두 보드 행에 표시된 Open Weights 마커는 정확하며, 이 점에 관해서는 아무것도 말해주지 않습니다.
Hy Image3.5 preview에는 라이선스할 가중치가 없습니다. Tencent는 이를 공개하지 않았습니다. 이 preview는 Tencent 자체 플랫폼에서 제공되며, 이 세대의 다운로드 가능한 릴리스는 없습니다. 여러분이 얻는 것은 요금표, 참조 이미지 제한, 그리고 시작하고 중지할 수 있는 서비스뿐입니다. 감사할 것도, 호스팅할 것도, 협상할 것도 없으며 — Tencent가 가격을 바꾸거나 preview를 종료하면 남는 것도 없습니다.
오픈 웨이트 문제를 실제로 해결해 주는 비교는 Qwen의 모델이 아니라 Tencent 자체의 전작입니다. HunyuanImage 3.0 Instruct는 두 보드 모두에 Open Weights 마커와 함께 올라와 있습니다. 편집에서는 1,066, 텍스트-투-이미지에서는 995입니다. Qwen-Image-2.1은 둘 다에서 이를 앞섭니다. 따라서 요구 사항이 "내 하드웨어에서 실행할 수 있는 다운로드 가능한 웨이트"라면, 이 맞대결에서 가장 좋은 선택은 어느 보드에서든 Alibaba의 것이며, 여전히 출력물 판매를 금지하는 라이선스가 적용됩니다.
서류가 알아서 해결되는 버전은 없다. 가중치 없이 종량제 청구로 더 나은 편집 점수를 얻거나, 상업적으로 이용할 수 없는 가중치로 더 나은 텍스트-투-이미지 점수를 얻을 수 있다. 어느 제약을 감당할 수 있는지 고르고, 그런 다음 자신의 프롬프트로 둘 다 측정해 보라 — 둘 사이의 편집 격차는 서로 겹치는 구간 안에서 4점 폭인데, 이는 단 하나의 홀드아웃 프롬프트 세트로도 지워질 수 있는 종류의 차이다.
