
Qwen-Image 2.1 vs MAI-Image-2.5-Pro: 0에 맞선 6,100개의 블라인드 투표
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
이 두 모델 중 하나는 약 6,100건의 블라인드 인간 비교를 통해 순위가 매겨졌습니다. 다른 하나는 자체 연구소 외부의 누구에게도 순위가 매겨진 적이 없습니다. MAI-Image-2.5-Pro는 마이크로소프트의 프리미엄 이미지 모델로, Artificial Analysis 이미지 편집 아레나에서 Elo 1,272로 1위에 올라 있으며, 이는 해당 카테고리에서 가장 많은 투표를 받은 결과입니다. Qwen-Image 2.1은 Qwen-Image 팀이 2026년 9월 20일에 오픈소스로 공개한 모델인데, 독립적인 점수가 전혀 없으며, 충분히 많은 사람들이 공개적으로 실행해 투표를 만들어내기 전까지는 점수가 생기지 않을 것입니다. 이 격차가 바로 이번 비교의 실제 주제입니다. 왜냐하면 그것이 두 모델 사이에서 벤더의 주장이 아닌 유일한 차이점이기 때문입니다. 나머지 모든 것 — 아키텍처, 해상도, 가격 — 은 알 수는 있지만 입증되지 않은 것이며, 두 모델은 서류상으로 충분히 비슷하기 때문에 결정을 이끌어야 할 것은 바로 이 측정 격차입니다.
투표가 실제로 말하는 것, 그리고 말하지 않는 것
Artificial Analysis는 블라인드 페어와이즈 비교를 진행합니다: 두 모델이 동일한 프롬프트를 받고, 투표자가 더 나은 출력을 선택하며, 그 결과에서 Elo가 산출됩니다. 완벽한 도구는 아니지만, 이 범주에서 공유 스코어보드에 가장 가까운 것이며, 표본 크기는 숫자만큼이나 중요합니다.
• MAI-Image-2.5-Pro — 약 6,100건의 비교를 기준으로 이미지 편집 부문에서 Elo 1,272로 1위입니다. 텍스트-투-이미지에서는 Elo 1,292로 7위이며, 1,369의 GPT Image 2 (high), 1,322의 Reve 2.1, 1,320의 Nano Banana 2, 1,310의 GPT Image 1.5 (high), 1,304의 MAI-Image-2.5보다 뒤에 있습니다.
• Qwen-Image 2.1 — 두 보드 어디에도 항목이 없습니다. 낮은 점수가 아니라 점수 자체가 없습니다. 이 릴리스는 작성 시점 기준으로 나온 지 하루밖에 되지 않았습니다.
그 숫자들의 형태는 주의 깊게 읽어볼 가치가 있습니다. 왜냐하면 그것은 마케팅이 암시하는 형태가 아니기 때문입니다. 마이크로소프트의 모델은 편집에서 실제로 1위이고 생성에서 실제로 7위입니다. 그것은 구체적이고 방어 가능한 위치, 즉 해당 카테고리를 선도하는 편집 전문가라는 위치이며, 최고의 이미지 모델이 되는 것과는 다른 것입니다. 그리고 실제로 최고의 이미지 모델은 아닙니다. 한편 텍스트-투-이미지에서 그것을 능가하는 모델은 GPT Image 2 (high)인데, 이는 이 분야에서 OpenAI의 최신 모델도 아닙니다. 독립적인 리더보드는 가장 많이 측정된 모델을 보상하는데, 이번 대결에서 그것은 명백히 마이크로소프트의 모델입니다.
오픈 모델이 완전히 압승하는 유일한 스펙
이 둘 사이에는 구체적이고 주관적이지 않은 차이가 있으며, 그것은 해상도입니다.
• Qwen-Image 2.1은(는) 2K에서 네이티브로 생성하며, 2048×2048이 40 추론 스텝에서 문서화된 기본값이고, 7가지 종횡비 프리셋과 매트가 아닌 실제 알파 채널을 갖춘 RGBA 출력을 제공합니다.
• MAI-Image-2.5-Pro출력을 1,048,576픽셀, 즉 약 100만 화소로 제한합니다. 이 제품의 대표 사양 수치는 다른 곳에 있습니다: 텍스트 입력 토큰 32,000개, 131k 컨텍스트 윈도, 출력 토큰 4,096개인데, 이는 이미지를 얼마나 많이 출력할 수 있는지가 아니라 얼마나 많은 지시를 흡수할 수 있는지를 말해주는 수치입니다.
대부분의 소셜 및 제품 작업에서 1메가픽셀 상한은 제약이 아니다. 인쇄, 대형 포맷 합성, 크롭이 살아남아야 하는 모든 작업에서는 제약이다. 이것은 전체 비교에서 숫자를 가리키며 오픈 모델이 앞서 있다고 말할 수 있는 유일한 차원이다. 그리고 그것은 품질 주장이 아니라 모델 카드에 있는 아키텍처적 사실이라는 점을 기억하라. Qwen-Image 2.1은 볼 만한 것을 렌더링하든 아니든 2048×2048로 렌더링할 것이다.
가격, 바로 그 지점에서 비교가 불편해진다.
MAI-Image-2.5-Pro는 프리미엄 모델로 책정되었으며, 수치는 결코 미묘하지 않다: 텍스트 입력 토큰 100만 개당 $5, 이미지 입력 토큰 100만 개당 $8, 이미지 출력 토큰 100만 개당 $106이다. 1024픽셀 출력에서는 이미지 1,000장당 약 $108.50로 환산된다. 규모를 가늠하자면, 이는 MAI-Image-2.5 비용의 약 2.3배이고 MAI-Image-2.5-Flash의 약 5.4배이므로, Microsoft는 Pro 등급을 점진적 업그레이드로 가격 책정하기보다 자사 라인을 의도적으로 세분화한 것이다.
Qwen-Image 2.1에는 호스팅 가격이 없습니다. 호스팅 엔드포인트가 없기 때문입니다. 이는 연구용 라이선스로 배포되는 가중치 다운로드입니다. 그 비용은 여러분의 GPU 시간이고, 그 제약은 그것이 생성한 결과물을 합법적으로 판매할 수 없다는 점입니다. 이미지 1,000장당 $108.50를 "무료 가중치"와 비교하는 것은 서비스를 기계와 비교하는 것이며, 그 비교의 정직한 형태는 이렇습니다. 종량제 가격은 측정되고 지원되며 상업적으로 라이선스된 모델을 사는 것이고, 가중치는 33 GB 다운로드와 비상업적 용도로만 사용 가능하다고 명시된 라이선스 파일을 사는 것입니다.
그러한 트레이드오프야말로 라우팅 계층이 존재 가치를 발휘하는 바로 그 지점입니다. OrcaRouter는 200개 이상의 모델을 하나의 OpenAI 호환 엔드포인트 뒤에 두고, 공급자 정가에 마크업 없이 제공하며, 공급자 간 자동 페일오버를 지원합니다 — 따라서 아직 측정되지 않은 오픈 모델을 평가하려는 팀이 그러기 위해 프로덕션을 그 모델로 옮길 필요가 없습니다, 그리고 정가가 그대로 전달되므로, 라우팅된 모델에 대한 공급업체 가격 변경은 다음 계약 갱신 때가 아니라 당일 우리 측에 반영됩니다. MAI-Image-2.5-Pro도 Qwen-Image 2.1도 현재 우리가 라우팅하는 모델에 포함되지 않으며, 이 글은 그렇지 않다고 암시하지 않을 것입니다. 우리가 실제로 앞단에 두는 이미지 라인은 OpenAI의 GPT-Image 제품군, Google의 Imagen 4 등급과 Gemini 이미지 프리뷰, 그리고 xAI의 Grok Imagine 이미지 엔드포인트입니다.

벤더 주장이 어디에 위치하는지, 그리고 그것에 얼마나 비중을 둘지
두 공급업체 모두 제3자가 재현한 적 없는 수치를 공표하고 있으므로, 이는 양쪽 모두에 대해 동일한 회의주의로 읽어야 합니다.
• 마이크로소프트의 주장 — 영어, 중국어, 일본어, 한국어, 스페인어 전반에서 96.8%의 텍스트 렌더링 정확도; GPT-Image-1.5보다 27% 더 나은 프롬프트 준수; 94%의 다중 이미지 캐릭터 일관성; 그리고 특정 마이크로소프트 내부 시나리오에서 최대 84~89% 더 낮은 GPU 비용. 마지막 항목은 주의해서 봐야 합니다. 이는 고객이 검증할 수 있는 어떤 것이 아니라 마이크로소프트 자체의 서빙 구성를 설명한 것이기 때문입니다.
• 알리바바의 주장 — Qwen-Image 2.1 블로그 게시물에는 Qwen-Image-Bench 비교 차트가 실려 있는데, 그 안의 수치는 벤더 자체에서 나온 것입니다. 또한 서드파티 보도에서는 이 모델을 20층 트랜스포머라고 설명하는 수치가 돌고 있는데, 이는 모델 카드의 32층 단일 스트림 DiT와 상충합니다. 모델 카드가 1차 출처이므로 32층이라는 수치를 사용해야 합니다.
두 상황의 차이는 어느 벤더의 정직성에 있는 것이 아니다. 그것은 Microsoft의 모델은 독립적으로 측정된 반면 Alibaba의 모델은 측정되지 않았다는 점이다. 따라서 Microsoft의 주장은 무엇인가와 대조해 확인할 수 있지만, Alibaba의 주장은 아직 아무것과도 대조해 확인할 수 없다.
각각의 용도
함께 읽으면, 이것들은 같은 자리를 두고 경쟁하는 것이 아닙니다.
• MAI-Image-2.5-Pro는 편집 도구입니다. 대규모 투표 기반에서 편집 리더보드를 선도하며, 긴 지시(32k 텍스트 입력 토큰, 131k 컨텍스트)를 입력받을 수 있고, 상업적 라이선스가 적용되며, 현재 Microsoft Foundry와 MAI Playground에서 공개 프리뷰로 이용할 수 있습니다. 당신의 작업이 반복적인 이미지 보정이고, 도입하기 전에 이 도구가 해당 작업에서 이용 가능한 최고인지 알아야 한다면, 이것이 측정된 답이며, 이미지 1,000장당 약 $108.50입니다.
• Qwen-Image 2.1은 공개 연구 결과물입니다. 더 크게 렌더링하고, 이미지 모델과 함께 검사 가능한 프롬프트 재작성 체크포인트를 제공하며, 원, 그린 주석 또는 마스크로 국소 편집을 하면서 최대 10개의 참조 이미지를 받아들이고, 무료로 다운로드할 수 있지만 판매하는 것은 불법입니다. 당신의 작업이 평가, 벤치마킹, 또는 읽을 수 있는 가중치를 기반으로 무언가를 구축하는 것이라면, 그것이 더 흥미로운 대상입니다 — 그리고 당신은 그것이 얼마나 좋은지 알려줄 리더보드도 없이 그 작업을 하고 있는 셈입니다.
언급할 가치가 있는 시점상의 비대칭성도 있다. MAI-Image-2.6은 2026년 8월 19일 비공개 프리뷰에 들어갔는데, 이는 편집 보드 최상단의 모델이 이미 Microsoft가 출시하려 준비 중인 것보다 한 세대 뒤처져 있다는 뜻이다. 반면 Qwen-Image 2.1은 첫날 단계로, 테스터들에게 9월 29일까지 공개하도록 요청한 얼리 액세스 프로그램을 운영 중이다. 이 비교의 두 점수판은 한 달 안에 모두 달라 보일 것이다.


무엇이 그것을 해결할까요?
한 가지 짚을 점: Qwen-Image 2.1이 리더보드에 등장한 것. 이 글에서 해상도 상한이나 가격이 아닌 모든 것은 어느 한 연구소나 다른 연구소의 주장이며, MAI-Image-2.5-Pro를 떳떳하게 추천할 수 있는 이유는 전적으로 Microsoft에서 일하지 않던 6,100명이 그 출력을 다른 것과 나란히 보고 그것을 더 선호했다는 점이다. 그것이 오픈 모델이 아직 충족하지 못한 기준이며, 마땅히 요구되어야 할 기준이다.
그때까지는 실용적인 판단이 간단하다. 오늘 편집 모델이 필요하고, 상업적 라이선스 아래에서, 그 뒤에 스코어보드까지 갖추길 원한다면, 답은 Microsoft의 것이며 이미지 1,000장당 약 $108.50이다. 네이티브 2K 출력과 검사 가능한 프롬프트 재작성기를 갖춘 7B 오픈 웨이트 모델이 더 나은지 알고 싶다면, 직접 측정해야 한다 — 그리고 그 결과로 할 수 있는 가장 유용한 일은 그것을 공개하는 것이다. 이 범주 전체가 현재 데이터 포인트 하나가 부족하기 때문이다.
