이미지 1,000개당 약 $108.50인 MAI-Image-2.5-Pro와 이미지 1,000개당 약 $25인 Qwen-Image 3.0 간의 대결을 보여주는 히어로 카드로, 두 API 이미지 모델 모두 텍스트 렌더링에서 선두를 달리고 있습니다.
Guides & Insights

MAI-Image-2.5-Pro vs Qwen-Image 3.0: 4배의 가격, 다른 종류의 텍스트

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

생각해 보세요. MAI-Image-2.5-ProQwen-Image 3.0을 나란히 놓고 보면 가장 먼저 눈에 띄는 것은 가격입니다: 대략 이미지 1,000장당 $108.50이며, 이는 Microsoft의 프리미엄 등급 가격입니다. 반면에 대략 1,000장당 $25–30이며, 이는 알리바바의 Qwen-Image 3.0의 가격입니다. — 알리바바 자체의 인용 요금은 약 $25이며, Artificial Analysis의 리더보드에는 $30으로 나와 있습니다. 어느 수치로 보나 세 배가 넘는 금액입니다. 그 프리미엄이 실제로 사 주는 것은 다른 종류의 텍스트 처리 작업입니다. Qwen-Image 3.0은 알리바바의 Q​wen 팀이 2026년 7월 21일에 출시하고 8월 4일에 국제 API로 개방한 모델로, 대량 텍스트 렌더러로 가격이 책정되어 있습니다. 12개 언어에서 ~10px까지 읽을 수 있으며, 복잡한 브리프를 위한 4,500-토큰 프롬프트 창을 갖추고 있습니다. MAI-Image-2.5-Pro는 7월 23일부터 Microsoft Foundry에서 공개 미리 보기 중이며, 독립 리더보드에서 가장 높은 평가를 받는 에디터로, 벤더가 주장하는 텍스트 렌더링 정확도를 갖추고 있지만 출력 상한이 ~1메가픽셀로 고정되어 있습니다. 둘 다 헤드라인이 텍스트에 관한 API 이미지 모델이며, 단일 품질 점수가 아닌 작업당 가격으로 경쟁하고 있습니다.

두 개의 텍스트 스토리, 어느 것도 완전히 검증되지 않음

텍스트 배틀은 두 모델이 모두 존재하는 이유이자, 증거가 가장 빈약한 지점이기도 하다 — 이 섹션의 모든 수치는 공급업체가 보고한 것이며, 그중 어느 것도 독립적으로 재현된 적이 없다.

Qwen-Image 3.0 — 알리바바의 출시 자료에 따르면 약 10px, 기본 지원 언어는 12개 언어 와 함께 20개 이상의 글꼴과 100개 이상의 아트 스타일, 수학 표기법, 아래 첨자, 위 첨자, 여러 줄 수식, 그리고 일반적인 웹, 게임, 소프트웨어 인터페이스에 대한 친숙성을 갖추고 있습니다. 프롬프트 창은 최대 4,500개 토큰 의 입력 — 이전 세대 대비 4.5배 증가 — 덕분에 신문 전면이나 9개 패널 지식 그리드와 같은 밀도 높은 브리핑을 한 번에 처리할 수 있습니다.

MAI-Image-2.5-Pro — 마이크로소프트는 96.8%의 텍스트 렌더링 정확도를 중국어, 영어, 일본어, 한국어, 스페인어에서 달성했고, 27% 더 높은 프롬프트 준수율을 GPT-Image-1.5에 비해 내부 평가에서 보였으며, 94%의 다중 이미지 캐릭터 일관성을 보였다고 주장합니다. 입력 사양은 명목상 더 넓다 — 최대 32,000개의 텍스트 입력 토큰과 131k 컨텍스트 창 — 그리고 출력은 1,048,576픽셀, 즉 1024×1024에 해당하는 크기로 제한됩니다.

두 주장 모두 작성 시점 기준으로 재현되지 않았다. 차이는 주장의 형태에 있다. Qwen의 주장은 여러 문자 체계에 걸친 용량과 가독성에 관한 것이고, Microsoft의 주장은 정해진 다섯 개 언어에 대한 정확성과 일관성에 관한 것이다. 두 공급업체 모두 다른 연구소가 실행하고 확인할 수 있는 벤치마크를 발표하지 않았다.

프리미엄이 사는 곳은 편집이다

둘을 구분하는 것은 편집이며, 이는 독립적인 증거가 있는 유일한 축입니다. MAI-Image-2.5-Pro는 Artificial Analysis Image Editing Arena의 Elo 1,272에서 1위입니다 (~6,100표의 블라인드 투표), Reve 2.1, MAI-Image-2.5, GPT Image 2보다 앞서 있습니다. 같은 보드에서, 더 새로운 Qwen-Image-3.0-Pro는 1,249 — 경쟁력 있는 점수이며, Elo 23점 뒤처져 있고, 이번 달에 국제 API에 도달한 모델로서 주목할 만합니다.

기본 모델을 넘어서, 알리바바의 편집 포트폴리오는 단일한 왕관이라기보다는 전문가용 트릭의 집합입니다: 고대 그림 복원, 파노라마 생성, 스케치-투-PPT, 멀티샷 스토리보드. 마이크로소프트의 것은 더 좁고 깊은 베팅입니다 — 나머지 프레임을 일관되게 유지하는 정밀하고 외과적인 편집(객체 교체, 레이아웃 변경, 이미지 내 텍스트 업데이트, 블러 정리)을 의미하며, 이는 이전 모델들이 전체 장면을 재생성하고 대상을 잃어버리는 편집 유형입니다. "기존 자산을 가져와 한 가지만 바꾸고 배포하는" 워크플로우의 경우, Pro 등급의 독립적인 1위가 더 강력한 신호입니다; 잡다한 창의적 편집 형식의 경우, Q​wen의 목록이 더 넓습니다.

Screenshot of the Artificial Analysis Image Editing leaderboard showing MAI-Image-2.5-Pro at No. 1 with Elo 1,272 ahead of Reve 2.1, MAI-Image-2.5, and GPT Image 2

스펙 대비

• 가격 — 1k 이미지당 ~$108.50 (1024×1024, AA 변환) vs 1k 이미지당 ~$25–30 (Alibaba 견적 vs AA 공시 요금)br />• 출시 — 2026년 7월 23일 (공개 미리보기, Foundry) vs 2026년 7월 21일, 국제 API 8월 4일br />• 텍스트 입력 — 32,000 토큰, 131k 컨텍스트 vs 4,500 토큰 프롬프트 창br />• 출력 상한 — ~1,048,576 픽셀 (~1K) vs 최대 2048×2048br />• 호출당 이미지 수 — 요청당 단일 출력 vs 호출당 최대 6개 이미지br />• 편집 순위 — 1위, Elo 1,272 (AA) vs 동일 리더보드에서 Qwen-Image-3.0-Pro의 1,249br />• 출처 — Microsoft의 "타사 모델에서 증류하지 않음" 주장 vs 출력물의 AIGC 출처 라벨br />• 가중치 — 비공개, API 전용 vs 비공개, API 전용

출력 상한과 호출당 개수는 겉보기보다 중요합니다. Qwen-Image 3.0은 2048×2048 이미지를 렌더링할 수 있고 호출당 최대 6개 이미지를 반환할 수 있어 배치 경제성에 유리합니다. Pro 티어는 약 1K에서 상한을 두고 요청당 단일 출력만 반환합니다. 요청이 "제품 사진 6장을 달라"는 것이라면, 알리바바 모델은 그에 적합하지만 마이크로소프트 모델은 그렇지 않습니다.

Two-column scoreboard for MAI-Image-2.5-Pro and Qwen-Image 3.0 comparing price per 1k images, output ceiling, images per call, prompt window, editing rank, and text-rendering claim

프리미엄이 스스로 비용을 충당할 때

결정 기준은 어떤 모델이 "더 나은지"에 관한 것이 아니라, 이미지가 무엇을 위한 것인지에 관한 것입니다.

MAI-Image-2.5-Pro에 프리미엄 요금을 지불하세요 — 출력물이 히어로 자산일 때, 즉 제품 비주얼, 포스터, 키프레임, 캠페인에 투입되어 50번이나 다시 생성되지 않을 이미지일 때만입니다. 편집이 처음부터 제대로 되어야 할 때는 #1 편집 랭킹과 캐릭터 일관성 보장이 가장 중요합니다.

Qwen-Image 3.0으로 대량 구매하세요.출력물이 일회용이거나 대량일 때 — 현지화된 광고 변형, 자리 표시용 아트, 스케치-투-PPT 데크, 스토리보드 프레임, 다듬기보다 재생성할 모든 것. 1k당 $25–30에서는 실패한 생성이 반올림 오류에 불과하지만, 1k당 $108.50에서는 그렇지 않습니다.

이름을 붙일 만한 중간 지점이 있습니다. 일본어와 스페인어 텍스트가 들어간 랜딩 페이지 목업, 수식이 포함된 인포그래픽처럼 텍스트가 빽빽하고 여러 언어로 된 이미지 작업에는 Q​wen의 10px 가독성과 12개 언어 지원이 서류상으로는 더 적합하며, 가격도 4분의 1입니다. Microsoft 모델의 반론은 5개 언어에서 96.8% 정확도를 주장한다는 점이지만, 그 주장은 검증되지 않았습니다. 검증되지 않은 두 텍스트 관련 주장 사이에서 고르는 구매자라면 가격에 더 무게를 두는 것이 합리적일 것입니다.

Scoreboard for MAI-Image-2.5-Pro: image editing No. 1 at Elo 1,272, text-to-image No. 7 at 1,292, $108.50 per 1k images, 32k text input tokens, 131k context, ~1-megapixel output cap, public preview on Microsoft Foundry

라우팅 계층이 적용될 때

어느 모델도 아직 OrcaRouter를 통해 연결할 수 없습니다 — Qwen-Image 3.0은 Alibaba 자체 API(Alibaba Cloud Bailian 및 Q​wen 플랫폼)와 여러 타사 플랫폼에 있고, MAI-Image-2.5-Pro는 Microsoft Foundry에 있습니다. 그러므로 솔직한 비교는 지금 어느 쪽도 우리 쪽에 없다는 것을 분명히 말해 줍니다. 둘 중 하나가 호출 가능한 호스팅 제공업체를 통해 제공되면 통과 과금(pass-through) 경제가 적용됩니다. 즉, 제공업체 공시 가격에 0% 인상이라서 벤더의 요금표 그대로를 지불하게 되고, 출시 할인 또는 가격 인하는 발표된 날짜에 바로 청구서에 반영됩니다. 장애 조치 측면이 나머지 절반입니다. Qwen-Image 3.0은 몇 주 전에 나온 국제 API로, 검증된 폴백이 엣지 케이스를 흡수하는 동안 트래픽 일부를 해당 모델로 라우팅하는 방식에 적합합니다. 이것이 바로 라우팅 계층이 만들어진 이유입니다.

평결

Qwen-Image 3.0과 MAI-Image-2.5-Pro는 가격만 다른 동일한 제품이 아니라, 우연히 가격이 다르게 책정된 서로 다른 제품입니다. Microsoft의 모델은 편집 부문에서 왕좌를 차지하고, 더 큰 컨텍스트 창을 보유하며, 5개 언어에 걸쳐 검증되지 않은 정확성 주장을 내세웁니다. 히어로 에셋과 정밀 편집의 경우 프리미엄 가격은 타당합니다. Alibaba의 모델은 더 많은 문자를 또렷하게 렌더링하고, 자체 조건으로 생성당 더 밀도 높은 브리프를 수용하며, 더 큰 크기로 6개 배치로 출력하고, 비용은 4분의 1에 불과합니다. 대량 작업과 다국어 텍스트 인 이미지 작업에는 경제적으로 합리적인 선택입니다. 이미지가 곧 제품이라면 프리미엄을 구매하고, 이미지가 재고라면 대량을 구매하세요.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube