
Ming-Image-0.1-Design, 오픈 웨이트 UI 디자인 보드에서 1위 — 그리고 그 숫자도 맞아떨어진다
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 177 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1323 tok/s
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
과 함께 유포되는 주장은 Ming-Image-0.1-DesigninclusionAI의 6B 모델이 UI 및 UX 작업을 위한 최고의 오픈 웨이트 텍스트-투-이미지 모델이며, Artificial Analysis UI/UX Design 리더보드의 오픈 웨이트 보기에서 1,082 Elo로 1위에 올라 있다는 것이다. 공급업체 리더보드 스크린샷은 보통 가장 약한 종류의 증거이므로, 가장 먼저 할 만한 일은 라이브 보드를 읽는 것이다. 2026년 9월 24일 기준으로 이는 유지되고 있지만, 스크린샷에는 없는 한 가지 중요한 단서가 있다: 1,082는 사용 사례 슬라이스이지 전체 보드가 아니며, 전체 텍스트-투-이미지 리더보드에서 같은 모델은 Elo 995로 45위에 올라 있다.
두 숫자는 모두 실제이며, 같은 아레나에서 나왔고, 동일한 가중치를 설명합니다. 이 둘을 가르는 것은 어떤 프롬프트에 투표가 이루어졌는지입니다.
라이브 보드에 실제로 적혀 있는 내용
Artificial Analysis는 하나의 블라인드 페어와이즈 아레나를 운영한 다음, 동일한 투표 풀을 사용 사례별 슬라이스로 필터링합니다. UI/UX 디자인 슬라이스는 대시보드, 앱 화면, 포스터, 인포그래픽을 위해 만들어진 모델에 중요한 부분이며, 바로 이곳에서 Ming-Image-0.1-Design이 가장 뛰어난 작업을 수행합니다:
• 종합 텍스트-투-이미지 리더보드 — Ming-Image-0.1-Design, #45위, Elo 995, 95% CI ±8, 21,342개 샘플, 2026년 9월 등재, 이미지 1,000장당 $30.00, Open Weights 플래그 지정됨
• UI/UX 디자인 슬라이스 — Ming-Image-0.1-Design, #16위, Elo 1,084, 슬라이스 내 샘플 2,100개
• 해당 구간에서 가장 높은 순위에 오른 오픈 웨이트 진입작 — Ming-Image-0.1-Design; 그 뒤를 잇는 다음 오픈 웨이트 모델은 Ideogram 4.0 (Quality) #22, 1,047점, Ideogram 4.0 #31, 1,018점, HunyuanImage 3.0 Instruct #40, 1,005점입니다.
• UI/UX 부문 최상위 — GPT Image 2.5 Flare (max) 1,226점, GPT Image 2.5 Sunburst (max) 1,215점, GPT Image 2 (high) 1,204점, Grok Imagine Image 2.0 1,183점
• 벤더 자체 스크린샷과 비교하면 — inclusionAI는 Ming에 대해 1,082를 공개했는데, 이는 Ideogram 4.0(Quality)의 1,052, FLUX.2 [dev]의 1,000과 대비된다. 실시간 슬라이스는 이제 각각 1,084, 1,047, 1,000으로 표시된다
그러니까 그 헤드라인은 나름의 기준에서는 정확하다. Ming-Image-0.1-Design은 UI/UX 디자인 부문에서 가장 높은 평가를 받은 오픈 웨이트 모델이며, 그 부문 상위 20위 안에 든 유일한 오픈 웨이트 모델이다. 또한 그 부문 선두보다 142 Elo 뒤처져 있고, 프롬프트가 디자인 프롬프트가 아닐 때는 중간권에 속한다. 대시보드에서 승리하고 전체 995에 그치는 모델은 올라운더가 아니라 전문가형이며, 두 수치는 그중 하나를 전체 이야기로 읽을 때만 모순된다.
전체 보드에 있는 21,342개 샘플은 그것이 무엇이 아닌지를 보여준다는 점에서도 주목할 만하다. 이는 많은 투표 수이며, 그래서 신뢰구간이 ±8 Elo로 좁다. 하지만 표본 수가 방법의 독립성과 같은 것은 아니다. 아레나는 블라인드 인간 선호도이므로, inclusionAI의 누구도 그 점수를 쓴 게 아니다 — 그 부분은 진짜다. 그 점수가 측정하는 것은 "투표자가 이 두 이미지 중 어느 것을 더 선호했는가"이며, UI 스크린샷을 판단하도록 요청받은 투표자들은 읽기 쉬운 텍스트와 일관된 레이아웃에 점수를 주는 경향이 있다. 그것이 바로 이 모델이 훈련된 축이다.

Ming-Image-0.1-Design이란 무엇인가
Ming-Image-0.1-Design은 Ant Group과 관련된 AI 연구소인 inclusionAI가 만든 텍스트-이미지 모델로, MIT 라이선스로 공개되며 가중치는 2026년 9월 17일에 게시되고 전체 릴리스 패키지는 9월 22일에 공개됩니다. 이 모델은 프롬프트만으로 생성하며 참조 이미지가 필요 없고, 사진이 아니라 텍스트가 많은 그래픽 디자인, 즉 UI 목업, 대시보드, 인포그래픽, 포스터, 그리고 렌더링된 텍스트가 실제로 읽힐 크기에서도 판독 가능하게 유지되어야 하는 모든 것을 겨냥합니다.
문서에 명시된 추론 구성은 구체적이며 단계당 비용이 이례적으로 저렴합니다:
• 해상도 — 2048 x 2048 권장, 더 빠른 생성을 위해서는 1024 x 1024, 중간 크기는 이 두 버킷 중 하나로 맞춰집니다
• 샘플링 단계 — 12
• 가이던스 — CFG 스케일 1.0
• 정밀도 — BF16
• 하드웨어 — 80 GiB의 VRAM을 갖춘 CUDA GPU 1개, 검증된 구성으로 설명됨
가이던스 스케일 1.0에서의 12단계는 증류된 또는 가이던스 없는 샘플러의 특징입니다. 바로 이것이 대부분의 디퓨전 모델이 시도하지 않을 단계 수에서 2048픽셀 출력을 감당 가능하게 만드는 이유이며, 한 번에 한 이미지가 아니라 대량으로 이미지 생성을 실행하는 사람에게 이 모델이 흥미로운 주된 이유입니다.
다른 구조적 특징은 투명성입니다. Ming-Image-0.1-Design은 네이티브 RGBA를 출력할 수 있으므로, 프롬프트가 문서화된 투명도 문구 중 하나로 시작하면 투명 배경이 매팅 패스가 아니라 샘플러에서 나옵니다. 동반 모델인 Ming-Image-0.1-Design-Layer는 한 단계 더 나아갑니다. 평탄화된 디자인과 레이어 계획을 입력받아 텍스트, 카드, 주요 피사체, 배경 등 별도의 RGBA PNG를 반환하며, 이들은 원본으로 다시 재구성됩니다. 이것이 디자인 모델과 이미지 모델의 차이입니다. 평면 PNG는 레이아웃의 그림이고, 분리된 레이어는 여전히 편집할 수 있는 레이아웃입니다.
![Screenshot of the inclusionAI/Ming-Image-0.1-Design model card on Hugging Face, captured 24 September 2026. The header shows 188 likes, 3,067 followers, tags including text-to-image, difusers, safetensors, image-generation, graphic-design, text-rendering and License: mit, and a safetensors panel reading Model size 6B params, Tensor type BF16. The card's UI/UX Design leaderboard image is embedded in the body, showing Ming-Image-0.1-Design first at 1,082 above Ideogram 4.0 (Quality) at 1,052 and FLUX.2 [dev] at 1,000. The right rail states 'This model isn't deployed by any Inference Provider', and the Quick Start block shows the infer.py command with --resolution 2048 and a note that prompt enhancement can use Ling-3.0-flash-VL or qwen3.8-27B.](https://cms.orcarouter.ai/api/media/file/3-1273.png)
6B 레이블과 26B 다운로드
"6B"는 대부분의 사람들이 말하는 부분에 대해서는 정확하지만, 실행 가능 여부를 결정하는 부분에 대해서는 오해를 부른다. 디퓨전 트랜스포머는 6.15B 파라미터다. 실제로 다운로드하는 패키지는 약 52.88GB인데, 멀티모달 텍스트 인코더가 17.01B 파라미터이고 커넥터가 3.09B를 더하기 때문이다 — BF16 기준 총 약 26B 파라미터다. Layer 모델의 트랜스포머는 12.31B로 기본 모델의 두 배이며, 패키지도 약 65.20GB로 더 크다.
이것은 두 가지 실용적인 이유에서 중요합니다. 첫째, 80 GiB VRAM 요구 사항은 6B 트랜스포머 자체에 관한 것이 아니라, 그와 함께 상주해야 하는 모든 것에 관한 것입니다. 둘째, "6B"라고 설명된 모델과 비교할 때는 어느 6B를 의미하는지 확인해야 합니다. 20B 텍스트 인코더를 갖춘 6B 확산 트랜스포머는 종단 간 6B 모델과는 매우 다른 배포 문제입니다.
프롬프트 처리는 카드가 숨기지 않고 명시적으로 드러내는 또 다른 사항입니다: 권장 레시피는 먼저 재작성 단계를 실행하며, 비전-언어 모델을 사용하여 짧은 프롬프트를 좌표, 계층 구조, 색상 사양 및 그대로의 텍스트를 포함하는 구조화된 Figma 스타일 JSON 레이아웃 설명으로 확장합니다. 모델 카드에는 해당 작업을 위해 Ling-3.0-flash-VL 또는 Qwen3.8-27B가 명시되어 있습니다. 다시 말해, 공급업체가 벤치마킹하는 파이프라인은 두 개의 모델로 구성된 파이프라인입니다. 한 줄 프롬프트와 재작성 단계 없이 Ming-Image-0.1-Design을 호출한다면, UI/UX 부문에서 1,084를 기록한 구성으로 실행하는 것이 아닙니다.
이것이 디자인 파이프라인을 어떤 상황에 놓는가
Ming-Image-0.1-Design에 대한 솔직한 요약은 이렇다. 이 모델은 특정하고도 값비싼 문제, 즉 사람이 들여다봐도 견디는 텍스트 밀집 레이아웃을 생성하는 문제를 해결하며, 그 문제를 측정하는 단 하나의 리더보드에서 오픈 웨이트 분야 최상위로 그 일을 해낸다. 전체 이미지 리더보드에서 선두를 차지하지는 않으며, 앞단에 VLM이 필요하다는 점을 없애주지도 않고, 제대로 된 GPU를 요구한다.
그것이 바꾸는 것은 디자인 워크플로의 중간 단계다. 현재 파이프라인이 평면 이미지를 생성한 뒤 사람이나 세그멘테이션 모델에게 비용을 지불해 그것을 잘라내고 있다면, RGBA를 기본으로 출력하는 모델과 2~9개의 이름 있는 레이어를 출력하는 동반 모델은 한 단계를 없애준다. 그것은 Elo 열보다 더 가치가 있으며, 어떤 리더보드도 측정하지 않는 부분이다.
인프라에 대한 약정 없이 테스트해 보고 싶은 팀이라면, 그 구분은 정확히 짚고 넘어갈 가치가 있습니다. Ming-Image-0.1-Design은 MIT 라이선스 다운로드이므로, 여러분의 하드웨어에서 실행되거나 아예 실행되지 않습니다 — OrcaRouter는 어떤 버전의 inclusionAI 모델도 라우팅하지 않으며, 그렇지 않다고 말하는 것은 저희가 지킬 수 없는 주장이 될 것입니다. 라우팅 레이어가 실제로 제공하는 것은 그 주변부입니다: 200개 이상의 모델을 아우르는 하나의 OpenAI 호환 엔드포인트, 제공업체 간 자동 페일오버, 그리고 0% 마크업으로 그대로 전달되는 제공업체 정가 — 따라서 여러분이 실제로 호출하는 어떤 모델이든 공급사 가격이 바뀌면 같은 날 저희 쪽에도 반영됩니다. 설계 파이프라인을 구축하면서 이미 신뢰하는 호스팅 모델과 이 모델을 A/B 비교하고 싶다면, 그 비교는 두 개의 계약이 아니라 하나의 키로 실행됩니다.

무엇이 상황을 바꿀까요?
세 가지가 Ming-Image-0.1-Design을 강력한 오픈 웨이트 전문 모델에서 기본 선택지로 바꿔 놓을 것이다. Layer 모델의 Crello 수치에 대한 최초의 독립적 재현 — 해당 카드에는 1024에서 RGB L1 오류 0.0574와 알파 소프트 IoU 0.8923이 보고되어 있으며, 외부 그룹이 이를 실행한 적은 없다. 그리고 80 GiB 요구 사항을 없애는 호스팅 엔드포인트. 그리고 모델이 UI/UX Design에서만큼 잘 배치하는 두 번째 사용 사례 슬라이스, 왜냐하면 단일 보드의 단일 슬라이스에서만 이기는 모델은 일반성이 아직 입증되지 않은 모델이기 때문이다.
그때까지, 정확한 문장은 좁은 것이다: Artificial Analysis UI/UX Design 슬라이스에서, 2026년 9월 24일 기준으로 읽으면, inclusionAI의 Ming-Image-0.1-Design은 2,100표에서 1,084 Elo로 가장 높은 평가를 받은 오픈 웨이트 텍스트-투-이미지 모델이며 — 같은 아레나의 전체 보드에서는 995로 45위다. 그 둘 모두 이 모델이다. 그중 어느 것도 출시 주장이 아니다. 이 모델은 출시가 없었고, 저장소가 있었기 때문이다.
