"{{Ming-Image-0.1-Design}} vs {{Qwen-Image 3.0}}"의 히어로 타이틀 카드로, 부제는 "텍스트가 어떻게 그려지는지 누가 보여주는가."이며, Ming-Image-0.1-Design(6.15B 파라미터, MIT 라이선스, 읽을 수 있는 가중치, 2026년 9월 17일 공개)과 Qwen-Image 3.0(비공개 호스팅 모델, 파라미터 수 미공개, 라이선스나 보고서 없음, 2026년 8월 5일 정식 출시)을 대조하고, 오른쪽 아래 모서리에 OrcaRouter 로고를 넣습니다.
Guides & Insights

Ming-Image-0.1-Design vs Qwen-Image 3.0: 텍스트가 어떻게 그려지는지 누가 보여줄까

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

에서 가장 흥미로운 점은Ming-Image-0.1-Design 모델 카드에 있지 않습니다. 그것은 추론 프레임워크에 대한 하나의 커밋 안에 있습니다. 2026년 9월 17일 이 모델이 조용히 Hugging Face에 업로드되던 무렵, vLLM-Omni는 feat: add byte5 support for Ming라는 제목의 변경 사항을 병합했는데, 이는 ByT5 글리프 인코더를 새로운 ming_flash_omni 파이프라인에 연결합니다 — 이 전용 구성 요소의 존재 목적은 요청한 그림이 아니라 렌더링하도록 요청한 문자를 들여다보는 것입니다. 이는 코드를 읽어야만 찾을 수 있는 종류의 세부 사항이며, 바로 Qwen-Image 3.0 — 2026년 7월 21일 출시되어 8월 5일 정식 출시된 해당 벤더의 폐쇄형 호스팅 이미지 모델 — 이 누구에게도 전혀 읽히지 않게 하는 바로 그 세부 사항입니다. 두 모델 모두 읽을 수 있는 활자가 어려운 부분인 디자인 작업을 겨냥합니다. 그 방법을 알려주는 것은 둘 중 하나뿐입니다.

각각이 텍스트에 대해 말하는 내용

Qwen-Image 3.0의 텍스트 렌더링 관련 이야기는 전적으로 출시 당시의 주장이며, 서류상으로는 훌륭한 주장이다. Alibaba의 자료는 프롬프트가 최대 약 4,500 토큰, 판독 가능한 텍스트는 약 10픽셀까지, 20개 이상의 폰트에 걸친 12개 언어 지원, 출력은 최대 2048×2048 및 호출당 최대 6개 이미지, 그리고 단일 호스팅 API를 통해 Pro와 Standard 에디션으로 제공된다고 설명한다. 이를 검증할 수 있는 가중치 공개도, 명시된 라이선스도, 모델 카드도, 기술 보고서도, 공개된 벤치마크 표도 없다. 널리 반복되는 약 20B 규모의 MMDiT 파라미터 수치는 확인된 것이 아니라 보도된 것에 불과하다.

Ming-Image-0.1-Design의 이야기는 하나의 저장소입니다. 6,154,901,056개의 파라미터, MIT 라이선스, diffusers 파이프라인 태그, 모든 가중치는 BF16 safetensors 형식이며, 약 71.5GB가 다음에 걸쳐 있습니다: connector/, mllm/, mlp/, scheduler/, transformer/vae/. 권장 추론은 하나의 80GiB CUDA GPU에서 12 샘플링 스텝과 가이던스 1.0으로 2048×2048이며, 속도를 위해서는 1024입니다. 배포용으로는 vLLM-Omni가 지정되어 있고, 프롬프트 향상용으로는 별도의 비전-언어 모델이 지정되어 있습니다. 카드에서는 이를 UI, 인포그래픽, 포스터 및 기타 텍스트가 풍부한 시각 디자인을 위한 텍스트-투-이미지 모델로 설명하며, 투명 배경을 위한 RGBA 출력을 제공합니다.

그 두 문단은 같은 종류의 진술이 아니며, 왜 그런지는 솔직히 짚고 넘어갈 가치가 있다. 하나는 그 제품을 판매하는 사람들이 쓴 제품 설명이다. 다른 하나는 누구나 내려받아 확인할 수 있는 산출물에 대한 설명이다.

글리프 인코더는 카테고리를 설명하는 부분입니다.

이미지 모델에서 텍스트 렌더링은 대개 특정한 방식으로 실패한다. 모델은 글쓰기처럼 보이지만 글쓰기는 아닌 무언가를 생성한다. 글자 형태는 그럴듯하지만 단어는 틀렸다. 그 이유는 무엇보다도 먼저 아키텍처에 있다. 대부분의 이미지 모델에는 문자를 문자로서 인식하는 컴포넌트가 없기 때문에, 활자는 잔디가 재구성되는 것과 같은 방식으로 시각적 통계로부터 재구성된다.

vLLM-Omni 커밋이 흥미로운 이유는 바로 그것을 가리키고 있기 때문입니다. 추가된 파일들 — byte5_encoder.py, pipeline_ming.py, t5_block_mapper.py 그리고 스테이지 입력 프로세서 — 는 이미지에 나타나야 할 텍스트를 ByT5 바이트 수준 인코더가 읽고, 토크나이저 어휘가 폰트 및 색상 마커로 확장되며, 그 결과로 나온 특징들이 시퀀스 차원을 따라 덧붙여지고 부정 측에는 0이 채워지는 경로를 설명합니다. 이 마지막 세부 사항이 이것이 단순한 배관 작업이 아니라 실제 설계 결정이라는 것을 보여주는 단서입니다. 만약 부정 브랜치가 동일한 글리프 특징을 담고 있었다면, classifier-free guidance는 텍스트를 렌더링하는 쪽으로 끌려가고 프롬프트에서는 멀어졌을 것이므로, 두 목표가 서로 충돌하지 않도록 0이 존재하는 것입니다. 인코더는 체크포인트에 실제로 byte5/ 하위 폴더가 포함되어 있을 때만 로드됩니다.

정직하게 밝힐 두 가지가 있습니다. 이것은 Ant Group의 성명이 아니라 서드파티 추론 프레임워크 커밋이며, 그 파일들이 의미하는 바에 대한 해석은 벤더의 것이 아니라 우리의 것입니다. 그리고 그것은 결과가 아니라 설계 의도를 뒷받침합니다: 글리프 인코더가 있다는 것은 좋은 텍스트 렌더링과 부합하지만, 텍스트 렌더링이 좋다는 증거는 아닙니다. 품질에 관한 유일한 독립적 증거는 아래에서 논의하는 단일 리더보드 순위입니다.

A pipeline diagram titled "How the glyph encoder enters the pipeline", showing prompt text passing through a tokenizer extended with font and colour markers into a ByT5 glyph encoder whose features are appended along the sequence dimension, with the negative branch receiving zeros so guidance is not pulled away from rendered text, and the result emerging as an RGBA image.

Qwen-Image 3.0과의 대비는 Alibaba의 모델이 텍스트를 형편없이 렌더링한다는 데 있지 않다 — Alibaba 외부의 누구도 그 모델이 텍스트를 얼마나 잘 렌더링하는지 말할 수 없으며, 바로 그 점이 핵심이다. 대비는 "이 모델은 글자를 어떻게 그리는가"라는 질문에 대해 한 모델은 답을 갖고 있고 다른 모델은 마케팅 주장을 갖고 있다는 데 있으며, 답과 주장 사이의 간극이 바로 엔지니어링 의사결정이 이루어지는 곳이다.

단 하나의 숫자, 그리고 그 숫자가 놓여 있지 않은 보드

Ming-Image-0.1-Design은 UI/UX 디자인 부문 Artificial Analysis 텍스트-투-이미지 리더보드의 오픈 웨이트 보기에서 Elo 1,082로 1위에 올랐습니다 — 1,052의 Ideogram 4.0 (Quality), 1,015의 Ideogram 4.0, 1,005의 HunyuanImage 3.0 Instruct, 1,000의 FLUX.2 [dev], 999의 FLUX.2 [dev] Flash, 994의 FLUX.2 [dev] Turbo보다 앞섭니다. 그 리더보드의 사본은 해당 모델 자체 카드에 재현된 것이며, Artificial Analysis 브랜딩을 달고 있습니다; 아무도 그 점수를 독립적으로 재현하지 않았습니다.

The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.

이것은 오픈 웨이트 보드이므로 Qwen-Image 3.0은 등재되지 않았고, 그 부재가 품질에 대해 말해주는 바는 없다. 그것이 실제로 말해주는 것은 구조적인 문제다. 블라인드 선호도 보드는 가중치가 공개된 모델만 순위를 매길 수 있다. 이는 오픈 릴리스에게 제품이 나오기도 몇 달 전에 측정 가능한 위치를 부여하고, 클로즈드 릴리스에게는 마케팅용 숫자 하나만을 줄 뿐이다. Qwen-Image 3.0의 주장, 즉 10픽셀 가독성, 4,500토큰 프롬프트, 20개 이상의 폰트는 이를 뒷받침하는 독립적 측정치가 전혀 없다.

A two-column scoreboard titled "Ming-Image-0.1-Design vs Qwen-Image 3.0 - the scoreboard". Left column Ming-Image-0.1-Design: Weights downloadable, 6.15B; Licence MIT; Text rendering glyph encoder visible; Independent score Elo 1,082; Price self-host; Internals readable. Right column Qwen-Image 3.0: Weights none; Licence not published; Text rendering 10px claim, vendor-reported; Independent score none; Price about $0.04 per image; Internals black box. Footer reads "Qwen-Image 3.0 claims vendor-reported; Ming score per the Artificial Analysis board on its model card.", with the OrcaRouter logo bottom-right.

실제로 이것을 어떻게 테스트할지, 그리고 시도하는 데 드는 비용

읽을 수 있는 활자가 바로 당신이 이 글을 읽고 있는 이유라면, 그 테스트는 리더보드가 아닙니다. 그것은 당신 자신의 서체, 당신 자신의 언어, 당신 자신의 문자열을 두 후보 모두에 돌려 보고 사람이 직접 읽는 것입니다. 그 테스트가 성립하려면 이 모델들 중 하나는 접근 가능하고 저렴해야 하며, 다른 하나는 다운로드 가능해야 합니다. 그리고 이 둘은 상반된 원칙에 따라 가격이 매겨져 있습니다.

• Qwen-Image 3.0 — Pro 에디션에서는 이미지당 약 $0.04, Standard에서는 약 $0.03이며, 중국 내 소비자 가격은 이미지당 ¥0.18 부근에서 시작합니다. 이는 출시 당시 수치이며 감사를 받지 않았습니다. 오늘 오후에 프롬프트 매트릭스를 실행하고 호출당 비용을 지불할 수 있습니다.

• Ming-Image-0.1-Design — 공개된 가격은 없습니다. 호스팅된 엔드포인트가 없기 때문입니다. 비용은 71.5 GB 다운로드, 80 GiB 카드, 그리고 본인의 시간이며, 이점은 동일한 테스트를 글리프 인코더 경로에 적용해 해당 구성 요소가 실제로 작업을 수행하는지 확인할 수 있다는 것입니다.

이것이 바로 라우팅 레이어가 만들어진 상황이며, 그중 어떤 부분이 해당되는지 정확히 짚어볼 가치가 있습니다. Qwen-Image 3.0도 Ming-Image-0.1-Design도 우리 플랫폼에는 없으므로, 라우팅 레이어가 오늘 이들 중 하나를 키 뒤에 둘 수는 없습니다. 라우팅 레이어가 할 수 있는 일은 당신이 비교를 돌리는 동안 그 비교를 정직하게 유지하는 것입니다: OrcaRouter는 200개 이상의 모델을 하나의 OpenAI 호환 엔드포인트 뒤에 두고, 공급자 정가에 마크업 없이 제공하며, 공급자 간 자동 장애 조치를 지원합니다, 따라서 이미 신뢰하는 모델이 프로덕션 경로를 맡을 수 있고 — 그 비용은 공급자 정가에 묶여 있으므로 공급사 요금 변경이 같은 날 우리 쪽에 반영됩니다 — 반면 아직 측정되지 않은 디자인 모델은 그 앞이 아니라 그 옆에서 평가됩니다.

오픈 릴리스 두 개, 클로즈드 릴리스 하나, 그리고 하나의 패턴

Ming 릴리스가 그 자체를 넘어 무엇의 증거인지는 주목할 만하다. 앤트 그룹은 61억 5천만 파라미터 규모의 디자인 모델을 MIT 라이선스로 아무런 발표 없이 공개했고, 같은 라이선스로 레이어 분해용 두 번째 모델도 함께 공개했다. 알리바바는 라이선스도, 모델 카드도, 보고서도 없이 같은 부류의 작업을 겨냥한 폐쇄형 호스팅 모델을 공개하고 이미지당 가격을 책정했다.

그것들은 디자인 모델에서 가치가 어디에 있는지에 관한 두 가지 서로 다른 베팅이다. 하나는 모델이 제품이고 가중치가 유통 채널이라고 말한다. 다른 하나는 모델이 서비스이고 가중치가 당신이 보유하는 것이라고 말한다. 두 베팅 모두 같은 시장에서 맞을 수 있으며, 평가 시점에 중요한 유일한 질문—내가 이것에 의존하기 전에 이것이 어떻게 작동하는지 알아낼 수 있는가?—에 대해 매우 다른 답을 낸다.

• 텍스트가 어떻게 렌더링되는지, 그리고 왜 때로는 렌더링되지 않는지 알아야 한다면 — Ming-Image-0.1-Design은 둘 중 유일하게 직접 확인할 수 있게 해 주며, MIT 라이선스 덕분에 발견한 내용을 바탕으로 실제로 조치를 취할 수 있습니다.

• 오늘 당장 이미지당 가격으로 별도 인프라 없이 쓸 수 있는 프로덕션 엔드포인트가 필요하다면, 둘 중 이런 걸 제공하는 건 Qwen-Image 3.0뿐이며, 그 내부 구조도 가격에 포함됩니다.

• 결정하기 전에 독립적인 근거가 필요하다면 — 둘 다 충분한 근거가 없습니다. 하나는 재현되지 않은 단일 리더보드 순위뿐이고, 다른 하나는 숫자가 전혀 붙지 않은 공급업체 주장 자료뿐입니다.

지켜봐야 할 것은 이 패턴이 유지되는지 여부다. 글리프 인코더가 들어간 MIT의 예고 없는 릴리스는 저자들이 그 모델이 어떻게 사용되기를 기대하는지, 즉 검사되고, 로컬에서 실행되고, 수정되기를 기대한다는 점을 보여주는 선언이다. 같은 팀의 다음 릴리스가 발표되고 벤치마크되고 호스팅된다면, 그것은 일회성이다. 그것이 또 다른 조용한 저장소라면, 디자인 모델 범주에는 두 번째 오픈 경쟁자가 생긴 것이고, 시장의 폐쇄형 절반은 7월에는 없던 가격 문제를 안게 된다.