Thẻ tiêu đề hero ghi 'Ming-Image-0.1-Design đứng đầu bảng xếp hạng thiết kế UI dành cho mô hình trọng số mở', phụ đề 'Mô hình trọng số mở được đánh giá cao nhất trong phân đoạn Thiết kế UI/UX của Artificial Analysis, ở mức 1.084 Elo', với một thẻ biểu tượng cúp có nhãn 'Mô hình trọng số mở được đánh giá cao nhất' và một thẻ biểu tượng màn hình có nhãn 'Dẫn đầu về Thiết kế UI/UX'. Logo OrcaRouter được ghép vào góc dưới cùng bên phải.
Guides & Insights

Ming-Image-0.1-Design đứng đầu Bảng xếp hạng Thiết kế UI Open-Weights — và con số này hoàn toàn chuẩn xác

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Tuyên bố đang lan truyền cùng với Ming-Image-0.1-Design cho rằng mô hình 6B của inclusionAI là mô hình text-to-image trọng số mở tốt nhất cho công việc UI và UX, đứng đầu ở chế độ xem trọng số mở của bảng xếp hạng Thiết kế UI/UX của Artificial Analysis với 1.082 Elo. Ảnh chụp màn hình bảng xếp hạng từ nhà cung cấp thường là loại bằng chứng yếu nhất, nên việc đầu tiên đáng làm là đọc bảng xếp hạng trực tiếp. Tính đến ngày 24 tháng 9 năm 2026, điều đó vẫn đứng vững, với một lưu ý quan trọng mà ảnh chụp màn hình không thể hiện: 1.082 là một lát cắt theo trường hợp sử dụng, không phải toàn bộ bảng xếp hạng, và trên bảng xếp hạng Text to Image đầy đủ, cùng mô hình đó đứng ở hạng 45 với Elo 995.

Cả hai con số đều là thật, chúng đến từ cùng một đấu trường, và chúng mô tả cùng một bộ trọng số. Điều phân biệt chúng là các phiếu bầu đã được bỏ trên những lời nhắc nào.

Bảng trực tiếp thực sự ghi gì

Artificial Analysis vận hành một đấu trường so sánh cặp ẩn danh, rồi lọc cùng một nhóm phiếu bầu thành các lát cắt theo trường hợp sử dụng. Lát cắt Thiết kế UI/UX là lát cắt quan trọng đối với một mô hình được xây dựng cho dashboard, màn hình ứng dụng, poster và infographic, và đây là nơi Ming-Image-0.1-Design làm tốt nhất:

• Bảng xếp hạng tổng thể Text to Image — Ming-Image-0.1-Design ở vị trí #45, Elo 995, CI 95% ±8, 21.342 mẫu, được liệt kê vào tháng 9 năm 2026, 30,00 USD cho mỗi 1.000 hình ảnh, được gắn cờ Open Weights

• Lát cắt Thiết kế UI/UX — Ming-Image-0.1-Design ở vị trí #16, Elo 1.084, 2.100 mẫu trong lát cắt

• Mục open-weights có vị trí cao nhất trong phân khúc đó — Ming-Image-0.1-Design; các mô hình open-weights tiếp theo xếp sau nó là Ideogram 4.0 (Quality) ở vị trí #22 với 1.047, Ideogram 4.0 ở vị trí #31 với 1.018, và HunyuanImage 3.0 Instruct ở vị trí #40 với 1.005

• Dẫn đầu phân khúc UI/UX — GPT Image 2.5 Flare (max) ở mức 1.226, GPT Image 2.5 Sunburst (max) ở mức 1.215, GPT Image 2 (high) ở mức 1.204, Grok Imagine Image 2.0 ở mức 1.183

• So với ảnh chụp màn hình của chính nhà cung cấp — inclusionAI đã công bố 1.082 cho Ming so với Ideogram 4.0 (Quality) ở mức 1.052 và FLUX.2 [dev] ở mức 1.000; lát cắt trực tiếp hiện hiển thị lần lượt là 1.084, 1.047 và 1.000

Vậy nên tiêu đề xét theo tiêu chí riêng của nó là chính xác. Ming-Image-0.1-Design là mô hình trọng số mở được đánh giá cao nhất trong phân khúc Thiết kế UI/UX, và nó là mô hình trọng số mở duy nhất nằm trong top hai mươi của phân khúc đó. Nó cũng kém mô hình dẫn đầu phân khúc đó 142 Elo, và nó ở tầm trung khi lời nhắc không phải là lời nhắc thiết kế. Một mô hình thắng ở các bảng điều khiển và đạt 995 điểm tổng thể là một mô hình chuyên biệt, không phải mô hình đa năng, và hai con số này chỉ mâu thuẫn nếu bạn coi một trong hai là toàn bộ câu chuyện.

21.342 mẫu trên bảng xếp hạng đầy đủ cũng đáng lưu ý vì những gì nó không phải là. Đó là một số lượng phiếu bầu lớn, đó là lý do khoảng tin cậy hẹp ở mức ±8 Elo, nhưng số lượng mẫu không đồng nghĩa với tính độc lập của phương pháp. Đấu trường dựa trên sở thích con người trong điều kiện mù, nên không ai tại inclusionAI viết điểm số — phần đó là thật. Điều mà điểm số đo lường là “người bỏ phiếu thích hình nào trong hai hình này hơn”, và những người bỏ phiếu được yêu cầu đánh giá ảnh chụp màn hình UI thường có xu hướng đánh giá cao chữ dễ đọc và bố cục mạch lạc. Đó chính xác là trục mà mô hình này được huấn luyện.

Screenshot of the Artificial Analysis Text to Image Leaderboard captured 24 September 2026, cropped to the lower rows. Ming-Image-0.1-Design is row 45, creator InclusionAI, with an Elo of 995, row range 39-50, 21,342 samples, a September 2026 release and $30.0 per 1k imgs, carrying the Open Weights badge. Neighbouring rows include P-Image-Ideogram (High) at 44 and 995, Cosmos3-Super-Text2Image (agentic) at 46 and 994, and Ideogram 4.0 at row 38 and 1,004, also Open Weights.

Ming-Image-0.1-Design là gì

Ming-Image-0.1-Design là một mô hình chuyển văn bản thành hình ảnh của inclusionAI, phòng thí nghiệm AI liên kết với Ant Group, được phát hành theo giấy phép MIT với trọng số được công bố vào ngày 17 tháng 9 năm 2026 và gói phát hành đầy đủ ra mắt ngày 22 tháng 9. Mô hình tạo sinh chỉ từ một lời nhắc — không cần ảnh tham chiếu — và hướng đến thiết kế đồ họa nhiều chữ thay vì nhiếp ảnh: bản mô phỏng UI, bảng điều khiển, đồ họa thông tin, áp phích và bất cứ thứ gì mà văn bản hiển thị phải giữ được độ dễ đọc ở kích thước mà nó sẽ được đọc.

Cấu hình suy luận được tài liệu hóa rất cụ thể và rẻ bất thường trên mỗi bước:

• Độ phân giải — khuyến nghị 2048 x 2048, hoặc 1024 x 1024 để tạo nhanh hơn, với các kích thước trung gian được đưa về một trong hai mức đó

• Số bước lấy mẫu — 12

• Hướng dẫn — CFG scale 1.0

• Độ chính xác — BF16

• Phần cứng — một GPU CUDA với 80 GiB VRAM, được mô tả là cấu hình đã được xác thực

Mười hai bước ở thang hướng dẫn 1.0 là dấu hiệu đặc trưng của một bộ lấy mẫu đã chưng cất hoặc không dùng hướng dẫn. Đó là điều khiến đầu ra 2048 pixel trở nên khả thi ở số bước mà hầu hết mô hình khuếch tán sẽ không thử đến, và là lý do chính khiến mô hình này đáng quan tâm với bất kỳ ai chạy tạo ảnh ở quy mô lớn thay vì từng ảnh một.

Đặc điểm cấu trúc khác là tính trong suốt. Ming-Image-0.1-Design có thể xuất RGBA gốc, vì vậy nền trong suốt được tạo ra từ bộ lấy mẫu thay vì từ một lượt tách nền, khi câu lệnh bắt đầu bằng một trong các cụm từ trong suốt được ghi trong tài liệu. Một mô hình đồng hành, Ming-Image-0.1-Design-Layer, đi xa hơn: nó nhận một thiết kế đã làm phẳng cùng một kế hoạch lớp và trả về các PNG RGBA riêng biệt — văn bản, thẻ, chủ thể chính, nền — những thứ tái hợp thành bản gốc. Đó là sự khác biệt giữa một mô hình thiết kế và một mô hình hình ảnh. Một PNG phẳng là một bức ảnh của bố cục; các lớp riêng biệt là một bố cục mà bạn vẫn có thể chỉnh sửa.

Screenshot of the inclusionAI/Ming-Image-0.1-Design model card on Hugging Face, captured 24 September 2026. The header shows 188 likes, 3,067 followers, tags including text-to-image, difusers, safetensors, image-generation, graphic-design, text-rendering and License: mit, and a safetensors panel reading Model size 6B params, Tensor type BF16. The card's UI/UX Design leaderboard image is embedded in the body, showing Ming-Image-0.1-Design first at 1,082 above Ideogram 4.0 (Quality) at 1,052 and FLUX.2 [dev] at 1,000. The right rail states 'This model isn't deployed by any Inference Provider', and the Quick Start block shows the infer.py command with --resolution 2048 and a note that prompt enhancement can use Ling-3.0-flash-VL or qwen3.8-27B.

Nhãn 6B và bản tải xuống 26B

"6B" chính xác về phần mà hầu hết mọi người ám chỉ và gây hiểu nhầm về phần quyết định liệu bạn có thể chạy nó hay không. Diffusion transformer có 6,15B tham số. Gói mà bạn thực sự tải xuống nặng khoảng 52,88 GB, vì bộ mã hóa văn bản đa phương thức có 17,01B tham số và connector bổ sung thêm 3,09B — tổng cộng khoảng 26B tham số ở BF16. Transformer của mô hình Layer gấp đôi mô hình cơ sở ở 12,31B, và gói của nó lại còn lớn hơn, vào khoảng 65,20 GB.

Điều này quan trọng vì hai lý do thực tiễn. Thứ nhất, yêu cầu 80 GiB VRAM không phải nói về transformer 6B; mà là nói về mọi thứ phải thường trú cùng với nó. Thứ hai, mọi so sánh với một mô hình được mô tả là "6B" đều cần kiểm tra xem đang nói đến 6B nào. Một diffusion transformer 6B với text encoder 20B là một bài toán triển khai rất khác so với một mô hình 6B từ đầu đến cuối.

Xử lý prompt là điều còn lại mà thẻ nêu rõ thay vì giấu đi: công thức được khuyến nghị chạy một bước viết lại trước, sử dụng mô hình thị giác - ngôn ngữ để mở rộng một prompt ngắn thành mô tả bố cục JSON có cấu trúc theo kiểu Figma, với tọa độ, phân cấp, thông số màu sắc và văn bản nguyên văn. Các thẻ mô hình nêu tên Ling-3.0-flash-VL hoặc Qwen3.8-27B cho công việc đó. Nói cách khác, pipeline mà nhà cung cấp đánh giá chuẩn là một pipeline hai mô hình. Nếu bạn gọi Ming-Image-0.1-Design bằng một prompt một dòng và không có bước viết lại, bạn không chạy cấu hình đã tạo ra 1,084 trong phân đoạn UI/UX.

Điều này đặt một quy trình thiết kế ở đâu

Tóm tắt trung thực về Ming-Image-0.1-Design là nó giải quyết một vấn đề cụ thể và tốn kém — tạo ra các bố cục dày đặc văn bản vẫn trụ được khi bị nhìn vào — và nó làm điều đó ở vị trí dẫn đầu lĩnh vực trọng số mở trên bảng xếp hạng duy nhất đo lường vấn đề đó. Nó không dẫn đầu bảng xếp hạng hình ảnh tổng thể, nó không loại bỏ nhu cầu về một VLM phía trước nó, và nó đòi hỏi một GPU mạnh.

Điều nó thay đổi là phần giữa của một quy trình thiết kế. Nếu pipeline của bạn hiện đang tạo ra một ảnh phẳng rồi trả tiền cho con người hoặc một mô hình phân đoạn để cắt nó ra, thì một mô hình xuất trực tiếp RGBA và một công cụ đi kèm xuất ra 2–9 lớp có tên sẽ loại bỏ một công đoạn. Điều đó đáng giá hơn một cột Elo, và đó là phần mà không bảng xếp hạng nào đo lường được.

Với những đội muốn thử nghiệm mà không phải cam kết hạ tầng, sự phân tách này đáng được nói cho chính xác. Ming-Image-0.1-Design là bản tải xuống theo giấy phép MIT, nên nó chạy trên phần cứng của bạn, hoặc không chạy được chút nào — OrcaRouter không định tuyến bất kỳ mô hình inclusionAI nào ở bất kỳ phiên bản nào, và nói khác đi sẽ là một tuyên bố chúng tôi không thể đảm bảo. Điều mà một lớp định tuyến thực sự mang lại cho bạn là bề mặt xung quanh: một endpoint tương thích OpenAI trên hơn 200 mô hình, tự động chuyển đổi dự phòng giữa các nhà cung cấp, và giá niêm yết của nhà cung cấp được truyền thẳng với mức đội giá 0%, nên khi nhà cung cấp thay đổi giá đối với bất kỳ mô hình nào bạn thực sự gọi, thay đổi đó sẽ có hiệu lực phía chúng tôi ngay trong ngày. Nếu bạn đang dựng một pipeline thiết kế và muốn A/B mô hình này với một mô hình được host mà bạn đã tin dùng, thì so sánh đó chạy trên một khóa thay vì hai hợp đồng.

A rendered summary card headed 'The two numbers' and titled 'One model, two readings', listing five figures: Overall Text to Image board #45, Elo 995, 95% CI 8, 21,342 samples; UI/UX Design slice #16, Elo 1,084, 2,100 samples in the slice; open-weights standing in that slice #1, next is Ideogram 4.0 (Quality) at #22 and 1,047; leader of the same slice GPT Image 2.5 Flare (max), Elo 1,226, a 142-point gap; board-listed API pricing $30.00 per 1,000 images, flagged Open Weights.

Điều gì sẽ thay đổi cục diện

Ba điều sẽ đưa Ming-Image-0.1-Design từ một chuyên gia open-weights mạnh mẽ trở thành lựa chọn mặc định. Một bản tái lập độc lập đầu tiên cho các số liệu Crello của mô hình Layer — thẻ báo cáo sai số RGB L1 là 0.0574 và alpha soft IoU là 0.8923 ở 1024, và chưa có nhóm bên ngoài nào chạy chúng. Một endpoint được host giúp loại bỏ yêu cầu 80 GiB. Và một lát cắt trường hợp sử dụng thứ hai, nơi mô hình xếp hạng tốt như khi ở UI/UX Design, bởi vì một mô hình chỉ thắng trên một lát cắt của một bảng xếp hạng là một mô hình mà tính tổng quát vẫn chưa được chứng minh.

Cho đến lúc đó, câu chính xác là câu có phạm vi hẹp: trên lát cắt UI/UX Design của Artificial Analysis, tính đến ngày 24 tháng 9 năm 2026, Ming-Image-0.1-Design của inclusionAI là mô hình text-to-image trọng số mở được đánh giá cao nhất, với 1.084 Elo trên 2.100 phiếu bầu — và trên bảng xếp hạng đầy đủ của cùng đấu trường đó, nó đứng thứ 45 với 995. Cả hai điều đó đều là mô hình. Không điều nào trong số đó là một tuyên bố ra mắt, vì mô hình này không có màn ra mắt; nó có một kho lưu trữ.