Thẻ tiêu đề hero ghi 'Ming-Image-0.1-Design', phụ đề 'Một mô hình thiết kế 6B được phát hành không thông báo và một liên kết hỏng', với hai thẻ ghi 'Trong repo: giấy phép MIT, đầu ra 2048 x 2048, 12 bước lấy mẫu, một GPU 80 GiB' và 'Không có trong repo: một thông báo, một API, hoặc một Quick Start hoạt động được'. Logo OrcaRouter được ghép vào góc dưới bên phải.
Guides & Insights

Ming-Image-0.1-Design âm thầm ra mắt: Một mô hình thiết kế 6B chỉ tồn tại trong một repo và không nơi nào khác

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Có một mô hình text-to-image 6B mang tên Ming-Image-0.1-Designnằm trong tổ chức inclusionAItrên Hugging Face, và tính đến ngày 23 tháng 9 năm 2026, gần như không còn thông tin nào khác về nó. Kho lưu trữ được tạo vào ngày 17 tháng 9, trọng số (weights) được đăng tải cùng ngày hôm đó, và thẻ mô hình (model card) được viết lại vào ngày 22 tháng 9 — ba commit trong vòng năm ngày, tất cả đều từ một tài khoản, không có bài đăng nào trên blog của nhà cung cấp, không có ghi chú ra mắt, không có trang mô hình trên bất kỳ nền tảng API nào, và bộ đếm lượt tải vẫn hiển thị con số không. Đó chính là hình dáng của một màn ra mắt thầm lặng khi nhìn từ bên ngoài: một sản phẩm hoàn chỉnh và không một lời thông báo. Vì vậy, bài viết này là một bản kiểm kê những gì kho lưu trữ nói, những gì đã thay đổi trên đó vào hôm qua, và những gì vẫn còn chưa thể xác minh — không phải một bài đánh giá, bởi chưa có ai ngoài inclusionAI công bố bất kỳ con số nào cho mô hình này.

Kho lưu trữ thực sự chứa những gì

Thẻ mô hình mô tả Ming-Image-0.1-Design là một mô hình text-to-image 6B dành cho UI, infographic, poster và các thiết kế thị giác giàu văn bản khác, tạo ra những bố cục thị giác hoàn chỉnh và hỗ trợ đầu ra RGBA với nền trong suốt. Siêu dữ liệu có mức cho phép bất thường đối với một mô hình mới như vậy: giấy phép MIT, diffuserssafetensors, thẻ pipeline text-to-image, cùng các thẻ bao gồm tạo hình ảnh, thiết kế đồ họa, kết xuất văn bản và RGBA.

Cài đặt suy luận được đề xuất đủ cụ thể để hữu ích:

• Độ phân giải — khuyến nghị 2048 x 2048, hoặc 1024 x 1024 để tạo nhanh hơn

• Số bước lấy mẫu — 12

• CFG scale — 1.0

• Độ chính xác — BF16

• Phần cứng — một GPU CUDA với 80 GiB VRAM, được mô tả là cấu hình đã được xác thực

Mười hai bước ở thang hướng dẫn 1.0 là đặc trưng của một bộ lấy mẫu đã chưng cất hoặc không cần hướng dẫn: chi phí thấp trên mỗi ảnh, đó là lý do tại sao thẻ có thể cung cấp đầu ra 2048 pixel ở số bước mà hầu hết các mô hình khuếch tán sẽ không thử. Thẻ cũng lưu ý rằng mã suy luận công khai ánh xạ các yêu cầu độ phân giải text-to-image vào nhóm được hỗ trợ 1024 hoặc 2048, vì vậy các kích thước trung gian được gắn vào một trong hai kích thước đó.

Cây thư mục cho bạn biết nhiều hơn một chút so với phần văn xuôi. Bên cạnh vaescheduler có một thư mục transformer với năm weight shard, cùng với các thành phần riêng biệt mllm, connectormlp — dáng dấp của một pipeline nhiều tầng với một mô hình ngôn ngữ đa phương thức làm text encoder thay vì một denoiser nguyên khối duy nhất. Điều đó khớp với ghi chú trên card rằng việc tăng cường prompt có thể do Ling-3.0-flash-VL hoặc qwen3.8-27B đảm nhiệm, cả hai đều là các mô hình anh em từ cùng một tổ chức.

Ba commit đã được hợp nhất vào ngày 22 tháng 9

Đây là phần duy nhất của câu chuyện có dấu thời gian nằm trong tuần vừa qua, và đó là lý do mô hình đáng được viết đến vào lúc này thay vì vào tháng Mười. Các tiêu đề commit, theo thứ tự:

• 22 tháng 9, 11:25 UTC — "Công bố gói phát hành Ming-Image-0.1-Design"

• 22 tháng 9, 12:01 UTC — "Làm mới thẻ mô hình Ming-Image-0.1-Design"

• 22 tháng 9, 15:17 UTC — "Thêm liên kết triển khai vLLM-Omni"

Hai mục đầu tiên chỉ là việc hành chính. Mục thứ ba mới là thay đổi thực chất: một framework không phải của chính nhà cung cấp đã đón nhận mô hình, và thẻ mô hình giờ đây khuyến nghị phục vụ nó qua vLLM-Omni, kèm liên kết đến một công thức và hướng dẫn cài đặt. Đó là tín hiệu tiêu chuẩn cho thấy một mô hình đã chuyển từ “trọng số trên giá” sang “thứ mà một đội ngũ thực sự có thể dựng lên và chạy phía sau một endpoint”, và đó là kiểu thay đổi không bao giờ tạo ra thông cáo báo chí.

Nó cũng chỉ mới được triển khai một nửa. Liên kết hướng dẫn cài đặt hoạt động. Đường dẫn công thức riêng cho mô hình trong cùng commit đó thì không — nó trả về 404 tính đến ngày 23 tháng 9. Vì vậy, tình hình triển khai cho Ming-Image-0.1-Design hiện nay là: khung tổng quát là thật, còn hướng dẫn cho mô hình này bên trong nó vẫn chỉ là phần giữ chỗ. Nếu bạn định phục vụ nó, hãy dự trù thời gian để đọc bản hướng dẫn nhanh vLLM-Omni và tự tìm ra cách kết nối mô hình.

Bảng xếp hạng trong thẻ, và bảng xếp hạng mà nó không nằm trên

Kho lưu trữ đi kèm một hình đồ họa về hiệu năng: assets/uiux_leaderboard.webp, một hình ảnh mang phong cách bảng xếp hạng với tiêu đề "Text to Image Leaderboard: UI/UX Design", phần chân có dòng "Elo scores from blind preference votes in our Image Arena" và một huy hiệu "Open Weights Leaderboard". Trong đó, Ming-Image-0.1-Design đứng đầu với 1.082 Elo, xếp trên Ideogram 4.0 (Quality) ở 1.052, Ideogram 4.0 ở 1.015, HunyuanImage 3.0 Instruct ở 1.005, và các biến thể FLUX.2 dev trong khoảng 994 đến 1.000.

Có ba điều cần nói về hình ảnh đó, và thứ tự rất quan trọng.

Đầu tiên, đó là tác phẩm nghệ thuật do nhà cung cấp tự công bố bên trong kho lưu trữ của chính nhà cung cấp. Chúng tôi đang báo cáo những gì tệp chứa, chứ không phải chứng thực nó.

Thứ hai, chúng tôi không thể tìm thấy Ming-Image-0.1-Design ở bất kỳ đâu trên các bảng Artificial Analysis đang hoạt động vào ngày 23 tháng 9 — không có trên bảng xếp hạng text-to-image, không có trong chế độ xem danh mục UI/UX Design, không có trên bảng chỉnh sửa hình ảnh, và không có trong chế độ xem open-weights. Vị trí dẫn đầu của danh mục UI/UX Design đang hoạt động là GPT Image 2.5 Flare với 1.227 Elo, và các mục FLUX.2 mà thẻ liệt kê lại xuất hiện trên chính bảng đang hoạt động đó với các giá trị khác: FLUX.2 [flex] ở 1.065, FLUX.2 [max] ở 1.053, FLUX.2 [dev] ở 1.000. Vì vậy, thứ hạng trên thẻ là một tuyên bố về một bảng mà chúng tôi không thể định vị được, được biểu thị trên một thang điểm thấp hơn khoảng 150 Elo so với thang điểm mà chúng tôi có thể.

Thứ ba, Elo được tính theo từng bảng. Điểm UI/UX theo danh mục cụ thể và điểm text-to-image tổng quát là những đại lượng khác nhau ngay cả đối với cùng một mô hình, đó là lý do cùng một bản phát hành FLUX.2 xuất hiện ở 1,026 trên một bảng của Artificial Analysis và 1,065 trên một bảng khác. Mọi so sánh trộn lẫn các bảng đều không phải là so sánh.

Kết luận tổng thể: Ming-Image-0.1-Design chỉ có một tuyên bố về hiệu năng, tuyên bố đó là của chính nhà cung cấp, và không có đánh giá độc lập nào về nó. Đó không phải là một lời buộc tội. Đó là lý do mô hình cần một lần chạy bên ngoài trước khi bất kỳ ai lập ngân sách dựa trên con số 1,082.

Những gì bạn chưa thể làm với nó

Quick Start chính là vấn đề. Nó hướng dẫn bạn clone github.com/inclusionAI/Ming-Image, cài đặt các phụ thuộc của nó, rồi chạy infer.py với model ID trên Hugging Face. Repository đó không tồn tại. Trang đó trả về 404, README raw trả về 404, và không có repository Ming-Image nào xuất hiện ở bất kỳ đâu trong danh sách repository công khai của tổ chức — danh sách này có Ming, Ling, Ring, Ming-UniVision, Ming-UniAudio và hàng tá cái tên khác, nên đây là sự vắng mặt chứ không phải một URL gõ sai. Con đường duy nhất được tài liệu hóa để chạy Ming-Image-0.1-Design lại chính là con đường không hề tồn tại.

Phần còn lại của câu chuyện về quyền truy cập cũng hết sức sơ sài. Thẻ mô hình đặt inference: false và Hugging Face báo cáo rằng mô hình không được triển khai bởi bất kỳ nhà cung cấp suy luận nào. Không có mức giá nào được công bố, không có mã định danh API, không có playground, và không có điều khoản thương mại nào ngoài giấy phép MIT áp dụng cho chính các trọng số. Số lượt tải xuống là không và số lượt thích là bốn.

Vậy tóm tắt trung thực về tính sẵn có là: các trọng số là thật và được cấp phép theo giấy phép cho phép, còn mọi thứ xung quanh chúng — mã, tài liệu, lưu trữ, đánh giá — thì hoặc là thiếu, hoặc chỉ là bản sơ khai.

Con số quyết định ai có thể sử dụng nó

Tám mươi gigabyte VRAM chính là toàn bộ lập luận. Đó là một card thuộc lớp H100 hoặc H200, hoặc một A100 80GB. Nó không phải GPU máy trạm, không phải laptop, và không phải một spot instance mà bạn quên hủy. Kết hợp với một cấu hình một GPU đã được kiểm chứng, điều đó có nghĩa là Ming-Image-0.1-Design miễn phí về giấy phép và đắt đỏ để vận hành, đúng hình dạng quen thuộc của một bản phát hành trọng số mở từ một phòng thí nghiệm huấn luyện ở quy mô lớn.

Để đầy đủ ở phía chúng tôi: hiện nay không có mô hình inclusionAI nào có thể định tuyến qua OrcaRouter.trang danh mục liệt kê 199 mô hình thuộc 15 nhà cung cấp khi chúng tôi đọc nó vào ngày 23 tháng 9, và nó không chứa mục Ming nào cũng như không có bất kỳ mục inclusionAI nào, nên ở đây không có gì để gọi qua chúng tôi. Điều mà một lớp định tuyến thực sự đáng giá trong tình huống này là bước thứ hai — vào ngày một nhà cung cấp thượng nguồn tiếp nhận mô hình đó, việc thử nó sẽ trở thành một thay đổi model-ID trên khóa bạn đã có thay vì một hợp đồng mới và một SDK mới. Cho đến lúc đó, cách duy nhất để chạy Ming-Image-0.1-Design là tìm kho lưu trữ còn thiếu và một GPU còn dư 80 GiB.

The UI/UX Design leaderboard image published in the Ming-Image-0.1-Design repository. It is headed 'Text to Image Leaderboard: UI/UX Design' with the footer 'Elo scores from blind preference votes in our Image Arena' and an 'Open Weights Leaderboard' badge. Ming-Image-0.1-Design is listed first at 1,082 Elo, above Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005, FLUX.2 [dev] at 1,000, FLUX.2 [dev] Flash at 999, FLUX.2 [dev] Turbo at 994 and HiDream-O1-Image at 987.The commit history page of the Ming-Image-0.1-Design repository on Hugging Face, captured 23 September 2026, showing five commits: 'Add vLLM-Omni deployment links' and 'Refresh Ming-Image-0.1-Design model card' and 'Publish Ming-Image-0.1-Design release package' all dated 22 September, above 'Upload initial model' and 'initial commit' dated 17 September.

Điều gì sẽ biến điều này thành một câu chuyện

Bốn điều, theo thứ tự tăng dần về mức độ chúng sẽ cho bạn biết. Sự xuất hiện của kho lưu trữ đồng hành, thứ sẽ giúp mô hình có thể chạy được như tài liệu mô tả. Công thức vLLM-Omni được hoàn thiện, thứ sẽ giúp nó có thể được phục vụ mà không cần đoán mò. Một nhà cung cấp suy luận đưa nó vào danh mục, điều sẽ gắn cho nó một mức giá. Và một Elo độc lập, thứ sẽ là con số đầu tiên về mô hình này không đến từ những người đã huấn luyện nó.

Cho đến khi ít nhất một trong số những điều đó thành hiện thực, thế đứng đúng đắn là hẹp và không hào nhoáng. Nếu bạn xây dựng các bộ đánh giá cho việc tạo UI và bố cục, thì các trọng số này đáng để tải về ngay bây giờ — MIT, 6B, một cấu hình, và số bước đủ thấp để có thể chi trả cho vài nghìn mẫu. Nếu bạn cần tạo hình ảnh trong môi trường sản xuất trong quý này, Ming-Image-0.1-Design không phải là một ứng viên: không có endpoint, không có hỗ trợ, và không có điểm số của bên thứ ba. Và nếu bạn đang theo dõi tổ chức inclusionAI, hãy lưu ý rằng hiện nó đã có một mô hình hình ảnh đi kèm với các dòng ngôn ngữ và giọng nói của mình, rằng nó đã phát hành mô hình này mà không thông báo cho ai, và rằng khoảng cách hai tuần giữa lần tải lên ban đầu và gói phát hành cho thấy giai đoạn yên tĩnh là có chủ đích.

The Artificial Analysis text-to-image leaderboard's UI/UX Design category view, captured 23 September 2026, showing GPT Image 2.5 Flare (max) first at 1,227 Elo with 1,287 samples and $210.7 per 1,000 images, GPT Image 2.5 Sunburst (max) second at 1,218, GPT Image 2 (high) third at 1,206, and Grok Imagine Image 2.0 fourth at 1,182. No Ming-Image-0.1-Design row appears anywhere on the board.