
Ming-Image-0.1-Design vs Qwen-Image 3.0: Ai Cho Bạn Thấy Cách Văn Bản Được Vẽ Ra
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Điều thú vị nhất về Ming-Image-0.1-Design không nằm trên thẻ mô hình của nó. Nó nằm trong một commit cho một framework suy luận. Khoảng thời gian quanh lúc mô hình được âm thầm tải lên Hugging Face ngày 17 tháng 9 năm 2026, vLLM-Omni đã hợp nhất một thay đổi có tiêu đề feat: thêm hỗ trợ byte5 cho Ming để nối một bộ mã hóa glyph ByT5 vào một ming_flash_omni pipeline mới — một thành phần chuyên dụng mà toàn bộ nhiệm vụ của nó là nhìn vào các ký tự bạn yêu cầu được render, chứ không phải vào hình ảnh bạn yêu cầu. Đó là kiểu chi tiết bạn chỉ có thể tìm thấy bằng cách đọc mã, và nó chính là chi tiết mà Qwen-Image 3.0 — mô hình hình ảnh đóng, được nhà cung cấp host, ra mắt ngày 21 tháng 7 năm 2026 và đạt trạng thái sẵn sàng chung vào ngày 5 tháng 8 — không cho phép bất kỳ ai đọc được chút nào. Cả hai mô hình đều hướng đến công việc thiết kế, nơi chữ dễ đọc là phần khó. Chỉ một trong hai sẽ cho bạn biết nó làm điều đó như thế nào.
Mỗi người trong số họ nói gì về văn bản
Câu chuyện kết xuất văn bản của Qwen-Image 3.0 hoàn toàn là một tuyên bố khi ra mắt, và xét trên lý thuyết thì đó là một tuyên bố hay. Tài liệu của Alibaba mô tả các prompt dài tới khoảng 4.500 token, văn bản còn đọc được ở kích thước nhỏ đến khoảng 10 pixel, độ bao phủ 12 ngôn ngữ trên hơn 20 phông chữ, đầu ra tối đa 2048×2048 và tối đa sáu hình ảnh mỗi lần gọi, được cung cấp dưới hai phiên bản Pro và Standard thông qua một API được lưu trữ. Không có bản phát hành trọng số, không có giấy phép được nêu rõ, không có thẻ mô hình, không có báo cáo kỹ thuật và không có bảng đánh giá chuẩn nào được công bố để đối chiếu bất kỳ điều nào trong số đó. Con số tham số MMDiT ~20B được nhắc lại rộng rãi là thông tin được báo cáo chứ không phải được xác nhận.
Câu chuyện của Ming-Image-0.1-Design là một repository. 6.154.901.056 tham số, giấy phép MIT, một diffusers thẻ pipeline, toàn bộ trọng số ở định dạng BF16 safetensors, khoảng 71,5 GB trải khắp connector/, mllm/, mlp/, scheduler/, transformer/ và vae/. Suy luận được khuyến nghị là 2048×2048 ở 12 bước lấy mẫu với guidance ở mức 1.0 trên một GPU CUDA 80 GiB, hoặc 1024 để có tốc độ nhanh hơn, với vLLM-Omni được nêu tên cho việc triển khai và một mô hình ngôn ngữ-thị giác riêng biệt được nêu tên cho việc tăng cường gợi ý. Thẻ này mô tả nó như một mô hình text-to-image dành cho UI, infographic, poster và các thiết kế trực quan giàu văn bản khác, với đầu ra RGBA cho nền trong suốt.
Hai đoạn văn đó không phải cùng một kiểu phát biểu, và đáng để nói thẳng lý do vì sao. Một đoạn là mô tả về một sản phẩm do chính những người bán nó viết. Đoạn kia là mô tả về một tạo tác mà bất kỳ ai cũng có thể tải về và kiểm chứng.
Bộ mã hóa glyph là phần giải thích danh mục
Việc kết xuất văn bản trong các mô hình hình ảnh thường thất bại theo một cách rất cụ thể: mô hình tạo ra thứ trông giống như chữ viết mà không phải là chữ viết. Các nét chữ trông có vẻ hợp lý nhưng từ thì lại sai. Lý do nằm ở kiến trúc trước hết, trước mọi thứ khác — hầu hết các mô hình hình ảnh không có thành phần nào nhìn nhận ký tự như là ký tự, nên chữ được tái dựng từ các thống kê thị giác giống hệt cách cỏ được tái dựng.
Commit của vLLM-Omni thú vị chính xác vì nó chỉ thẳng vào điều đó. Các tệp được thêm vào — byte5_encoder.py, pipeline_ming.py, t5_block_mapper.py và một bộ xử lý đầu vào theo giai đoạn — mô tả một đường đi trong đó một bộ mã hóa cấp byte ByT5 đọc văn bản lẽ ra phải xuất hiện trong ảnh, từ vựng của tokenizer được mở rộng bằng các dấu phông chữ và màu sắc, và các đặc trưng thu được sẽ được nối thêm dọc theo chiều chuỗi với phía âm nhận các giá trị không. Chi tiết cuối cùng đó chính là dấu hiệu cho thấy đây là một quyết định thiết kế thực sự chứ không phải chỉ là phần kỹ thuật đường ống: nếu nhánh âm mang cùng các đặc trưng glyph, thì hướng dẫn không phân loại sẽ bị kéo về phía kết xuất văn bản và xa rời câu lệnh, vì vậy các giá trị không tồn tại để giữ cho hai mục tiêu không chống chọi lẫn nhau. Bộ mã hóa chỉ tải khi checkpoint thực sự chứa một byte5/ thư mục con.
Hai ghi chú trung thực. Đây là một commit của framework suy luận bên thứ ba, không phải tuyên bố của Ant Group, và cách diễn giải ý nghĩa của những tệp đó là của chúng tôi chứ không phải của nhà cung cấp. Và nó củng cố một ý định thiết kế, không phải một kết quả: việc tồn tại một bộ mã hóa glyph thì nhất quán với kết xuất văn bản tốt, và nó không phải là bằng chứng rằng kết xuất văn bản là tốt. Bằng chứng độc lập duy nhất về chất lượng là một vị trí duy nhất trên bảng xếp hạng, được thảo luận bên dưới.

Sự tương phản với Qwen-Image 3.0 không nằm ở chỗ mô hình của Alibaba kết xuất văn bản tệ — không ai ngoài Alibaba có thể nói nó kết xuất văn bản tốt đến mức nào, và đó chính là điểm mấu chốt. Mà là ở chỗ câu hỏi “mô hình này vẽ chữ như thế nào” có câu trả lời đối với một trong hai mô hình này và chỉ là một tuyên bố tiếp thị đối với mô hình còn lại, và khoảng cách giữa một câu trả lời và một tuyên bố tiếp thị chính là nơi các quyết định kỹ thuật được đưa ra.
Con số duy nhất, và tấm bảng mà nó không nằm trên.
Ming-Image-0.1-Design đứng đầu trên Bảng xếp hạng Text to Image của Artificial Analysis cho Thiết kế UI/UX, chế độ xem trọng số mở, với Elo 1.082 — dẫn trước Ideogram 4.0 (Quality) ở 1.052, Ideogram 4.0 ở 1.015, HunyuanImage 3.0 Instruct ở 1.005, FLUX.2 [dev] ở 1.000, FLUX.2 [dev] Flash ở 999 và FLUX.2 [dev] Turbo ở 994. Bản sao của bảng đó là bản được tái hiện trên thẻ của chính mô hình, và nó mang thương hiệu Artificial Analysis; chưa có ai độc lập tái tạo lại điểm số này.
![The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.](https://cms.orcarouter.ai/api/media/file/3-1124.png)
Đây là một bảng xếp hạng dành cho các mô hình trọng số mở, nên Qwen-Image 3.0 không có mặt, và việc nó vắng mặt không nói lên điều gì về chất lượng của nó. Điều nó thực sự nói lên mang tính cấu trúc: một bảng xếp hạng ưu tiên mù chỉ có thể xếp hạng những mô hình có trọng số được công khai. Điều đó mang lại cho một bản phát hành mở một vị trí có thể đo lường được từ nhiều tháng trước khi nó có sản phẩm, còn với một bản phát hành đóng, nó chỉ mang lại một con số tiếp thị và không gì khác. Những tuyên bố của Qwen-Image 3.0 — đọc rõ ở 10 pixel, prompt 4.500 token, hơn 20 phông chữ — hoàn toàn không có phép đo độc lập nào đứng sau.

Bạn sẽ thực sự kiểm thử điều này như thế nào, và việc thử tốn bao nhiêu chi phí
Nếu kiểu chữ dễ đọc là lý do bạn đang đọc điều này, thì phép thử không phải là một bảng xếp hạng. Nó là chính kiểu chữ của bạn, chính ngôn ngữ của bạn và chính các chuỗi của bạn, được chạy qua cả hai ứng viên và được một người đọc. Phép thử đó cần một trong hai mô hình này phải dễ tiếp cận và rẻ, còn mô hình kia phải có thể tải xuống, và chúng được định giá theo những nguyên tắc trái ngược nhau.
• Qwen-Image 3.0 — khoảng $0.04 mỗi hình ảnh trên bản Pro và khoảng $0.03 trên bản Standard, với giá tiêu dùng nội địa khởi điểm gần ¥0.18 mỗi hình ảnh. Đó là những con số ra mắt và chưa được kiểm toán. Bạn có thể chạy một ma trận prompt vào chiều nay và trả tiền theo từng lượt gọi.
• Ming-Image-0.1-Design — không có giá công bố, vì không có endpoint được host. Chi phí là một bản tải xuống 71,5 GB, một card 80 GiB và thời gian của chính bạn, còn lợi ích là bạn có thể hướng cùng bài kiểm tra đó vào đường dẫn bộ mã hóa glyph và xem liệu nó có phải là thành phần đang đảm nhiệm công việc hay không.
Đây chính là tình huống mà một lớp định tuyến được sinh ra để xử lý, và cần nói chính xác phần nào trong đó được áp dụng. Cả Qwen-Image 3.0 lẫn Ming-Image-0.1-Design đều không có trên nền tảng của chúng tôi, nên một lớp định tuyến không thể đưa một trong hai ra sau một key ngay hôm nay. Điều nó có thể làm là giữ cho việc so sánh được trung thực trong khi bạn chạy thử: OrcaRouter đưa hơn 200 mô hình ra sau một endpoint tương thích OpenAI với đúng giá niêm yết của nhà cung cấp, không thêm phí, kèm khả năng tự động chuyển sang nhà cung cấp khác khi gặp sự cố, nhờ đó mô hình bạn đã tin dùng có thể giữ đường chạy production — và chi phí của nó vẫn gắn với giá niêm yết của nhà cung cấp, nên nếu nhà cung cấp thay đổi mức giá thì phía chúng tôi cập nhật ngay trong cùng ngày — trong khi một mô hình thiết kế chưa được đo lường sẽ được đánh giá bên cạnh nó thay vì đặt lên trước nó.
Hai bản phát hành mở, một bản đóng và một mẫu.
Điều đáng lưu ý là bản phát hành Ming còn là bằng chứng cho điều gì, vượt ra ngoài chính nó. Ant Group đã công bố một mô hình thiết kế 6,15 tỷ tham số theo giấy phép MIT mà không có thông báo nào, cùng với một mô hình thứ hai để phân tách lớp theo cùng giấy phép. Alibaba đã công bố một mô hình đóng được lưu trữ trực tuyến không có giấy phép, không có thẻ mô hình và không có báo cáo, nhắm đến cùng loại công việc, và định giá theo từng hình ảnh.
Đó là hai cược khác nhau về việc giá trị trong các mô hình thiết kế nằm ở đâu. Một bên nói mô hình chính là sản phẩm và trọng số là kênh phân phối. Bên kia nói mô hình là một dịch vụ và trọng số là thứ bạn giữ lại. Cả hai cược đều có thể đúng trong cùng một thị trường, và chúng tạo ra những câu trả lời rất khác nhau cho câu hỏi duy nhất quan trọng ở thời điểm đánh giá: liệu tôi có thể tìm hiểu cách thứ này hoạt động trước khi phụ thuộc vào nó không?
• Nếu bạn cần biết văn bản được kết xuất như thế nào, và tại sao đôi khi nó lại không được như vậy — Ming-Image-0.1-Design là cái duy nhất trong hai cái cho phép bạn xem tận mắt, và giấy phép MIT nghĩa là bạn có thể hành động dựa trên những gì mình tìm thấy.
• Nếu bạn cần một endpoint production ngay lúc này với mức giá tính theo từng ảnh và không phải dựng hạ tầng — Qwen-Image 3.0 là cái duy nhất trong hai cái đưa ra được điều đó, và phần nội bộ của nó đã nằm trong mức giá.
• Nếu bạn cần bằng chứng độc lập trước khi đưa ra quyết định — cả hai đều không có đủ. Một bên chỉ có một vị trí trên bảng xếp hạng chưa được tái lập; bên kia có bảng tuyên bố của nhà cung cấp mà không kèm số liệu nào.
Điều cần theo dõi là liệu quy luật đó có giữ vững hay không. Một bản phát hành không được công bố của MIT có kèm theo bộ mã hóa glyph chính là một tuyên bố về cách mà những tác giả của nó mong đợi mô hình sẽ được sử dụng — được kiểm tra, chạy cục bộ, chỉnh sửa. Nếu bản phát hành tiếp theo từ cùng nhóm đó được công bố, được đánh giá chuẩn và được lưu trữ trên nền tảng, thì đây chỉ là trường hợp cá biệt. Nếu đó lại là một kho lưu trữ âm thầm khác, thì hạng mục mô hình thiết kế đã có thêm một đối thủ mở thứ hai, và nửa kín của thị trường phải đối mặt với một vấn đề về giá mà vào tháng Bảy nó chưa hề có.
