
Qwen-Image 2.1 vs Meta Muse Image: Mô hình bạn có thể gọi vs Mô hình bạn có thể giữ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Có một phiên bản của sự so sánh này xoay quanh chất lượng hình ảnh, và nó chưa thể được viết ra — không thể viết một cách trung thực. Qwen-Image 2.1, do nhóm Qwen-Image công bố ngày 20 tháng 9 năm 2026, không có bất kỳ điểm số độc lập nào. Meta Muse Image, được Meta Superintelligence Labs ra mắt ngày 7 tháng 7 năm 2026 với tư cách là mô hình hình ảnh nội bộ đầu tiên của Meta, đã được đo lường — nó đứng thứ ba trên bảng xếp hạng chỉnh sửa hình ảnh của Artificial Analysis với Elo khoảng 1.105, nằm trong top năm về chuyển văn bản thành hình ảnh, và nằm trên đường biên Pareto chất lượng so với giá ở mức 10 đô la cho một nghìn hình ảnh. Nhưng câu hỏi hữu ích hơn về hai mô hình này không phải là mô hình nào tốt hơn. Mà là bạn được phép làm gì với từng mô hình, và những câu trả lời đó gần như đảo ngược hoàn toàn.
Truy cập và khả năng kiểm tra là hai thứ khác nhau, và không ai cung cấp cả hai
Meta Muse Image là cái bạn có thể gọi tới. Kể từ tháng 8 năm 2026, nó đã có thể được truy cập thông qua Model API của chính Meta với mức giá cố định 0,01 USD mỗi ảnh — khoảng 10 USD mỗi nghìn ảnh — qua một endpoint tương thích với OpenAI, một thay đổi thực sự so với cách mô hình này được mô tả khi ra mắt vào tháng 7, khi hoàn toàn không có đường dành cho nhà phát triển để tiếp cận nó. Mức giá cố định đó là điều bất thường trong một hạng mục mà gần như mọi thứ khác đều được tính theo token, và nó khiến việc dự báo chi phí trở nên đơn giản: một nghìn ảnh là mười đô la, bất kể chúng đơn giản hay cầu kỳ.
Qwen-Image 2.1 là bản bạn có thể giữ lại. Đây là bản tải xuống trọng số — khoảng 33 GB cho cả diffusion transformer, bộ mã hóa văn bản và VAE — được phát hành theo Thỏa thuận Giấy phép Nghiên cứu Qwen ngày 20 tháng 9 năm 2026, trong đó cấp các quyền "CHỈ DÀNH CHO MỤC ĐÍCH PHI THƯƠNG MẠI" và yêu cầu một giấy phép riêng cho mục đích thương mại. Không có endpoint được host sẵn. Không có mức giá cố định. Cũng không có gì bị ẩn giấu: bạn có thể đọc kiến trúc, đọc system prompt viết lại prompt, diff nó, ghi đè nó và chạy toàn bộ trên phần cứng của riêng bạn.
Vậy nên sự đánh đổi không phải là chất lượng đối đầu với chất lượng. Đó là một mô hình bị đo đếm, được đo lường, cấp phép thương mại mà bạn không sở hữu, đối đầu với một mô hình miễn phí, không đo lường, phi thương mại mà bạn sở hữu hoàn toàn. Rất ít đội ngũ có thể chọn một trong hai phía của sự đánh đổi đó mà không phải từ bỏ điều gì đó.
Tại sao Muse không hẳn là một mô hình khuếch tán theo nghĩa thông thường
Điều khiến Meta Muse Image trở nên khác thường là nó không chỉ tạo sinh. Nó vận hành một vòng lặp: nó có thể tìm kiếm trên web, viết và chạy mã, và tự xem xét lại đầu ra của chính mình trước khi trả về một hình ảnh. Đó là mô tả của chính Meta, và đó là lý do mô hình này thú vị chứ không chỉ đơn thuần là cạnh tranh — các bước mang tính tác tử chính là nơi sự mơ hồ trong prompt được giải quyết, và là nơi một yêu cầu như "hãy làm cho tôi một biểu đồ về các con số của năm nay" có thể được trả lời thay vì chỉ được xấp xỉ.
Đó cũng là lý do khiến việc lý giải hành vi của nó trở nên khó hơn. Một mô hình hình ảnh thông thường là một hàm từ prompt đến pixel. Một mô hình dạng tác tử thì có quỹ đạo, và quỹ đạo không phải là thứ bạn có thể đọc được từ thẻ mô hình. Những con số do nhà cung cấp báo cáo — độ nhất quán nhân vật trên nhiều ảnh đạt 94%, tối đa 10 ảnh tham chiếu, đầu ra tối đa 1600 pixel ở cạnh dài — mô tả phạm vi bao quát, chứ không phải vòng lặp.
Qwen-Image 2.1 giải quyết cùng vấn đề nhập nhằng theo cách ngược lại: một cách tường minh và công khai. Cùng với mô hình hình ảnh, bản phát hành này còn đi kèm hai checkpoint viết lại prompt — Qwen/Qwen-Image-2.1-PE-T2I và Qwen/Qwen-Image-2.1-PE-I2I, mỗi cái là một Qwen3.5-VL 9B đã được tinh chỉnh, nặng khoảng 18,8 GB — có nhiệm vụ nhận một chỉ dẫn mơ hồ và viết lại nó thành một chỉ thị chính xác trước khi mô hình khuếch tán nhìn thấy nó. Biến thể I2I luôn có ảnh đầu vào, nên nó luôn là một tác vụ chỉnh sửa. Và đặc biệt quan trọng, hành vi của bộ viết lại được quy định trong một tệp system_prompt.txt đi kèm trong kho lưu trữ, nghĩa là bước quyết định ý nghĩa prompt của bạn là thứ mà bạn có thể đọc và thay đổi.
Vòng lặp agentic của Meta và prompt rewriter của Alibaba đều là câu trả lời cho vấn đề “mô hình không biết ý bạn là gì”. Một cái là dịch vụ tự quyết định thay bạn. Cái còn lại là một tệp bạn có thể chỉnh sửa.
Các con số trông như thế nào khi chỉ một bên có chúng
Meta Muse Image có mặt trên cả hai bảng xếp hạng hình ảnh của Artificial Analysis. Nó đứng thứ ba về chỉnh sửa ảnh với khoảng Elo 1.105, sau MAI-Image-2.6 ở 1.122 và GPT Image 2 (high) ở 1.117, đồng thời nằm trong top năm về tạo ảnh từ văn bản với khoảng Elo 1.116. Ở mức 10 USD cho mỗi nghìn hình ảnh, nó nằm trên đường biên Pareto giữa chất lượng và giá cả, một vị trí hữu ích: không phải mô hình tốt nhất trên bảng, nhưng là một trong số ít mô hình mà trả thêm tiền sẽ giúp bạn nhận được nhiều hơn một cách có thể đo lường.
Qwen-Image 2.1 không có bất kỳ điều nào trong số đó. Nó chỉ có một bài đăng blog của nhà cung cấp với biểu đồ Qwen-Image-Bench mà chưa bên thứ ba nào tái lập được, và nó có một báo cáo trải nghiệm thực tế — một người thử nghiệm truy cập sớm trong chương trình Qwen Ambassador, người đã chạy bộ trọng số cuối cùng qua giao diện ModelScope Studio và báo cáo thời gian khoảng 10–15 giây cho text-to-image và 18–23 giây cho chỉnh sửa, với độ nhất quán đa tham chiếu bắt đầu suy giảm từ khoảng ba ảnh đầu vào trở đi. Một người đánh giá, không có đồng hồ bấm giờ, không có bộ prompt. Đó là một tín hiệu hữu ích và nó không phải là một benchmark, và cách trung thực để nhìn nhận nó là một gợi ý về nơi mô hình có thể đạt tới, chứ không phải bằng chứng về vị trí hiện tại của nó.
Điểm mà Qwen-Image 2.1 thực sự vượt trội không phải là chất lượng mà là khả năng ở cấp độ điểm ảnh: đầu ra 2K gốc ở 2048×2048 theo mặc định, 40 bước suy luận, bảy preset tỷ lệ khung hình, tối đa 10 ảnh tham chiếu, chỉnh sửa cục bộ bằng vòng tròn, chú thích vẽ tay hoặc mặt nạ riêng, và tạo RGBA với chỉnh sửa lớp trong suốt và trích xuất chủ thể từ ảnh RGB. Mô hình của Meta giới hạn ở 1600 pixel và thông tin về độ trong suốt của nó không được công bố. Nếu bạn cần một kênh alpha thực sự có sẵn ngay, đó là quyết định đã được đưa ra thay bạn.

Mức phí cố định là phần đáng để cân nhắc.
Một xu cố định cho mỗi hình ảnh là một quyết định về giá, không phải quyết định kỹ thuật, và nó thay đổi mục đích của mô hình. Cách tính giá hình ảnh theo token trừng phạt sự phức tạp: một chỉ dẫn dài với nhiều hình ảnh tham chiếu tốn kém hơn một chỉ dẫn ngắn, nghĩa là chi phí của một hình ảnh gắn liền với độ khó của nó. Ở mức giá cố định, sự gắn kết đó biến mất, và hành vi hợp lý cũng thay đổi theo — bạn ngừng tối ưu hóa prompt theo độ dài và bắt đầu sử dụng mô hình theo cách nó được thiết kế để sử dụng, với vòng lặp tác tử và các hình ảnh tham chiếu làm công việc của chúng.
Đây cũng là kiểu định giá mà chỉ một công ty phục vụ mô hình của chính mình mới có thể đưa ra, một điều đáng để gọi tên khi bạn đang cân nhắc chọn nhà cung cấp. OrcaRouter đưa hơn 200 mô hình ra sau một endpoint tương thích OpenAI duy nhất với đúng giá niêm yết của nhà cung cấp, không cộng thêm markup, kèm khả năng tự động chuyển đổi dự phòng giữa các nhà cung cấp và một DSL định tuyến cho phép ghép nhiều mô hình vào một lệnh gọi duy nhất. Điểm đáng quan tâm ở đây là cơ chế chuyển thẳng: vì chúng tôi tính đúng giá niêm yết của nhà cung cấp thay vì cộng thêm markup, một thay đổi giá từ nhà cung cấp — chẳng hạn mức giá cố định mới xuất hiện hay giá theo token giảm — sẽ có hiệu lực ngay bên phía chúng tôi trong cùng ngày thay vì phải chờ hợp đồng. Cả Meta Muse Image lẫn Qwen-Image 2.1 đều không nằm trong số các mô hình chúng tôi định tuyến hiện nay và bài viết này sẽ không ngụ ý điều ngược lại; những mô hình hình ảnh mà chúng tôi thực sự cung cấp là dòng GPT-Image của OpenAI, các phiên bản Imagen 4 và bản xem trước hình ảnh Gemini của Google, cùng endpoint hình ảnh Grok Imagine của xAI.
Điểm tương phản đáng kể trong so sánh này là một trong hai mô hình này thậm chí có giá. Meta Muse Image có giá 0,01 USD mỗi ảnh, được công bố công khai, trên một API mà bạn có thể gọi ngay chiều nay. Qwen-Image 2.1 thì tốn một bản tải xuống 33 GB, một GPU bạn đã sở hữu, và một cuộc rà soát pháp lý đối với giấy phép ghi rõ chỉ dùng phi thương mại.
Nơi chúng vô tình hội tụ
Cả hai mô hình đều chấp nhận tối đa 10 ảnh tham chiếu. Đó không hẳn là một sự trùng hợp, mà đúng hơn là cả ngành đang thống nhất một câu trả lời: mười là đủ cho một character sheet, một bộ sản phẩm hoặc một gói tham chiếu phong cách, và vượt quá ngưỡng đó thì conditioning không còn giúp ích nữa mà bắt đầu chống lại. Meta công bố con số 94% về độ nhất quán nhân vật đa ảnh cho mô hình của mình; Alibaba không công bố số liệu tương đương, và báo cáo thực hành độc lập duy nhất cho thấy độ nhất quán bắt đầu suy giảm quanh ảnh tham chiếu thứ ba. Hai mô hình cùng tuyên bố một phạm vi giống nhau nhưng đằng sau là những bằng chứng khác biệt hoàn toàn — đó chính là toàn bộ cuộc so sánh được thu nhỏ lại.
Chúng cũng hội tụ về cùng một vấn đề mà cả hai đều chưa giải quyết: không bên nào cho bạn cả hai. Meta Muse Image không thể được tải xuống, kiểm tra hoặc chạy trên phần cứng của riêng bạn, và vòng lặp agentic của nó vốn dĩ là một hộp đen. Qwen-Image 2.1 không thể được bán, không thể được gọi, và chưa thể được đo lường so với bất cứ thứ gì. Nếu ràng buộc của bạn là thời hạn, một trong hai cái này dùng được ngay hôm nay. Nếu ràng buộc của bạn là một cuộc đánh giá tuân thủ hoặc nhu cầu hiểu chính xác pipeline của bạn đang làm gì, thì cái kia mới đáp ứng được.


Chọn theo việc bạn phải làm tiếp theo, chứ không phải theo cái nào tốt hơn
Nếu bạn cần tung ra tính năng tạo ảnh trong quý này theo giấy phép thương mại với một mô hình có thể đo lường được phía sau, thì Meta Muse Image là câu trả lời, và 0,01 đô la mỗi ảnh là con số bạn có thể đưa vào ngân sách. Nếu bạn cần hiểu một mô hình ảnh từ đầu đến cuối — cơ chế che khuất attention, bộ viết lại prompt, VAE, giấy phép — thì Qwen-Image 2.1 là mô hình duy nhất trong hai mô hình cho phép bạn làm điều đó, và nó chỉ còn cách việc không thể dùng được cho bất cứ mục đích nào khác đúng một giấy phép nghiên cứu. Cả hai lựa chọn đều không phải là thỏa hiệp về chất lượng, bởi vì câu hỏi về chất lượng vẫn còn bỏ ngỏ ở một phía. Nó sẽ khép lại khi đủ người chạy Qwen-Image 2.1 công khai để đưa nó lên bảng xếp hạng, và những người thử nghiệm quyền truy cập sớm đã được yêu cầu công bố trước ngày 29 tháng 9. Đó là ngày mà sự so sánh này trở thành một so sánh thực thụ.
