
Qwen-Image-2.1 vs Grok Imagine Image 2.0: Trọng số miễn phí đối đầu môi trường trả phí
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Một trong hai thứ này không tốn đồng nào cho mỗi bức ảnh và đi kèm giấy phép cấm bán kết quả. Thứ còn lại tốn từ hai đến sáu xu một ảnh tùy nơi bạn mua, không có hạn chế như vậy, và được xếp hạng trên những bảng mà bạn thực sự có thể tra cứu. Qwen-Image-2.1 ra mắt công khai vào ngày 20 tháng 9 năm 2026 dưới dạng trọng số mở theo một giấy phép nghiên cứu. Grok Imagine Image 2.0 là endpoint tạo ảnh trả phí của nhà cung cấp, được phân phối qua API riêng của họ và một loạt nhà cung cấp bên thứ ba. Lựa chọn giữa hai thứ này không nằm ở chất lượng — mà ở việc bạn muốn sở hữu mô hình hay thuê môi trường xung quanh nó, và môi trường đó đang làm nhiều việc hơn mức mà cái giá gợi ra.
Giá của một bức ảnh ở mỗi bên là bao nhiêu
Giá của Qwen-Image-2.1 là 0 cho mỗi ảnh và khác 0 một lần. Bạn phải tải xuống khoảng 33 GB — một diffusion transformer một luồng, 7B, 32 lớp, nặng khoảng 14 GB, cộng thêm bộ mã hóa văn bản Qwen3-VL 8B chiếm phần lớn dung lượng còn lại — và sau đó, chi phí biên cho mỗi ảnh chính là lượng điện để chạy nó. Trên một card bị hạn chế, model card khuyến nghị dùng CPU offload thông qua pipe.enable_model_cpu_offload(), đây là lối thoát tiêu chuẩn và cái bạn phải trả là tốc độ chứ không phải tiền.
Giá của Grok Imagine Image 2.0 lại có hình dạng trái ngược. Tài liệu của chính xAI liệt kê mẫu flagship ở mức 0,04 USD cho mỗi ảnh đầu ra, với endpoint hình ảnh Grok Imagine cơ bản ở mức 0,02 USD và hạng chất lượng ở mức 0,05 USD. Các nhà cung cấp bên thứ ba cũng nằm trong khoảng tương tự với cách phân hạng riêng của họ — một bên niêm yết mức giá cố định 0,05 USD cho text-to-image và 0,06 USD cho chỉnh sửa, bất kể độ phân giải hay thiết lập chất lượng; một bên khác báo giá cố định 0,045 USD ở cả 1K và 2K cho hạng chất lượng của mình; và bên thứ ba quảng cáo mức 0,025 USD cho text-to-image hoặc chỉnh sửa theo ảnh tham chiếu với tối đa năm ảnh đầu vào. Trên toàn thị trường, mức giá này dao động trong khoảng 0,02 đến 0,06 USD mỗi ảnh, với quyền truy cập dành cho người tiêu dùng được gộp vào X Premium và SuperGrok thay vì tính phí theo từng ảnh.
• Mô hình chi phí — Qwen-Image-2.1 là chi phí phần cứng và tải xuống cố định với chi phí biên bằng không cho mỗi ảnh; Grok Imagine Image 2.0 thuần túy là chi phí biên, tăng tuyến tính theo khối lượng mãi mãi.
• Điểm hòa vốn — điểm giao nhau là một bài toán về khối lượng mà bạn có thể tính được, và nó thay đổi mỗi khi nhà cung cấp điều chỉnh mức giá. Với vài nghìn ảnh mỗi tháng, hướng dùng dịch vụ host rẻ hơn hẳn so với việc mua GPU; ở khối lượng duy trì cao, hướng cục bộ thắng về chi phí và thua trên mọi trục khác.
• Những gì bạn không thể mua ở phía cục bộ — giới hạn tốc độ, thời gian hoạt động và đội ngũ vận hành của người khác. Điều bạn không thể mua ở phía dịch vụ host chính là các trọng số.
Bảng xếp hạng nói lên điều gì, và không nói lên điều gì
Grok Imagine Image 2.0 có những tuyên bố xếp hạng được công khai. Tài liệu ra mắt của xAI viện dẫn vị trí thứ hai chung cuộc trên cả bảng Text-to-Image lẫn Image Edit Arena tính đến ngày 7 tháng 8 năm 2026, sau GPT Image 2 — đó là một ảnh chụp nhanh có dấu thời gian do nhà cung cấp viện dẫn và nên được hiểu đúng như vậy. Các đơn vị theo dõi bên thứ ba trong những tuần sau đó đặt nó ở khoảng thứ hai về chỉnh sửa hình ảnh và thứ ba về tạo hình ảnh từ văn bản, một lần nữa sau GPT Image 2, với các con số Elo ở mức đầu 1.300 và một số trang theo dõi báo cáo gần 1.173–1.175 hơn. Khoảng cách giữa những con số đó tự nó là bài học: vị trí trên bảng xếp hạng trong hạng mục này thay đổi từng tuần, và một thứ hạng không gắn ngày tháng thì không phải là thông tin.
Qwen-Image-2.1 hoàn toàn không có xếp hạng nào. Nó vắng mặt trên các bảng xếp hạng hình ảnh độc lập vào thời điểm bài viết này được thực hiện. Con số chất lượng duy nhất của nó là biểu đồ Qwen-Image-Bench của chính nhà cung cấp, trong đó nó ghi 60,28 so với Nano Banana 2.0 ở 59,82 và GPT Image 1.5 ở 59,65 — tài liệu của nhà cung cấp, không được bên thứ ba nào tái lập. Điểm dữ liệu thực sự độc lập duy nhất là xác minh chức năng được công bố cùng với công việc tích hợp SGLang: đầu ra PNG trong suốt đã đạt, alpha được giữ nguyên trên toàn bộ dải 0–255, và RGBA PSNR đo được 60,69 dB trong một mẫu duy nhất mà các tác giả mô tả rõ ràng là kiểm tra tính đúng đắn chứ không phải bảo đảm chất lượng.
Vậy bảng điểm trung thực là: một mô hình có thứ hạng công khai có thể thay đổi và một tuyên bố của nhà cung cấp gắn với nó, còn mô hình kia có bảng đánh giá của nhà cung cấp và một bài kiểm thử tích hợp đạt. Đó không phải là một so sánh, và không có bài viết nào khẳng định ngược lại đã chạy cả hai.

Alpha, và tại sao nó là bất đối xứng kỹ thuật duy nhất
Tính trong suốt của Qwen-Image-2.1 được tích hợp ngay trong mô hình. Một VAE RGBA 64 kênh với mức nén không gian 16× nghĩa là kênh alpha là một phần của không gian latent đang được khử nhiễu, và điều đó mang lại cho bạn ba thứ từ một cơ chế duy nhất: tạo sinh kèm tính trong suốt, chỉnh sửa bên trong một hình ảnh vốn đã có tính trong suốt mà không cần làm phẳng nó trước, và tách chủ thể từ một bức ảnh RGB thông thường để trả về alpha thay vì một mặt nạ cứng. Không node xóa nền, không mô hình matting, không dọn cạnh — đó là tuyên bố của nhà cung cấp, và kiểm chứng chức năng bằng SGLang là bằng chứng độc lập duy nhất cho thấy kênh này là thật chứ không chỉ tồn tại trên danh nghĩa.
Grok Imagine Image 2.0 không có tương đương nào được ghi nhận chính thức. Những gì được công bố của nó gồm tạo ảnh từ văn bản và chỉnh sửa dựa trên ảnh tham chiếu, với các bậc độ phân giải và chất lượng, cùng tối đa năm ảnh đầu vào trên một số nhà cung cấp. Nếu tài sản của bạn cần một chủ thể được tách nền với các cạnh bán trong suốt sạch sẽ — tóc, thủy tinh, khói — bạn đang thêm một bước matting ở phía Grok chứ không phải ở phía Qwen. Liệu bước đó có tốn kém hơn rắc rối về giấy phép ở phía bên kia hay không mới là câu hỏi kỹ thuật thực sự, và nó phụ thuộc vào chủ thể của bạn.
Môi trường chỉnh sửa so với điểm kiểm tra
Hai hệ thống bất đồng về việc trí tuệ chỉnh sửa nên nằm ở đâu.
Grok Imagine Image 2.0 đưa nó vào dịch vụ. Bạn gửi một ảnh tham chiếu và một chỉ dẫn, nhà cung cấp quyết định điều đó nghĩa là gì, và các bậc độ phân giải cùng chất lượng được chọn theo từng yêu cầu. Không có gì để đọc, không có gì để tinh chỉnh, và không có gì để hỏng — đó là một lợi thế thực sự cho một nhóm không muốn tự sở hữu một pipeline diffusers. Đó cũng là lý do giá thay đổi theo nhà cung cấp đối với thứ danh nghĩa là cùng một mô hình: bạn đang mua một môi trường, chứ không chỉ là trọng số.
Qwen-Image-2.1 đặt nó vào trong các checkpoint mà bạn có thể kiểm tra. Bên cạnh mô hình hình ảnh, nó còn đi kèm hai mô hình viết lại prompt — PE-T2I và PE-I2I, mỗi mô hình là một Qwen3.5-VL 9B đã được tinh chỉnh, nặng khoảng 18,8 GB — với mã viết lại nằm trong prompt_rewrite/ — thư mục này — và một tệp system_prompt.txt đi kèm, trong đó nêu rõ, cùng nhiều thứ khác, cách chọn ngôn ngữ cho văn bản được kết xuất. Đó là mức độ có thể kiểm tra được mà không một API hình ảnh dạng hosted nào mang lại. Nó cũng đồng nghĩa với 37,6 GB mô hình viết lại chồng thêm lên trên mô hình chính, một chi phí thực sự về dung lượng đĩa và thời gian tải cho một thành phần mà hầu hết các pipeline sẽ coi là tùy chọn.
• Bề mặt chỉnh sửa — Qwen-Image-2.1 hỗ trợ chỉnh sửa cục bộ bằng cách khoanh tròn, chú thích vẽ tay hoặc mặt nạ riêng, cùng với chỉnh sửa lớp trong suốt và tách chủ thể; tính năng chỉnh sửa được ghi nhận của Grok Imagine Image 2.0 dựa trên ảnh tham chiếu.
• Đầu vào tham chiếu — Qwen-Image-2.1 chấp nhận tối đa 10 ảnh tham chiếu, với một người đánh giá quyền truy cập sớm báo cáo rằng tính nhất quán đa tham chiếu bắt đầu giảm từ khoảng ba ảnh trở đi; một số nhà cung cấp Grok ghi nhận tối đa năm ảnh đầu vào.
• Độ phân giải gốc — Qwen-Image-2.1 xuất ra ở độ phân giải gốc 2K với 2048×2048 là mặc định ở 40 bước trên bảy cài đặt sẵn tỷ lệ khung hình; độ phân giải của Grok Imagine Image 2.0 là lựa chọn theo từng yêu cầu, được tính giá theo nhà cung cấp.
Phân phối và giấy phép
Đây chính là chỗ hai bên khác biệt nhau rõ rệt nhất, và đó hoàn toàn không phải là một khác biệt về mặt kỹ thuật.
Grok Imagine Image 2.0 có sẵn thông qua API của xAI và thông qua nhiều nhà cung cấp bên thứ ba độc lập, nghĩa là có cạnh tranh về giá, nghĩa là mức giá bạn trả là giá thị trường chứ không phải giá niêm yết. Không cần tải xuống, không cần GPU, không có tệp giấy phép để đọc và không có hạn chế nào đối với việc sử dụng thương mại ngoài các điều khoản của chính nhà cung cấp.
Qwen-Image-2.1 chỉ có một cách để có được: tải xuống. Nó được phát hành theo Thỏa thuận Cấp phép Nghiên cứu Qwen ngày 20 tháng 9 năm 2026, thỏa thuận này chỉ cấp quyền cho các mục đích phi thương mại và nêu rõ rằng việc sử dụng thương mại đòi hỏi một giấy phép riêng phải yêu cầu từ nhà cung cấp. Đó là sự thắt chặt so với dòng Qwen-Image trước đó, vốn được phát hành theo Apache 2.0, và đây chính là sự thật duy nhất quyết định phần lớn các quyết định thực tế giữa hai phiên bản này. Một studio so sánh chúng về chất lượng đầu ra đang trả lời sai câu hỏi; studio không thể dùng Qwen-Image-2.1 cho công việc khách hàng thì hoàn toàn không so sánh chúng.
OrcaRouter là nơi phần cho thuê của thỏa thuận đó tồn tại. Chúng tôi định tuyến hơn 200 mô hình phía sau một endpoint tương thích OpenAI với giá niêm yết của nhà cung cấp, không đánh thêm phí, cùng khả năng chuyển đổi dự phòng tự động giữa các nhà cung cấp, một DSL định tuyến và hợp nhất mô hình — để một tuyến hình ảnh có thể chỉ định mô hình chính và mô hình dự phòng thay vì đặt cược vào buổi chiều của một nhà cung cấp. Chúng tôi định tuyến endpoint hình ảnh xAI Grok Imagine, nhưng lưu ý phiên bản: danh mục của chúng tôi có grok/grok-imagine-image, không phải Grok Imagine Image 2.0, nên mô hình mới hơn hiện không phải thứ chúng tôi có thể phục vụ bạn. Chúng tôi cũng không định tuyến bất kỳ mô hình Qwen-Image phiên bản nào, nên Qwen-Image-2.1 chỉ chạy cục bộ. Dòng hình ảnh được định tuyến mà chúng tôi thực sự cung cấp là họ GPT-Image của OpenAI, các bậc Imagen 4 của Google và bản xem trước hình ảnh Gemini, cùng endpoint hình ảnh Grok Imagine cũ đó; vì giá niêm yết được chuyển thẳng thay vì đánh thêm phí, việc nhà cung cấp giảm giá cho bất kỳ mô hình nào trong số đó sẽ có hiệu lực ngay trong ngày.

Điều gì sẽ làm thay đổi câu trả lời này?
Ba điều, và cả ba đều có khả năng xảy ra trong vòng một quý.
• Giấy phép thương mại cho Qwen-Image-2.1. Nếu nhà cung cấp công bố các điều khoản ở mức giá mà một studio sẵn sàng chi trả, thì lợi thế minh bạch và chi phí cận biên bằng không đều trở nên khả dụng trong công việc thương mại, và sự so sánh này thay đổi hoàn toàn về hình thái. Hiện nay chưa có mức giá nào được công bố và cũng không có điều khoản nào được nêu ra.
• Một đánh giá độc lập về Qwen-Image-2.1. Một bên thứ ba tái tạo các số liệu Qwen-Image-Bench của nhà cung cấp, hoặc đưa mô hình lên một bảng hình ảnh công khai, sẽ biến câu hỏi mở duy nhất còn lại — liệu nó có thực sự tốt không — thành một câu hỏi đã ngã ngũ.
• Một động thái giá từ phía Grok. Sự cạnh tranh giữa các nhà cung cấp đã tạo ra mức chênh từ $0,02 đến $0,06 cho một mô hình danh nghĩa là giống nhau. Một đợt giảm giá bền vững sẽ khiến lộ trình qua dịch vụ lưu trữ trở thành mặc định cho nhiều dải khối lượng hơn so với hiện tại.
Cho đến khi một trong số đó thành hình, yếu tố phân định không phải là chất lượng và cũng không phải là giá cả. Mà là việc bạn cần bản alpha và có thể sống chung với một giấy phép phi thương mại — khi đó bạn tải nó về và trả tiền bằng phần cứng; hay là bạn cần phát hành sản phẩm và muốn người khác vận hành mô hình — khi đó bạn trả tiền theo từng ảnh và không bao giờ phải nghĩ đến VAE nữa.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
