Đã tạo thẻ hero cho bài viết Qwen-Image-2.1 so với Hy Image3.5, với tiêu đề Qwen-Image-2.1 vs Hy Image3.5, phụ đề Các bảng xếp hạng xếp chúng theo thứ tự ngược nhau, các chip ghi Chỉnh sửa: Hy Image3.5 dẫn trước 1.088 so với 1.074 và Tạo ảnh từ văn bản: Qwen-Image-2.1 dẫn trước 1.034 so với 975, cùng phần chân trang Cả hai mô hình đều được chấm điểm theo Artificial Analysis, tháng 9 năm 2026, với logo OrcaRouter được ghép ở góc dưới bên phải
Guides & Insights

Qwen-Image-2.1 vs Hy Image3.5: Các bảng xếp hạng độc lập xếp chúng theo thứ tự trái ngược nhau

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đặt Qwen-Image-2.1 và Hy Image3.5 đối đầu trực tiếp trên hai bảng xếp hạng hình ảnh của Artificial Analysis và các bảng xếp hạng này không đồng ý với nhau về việc mô hình nào tốt hơn. Ở tác vụ text-to-image, Qwen-Image-2.1 hơn Hy Image3.5 tới 59 Elo — 1.034 so với 975, hạng 18 so với hạng 66. Ở tác vụ chỉnh sửa hình ảnh, cũng hai mô hình đó lại đổi chỗ cho nhau: Hy Image3.5 đứng ở mức 1.088 Elo và hạng 14, Qwen-Image-2.1 ở mức 1.074 và hạng 18. Khoảng cách 14 điểm theo chiều ngược lại. Hai mô hình này ra mắt công chúng cách nhau hai ngày — Qwen-Image-2.1 với trọng số mở vào ngày 20 tháng 9 năm 2026, Hy Image3.5 ở dạng xem trước công khai vào ngày 22 tháng 9 năm 2026 — và đây là lần đầu tiên một trong hai có điểm số trên cùng một thước đo, chính điều đó khiến sự bất đồng này đáng để đọc chứ không chỉ để đưa tin.

Cách làm hiển nhiên là nói rằng bảng chỉnh sửa thì ồn ào và bỏ qua. Điều đó đúng một nửa. Nửa còn lại là hai hàng không vững chắc như nhau, giá trên một hàng không phải là giá trên hàng kia, và một trong những mô hình này nắm quyền đối với các trọng số còn mô hình kia thì sẽ không bao giờ có.

Hai bảng, hai đơn hàng

Artificial Analysis chạy các so sánh cặp mù — cùng một prompt cho hai mô hình, một người bỏ phiếu chọn người thắng, Elo tích lũy — và công bố một bảng riêng cho mỗi tác vụ. Bảng text-to-image có 166 dòng; bảng chỉnh sửa có 97. Cả hai dòng cho cả hai mô hình đều đến từ snapshot của cùng một nhà cung cấp, nên đây không phải là lệch phiên bản.

• Văn bản thành hình ảnh: Qwen-Image-2.1 đạt 1.034 Elo (khoảng 1.024 đến 1.044) từ 5.286 phép so sánh, xếp hạng 18 trong số 166. Hy Image3.5 đạt 975 Elo (khoảng 966 đến 984) từ 5.334 phép so sánh, xếp hạng 66 trong số 166. Các khoảng không giao nhau. Mức chênh lệch 59 điểm trên các mẫu có kích thước tương tự là một thứ tự thực sự, không phải là sai lệch do làm tròn.

• Chỉnh sửa ảnh — Hy Image3.5 đạt 1.088 Elo (khoảng từ 1.079 đến 1.097) từ 5.550 lượt so sánh, xếp hạng 14 trong số 97. Qwen-Image-2.1 đạt 1.074 Elo (khoảng từ 1.065 đến 1.083) từ 5.536 lượt so sánh, xếp hạng 18 trong số 97. Hai khoảng này chồng lấn trên một dải bốn điểm từ 1.079 đến 1.083. Thứ tự chỉ mang tính định hướng, chứ chưa được xác lập.

• Kích thước mẫu khá sát nhau trên cả hai bảng — 5,286 so với 5,334 ở text-to-image, 5,536 so với 5,550 ở chỉnh sửa — nên khác biệt về độ tin cậy không phải do một mô hình nhận được ít phiếu bầu hơn.

• Bảng gán nhãn cho các mô hình theo cách khác nhau, và điều đó rất quan trọng: các hàng Qwen-Image-2.1 mang dấu Open Weights, còn các hàng Hy Image3.5 thì không.

Vậy cách đọc trung thực là bất đối xứng. Text-to-image: Qwen-Image-2.1 thắng rõ ràng. Chỉnh sửa: Hy Image3.5 có lẽ đang nhỉnh hơn, với khoảng cách nằm trong mức nhiễu của phép đo.

Sự bất đối xứng đến từ đâu

Sức mạnh chỉnh sửa của Hy Image3.5 không có gì đáng ngạc nhiên khi bạn nhìn vào những gì Tencent đã trang bị cho nó. Bản xem trước đã ra mắt công khai với tối đa năm ảnh tham chiếu mỗi yêu cầu, khả năng tạo ảnh từ văn bản và tạo ảnh từ ảnh trong cùng một mô hình, cùng tính năng chỉnh sửa nhiều lượt — mảng chỉnh sửa được nhấn mạnh khi ra mắt. Qwen-Image-2.1 được xây dựng với một ngăn xếp tạo và chỉnh sửa hợp nhất, cũng xử lý được ảnh tham chiếu, nhưng các hàng trên bảng xếp hạng của nó cho thấy mảng chỉnh sửa về đích thấp hơn hai Elo so với Qwen-Image-3.0-Pro của chính Alibaba, một kết quả ít cách biệt hơn so với cách định vị khi ra mắt ngụ ý.

Tuyên bố của chính Tencent cũng không phải là điều mà bảng xếp hạng thể hiện. Nhà cung cấp dẫn con số cho bản xem trước là tỷ lệ thắng khoảng 30% trong đánh giá mù so với Hy Image3.0. Con số đó chưa được bất kỳ ai ngoài Tencent tái lập, và bảng đánh giá độc lập không xác nhận điều đó ở mảng tạo ảnh từ văn bản — nơi Hy Image3.5 preview ở mức 975 thấp hơn 20 Elo so với HunyuanImage 3.0 Instruct trọng số mở ở mức 995. Ở mảng chỉnh sửa, phép so sánh tương tự lại nghiêng về phía nhà cung cấp: Hy Image3.5 preview ở mức 1.088 cao hơn 22 Elo so với HunyuanImage 3.0 Instruct ở mức 1.066. Một thế hệ tiến bộ trên bảng này, và một bước lùi trên bảng kia, đến từ chính sự kế thừa của Tencent.

Screenshot of the Artificial Analysis image editing leaderboard, AA-Image-Editing v2.0, captured in English and cropped from the top row down through the Ideogram 4.5 row, showing GPT Image 2.5 Sunburst (max) first at 1,182 Elo from 17,899 samples, the Hunyuanimage 3.5 (Preview) row at rank 14 with 1,088 Elo and 5,550 appearances, the Qwen-Image-2.1 row at rank 18 with 1,074 Elo and 5,536 appearances and a No API available note, and the Hunyuanimage 3.0 Instruct row at 1,066 with No API available

Trục giá, nơi mà hai cái hoàn toàn không thể so sánh với nhau

Hy Image3 preview là một API tính phí theo mức sử dụng mà Tencent Cloud tính ¥0,2K/ảnh ở Trung Quốc đại lục và US$0,024 ở bản quốc tế, chỉ tính phí qua API. Giá của Artificial Analysis tính 24,00 USD cho 1.000 ảnh, cũng là con số tương tự theo đơn vị mà bảng sử dụng — và so với hàng đầu trị giá 210 USD của bảng text-to-board cho cùng một nghìn ảnh, nó chưa bằng một phần chín mức giá đó.

Qwen-Image-2.1 không có dòng giá, vì nó không có endpoint. Cả hai dòng trên bảng của nó đều mang ghi chú rõ ràng Không có API khả dụng. Bạn không mua mô hình này; bạn tải nó về, và bạn trả giá cho nó bằng giờ GPU và bằng câu hỏi về giấy phép ở bên dưới. 5.286 và 5.536 phiếu trên các dòng của nó đến từ những người tự chạy trọng số. Điều đó cũng khiến bảng xếp hạng có một lưu ý đáng giữ: điểm Elo độc lập cho một mô hình chỉ tự lưu trữ đo lường một nhóm đối tượng khác so với Elo cho thứ mà ai cũng có thể gọi.

Nếu kế hoạch là đưa một trong hai mô hình này vào một sản phẩm, thì sự phân chia thực tế giờ đã rõ ràng, và đó cũng chính là sự phân chia mà mức giá hàm ý: mô hình có điểm chỉnh sửa tốt hơn là mô hình bạn thuê, còn mô hình có điểm text-to-image tốt hơn là mô hình bạn tự chạy. OrcaRouter là phía cho thuê của sự phân chia đó — một API trên hơn 200 mô hình với giá niêm yết của nhà cung cấp được chuyển nguyên, không đánh thêm phí, tự động chuyển đổi dự phòng giữa các nhà cung cấp, và một DSL định tuyến để kết hợp nhiều mô hình vào một lệnh gọi. Chúng tôi không định tuyến Hy Image3.5 preview hay Qwen-Image-2.1; các dòng hình ảnh trên nền tảng là các bậc Imagen của Google và bản xem trước hình ảnh Gemini, endpoint hình ảnh Grok Imagine của xAI và dòng GPT-Image của OpenAI. Cả hai mô hình này đều không phải lựa chọn đầu tiên từ danh sách đó chỉ dựa trên một dòng trên bảng xếp hạng, và đó chính xác là lý do câu hỏi về giấy phép bên dưới là yếu tố quyết định.

Trục mà cả hai bảng đều không có cột cho

Generated comparison scoreboard for Qwen-Image-2.1 and Hy Image3.5, listing editing Elo 1,074 against 1,088 with ranks 18 and 14, editing intervals 1,065 to 1,083 against 1,079 to 1,097, text-to-image Elo 1,034 against 975 with ranks 18 and 66, and the board labels Open Weights, no API for Qwen-Image-2.1 against no Open Weights and $24.00 per 1,000 images for Hy Image3.5

Qwen-Image-2.1 được phát hành theo Thỏa thuận Giấy phép Nghiên cứu Qwen, ngày 20 tháng 9 năm 2026, chỉ cấp quyền cho các mục đích phi thương mại và yêu cầu một giấy phép riêng từ nhà cung cấp cho việc sử dụng thương mại. Các kho lưu trữ Hugging Face báo cáo giấy phép là khác vì lý do đó — đây không phải là giấy phép OSI và không nên được hiểu là như vậy. Dấu hiệu Open Weights trên cả hai hàng bảng là chính xác và không nói lên điều gì về vấn đề này.

Bản xem trước Hy Image3.5 không có trọng số nào để cấp phép. Tencent chưa công bố chúng; bản xem trước được cung cấp từ nền tảng của chính Tencent và không có bản phát hành nào có thể tải xuống cho thế hệ này. Những gì bạn nhận được là một bảng giá, một giới hạn ảnh tham chiếu và một dịch vụ mà bạn có thể khởi động và dừng. Không có gì để kiểm toán, không có gì để tự lưu trữ, không có gì để thương lượng — và không có gì bạn giữ được nếu Tencent thay đổi giá hoặc ngừng cung cấp bản xem trước.

Phép so sánh thực sự giải quyết câu hỏi về trọng số mở là mô hình tiền nhiệm của chính Tencent chứ không phải mô hình của Qwen. HunyuanImage 3.0 Instruct có mặt trên cả hai bảng với nhãn Open Weights — 1.066 về chỉnh sửa, 995 về văn bản thành hình ảnh. Qwen-Image-2.1 đánh bại nó trên cả hai. Vì vậy, nếu yêu cầu là "trọng số có thể tải xuống mà tôi có thể chạy trên phần cứng của riêng mình," lựa chọn tốt nhất trong cuộc so tài này là của Alibaba, trên cả hai bảng, theo một giấy phép vẫn cấm bán đầu ra.

Không có phiên bản nào của chuyện này mà giấy tờ tự giải quyết được. Bạn có thể có điểm chỉnh sửa tốt hơn với không trọng số và một hóa đơn tính theo mức sử dụng, hoặc điểm text-to-image tốt hơn với các trọng số mà bạn có thể không được thương mại hóa. Hãy chọn xem bạn sống được với ràng buộc nào, rồi đi đo cả hai trên chính prompt của bạn — khoảng cách chỉnh sửa giữa chúng rộng bốn điểm nằm trong các khoảng chồng lấn, đúng kiểu mức chênh lệch mà một tập prompt held-out duy nhất có thể xóa sạch.