Tiêu đề bài đăng blog của nhà cung cấp Qwen công bố Qwen-Image-2.1, hiển thị tiêu đề 'Qwen-Image-2.1: Nhỏ gọn, Hiệu quả và Thống nhất trong Tạo hình ảnh' phía trên dòng chữ 'Giờ đã mở trọng số' cùng biểu trưng Qwen, với trình chuyển đổi ngôn ngữ của trang được đặt thành EN
Guides & Insights

Qwen-Image-2.1 là mô hình hình ảnh trọng số mở hàng đầu trên cả hai bảng xếp hạng Artificial Analysis

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Nhóm Qwen của Alibaba đã phát hành Qwen-Image-2.1 với trọng số mở vào ngày 20 tháng 9 năm 2026. Mười hai ngày sau, các bảng điểm độc lập đã bắt kịp nó, và kết quả còn thú vị hơn cả màn ra mắt. Trên AA-Image-T2I v2.0 bảng xếp hạng, Qwen-Image-2.1 đứng ở hạng 18 trong số 166 với Elo 1.034, từ 5.286 lượt so sánh mù. Trên AA-Image-Editing v2.0 bảng xếp hạng, nó đứng ở hạng 18 trong số 97 với Elo 1.074, từ 5.536. Cả hai dòng đó đều được đánh dấu Trọng số mở trên một bảng đánh dấu từng mô hình riêng lẻ. Không có mô hình nào khác mang dấu đó trên một trong hai bảng lại được xếp trên chúng. Đó là toàn bộ phát hiện: trên hai bảng hình ảnh công khai duy nhất chấm điểm mô hình bằng so sánh cặp mù, Qwen-Image-2.1 đã phát hành là bộ trọng số có thể tải xuống mạnh nhất trong lĩnh vực, và chính Qwen-Image-2.1 cụ thể, chứ không phải bản xem trước của nó, nắm giữ cả hai vị trí.

Phần tiếp theo đây nói về nguồn gốc của hai con số đó, hình dạng các hàng xung quanh chúng, và ba chi tiết trên bảng mà hầu hết các bài đưa tin về buổi ra mắt đã bỏ sót — bắt đầu với việc bảng không ghi nhận API nào ở bất kỳ đâu cho mô hình.

Nơi hai hàng nằm

Artificial Analysis xây dựng cả hai bảng xếp hạng từ các so sánh cặp mù: hai mô hình trả lời cùng một câu lệnh, một người đánh giá chọn đầu ra tốt hơn, và điểm Elo được tạo ra từ dữ liệu tổng hợp. Hai bảng chỉ có chung một phong cách trình bày, ngoài ra không có gì khác. Chúng chấm điểm các tác vụ khác nhau, có thành phần người đánh giá khác nhau, và giá trị Elo của chúng không thể so sánh với nhau. Qwen-Image-2.1 tình cờ đạt cùng thứ hạng ở cả hai, đó là sự trùng hợp của hai phân phối khác nhau.

Tạo ảnh từ văn bản, 166 mô hình trên bảng:

• Hàng trên cùng của bảng xếp hạng là GPT Image 2.5 Sunburst (max) với 1.107 Elo từ 14.023 lần xuất hiện — một mô hình độc quyền có số mẫu nhiều hơn gấp đôi so với Qwen-Image-2.1.

• Qwen-Image-2.1 đứng ở vị trí thứ 18 với 1.034 Elo và khoảng tin cậy 95% từ 1.024 đến 1.044, qua 5.286 lần xuất hiện.

• Hãy đọc số lượng mô hình trong bảng trước khi xem thứ hạng. Qwen-Image-2.1 đứng ở vị trí thứ 18 trên cả hai bảng, nhưng những thứ hạng đó đến từ hai tập hợp khác nhau — 166 mô hình ở text-to-image, 97 ở editing — và hai giá trị Elo thuộc hai thang đo riêng biệt. Thứ hạng giống hệt nhau chỉ là kết quả số học, không phải bằng chứng rằng hai bảng đồng thuận với nhau về bất cứ điều gì.

• Hai mô hình thuộc phân khúc Pro của chính Alibaba đều xếp trên nó trong bảng xếp hạng này: Qwen-Image-3.0-Pro với 1.089 Elo, hạng 14, và Qwen-Image-3.0 với 1.075, hạng 16. Cả hai đều không mang nhãn Open Weights. Bản chụp nhanh tháng 9 của bảng xếp hạng liệt kê cả hai là bản phát hành tháng 7 năm 2026, tức là phiên bản câu chuyện mà ở đó mô hình hình ảnh Qwen mới nhất không phải là mô hình đạt điểm cao nhất — và ở mảng text-to-image thì đúng là như vậy.

Chỉnh sửa hình ảnh, 97 mô hình trên bảng:

• GPT Image 2.5 Sunburst (max) cũng đứng đầu bảng xếp hạng này, với 1.182 Elo từ 17.899 lần xuất hiện.

• Qwen-Image-2.1 đang ở vị trí thứ 18 với 1.074 Elo, khoảng tin cậy từ 1.065 đến 1.083, từ 5.536 lần xuất hiện — một mẫu lớn hơn một chút so với dòng text-to-image của nó, điều này hợp lý với một mô hình mà phần chỉnh sửa nhận được nội dung giới thiệu khi ra mắt rầm rộ hơn.

• Các hàng xung quanh nó rất đông đúc. grok-imagine-image nằm một bậc bên dưới ở 1.071 và Luma UNI 1 Max ở 1.069. Hàng trọng số mở gần nhất bên dưới nó trên bảng này là HunyuanImage 3.0 Instruct ở 1.066 trên 5.221 lần xuất hiện — cách 8 Elo. Bảy hàng nằm trong vòng mười tám điểm Elo.

Đọc một cách trung thực tuyên bố “mô hình open-weights hàng đầu”

Cụm từ trong tiêu đề đang đảm nhiệm một vai trò cụ thể, và nó đáng được kiểm tra thay vì chỉ được lặp lại.

• Đây là thứ hạng trong nhóm được gắn dấu, không phải thứ hạng tổng thể. Qwen-Image-2.1 đứng thứ 18 trên cả hai bảng xếp hạng tổng thể. Nhãn Open Weights chính là thứ đưa nó lên vị trí đầu tiên trên mỗi bảng, và nhãn này được áp dụng cho từng mô hình theo thẩm quyền của chính bảng xếp hạng — 47 dòng text-to-image mang dấu này; 36 dòng mang dấu trên bảng chỉnh sửa, bảng vốn liệt kê 97 dòng.

• Nhãn này mô tả trọng số, không phải các điều khoản. Qwen-Image-2.1 được phát hành theo Thỏa thuận Cấp phép Nghiên cứu Qwen ngày 20 tháng 9 năm 2026, theo đó chỉ cấp quyền cho các mục đích phi thương mại. Nhãn Open Weights của bảng xếp hạng thì chính xác về khả năng tải xuống và không nói gì về những gì bạn được phép làm với bản tải xuống đó. Bất kỳ ai đọc "mô hình hình ảnh mở trọng số hàng đầu" thành "được tự do dùng trong sản phẩm" đều đã đọc nhãn đó vượt quá ý nghĩa của nó.

• Đây là một ảnh chụp nhanh, không phải một bảng xếp hạng đã ổn định. Bảng xếp hạng thay đổi mỗi ngày khi số phiếu bầu tăng lên. Khoảng tin cậy của Qwen-Image-2.1 là ±10 Elo ở tác vụ tạo ảnh từ văn bản và ±9 ở tác vụ chỉnh sửa; các dòng bên dưới nó nằm trên những khoảng tin cậy chồng lấn nhau. Hãy coi vị trí này là tạm thời ở hiện tại chứ không phải vĩnh viễn.

Chi tiết mà tin tức về buổi ra mắt không hề có: không có API

Cả hai hàng Qwen-Image-2.1 đều mang một ghi chú rõ ràng là Không có API khả dụng. Đó là một cái giá thực sự đối với bảng xếp hạng, và nó cho bạn biết đôi điều về những người đã tạo ra 5.286 và 5.536 phiếu bầu — nếu không có endpoint nào để trỏ một prompt tới, các so sánh đến từ những người tự chạy trọng số và gửi kết quả. Elo độc lập cho một mô hình chỉ tự vận hành thực sự là một phép đo khó hơn Elo cho thứ mà bất kỳ ai cũng có thể gọi, và đó là lý do vì sao các mẫu ở đây chỉ bằng một phần ba kích thước của các hàng đầu.

Đối với một lập trình viên, hình dạng của vấn đề này rất quen thuộc: mô hình hình ảnh tải về được mạnh nhất trong lĩnh vực không phải là mô hình bạn có thể gọi ngay hôm nay. Về mặt thực tế, điều đó chia công việc thành hai hướng. Hoặc bạn tự phục vụ Qwen-Image-2.1 trên phần cứng của riêng mình, hoặc bạn gọi một trong những mô hình xoay quanh nó trên bảng này. Lựa chọn thứ hai chính là nơi định tuyến chứng minh được giá trị của mình — một API trên hơn 200 mô hình với giá niêm yết của nhà cung cấp được chuyển nguyên vẹn, không thêm phụ phí, tự động chuyển đổi dự phòng khi một nhà cung cấp gặp sự cố suy giảm, cùng một DSL định tuyến để kết hợp nhiều mô hình thành một lệnh gọi duy nhất. OrcaRouter hiện chưa phục vụ Qwen-Image-2.1; các dòng hình ảnh trên nền tảng là các bậc Imagen của Google và bản xem trước hình ảnh Gemini, endpoint hình ảnh Grok Imagine của xAI và dòng GPT-Image của OpenAI. Trên bảng này, đó chính là hàng GPT Image 2.5 Sunburst ở ngay trên cùng, và nó là một câu trả lời hoàn toàn hợp lý cho "Tôi muốn điểm số tốt nhất và tôi muốn có thể gọi nó vào ngay chiều nay."

Screenshot of the Artificial Analysis text-to-image leaderboard, AA-Image-T2I v2.0, captured in English, listing GPT Image 2.5 Sunburst (max) first at 1,107 Elo from 14,023 samples, the Qwen-Image-3.0-Pro row at rank 14 with 1,089 Elo and 6,353 samples, and the Qwen-Image-2.1 row at rank 18 with 1,034 Elo from 5,286 samples

Những gì cần theo dõi trên bảng

Ba điều sẽ thúc đẩy câu chuyện này, và cả ba đều đã hiện rõ trên các bảng tin.

Điều đầu tiên là liệu một API có xuất hiện. Nếu Alibaba hoặc một đối tác cung cấp dịch vụ đặt Qwen-Image-2.1 sau một endpoint, thì Không có API khả dụng, ghi chú này sẽ biến mất, lượng phiếu bầu sẽ tăng lên tới mức của các hàng lân cận, và khoảng tin cậy thu hẹp lại. Một khoảng tin cậy hẹp hơn trên mức 1,034 hay 1,074 là một khẳng định mạnh hơn nhiều so với hiện tại.

Thứ hai là stack của chính Alibaba. Qwen-Image-3.0-Pro với 1.089 và Qwen-Image-3.0 với 1.075 đều xếp trên Qwen-Image-2.1 ở mảng tạo ảnh từ văn bản trong khi không mang dấu hiệu Open Weights. Nếu Qwen-Image-2.1 được coi là bản đối chiếu có thể tải xuống cho dòng sản phẩm đó thay vì là bản kế nhiệm, thì câu hỏi thú vị là liệu khoảng cách có thu hẹp lại không — và trên bảng chỉnh sửa thì điều đó đã xảy ra, khi Qwen-Image-3.0-Pro dẫn trước Qwen-Image-2.1 hai điểm Elo.

Điều thứ ba là giấy phép. Mọi hàng Open Weights trên cả hai bảng đều đủ điều kiện như nhau để được gắn nhãn, còn những giấy phép đằng sau chúng thì không hề ngang bằng chút nào. Bảng sẽ không bao giờ cho bạn biết điều đó. Đó là cột duy nhất mà bảng điểm không hề có.

Generated summary card for Qwen-Image-2.1 on the Artificial Analysis boards, listing text-to-image rank 18 of 166 at 1,034 Elo from 5,286 votes, editing rank 18 of 97 at 1,074 Elo from 5,536 votes, the note that it is the top Open Weights row on both boards, and the sourcing line that the figures are per Artificial Analysis

FAQ

Qwen-Image-2.1 có phải là mô hình hình ảnh trọng số mở tốt nhất không?

Trên hai bảng này, đúng vậy — đó là hàng có Elo cao nhất mang dấu Open Weights trên cả hai, với 1.034 ở văn bản thành hình ảnh và 1.074 ở chỉnh sửa. Nhìn chung, nó xếp thứ 18 trên mỗi bảng — và con số 18 là thứ hạng trong số 166 hàng ở một bảng và trong số 97 ở bảng kia, đại diện cho hai thang điểm Elo không thể so sánh với nhau. Tuyên bố chỉ đúng nếu cả hai điều kiện đều được giữ nguyên.

Tại sao hai bảng xếp hạng lại hiển thị giá trị Elo khác nhau cho cùng một mô hình?

Chúng đánh giá các tác vụ khác nhau trên các tập hợp mô hình khác nhau. Elo văn bản-thành-hình ảnh và Elo chỉnh sửa là hai thang đo riêng biệt; việc so sánh 1.034 với 1.074 đo lường bảng xếp hạng, chứ không phải mô hình.

Tôi có thể gọi Qwen-Image-2.1 thông qua API không?

Cả hai hàng của bảng xếp hạng đều ghi Không có API khả dụng. Các trọng số có thể tải xuống từ các kho lưu trữ của Alibaba, nên mô hình chạy được — chỉ là nó không có endpoint được lưu trữ mà bảng xếp hạng đã ghi nhận là đã phục vụ nó.

Nếu bạn muốn có một con số ngay hôm nay thay vì phải tải xuống, phần đầu của cả hai bảng xếp hạng đều có thể gọi được qua API riêng của các nhà cung cấp, và dòng GPT-Image, các bậc Imagen của Google cùng Grok Imagine của xAI là những mô hình hình ảnh mà OrcaRouter trực tiếp cung cấp giao diện. Hãy giữ tệp trọng số cho thí nghiệm và endpoint cho hạn chót.