Một thẻ hero được tạo có tiêu đề Qwen-Image-2.1 so với GPT-Image-2.5, hiển thị một thẻ được gắn nhãn Qwen-Image-2.1 với biểu tượng tải xuống và dòng chữ trọng số 33 GB bên cạnh một thẻ được gắn nhãn GPT-Image-2.5 với biểu tượng đồng hồ đo và dòng chữ tính phí theo token, chú thích là một cái bạn tải xuống, một cái bạn tính theo mức dùng.
Guides & Insights

Qwen-Image-2.1 vs GPT-Image-2.5: Khoảng cách chỉ là một con số, và đó không phải là chất lượng

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đặt Qwen-Image-2.1GPT-Image-2.5 cạnh nhau về thông số kỹ thuật và chúng trông như anh em sinh đôi: cả hai đều là mô hình hình ảnh hợp nhất tạo và chỉnh sửa, cả hai đều có đầu ra nền trong suốt, cả hai đều ra mắt trong năm tuần qua, cả hai đều có khả năng tạo ảnh tĩnh đạt chuẩn 2K. Khác biệt quyết định lựa chọn giữa chúng là một con số duy nhất, và đó không phải là điểm chuẩn đánh giá. Qwen-Image-2.1 miễn phí tải về và không thể bán. GPT-Image-2.5 không thể tải về và dễ dàng bán. Mọi thứ khác — kiến trúc, độ trễ, cách triển khai độ trong suốt — đều là hệ quả từ đó. Qwen-Image-2.1 được phát hành dưới dạng mã nguồn mở vào ngày 20 tháng 9 năm 2026; GPT-Image-2.5 được công bố với các mô hình API đã hoạt động vào ngày 8 tháng 9 năm 2026.

Hai cách để thêm tính minh bạch, cách nhau một tháng

Việc cả hai mô hình đều có được đầu ra minh bạch chỉ cách nhau vài tuần là một sự trùng hợp đáng để tìm hiểu, bởi vì hai cách triển khai này không tương đương.

Qwen-Image-2.1 đặt alpha vào bên trong mô hình. Nó khử nhiễu trong không gian latent RGBA 64 kênh với nén không gian 16×, vì vậy kênh alpha là một thành phần hạng nhất của thứ mà bộ lấy mẫu tạo ra. Không có bước phân đoạn và không có lượt matting. Bên cạnh đó là một phần bổ sung khác thường: vì mô hình có thể quyết định theo từng prompt liệu phát ra RGB hay ảnh kênh alpha, nó cũng có thể tách một chủ thể ra khỏi một bức ảnh thông thường và trả lại một lớp trong suốt thay vì mặt nạ nhị phân.

GPT-Image-2.5 đi theo con đường tham số. API của OpenAI chấp nhận một background với thiết lập auto, opaque hoặc transparent, và mô hình sẽ phản hồi tương ứng. Đó là một công tắc bật/tắt tính năng trên một endpoint được lưu trữ (hosted) chứ không phải là một thuộc tính của không gian latent, và nó mang lại lợi thế là bạn không phải bận tâm về nó: đặt cờ, nhận ảnh tách nền, rồi đi tiếp. Cái phải đánh đổi là bạn chỉ nhận được những gì endpoint đưa cho bạn, ở độ phân giải và mức chi phí do endpoint quyết định.

Cái nào tốt hơn thực sự vẫn chưa được giải quyết. Không có so sánh công khai nào giữa các cạnh alpha của Qwen-Image-2.1 với một mô hình matting chuyên dụng tồn tại ở thời điểm viết bài, và kiểm tra duy nhất được công bố về phía Qwen là một kiểm tra chức năng — đầu ra PNG trong suốt đã đạt, alpha được giữ nguyên trên toàn bộ dải 0–255, RGBA PSNR là 60,69 dB trong một mẫu đơn. Đó là một kiểm tra tính đúng đắn, không phải một phán quyết về chất lượng. Nó cho bạn biết kênh đó là thật.

Những gì bạn thực sự có thể đo lường

Số tham số — Thành phần sinh của Qwen-Image-2.1 là một diffusion transformer đơn luồng 7B, 32 lớp, đi kèm text encoder Qwen3-VL 8B; tổng cộng khoảng 33 GB trọng số, trong đó DiT chiếm khoảng 14 GB. OpenAI không công bố số tham số cho GPT-Image-2.5.
Độ phân giải — Qwen-Image-2.1 xuất ra native tối đa 2048×2048 ở 40 bước suy luận với bảy preset tỷ lệ khung hình. GPT-Image-2.5 chấp nhận các kích thước lên tới 3840×2160 và 2160×3840, với mỗi cạnh giới hạn ở 3840 px và yêu cầu là bội số của 16.
Ảnh tham chiếu — Qwen-Image-2.1 nhận tối đa 10 ảnh cho việc tổ hợp nhiều chủ thể và thử đồ ảo. Các mô hình ảnh của OpenAI chấp nhận đầu vào tham chiếu để chỉnh sửa, nhưng giới hạn thực tế và đặc tính độ trung thực khác nhau tùy theo từng mô hình và từng hạng chất lượng.
Độ trễ — SGLang-Diffusion công bố 2.748 s cho một lần sinh ảnh 1024×1024, 40 bước trên một B200 duy nhất, và 4.74 s trên RTX 4090 24 GB với Cache-DiT và kernel INT8, chỉ tính phần khử nhiễu. OpenAI báo cáo biến thể Flare của GPT-Image-2.5 có độ trễ thấp hơn tới 50% so với GPT-Image-2, với một đối tác ra mắt đo được 2–4× — lần lượt là do nhà cung cấp báo cáo và đối tác báo cáo, không phải một so sánh có kiểm soát.
Giá — Qwen-Image-2.1 không có giá dạng dịch vụ lưu trữ vì không có endpoint lưu trữ; chi phí chính là thời gian GPU của bạn. GPT-Image-2.5 tính phí theo cùng mức token như GPT-Image-2: $8.00 cho 1M token đầu vào hình ảnh, $30.00 cho 1M token đầu ra hình ảnh, $5.00 cho 1M token đầu vào văn bản.
Giấy phép — Qwen-Image-2.1 được phát hành theo Thỏa thuận Giấy phép Nghiên cứu Qwen ngày 20 tháng 9 năm 2026, chỉ dùng cho mục đích phi thương mại. GPT-Image-2.5 là một API thương mại với nguồn gốc C2PA và hình mờ vô hình trên đầu ra.

Một hàng trong danh sách đó mỏng hơn vẻ ngoài của nó. OpenAI không công bố giá theo từng hình ảnh cho GPT-Image-2.5, chỉ có mức giá theo token, và mức tiêu thụ token hình ảnh thay đổi theo độ phân giải và bậc chất lượng. Các đo lường của bên thứ ba đưa ra khoảng từ khoảng $0.0059 đến $0.712 mỗi hình ảnh trên 1K, 2K và 4K ở cài đặt thấp, trung bình và cao với tỷ lệ khung hình 1:1 — hữu ích như một bậc độ lớn, không phải như một báo giá. Nếu bạn đang dự báo, hãy xây dựng ước tính từ số lượng token và phân bố prompt của chính bạn, không phải từ một con số trên mỗi hình ảnh do người khác đo được.

A generated two-column scoreboard titled Qwen-Image-2.1 vs GPT-Image-2.5 - the scoreboard. Left column Qwen-Image-2.1 rows: Generation component 7B DiT; Transparency native RGBA; Resolution 2048 x 2048 native; Reference images up to 10; Price self-hosted GPU time; Licence non-commercial research only. Right column GPT-Image-2.5 rows: Generation component undisclosed; Transparency API parameter; Resolution up to 3840 x 2160; Reference images per the editing API; Price 8 and 30 dollars per 1M tokens; Licence commercial, C2PA and watermark. Footer: Qwen figures per the vendor model card, unaudited; OpenAI figures per the vendor API reference.

Hai loại chi phí mà không ai đặt vào cùng một cột

Lý do khiến việc so sánh này khó có một câu trả lời đơn giản là hai mô hình này tính phí bạn bằng những loại tiền tệ khác nhau, và tỷ giá quy đổi chính là hoàn cảnh của riêng bạn.

GPT-Image-2.5 tính phí theo token, nghĩa là đồng hồ đo luôn hiển thị rõ, có thể dự đoán được và tăng tuyến tính theo khối lượng. Đó là một lợi thế thực sự đối với một sản phẩm có lưu lượng đã biết: bạn có thể đưa nó vào ngân sách, và việc nhà cung cấp giảm giá sẽ thay đổi chi phí của bạn ngay trong cùng ngày. Nó cũng là một thứ thuế đánh vào việc khám phá, bởi vì lần lặp thứ mười của một prompt tốn chi phí đúng bằng lần đầu tiên. Hành vi input_fidelity khiến điều này trở nên rõ nét hơn so với mức giá niêm yết — API có thể tự động áp dụng độ trung thực cao cho đầu vào hình ảnh, vốn tiêu tốn nhiều token đầu vào hơn so với những gì một lần đọc lướt bảng giá gợi ra, nên các vòng lặp chỉnh sửa tốn kém hơn những con số trên mỗi hình ảnh mà người ta thường trích dẫn.

Qwen-Image-2.1 đảo ngược cả hai đặc tính. Chi phí biên của lần tạo thứ một trăm là điện năng. Điều đó khiến nó trở thành công cụ tốt hơn cho việc lặp lại, cho việc bổ sung hàng loạt, và cho bất cứ thứ gì mà lời nhắc vẫn đang được khám phá. Điều nó không mang lại cho bạn là một con số cho bảng tài chính — bạn đang trả tiền cho GPU dù nó bận hay rảnh — và nó không cho bạn quyền bán đầu ra. Thỏa thuận Giấy phép Nghiên cứu Qwen cho phép nghiên cứu và đánh giá phi thương mại, và nêu rõ rằng việc triển khai thương mại yêu cầu một giấy phép riêng từ Hangzhou Tongyi Laboratory Technology. Không có mức giá công bố cho giấy phép đó và không có điều khoản nào được nêu. Đó không phải là một chú thích nhỏ; đối với một quy trình thương mại, đó là toàn bộ quyết định.

Vận hành cả hai mà không cần hợp đồng thứ hai

Câu trả lời thực tế cho hầu hết các nhóm không phải là cái này hay cái kia, mà là cả hai. GPT-Image-2.5 xử lý lộ trình sản xuất, nơi đầu ra được giao cho khách hàng và đồng hồ tính theo token là một mục chi phí riêng. Qwen-Image-2.1 xử lý lộ trình khám phá, nơi bạn cần hai trăm biến thể của một ảnh chụp sản phẩm nền trong suốt và không nhà cung cấp nào sẽ bán cho bạn khối lượng đó với một mức giá hợp lý.

Điểm ma sát nằm ở chỗ hai thứ này đến qua những con đường hoàn toàn khác nhau. Một cái là API key. Cái còn lại là bản tải xuống 33 GB, một môi trường Python và một GPU của chính bạn. OrcaRouter đảm nhiệm nửa phần hosted: hơn 200 mô hình sau một endpoint tương thích OpenAI, giá niêm yết của nhà cung cấp được chuyển thẳng với mức markup bằng không, tự động chuyển đổi dự phòng giữa các nhà cung cấp, một DSL định tuyến để diễn đạt các phương án dự phòng, và tính năng hợp nhất mô hình để kết hợp nhiều mô hình vào một lời gọi. Cần nói chính xác về mô hình này — hiện tại chúng tôi không định tuyến GPT-Image-2.5; các tuyến hình ảnh OpenAI của chúng tôi là GPT-Image-2, GPT-Image-1.5GPT-Image-1-mini, tất cả đều theo giá niêm yết của OpenAI, và vào ngày một nhà cung cấp thượng nguồn thêm các định danh gpt-image-2.5, cùng một key đó sẽ gọi chúng mà không cần thay đổi mã. Chúng tôi cũng không định tuyến bất kỳ mô hình Qwen-Image nào ở bất kỳ phiên bản nào, nên Qwen-Image-2.1 hoàn toàn không phải là một tuyến ở phía chúng tôi. Điều mà mức giá chuyển thẳng mang lại cho bạn trong lúc này là khi OpenAI thay đổi một mức giá, con số ở phía chúng tôi cũng thay đổi theo chứ không bị trễ.

Phán quyết, được nêu như một điều kiện thay vì một người chiến thắng

Nếu đầu ra phải được bán, thì đây không phải là một lựa chọn sát nút: GPT-Image-2.5 là cái duy nhất trong hai cái mà bạn được cấp phép sử dụng, và đồng hồ đo token chính là cái giá phải trả cho điều đó. Nếu đầu ra là để nghiên cứu, công cụ nội bộ hoặc đánh giá, Qwen-Image-2.1 là công cụ mạnh hơn — 2K gốc, alpha xuất trực tiếp từ sampler, mười ảnh tham chiếu, và chi phí biên bằng không một khi phần cứng đã được trả tiền. Nếu bạn cần cả hai, hãy chạy cả hai, và coi giấy phép là ranh giới quyết định một công việc cụ thể sẽ đi vào pipeline nào.

Hai điều sẽ thay đổi cục diện này. Một bản điều khoản thương mại được công bố cho Qwen-Image-2.1 sẽ thu hẹp khoảng cách ở hàng giấy phép, vốn hiện đang gánh phần lớn trọng lượng trong so sánh này. Và một mục xếp hạng hình ảnh độc lập cho Qwen-Image-2.1 sẽ cho chúng ta biết liệu kết quả Qwen-Image-Bench của nhà cung cấp — 60,28, vượt Nano Banana 2.0 ở 59,82 và GPT Image 1.5 ở 59,65, đứng đầu trong số các mô hình mở — có đứng vững bên ngoài phòng thí nghiệm đã tạo ra nó hay không. Cả hai hiện đều chưa tồn tại. Cho đến khi chúng xuất hiện, khuyến nghị trung thực là hãy chọn dựa trên giấy phép và đồng hồ đo, chứ không phải trên bảng điểm.

A screenshot of OrcaRouter's own model page for openai/gpt-image-2, captured September 21 2026, showing the model description as OpenAI's token-billed image model reached through the Images API, the /v1/images/generations endpoint, and the published list rates of $8.00 per 1M image input tokens and $30.00 per 1M image output tokens.A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.