
Qwen-Image-2.1 vs GPT-Image-2.5: Khoảng cách chỉ là một con số, và đó không phải là chất lượng
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Đặt Qwen-Image-2.1 và GPT-Image-2.5 cạnh nhau về thông số kỹ thuật và chúng trông như anh em sinh đôi: cả hai đều là mô hình hình ảnh hợp nhất tạo và chỉnh sửa, cả hai đều có đầu ra nền trong suốt, cả hai đều ra mắt trong năm tuần qua, cả hai đều có khả năng tạo ảnh tĩnh đạt chuẩn 2K. Khác biệt quyết định lựa chọn giữa chúng là một con số duy nhất, và đó không phải là điểm chuẩn đánh giá. Qwen-Image-2.1 miễn phí tải về và không thể bán. GPT-Image-2.5 không thể tải về và dễ dàng bán. Mọi thứ khác — kiến trúc, độ trễ, cách triển khai độ trong suốt — đều là hệ quả từ đó. Qwen-Image-2.1 được phát hành dưới dạng mã nguồn mở vào ngày 20 tháng 9 năm 2026; GPT-Image-2.5 được công bố với các mô hình API đã hoạt động vào ngày 8 tháng 9 năm 2026.
Hai cách để thêm tính minh bạch, cách nhau một tháng
Việc cả hai mô hình đều có được đầu ra minh bạch chỉ cách nhau vài tuần là một sự trùng hợp đáng để tìm hiểu, bởi vì hai cách triển khai này không tương đương.
Qwen-Image-2.1 đặt alpha vào bên trong mô hình. Nó khử nhiễu trong không gian latent RGBA 64 kênh với nén không gian 16×, vì vậy kênh alpha là một thành phần hạng nhất của thứ mà bộ lấy mẫu tạo ra. Không có bước phân đoạn và không có lượt matting. Bên cạnh đó là một phần bổ sung khác thường: vì mô hình có thể quyết định theo từng prompt liệu phát ra RGB hay ảnh kênh alpha, nó cũng có thể tách một chủ thể ra khỏi một bức ảnh thông thường và trả lại một lớp trong suốt thay vì mặt nạ nhị phân.
GPT-Image-2.5 đi theo con đường tham số. API của OpenAI chấp nhận một background với thiết lập auto, opaque hoặc transparent, và mô hình sẽ phản hồi tương ứng. Đó là một công tắc bật/tắt tính năng trên một endpoint được lưu trữ (hosted) chứ không phải là một thuộc tính của không gian latent, và nó mang lại lợi thế là bạn không phải bận tâm về nó: đặt cờ, nhận ảnh tách nền, rồi đi tiếp. Cái phải đánh đổi là bạn chỉ nhận được những gì endpoint đưa cho bạn, ở độ phân giải và mức chi phí do endpoint quyết định.
Cái nào tốt hơn thực sự vẫn chưa được giải quyết. Không có so sánh công khai nào giữa các cạnh alpha của Qwen-Image-2.1 với một mô hình matting chuyên dụng tồn tại ở thời điểm viết bài, và kiểm tra duy nhất được công bố về phía Qwen là một kiểm tra chức năng — đầu ra PNG trong suốt đã đạt, alpha được giữ nguyên trên toàn bộ dải 0–255, RGBA PSNR là 60,69 dB trong một mẫu đơn. Đó là một kiểm tra tính đúng đắn, không phải một phán quyết về chất lượng. Nó cho bạn biết kênh đó là thật.
Những gì bạn thực sự có thể đo lường
• Số tham số — Thành phần sinh của Qwen-Image-2.1 là một diffusion transformer đơn luồng 7B, 32 lớp, đi kèm text encoder Qwen3-VL 8B; tổng cộng khoảng 33 GB trọng số, trong đó DiT chiếm khoảng 14 GB. OpenAI không công bố số tham số cho GPT-Image-2.5.
• Độ phân giải — Qwen-Image-2.1 xuất ra native tối đa 2048×2048 ở 40 bước suy luận với bảy preset tỷ lệ khung hình. GPT-Image-2.5 chấp nhận các kích thước lên tới 3840×2160 và 2160×3840, với mỗi cạnh giới hạn ở 3840 px và yêu cầu là bội số của 16.
• Ảnh tham chiếu — Qwen-Image-2.1 nhận tối đa 10 ảnh cho việc tổ hợp nhiều chủ thể và thử đồ ảo. Các mô hình ảnh của OpenAI chấp nhận đầu vào tham chiếu để chỉnh sửa, nhưng giới hạn thực tế và đặc tính độ trung thực khác nhau tùy theo từng mô hình và từng hạng chất lượng.
• Độ trễ — SGLang-Diffusion công bố 2.748 s cho một lần sinh ảnh 1024×1024, 40 bước trên một B200 duy nhất, và 4.74 s trên RTX 4090 24 GB với Cache-DiT và kernel INT8, chỉ tính phần khử nhiễu. OpenAI báo cáo biến thể Flare của GPT-Image-2.5 có độ trễ thấp hơn tới 50% so với GPT-Image-2, với một đối tác ra mắt đo được 2–4× — lần lượt là do nhà cung cấp báo cáo và đối tác báo cáo, không phải một so sánh có kiểm soát.
• Giá — Qwen-Image-2.1 không có giá dạng dịch vụ lưu trữ vì không có endpoint lưu trữ; chi phí chính là thời gian GPU của bạn. GPT-Image-2.5 tính phí theo cùng mức token như GPT-Image-2: $8.00 cho 1M token đầu vào hình ảnh, $30.00 cho 1M token đầu ra hình ảnh, $5.00 cho 1M token đầu vào văn bản.
• Giấy phép — Qwen-Image-2.1 được phát hành theo Thỏa thuận Giấy phép Nghiên cứu Qwen ngày 20 tháng 9 năm 2026, chỉ dùng cho mục đích phi thương mại. GPT-Image-2.5 là một API thương mại với nguồn gốc C2PA và hình mờ vô hình trên đầu ra.
Một hàng trong danh sách đó mỏng hơn vẻ ngoài của nó. OpenAI không công bố giá theo từng hình ảnh cho GPT-Image-2.5, chỉ có mức giá theo token, và mức tiêu thụ token hình ảnh thay đổi theo độ phân giải và bậc chất lượng. Các đo lường của bên thứ ba đưa ra khoảng từ khoảng $0.0059 đến $0.712 mỗi hình ảnh trên 1K, 2K và 4K ở cài đặt thấp, trung bình và cao với tỷ lệ khung hình 1:1 — hữu ích như một bậc độ lớn, không phải như một báo giá. Nếu bạn đang dự báo, hãy xây dựng ước tính từ số lượng token và phân bố prompt của chính bạn, không phải từ một con số trên mỗi hình ảnh do người khác đo được.

Hai loại chi phí mà không ai đặt vào cùng một cột
Lý do khiến việc so sánh này khó có một câu trả lời đơn giản là hai mô hình này tính phí bạn bằng những loại tiền tệ khác nhau, và tỷ giá quy đổi chính là hoàn cảnh của riêng bạn.
GPT-Image-2.5 tính phí theo token, nghĩa là đồng hồ đo luôn hiển thị rõ, có thể dự đoán được và tăng tuyến tính theo khối lượng. Đó là một lợi thế thực sự đối với một sản phẩm có lưu lượng đã biết: bạn có thể đưa nó vào ngân sách, và việc nhà cung cấp giảm giá sẽ thay đổi chi phí của bạn ngay trong cùng ngày. Nó cũng là một thứ thuế đánh vào việc khám phá, bởi vì lần lặp thứ mười của một prompt tốn chi phí đúng bằng lần đầu tiên. Hành vi input_fidelity khiến điều này trở nên rõ nét hơn so với mức giá niêm yết — API có thể tự động áp dụng độ trung thực cao cho đầu vào hình ảnh, vốn tiêu tốn nhiều token đầu vào hơn so với những gì một lần đọc lướt bảng giá gợi ra, nên các vòng lặp chỉnh sửa tốn kém hơn những con số trên mỗi hình ảnh mà người ta thường trích dẫn.
Qwen-Image-2.1 đảo ngược cả hai đặc tính. Chi phí biên của lần tạo thứ một trăm là điện năng. Điều đó khiến nó trở thành công cụ tốt hơn cho việc lặp lại, cho việc bổ sung hàng loạt, và cho bất cứ thứ gì mà lời nhắc vẫn đang được khám phá. Điều nó không mang lại cho bạn là một con số cho bảng tài chính — bạn đang trả tiền cho GPU dù nó bận hay rảnh — và nó không cho bạn quyền bán đầu ra. Thỏa thuận Giấy phép Nghiên cứu Qwen cho phép nghiên cứu và đánh giá phi thương mại, và nêu rõ rằng việc triển khai thương mại yêu cầu một giấy phép riêng từ Hangzhou Tongyi Laboratory Technology. Không có mức giá công bố cho giấy phép đó và không có điều khoản nào được nêu. Đó không phải là một chú thích nhỏ; đối với một quy trình thương mại, đó là toàn bộ quyết định.
Vận hành cả hai mà không cần hợp đồng thứ hai
Câu trả lời thực tế cho hầu hết các nhóm không phải là cái này hay cái kia, mà là cả hai. GPT-Image-2.5 xử lý lộ trình sản xuất, nơi đầu ra được giao cho khách hàng và đồng hồ tính theo token là một mục chi phí riêng. Qwen-Image-2.1 xử lý lộ trình khám phá, nơi bạn cần hai trăm biến thể của một ảnh chụp sản phẩm nền trong suốt và không nhà cung cấp nào sẽ bán cho bạn khối lượng đó với một mức giá hợp lý.
Điểm ma sát nằm ở chỗ hai thứ này đến qua những con đường hoàn toàn khác nhau. Một cái là API key. Cái còn lại là bản tải xuống 33 GB, một môi trường Python và một GPU của chính bạn. OrcaRouter đảm nhiệm nửa phần hosted: hơn 200 mô hình sau một endpoint tương thích OpenAI, giá niêm yết của nhà cung cấp được chuyển thẳng với mức markup bằng không, tự động chuyển đổi dự phòng giữa các nhà cung cấp, một DSL định tuyến để diễn đạt các phương án dự phòng, và tính năng hợp nhất mô hình để kết hợp nhiều mô hình vào một lời gọi. Cần nói chính xác về mô hình này — hiện tại chúng tôi không định tuyến GPT-Image-2.5; các tuyến hình ảnh OpenAI của chúng tôi là GPT-Image-2, GPT-Image-1.5 và GPT-Image-1-mini, tất cả đều theo giá niêm yết của OpenAI, và vào ngày một nhà cung cấp thượng nguồn thêm các định danh gpt-image-2.5, cùng một key đó sẽ gọi chúng mà không cần thay đổi mã. Chúng tôi cũng không định tuyến bất kỳ mô hình Qwen-Image nào ở bất kỳ phiên bản nào, nên Qwen-Image-2.1 hoàn toàn không phải là một tuyến ở phía chúng tôi. Điều mà mức giá chuyển thẳng mang lại cho bạn trong lúc này là khi OpenAI thay đổi một mức giá, con số ở phía chúng tôi cũng thay đổi theo chứ không bị trễ.
Phán quyết, được nêu như một điều kiện thay vì một người chiến thắng
Nếu đầu ra phải được bán, thì đây không phải là một lựa chọn sát nút: GPT-Image-2.5 là cái duy nhất trong hai cái mà bạn được cấp phép sử dụng, và đồng hồ đo token chính là cái giá phải trả cho điều đó. Nếu đầu ra là để nghiên cứu, công cụ nội bộ hoặc đánh giá, Qwen-Image-2.1 là công cụ mạnh hơn — 2K gốc, alpha xuất trực tiếp từ sampler, mười ảnh tham chiếu, và chi phí biên bằng không một khi phần cứng đã được trả tiền. Nếu bạn cần cả hai, hãy chạy cả hai, và coi giấy phép là ranh giới quyết định một công việc cụ thể sẽ đi vào pipeline nào.
Hai điều sẽ thay đổi cục diện này. Một bản điều khoản thương mại được công bố cho Qwen-Image-2.1 sẽ thu hẹp khoảng cách ở hàng giấy phép, vốn hiện đang gánh phần lớn trọng lượng trong so sánh này. Và một mục xếp hạng hình ảnh độc lập cho Qwen-Image-2.1 sẽ cho chúng ta biết liệu kết quả Qwen-Image-Bench của nhà cung cấp — 60,28, vượt Nano Banana 2.0 ở 59,82 và GPT Image 1.5 ở 59,65, đứng đầu trong số các mô hình mở — có đứng vững bên ngoài phòng thí nghiệm đã tạo ra nó hay không. Cả hai hiện đều chưa tồn tại. Cho đến khi chúng xuất hiện, khuyến nghị trung thực là hãy chọn dựa trên giấy phép và đồng hồ đo, chứ không phải trên bảng điểm.


