Thẻ hero ghi 'Qwen-Image-2.1 vs GPT Image 2' với phụ đề 'Tải miễn phí, hoặc thuê bản được xếp hạng' và ba hàng: Qwen-Image-2.1 tải xuống 33 GB phi thương mại, GPT Image 2 chỉ có API tính phí theo token, Độ trong suốt RGBA VAE so với một tham số yêu cầu, bên cạnh biểu tượng mũi tên tải xuống và đồng hồ đo.
Guides & Insights

Qwen-Image-2.1 so với GPT Image 2: Tải miễn phí, hay thuê bản tốt nhất

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Qwen-Image-2.1 là bản tải về 33 GB mà bạn có thể chạy miễn phí và không thể bán. GPT Image 2 là một API mà bạn hoàn toàn không thể tải về, tính phí theo token, đã đi vào sản xuất được bốn tháng và đang đứng đầu các bảng xếp hạng hình ảnh độc lập. Hai sự thật đó chính là toàn bộ sự đánh đổi, và phần thú vị nằm ở chỗ tính năng trong suốt — thứ khiến Qwen-Image-2.1 đáng để ngó tới ngay từ đầu — đã xuất hiện trên cả hai hệ thống trong vòng một tháng của nhau bằng những con đường hoàn toàn khác biệt. Qwen-Image-2.1 ra mắt ngày 20 tháng 9 năm 2026 với kênh alpha được tích hợp sẵn vào không gian tiềm ẩn. GPT Image 2 đã có thêm một background: "transparent" tham số vào ngày 20 tháng 8 năm 2026 dưới dạng cờ API.

Hai con đường dẫn đến cùng một tính năng

Đầu ra minh bạch là lý do khiến hầu hết mọi người cuối cùng so sánh hai thứ này, nên hãy bắt đầu từ đó, bởi vì các cách triển khai không tương đương và sự khác biệt đó quan trọng hơn cả đầu ra.

Độ trong suốt của Qwen-Image-2.1 mang tính kiến trúc. Một VAE RGBA 64 kênh với mức nén không gian 16× nghĩa là alpha là một phần của không gian latent mà mô hình khử nhiễu trong đó. Chính cơ chế này cho bạn khả năng tạo sinh có độ trong suốt, chỉnh sửa bên trong một hình ảnh vốn đã có độ trong suốt mà không làm dẹt nó, và trích xuất chủ thể từ một ảnh chụp RGB thông thường để trả về alpha thay vì mặt nạ nhị phân. Đó là một năng lực với ba công dụng, và cách diễn đạt của chính nhà cung cấp là không cần nút xóa nền, mô hình matting hay bước làm sạch viền riêng biệt nào.

Độ trong suốt của GPT Image 2 là một tham số yêu cầu. Thêm background: "transparent" cùng với output_format: "png" sẽ trả về một hình ảnh có kênh alpha thật, và nó hoạt động trên cả text-to-image, chỉnh sửa ảnh lẫn công cụ tạo ảnh trong Responses API. Inpainting dựa trên mặt nạ và nền trong suốt có thể được kết hợp với nhau. Nó ra mắt ở dạng Preview, nên hướng dẫn của chính OpenAI là kết quả có thể không ổn định — và việc chỉnh sửa với độ trong suốt được mô tả là vẽ lại hoặc xóa nền chứ không phải tách viền chính xác. Ít nhất hai nguồn thứ cấp khẳng định rằng tham số này không khả dụng và GPT Image 2 hoàn toàn không xuất ra độ trong suốt; những nguồn đó mâu thuẫn với các bài đưa tin về thông báo, các bản sao tài liệu API và thử nghiệm của bên thứ ba, nên hãy coi chúng là lỗi thời hoặc sai thay vì là một tín hiệu ngược lại. Độ trong suốt không làm thay đổi chi phí token — ở cùng một mức chất lượng và kích thước, ảnh trong suốt và ảnh đục tiêu tốn số token hình ảnh như nhau.

Vậy cả hai đều tạo ra alpha. Một cái làm điều đó vì mô hình được xây dựng theo cách đó; cái kia vì một tham số yêu cầu dịch vụ cung cấp nó. Cái nào tốt hơn phụ thuộc hoàn toàn vào việc alpha có phải tồn tại qua một vòng lặp chỉnh sửa hay không, và điều đó có thể kiểm chứng được trong một buổi chiều.

Lợi thế dẫn đầu của GPT Image 2 mang lại cho bạn điều gì

Bốn tháng vận hành trong môi trường thực tế không phải là một điểm tiếp thị, mà là một khoảng cách về độ chín muồi, và nó lộ ra ở những chỗ tưởng chừng nhàm chán nhưng lại mang tính quyết định.

Vị thế độc lập — GPT Image 2 đứng đầu các bảng xếp hạng hình ảnh độc lập và đã ở đó đủ lâu để điều đó trở thành một khẳng định ổn định chứ không phải chỉ là đợt tăng vọt trong tuần ra mắt. Qwen-Image-2.1 hoàn toàn vắng mặt trên các bảng đó vào thời điểm bài này được viết.
Các kiểu lỗi đã được ghi nhận — một mô hình đã được công chúng sử dụng trong bốn tháng có một tập hợp các ca lỗi đã biết để bạn đọc trước khi gặp phải chúng. Một mô hình mới ra mắt công khai ngày hôm qua thì chỉ có bảng điểm của nhà cung cấp và một bài kiểm thử tích hợp.
Bề mặt vận hành — giới hạn tốc độ theo bậc được biểu thị bằng cả token mỗi phút lẫn hình ảnh mỗi phút (từ 100.000 TPM và 5 IPM ở bậc khởi điểm lên đến 8.000.000 TPM và 250 IPM ở bậc cao nhất), cùng với hỗ trợ endpoint theo lô. Đó là khác biệt giữa một bản demo và một hàng đợi mà bạn có thể định cỡ.
Số liệu chất lượng từ bên thứ ba — vị trí trên bảng xếp hạng được đo lường độc lập. Con số duy nhất của Qwen-Image-2.1 là biểu đồ Qwen-Image-Bench của chính nhà cung cấp, nơi nó đạt 60,28 so với Nano Banana 2.0 ở 59,82 và GPT Image 1.5 ở 59,65. Tài liệu của nhà cung cấp, chưa được tái lập.

Điểm dữ liệu thực sự độc lập duy nhất về Qwen-Image-2.1 là phần xác minh chức năng được công bố cùng tích hợp SGLang: đầu ra PNG trong suốt đã đạt, alpha được giữ nguyên trên toàn bộ dải 0–255, PSNR RGBA đo được 60,69 dB trên một mẫu duy nhất, và các cấu hình FP8 đã vượt qua việc tạo PNG trong suốt. Các tác giả SGLang nói rõ rằng đây là một bước kiểm tra tính đúng đắn chứ không phải một bảo đảm chất lượng tổng quát. Đó là bằng chứng mạnh nhất hiện có cho thấy kênh alpha là thật. Nó không nói gì về việc liệu những bức ảnh có tốt hay không.

Hóa đơn, đã được xử lý xong

GPT Image 2 được tính phí theo token, nghĩa là chi phí của một tài nguyên phụ thuộc vào bậc chất lượng và độ phân giải theo cách mà mức giá theo từng ảnh che giấu. Mức giá niêm yết được công bố là $5.00 cho mỗi triệu token đầu vào văn bản, $8.00 cho mỗi triệu token đầu vào hình ảnh và $30.00 cho mỗi triệu token đầu ra hình ảnh, với mức giá cho token lưu trong bộ nhớ đệm lần lượt là $1.25 và $2.00. OpenAI không công bố bảng token đầu ra tĩnh cho mô hình này — bảng cũ hơn bao gồm số lượng token Thấp, Trung bình và Cao được đánh dấu rõ ràng là không áp dụng cho GPT Image 2 — vì vậy những con số dưới đây là các phép đo của bên thứ ba về giá niêm yết ở tỷ lệ khung hình 1:1, từ văn bản sang hình ảnh:

Đầu ra 1K — chất lượng thấp $0.0059, trung bình $0.053, cao $0.211 mỗi ảnh.
Đầu ra 2K — thấp $0.012, trung bình $0.107, cao $0.428.
Đầu ra 4K — thấp $0.020, trung bình $0.178, cao $0.712.

Mức chênh lệch giữa chất lượng thấp và chất lượng cao ở cùng một độ phân giải là khoảng ba mươi lăm lần. Đó mới là quyết định thực sự bên trong một pipeline GPT Image 2: không phải chọn mô hình nào, mà là bậc chất lượng nào vẫn trụ được qua khâu đánh giá với chi phí thấp nhất. Và nó tương tác với việc chỉnh sửa theo một cách khiến không ít người bị bất ngờ — input_fidelity không thể điều chỉnh trên mô hình này vì nó tự động xử lý mọi ảnh đầu vào ở độ trung thực cao, nên một yêu cầu chỉnh sửa kèm ảnh tham chiếu sẽ tiêu tốn nhiều token đầu vào hình ảnh hơn mức bạn ước tính từ kích thước đầu ra. Vì vậy, các vòng lặp tạo – kiểm tra – chỉnh sửa ở đây tốn kém hơn so với những gì các con số tính theo từng ảnh gợi ý.

Đổi lại, chi phí biên cho mỗi ảnh của Qwen-Image-2.1 chỉ là tiền điện. Vấn đề nằm ở chi phí cố định và giấy phép. Ba mươi ba gigabyte để tải về, một DiT khoảng 14 GB, phần còn lại dành cho bộ mã hóa văn bản Qwen3-VL 8B, khuyến nghị CPU offload trên các card hạn chế, và toàn bộ nằm dưới Qwen Research License Agreement ngày 20 tháng 9 năm 2026 — chỉ dùng cho mục đích phi thương mại, còn quyền thương mại phải thỏa thuận riêng và không có giá hay điều khoản nào được công bố cho các quyền đó.

A two-column board for Qwen-Image-2.1 and GPT Image 2 carrying both sides on one line per dimension: Weights, Licence, Transparency, Quality evidence, Pricing and Maturity. Footer separates vendor-reported figures from independently verified ones and notes that per-image API cost moves with quality tier and resolution.

Vị trí của tùy chọn lưu trữ trực tuyến

Có một con đường ở giữa giúp tránh được cả câu hỏi về GPU lẫn vấn đề giấy phép, và đó chính là con đường mà hầu hết các đội thực sự chọn. OrcaRouter định tuyến dòng GPT-Image của OpenAI song song với các bậc Imagen 4 của Google, các bản xem trước hình ảnh của Gemini và endpoint hình ảnh Grok Imagine của xAI — hơn 200 mô hình đằng sau một endpoint tương thích OpenAI, giá niêm yết của nhà cung cấp được chuyển nguyên không thêm markup, tự động chuyển đổi dự phòng giữa các nhà cung cấp, một DSL định tuyến, và tính năng hợp nhất mô hình. Bởi vì giá niêm yết được chuyển nguyên thay vì bị đánh thêm, nên việc nhà cung cấp giảm giá đối với bất kỳ mô hình nào được định tuyến sẽ có hiệu lực ngay trong cùng ngày, và bởi vì chuyển đổi dự phòng là tự động, một nhà cung cấp gặp trục trặc vào buổi chiều sẽ không trở thành sự cố gián đoạn của bạn. Qwen-Image-2.1 không nằm trong số các mô hình chúng tôi định tuyến và cũng không có bất kỳ phiên bản Qwen-Image nào khác — nó chỉ là một giải pháp chạy cục bộ — vì vậy đây không phải là lời quảng bá cho người mới. Đây là câu trả lời trung thực cho câu hỏi "tôi nên dùng gì trong khi đánh giá người mới này."

Decision card titled 'The tiebreak' with two panels: 'Download it - Qwen-Image-2.1', free to run and non-commercial with alpha that is part of the latent space, and 'Rent it - GPT Image 2', independently ranked with a per-image cost from about $0.006 to $0.71 depending on tier and resolution.

Quyết định, được trình bày một cách rõ ràng

Chọn GPT Image 2 nếu đầu ra là thương mại, nếu bạn cần một mức chất lượng tối thiểu được đo lường độc lập, nếu bạn muốn chi phí trên mỗi tài sản có thể dự báo và giới hạn, hoặc nếu bạn cần thứ đó hoạt động trong tuần này mà không phải mua phần cứng. Hãy chấp nhận rằng bạn đang thuê, rằng bạn không thể tinh chỉnh nó, rằng bạn không thể chạy nó ngoại tuyến, và rằng chi phí trên mỗi hình ảnh sẽ tăng tuyến tính theo khối lượng mãi mãi.

Chọn Qwen-Image-2.1 nếu đầu ra là nghiên cứu, đánh giá hoặc công việc cá nhân, nếu bạn đặc biệt muốn loại alpha tồn tại qua một vòng lặp chỉnh sửa thay vì alpha do một tham số tạo ra chỉ một lần, nếu bạn muốn đọc logic viết lại — các checkpoint PE-T2I và PE-I2I được phát hành là những mô hình Qwen3.5-VL 9B đã được tinh chỉnh với một system_prompt.txt có thể đọc được, điều mà bạn không thể có được từ bất kỳ API hình ảnh được lưu trữ nào — hoặc nếu bạn chỉ đơn giản muốn biết một mô hình hình ảnh trọng số mở 7B có thể làm được gì vào tháng 9 năm 2026 mà không phải trả tiền theo từng bức ảnh để tìm hiểu.

Đừng chọn cái nào trong hai, mà hãy chuyển nó đi nếu sản phẩm bàn giao mang tính thương mại và thời hạn là có thật. Đó không phải là cách né tránh; đó là phương án không đòi hỏi bạn phải giải quyết một câu hỏi về giấy phép mà bạn chưa thể có câu trả lời.

Screenshot of the OrcaRouter catalogue page for the openai/gpt-image-2 model, showing the model listing, the $8.00 per 1M token input and $30.00 per 1M token output pricing cards, and the LM Arena image-edit Elo figure quoted in the model description.