
Qwen-Image-2.1 vs Nano Banana 2 Lite: $340 cho mười nghìn hình ảnh, hoặc 13 giờ GPU
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Mười nghìn ảnh 1024 pixel trên Nano Banana 2 Lite tốn khoảng 340 đô la. Mười nghìn ảnh từ Qwen-Image-2.1 tốn khoảng mười ba giờ chạy trên một GPU 24 GB cùng một giấy phép cấm bạn bán bất kỳ ảnh nào trong số đó. Đó là toàn bộ sự đánh đổi gói gọn trong một dòng, và đây là phép so sánh duy nhất trong họ mô hình này mà hai mô hình thực sự làm cùng một việc vào cùng một thời điểm. Qwen-Image-2.1 đã mở trọng số vào ngày 20 tháng 9 năm 2026. Nano Banana 2 Lite — mã mô hình của nhà cung cấp là google/gemini-3.1-flash-lite-image, tên chính thức là Gemini 3.1 Flash-Lite Image — ra mắt ngày 30 tháng 6 năm 2026 và là trình tạo ảnh tĩnh rẻ nhất trong dòng Nano Banana.
Hai ứng viên, được định giá một cách trung thực
Nano Banana 2 Lite tạo một hình ảnh 1K trong khoảng bốn giây, nhanh hơn Gemini 3.1 Flash Image khoảng 2,7 lần và tính mức giá cố định 0,034 USD cho mỗi hình ảnh 1K. Mức giá token của Google đằng sau con số đó là 0,25 USD cho mỗi 1 triệu token đầu vào và 30 USD cho mỗi 1 triệu token đầu ra hình ảnh, tức khoảng 0,0336 USD ở 1K; chế độ batch giảm một nửa xuống còn khoảng 0,0168 USD. Không có gói miễn phí, và mọi kết quả đầu ra đều mang một hình mờ SynthID vô hình.
Qwen-Image-2.1 không có giá, bởi vì chẳng có gì để mua. Đây là một bản tải xuống nặng khoảng 33 GB — một transformer khuếch tán luồng đơn 7B, 32 lớp, đi kèm bộ mã hóa văn bản Qwen3-VL 8B — mà bạn tự vận hành lấy. Thứ gần giống với một bảng giá nhất chính là độ trễ đo được của SGLang-Diffusion: 4,74 giây cho lượt khử nhiễu trên một chiếc RTX 4090 24 GB dùng Cache-DiT và các kernel INT8, 8,23 giây cho một lần sinh ảnh đầy đủ 1024×1024 với 40 bước trên RTX PRO 6000 Blackwell với mức tiêu thụ đỉnh 40,1 GiB, và 2,748 giây trên một chiếc B200. Đó là độ trễ cho một yêu cầu đơn lẻ, bao gồm các thành phần đã nêu, chứ không phải số liệu thông lượng, nên hãy coi con số 13 giờ cho một vạn bức ảnh như một bậc độ lớn ước chừng chứ không phải một phép đo chuẩn.
Đặt chúng cạnh nhau và bài toán không phải là “$340 so với miễn phí”. Đó là $340 so với mười ba giờ của một chiếc card mà bạn hoặc đã sở hữu hoặc đi thuê, cộng với thời gian kỹ thuật để dựng lên một serving stack. Khối lượng hòa vốn thấp hơn nhiều so với mức mà hầu hết các nhóm giả định — nhưng chỉ khi chiếc card không nằm không trong phần còn lại của tháng, và chỉ khi đầu ra là thứ mà bạn được phép tạo ra.
Ba khối lượng công việc, và mô hình nào đảm nhiệm từng loại
Khối lượng tự nó là một trục sai. Loại công việc quyết định điều đó nhanh hơn.
• Tài nguyên trên màn hình khối lượng lớn — ảnh cắt cho mạng xã hội, hình thu nhỏ, biến thể A/B. Nano Banana 2 Lite thắng ở gần như mọi thành phần. Bốn giây mỗi ảnh, mười bốn tỷ lệ khung hình bao gồm 1:4 và 8:1, giá cố định mỗi ảnh mà bạn có thể dự đoán đến từng xu, chế độ hàng loạt chỉ bằng một nửa. Không có gì trong khối lượng công việc này cần alpha hay 2K, và giấy phép thương mại có hình mờ chính xác là thứ bạn muốn khi đầu ra được phát hành.
• In ấn, tổng hợp khổ lớn, hoặc bất cứ thứ gì bạn sẽ cắt mạnh. Qwen-Image-2.1, và khoảng cách không hề nhỏ. Độ phân giải gốc 2048×2048 ở 40 bước so với một mô hình bị giới hạn cứng ở khoảng 1 megapixel, không có chế độ 2K, không có nâng cấp độ phân giải, và không có tham số API nào để tăng lên — Google hướng công việc 2K và 4K sang Nano Banana 2 hoặc Nano Banana Pro thay vào đó. Nếu bạn cần cắt bỏ một phần ba khung hình mà vẫn có tài nguyên dùng được, Lite không thể giúp bạn làm điều đó.
• Ảnh cắt trong suốt, biểu tượng, sprite, tổng hợp nhiều lớp. Qwen-Image-2.1. Kênh alpha là một thành phần của không gian tiềm ẩn RGBA 64 kênh mà bộ lấy mẫu khử nhiễu bên trong, nên không có lượt phân đoạn và không có lượt tách nền; mô hình cũng có thể tách chủ thể ra khỏi một bức ảnh thông thường thành một lớp trong suốt. Nano Banana 2 Lite không có đầu ra nền trong suốt được tài liệu hóa.
• Bất cứ thứ gì phải được cấp phép thương mại. Nano Banana 2 Lite, không cần phải bàn cãi. Qwen-Image-2.1 được phát hành theo Thỏa thuận Giấy phép Nghiên cứu Qwen ngày 20 tháng 9 năm 2026 và chỉ cho phép nghiên cứu, đánh giá phi thương mại; triển khai thương mại yêu cầu giấy phép riêng từ Hangzhou Tongyi Laboratory Technology, và không có bảng giá hay điều khoản nào được công bố cho việc đó.
Một hàng nữa thuộc về danh sách đó, và nó đi ngược lại mô hình mở. Nano Banana 2 Lite biết nhiều thứ — nó được phát hành với mốc kiến thức tháng 1 năm 2025 và một hồ sơ tuân thủ lời nhắc được xây dựng trên nền tảng Gemini 3.1 Flash Lite, với khả năng kết xuất văn bản trong ảnh mạnh mẽ bao gồm tiếng Trung, tiếng Nhật và tiếng Hàn. Bằng chứng độc lập của Qwen-Image-2.1 về việc tuân theo chỉ dẫn còn mỏng và trái chiều. Một so sánh đấu trường do AI giám khảo chấm, đối đầu Nano Banana 2 Lite với một mô hình hình ảnh Qwen — mục này không ghim phiên bản, nên hãy đọc nó như một tín hiệu về dòng sản phẩm chứ không phải riêng về 2.1 — đã cho Lite thắng ở các lời nhắc không gian kỳ lạ ("phi hành gia cưỡi ngựa", "tài xế taxi capybara") và ở kết xuất văn bản, nơi đầu ra của Qwen kết xuất tiêu đề thiệp mời Halloween thành "Hallofarty Invitation". Những điểm yếu được ghi nhận của chính Lite là khuôn mặt nhỏ, chi tiết chữ nhỏ, đồ họa thông tin dày đặc và các chỉnh sửa có mặt nạ phức tạp. Không mô hình nào thực sự tốt hơn một cách đáng tin cậy trong việc tuân theo một chỉ dẫn kỳ lạ; chúng thất bại ở những chỗ khác nhau.

Câu hỏi về hình ảnh tham chiếu, vẫn chưa ngã ngũ
Chỉnh sửa đa ảnh là điểm mà tại đó một pipeline khối lượng không còn có thể thay thế mô hình này bằng mô hình kia, và đó cũng là hàng mà thông tin công khai mâu thuẫn.
Qwen-Image-2.1 chấp nhận tối đa 10 hình ảnh tham chiếu, đồng thời hỗ trợ thêm tính năng thử đồ ảo, ảnh chân dung nhóm và phối tủ đồ. Với Nano Banana 2 Lite, các nguồn tin mâu thuẫn gay gắt: trang mô hình của một nhà cung cấp nêu rằng hỗ trợ tối đa 14 ảnh tham chiếu cho chuyển đổi phong cách và chỉnh sửa đa tham chiếu, trong khi một bài so sánh lại nói ngược lại — rằng Lite chỉ nhận một ảnh để chỉnh sửa, và khả năng 14 tham chiếu thuộc về Nano Banana 2 đầy đủ, với tối đa năm người cộng sáu đồ vật. Trước mâu thuẫn này, lập trường có thể bảo vệ là Lite hỗ trợ đầu vào hình ảnh và ghép nhiều hình ảnh, nhưng dung lượng tham chiếu của nó chính là điểm khác biệt mà Google dùng để tách nó khỏi Nano Banana 2. Nếu quy trình của bạn phụ thuộc vào sáu nhân vật nhất quán xuyên suốt một loạt, hãy xác minh giới hạn này dựa trên thẻ mô hình của chính Google trước khi bạn thiết kế hệ thống quanh nó.
Đây cũng chính là điểm mà, theo nghĩa rộng hơn, các mô hình không còn có thể thay thế cho nhau nữa. Google định vị Nano Banana 2 Lite và Gemini Omni Flash như một cặp — mô hình ảnh tĩnh và mô hình video, được xây dựng để nối tiếp nhau. Qwen-Image-2.1 không có phiên bản video tương ứng, và chiêu tạo hoạt ảnh của nó chỉ là một chuỗi chỉnh sửa vùng cục bộ được nối tiếp nhau để dựng nên một vòng lặp từng khung hình đơn giản, chứ không phải một mô hình video.
Nơi một lớp định tuyến khẳng định được chỗ đứng của nó
Không mô hình nào trong hai mô hình này có trên OrcaRouter. Chúng tôi không định tuyến bất kỳ mô hình Qwen-Image nào thuộc bất kỳ phiên bản nào, vì vậy Qwen-Image-2.1 chỉ có thể tự lưu trữ hoặc không có gì. Nano Banana 2 Lite — định danh gemini-3.1-flash-lite-image — cũng không có trong danh mục của chúng tôi; các tuyến hình ảnh Google mà chúng tôi cung cấp là google/gemini-3.1-flash-image-preview, google/gemini-2.5-flash-image, google/gemini-3-pro-image-preview cùng ba hạng của Imagen 4, cộng với GPT-Image-2, GPT-Image-1.5 và GPT-Image-1-mini của OpenAI, và endpoint hình ảnh Grok Imagine của xAI.
Điều đó mang lại cho một pipeline hỗn hợp chính là điều mà so sánh này liên tục gặp phải: một quyết định thay đổi theo từng tài nguyên. Các tài nguyên khối lượng lớn đi vào một tuyến hosted rẻ, các cutout trong suốt chạy trên card của riêng bạn, và một thay đổi giá từ nhà cung cấp ở phía hosted được áp dụng ngay trong ngày vì chúng tôi chuyển tiếp giá niêm yết của nhà cung cấp với mức markup bằng 0 thay vì tự định giá. Thêm chuyển đổi dự phòng tự động giữa các nhà cung cấp, một DSL định tuyến để kết hợp các phương án dự phòng, và hợp nhất mô hình cho các lệnh gọi kiểu panel, và nửa hosted không còn là mối quan hệ nhà cung cấp mà bạn phải quản lý theo từng mô hình — hơn 200 mô hình, một endpoint tương thích OpenAI, một khóa. Nửa tự vận hành vẫn là vấn đề của bạn, đó là chi phí trung thực của việc chạy một checkpoint được cấp phép nghiên cứu trên phần cứng bạn sở hữu.
Chọn cái nào, và điều kiện khiến nó đảo chiều
Nếu bạn đang sản xuất tài nguyên hiển thị trên màn hình với khối lượng lớn cho mục đích thương mại, Nano Banana 2 Lite chính là câu trả lời và câu hỏi về giấy phép không hề phát sinh: $0.034 một ảnh, bốn giây, có thể dự báo được, có thể bán được. Nếu bạn cần 2K, độ trong suốt gốc, hoặc mười ảnh tham chiếu, Qwen-Image-2.1 là lựa chọn duy nhất trong hai cái có bất kỳ thứ nào trong số đó, và bạn phải trả giá cho điều đó bằng phần cứng, thời gian kỹ thuật, cùng một giấy phép phi thương mại khiến nó trở thành công cụ nghiên cứu thay vì một thành phần phụ thuộc trong môi trường sản xuất.
Chỉ cần một dữ kiện là đủ để xoá sổ khoảng cách đó. Một bản điều khoản thương mại được công bố cho Qwen-Image-2.1 — kèm mức giá và các điều khoản mà người ta thực sự có thể ký — sẽ biến một job GPU 13 giờ thành một mục chi phí cạnh tranh được với mức 340 đô, và đến lúc đó, những lợi thế về độ phân giải và alpha bắt đầu giành được các workload mà hiện nay mặc định thuộc về Lite. Chừng nào điều đó còn chưa tồn tại, sự phân chia vẫn rạch ròi: Lite cho mọi thứ được đưa ra sản xuất, Qwen-Image-2.1 cho mọi thứ chỉ ở lại trong nội bộ, cùng một serving stack cho cái thứ hai mà bạn phải tự vận hành.


So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
