
Gemini Nano Banana 2.1 vs Qwen Image 3.0: Hòa ở 1K, chia rẽ ở 2K
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Đặt Gemini Nano Banana 2.1 và Qwen Image 3.0 lên bảng giá và con số đầu tiên thật buồn cười: một ảnh 1K từ mô hình hình ảnh Gemini mới nhất có giá $0.0336, còn một lần tạo 1K từ Qwen Image 3.0 trên Model Studio có giá $0.03438. Chênh nhau bảy phần trăm của một xu. Hai phòng thí nghiệm ở hai đầu thế giới, công bố bằng những loại tiền tệ khác nhau cho những nền tảng khác nhau, lại chốt cùng một mức giá cho thứ mà hầu hết mọi người thực sự mua. Thế hòa vỡ ngay khi bạn chuyển sang 2K — $0.0504 so với $0.0688, khoảng cách 36% nghiêng về phía Gemini — và nó lại vỡ theo cách khác khi bạn nhận ra rằng Qwen tính phí đầu vào hình ảnh và đầu vào chỉnh sửa như hai đồng hồ đo riêng biệt, còn Nano Banana 2.1 thì không. Sự thật nào trong hai sự thật đó quyết định bản build của bạn phụ thuộc hoàn toàn vào số lần pipeline của bạn chạm vào một hình ảnh trước khi nó xuất ra một hình ảnh.
Chúng cũng khác nhau nhiều hơn mức giá gợi ý. Nano Banana 2.1 chính thức ra mắt vào ngày 6 tháng 10 năm 2026 dưới dạng mô hình API được lưu trữ với thời hạn chuyển đổi 23 ngày gắn với phiên bản tiền nhiệm. Qwen Image 3.0 ra mắt trên nền tảng Qwen AI của Alibaba vào ngày 5 tháng 8 năm 2026 với các gói Standard và Pro và API cùng lúc, và tiếp cận các nhà phát triển quốc tế thông qua Qwen Cloud và Alibaba Cloud Model Studio. Một bên là mô hình của phòng thí nghiệm tiên phong phương Tây định giá theo token hình ảnh; bên kia là mô hình nền tảng Trung Quốc định giá theo hình ảnh, với ngân sách đồng thời được công bố và bảng giá trong nước và quốc tế không khớp với nhau.
Hai bảng giá, từng dòng một
Nano Banana 2.1 được tính phí theo token, với cách quy đổi theo từng ảnh được công bố đi kèm. Đầu ra là $30 mỗi triệu token hình ảnh, mà Google quy đổi thành $0,0336, $0,0504 và $0,0756 cho 1K, 2K và 4K, với số token mỗi ảnh được đưa ra là 1.120, 1.680 và 2.520. Đầu vào là $1,50 mỗi triệu token cho văn bản, hình ảnh và video. Đầu ra theo lô bằng một nửa: $0,0168, $0,0252 và $0,0378. Không có cách tính riêng cho việc đưa một hình ảnh trở lại đầu vào — hình ảnh bạn truyền làm đầu vào được tính theo mức token đầu vào, một lần.
Qwen Image 3.0 có hai hạng trên bảng giá đám mây Trung Quốc. Hạng Tiêu chuẩn là 0,18 RMB mỗi ảnh ở cả 1K và 2K, với đầu vào hình ảnh là 0,02 RMB và đầu vào chỉnh sửa là 0,02 RMB mỗi ảnh. Pro là 0,25 RMB ở 1K và 0,50 RMB ở 2K. Trên Qwen Cloud quốc tế, hạng Tiêu chuẩn có giá đầu vào $0,003 và đầu ra $0,03 mỗi ảnh. Trên Alibaba Cloud Model Studio bằng USD, các con số được công bố là $0,00275 mỗi 1K đầu vào, $0,03438 mỗi 1K tạo, $0,068761 mỗi 2K tạo, $0,04 mỗi 1K đầu ra và $0,075 mỗi 2K đầu ra. Thông lượng cũng được công bố: 10 yêu cầu đồng thời, hàng đợi bất đồng bộ 200 yêu cầu và 20 yêu cầu mỗi phút.
• Tạo ảnh 1K — Gemini Nano Banana 2.1 $0.0336; Qwen Image 3.0 Standard $0.03438 trên Model Studio. Thực chất là hòa nhau.
• Tạo 2K — Nano Banana 2.1 $0.0504; Qwen Image 3.0 Standard $0.068761. Google rẻ hơn 36%.
• 4K — Nano Banana 2.1 $0.0756 và đây là một hạng mục đã được ghi trong tài liệu; mục Model Studio của Qwen Image 3.0 giới hạn tổng số pixel ở mức 2048×2048, nên không có hàng 4K nào để so sánh.
• Đầu vào hình ảnh — Nano Banana 2.1 tính ở mức 1,50 đô la cho mỗi triệu đầu vào; Qwen Image 3.0 tính riêng ở mức 0,00275 đô la cho 1K đầu vào, với đầu vào chỉnh sửa được tính ở mức 0,02 nhân dân tệ trong nước.
• Batch — Nano Banana 2.1 giảm một nửa mọi thứ thông qua Batch API với thời gian xử lý lên tới 24 giờ; đòn bẩy đã được công bố của Qwen Image 3.0 là hàng đợi bất đồng bộ 200 chứ không phải một bậc chiết khấu.
• Thông lượng — Qwen Image 3.0 công bố 10 yêu cầu đồng thời, 200 trong hàng đợi, 20 RPM; Google không công bố bất kỳ thông số nào trong số này cho Nano Banana 2.1.
• Trong nước — Qwen Image 3.0 Standard có giá 0,18 RMB mỗi ảnh trên bảng giá Trung Quốc; Nano Banana 2.1 không có gói nội địa Trung Quốc vì Google không cung cấp gói đó.
Hai trong số những hàng đó quan trọng hơn phần còn lại. Hàng 4K là một khoảng cách về năng lực chứ không phải khoảng cách về giá — nếu bạn cần đầu ra 4K, thì mục Model Studio của Qwen Image 3.0 hoàn toàn không nằm trong cuộc thảo luận. Và hàng nhập hình ảnh là nơi hai triết lý tính phí khác biệt rõ rệt, điều này đáng có một phần riêng vì đó là phần không xuất hiện trong mức giá được quảng cáo.
Tại sao lượt thứ hai lại thay đổi phép tính
Tạo chỉ một lần là trường hợp dễ, và với chỉ một lần tạo thì hai lựa chọn này tương đương nhau về giá. Công việc hình ảnh thực tế hiếm khi chỉ diễn ra trong một lần. Một quy trình chỉnh sửa điển hình tạo ra một ứng viên, đưa một ảnh tham chiếu trở lại để hiệu chỉnh, đưa ảnh đã hiệu chỉnh trở lại lần nữa để chạy một lượt phong cách, và chỉ khi đó mới xuất ra. Mỗi lần trả về như vậy đều là một đầu vào hình ảnh.
Trên Nano Banana 2.1, đầu vào đó được tính theo mức giá đầu vào chung cùng với prompt văn bản, và khả năng chỉnh sửa hội thoại của mô hình được thiết kế rõ ràng cho việc này — chỉnh sửa nhiều lượt thông qua một tương tác trước đó là một tính năng đã được ghi nhận trong tài liệu, và chế độ thinking duy trì mạch hội thoại. Trên Qwen Image 3.0, cùng vòng lặp đó được tính trên một dòng riêng mà nhà cung cấp công bố: đầu vào hình ảnh ở mức $0.00275 mỗi 1K trên Model Studio, 0,02 RMB mỗi ảnh làm đầu vào chỉnh sửa trong nước. Cả hai đều không đắt tính theo mỗi lần gọi. Điểm khác biệt là cách tính của Qwen khiến chi phí lặp lại hiển thị rõ thành một mục riêng, trong khi cách tính của Google gộp nó vào token đầu vào, và một nhóm lập ngân sách dựa trên con số mỗi ảnh được nêu ở tiêu đề sẽ đánh giá thấp quy trình ba lượt trên cả hai nền tảng.
Cứ tính toán một cách thẳng thắn, và hướng dẫn thực tế thì nhàm chán nhưng có thật. Ở mức giá 1K, chúng giống nhau, nên giá không phải là lý do để chọn bên nào. Ở 2K, Nano Banana 2.1 rẻ hơn đáng kể tính trên mỗi lần tạo, và còn cung cấp thêm một bậc theo lô giúp giảm một nửa chi phí đó lần nữa. Nếu bạn cần 4K, không có gì để so sánh nữa. Nếu bạn cần một hạn mức đồng thời được công bố để có thể lập kế hoạch hàng đợi dựa trên đó, Qwen Image 3.0 có công bố một hạn mức như vậy còn Nano Banana 2.1 thì không. Đó là cục diện của quyết định: chủ yếu xoay quanh độ phân giải và mức bảo đảm thông lượng mà bạn cần, chứ không phải giá ở bậc mà ai cũng nhắc tới.
Cái gì được đo lường, và cho ai
Sự bất đối xứng về bằng chứng ở đây diễn ra ngược với điều bạn có thể mong đợi. Qwen Image 3.0 có một vị trí độc lập, còn Nano Banana 2.1, mới một ngày tuổi, thì không. Trên bảng xếp hạng text-to-image của Artificial Analysis, từ các mẫu được thu thập vào tháng 7 năm 2026, Qwen-Image-3.0 đứng ở Elo 1.077, vị trí thứ mười sáu trong 5.816 mẫu, và Qwen-Image-3.0-Pro ở 1.088, vị trí thứ mười bốn trong 6.077 mẫu — mức giữa bảng, được lấy mẫu đầy đủ, và nằm quanh nơi một mô hình nền tảng mạnh tầm cỡ đáp xuống chứ không phải một mô hình tiên phong. Tuyên bố khi ra mắt của chính Alibaba, rằng mô hình đã chiếm vị trí số một tại Trung Quốc trên bảng xếp hạng text-to-image của Arena.ai, là con số do nhà cung cấp báo cáo trên một bảng xếp hạng khác với nhóm người bình chọn khác; nó không mâu thuẫn với vị trí trên Artificial Analysis, nó chỉ đo lường một thứ khác.
Phần của Nano Banana 2.1 trong bảng cân đối này thì mỏng hơn. Không có Elo, không có số phiếu bầu và không có so sánh kết xuất từ bên thứ ba trong hồ sơ công khai tính đến ngày 7 tháng 10 năm 2026. Những gì hiện có là ngôn ngữ trong nhật ký thay đổi của Google — "cải thiện đáng kể" về chất lượng hình ảnh, độ tuân thủ lời nhắc, tính nhất quán nhân vật qua nhiều lượt và khả năng kết xuất văn bản — cùng những thay đổi tính năng đã được ghi lại: đầu ra 1K, 2K và 4K không có mức 512px, tối đa 14 ảnh tham chiếu được chia thành mười đối tượng và bốn nhân vật, chế độ suy nghĩ bật theo mặc định, và neo bằng Google Tìm kiếm Hình ảnh song song với tìm kiếm web. Nếu hôm nay bạn muốn so sánh chất lượng của hai mô hình này, thì bạn đang so sánh điểm số đo được ở mức trung bình của một mô hình với tuyên bố của nhà cung cấp về mô hình kia, và đó không phải là cùng một loại con số.

Nơi bạn có thể gọi từng người trong số họ
Cả hai mô hình đều không có trên OrcaRouter, và điều đó đáng nói thẳng ra thay vì ngụ ý điều ngược lại. Gemini Nano Banana 2.1 có sẵn qua API của chính nhà cung cấp và từ một số nền tảng bên thứ ba; Qwen Image 3.0 có sẵn qua nền tảng riêng của nó và một số nền tảng bên thứ ba. Danh mục của chúng tôi có các mô hình hình ảnh khác — của OpenAI openai/gpt-image-2 và google/gemini-3.1-flash-image-preview trong số đó — và tổng cộng 207 mô hình đằng sau một endpoint tương thích OpenAI.
Điều đó quan trọng đối với so sánh này vì một lý do cụ thể: cả hai nhà cung cấp này đều thay đổi con số của họ. Google đã thay đổi toàn bộ cấu trúc bậc giá của phiên bản tiền nhiệm của Nano Banana 2.1 và công bố ngừng hoạt động trong cùng một ngày; Alibaba công bố một bảng giá bằng USD cho nền tảng nội địa, một bảng thứ hai bằng USD cho Model Studio và một bộ số liệu thứ ba cho Qwen Cloud quốc tế. Khi giá của một nhà cung cấp là một mục tiêu luôn thay đổi, giá trị của việc mua qua một lớp mà chuyển nguyên giá niêm yết của nhà cung cấp với mức chênh lệch 0% là ở chỗ con số ở phía bạn thay đổi cùng ngày với con số ở phía họ, không có phần chênh lệch nào giữa bạn và con số đã công bố và không có hợp đồng riêng nào để đàm phán lại. Đó là nguyên tắc mà định tuyến của OrcaRouter được xây dựng dựa trên, và đó là lý do một so sánh bảng giá như thế này vẫn đúng sau một tháng thay vì bị lệch.

Thực sự nên chọn cái nào
Chọn Gemini Nano Banana 2.1 khi bạn cần đầu ra 4K, khi bạn muốn một gói theo lô giúp giảm một nửa chi phí trên mỗi ảnh cho các lượt xử lý nhiều ảnh tham chiếu, khi quy trình làm việc của bạn là chỉnh sửa dựa trên câu lệnh với tối đa 14 ảnh tham chiếu, hoặc khi bạn muốn có nền tảng Google Search ngay trong quá trình tạo. Hạn chót chuyển đổi của phiên bản tiền nhiệm là lý do để chuyển sang nó chứ không phải lý do để tránh nó, và mức giảm giá so với Nano Banana 2 là khoảng một nửa ở mọi độ phân giải. Những câu hỏi còn bỏ ngỏ là việc không có bất kỳ đo lường chất lượng độc lập nào và các giới hạn thông lượng chưa được công bố, đó là lý do vì sao một lộ trình sản xuất nên được chuẩn bị để chuyển đổi dự phòng thay vì giả định rằng điểm cuối sẽ trụ vững.
Chọn Qwen Image 3.0 khi đầu ra vẫn ở mức bằng hoặc dưới 2048×2048, khi ngân sách đồng thời được công bố trở nên quan trọng vì bạn đang xếp hàng công việc, khi bảng giá Trung Quốc ở mức 0,18 RMB mỗi ảnh là con số có ý nghĩa thương mại, hoặc khi mức giá cao hơn của gói Pro mang lại cho bạn điều gì đó mà đánh giá của bạn có thể chứng minh. Vị trí độc lập ở giữa bảng không phải là điểm yếu cho mục đích sử dụng này — đó là sự thật đơn lẻ đáng tin cậy nhất trong so sánh này, vì đây là con số duy nhất ở đây mà cả hai nhà cung cấp đều không tạo ra.
Nếu bạn có đủ điều kiện để tổ chức một cuộc so tài, hãy chạy nó trên đúng khía cạnh thực sự khác biệt: chỉnh sửa đa lượt. Hãy tạo một phương án, sau đó thực hiện ba lần chỉnh sửa liên tiếp trên mỗi mô hình, và tính tổng chi phí của ảnh được chấp nhận thay vì chi phí của lần render đầu tiên. Đó là phép so sánh mà bảng giá của cả hai nhà cung cấp đều không thực hiện thay bạn, và chính nó quyết định liệu một “thế hòa” ở 1K có thật sự là hòa hay không.

