一张生成的主视觉卡片,标题为 Qwen-Image-2.1 对比 Nano Banana 2 Lite,展示了一个收据图标,其旁文字为每张图片 0.034 美元,紧挨着一个秒表图标,其旁文字为每次生成 4.74 秒,配文为便宜的那个按量计费,快的那个并非免费。
Guides & Insights

Qwen-Image-2.1 对比 Nano Banana 2 Lite:340 美元换一万张图片,还是 13 小时的 GPU

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

一万张 1024 像素图像,在 Nano Banana 2 Lite 上的成本约为 340 美元。一万张图像,在 Qwen-Image-2.1 上的成本大约是让一块 24 GB 的 GPU 运行十三个小时,外加一份禁止你出售其中任何一张的许可证。这就是一句话概括的取舍,也是这个系列中唯一一个两款模型真正在同一时刻做同一件事的对比。Qwen-Image-2.1 于 2026 年 9 月 20 日开放权重。Nano Banana 2 Lite——厂商的模型 ID 为 google/gemini-3.1-flash-lite-image,官方名称为 Gemini 3.1 Flash-Lite Image——于 2026 年 6 月 30 日发布,是 Nano Banana 系列中最便宜的静态图像生成器。

两位候选人,诚实标价

Nano Banana 2 Lite 生成一张 1K 图像大约需要四秒,比 Gemini 3.1 Flash Image 快约 2.7 倍,并按每张 1K 图像 0.034 美元的固定价格计费。这一数字背后的 Google token 费率为每 100 万输入 token 0.25 美元、每 100 万图像输出 token 30 美元,按 1K 计算约为 0.0336 美元;批量模式可将其减半至约 0.0168 美元。该服务没有免费层,且每份输出都带有不可见的 SynthID 水印。

Qwen-Image-2.1 没有价格,因为根本没有东西可买。它是一个约 33 GB 的下载包——由 7B、32 层的单流扩散 Transformer 搭配 Qwen3-VL 8B 文本编码器组成——由你自己部署运行。最接近价目表的东西,是 SGLang-Diffusion 实测的延迟数据:在 24 GB 的 RTX 4090 上使用 Cache-DiT 和 INT8 内核,去噪过程耗时 4.74 秒;在 RTX PRO 6000 Blackwell 上完成一次完整的 1024×1024、40 步生成需 8.23 秒,峰值占用 40.1 GiB;在单块 B200 上则为 2.748 秒。这些是包含上述组件在内的单请求延迟,而非吞吐量数据,因此请把“一万张图 13 小时”当作数量级参考,而不是基准测试结果。

把这两者放在一起对比,算出来的账并不是"340 美元对免费",而是 340 美元对十三个小时的显卡使用时间——这张卡要么你本来就拥有,要么是租来的——再加上搭建一套服务栈的工程时间。达到盈亏平衡的用量远低于大多数团队的预期——但前提是这张卡在当月剩下的时间里没有闲置,而且前提是所产生的输出是你被允许产出的。

三种工作负载,以及每种工作负载由哪个模型承担

单凭数量是错误的维度。工作类型能更快地决定它。

大批量屏幕端素材——社交平台裁切图、缩略图、A/B 变体。 Nano Banana 2 Lite 几乎在每一项指标上都胜出。每张图四秒,十四种宽高比(包括 1:4 和 8:1),统一单张定价、成本可精确预测到分,批量模式半价。这类工作负载完全不需要 alpha 或 2K,而当产出要交付时,带水印的商用许可正是你想要的。
印刷、大幅面合成,或任何你会大幅裁切的内容。 Qwen-Image-2.1,而且差距悬殊。原生 2048×2048、40 步采样,对手则被硬性限制在约 100 万像素,没有 2K 模式,没有超分辨率,也没有可提升的 API 参数——Google 会把 2K 和 4K 的工作导向 Nano Banana 2 或 Nano Banana Pro。如果你需要裁掉画面三分之一后仍能得到可用素材,Lite 做不到。
透明抠图、图标、精灵图、分层合成。 Qwen-Image-2.1。alpha 通道是采样器进行去噪的 64 通道 RGBA 潜空间的一个组成部分,因此无需分割步骤,也无需抠像步骤;该模型还能把普通照片中的主体提取到透明图层中。Nano Banana 2 Lite 没有文档记载的透明背景输出。
任何必须获得商业授权的内容。 Nano Banana 2 Lite,毫无保留。Qwen-Image-2.1 依据 2026 年 9 月 20 日发布的《Qwen 研究许可协议》发布,仅允许非商业研究与评估用途;商业部署需要从杭州通义实验室技术公司获得单独许可,而且目前没有公布的价格或条款清单。

那份清单里还该再加一行,而它不利于开源模型。Nano Banana 2 Lite 是有知识的——它的知识截止日期为 2025 年 1 月,并基于 Gemini 3.1 Flash Lite 主干构建了提示词遵循能力,具备强大的图像内文本渲染能力,包括中文、日文和韩文。Qwen-Image-2.1 在指令遵循方面的独立证据既少又混杂。一场由 AI 评审进行的竞技场对比将 Nano Banana 2 Lite 与某个 Qwen 图像模型放在一起较量——该条目并未锁定具体版本,因此应将其视为关于该系列的信号,而非特指 2.1——结果 Lite 在一些古怪的空间提示(“astronaut riding a horse”、“capybara taxi driver”)上获胜,并在文本渲染上获胜,其中 Qwen 的输出将万圣节邀请函标题渲染成了“Hallofarty Invitation”。Lite 自身有记录的弱项是小脸、精细文字细节、密集信息图以及复杂的蒙版编辑。在遵循奇怪指令方面,两个模型都没有可靠地更胜一筹;它们在不同地方出错。

A generated two-column scoreboard titled Qwen-Image-2.1 vs Nano Banana 2 Lite - the scoreboard. Left column Qwen-Image-2.1 rows: Speed 4.74 s denoise on an RTX 4090; Price self-hosted GPU time; Resolution 2048 x 2048 native; Transparency native RGBA; Reference images up to 10; Licence non-commercial research only. Right column Nano Banana 2 Lite rows: Speed about 4 s per 1K image; Price 0.034 dollars per 1K image; Resolution hard cap at 1K; Transparency not supported; Reference images one image for editing; Licence commercial, SynthID watermark. Footer: Qwen figures per the vendor model card and SGLang measurements, unaudited; Google figures per the vendor launch material.

参考图像问题,悬而未决

多图编辑是批量流水线不再能够用一个模型替代另一个模型的环节,也是公开信息相互矛盾的那一行。

Qwen-Image-2.1 最多可接受 10 张参考图像,并在此基础上支持虚拟试穿、多人合影和衣橱搭配。对于 Nano Banana 2 Lite,各方说法截然不同:一家供应商的模型页面称其支持最多 14 张参考图像,用于风格迁移和多参考编辑;而一篇对比文章的说法则相反——Lite 只能接受单张图像进行编辑,14 张参考图的能力属于完整版 Nano Banana 2,且最多支持五个人物加六个物体。鉴于存在冲突,稳妥的立场是:Lite 支持图像输入和多图合成,但其参考图容量是 Google 用来将其与 Nano Banana 2 区分开的差异化点。如果你的工作流依赖在一个系列中保持六个一致的角色,在围绕它设计架构之前,请先对照 Google 自己的模型卡核实这一限制。

这也是这些模型在更广泛意义上不再可以互换的地方。Google 将 Nano Banana 2 Lite 和 Gemini Omni Flash 定位为一对——静态图像模型与视频模型,专为串联而构建。Qwen-Image-2.1 没有对应的视频版本,它的动画技巧是一连串局部区域编辑组成的链式序列,构建出一个简单的逐帧循环,而不是一个视频模型。

路由层何处彰显其价值

这两个模型都不在 OrcaRouter 上。我们不路由任何版本的 Qwen-Image 模型,所以 Qwen-Image-2.1 只能自托管,别无他法。Nano Banana 2 Lite——即 gemini-3.1-flash-lite-image 这个标识符——同样不在我们的目录中;我们确实提供的 Google 图像路由有 google/gemini-3.1-flash-image-previewgoogle/gemini-2.5-flash-imagegoogle/gemini-3-pro-image-preview 以及三档 Imagen 4,此外还有 OpenAI 的 GPT-Image-2、GPT-Image-1.5 和 GPT-Image-1-mini,以及 xAI 的 Grok Imagine 图像端点。

这对混合流水线意味着什么,正是这次比较反复撞上的那件事:一项随资产而变的决策。海量资产走廉价的托管路由,透明抠图走你自己的卡,而托管侧的供应商调价当天就能落地,因为我们以零加价透传供应商的标价,而不是自己定价。再加上跨供应商的自动故障转移、用于组合回退的路由 DSL,以及面向面板式调用的模型融合,托管的那一半就不再是你必须按模型逐个管理的供应商关系——200+ 个模型,一个 OpenAI 兼容端点,一个密钥。自托管的那一半仍然是你自己的问题,而这正是在自有硬件上运行研究授权检查点所付出的诚实成本。

该选哪一个,以及会使其反转的条件

如果你要制作可商用的大批量屏幕素材,Nano Banana 2 Lite 就是答案,许可证问题也根本不会出现:每张图 0.034 美元,四秒,可预测,可销售。如果你需要 2K、原生透明背景或十张参考图,Qwen-Image-2.1 是两者中唯一具备其中任何一项的,而你为此付出的代价是硬件、工程时间,以及一个非商业许可证——这使它更像研究工具,而不是生产依赖。

一个事实就能弥合这个差距。一份公开的 Qwen-Image-2.1 商业条款清单——包含真正可签署的价格和条款——能把 13 小时的 GPU 任务变成一项可与 340 美元竞争的明细项,而到那时,分辨率和 alpha 优势就会开始赢得目前默认交给 Lite 的工作负载。在那样东西出现之前,分工很清晰:任何要交付的东西都用 Lite,任何只留在内部的东西都用 Qwen-Image-2.1,而后者还需要一套你自己维护的服务栈。

A screenshot of OrcaRouter's own model page for google/gemini-3.1-flash-image-preview, captured September 21 2026, showing the model title Nano Banana 2 (Gemini 3.1 Flash Image Preview), the Vision, JSON and Reasoning capability tags, the 2026-02-26 date, the generateContent endpoint and a $0.15 price.A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新