为“Gemini Nano Banana 2.1 vs Qwen Image 3.0”设计的主视觉标题卡,副标题为“1K 平局,2K 分胜负”。左侧卡片标题为“Gemini Nano Banana 2.1”,列出其 GA 日期、1K、2K 和 4K 价格,并注明其尚未获得竞技场评分;右侧卡片标题为“Qwen Image 3.0”,列出其发布日期、1K 和 2K 价格,并注明不提供 4K 及其竞技场 Elo 分,二者之间有一个小的“vs”分隔符。OrcaRouter 标志合成在右下角。
Guides & Insights

Gemini Nano Banana 2.1 与 Qwen Image 3.0:1K 打平,2K 出现分化

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

把 Gemini Nano Banana 2.1 和 Qwen Image 3.0 放到价目表上,第一个数字很有意思:来自最新 Gemini 图像模型的 1K 图像要 $0.0336,而 Qwen Image 3.0 在 Model Studio 上生成一张 1K 图像要 $0.03438。只差 0.07 美分。两家实验室位于世界两端,用不同货币、为不同平台发布定价,却对大多数人真正购买的东西得出了相同的价格。一旦升到 2K,这种持平就被打破——$0.0504 对 $0.0688,36% 的差距对 Gemini 有利——而当你注意到 Qwen 把图像输入和编辑输入作为独立计费项,而 Nano Banana 2.1 不这样时,它又会以另一种方式被打破。这两个事实中哪一个会决定你的构建方案,完全取决于你的流水线在交付一张图像之前要触碰它多少次。

它们之间的差异也比价格所显示的更大。Nano Banana 2.1 于 2026 年 10 月 6 日正式全面可用,作为托管式 API 模型,并为其前代设定了 23 天的迁移截止期限。Qwen Image 3.0 于 2026 年 8 月 5 日在阿里巴巴的 Qwen AI 平台上推出,同时提供 Standard 和 Pro 层级及 API,并通过 Qwen Cloud 和 Alibaba Cloud Model Studio 面向国际开发者。一个是按图像 token 计价的西方前沿实验室模型;另一个是按图像计价的中国平台模型,带有已公布的并发预算,以及一份国内和国际费率表,而两者彼此并不一致。

两份费率卡,逐行

Nano Banana 2.1 按词元计费,并同时公布每张图像的换算。输出为每百万图像词元 30 美元,Google 将其换算为:1K、2K 和 4K 分别为 0.0336 美元、0.0504 美元和 0.0756 美元,每张图像对应的词元数分别为 1,120、1,680 和 2,520。输入为每百万词元 1.50 美元,涵盖文本、图像和视频。批量输出减半:0.0168 美元、0.0252 美元和 0.0378 美元。将图像再次输入没有单独的计量项——你作为输入传入的图像按输入词元费率计费,只计一次。

Qwen Image 3.0 在中国云价目表中分为两档。标准版在 1K 和 2K 下均为每张图片人民币 0.18 元,图片输入为人民币 0.02 元,编辑输入为每张图片人民币 0.02 元。Pro 版 1K 为人民币 0.25 元,2K 为人民币 0.50 元。在 Qwen Cloud 国际站,标准版为每张图片输入 $0.003、输出 $0.03。在阿里云百炼(Alibaba Cloud Model Studio)以美元计价的公开数据为:1K 输入 $0.00275,1K 生成 $0.03438,2K 生成 $0.068761,1K 输出 $0.04,2K 输出 $0.075。吞吐量也已公布:10 个并发请求、200 个请求的异步队列,以及每分钟 20 个请求。

• 1K 生成 — Gemini Nano Banana 2.1 $0.0336;Qwen Image 3.0 Standard 在 Model Studio 上 $0.03438。实际上不相上下。

• 2K 生成 — Nano Banana 2.1 $0.0504;Qwen Image 3.0 Standard $0.068761。Google 便宜 36%。

• 4K — Nano Banana 2.1 为 $0.0756,且这是一个有文档记录的档位;Qwen Image 3.0 在 Model Studio 中的条目将总像素上限设为 2048×2048,因此没有可供对比的 4K 行。

• 图像输入 —— Nano Banana 2.1 按每百万输入 1.50 美元的费率计算;Qwen Image 3.0 则单独按每 1K 输入 0.00275 美元计量,其中编辑输入在国内按人民币 0.02 元收费。

• 批量处理 —— Nano Banana 2.1 通过 Batch API 将一切成本减半,周转时间最长可达 24 小时;Qwen Image 3.0 公开的调节手段是 200 的异步队列,而非折扣档位。

• 吞吐量 — Qwen Image 3.0 公布了 10 个并发、200 个排队、20 RPM;Google 对 Nano Banana 2.1 则未公布任何这些数据。

• 中国境内——按中国区价目表,Qwen Image 3.0 Standard 每张图片为 0.18 元人民币;Nano Banana 2.1 没有中国境内档位,因为 Google 并未提供。

其中两行比其余几行更关键。4K 那一行体现的是能力差距,而不是价格差距——如果你需要输出 4K,Qwen Image 3.0 的 Model Studio 版本根本不在讨论范围内。而图像输入那一行,正是两种计费理念出现明显分歧的地方,这值得单独用一节来讲,因为这部分不会体现在醒目的价格里。

为什么第二遍会改变计算方式

单次生成是简单情形,而在单次生成中,这两者在价格上没什么区别。真实的图像工作很少只做单次生成。典型的编辑工作流会先生成一个候选结果,再回传一张参考图来进行修正,然后把修正后的图像再次回传做风格处理,之后才会交付。每一次这样的回传都是一次图像输入。

在 Nano Banana 2.1 上,该输入与文本提示词一同按通用输入费率计费,而且该模型的对话式编辑正是为此设计的——通过先前交互进行多轮编辑是有文档记载的功能,思考模式会延续整个对话。在 Qwen Image 3.0 上,同样的循环则按厂商单独公布的一条专设计费项来计量:在 Model Studio 上,图像输入为每 1K $0.00275;在国内,作为编辑输入则为每张图 0.02 元人民币。单次调用两者都不算贵。区别在于,Qwen 的计费表让迭代成本作为独立的明细项变得可见,而 Google 的计费表则把它并入输入 token 之中;而依据每张图表面单价做预算的团队,会低估这两个平台上三遍工作流的实际成本。

认真算一算,实用建议虽然乏味,却很真实。在 1K 价位上,两者相同,所以价格不是选择任何一方的理由。在 2K 下,Nano Banana 2.1 每次生成都明显更便宜,并且还提供批量层级,可将价格再减半。如果你需要 4K,那就没什么可比较的。如果你需要一个已公布、可用于规划队列的并发预算,Qwen Image 3.0 公布了,而 Nano Banana 2.1 没有。这就是决策的轮廓:主要取决于你需要的分辨率和吞吐量保证,而不是大家都在引用的那个层级的价格。

衡量什么,为谁衡量?

这里的证据不对称性与你可能预期的方向相反。Qwen Image 3.0 有一个独立排名,而刚发布一天的 Nano Banana 2.1 没有。在 Artificial Analysis 的文生图排行榜上,基于 2026 年 7 月收集的样本,Qwen-Image-3.0 以 Elo 1,077 在 5,816 个样本中排第十六位,Qwen-Image-3.0-Pro 以 1,088 在 6,077 个样本中排第十四位——处于中游,样本充足,大致是一个强平台模型而非前沿模型的位置。阿里巴巴自己在发布时声称,该模型在 Arena.ai 的文生图排行榜上拿下了中国第一,这是厂商报告的数据,来自一个不同的榜单,且投票者群体不同;它并不与 Artificial Analysis 的排名相矛盾,只是衡量的是另一回事。

Nano Banana 2.1 这一边的账目要单薄得多。截至 2026 年 10 月 7 日,公开记录中既没有 Elo 评分,也没有投票数,更没有第三方渲染对比。存在的只是 Google 更新日志中的措辞——在视觉质量、提示词遵循度、多轮角色一致性和文字渲染方面有"显著改进"——以及有据可查的功能变更:提供 1K、2K 和 4K 输出,没有 512px 档位;最多支持 14 张参考图,分为十个物体和四个角色;思考模式默认开启;以及除网页搜索外还支持 Google 图片搜索接地。如果你今天想在质量上比较这两者,那是在拿一个模型实测出来的中游分数,去对比另一个模型厂商宣称的说法,而这两者根本不是同一类数字。

A two-column comparison scoreboard titled 'Gemini Nano Banana 2.1 vs Qwen Image 3.0 — the scoreboard', contrasting GA date, 1K/2K/4K image prices, maximum output resolution and arena placement for the two models, with a footer citing Google's pricing page, Alibaba Cloud Model Studio and Artificial Analysis. The OrcaRouter logo is composited in the bottom-right corner.

你可以在哪里给他们每个人打电话

这两个模型都没有上架 OrcaRouter,这一点值得直说,而不是含糊其辞地暗示别的。Gemini Nano Banana 2.1 可通过厂商自家的 API 以及多个第三方平台使用;Qwen Image 3.0 可通过其自有平台和多个第三方平台使用。我们的目录确实收录了其他图像模型——其中包括 OpenAI 的 openai/gpt-image-2 和 google/gemini-3.1-flash-image-preview——总计 207 个模型,全部由同一个 OpenAI 兼容端点提供接入。

这对本次比较之所以重要,有一个具体原因:这两家供应商都会调整自己的价格。谷歌在同一天既调整了 Nano Banana 2.1 前代产品的整个层级结构,又宣布了关停计划;阿里巴巴则发布了三套价格:面向国内平台以人民币计价的一份价目表、面向 Model Studio 以美元计价的第二份价目表,以及面向国际 Qwen Cloud 的第三组数字。当供应商的价格是移动靶时,通过一个以 0% 加价传递提供商标价的层来购买,其价值就在于:你这一侧的数字会在对方调整的同一天随之变化,你和公布价格之间没有加价,也没有另一份需要重新谈判的合同。这正是 OrcaRouter 路由所建立的纪律,也是像本文这样的价目表比较在一个月后仍然真实、而不会发生漂移的原因。

Screenshot of Alibaba Cloud Model Studio documentation, in English, captured October 7, 2026, listing the Qwen-Image model family: the qwen-image-3.0-pro entry marked Recommended, described as the Qwen image generation and editing 3.0 series supporting image-to-image and image editing with an output range from 912x512 to 2048x2048 in PNG format, above the qwen-image-2.0-pro, qwen-image-2.0, qwen-image-max and qwen-image-plus entries.

到底该选哪一个?

当需要 4K 输出时,当你想采用一个能将大批量参考图处理按单张图像成本减半的批量层级时,当工作流是基于提示词、最多使用 14 张参考图的编辑时,或者当你希望在生成过程中内置 Google 搜索接底时,就选择 Gemini Nano Banana 2.1。其前代产品的迁移截止日期是迁向它、而非回避它的理由,而相较 Nano Banana 2 的价格下调,在每种分辨率下都大约是减半。悬而未决的问题是缺乏任何独立的质量评测,以及未公布的吞吐量上限——正因如此,生产路径应当做好故障转移的准备,而不是假定该端点始终可用。

当输出保持在 2048×2048 或以下时,当你因排队处理工作而需要关注已公布的并发预算时,当每张图片 0.18 元人民币的中国价目表才是商业上相关的数字时,或者当 Pro 档更高的价格能为你带来你的评估可以证明的收益时,就选择 Qwen Image 3.0。中游的独立位次对这种用途来说并非弱点——它是这项比较中最可靠的单一事实,因为它是这里唯一一个两家供应商都没有给出的数字。

如果你有条件做一场对比测试,就把它放在真正有差异的维度上:多轮编辑。为每个模型生成一个候选结果,然后连续做三次修正,并计算最终被采用的图像的总成本,而不是首次渲染的成本。这是两家供应商的费率卡都不会替你做的比较,而正是这个比较决定了 1K 下的“平局”是否真的是平局。

Screenshot of Google's Gemini API pricing page, in English, captured October 7, 2026, showing the Gemini Nano Banana 2.1 row: model code gemini-nano-banana-2.1, described as an update to Nano Banana 2 built for high-efficiency image generation and conversational editing with improved visual quality, multi-turn character consistency, accurate text rendering and search-grounded generation across 1K, 2K and 4K resolutions, with output priced at $30.00 per 1M image tokens, equivalent to $0.0336 per 1K image, $0.0504 per 2K image and $0.0756 per 4K image, and the footnote that output images at 1K consume 1,120 tokens.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新