一张生成的主视觉卡片,标题为 Qwen-Image-2.1 与 Gemini Omni 1.1 Flash 的对比,展示了一张标有 Qwen-Image-2.1 的卡片,带有一个画框图标和一个透明棋盘格,旁边是一张标有 Gemini Omni 1.1 Flash 的卡片,带有一个胶片条图标,配文为:一个返回文件,另一个返回视频片段。
Guides & Insights

Qwen-Image-2.1 对比 Gemini Omni 1.1 Flash:一个返回 PNG,另一个则不能

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

关于Qwen-Image-2.1Gemini Omni 1.1 Flash最有用的一点是:它们并不构成竞争。向 Gemini Omni 1.1 Flash 索要一张静态图像,你只会得到一个报错——厂商自家文档就把图像生成、图像编辑以及图文交错输出列为该模型不支持的能力。向 Qwen-Image-2.1 索要一段视频,你得到的是一张带 alpha 通道的 2048×2048 静态图。任何把它们放进两栏做对比的表格,都是在拿相机和投影仪作比较。真正的问题——那个真正烧钱的问题——是把二者串联起来会发生什么,以及这条链路能否扛得住价目表的考验。Qwen-Image-2.1 于 2026 年 9 月 20 日公开发布;Gemini Omni 1.1 Flash 自 2026 年 8 月 27 日起已全面可用。

每个模型实际返回的内容

这就是全部的比较,其余一切都由此而来。

输出格式 — Qwen-Image-2.1 返回一张静态图像,原生最高可达 2048×2048,40 个推理步数,并可选配真实的 Alpha 通道;Gemini Omni 1.1 Flash 返回视频,通过 10 秒生成与延长调用拼接而成,最长可达 40 秒,完全不具备静态图像模式。
透明度 — Qwen-Image-2.1 在 64 通道 RGBA 潜空间中进行去噪,因此 Alpha 通道直接由采样器输出;Gemini Omni 1.1 Flash 不支持透明背景输出,请求该功能会失败。
参考输入 — Qwen-Image-2.1 最多接受 10 张参考图像,用于多主体合成;Gemini Omni 1.1 Flash 每个提示词最多接受 10 张图像作为*输入*,以及最多三段 3 秒的参考视频片段。
分辨率上限 — Qwen-Image-2.1 原生为 2K;Gemini Omni 1.1 Flash 提供 360p、720p、1080p 和 4K,但 1080p 和 4K 是对原生 720p 渲染结果的放大,而非原生生成。
费用 — Qwen-Image-2.1 没有托管价格,因为它没有托管端点,所以成本就是你自己的 GPU 时间;Gemini Omni 1.1 Flash 在 720p 下按每秒 $0.10 计费,360p 草稿档约为每秒 $0.03。
许可 — Qwen-Image-2.1 依据日期为 2026 年 9 月 20 日的《Qwen 研究许可协议》发布,仅限非商业用途;Gemini Omni 1.1 Flash 是一项商业 API,其输出默认带有 SynthID 和 C2PA 溯源信息。

最后一行是人们一扫而过的那一行。一边是你可以下载却不能出售的模型。另一边是你可以不能下载却能自由出售的模型——每一帧都带有隐形水印。

为什么“versus”这种对立框架还是不断出现

把这两个名字放在一起搜索,你会找到一些把它们捉对排名的页面。原因在于,即便这种提法本身有误,其背后的问题却是真实的:这两个模型同处一条创作流程之中,而且都是其中最新的产物。人们真正想弄清楚的,是静态图像止于何处,动态影像又从何处开始。

Gemini Omni 1.1 Flash 在那个问题上凭借独立数据而非厂商数据赢得了一席之地。截至 2026 年 9 月 2 日,在 Artificial Analysis 上,它在无音频类别的文本转视频和图像转视频两个竞技场中都位居榜首,Elo 分别为 1324 和 1364。启用音频后,它降至 Elo 1237 和 1180——分别位列第二和第四。这种音频差距,正是规格表会隐藏、而排行榜会暴露的那类细节。

Qwen-Image-2.1 的证据更单薄,而且性质不同。厂商自家的 Qwen-Image-Bench 给它打出 60.28 分,领先于 Nano Banana 2.0 的 59.82 分和 GPT Image 1.5 的 59.65 分,并在开源模型中排名第一——但这是厂商自己运行的基准测试,且分差不到一分,也不是第三方复现。迄今为止的独立测试仅包括 GenAI Showdown 的一轮人工评分,为 7/15,较初代 Qwen-Image 的 4/15 有所提升,但落后于 Ideogram 4 的 8/15。在本文写作时,该模型在 Artificial Analysis 的图像排行榜上没有任何记录。不是低分——而是没有分数。

A generated two-column scoreboard titled Qwen-Image-2.1 vs Gemini Omni 1.1 Flash - the scoreboard. Left column Qwen-Image-2.1 rows: Output still image, 2048 x 2048; Transparency native RGBA; Reference input up to 10 images; Resolution native 2K; Price self-hosted only; Licence non-commercial research only. Right column Gemini Omni 1.1 Flash rows: Output video, up to 40 seconds; Transparency none; Reference input 10 images plus 3 clips; Resolution native 720p, upscaled; Price 0.10 dollars per second at 720p; Licence commercial, SynthID and C2PA. Footer: Qwen figures per the vendor model card, unaudited; Gemini figures per Google documentation and Artificial Analysis.A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.

交接,以及它真正要付出的代价

如果你要构建的东西既需要静态图又需要视频片段,那么流程只能是单向的:由 Qwen-Image-2.1 生成画面,再由 Gemini Omni 1.1 Flash 将其动画化。反向流程并不存在。

这笔账一旦算起来就毫不留情。在 Gemini Omni 1.1 Flash 上,一段 10 秒的 720p 片段计费约 $1.00。在 360p 草稿档位,同样的 10 秒大约 $0.30,而一段完整的 40 秒 720p 场景——一次生成加三次扩展调用——接近 $4.00。与此同时,作为整个生成起点的静帧,除了你自己显卡上的电费之外不花什么钱。也就是说,真正值得关心的成本决策不是“用哪个模型”,而是“生成多少条”。静帧可以免费反复迭代;视频不行。那些按成品资产而不是按尝试次数来给视频生成做预算的团队,正是会感到意外的人,因为第一帧免费,重试可不免费。

交接环节中也存在一个质量陷阱。Gemini Omni 1.1 Flash 原生以 720p 渲染,再上采样到 1080p 和 4K。如果你的静帧是一张带干净 alpha 通道的 2048×2048 Qwen-Image-2.1 画面,把它送进一条以 720p 渲染再上采样的视频流程,就会丢掉图像模型给你的大部分东西——而且 alpha 通道会被完全丢弃,因为不存在透明视频输出。透明度是在合成器里保住的,而不是在模型链里。把合成安排在片段返回之后,而不是之前。

路由层所处的位置

这对组合的别扭之处在于,两个模型都无法以你技术栈中其他组件那种方式访问。Gemini Omni 1.1 Flash 是厂商 API,有自己的密钥和自己的按秒计量。Qwen-Image-2.1 则是一个约 33 GB 的下载包——一个 7B 扩散 Transformer 加上一个 Qwen3-VL 8B 文本编码器——需要你自己部署,且其许可证仅允许非商业用途。两种计费模式,两条访问路径,同一个项目。

OrcaRouter 的存在,恰恰是为了覆盖周边这一层面:一个兼容 OpenAI 的端点,覆盖 200+ 模型,按供应商标价透传、零加价,跨供应商自动故障转移、用于组合回退的路由 DSL,以及用于面板式调用的模型融合。在这里把它的覆盖范围说清楚很重要。我们不路由任何版本的 Qwen-Image 模型,所以 Qwen-Image-2.1 在我们这边不是你能调用的路由——它只能跑在你自己的硬件上,否则就没有。我们也不路由 Gemini Omni 1.1 Flash。在动态影像方面,我们确实提供的是 Kling 的视频产品线,包括 kling-v3、kling-v3-omni 和 kling-video-o1,以及 MiniMax H3——因此这条流水线的动画部分拥有一条托管路由,无需再签第二家供应商的合同;而在图像方面,我们提供 OpenAI GPT-Image 系列、Google 的 Imagen 4 各档位和 Gemini 图像预览,以及 xAI 的 Grok Imagine 图像端点。由于标价是透传而非加价,其中任何一家供应商降价,这里当天即生效。

你到底需要哪一个?

你需要的是资产,而不是视频片段——Qwen-Image-2.1,原因就在于 alpha 通道。透明产品抠图、图标、精灵图和分层合成,正是输出 RGBA 的采样器能够省掉整条抠像流水线的场景。
你需要动态效果,而且需要它可衡量——Gemini Omni 1.1 Flash。它是两者中唯一在榜单上拥有独立竞技场结果且位居榜首的,也是唯一公布了可按秒计价、能让你写进预测的价格的。
你两者都需要——视频那一半要按每次尝试来预算,而不是按每个资产,也不要假定 alpha 通道能完整保留下来。
你需要把产出卖出去——Gemini Omni 1.1 Flash,而且只有 Gemini Omni 1.1 Flash,直到 Qwen 公布 Qwen-Image-2.1 的商业条款为止。目前,该许可还没有已公布的价格或条款清单。

坦率的总结是,那份给它们排名的对比本身就是错误的产物。接下来真正值得关注的是:Qwen 是否会给 Qwen-Image-2.1 附加商业条款,以及 Google 是否能在 Omni 榜单上弥合音频方面的差距——决定这条流水线哪一半能拿到预算的,是这两个事实,而不是又一份记分牌。

A screenshot of the Google Gemini API documentation models index, captured September 21 2026, showing the left navigation listing Nano Banana, Veo and Gemini Omni Flash under the models section, and the main panel opening with the Gemini 3 family of stable models.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新