为 Qwen-Image-2.1 与 Ideogram 4.5 的文章生成了主视觉卡片,标题为 Qwen-Image-2.1 vs Ideogram 4.5,副标题为“一个供你租用,一个你或许不能出售”,两个标签分别显示 Qwen Elo:1,034 和 1,074,以及 Ideogram Elo:1,014 和 1,064,页脚为“排名依据 Artificial Analysis,2026 年 9 月”,并将 OrcaRouter 标志合成在右下角
Guides & Insights

Qwen-Image-2.1 对比 Ideogram 4.5:一个只能租用,一个可能不得转售

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

无论是Qwen-Image-2.1还是Ideogram 4.5都同时出现在 Artificial Analysis 的两个图像榜单上,而在这两个榜单上,已发布、可下载的 Qwen-Image-2.1 都领先。文生图:1,034 Elo,排名第 18,而 Ideogram 4.5(High)为 1,014,排名第 34。图像编辑:1,074,排名第 18,而对方为 1,064,排名第 23。这在计分板上是一场完胜,却对大多数人真正关心的问题毫无用处,因为它拿一个可以按非商业研究许可下载的模型,去和一个可以按张租用、并能用于商业交付的模型作比较。阿里巴巴的 Qwen 团队于 2026 年 9 月 20 日发布了开放权重的 Qwen-Image-2.1;Ideogram 4.5 于 2026 年 9 月 30 日上线,是一个带有积分计量表的托管闭源模型。

Elo 排名栏不会告诉你的另一件事是:Ideogram 那一行所依据的票数只有 Qwen 的一半,而且随权重一起发布的其实是 Ideogram 自己的上一代。这两点都比那二十分的差距更重要。

样本减半,以及对比较的影响

先看票数,再看分数。在文生图方面,Qwen-Image-2.1 的那一行基于 5,286 次盲测对比,而 Ideogram 4.5(High)基于 2,247 次。在编辑方面,则是 5,536 对 2,382。在同样的榜单上,Ideogram 的各行大约只有 Qwen 的 40% 到 43% 那么大,而其中一部分原因只是时间——榜单在 Qwen 模型上多积累了十二天的投票。

置信区间说明了同样的问题。Ideogram 4.5 (High) 在文生图上带有 ±11 的 Elo 区间,在编辑上带有 ±11,而 Qwen-Image-2.1 分别为 ±10 和 ±9。而在编辑排行榜上,原始行足够接近,值得逐行说明:

• 文生图——Qwen-Image-2.1 为 1,034(区间 1,024 至 1,044),而 Ideogram 4.5(High)为 1,014(区间 1,003 至 1,025)。在仅刚好相接的区间上相差二十分。是方向性的,而非决定性的。

• 图像编辑 — Qwen-Image-2.1 为 1,074(1,065 至 1,083),对比 Ideogram 4.5(High)的 1,064(1,053 至 1,075)。相差十分,区间重叠约两个 Elo 分。这一项不过是披着排名外衣的掷硬币。

• 标签 — Qwen-Image-2.1 在两个榜单上都带有 Open Weights 标记。Ideogram 4.5 (High) 则两个都没有。

Screenshot of the Artificial Analysis text-to-image leaderboard, AA-Image-T2I v2.0, captured in English and cropped from the top row down through the Ideogram 4.5 row, showing GPT Image 2.5 Sunburst (max) first at 1,107 Elo from 14,023 samples, the Qwen-Image-2.1 row at rank 18 with 1,034 Elo from 5,286 samples, and the Ideogram 4.5 (High) row at rank 34 with 1,014 Elo from 2,247 samples

较旧的 Ideogram 才是带权重的那个

这个细节重新框定了整场对比。Ideogram 宣布计划发布 4.5 的开放权重,但尚未发布。如今可从 Ideogram 下载的是上一代,而它却被与新一代放在一起评分:

• Ideogram 4.0(Quality)—— 在文生图任务上获得 1,011 Elo,排名第 38,来自 12,176 次对比,并带有 Open Weights 标记。这比 Qwen-Image-2.1 低 23 Elo,而样本量是其两倍多。

• Ideogram 4.0 — 1,004 Elo,排名第 40,基于 10,921 次比较,开放权重标记。

• Ideogram 4.0 Fast(质量)和 Ideogram 4.0 Fast — 984 和 968 Elo,两者均标记为开放权重。

• Ideogram 4.0 Instant — 982 Elo,排名第64,同样开放权重。

所以,诚实的开放权重比较,并不是 Qwen-Image-2.1 与一个闭源托管模型对比。而是仅限研究许可证下的 Qwen-Image-2.1(1,034 分)与 Ideogram 4.0(Quality)(1,011 分)对比,后者受这些权重所附带的任意许可证约束——榜单上两个最强的可下载图像模型之间相差 23 分,而且是两个许可证问题,而不是一个。Ideogram 4.5 是更好的模型,而它正是你无法下载的那个。这就是这两行位于同一张表中的全部原因。

0.22美元能买到什么

Ideogram 4.5 的价格是一套阶梯,而不是一个数字,而榜单的价格栏取的是最高那一档。该服务提供四种渲染速度——Turbo、Balanced、Quality 和 High——按 Low、Medium、High 三档分别以每张图像 $0.03、$0.06 和 $0.22 计费,原生 2K 输出为 2,048 像素。Artificial Analysis 一栏记录的是每 1,000 张图像 $220.0,这正是 High 档,也与每张图像标称的 $0.22 相同。榜单引用的是该模型所提供的最昂贵配置,而不是一份典型的账单。

Qwen-Image-2.1 完全没有价格列——它的两行榜单条目都带有明确的无可用 API备注。你并不能从它那里买一张图。你要下载权重文件,在你自己付费的硬件上运行,然后把成本摊到你生成的图片数量上。在高生成量下,这通常比 $0.22 更便宜,而且总是更费功夫;在低生成量下则总是更不划算。这两种都是站得住脚的答案,而两者都不是按张计价的价格。

对于任何想获得托管那一半、又不想再签第二份合同的人来说,路由问题就落在这里。OrcaRouter 在一个兼容 OpenAI 的端点背后对接了 200 多个模型,按提供商标价原样透传、零加价,并在某个提供商性能下降时于各提供商之间自动故障切换,还配有路由 DSL,可把多个模型组合成一次调用。Qwen-Image-2.1 和 Ideogram 4.5 都不在其列——我们提供的图像线路是 Google 的 Imagen 各档位与 Gemini 图像预览版、xAI 的 Grok Imagine 图像端点,以及 OpenAI 的 GPT-Image 系列。如果当下的需求是一个可调用、具备商业许可的图像模型,那份清单就是答案,而上面的计分板并不是用来挑出它的工具。

董事会无法回答的问题

Generated comparison scoreboard for Qwen-Image-2.1 and Ideogram 4.5, listing editing Elo 1,074 against 1,064, editing samples 5,536 against 2,382, text-to-image Elo 1,034 against 1,014, text-to-image samples 5,286 against 2,247, and the closing pair Weights: downloadable with Licence: none for commercial use against Weights: never downloadable with Price: 220 dollars per 1,000 images

许可证是那个已有定论的维度,而它指向的方向与排名恰恰相反。Qwen-Image-2.1 依据 2026 年 9 月 20 日的《Qwen 研究许可协议》发布:仅限非商业用途,商业使用需向供应商另行申请许可。这与早先的 Qwen-Image 系列不同,后者以 Apache 2.0 发布,而阿里巴巴自家的 Hugging Face 仓库将该许可证标注为其他。两行榜单上的“开放权重”标记就可下载性而言是准确的,但对此却只字未提。

相比之下,Ideogram 4.5 是一项商业服务。你租用其输出,并拥有使用它的权利——积分计量就是为此而设——而你从不持有权重。如果交付物是包含图像功能的产品,那么这与“这里有一个文件,你不得将其生成的内容用于商业用途”相比,是截然不同的立场。

还有第三条路,两栏都没有展示,而它却是大多数团队最终会走的:内部工作和评估时运行可下载的模型,此时研究许可证不会挡道;而任何面向客户的东西,则租用托管版本。排行榜给了你偏爱每一种的理由,而偏爱 Qwen-Image-2.1 的理由,是它在仅限你自己笔记本电脑的许可证上拥有二十分的 Elo 优势。这并不是把它放进产品里的理由,而且任何记分牌都永远不会告诉你这一点。

值得关注的范围比看起来更窄。如果 Ideogram 发布它承诺的 4.5 权重,那么在 1,034 分上与 Qwen-Image-2.1 的开放权重对比就会变成一场真正的较量,而不是针对 Ideogram 4.0 的 23 分替代比较。在那之前,排名和许可证指向相反方向,而许可证才是能通过首次合同审查的那一个。