为 Qwen-Image-2.1 与 Hy Image3.5 对比文章生成的主视觉卡片,标题为 Qwen-Image-2.1 vs Hy Image3.5,副标题为“各榜单对二者的排名正好相反”,标签显示“图像编辑:Hy Image3.5 以 1,088 比 1,074 领先”以及“文生图:Qwen-Image-2.1 以 1,034 比 975 领先”,页脚为“两个模型的评分均依据 Artificial Analysis,2026 年 9 月”,并在右下角合成 OrcaRouter 标志
Guides & Insights

Qwen-Image-2.1 与 Hy Image3.5:独立榜单对它们的排名顺序完全相反

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

将Qwen-Image-2.1与Hy Image3.5放在 Artificial Analysis 的两个图像榜单上正面比拼,而两个榜单对谁更胜一筹给出了不一致的答案。在文生图榜上,Qwen-Image-2.1 领先 Hy Image3.5 整整 59 Elo——1,034 对 975,排名第 18 对第 66。在图像编辑榜上,同样这两个模型位置互换:Hy Image3.5以 1,088 Elo 位列第 14,Qwen-Image-2.1则以 1,074 排名第 18。差距反向拉开到 14 分。这两个模型相隔两天公开——Qwen-Image-2.1 于 2026 年 9 月 20 日以开放权重发布,Hy Image3.5 于 2026 年 9 月 22 日进入公开预览——而这是两者首次在同一套评测标准上获得分数,也正是这一点让这处分歧值得细读,而不只是照搬转述。

最显而易见的做法,就是说编辑委员会太吵,然后翻篇。这只说对了一半。另一半是,这两行并不一样扎实,其中一行的价格并不是另一行的价格,而且这些模型中的一个拥有权重相关的权利,另一个则永远不会。

两个委员会,两套指令

Artificial Analysis 进行盲式两两比较——向两个模型发送相同的提示词,由投票者选出胜者,Elo 随之累积——并按任务分别发布榜单。文生图榜单包含 166 行;编辑榜单包含 97 行。两个模型在这两个榜单上的行都来自同一提供商的快照,因此这不是版本不匹配。

• 文生图 — Qwen-Image-2.1 的 Elo 为 1,034(区间 1,024 至 1,044),基于 5,286 次比较,在 166 个模型中位列第 18。Hy Image3.5 的 Elo 为 975(区间 966 至 984),基于 5,334 次比较,位列第 66(共 166 个)。两个区间并不重叠。在样本量相近的情况下,59 分的差距是真实的排序差异,而非四舍五入造成的假象。

• 图像编辑 — Hy Image3.5 以 1,088 Elo(区间 1,079 至 1,097)基于 5,550 次比较,在 97 个中排名第 14。Qwen-Image-2.1 以 1,074 Elo(区间 1,065 至 1,083)基于 5,536 次比较,在 97 个中排名第 18。这些区间在 1,079 至 1,083 的四点区间内重叠。这一排序只是方向性的,尚未确立。

• 两个榜单上的样本量都很接近——文生图上为 5,286 对 5,334,编辑上为 5,536 对 5,550——因此置信度的差异并不是某一个模型被投票不足的问题。

• 榜单对模型的标注方式不同,而这一点很重要:Qwen-Image-2.1 各行带有开放权重标记,Hy Image3.5 各行则没有。

所以,诚实的解读是不对称的。文生图:Qwen-Image-2.1 明显胜出。图像编辑:Hy Image3.5 可能领先,但领先幅度落在测量噪声之内。

不对称从何而来

Hy Image3.5 的编辑实力并不让人意外,只要看看腾讯为它配备了什么就明白了。该预览版公开发布时,每次请求最多支持五张参考图,在同一模型中同时提供文生图与图生图,以及多轮编辑——编辑能力在发布时被重点强调。Qwen-Image-2.1 构建于一套统一的生成与编辑技术栈之上,同样能处理参考图像,但其榜单行显示,编辑一侧的得分比阿里巴巴自家的 Qwen-Image-3.0-Pro 低两个 Elo,这一差距比发布时的宣传口径所暗示的更窄。

腾讯自己的说法也与榜单所示不符。该厂商称,这款预览版在盲评中对 Hy Image3.0 的胜率约为 30%。这一数字尚未被腾讯以外的任何人复现,而独立榜单在文生图上也未予以印证——Hy Image3.5 预览版为 975 分,以 20 Elo 之差落后于开放权重的 HunyuanImage 3.0 Instruct 的 995 分。而在图像编辑上,同样的对比则站在厂商一边:Hy Image3.5 预览版为 1,088 分,比 HunyuanImage 3.0 Instruct 的 1,066 分高出 22 Elo。腾讯自家产品的这一次换代,在一块榜单上进步了一代,在另一块榜单上却退了一步。

Screenshot of the Artificial Analysis image editing leaderboard, AA-Image-Editing v2.0, captured in English and cropped from the top row down through the Ideogram 4.5 row, showing GPT Image 2.5 Sunburst (max) first at 1,182 Elo from 17,899 samples, the Hunyuanimage 3.5 (Preview) row at rank 14 with 1,088 Elo and 5,550 appearances, the Qwen-Image-2.1 row at rank 18 with 1,074 Elo and 5,536 appearances and a No API available note, and the Hunyuanimage 3.0 Instruct row at 1,066 with No API available

价格维度上,两者完全不可同日而语

Hy Image3.5 preview 是一款按量计费的 API。腾讯云在中国大陆端点对一张 2K 图片收费 ¥0.15,在国际端点收费 US$0.024,且仅对 API 实际返回的图片计费。Artificial Analysis 的价格列记录为每 1,000 张图片 $24.00,这与榜单所用单位下的数值相同——而相比文生图榜单首行对同样一千张图片所标的 $210.70,这还不到其价格的九分之一。

Qwen-Image-2.1 没有价格行,因为它没有端点。它的两行榜单条目都带有明确的无可用 API说明。你不购买这个模型;你下载它,并以 GPU 机时以及下文提到的许可问题为它付出代价。它两行上的 5,286 票和 5,536 票来自那些自己运行权重的人。这一事实也给排名带来一个值得保留的提醒:一个仅限自托管的模型的独立 Elo,衡量的是与任何人都能调用的模型的 Elo 不同的群体。

如果计划是把这两者中的任何一个放进产品里,那么实际的分工现在就很清楚了,而且这与价格所暗示的分工一致:编辑得分更高的那个模型是你租用的,而文生图得分更高的那个模型是你自己运行的。OrcaRouter 正是“租用”这一侧的答案——一个 API 覆盖 200+ 模型,按提供商标价零加价透传,跨提供商自动故障转移,以及一套路由 DSL,可将多个模型组合成一次调用。我们不路由 Hy Image3.5 preview 或 Qwen-Image-2.1;该平台上的图像产品线是 Google 的 Imagen 层级和 Gemini 图像预览、xAI 的 Grok Imagine 图像端点以及 OpenAI 的 GPT-Image 系列。单凭榜单上的一行成绩,这两者中的任何一个都不会从这份列表中成为首选,而这正是下面这个许可证问题能一锤定音的原因。

两块板都没有为其设置列的轴

Generated comparison scoreboard for Qwen-Image-2.1 and Hy Image3.5, listing editing Elo 1,074 against 1,088 with ranks 18 and 14, editing intervals 1,065 to 1,083 against 1,079 to 1,097, text-to-image Elo 1,034 against 975 with ranks 18 and 66, and the board labels Open Weights, no API for Qwen-Image-2.1 against no Open Weights and $24.00 per 1,000 images for Hy Image3.5

Qwen-Image-2.1 依据《Qwen 研究许可协议》发布,该协议日期为 2026 年 9 月 20 日,仅授予非商业用途的权利,商业使用则需向供应商单独取得许可。正因如此,Hugging Face 仓库将该许可证报告为其他——它并非 OSI 许可证,也不应被当作 OSI 许可证来解读。两行榜单上的“开放权重”标记是准确的,且并未就这一点作出任何说明。

Hy Image3.5 preview 没有可授权的权重。Tencent 尚未发布它们;该预览版由 Tencent 自己的平台提供服务,且这一代没有可下载的发布版本。你能得到的是一份价目表、一个参考图数量上限,以及一项可随时启用和停止的服务。没有可审计的东西,没有可托管的东西,没有可协商的东西——如果 Tencent 更改价格或停用该预览版,你也什么都留不住。

真正能解决开放权重问题的比较对象,是腾讯自家的前代模型,而不是 Qwen 的模型。HunyuanImage 3.0 Instruct在两个榜单上都带有开放权重标记——图像编辑得分为 1,066,文生图得分为 995。Qwen-Image-2.1 在两项上都胜过它。因此,如果要求是“我可以下载并在自己的硬件上运行的权重”,那么在这场对决中最佳选择是阿里巴巴的模型,无论在哪一个榜单上,且其许可证仍然禁止出售输出结果。

这个问题不存在什么文书工作能自行解决的版本。你要么拿到更好的编辑得分,代价是没有权重、且按用量计费;要么拿到更好的文生图得分,代价是权重不得商用。选一个你能接受的约束,然后拿你自己的提示词把两者都测一遍——它们之间的编辑分差宽达四分,且落在相互重叠的区间内,而这样的差距,一组留出的提示词集就足以抹平。