
Qwen-Image-2.1 与 Hy Image3.5:独立榜单对它们的排名顺序完全相反
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 223 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
将Qwen-Image-2.1与Hy Image3.5放在 Artificial Analysis 的两个图像榜单上正面比拼,而两个榜单对谁更胜一筹给出了不一致的答案。在文生图榜上,Qwen-Image-2.1 领先 Hy Image3.5 整整 59 Elo——1,034 对 975,排名第 18 对第 66。在图像编辑榜上,同样这两个模型位置互换:Hy Image3.5以 1,088 Elo 位列第 14,Qwen-Image-2.1则以 1,074 排名第 18。差距反向拉开到 14 分。这两个模型相隔两天公开——Qwen-Image-2.1 于 2026 年 9 月 20 日以开放权重发布,Hy Image3.5 于 2026 年 9 月 22 日进入公开预览——而这是两者首次在同一套评测标准上获得分数,也正是这一点让这处分歧值得细读,而不只是照搬转述。
最显而易见的做法,就是说编辑委员会太吵,然后翻篇。这只说对了一半。另一半是,这两行并不一样扎实,其中一行的价格并不是另一行的价格,而且这些模型中的一个拥有权重相关的权利,另一个则永远不会。
两个委员会,两套指令
Artificial Analysis 进行盲式两两比较——向两个模型发送相同的提示词,由投票者选出胜者,Elo 随之累积——并按任务分别发布榜单。文生图榜单包含 166 行;编辑榜单包含 97 行。两个模型在这两个榜单上的行都来自同一提供商的快照,因此这不是版本不匹配。
• 文生图 — Qwen-Image-2.1 的 Elo 为 1,034(区间 1,024 至 1,044),基于 5,286 次比较,在 166 个模型中位列第 18。Hy Image3.5 的 Elo 为 975(区间 966 至 984),基于 5,334 次比较,位列第 66(共 166 个)。两个区间并不重叠。在样本量相近的情况下,59 分的差距是真实的排序差异,而非四舍五入造成的假象。
• 图像编辑 — Hy Image3.5 以 1,088 Elo(区间 1,079 至 1,097)基于 5,550 次比较,在 97 个中排名第 14。Qwen-Image-2.1 以 1,074 Elo(区间 1,065 至 1,083)基于 5,536 次比较,在 97 个中排名第 18。这些区间在 1,079 至 1,083 的四点区间内重叠。这一排序只是方向性的,尚未确立。
• 两个榜单上的样本量都很接近——文生图上为 5,286 对 5,334,编辑上为 5,536 对 5,550——因此置信度的差异并不是某一个模型被投票不足的问题。
• 榜单对模型的标注方式不同,而这一点很重要:Qwen-Image-2.1 各行带有开放权重标记,Hy Image3.5 各行则没有。
所以,诚实的解读是不对称的。文生图:Qwen-Image-2.1 明显胜出。图像编辑:Hy Image3.5 可能领先,但领先幅度落在测量噪声之内。
不对称从何而来
Hy Image3.5 的编辑实力并不让人意外,只要看看腾讯为它配备了什么就明白了。该预览版公开发布时,每次请求最多支持五张参考图,在同一模型中同时提供文生图与图生图,以及多轮编辑——编辑能力在发布时被重点强调。Qwen-Image-2.1 构建于一套统一的生成与编辑技术栈之上,同样能处理参考图像,但其榜单行显示,编辑一侧的得分比阿里巴巴自家的 Qwen-Image-3.0-Pro 低两个 Elo,这一差距比发布时的宣传口径所暗示的更窄。
腾讯自己的说法也与榜单所示不符。该厂商称,这款预览版在盲评中对 Hy Image3.0 的胜率约为 30%。这一数字尚未被腾讯以外的任何人复现,而独立榜单在文生图上也未予以印证——Hy Image3.5 预览版为 975 分,以 20 Elo 之差落后于开放权重的 HunyuanImage 3.0 Instruct 的 995 分。而在图像编辑上,同样的对比则站在厂商一边:Hy Image3.5 预览版为 1,088 分,比 HunyuanImage 3.0 Instruct 的 1,066 分高出 22 Elo。腾讯自家产品的这一次换代,在一块榜单上进步了一代,在另一块榜单上却退了一步。

价格维度上,两者完全不可同日而语
Hy Image3.5 preview 是一款按量计费的 API。腾讯云在中国大陆端点对一张 2K 图片收费 ¥0.15,在国际端点收费 US$0.024,且仅对 API 实际返回的图片计费。Artificial Analysis 的价格列记录为每 1,000 张图片 $24.00,这与榜单所用单位下的数值相同——而相比文生图榜单首行对同样一千张图片所标的 $210.70,这还不到其价格的九分之一。
Qwen-Image-2.1 没有价格行,因为它没有端点。它的两行榜单条目都带有明确的无可用 API说明。你不购买这个模型;你下载它,并以 GPU 机时以及下文提到的许可问题为它付出代价。它两行上的 5,286 票和 5,536 票来自那些自己运行权重的人。这一事实也给排名带来一个值得保留的提醒:一个仅限自托管的模型的独立 Elo,衡量的是与任何人都能调用的模型的 Elo 不同的群体。
如果计划是把这两者中的任何一个放进产品里,那么实际的分工现在就很清楚了,而且这与价格所暗示的分工一致:编辑得分更高的那个模型是你租用的,而文生图得分更高的那个模型是你自己运行的。OrcaRouter 正是“租用”这一侧的答案——一个 API 覆盖 200+ 模型,按提供商标价零加价透传,跨提供商自动故障转移,以及一套路由 DSL,可将多个模型组合成一次调用。我们不路由 Hy Image3.5 preview 或 Qwen-Image-2.1;该平台上的图像产品线是 Google 的 Imagen 层级和 Gemini 图像预览、xAI 的 Grok Imagine 图像端点以及 OpenAI 的 GPT-Image 系列。单凭榜单上的一行成绩,这两者中的任何一个都不会从这份列表中成为首选,而这正是下面这个许可证问题能一锤定音的原因。
两块板都没有为其设置列的轴

Qwen-Image-2.1 依据《Qwen 研究许可协议》发布,该协议日期为 2026 年 9 月 20 日,仅授予非商业用途的权利,商业使用则需向供应商单独取得许可。正因如此,Hugging Face 仓库将该许可证报告为其他——它并非 OSI 许可证,也不应被当作 OSI 许可证来解读。两行榜单上的“开放权重”标记是准确的,且并未就这一点作出任何说明。
Hy Image3.5 preview 没有可授权的权重。Tencent 尚未发布它们;该预览版由 Tencent 自己的平台提供服务,且这一代没有可下载的发布版本。你能得到的是一份价目表、一个参考图数量上限,以及一项可随时启用和停止的服务。没有可审计的东西,没有可托管的东西,没有可协商的东西——如果 Tencent 更改价格或停用该预览版,你也什么都留不住。
真正能解决开放权重问题的比较对象,是腾讯自家的前代模型,而不是 Qwen 的模型。HunyuanImage 3.0 Instruct在两个榜单上都带有开放权重标记——图像编辑得分为 1,066,文生图得分为 995。Qwen-Image-2.1 在两项上都胜过它。因此,如果要求是“我可以下载并在自己的硬件上运行的权重”,那么在这场对决中最佳选择是阿里巴巴的模型,无论在哪一个榜单上,且其许可证仍然禁止出售输出结果。
这个问题不存在什么文书工作能自行解决的版本。你要么拿到更好的编辑得分,代价是没有权重、且按用量计费;要么拿到更好的文生图得分,代价是权重不得商用。选一个你能接受的约束,然后拿你自己的提示词把两者都测一遍——它们之间的编辑分差宽达四分,且落在相互重叠的区间内,而这样的差距,一组留出的提示词集就足以抹平。
