Qwen-Image-2.1-Turbo 主视觉卡,该模型是 Qwen-Image-2.1 的 8 步加速检查点,展示了随权重保存的 8 步调度、默认 CFG 为 1、前缀 KV 缓存复用,以及保持不变的 Qwen Research Licence
Engineering & Research

Qwen-Image-2.1-Turbo:一个将调度融入权重的 8 步检查点

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

仓库Qwen-Image-2.1-Turbo于 2026 年 10 月 9 日出现在 Hugging Face 上,而它最有趣的地方并不是步数。其中有 bfloat16 权重、一份带有可运行代码的模型卡、一个许可证文件、八张展示图片,以及 Qwen-Image-2.1 项目 GitHub 新闻列表中宣布此次发布的一行文字。它没有属于自己的博客文章,没有基准测试表,没有媒体宣传周期,而且 Qwen-Image-2.1 的分发条款也毫无变化。Turbo 是 Qwen-Image-2.1 的一个加速检查点,用于文本到图像生成和图像编辑,它只需八步去噪即可运行,而基础模型自带的示例使用的是四十步。它还悄无声息地改变了采样调度表的来源——而这正是会破坏代码的那部分。

仓库里实际有什么?

这张卡片简短且异常具体,因此很容易把已确认的内容与暗示的内容区分开来。

• 它是什么:模型卡片将 Qwen-Image-2.1-Turbo 描述为"Qwen-Image-2.1 的加速检查点,用于文本到图像生成和图像编辑,仅需 8 个去噪步骤"。它并非新架构,也不是新的模型系列。它仍是同一个 7B 视觉生成组件,只是围绕一条短得多的采样轨迹重新打包而成。

• 加载方式:通过 Diffusers 中的 QwenImage21Pipeline 加载,即基础模型所使用的同一个 pipeline 类,只是替换了 checkpoint 名称。该仓库自身的元数据声明了 base_model: Qwen/Qwen-Image-2.1 和 library_name: diffusers,并将 base_model:finetune:Qwen/Qwen-Image-2.1 作为第二个标签。这是厂商将其描述为基础 checkpoint 的微调版本,而非同级模型。

• 它保留了:相同的 7B 视觉生成架构、与 Qwen-Image-2.1 一致的七种分辨率预设(方形 2048 × 2048、4:3 为 2400 × 1792、3:4 为 1792 × 2400、3:2 为 2528 × 1696、2:3 为 1696 × 2528、16:9 为 2752 × 1536,以及 9:16 为 1536 × 2752),以及相同的两项能力——文生图生成与指令引导的图像编辑。该卡片的展示按类别组织:人像摄影、人体姿态与动态、透明 RGBA 生成、字体排印与海报设计、UI 与信息布局、单图变换、多参考合成,以及四图室内合成。

• 它没有包含的内容:任何评测数字。卡片上并没有 Turbo checkpoint 的 Qwen-Image-Bench 分数,也没有与 base 的对比。Qwen-Image-2.1 系列中出现的唯一分数仍然是 base 模型自身的 Qwen-Image-Bench 结果,而这是厂商报告的数字,是在 base checkpoint 上测得的——并非在此 checkpoint 上测得。

Screenshot of the Hugging Face model card for Qwen/Qwen-Image-2.1-Turbo, captured in English, showing the Text-to-Image, Diffusers, Safetensors and QwenImage21Pipeline tags, 25 likes, the qwen-research licence label, and the introduction text describing it as an accelerated checkpoint of Qwen-Image-2.1 for text-to-image generation and image editing with 8 denoising steps that loads directly with QwenImage21Pipeline in Diffusers

调度现在存在于权重之中,这才是真正的变化。

这是卡片上最重要的一句话,而它却被埋在安装说明下面:该检查点“包含其推荐的采样计划,因此无需手动配置调度器即可直接使用”。

随后,采样部分直白地说明了后果:“推荐的 8 步采样调度会随检查点一起保存并自动加载。仅设置 num_inference_steps 并不会覆盖它。”

把这一点读两遍。在大多数人脑海中沿用的 Diffusers 惯例里,步数是调用时传入的参数——你为基础模型传 num_inference_steps=40,为蒸馏检查点传 num_inference_steps=4,然后管线会据此构建对应的调度表。Qwen-Image-2.1-Turbo 打破了这个惯例。八步调度表是检查点的元数据,而不是请求参数。你传入一个不同的整数,管线仍然会使用已保存的调度表。模型卡上说,覆盖它的唯一方式是在调用时显式传入 sigmas 参数,并补充说其他调度表“尚未针对该检查点进行评估”。

实际后果就是一个复现陷阱。从 Qwen-Image-2.1 模型卡中照搬的代码,指向 Turbo 仓库后能够运行,不会报错,但也不会产出 Turbo 展示页所展示的结果。它还需要一个能理解由 pipeline 配置的采样 sigmas 的 Diffusers 版本——这一支持由 Diffusers PR #14950 加入,而在撰写本文时,它还存在于源代码树中,而非某个已打标签的发布版本里。官方给出的安装要求是一个兼容 CUDA 的 PyTorch 构建版本,加上 git+https://github.com/huggingface/diffusers.git、transformers>=5.17.0、accelerate 和 pillow。

还有两项默认值来自模型卡,而非你所设置的任何内容:生成默认使用 CFG 1,而前缀 KV 缓存“在去噪步骤间复用文本和参考图像上下文”。CFG 1 意味着没有无分类器引导过程,这在很大程度上正是轨迹得以缩短而不崩溃的原因——这也是模型卡不费心给出引导尺度建议的原因。前缀 KV 缓存是基座模型的继承:与 Qwen-Image-2.1 用来复用文本和参考图像上下文的机制相同;当去噪循环只有八次迭代时,这一点只会更重要,而非更不重要。

在更新日志中宣布,以仓库形式交付

对这次发布最贴切的定性既不是“上线”,也不是“泄露”。它是一件已入库的产物,在新闻列表里留下一行带日期的记录。Qwen-Image-2.1 项目在 GitHub 上的新闻列表中有两条日期为 2026.10.09 的条目:一条关于 Turbo 检查点,另一条指出 Qwen-Image-2.1 Pro 和 Turbo API“现已在 Alibaba Cloud Model Studio 正式上线”。并没有单独的 Turbo 博客文章;卡片上的博客链接指向 2026 年 9 月 20 日的 Qwen-Image-2.1 博客。

对比一下基础模型三周前的发布情况。Qwen-Image-2.1 的新闻列表里有一条标注日期的权重条目,随后同一天还有另外五条:通过 PR #14804 从第一天起支持 Diffusers、从第一天起原生支持 ComfyUI、支持 vLLM-Omni 并具备逐步执行、前缀 KV 缓存、FP8 量化以及张量并行、支持 SGLang 并带有 Cache-DiT 和 CUDA graphs,以及来自 LightX2V 的首日加速。Turbo 检查点完全没有这些。那些生态条目中的每一条指的都是 Qwen-Image-2.1。

Screenshot of the GitHub repository page for QwenLM/Qwen-Image-2.1, captured in English, showing the file listing with the README and LICENSE and the most recent commit message reading 'docs: announce Qwen-Image-2.1-Turbo and API availability' committed 27 minutes ago

仓库计数器讲述的是关于成熟度而非优劣的同一个故事,它们只是一张快照,而非最终定论:在撰写本文时,Qwen-Image-2.1 显示过去一个月有 122,311 次下载和 3,142 个点赞,而问世仅数小时的 Qwen-Image-2.1-Turbo 只有 33 个点赞。下载量是滞后指标,Turbo 的数字还会变化。它今天告诉你的,只是还没有人有时间运行它而已。

八个步骤没有告诉你的事

步数是发布说明中最显眼的数字,也是最没用的数字,原因有三,值得直言。

• 步数并不等于秒数。无论是模型卡还是代码仓库,都没有公布 Turbo checkpoint 的吞吐量、延迟或内存占用。在 7B bfloat16 模型上以 2048 × 2048 跑八步,与在更小的模型上跑八步是完全不同的工作负载;而且模型卡没有说明是在什么硬件上测得的,因为它根本没有报告任何测量结果。

• 目前尚不存在质量锚点。Turbo 没有已发布的评分,没有与基础检查点的并排对比,也没有针对两者的独立评估。展示图片是厂商在推荐设置下挑选出的输出。它们只能证明该模型能生成图像,却无法证明为了减少步数牺牲了多少质量,也无法替代基准测试。

• 缺少内存方面的指导。基础模型的卡片中包含一个内存优化部分;Turbo 卡片则记录了安装、生成、编辑、采样、宽高比以及停止条件。如果你打算将其部署上线,就要做好实测的准备。

Summary card for Qwen-Image-2.1-Turbo with two columns: the left column headed 'Stated in the repository' listing 8 denoising steps, schedule saved with the checkpoint, CFG 1 by default, prefix KV caching across steps, the same seven resolution presets and the Qwen Research Licence; the right column headed 'Not stated anywhere' listing no quality score for this checkpoint, no speed or memory figure and no day-zero framework support

许可证未变,这对任何发布产品的人来说都是最重要的信息

Qwen-Image-2.1-Turbo 依据 Qwen 研究许可协议进行授权。该仓库的元数据显示为 license: other,其中 license_name: qwen-research、license_link: LICENSE,并且仓库中存在一份与权重文件并列存放的 LICENSE 文件。模型卡自身的许可部分只写了一句话:该模型依据 Qwen 研究许可协议授权。

加速并不能改变这一点。基础模型上的非商业研究许可不会因为检查点更快就变成商业许可,而 Turbo 仓库也是按相同条款单独下载的。如果你对八步生成的兴趣在于它能让模型足够便宜,从而可以放进产品中,那么约束在于许可,而不是步数。这个问题必须问供应商;本仓库中没有任何地方对此作出回答。

托管路径,以及 OrcaRouter 在其中的位置

OrcaRouter 不路由 Qwen-Image-2.1-Turbo,也不路由 Qwen-Image-2.1。两者均未出现在我们的目录中,本文中的任何内容都不应被解读为提供这些模型服务的要约。如果你需要其中任何一个,途径是供应商自己的 API 以及若干第三方平台,或者直接使用模型权重,并搭配足够新的 Diffusers 构建,以加载 Turbo 检查点所保存的调度表。

我们主推的是托管图像产品线,值得了解它包含什么,这样你可以把它与自托管实验对照来看。 OrcaRouter 将 200 多个模型置于一个与 OpenAI 兼容的端点之后,按提供商目录价提供,零加价——因此,当供应商降价时,我们这边当天就能生效,而不必等待重新定价流程。 它增加了提供商服务劣化时的自动故障转移,一种用于表达请求可以使用哪些模型和提供商的路由 DSL,以及用于将多个模型组合成一次调用的模型融合。 我们路由的图像模型包括 OpenAI GPT-Image 系列、Google 的 Imagen 4 各档位(包括 fast 和 ultra 变体)、Google 的 Gemini 图像预览端点,以及 xAI Grok Imagine 图像端点。

决策的真实面貌是:如果你需要一个可以检查并修改的八步 7B 开放权重模型,Turbo 属于自托管工作,而许可证是首先要确定的事。如果你这周就需要生产环境中的图像端点,那是另一笔采购,而且正是我们出售的那一个。

可以说的,和不可以说的

• 已由仓库本身确认: Qwen-Image-2.1 的 7B 加速检查点,可在八个去噪步骤中执行文本到图像生成和图像编辑;一个不会被 num_inference_steps 覆盖的已保存采样计划;默认 CFG 为 1;用于文本和参考图像上下文的前缀 KV 缓存;与基础模型相同的七种分辨率预设;一条 QwenImage21Pipeline 加载路径;项目自身新闻列表中一条日期为 2026 年 10 月 9 日的发布条目;以及与基础模型相同的 Qwen Research License Agreement。

• 任何地方都未确立:针对 Turbo 检查点的任何质量测量、任何速度或内存测量、对其所衍生的基础检查点的任何独立评估、除研究许可之外的任何商业条款声明,以及 Qwen-Image-2.1 发布时自带的那种首日框架支持。

八个步骤是会被人引用的数字。迁入权重的调度,才是决定你第一次运行能否复现出任何结果的细节。