
Qwen-Image-2.1-Turbo:一个将调度融入权重的 8 步检查点
- Orca新Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 每百万 tokens · 69 tok/s
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 367 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
仓库Qwen-Image-2.1-Turbo于 2026 年 10 月 9 日出现在 Hugging Face 上,而它最有趣的地方并不是步数。其中有 bfloat16 权重、一份带有可运行代码的模型卡、一个许可证文件、八张展示图片,以及 Qwen-Image-2.1 项目 GitHub 新闻列表中宣布此次发布的一行文字。它没有属于自己的博客文章,没有基准测试表,没有媒体宣传周期,而且 Qwen-Image-2.1 的分发条款也毫无变化。Turbo 是 Qwen-Image-2.1 的一个加速检查点,用于文本到图像生成和图像编辑,它只需八步去噪即可运行,而基础模型自带的示例使用的是四十步。它还悄无声息地改变了采样调度表的来源——而这正是会破坏代码的那部分。
仓库里实际有什么?
这张卡片简短且异常具体,因此很容易把已确认的内容与暗示的内容区分开来。
• 它是什么:模型卡片将 Qwen-Image-2.1-Turbo 描述为"Qwen-Image-2.1 的加速检查点,用于文本到图像生成和图像编辑,仅需 8 个去噪步骤"。它并非新架构,也不是新的模型系列。它仍是同一个 7B 视觉生成组件,只是围绕一条短得多的采样轨迹重新打包而成。
• 加载方式:通过 Diffusers 中的 QwenImage21Pipeline 加载,即基础模型所使用的同一个 pipeline 类,只是替换了 checkpoint 名称。该仓库自身的元数据声明了 base_model: Qwen/Qwen-Image-2.1 和 library_name: diffusers,并将 base_model:finetune:Qwen/Qwen-Image-2.1 作为第二个标签。这是厂商将其描述为基础 checkpoint 的微调版本,而非同级模型。
• 它保留了:相同的 7B 视觉生成架构、与 Qwen-Image-2.1 一致的七种分辨率预设(方形 2048 × 2048、4:3 为 2400 × 1792、3:4 为 1792 × 2400、3:2 为 2528 × 1696、2:3 为 1696 × 2528、16:9 为 2752 × 1536,以及 9:16 为 1536 × 2752),以及相同的两项能力——文生图生成与指令引导的图像编辑。该卡片的展示按类别组织:人像摄影、人体姿态与动态、透明 RGBA 生成、字体排印与海报设计、UI 与信息布局、单图变换、多参考合成,以及四图室内合成。
• 它没有包含的内容:任何评测数字。卡片上并没有 Turbo checkpoint 的 Qwen-Image-Bench 分数,也没有与 base 的对比。Qwen-Image-2.1 系列中出现的唯一分数仍然是 base 模型自身的 Qwen-Image-Bench 结果,而这是厂商报告的数字,是在 base checkpoint 上测得的——并非在此 checkpoint 上测得。

调度现在存在于权重之中,这才是真正的变化。
这是卡片上最重要的一句话,而它却被埋在安装说明下面:该检查点“包含其推荐的采样计划,因此无需手动配置调度器即可直接使用”。
随后,采样部分直白地说明了后果:“推荐的 8 步采样调度会随检查点一起保存并自动加载。仅设置 num_inference_steps 并不会覆盖它。”
把这一点读两遍。在大多数人脑海中沿用的 Diffusers 惯例里,步数是调用时传入的参数——你为基础模型传 num_inference_steps=40,为蒸馏检查点传 num_inference_steps=4,然后管线会据此构建对应的调度表。Qwen-Image-2.1-Turbo 打破了这个惯例。八步调度表是检查点的元数据,而不是请求参数。你传入一个不同的整数,管线仍然会使用已保存的调度表。模型卡上说,覆盖它的唯一方式是在调用时显式传入 sigmas 参数,并补充说其他调度表“尚未针对该检查点进行评估”。
实际后果就是一个复现陷阱。从 Qwen-Image-2.1 模型卡中照搬的代码,指向 Turbo 仓库后能够运行,不会报错,但也不会产出 Turbo 展示页所展示的结果。它还需要一个能理解由 pipeline 配置的采样 sigmas 的 Diffusers 版本——这一支持由 Diffusers PR #14950 加入,而在撰写本文时,它还存在于源代码树中,而非某个已打标签的发布版本里。官方给出的安装要求是一个兼容 CUDA 的 PyTorch 构建版本,加上 git+https://github.com/huggingface/diffusers.git、transformers>=5.17.0、accelerate 和 pillow。
还有两项默认值来自模型卡,而非你所设置的任何内容:生成默认使用 CFG 1,而前缀 KV 缓存“在去噪步骤间复用文本和参考图像上下文”。CFG 1 意味着没有无分类器引导过程,这在很大程度上正是轨迹得以缩短而不崩溃的原因——这也是模型卡不费心给出引导尺度建议的原因。前缀 KV 缓存是基座模型的继承:与 Qwen-Image-2.1 用来复用文本和参考图像上下文的机制相同;当去噪循环只有八次迭代时,这一点只会更重要,而非更不重要。
在更新日志中宣布,以仓库形式交付
对这次发布最贴切的定性既不是“上线”,也不是“泄露”。它是一件已入库的产物,在新闻列表里留下一行带日期的记录。Qwen-Image-2.1 项目在 GitHub 上的新闻列表中有两条日期为 2026.10.09 的条目:一条关于 Turbo 检查点,另一条指出 Qwen-Image-2.1 Pro 和 Turbo API“现已在 Alibaba Cloud Model Studio 正式上线”。并没有单独的 Turbo 博客文章;卡片上的博客链接指向 2026 年 9 月 20 日的 Qwen-Image-2.1 博客。
对比一下基础模型三周前的发布情况。Qwen-Image-2.1 的新闻列表里有一条标注日期的权重条目,随后同一天还有另外五条:通过 PR #14804 从第一天起支持 Diffusers、从第一天起原生支持 ComfyUI、支持 vLLM-Omni 并具备逐步执行、前缀 KV 缓存、FP8 量化以及张量并行、支持 SGLang 并带有 Cache-DiT 和 CUDA graphs,以及来自 LightX2V 的首日加速。Turbo 检查点完全没有这些。那些生态条目中的每一条指的都是 Qwen-Image-2.1。

仓库计数器讲述的是关于成熟度而非优劣的同一个故事,它们只是一张快照,而非最终定论:在撰写本文时,Qwen-Image-2.1 显示过去一个月有 122,311 次下载和 3,142 个点赞,而问世仅数小时的 Qwen-Image-2.1-Turbo 只有 33 个点赞。下载量是滞后指标,Turbo 的数字还会变化。它今天告诉你的,只是还没有人有时间运行它而已。
八个步骤没有告诉你的事
步数是发布说明中最显眼的数字,也是最没用的数字,原因有三,值得直言。
• 步数并不等于秒数。无论是模型卡还是代码仓库,都没有公布 Turbo checkpoint 的吞吐量、延迟或内存占用。在 7B bfloat16 模型上以 2048 × 2048 跑八步,与在更小的模型上跑八步是完全不同的工作负载;而且模型卡没有说明是在什么硬件上测得的,因为它根本没有报告任何测量结果。
• 目前尚不存在质量锚点。Turbo 没有已发布的评分,没有与基础检查点的并排对比,也没有针对两者的独立评估。展示图片是厂商在推荐设置下挑选出的输出。它们只能证明该模型能生成图像,却无法证明为了减少步数牺牲了多少质量,也无法替代基准测试。
• 缺少内存方面的指导。基础模型的卡片中包含一个内存优化部分;Turbo 卡片则记录了安装、生成、编辑、采样、宽高比以及停止条件。如果你打算将其部署上线,就要做好实测的准备。

许可证未变,这对任何发布产品的人来说都是最重要的信息
Qwen-Image-2.1-Turbo 依据 Qwen 研究许可协议进行授权。该仓库的元数据显示为 license: other,其中 license_name: qwen-research、license_link: LICENSE,并且仓库中存在一份与权重文件并列存放的 LICENSE 文件。模型卡自身的许可部分只写了一句话:该模型依据 Qwen 研究许可协议授权。
加速并不能改变这一点。基础模型上的非商业研究许可不会因为检查点更快就变成商业许可,而 Turbo 仓库也是按相同条款单独下载的。如果你对八步生成的兴趣在于它能让模型足够便宜,从而可以放进产品中,那么约束在于许可,而不是步数。这个问题必须问供应商;本仓库中没有任何地方对此作出回答。
托管路径,以及 OrcaRouter 在其中的位置
OrcaRouter 不路由 Qwen-Image-2.1-Turbo,也不路由 Qwen-Image-2.1。两者均未出现在我们的目录中,本文中的任何内容都不应被解读为提供这些模型服务的要约。如果你需要其中任何一个,途径是供应商自己的 API 以及若干第三方平台,或者直接使用模型权重,并搭配足够新的 Diffusers 构建,以加载 Turbo 检查点所保存的调度表。
我们主推的是托管图像产品线,值得了解它包含什么,这样你可以把它与自托管实验对照来看。 OrcaRouter 将 200 多个模型置于一个与 OpenAI 兼容的端点之后,按提供商目录价提供,零加价——因此,当供应商降价时,我们这边当天就能生效,而不必等待重新定价流程。 它增加了提供商服务劣化时的自动故障转移,一种用于表达请求可以使用哪些模型和提供商的路由 DSL,以及用于将多个模型组合成一次调用的模型融合。 我们路由的图像模型包括 OpenAI GPT-Image 系列、Google 的 Imagen 4 各档位(包括 fast 和 ultra 变体)、Google 的 Gemini 图像预览端点,以及 xAI Grok Imagine 图像端点。
决策的真实面貌是:如果你需要一个可以检查并修改的八步 7B 开放权重模型,Turbo 属于自托管工作,而许可证是首先要确定的事。如果你这周就需要生产环境中的图像端点,那是另一笔采购,而且正是我们出售的那一个。
可以说的,和不可以说的
• 已由仓库本身确认: Qwen-Image-2.1 的 7B 加速检查点,可在八个去噪步骤中执行文本到图像生成和图像编辑;一个不会被 num_inference_steps 覆盖的已保存采样计划;默认 CFG 为 1;用于文本和参考图像上下文的前缀 KV 缓存;与基础模型相同的七种分辨率预设;一条 QwenImage21Pipeline 加载路径;项目自身新闻列表中一条日期为 2026 年 10 月 9 日的发布条目;以及与基础模型相同的 Qwen Research License Agreement。
• 任何地方都未确立:针对 Turbo 检查点的任何质量测量、任何速度或内存测量、对其所衍生的基础检查点的任何独立评估、除研究许可之外的任何商业条款声明,以及 Qwen-Image-2.1 发布时自带的那种首日框架支持。
八个步骤是会被人引用的数字。迁入权重的调度,才是决定你第一次运行能否复现出任何结果的细节。
