Carte hero pour Qwen-Image-2.1-Turbo, un checkpoint accéléré en 8 étapes de Qwen-Image-2.1, présentant le planning en 8 étapes sauvegardé avec les poids, CFG 1 par défaut, la réutilisation du cache KV de préfixe, et la Qwen Research Licence inchangée
Engineering & Research

Qwen-Image-2.1-Turbo : un checkpoint en 8 étapes qui a déplacé le schedule dans les poids

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le dépôt de Qwen-Image-2.1-Turbo est apparu sur Hugging Face le 9 octobre 2026, et ce qu'il y a de plus intéressant à son sujet n'est pas le nombre d'étapes. Il y a des poids bfloat16, une fiche de modèle avec du code exécutable, un fichier de licence, huit images de démonstration, et une ligne dans la liste d'actualités GitHub du projet Qwen-Image-2.1 annonçant la sortie. Il n'y a pas de billet de blog qui lui soit propre, pas de tableau de benchmarks, pas de cycle de presse, et aucun changement, quel qu'il soit, aux conditions sous lesquelles Qwen-Image-2.1 est distribué. Turbo est un checkpoint accéléré de Qwen-Image-2.1 pour la génération d'images à partir de texte et l'édition d'images, qui s'exécute en huit étapes de débruitage plutôt que les quarante qu'utilisent les propres exemples du modèle de base. Il change aussi, discrètement, d'où vient le calendrier d'échantillonnage — et c'est la partie qui cassera le code.

Qu'y a-t-il réellement dans le dépôt ?

La carte est brève et étonnamment précise, ce qui permet de distinguer facilement ce qui est confirmé de ce qui est sous-entendu.

• De quoi il s’agit : la fiche décrit Qwen-Image-2.1-Turbo comme « un checkpoint accéléré de Qwen-Image-2.1 pour la génération d’images à partir de texte et l’édition d’images avec 8 étapes de débruitage ». Ce n’est pas une nouvelle architecture ni une nouvelle famille de modèles. Il s’agit du même composant de génération visuelle de 7B, reconditionné autour d’une trajectoire d’échantillonnage beaucoup plus courte.

• Comment il se charge : via QwenImage21Pipeline dans Diffusers, la même classe de pipeline que celle utilisée par le modèle de base, avec le nom du checkpoint remplacé. Les métadonnées du dépôt lui-même déclarent base_model : Qwen/Qwen-Image-2.1 et library_name : diffusers, et portent base_model:finetune:Qwen/Qwen-Image-2.1 comme deuxième tag. C'est l'éditeur qui décrit ceci comme un fine-tune du checkpoint de base, et non comme un modèle frère.

• Ce qu'il préserve : la même architecture de génération visuelle 7B, les mêmes sept préréglages de résolution que Qwen-Image-2.1 (carré 2048 × 2048, 4:3 en 2400 × 1792, 3:4 en 1792 × 2400, 3:2 en 2528 × 1696, 2:3 en 1696 × 2528, 16:9 en 2752 × 1536 et 9:16 en 1536 × 2752), et les deux mêmes capacités — génération d'images à partir de texte et édition d'image guidée par instructions. La vitrine de la carte est organisée par catégorie : photographie de portrait, poses et mouvements humains, génération RGBA transparente, typographie et conception d'affiches, UI et mise en page d'informations, transformation d'image unique, composition multi-références et composition intérieure à quatre images.

• Ce qu'elle ne comporte pas : aucun chiffre d'évaluation. Il n'y a pas de score Qwen-Image-Bench pour le checkpoint Turbo sur la fiche, ni de comparaison avec le modèle de base. Le seul score existant dans toute la gamme Qwen-Image-2.1 reste le résultat Qwen-Image-Bench du modèle de base lui-même, un chiffre rapporté par le fournisseur et mesuré sur le checkpoint de base — pas sur celui-ci.

Screenshot of the Hugging Face model card for Qwen/Qwen-Image-2.1-Turbo, captured in English, showing the Text-to-Image, Diffusers, Safetensors and QwenImage21Pipeline tags, 25 likes, the qwen-research licence label, and the introduction text describing it as an accelerated checkpoint of Qwen-Image-2.1 for text-to-image generation and image editing with 8 denoising steps that loads directly with QwenImage21Pipeline in Diffusers

Le planning réside désormais dans les poids, et c'est là le vrai changement.

Voici la phrase la plus importante sur la carte, et elle est enfouie sous les instructions d’installation : le checkpoint « inclut son calendrier d’échantillonnage recommandé, il est donc prêt à l’emploi sans avoir à configurer manuellement le planificateur. »

Ensuite, la conséquence, énoncée clairement dans la section sur l’échantillonnage : « Le calendrier d’échantillonnage recommandé en 8 étapes est enregistré avec le checkpoint et chargé automatiquement. Le simple fait de définir num_inference_steps ne le remplace pas. »

Relisez cela deux fois. Dans la convention Diffusers que la plupart des gens gardent en tête, le nombre d’étapes est un argument fourni au moment de l’appel — vous passez num_inference_steps=40 pour le modèle de base, num_inference_steps=4 pour un checkpoint distillé, et le pipeline construit un calendrier correspondant. Qwen-Image-2.1-Turbo rompt avec cette convention. Le calendrier en huit étapes fait partie des métadonnées du checkpoint, et non d’un paramètre de requête. Vous pouvez passer un autre entier, le pipeline utilisera quand même le calendrier enregistré. La fiche indique que le seul moyen de le remplacer est de passer un argument sigmas explicite au moment de l’appel, et ajoute que d’autres calendriers « n’ont pas été évalués pour ce checkpoint ».

La conséquence pratique est un piège de reproduction. Du code repris de la fiche du modèle Qwen-Image-2.1 et pointé vers le dépôt Turbo s’exécutera, ne renverra pas d’erreur et ne produira pas les sorties que montre la démonstration Turbo. Il aura aussi besoin d’une build de Diffusers qui comprend les sigmas d’échantillonnage configurés par le pipeline — prise en charge ajoutée dans la PR Diffusers #14950, qui, au moment de la rédaction, se trouve dans l’arborescence des sources plutôt que dans une version taguée. L’installation indiquée est une build de PyTorch compatible CUDA, plus git+https://github.com/huggingface/diffusers.git, transformers>=5.17.0, accelerate et pillow.

Deux autres valeurs par défaut proviennent de la fiche plutôt que de ce que vous définissez : la génération utilise CFG 1 par défaut, et la mise en cache KV de préfixe « réutilise le contexte textuel et d’image de référence à travers les étapes de débruitage. » CFG 1 signifie aucune passe de guidage sans classifieur, ce qui constitue une grande part de la manière dont la trajectoire est raccourcie sans s’effondrer — et c’est aussi pourquoi la fiche ne s’embarrasse pas d’une recommandation d’échelle de guidage. Le cache KV de préfixe est un héritage du modèle de base : le même mécanisme que Qwen-Image-2.1 utilise pour réutiliser le contexte textuel et d’image de référence, ce qui compte d’autant plus, et non moins, lorsque la boucle de débruitage ne dure que huit itérations.

Annoncé dans un {{1}}journal des modifications{{/1}}, livré sous forme de {{2}}dépôt{{/2}}

Le cadrage qui correspond à cette version n'est ni « lancement » ni « fuite ». C'est un artefact enregistré avec une ligne datée dans une liste d'actualités. La liste d'actualités GitHub du projet Qwen-Image-2.1 comporte deux entrées datées du 2026.10.09 : l'une pour le checkpoint Turbo, l'autre notant que les API Qwen-Image-2.1 Pro et Turbo « sont désormais officiellement en ligne » sur Alibaba Cloud Model Studio. Il n'y a pas d'article de blog distinct pour Turbo ; le lien de blog sur la carte pointe vers le blog Qwen-Image-2.1 du 20 septembre 2026.

Comparez cela avec la manière dont le modèle de base est arrivé trois semaines plus tôt. La liste d’actualités de Qwen-Image-2.1 comporte une entrée datée pour les poids, puis cinq autres le même jour : prise en charge de Diffusers dès le premier jour via la PR #14804, prise en charge native de ComfyUI dès le premier jour, prise en charge de vLLM-Omni avec exécution par étapes, mise en cache KV de préfixe, quantification FP8 et parallélisme tensoriel, prise en charge de SGLang avec Cache-DiT et graphes CUDA, et accélération dès le premier jour grâce à LightX2V. Le checkpoint Turbo n’a rien de tout cela. Chacune de ces entrées de l’écosystème fait référence à Qwen-Image-2.1.

Screenshot of the GitHub repository page for QwenLM/Qwen-Image-2.1, captured in English, showing the file listing with the README and LICENSE and the most recent commit message reading 'docs: announce Qwen-Image-2.1-Turbo and API availability' committed 27 minutes ago

Les compteurs du dépôt racontent la même histoire à propos de la maturité plutôt que du mérite, et ils constituent un instantané plutôt qu’un verdict : au moment de la rédaction, Qwen-Image-2.1 affiche 122 311 téléchargements au cours du dernier mois et 3 142 mentions J’aime, tandis que Qwen-Image-2.1-Turbo — vieux de quelques heures — affiche 33 mentions J’aime. Les téléchargements sont un indicateur retardé et le chiffre de Turbo évoluera. Ce qu’il vous dit aujourd’hui, c’est seulement que personne n’a encore eu le temps de l’exécuter.

Ce que huit étapes ne vous disent pas

Le nombre d’étapes est le chiffre qui fait la une et le moins utile de la version, pour trois raisons qu’il vaut la peine d’énoncer clairement.

• Les étapes ne sont pas des secondes. Ni la fiche ni le dépôt ne publient le débit, la latence ou la mémoire pour le checkpoint Turbo. Huit étapes en 2048 × 2048 sur un modèle 7B bfloat16 constituent une charge de travail différente de huit étapes sur un modèle plus petit, et la fiche n'indique pas sur quel matériel les mesures ont été effectuées, car elle ne rapporte aucune mesure du tout.

• Il n’existe encore aucun repère de qualité. Il n’existe pas de score publié pour Turbo, pas de comparaison côte à côte avec le checkpoint de base, et aucune évaluation indépendante de l’un ou de l’autre. Les images de démonstration sont des sorties sélectionnées par le fournisseur aux réglages recommandés par le fournisseur. Elles prouvent que le modèle produit des images ; elles ne prouvent pas quelle part de qualité a été sacrifiée pour la réduction du nombre d’étapes, et elles ne remplacent pas un benchmark.

• Les consignes relatives à la mémoire sont absentes.La fiche du modèle de base comprend une section sur l'optimisation de la mémoire ; la fiche Turbo documente l'installation, la génération, l'édition, l'échantillonnage et les ratios d'aspect, ainsi que les arrêts. Si vous prévoyez de le servir, prévoyez de mesurer.

Summary card for Qwen-Image-2.1-Turbo with two columns: the left column headed 'Stated in the repository' listing 8 denoising steps, schedule saved with the checkpoint, CFG 1 by default, prefix KV caching across steps, the same seven resolution presets and the Qwen Research Licence; the right column headed 'Not stated anywhere' listing no quality score for this checkpoint, no speed or memory figure and no day-zero framework support

La licence est inchangée, et c’est là le gros titre pour quiconque livre.

Qwen-Image-2.1-Turbo est sous licence selon l'accord de licence Qwen Research. Les métadonnées du dépôt indiquent license: other avec license_name: qwen-research et license_link: LICENSE, et un fichier LICENSE est présent dans le dépôt aux côtés des poids. La section de licence de la fiche elle-même indique en une phrase : le modèle est sous licence selon l'accord de licence Qwen Research.

L'accélération n'y change rien. Une licence de recherche non commerciale sur le modèle de base ne devient pas une licence commerciale parce que le checkpoint est plus rapide, et le dépôt Turbo est un téléchargement distinct, régi par les mêmes conditions. Si votre intérêt pour la génération en huit étapes tient au fait qu'elle rend le modèle assez bon marché pour être intégré à un produit, c'est la licence qui constitue la contrainte, pas le nombre d'étapes. Cette question doit être posée au fournisseur ; elle ne trouve réponse nulle part dans ce dépôt.

Le chemin hébergé, et où OrcaRouter s'y positionne

OrcaRouter n’achemine pas Qwen-Image-2.1-Turbo, et n’achemine pas non plus Qwen-Image-2.1. Ni l’un ni l’autre n’apparaît dans notre catalogue, et rien dans cet article ne doit être interprété comme une offre de les servir. Si vous voulez l’un ou l’autre, les voies possibles sont les API propres du fournisseur et plusieurs plateformes tierces, ou les poids eux-mêmes avec une version de Diffusers suffisamment récente pour charger le schedule enregistré du checkpoint Turbo.

Ce que nous présentons en vitrine, c'est la gamme d'images hébergées, et il vaut la peine de savoir ce qu'elle contient pour pouvoir la comparer à l'expérience auto-hébergée. OrcaRouter place plus de 200 modèles derrière un seul point de terminaison compatible OpenAI, au prix catalogue du fournisseur et sans aucune marge — ainsi, lorsqu'un fournisseur baisse un prix, la baisse est effective de notre côté le jour même, sans attendre une passe de réévaluation tarifaire. Il ajoute un basculement automatique lorsqu'un fournisseur se dégrade, un DSL de routage permettant d'exprimer quels modèles et fournisseurs une requête peut utiliser, ainsi que la fusion de modèles pour composer plusieurs modèles en un seul appel. Les modèles d'image que nous routons sont la famille OpenAI GPT-Image, les différents paliers d'Imagen 4 de Google, y compris les variantes fast et ultra, les points de terminaison de prévisualisation d'images Gemini de Google, et le point de terminaison d'image xAI Grok Imagine.

La forme honnête de la décision : si vous avez besoin d’un modèle 7B à poids ouverts en huit étapes que vous pouvez inspecter et modifier, Turbo, c’est du travail d’auto-hébergement, et la licence est la chose à régler en premier. Si vous avez besoin d’un endpoint d’images en production cette semaine, c’est un autre achat, et c’est celui que nous vendons.

Ce qui peut être dit, et ce qui ne peut pas l’être

• Confirmé par le dépôt lui-même : un checkpoint accéléré 7B de Qwen-Image-2.1 qui effectue la génération texte-image et l’édition d’image en huit étapes de débruitage ; un calendrier d’échantillonnage enregistré que num_inference_steps ne remplace pas ; CFG 1 par défaut ; une mise en cache KV de préfixe pour le texte et le contexte d’image de référence ; les mêmes sept préréglages de résolution que le modèle de base ; un chemin de chargement QwenImage21Pipeline ; une entrée de publication datée du 9 octobre 2026 dans la liste d’actualités du projet ; et le même contrat de licence Qwen Research que le modèle de base.

• Non établi nulle part :aucune mesure de qualité pour le checkpoint Turbo, aucune mesure de vitesse ou de mémoire, aucune évaluation indépendante du checkpoint de base dont il est dérivé, aucune déclaration sur les conditions commerciales au-delà de la licence de recherche, et aucun support de framework dès le jour zéro du type de celui livré avec Qwen-Image-2.1.

Les huit étapes sont le nombre qui sera cité. Le planning qui est passé dans les poids est le détail qui détermine si votre première exécution reproduit quoi que ce soit.