Carte hero générée pour l'article « Qwen-Image 2.1 vs FLUX 3 », présentant un graphique de confrontation à deux colonnes avec une icône de cadenas entre deux cartes de modèles arrondies étiquetées « Qwen-Image 2.1 » et « FLUX 3 », ainsi qu'un ruban portant l'inscription « L'un que vous pouvez exécuter sans pouvoir le vendre ; l'autre que vous pourriez vendre sans pouvoir l'exécuter ».
Guides & Insights

Qwen-Image 2.1 vs FLUX 3 : deux modèles d'image que vous ne pouvez pas vraiment utiliser

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Qwen-Image 2.1 et FLUX 3 sont les deux sorties de modèles d’image les plus intéressantes du second semestre 2026, et aucune des deux n’est directement utilisable. Qwen-Image 2.1, que l’équipe Qwen-Image a publié en open source le 20 septembre 2026, est un modèle unifié de génération et d’édition de 7 milliards de paramètres que vous pouvez télécharger cet après-midi et que vous ne pouvez pas légalement intégrer à un produit commercial. FLUX 3, que Black Forest Labs a annoncé le 23 juillet 2026, est un modèle de fondation multimodal unifié dont le volet image — la partie que vous compareriez réellement — n’a toujours ni point de terminaison public, ni identifiant de modèle, ni prix, ni benchmarks deux mois après l’annonce. La comparaison n’est donc pas « lequel est le meilleur ». Elle consiste à déterminer lequel des deux obstacles vous pouvez contourner.

Deux types différents d'indisponible

Il est tentant de classer les deux sous « pas encore prêt » et de passer à autre chose. Cela masquerait la seule décision qui compte, car les deux obstacles ont des formes opposées.

Le blocage de Qwen-Image 2.1 est juridique, et il tient à une ligne dans un fichier que vous pouvez lire avant de télécharger quoi que ce soit. Les poids sont sur Hugging Face et ModelScope, la fiche du modèle est rédigée, le code d'inférence est publié, et quatre frameworks de serving distincts avaient vu leur prise en charge fusionnée avant le jour de la sortie, ou le jour même. Rien de technique ne vous sépare d'un modèle opérationnel. Ce qui vous sépare de sa mise sur le marché, c'est le Qwen Research License Agreement, daté du 20 septembre 2026, dont la clause d'octroi de droits autorise une utilisation « À DES FINS NON COMMERCIALES UNIQUEMENT » et invite toute personne souhaitant obtenir des droits commerciaux à demander une licence distincte au fournisseur.

L’obstacle de FLUX 3 est physique. Il n’y a aucun point de terminaison d’image à appeler, aucun identifiant de modèle à transmettre et aucune grille tarifaire sur laquelle baser un budget. La page de tarification de BFL couvre les paliers FLUX 3 Video et l’ancienne gamme d’images FLUX.2 ; elle ne couvre pas de palier image FLUX 3, car il n’y a rien à tarifer. L’accès au modèle d’image se fait uniquement sur demande, plutôt que via un bouton de démarrage : la page FLUX 3 de BFL répertorie le palier image comme « bientôt disponible », et c’est le palier d’action qui porte l’étiquette d’accès anticipé.

Donc, l’un de ces modèles est un modèle que vous pouvez faire tourner dès ce soir et que vous ne pouvez pas vendre, et l’autre est un modèle que vous pourriez vendre et que vous ne pouvez pas faire tourner. Lequel est le plus utile pour vous dépend entièrement du côté de cette phrase où vous vous trouvez — une équipe de recherche interne et une équipe produit commerciale devraient aboutir à des conclusions opposées à partir des deux mêmes faits.

La lecture dimension par dimension

Statut — les poids, la licence et la fiche modèle de Qwen-Image 2.1 ont été publiés le 20 septembre 2026, accompagnés d'un article de blog du fournisseur le jour même. FLUX 3 a été annoncé le 23 juillet 2026 ; seule la gamme vidéo a été livrée, atteignant la disponibilité générale le 4 août 2026.

Ce que vous pouvez réellement appeler dès aujourd'hui — Qwen-Image 2.1 s'exécute localement via Diffusers, ComfyUI, vLLM-Omni, SGLang et LightX2V, ou via l'API de l'éditeur et plusieurs plateformes tierces. FLUX 3 indique son offre d'images comme « bientôt disponible », sans point de terminaison à appeler, et propose un point de terminaison vidéo payant en disponibilité générale.

Architecture — Qwen-Image 2.1 est un DiT à flux unique de 32 couches comptant 7 milliards de paramètres dans le composant de génération visuelle, un encodeur de texte Qwen3-VL 8B, et un VAE RGBA à 64 canaux avec une compression spatiale de 16×. FLUX 3 est un modèle de flux unifié unique entraîné conjointement sur l'image, la vidéo et l'audio, reposant sur une méthode d'appariement de flux auto-supervisée que BFL appelle Self-Flow, avec un niveau de prédiction d'actions développé aux côtés de Mimic Robotics.

Transparence native — Qwen-Image 2.1 génère et modifie des images RGBA, modifie le texte à l'intérieur de calques transparents et extrait des sujets de photographies RGB vers des calques transparents, intégrant ainsi la capacité qu'Alibaba a commercialisée séparément sous le nom de Qwen-Image-Layered en décembre 2025. BFL n'a publié aucune revendication de transparence pour FLUX 3 Image.

Images de référence — Qwen-Image 2.1 accepte jusqu’à 10 références d’entrée, avec édition locale par cercle, annotation peinte ou masque séparé. Aucun chiffre publié n’existe pour FLUX 3 Image.

Résolution — Qwen-Image 2.1 est natif en 2K, avec une valeur par défaut de 2048×2048 à 40 étapes d'inférence, et sept préréglages de rapport d'aspect documentés. Les résolutions de FLUX 3 Image ne sont décrites dans l'annonce que comme « broad », sans aucune publication.

Prix — aucun prix publié pour l'un ou l'autre. Qwen-Image 2.1 n'a pas de tarif hébergé répertorié au moment de la rédaction ; FLUX 3 Image n'a pas de grille tarifaire car il n'a pas de point de terminaison. La seule tarification FLUX 3 qui existe concerne la vidéo, à 0,06 $ par seconde en qualité brouillon, 0,17 $ par seconde en HD et 0,29 $ par seconde en FHD.

Licence — Accord de licence de recherche Qwen, à usage non commercial uniquement, toute utilisation commerciale nécessitant une demande distincte. Les conditions de licence du palier image de FLUX 3 n'ont pas été publiées du tout.

Une asymétrie mérite une ligne à part, car c'est le piège de cette confrontation. FLUX 3 a bel et bien des chiffres de référence publiés — un Elo interne de 1 135 pour le texte-vers-vidéo et des taux de victoire en préférence humaine rapportés face à Grok Imagine Video, Seedance 2.0, Gemini Omni Flash, Runway Gen-4.5 et Luma Ray 3.2. Chacun de ces chiffres décrit le palier vidéo. Aucun d'entre eux ne s'applique à la génération d'images, et BFL elle-même n'a publié aucun benchmark ni aucun taux de victoire pour l'image. Citer un Elo vidéo de FLUX 3 comme preuve de la qualité d'image de FLUX 3 est l'erreur la plus facile à commettre dans cette comparaison.

A generated two-column comparison scoreboard titled 'Qwen-Image 2.1 vs FLUX 3 — the scoreboard'. Left column 'Qwen-Image 2.1': rows reading Status: released 20 Sep 2026; Callable today: local, five frameworks; Architecture: 7B, 32-layer DiT; Transparency: native RGBA; Reference images: up to 10; Price: none published; Licence: research, non-commercial. Right column 'FLUX 3': rows reading Status: announced 23 Jul 2026; Callable today: video only; Architecture: unified flow model; Transparency: none claimed; Reference images: not published; Price: video $0.06-$0.29 per second; Licence: not published for image. Footer reads 'Qwen-Image 2.1 figures per the vendor model card, unaudited; FLUX 3 image tier has published no figures at all.'

Ce que chaque camp peut réellement montrer

Mettez les preuves côte à côte et l’asymétrie s’inverse par rapport à la section précédente.

FLUX 3 propose un produit livré, tarifé et généralement disponible — mais pas celui qui figure dans le titre de cet article. FLUX 3 Video génère des clips jusqu'à 20 secondes avec un audio synchronisé en une seule passe, prend en charge le texte-vers-vidéo, l'image-vers-vidéo, la vidéo-vers-vidéo, le keyframe-vers-vidéo et la continuation générative, et est déjà testé par Canva, Burda, Magnific, Krea et Picsart. C'est un système réel, déployé, avec une véritable liste de clients. Le volet image est la partie qui n'est pas encore arrivée, et l'indication initiale de BFL selon laquelle il suivrait « dans les semaines à venir » a maintenant dépassé deux mois entiers sans point de terminaison public.

Qwen-Image 2.1 présente le profil inverse. Ses affirmations de qualité proviennent du propre tableau comparatif Qwen-Image-Bench du fournisseur, et aucun tiers ne les a reproduites. Mais l’objet lui-même est entre vos mains : 33 Go de poids, une structure de dépôt de style Apache avec un fichier de licence qui reconnaît honnêtement un usage réservé à la recherche, et un chemin de serving dès le jour zéro sur cinq frameworks. Il existe aussi un seul test pratique en accès anticipé, réalisé par un testeur qui a exécuté les poids finaux via une interface ModelScope Studio et a rapporté environ 10 à 15 secondes pour la génération texte-image et 18 à 23 secondes pour l’édition, un comportement performant en matière de préréglages de caméra et d’attribution de rôles à plusieurs personnages, ainsi qu’une cohérence multi-références qui commence à se dégrader à partir d’environ trois images d’entrée. Un seul évaluateur, aucun chronomètre, aucun jeu de prompts publié. Utile à titre indicatif, non vérifié formellement.

Le résumé honnête des éléments disponibles : Qwen-Image 2.1 a un modèle exécutable et aucune donnée de qualité indépendante ; FLUX 3 Image n’a que des affirmations de son fournisseur, et ni modèle exécutable ni la moindre donnée d’image. Si votre question est « lequel de ces deux dois-je prendre comme base pour planifier un pipeline ? », la réponse aujourd’hui est : ni l’un ni l’autre, et la raison n’est pas la même.

A screenshot of the Black Forest Labs FLUX 3 model page, captured September 20 2026, showing the FLUX 3 family overview with the Video tier marked as generally available and the Image tier listed as coming soon, alongside the FLUX 3 Video per-second pricing tiers.

Où se trouve réellement la solution de contournement

Pour une équipe commerciale, le blocage lié à Qwen-Image 2.1 a une forme que vous pouvez anticiper. La licence est explicite, le contact pour la licence commerciale est indiqué dans le dépôt, et le modèle est suffisamment petit — 7B dans le composant de génération — pour que le coût de son évaluation sur votre propre matériel se mesure en une après-midi, et non en un trimestre. Évaluez d’abord, négociez ensuite, et en attendant, gardez la version de recherche à l’écart de tout parcours client. C’est un problème d’approvisionnement normal.

Le blocage de FLUX 3 Image n'est pas un problème d'approvisionnement, car il n'y a rien à approvisionner. Vous pouvez rejoindre une file d'attente d'accès anticipé, et vous pouvez guetter l'apparition du point de terminaison, et c'est là l'unique action disponible. Si vous avez besoin de génération d'images de la famille FLUX en production aujourd'hui, les options appelables sont les anciennes gammes FLUX.2 et FLUX Pro/Dev, qui sont proposées à un tarif et disponibles — et qui appartiennent à une génération de modèle différente de celle dont traite cet article.

Pour une équipe qui souhaite tester les deux candidats sans engager ni l'un ni l'autre sur un chemin de production, c'est exactement le cas pour lequel la couche de routage existe. OrcaRouter place plus de 200 modèles derrière un seul point de terminaison compatible OpenAI, au prix catalogue du fournisseur et sans marge, avec basculement automatique entre fournisseurs, de sorte qu'un modèle non éprouvé ou non encore publié se retrouve derrière une route, à côté de quelque chose en lequel vous avez déjà confiance, plutôt que de le remplacer — et comme le prix catalogue est répercuté tel quel, toute modification tarifaire d'un fournisseur sur un modèle routé est effective le jour même. Ni Qwen-Image 2.1 ni FLUX 3 Image ne sont routables au moment où nous écrivons, et nous n'allons pas prétendre le contraire ; ce que nous routons, c'est la gamme d'images qui les entoure, notamment la famille GPT-Image d'OpenAI, les différents paliers d'Imagen 4 de Google et les aperçus d'images Gemini, ainsi que le point de terminaison d'images Grok Imagine de xAI. Ce sont là les modèles capables de porter une charge de travail pendant que ces deux-là se stabilisent.

Un autre point à surveiller, spécifiquement du côté de Qwen. Alibaba a publié Qwen-Image 1.0 et 2.0 sous forme de poids ouverts Apache-2.0, puis a publié Qwen-Image 3.0 en juillet 2026 comme un modèle hébergé entièrement fermé, sans poids, sans licence ni rapport technique, puis a publié Qwen-Image 2.1 en septembre sous forme de poids ouverts, sous une licence réservée à la recherche. La trajectoire n’est pas une ligne droite, et les conditions de licence de la prochaine version sont une véritable question ouverte plutôt qu’une hypothèse sûre dans un sens ou dans l’autre.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 20 2026, showing the 2026/09/20 date, the headline 'Compact, Efficient, and Unified Image Creation', the 'Now open weights' hero banner, GitHub, Hugging Face and ModelScope buttons, and the 7B parameter figure.

Le verdict, tel qu'il est.

Si vous êtes un chercheur ou une équipe d’évaluation interne, Qwen-Image 2.1 est, de loin, le plus utile des deux en ce moment — il est téléchargeable, documenté, pris en charge par les frameworks et transparent sur ses conditions. Si vous êtes une équipe commerciale, les deux sont bloqués et les blocages ne sont pas équivalents : l’un est un contrat au sujet duquel vous pouvez entamer une discussion, l’autre est un produit qui n’existe pas encore.

Si vous devez livrer de la génération d'images ce mois-ci, aucun de ces deux n'est la réponse, et la question utile est de savoir lequel des modèles que vous pouvez appeler vous rapproche le plus. C'est un exercice de benchmarking, et il vaut la peine de le faire avec vos propres prompts plutôt qu'avec le graphique de lancement de n'importe qui — y compris celui du fournisseur, et y compris celui-ci.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement