
FLUX 3 Image vs Bernini-Diffusers-v2 : un point de terminaison payant contre un dépôt téléchargeable
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 223 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
FLUX 3 Image et Bernini-Diffusers-v2 sont tous deux des modèles d'image que vous pouvez obtenir intégralement dès aujourd'hui, et aucun des deux n'est un produit que vous pouvez louer. FLUX 3 Image est sorti le 1er octobre 2026 à l'adresse api.bfl.ai/v1/flux-3-image avec une grille tarifaire publiée et aucun score publié. Bernini-Diffusers-v2 est arrivé sur Hugging Face le 13 août 2026 sous licence Apache-2.0, avec des scores publiés et aucun moyen de l'appeler autrement que sur vos propres GPU. L'un s'accompagne d'une facture. L'autre s'accompagne d'un épinglage de version Python.
Cette séparation constitue toute la comparaison, et il vaut la peine d’être précis à ce sujet, car le cadre habituel « hébergé vs poids ouverts » ne convient pas ici. Bernini n’est pas un modèle à poids ouverts que l’on peut intégrer directement dans une pile d’inférence existante. C’est un système en deux étapes — un planificateur Qwen2.5-VL-7B devant un décodeur de diffusion Wan2.2-T2V-A14B — et sa version v2 est une correction du programme d’entraînement, pas un nouveau palier de capacités. FLUX 3 Image est un point de terminaison unique auquel est greffée une quantité inhabituelle de surface de contrôle : ancrage spatial, une grille de coordonnées de 0 à 1000, et une édition délimitée par des boîtes où vous désignez les régions qui survivent. Des objets de formes différentes.
Ce que chacun est réellement
• FLUX 3 Image — Black Forest Labs' image tier of its unified FLUX 3 family, released October 1, 2026. One HTTP POST to https://api.bfl.ai/v1/flux-3-image with an x-key header; only prompt is required. The call returns a polling URL, and a finished 4K render can take several minutes. Generated samples are downloadable for one hour.
• Bernini-Diffusers-v2 — la pile planificateur + moteur de rendu de ByteDance, mise en ligne sur Hugging Face le 13 août 2026 sans annonce d'accompagnement. Le dépôt est étiqueté image-text-to-video et dépend de diffusers. Tâches répertoriées : texte-vers-image, image-vers-image, texte-vers-vidéo, vidéo-vers-vidéo, référence-vers-vidéo et référence-vers-image. Il n'y a pas d'inférence hébergée ni de grille tarifaire — le parcours de prise en main est hf download et une application Gradio.
• L’écart de distribution — FLUX 3 Image est un service facturé à l’usage que vous appelez. Bernini est un dépôt que vous déployez. Avant qu’une question de qualité ne vaille la peine d’être posée, l’un de ces deux exige un GPU de classe Hopper et l’autre exige une carte de crédit.
C’est sur la question des licences que ces deux-là divergent le plus.
Bernini-Diffusers-v2 est sous licence Apache-2.0 au niveau du dépôt. Pour un pipeline auto-hébergé, cela change énormément les choses : pas de compteur par image, pas d’accord commercial négocié, pas de déclaration d’utilisation. Vous payez l’électricité et le temps de l’ordonnanceur, et le coût marginal de la dix-millième image est le même que celui de la première.
FLUX 3 Image n'est pas en open weights, et Black Forest Labs précise explicitement que c'est temporaire. Des poids commerciaux sont disponibles dès aujourd'hui sous licence BFL négociée, et la publication publique en open weights est annoncée pour les semaines à venir. C'est une promesse avec une forme mais sans date, et c'est l'élément le plus important de cette page à revérifier plutôt qu'à supposer. Si vous choisissez une pile d'images pour les deux prochaines années, la question de la licence pèse probablement plus que celle d'Elo — mais seulement si vous êtes prêt à exploiter vous-même une pile de diffusion native vidéo en deux étapes.
Surface de contrôle : boîtes englobantes versus enrichissement de prompt
C’est la partie du duel qui est vraiment intéressante, car les deux modèles résolvent « faire en sorte que ça aille exactement là » de façons complètement différentes.
FLUX 3 Image prend un tableau JSON ajouté au prompt. Les coordonnées s'étendent sur une grille de 0 à 1000 sur les deux axes, et chaque boîte s'écrit [top, left, bottom, right]. Vous fournissez une table d'éléments, chacun avec un id, un bbox et un desc, ainsi qu'une légende globale qui cite ces ids par leur nom. Dans l'exemple propre à BFL, les ids se lisent comme animal_1 et silhouette_1 ; la légende s'y réfère directement. Au-dessus de l'appel de génération se trouve grounding, activé par défaut, qui exécute une recherche web et d'images avant de générer.
FLUX 3 Image étend ensuite le même système de coordonnées à l'édition. Au lieu d'envoyer un masque, vous envoyez un ensemble d'opérations délimitées par des boîtes : Conserver (boîte source vers la même boîte, issue de ref_image_0), Déplacer (boîte source vers une nouvelle boîte cible), Nouveau (aucune source, boîte cible générée à partir d'une description — ajouter, remplacer ou recolorer) et Supprimer (boîte source vers une cible nulle). Plusieurs opérations tiennent dans une seule requête.
La nuance compte. La documentation de BFL indique que les pixels en dehors des zones modifiées « restent généralement identiques ». Généralement. C’est une affirmation de préservation avec une réserve intégrée à la formulation, ce qui est la façon honnête d’en livrer une, et aussi la raison pour laquelle vous devriez tester sur vos propres images plutôt que de vous fier à une démo.
Bernini n'a pas de langage de coordonnées équivalent côté utilisateur. Son édition guidée par référence s'est améliorée dans la v2 en raison d'un changement d'entraînement — le module connecteur est préchauffé pendant des milliers d'étapes avant que le co-entraînement ne commence — et ByteDance rapporte que ce changement se traduit par une meilleure édition guidée par référence et de meilleures performances OpenS2V. Il s'agit d'un correctif de qualité au sein d'une architecture existante, et non d'une nouvelle interface de contrôle. Si votre flux de travail dépend du fait de dire au modèle quel rectangle ne pas modifier, une seule de ces deux réponses répond à la question.

Ce que les chiffres étayent et n'étayent pas
La page de Bernini-Diffusers-v2 présente un tableau de sept métriques comparant v2 à v1, et chaque chiffre qui y figure est rapporté par le fournisseur. La tendance est mitigée, ce qui mérite d’être dit tout haut :
• En hausse — OpenS2V 63,83 (contre 62,30), VBench 84,46 (contre 84,37), Bernini-rv2v 3,55 (contre 3,48).
• Plat — EditVerse 8.02, inchangé, et Bernini-v2v 3.49, inchangé.
• Indisponible — OpenVE 3.96, à partir de la 4.03.
La page indique également que v2 se situe dans le premier niveau parmi les principaux modèles commerciaux à code source fermé dans une arène interne de comparaisons humaines par paires en aveugle. Cela n’est pas vérifiable depuis l’extérieur de ByteDance et doit être lu comme une allégation marketing, non comme une mesure. Les trois véritables évolutions sont celles listées ci-dessus, et elles sont autodéclarées par rapport à la propre v1 du même laboratoire.
FLUX 3 Image n’a encore aucun chiffre. Le tableau texte-image d’Artificial Analysis et son tableau d’édition ont tous deux été vérifiés le 1er octobre et le 2026-10-02 et ne comportent aucune ligne FLUX 3 Image — les entrées BFL de ces tableaux s’arrêtent à la ligne FLUX.2, où FLUX.2 [max] se situe à 1021 Elo sur le tableau de génération et à 996 sur le tableau d’édition. FLUX.2 [dev] ancre les deux tableaux à exactement 1000. Donc, la déclaration honnête concernant la qualité de FLUX 3 Image à l’heure actuelle est que personne en dehors de Black Forest Labs n’a publié de score pour celui-ci, et le point de référence disponible le plus proche est la génération qui le précède.
Cette asymétrie est le piège pratique de cette comparaison. Les chiffres de Bernini sont produits par le fournisseur, mais ils existent et ils indiquent une tendance. Ceux de FLUX 3 Image sont absents. Une absence n'est pas un échec — le modèle n'a qu'un jour — mais cela signifie que la seule preuve de l'affirmation de FLUX 3 Image concernant ses capacités d'édition provient pour l'instant de l'entreprise qui le vend.
Le côté prix, qui n'est pas du tout symétrique
FLUX 3 Image est facturé à l'image selon le palier de résolution, et la grille tarifaire du fournisseur en répertorie cinq :
• 768sq — 0,041 $ au prix catalogue, 0,0205 $ pendant la période de lancement.
• 1K (par défaut) — 0,048 $ prix catalogue, 0,024 $ en promotion.
• 1,5 K — 0,07 $ prix catalogue, 0,035 $ en promotion.
• 2K — 0,10 $ au prix catalogue, 0,05 $ en promotion.
• 4K — 0,607 $ prix catalogue, 0,3035 $ en promotion.

Les images de référence et la longueur du prompt sont incluses sans frais supplémentaires, et les requêtes rejetées, en échec ou modérées ne sont pas facturées — ce qui compte davantage que d'habitude ici, car un appel 4K est lent et la tentation d'abandonner une requête est bien réelle. La tarification de lancement s'applique du 1er octobre à 15:00 UTC au 8 octobre à 15:00 UTC. L'écart de prix catalogue entre la 2K et la 4K est d'un facteur 6,07, bien plus important que le rapport du nombre de pixels, donc le palier de résolution que vous choisissez constitue la principale décision de coût de toute l'API.
Les paliers suivent un budget de pixels plutôt qu'un cadre fixe. La sortie d'exemple de BFL est de 5456 × 3072, soit environ 16,8 mégapixels, contre UHD 2160p à 8,3 mégapixels — donc « 4K » désigne ici un budget, et les dimensions de sortie sont arrondies à des multiples de 16, le chiffre réel étant renvoyé sous la forme de output_mp.
Le prix de Bernini est de zéro par image et non nul par heure. Huit GPU pour l'inférence en parallélisme de séquence, silicium de classe Hopper recommandé, Python 3.11.2 avec PyTorch 2.7.1 et CUDA 12.6. Le seuil de rentabilité par rapport à 0,048 $ par image en 1K se situe quelque part dans les milliers d'images par mois, en fonction entièrement de ce que vous payez pour le calcul — et c'est un vrai nombre, pas un nombre rhétorique. Si vous exploitez déjà une infrastructure d'inférence, l'image marginale de Bernini est presque gratuite. Si ce n'est pas le cas, le point de terminaison FLUX 3 Image est nettement moins cher que de mettre en place un stack de diffusion à deux étapes.
Routage : aucun de ces deux ne figure dans notre catalogue.
Cela vaut la peine de le dire clairement, car c’est le genre d’affirmation qui devient vite obsolète. OrcaRouter ne route pas FLUX 3 Image, et il ne route pas Bernini-Diffusers-v2. Appeler FLUX 3 Image signifie appeler Black Forest Labs directement sur son propre point de terminaison. Appeler Bernini signifie le déployer vous-même.
Dans un pipeline comme celui-ci, ce à quoi sert réellement un routeur compatible OpenAI, c'est tout ce qui se trouve de part et d'autre de l'appel à l'image. Une passe de légendage ou de réécriture de prompt, un modèle de vision qui vérifie que le rendu correspond au brief, un modèle vidéo qui anime l'image fixe approuvée, un petit modèle texte qui classe la sortie — voilà les étapes où pouvoir changer de fournisseur avec une seule chaîne, sur une seule clé, et faire basculer automatiquement les requêtes lorsqu'un fournisseur est dégradé, ce qui élimine une bonne part de maintenance. OrcaRouter répercute le prix catalogue des fournisseurs sans marge, si bien que lorsqu'un fournisseur baisse son tarif, le changement est effectif le jour même plutôt que d'attendre qu'un revendeur révise son prix, et le DSL de routage permet d'épingler un modèle précis ou de définir un ordre de repli sans toucher au code de l'application. Rien de tout cela ne rend FLUX 3 Image routable. Cela signifie simplement que le reste du pipeline n'a pas besoin de savoir quel modèle a produit l'image fixe.
![Screenshot of the Artificial Analysis text-to-image leaderboard, showing FLUX.2 [max] at 1021 Elo and FLUX.2 [dev] fixed as the 1000 anchor, with no FLUX 3 Image entry anywhere on the board](https://cms.orcarouter.ai/api/media/file/4-1497.png)
Sur lequel construire
Trois questions les séparent nettement, et elles n'ont pas de réponse commune.
Avez-vous besoin de contrôler où vont les choses ? FLUX 3 Image est le seul des deux à disposer d’un langage de coordonnées, et ses opérations d’édition limitées à une boîte — conserver, déplacer, ajouter, supprimer — constituent une interface réellement différente de l’édition par instructions textuelles. Si votre travail relève du compositing, de la mise en page ou de l’imagerie produit où les régions doivent être préservées, c’est déterminant, et la réserve contenue dans « restent généralement identiques » doit être testée plutôt que présumée.
Devez-vous savoir à quel point il est bon avant de vous engager ? Bernini a des chiffres, tous rapportés par le fournisseur, et une direction d'évolution mitigée. FLUX 3 Image n'en a aucun. Si vous ne pouvez pas mener votre propre évaluation, vous choisissez entre un modèle mesuré et un modèle non mesuré, et celui qui est mesuré est l'architecture la plus ancienne.
Pouvez-vous faire fonctionner une pile de diffusion en deux étapes ? C'est là le véritable verrou pour Bernini. Un planificateur Qwen2.5-VL-7B qui alimente un décodeur Wan2.2-T2V-A14B, sur des GPU Hopper, avec un hook d'enrichissement de prompt qui pointe vers un point de terminaison compatible OpenAI. La licence est permissive, mais la facture de calcul ne l'est pas. Si vous ne pouvez pas, la question est sans objet et 0,048 $ par image est la réponse.
La seule chose qui ferait évoluer cette page le plus vite serait que BFL ouvre les poids de FLUX 3 Image, ce que l’entreprise dit être à quelques semaines. Cela ferait passer l’asymétrie des licences de décisive à légère et laisserait la différence de surface de contrôle comme véritable comparaison. D’ici là, le résumé exact est qu’il s’agit de deux bons modèles aux modèles de distribution opposés, et le choix se fait sur la licence et le contrôle bien avant de se faire sur la qualité.
