Carte vedette pour la confrontation Bernini-Diffusers-v2 contre Qwen Image 3.0, présentant des poids Apache-2.0 que vous auto-hébergez face à une API fermée qui génère du texte jusqu'à ~10px, sous le slogan Même description de poste, réponses opposées sur le contrôle.
Guides & Insights

Bernini-Diffusers-v2 vs Qwen Image 3.0 : des poids que vous possédez contre une API qui génère du texte

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Deux laboratoires chinois ont publié des modèles capables de générer des images à trois semaines d'intervalle et se sont retrouvés de part et d'autre du plus grand clivage de la catégorie. Qwen-Image-3.0, publié par l'équipe d'Alibaba le 21 juillet 2026 et ouvert à une API internationale le 4 août, est un modèle d'image à poids fermés que l'on appelle via HTTP. Bernini-Diffusers-v2, que ByteDance a publié sur Hugging Face le 13 août 2026 sans aucune annonce, est un modèle à poids ouverts sous licence Apache-2.0 que l'on télécharge et exécute. Même description de poste approximative — génération et édition d'images — et réponses opposées à la question de savoir qui contrôle le modèle. La majeure partie de ce qui suit est la conséquence de cette seule décision, c'est donc là que commence cette comparaison, plutôt que là où elle se termine.

Les poids se divisent

Qwen-Image-3.0 — poids fermés. À l'heure actuelle, Alibaba n'a pas publié les poids ni de rapport technique pour ce modèle ; vous l'utilisez via l'API sur Alibaba Cloud Bailian ou la plateforme Qwen. Les sorties portent un label de provenance AIGC. Ce que vous achetez, c'est une capacité sans garde : pas d'hébergement propre, pas de fine-tuning, pas d'utilisation hors ligne, pas de regard sous le capot.

Bernini-Diffusers-v2 — poids ouverts. Apache-2.0, un répertoire diffusers autonome sur Hugging Face, et des scripts d’inférence locaux dans le dépôt bytedance/Bernini. Vous pouvez l’affiner, l’exécuter en environnement isolé (air-gapped), conserver vos données sur votre propre matériel et cesser de payer par image. Le prix de cette garde est de l’exploiter : le README recommande des GPU de classe Hopper et une pile Python 3.11.2 / PyTorch 2.7.1+cu126.

Pour une équipe dont les images contiennent des informations confidentielles, ou dont les règles de conformité interdisent l'envoi de données à une API tierce, cette distinction tranche le débat d'elle-même.

Fidélité du texte et de la mise en page

Là où Qwen-Image-3.0 se distingue véritablement, c'est dans le texte. Ses chiffres clés, issus des documents de publication d'Alibaba :

• Fenêtre de prompt — jusqu'à 4 500 tokens d'entrée, soit un bond de 4,5× par rapport à la génération précédente, ce qui lui permet de traiter des briefs denses comme des unes de journaux ou une grille de connaissances à neuf cases en un seul appelbr />• Petit texte — rendu lisible jusqu'à environ 10px, y compris les notations mathématiques, les indices, les exposants et les formules multi-lignesbr />• Langues — rendu natif dans 12 langues avec 20+ polices et 100+ styles artistiques, ainsi qu'une familiarité avec les interfaces web, de jeux et logicielles courantes

Bernini-Diffusers-v2 ne revendique rien de comparable en matière de texte et de mise en page sur sa fiche. Ses points forts sont ailleurs — l’édition sémantique basée sur la planification et un pipeline vidéo — et pour un brief qui consiste principalement à « rendre cette infographie avec précision », Qwen-Image-3.0 est le choix qui a fait ses preuves, et Bernini est celui qui reste à prouver.

Profondeur d'édition

Qwen-Image-3.0 — génération et édition, avec un répertoire de techniques spécialisées : restauration de peintures anciennes, génération de panoramas, croquis vers PPT et storyboard multi-plans. L'argument est l'utilité en production — des mises en page qui tiennent la route, des détails qui semblent réels — plutôt qu'une architecture d'édition particulière.

Bernini-Diffusers-v2 — modification via un planificateur sémantique. Un planificateur Qwen2.5-VL décompose l'instruction en un plan de ce qui doit changer, et un moteur de rendu basé sur Wan2.2 le dessine. C'est une conception convaincante pour des modifications complexes en plusieurs étapes — « changer la saison, remplacer la voiture, conserver le cadrage » — et elle s'étend à des tâches vidéo (t2v, v2v, rv2v) qu'aucun concurrent n'aborde. Tout cela est rapporté par le fournisseur et non vérifié publiquement.

Two-column comparison scoreboard for Bernini-Diffusers-v2 and Qwen Image 3.0: weights, price, prompt window, text rendering, editing strengths, and hosted API availabilityScreenshot of the ByteDance/Bernini-Diffusers-v2 model card on Hugging Face showing the News and Highlights sections, including the v2 training-recipe change, and the start of the model card table

Coût

Qwen-Image-3.0 — environ $0.025 par 1K image sur l'API internationale (environ 0,18 yuan), avec une sortie pouvant atteindre 2048×2048 et jusqu'à six images par appel. Son prix est conçu pour concurrencer sérieusement le reste du marché des API d'images — une fraction de ce que facturaient les modèles d'images premium hébergés il y a un an.

Bernini-Diffusers-v2 — poids gratuits, aucun frais par image, mais une facture de matériel à la place. La donne économique s'inverse avec le volume : l'auto-hébergement est une mauvaise affaire pour des images occasionnelles, et une affaire de plus en plus intéressante à mesure que vous générez, car le coût marginal d'une image supplémentaire tend vers zéro.

Il existe un troisième coût qui favorise le camp des poids ouverts et qu'il est facile de sous-estimer : le coût du changement. Un modèle API fermé vous enferme dans sa tarification, ses limites de débit et sa feuille de route ; un modèle que vous possédez peut être remplacé, corrigé ou affiné sans avoir à renégocier quoi que ce soit.

Laquelle est l'API sur laquelle vous construisez ?

Qwen-Image-3.0 est uniquement disponible via API, donc si vous construisez dessus, vous vous engagez à un paiement à l'image sur l'infrastructure de quelqu'un d'autre — ce qui est précisément là où le passage direct d'OrcaRouter compte. Le prix que vous voyez de notre côté est le prix catalogue d'Alibaba avec une marge de 0%, et une baisse de prix du fournisseur est répercutée le jour même, donc l'économie par image est celle du fournisseur, pas une majoration de revendeur par-dessus. Le basculement automatique entre fournisseurs est l'autre moitié de l'argument : une API d'images qui tombe en panne en pleine campagne cesse d'être un problème lorsque vos appels sont routés autour d'elle. Si vous choisissez plutôt la voie des poids ouverts avec Bernini-Diffusers-v2, vous acceptez la charge opérationnelle aujourd'hui en échange de frais nuls par image, et lorsqu'un fournisseur hébergé finit par adopter les poids, le même passage direct s'applique à ce que ce fournisseur facture.

Decision card for the Bernini-Diffusers-v2 versus Qwen Image 3.0 matchup: Qwen Image 3.0 rents the capability as a text-accurate API at ~$0.025 per image with zero infrastructure; Bernini-Diffusers-v2 owns the model as Apache-2.0 weights that are self-hosted and fine-tunable but unverified

Le verdict

Sur le papier, Qwen-Image-3.0 est le modèle d'image pure le plus performant : rendu de texte éprouvé, fenêtre de prompt immense, fidélité de mise en page multilingue et prix d'API compétitif. C'est le choix sûr pour la génération d'images en production lorsque le brief est riche en texte et que le flux de travail est orienté API. Bernini-Diffusers-v2 est le modèle que vous pouvez réellement posséder — poids Apache-2.0, auto-hébergé, affinable, compatible vidéo — au prix d'une exploitation par vos soins et d'une confiance accordée à un tableau de référence que personne n'a reproduit. Choisissez Qwen-Image-3.0 pour la précision et l'absence totale d'infrastructure ; choisissez Bernini-Diffusers-v2 pour la garde et le contrôle. La règle de décision en une ligne : voulez-vous louer la capacité, ou posséder le modèle ?

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube