Carte de titre principale : « Hy Image3.5 vs LLaDA-Image — l'endpoint contre le checkpoint », avec pour sous-titre « Deux façons d'acheter un modèle d'image 2K en septembre 2026, et qui porte le risque opérationnel ». La colonne de gauche, « Hy Image3.5 preview — louer », liste : accès via un endpoint à l'usage, sans poids ; 0,024 $ par image 2K, facturé sur la sortie livrée ; un plafond de 2K et jusqu'à 5 images de référence ; édition multi-tours avec contexte conservé : oui ; affinable : non ; peut être déprécié sous vos pieds : oui. La colonne de droite, « LLaDA-Image — posséder », liste : accès via des checkpoints téléchargeables, sans endpoint hébergé ; poids gratuits plus votre propre GPU ; une famille de Base 50 étapes et Turbo 2-4 étapes en BF16 et FP8 ; édition multi-tours avec contexte conservé : non annoncée ; affinable : oui ; peut être déprécié sous vos pieds : non. Un pied de page indique : « Chiffres Tencent rapportés par le fournisseur. LLaDA-Image appartient à la famille ouverte d'inclusionAI ; sa fiche porte un tag apache-2.0 et annonce 6B dans le texte contre 7B dans la barre latérale. OrcaRouter ne route ni l'un ni l'autre. » Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Guides & Insights

Hy Image3.5 vs LLaDA-Image : louer l’endpoint ou posséder les poids

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Il existe deux façons d’acheter un modèle d’image 2K en septembre 2026, et ce ne sont pas tant deux produits que deux modèles économiques. Hy Image3.5 preview, disponible depuis le 22 septembre 2026, est un point de terminaison facturé à l’usage : 0,024 $ par image selon la grille tarifaire internationale de Tencent, 0,15 ¥ au niveau national, facturé sur la sortie livrée, et vous ne touchez jamais à un GPU. LLaDA-Image, issu du groupe de modèles ouverts inclusionAI et publié le 4 septembre 2026, est un checkpoint téléchargeable : une famille unifiée de génération et d’édition de classe 7B sous une étiquette Apache-2.0, présente sur Hugging Face sans aucun point de terminaison hébergé qui lui soit associé. Cent mille images 2K par mois coûtent environ 2 400 $ avec la première méthode. La seconde ne coûte rien par image et une somme d’argent que vous devez calculer vous-même, parce que les poids sont gratuits et que le matériel ne l’est pas.

C'est toute la comparaison, et presque toutes les erreurs commises à son sujet viennent du fait de comparer les deux comme si la colonne des prix était la seule différence. Ce n'est pas le cas. L'un des deux peut être déprécié sous vous. L'un des deux peut être affiné. L'un d'eux est livré avec le propre benchmark d'un fournisseur et aucun score indépendant ; l'autre est livré avec un rapport technique, un dépôt public et environ un millier de téléchargements.

Deux affirmations attachées à LLaDA-Image qui ne concordent pas avec elles-mêmes

Avant que la comparaison ait la moindre valeur, deux détails sur la fiche LLaDA-Image doivent être signalés plutôt que résolus, car tous deux constituent de véritables contradictions dans les sources publiques, et choisir discrètement un camp serait une erreur pire que de le dire.

Le premier est le nombre de paramètres. Le texte de la fiche de modèle elle-même décrit « une famille compétitive de modèles unifiés open source de génération et d’édition d’images à 6 milliards de paramètres ». L’encadré latéral de cette même page indique une taille de modèle Safetensors de 7 milliards de paramètres en BF16. Les deux chiffres figurent sur la même page, publiés par la même organisation, et rien dans la fiche ne permet de les concilier. Considérez la classe comme « environ sept milliards de paramètres, avec un chiffre de six milliards dans la description » et ne citez ni l’un ni l’autre comme établi. Quiconque vous donne le nombre exact ne fait que deviner à partir de la même fiche que vous pouvez lire.

La seconde est la licence. La fiche porte License: apache-2.0 aujourd'hui. Notre propre couverture antérieure de cette famille indiquait qu'aucune des fiches publiées ne portait de mention de licence et qu'il n'y avait pas de fichier LICENSE dans le dépôt. Les deux affirmations peuvent être vraies à des moments différents — une mention peut être ajoutée — mais nous n'allons pas prétendre qu'elles ont toujours été identiques, et une licence apparue après la publication est un fait d'une nature différente d'une licence livrée avec les poids. Si la licence est déterminante pour votre cas d'usage, vérifiez vous-même le dépôt au moment où vous téléchargez, et vérifiez si le code d'entraînement, que la fiche annonce comme à venir, arrive sous les mêmes conditions.

Screenshot of the Hugging Face model card for inclusionAI/LLaDA-Image, showing License: apache-2.0, tags including Text-to-Image, Diffusers, Safetensors, LLaDAImagePipeline, image-generation, image-editing and arxiv:2609.03796, model-scope badges for Base, Base-FP8, Turbo and Turbo-FP8, the description text 'LLaDA-Image is a competitive 6B-parameter open-source unified image generation and editing model family', and a right rail listing 1,021 downloads last month, Safetensors with model size 7B params at BF16 tensor type, an inference-providers panel reading 'This model isn't deployed by any Inference Provider', a model tree with 1 finetune and 3 quantizations, 5 Spaces, and a collection updated 19 days ago with the paper published 20 days ago.

Ce que les deux architectures vendent réellement

LLaDA-Image n’est pas un modèle de diffusion au sens habituel, et c’est là ce qu’il a d’intéressant. Il associe un transformer de diffusion à un modèle vision-langage gelé — LLaDA2.0-mini — et un connecteur RQA entre les deux, et il est publié sous forme de famille plutôt que comme un point de contrôle unique : Base à 50 étapes pour la qualité, Turbo à deux à quatre étapes pour le débit, chacun en BF16 et FP8. Cela fait quatre points de contrôle, et c’est le nombre d’étapes qui explique qu’un déploiement auto-hébergé puisse être rendu viable avec un budget, tout simplement : un modèle 7B à 50 étapes ne représente pas du tout la même proposition matérielle qu’un modèle à 2 à 4 étapes. Le rapport technique est public et la recette d’entraînement est décrite comme entièrement ouverte, ce qui constitue une revendication de transparence plus forte que celle de la plupart des publications de modèles à poids ouverts.

Hy Image3.5 preview est délibérément conçu à l'inverse. Il s'agit d'un seul point de terminaison avec un seul comportement : texte-vers-image et image-vers-image sur le même appel, édition multi-tours qui reprend les tours précédents comme contexte, jusqu'à cinq images de référence par requête, un plafond de sortie de 2K, et l'identifiant hy-image-v3.5-preview. Il n'y a rien à choisir, rien à paramétrer et rien à télécharger. L'ensemble des capacités est plus étendu dès le départ — l'édition conversationnelle multi-tours avec conservation du contexte est une véritable fonctionnalité que la famille ouverte ne met pas en avant — et vous n'avez aucun contrôle sur aucun de ces éléments.

• Coût de base — Hy Image3.5 preview est à 0,024 $ par image 2K, facturé sur la sortie livrée ; LLaDA-Image, ce sont des poids gratuits plus ce que coûte l'exécution sur votre GPU.

• Ce que vous obtenez — Hy Image3.5 preview est une API hébergée avec édition multi-tours et cinq images de référence ; LLaDA-Image correspond à quatre checkpoints (Base et Turbo, BF16 et FP8) et à une recette d'entraînement.

• Étapes pour générer une image — Hy Image3.5 preview est un seul appel sans paramètre d’étapes exposé ; LLaDA-Image compte 50 étapes sur Base ou 2 à 4 sur Turbo, que vous définissez vous-même.

• Poids — Hy Image3.5 preview n’en publie aucun ; LLaDA-Image publie toute la famille.

• Licence — Hy Image3.5 preview est un service commercial régi par les conditions de Tencent ; LLaDA-Image porte une étiquette apache-2.0 que notre propre couverture antérieure n'avait pas vue.

• Éléments probants — Hy Image3.5 preview dispose d’un test à l’aveugle GSD réalisé par le fournisseur et d’aucun Elo indépendant ; LLaDA-Image présente un chiffre Qwen-Image-Bench rapporté par l’auteur de 53,53 en anglais et de 53,38 en chinois, et ne dispose pas non plus d’Elo indépendant.

Les choses que seul l'un d'entre eux peut faire

Commencez par ce que les poids vous apportent, car c’est plus qu’une préférence de licence. Un checkpoint est un actif : il ne peut pas être déprécié, faire l’objet d’un nouveau tarif, d’une limitation de débit ou d’une fermeture, et un pipeline rattaché à un fichier précis fonctionnera encore dans trois ans. Il peut être affiné sur vos propres contenus, ce qui, pour une équipe dotée d’un style maison ou d’un jeu de caractères particulier, fait toute la différence entre solliciter le modèle de quelqu’un d’autre et entraîner le vôtre. Il fonctionne hors ligne, ce qui compte si le contenu est un travail client soumis à une clause de confidentialité. Et son débit dépend du matériel que vous avez acheté plutôt que d’une file d’attente que vous avez rejointe.

En contrepartie, un endpoint vous achète une absence de travail. Personne dans votre équipe n'apprend une stack de serving, personne ne dimensionne un GPU, personne ne découvre en production que le checkpoint FP8 nécessite un runtime différent de celui du BF16, et personne n'est tenu pour responsable lorsque le job échoue à 3 h du matin. Le modèle de Tencent porte aussi une capacité que la famille ouverte ne revendique pas : l'édition multi-tours qui conserve la conversation, ce qui est précisément le mécanisme permettant de maintenir un personnage au fil d'une longue série de modifications. Le support d'édition de LLaDA-Image est bien réel — c'est une famille unifiée de génération et d'édition — mais l'état conversationnel d'un tour à l'autre n'est pas quelque chose que la fiche annonce.

Pour être honnête, ces options ne se concurrencent pas du tout sur la qualité. Elles se concurrencent sur qui porte le risque opérationnel, et les deux réponses sont « Tencent » et « vous ».

Qu’est-ce qui a réellement été mesuré, de part et d’autre ?

Aucun des deux modèles ne dispose d’un classement indépendant. Le classement texte-image d’Artificial Analysis, consulté le 23 septembre 2026, ne comporte aucune ligne d’aperçu Hy Image3.5 ni aucune ligne LLaDA-Image. Là où le classement mentionne bien Tencent, c’est pour la génération précédente : HunyuanImage 3.0 Instruct à 964 Elo et HunyuanImage 3.0 à 945, classés 65e et 70e sur 156 modèles — ce qui constitue la seule mesure tierce de quoi que ce soit dans cette famille, et elle date d’une génération.

Ce que chaque partie propose à la place, c'est son propre travail. Celui de Tencent est un test de préférence en aveugle de type GSD, mené auprès de plusieurs centaines de designers professionnels de l'entreprise elle-même, qui affiche environ trente pour cent d'avance sur Hy Image3.0, une parité avec Seedream 5.0 Pro, et un léger avantage sur Nano-Banana Pro et Qwen-Image-3.0-Pro. Piloté par le fournisseur, peuplé par le fournisseur, jeu de prompts non publié — une méthode réelle avec un véritable conflit d'intérêts, et les deux moitiés de cette phrase doivent être dites d'un même souffle.

Le score de LLaDA-Image sur Qwen-Image-Bench est de 53,53 en anglais et de 53,38 en chinois, un chiffre rapporté par les auteurs sur un benchmark choisi par les auteurs. Il n'est pas plus indépendant que le test de Tencent ; il est simplement non audité d'une autre manière. La fiche recense aussi cinq Spaces communautaires et un nombre de téléchargements mensuels d'environ un millier, ce qui vous indique que la famille ouverte a une traction réelle mais modeste — ce n'est pas un modèle que le domaine a déjà adopté, et quiconque vous dit le contraire n'a pas regardé le chiffre.

A single-panel card titled 'Hy Image3.5 preview vs LLaDA-Image - two unaudited claims and one empty column', subtitled 'Neither model has a third-party placement; both sides are reporting their own work'. Five rows: 'Independent board - no Hy Image3.5 preview row, no LLaDA-Image row, on the 156-model Artificial Analysis text-to-image board'; 'Tencent's own test - GSD-style blind preference with several hundred of its own designers, roughly +30% over Hy Image3.0 and parity with Seedream 5.0 Pro'; 'LLaDA-Image's own numbers - Qwen-Image-Bench 53.53 English and 53.38 Chinese, author-reported on a benchmark the authors chose'; 'Traction for the open family - about 1,021 downloads in the last month and 5 community Spaces on the model card'; 'Previous Tencent generation - HunyuanImage 3.0 Instruct 964 Elo at rank 65 and HunyuanImage 3.0 945 Elo at rank 70, the only third-party measurement in the family'. A footer reads: 'Tencent and inclusionAI figures are vendor-reported and unreproduced by us. Board figures per Artificial Analysis, read 23 September 2026.' The OrcaRouter logo is composited in the bottom-right corner.

Où va vraiment l'argent, à grande échelle

Évaluez le côté location honnêtement, car c'est le seul côté avec un tarif publié. Cent mille images 2K par mois à 0,024 $ font 2 400 $. Un demi-million par mois représente 12 000 $, soit environ 144 000 $ par an, et à cette échelle, un modèle d'image auto-hébergé de classe 7B cesse d'être une option d'amateur et devient un poste de dépense évident. En dessous d'environ dix mille images par mois, l'arithmétique ne fonctionne pas du tout de cette façon : 240 $ face au coût d'un GPU, de l'électricité, du stockage, de la pile de service et de l'attention de quelqu'un, ce n'est pas un choix serré, et le point d'accès facturé à l'usage gagne sur tous les axes, y compris celui que vous ne comptez pas.

Le point de croisement n’est pas un chiffre que quiconque peut vous donner, car le côté auto-hébergé dépend du matériel que vous possédez déjà, de l’utilisation que vous atteignez réellement et du fait que le GPU fait autre chose ou non lorsqu’il ne génère pas d’images. Ce que l’on peut dire précisément, c’est la forme de la courbe : le modèle facturé à l’usage est linéaire en volume et le modèle auto-hébergé est une fonction en escalier, donc la question n’est pas de savoir lequel est le moins cher, mais où se situe votre volume par rapport au palier.

Un seul point de terminaison, quel que soit le chemin que vous empruntez.

OrcaRouter ne route ni l’un ni l’autre. Nous n’hébergeons aucun modèle d’image Tencent — les seules entrées Tencent du catalogue sont la gamme Hy3, uniquement textuelle — et absolument rien d’inclusionAI, donc Hy Image3.5 preview désigne le cloud propre à Tencent et les produits Tencent first-party, et LLaDA-Image désigne les poids publiés et le runtime vers lequel vous les pointez. Le dire clairement est plus utile qu’une page de modèle qui laisse planer l’ambiguïté.

Ce qu'une couche de routage apporte dans cette décision, c'est la troisième option qu'elle rend peu coûteuse. Si vous pesez 2 400 $ par mois face à l'achat d'un GPU, l'étape intermédiaire utile consiste à savoir ce que la même charge de travail coûte sur les modèles auxquels vous pouvez accéder dès aujourd'hui sans contrat — openai/gpt-image-2, google/gemini-3.1-flash-image-preview, la famille Imagen 4 et grok/grok-imagine-image se trouvent tous derrière un même point de terminaison compatible OpenAI, au prix catalogue du fournisseur, avec 0 % de marge, si bien qu'un changement de tarif chez un fournisseur est répercuté chez nous le jour même, et le basculement automatique en cas de défaillance fait qu'un après-midi difficile chez un fournisseur ne se transforme pas en panne chez vous. Ce n'est pas un substitut à l'un ou l'autre des modèles de cette comparaison. C'est ce qui empêche la comparaison d'être un choix binaire fait à l'aveugle.

A single-panel card titled 'The crossover is not a number anyone can hand you', subtitled 'Metered pricing is the only side of this comparison with a published rate card'. Six rows: '10,000 images a month - about $240 metered, against a GPU, its power, its storage and somebody's attention'; '100,000 images a month - about $2,400 metered'; '500,000 images a month - about $12,000 a month, roughly $144,000 a year'; 'The shape of the curve - the metered model is linear in volume, the self-hosted model is a step function'; 'The question - not which is cheaper, but where your volume sits relative to the step'; 'Before 7 October 2026 - run your own prompt set through the free window on Miora, WorkRally and OnSolo and write down the accept rate'. A footer reads: 'Hy Image3.5 preview pricing per Tencent ($0.024 per 2K image, billed on delivered output). OrcaRouter routes neither model; we host no Tencent or inclusionAI image model.' The OrcaRouter logo is composited in the bottom-right corner.

La seule question qui tranche

Demandez si votre charge de travail a une forme que les poids peuvent capturer et que le point de terminaison ne peut pas. Si vous générez selon un style maison, un jeu de caractères fixe ou les propres contenus d'un client, et que vous avez le volume et le matériel nécessaires pour qu'un modèle de classe 7B justifie sa place, alors LLaDA-Image est l'actif le plus durable, et l'étiquette Apache-2.0 — vérifiez-la au moment du téléchargement, compte tenu de l'historique ci-dessus — est ce qui le rend utilisable. Vous achetez de l'optionalité et vous la payez en opérations.

Si votre charge de travail est en rafales, si personne dans l’équipe ne veut prendre en charge une pile de service, si l’édition multi-tours avec contexte conservé est la fonctionnalité dont vous avez réellement besoin, ou si votre volume est inférieur à dix mille images par mois, alors 0,024 $ pour une image 2K livrée est un bon prix pour le problème de quelqu’un d’autre, et l’étiquette d’aperçu est le principal élément à garder à l’esprit. La seule chose qui vaut la peine d’être faite avant le 7 octobre 2026 — pendant que Miora, WorkRally et OnSolo font tourner la fenêtre gratuite — est de faire passer votre propre ensemble de prompts dans le modèle tencent et de noter le taux d’acceptation, car ce chiffre, et non les trente pour cent, est celui qui décide si le côté facturé au compteur vaut son compteur.