Tarjeta de título principal que dice 'Hy Image3.5 vs LLaDA-Image - el endpoint contra el checkpoint', con el subtítulo 'Dos formas de comprar un modelo de imagen 2K en septiembre de 2026, y quién asume el riesgo operativo'. La columna izquierda, 'Hy Image3.5 preview - alquilar', enumera: acceso mediante un endpoint con medición de uso y sin pesos; $0.024 por imagen 2K facturado sobre la salida entregada; un techo de 2K y hasta 5 imágenes de referencia; edición multiturno con contexto retenido, sí; afinable con fine-tuning, no; puede quedar obsoleto mientras dependes de él, sí. La columna derecha, 'LLaDA-Image - poseer', enumera: acceso mediante checkpoints descargables, sin endpoint alojado; pesos gratuitos más tu propia GPU; una familia de Base de 50 pasos y Turbo de 2-4 pasos en BF16 y FP8; edición multiturno con contexto retenido no publicitada; afinable con fine-tuning, sí; puede quedar obsoleto mientras dependes de él, no. Un pie de página dice: 'Las cifras de Tencent son reportadas por el proveedor. LLaDA-Image pertenece a la familia abierta de inclusionAI; su ficha lleva una etiqueta apache-2.0 y reporta 6B en prosa frente a 7B en la barra lateral. OrcaRouter no enruta ninguna de las dos.' El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

Hy Image3.5 vs LLaDA-Image: ¿Alquilar el endpoint o poseer los pesos?

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Hay dos formas de comprar un modelo de imagen 2K en septiembre de 2026 y no son tanto dos productos como dos modelos de negocio. Hy Image3.5 preview, disponible desde el 22 de septiembre de 2026, es un endpoint con tarificación por uso: 0,024 USD por imagen en la lista de precios internacional de Tencent, 0,15 ¥ a nivel nacional, facturado según la salida entregada, y nunca tocas una GPU. LLaDA-Image, del grupo de modelos abiertos inclusionAI y publicado el 4 de septiembre de 2026, es un checkpoint descargable: una familia unificada de generación y edición de clase 7B bajo una etiqueta Apache-2.0, alojada en Hugging Face sin ningún endpoint alojado asociado. Cien mil imágenes 2K al mes cuestan alrededor de 2400 USD de la primera forma. La segunda forma no cuesta nada por imagen y una cantidad de dinero que tienes que calcular tú mismo, porque los pesos son gratis y el hardware no.

Esa es toda la comparación, y casi todos los errores que se cometen al respecto provienen de comparar los dos como si la columna de precio fuera la única diferencia. No lo es. Uno de estos puede quedar obsoleto mientras lo usas. Uno de ellos admite ajuste fino. Uno de ellos viene con el benchmark propio del proveedor y sin ninguna puntuación independiente; el otro viene con un informe técnico, un repositorio público y alrededor de mil descargas.

Dos afirmaciones asociadas a LLaDA-Image que no concuerdan consigo mismas

Antes de que la comparación valga algo, dos detalles en la ficha de LLaDA-Image deben señalarse en lugar de resolverse, porque ambos son conflictos genuinos en el registro público y elegir un bando en silencio sería un error peor que decirlo.

El primero es el número de parámetros. La propia prosa de la tarjeta del modelo describe «una familia competitiva de modelos unificados de generación y edición de imágenes de código abierto con 6B de parámetros». La barra lateral de esa misma página indica que el tamaño del modelo Safetensors es de 7B parámetros en BF16. Ambas cifras están en la misma página, publicadas por la misma organización, y nada en la tarjeta las concilia. Trata la clase como «aproximadamente siete mil millones de parámetros, con una cifra de seis mil millones en la descripción» y no cites ninguna de las dos como definitiva. Cualquiera que te diga el número exacto está adivinando a partir de la misma tarjeta que tú puedes leer.

El segundo es la licencia. La tarjeta incluye Licencia: apache-2.0 hoy. Nuestra propia cobertura anterior de esta familia decía que ninguna de las tarjetas publicadas llevaba una etiqueta de licencia y que no había ningún archivo LICENSE en el repositorio. Ambas afirmaciones pueden ser ciertas en momentos distintos —se puede añadir una etiqueta—, pero no vamos a pretender que siempre fueron iguales, y una licencia que apareció después del lanzamiento es un hecho materialmente distinto de una licencia que se distribuyó con los pesos. Si la licencia es determinante para tu caso de uso, comprueba el repositorio tú mismo en el momento en que lo descargues, y comprueba si el código de entrenamiento, que la tarjeta describe como próximamente, llega bajo los mismos términos.

Screenshot of the Hugging Face model card for inclusionAI/LLaDA-Image, showing License: apache-2.0, tags including Text-to-Image, Diffusers, Safetensors, LLaDAImagePipeline, image-generation, image-editing and arxiv:2609.03796, model-scope badges for Base, Base-FP8, Turbo and Turbo-FP8, the description text 'LLaDA-Image is a competitive 6B-parameter open-source unified image generation and editing model family', and a right rail listing 1,021 downloads last month, Safetensors with model size 7B params at BF16 tensor type, an inference-providers panel reading 'This model isn't deployed by any Inference Provider', a model tree with 1 finetune and 3 quantizations, 5 Spaces, and a collection updated 19 days ago with the paper published 20 days ago.

Lo que las dos arquitecturas están vendiendo en realidad

LLaDA-Image no es un modelo de difusión en el sentido habitual, y esa es la parte interesante. Combina un transformador de difusión con un modelo de visión-lenguaje congelado —LLaDA2.0-mini— y un conector RQA entre ellos, y se publica como una familia en lugar de como un único checkpoint: Base con 50 pasos para calidad, Turbo con dos a cuatro pasos para rendimiento, cada uno en BF16 y FP8. Eso son cuatro checkpoints, y los recuentos de pasos son la razón por la que un despliegue autoalojado puede siquiera funcionar con un presupuesto ajustado: un modelo 7B de 50 pasos es una propuesta de hardware diferente de uno de 2 a 4 pasos. El informe técnico es público y la receta de entrenamiento se describe como totalmente abierta, lo que es una afirmación de transparencia más fuerte que la que hacen la mayoría de los lanzamientos de pesos abiertos.

Hy Image3.5 preview tiene la forma opuesta por diseño. Es un único endpoint con un único comportamiento: texto a imagen e imagen a imagen en la misma llamada, edición multiturno que arrastra los turnos anteriores como contexto, hasta cinco imágenes de referencia por solicitud, un límite de salida de 2K y el identificador hy-image-v3.5-preview. No hay nada que elegir, nada que ajustar y nada que descargar. El conjunto de capacidades es más amplio desde el primer momento —la edición conversacional multiturno con contexto retenido es una característica real que la familia abierta no anuncia— y no tienes control sobre nada de ello.

• Base de costos — Hy Image3.5 preview cuesta $0.024 por imagen 2K, facturado según la salida entregada; LLaDA-Image consiste en pesos gratuitos más lo que te cueste ejecutarla en tu GPU.

• Lo que obtienes — Hy Image3.5 preview es una API alojada con edición multiturno y cinco imágenes de referencia; LLaDA-Image son cuatro checkpoints (Base y Turbo, BF16 y FP8) y una receta de entrenamiento.

• Pasos para una imagen — Hy Image3.5 preview es una sola llamada sin parámetro de pasos expuesto; LLaDA-Image son 50 pasos en Base o de 2 a 4 en Turbo, que configuras tú mismo.

• Pesos — Hy Image3.5 preview no publica ninguno; LLaDA-Image publica la familia completa.

• Licencia — Hy Image3.5 preview es un servicio comercial regido por los términos de Tencent; LLaDA-Image lleva una etiqueta apache-2.0 que nuestra propia cobertura anterior no vio.

• Evidencia — Hy Image3.5 preview tiene una prueba ciega GSD de proveedor y ningún Elo independiente; LLaDA-Image tiene una cifra de Qwen-Image-Bench reportada por el autor de 53.53 en inglés y 53.38 en chino, y tampoco tiene un Elo independiente.

Las cosas que solo uno de estos puede hacer

Empieza por lo que los pesos te aportan, porque es más que una preferencia de licencia. Un checkpoint es un activo: no se puede deprecar, repreciar, limitar en velocidad ni apagar, y una canalización fijada a un archivo específico seguirá funcionando dentro de tres años. Se puede ajustar con tu propio material, lo que para un equipo con un estilo propio o un conjunto de caracteres específico es la diferencia entre hacer prompting a un modelo ajeno y entrenar el tuyo. Se ejecuta sin conexión, lo cual importa si el material es trabajo de cliente sujeto a un acuerdo de confidencialidad. Y su rendimiento es una función del hardware que compraste, en lugar de una cola a la que te uniste.

Frente a eso, un endpoint te garantiza la ausencia de trabajo. Nadie en tu equipo aprende una pila de servicio, nadie dimensiona una GPU, nadie descubre en producción que el checkpoint FP8 necesita un runtime diferente al de BF16, y nadie es responsable cuando el trabajo falla a las 3 de la mañana. El modelo de Tencent también tiene una capacidad que la familia abierta no reclama: edición multi-turno que retiene la conversación, que es precisamente el mecanismo detrás de mantener un personaje a lo largo de una larga serie de ediciones. El soporte de edición de LLaDA-Image es real —es una familia unificada de generación y edición—, pero el estado conversacional entre turnos no es algo que la tarjeta anuncie.

La forma honesta de plantearlo es que no compiten en absoluto en calidad. Compiten por quién asume el riesgo operativo, y las dos respuestas son «Tencent» y «tú».

¿Qué se ha medido realmente, en cualquiera de los dos lados?

Ninguno de los dos modelos tiene una ubicación independiente. La tabla de texto a imagen de Artificial Analysis, consultada el 23 de septiembre de 2026, no incluye ninguna fila de vista previa de Hy Image3.5 ni ninguna fila de LLaDA-Image. Donde la tabla sí incluye a Tencent es en la generación anterior: HunyuanImage 3.0 Instruct con 964 puntos Elo y HunyuanImage 3.0 con 945, clasificados en los puestos 65 y 70 de 156 modelos —lo que constituye la única medición de terceros de cualquier cosa en esta familia, y es de hace una generación.

Lo que cada lado ofrece en cambio es su propio trabajo. El de Tencent es la prueba de preferencia ciega al estilo GSD realizada con varios cientos de diseñadores profesionales de la propia compañía, que reporta aproximadamente un treinta por ciento por encima de Hy Image3.0, paridad con Seedream 5.0 Pro, y una ligera ventaja sobre Nano-Banana Pro y Qwen-Image-3.0-Pro. Ejecutada por el proveedor, poblada por el proveedor, conjunto de prompts no publicado — un método real con un conflicto de interés real, y ambas mitades de esa frase van en el mismo aliento.

La de LLaDA-Image es una puntuación de 53,53 en Qwen-Image-Bench en inglés y 53,38 en chino, una cifra reportada por los autores en un benchmark que los propios autores eligieron. No es más independiente que la prueba de Tencent; su falta de auditoría es de otro tipo. La ficha también enumera cinco Spaces de la comunidad y un recuento de descargas mensuales de alrededor de mil, lo que indica que la familia abierta tiene una tracción real pero modesta —no es un modelo que el campo ya haya adoptado, y quien te diga lo contrario no ha mirado la cifra.

A single-panel card titled 'Hy Image3.5 preview vs LLaDA-Image - two unaudited claims and one empty column', subtitled 'Neither model has a third-party placement; both sides are reporting their own work'. Five rows: 'Independent board - no Hy Image3.5 preview row, no LLaDA-Image row, on the 156-model Artificial Analysis text-to-image board'; 'Tencent's own test - GSD-style blind preference with several hundred of its own designers, roughly +30% over Hy Image3.0 and parity with Seedream 5.0 Pro'; 'LLaDA-Image's own numbers - Qwen-Image-Bench 53.53 English and 53.38 Chinese, author-reported on a benchmark the authors chose'; 'Traction for the open family - about 1,021 downloads in the last month and 5 community Spaces on the model card'; 'Previous Tencent generation - HunyuanImage 3.0 Instruct 964 Elo at rank 65 and HunyuanImage 3.0 945 Elo at rank 70, the only third-party measurement in the family'. A footer reads: 'Tencent and inclusionAI figures are vendor-reported and unreproduced by us. Board figures per Artificial Analysis, read 23 September 2026.' The OrcaRouter logo is composited in the bottom-right corner.

Adónde va realmente el dinero, a gran escala

Analiza el lado del alquiler con honestidad, porque es el único lado con una tarifa publicada. Cien mil imágenes 2K al mes a $0.024 son $2,400. Medio millón al mes son $12,000, o unos $144,000 al año, y a esa escala un modelo de imagen autoalojado de clase 7B deja de ser una opción de aficionado y empieza a ser una partida obvia. Por debajo de unas diez mil imágenes al mes, la aritmética no funciona así en absoluto: $240 frente al costo de una GPU, la energía, el almacenamiento, la pila de servicio y la atención de alguien no es una decisión reñida, y el endpoint medido gana en todos los ejes, incluido el que no estás contando.

El punto de cruce no es un número que alguien pueda darte, porque el lado autoalojado depende del hardware que ya tienes, de la utilización que realmente alcanzas y de si la GPU está haciendo otra cosa cuando no está generando imágenes. Lo que sí se puede decir con precisión es la forma de la curva: el modelo de pago por uso es lineal en volumen y el modelo autoalojado es una función escalonada, así que la pregunta no es cuál es más barato, sino dónde se sitúa tu volumen con respecto al escalón.

Un solo endpoint, elijas el camino que elijas

OrcaRouter no enruta ninguna de estas dos. No alojamos ningún modelo de imagen de Tencent —las únicas entradas de Tencent en el catálogo son la línea Hy3, solo de texto— y nada de inclusionAI en absoluto, así que Hy Image3.5 preview se refiere a la nube propia de Tencent y a los productos de Tencent de primera parte, y LLaDA-Image se refiere a los pesos publicados y al runtime que le indiques. Decirlo con claridad es más útil que una página de modelo que lo deje ambiguo.

Lo que aporta una capa de enrutamiento en esta decisión es la tercera opción que abarata. Si estás sopesando 2.400 $ al mes frente a la compra de una GPU, el punto intermedio útil es saber cuánto cuesta la misma carga de trabajo en los modelos a los que puedes acceder hoy sin contrato — openai/gpt-image-2, google/gemini-3.1-flash-image-preview, la familia Imagen 4 y grok/grok-imagine-image están todos detrás de un único endpoint compatible con OpenAI a precio de lista del proveedor con 0% de margen, así que un cambio de precio del proveedor se refleja en nuestro lado el mismo día, y la conmutación automática por error significa que una mala tarde de un proveedor no es tu caída del servicio. Eso no sustituye a ninguno de los dos modelos de esta comparación. Es lo que impide que la comparación sea una elección binaria hecha a ciegas.

A single-panel card titled 'The crossover is not a number anyone can hand you', subtitled 'Metered pricing is the only side of this comparison with a published rate card'. Six rows: '10,000 images a month - about $240 metered, against a GPU, its power, its storage and somebody's attention'; '100,000 images a month - about $2,400 metered'; '500,000 images a month - about $12,000 a month, roughly $144,000 a year'; 'The shape of the curve - the metered model is linear in volume, the self-hosted model is a step function'; 'The question - not which is cheaper, but where your volume sits relative to the step'; 'Before 7 October 2026 - run your own prompt set through the free window on Miora, WorkRally and OnSolo and write down the accept rate'. A footer reads: 'Hy Image3.5 preview pricing per Tencent ($0.024 per 2K image, billed on delivered output). OrcaRouter routes neither model; we host no Tencent or inclusionAI image model.' The OrcaRouter logo is composited in the bottom-right corner.

La única pregunta que lo decide

Pregúntate si tu carga de trabajo tiene una forma que los pesos pueden capturar y el endpoint no. Si estás generando con un estilo propio de la casa, un conjunto de caracteres fijo o el material propio de un cliente, y tienes el volumen y el hardware para que un modelo de clase 7B se justifique, entonces LLaDA-Image es el activo más duradero y la etiqueta Apache-2.0 —compruébala en el momento de la descarga, dada la historia anterior— es lo que lo hace utilizable. Estás comprando opcionalidad y pagándola en operaciones.

Si tu carga de trabajo es a ráfagas, si nadie en el equipo quiere ser responsable de un stack de servicio, si la edición multiturno con contexto retenido es la función que realmente necesitas, o si tu volumen es inferior a diez mil imágenes al mes, entonces $0.024 por cada imagen 2K entregada es un buen precio por el problema de otra persona, y la etiqueta de preview es lo principal que conviene mantener a la vista. Lo único que vale la pena hacer antes del 7 de octubre de 2026 —mientras Miora, WorkRally y OnSolo tienen abierta la ventana gratuita— es pasar tu propio conjunto de prompts por el modelo de tencent y anotar la tasa de aceptación, porque ese número, y no el treinta por ciento, es el que decide si el lado de pago por uso merece su medidor.