
LLaDA2.2-mini: los pesos del agente de difusión de Ant inclusionAI aparecieron silenciosamente el 5 de septiembre
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0455Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0247Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0247Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0157Inteligencia82Código
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2646Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1849Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1541Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1251Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0547Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0347Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2140Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Inteligencia49Código
A las 05:16 UTC del 5 de septiembre de 2026, apareció un repositorio de Hugging Face llamado inclusionAI/LLaDA2.2-mini, y a fecha de redacción esto es casi toda la historia del lanzamiento: los pesos están publicados, la tarjeta del modelo está redactada, y el proveedor —inclusionAI, el laboratorio del Ant Group detrás de la línea de modelos de difusión LLaDA— no ha dicho nada al respecto. No hay publicación de lanzamiento, ni despliegue en redes sociales, ni entrada en la tabla de modelos del README de GitHub de inclusionAI/LLaDA2.X, donde el LLaDA2.2-flash, de mayor tamaño, aparece en solitario. Veinticuatro horas después de la aparición del repositorio, su contador de descargas marcaba cero. Este es un artículo de «lo que sabemos hasta ahora» sobre LLaDA2.2-mini, y la disciplina de ese formato importa aquí, porque casi todos los números interesantes asociados al modelo son cifras que inclusionAI escribió en su propia tarjeta. Este artículo separa lo que se puede verificar de forma independiente sobre el lanzamiento de lo que declara el proveedor, y señala las preguntas abiertas en lugar de pasarlas por alto.
La versión breve, para quien solo quiera hacerse una idea: LLaDA2.2-mini es el hermano pequeño del modelo de lenguaje de difusión LLaDA2.2-flash que inclusionAI anunció en julio de 2026; ahora está disponible como un checkpoint de mezcla de expertos de 16 mil millones de parámetros que activa solo 1400 millones de parámetros por token, opera con una ventana de contexto de 128K y está entrenado para tareas de agente —llamada de herramientas, corrección en múltiples turnos— mediante un decodificador de difusión que puede insertar y eliminar tokens a mitad de la generación. Es Apache-2.0. Y como los pesos tienen un día de antigüedad y no hay ningún anuncio detrás, todavía no existe nada del andamiaje habitual: sin evaluación independiente, sin API alojada que podamos encontrar, ni guías de despliegue más allá de lo que recomienda la propia ficha. Lo que se puede verificar hoy es la arquitectura, la licencia y las cifras que inclusionAI eligió publicar.
El lanzamiento es un repositorio, no un evento
Empieza por lo que se puede comprobar sin confiar en nadie. La API de Hugging Face registra inclusionAI/LLaDA2.2-mini como creado el 5 de septiembre de 2026 y modificado por última vez ese mismo día. Está licenciado bajo Apache-2.0, utiliza el formato safetensors con tensores bf16, incluye una plantilla de chat y requiere trust_remote_code porque la arquitectura de difusión se distribuye como código de modelado personalizado. El repositorio hermano, inclusionAI/LLaDA2.2-flash, fue creado el 16 de julio de 2026, ha acumulado miles de descargas y decenas de likes en las semanas transcurridas desde entonces y se anunció públicamente. El mini no cuenta ni con el anuncio ni con la adopción —en su primer día registró likes de un solo dígito y ninguna descarga en absoluto—.

La única atención de terceros que el mini ha recibido hasta ahora es una página agregadora que republicó la tarjeta del modelo a las pocas horas de aparecer el repositorio; es un espejo de la tarjeta, no una fuente independiente, y no aporta información que el propio repositorio no contenga. Ese es todo el registro público al 6 de septiembre. El encuadre que importa para un lector que decide si prestar atención: inclusionAI ha publicado pesos de difusión en silencio dos veces en la misma semana —este modelo el 5 de septiembre y los checkpoints de generación LLaDA-Image el día anterior—, así que una publicación discreta en el repositorio parece ser un patrón de lanzamiento establecido para el laboratorio, no un accidente. Nada en ese patrón nos dice si habrá un anuncio.
Qué es realmente LLaDA2.2-mini
La arquitectura es donde el modelo resulta más interesante, y está completamente descrita en la ficha. LLaDA2.2-mini es un modelo de lenguaje de difusión de mezcla de expertos construido sobre el backbone de LLaDA2.0-mini. Los modelos de lenguaje de difusión invierten el bucle de generación habitual: en lugar de que un modelo autorregresivo prediga un siguiente token a la vez, un LLM de difusión parte de un bloque de tokens enmascarados o ruidosos y refina todo el bloque en paralelo, eliminando ruido hacia una secuencia coherente. La generación de LLaDA2.2 añade lo que inclusionAI denomina edición Levenshtein: dos tokens de control, DELETE e INSERT, que permiten al decodificador cambiar la longitud y la estructura de la secuencia que está produciendo, y no solo el contenido — eliminar un segmento redundante que ya escribió, o abrir un punto de inserción donde necesita ir nuevo contexto (por ejemplo, el resultado de una herramienta). Ese es el mecanismo que la familia utiliza para hacer que la decodificación por difusión funcione en bucles de múltiples turnos y uso de herramientas, donde un modelo autorregresivo puede simplemente esperar al siguiente turno del usuario, pero un modelo de difusión por bloques tiene que revisar lo que ya ha generado.
Las especificaciones relevantes, todas directamente de la ficha: 16 mil millones de parámetros totales excluyendo los embeddings, 1.4 mil millones activos por token a través de un MoE de 256 expertos con 8 expertos enrutados por token; 20 capas, 16 cabezas de atención, 4 cabezas KV; un vocabulario de 157,184 tokens; embeddings de posición rotatoria; y una ventana de contexto de 128K. Una técnica llamada Block Routing restringe qué expertos se activan a nivel de bloque de difusión, que es como el modelo mantiene un contexto de 128K manejable en una sola GPU de consumo. La ficha lo orienta a una tarjeta de 24GB o más y recomienda SGLang como backend de servicio para cargas de trabajo agénticas de contexto largo.

Arriba se muestra dónde se sitúa el lanzamiento en la cronología de la familia — el linaje que hace legible a «LLaDA2.2-mini». LLaDA2.0 en noviembre de 2025 fue el primer modelo de lenguaje de difusión escalado a 100 mil millones de parámetros; LLaDA2.1 en febrero de 2026 añadió edición de tokens para una difusión de texto más rápida; la generación LLaDA2.2 en julio de 2026, anunciada con LLaDA2.2-flash y su informe técnico, orientó la familia hacia los agentes. La mini es la pieza de esa generación que permaneció como una promesa hasta ahora: la cobertura del lanzamiento de julio ya mencionaba una variante 16B más ligera del flash para un despliegue más barato, pero los pesos independientes solo se materializaron el 5 de septiembre.
Los números en la tarjeta, etiquetados como lo que son.
La tabla de benchmarks en la tarjeta del modelo es propia de inclusionAI, impresa el día en que se publicaron los pesos, y ningún laboratorio independiente ha reproducido nada de ella: Artificial Analysis no tiene una entrada para LLaDA2.2-mini, y no podemos encontrar ninguna ejecución de terceros. Lea las cifras como afirmaciones orientativas del proveedor, no como hechos medidos. Dentro de ese marco, la historia que cuenta la tarjeta es coherente: LLaDA2.2-mini es un especialista en agentes y en contextos largos, y sacrifica algunos puntos en benchmarks generales para lograrlo.
• Promedio agéntico — 59.00, de τ²-Bench 57.50, Claw-Eval 57.16 y PinchBench 62.33 (reportado por el proveedor).
• Llamada a funciones — 47.68 en BFCL v4, frente a los 25.05 y 28.44 de LLaDA2.0-mini y LLaDA2.1-mini, respectivamente; 69.02 en el BFCL v3 anterior.
• Contexto largo — 34.99 en LongBench v2, más del doble de los 15.51 y 12.13 que lograron los minis anteriores, lo cual es el beneficio concreto de la ventana de 128K.
• General: una media general de 46.47, con AIME 2026 en 35.05, OlympiadBench 61.11, LiveCodeBench v6 28.14, GPQA-Diamond 44.41 e IFBench 24.93 — varios de ellos ligeramente por debajo de los minis anteriores, el costo visible de gastar el presupuesto de entrenamiento en comportamiento agéntico en su lugar.

Ese último punto merece que nos detengamos en él, porque es la razón honesta por la que un equipo elegiría este modelo frente a un generalista más fuerte sobre el papel. LLaDA2.2-mini no afirma ser el mejor modelo pequeño en matemáticas o en el seguimiento de instrucciones; afirma ser bueno en aquello en lo que los modelos de difusión fueron históricamente malos — trabajo sostenido, multiturno y con uso de herramientas — mientras mantiene el número de parámetros activos lo bastante bajo como para importar en una sola GPU. El salto en BFCL v4 y el salto en LongBench v2 son las cifras que sobrevivirían a una ejecución independiente si la ficha es en líneas generales correcta.
Ejecutándolo, y el andamiaje faltante.
Sobre el papel, la forma de ejecutar LLaDA2.2-mini es sencilla, porque el lanzamiento es nativo de Transformers: la ficha muestra cómo cargarlo con AutoModelForCausalLM y trust_remote_code=True en transformers ≥ 5.2.0, y luego llamar a generate con los parámetros específicos de difusión: una longitud de bloque de 32 y una temperatura de 0.0 son los valores predeterminados recomendados, y la ficha sugiere una longitud de salida de 32.768 tokens para la mayoría de las consultas. Para el servicio agéntico de contexto largo apunta a SGLang, y los usuarios de la China continental tienen un espejo de ModelScope. Lo que aún no existe es el ecosistema circundante: ninguna API alojada en un proveedor que podamos verificar, ninguna compilación GGUF que podamos encontrar y un soporte de frameworks que todavía se está asentando: el trabajo de la comunidad sobre la arquitectura LLaDA2 en llama.cpp es reciente, por lo que la historia de la cuantización es escasa.
Esa combinación — un paradigma de decodificación genuinamente nuevo, de un día de vida y solo para autoalojamiento — es exactamente la situación en la que una capa de enrutamiento justifica su existencia sin pretender que el nuevo modelo esté listo para producción. La forma de probar LLaDA2.2-mini de manera responsable es ejecutarlo tú mismo en una ruta de pruebas mientras la producción permanece en un modelo maduro, y para eso está la configuración de OrcaRouter: una sola API para más de 200 modelos al precio de lista del proveedor con un margen del 0%, conmutación automática por error para que el estancamiento del checkpoint de un día no derribe un flujo de trabajo, y el DSL de enrutamiento para componer una llamada de difusión autoalojada con modelos autorregresivos alojados detrás de una única clave. Cuando — si acaso — un proveedor incluya a LLaDA2.2-mini, se aplica la misma transferencia directa y el precio que ves es el del propio proveedor. Hasta entonces, la línea honesta de disponibilidad es esta: descarga los pesos bajo licencia Apache-2.0 desde Hugging Face o ModelScope y ejecútalos tú mismo.
Qué ver a continuación
Tres cosas harían que lo que sabemos hasta ahora se convirtiera en una historia real, y las tres están ausentes hoy. Primero, un anuncio: si el patrón de LLaDA2.2-flash se mantiene, una publicación de lanzamiento y la cobertura de un informe técnico podrían seguir a la silenciosa publicación del repositorio, y probablemente añadirían detalles de entrenamiento que la ficha técnica omite. Segundo, una ejecución independiente: el promedio agéntico de 59.00 y la puntuación BFCL v4 de 47.68 son las afirmaciones que más vale la pena reproducir, porque los benchmarks agénticos son aquellos en los que la elección del harness mueve más las puntuaciones. Tercero, madurez de servicio: guías de uso de SGLang, una ruta para vLLM y cuantizaciones de la comunidad te dirían si la huella de 1.4B activos es tan barata de operar en la práctica como sugiere la hoja de especificaciones. Ninguna de esas cosas existe el 6 de septiembre. Los pesos son reales, la licencia es permisiva, y la arquitectura es genuinamente una forma diferente de ejecutar un agente — pero la evidencia de que es un buen agente es, por ahora, la tarjeta de un único proveedor.
