Una tarjeta de título generada que dice 'AREX-2 vs LFM2.5 2.6B Base - Dos tipos de inacabado', con dos paneles. El panel izquierdo, encabezado LFM2.5 2.6B Base, enumera: lanzado en agosto de 2026; 2.69B parámetros, denso; contexto de 131,072 tokens; descargable, sin ajuste de instrucciones. El panel derecho, encabezado AREX-2, enumera: repositorio creado el 29 de septiembre de 2026; cero bytes almacenados; ninguna tarjeta de modelo en absoluto; nada que descargar. Un pie de página dice 'Uno es un checkpoint sin instrucciones. El otro es un nombre sin un checkpoint.' El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

AREX-2 vs LFM2.5 2.6B Base: un repositorio vacío y un checkpoint sin instrucciones

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Coloca AREX-2 junto a LFM2.5 2.6B Base y lo primero que comparten es que ninguno de los dos es un producto que puedas usar hoy — por razones que no tienen nada que ver entre sí. AREX-2 es un repositorio de Hugging Face que BAAI creó el 29 de septiembre de 2026 a las 17:56 UTC; contiene un .gitattributes, almacena cero bytes de datos del modelo y no lleva tarjeta de modelo, ni etiqueta de licencia ni anuncio de ningún tipo. LFM2.5 2.6B Base, publicado por Liquid AI en agosto de 2026, es el tipo opuesto de inacabado: un checkpoint completo y descargable de 2,69 mil millones de parámetros, solo de texto, bajo la LFM Open License (lfm1.0) que se distribuye deliberadamente sin ajuste por instrucciones, porque está pensado para fine-tuning en lugar de para responder preguntas.

Uno es la ausencia de un artefacto. El otro es un artefacto al que le falta un paso que nunca debía tener. Esos son la misma categoría solo si uno lee por encima, y tratarlos como la misma categoría es exactamente como un equipo acaba esperando lo incorrecto. La comparación útil entre estos dos no es la capacidad —no hay un AREX-2 que medir—, sino para, y lo que cuesta averiguar si sirve de algo.

La diferencia de tipo, enunciada primero

LFM2.5 2.6B Base es una sustancia. Es el checkpoint preentrenado de la familia híbrida LFM2.5 de Liquid AI: 30 capas, de las cuales 22 son bloques de convolución corta con doble compuerta y 8 son atención de consultas agrupadas, entrenado con aproximadamente 34 billones de tokens en 16 idiomas, con una ventana de contexto de 131.072 tokens y una versión cuantizada que se sitúa cerca de 1,67 GB en Q4_K_M. No tiene ajuste por instrucciones. Dale una pregunta y continúa el texto; no responde. La propia ficha de Liquid AI señala el ajuste fino intensivo como el uso previsto, y hay un hermano postentrenado para quien quiera un modelo que responda a prompts. Es un sustrato, y el hecho de que obtenga malos resultados en los benchmarks de seguimiento de prompts no es un defecto: es la definición de lo que es.

AREX-2 no es una sustancia ni un producto; es un espacio de nombres. Los únicos datos disponibles son la organización (BAAI), la marca de tiempo de creación (29 de septiembre de 2026) y el nombre. No se ha subido nada y no se ha dicho nada. El nombre en sí pertenece a una familia que sí existe: el 23 de julio de 2026 BAAI lanzó AREX-Base, un modelo de mezcla de expertos de 122 mil millones de parámetros con 10 mil millones de parámetros activos construido sobre Qwen3.5-122B-A10B, y AREX-Turbo, un denso 4B construido sobre Qwen3.5-4B — ambos Apache 2.0, ambos agentes de investigación profunda con un diseño de dos bucles que recopila evidencia, produce una respuesta candidata con una cifra de confianza, luego verifica esa respuesta contra las restricciones originales y la refina o reinicia. Sus números publicados, reportados por el fabricante y no reproducidos de forma independiente, alcanzan 82.5 en BrowseComp y 85.4 en GAIA para el Base, y 70.7 / 81.6 para el Turbo.

• Disponibilidad — LFM2.5 2.6B Base ya está disponible para descargar. AREX-2 no tiene archivos en su repositorio.

• Tamaño — 2,69B de parámetros densos para el modelo Liquid, todos visibles en el checkpoint. Se desconoce para AREX-2; la familia abarca un MoE de 122B y un denso de 4B, así que el "2" no predice nada.

• Contexto — 131.072 tokens para LFM2.5 2.6B Base. Nada publicado para AREX-2.

• Licencia — LFM Open License v1.0, gratuita por debajo de $10M de ingresos anuales y con la obligación de obtener una licencia aparte a partir de ese umbral. AREX-2 aún no tiene etiqueta de licencia; la primera generación de AREX era Apache 2.0.

• Qué es — un sustrato de ajuste fino frente a, si nos guiamos por lo que muestra la familia, un agente alojado cuyo valor reside en un bucle de búsqueda y verificación más que en sus pesos.

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-Base, showing the Liquid AI author line, tags for Text Generation, Transformers, Safetensors and 16 languages, a Model Details table listing LFM2.5-2.6B-Base at 2.6B parameters as a pre-trained base model for fine-tuning alongside the post-trained LFM2.5-2.6B, and the feature list beginning with total parameters 2.69B, 30 layers, a 34-trillion-token training budget, a 128,000 vocabulary and a 131,072-token context length.

Tarjetas de puntuación en blanco que significan cosas opuestas

Ninguno de los dos modelos tiene un benchmark en torno al cual planificar, y las razones divergen por completo.

Liquid AI no oculta nada al dejar su Base sin puntuar. Puntuar un checkpoint preentrenado en benchmarks de seguimiento de instrucciones mediría la ausencia de ajuste fino, no la calidad del sustrato — y por eso la empresa evalúa al hermano postentrenado y deja el Base sin evaluar. Ese espacio en blanco es verificable desde tu lado, y de eso se trata: puedes descargar 1,67 GB, ejecutar tu propia evaluación en tu propia tarea, y conocer la respuesta antes de gastar nada en servirla.

El espacio en blanco de AREX-2 no es una decisión de diseño, es un aún no. No hay nada que descargar, así que no hay nada que probar, y ninguna evaluación que pudieras ejecutar esta semana te diría nada sobre él. Cualquiera que publique cifras de benchmark de AREX-2 en los próximos días está publicando algo que no puede haber medido.

A generated two-column card headed 'Two blank scorecards, for opposite reasons'. The left column, LFM2.5 2.6B Base, reads: no published evaluation - deliberate; scoring a pretrained checkpoint measures the missing fine-tuning; downloadable, verify it on your own task today; 1.67 GB at Q4_K_M, runs on a single card. The right column, AREX-2, reads: no published evaluation - nothing to evaluate; no weights, no card, no licence tag; not downloadable, nothing to verify; any figure quoted this week is not a measurement. A footer reads 'One blank is a design decision. The other is a not-yet.' The OrcaRouter logo is composited in the bottom-right corner.

Dos preguntas diferentes sobre ajuste fino

Dado que ambos son puntos de partida en lugar de servicios terminados, vale la pena ser precisos sobre para qué serían un punto de partida, ya que es ahí donde verdaderamente dejan de parecerse entre sí.

Un checkpoint híbrido de 2,69B es una herramienta para crear un modelo pequeño, barato y especializado. Los usos interesantes son los poco glamorosos: un clasificador que lee un tipo de documento en un flujo de trabajo regulado, un modelo de extracción que convierte un formulario en JSON estructurado, un reescritor específico de dominio que se ejecuta en una sola tarjeta cerca de los datos. El valor proviene de que eres dueño del artefacto después y de que el costo marginal de una llamada es la electricidad. El bucle de entrenamiento es el trabajo, y es un trabajo que puedes empezar hoy.

AREX-2 apunta en la dirección opuesta. La familia AREX no está diseñada para ser ajustada finamente hasta convertirse en un producto; está diseñada para ser llamada como un agente que ejecuta búsquedas, integra evidencia y verifica sus propias respuestas contra restricciones. Si una segunda generación continúa con eso, lo que se estaría evaluando es una trayectoria — cuántos pasos da, si nota una contradicción, si la cifra de confianza de su respuesta candidata significa algo. Eso no es una cuestión de ajuste fino y no es una cuestión de pesos. Es una cuestión de serving, y empieza con que alguien publique los pesos y una tarjeta.

No son sustitutos en ningún tamaño. Un equipo que necesita un modelo que pueda tener en propiedad y reentrenar no está esperando AREX-2. Un equipo que necesita un agente de investigación no va a convertir mediante ajuste fino un híbrido de 2.6B en uno.

Dónde encaja la capa de enrutamiento, para cada uno de ellos

La diferencia práctica entre estos dos se hace evidente en el momento en que un modelo entra en una aplicación, porque ambos tienen relaciones opuestas con el alojamiento.

LFM2.5 2.6B Base no está en el catálogo de OrcaRouter y ninguna variante de LFM2.5 lo está, así que proviene de la distribución propia de Liquid AI y de los habituales hosts de terceros — un artefacto local en lugar de un endpoint enrutado. AREX-Base y AREX-Turbo tampoco están en nuestro catálogo. Lo que una capa de enrutamiento está realmente destinada a hacer en este panorama es el otro lado de la arquitectura: el día que compares tu fine-tune con los modelos a los que tiene que superar, querrás que esa comparación cueste un cambio de configuración en lugar de un ciclo de adquisición. Una API frente a más de 200 modelos, precio de lista del proveedor transferido sin añadir nada por token, una clave para todo el panel y conmutación por error para que una mala tarde de un proveedor no se convierta en la mala tarde de tu evaluación. Esas son las condiciones bajo las cuales una prueba A/B de un modelo no probado es lo bastante barata como para ejecutarla de verdad.

Esa es también la forma honesta de enmarcar al propio AREX-2. Cuando se publique —suponiendo que se publique con pesos abiertos, como hicieron sus dos predecesores—, la forma sensata de probar un agente completamente nuevo en una carga de trabajo real es en una ruta secundaria, detrás de un failover, no como el único proveedor del que depende tu bucle de producción.

Lo que hace una persona razonable con cada uno esta semana

Si tienes una tarea pequeña y específica y datos que no pueden salir de tu infraestructura, el checkpoint Liquid está disponible, es pequeño, tiene una licencia permisiva por debajo de un umbral de ingresos y se puede probar esta tarde. Descárgalo, ejecútalo en tu propio conjunto de evaluación y deja que el resultado decida. Nada relacionado con AREX-2 cambia ese plan.

Si hoy necesitas un comportamiento de investigación de horizonte largo, el modelo al que hay que recurrir es el que ya existe: AREX-Base, lanzado en julio, con benchmarks de agentes publicados que al menos puedes contrastar con un artículo. AREX-2 es un nombre con una marca temporal, y las dos cosas que cambiarían su estatus son visibles desde fuera: si aparecen archivos en el árbol y si aparece junto a ellos una ficha con un número de parámetros y una licencia.

El modo de fallo que este artículo existe para prevenir es aquel en el que un nombre reservado se trata como un elemento de la hoja de ruta. No lo es. Es un repositorio que BAAI creó ayer, y la cantidad correcta de planificación que hay que hacer en torno a él ahora mismo es ninguna.