Una tarjeta de título generada con el encabezado 'TwIL-LM3-Pro vs LFM2.5 2.6B Base', con el subtítulo 'Uno está terminado, el otro es un punto de partida', con dos tarjetas redondeadas que dicen 'TwIL-LM3-Pro - entrenado posteriormente y fusionado' y 'LFM2.5 2.6B Base - checkpoint preentrenado'. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

TwIL-LM3-Pro vs LFM2.5 2.6B Base: Uno está terminado, el otro es un punto de partida

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Lo más revelador de la comparación publicada entre TwIL-LM3-Pro y LFM2.5 2.6B Base es que webAI no publicó ninguna contra el 2.6B en absoluto. Las tablas Track A y Track B de webAI enfrentan a su especialista en lógica formal de 3.66B contra una variedad de oponentes — su propia base Granite, VibeThinker-3B, Qwen3-8B, Qwen3.5-4B, Llama-3.2-3B, gpt-oss-120b — y la entrada de Liquid AI que eligieron es LFM2.5-8B-A1B, no el 2.6B. El 2.6B que sí aparece en la tabla es `LFM2-2.6B`, la generación anterior, que es un modelo diferente con una ejecución de preentrenamiento diferente. Esa omisión no es un descuido. LFM2.5 2.6B Base es un checkpoint preentrenado sin ajuste de instrucciones, y los benchmarks de seguimiento de instrucciones no son una prueba para la que fue creado.

Así que esta página compara un artefacto terminado con una materia prima. El encuadre al estilo Aion —un modelo tiene una puntuación y el otro no— encaja, pero la razón es más específica y más interesante: uno está post-entrenado y fusionado, el otro se detiene deliberadamente antes del post-entrenamiento, y los dos documentos que los describen responden a preguntas diferentes a propósito.

Dos recuentos de parámetros que no son la misma medición

TwIL-LM3-Pro tiene 3.66B de parámetros, es denso, y todos ellos están activos en cada token. Desciende de `ibm-granite/granite-4.2-3b` mediante ajuste fino con LoRA, destilación multipath, fusión de checkpoints, una fusión WiSE-FT de vuelta hacia la base, y una etapa GRPO ponderada por entropía — y el artefacto que webAI distribuyó es la política fusionada, no un adaptador LoRA, por lo que se ejecuta de forma independiente.

LFM2.5 2.6B Base tiene 2,69 mil millones de parámetros en 30 capas: 22 bloques de convolución corta con doble compuerta intercalados con 8 capas de atención de consultas agrupadas. Ese diseño híbrido de convolución/atención es la arquitectura en dispositivo de Liquid, y es la razón por la que las cifras de rendimiento de la familia son las que son en lugar de ser una función únicamente del número de parámetros. Se entrenó con 34 billones de tokens, con un vocabulario de 128.000 tokens, y cuenta con una ventana de contexto de 131.072 tokens.

Los dos recuentos difieren entre sí en torno a un 36% y se obtienen mediante arquitecturas completamente distintas, así que ni "3.66B supera a 2.69B" ni lo contrario significan nada como afirmación de calidad. La propia ficha de modelo de webAI apunta esto de forma indirecta cuando se abstiene de comparar la perplejidad del corpus entre tokenizadores: el vocabulario de TwIL-LM3-Pro es de 100,352, el de LFM2.5-2.6B es de 128,000, y la perplejidad es por token.

Qué elimina "Base", y por qué cambia el marcador

Liquid AI publica LFM2.5 2.6B en dos formas: el checkpoint post-entrenado, ajustado para cargas de trabajo agénticas en los harness de agentes más populares, y el Base, descrito en su propia ficha como «el checkpoint preentrenado solo de texto, utilizado para crear todas las variantes de LFM2.5-2.6B». El Base es la entrada del ajuste fino, no un producto. No tiene ajuste por instrucciones, ni una plantilla de chat que merezca ese nombre, ni evaluación publicada — porque evaluar un modelo base en tareas de seguimiento de instrucciones mide lo que no corresponde.

La posición de TwIL-LM3-Pro es la inversa. Todo su valor reside en el stack de post-entrenamiento: webAI informa que, en su propio harness, el pipeline elevó la compuerta macro en el dominio desde el 0,4313 de su base hasta 0,5539, mientras que la macro de los 10 conjuntos de datos reservados se mantuvo estable (de 0,7942 a 0,7901) en lugar de colapsar. La retención en datos reservados es la parte difícil del post-entrenamiento especializado, y es la parte a la que la Base no puede responder.

Aquí es también donde la comparación de tamaños en las tablas de webAI da sus frutos. Se informa que TwIL-LM3-Pro está por delante de LFM2.5-8B-A1B en ambas métricas macro de conjuntos reservados —0,7901 frente a 0,7884 en el conjunto de diez datasets, 0,7425 frente a 0,7378 en el de catorce— con menos de la mitad del número de parámetros de ese modelo MoE. Ese es un resultado genuino en igualdad de condiciones, y está disponible precisamente porque LFM2.5-8B-A1B es un modelo post-entrenado que puede ejecutarse mediante un arnés de instrucciones. El Base no puede, y por eso el 2.6B nunca obtuvo una columna.

Las dimensiones que vale la pena alinear

• Parámetros — TwIL-LM3-Pro 3.66B denso vs LFM2.5 2.6B Base 2.69B (30 capas: 22 conv + 8 GQA).

• Post-entrenamiento — LoRA SFT, destilación, fusión WiSE-FT y GRPO en el paso 2580 frente a ninguno; la Base es la salida del preentrenamiento por diseño.

• Ventana de contexto — 131,072 tokens en ambos, heredados de sus respectivas bases.

• Vocabulario — 100.352 tokens frente a 128.000, por lo que sus perplejidades no son comparables.

• Idiomas — solo inglés frente a diecisiete, incluidos el árabe, el chino, el japonés, el coreano, el español y el tailandés.

• Formato de pensamiento: TwIL-LM3-Pro emite un bloque `<think>` de forma predeterminada y razona extensamente (1.902 tokens en promedio en el dominio, con un 24,2 % de las generaciones que alcanzan el límite de longitud) frente a un checkpoint base sin ningún formato de instrucción.

• Licencia — webAI Non-Commercial License ver. 1.0 vs Liquid's LFM Open License v1.0.

• Para qué sirve — un endpoint de inferencia de lógica formal frente a un punto de partida de ajuste fino.

Las líneas de contexto merecen una nota al pie que ambos modelos aportan: cada uno arrastra 131.072 tokens desde el preentrenamiento, y ningún proveedor validó el comportamiento de contexto largo — la ficha de TwIL-LM3-Pro dice que cada puntuación publicada se midió dentro de una ventana de 8.192 tokens. Las cifras coincidentes aquí son heredadas, no demostradas.

Licencia, y para qué sirve legalmente cada una

La Licencia No Comercial de webAI correspondiente a TwIL-LM3-Pro permite la investigación y el uso personal, y exige un acuerdo por separado con webAI para el despliegue que genere ingresos. LFM2.5 2.6B Base se distribuye bajo la propia LFM Open License v1.0 de Liquid, que la API de Hugging Face reporta como `license: other` en lugar de un identificador SPDX estándar —lee el archivo de licencia antes de hacer planes en torno a ella, porque los términos son propios de Liquid y no una plantilla reconocida.

Ninguna de las dos licencias es Apache 2.0, y es un error tratar los «pesos abiertos» como sinónimo de «permisivo en lo comercial». La diferencia práctica entre ambas radica en qué protegen las licencias: un investigador no comercial puede usar las dos, una empresa que desarrolla un producto necesita revisar ambas, y todo el propósito de Base —ser ajustada para integrarse en el producto de otra persona— hace que sus términos exactos sean más importantes de lo que parecen.

Dónde va cada uno en una pila

Base es la elección correcta cuando tienes la intención de entrenar. Si tu problema es una tarea de etiquetado concreta, una cabeza de clasificación específica del dominio o un ajuste fino con unos pocos miles de ejemplos etiquetados, partir de un checkpoint preentrenado de 2,69B con un amplio vocabulario multilingüe y una arquitectura convolucional híbrida diseñada para el rendimiento es una decisión de ingeniería sensata, y el coste del postentrenamiento que omitirías es el coste que estás pagando deliberadamente a cambio.

TwIL-LM3-Pro es la elección correcta cuando no piensas entrenar y la tarea ya es lógica formal. Las etiquetas de implicación, la formalización de enunciados en Lean, los análisis semánticos y la crítica de demostraciones son las tareas a las que estaba dirigido todo su pipeline, y empezar desde un checkpoint que ya ha pasado por la fase de merge y de refuerzo te ahorra la única parte de esto que es realmente difícil de reproducir: mantener el nivel del conjunto de evaluación reservado mientras ganas en el dominio.

El error es interpretar "especialista post-entrenado de 3.66B" como estrictamente mejor que "checkpoint base de 2.69B". Están en etapas diferentes de la misma línea de producción.

Servirles, o servir a su alrededor

Ninguno de los dos modelos es una ruta en el catálogo de OrcaRouter hoy, y la razón difiere en cada caso. TwIL-LM3-Pro tiene licencia no comercial y no tiene un endpoint alojado; LFM2.5 2.6B Base es un artefacto de fine-tuning que nadie serviría como endpoint de inferencia a propósito. Donde un router se gana su lugar es una capa por encima, en el trabajo que rodea a un especialista: generar y filtrar los datos de entrenamiento con los que harías fine-tuning del Base, ampliar los prompts que alimentarías a un modelo de lógica formal y calificar las salidas. Esas son llamadas de texto, y se ejecutan a través de un endpoint compatible con OpenAI con más de 200 modelos al precio de lista del proveedor con un 0 % de margen añadido, así que un recorte de precios del proveedor llega el mismo día y cambiar de un modelo de generación de datos a otro es una edición de configuración en lugar de una segunda relación con un proveedor.

La conmutación automática por error importa más de lo habitual en un pipeline de ajuste fino, porque un trabajo por lotes que falla al 80% desperdicia toda la ejecución. Una sola clave para los modelos de generación, con un respaldo que la reemita ante un error del proveedor, es una pieza de infraestructura más pequeña que tres integraciones de API.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs LFM2.5 2.6B Base - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Post-training SFT, merge, GRPO; Context 131,072 tokens; Vocabulary 100,352; Languages English; Licence non-commercial. LFM2.5 2.6B Base: Parameters 2.69B (30 layers); Post-training none by design; Context 131,072 tokens; Vocabulary 128,000; Languages 17; Licence LFM Open License v1.0. A footer line reads 'Both vendor-reported; neither model has a third-party evaluation.' The OrcaRouter logo is composited in the bottom-right corner.

Cuál, decidido por tu intención

Si estás entrenando, usa el Base. Si estás haciendo inferencia sobre lógica formal y la licencia permite tu uso, usa TwIL-LM3-Pro. Si necesitas hoy un modelo pequeño que siga instrucciones y ninguna de las dos restricciones encaja, usa el hermano post-entrenado de LFM2.5 2.6B —el modelo que Liquid publica realmente para ese propósito— y deja el Base para el fine-tuning que de todos modos tenías planeado.

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-Base, showing the Liquid AI author line, the 16-languages tag, the LFM2 and liquid tags, and the card's opening description of LFM2.5 as a family of hybrid models designed for on-device deployment, built on the LFM2 architecture with extended pre-training and reinforcement learning.A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B, the post-trained sibling, showing the 16-languages and LFM2 tags and the card's description of LFM2.5-2.6B as part of the LFM2.5 family with a 128K context window and agentic post-training.