
TwIL-LM3-Pro vs LFM2.5 2.6B Base: Uno está terminado, el otro es un punto de partida
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 219 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Lo más revelador de la comparación publicada entre TwIL-LM3-Pro y LFM2.5 2.6B Base es que webAI no publicó ninguna contra el 2.6B en absoluto. Las tablas Track A y Track B de webAI enfrentan a su especialista en lógica formal de 3.66B contra una variedad de oponentes — su propia base Granite, VibeThinker-3B, Qwen3-8B, Qwen3.5-4B, Llama-3.2-3B, gpt-oss-120b — y la entrada de Liquid AI que eligieron es LFM2.5-8B-A1B, no el 2.6B. El 2.6B que sí aparece en la tabla es `LFM2-2.6B`, la generación anterior, que es un modelo diferente con una ejecución de preentrenamiento diferente. Esa omisión no es un descuido. LFM2.5 2.6B Base es un checkpoint preentrenado sin ajuste de instrucciones, y los benchmarks de seguimiento de instrucciones no son una prueba para la que fue creado.
Así que esta página compara un artefacto terminado con una materia prima. El encuadre al estilo Aion —un modelo tiene una puntuación y el otro no— encaja, pero la razón es más específica y más interesante: uno está post-entrenado y fusionado, el otro se detiene deliberadamente antes del post-entrenamiento, y los dos documentos que los describen responden a preguntas diferentes a propósito.
Dos recuentos de parámetros que no son la misma medición
TwIL-LM3-Pro tiene 3.66B de parámetros, es denso, y todos ellos están activos en cada token. Desciende de `ibm-granite/granite-4.2-3b` mediante ajuste fino con LoRA, destilación multipath, fusión de checkpoints, una fusión WiSE-FT de vuelta hacia la base, y una etapa GRPO ponderada por entropía — y el artefacto que webAI distribuyó es la política fusionada, no un adaptador LoRA, por lo que se ejecuta de forma independiente.
LFM2.5 2.6B Base tiene 2,69 mil millones de parámetros en 30 capas: 22 bloques de convolución corta con doble compuerta intercalados con 8 capas de atención de consultas agrupadas. Ese diseño híbrido de convolución/atención es la arquitectura en dispositivo de Liquid, y es la razón por la que las cifras de rendimiento de la familia son las que son en lugar de ser una función únicamente del número de parámetros. Se entrenó con 34 billones de tokens, con un vocabulario de 128.000 tokens, y cuenta con una ventana de contexto de 131.072 tokens.
Los dos recuentos difieren entre sí en torno a un 36% y se obtienen mediante arquitecturas completamente distintas, así que ni "3.66B supera a 2.69B" ni lo contrario significan nada como afirmación de calidad. La propia ficha de modelo de webAI apunta esto de forma indirecta cuando se abstiene de comparar la perplejidad del corpus entre tokenizadores: el vocabulario de TwIL-LM3-Pro es de 100,352, el de LFM2.5-2.6B es de 128,000, y la perplejidad es por token.
Qué elimina "Base", y por qué cambia el marcador
Liquid AI publica LFM2.5 2.6B en dos formas: el checkpoint post-entrenado, ajustado para cargas de trabajo agénticas en los harness de agentes más populares, y el Base, descrito en su propia ficha como «el checkpoint preentrenado solo de texto, utilizado para crear todas las variantes de LFM2.5-2.6B». El Base es la entrada del ajuste fino, no un producto. No tiene ajuste por instrucciones, ni una plantilla de chat que merezca ese nombre, ni evaluación publicada — porque evaluar un modelo base en tareas de seguimiento de instrucciones mide lo que no corresponde.
La posición de TwIL-LM3-Pro es la inversa. Todo su valor reside en el stack de post-entrenamiento: webAI informa que, en su propio harness, el pipeline elevó la compuerta macro en el dominio desde el 0,4313 de su base hasta 0,5539, mientras que la macro de los 10 conjuntos de datos reservados se mantuvo estable (de 0,7942 a 0,7901) en lugar de colapsar. La retención en datos reservados es la parte difícil del post-entrenamiento especializado, y es la parte a la que la Base no puede responder.
Aquí es también donde la comparación de tamaños en las tablas de webAI da sus frutos. Se informa que TwIL-LM3-Pro está por delante de LFM2.5-8B-A1B en ambas métricas macro de conjuntos reservados —0,7901 frente a 0,7884 en el conjunto de diez datasets, 0,7425 frente a 0,7378 en el de catorce— con menos de la mitad del número de parámetros de ese modelo MoE. Ese es un resultado genuino en igualdad de condiciones, y está disponible precisamente porque LFM2.5-8B-A1B es un modelo post-entrenado que puede ejecutarse mediante un arnés de instrucciones. El Base no puede, y por eso el 2.6B nunca obtuvo una columna.
Las dimensiones que vale la pena alinear
• Parámetros — TwIL-LM3-Pro 3.66B denso vs LFM2.5 2.6B Base 2.69B (30 capas: 22 conv + 8 GQA).
• Post-entrenamiento — LoRA SFT, destilación, fusión WiSE-FT y GRPO en el paso 2580 frente a ninguno; la Base es la salida del preentrenamiento por diseño.
• Ventana de contexto — 131,072 tokens en ambos, heredados de sus respectivas bases.
• Vocabulario — 100.352 tokens frente a 128.000, por lo que sus perplejidades no son comparables.
• Idiomas — solo inglés frente a diecisiete, incluidos el árabe, el chino, el japonés, el coreano, el español y el tailandés.
• Formato de pensamiento: TwIL-LM3-Pro emite un bloque `<think>` de forma predeterminada y razona extensamente (1.902 tokens en promedio en el dominio, con un 24,2 % de las generaciones que alcanzan el límite de longitud) frente a un checkpoint base sin ningún formato de instrucción.
• Licencia — webAI Non-Commercial License ver. 1.0 vs Liquid's LFM Open License v1.0.
• Para qué sirve — un endpoint de inferencia de lógica formal frente a un punto de partida de ajuste fino.
Las líneas de contexto merecen una nota al pie que ambos modelos aportan: cada uno arrastra 131.072 tokens desde el preentrenamiento, y ningún proveedor validó el comportamiento de contexto largo — la ficha de TwIL-LM3-Pro dice que cada puntuación publicada se midió dentro de una ventana de 8.192 tokens. Las cifras coincidentes aquí son heredadas, no demostradas.
Licencia, y para qué sirve legalmente cada una
La Licencia No Comercial de webAI correspondiente a TwIL-LM3-Pro permite la investigación y el uso personal, y exige un acuerdo por separado con webAI para el despliegue que genere ingresos. LFM2.5 2.6B Base se distribuye bajo la propia LFM Open License v1.0 de Liquid, que la API de Hugging Face reporta como `license: other` en lugar de un identificador SPDX estándar —lee el archivo de licencia antes de hacer planes en torno a ella, porque los términos son propios de Liquid y no una plantilla reconocida.
Ninguna de las dos licencias es Apache 2.0, y es un error tratar los «pesos abiertos» como sinónimo de «permisivo en lo comercial». La diferencia práctica entre ambas radica en qué protegen las licencias: un investigador no comercial puede usar las dos, una empresa que desarrolla un producto necesita revisar ambas, y todo el propósito de Base —ser ajustada para integrarse en el producto de otra persona— hace que sus términos exactos sean más importantes de lo que parecen.
Dónde va cada uno en una pila
Base es la elección correcta cuando tienes la intención de entrenar. Si tu problema es una tarea de etiquetado concreta, una cabeza de clasificación específica del dominio o un ajuste fino con unos pocos miles de ejemplos etiquetados, partir de un checkpoint preentrenado de 2,69B con un amplio vocabulario multilingüe y una arquitectura convolucional híbrida diseñada para el rendimiento es una decisión de ingeniería sensata, y el coste del postentrenamiento que omitirías es el coste que estás pagando deliberadamente a cambio.
TwIL-LM3-Pro es la elección correcta cuando no piensas entrenar y la tarea ya es lógica formal. Las etiquetas de implicación, la formalización de enunciados en Lean, los análisis semánticos y la crítica de demostraciones son las tareas a las que estaba dirigido todo su pipeline, y empezar desde un checkpoint que ya ha pasado por la fase de merge y de refuerzo te ahorra la única parte de esto que es realmente difícil de reproducir: mantener el nivel del conjunto de evaluación reservado mientras ganas en el dominio.
El error es interpretar "especialista post-entrenado de 3.66B" como estrictamente mejor que "checkpoint base de 2.69B". Están en etapas diferentes de la misma línea de producción.
Servirles, o servir a su alrededor
Ninguno de los dos modelos es una ruta en el catálogo de OrcaRouter hoy, y la razón difiere en cada caso. TwIL-LM3-Pro tiene licencia no comercial y no tiene un endpoint alojado; LFM2.5 2.6B Base es un artefacto de fine-tuning que nadie serviría como endpoint de inferencia a propósito. Donde un router se gana su lugar es una capa por encima, en el trabajo que rodea a un especialista: generar y filtrar los datos de entrenamiento con los que harías fine-tuning del Base, ampliar los prompts que alimentarías a un modelo de lógica formal y calificar las salidas. Esas son llamadas de texto, y se ejecutan a través de un endpoint compatible con OpenAI con más de 200 modelos al precio de lista del proveedor con un 0 % de margen añadido, así que un recorte de precios del proveedor llega el mismo día y cambiar de un modelo de generación de datos a otro es una edición de configuración en lugar de una segunda relación con un proveedor.
La conmutación automática por error importa más de lo habitual en un pipeline de ajuste fino, porque un trabajo por lotes que falla al 80% desperdicia toda la ejecución. Una sola clave para los modelos de generación, con un respaldo que la reemita ante un error del proveedor, es una pieza de infraestructura más pequeña que tres integraciones de API.

Cuál, decidido por tu intención
Si estás entrenando, usa el Base. Si estás haciendo inferencia sobre lógica formal y la licencia permite tu uso, usa TwIL-LM3-Pro. Si necesitas hoy un modelo pequeño que siga instrucciones y ninguna de las dos restricciones encaja, usa el hermano post-entrenado de LFM2.5 2.6B —el modelo que Liquid publica realmente para ese propósito— y deja el Base para el fine-tuning que de todos modos tenías planeado.


