
LFM2.5-2.6B-Base: el lanzamiento más silencioso de Liquid AI es el que los ajustadores finos realmente querían
- qwenNUEVOQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 por 1M de tokens · 56 tok/s
- deepseekNUEVODeepSeek: DeepSeek V4 Flash 07312026-07-3150Inteligencia69Código
- qwenNUEVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 201 tok/s
- orcaNUEVOOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNUEVOAnthropic: Claude Opus 52026-07-2461Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2150Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1651Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1557Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Inteligencia77Código
- grokxAI: Grok 4.52026-07-0854Inteligencia72Código
- tencentTencent: Hy32026-07-0641Inteligencia59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencia42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencia39Código
- anthropicAnthropic: Claude Sonnet 52026-06-3053Inteligencia72Código
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligencia52Código57Matemáticas
- z-aiZ.ai: GLM 5.22026-06-1651Inteligencia69Código60Matemáticas
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Inteligencia61Código61Matemáticas
Al revisar los contadores de Hugging Face el 5 de agosto de 2026, la brecha es difícil de pasar por alto: LFM2.5-2.6B, el modelo agéntico en el dispositivo que Liquid AI lanzó el 4 de agosto, registra 47,393 descargas. LFM2.5-2.6B-Base, el checkpoint preentrenado del que descienden todos esos pesos, se sitúa en 151. Misma organización, misma arquitectura, misma semana, una proporción de 314 a 1.
El checkpoint base no fue filtrado ni ocultado. Apareció en la publicación de lanzamiento de Liquid en exactamente un paréntesis — "El modelo base (LFM2.5-2.6B-Base) y el post-entrenado (LFM2.5-2.6B) están disponibles hoy en Hugging Face" — y esa es toda la información publicada al respecto. Sin benchmarks propios, sin sección, sin tarjeta separada. Todo lo siguiente se lee directamente del repositorio — la tarjeta del modelo, config.json, el LICENSE archivo y la API de Hugging Face — además de los cálculos que hicimos nosotros. Cuando un número proviene de las evaluaciones propias de Liquid, lo decimos, porque para este checkpoint en particular el dato más importante es lo poco que realmente se ha medido.
Eso importa más de lo que sugiere una nota al pie. {{1}}Un modelo post-entrenado se puede juzgar probándolo.{{/1}} {{2}}Un checkpoint base es una oferta para gastar dos semanas y un presupuesto de GPU antes de aprender nada,{{/2}} así que los términos de la oferta — {{3}}qué contiene, para qué está licenciado, qué ha sido evaluado{{/3}} — son toda la decisión.
¿Qué hay realmente en el repositorio?
Nueve archivos, un fragmento de pesos, sin código de modelado. La lista de especificaciones de la tarjeta, corroborada contra config.json:
• 2.69B de parámetros totales, bfloat16, en un único archivo de 5.39 GB llamado model.safetensors. Planifica el almacenamiento y la VRAM a partir de esa cifra, no de «2.6B».
• 30 layers, hybrid. The card says 22 double-gated short convolution blocks plus 8 GQA attention layers. The layer_types array in config.json confirms it exactly: 22 entries of conv and 8 of full_attention, the attention layers spaced roughly every third or fourth block rather than clustered.
• Ancho oculto de 2048, intermedio de 10752, 32 cabezas de atención sobre 8 cabezas de clave-valor — una relación GQA de 4 a 1 — con embeddings de entrada y salida compartidos y un rope theta de 10,000,000.
• vocabulario de 128,000 tokens, y un tokenizador de 18 MB para acompañarlo. Liquid duplicó el vocabulario en esta generación, lo que supone un costo significativo a 2.6B: con incrustaciones atadas, la tabla de vocabulario por sí sola representa aproximadamente 262M del presupuesto de parámetros, cerca de una décima parte del modelo.
• 34 billones de tokens de entrenamiento. Eso es un proceso de preentrenamiento inusualmente largo para esta clase de tamaño, y es, con diferencia, la razón más fuerte para siquiera considerar el checkpoint.
• 16 idiomas declarados: inglés, árabe, chino, francés, alemán, hindi, indonesio, italiano, japonés, coreano, polaco, portugués, ruso, español, tailandés y vietnamita.
Una inconsistencia para cualquiera que planee trabajo de contexto largo: la ficha anuncia una longitud de contexto de 131,072 tokens, mientras que config.json establece max_position_embeddings en 128,000. El propio blog y los documentos de Liquid dicen 128K. La diferencia de 3,072 tokens no importará a la mayoría, pero si estás escribiendo un script de entrenamiento que empaqueta secuencias hasta el máximo anunciado, confía en el archivo de configuración en lugar de la ficha.
La cadena de arquitectura es el titular práctico: model_type es lfm2 y la clase es Lfm2ForCausalLM — la misma clase que traía LFM2. LFM2.5 es preentrenamiento extendido y nuevo postentrenamiento sobre una arquitectura existente, no una nueva, por lo que nada aquí necesita código de modelado personalizado. Es por eso que llama.cpp, vLLM, MLX, ONNX Runtime, SGLang y LM Studio soportaron esta familia desde el primer día, y por eso la ruta de ajuste fino a través de Unsloth y TRL funciona sin parches. Sí necesitas transformers>=5.0.0.
La tarjeta que recibes es la tarjeta del otro modelo.
Abre el repositorio base y el primer encabezado es "LFM2.5-2.6B" — el nombre del modelo post-entrenado, no el que estás viendo. Esto no es una minucia; toda la página se lee como la tarjeta de instrucciones con un párrafo base insertado, y tres de los artefactos que quedaron pueden costarte un tiempo valioso.

• El frontmatter YAML dice base_mode: LiquidAI/LFM2.5-2.6B-Base. Dos problemas en una sola línea: la clave es un error ortográfico del base_model de Hugging Face, y apunta el repositorio base hacia sí mismo. Nada se rompe, pero los enlaces del árbol de modelos que cabría esperar de un linaje correctamente declarado no se están generando a partir de esto.
• El repositorio está etiquetado como conversational e incluye un chat_template.jinja, por lo que Hugging Face muestra una insignia "Chat template" en un checkpoint que nunca ha sido ajustado con instrucciones. La plantilla existe porque la configuración del tokenizador fue heredada, no porque los pesos sepan qué hacer con ella.
• El fragmento de inicio rápido usa entonces esa plantilla. El ejemplo de Python en la tarjeta base llama a tokenizer.apply_chat_template con un {"role": "user"} mensaje y pregunta «¿Qué es C. elegans?» — la forma clásica de hacer que un modelo base parezca roto. Envuelve un checkpoint preentrenado en bruto en turnos de chat y obtendrás texto que divaga, se repite y se auto-continúa, y es fácil leerlo como un modelo malo en lugar de un formato de prompt incorrecto. Indúcelo como un completador de texto, con pocos ejemplos (few-shot), con secuencias de parada que tú controles.
• La tabla de variantes solo enumera la línea post-entrenada — LFM2.5-2.6B, además de sus versiones GGUF, ONNX y MLX. No hay ninguna versión GGUF o MLX del checkpoint base, así que "ejecutarlo localmente esta noche en LM Studio" no es una opción sin convertirlo tú mismo.
Hugging Face también informa que ningún proveedor de inferencia sirve este repositorio. No hay ningún endpoint alojado para el checkpoint base en ningún lugar; si quieres sus logits, alquilas la GPU.
La sección de benchmark que no existe.
No se ha publicado ni un solo número de evaluación para LFM2.5-2.6B-Base. Ni MMLU, ni MMLU-Pro, ni GPQA, ni HellaSwag, ni ARC, ni cifra de perplejidad: nada, en ninguna de las tres superficies de Liquid (la tarjeta del modelo, el post de lanzamiento, la documentación). Para un checkpoint base, esa es la ausencia más conspicua, porque esas puntuaciones de conocimiento y razonamiento son precisamente cómo se juzga si 34T tokens de preentrenamiento dejaron algo que valga la pena afinar.
Lo que existe pertenece al hermano post-entrenado, es reportado por Liquid y no ha sido reproducido de forma independiente. En las evaluaciones propias de Liquid, LFM2.5-2.6B obtiene 51.87 en AIME25, 59.17 en IFBench, 80.07 en Multi-IF, 56.88 en BFCLv4, 77.83 en ToolSandbox y 26.89 en BrowseComp+ dentro del harness de OpenClaw, medido contra gemma-4-E2B-it (5.1B), gemma-4-E4B-it (8B), Qwen3.5-4B (4.7B) y Qwen3.5-9B (9.7B). El resumen de Liquid es que lidera todos los benchmarks de seguimiento de instrucciones y casi todos los de uso de herramientas, y su propio gráfico es honesto sobre las excepciones: Qwen3.5-9B va por delante en AIME25 con 56.07 y en BFCLv4 con 60.13. Las afirmaciones de velocidad siguen la misma regla — 220 tokens/s de decodificación en un M5 Max, 113 en un Ryzen AI Max+ 395, unos 30 en un teléfono, menos de 2.5 GB de memoria, y aproximadamente 15K tokens/s de salida con alta concurrencia en un H100 — todo medido por el proveedor, nada verificado por nadie más todavía.
La trampa es asumir que algo de eso se transfiere. Esas puntuaciones son el producto de un pipeline de cuatro etapas aplicado sobre este checkpoint: dos rondas de ajuste fino supervisado, especialización de maestros por dominio, destilación on-policy multi-dominio, y luego aprendizaje por refuerzo agéntico con GRPO ejecutado en entornos de prueba reales. La llamada a herramientas y el seguimiento de instrucciones son exactamente los comportamientos que ese pipeline instala. Toma los pesos base y estarás empezando antes de todo eso. Lo que heredas es el pre-entrenamiento — los idiomas, el conocimiento del mundo, la capacidad de contexto largo, la arquitectura híbrida eficiente — y deberías asumir que no heredas nada del marcador agéntico.
151 descargas no es solo temprano — está fuera del patrón de la propia familia
Liquid publica checkpoints base de forma rutinaria, por lo que este lanzamiento no es nada excepcional en su tipo. Lo que es medible es el descuido. Comparar cada repositorio base de LFM2.5 con su homólogo instruct del mismo día arroja una clara norma interna — y un claro valor atípico.

• LFM2.5-230M — 58,676 descargas frente a las 6,982 de su base: aproximadamente 8 a 1.
• LFM2.5-350M — 94.526 frente a 9.397: aproximadamente 10 a 1.
• LFM2.5-1.2B — 583,914 para la versión Instruct frente a 17,867 para la base: aproximadamente 33 a 1.
• LFM2.5-8B-A1B — 171,520 frente a 3,996: aproximadamente 43 a 1.
• LFM2.5-2.6B — 47,393 contra 151: aproximadamente 314 a 1.
Parte de eso es simplemente la edad; el repositorio base se creó el 1 de agosto y el modelo instruct tuvo una ventaja de cuatro días además de una publicación de lanzamiento. Pero los checkpoints base más antiguos de esta familia se situaron entre 8 a 1 y 43 a 1, por lo que un orden de magnitud por encima del peor de ellos es una anomalía real, no un artefacto de redondeo de un repositorio nuevo.
Los 'me gusta' cuentan una historia más sutil. El repositorio base tiene 28 'me gusta' frente a 151 descargas: aproximadamente un marcador por cada cinco descargas. El modelo instruct tiene 232 'me gusta' frente a 47,393, aproximadamente uno por cada 204. La gente está marcando el checkpoint base para volver a él, no descargándolo. Ya existen dos fine-tunes comunitarios y siete cuantizaciones en su árbol de modelos, que es lo que parece el borde de la adopción antes de que llegue el volumen.
"Sin restricciones" no es lo que dice la licencia.
La página de lanzamiento de Liquid describe el lanzamiento como de peso abierto: "Descargar, afinar e implementar sin restricciones." El archivo en el repositorio dice algo más restringido, y esta es la sección que debes leer dos veces si estás considerando construir un producto sobre estos pesos.

La licencia es LFM Open License v1.0 — no Apache-2.0, no MIT, y no los mismos términos que la mayoría de los modelos pequeños de peso abierto con los que probablemente la estés comparando. Citando el archivo directamente, la Sección 5 se titula "Limitación de Uso Comercial" y dice: "Los derechos otorgados bajo esta Licencia para el Uso Comercial están condicionados a que Usted o su Entidad Legal no superen el Umbral," seguido de "Cualquier Uso Comercial de la Obra o de una Obra Derivada por una Entidad Legal que supere el Umbral no está licenciado bajo este Acuerdo." La Sección 1 define el Umbral como "ingresos anuales de 10 millones de dólares estadounidenses ($10,000,000) o más."
Así que la lectura práctica:
• Con menos de $10M en ingresos anuales — usted tiene una licencia amplia, perpetua y libre de regalías que cubre reproducción, obras derivadas, distribución y sublicencia, incluido el uso comercial.
• $10M o más — el uso comercial no está licenciado por este acuerdo. No "requiere atribución", no "requiere notificación". Tienes que hablar con Liquid, que es presumiblemente por lo que la tarjeta termina con un enlace a su equipo de ventas.
• Las obras derivadas heredan la limitación. Su ajuste fino de este checkpoint es una Obra Derivada, por lo que un modelo en cuyo entrenamiento invierte un trimestre conlleva la misma concesión condicionada a ingresos. Si su empresa supera el umbral — o es adquirida por una que ya lo ha superado — los términos de los que depende su producto cambian en su base.
• Las organizaciones sin fines de lucro calificadas quedan excluidas: el Umbral no se aplica a una 501(c)(3) o su equivalente extranjero que utilice la obra con fines no comerciales o de investigación. También se aplican las obligaciones ordinarias: transmitir la licencia, conservar los avisos de atribución y marcar los archivos modificados.
Nada de esto hace que el lanzamiento sea tacaño; un umbral de 10 millones de dólares exime a casi todas las startups y a todos los investigadores, y es una forma legítima de publicar pesos. Pero «sin restricciones» es texto de marketing que la licencia contradice, y el desajuste muerde con más fuerza exactamente aquí. El ajuste fino de un checkpoint base es la forma más cara y menos reversible de adoptar un modelo. Ese es el peor lugar para descubrir una cláusula de ingresos.
¿Quién debería tomar realmente este checkpoint?
La propia guía de Liquid es agradablemente acotada y vale la pena seguirla: la tarjeta dice que el checkpoint preentrenado es "solo recomendado para tareas que requieren un ajuste fino intenso, como asistentes específicos de idioma (p. ej., japonés) o de dominio (p. ej., médicos), entrenamiento con datos propietarios o experimentación con enfoques novedosos de post-entrenamiento". Esa palabra "only" está haciendo un trabajo real. Si quieres un agente en el dispositivo que llame a herramientas, el LFM2.5-2.6B post-entrenado es estrictamente el mejor punto de partida, y el checkpoint base te hará perder el mes.
Los casos en los que es genuinamente la elección correcta:
• Un idioma al que el post-entrenamiento atiende insuficientemente.34T de tokens en 16 idiomas constituyen una base multilingüe sólida, y Liquid ya ha demostrado este patrón internamente con una versión en japonés de la línea 1.2B. Continuar el pre-entrenamiento en tu idioma y luego aplicar tu propio ajuste de instrucciones evita tener que luchar contra una personalidad post-entrenada centrada en el inglés.
• Un sector vertical regulado con datos propietarios. Menos de 2.5 GB en inferencia, sin dependencia de la nube y una licencia lo suficientemente permisiva por debajo del umbral de ingresos es una combinación poco frecuente para despliegues médicos, legales o industriales donde los datos no pueden salir del dispositivo.
• Investigación post-entrenamiento.Liquid publicó su receta — SFT, especialización del profesor, MOPD, RL agéntico — y luego proporcionó la entrada exacta de esa receta junto con la salida. Poder ejecutar tu propio método con los mismos pesos iniciales y compararlo contra una implementación de referencia sólida es inusual y valioso.
• Objetivos de destilación. Un híbrido de 2.6B que decodifica a 220 tokens/s en una laptop es un alumno atractivo para comprimir un maestro mucho más grande en algo que se pueda distribuir.
Ese último par es donde realmente recae el costo, y no son horas de GPU — son datos. El pipeline de Liquid se basa en especialización de maestros y destilación on-policy, lo que significa que el verdadero requisito para reproducir algo similar es un gran volumen de datos generados por modelos más fuertes, además de pares de preferencia y rollouts con recompensa verificable. Es un trabajo de muchos modelos antes de ser un trabajo de entrenamiento: quieres comparar maestros candidatos en tu dominio y luego generar a gran escala a partir del que gane. Es la parte del trabajo a la que apunta nuestro propio producto: OrcaRouter pone más de 200 modelos detrás de una sola clave de API con un margen del 0%, así que lo que pagas por un conjunto de SFT sintético es el precio de lista del proveedor, no una prima de enrutamiento (cuando un proveedor baja precios, eso se traslada a nuestro lado el mismo día); el failover automático evita que una ejecución de generación de veinte horas muera por la mala hora de un proveedor, y el DSL de enrutamiento te permite distribuir un mismo prompt entre varios maestros y quedarte con la mejor respuesta. Para ser claros sobre lo que no ofrecemos: LFM2.5-2.6B-Base no está en OrcaRouter y ningún proveedor de inferencia lo aloja — ejecutas estos pesos tú mismo. Nosotros somos útiles para los maestros, no para el estudiante.
Vale la pena tener en cuenta esa misma división para cualquier cosa que lances. El post de Liquid sostiene que los agentes locales hacen que la inferencia sea gratuita y eliminan el costo por token como restricción, lo cual es cierto para el token marginal, pero no para la factura total — ya la pagaste por adelantado en hardware, y un modelo de 2.6B sigue teniendo un techo. La propia Liquid lo dice, desaconsejando esta familia para trabajo agéntico con mucho código o intensivo en conocimiento. El patrón duradero es un modelo local ajustado que maneja en el dispositivo el camino común de alto volumen y escala la minoría difícil a un modelo de frontera mediante una API, lo que conserva las ventajas de privacidad y latencia donde importan, sin pretender que 2.6B parámetros puedan hacerlo todo.
El camino desde estos pesos hasta algo utilizable
La publicación de lanzamiento no dice nada al respecto, pero la tarjeta base incluye discretamente lo más práctico de todo el repositorio: siete notebooks de Colab listos para ejecutar que cubren las etapas exactas del pipeline que necesita un checkpoint base. Dos de ellos son de preentrenamiento continuado — uno para completar texto y otro para traducción —, que es el paso que solo tiene sentido desde los pesos base y del que nadie escribe tutoriales. El resto cubre el ajuste fino supervisado con Unsloth y TRL, DPO con TRL y GRPO con ambos. Liquid también incluye LEAP Finetune como su propio stack de entrenamiento si prefieres no montar uno.
Al leer la documentación de ajuste fino de Liquid a la luz de la forma de este modelo, la secuencia realista es la siguiente:
• Pruébalo como completador primero, antes de entrenar nada. Ignora la plantilla de chat de la tarjeta. Few-shot, texto sin procesar, tus propias secuencias de parada. Así es como averiguas si el preentrenamiento ya cubre tu dominio e idioma, lo que decide si necesitas preentrenamiento continuado en absoluto o puedes saltar directamente al SFT.
• Continuar el pre-entrenamiento solo si estás añadiendo conocimiento o un idioma. Esta es la rama costosa — a escala de corpus, no de ejemplos — y lo único que el hermano post-entrenado genuinamente no puede darte.
• Luego SFT con LoRA, en 500 a 5,000 ejemplos.La propia guía de Liquid es que la calidad y la distribución superan al volumen, y que los ejemplos deben coincidir con las entradas de producción. Con 2.6B, una pasada de LoRA es corta: la documentación sitúa una ejecución de 1.2B en minutos o decenas de minutos en una GPU moderna, por lo que este tamaño sigue siendo un ciclo de una misma tarde.
• Congela un conjunto de reserva antes de entrenar. Directo, y vale la pena repetirlo en particular para este checkpoint, porque no hay una línea base publicada con la que comparar — tu conjunto de evaluación es el único número que hay.
• Las etapas de preferencia o RL van al final, y solo si el comportamiento es el problema. Existen recetas de DPO y GRPO para la familia, pero son un refinamiento sobre un modelo que ya responde; recurrir a ellas antes de que aterrice SFT es como los proyectos de base-checkpoint se estancan.
Observa lo que no está en esa lista: nada aquí necesita un kernel personalizado, un entrenador parcheado o un archivo de modelado. Debido a que LFM2.5 reutiliza la arquitectura de LFM2, el checkpoint base se integra en la pila estándar, y todo el costo de este proyecto es el corpus y el conjunto de evaluación que construyas para ello.
¿Qué cambiaría el panorama?
Hay tres cosas que vale la pena vigilar, todas ellas baratas de resolver para Liquid y ninguna resuelta hoy.
La primera son las evaluaciones base. Un solo número de MMLU-Pro o GPQA en el checkpoint preentrenado les diría a los fine-tuners más que todos los benchmarks agénticos de la publicación de lanzamiento juntos, y el hecho de que se invirtieron 34T tokens hace que su ausencia sea más curiosa, no menos. La segunda es la propia tarjeta — un repositorio base cuyo título nombra un modelo diferente, cuya guía de inicio rápido aplica una plantilla de chat a un modelo que no es de chat, y cuyo frontmatter escribe malbase_model es un arreglo de diez minutos que evitaría que la gente concluya que los pesos están rotos cuando las instrucciones lo están. La tercera es el informe técnico de LFM2.5. El bloque de citas apunta a arXiv 2511.23404, que es elLFM2 informe técnico de noviembre de 2025; el artículo de la propia generación 2.5 aún no ha salido, por lo que la mezcla de datos de preentrenamiento detrás de esos 34T tokens sigue sin revelarse.
Hasta entonces, el resumen honesto es que se trata de un modelo fundacional de 2.6B bien especificado, con un entrenamiento extenso y una arquitectura eficiente, con un público objetivo inusualmente claro, publicado sin mediciones y con una licencia con tope de ingresos, y hasta ahora casi nadie lo ha sacado de la caja. Si formas parte del público que describe la ficha, merece la pena tu tiempo de GPU — y estarás entre las primeras personas del mundo en saber lo bueno que es en realidad.
Preguntas que valen la pena responder
¿Es este el mismo checkpoint desde el que se realizó el post-entrenamiento de LFM2.5-2.6B, o una ejecución de preentrenamiento separada?
La tarjeta indica que LFM2.5-2.6B-Base «es el checkpoint preentrenado solo de texto, utilizado para crear todas las variantes de LFM2.5-2.6B», por lo que es la entrada real del pipeline publicado, en lugar de una versión paralela o reducida. Eso es lo que lo hace útil para la investigación posterior al entrenamiento: tu método y las cuatro etapas de Liquid parten de los mismos pesos, por lo que una comparación entre ambos es significativa. Vale la pena señalar que el repositorio base se creó el 1 de agosto y se modificó por última vez el 4 de agosto, el día del lanzamiento; revisa el historial de commits antes de asumir que el archivo que descargaste antes es el archivo que se publicó.
¿Puedo ajustarlo y vender el resultado?
Si los ingresos anuales de su entidad jurídica son inferiores a $10,000,000, sí: la subvención LFM1.0 cubre el uso comercial de obras derivadas, siempre que se mantengan la licencia y los avisos de atribución intactos y se marquen los archivos modificados. En ese umbral o por encima de él, el uso comercial del modelo o de cualquier derivado del mismo queda fuera de la licencia y requiere un acuerdo por separado con Liquid. El umbral se aplica a los ingresos de su entidad, no al modelo ni a los ingresos que este genere; por lo tanto, el mismo ajuste fino puede estar licenciado para una empresa y no para otra, y una empresa que supere el umbral al crecer no conserva la subvención que tenía.
¿Por qué no simplemente ajustar el LFM2.5-2.6B post-entrenado?
Para la mayoría de los proyectos deberías hacerlo, y la ficha de Liquid efectivamente lo dice. La razón para partir del checkpoint base es cuando el post-entrenamiento trabaja en tu contra en lugar de a tu favor: el pre-entrenamiento continuado intensivo en un nuevo idioma o en un corpus especializado tiende a dañar de todos modos el comportamiento ajustado por instrucciones, y los patrones de rechazo, las convenciones de llamada a herramientas y el estilo de respuesta incorporados por SFT y RL son difíciles de eliminar y fáciles de contravenir. Si estás añadiendo conocimiento o un idioma, parte de la base. Si estás ajustando el comportamiento en los márgenes, parte del modelo post-entrenado y conserva las cuatro fases de trabajo por las que alguien ya pagó.
