Una tarjeta de título hero con el encabezado 'Liquid AI d1-3B vs LFM2.5-2.6B-Base' y el subtítulo 'el modelo de decisión y su propio ancestro', dibujada como un árbol genealógico de izquierda a derecha: una tarjeta etiquetada como LFM2.5-2.6B-Base pesos sin procesar, una flecha etiquetada como post-entrenamiento, y una tarjeta etiquetada como d1-3B responde preguntas, con un chip de mantener el entrenamiento debajo de la tarjeta izquierda y chips de sí/no, etiqueta y puntuación debajo de la derecha.
Guides & Insights

Liquid AI d1-3B vs LFM2.5-2.6B-Base: El modelo de decisión y su propio ancestro

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Esto no es una batalla entre dos modelos Liquid AI d1-3B. El modelo de decisión de pesos abiertos que Liquid AI publicó el 26 de octubre de 2026 se construyó sobre una base que el proveedor armó a partir de los pesos de LFM2.5-2.6B y la arquitectura troncal de texto de LFM2.5-V-3B. LFM2.5-2.6B-Base es ese primero: el preentrenamiento en bruto que Liquid subió el 26 de octubre de 2026, 2,69B, 34 billones de tokens de entrenamiento, contexto de 131.072 tokens, sin ajuste por instrucciones y sin plantilla de chat. El encuadre honesto de esta comparación es descendiente frente a ancestro: un modelo que ha sido postentrenado para un trabajo muy específico, situado junto al sustrato sin moldear del que fue moldeado. Uno de ellos responde preguntas esta noche. El otro es el punto de partida si la pregunta cuya respuesta necesitas es una que nadie ha planteado todavía.

Lo que realmente es cada uno

Las dos tarjetas de modelo se leen como documentos de distintas etapas de una línea de producción, y las diferencias no son estilísticas.

Liquid AI d1-3B tiene 3,12 mil millones de parámetros, un codificador de visión SigLIP2 NaFlex de 400M, una ventana de contexto de 32.768 tokens, un vocabulario de 128.000 tokens y dieciséis idiomas documentados. Es un modelo de decisión: le das un estado y preguntas con nombre, y devuelve una probabilidad de sí/no, una etiqueta elegida con confianza y una distribución de opciones, o una puntuación ordenada — en una sola pasada hacia delante, sin tokens de salida. Incluye una llamada a system_one para un estado con varias preguntas, una variante por lotes que empaqueta muchas solicitudes sin relleno, y un accesor de probabilities sin procesar para las distribuciones subyacentes. No es un modelo de chat y no escribe texto, y la tarjeta lo dice con esas palabras.

LFM2.5-2.6B-Base lleva 2,69B de parámetros en 30 capas —22 bloques de convolución corta con doble compuerta y 8 bloques de atención con consultas agrupadas—, entrenado con 34 billones de tokens y ampliado a un contexto de 131.072 tokens durante el entrenamiento intermedio, con el mismo vocabulario de 128.000 tokens y los mismos dieciséis idiomas. Es un checkpoint preentrenado solo de texto, sin ajuste por instrucciones, sin benchmarks en su tarjeta y con una recomendación que se lee como una advertencia: úsalo únicamente para tareas que requieran un ajuste fino intensivo. Completa texto. No sigue instrucciones.

Ambas son descargas sin restricciones bajo la propia licencia abierta de Liquid. Ambas priorizan el texto. Ninguna de las dos está en nuestro catálogo, y nada de lo aquí expuesto constituye una afirmación de disponibilidad para ninguna de las dos.

A two-column scoreboard for Liquid AI d1-3B and LFM2.5-2.6B-Base. The d1-3B column reads: role post-trained decision model; 3.12B parameters; 32,768-token context; text and image input; Decision Index 48.57 (vendor); answers a question in 8 ms. The base column reads: role raw pre-trained base; 2.69B parameters; 131,072-token context; text-only input; Decision Index not scoreable; answers a question only after you fine-tune. The footer reads 'd1-3B figures vendor-reported; the base checkpoint publishes no benchmark table.'

El linaje es la parte

Liquid no ajustó un modelo nuevo desde cero para el lanzamiento de d1. Promedió dos checkpoints —LFM2.5-2.6B y la torre de texto de LFM2.5-VL-3B— para obtener un mejor punto de partida, y luego realizó varias ejecuciones de ajuste fino con distintas semillas aleatorias y mezclas de datos, y las fusionó de nuevo. La explicación del proveedor sobre lo que mejoró el resultado está llamativamente carente de técnicas exóticas: entrenar con entradas largas, barajar el orden en que aparecen las opciones de respuesta y eliminar atajos de los datos de entrenamiento hicieron más que cualquier método avanzado que probaron.

Ese detalle de la eliminación de atajos merece que nos detengamos, porque nombra el fallo que esta categoría existe para evitar. Un modelo entrenado para responder preguntas de opción múltiple aprenderá encantado que la opción B suele ser la correcta, o que gana la opción más larga. Barajar el orden de las opciones durante el entrenamiento es lo que lo detiene. Un modelo de decisión que ha aprendido un prior de posición en lugar de leer el estado es peor que inútil —está equivocado con confianza a escala—, y es justamente lo que separa a un verdadero modelo de decisión de un clasificador con un prompt.

También hay una regresión que merece nombrarse sin rodeos, porque el proveedor no lo hace: el checkpoint base tiene una ventana de contexto de 131.072 tokens y Liquid AI d1-3B tiene 32.768. El post-entrenamiento hacia un modelo de decisión costó tres cuartas partes del contexto utilizable. Si imaginabas que el descendiente domina estrictamente a su ancestro en todos los ejes, no lo hace, y las decisiones sobre documentos largos son el eje donde el checkpoint más antiguo tiene más espacio —en principio, aunque no tiene una cabeza de decisión con la que usarlo.

El marcador, con la asimetría adjunta

Comparar estos dos en los benchmarks es un error de categoría, pero es un error de categoría con una forma informativa, así que aquí está con las salvedades en su sitio. Cada cifra de d1-3B es de Liquid, puntuada por el proveedor con el evaluador oficial en lugar de enviarse a una tabla de clasificación pública, y no ha sido reproducida por ningún tercero. Cada cifra de LFM2.5-2.6B-Base está ausente porque un modelo base no tiene nada que medir.

• Decision Index 0.2.1 — Liquid AI d1-3B 48.57, primero entre todo lo que está por debajo de 10B en la tabla del proveedor y por delante de un modelo de decisión doce veces más grande. LFM2.5-2.6B-Base — no, no puntuable sin una cabeza de decisión.

• Evaluaciones comparativas de texto — Liquid AI d1-3B promedia 82,9 en siete evaluaciones comparativas públicas que abarcan comprensión, toxicidad, intención, preguntas y respuestas médicas y comprensión interlingüística. LFM2.5-2.6B-Base no publica ninguna tabla de evaluaciones comparativas en absoluto.

• Visión — Liquid AI d1-3B promedia 74,1 en once benchmarks de imágenes interpretados como decisiones; eliminar las imágenes reduce las mismas preguntas a 45,1. LFM2.5-2.6B-Base es solo texto, sin torre de visión.

• Parámetros — 3,12B frente a 2,69B. El modelo de decisión es el mayor de los dos, lo que es lo contrario del relato habitual posterior al entrenamiento.

• Contexto — 32,768 tokens frente a 131,072. El ancestro gana esta fila y es la única fila que gana.

• Latencia — Liquid AI d1-3B responde una sola pregunta en 8 ms en una RTX 4090 y en 50 ms en una Jetson Orin Nano, y ejecuta 64 estados empaquetados a 475 por segundo en la 4090. LFM2.5-2.6B-Base no tiene latencia que citar hasta que lo ajustas con fine-tuning para convertirlo en algo que responda a una pregunta, y en ese momento el número es el de tu ajuste.

A capture of Liquid AI's documentation page for its decision models, showing the left-hand navigation including Decision Models and Liquid Nanos, the 'Open d1' banner announcing that visitors can now run d1-3B and d1-omni-600M locally, and the page's opening description of purpose-built models for structured decisions such as classification, routing and scoring in a single call with zero generation.

Entre lo que estás eligiendo, en la práctica

La regla de decisión aquí es inusualmente clara, porque los dos puntos de control no compiten por la misma línea presupuestaria.

Elija Liquid AI d1-3B cuando la pregunta ya existe y es una de las tres formas que maneja un modelo de decisión: un sí o un no, una selección de un conjunto con nombre, o una valoración en una escala ordenada. Las aplicaciones publicadas son todas tareas de producción reconocibles —triaje y enrutamiento, moderación, clasificación de intención y tema, comprobaciones de extracción, reordenación, barreras de seguridad para agentes e inspección visual. Los números de la demo que el proveedor realizó el 5 de octubre comparan a d1 con GPT-6.1 Sol y Claude Opus 5.5 en seis de esas tareas, y se afirma que iguala o supera a GPT-6.1 Sol en cuatro mientras cuesta entre 19 y 200 veces menos; la página de metodología declara claramente que cada aplicación se ejecutó una vez por modelo, así que considere la forma de la afirmación como el hallazgo, no los decimales. La verdaderamente llamativa es la demo de inspección: clasificación de buenos frente a defectuosos en cuatro líneas de producción con una precisión del 85 al 97 % en una tarea para la que el modelo nunca fue entrenado, entendida a partir de una breve descripción.

Elige LFM2.5-2.6B-Base cuando la pregunta aún no existe. Es el punto de partida más barato para un fine-tune que pretendes poseer — una cabeza de decisión de dominio, un clasificador a medida, una tarea para la que nadie tiene un checkpoint. Heredas la arquitectura, el tokenizador y el contexto largo, y pagas en cómputo, datos y evaluación. Dos de las cuatro aplicaciones que el proveedor construyó en torno a d1 partieron de proyectos de código abierto en lugar de desde cero, lo que es una imagen justa de lo que realmente produce un checkpoint base más disciplina.

La trampa práctica es tratar el checkpoint base como un sustituto directo. No es un asistente, no seguirá un prompt y, evaluado como modelo de chat, obtiene una puntuación cercana a cero —lo cual no es un hecho sobre su calidad, sino un hecho sobre lo que significa «base».

Autoalojar cualquiera de los dos, y la capa superior

Ambos llegan como pesos, y el proveedor hizo el trabajo de despliegue por el lado de d1: compatibilidad con llama.cpp desde el primer día, la pila completa de NVIDIA desde DGX hasta Jetson, cuantización NVFP4, una variante de pesos y activaciones de 8 bits, y conversiones a GGUF en Hugging Face. El checkpoint base tiene sus propias variantes en GGUF, ONNX y MLX a través de la familia LFM2.5 más amplia. Si prefieres no alojar nada, Liquid sirve la versión alojada del d1 desde su propia API, con precios basados únicamente en tokens de entrada, y las imágenes se facturan a 1,5 tokens por parche de 32×32 píxeles; también hay acceso solo de texto a través de plataformas de terceros.

Lo que ninguna de las dos rutas cambia es el resto del stack. Un modelo que alojas es un modelo que tienes que mantener vivo, versionar y con conmutación por error — y las decisiones que alimenta siguen aterrizando junto a las llamadas generativas que no alojas. Esa mezcla es la capa que un router colapsa: un único endpoint en más de 200 modelos, precios de lista de los proveedores transferidos con un 0% de margen para que un cambio de precio de un proveedor esté activo en tu lado el mismo día, y conmutación por error automática para que una mala tarde de un proveedor upstream no se convierta en tu caída. Alojar por tu cuenta un modelo de decisión de 3B junto a ello hace que la cuestión del enrutamiento sea más nítida en lugar de más laxa, porque ahora posees la mitad del pipeline y alquilas la otra mitad.

¿Cuál, para quién?

Si la pregunta que necesitas responder esta semana es una de las tres formas que adopta un modelo de decisión, y es una pregunta que alguien más ya imaginó, el descendiente está terminado y es gratuito y se ejecuta en 50 ms en un dispositivo sin GPU — toma Liquid AI d1-3B y asunto resuelto.

Si estás construyendo eso que responde a una pregunta que nadie ha formulado todavía, y tienes los datos y la capacidad de cómputo para adueñarte de eso, LFM2.5-2.6B-Base es el punto de partida honesto, y vale la pena saber que el descendiente de este artículo se creó a partir de él siguiendo exactamente el camino que estás a punto de tomar.

Y si no estás seguro de en cuál de esas dos situaciones te encuentras, la respuesta casi siempre es la primera. El post-entrenamiento para crear una cabeza de decisión es la opción costosa; ejecutar la de otra persona es gratis.

A capture of our own models catalogue page, showing the filter rail for input modalities, context length, input price, status, series and supported parameters, a header reading '207 models, 16 providers, one API key, one bill', sort control set to Newest, a model listing beginning with openai/gpt-5-search-api-2025-10-14, and a 'How to call any model' panel with the OpenAI-compatible endpoint https://api.orcarouter.ai/v1/chat/completions.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario