
Liquid AI d1-3B vs LFM2.5-2.6B-Base: El modelo de decisión y su propio ancestro
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Esto no es una batalla entre dos modelos Liquid AI d1-3B. El modelo de decisión de pesos abiertos que Liquid AI publicó el 26 de octubre de 2026 se construyó sobre una base que el proveedor armó a partir de los pesos de LFM2.5-2.6B y la arquitectura troncal de texto de LFM2.5-V-3B. LFM2.5-2.6B-Base es ese primero: el preentrenamiento en bruto que Liquid subió el 26 de octubre de 2026, 2,69B, 34 billones de tokens de entrenamiento, contexto de 131.072 tokens, sin ajuste por instrucciones y sin plantilla de chat. El encuadre honesto de esta comparación es descendiente frente a ancestro: un modelo que ha sido postentrenado para un trabajo muy específico, situado junto al sustrato sin moldear del que fue moldeado. Uno de ellos responde preguntas esta noche. El otro es el punto de partida si la pregunta cuya respuesta necesitas es una que nadie ha planteado todavía.
Lo que realmente es cada uno
Las dos tarjetas de modelo se leen como documentos de distintas etapas de una línea de producción, y las diferencias no son estilísticas.
Liquid AI d1-3B tiene 3,12 mil millones de parámetros, un codificador de visión SigLIP2 NaFlex de 400M, una ventana de contexto de 32.768 tokens, un vocabulario de 128.000 tokens y dieciséis idiomas documentados. Es un modelo de decisión: le das un estado y preguntas con nombre, y devuelve una probabilidad de sí/no, una etiqueta elegida con confianza y una distribución de opciones, o una puntuación ordenada — en una sola pasada hacia delante, sin tokens de salida. Incluye una llamada a system_one para un estado con varias preguntas, una variante por lotes que empaqueta muchas solicitudes sin relleno, y un accesor de probabilities sin procesar para las distribuciones subyacentes. No es un modelo de chat y no escribe texto, y la tarjeta lo dice con esas palabras.
LFM2.5-2.6B-Base lleva 2,69B de parámetros en 30 capas —22 bloques de convolución corta con doble compuerta y 8 bloques de atención con consultas agrupadas—, entrenado con 34 billones de tokens y ampliado a un contexto de 131.072 tokens durante el entrenamiento intermedio, con el mismo vocabulario de 128.000 tokens y los mismos dieciséis idiomas. Es un checkpoint preentrenado solo de texto, sin ajuste por instrucciones, sin benchmarks en su tarjeta y con una recomendación que se lee como una advertencia: úsalo únicamente para tareas que requieran un ajuste fino intensivo. Completa texto. No sigue instrucciones.
Ambas son descargas sin restricciones bajo la propia licencia abierta de Liquid. Ambas priorizan el texto. Ninguna de las dos está en nuestro catálogo, y nada de lo aquí expuesto constituye una afirmación de disponibilidad para ninguna de las dos.

El linaje es la parte
Liquid no ajustó un modelo nuevo desde cero para el lanzamiento de d1. Promedió dos checkpoints —LFM2.5-2.6B y la torre de texto de LFM2.5-VL-3B— para obtener un mejor punto de partida, y luego realizó varias ejecuciones de ajuste fino con distintas semillas aleatorias y mezclas de datos, y las fusionó de nuevo. La explicación del proveedor sobre lo que mejoró el resultado está llamativamente carente de técnicas exóticas: entrenar con entradas largas, barajar el orden en que aparecen las opciones de respuesta y eliminar atajos de los datos de entrenamiento hicieron más que cualquier método avanzado que probaron.
Ese detalle de la eliminación de atajos merece que nos detengamos, porque nombra el fallo que esta categoría existe para evitar. Un modelo entrenado para responder preguntas de opción múltiple aprenderá encantado que la opción B suele ser la correcta, o que gana la opción más larga. Barajar el orden de las opciones durante el entrenamiento es lo que lo detiene. Un modelo de decisión que ha aprendido un prior de posición en lugar de leer el estado es peor que inútil —está equivocado con confianza a escala—, y es justamente lo que separa a un verdadero modelo de decisión de un clasificador con un prompt.
También hay una regresión que merece nombrarse sin rodeos, porque el proveedor no lo hace: el checkpoint base tiene una ventana de contexto de 131.072 tokens y Liquid AI d1-3B tiene 32.768. El post-entrenamiento hacia un modelo de decisión costó tres cuartas partes del contexto utilizable. Si imaginabas que el descendiente domina estrictamente a su ancestro en todos los ejes, no lo hace, y las decisiones sobre documentos largos son el eje donde el checkpoint más antiguo tiene más espacio —en principio, aunque no tiene una cabeza de decisión con la que usarlo.
El marcador, con la asimetría adjunta
Comparar estos dos en los benchmarks es un error de categoría, pero es un error de categoría con una forma informativa, así que aquí está con las salvedades en su sitio. Cada cifra de d1-3B es de Liquid, puntuada por el proveedor con el evaluador oficial en lugar de enviarse a una tabla de clasificación pública, y no ha sido reproducida por ningún tercero. Cada cifra de LFM2.5-2.6B-Base está ausente porque un modelo base no tiene nada que medir.
• Decision Index 0.2.1 — Liquid AI d1-3B 48.57, primero entre todo lo que está por debajo de 10B en la tabla del proveedor y por delante de un modelo de decisión doce veces más grande. LFM2.5-2.6B-Base — no, no puntuable sin una cabeza de decisión.
• Evaluaciones comparativas de texto — Liquid AI d1-3B promedia 82,9 en siete evaluaciones comparativas públicas que abarcan comprensión, toxicidad, intención, preguntas y respuestas médicas y comprensión interlingüística. LFM2.5-2.6B-Base no publica ninguna tabla de evaluaciones comparativas en absoluto.
• Visión — Liquid AI d1-3B promedia 74,1 en once benchmarks de imágenes interpretados como decisiones; eliminar las imágenes reduce las mismas preguntas a 45,1. LFM2.5-2.6B-Base es solo texto, sin torre de visión.
• Parámetros — 3,12B frente a 2,69B. El modelo de decisión es el mayor de los dos, lo que es lo contrario del relato habitual posterior al entrenamiento.
• Contexto — 32,768 tokens frente a 131,072. El ancestro gana esta fila y es la única fila que gana.
• Latencia — Liquid AI d1-3B responde una sola pregunta en 8 ms en una RTX 4090 y en 50 ms en una Jetson Orin Nano, y ejecuta 64 estados empaquetados a 475 por segundo en la 4090. LFM2.5-2.6B-Base no tiene latencia que citar hasta que lo ajustas con fine-tuning para convertirlo en algo que responda a una pregunta, y en ese momento el número es el de tu ajuste.

Entre lo que estás eligiendo, en la práctica
La regla de decisión aquí es inusualmente clara, porque los dos puntos de control no compiten por la misma línea presupuestaria.
Elija Liquid AI d1-3B cuando la pregunta ya existe y es una de las tres formas que maneja un modelo de decisión: un sí o un no, una selección de un conjunto con nombre, o una valoración en una escala ordenada. Las aplicaciones publicadas son todas tareas de producción reconocibles —triaje y enrutamiento, moderación, clasificación de intención y tema, comprobaciones de extracción, reordenación, barreras de seguridad para agentes e inspección visual. Los números de la demo que el proveedor realizó el 5 de octubre comparan a d1 con GPT-6.1 Sol y Claude Opus 5.5 en seis de esas tareas, y se afirma que iguala o supera a GPT-6.1 Sol en cuatro mientras cuesta entre 19 y 200 veces menos; la página de metodología declara claramente que cada aplicación se ejecutó una vez por modelo, así que considere la forma de la afirmación como el hallazgo, no los decimales. La verdaderamente llamativa es la demo de inspección: clasificación de buenos frente a defectuosos en cuatro líneas de producción con una precisión del 85 al 97 % en una tarea para la que el modelo nunca fue entrenado, entendida a partir de una breve descripción.
Elige LFM2.5-2.6B-Base cuando la pregunta aún no existe. Es el punto de partida más barato para un fine-tune que pretendes poseer — una cabeza de decisión de dominio, un clasificador a medida, una tarea para la que nadie tiene un checkpoint. Heredas la arquitectura, el tokenizador y el contexto largo, y pagas en cómputo, datos y evaluación. Dos de las cuatro aplicaciones que el proveedor construyó en torno a d1 partieron de proyectos de código abierto en lugar de desde cero, lo que es una imagen justa de lo que realmente produce un checkpoint base más disciplina.
La trampa práctica es tratar el checkpoint base como un sustituto directo. No es un asistente, no seguirá un prompt y, evaluado como modelo de chat, obtiene una puntuación cercana a cero —lo cual no es un hecho sobre su calidad, sino un hecho sobre lo que significa «base».
Autoalojar cualquiera de los dos, y la capa superior
Ambos llegan como pesos, y el proveedor hizo el trabajo de despliegue por el lado de d1: compatibilidad con llama.cpp desde el primer día, la pila completa de NVIDIA desde DGX hasta Jetson, cuantización NVFP4, una variante de pesos y activaciones de 8 bits, y conversiones a GGUF en Hugging Face. El checkpoint base tiene sus propias variantes en GGUF, ONNX y MLX a través de la familia LFM2.5 más amplia. Si prefieres no alojar nada, Liquid sirve la versión alojada del d1 desde su propia API, con precios basados únicamente en tokens de entrada, y las imágenes se facturan a 1,5 tokens por parche de 32×32 píxeles; también hay acceso solo de texto a través de plataformas de terceros.
Lo que ninguna de las dos rutas cambia es el resto del stack. Un modelo que alojas es un modelo que tienes que mantener vivo, versionar y con conmutación por error — y las decisiones que alimenta siguen aterrizando junto a las llamadas generativas que no alojas. Esa mezcla es la capa que un router colapsa: un único endpoint en más de 200 modelos, precios de lista de los proveedores transferidos con un 0% de margen para que un cambio de precio de un proveedor esté activo en tu lado el mismo día, y conmutación por error automática para que una mala tarde de un proveedor upstream no se convierta en tu caída. Alojar por tu cuenta un modelo de decisión de 3B junto a ello hace que la cuestión del enrutamiento sea más nítida en lugar de más laxa, porque ahora posees la mitad del pipeline y alquilas la otra mitad.
¿Cuál, para quién?
Si la pregunta que necesitas responder esta semana es una de las tres formas que adopta un modelo de decisión, y es una pregunta que alguien más ya imaginó, el descendiente está terminado y es gratuito y se ejecuta en 50 ms en un dispositivo sin GPU — toma Liquid AI d1-3B y asunto resuelto.
Si estás construyendo eso que responde a una pregunta que nadie ha formulado todavía, y tienes los datos y la capacidad de cómputo para adueñarte de eso, LFM2.5-2.6B-Base es el punto de partida honesto, y vale la pena saber que el descendiente de este artículo se creó a partir de él siguiendo exactamente el camino que estás a punto de tomar.
Y si no estás seguro de en cuál de esas dos situaciones te encuentras, la respuesta casi siempre es la primera. El post-entrenamiento para crear una cabeza de decisión es la opción costosa; ejecutar la de otra persona es gratis.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
