
Liquid AI d1-omni-600M vs LFM2.5-VL-3M: Uno decide, uno describe
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Liquid AI d1-omni-600M y LFM2.5-VL-3B son ambos pequeños, ambos multimodales, ambos publicados por el mismo laboratorio en Hugging Face bajo la misma licencia lfm1.0, y emparejarlos es un error de categoría que resulta ser útil. LFM2.5-VL-3B llegó el 12 de agosto de 2026 como el modelo de visión-lenguaje de borde de Liquid AI: 3100 millones de parámetros, una ventana de 32.768 tokens y una salida que es prosa. Dale una página escaneada y devuelve la transcripción, con diseño, como texto. Liquid AI d1-omni-600M se subió el 7 de octubre de 2026 con el resto de la familia d1 abierta, y hace lo contrario con las mismas entradas. Es un modelo de decisión de 587 millones de parámetros: adjuntas preguntas con nombre a un estado y reporta lo que ya cree —P(sí), una etiqueta elegida con una confianza, una posición en una escala ordenada de dos a diez— en una sola pasada hacia delante, con cero tokens de salida y nada que analizar después. Si buscabas "el modelo Liquid multimodal pequeño", ahora tienes dos formas delante y la forma es la decisión.
Esta página es lo que realmente establecen las dos fichas de modelo, la publicación del lanzamiento del 7 de octubre y los propios repositorios. También es explícita sobre dónde se detienen. Nada de esta comparación se ha reproducido fuera de Liquid AI y, en el caso de uno de los dos modelos, el proveedor no ha publicado ningún benchmark de precisión específico para su propia capacidad más destacada.
Los dos puntos de control, lado a lado
Las fichas técnicas divergen en casi todos los aspectos, que es lo que cabría esperar de dos modelos que nunca estuvieron destinados a competir por el mismo hueco.
• Qué es — LFM2.5-VL-3B es un modelo generativo de visión-lenguaje que escribe texto; Liquid AI d1-omni-600M es un modelo de decisión que devuelve respuestas estructuradas y no emite tokens
• Parámetros — 3.1B en BF16 para LFM2.5-VL-3B frente a 587M para Liquid AI d1-omni-600M, que a su vez consta de un tronco compartido y una cabeza de decisión de 381M, más un codificador de visión de 94M y un codificador de audio de 112M
• Backbone — LFM2.5-VL-3B combina un modelo de lenguaje LFM2.5-2.6B con un codificador de visión de 400M SigLIP2 NaH optimizado en formas; Liquid AI d1-omni-600M se entrena a partir de LFM2.5-Encoder-350M, un codificador bidireccional, con una torre SigLIP2 tomada de LFM2.5-VL-450M y un FastConformer de 17 capas para
• Entradas — texto e imágenes para LFM2.5-VL-3B; texto más imágenes o texto más hasta 30 segundos de voz para Liquid AI d1-omni-600M, que lanza un ValueError si las imágenes y el audio llegan en la misma solicitud
• Contexto — 32,768 tokens para LFM2.5-VL-3B frente a 16,384 posiciones combinadas de texto, imagen y audio para Liquid AI d1-omni-600M, cuya ficha añade que, cuando hay imágenes presentes, el texto del estado y de la pregunta se recorta a 896 tokens para coincidir con el entrenamiento
• Vocabulario — 128.000 tokens para LFM2.5-VL-3B, 65.536 para Liquid AI d1-omni-600M
• Entorno de ejecución — LFM2.5-VL-3B se ejecuta en transformers y vLLM y tiene un modelo borrador DSpark independiente para decodificación especulativa; Liquid AI d1-omni-600M incluye código personalizado, requiere trust_remote_code=True, y su tarjeta recomienda float16 en GPU mientras advierte que bfloat16 cambió la respuesta principal en algunas filas
• Licencia — lfm1.0 para ambos, lo que permite el ajuste fino y el despliegue
Una línea de esa lista hace más trabajo que todas las demás. Liquid AI d1-omni-600M se basa en un codificador bidireccional en lugar de un decodificador. No se trata de una reducción de tamaño del LFM2.5-VL-3B; es un linaje distinto, y es la razón arquitectónica por la que ambos modelos no pueden intercambiarse entre sí, sin importar cómo se lean las tablas de benchmark.
El contrato de salida decide más que los benchmarks.
Hazle una pregunta a LFM2.5-VL-3B sobre una imagen y obtendrás lenguaje de vuelta. Eso vale dinero cuando la respuesta tiene que ser leída por una persona, registrada como una cadena o alimentada a un paso que espera prosa. También es un riesgo que hay que sortear con ingeniería: la salida generada puede divagar, una solicitud con forma de JSON puede volver con una forma distinta de la que pediste, y cada token se factura y hay que esperar por él. El modelo está explícitamente acotado para trabajo de visión de un solo turno, de alto rendimiento y de baja latencia —OCR por lotes de documentos escaneados, detección en tiempo real en un vehículo, traducción de señalización en el dispositivo— y se le aparta explícitamente de preguntas de contexto largo y con mucha carga de razonamiento, como «¿qué está mal con este plano?».
Liquid AI d1-omni-600M responde a una pregunta estrictamente más estrecha en un entorno estrictamente más fiable. Su interfaz es un estado — texto, JSON, una o más imágenes, o hasta 30 segundos de habla — más un conjunto de preguntas con nombre, cada una declarando su propio tipo. Una noul es una pregunta de sí/no y devuelve P(sí) entre 0 y 1. Una choice es una pregunta que elige una etiqueta de un conjunto que tú nombras y devuelve la etiqueta, una confianza, y la probabilidad de cada opción. Una score es una pregunta que coloca el estado en una escala ordenada de dos a diez niveles y devuelve el nivel esperado con su distribución. Varias preguntas pueden colgar de un estado y se leen de una sola pasada, por lo que el contador de uso de la tarjeta del modelo informa output_tokens: 0. No hay paso de generación, lo que significa que no existe algo como una salida que falle al analizar.
Lo que sacrificas es todo lo que una respuesta generada aporta y una etiqueta no: el razonamiento, la matización, la frase que puedes pegar en un ticket, la capacidad de hacer una pregunta de seguimiento en la misma conversación. Liquid lo dice claramente: el modelo no es un modelo de chat y no escribe texto. Si tu pipeline necesita una explicación junto al veredicto, Liquid AI d1-omni-600M es la mitad equivocada del par, y la respuesta honesta es ejecutar ambos: LFM2.5-VL-3B para producir la lectura de la imagen, Liquid AI d1-omni-600M para producir la decisión sobre ella.

No hay una cifra de visión comparativa directa, y ese es el hallazgo
El siguiente movimiento instintivo es alinear los benchmarks de visión. No puedes. En LFM2.5-VL-3B el proveedor publica un conjunto completo: RefCOCO Macro Precision@1 en 87,9, ScreenSpot-v2 en 80,7, ChartQA en 81,3, POPE en 88,7, MMStar en 63,3, BLINK en 61,5, MuirBench en 58,3, ToolSandBox en 59,5, OCRBench v2 inglés en 47,5, y un RealWorldQA de 73,1 que supera por poco el 71,1 del anterior LFM2-VL-3B. Todos ellos están reportados por el proveedor, ninguno se ha vuelto a ejecutar de forma independiente y, no obstante, son afirmaciones específicas sobre capacidades específicas que un lector puede usar para exigir cuentas al laboratorio.
Para Liquid AI d1-omni-600M, la publicación de lanzamiento dice que Decision Index v0.3 incluye una división privada de visión “sobre la cual no informamos en esta versión”, y que, en su lugar, Liquid validó que el checkpoint de 600M “maneja las tres modalidades”, con la evidencia colocada en demos de playground. Eso es todo el registro publicado sobre visión. No hay ninguna cifra de benchmark de imágenes para este checkpoint, ni en su model card ni en la publicación de lanzamiento. La misma publicación confirma lo que falta en el lado del audio de manera aún más directa: los benchmarks dedicados a decisiones de audio son, en palabras del propio proveedor, “actualmente un problema abierto”.
Así que la interpretación correcta de esta comparación es asimétrica y debería presentarse como tal. LFM2.5-VL-3B ha demostrado capacidad de visión con cifras que la respaldan. Liquid AI d1-omni-600M tiene un codificador de visión tomado prestado de un modelo hermano, un adaptador entrenado contra un backbone congelado, una demo y una promesa. Si tu despliegue necesita que el modelo acierte con las imágenes este mes, el 3B es el único de los dos con algo sobre lo que sostenerse.
Velocidad: solo uno de estos ha sido medido.
Debido a que un modelo de decisión no genera nada, la latencia es la cifra que importa y, una vez más, solo se documenta uno de los lados. LFM2.5-VL-3B se declara a 228 tokens por segundo en un Apple M5 Max y 116 tokens por segundo en un AMD Ryzen AI Max+ 395, ambos dentro de 3,3 GB de memoria, con unos 20 tokens por segundo en un Galaxy S26 Ultra y aproximadamente 11.000 tokens por segundo en una sola H100 con vLLM. Esas cifras describen el rendimiento de decodificación, que es la medición correcta para un modelo que escribe.
Para Liquid AI d1-omni-600M, la ficha indica que no se reportan cifras de inferencia porque el modelo es un lanzamiento de investigación temprana y está en desarrollo activo. El hermano d1-3B de la misma familia sí tiene tablas de latencia: 8 ms para una pregunta en una RTX 4090, 16 ms en una Jetson AGX Thor, 26 ms en una Jetson AGX Orin de 64 GB, 50 ms en una Orin Nano, y tres preguntas sobre un mismo estado cuestan aproximadamente 1,3 veces el tiempo de una. Esas cifras pertenecen al modelo de decisión de 3B y no deben extrapolarse al de 600M. Para Liquid AI d1-omni-600M, la postura honesta es que la arquitectura implica un modelo pequeño y rápido, y nadie fuera del laboratorio ha publicado una cifra en milisegundos.
La huella de pesos al menos puede estimarse. Con la precisión float16 que recomienda la ficha, 587M parámetros equivalen a aproximadamente 1,2 GB de pesos antes de las activaciones —aritmética sobre el recuento de parámetros publicado, no una medición del proveedor— frente a los menos de 3,3 GB que Liquid reporta para LFM2.5-VL-3B. En un dispositivo donde los megabytes son la restricción, esa diferencia es el argumento a favor del 600M.

Cómo elegir entre ellos
La elección queda resuelta sin ambigüedad una vez que el contrato de salida se considera fijo y no negociable.
Recurre a LFM2.5-VL-3B cuando el resultado sea texto: OCR de página completa con anotación de diseño, grounding y detección a partir de consultas en lenguaje natural, traducción de carteles en el dispositivo, cualquier paso en el que un humano o un modelo de lenguaje posterior consuma la respuesta. Además, cuenta con un contexto más amplio de 32.768 tokens y, en la práctica, una cobertura lingüística más profunda, porque sus respuestas son lenguaje y no etiquetas.
Recurre a Liquid AI d1-omni-600M cuando el entregable sea una decisión: enrutar un ticket, clasificar un fotograma, moderar un clip, controlar una barrera de seguridad, puntuar una respuesta en una escala del dos al diez —y, de manera única entre estos dos, cuando la entrada es voz. Es el único del par que admite audio, hasta 30 segundos por solicitud, aunque su ficha señala que el audio se entrenó con intercambios entre un hablante de inglés y un asistente, lo que es una descripción limitada del mundo del que provendrán tus llamadas.
No recurras a ninguno de los dos y quédate con un modelo general de visión y lenguaje si la tarea exige razonar sobre la imagen en lugar de leerla o emitir un veredicto sobre ella. Ambas tarjetas de modelo apuntan en sentido contrario a ese caso de uso, y Liquid AI d1-omni-600M no tiene ningún mecanismo para intentarlo.
Probar un checkpoint experimental sin arriesgar todo el pipeline en ello
Liquid AI d1-omni-600M es, según la propia etiqueta del proveedor, una versión de investigación temprana, y su comportamiento en visión y audio no ha sido evaluado con benchmarks. Ese es exactamente el perfil de un modelo que quieres evaluar detrás de un fallback en lugar de delante de los clientes. OrcaRouter enruta más de 200 modelos a través de una sola clave de API con conmutación automática entre proveedores, que es la forma económica de poner un checkpoint como este en una ruta activa: si la ruta experimental se degrada o un proveedor se cae, la solicitud acaba en el fallback sin necesidad de cambiar código. La misma clave transporta todos los modelos a los que el pipeline deriva, al precio de lista de cada proveedor trasladado con un 0 % de margen, así que una rebaja de precio del proveedor es tu precio ese mismo día.
Una advertencia, que menciono porque es fundamental: los modelos abiertos d1 y la familia LFM2.5-VL no están en nuestro catálogo actualmente. El autoalojamiento de los pesos es la vía que el proveedor recomienda para ambos, con soporte de llama.cpp desde el primer día en hardware de Apple, AMD, Qualcomm y NVIDIA, y ejecutarlos en un endpoint alojado implica la propia API del proveedor o plataformas de terceros. Interpretar esta página como una declaración de disponibilidad sería un error.

Qué ver
La pregunta interesante no es si el 600M acabará superando al 3B en algo —no lo hará, y no se construyó para eso—. Es si Liquid AI publica la partición privada de visión que retuvo, y si alguien construye el benchmark de decisión de audio que, según el laboratorio, aún no existe. Hasta que uno de esos se materialice, una comparación entre Liquid AI d1-omni-600M y LFM2.5-VL-3B es una comparación entre un modelo medido y uno plausible. Para el trabajo no medido —voz de entrada, veredicto de salida, lo bastante pequeño para caber en el dispositivo—, el 600M es el único checkpoint de pesos abiertos de esta familia que lo intenta, y ser el primero sin una tabla de puntuaciones sigue siendo ser el primero.
OrcaRouter enruta más de 200 modelos a través de una sola clave de API, con el precio de lista de cada proveedor aplicado con un 0 % de margen de beneficio, de modo que una rebaja de precio del proveedor es tu precio ese mismo día.
