
LFM2.5-VL-3B: el nuevo modelo de visión-lenguaje de 3B de Liquid AI para el edge
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
Lo primero que debes saber sobre LFM2.5-VL-3B es que se lanzó en dos semipasos. Los pesos aparecieron en Hugging Face el 11 de agosto de 2026: un checkpoint completo en bf16, una tarjeta de modelo con una tabla de benchmarks y un README en dieciséis idiomas, y sin anuncio adjunto. La tarjeta mostraba cero descargas. Al día siguiente, el 12 de agosto, Liquid AI publicó el artículo oficial, «LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge», y el lanzamiento silencioso se convirtió en uno real. Si estás leyendo esto la misma semana, estás leyendo uno de los primeros análisis independientes de un modelo que casi nadie fuera del laboratorio de Liquid ha ejecutado aún. Así que esto es lo que realmente se puede saber desde el repositorio, y lo que no.
Qué es LFM2.5-VL-3B
LFM2.5-VL-3B es un modelo de visión-lenguaje —entrada de imagen y texto, salida de texto— construido sobre el backbone de texto LFM2.5 de Liquid AI. Concretamente: el modelo de lenguaje es el LFM2.5-2.6B, junto con un codificador de visión SigLIP2 NaFlex 400M, para un total de aproximadamente 3.1 mil millones de parámetros. Mantiene la arquitectura híbrida de la familia: bloques de convolución con compuerta de corto alcance intercalados con atención de consulta agrupada, un vocabulario de 128.000 tokens y una ventana de contexto de 32.768 tokens. Admite dieciséis idiomas (inglés, árabe, chino, francés, alemán, hindi, indonesio, italiano, japonés, coreano, polaco, portugués, ruso, español, tailandés y vietnamita), se distribuye en bfloat16 y está licenciado bajo la licencia abierta lfm1.0 de Liquid.
No es un modelo desde cero. La tarjeta lo describe como una variante multimodal de LFM2.5 que se basa en el anterior LFM2-VL-3B con entrenamiento adicional intermedio y posterior. Ese linaje importa: las capacidades de visión se apilan sobre un modelo de texto ya preentrenado con aproximadamente 34 billones de tokens, por lo que el lado del lenguaje no es un juguete: es el mismo motor de la familia que usan los modelos de texto, con un codificador de visión soldado y reentrenado para tareas de visión.
Qué puede hacer
El informe de Liquid destaca cuatro mejoras con respecto al anterior LFM2-VL-3B: comprensión de pantalla e interfaz de usuario, llamada de funciones, grounding y entrada de múltiples imágenes. En términos sencillos, eso significa:
• Grounding — señala objetos con consultas en lenguaje natural ("la señal de stop", "la columna del precio") y obtén una ubicación normalizada como respuesta.
Comprensión de pantalla: responder preguntas sobre qué hay en la pantalla y dónde, evaluado con ScreenSpot-v2.
• OCR con anotación de diseño — OCR de página completa que también devuelve la estructura del documento, con 23 etiquetas de diseño (texto, título, lista, tabla, título de tabla, gráfico, ecuación, código, encabezados y pies de página, y más) como coordenadas enteras normalizadas.
• Uso de herramientas: un flujo de llamada a funciones en cuatro pasos que toma definiciones de herramientas como JSON, emite llamadas de estilo Python entre los tokens de llamada a herramientas y devuelve una respuesta final en texto plano.
• Entrada de múltiples imágenes: razona sobre varias imágenes en un solo turno.
La propia guía de Liquid sobre dónde no encaja es inusualmente específica. La tarjeta lo recomienda para tareas de un solo turno, alto rendimiento y baja latencia —detección de objetos casi en tiempo real en automoción, OCR por lotes de documentos escaneados, traducción de menús y señales de tráfico en el dispositivo— y advierte explícitamente en contra de trabajos de razonamiento intensivo de contexto largo, diseño web visual y preguntas sobre planos altamente técnicos.
Los números — todos reportados por el proveedor
Cada figura de esta sección proviene de la model card y la publicación del blog de Liquid AI. Nada de esto ha sido reproducido de forma independiente, y hasta que un tercero corra el checkpoint, debes tratar esto como afirmaciones, no como hechos. Esa etiqueta está haciendo un trabajo real aquí, porque el historial es genuinamente sólido sobre el papel:
• Grounding — precisión macro@1 de RefCOCO de 87,9, frente al 57,1 del LFM2-VL-3B anterior — un salto de aproximadamente treinta puntos que Liquid atribuye al post-entrenamiento de visión.
• Comprensión de pantalla — promedio de 80.7 en ScreenSpot-v2, que Liquid reporta por delante del 78.5 que atribuyen a Qwen3.5-4B.
• Uso de herramientas — ToolSandbox 59.5, más del doble de los 26.4 que Liquid obtuvo en LFM2-VL-3B; BFCLv4 32.5, frente a 20.5.
• Razonamiento general de visión — MME 73.1, MMStar 63.3, RealWorldQA 73.1, MMMB 83.0, ChartQA 81.3, MathVista 68.5, POPE 88.7.
• OCR — OCRBenchv2 (subconjunto en inglés) 47,5, frente a 43,9.
• Razonamiento multimodal difícil — MMMU Pro 30.5, BLINK 61.5, MuirBench 58.3 — el punto más débil, como se esperaba para un modelo de 3B.
• Velocidad, ejecutada por el proveedor — 228 tokens/s en un Apple M5 Max, 116 tokens/s en un AMD Ryzen AI Max+ 395 y 20 tokens/s en un Galaxy S26 Ultra, todo dentro de aproximadamente 3.3 GB de memoria. En un H100 con vLLM, Liquid afirma unos 11K tokens de salida/s con alta concurrencia y un tiempo hasta el primer token de aproximadamente 34 ms en un clip de cinco fotogramas, lo que atribuye a que el modelo responde directamente en lugar de razonar.

Son muchas afirmaciones para un solo modelo de 3B, y vale la pena reiterar la advertencia en el pie de página de la propia ficha del modelo: estos son los números de Liquid. La brecha entre «obtiene buenos resultados en una evaluación de laboratorio» y «se sostiene con tus datos» es exactamente donde un modelo tan nuevo suele tropezar.
Lo que aún no se sabe
La lista sincera de preguntas abiertas:
• Sin benchmark independiente — al momento de escribir esto, LFM2.5-VL-3B no aparece en ningún ranking de terceros. Todas las puntuaciones anteriores son reportadas por el proveedor.
• No hay endpoint alojado — ningún proveedor de inferencia lo ofrece todavía. Esta es una historia de autoalojamiento, y punto.
• Sin datos de uso — cero descargas en su primer día significa que no hay comentarios de la comunidad, ni ajustes finos, ni "lo ejecuté en X y se rompió en Y". Los primeros informes del mundo real aún están por llegar.
• Una característica experimental: la salida de anotación de diseño está marcada por el propio Liquid como "experimental" y "puede cambiar, puede no ser confiable y puede no ser trivial de analizar". No construyas tu analizador en torno a ella todavía.
• Cobertura de terceros escasa — la prensa de la primera semana consiste principalmente en resúmenes de noticias breves. Nadie ha realizado una prueba independiente a fondo.

Nada de eso significa que el modelo sea malo. Significa que está sin probar, como lo está cualquier modelo en los días posteriores a su lanzamiento.
Cómo ejecutarlo tú mismo
Para un modelo tan joven, la historia de su ecosistema es inusualmente buena. Las variantes de formato llegaron el mismo día que los pesos: GGUF para llama.cpp, ONNX y cinco cuantizaciones MLX para Apple Silicon, junto con el checkpoint bf16 nativo para Transformers, vLLM y SGLang. Liquid enumera soporte desde el primer día en llama.cpp, MLX, vLLM, SGLang y ONNX, además de una demo de navegador WebGPU. Los parámetros de muestreo recomendados son temperatura 0.2, top_k 50, penalización de repetición 1.0, y la visión se maneja mediante la configuración del procesador del modelo. Si quieres probarlo en un portátil esta noche, las versiones MLX o GGUF son el camino más corto.
Qué ver
Dos cosas determinan si LFM2.5-VL-3B importa más allá del ciclo de hype. Primero, si las cifras de grounding y comprensión de pantalla resisten la reproducción independiente — 80.7 en ScreenSpot-v2 y 87.9 en RefCOCO son las dos afirmaciones que más vale la pena comprobar, porque son las que convertirían a este en un modelo edge genuinamente disruptivo. Segundo, si aparece un endpoint alojado, porque eso cambia el cálculo de "proyecto interesante de autoalojamiento" a "listo para lanzar hoy". Y es precisamente entonces cuando una capa de enrutamiento justifica su existencia: una API para más de 200 modelos significa que el día en que Liquid o un proveedor levante un endpoint, añades LFM2.5-VL-3B junto a los modelos que ya invocas sin cambiar tu integración, al precio de lista del proveedor con cero recargo, y el failover automático te permite dirigir tráfico real hacia él mientras un modelo probado cubre las llamadas en las que falla. Hasta entonces, es una historia prometedora de autoalojamiento — y para un modelo de una semana de vida, eso ya es más de lo que consiguen la mayoría de los lanzamientos.

