Tarjeta de título principal para LFM2.5-VL-3B, con el titular 'LFM2.5-VL-3B' y el subtítulo 'El modelo de visión y lenguaje de 3B de Liquid AI para el edge', una etiqueta que dice 'Nuevo — enviado el 11 de agosto de 2026', y tres iconos de línea plana (marco de imagen, párrafo, ojo).
Guides & Insights

LFM2.5-VL-3B: el nuevo modelo de visión-lenguaje de 3B de Liquid AI para el edge

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Lo primero que debes saber sobre LFM2.5-VL-3B es que se lanzó en dos semipasos. Los pesos aparecieron en Hugging Face el 11 de agosto de 2026: un checkpoint completo en bf16, una tarjeta de modelo con una tabla de benchmarks y un README en dieciséis idiomas, y sin anuncio adjunto. La tarjeta mostraba cero descargas. Al día siguiente, el 12 de agosto, Liquid AI publicó el artículo oficial, «LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge», y el lanzamiento silencioso se convirtió en uno real. Si estás leyendo esto la misma semana, estás leyendo uno de los primeros análisis independientes de un modelo que casi nadie fuera del laboratorio de Liquid ha ejecutado aún. Así que esto es lo que realmente se puede saber desde el repositorio, y lo que no.

Qué es LFM2.5-VL-3B

LFM2.5-VL-3B es un modelo de visión-lenguaje —entrada de imagen y texto, salida de texto— construido sobre el backbone de texto LFM2.5 de Liquid AI. Concretamente: el modelo de lenguaje es el LFM2.5-2.6B, junto con un codificador de visión SigLIP2 NaFlex 400M, para un total de aproximadamente 3.1 mil millones de parámetros. Mantiene la arquitectura híbrida de la familia: bloques de convolución con compuerta de corto alcance intercalados con atención de consulta agrupada, un vocabulario de 128.000 tokens y una ventana de contexto de 32.768 tokens. Admite dieciséis idiomas (inglés, árabe, chino, francés, alemán, hindi, indonesio, italiano, japonés, coreano, polaco, portugués, ruso, español, tailandés y vietnamita), se distribuye en bfloat16 y está licenciado bajo la licencia abierta lfm1.0 de Liquid.

No es un modelo desde cero. La tarjeta lo describe como una variante multimodal de LFM2.5 que se basa en el anterior LFM2-VL-3B con entrenamiento adicional intermedio y posterior. Ese linaje importa: las capacidades de visión se apilan sobre un modelo de texto ya preentrenado con aproximadamente 34 billones de tokens, por lo que el lado del lenguaje no es un juguete: es el mismo motor de la familia que usan los modelos de texto, con un codificador de visión soldado y reentrenado para tareas de visión.

Qué puede hacer

El informe de Liquid destaca cuatro mejoras con respecto al anterior LFM2-VL-3B: comprensión de pantalla e interfaz de usuario, llamada de funciones, grounding y entrada de múltiples imágenes. En términos sencillos, eso significa:

• Grounding — señala objetos con consultas en lenguaje natural ("la señal de stop", "la columna del precio") y obtén una ubicación normalizada como respuesta.

Comprensión de pantalla: responder preguntas sobre qué hay en la pantalla y dónde, evaluado con ScreenSpot-v2.

• OCR con anotación de diseño — OCR de página completa que también devuelve la estructura del documento, con 23 etiquetas de diseño (texto, título, lista, tabla, título de tabla, gráfico, ecuación, código, encabezados y pies de página, y más) como coordenadas enteras normalizadas.

• Uso de herramientas: un flujo de llamada a funciones en cuatro pasos que toma definiciones de herramientas como JSON, emite llamadas de estilo Python entre los tokens de llamada a herramientas y devuelve una respuesta final en texto plano.

• Entrada de múltiples imágenes: razona sobre varias imágenes en un solo turno.

La propia guía de Liquid sobre dónde no encaja es inusualmente específica. La tarjeta lo recomienda para tareas de un solo turno, alto rendimiento y baja latencia —detección de objetos casi en tiempo real en automoción, OCR por lotes de documentos escaneados, traducción de menús y señales de tráfico en el dispositivo— y advierte explícitamente en contra de trabajos de razonamiento intensivo de contexto largo, diseño web visual y preguntas sobre planos altamente técnicos.

Los números — todos reportados por el proveedor

Cada figura de esta sección proviene de la model card y la publicación del blog de Liquid AI. Nada de esto ha sido reproducido de forma independiente, y hasta que un tercero corra el checkpoint, debes tratar esto como afirmaciones, no como hechos. Esa etiqueta está haciendo un trabajo real aquí, porque el historial es genuinamente sólido sobre el papel:

• Grounding — precisión macro@1 de RefCOCO de 87,9, frente al 57,1 del LFM2-VL-3B anterior — un salto de aproximadamente treinta puntos que Liquid atribuye al post-entrenamiento de visión.

• Comprensión de pantalla — promedio de 80.7 en ScreenSpot-v2, que Liquid reporta por delante del 78.5 que atribuyen a Qwen3.5-4B.

• Uso de herramientas — ToolSandbox 59.5, más del doble de los 26.4 que Liquid obtuvo en LFM2-VL-3B; BFCLv4 32.5, frente a 20.5.

• Razonamiento general de visión — MME 73.1, MMStar 63.3, RealWorldQA 73.1, MMMB 83.0, ChartQA 81.3, MathVista 68.5, POPE 88.7.

• OCR — OCRBenchv2 (subconjunto en inglés) 47,5, frente a 43,9.

• Razonamiento multimodal difícil — MMMU Pro 30.5, BLINK 61.5, MuirBench 58.3 — el punto más débil, como se esperaba para un modelo de 3B.

• Velocidad, ejecutada por el proveedor — 228 tokens/s en un Apple M5 Max, 116 tokens/s en un AMD Ryzen AI Max+ 395 y 20 tokens/s en un Galaxy S26 Ultra, todo dentro de aproximadamente 3.3 GB de memoria. En un H100 con vLLM, Liquid afirma unos 11K tokens de salida/s con alta concurrencia y un tiempo hasta el primer token de aproximadamente 34 ms en un clip de cinco fotogramas, lo que atribuye a que el modelo responde directamente en lugar de razonar.

Scoreboard for LFM2.5-VL-3B with one column: Params 3.1B (2.6B LM + 400M vision), Context 32,768 tokens, Vision encoder SigLIP2 NaFlex 400M, Grounding RefCOCO 87.9, Screen understanding ScreenSpot-v2 80.7, Status no hosted endpoint yet. Footer: 'All benchmark figures vendor-reported; no independent scores yet.'

Son muchas afirmaciones para un solo modelo de 3B, y vale la pena reiterar la advertencia en el pie de página de la propia ficha del modelo: estos son los números de Liquid. La brecha entre «obtiene buenos resultados en una evaluación de laboratorio» y «se sostiene con tus datos» es exactamente donde un modelo tan nuevo suele tropezar.

Lo que aún no se sabe

La lista sincera de preguntas abiertas:

• Sin benchmark independiente — al momento de escribir esto, LFM2.5-VL-3B no aparece en ningún ranking de terceros. Todas las puntuaciones anteriores son reportadas por el proveedor.

• No hay endpoint alojado — ningún proveedor de inferencia lo ofrece todavía. Esta es una historia de autoalojamiento, y punto.

• Sin datos de uso — cero descargas en su primer día significa que no hay comentarios de la comunidad, ni ajustes finos, ni "lo ejecuté en X y se rompió en Y". Los primeros informes del mundo real aún están por llegar.

• Una característica experimental: la salida de anotación de diseño está marcada por el propio Liquid como "experimental" y "puede cambiar, puede no ser confiable y puede no ser trivial de analizar". No construyas tu analizador en torno a ella todavía.

• Cobertura de terceros escasa — la prensa de la primera semana consiste principalmente en resúmenes de noticias breves. Nadie ha realizado una prueba independiente a fondo.

Screenshot of the Hugging Face model card for LiquidAI/LFM2.5-VL-3B, showing Image-Text-to-Text, license lfm1.0, 16 languages, 'This model isn't deployed by any Inference Provider', and 228 tok/s on Apple M5 Max / 116 tok/s on AMD Ryzen AI Max+ 395 in under 3.3 GB of memory.

Nada de eso significa que el modelo sea malo. Significa que está sin probar, como lo está cualquier modelo en los días posteriores a su lanzamiento.

Cómo ejecutarlo tú mismo

Para un modelo tan joven, la historia de su ecosistema es inusualmente buena. Las variantes de formato llegaron el mismo día que los pesos: GGUF para llama.cpp, ONNX y cinco cuantizaciones MLX para Apple Silicon, junto con el checkpoint bf16 nativo para Transformers, vLLM y SGLang. Liquid enumera soporte desde el primer día en llama.cpp, MLX, vLLM, SGLang y ONNX, además de una demo de navegador WebGPU. Los parámetros de muestreo recomendados son temperatura 0.2, top_k 50, penalización de repetición 1.0, y la visión se maneja mediante la configuración del procesador del modelo. Si quieres probarlo en un portátil esta noche, las versiones MLX o GGUF son el camino más corto.

Qué ver

Dos cosas determinan si LFM2.5-VL-3B importa más allá del ciclo de hype. Primero, si las cifras de grounding y comprensión de pantalla resisten la reproducción independiente — 80.7 en ScreenSpot-v2 y 87.9 en RefCOCO son las dos afirmaciones que más vale la pena comprobar, porque son las que convertirían a este en un modelo edge genuinamente disruptivo. Segundo, si aparece un endpoint alojado, porque eso cambia el cálculo de "proyecto interesante de autoalojamiento" a "listo para lanzar hoy". Y es precisamente entonces cuando una capa de enrutamiento justifica su existencia: una API para más de 200 modelos significa que el día en que Liquid o un proveedor levante un endpoint, añades LFM2.5-VL-3B junto a los modelos que ya invocas sin cambiar tu integración, al precio de lista del proveedor con cero recargo, y el failover automático te permite dirigir tráfico real hacia él mientras un modelo probado cubre las llamadas en las que falla. Hasta entonces, es una historia prometedora de autoalojamiento — y para un modelo de una semana de vida, eso ya es más de lo que consiguen la mayoría de los lanzamientos.

Screenshot of Liquid AI's announcement blog post 'LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge' dated Aug 12, 2026, showing the opening paragraphs and an evaluations table comparing LFM2.5-VL-3B with Gemma, InternVL, and Qwen models.
© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube