Tarjeta principal con el antetítulo «DOS TRABAJOS DIFERENTES» y el titular «DSpark vs UI-Venus 2.9B», con el subtítulo «Un multiplicador de velocidad de 279,5 M frente a un agente GUI de 9B: la comparación solo tiene sentido cuando dejas de tratarlos como sustitutos». Tres tarjetas dicen «Redactor de 279,5 M: hace más rápido a LFM2.5-VL-3B; por sí solo no produce nada», «Agente GUI de 9B: inclusionAI de Ant Group; hace clic, escribe y navega» y «No son sustitutos: uno es una optimización en tiempo de ejecución y el otro es la política». Un pie de página dice «Las cifras de velocidad fueron medidas por el proveedor, Liquid AI; las puntuaciones del agente fueron reportadas por el proveedor, Ant Group. Ninguna se ha reproducido de forma independiente». El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Engineering & Research

LFM2.5-VL-3B-DSpark vs UI-Venus 2.9B: un multiplicador de velocidad frente a un agente de GUI

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

LFM2.5-VL-3B-DSpark y UI-Venus 2.9B se clasifican bajo el mismo encabezado vago —pequeños modelos de visión— y luego se comparan entre sí, lo cual es un error de categoría que vale la pena corregir antes de que le cueste a alguien una semana de integración. LFM2.5-VL-3B-DSpark es un modelo borrador de 279,5 millones de parámetros que acelera LFM2.5-VL-3B de Liquid AI. UI-Venus 2.9B, del laboratorio inclusionAI de Ant Group, es un agente GUI de 9B que lee capturas de pantalla, decide una acción y la ejecuta en entornos móviles, web y de escritorio. Uno hace que un modelo existente sea más rápido. El otro es el que hace el trabajo. Si lo que necesitas es un agente GUI, el modelo borrador no es una opción más barata: no es una opción en absoluto.

La comparación útil no es cuál es mejor, sino qué problema resuelve cada uno y qué te cuesta cada uno en el proceso. Ambos son además recién llegados con los que el ecosistema en general aún no se ha puesto al día, y la brecha entre lo que afirman sus repositorios y lo que cualquier otra persona ha verificado es mayor en uno de ellos que en el otro.

Qué es cada uno, exactamente

Empieza por las formas, porque explican la mayor parte de lo demás.

• Qué es — LFM2.5-VL-3B-DSpark es un borrador de decodificación especulativa; UI-Venus 2.9B es una política de agente GUI de propósito general

• Parámetros: 279,5M en BF16 para el drafter, frente a 9B para UI-Venus 2.9B inicializado a partir de Qwen3.5-9B

• Capacidad autónoma — el redactor no genera nada utilizable por sí solo y no se puede evaluar de forma aislada; UI-Venus 2.9B funciona como un agente completo

• Entradas — el redactor nunca ve la imagen en sí, solo los estados ocultos del modelo objetivo; UI-Venus 2.9B consume capturas de pantalla directamente y está construido enteramente en torno a ellas

• Salidas — el redactor propone tokens para su verificación; UI-Venus 2.9B emite acciones fundamentadas con cuadros delimitadores sobre una interfaz en vivo

• Base — el borrador está vinculado a LiquidAI/LFM2.5-VL-3B en sus propios metadatos; UI-Venus 2.9B se basa en Qwen3.5-9B

• Contexto — el modelo borrador hereda todo lo que proporcione el modelo objetivo; UI-Venus 2.9B se sirve con un máximo de 262.144 tokens en la propia receta de vLLM del proveedor

• Licencia — ambas están sin resolver, aunque de maneras distintas; Liquid se distribuye bajo la licencia LFM1.0, y la ficha de UI-Venus 2.9B afirma sin rodeos que la licencia de sus pesos está pendiente de confirmación final

A two-panel card titled 'Drafter vs agent - different units', subtitled 'One column measures seconds saved. The other measures tasks completed. They are not on the same axis.' The left panel 'LFM2.5-VL-3B-DSpark' has rows: What it is 'Speculative-decoding drafter', Parameters '279.5M BF16', Base 'LiquidAI/LFM2.5-VL-3B', Runs alone 'No, by construction', Its number '2.04x-3.13x decode', License 'LFM1.0, not OSI'. The right panel 'UI-Venus 2.9B' has rows: What it is 'GUI agent policy', Parameters '9B, from Qwen3.5-9B', Base 'Ant Group inclusionAI', Runs alone 'Yes - a complete agent', Its number '80.2 AndroidWorld', License 'Pending final confirmation'. A strip beneath reads 'Neither figure has been reproduced outside the lab that published it. Treat both as ceilings, not expectations.' The OrcaRouter logo is composited in the bottom-right corner.

Ese último punto es en el que hay que detenerse. Nuestra propia cobertura de UI-Venus-2-9B a finales de agosto describía el lanzamiento como Apache-2.0, porque eso era lo que llevaban los materiales del proyecto en ese momento. La tarjeta del modelo hoy dice algo diferente y más contundente: que la licencia de los pesos del modelo está pendiente de confirmación final y se añadirá antes del lanzamiento público, y que una declaración de Apache-2.0 intencionadamente no se ha trasladado porque los materiales upstream actuales contienen declaraciones de licencia contradictorias. Si estás planeando un despliegue comercial de UI-Venus 2.9B, la cuestión de la licencia está abierta según la propia admisión del proveedor, y eso es un riesgo material más que una nota a pie de página.

Las cifras que cada parte publicó en realidad

Los dos repositorios miden cosas distintas, que es precisamente la cuestión. Liquid publica el rendimiento; Ant Group publica el éxito en las tareas.

Para el modelo de borrador, según el propio harness de Liquid: una aceleración de decodificación de 2,66× como máximo en una única H100 de 80 GB en BF16 mediante SGLang, de 3,13× como máximo con MLX-VLM en un Apple M5 Max, y de 2,14× como máximo con llama.cpp en un M3 Ultra. De extremo a extremo, esas mismas ejecuciones se sitúan entre 1,30× y 2,62× según la pila y la tarea. La aceptación del borrador se sitúa en torno a 3,2 a 4,5 tokens por pasada de verificación. Todas esas cifras están medidas por el proveedor y no cuentan con reproducción externa.

Para UI-Venus 2.9B, las tablas de la propia ficha reportan 80.2 en AndroidWorld, 65.8 en MobileWorld con un presupuesto de 50 pasos, 70.8 en OSWorld-Verified, 48.0 en DeskCraft, 90.8 en WebVoyager en la partición renovada de 595 tareas, 74.0 en Online-Mind2Web, 73.0 en ScreenSpot-Pro y 77.1 en VenusBench-GD. En CAPTCHA reporta 78.1 en VenusBench-CAPTCHA y 75.7 en MCA-Bench. En el apartado de seguridad reporta una tasa de éxito de ataque del 11.3% en OSHarm frente al 25.3% de su base Qwen3.5-9B. Todos estos son datos reportados por el proveedor, algunas líneas base llevan un asterisco que significa que los autores de UI-Venus las evaluaron bajo el protocolo indicado, y la propia ficha advierte de que las comparaciones con OSWorld-Verified utilizan andamiajes de acción específicos de cada modelo y deben interpretarse como referencias a nivel de benchmark en lugar de como ablaciones controladas.

Observa lo que está ausente en ambas listas: cualquier cosa medida por un tercero. En el caso del drafter, se debe a que el checkpoint tiene varios días de antigüedad. En el caso de UI-Venus 2.9B, se debe a que los benchmarks de agentes de GUI son costosos de reproducir y los resultados en entornos en vivo varían según el estado del entorno en la fecha de evaluación — una advertencia que la ficha técnica ofrece por iniciativa propia.

Donde los dos realmente se encuentran

A screenshot of the Hugging Face model card for inclusionAI/UI-Venus-2-9B showing 'Like 34' and 'Downloads last month 8,423'. The card describes UI-Venus-2 as a general-purpose foundation GUI agent covering 170+ multilingual apps and 4,000+ domains across 19 categories, evaluated on OSWorld, AndroidWorld and MobileWorld, and reports an OSHarm attack success rate of 11.3% against 25.3% for its Qwen3.5-9B base and an OSBlind figure of 48.8% against 79.4% for that base.

Existe una superposición real, y es más estrecha de lo que sugiere la etiqueta de la categoría. Ambos son relevantes si estás creando un agente visual en el dispositivo o en el edge, y ambos se preocupan por el coste de hacer pasar píxeles por un modelo. Atacan el problema desde extremos opuestos.

UI-Venus 2.9B lo ataca con entrenamiento: un pipeline de tres etapas de mid-training multimodal sobre entornos simulados de móvil, web y OS, RL offline por dominio, y luego destilación on-policy multi-profesor en una única política. La capacidad publicada es el resultado. El modelo es de 9B, lo que es pequeño para un agente GUI y grande para un dispositivo de borde, y la configuración de servicio prevista de la tarjeta es un despliegue de vLLM —la misma documentación señala que esa configuración no fue validada con canario en vivo como parte de la actualización de la tarjeta y te indica que fijes y verifiques tu versión de vLLM para Qwen3.5 antes de desplegar.

LFM2.5-VL-3B-DSpark lo ataca con runtime: deja intactos los pesos del modelo objetivo y compra velocidad generando borradores y verificando tokens. En un dispositivo de clase telefónica, el intercambio es unilateral a favor del generador de borradores, porque la salida es demostrablemente la del objetivo y la memoria adicional es inferior a una décima parte de la de un modelo.

La consecuencia para cualquiera que elija: un bucle de agente realiza muchas llamadas al modelo por tarea, y cada llamada paga el prefill de una captura de pantalla nueva. La codificación de visión y el prefill son precisamente las etapas que la decodificación especulativa no acelera; el propio anuncio de Liquid plantea este argumento contra una lectura ilimitada de sus cifras destacadas. Así, la ventaja del drafter se reduce exactamente en la carga de trabajo en la que vive UI-Venus 2.9B. A la inversa, la ventaja de UI-Venus 2.9B —completar realmente la tarea— no es algo que un drafter proporcione a ninguna velocidad.

Ejecutando los dos

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-VL-3B-DSpark showing 'Like 6', the license 'lfm1.0' and 'Model size 0.3B params  Tensor type BF16'. The card text specifies 'Target model: LiquidAI/LFM2.5-VL-3B', 'Draft parameters: 279.5M (BF16)', a backbone of 4 full attention layers at hidden_size=2048 with grouped-query attention plus a Markov head and a confidence head, 'Block size: 9 during training; 8 or 9 at inference', a vocabulary of 128,000, and the notes 'On Apple silicon the drafter is run at block size 8 rather than 9' and 'Use each drafter checkpoint with its corresponding target model'.

Ninguno de los dos es un endpoint alojado en OrcaRouter. Tanto LFM2.5-VL-3B-DSpark como UI-Venus 2.9B requieren que descargues los pesos y los sirvas tú mismo, y sus historias de servicio están moldeadas por sus roles tan diferentes. El drafter necesita SGLang v0.5.19 o posterior con un flag de algoritmo especulativo DSPARK y un tamaño de bloque de 9, o MLX-VLM v0.7.2 o posterior con el drafter pasado como modelo de borrador y la temperatura forzada a cero, o llama.cpp con un GGUF F16 de 567 MB emparejado con un objetivo cuantizado. UI-Venus 2.9B necesita un servidor vLLM lo suficientemente grande para un modelo de 9B con una longitud máxima de 262.144 tokens, además de los prompts de referencia y los analizadores de acciones del repositorio de código del proyecto; la ficha es explícita en que iniciar el servidor por sí solo no te da un agente GUI de bucle cerrado funcional.

Ambos también dejan el mismo vacío en los límites de lo que pueden hacer. Un modelo pequeño de visión y lenguaje emparejado con un modelo borrador sigue topándose con pantallas y tareas que no puede manejar, y un agente de GUI sigue fallando en entornos fuera de su distribución de entrenamiento. Las consultas que se quedan fuera acaban en algún sitio, y en la mayoría de los diseños de producción ese sitio es un modelo de propósito general más grande. Enrutar esas consultas a través de un único endpoint que cubre más de 200 modelos al precio de lista de cada proveedor, con conmutación automática por error cuando un proveedor se degrada, mantiene la ruta de respaldo fuera de la lista de integraciones críticas en lugar de convertirla en un segundo proyecto de despliegue con sus propias claves y contratos.

Cómo decidir en un minuto

Si necesita software que opere una interfaz de usuario —haciendo clics, escribiendo, navegando por una aplicación que nunca ha visto—, está comprando una política, y eso es UI-Venus 2.9B. Presupueste un despliegue de 9B con vLLM, lea la cuestión de licencia pendiente antes de comprometerse comercialmente y trate la tabla de benchmarks del proveedor como una sólida hipótesis inicial en lugar de un resultado definitivo, en particular las comparaciones de OSWorld-Verified que la propia ficha señala como dependientes del scaffold.

Si ya ejecutas LFM2.5-VL-3B y quieres que vaya más rápido en hardware de tu propiedad, estás comprando una optimización del entorno de ejecución, y esa es LFM2.5-VL-3B-DSpark. Comprueba primero tres cosas: que tus cargas de trabajo sean más intensivas en decodificación que en prellenado, que estés sirviendo en 16 bits en lugar de con una exportación de 4 bits, y que tu entorno de ejecución cumpla con las versiones mínimas requeridas. Si se cumplen las tres, el costo de memoria es del 8,9 % y la salida no cambia por construcción.

Lo único que no sobrevive al contacto con ninguno de los dos repositorios es tratarlos como sustitutos. Son un multiplicador de velocidad y un agente, y el único escenario en el que compiten es aquel en el que ya has decidido qué estás construyendo y buscas una razón para construir algo más barato en su lugar.

OrcaRouter llega a más de 200 modelos a través de una sola clave al precio de lista del proveedor y con un 0 % de recargo, con política de enrutamiento y conmutación por error automática para las consultas que un modelo de borde o un agente no debería atender. una API para la ruta de respaldo Ninguno de los modelos de esta página se aloja allí —ambos se sirven desde tus propios pesos—, pero la ruta de respaldo es la parte que no tienes que construir.