
LFM2.5-8B-A1B-DSpark vs Qwen3-8B: El borrador que acelera un modelo, contra el 8B que todo el mundo ya ejecuta
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
Liquid AI lanzó el checkpoint de borrador LFM2.5-8B-A1B-DSpark el 20 de agosto de 2026: un asistente de decodificación especulativa de 327,7 millones de parámetros que hace que el MoE de borde LFM2.5-8B-A1B genere hasta 3,18× más rápido en una sola H100. Antes de que esta comparación pueda ser honesta, un hecho debe quedar sobre la mesa: el checkpoint DSpark no es un modelo al que se pueda invocar; solo acelera a otro modelo. Así que la verdadera pregunta de despliegue que alimenta este lanzamiento es la que la mayoría de los equipos lleva todo el año sopesando: LFM2.5-8B-A1B o Qwen3-8B, dos modelos de pesos abiertos de clase 8B en momentos muy distintos de sus vidas.
El marco importa más de lo habitual aquí, porque las dos partes no son el mismo tipo de cosa. Qwen3-8B es un modelo completo y desplegable que puedes autoalojar o comprar tokens hoy mismo. LFM2.5-8B-A1B también es un modelo completo y desplegable — el borrador de DSpark es un complemento, no una versión. Todo lo que promete el borrador está medido por el proveedor y tiene un día de antigüedad; todo lo relacionado con los repos y formatos está simplemente ahí para que se compruebe. Este artículo mantiene esas dos categorías separadas.
Primero, la palabra "DSpark" no es el sustantivo en esta oración.
La decodificación especulativa ejecuta un modelo de borrador barato por delante del real: el borrador predice el siguiente puñado de tokens, el objetivo verifica todo el bloque en un solo paso hacia adelante y conserva aquello con lo que coincide. Cuando las predicciones son buenas, avanzas varios tokens por el precio de un paso de carga de pesos, por lo que el rendimiento aumenta sin tocar los pesos del objetivo — y como el objetivo revisa cada token propuesto, la salida bajo decodificación voraz es idéntica a ejecutar el LFM2.5-8B-A1B solo. Liquid llama a esto "sin pérdidas por construcción", y es toda la razón por la que un borrador es seguro de acoplar.
El LFM2.5-8B-A1B-DSpark de Liquid es un borrador deliberadamente pequeño: cinco capas de solo atención, un bloque de nueve tokens propuestos por paso y una cabeza de Markov sobre el vocabulario de 128.000 tokens del modelo objetivo, entrenado durante 15 épocas con una mezcla de datos de chat, código y llamadas a funciones, con puntos de control seleccionados por tasa de aceptación en lugar de pérdida. Es uno de los tres borradores que el proveedor publicó ese día, junto con LFM2.5-1.2B-Instruct y LFM2.5-2.6B, cada uno en Safetensors y GGUF con soporte desde el primer día para SGLang y llama.cpp. También es importante para cualquiera que lea una comparación con un modelo de clase 8B: no lo sirve ningún proveedor de inferencia y no tiene precio por token. Solo vive dentro de tu propia pila de decodificación especulativa.

Los dos modelos que realmente se despliegan
Dejando de lado el borrador, la comparación real es entre el modelo que acelera y el actual. Ambos son de peso abierto y aproximadamente de clase 8B, y ahí termina el parecido:
• Arquitectura — LFM2.5-8B-A1B es un MoE disperso con 8.3B de parámetros totales, pero solo ~1.5B activos por token; Qwen3-8B es un modelo denso de 8.2B que activa todos los parámetros en cada token.
• Lanzamiento — LFM2.5-8B-A1B se lanzó el 28 de mayo de 2026; Qwen3-8B se lanzó en abril de 2025 y tiene más de un año, ya obsoleto en algunas plataformas de servicio.
Contexto — LFM2.5-8B-A1B ofrece un contexto nativo de 128K con un vocabulario de 128K tokens; Qwen3-8B ofrece 32K de contexto nativo, ampliable a aproximadamente 128K mediante YaRN.
• Razonamiento — LFM2.5-8B-A1B es un modelo de razonamiento que emite una cadena de pensamiento explícita; Qwen3-8B alterna entre modos de pensamiento y no pensamiento según la solicitud.
• Inteligencia — según Artificial Analysis, LFM2.5-8B-A1B obtiene un índice de inteligencia de 8 y Qwen3-8B obtiene 8–8,3, ambos por debajo de la mediana de 9 para modelos de pesos abiertos comparables; ninguno es un cerebro de frontera, y ambos son honestos al respecto.
• Velocidad — según Artificial Analysis, LFM2.5-8B-A1B genera aproximadamente 340 tokens por segundo en todos los proveedores; Qwen3-8B se sitúa en torno a 37–40 tokens por segundo, entre los más lentos de su clase.
• Licencia — LFM2.5-8B-A1B está bajo la LFM Open License v1.0 de Liquid; Qwen3-8B es Apache-2.0.

La velocidad es donde esto deja de estar reñido.
La razón más importante por la que {{1}}la conversación de pesos abiertos de clase 8B{{/1}} avanzó es la velocidad por unidad de memoria. Qwen3-8B es un modelo denso: cada token que produce transmite todos los 8.2B de pesos a través del bus de memoria, razón por la cual es lento para su tamaño y por lo que necesita VRAM real. LFM2.5-8B-A1B enruta cada token a través de aproximadamente {{2}}1.5B de parámetros activos{{/2}}, que es el punto central del diseño: un MoE en el dispositivo que se mantiene rápido y pequeño. Las afirmaciones de la propia Liquid van más allá: aproximadamente 253 tokens por segundo en una CPU M5 Max con menos de 6GB de memoria, según informa el proveedor. En cuanto al rendimiento bruto del modelo desplegable, el borrador ni siquiera importa en esta parte de la historia: el MoE ya es varias veces más rápido que el 8B denso antes de añadir especulación.
En cuanto al precio, ambos tienen pesos abiertos, por lo que auto-alojar cualquiera de ellos cuesta lo que cueste tu hardware. La comparación de servicios alojados está desequilibrada en disponibilidad: {{1}}Qwen3-8B se sirve a través de la API de Alibaba a un precio de lista de 0,18 $ por millón de tokens de entrada y 2,10 $ por millón de tokens de salida, y también mediante un amplio conjunto de hosts de modelos abiertos de terceros; LFM2.5-8B-A1B no dispone de un precio de token alojado de primera parte que sea digno de mención, y el borrador no tiene ninguno en absoluto.{{/1}} Lo que significa que la forma práctica en que la mayoría de los equipos ejecutarán el MoE de borde de Liquid hoy en día es auto-alojado, en un portátil, un dispositivo de borde o una GPU propia — y esa es exactamente la configuración donde el borrador DSpark se convierte en la variable relevante.
Lo que el borrador realmente cambia para esta decisión.
El borrador cambia solo un eje: la rapidez con la que LFM2.5-8B-A1B produce tokens en un stack de serving que tú controlas. No hace que el modelo sea más inteligente ni cambia lo que responde: la salida greedy es bit-idéntica a la del modelo objetivo por sí solo. Donde ayuda es en el serving de GPU con rendimiento de una sola petición: Liquid midió una media de 2,54× en una única H100 en cinco benchmarks (418 → 1.074 tokens por segundo), con un máximo de 3,18× en MATH500, con tamaño de lote 1 y temperatura 0. Donde apenas ayuda es en los chips de Apple: el mismo modelo promedió solo 1,18× en un M4 Max (90 → 106 tok/s), porque verificar un bloque de tokens de borrador activa más expertos en el backend actual de Metal MoE de llama.cpp y mueve más tráfico de pesos, que es exactamente el coste que la decodificación especulativa pretende amortizar. Todas estas son cifras del proveedor del día del lanzamiento, no reproducidas de forma independiente.
Esa división se traduce directamente en una regla de decisión. Si ejecutas LFM2.5-8B-A1B en una GPU propia, el borrador es una verdadera palanca de coste: aproximadamente 2,5× más tokens por segundo desde el mismo silicio, sin ningún cambio en la salida, y solo necesitas una compilación con las integraciones DSpark del 20 de agosto. Si en cambio llamas al modelo a través de una API, el proveedor se queda con la ganancia de velocidad y el borrador te resulta irrelevante. Y si el dispositivo es un portátil o un teléfono, el borrador para este modelo concreto es hoy prácticamente un no-op; los borradores hermanos para los densos LFM2.5-1.2B-Instruct y LFM2.5-2.6B son los que ofrecen las mejoras en el dispositivo, con 2,54× y 2,27× respectivamente. Qwen3-8B, por su parte, no necesita ningún borrador: es simplemente un modelo más lento y denso que no requiere decodificación especulativa para poder desplegarse.

La elección, a un año de vida de Qwen3-8B
Qwen3-8B es la opción predeterminada aburrida y correcta: madura, con licencia Apache-2.0, 119 idiomas, modos de pensamiento y no pensamiento, disponible en todas partes, y sigue siendo un generalista perfectamente bueno para chat, código y texto estructurado. Sus problemas son la antigüedad y la velocidad: un denso 8B de 16 meses que es lento para su clase y ya está obsoleto en algunas plataformas, lo cual es una señal de mantenimiento que vale la pena tomar en serio si estás comenzando un proyecto greenfield hoy.
LFM2.5-8B-A1B es la apuesta más nueva y más específica: un MoE orientado al edge, diseñado para la llamada de herramientas y el seguimiento de instrucciones a gran velocidad en hardware de consumo, con el borrador DSpark como un impulso opcional de servicio para el caso de autoalojamiento en GPU. No es un modelo más inteligente — ambos están por debajo de la mediana de pesos abiertos en Artificial Analysis — pero es uno dramáticamente más rápido con una fracción de la memoria por token, que es el equilibrio que importa para los agentes en el dispositivo. Sus advertencias son la imagen especular de las de Qwen3-8B: un lanzamiento más reciente, sin precios de alojamiento de primera parte, y una historia de decodificación especulativa cuyas cifras nadie fuera del proveedor ha reproducido todavía.
La capa de enrutamiento subyacente sigue siendo la misma en cualquier caso. Ni LFM2.5-8B-A1B ni Qwen3-8B están hoy en el catálogo alojado de OrcaRouter, así que el planteamiento honesto es lo que un enrutador hace por la combinación: una API para más de 200 modelos alojados con los precios de lista del proveedor transmitidos con un margen del 0%, de modo que un recorte de precio del proveedor está activo en la plataforma el mismo día en que se anuncia; conmutación automática por error para que un modelo nuevo no probado sea algo que pruebas contra tráfico real en lugar de algo sobre lo que apuestas una ruta de producción; y un DSL de enrutamiento que puede poner al frente un modelo que tú mismo sirves, que es como una pila LFM2.5-8B-A1B autoalojada coexiste con endpoints alojados detrás de una sola clave.
Si estás construyendo para una laptop o un dispositivo de borde y te importa la velocidad de llamada a herramientas, LFM2.5-8B-A1B es la dirección a probar, y el borrador es un 2.5× gratis en la ruta de servicio de GPU cuando llegue el momento. Si quieres un generalista del que puedas dejar de preocuparte, Qwen3-8B sigue funcionando; solo debes saber que es un modelo de principios de 2025 que el ecosistema está empezando a retirar. Lo único que ni el borrador ni el objetivo cambian es el honesto estado de la evidencia: todo lo rápido del lanzamiento de DSpark es una medición de un solo proveedor en un solo día, y los puntos de referencia independientes son la cuestión pendiente que decide cuánto de esto realmente crees.
