
MiniCPM5-2B-DSpark vs Qwen3-8B: el nuevo stack de 2.5B en el dispositivo frente al caballo de batalla de pesos abiertos
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Toda comparación de modelos esconde una cuestión de hardware, y MiniCPM5-2B-DSpark frente a Qwen3-8B es esa cuestión disfrazada de benchmark. Qwen3-8B es el caballo de batalla de pesos abiertos de Alibaba de abril de 2025: unos 8.2B de parámetros densos, 119 idiomas, contexto nativo de 32K ampliable a 131K, modos de pensamiento híbridos y dieciséis meses de evidencia comunitaria detrás. MiniCPM5-2B-DSpark no es un modelo independiente que pueda ponerse a su lado: es el checkpoint de borrador DSpark de 323.8M de parámetros que OpenBMB publicó discretamente en Hugging Face el 6 de septiembre de 2026 para acelerar MiniCPM5-2B, el modelo denso de 2.52B para dispositivos que ModelBest anunció en WAIC el 19 de julio de 2026. Junta la pareja y aflora la pregunta real: ¿debería la carga de trabajo que hoy corre en un 8B estar ejecutándose en un hardware que solo puede cargar un 2B? ¿Y es suficiente un 2.5B con un borrador gratuito para dar el salto?
La respuesta corta es que todavía no, para la mayoría de las cargas de trabajo, pero las razones son más acotadas de lo que sugiere la brecha de tamaño, y hay una clase de despliegue donde el 8B no tiene respuesta alguna. Todo lo cuantitativo de esta pieza es reportado por los proveedores —las cifras de MiniCPM son las propias de ModelBest, sin reproducir; las de Qwen3-8B son de Alibaba, expuestas durante largo tiempo al uso de la comunidad—, así que las etiquetas importan más que los dígitos.
Dos modelos en diferentes puntos de la curva de memoria
MiniCPM5-2B es un Transformer causal denso con un tercio del tamaño de un 8B: 42 capas, atención de consulta agrupada, Apache-2.0, diseñado para la clase de dispositivos a los que un modelo grande no puede llegar: teléfonos, cabinas inteligentes y pequeñas cajas edge donde el bus de memoria se atragantaría con ocho mil millones de parámetros. Sus materiales de lanzamiento ponen el énfasis en el trabajo agéntico y el contexto largo, más que en la amplitud bruta: contexto nativo de 128K, y la afirmación de ModelBest de que, en su propio conjunto de evaluación, el modelo promedia 53.9 — SOTA de código abierto en la clase 2B, según el proveedor, incluyendo un 46.4 ejecutado por el proveedor en SWE-bench Verified que sería notable para un modelo de 2B si sobrevive a las pruebas independientes. El borrador DSpark es la respuesta de rendimiento a la objeción obvia de que un modelo denso pequeño es rápido de cargar pero lento de generar, porque cada token arrastra sus parámetros por el bus de memoria. El borrador propone hasta siete tokens a la vez para que el modelo objetivo los verifique, y el repositorio informa una aceptación codiciosa de 5.52 tokens por paso de verificación en agregado — 6.11 en código. Ese número es la calidad del borrador; su aceleración aún no se ha medido, y no se ha publicado ninguna cifra de tokens por segundo.

La tarjeta openbmb/MiniCPM5-2B-DSpark mostrada arriba es toda la superficie pública del silencioso lanzamiento del 6 de septiembre: un accesorio de servicio que reporta la longitud de aceptación, sin anuncio y sin aceleración en tiempo de reloj.
Qwen3-8B pertenece a la misma familia arquitectónica, tres veces más grande y dieciséis meses más antigua. Es un Transformer causal denso con atención de consulta agrupada, entrenado sobre un corpus multilingüe de 36 billones de tokens, con licencia Apache-2.0, y uno de los modelos de 8B más autoalojados y servidos en el mundo de pesos abiertos. Su rasgo distintivo es el modo de razonamiento híbrido de Qwen3 —pensamiento activado o desactivado por solicitud— y su perfil es deliberadamente amplio: MMLU en los 70 altos, sólidos resultados en GSM8K y codificación, 119 idiomas. Necesita una GPU real o un dispositivo edge potente: en una cuantización práctica, ocupa unos pocos gigabytes y cabe cómodamente en una tarjeta de gama media, pero no en un teléfono.

La ficha del modelo de Alibaba para Qwen3-8B mostrada arriba es la cara del actual líder: dieciséis meses de comportamiento documentado y probado por la comunidad en 119 idiomas.
Donde el 8B todavía gana
Baja una categoría de peso y renuncias a tres cosas concretas. Primero, los idiomas: Qwen3-8B cubre 119; la ficha y los conjuntos de datos de MiniCPM5-2B se centran en el inglés y el chino, y no se afirma amplitud multilingüe. Para un producto que sirve a una larga cola de idiomas, eso es un muro duro, no blando. Segundo, la evidencia: los números de Qwen3-8B llevan dieciséis meses siendo puestos a prueba, cuantizados, afinados y servidos a escala; sus modos de fallo son conocidos, sus cuantizaciones existen, su ecosistema está en todas partes. MiniCPM5-2B es un lanzamiento de julio de 2026 con un marcador gestionado por el proveedor y sin reproducción independiente, y el borrador tiene un día de antigüedad. Tercero, el stack de servido: todo lo que ya habla con Qwen3-8B — vLLM, SGLang, llama.cpp, mil modelos de ajuste fino — habla con un objetivo maduro, mientras que el borrador de MiniCPM requiere construir un motor de decodificación especulativa (el algoritmo DSPARK de SGLang) que el repositorio documenta, pero que el ecosistema en general aún no ha absorbido.
Donde el stack 2B es la única opción.
Nada de eso importa en la clase de dispositivos donde un modelo de 8B simplemente no cabe. En un teléfono o en una placa de edge computing con unos pocos gigabytes de DRAM, Qwen3-8B no compite con MiniCPM5-2B: no es desplegable a una velocidad útil en absoluto. Esa es exactamente la razón por la que existe la pila de 2B, y por eso el borrador es la parte estructural de este lanzamiento y no un adorno. La decodificación especulativa es más efectiva precisamente en el régimen denso y limitado por memoria en el que vive un modelo pequeño en silicio pequeño: un modelo borrador compacto propone un bloque, el modelo objetivo lo verifica en una sola pasada, y el costo de cargar los pesos se paga una vez por bloque en lugar de una vez por token. El método DSpark, originado en DeepSeek (arXiv 2607.05147), se diseñó para sistemas de servicio de alta concurrencia, pero su mecánica —y las cifras de aceptación en este repositorio— son la palanca relevante para un modelo de 2B que debe sentirse interactivo en hardware limitado. Solo ten presente la advertencia honesta: OpenBMB midió la aceptación del borrador, no su aceleración, así que la ganancia real de tokens por segundo en tu dispositivo objetivo todavía depende de que la midas tú.
El marcador, etiquetado honestamente
• Lanzamiento — MiniCPM5-2B: 19 de julio de 2026 (anunciado); MiniCPM5-2B-DSpark: 6 de septiembre de 2026, en silencio. Qwen3-8B: abril de 2025, anunciado.
• Tamaño — MiniCPM5-2B: modelo denso de 2,52B, más un modelo borrador de 324M. Qwen3-8B: modelo denso de ~8,2B.
• Contexto — MiniCPM5-2B: 128K nativo. Qwen3-8B: 32K nativo, 131K mediante YaRN.
• Idiomas — MiniCPM5-2B: centrado en inglés/chino. Qwen3-8B: 119.
• Razonamiento — MiniCPM5-2B: modos híbridos rápido/deliberado según los materiales de lanzamiento. Qwen3-8B: pensamiento activado o desactivado según la solicitud.
• Evidencia: las cifras de MiniCPM son afirmaciones de la ficha de ModelBest (promedio de 53.9 en su propio conjunto de pruebas; sin ejecución independiente). Las cifras de Qwen3-8B son reportadas por Alibaba, con dieciséis meses de exposición a la comunidad.

El marcador superior es el desajuste representado con honestidad: las columnas difieren en casi todo excepto en la licencia abierta Apache-2.0, y la clase de dispositivo a la que te diriges decide qué columna se te permite siquiera elegir.
La realidad del enrutamiento
Ninguno de los dos modelos se encuentra hoy en un catálogo alojado en OrcaRouter, por lo que esta comparación ocurre por completo en el mundo autoalojado; pero es exactamente ahí donde una capa de enrutamiento sigue ganándose su lugar. A Qwen3-8B lo sirven su proveedor y varias plataformas de terceros; MiniCPM5-2B y su borrador son algo que tú mismo ejecutas. Cuando un equipo quiere probar si una pila de 2.5B puede cargar con parte de una carga de trabajo de 8B, la movida reversible es apuntar una ruta de prueba a una compilación de SGLang autoalojada de MiniCPM5-2B-más-borrador a través de una sola API con conmutación automática por error: la producción permanece en el sistema actual, la pila nueva puede atascarse sin derribar nada, y los precios de lista de los proveedores en toda la comparación se trasladan con un margen del 0 %, así que la prueba A/B resulta barata y reversible en lugar de una apuesta. La capa no aloja ninguno de los dos modelos; lo que hace es que el experimento sea seguro de ejecutar.
Quién debería moverse, y quién debería esperar
Mantente en Qwen3-8B para cualquier cosa multilingüe, cualquier cosa que necesite dieciséis meses de comportamiento conocido, o cualquier carga de trabajo ya servida en hardware que soporte un 8B cómodamente: la diferencia de tamaño no es motivo para migrar, y la falta de evidencia argumenta en contra. Prueba seriamente la pila MiniCPM5-2B con su borrador DSpark solo si tu dispositivo objetivo no puede soportar el 8B en absoluto, o si un 2.5B que rinda a la altura en trabajos agénticos y de contexto largo te permitiría reducir memoria y consumo de energía en el hardware que ya distribuyes. Y antes de comprometerte con el borrador, ejecuta la medición que OpenBMB no publicó: la longitud de aceptación no es latencia, y la ganancia de tokens por segundo en tu dispositivo es el número que realmente decide si el pequeño checkpoint discreto en Hugging Face valió la pena la descarga.
