
MiniCPM5-2B-DSpark: OpenBMB libera en silencio los pesos de MiniCPM5-2B con un modelo de borrador diseñado para la velocidad
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Hace seis semanas, MiniCPM5-2B era una promesa. Presentado en la conferencia WAIC de Shanghái el 19 de julio de 2026 como el modelo de menos de 4B parámetros que encabezaba el Índice de Análisis Artificial, llegó con una nota de hoja de ruta que indicaba que los pesos abiertos estaban "próximos". Lo próximo llegó esta semana, sin ningún tipo de fanfarria. El 6 de septiembre de 2026, OpenBMB subió el repositorio principal de MiniCPM5-2B a Hugging Face bajo una licencia Apache-2.0, y veintiún minutos después subió MiniCPM5-2B-DSpark, un checkpoint de borrador de 323,8 millones de parámetros cuya única función es hacer que MiniCPM5-2B decodifique más rápido con el algoritmo de decodificación especulativa DSpark. Una compilación GPTQ siguió el 7 de septiembre de 2026. Al momento de escribir esto, no hay ningún anuncio, publicación de lanzamiento ni entrada de registro de cambios que hayamos podido encontrar; el lanzamiento salió a la luz cuando los repositorios se hicieron públicos silenciosamente en un período de once días.
Esto es un artículo de «lo que sabemos hasta ahora», y el encuadre importa. MiniCPM5-2B-DSpark no es un chatbot independiente ni un nuevo modelo insignia: es un acelerador: un modelo pequeño y rápido que propone tokens por delante de MiniCPM5-2B, que luego los verifica en paralelo. Es inútil sin su objetivo, y su objetivo es la razón por la que debería importarnos. El lanzamiento de pesos abiertos de MiniCPM5-2B que OpenBMB prometió para julio ahora sí está en Hugging Face, y el modelo borrador que se distribuye junto a él es el mecanismo que el proveedor recomienda para ejecutarlo a una velocidad útil. Todo lo que no se atribuya explícitamente a continuación se lee directamente de las dos fichas de modelo y sus repositorios.
¿Qué se lanzó, y cuándo?
La familia 2B se hizo pública como un lanzamiento continuo y no anunciado, con las entradas más recientes primero:
• 2026-08-27 — Aparecen MiniCPM5-2B-Base y MiniCPM5-2B-SFT, los checkpoints preentrenados en bruto y con ajuste fino supervisado.
• 2026-09-01 — MiniCPM5-2B-Midtrain, la etapa de entrenamiento intermedio agéntico.
• 2026-09-05 — MiniCPM5-2B-MLX y MiniCPM5-2B-GGUF, los formatos Apple-Silicon y llama.cpp.
• 2026-09-06 — el repositorio insignia MiniCPM5-2B, y luego MiniCPM5-2B-DSpark veintiún minutos después.
• 2026-09-07 — MiniCPM5-2B-GPTQ, el formato de servicio cuantizado.
Todos ellos llevan la licencia Apache-2.0, ModelBest la usó para la familia MiniCPM5-1B en mayo, y los checkpoints anteriores de la secuencia siguen mostrando prácticamente ninguna señal de comunidad: un puñado de descargas y "me gusta" cada uno. Eso es la marca de una publicación de pesos en curso más que de un lanzamiento coordinado: los artefactos aparecen en orden de dependencia (primero base y SFT, y por último los formatos cuantizados y draft), sin que haya un solo día que actúe como fecha de lanzamiento.
Lo que MiniCPM5-2B-DSpark realmente es
La decodificación especulativa divide la generación entre un proponente barato y un verificador costoso. Un modelo de borrador pequeño predice los próximos varios tokens; el modelo grande comprueba todas las predicciones en una sola pasada hacia adelante y acepta aquellas con las que coincide. Cuando el borrador está bien calibrado, se obtiene la salida del modelo grande a una fracción del costo, y cuando se equivoca solo se desperdicia un paso de verificación. DSpark es una receta específica para esa idea, a partir de un artículo publicado el 6 de julio de 2026 (arXiv 2607.05147, "Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation"). Dos decisiones de diseño lo distinguen: combina una arquitectura de borrador paralela con un módulo secuencial ligero, de modo que los tokens dentro de un bloque propuesto dependen unos de otros en lugar de perder precisión hacia el final del bloque, y ajusta el tamaño de cada pasada de verificación por solicitud a partir de estimaciones de confianza y el rendimiento del motor, en lugar de verificar siempre un bloque de longitud fija.
El borrador DSpark que publicó OpenBMB es un Transformer de cinco capas con 323,8 millones de parámetros en BF16 (unos 648 MB). Se asienta sobre la familia de arquitecturas Qwen3, pero incorpora adiciones específicas de DSpark: un proyector que lee los estados ocultos de MiniCPM5-2B de cinco de las capas del modelo objetivo (1, 10, 20, 30 y 39), una cabeza de confianza y una pequeña cabeza de Markov que modela la distribución del siguiente token. Su configuración propone un bloque de siete tokens por pasada hacia adelante. Con aproximadamente una octava parte de los 2,5 mil millones de parámetros de MiniCPM5-2B, es uno de los modelos de borrador más pequeños publicados para un checkpoint abierto convencional, lo cual es justo lo que se necesita en un modelo orientado a la periferia, donde el borrador debe ser lo bastante barato como para que ejecutar dos modelos en un mismo dispositivo siga siendo mejor que ejecutar uno solo.

El repositorio anterior es toda la superficie pública del modelo borrador: {{1}}un README{{/1}}, {{2}}una configuración{{/2}}, {{3}}un único archivo safetensors{{/3}} y {{4}}una tarjeta de modelo{{/4}} cuya descripción del entrenamiento muestra 1.959.525 secuencias (7,05 mil millones de tokens) generadas por MiniCPM5-2B a partir de indicaciones generales, de matemáticas y de código; el entrenamiento se realizó durante seis épocas con un objetivo combinado de entropía cruzada, L1 y confianza. No se utiliza el checkpoint como modelo generativo por sí solo.
Los números que publicó OpenBMB, etiquetados honestamente.
La tarjeta del modelo borrador reporta una cifra que importa: la longitud de aceptación, el número promedio de tokens propuestos que el objetivo acepta de cada bloque de siete tokens. La evaluación se ejecutó en salidas de MiniCPM5-2B en tres dominios, con hasta 4,096 tokens generados:
• Matemáticas — 6,05 tokens aceptados en promedio con decodificación greedy (T=0); 4,61 bajo muestreo T=1.0.
• Código — 6.11 codicioso; 4.44 muestreado.
• General — 4.16 codicioso; 3.10 muestreado.
• Agregado — 5.52 codicioso; 4.05 muestreado, de un máximo de siete.
Esas cifras las reporta el proveedor en la ficha del modelo y no se han reproducido de forma independiente. También describen la tasa de acierto del borrador, no una aceleración en tiempo de reloj (wall-clock): la velocidad es una métrica del servicio que depende de lo que cuesta la pasada de verificación del modelo objetivo frente a la pasada de propuesta del borrador, de la ocupación del lote y de que el programador de confianza de DSpark recorte la duración de la verificación. OpenBMB no publicó ninguna cifra de tokens por segundo para el par. Para hacerse una idea del techo del método, el artículo de DSpark indica que la generación por usuario es entre un 60 % y un 85 % más rápida con un rendimiento equivalente en comparación con la línea base MTP-1 en el sistema de servicio en vivo de DeepSeek: un punto de referencia útil de lo que el algoritmo ha logrado en otros entornos, no una afirmación sobre MiniCPM5-2B en tu hardware.

El marcador anterior es la propia ficha técnica del lanzamiento. Lea la cifra de aceptación como una {{1}}tasa de acierto preliminar{{/1}}; el {{2}}multiplicador sobre el rendimiento real{{/2}} es lo que {{3}}una ejecución independiente de SGLang{{/3}} todavía tiene que medir.
El modelo que el borrador acelera
MiniCPM5-2B es un Transformer denso de 2.5B parámetros — 2,516,756,480 en total — con 42 capas, 16 cabezas de consulta y 2 cabezas KV, un vocabulario de 130,560 tokens y una ventana de contexto de 131,072 tokens, en BF16 con unos 5 GB. Arquitectónicamente es deliberadamente aburrido: un LlamaForCausalLM estándar sin kernels personalizados ni fork del código del modelo, lo cual explica exactamente por qué se porta a tantos entornos de ejecución y objetivos de chip. En la suite interna de benchmarks de OpenBMB, la ficha del modelo le otorga un promedio de 53.9 en razonamiento, seguimiento de instrucciones, conocimiento, contexto largo, uso de herramientas, codificación y tareas de agentes de búsqueda — por delante de Qwen3.5-4B con 51.1 y de granite-4.2-3B con 42.7 en la misma tabla, con varias celdas (GPQA-Diamond 70.2, HLE 8.9 y diversas filas de contexto largo y de agentes) marcadas como procedentes de Artificial Analysis en lugar de reproducidas internamente. Las celdas destacadas por tarea incluyen MATH-500 con 94.6, AIME 2025 y 2026 con 86.5, IFEval con 86.7, MMLU-Pro con 70.8 y SWE-bench Verified con 46.4. Estos son los números del proveedor en su propia suite, y la ficha señala explícitamente que algunas filas provienen de terceros; trate la mezcla en consecuencia.

En la presentación de julio, los materiales de lanzamiento de ModelBest citaban un índice de Artificial Analysis de 17 — primero entre los modelos de menos de 4B parámetros — y la cobertura de julio hacía referencia a una ventana de 512K tokens. Los checkpoints que realmente se distribuyeron configuran 131.072 tokens de contexto. Cuando una cifra de marketing del día del lanzamiento y una configuración distribuida no coinciden, la configuración es el número que determina lo que puedes ejecutar, y la diferencia merece la pena conocerla antes de planificar una carga de trabajo de contexto largo en torno a la cifra de marketing.
Ejecutando MiniCPM5-2B con su borrador
La ruta prevista es SGLang, que ha admitido el algoritmo DSpark upstream desde v0.5.16 — la versión mínima que solicita la tarjeta del modelo. El comando de servicio completo de la tarjeta:
python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --speculative-algorithm DSPARK --speculative-draft-model-path openbmb/MiniCPM5-2B-DSpark --speculative-dspark-block-size 7
Bajo decodificación greedy (T=0), la verificación de DSpark no tiene pérdidas: la salida es idéntica a la de servir MiniCPM5-2B por sí solo, lo que convierte al draft en una pura cuestión de latencia. Con el muestreo habilitado, DSpark en SGLang usa por defecto únicamente el muestreo del modelo objetivo, con muestreo por rechazo opcional. OpenBMB también documenta la carga normal con Transformers (transformers ≥ 5.6) y el uso de vLLM ≥ 0.21 para servir el modelo objetivo por separado, además de un analizador de llamadas a herramientas de minicpm5 para cargas de trabajo agénticas; la ruta especulativa de DSPARK corresponde específicamente a SGLang.
La aritmética del hardware es lo que realmente importa en un par de clase edge: unos 5 GB para MiniCPM5-2B en BF16 más aproximadamente 0,65 GB para el draft. La combinación de draft y modelo objetivo cabe cómodamente allí donde el modelo de 2B por sí solo ya era viable, que es precisamente la razón de lanzar un draft tan pequeño en lugar de un segundo modelo más grande.
Lo que no está confirmado
• No existe ningún anuncio que hayamos podido encontrar — ni blog de OpenBMB o ModelBest, ni publicación en redes sociales en inglés o chino. La descripción de "lanzado silenciosamente" es literal, y la única presencia pública es la colección de Hugging Face.
• No hay evaluación independiente. Las longitudes de aceptación del borrador y el promedio de 53.9 en la suite de MiniCPM5-2B son reportados por el proveedor y no reproducidos; las celdas marcadas como AA son de terceros, pero son valores instantáneos, no ejecuciones de estos pesos exactos.
• No hay ninguna API alojada que podamos encontrar en ningún sitio, así que adoptarlo hoy significa ejecutar los checkpoints tú mismo. Un espejo de ModelScope, prometido en la cobertura de julio de la presentación, no estaba visible al momento de escribir esto.
• Sin cifra de aceleración en tiempo real para el par DSPARK. Una longitud de aceptación de 5.52 es una tasa de aciertos sólida, pero "cuántas veces más rápido" en una GPU determinada es exactamente el número que OpenBMB no publicó.
• La ambigüedad de la ventana de contexto mencionada anteriormente: los materiales de marketing decían 512K, la configuración incluida dice 131,072, y nada en los repositorios conecta ambos valores.
Dónde encaja un lanzamiento silencioso de open-weight en el stack
La lectura honesta de MiniCPM5-2B hoy es que se trata de una apuesta: cifras sólidas del proveedor, cero ejecuciones independientes, sin historial de servicio y un modelo borrador cuya aceleración en el mundo real no se ha medido. Esa es precisamente la situación para la que existe una capa de enrutamiento. Un equipo que quiera probar si la salida de un modelo abierto pequeño puede sustituir a un modelo alojado al que ya llama puede hacer esa comparación desde una sola API: OrcaRouter da acceso a más de 200 modelos alojados al precio de lista del proveedor sin recargo, por lo que poner en marcha una semana de evaluación no cuesta nada, y la conmutación automática por error significa que un checkpoint de hace unos días nunca tiene que secuestrar una ruta de producción mientras demuestra su valía. Nada de eso exige que MiniCPM5-2B esté alojado en ningún sitio; es la red de seguridad en torno a los modelos de los que ya dependes mientras decides si un 2B autoalojado merece la GPU.
Vigila, en orden de importancia: una ejecución independiente de SGLang DSPARK que informe de tokens reales por segundo para el par, ya que la longitud de aceptación es un proxy y no un punto de referencia; un anuncio formal o un espejo de ModelScope que confirme que el lanzamiento es definitivo; y un proveedor de alojamiento que adopte MiniCPM5-2B — si alguno lo hace, el precio que pagas a través de nosotros es el precio de lista del propio proveedor, ese mismo día, porque eso es lo que significa el traspaso directo. Mientras tanto, el modelo borrador es el artefacto más interesante de los dos. Un proponente de cinco capas que el objetivo acepta cinco tokens y medio de cada siete es la diferencia entre un pequeño modelo de borde que se siente pequeño y uno que se siente como un modelo más grande ejecutándose en el mismo dispositivo.
