Una tarjeta de título principal para la comparación MiniCPM5-2B-DSpark vs Granite 4.2 3B, con el subtítulo Dos lanzamientos silenciosos Apache-2.0 para servir modelos pequeños y rápidos, que muestra dos cajas de cartón abiertas una al lado de la otra — la izquierda emite un rayo etiquetado como borrador DSpark y la derecha muestra un engranaje etiquetado como modos de razonamiento — con una cinta Apache-2.0 en la parte inferior y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

MiniCPM5-2B-DSpark vs Granite 4.2 3B: Dos lanzamientos discretos bajo Apache-2.0 para servir modelos pequeños, rápidos y autoalojados

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Agosto y principios de septiembre de 2026 trajeron dos lanzamientos discretos, ambos bajo Apache-2.0 y orientados a lo mismo —modelos pequeños que alojas tú mismo—, aunque lo hicieron desde extremos opuestos. Granite 4.2 3B es el modelo de razonamiento de IBM pensado para portátiles; sus pesos llegaron a Hugging Face a principios de agosto, y su ficha de modelo y su blog técnico se publicaron el 25 de agosto de 2026. MiniCPM5-2B-DSpark no es en absoluto un modelo en ese mismo sentido: es un checkpoint borrador DSpark de 323,8 millones de parámetros que OpenBMB publicó el 6 de septiembre de 2026 sin ningún anuncio, construido para que MiniCPM5-2B (el modelo denso on-device de 2,52 mil millones de parámetros que ModelBest anunció en la WAIC el 19 de julio de 2026) genere tokens más rápido mediante decodificación especulativa. Uno de los lanzamientos es un pequeño modelo de razonamiento independiente; el otro es un accesorio de aceleración para un modelo pequeño. Ambos están bajo Apache-2.0, ambos son únicamente de autoalojamiento y ninguno ha sido aún evaluado con un benchmark independiente.

Despoja la capa de marketing y la pregunta práctica que enfrenta un equipo es sencilla: para una carga de trabajo pequeña de autohospedaje a finales de 2026, ¿quieres el especialista en razonamiento de 3B de IBM o la pila orientada a agentes de 2B de ModelBest con un borrador gratuito acoplado? La evidencia es más escasa de lo que sugieren las especificaciones de cada proveedor, así que este artículo repasa los datos de lanzamiento, el único conjunto de cifras de la misma suite que existe realmente y la diferencia de carga de trabajo que debería guiar la elección.

Los dos lanzamientos, lo que es conocible

Granite 4.2 3B es el modelo de razonamiento más pequeño de IBM, ajustado a partir de Granite-4.1-3B-Base. Es denso y solo de texto: 40 capas, atención de consulta agrupada, un contexto nativo de 128K que se extiende a 512K en una quinta fase de preentrenamiento, y tres modos de razonamiento: pensamiento completo por defecto, un modo de bajo esfuerzo y una vía sin pensamiento. La ficha de IBM es explícita en que el 3B omitió deliberadamente el bloque de aprendizaje por refuerzo agéntico que recibieron los modelos hermanos mayores de Granite 4.2, por lo que no lista resultados de SWE-Bench y es un modelo de razonamiento más que un modelo agente. Se sirve a través de vLLM, SGLang, Transformers, GGUF y Ollama (granite4.2:3b), y no tiene API alojada. Sus cifras destacadas en la ficha — 78.33 en AIME 2025, 54.80 GPQA, 69.71 LiveCodeBench v6 — son reportadas por el proveedor y no reproducidas hasta la fecha.

A screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b (reused from a published sibling) showing the Model Overview with the 3B dense decoder-only architecture, 128K native context extending to 512K, and the Apache-2.0 license.

La tarjeta ibm-granite/granite-4.2-3b que aparece arriba es la cara pública de ese lanzamiento: un 3B afinado para razonamiento, con una historia de contexto largo y sin afirmaciones agénticas.

MiniCPM5-2B-DSpark, en cambio, existe únicamente al servicio de su modelo objetivo. El borrador consta de cinco capas de atención completa con 323.776.001 parámetros, un tamaño de bloque de siete tokens candidatos por pasada hacia adelante, entrenado durante seis épocas con 7,05 mil millones de tokens de respuestas generadas por MiniCPM5-2B. Su repositorio reporta la longitud de aceptación —5,52 tokens aceptados por paso de verificación globalmente con decodificación voraz, 6,11 en código—, pero no presenta ninguna cifra de tokens por segundo. El modelo objetivo que acelera, MiniCPM5-2B, es el producto más interesante: un modelo denso de 2,52 mil millones de parámetros, 42 capas, contexto de 128K, cuyos materiales de lanzamiento enfatizan la capacidad de agente —entrenamiento intermedio de agente a escala de 200 mil millones, un gran conjunto de SFT de agente y alineación RL de agente, según el anuncio de julio de ModelBest—, además de contexto largo nativo y modos híbridos rápidos/deliberados. En la suite de comparación propia de ModelBest, el modelo objetivo obtiene un promedio de 53,9 frente a modelos abiertos de la misma clase. Cada uno de esos números es del proveedor.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B description, and the Model Specification table listing the MiniCPM5-2B target, five draft layers, and a block size of seven.

La tarjeta openbmb/MiniCPM5-2B-DSpark de arriba es toda la superficie de lanzamiento: tarjeta de modelo, config, un archivo Safetensors y ningún anuncio.

La única comparación de la misma suite que existe

Las tablas comparativas entre proveedores son en su mayoría como comparar peras con manzanas, pero hay un lugar donde Granite 4.2 3B y MiniCPM5-2B se midieron juntos: la propia tabla de evaluación de ModelBest para MiniCPM5-2B, que lista granite-4.2-3B entre sus modelos de referencia. En esa suite, MiniCPM5-2B promedia 53.9 frente a los 42.7 de Granite 4.2 3B. Lee ese número exactamente por lo que es: un proveedor ejecutando ambos modelos en una sola suite, sin reproducir y seleccionada para que su propio modelo luzca bien. No es un veredicto. Lo que sí te dice es que ModelBest tuvo la confianza suficiente para poner el 3B de un competidor en la tarjeta, y la brecha que afirma es mayor precisamente donde su propio entrenamiento invirtió: filas de contexto largo y agéntico. Tómalo como una afirmación direccional, verifícala con tus propios datos y sopesa las afirmaciones separadas que IBM hace en su propia tarjeta antes de decidir algo al respecto.

El marcador, etiquetado honestamente

• Qué modelos — MiniCPM5-2B-DSpark: un draft de 324M para MiniCPM5-2B (objetivo denso de 2,52B), no independiente. Granite 4.2 3B: un modelo de razonamiento denso independiente de ~3B.

• Rol — MiniCPM5-2B stack: énfasis en agente en el dispositivo y uso de herramientas, según ModelBest. Granite 4.2 3B: especialista en razonamiento, deliberadamente no agéntico.

• Contexto — MiniCPM5-2B: objetivo de 128K nativo. Granite 4.2 3B: 128K nativo, ampliable a 512K.

• Aceleración — MiniCPM5-2B-DSpark: borrador DSpark externo, siete tokens por pasada, aceptación codiciosa ~5.5 por paso (reportado en el repositorio). Granite 4.2 3B: ninguno incluido en esta versión.

• Licencia — ambos Apache-2.0.

• Evidencia — Las cifras de MiniCPM son afirmaciones de la ficha de ModelBest (su suite: 53.9 frente a los 42.7 de Granite); las cifras de Granite son afirmaciones de la ficha de IBM (AIME 2025 78.33, GPQA 54.80). No existe ninguna ejecución independiente de ninguno de los dos.

A two-column scoreboard for MiniCPM5-2B-DSpark vs Granite 4.2 3B: left column MiniCPM5-2B-DSpark with What it is: 324M draft + 2.52B dense target, on-device agent and tool-use role, 128K native context, DSpark acceleration at 7 tokens per pass, Apache-2.0 license, and own-suite average 53.9; right column Granite 4.2 3B with a standalone ~3B dense reasoning model, non-agentic role, 128K native / 512K extended context, no shipped acceleration, Apache-2.0 license, and AIME 2025 78.33 / GPQA 54.80, with a footer reading All figures vendor-reported; no independent run of either and the OrcaRouter logo in the bottom-right corner.

{{1}}El marcador anterior tiene la misma fuente que el texto principal:{{/1}} {{2}}todas las cifras que aparecen en él son reportadas por los proveedores, y el único número de la misma suite que cualquiera de los proveedores ha publicado es el de ModelBest.{{/2}}

La diferencia que supera todos los benchmarks

Antes de las puntuaciones, decide qué tipo de modelo pequeño necesita tu carga de trabajo, porque los dos lanzamientos responden a preguntas distintas. Granite 4.2 3B está diseñado para razonamiento y contexto largo en hardware con recursos limitados: una ventana de contexto nativa de 128K ampliable a 512K, tres modos de pensamiento por consulta, una huella que funciona en una laptop y una decisión explícita de omitir el entrenamiento agéntico. Si tu tarea es el análisis de documentos largos, el contexto a escala de repositorio o un razonamiento fiable en un equipo pequeño, esta es una opción coherente. MiniCPM5-2B está diseñado con el énfasis opuesto: comportamiento agéntico y uso de herramientas en el dispositivo; el hecho de que exista un draft ya indica que ModelBest espera atender este objetivo de forma interactiva y quiere recuperar los tokens por segundo. Si tu tarea es un bucle de agente en el dispositivo que llama a herramientas y mantiene conversaciones largas, esa es la pila pensada para ti.

El borrador altera la economía de esa segunda opción de una manera que el lanzamiento de Granite no aborda. MiniCPM5-2B es denso, y la decodificación especulativa rinde más precisamente en el régimen denso y limitado por memoria: un modelo fijo pequeño que propone tokens a otro fijo ligeramente más grande. Un modelo borrador externo que añade aproximadamente 650 MB de pesos BF16 a un modelo objetivo de ~5 GB, con una ruta de servicio SGLang documentada y una tasa de aceptación codiciosa de alrededor de cinco tokens y medio por paso de verificación, es una palanca de rendimiento creíble para un modelo que se sirve con concurrencia de una sola solicitud. Pero la advertencia es ineludible: OpenBMB no ha publicado ninguna aceleración de extremo a extremo, por lo que la palanca no está calibrada. IBM no incluye ningún modelo borrador externo equivalente para Granite 4.2 3B en este lanzamiento: se ejecuta denso, y su argumento de velocidad es simplemente que el 3B es pequeño.

Quién debería ejecutar cuál

- Ejecuta Granite 4.2 3B si tu carga de trabajo es razonamiento de contexto largo en un equipo de clase portátil — documentos, repositorios, análisis profundo de un solo hilo — y quieres tres modos de pensamiento y un límite de 512K en un modelo Apache-2.0 que controlas por completo. Acepta que no hay entrenamiento agéntico detrás y ninguna API alojada.

• Ejecute la pila MiniCPM5-2B con su borrador DSpark si su carga de trabajo es un agente interactivo en el dispositivo que llama a herramientas y el modelo objetivo cabe en su presupuesto de memoria, y desea recuperar el rendimiento que un borrador puede devolverle. Reserve tiempo para medir la aceleración real del borrador en su propia compilación de SGLang, porque no se ha publicado ninguna cifra al respecto.

• Ejecuta ambos detrás de una capa de enrutamiento si no estás realmente seguro. Ninguno de los dos modelos está hoy en un catálogo alojado, incluido OrcaRouter — ambos son propuestas de autoalojamiento —, pero un enrutador que queda delante de tus propios endpoints con conmutación automática por error permite que la nueva pila candidata se mantenga en una ruta de pruebas mientras la producción sigue en la probada, y su pase directo sin margen de beneficio sobre los modelos alojados que los rodean mantiene barata la comparación A/B. El punto es la reversibilidad: cambia el nombre de un modelo, mide, y revierte el cambio si el checkpoint de un día de antigüedad se atasca.

Qué ver a continuación

Dos cosas decidirán este enfrentamiento más rápido que cualquier opinión. Primero, una ejecución independiente de MiniCPM5-2B que confirme o desmienta el {{1}}promedio de 53.9 y las afirmaciones sobre las capacidades de agente{{/1}}: un modelo de 2B que puntúe tan bien en tareas estilo SWE-Bench sería un dato genuinamente nuevo para la clase de modelos en el dispositivo. Segundo, que las cifras del propio modelo de razonamiento de IBM sobrevivan a la reproducción por parte de la comunidad; el 78.33 del modelo de 3B en AIME 2025 es el tipo de afirmación que cambia cuando alguien más ejecuta la prueba. Hasta que una de esas dos cosas se concrete, la postura honesta es: {{2}}Granite 4.2 3B es el modelo pequeño más seguro y mejor documentado en la actualidad, y el stack de MiniCPM5-2B es la apuesta más interesante{{/2}} — {{3}}un agente más rápido en el dispositivo si sus afirmaciones se sostienen{{/3}}, con {{4}}un modelo borrador cuyo beneficio ni siquiera su propio proveedor ha medido todavía{{/4}}.