
MiniCPM5-2B-DSpark vs Gemma 4 12B: Dos maneras de redactar, dos categorías de peso de la IA local
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
La forma más rápida de entender por qué MiniCPM5-2B-DSpark y Gemma 4 12B merecen aparecer en la misma página es ignorar sus tamaños por un momento y observar cómo escribe una frase cada uno. Ambos engañan al bus de memoria con un modelo borrador: un modelo pequeño propone varios tokens siguientes a la vez y el modelo real verifica el bloque en una sola pasada, por lo que el silicio paga el costo de cargar los pesos una vez por bloque en lugar de una vez por token. MiniCPM5-2B-DSpark es el modelo borrador que OpenBMB publicó discretamente en Hugging Face el 6 de septiembre de 2026: un checkpoint complementario de 323,8 millones de parámetros que acelera MiniCPM5-2B, el modelo denso de 2,52 mil millones de parámetros para dispositivos que ModelBest anunció en WAIC el 19 de julio de 2026. Gemma 4 12B es el generalista multimodal sin codificador de Google, de 11,95 mil millones de parámetros, lanzado el 3 de junio de 2026 con sus propios modelos borradores integrados y un contexto de 256K. Una vende el modelo borrador como un checkpoint Apache-2.0 separado que cargas tú mismo; la otra esconde un truco similar dentro de un único modelo grande que solo tienes que ejecutar.
La nota de honestidad que determina la forma de este artículo: MiniCPM5-2B-DSpark no es un modelo al que puedas hacer prompting. No tiene tokenizador, ni plantilla de chat, ni salida independiente — una ficha que solo enumera un model.safetensors, un config y un README. Es un accesorio de la capa de servicio para un objetivo de clase 2B, y la comparación real que hace un lector es entre dos clases de pesos de IA local: una pila 2B del tamaño de un teléfono que redacta sus tokens, frente a un generalista 12B de 16 gigabytes que redacta sus tokens. Todo lo demás a continuación es esa decisión hecha realidad.
Lo que MiniCPM5-2B-DSpark realmente es
La ficha del modelo es toda la superficie pública del lanzamiento, así que esto es lo que puede saberse a partir de ella. MiniCPM5-2B-DSpark es un checkpoint de borrador de DSpark: cinco capas de atención completa, 323.776.001 parámetros, atención de consulta agrupada con 16 cabezas de consulta y 2 cabezas KV, y un tamaño de bloque de siete — propone hasta siete tokens candidatos por pasada hacia adelante para que el objetivo MiniCPM5-2B los verifique. La configuración declara la arquitectura Qwen3DSparkModel con un auto-map de DSparkDraftModel, y el modelo viene con la cabeza de confianza y la cabeza de Markov del método DSpark (arXiv 2607.05147, el artículo de DeepSeek de julio de 2026) aún habilitadas — el verificador consciente de la carga que decide cuándo no vale la pena comprobar un sufijo. Se entrenó durante seis épocas con 7,05 mil millones de tokens de respuestas generadas por MiniCPM5-2B ante prompts generales, de matemáticas y de código.

La ficha del modelo openbmb/MiniCPM5-2B-DSpark que se muestra arriba es todo lo que se publicó: ficha del modelo, config, un archivo Safetensors y nada más — sin anuncio, sin entrada de blog, sin comunicado de prensa. Una liberación silenciosa de pesos con apenas un día de antigüedad al momento de escribir esto.
Lo que la ficha no contiene es tan importante como lo que contiene. Informa de la longitud de aceptación — en la evaluación del propio repositorio, un agregado de 5,52 tokens aceptados por paso de verificación con decodificación voraz, con 6,05 en matemáticas y 6,11 en código de un techo de siete tokens — pero no publica ninguna aceleración en tiempo real, ninguna cifra de tokens por segundo ni ningún benchmark independiente. El motor DSPARK de SGLang es la ruta de servicio documentada, con el borrador cargado junto al modelo objetivo MiniCPM5-2B. En otras palabras: la calidad del borrador está cuantificada, su rendimiento aún no, y cualquiera que lo adopte debería medirlo antes de creérselo.
Lo que Gemma 4 12B aporta al otro lado
Gemma 4 12B es el hijo mediano de la familia Gemma 4 de Google y se sitúa en un punto completamente distinto de la curva de IA local. Es un modelo denso de 11,95B que acepta texto, imagen, audio y video como entrada sin codificadores separados, atiende llamadas a herramientas sin configuración adicional y combina un contexto nativo de 256K con borradores de predicción de múltiples tokens que realizan el mismo truco de bus de memoria internamente, pero desde dentro del checkpoint, por lo que no hay nada extra que descargar o conectar. Es Apache 2.0, funciona en la práctica en un portátil de 16GB y llegó con todo el andamiaje de Google: evaluaciones de lanzamiento, tarjetas de modelo para las variantes base y de instrucción, y soporte del ecosistema en Model Garden, LM Studio y Ollama. Tiene meses de despliegue comunitario a sus espaldas, algo que el borrador MiniCPM de un día aún no tiene.

La ficha del modelo de Google para Gemma 4 12B que aparece arriba es el contraste en una sola imagen: un generalista multimodal maduro cuyos redactores son parte del lanzamiento, no un repositorio aparte.
Las especificaciones, etiquetadas honestamente
Lee esto teniendo en cuenta las fuentes: las cifras de MiniCPM5-2B son afirmaciones de la ficha de ModelBest, sin reproducir; las cifras de Gemma 4 12B son de Google, expuestas desde hace tiempo al uso de la comunidad.
• Lo que ejecutas — MiniCPM5-2B-DSpark: un borrador de 324M que solo sirve junto a MiniCPM5-2B (2.52B denso, 42 capas). Gemma 4 12B: un modelo denso independiente de 11.95B.
• Contexto — MiniCPM5-2B objetivo: 128K nativo. Gemma 4 12B: 256K nativo.
• Modalidad — stack MiniCPM5-2B: solo texto. Gemma 4 12B: entrada de texto, imagen, audio y video, sin codificador.
• Borrador — MiniCPM5-2B-DSpark: borrador externo de DSpark, siete tokens por pasada, motor SGLang DSPARK. Gemma 4 12B: borradores internos de predicción multitoken, nada que instalar.
• Huella — MiniCPM5-2B apunta a aproximadamente 5GB en BF16 más un archivo de borrador de ~650MB; Gemma 4 12B ocupa aproximadamente 18GB en BF16, y resulta práctico en hardware de clase 16GB mediante cuantización.
• Evidencia — MiniCPM5-2B-DSpark: solo cifras de aceptación del repositorio, con un día de antigüedad. Gemma 4 12B: evaluaciones de lanzamiento y meses de despliegue comunitario.

El marcador superior es el mismo retrato en seis filas: las dos columnas discrepan en casi todo excepto en la estrategia que ambas usan para escribir rápido.
¿Qué clase de peso se adapta al silicio que realmente tienes?
Debido a que MiniCPM5-2B-DSpark no es un modelo, la bifurcación significativa es la clase de peso del modelo objetivo frente a la de Gemma 4 12B — y esa bifurcación es principalmente una cuestión de hardware. Un teléfono, una placa de cabina inteligente o una pequeña caja de edge computing con unos pocos gigabytes de DRAM no pueden cargar un modelo de 11.95B a una velocidad útil; el bus de memoria es exactamente el cuello de botella que lo asfixiaría. Ese es el mundo para el que fue construida la pila MiniCPM5-2B: un modelo denso de 2B cuyos pesos caben en la memoria del dispositivo, con un draft acoplado para recuperar algunos de los tokens por segundo que los modelos densos pequeños pierden. La decodificación especulativa es más efectiva precisamente en este régimen denso y limitado por memoria, por lo que el draft es la parte interesante del lanzamiento, no un truco.
Gemma 4 12B es la respuesta una categoría de peso por encima. Si tu máquina tiene 16 GB o más —un portátil, una estación de trabajo, un servidor edge potente— puedes ejecutar el generalista multimodal, y obtienes tres cosas que el stack de 2B no puede ofrecer: entrada de imagen, audio y vídeo sin codificadores ni un segundo pipeline; una ventana de 256K para trabajo a escala de repositorios o documentos; y una madurez que un checkpoint borrador de un día de antigüedad sencillamente no tiene. Renuncias a la posibilidad de ejecutarlo en los dispositivos más pequeños y pagas una huella de memoria aproximadamente tres veces mayor.
La realidad del enrutamiento para ambos
Hoy ninguno de los dos bandos de esta comparación está en un catálogo alojado, y OrcaRouter tampoco. MiniCPM5-2B-DSpark es, por definición, un accesorio autoalojado para servir modelos: tú mismo ejecutas la pila de SGLang, y el borrador solo existe en tu despliegue local. Gemma 4 12B tiene pesos abiertos, así que puedes servirlo tú o usarlo donde ya esté disponible. Esa es precisamente la situación en la que una capa de enrutamiento demuestra su valor como red de seguridad, no como mecanismo de entrega: cuando pruebas un build de borrador completamente nuevo contra una carga de trabajo que ya sirves, enrutar el tráfico de prueba a través de una única API con conmutación automática ante fallos significa que una pila no probada puede atascarse sin que se caiga la producción; además, los precios de lista de los proveedores se transmiten con un margen del 0%, de modo que cualquier cambio de precio en un modelo alojado contra el que compares se refleja ese mismo día. Para la comparación en sí, sin embargo, el plan honesto es el mismo para ambos modelos: estás autoalojando, así que el benchmark que importa es el que ejecutas en tu propio hardware.
El veredicto
MiniCPM5-2B-DSpark y Gemma 4 12B no son competidores en ningún sentido de enfrentamiento directo: son dos categorías de peso de IA local que casualmente comparten un truco. Elige la pila MiniCPM5-2B con su borrador DSpark cuando tu dispositivo no pueda cargar un modelo de 12B y quieras un modelo orientado a agentes, capaz de procesar texto, con licencia Apache-2.0 y que quepa en la memoria del dispositivo; el borrador es una aceleración gratuita prometedora, pero mide su rendimiento en tu propia compilación de SGLang antes de confiar en él, porque su beneficio aún no está cuantificado. Elige Gemma 4 12B cuando tu hardware tenga margen de sobra y quieras un único modelo multimodal con una ventana de 256K y un ecosistema que lo respalde. La cuestión no es qué modelo es más inteligente, sino a cuál puede alimentar de verdad tu silicio.
