
MiniCPM5-2B vs Gemma 4 12B: El líder de los rankings sub-4B frente al generalista de 12B de Google
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
Los materiales de lanzamiento de MiniCPM5-2B contienen una frase que parece zanjar cualquier debate antes de que comience: en la Conferencia Mundial de Inteligencia Artificial del 19 de julio, ModelBest y OpenBMB calificaron al modelo como el mejor clasificado entre los modelos de menos de 4B parámetros en el ranking de Artificial Analysis, y sus pesos abiertos ya están discretamente disponibles en Hugging Face. Gemma 4 12B es la respuesta de Google desde una categoría de peso completamente distinta: un generalista multimodal denso y sin codificador, de 11.95B, lanzado el 3 de junio, que acepta texto, imagen, audio y vídeo como entrada y que ya acumula meses de despliegue comunitario. Compararlos no es un ejercicio de fichas técnicas; es una decisión sobre a qué dispositivo te diriges, porque un modelo que lidera su clase de tamaño y un modelo que sencillamente es más grande están respondiendo a preguntas de hardware distintas.
El momento es la razón de que este duelo exista. MiniCPM5-2B se presentó en WAIC en julio como un producto — una historia de chips tanto como de modelo, con nueve socios de silicio desde el día cero de su comunidad FlagOS — y los pesos se prometieron "en un futuro cercano". Siete semanas después, el repositorio openbmb/MiniCPM5-2B apareció en Hugging Face (el registro de cambios de OpenBMB fecha el lanzamiento el 7 de septiembre), bajo Apache-2.0, sin restricciones, con el checkpoint BF16, GGUF, MLX, GPTQ, los checkpoints base y SFT y los conjuntos de datos de entrenamiento, todo en la misma colección. Sin comunicado de prensa, sin evento de lanzamiento. Al momento de escribir esto, la ficha del modelo es el anuncio, y aún no se ha publicado ninguna ejecución independiente de benchmarks: todo lo cuantitativo sobre la 2B a continuación proviene de la propia reproducción de ModelBest o de la instantánea de Artificial Analysis que cita. Gemma 4 12B, en cambio, se lanzó a través de la maquinaria habitual de Google y acumula millones de descargas. Esa brecha de evidencia es parte de la comparación, no una nota al pie.
Qué acaba de cambiar en cada lado
MiniCPM5-2B es el segundo modelo de la serie MiniCPM5, después del MiniCPM5-1B que OpenBMB publicó en código abierto el 19 de mayo. La ficha describe un transformer denso con 2.516.756.480 parámetros en total (1.981.982.720 sin incluir los embeddings —la cifra que hace que merezca la etiqueta de «clase 2B»—), 42 capas con un tamaño oculto de 2048, atención de consulta agrupada con 16 cabezas de consulta y solo 2 cabezas KV, y un vocabulario de 130.560. Es una arquitectura LlamaForCausalLM simple —la ficha es explícita en que no se necesitan kernels personalizados ni una bifurcación del código del modelo— y todo el checkpoint se distribuye como un único fragmento safetensors en BF16. La decisión de diseño interesante es el post-entrenamiento: SFT sobre 400 000 millones de tokens de datos de pensamiento profundo y, después, destilación on-policy (OPD) que pliega dieciséis modelos expertos de RL, cinco de ellos orientados a agentes, de vuelta en una única red densa pequeña. La ficha atribuye a RL + OPD una ganancia media de 10,96 puntos en tareas de razonamiento y generales, y de 6,96 puntos en las orientadas a agentes —deltas internos, pero explican la forma de este modelo: un 2B construido para ser un agente en el dispositivo, que emite llamadas a herramientas con formato XML de forma nativa.

Gemma 4 12B ocupa una posición distinta en el catálogo de Google. Es el miembro intermedio de la familia Gemma 4—por encima de los modelos E2B y E4B, orientados al edge, y por debajo del MoE de 26B y del modelo frontier de 31B—y es el único de la familia construido con un diseño sin encoder: los parches de imagen sin procesar y las formas de onda de audio se proyectan directamente al espacio de tokens, de modo que un único modelo denso procesa entradas de texto, imagen, audio y video sin necesidad de servir una torre de encoder aparte. Incluye una ventana de contexto de 256K, llamada a herramientas de serie, una pasada de razonamiento opcional y borradores de predicción multitoken que aceleran la decodificación desde el interior del checkpoint. Tiene licencia Apache-2.0, resulta práctico en hardware de 16 GB (unos 8 GB a 4 bits) y su página de Hugging Face registra millones de descargas al mes.

La afirmación sobre el ranking, y la clase de tamaño que deja fuera.
El titular de ModelBest para MiniCPM5-2B es un Artificial Analysis Intelligence Index de 17, {{1}}el primero entre los modelos de menos de 4B parámetros en el lanzamiento{{/1}}. Dos salvedades deben acompañar a esa cifra. La puntuación refleja la instantánea v4.1 de AA y no es directamente comparable con los valores de índice de instantáneas anteriores; además, es una cifra del lanzamiento que el proveedor citó antes de que se realizara una re-ejecución independiente. La interpretación honesta es más acotada y aun así impresionante: en el momento de su lanzamiento, bajo la metodología de AA de entonces, este modelo de 2.5B se situaba a la cabeza de toda su categoría de tamaño. Gemma 4 12B no aparece en esa categoría y, en las propias páginas de Artificial Analysis, hoy figura con un índice más alto — {{2}}alrededor de 22 para la variante de razonamiento y 13 para el modelo instruct sin razonamiento, ambos «muy por encima de la media» para su grupo de pares{{/2}}. Los índices de distintas instantáneas no se alinean limpiamente, así que conviene leerlos como una tendencia, no como una medición exacta: el generalista de 12B se revela en las pruebas como el modelo más capaz, y el de 2B, como el modelo más capaz de su tamaño. Son afirmaciones distintas y ambas pueden ser ciertas.
El marcador, etiquetado honestamente
Lee estas filas teniendo en cuenta la procedencia de los datos: las cifras de MiniCPM5-2B son afirmaciones de la ficha de ModelBest, de una semana de antigüedad y sin reproducir; las de Gemma 4 12B son reportadas por Google y llevan mucho tiempo expuestas al uso de la comunidad:
• Tamaño — MiniCPM5-2B: 2.52B total / 1.98B no-embedding, denso. Gemma 4 12B: 11.95B, denso.
• Modalidad — MiniCPM5-2B: solo texto. Gemma 4 12B: entrada de texto, imagen, audio y video, sin codificador.
• Contexto — MiniCPM5-2B: 131 072 tokens en la configuración incluida. Gemma 4 12B: 256K nativo (algunas recetas de servicio lo fijan en 128K).
• Idiomas — MiniCPM5-2B: ficha y datos centrados en inglés y chino. Gemma 4 12B: más de 140 idiomas.
• Lanzamiento — MiniCPM5-2B: anunciado el 19 de julio de 2026; pesos disponibles el 6 y 7 de septiembre, en silencio. Gemma 4 12B: lanzado el 3 de junio de 2026, con evaluaciones completas de lanzamiento.
• Evidencia — MiniCPM5-2B: ficha del proveedor más AA v4.1 (Índice 17, #1 sub-4B); aún sin ejecución independiente. Gemma 4 12B: evaluaciones de lanzamiento más meses de despliegue comunitario y ~3.3M de descargas mensuales.

El marcador de arriba es el mismo retrato en seis filas: los dos modelos discrepan en casi todas las dimensiones, y las columnas que deciden la elección — modalidad, idiomas, clase de dispositivo — son las que ningún promedio de benchmarks capta.
Dónde gana la 12B: las cosas que una 2B solo de texto no puede fingir
Comencemos por la modalidad. Gemma 4 12B procesa audio, imágenes y video de forma nativa; MiniCPM5-2B es solo texto. Cualquier producto que transcriba, mire una pantalla o vea un video necesita un segundo pipeline además del modelo 2B, y en ese punto la ventaja del "modelo pequeño" se evapora en parte. Los idiomas son la segunda barrera: más de 140 frente a un lanzamiento centrado en inglés y chino. Para un producto que atiende una larga cola de idiomas, el modelo 2B no es candidato en absoluto. Y luego está la evidencia. Gemma 4 12B se ha descargado millones de veces, cuantizado, ajustado y servido en producción durante tres meses; sus modos de fallo están documentados y su ecosistema abarca llama.cpp, Ollama, LM Studio, MLX, vLLM y SGLang. MiniCPM5-2B es un repositorio de una semana de antigüedad cuyas cifras principales —incluido un 46.4 obtenido por el proveedor en SWE-bench Verified, algo notable para un modelo denso de 2.5B si supera pruebas independientes— no han sido verificadas por nadie fuera del laboratorio. Solo por madurez, la elección no es ni cercana.
Donde el 2B es la única opción.
Nada de eso importa en la clase de dispositivos donde un 12B simplemente no cabe. Un teléfono, una placa de cabina inteligente o una pequeña caja de edge computing con unos pocos gigabytes de DRAM no puede mover los pesos de un modelo de 11.95B a través del bus de memoria a una velocidad útil — ese es exactamente el cuello de botella que lo ahogaría. MiniCPM5-2B fue construido para ese mundo: pesos que caben en la memoria del dispositivo, una ventana de 128K para sesiones de agente largas, llamada nativa a herramientas diseñada para ejecutarse de forma interactiva y adaptación desde el primer día en nueve familias de chips además de ARM. Si tu objetivo es una NPU de clase telefónica o una placa embebida, Gemma 4 12B no compite con MiniCPM5-2B; no es desplegable allí en absoluto. Y si tu objetivo puede cargar 12B pero apenas — un portátil de 16GB — el 2B te da margen: menor latencia por token, menor consumo energético y la opción de ejecutar un segundo modelo en el mismo espacio.
Cómo averiguar qué reclamaciones sobreviven
Como ambos lados son de peso abierto y autoalojables, el siguiente paso honesto es la medición en tu propio hardware en lugar de otra lectura de las especificaciones. Si estás sopesando un MiniCPM5-2B frente a un Gemma 4 12B para una carga de trabajo que ya sirves, aquí es también donde una capa de enrutamiento demuestra su valor: apuntar la ruta de prueba a un nuevo checkpoint autoalojado a través de una sola API con conmutación automática por error significa que una pila no probada puede atascarse o entrar en bucle sin tumbar la producción, mientras que los precios de lista del proveedor de cualquier alternativa con la que compares se transmiten con un margen del 0%. El modelo en sí es un repositorio de hace un día, así que por defecto hay que tratarlo como un experimento; pero el experimento es barato de ejecutar, y las dos horas que se tarda en reproducir SWE-bench o un fragmento de tu propio conjunto de evaluación en el modelo de 2B es exactamente la evidencia que le falta a esta comparativa.
El veredicto
Elige {{1}}Gemma 4 12B{{/1}} cuando tu hardware tenga el margen necesario y tu carga de trabajo se extienda más allá del texto — un producto multimodal, una audiencia multilingüe o cualquier escenario en el que tres meses de comportamiento contrastado por la comunidad importen más que una corona en el ranking. Elige {{2}}MiniCPM5-2B{{/2}} cuando tu dispositivo no pueda ejecutar un {{3}}12B{{/3}} en absoluto, o cuando un {{4}}2.5B{{/4}} con capacidad de texto y orientado a agentes en un chip de smartphone te permita lanzar un producto que un modelo más grande hace imposible. El líder del ranking sub-4B es un logro real y su lanzamiento con pesos abiertos permite probarlo hoy; sencillamente no es, según la evidencia disponible, un sustituto de un generalista de 12B en ningún lugar donde un 12B pueda ejecutarse de verdad.
