
Los pesos de MiniCPM5-2B ya están disponibles: el pequeño modelo que se adjudicó la corona Sub-4B ahora es de código abierto
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0455Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0247Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0247Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0157Inteligencia82Código
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2646Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1849Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1541Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1251Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0547Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0347Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2140Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Inteligencia49Código
El modelo en sí tiene siete semanas de antigüedad. MiniCPM5-2B fue presentado en la Conferencia Mundial de Inteligencia Artificial de 2026 el 19 de julio, donde ModelBest y OpenBMB lo llamaron el modelo mejor clasificado por debajo de 4B de parámetros en la tabla de clasificación de Artificial Analysis y prometieron que los pesos seguirían "en un futuro cercano". Lo que sucedió este fin de semana es que ese futuro cercano llegó sin la fanfarria de lanzamiento: el repositorio de MiniCPM5-2B se publicó en Hugging Face el 6 de septiembre, y el registro de cambios de OpenBMB marca el lanzamiento el 7 de septiembre, bajo licencia Apache-2.0, con el paquete completo: pesos BF16, cuantizaciones GGUF, MLX y GPTQ, puntos de control base y SFT, un modelo de borrador DSpark para decodificación especulativa y los conjuntos de datos de entrenamiento que los respaldan.
Ningún comunicado de prensa lo acompañó, y no hubo evento de lanzamiento. Simplemente apareció: un repositorio de Hugging Face un día, una línea en el registro de cambios al siguiente. Eso hace que esto sea un artículo de «lo que sabemos hasta ahora», con una actualización temprana. El repositorio nos dice mucho: el modelo se puede descargar y ejecutar realmente hoy mismo, y la hoja de especificaciones es pública. Y ya ha llegado una puntuación externa: Artificial Analysis sitúa a MiniCPM5-2B en su Intelligence Index v4.2 con un 15, el mejor resultado de pesos abiertos por debajo de 4B de parámetros totales en ese índice, por lo que la clasificación sub-4B ya no depende únicamente de la palabra del proveedor. Lo que todavía no está confirmado son las cifras principales de la ficha del modelo, que OpenBMB reprodujo en su propio banco de pruebas y que nadie fuera del laboratorio ha vuelto a ejecutar. Esto es lo que se puede saber desde el repositorio, lo que ahora se ha medido de forma independiente y lo que aún necesita verificación antes de que construyas sobre ello.
¿Qué acaba de pasar?
MiniCPM5-2B es el segundo modelo de la serie MiniCPM5, después del MiniCPM5-1B, que OpenBMB publicó en código abierto el 19 de mayo. Cuando el 2B se lanzó como producto en la WAIC, la historia era tanto de chips como de modelos: ModelBest lo presentó como una base de agentes en el dispositivo para teléfonos, PC y cabinas inteligentes, y nombró nueve chips con soporte desde el primer día a través de su comunidad FlagOS, desde Huawei Ascend hasta NVIDIA, además de un amplio abanico de aceleradores nacionales. La publicación en código abierto se anunció como inminente. Pasaron siete semanas.
El 6 de septiembre apareció el repositorio openbmb/MiniCPM5-2B. Al momento de escribir esto, la tarjeta del modelo es el anuncio de lanzamiento, y es inusualmente completa para una publicación discreta:
• Pesos — el checkpoint final post-entrenado de RL + OPD en BF16, con licencia Apache-2.0 y sin restricciones de acceso — cualquiera puede descargarlo.
• Puntos de control complementarios — {{1}}MiniCPM5-2B-SFT, -Midtrain y -Base{{/1}} para quienes quieren el modelo antes de RL/OPD, además de {{2}}-GGUF, -MLX, -GPTQ y un modelo de borrador -DSpark{{/2}}, todos enumerados en la colección MiniCPM5 de Hugging Face.
• Datos: los corpus de entrenamiento también son abiertos, publicados como parte de la familia UltraData: Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, UltraData-SFT-Agent-2609 y UltraData-RL-2609.
• Espejos — el README apunta tanto a Hugging Face como a ModelScope.
Una línea de la tarjeta importa más de lo que parece: «sin kernels personalizados, sin fork del código del modelo». MiniCPM5-2B utiliza la arquitectura estándar LlamaForCausalLM, por lo que cualquier motor que ya sirva modelos de la familia Llama puede cargarlo sin esperar una implementación a medida.
Por qué un modelo de 2.5B merece una segunda mirada
La presentación en WAIC se basó en los rankings. ModelBest afirmó que MiniCPM5-2B obtuvo un índice de inteligencia de Artificial Analysis de 17, lo que lo colocó en primer lugar entre los modelos de menos de 4B parámetros en el ranking de AA en el momento del lanzamiento. Ese número conlleva dos salvedades. Primero, las puntuaciones del índice solo son comparables dentro de una versión de metodología: el 17.9 anterior del MiniCPM5-1B provenía de una instantánea previa de AA, por lo que no es evidencia de que el modelo más pequeño "obtenga una puntuación más alta", y, por la misma regla, una puntuación más reciente con una metodología más nueva no es una regresión. Segundo, las cifras de AA alimentan la ficha del modelo, pero el promedio destacado de la ficha es propio de OpenBMB, reproducido en el propio entorno de pruebas de OpenBMB. Esa distinción importa porque AA desde entonces ha adoptado una metodología más nueva y ha publicado una puntuación nueva: la primera verificación externa de la propuesta desde el lanzamiento de los pesos abiertos.
Un número externo llegó la misma semana que los pesos. El 4 de septiembre, Artificial Analysis publicó Intelligence Index v4.2, una revisión de metodología que eleva al 40% el peso de las pruebas privadas reservadas y añade dos nuevos componentes: AA-Briefcase, una evaluación de agentes, y el GDP.pdf de Surge, una tarea de razonamiento documental de contexto largo. La entrada del índice de AA para MiniCPM5-2B ahora muestra una puntuación de 15 en v4.2: el mejor resultado entre los modelos de pesos abiertos con menos de 4B de parámetros totales, y el primero de los 47 modelos abiertos de esa clase de tamaño en el listado de AA. Eso mantiene al modelo donde lo situó la presentación de julio, esta vez con una metodología más difícil de manipular y con pesos que cualquiera puede descargar y volver a verificar. El 15 no es comparable al 17 de la época del lanzamiento, que provenía de v4.1 — la metodología es más estricta, no el modelo más débil — y el compuesto no vuelve a verificar las filas individuales de la ficha, la mayoría de las cuales OpenBMB reprodujo en su propio banco de pruebas. Lo que sí hace es incidir en los dos ejes para los que OpenBMB dice haber optimizado el modelo: v4.2 se apoya más en tareas de agentes, y el seguimiento de verbosidad de AA muestra que MiniCPM5-2B genera 57M tokens de salida en las tareas del índice, el modelo más conciso de su clase frente a una mediana de 72M. OpenBMB agradeció a AA la ejecución y lo enmarcó exactamente en esos términos: rendimiento agéntico y eficiencia de tokens en 2.6B, dijo, son para lo que fue optimizado el modelo.
La afirmación sustancial era la capacidad agéntica en un paquete pequeño: llamada nativa a herramientas, búsqueda profunda y generación de código, entrenadas desde cero en lugar de añadidas como remiendo. La ficha técnica describe un proceso de tres etapas: entrenamiento base, entrenamiento intermedio y luego post-entrenamiento con SFT sobre 400 mil millones de tokens de datos de pensamiento profundo, profesores RL especializados y destilación on-policy (OPD) que fusiona dieciséis modelos expertos RL, cinco de ellos agénticos, de nuevo en una única red densa pequeña. OpenBMB atribuye a la etapa de RL + OPD una ganancia media de 10,96 puntos en tareas de razonamiento y generales y de 6,96 puntos en tareas agénticas — diferencias internas, pero explican la inusual forma de este modelo: una red de 2,5 mil millones de parámetros construida como un modelo de razonamiento y orientada al uso de herramientas.

Lo que realmente contiene el repositorio
La hoja de especificaciones es inequívoca, porque es el archivo de configuración. MiniCPM5-2B tiene 2.516.756.480 parámetros, de los cuales 1.981.982.720 son no-embedding — los proveedores cuentan la cifra de no-embedding cuando dicen "clase 2B". Es un transformador denso con 42 capas, un tamaño oculto de 2048, atención de consulta agrupada con 16 cabezales de consulta y solo 2 cabezales de KV, un vocabulario de 130.560 y tensores BF16. Todo el modelo se distribuye como un único shard de safetensors, lo bastante pequeño para descargarlo con una conexión de portátil y ejecutarlo en una GPU de gama media o en una NPU de clase teléfono.
• Params — 2,516,756,480 en total; 1,981,982,720 no-embedding.
• Arquitectura — LlamaForCausalLM denso, 42 capas, tamaño oculto de 2048, GQA con 16 cabezas de consulta y 2 cabezas KV, vocabulario de 130.560.
• Contexto — 131,072 tokens configurados (max_position_embeddings), sin escalado de RoPE en la configuración.
• Licencia — Apache-2.0, tanto para el modelo como para los datos de entrenamiento liberados.
• Formato — BF16; los archivos compatibles con GGUF, MLX y GPTQ se publican por separado.

Una cifra de la presentación de julio no aparece en el checkpoint. Los materiales de WAIC presumían una ventana de contexto de 512K tokens; la configuración publicada establece max_position_embeddings en 131,072 (128K) sin entrada de rope_scaling. Es posible que la cifra de 512K se pretenda alcanzar mediante una extensión en tiempo de inferencia, de la misma manera que varios modelos pequeños amplían su contexto — pero tal como se distribuye, el repositorio documenta 131,072, y ese es el número de referencia para el diseño hasta que OpenBMB publique una receta de extensión.
Los números, ordenados por quién los midió.
La ficha del modelo es cuidadosa con la procedencia, y merece la pena leer las notas al pie. Las puntuaciones que marca con una daga «provienen de la publicación oficial de Artificial Analysis» — filas como GPQA-Diamond 70.2, HLE 8.9, AA-LCR 59.0, Terminal-Bench v2.1 8.6 y GDPval-AA v2 19.6. Todo lo demás se describe como «reproducido internamente», lo que significa que OpenBMB ejecutó esas evaluaciones en su propio banco de pruebas. Esa categoría incluye las cifras que más llaman la atención: una media interna de 53.9 en el conjunto de comparación de la ficha, AIME 2025/2026 con 86.5, MATH-500 con 94.6, LiveCodeBench v6 con 69.1, SWE-bench Verified con 46.4, BFCL v4 con 66.6, τ²-Bench Telecom con 97.1, GAIA (Text-103) con 88.7 y MMLU-Pro con 70.8.
Hay tres cosas que mantienen honestas esas cifras al leerlas. La media de 53.9 es una puntuación relativa, no absoluta: la ficha normaliza cada eje del radar para que el mejor modelo de la comparación obtenga 100. El conjunto de comparación lo selecciona el proveedor: otros modelos abiertos de 2B-4B, incluidos Qwen3.5-2B, Qwen3.5-4B, Gemma-4-E2B-it, granite-4.2-3B, LFM2.5-2.6B y LFM2.5-8B-A1B. Dentro de ese conjunto, la ficha muestra a MiniCPM5-2B superando al siguiente mejor, Qwen3.5-4B, con 51.1: un resultado francamente llamativo para un modelo de la mitad de tamaño y, precisamente, el tipo de resultado que exige una reproducción independiente antes de que nadie construya sobre él. Además, un par de filas concretas son difíciles de conciliar con el marketing: un SWE-bench Verified de 46.4 procedente de un modelo denso de 2.5B sería notable si se reproduce, mientras que un HLE de 8.9 recuerda que «líder sub-4B» y «frontera» son ligas distintas. Nada de esto contradice el repositorio, y el compuesto v4.2 de AA ha confirmado desde entonces la posición general del modelo al frente de la clase de pesos abiertos sub-4B; pero esas filas específicas son de OpenBMB, aún sin verificar por nadie ajeno al laboratorio.
Ejecutando MiniCPM5-2B hoy
Debido a que la arquitectura es Llama pura, los motores convencionales la cargan directamente. El README de OpenBMB ofrece guías de inicio rápido para vLLM (0.21 o superior), SGLang (0.5.16 o superior) y Transformers (5.6 o superior), con un muestreo recomendado a temperatura 1.0 y top-p 0.95, y enable_thinking activado cuando se desea el paso de razonamiento. Los complementos GGUF y MLX cubren llama.cpp, Ollama, LM Studio y Apple Silicon; la ficha también enumera el runtime ArcLight y las pilas de fine-tuning habituales (TRL + PEFT, LLaMA-Factory, ms-swift, unsloth).
Hay dos detalles de implementación que conviene conocer antes de empezar. Para la llamada a herramientas y funciones, SGLang es el backend recomendado: el modelo emite llamadas a herramientas en formato XML, y el analizador minicpm5 integrado en SGLang las convierte de forma nativa en tool_calls compatibles con OpenAI, lo que significa que los clientes estándar de llamada a herramientas funcionan sin necesidad de un adaptador personalizado. Y el modelo borrador DSpark existe para abaratar el paso de razonamiento: lanzado en SGLang con el algoritmo de decodificación especulativa DSPARK, acelera la decodificación sin alterar las salidas del modelo objetivo, algo que determina si un bucle de agente con contexto de 128K en una computadora portátil es utilizable o apenas posible.

Si prefieres evaluar un lote de modelos abiertos pequeños en lugar de ajustar uno a mano, la capa de enrutamiento justifica su presencia aquí: cuando un proveedor incorpora MiniCPM5-2B, un router es la forma barata de hacerle un A/B contra Qwen3.5-2B y los demás checkpoints abiertos de menos de 4B en la misma tarea, sin una segunda integración. En OrcaRouter eso supone una sola API con más de 200 modelos, precios de catálogo de los proveedores trasladados sin margen y conmutación automática ante fallos si un checkpoint recién salido se estanca o entra en bucle en una ruta de producción. El repo tiene apenas dos días y todavía no hay ningún API alojado al que podamos señalar que incluya MiniCPM5-2B, así que lo honesto por defecto hoy es tratarlo como un experimento de autoalojamiento, no como una dependencia.
¿Quién debería levantar estas pesas?
Descárgalos hoy si tu trabajo son agentes en el dispositivo, llamada de herramientas en el borde o experimentos de codificación y razonamiento con modelos pequeños, y quieres la opción de clase 2B con el entrenamiento más agresivo sobre la mesa. La licencia Apache-2.0 y los datos de entrenamiento abiertos eliminan las dos razones por las que la mayoría de los equipos dudan ante un modelo pequeño de laboratorio chino: sin restricción de uso comercial y sin corpus de caja negra. Descárgalos con cautela si estás eligiendo un modelo de producción basándote solo en la tabla de benchmarks: las filas principales de la ficha son reproducciones del propio OpenBMB, y el compuesto v4.2 de AA —la única medición externa hasta ahora— no las respalda. Un modelo de 2.5B que supuestamente supera a Qwen3.5-4B es una afirmación que merece las dos horas que se tarda en reproducir SWE-bench por uno mismo.
Qué ver a continuación. El repositorio tiene apenas dos días, así que las señales a corto plazo siguen siendo mecánicas: si llama.cpp y la librería de Ollama incorporan el GGUF, si el espejo de ModelScope y las compilaciones para el chip FlagOS se lanzan sin problemas, y si una API alojada añade MiniCPM5-2B a su catálogo — ese es el momento en que deja de ser exclusivamente autoalojado. La señal sustantiva que esta pieza señaló como ausente — una ejecución independiente por parte de Artificial Analysis o de un laboratorio universitario — ya ha llegado en forma del puntaje del índice v4.2, y mantiene a MiniCPM5-2B en primer lugar entre los modelos de pesos abiertos de menos de 4B. Lo que sigue pendiente es la verificación a nivel de fila: nadie fuera de OpenBMB ha reproducido las cifras internas de la ficha, sobre todo SWE-bench Verified con 46.4 y el promedio interno de 53.9. Hasta que se vuelvan a ejecutar esas filas específicas, trata a MiniCPM5-2B como tratarías a cualquier modelo lanzado discretamente con una ficha impresionante: como una hipótesis muy prometedora que puedes ejecutar localmente esta noche, y como un modelo cuyas cifras más llamativas deberías verificar antes de confiarle trabajo real.
