Una tarjeta de título generada que dice «Intern-Decision-2B vs MiniCPM5-2B», con el subtítulo «Dos presupuestos de 2B, con veinte días de diferencia», con las insignias «un puntuador de decisiones» y «un generalista denso», con el logotipo de OrcaRouter compuesto en la esquina.
Guides & Insights

Intern-Decision-2B vs MiniCPM5-2B: dos checkpoints de 2B, con veinte días de diferencia, formas opuestas de gastar los parámetros

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

internlm/Intern-Decision-2B y openbmb/MiniCPM5-2B son del mismo tamaño, se publicaron con veinte días de diferencia, tienen la misma licencia y están concebidos para trabajos que no se parecen en nada. El checkpoint de InternLM son 2.213.241.664 parámetros de evaluador de decisiones: recibe un estado y preguntas tipadas, ejecuta una única pasada hacia delante y devuelve probabilidades calibradas sin generar un solo token, y rechaza cualquier entrada que supere los 8.192 tokens. El de OpenBMB son 2.516.756.480 parámetros de generalista denso: un Llama de 42 capas derivado de la receta de MiniCPM5, que acepta 131.072 tokens de contexto, escribe código, llama a herramientas y hace matemáticas, con un Artificial Analysis Intelligence Index de 12,5 y 726.518 descargas el mes pasado. Cuestan lo mismo de descargar y compran cosas completamente distintas.

Lo interesante de este emparejamiento no es la brecha en el benchmark —apenas hay un benchmark que se solape para comparar—. Es en qué puede gastarse cada uno de los presupuestos de 2.200 millones y 2.500 millones de parámetros, y qué te dice la elección sobre cuál de los dos está terminado. MiniCPM5-2B es el segundo modelo de su serie, que sigue a MiniCPM5-1B de mayo, y llegó con un aparato de lanzamiento completo. Intern-Decision-2B es el intermedio de los tres tamaños que InternLM subió a Hugging Face a las 05:36 UTC del 26 de septiembre de 2026 sin anuncio alguno, y su aparato de lanzamiento —una base de código de entrenamiento, un paquete de evaluación verificado por hash, un benchmark de calibración de 96 casos— no se hizo público hasta esta mañana a las 08:58 UTC.

A dónde fueron los dos presupuestos

Ambos modelos son ajustes finos de la arquitectura de otra persona, y ambos tienen aproximadamente 2500 millones de parámetros. Ahí es donde termina el parecido.

A screenshot of the Hugging Face model card for openbmb/MiniCPM5-2B, showing the OpenBMB organisation, the tags Text Generation, Transformers, Safetensors, English, Chinese, llama, minicpm5, long-context, tool-calling, on-device and edge-ai, an Apache 2.0 licence, the MiniCPM Tech Report, MiniCPM Wiki, GitHub Repo, UltraData and Online Demo links, and the model title.

MiniCPM5-2B es un Transformer denso de 42 capas, tamaño oculto de 2.048, 16 cabezas de atención, un tamaño intermedio de 6.144, un vocabulario de 130.560 tokens y un contexto de 131.072 tokens, entrenado con una mezcla de corpus abiertos que OpenBMB publicó junto a él: UltraX para preentrenamiento web, UltraData-Code con gestión de código por niveles L0–L3, UltraData-Math, y 500.000 muestras SFT de agentes con más de 80.000 muestras de RL en UltraData-RL-2609. Su postentrenamiento ejecuta SFT, luego profesores de RL especializados en matemáticas, código y tareas agénticas, y después destilación on-policy de vuelta a un único modelo. Es un modelo de propósito general cuyo presupuesto completo de parámetros se expone como capacidad que se puede invocar mediante prompts.

Intern-Decision-2B es un Qwen3_5ForConditionalGeneration con 24 capas —un patrón repetitivo de tres capas de atención lineal por cada capa de atención completa—, tamaño oculto 2.048, 8 cabezas de consulta frente a 2 cabezas de clave-valor, dimensión de cabeza 256, una capa de predicción multi-token retenida y un techo de embeddings de 262.144 posiciones. Se entrega con una torre de visión de 612,5 MB y un proyector de 50,3 MB. Casi nada de ese presupuesto está disponible para ti como prompt: el modelo responde a un esquema fijo de preguntas, y su arquitectura es el mecanismo de entrega de un softmax, no un generador de texto.

Vale la pena destacar un detalle del repositorio recién publicado de InternLM, porque replantea la etiqueta multimodal de la tarjeta del modelo. El ajuste de decisión «afina la columna vertebral lingüística de Qwen3.5 mientras congela la torre de visión y el proyector». Tanto los checkpoints de decisión de 2B como los de 4B incluyen un fragmento de visión de exactamente 612.517.440 bytes —el mismo tamaño en ambos—, lo que es coherente con que esos componentes se hereden de la base de Qwen en lugar de haberse entrenado. La ruta de imagen es real y es utilizable, pero no es en lo que el ajuste de decisión de InternLM centró sus esfuerzos. Si tu carga de trabajo es puntuación de decisiones solo de texto, aproximadamente 660 MB de esa descarga de 4,46 GB no te aportan nada.

Marcador

A two-column comparison scoreboard titled 'Intern-Decision-2B vs MiniCPM5-2B'. The left column reads: Parameters 2,213,241,664 plus vision tower; Context 8,192 tokens, refused above; Output calibrated probabilities, no text; Modality text plus up to 8 images; Published evidence vendor table, unreproduced; Adoption one like, zero downloads. The right column reads: Parameters 2,516,756,480 dense; Context 131,072 tokens; Output generated text, token by token; Modality text only; Published evidence OpenBMB card, AA Index 12.5; Adoption 726,518 downloads last month. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the MiniCPM5-2B figures are OpenBMB's own card plus an independent Artificial Analysis index.

• Parámetros — Intern-Decision-2B: 2.213.241.664 en BF16 más aproximadamente 660 MB de torre de visión y proyector, unos 4,46 GB de repositorio; MiniCPM5-2B: 2.516.756.480 en BF16, un archivo safetensors de 5,03 GB.

• Contexto — 8.192 tokens para Intern-Decision-2B, rechazado sin truncamiento por encima de eso; 131.072 tokens para MiniCPM5-2B.

• Salida — una distribución calibrada más un argmax por campo, sin texto alguno; texto generado, token a token.

• Entrenamiento — ajuste de decisión de un backbone Qwen3.5-2B con la torre de visión congelada, datos de entrenamiento no revelados; una pasada completa de preentrenamiento, entrenamiento intermedio y SFT de pensamiento profundo de 400 mil millones de tokens, seguida de RL y destilación on-policy, con los corpus publicados de manera conjunta.

• Evidencia publicada: una tabla de proveedor de siete suites que promedia 84.68, con Brier 0.437 y ECE 0.100, sin que ningún tercero la haya reproducido, un «me gusta» y cero descargas; una tarjeta de OpenBMB que promedia 53.9 dentro de su propio conjunto de comparación y un índice independiente Artificial Analysis Intelligence Index de 12.5, con 726,518 descargas en el último mes.

• Licencia — Apache-2.0 con los términos de Qwen originales conservados como LICENSE-QWEN, y ninguna licencia declarada en absoluto en el repositorio de código; Apache-2.0 en todo, incluido el código.

En qué es realmente mejor cada uno, y no hay comparación.

La comparación es asimétrica hasta el punto de constituir un error categorial, por lo que es más útil nombrar los trabajos.

MiniCPM5-2B gana en todo lo que implica producir una respuesta en lugar de seleccionar una. Escribe código; Intern-Decision-2B no tiene ruta de código. Maneja un contexto de 131.072 tokens; Intern-Decision-2B se detiene en 8.192 y falla de forma ruidosa. Llama a herramientas, con una puntuación de 66,6 en BFCL v4 en la propia tabla de OpenBMB, y hace matemáticas, con MATH-500 en 94,6 y GPQA-Diamond en 70,2 — cifras de la tarjeta del proveedor, con la fila de GPQA con una nota al pie que la propia tarjeta proporciona. Soporta 70,8 en MMLU-Pro y 84,7 en MMLU-Redux. Se ejecuta en llama.cpp y MLX, se distribuye en variantes GGUF, GPTQ y DSpark, y tiene un Space de demostración en el Hub que es público, a diferencia del 401 al que apunta la tarjeta de Intern-Decision.

Intern-Decision-2B gana exactamente dos cosas, y son la razón por la que existe. Primero, una decisión de conjunto cerrado con un esquema que tú escribes devuelve una probabilidad que puedes umbralizar, en una sola pasada hacia adelante, en unos 33 milisegundos, sin parser y sin muestreo — una forma que MiniCPM5-2B no puede producir salvo generando texto y esperando que el número dentro de él se comporte bien. Segundo, es un artefacto reproducible: el repositorio ahora incluye el objetivo de entrenamiento, las siete suites de precisión con hashes SHA-256 y recuentos de filas por suite, el código de puntuación, los scripts de ajuste de temperatura y de replay, y un benchmark de calibración de distribución de 96 casos con su propio generador y evaluador offline. La guía de evaluación de InternLM señala que los presets publicados están vinculados al backend XTuner y que los resultados de HF deben informarse como un entorno de ejecución diferente — que es exactamente el tipo de advertencia que un kit de reproducción existe para hacer verificable.

A screenshot of the GitHub repository page for InternLM/Intern-Decision, showing the organisation and repository breadcrumb, the description 'Fast multi-modal decision model', 5 stars and 0 forks, the file tree with assets, benchmarks, configs, docs, runtime, scripts, src and tests directories plus a release-manifest.json, and a commit list headed by 'Add demonstration videos and centered README links' roughly an hour old.

Quién debería descargar cuál

Si tienes una tarea que implica leer algo largo, escribir algo o responder una pregunta cuyas opciones no enumeraste de antemano, MiniCPM5-2B es el modelo y no hay decisión que tomar. Es un generalista terminado de clase 2B con un ecosistema real, datos abiertos detrás de él y un listado de evaluación independiente, y probarlo no cuesta nada: las compilaciones GGUF y MLX ya están en el Hub.

Si tienes una tarea que es genuinamente una elección entre respuestas conocidas —enrutar un ticket, clasificar un correo de soporte, etiquetar a un candidato, puntuar una intención en una escala ordinal—, entonces un modelo generativo es el instrumento equivocado, e Intern-Decision-2B es el más interesante de los dos aunque casi nadie lo haya ejecutado. Una probabilidad a la que puedes aplicar un umbral es más barata de operar, más fácil de auditar e imposible de alucinar, y el hecho de que el checkpoint llegara con un kit de reproducción en lugar de una publicación en una tabla de clasificación lo convierte en el mejor documentado de los dos en el aspecto que importa cuando tienes que defender la elección.

Ninguno de los dos modelos está en OrcaRouter. Nuestra página del modelo Intern-Decision-2B devuelve 404 y no existe ninguna ruta para MiniCPM5-2B; nada de esto constituye una afirmación de disponibilidad, y ambos implican ejecutar tu propia inferencia. Donde sí existe la alternativa práctica es en los modelos de decisión alojados: Jev 1.13 de TypeSafe, el modelo con el que InternLM comparó toda su familia, está en el catálogo a $0,042 por millón de tokens de entrada, con un contexto de 65K y un tiempo hasta el primer token (P50) de 178 ms. Y si lo que realmente necesitas es un modelo generalista de la misma clase de tamaño que MiniCPM5-2B sin el trabajo operativo, nuestra ruta Qwen alojada más pequeña es varias veces más grande, pero es una sola clave entre más de 200 modelos, a precio de lista del proveedor transferido sin ningún recargo y conmutación automática por error detrás.

El único número que lo decide

No es 84,68 frente a 53,9. Esos dos promedios provienen de suites distintas, medidos por laboratorios distintos y, en un caso, por un laboratorio cuyas cifras nunca se han verificado. El número que lo decide es 8.192. Si tu estado cabe dentro de ocho mil tokens y tu respuesta ya es una lista, Intern-Decision-2B es un instrumento preciso con un kit de reproducción y una anomalía de calibración de la que deberías estar al tanto —su error de calibración esperado de 0,100 es el peor de los tres tamaños que publicó InternLM, frente a 0,066 para el modelo de la mitad de su tamaño—, así que ajusta tu propia temperatura antes de confiar en un valor de confianza. Si tu estado no cabe, el asunto se acaba antes de que empiecen los benchmarks, y MiniCPM5-2B es la respuesta.