
Kolibri vs MiniCPM5-2B: 78 mil millones de parámetros frente a 2,5, y por qué el pequeño no es la opción barata
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 217 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Coloque Kolibri junto a MiniCPM5-2B y la lectura instintiva es que se trata de una comparación de tamaños, y que el modelo de 2500 millones de parámetros es la opción económica. Esa lectura es errónea de una manera instructiva. Kolibri es el modelo de mezcla de expertos de 78,1 mil millones de parámetros de Aleph Alpha, publicado el 3 de octubre de 2026, que activa 3460 millones de parámetros por token, con una huella en FP8 de unos 78 GB y una configuración mínima de servicio de dos tarjetas A100 de 80 GB. MiniCPM5-2B es el modelo denso de 2520 millones de parámetros de ModelBest y OpenBMB, presentado en la Conferencia Mundial de Inteligencia Artificial el 19 de julio de 2026, con los pesos disponibles en Hugging Face el 6 de septiembre. MiniCPM5-2B es treinta y una veces más pequeño en cuanto a número de parámetros. También es el que exige un presupuesto de evaluación antes de confiar en él, porque sus cifras más citadas proceden del proveedor y no se han reproducido —lo que es precisamente lo contrario de lo que «modelo pequeño» suele implicar en cuanto al riesgo.
Ambos se lanzaron en silencio; solo uno de ellos se lanzó recientemente.
Tienen historias de origen similares y edades muy diferentes, y las edades importan. El repositorio de Aleph Alpha para Kolibri se creó el 2 de octubre de 2026 con una fecha de lanzamiento declarada del 3 de octubre, y el anuncio de la propia sala de prensa del proveedor se emitió esa mañana, el Día de la Reunificación Alemana. La prensa generalista de IA en gran medida lo pasó por alto ese día, de ahí proviene el encuadre de "lanzamiento silencioso", pero una tarjeta de modelo, un informe técnico y una publicación del proveedor no son un lanzamiento silencioso. MiniCPM5-2B realmente fue más discreto: el anuncio de WAIC en julio fue la presentación en una conferencia de una propuesta y especificaciones, y los pesos reales no aparecieron hasta el 6 de septiembre, publicados sin un evento de lanzamiento, junto con checkpoints GGUF, MLX, GPTQ, base, SFT y draft, y los corpus de entrenamiento que hay detrás de ellos.
Esa brecha de cinco semanas entre el anuncio y los pesos vale la pena recordarla, porque es la razón por la que circulan dos conjuntos diferentes de números para este modelo. El material de julio presumía de una ventana de contexto de 512K tokens. La configuración publicada establece 131,072. El artefacto lanzado es el que cuenta.
Para qué sirve realmente cada modelo
Kolibri está diseñado para el trabajo con documentos en alemán e inglés, y Aleph Alpha es inusualmente específico sobre por qué eso requirió ingeniería real. Pequeños experimentos con modelos proxy fijaron un objetivo de aproximadamente un 20 por ciento de alemán en la mezcla de entrenamiento, lo que para una ejecución de 20 billones de tokens significaba encontrar 4 billones de tokens en alemán. Los conjuntos de datos alemanes abiertos, deduplicados y filtrados, arrojaron 390.000 millones —un orden de magnitud por debajo—, así que el laboratorio reajustó un filtro de Common Crawl específicamente para el alemán, produciendo 1,3 billones de tokens orgánicos únicos, y reformuló documentos alemanes existentes en entradas de enciclopedia, diálogos y pasajes para aproximadamente otro billón más, que se convirtió en la mayor fuente única en alemán. La traducción, utilizada para el predecesor Kolibri Origin, se descartó para Kolibri. El detalle del filtro es el que hay que retener: un pipeline estándar de datos lingüísticos descarta documentos con demasiadas palabras largas, y la prosa administrativa alemana supera rutinariamente el límite inglés de longitud media de palabra, por lo que la configuración predeterminada elimina silenciosamente el registro en el que escribe la administración pública.
MiniCPM5-2B se construyó para el extremo opuesto: un agente en el dispositivo. La tarjeta describe un transformer denso de 2,52 mil millones de parámetros totales, 1,98 mil millones excluyendo embeddings, 42 capas con tamaño oculto 2048, atención de consultas agrupadas con 16 cabezas de consulta y 2 cabezas KV, y una arquitectura estándar LlamaForCausalLM sin kernels personalizados. El pipeline de entrenamiento tiene un enfoque agéntico: entrenamiento intermedio de agente a escala de 200 mil millones, un gran conjunto de SFT para agentes, alineación mediante RL para agentes y una etapa final de Destilación On-Policy que vuelve a integrar dieciséis modelos expertos de RL en una única red densa pequeña. Incluye llamadas a herramientas estilo XML con un analizador de SGLang integrado, y su configuración publicada establece una ventana de 131.072 tokens.
• Parámetros — Kolibri: 78.103.074.560 en total, 3.457.573.120 activos, dispersión de 22,6:1. MiniCPM5-2B: 2.516.756.480 en total, 1,98 mil millones sin embeddings, denso.
• Publicado — Kolibri: 3 de octubre de 2026. MiniCPM5-2B: anunciado el 19 de julio de 2026, pesos el 6 de septiembre de 2026.
• Contexto — Kolibri: 16,384 entrenado, 65,536 con entrenamiento intermedio, 262,144 nativo, 1,048,576 validado. MiniCPM5-2B: 131,072 en la configuración distribuida; la afirmación de 512K de julio no figura en ella.
• Huella — Kolibri: unos 78 GB en FP8; como mínimo, dos A100 de 80 GB, dos H100 SXM5, una H200, una B200 o una B300. MiniCPM5-2B: un único fragmento BF16, de clase portátil.
• Idiomas — Kolibri: alemán e inglés, por diseño y nada más. MiniCPM5-2B: inglés y chino, con todas las suites de evaluación publicadas en inglés.
• Llamada a herramientas: estilo Hermes con un analizador v1 incluido. MiniCPM-2B: XML con un analizador SGLang.
• Licencia — ambas Apache 2.0, ambas sin una cláusula adicional de uso aceptable.

Los tableros de puntuación, y el abastecimiento que hay detrás de ellos
No hay ninguna cifra de comparación directa para esta combinación en ningún lugar, ni en el material de ninguno de los dos proveedores, y no vamos a ensamblar una a partir de dos arneses de prueba distintos para llamarla comparación. Conviene separar cuidadosamente lo que publica cada parte, porque los dos conjuntos de cifras aportan cantidades muy distintas de evidencia.
Los números de Kolibri provienen de la propia tabla comparativa de catorce modelos de Aleph Alpha, ejecutada en un único arnés con Kolibri en esfuerzo de razonamiento alto: 75,5 en el promedio en inglés, 70,8 en el promedio en alemán. Esa tabla no favorece a su sujeto: Qwen3.8 27B obtiene 80,2 y 79,9 en los mismos dos promedios y lidera en GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified y ambas pruebas de contexto largo, mientras activa aproximadamente un octavo de los parámetros de Kolibri. El encuadre del proveedor para esa brecha es una frontera de Pareto de calidad frente a tokens decodificados por segundo por GPU, que ninguno de los modelos comparados supera. Es un argumento de economía de servicio, no de capacidad, y ningún tercero lo ha medido: no hay entrada de Artificial Analysis para Kolibri ni replicación del arnés.
Los números de MiniCPM5-2B provienen de su propia ficha: un promedio interno de 53,9 en un conjunto de comparación seleccionado por el proveedor, AIME 2025/2026 con 86,5, MATH-500 con 94,6, y un 46,4 ejecutado por el proveedor en SWE-bench Verified que sería notable para un modelo denso de 2.500 millones de parámetros si supera pruebas independientes. En esa ficha, Granite 4.2 3B de IBM se sitúa en 42,7 frente a los 53,9 de MiniCPM5-2B —un proveedor ejecutando ambos modelos en una misma suite que él eligió—. Distintas suites, distintos harnesses, distintos proveedores. Nada de esto es un veredicto sobre este emparejamiento.
Lo que es verdaderamente útil del lado de MiniCPM5-2B es la divulgación. OpenBMB publicó los corpus de entrenamiento UltraData junto con los pesos —Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, los conjuntos SFT y RL de agentes—, todo bajo Apache 2.0, lo que convierte una caja negra en una receta que puedes inspeccionar y continuar en tu propio dominio. El modelo también llega con adaptación desde el primer día para nueve familias de chips a través de la comunidad FlagOS de ModelBest, desde Huawei Ascend hasta NVIDIA y ARM, lo cual es una declaración de despliegue más que de benchmarks. En contraste, IBM publicó los pesos de Granite 4.2 3B y un relato técnico detallado de su construcción, pero no sus datos de entrenamiento, y Aleph Alpha publicó el pipeline de datos y la contabilidad energética de Kolibri —20 billones de tokens de preentrenamiento, 9,5×10² MWh incluyendo la sobrecarga del centro de datos y excluyendo el ajuste fino supervisado y el aprendizaje por refuerzo—, pero no el corpus en sí.
Donde realmente se nota la diferencia de tamaño
La forma más útil de poner a estos dos uno junto al otro es sobre los dos ejes que deciden un despliegue real: qué tiene que haber en la sala y qué ocurre cuando el modelo se equivoca.
A nivel de hardware, MiniCPM5-2B gana y no por poco. Un modelo denso de 2,52 mil millones de parámetros en un solo shard BF16 se ejecuta en una laptop, un dispositivo de borde o una sola GPU de consumo, y el soporte de FlagOS en nueve familias de chips significa que se ejecuta en hardware que no es un acelerador NVIDIA en absoluto. El mínimo de Kolibri son dos tarjetas A100 de 80 GB o una B200, aproximadamente 78 GB de pesos FP8, servido a través del plugin vLLM de aleph-alpha-inference o el contenedor publicado. Para una carga de trabajo de cabina inteligente o relacionada con teléfonos, el 2B es el único de los dos que califica, y Kolibri nunca fue diseñado para competir allí.
En cuanto a la verificabilidad, Kolibri gana por una razón más sutil. Su afirmación más citada —la economía del servicio— no está probada, pero sus cifras de calidad al menos están publicadas frente a trece competidores nombrados en un mismo banco de pruebas con la configuración divulgada, y la propia tabla del proveedor concede la victoria en la mayoría de las filas a un oponente. Las cifras destacadas de MiniCPM5-2B son del proveedor, en la suite del proveedor y sin ningún banco de pruebas comparativo divulgado, y el modelo arrastra la incertidumbre adicional de un checkpoint que tiene semanas de antigüedad en lugar de días. Ninguno de los dos modelos ha sido evaluado de forma independiente. La diferencia es que un proveedor escribió una comparación que hace perder a su propio modelo, y el otro escribió una que hace ganar a su propio modelo por un amplio margen.
A propósito, no hay competencia en absoluto. Kolibri existe para el procesamiento de documentos en alemán en las instalaciones, con un tokenizador bilingüe que Aleph Alpha reporta en 4,90 bytes promedio por token en texto web en alemán, frente a los 4,35 de GPT-5 y los 3,28 de Kimi K3 — todo medido por el proveedor, y un efecto en el costo por token más que una afirmación de calidad. MiniCPM5-2B existe para agentes de llamada a herramientas en inglés y chino en hardware limitado. Un equipo con contratos en alemán y un requisito de cumplimiento normativo no está eligiendo entre ellos.

La realidad del enrutamiento, y el experimento que vale la pena realizar
Ninguno de los dos modelos está hoy en un catálogo alojado, y comprobamos ambos en lugar de suponerlo. Kolibri no tiene un SKU de API de proveedor —la publicación son pesos, un informe técnico y una imagen de contenedor— y no está en OrcaRouter: consultamos el catálogo con todas las grafías posibles del prefijo del proveedor y del nombre del modelo, y devuelve no encontrado. MiniCPM5-2B tampoco tiene un endpoint alojado de ModelBest, y no está enrutado con nosotros. Ambas son propuestas de autoalojamiento y preferimos decirlo antes que dar a entender que servimos cualquiera de las dos.
Donde esto se vuelve interesante es en el experimento. Un modelo agéntico de 2.500 millones de parámetros y un modelo de documentos de 78.000 millones de parámetros resuelven problemas distintos, y la única forma de saber cuál necesita tu carga de trabajo es ejecutar ambos contra ella, que es exactamente la situación para la que está hecha una capa de enrutamiento, incluso cuando no aloja ninguno de los dos modelos. Apunta una ruta de prueba a una compilación autoalojada de MiniCPM5-2B a través de un endpoint compatible con OpenAI con conmutación por error automática, dejando producción en un modelo enrutado ya probado, y el nuevo stack puede atascarse o producir incoherencias sin que nada se caiga. Los precios de lista de los proveedores de los modelos con los que comparas se repercuten sin margen de beneficio, así que la prueba A/B se mantiene barata y reversible. Y si lo que el experimento revela en realidad es que tu carga de trabajo en alemán no necesita ninguno de los dos modelos autoalojados, la misma clave llega a un nivel pequeño de mezcla de expertos que ya está enrutado —la variante Gemma 4 26B-A4B a 0,06 $ por millón de tokens de entrada y 0,33 $ por millón de salida, con una ventana de 262.144 tokens y entrada de texto, imagen y vídeo—, que es la forma más barata de averiguarlo antes de comprar dos GPU.
¿Cuál, y qué cambiaría la respuesta?
Ejecuta MiniCPM5-2B si la restricción es el dispositivo. Con 2520 millones de parámetros, es el único de los dos que cabe en un portátil, una cabina de mando o un dispositivo de borde, y si tu carga de trabajo es un agente interactivo de llamada a herramientas en inglés o chino, ese es el modelo destinado a ello. Reserva tiempo para reproducir sus cifras primero: el promedio de 53.9 y la afirmación de 46.4 en SWE-bench son solo de ModelBest, y que los corpus de entrenamiento estén abiertos hace que esa reproducción sea genuinamente posible en lugar de teórica.
Ejecute Kolibri si el corpus está en alemán, el hardware existe y los pesos no pueden salir del edificio. Una ventana nativa de 262.144 tokens, una caché KV FP8, cuatro niveles de esfuerzo de razonamiento y la invocación de herramientas de Hermes son la forma adecuada para el trabajo con documentos regulados, y los términos de Apache 2.0 junto con la canalización de datos publicada son la parte que sobrevive a una revisión de adquisiciones.
Hay dos cosas que zanjarían esto más rápido que cualquier discusión. Una ejecución independiente de SWE-bench Verified sobre MiniCPM5-2B confirmaría o hundiría la afirmación más sorprendente que hace cualquiera de las dos fichas. Y una medición independiente del rendimiento de Kolibri en su configuración recomendada de dos H100 —o una entrada en Artificial Analysis, que hoy no existe— convertiría «78 mil millones de parámetros» de una especificación en un costo, que es el número que realmente busca cualquiera que evalúe esta comparación frente al hardware. Hasta entonces, la brecha de tamaño es real, la brecha de propósito es mayor, y la opción que parece barata es la que lleva la afirmación no verificada.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
