Tarjeta hero generada para el explicativo de Kolibri, con el encabezado 'Kolibri: un modelo de pesos abiertos de 78B de Alemania' y la sublínea '78B en total / 3.46B activos / contexto de 1M de tokens / Apache 2.0', además de tres iconos planos de línea: un colibrí, una pila de capas y un candado sobre un documento. El logotipo de OrcaRouter se encuentra en la franja debajo de la ilustración.
Guides & Insights

Kolibri, explicado: Aleph Alpha lanza un modelo alemán-inglés de 78B bajo Apache 2.0

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Aleph Alpha lanzó Kolibri el 3 de octubre de 2026, un modelo de mezcla de expertos de 78,1 mil millones de parámetros que activa 3,46 mil millones de parámetros por token, tiene una ventana de contexto validada de 1.048.576 tokens y se distribuye con los pesos completos en Hugging Face bajo la licencia Apache 2.0. El laboratorio de Heidelberg lo publicó el Día de la Reunificación Alemana, junto con un informe técnico, una ficha del modelo en alemán e inglés y un relato inusualmente detallado de cómo se entrenó el modelo. El modelo con el que se compara en toda la documentación propia de Aleph Alpha es Kolibri Origin — el predecesor de 30,6 mil millones de parámetros y 3,27 mil millones activos que terminó el preentrenamiento el 11 de junio de 2026 y nunca se publicó públicamente. Dos modelos, con tres meses de diferencia, y la distancia entre ellos es lo más interesante del lanzamiento.

Lo que hace que Kolibri merezca una lectura atenta no es que sea el modelo más potente disponible. En las propias tablas comparativas de Aleph Alpha no lo es, y llegaremos a eso. Lo destacable es que un laboratorio europeo haya lanzado siquiera un modelo de pesos abiertos a esta escala, con el pipeline de entrenamiento, la procedencia de los datos y la cifra de energía publicados junto a él, y que haya fijado la licencia en Apache 2.0 en lugar de una licencia de investigación a medida. Para los equipos cuyas normas de adquisición empiezan por «¿adónde van los datos?», esa combinación es el producto.

La ficha técnica, y los dos números que importan

Todo lo que aparece a continuación proviene de la model card que Aleph Alpha publicó junto con los pesos; nada de ello ha sido reproducido de forma independiente todavía, y no existe una fila de Artificial Analysis para Kolibri en el momento de escribir esto.

• Parámetros totales — 78.103.074.560, con 3.457.573.120 activos por token, una proporción de aproximadamente 22,6 a 1.

• Arquitectura — un transformador de 50 capas, todas las capas de mezcla de expertos, 384 expertos por capa con 1 compartido y 6 enrutados, y una proporción 4:1 de atención de ventana deslizante a atención de consultas agrupadas en toda la pila.

• Contexto — entrenado a 16.384 tokens, con entrenamiento intermedio a 65.536 y ampliado a 262.144 nativos. Dado que la codificación posicional solo se aplica en las capas de ventana deslizante, Aleph Alpha afirma que la ventana puede ampliarse sin escalado posicional, y ha validado la calidad y la eficiencia de servicio hasta 1.048.576 tokens. La ficha recomienda mantenerse en 262.144 o por debajo para trabajos sensibles a la latencia y para tareas complejas.

• Precisión — pesos FP8 en bloques de 128×128 con activaciones cuantizadas dinámicamente, evaluados con una caché KV FP8; los embeddings, la cabeza LM, las normas y el enrutador MoE permanecen en bfloat16.

• Razonamiento — cuatro niveles de esfuerzo, ninguno, bajo, medio y alto, configurados a través de la plantilla de chat.

• Llamada a herramientas — sí, al estilo Hermes, con un analizador de vLLM incluido en el mismo repositorio que los pesos.

• Idiomas — alemán e inglés, y nada más. Eso se plantea como una decisión de diseño, no como una omisión.

• Entrenamiento — 20 billones de tokens de preentrenamiento sobre un corpus bilingüe filtrado, aproximadamente 62,5 por ciento en inglés, 23,9 por ciento en alemán y 13,6 por ciento de código, más 3,44 billones de tokens de entrenamiento intermedio y 201 mil millones para la extensión de contexto largo.

• Cómputo — 768 NVIDIA B200 en 96 nodos HGX, 21 días de preentrenamiento durante 511 horas y 392.000 horas de GPU, con 6,4×10²³ FLOPs reportados. El entrenamiento intermedio añadió cinco días y 90.000 horas de GPU; la extensión de contexto largo añadió 13 horas y 10.000 horas de GPU.

• Energía — 9,5×10² MWh estimados, incluida la sobrecarga del centro de datos, abarcando el preentrenamiento, el entrenamiento intermedio y el entrenamiento de contexto largo, pero excluyendo el ajuste fino supervisado y el aprendizaje por refuerzo.

• Licencia — Apache 2.0. Sin cláusula adicional de uso aceptable, sin umbral de usuarios activos mensuales, sin términos comerciales por separado.

Dos de esas líneas son las que un comprador debería leer dos veces. El recuento de parámetros activos es lo que se paga en inferencia, y 3,46 mil millones activos de 78 mil millones totales es una relación de esparsidad agresiva: es la razón por la que un modelo de este tamaño puede servirse siquiera en dos GPU. Y la cifra de contexto se indica como 262.144 nativos con 1.048.576 validados, que es una afirmación más cuidadosa que el escueto "1M context" que verás en la mayoría de la cobertura de este lanzamiento.

Generated single-column scoreboard for Kolibri with six rows: total parameters 78.1B, active per token 3.46B, context 262,144 native and 1M validated, licence Apache 2.0, independent score 'none published', and deployment floor 2x H100 80GB. The footer reads 'All figures vendor-reported from the model card; no independent evaluation yet.'

Dos modelos, con tres meses de diferencia

Kolibri es el segundo modelo de lo que Aleph Alpha llama su Model Factory, y la cronología que publicó es la parte del lanzamiento que la mayoría de la cobertura omite.

El trabajo en el pipeline de entrenamiento comenzó en enero de 2026. Kolibri Origin terminó el preentrenamiento a la escala objetivo el 11 de junio de 2026 — 30,6 mil millones de parámetros totales, 3,27 mil millones activos, una ventana de contexto de 65.536 tokens, 7,51 billones de tokens de entrenamiento, 50 capas de las cuales dos eran densas y 48 eran MoE, y un único modo de razonamiento. Se validó internamente y nunca se publicó. Kolibri terminó el preentrenamiento el 11 de septiembre de 2026.

• Parámetros — 30,6B en total y 3,27B activos, frente a 78,1B en total y 3,46B activos.

• Contexto — 8.192 tokens de contexto de preentrenamiento en Origin, frente a 16.384 en Kolibri, hasta un contexto nativo de 262.144.

• Datos — 7,51 billones de tokens de preentrenamiento en Origin, frente a 20 billones, extraídos de un conjunto bruto de más de 200 billones que el pipeline filtró, deduplicó y curó.

• Arquitectura — dos capas densas más 48 capas MoE en Origin, frente a 50 capas MoE, con un diseño de atención modificado, el triple de expertos, mayor esparsidad y un algoritmo de enrutamiento sustituido.

• Razonamiento — un modo en Origin, frente a ninguno, bajo, medio y alto en Kolibri.

• Lanzamiento — sin lanzamiento público para Origin, 3 de octubre de 2026 para Kolibri.

Los números que más se mueven son los de los conjuntos de tareas, donde el mismo arnés de evaluación puntuó a ambos modelos. En el promedio alemán del conjunto de posentrenamiento, Origin obtuvo 46,4 y Kolibri obtuvo 70,8; en el promedio inglés, 54,1 frente a 75,5. En AIME 2025 en alemán, 73,5 frente a 87,5. En los benchmarks internos de proxy de cliente que el proveedor publica como un conjunto vertical, el conjunto de proveedores de automoción pasó de 0,72 a 0,99, semiconductores de 0,35 a 0,80, el sector público alemán de 0,54 a 0,75, tecnología de accionamientos industriales de 0,31 a 0,60 y aeroespacial de 0,14 a 0,59.

Esas cifras internas por sector las gestionan los propios proveedores, en conjuntos de evaluación creados por ellos y diseñados en torno a sus clientes, así que conviene tratarlas como una descripción de intenciones más que como una puntuación. El objetivo de publicarlas es que explican para qué se optimizó el modelo: no una tabla de clasificación, sino un conjunto de documentos de sectores regulados.

Screenshot of Aleph Alpha's newsroom post 'Kolibri Has Landed: A Sovereign Open-Weight Model', showing the opening lines dating the release to the Day of German Reunification, describing Kolibri as an English-German mixture-of-experts transformer with 78B total and 3B active parameters, context lengths up to 1M tokens, full weights on Hugging Face under Apache 2.0, and the paragraph on Kolibri Origin as the 30B total, 3B active predecessor with a 65k context window.

El alemán es una decisión de diseño aquí, no una etiqueta de idioma.

La mayoría de las "fichas de modelo multilingües" aluden a una mezcla de entrenamiento que, por casualidad, incluía algo de alemán. Esta está construida al revés, y la ficha es precisa sobre la mecánica.

Aleph Alpha descubrió mediante experimentos con pequeños modelos proxy que alrededor del 20 % de datos en alemán en la mezcla producía los mejores resultados, lo que para una ejecución de 20 billones de tokens significaba encontrar 4 billones de tokens en alemán. Los conjuntos de datos abiertos en alemán, deduplicados y filtrados, le dieron 390.000 millones — por debajo del objetivo en un orden de magnitud. Cerró la brecha de tres maneras: reajustando un filtro de Common Crawl específicamente para el alemán, lo que produjo 1,3 billones de tokens orgánicos únicos; reformulando documentos existentes en alemán como entradas de estilo enciclopédico, diálogos de preguntas y respuestas y pasajes de texto, lo que produjo aproximadamente 1 billón más y se convirtió en la mayor fuente individual en alemán; y la traducción, utilizada solo en Kolibri Origin y descartada para Kolibri. El alemán terminó como un conjunto único de 2,4 billones de tokens, el 80 % de él curado o generado internamente, visto en el 21,3 % de los tokens de preentrenamiento después del sobremuestreo.

Vale la pena citar el detalle del filtro porque es el tipo de cosa que solo aparece en un laboratorio que realmente entrenó con alemán. Un pipeline estándar de datos lingüísticos descarta documentos con demasiadas palabras largas, pero la prosa administrativa alemana supera habitualmente el límite inglés de longitud media de palabra, así que la configuración predeterminada elimina en silencio el registro en el que escribe la administración pública. La consecuencia comercial obvia es que un modelo entrenado con un filtro inglés estándar no tiene apenas vocabulario jurídico-administrativo alemán, y ningún benchmark te lo dirá.

El tokenizador recibe el mismo tratamiento. Aleph Alpha entrenó un tokenizador bilingüe alemán-inglés con un vocabulario de 128.000 tokens usando un nuevo método al que llama UniBPE, que conserva la fusión ascendente de la codificación por pares de bytes, pero elige las fusiones con un objetivo unigrama. En texto web en alemán, reporta 4,90 bytes medios por token, por delante de GPT-5 con 4,35, Gemini con 4,13, Qwen3.5–3.8 con 4,17, GLM 5.3 con 3,93, DeepSeek V4 con 3,72 y Kimi K3 con 3,28 —todas cifras reportadas por el proveedor en la comparación del propio proveedor. Más texto por token significa menos tokens por tarea, lo que es un efecto directo sobre el coste de inferencia más que una afirmación de calidad, y es el tipo de mejora de eficiencia que se acumula a lo largo de una carga de trabajo de procesamiento de documentos.

Lo que la tabla del proveedor no resuelve

Aleph Alpha publicó una comparativa de post-entrenamiento que abarca catorce modelos, y es más útil que la mayoría de las tablas de lanzamiento porque no adula al sujeto.

En el mismo harness, con Kolibri en esfuerzo de razonamiento alto, Qwen3.8 27B obtiene 80,2 en el promedio de inglés frente a 75,5 de Kolibri, y 79,9 en el promedio de alemán frente a 70,8. También lidera en GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified y los dos benchmarks de contexto largo. Nemotron 3 Super 120B-A12B obtiene 73,0 en inglés frente a 75,5 de Kolibri —más cerca, y por delante en AIME 2025. Gemma 4 26B-A4B IT obtiene 71,9 y 66,3 en los dos promedios.

Por lo tanto, el resumen honesto del lanzamiento no es «estado del arte». Es que Kolibri se sitúa en medio de un campo de modelos que activan entre tres y doce mil millones de parámetros por token, que supera claramente a los mucho más pequeños, y que pierde frente a un modelo denso de 27 mil millones de parámetros de Alibaba en la mayoría de las filas de su propia tabla mientras activa aproximadamente un octavo de los parámetros. El encuadre de Aleph Alpha para eso es la frontera de Pareto de calidad frente a tokens decodificados por segundo por GPU: ninguno de los modelos comparados ofrece más calidad al mismo coste de servicio, o la misma calidad a menor coste. Esa es la afirmación que hay que interrogar, y es una afirmación de economía de servicio, no de capacidad.

Ninguna de estas cifras ha sido verificada de forma independiente. No hay una entrada de Artificial Analysis para Kolibri, no hay replicación por terceros del marco de evaluación, y los benchmarks verticales están creados por el proveedor. La comparación también es estructuralmente generosa con Kolibri en un sentido y poco generosa en otro: los catorce modelos se ejecutaron a través del propio entorno de pruebas de Aleph Alpha con prompts idénticos y configuraciones de few-shot idénticas, que es la forma correcta de hacerlo, pero sigue siendo el entorno de pruebas de un solo laboratorio. Considera cada número de esta sección como reportado por el proveedor hasta que alguien más lo ejecute.

Screenshot of the Hugging Face model card for Aleph-Alpha/Kolibri-1, showing the licence badge apache-2.0 and the Model overview block: architecture Mixture-of-Experts, 78B total parameters given as 78,103,074,560, active parameters per token 3,457,573,120, languages German and English, context length 1,048,576 tokens with a recommendation to stay at or below 262,144 for serving efficiency and complex tasks, float8_e4m3 weights in 128x128 blocks with an FP8 KV cache and embeddings, LM head, norms and MoE router in bfloat16, reasoning mode yes, tool calling yes, and the June 18 2026 knowledge cutoff.

Lo que necesitas para ejecutarlo

Kolibri no es un modelo que se pruebe en un portátil. Los pesos FP8 tienen una huella de memoria del modelo de aproximadamente 78 GB, y el mínimo de tarjetas es dos tarjetas A100 de 80 GB, dos H100 SXM5, una H200, una B200 o una B300; la configuración recomendada es dos H100 SXM5, dos H200, una B200 o una B300.

Servirlo implica instalar el paquete aleph-alpha-inference, que proporciona el plugin Kolibri vLLM y fija la versión de vLLM que admite, o descargar la imagen de contenedor ghcr.io/aleph-alpha/aleph-alpha-inference. A partir de ahí, es una invocación estándar de vLLM con la caché KV FP8, el analizador de razonamiento Kolibri y el analizador de llamadas a herramientas Kolibri. Los contextos de más de 262.144 tokens necesitan un flag explícito de longitud máxima del modelo y una anulación de la incrustación de posición. Los parámetros de muestreo recomendados son temperatura 1.0, top-p 0.97 y top-k 128.

La superficie de la API es compatible con OpenAI, lo cual importa más de lo que parece: el esfuerzo de razonamiento se pasa a través de la plantilla de chat como un valor reasoning_effort, y las llamadas a herramientas se emiten en el campo estándar tools. Un equipo que ya habla el formato chat-completions puede apuntar el código existente a un endpoint de Kolibri en una máquina en su propio edificio sin una capa de envoltura.

Lo que Kolibri todavía no tiene

Vale la pena señalar con claridad cuatro ausencias, porque la cobertura del lanzamiento suele pasarlas por alto.

• No independiente. Artificial Analysis no tiene una página de modelo para Kolibri, y ningún tercero ha publicado una reproducción de la tabla del proveedor.

• No hay ningún endpoint alojado del proveedor. La publicación consta de los pesos más un informe técnico; no hay ningún SKU de API de Aleph Alpha para Kolibri en el material publicado con el modelo.

• No hay ruta en OrcaRouter, ni en ningún agregador que fuéramos a nombrar. Sondeamos el catálogo con todas las grafías posibles del prefijo del proveedor y del nombre del modelo, y Kolibri no aparece — así que si quieres invocarlo, tendrás que descargar 78 GB y ejecutar tú mismo un endpoint de vLLM. Preferimos decir eso antes que dar a entender que lo servimos.

• Sin entrada multimodal. Texto de entrada, texto de salida, dos idiomas. Ese es el intercambio que hizo el laboratorio para priorizar profundidad sobre amplitud, y para un despliegue de procesamiento de documentos probablemente sea el correcto, pero es un límite real.

Si lo que realmente necesitas hoy es un modelo pequeño de mezcla de expertos al que puedas invocar sin comprar dos GPU, el nivel Gemma 4 MoE es lo más cercano que ya está en un endpoint enrutado, a 0,06 $ por millón de tokens de entrada y 0,33 $ por millón de tokens de salida en la variante 26B-A4B, con una ventana de 262.144 tokens. Para quien esté sopesando un despliegue soberano autoalojado de 78B frente a eso, la comparación útil no son las filas de benchmarks, sino 78 GB de VRAM y una conversación de adquisición frente a una partida de coste por token. OrcaRouter enruta ese nivel con una sola clave compatible con OpenAI, con el precio de lista del proveedor tal cual y sin añadir nada, que es la forma barata de averiguar si la carga de trabajo justifica tener el hardware en propiedad.

Kolibri en sí es el artefacto más interesante. Un modelo alemán-inglés de 78 mil millones de parámetros bajo Apache 2.0, con el pipeline de datos, el método del tokenizador, la cifra de energía y una historia de iteración de tres meses publicados junto a los pesos, es un tipo de lanzamiento distinto de la habitual publicación de pesos — la divulgación es parte del producto, no una entrada de blog sobre él. Que la afirmación de Pareto se sostenga es ahora una cuestión para gente con dos H100s y un cronómetro, y la respuesta no vendrá de nadie que haya escrito la ficha del modelo.