
El primer día de Kolibri: Aleph Alpha abrió 78B de pesos alemán-inglés, y la reacción va por delante de la evidencia
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 217 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Veinticuatro horas después de que Aleph Alpha publicara Kolibri, la reacción se ha endurecido hasta convertirse en una sola línea, y vale la pena desarmar esa línea. El laboratorio de Heidelberg puso un modelo de mezcla de expertos de 78.100 millones de parámetros en Hugging Face bajo Apache 2.0 el 3 de octubre de 2026, lo anunció esa misma mañana en su propia sala de redacción y desde su propia cuenta, y para el día siguiente el resumen que circulaba en los feeds de IA decía: 78.000 millones de parámetros totales, 3.460 millones activos por token, pesos abiertos bajo Apache 2.0, diseñado para alemán e inglés. Cada cláusula de esa frase es verificable desde el repositorio. Lo que en gran medida no se ha dicho es qué partes del lanzamiento son hechos medidos y cuáles son afirmaciones que los autores hicieron sobre su propio modelo que nadie fuera de Heidelberg ha ejecutado. Esa brecha es la historia del primer día, y importa más que el número del titular.
Empieza por la cronología, porque una cantidad sorprendente de la reacción trató esto como un misterioso lanzamiento silencioso, y no lo fue. El repositorio de Hugging Face Aleph-Alpha/Kolibri-1 se creó el 2 de octubre de 2026 a las 05:54:02 UTC, la tarjeta del modelo indica una fecha de lanzamiento declarada del 3 de octubre, y la publicación de la sala de prensa del proveedor se publicó esa misma mañana a las 08:43:53 GMT — el Día de la Reunificación Alemana, una fecha que el laboratorio claramente eligió. La propia cuenta de Aleph Alpha publicó al respecto en cuestión de minutos. No hubo embargo de prensa ni evento de lanzamiento, que es probablemente de donde surgió la idea de "lanzamiento silencioso", pero una publicación en la sala de prensa de un proveedor, un informe técnico y un anuncio oficial no son un lanzamiento silencioso. Son un lanzamiento normal que la prensa general de IA simplemente no cubrió ese día.
El número que la reacción está repitiendo
La razón de que 3,46 mil millones de parámetros activos sea la cifra que todos citan es que es el único número del lanzamiento que cambia lo que un comprador tiene que poseer. Kolibri es un transformer de 50 capas en el que cada capa es una mezcla de expertos, con 384 expertos por capa, uno compartido y seis enrutados, con un total de 78.103.074.560 parámetros. Por cada token, activa 3.457.573.120 de ellos — una relación de dispersión de aproximadamente 22,6 a 1. Eso es lo que hace que un modelo de 78 mil millones de parámetros se pueda servir en un par de H100s en lugar de un rack, y es la afirmación más trascendental del lanzamiento.
Alrededor de él se sitúan las demás cifras destacadas, todas ellas procedentes de la ficha del modelo en lugar de una ejecución independiente:
• Contexto — entrenado a 16,384 tokens, entrenado de forma intermedia a 65,536, nativo a 262,144 y validado hasta 1,048,576. La ficha recomienda mantenerse en 262,144 o por debajo para trabajos sensibles a la latencia. Fíjate bien en que el "contexto de 1M" a secas que verás en los resúmenes es el techo validado, no la ventana nativa.
• Precisión — pesos FP8 en bloques de 128x128 con activaciones cuantizadas dinámicamente, evaluados con una caché KV en FP8; los embeddings, la cabeza LM, las normalizaciones y el enrutador MoE permanecen en bfloat16.
• Razonamiento — cuatro niveles de esfuerzo — ninguno, bajo, medio, alto — configurado mediante la plantilla de chat, con llamada a herramientas al estilo Hermes y un analizador de vLLM incluido en el mismo repositorio que los pesos.
• Idiomas — alemán e inglés, y nada más.
• Entrenamiento — 20 billones de tokens de preentrenamiento sobre un corpus bilingüe filtrado que es aproximadamente 62,5 por ciento inglés, 23,9 por ciento alemán y 13,6 por ciento código, más 3,44 billones de tokens de entrenamiento intermedio y 201 mil millones para la extensión de contexto largo.
• Cómputo y energía: 768 NVIDIA B200 en 96 nodos HGX, 21 días de preentrenamiento durante 511 horas y 392.000 horas de GPU con 6,4x10^23 FLOPs reportados, y un estimado de 9,5x10^2 MWh, incluida la sobrecarga del centro de datos, excluyendo el ajuste fino supervisado y el aprendizaje por refuerzo.
• Licencia — Apache 2.0. Sin cláusula adicional de uso aceptable, sin umbral de usuarios activos mensuales, sin términos comerciales por separado.
Las dos afirmaciones que nadie ha verificado
Esta es la parte del primer día que la reacción se ha saltado, y es la parte que decide si Kolibri es importante o simplemente interesante.
La primera es la afirmación sobre la economía del servicio. El planteamiento de Aleph Alpha no es que Kolibri sea el modelo más potente disponible —en la propia tabla comparativa del laboratorio no lo es, y el laboratorio lo dice—. Su planteamiento es que ningún modelo comparado ofrece más calidad con el mismo coste de servicio, o la misma calidad a menor coste, a lo largo de una frontera de Pareto de calidad frente a tokens decodificados por segundo por GPU. Esa es una afirmación sobre el rendimiento en hardware específico, y es exactamente el tipo de afirmación que solo un tercero con un cronómetro y dos H100s puede resolver. Nadie lo ha hecho. No hay ninguna entrada de Artificial Analysis para Kolibri a 4 de octubre de 2026, ni ninguna replicación por terceros del arnés de evaluación.
La segunda es la afirmación sobre el tokenizador. Aleph Alpha entrenó un tokenizador bilingüe alemán-inglés con un vocabulario de 128.000 tokens usando un método al que llama UniBPE, y reporta 4,90 bytes promedio por token en texto web en alemán frente a GPT-5 con 4,35, Gemini con 4,13, Qwen 3.5-3.8 con 4,17, GLM 5.3 con 3,93, DeepSeek V4 con 3,72 y Kimi K3 con 3,28. Todas esas cifras son del propio proveedor, medidas en el corpus del propio proveedor y frente a competidores que el propio proveedor eligió. Que haya más texto por token es un efecto real sobre el coste de inferencia más que una afirmación de calidad y, si se mantiene, se acumula en cualquier carga de trabajo de procesamiento de documentos —pero es la medición de un solo laboratorio, no un resultado de benchmark.
El alemán es lo importante, y es la ingeniería más interesante del lanzamiento.
La mayoría de las fichas de modelos «multilingües» describen una mezcla de entrenamiento que resultó incluir alemán. Esta está construida a la inversa, y la ficha es inusualmente específica en cuanto a la mecánica.
Los experimentos con un pequeño modelo proxy llevaron a Aleph Alpha a fijar un objetivo de aproximadamente el 20 por ciento de datos en alemán en la mezcla, lo que para una ejecución de 20 billones de tokens significaba encontrar 4 billones de tokens en alemán. Los conjuntos de datos abiertos en alemán, deduplicados y filtrados, aportaron 390 mil millones, un orden de magnitud por debajo. El laboratorio cerró la brecha de tres maneras: reajustar un filtro de Common Crawl específicamente para el alemán, lo que produjo 1,3 billones de tokens orgánicos únicos; reformular documentos existentes en alemán como entradas enciclopédicas, diálogos de preguntas y respuestas y pasajes de texto, lo que produjo aproximadamente otro billón y se convirtió en la mayor fuente individual en alemán; y la traducción, que se utilizó para el modelo predecesor y se descartó deliberadamente para Kolibri. El alemán terminó como un fondo único de 2,4 billones de tokens, el 80 por ciento del cual fue curado o generado internamente, y se usó en el 21,3 por ciento de los tokens de preentrenamiento tras el sobremuestreo.
El detalle del filtro es el tipo de cosa que solo sale a la luz en un laboratorio que realmente se entrenó con alemán. Una canalización estándar de datos lingüísticos descarta documentos con demasiadas palabras largas, pero la prosa administrativa alemana supera habitualmente el límite inglés de longitud media de las palabras, así que la configuración predeterminada elimina en silencio el registro en el que escribe la administración pública. Un modelo entrenado con un filtro inglés estándar no tiene prácticamente vocabulario jurídico-administrativo alemán, y ninguna evaluación comparativa te lo dirá.
Lo que realmente muestra la tabla comparativa
Aleph Alpha publicó una comparación de post-entrenamiento que abarca catorce modelos, y es más útil que la mayoría de las tablas de lanzamiento porque no halaga al sujeto. En el mismo harness, con Kolibri en esfuerzo de razonamiento alto, Qwen3.8 27B obtiene 80,2 en la media de inglés frente a los 75,5 de Kolibri, y 79,9 en la media de alemán frente a 70,8, y lidera en GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified y en ambos benchmarks de contexto largo. Nemotron 3 Super 120B-A12B obtiene 73,0 en inglés frente a los 75,5 de Kolibri. Gemma 4 26B-A4B IT obtiene 71,9 y 66,3 en las dos medias.
Así que el resumen honesto del lanzamiento no es «estado del arte». Es que Kolibri se sitúa en medio de un campo de modelos que activan entre tres y doce mil millones de parámetros por token, que supera claramente a los mucho más pequeños y que pierde frente a un modelo denso de 27 mil millones de parámetros de Alibaba en la mayoría de las filas de su propia tabla, mientras activa aproximadamente un octavo de los parámetros. Que la economía rescate esa brecha es la afirmación de Pareto, y la afirmación de Pareto no está probada.

Cómo lo llamarías realmente, hoy
No hay un endpoint alojado del proveedor — el lanzamiento consiste en pesos más un informe técnico, sin ninguna SKU de API de Aleph Alpha para Kolibri en el material publicado. Tampoco hay una ruta para él en OrcaRouter: sondeamos el catálogo con todas las variantes de escritura del prefijo del proveedor y del nombre del modelo, y Kolibri no aparece, así que invocarlo hoy significa descargar aproximadamente 78 GB de pesos FP8 y ejecutar tú mismo un endpoint de vLLM desde el aleph-alpha-inference, ya sea el paquete o la imagen de contenedor publicada.
Eso es una decisión de compra real, no una nota al pie, y es ahí donde una capa de enrutamiento se gana su lugar incluso para un modelo que no aloja. La comparación honesta para cualquiera que esté sopesando un despliegue soberano autoalojado de 78B no son las filas de benchmarks — son 78 GB de VRAM y una conversación de adquisición frente a una partida por token en hardware que es de otra persona. Si lo que realmente necesitas este mes es un pequeño modelo de mezcla de expertos al que puedas llamar sin comprar dos GPUs, el nivel Gemma 4 26B-A4B es lo más cercano que ya está en un endpoint enrutado, a $0,06 por millón de tokens de entrada y $0,33 por millón de salida con una ventana de 262.144 tokens, y OrcaRouter enruta ese nivel con una única clave compatible con OpenAI al precio de lista del proveedor sin nada añadido. Esa es la vía barata para averiguar si la carga de trabajo justifica tener el hardware antes de que llegue el hardware.

Qué hay que vigilar, y qué cambiaría el veredicto
Tres cosas, en orden de cuánto cambiarían el panorama.
Una medición independiente de la capacidad de procesamiento en la configuración de dos H100 recomendada para la tarjeta confirmaría o desmentiría la afirmación de Pareto, que es la única afirmación del comunicado que es genuinamente novedosa en lugar de una reformulación de una ficha técnica. Una reproducción independiente de los promedios de las suites de tareas en alemán e inglés te diría si la brecha con Qwen3.8 27B es tan estrecha como sugiere la propia tabla del proveedor o más estrecha aún. Y una evaluación en alemán sobre texto administrativo real —no un benchmark general traducido— pondría a prueba aquello para lo que realmente se creó el lanzamiento, algo que ninguna tabla de clasificación mide actualmente.
Hasta que uno de esos se materialice, el encuadre correcto es el que el propio repositorio respalda. Kolibri es un auténtico lanzamiento de pesos abiertos de un laboratorio europeo, a una escala que los laboratorios europeos no habían lanzado antes, con unos términos Apache 2.0 que ningún actor establecido igualó, un pipeline de datos publicado junto con los pesos, y una historia de iteración de dos modelos que es más interesante que la cifra principal. También es, por ahora, un modelo cuyas cifras más citadas provienen de sus propios autores. Ambas frases son ciertas desde el primer día, y la segunda es la que la reacción dejó fuera.

