
Kolibri vs Gemma 4 12B: 78 mil millones de parámetros frente a 12, y solo uno de ellos tiene una puntuación
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 218 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Kolibri y Gemma 4 12B son los dos extremos de un espectro que los lanzamientos de pesos abiertos no suelen permitirte comparar en igualdad de condiciones. El Kolibri de Aleph Alpha se lanzó el 3 de octubre de 2026: 78,1 mil millones de parámetros totales, 3,46 mil millones activos por token, una ventana de contexto validada de 1.048.576 tokens, solo alemán e inglés, Apache 2.0. Gemma 4 12B se lanzó el 3 de junio de 2026: 11,95 mil millones de parámetros densos, una ventana de contexto de 262.144 tokens, entrada de texto, imagen, audio y vídeo, Apache 2.0. Uno de ellos tiene una puntuación independiente y reproducible públicamente. El otro tiene una tabla de referencia del proveedor. Esa asimetría no es una nota a pie de página de esta comparación; es la comparación, porque todo lo demás que le importa a un comprador —coste por tarea, calidad por vatio, si funcionará con tus documentos— pasa por ella.
Deberíamos ser igual de directos sobre la forma del enfrentamiento, porque un titular que empareja un modelo de 78B con uno de 12B invita a la conclusión equivocada. No son competidores. Uno es un despliegue de 78 GB orientado al trabajo documental del sector público alemán y de la industria en bastidores que el cliente posee; el otro es un modelo multimodal unificado de 12 mil millones de parámetros que se ejecuta en un portátil y lleva un índice independiente de 14. Lo que sigue es un recuento de para qué sirve realmente cada uno, dónde los números publicados permiten y no permiten clasificarlos, y cuánto cuesta no tener una puntuación independiente.
El único número en el que puedes confiar aquí, y el único en el que no.
Artificial Analysis ha medido Gemma 4 12B, en su configuración de razonamiento. Los hallazgos, tal como se publicaron en su página del modelo, son los que hay que usar como base:
• Inteligencia — un Artificial Analysis Intelligence Index de 14, que lo sitúa en la banda de clase superior con una posición n.º 21 entre los 142 modelos de esa comparación, frente a una mediana de 8 para modelos comparables.
• Velocidad — 112.5 tokens de salida por segundo, n.º 21 de 142 en la vista de velocidad, y por encima de la mediana de 91 tokens para modelos comparables.
• Precio — $0.10 por millón de tokens de entrada y $0.30 por millón de salida, lo que su página señala como algo caro frente a una mediana de $0.03 y $0.15 para modelos de tamaño y clase similares.
• Especificación — contexto de 262.144 tokens, 12B de parámetros totales, Apache 2.0, entrada de texto, imagen, voz y vídeo, salida de texto.
El veredicto resumen de Artificial Analysis es inusualmente directo para una página de clasificación, y vale la pena repetirlo: Gemma 4 12B está entre los modelos líderes en inteligencia, pero es algo costoso en comparación con otros modelos de pesos abiertos de tamaño similar. Esa es una evaluación real, independiente y reproducible de un tercero que no tiene intereses en ninguno de los dos proveedores.
Kolibri no tiene nada equivalente. No existe una página de modelo de Artificial Analysis para él y, en el momento de escribir esto, ningún tercero ha reproducido la suite de evaluación. Lo que existe es la propia tabla comparativa de Aleph Alpha, en la que Kolibri obtiene 75,5 en el promedio de inglés y 70,8 en el promedio de alemán en su conjunto de tareas. Esos son promedios porcentuales no ponderados sobre una combinación de benchmarks que el proveedor eligió, en un arnés que el proveedor escribió, con un esfuerzo de razonamiento alto. No son un Intelligence Index, y los dos números no pueden convertirse entre sí ni ponerse uno al lado del otro. Cualquiera que presente "Kolibri 75,5 versus Gemma 14" como una clasificación está comparando un porcentaje en una escala con una puntuación en otra. La postura honesta es que la calidad de Gemma 4 12B está medida y la de Kolibri está afirmada.
Lo que la tabla del proveedor sí te permite hacer es leer a lo largo de las filas. Gemma 4 26B-A4B IT, el propio hermano de Google con mezcla de expertos del 12B, aparece en la tabla de Aleph Alpha con 71,9 en inglés y 66,3 en alemán, por debajo de Kolibri en ambos. Eso es lo más parecido a una verificación cruzada de que se dispone, y viene con la misma advertencia: arnés del proveedor, cifras del proveedor. Es una señal débil, no una prueba.

Un denso de 12B contra un disperso de 78B no es la disparidad que parece
La brecha de arquitectura es mayor que la brecha de parámetros una vez que se tiene en cuenta lo que realmente se calcula por token.
• Cómputo por token — Gemma 4 12B activa los 11.95 mil millones de parámetros en cada token. Kolibri activa 3,457,573,120 de sus 78,103,074,560, aproximadamente una veintidósava parte del modelo, con un experto compartido y seis expertos enrutados por capa de 384.
• Memoria — la balanza se inclina en sentido contrario y es brutal. Gemma 4 12B en bfloat16 está en el orden de los 24 GB de pesos. La ficha de Kolibri sitúa los pesos FP8 en aproximadamente 78 GB, con un mínimo de dos tarjetas A100 de 80 GB, dos H100 SXM5, una H200, una B200 o una B300.
• Atención — Gemma 4 utiliza un híbrido de atención local de ventana deslizante y atención global completa, con la capa final siempre global. Kolibri utiliza una división 4:1 de ventana deslizante a consulta agrupada en 50 capas totalmente MoE.
• Contexto — 262,144 tokens para Gemma 4 12B; 262,144 nativos para Kolibri, validado hasta 1,048,576 sin escalado de posición.
Así que la forma honesta de plantear «78B frente a 12B» es que Kolibri gana en coste de activación y pierde en huella de pesos, y ninguna de las dos ventajas sale gratis. Un modelo disperso que activa 3.46 mil millones de parámetros por token sigue teniendo que mantener los 78 mil millones en memoria, por eso el mínimo de despliegue es un par de aceleradores de 80 GB en lugar de una sola tarjeta de consumo. Gemma 4 12B hace el intercambio opuesto: una mayor proporción del modelo se activa en cada token, pero cabe en hardware que una persona puede comprar.
Hay una particularidad específica del alemán en el lado de Kolibri que cambia la aritmética en lugar de la clasificación. Su tokenizador promedia 4,90 bytes por token en texto web en alemán, frente a 4,13 para Gemini, 4,17 para la familia Qwen3.5–3.8 y 4,35 para GPT-5, según las propias mediciones de Aleph Alpha. Menos tokens por documento en alemán es una reducción directa en el costo de inferencia, y para una carga de trabajo que es texto administrativo alemán por millones, ese efecto puede valer más que unos pocos puntos de índice. Además, está enteramente reportado por el proveedor.

Lo que cada uno puede ver en realidad
Aquí es donde la comparación deja de estar reñida, y se trata de un hecho de especificación, no de una afirmación sobre la calidad. Gemma 4 12B es un modelo multimodal unificado: su ficha describe una arquitectura sin codificadores que proyecta parches de imagen sin procesar y formas de onda de audio directamente en el espacio de embeddings del modelo de lenguaje, con entrada de texto, imagen, voz y vídeo, y salida de texto. Está diseñado para ejecutarse en dispositivos de consumo, sin codificadores separados que aprovisionar.
Kolibri lee texto, en dos idiomas, y nada más. Aleph Alpha lo enmarca deliberadamente como profundidad sobre amplitud: dos idiomas, muy curados, en lugar de una amplia mezcla multilingüe. No hay torre de visión, ni ruta de audio, ni vídeo. Si su carga de trabajo incluye formularios escaneados, llamadas grabadas o fotografías de equipos, Gemma 4 12B es un candidato y Kolibri no, digan lo que digan las filas del benchmark. Si su carga de trabajo es un corpus de documentos en alemán e inglés que nunca debe salir del edificio, lo contrario se acerca más a la verdad — pero tenga en cuenta que el requisito de "nunca sale del edificio" también lo cumple Gemma 4 12B, ya que los pesos son Apache 2.0 y se pueden descargar.
Cuál es más barato depende de lo que estés comprando
Los dos modelos tienen precios en monedas que no se convierten. Gemma 4 12B tiene una tarifa de mercado: $0.10 y $0.30 por millón de tokens, según la medición de Artificial Analysis entre proveedores, y más barato en el nivel MoE en endpoints enrutados. Kolibri no tiene tarifa alguna, porque Aleph Alpha no vende inferencia para él: la publicación son pesos, un informe técnico y una ficha de modelo.
• Gemma 4 12B en una ruta alojada — $0.10 por millón de entrada y $0.30 por millón de salida según las cifras de Artificial Analysis. En nuestro propio catálogo, el hermano MoE Gemma 4 26B-A4B IT figura a $0.06 de entrada y $0.33 de salida con una ventana de 262,144 tokens, y el denso más grande Gemma 4 31B IT a $0.13 y $0.38; esos son precios de lista del proveedor trasladados, que es el único número al que no le añadimos nada.
• Kolibri en tu propio hardware: 78 GB de pesos, un vLLM del paquete aleph-alpha del proveedor y un mínimo de una H200 o una H100 SXM5. El costo es una compra de capital, un rack y una persona capaz de ejecutar un despliegue de vLLM, tantos tokens como generes.
No son la misma compra, y la comparación no es «cuál es más barato». Se trata de si la carga de trabajo tiene una forma que justifique poseer el hardware. Un equipo que procesa un corpus de documentos fijos y sensibles en gran volumen puede salir muy por delante con la opción autoalojada. Un equipo que desarrolla una función de producto que llama a un modelo unos pocos millones de tokens al día casi nunca sale ganando.
Una vía intermedia práctica: el nivel de Gemma es OrcaRouter hoy, en el mismo endpoint compatible con OpenAI que todo lo demás, con conmutación por error entre proveedores y el precio de lista del proveedor aplicado tal cual, sin añadir nada por token. Eso lo convierte en una forma barata de medir tu volumen real de tokens en una ruta alojada antes de decidir si se justifica un despliegue soberano de 78 GB. Vale la pena decir con claridad lo que no es: no enrutamos Kolibri. Sondeamos el catálogo con todas las grafías del nombre del proveedor y del modelo, y no está ahí. El autoalojamiento es actualmente la única forma de invocarlo.

¿Quién debería elegir cuál?
La regla de decisión es lo suficientemente breve como para enunciarla en tres líneas.
Elige Gemma 4 12B si necesitas algo más que texto en alemán e inglés, si necesitas una cifra de calidad medida antes de comprometerte, si el modelo tiene que ejecutarse en hardware que ya tienes o si prefieres alquilar tokens en lugar de tener tu propio rack. Es el único de los dos con una puntuación independiente, una velocidad publicada y un precio de mercado.
Elige Kolibri si tu requisito es un modelo de razonamiento de 78.000 millones de parámetros cuyos pesos, procedencia de los datos de entrenamiento, consumo energético y licencia estén todos documentados, desplegado dentro de tu propio perímetro, con un tokenizador diseñado para la prosa administrativa alemana y un comportamiento de abstención en el que un flujo de trabajo regulado pueda confiar. Ese es un objetivo muy concreto y Aleph Alpha apuntó a él deliberadamente.
No elijas ninguno de los dos basándote en una fila de benchmark que viste en una publicación de lanzamiento. El 14 de Gemma 4 12B es una medición que hizo otra persona y que puedes verificar. El 75.5 de Kolibri es una afirmación que hizo su autor, y la única persona que actualmente puede refutarla es un cliente con dos H100s y un corpus documental.
