
Kolibri vs Qwen 3.8: el modelo alemán pierde en su propia tabla, y ese es el punto.
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 218 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Empieza por la frase que la mayor parte de la cobertura del lanzamiento de Kolibri omitió. En la tabla de benchmarks que Aleph Alpha publicó con su propio modelo el 3 de octubre de 2026, el modelo con el que se lo compara con más frecuencia no es un rival europeo ni uno estadounidense. Es Qwen3.8 27B, la variante de pesos abiertos del proveedor de esa generación, lanzada el 13 de agosto de 2026 — y, según los propios números de Aleph Alpha, gana. Qwen3.8 27B obtiene 80,2 en el promedio de inglés y 79,9 en el promedio de alemán de la misma batería de evaluación que le da a Kolibri 75,5 y 70,8. Lidera en GPQA Diamond, 89,2 frente a 84,3. Lidera en LiveCodeBench v6, 93,8 frente a 85,9. Lidera en SWE-Bench Verified, 72,6 frente a 66,4, y en ambos benchmarks de contexto largo, 76,9 frente a 64,5 en LongBench Pro y 81,3 frente a 68,3 en AA-LCR. Un modelo chino denso de 27.000 millones de parámetros, evaluado por un laboratorio alemán, supera al modelo insignia de 78.000 millones de parámetros de ese laboratorio en la mayor parte de su propia tabla. Eso no es un escándalo. Es el hecho más útil del lanzamiento, porque obliga a preguntarse para qué sirve Kolibri en realidad.
Una aclaración antes de que la comparación avance más, porque «Qwen 3.8» designa a una familia y no a un modelo, y aquí las distinciones importan. Qwen3.8-Max es el buque insignia alojado de Alibaba, activo desde el 3 de agosto de 2026 con una ventana de contexto de 1M de tokens a $2.00 por millón de tokens de entrada y $6.00 de salida. Qwen3.8-27B es el nivel de pesos abiertos, lanzado el 13 de agosto de 2026 con una ventana de 262.144 tokens. Qwen3.8-Flash es el nivel de volumen, lanzado el 26 de agosto de 2026 con la ventana de 1M de tokens y precios mucho más bajos. Y el Qwen3.8 a secas —anunciado el 19 de julio de 2026 como un buque insignia de pesos abiertos con 2,4 billones de parámetros— no está lanzado; existe como una página de seguimiento de catálogo y un anuncio. Todo lo que sigue trata sobre el que tiene pesos que puedes descargar y ejecutar, que es el 27B.
Donde Kolibri realmente gana, según la misma tabla
Las filas en las que Kolibri supera a Qwen3.8 27B no están dispersas al azar. Se agrupan, y ese agrupamiento es el producto.
• Abstención — en RGB Negative, Kolibri obtiene 85.6 frente a 70.6. Cuando el contexto no contiene la respuesta, Kolibri lo indica con mucha más frecuencia.
• Llamada a herramientas bajo restricción — en τ²-bench telecom, 94,7 frente a 82,5; en la suite vertical de proveedores de automoción, 99,0 frente a 97,3.
• Contexto muy largo — en SealQA sin distractores por encima de 24k tokens, 100,0 frente a 94,4.
• Economía del servicio en alemán: un tokenizador bilingüe con 4,90 bytes promedio por token en texto web en alemán, frente a 4,17 para la familia Qwen3.5–3.8 según la propia medición de Aleph Alpha. Menos tokens por documento en alemán es una reducción directa del coste de inferencia que se refleja en una factura y en ninguna fila de benchmark.
Tres de esos cuatro tienen que ver con el comportamiento más que con la capacidad. La abstención, la llamada a herramientas con restricciones y la recuperación fundamentada de contexto largo son lo que necesitas de un modelo que lee el material propio de tu organización y del que se espera que admita cuando el material no responde a la pregunta. Aleph Alpha construyó todo el lanzamiento en torno a esa apuesta, y la tabla muestra que la apuesta está dando resultado.

Las filas en las que gana Qwen3.8 27B tienen que ver con la amplitud: conocimiento en ambos idiomas, preguntas de ciencia de nivel de posgrado, programación competitiva, ingeniería de software a nivel de repositorio y comprensión de documentos largos. Si tu requisito es un modelo general sólido a un bajo precio por token y con pesos abiertos, Qwen3.8 27B es el mejor modelo, y la tabla lo dice con la propia tinta del proveedor.
Esa lectura está corroborada, mientras que la de Kolibri no. Artificial Analysis ha medido Qwen3.8 27B de forma independiente, en su configuración de razonamiento Xhigh, y reporta un Intelligence Index de 34, en el n.º 1 de los 142 modelos de esa comparación, 45,4 tokens de salida por segundo, un contexto de 256.000 tokens y una licencia Apache 2.0. Su nota es poco halagadora de una manera conocida —muy verboso, con 200 millones de tokens generados durante la evaluación del índice frente a una mediana de 82 millones, y lento—, pero la puntuación en sí es una medición de terceros del oponente. Kolibri no tiene ninguna página en Artificial Analysis. Así que el modelo más fuerte de esta comparación ha sido verificado de forma independiente y el más débil es palabra del proveedor, lo cual es lo contrario de cómo se suele presentar un buque insignia europeo de primera generación.
Dos tipos de afirmación sobre la cadena de suministro, que apuntan en direcciones opuestas
Ambos lanzamientos son argumentos sobre el origen de un modelo, y los argumentos son imágenes especulares.
El caso de Aleph Alpha es la procedencia como característica. Kolibri fue entrenado por equipos alemanes sobre infraestructura en Alemania y Finlandia, bajo la legislación de la UE y alemana. La ficha divulga la mezcla de preentrenamiento —20 billones de tokens con aproximadamente un 62,5 % de inglés, un 23,9 % de alemán y un 13,6 % de código—, los presupuestos de entrenamiento intermedio y de contexto largo, el cómputo exacto —768 NVIDIA B200 repartidas en 96 nodos HGX durante 21 días— y un consumo energético estimado de 9,5×10² MWh, incluidos los gastos generales del centro de datos. Detalla el método de entrenamiento hasta el nivel de capa: un transformer de mezcla de expertos de 50 capas con una división 4:1 entre atención de ventana deslizante y atención de consultas agrupadas, Muon y Exact Quantile Balancing en 384 expertos, con 1 compartido y 6 enrutados. Doce mil palabras de divulgaciones adjuntas a una descarga de 78 GB, y una posición de firmante declarada sobre el Código de Buenas Prácticas para la IA de Uso General de la UE.
El caso de Alibaba es distinto en esencia: no se trata de «podemos dar cuenta de cada decisión», sino de «aquí están los pesos, tómalos». Pesos abiertos con licencia Apache, a una escala y con una calidad que convirtieron a Qwen en la opción predeterminada de facto en todo el mundo, un vocabulario de 248.077 tokens que cubre bastante más de cien idiomas, y un ecosistema de servicio que se ha ajustado en torno a esos checkpoints durante el tiempo suficiente como para que casi todas las pilas de inferencia los soporten de fábrica. El argumento de soberanía en ese caso tiene que ver con la disponibilidad: ningún proveedor puede retirar el modelo, porque ya tienes el archivo.
Ambas afirmaciones son honestas y responden a miedos distintos. A un comprador del sector público en Baden-Wurtemberg le preocupan la jurisdicción y la auditabilidad, y Kolibri está dirigido a esa preocupación. A un grupo de investigación en Nairobi o São Paulo le preocupa que un modelo esté restringido detrás de una tarjeta de crédito en una moneda en la que no pueden pagar, y los pesos abiertos de Qwen están dirigidos a esa otra. Lo que no es honesto es pretender que cualquiera de las dos sea una comparación de capacidades, porque la tabla de capacidades ya dio su respuesta.

La brecha de licencias es real, pero más estrecha de lo que parece.
Kolibri es Apache 2.0. Qwen3.8 27B tiene pesos abiertos con licencia Apache. Ambos vienen sin cláusula de uso aceptable, sin umbral de usuarios activos mensuales y sin términos comerciales separados — lo que los coloca en un grupo reducido y significa que ninguno requiere una revisión legal antes de su uso comercial.
Lo que los separa es todo lo que viene después de la licencia. Kolibri llega con un plugin de vLLM y un paquete de analizador del proveedor, una imagen de contenedor, cuatro niveles de esfuerzo de razonamiento configurables a través de la plantilla de chat, un comportamiento de abstención explícito y una configuración de muestreo recomendada. Qwen3.8 27B llega como pesos que Transformers, vLLM y SGLang ya saben servir, con un formato de llamada a herramientas que el ecosistema en general ha tenido meses para acomodar.
El hardware de despliegue difiere en los mismos términos. Los pesos FP8 de Kolibri ocupan ~78 GB, con un mínimo de dos tarjetas A100 de 80 GB, dos H100 SXM5, una H200, una B200 o una B300. Qwen3.8 27B en bfloat16 es aproximadamente 54 GB de pesos, lo que equivale a un único acelerador de 80 GB a plena precisión o a una versión cuantizada con bastante menos. El modelo alemán requiere más hardware y a cambio ofrece menos benchmark. Eso solo es un mal negocio si lo que comprabas era benchmark.
Lo que las etiquetas de precio te dicen y no te dicen
Kolibri no tiene precio, porque Aleph Alpha no vende inferencia para él. El lanzamiento son pesos, un informe técnico y una ficha; no hay ningún SKU alojado. Cualquier cifra de coste para Kolibri es un cálculo de amortización de hardware que haces tú mismo.
Qwen3 tiene precios públicos en tres niveles, y el intermedio es el que importa para un equipo que compara el autoalojamiento con el alquiler.
• Qwen3.8-Max — $2.00 por millón de tokens de entrada y $6.00 de salida, contexto de 1M de tokens, lecturas de caché a $0.25, lanzado el 3 de agosto de 2026.
• Qwen3.8-27B — $0.33 de entrada y $2.40 de salida, contexto de 262,144 tokens, lanzado el 13 de agosto de 2026. Estos son los pesos abiertos, así que este precio es lo que pagas si prefieres no ejecutarlos.
• Qwen3.8-Flash — $0.15 de entrada y $0.47 de salida con la ventana de 1M de tokens, lanzado el 26 de agosto de 2026.
Esos son los precios de lista de los proveedores en OrcaRouter, traspasados sin añadir nada por token, que es la propiedad útil cuando la pregunta es si un despliegue autoalojado se amortiza por sí mismo: puedes medir tu volumen real de tokens en los niveles alojados antes de comprometerte con el hardware. No añadimos margen, así que un recorte de precios de un proveedor está activo en nuestro lado el mismo día. Los tres niveles de Qwen3.8 se pueden enrutar hoy con una única clave compatible con OpenAI con conmutación automática ante fallos entre proveedores, y el próximo Qwen3.8 de 2,4 billones de parámetros tiene una página de catálogo esperando los pesos en lugar de un marcador de posición que pretende servirlos.
Kolibri no es enrutable. Exploramos el catálogo con todas las grafías de proveedor y modelo y no aparece, así que la única forma de invocarlo es la descarga de 78 GB. Si quieres saber cuánto le costaría el modelo alemán a tu carga de trabajo, la respuesta es un rack y una persona que sepa ejecutar vLLM, y actualmente ningún tercero puede cotizarte algo distinto.

Quién debería comprar cuál
La decisión no depende de la calidad, porque esa cuestión ya la ha resuelto a favor de Alibaba la propia tabla del proveedor. Depende de contra qué riesgo estás comprando un seguro.
• Elija Kolibri si la restricción determinante es la jurisdicción, la documentación de procedencia o la auditabilidad — si necesita poder responder de dónde procedían los datos de entrenamiento, dónde se ejecutó el cómputo y bajo qué legislación, y si la carga de trabajo son documentos en alemán e inglés procesados dentro de su propio perímetro. Por eso está pagando una prima de capacidad, y esa prima es visible en la tabla anterior.
• Elige Qwen3.8 27B si la restricción determinante es la capacidad por dólar, la amplitud de idiomas o el soporte del ecosistema. Es el modelo más potente según la propia evaluación de Aleph Alpha, tiene licencia Apache, se ejecuta en un solo acelerador y los niveles alojados comienzan en $0.33 por millón de tokens de entrada si prefieres no ejecutarlo en absoluto.
• Considera ambos en la misma arquitectura si la carga de trabajo tiene un núcleo regulado y una periferia general. Los documentos que no pueden salir del edificio van a un punto de conexión Kolibri autoalojado; el trabajo de resumen, traducción y código va a un nivel Qwen3.8 enrutado a un tercio de centavo por cada mil tokens. Una clave de API, una regla de enrutamiento, precios de lista del proveedor tal cual y la conmutación por error gestionada para ti, lo cual es una disposición considerablemente más útil que elegir uno de estos dos y pretender que el otro no existe.
