Una tarjeta de título principal que dice «Kolibri vs Intern-Decision 4B» en tipografía grande y en negrita, con una única línea más pequeña debajo que dice «texto generado frente a una distribución de probabilidad calibrada», y dos pequeños iconos planos de línea uno al lado del otro —un colibrí a la izquierda y un pequeño gráfico de curva de campana a la derecha— separados por un delgado divisor vertical, sobre un fondo blanco con suaves acentos de degradado azul y cian y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Kolibri vs Intern-Decision 4B: Uno escribe documentos, el otro se niega a escribir absolutamente nada

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Lo más útil que hay que notar sobre Kolibri y Intern-Decision-4B es que no son la misma clase de objeto, y tratar esto como una comparación modelo contra modelo sería un error de categoría. Kolibri es el modelo de lenguaje de mezcla de expertos de 78.100 millones de parámetros de Aleph Alpha, publicado el 3 de octubre de 2026, que activa 3.460 millones de parámetros por token y escribe texto en alemán e inglés. Intern-Decision-4B es un modelo multimodal de decisión estructurada de 4.540 millones de parámetros del equipo de InternLM, subido a Hugging Face el 26 de septiembre de 2026, cuya ficha afirma claramente que "no llama a generate() ni muestrea texto de forma libre" en absoluto. Uno produce prosa. El otro produce una distribución de probabilidad sobre las opciones que proporciones, en una sola pasada hacia delante, y no tiene ninguna capacidad de escribir una oración. Solo se convierten en competidores en una situación muy concreta, y saber exactamente cuál es esa situación resulta ser lo más útil de cualquiera de los dos lanzamientos.

Dos lanzamientos, dos afirmaciones lacónicas totalmente distintas

La ficha de Kolibri es una especificación de un modelo de lenguaje disperso grande: 50 capas, todas ellas de mezcla de expertos, 384 expertos por capa con uno compartido y seis enrutados, un contexto nativo de 262.144 tokens validado hasta 1.048.576, cuatro niveles de esfuerzo de razonamiento, llamada a herramientas al estilo Hermes con un analizador de vLLM incluido, pesos FP8 en bloques de 128×128 y términos de Apache 2.0. Su entrenamiento procesó 20 billones de tokens en 768 NVIDIA B200 durante 21 días — 392.000 horas de GPU a un valor reportado de 6,4×10²³ FLOPs y un consumo estimado de 9,5×10² MWh, incluida la sobrecarga del centro de datos, excluyendo el ajuste fino supervisado y el aprendizaje por refuerzo. La configuración mínima de servicio de la ficha es de dos tarjetas A100 de 80 GB, dos H100 SXM5, una H200, una B200 o una B300, y la huella FP8 es de unos 78 GB. Es una pieza de infraestructura seria, y responde a las preguntas generando texto.

Intern-Decision-4B es el tipo opuesto de objeto y la ficha del modelo es refrescantemente directa al respecto. Es un ajuste fino de Qwen3.5-4B en el que la torre de visión y el proyector están congelados y solo se entrena la columna vertebral del lenguaje. Le entregas un estado, un esquema de preguntas con nombre y, opcionalmente, hasta ocho imágenes, y devuelve una distribución sobre las respuestas candidatas para todas las preguntas a la vez. El mecanismo es inusual y vale la pena exponerlo con precisión: las opciones se asignan a símbolos de un solo token que abarcan de A a Z, de a a z y de 0 a 9 —62 candidatos, así que un máximo de 62 opciones por pregunta—, el prompt se renderiza con un marcador de posición por campo, y el modelo lee los logits en la posición inmediatamente anterior a cada marcador de posición. Softmax se ejecuta solo sobre los logits de símbolos permitidos de ese campo, una temperatura específica del checkpoint calibra el resultado, y los símbolos se asignan de vuelta a los valores de tus opciones originales como JSON tipado. No hay bucle de decodificación, ni muestreo, ni prosa.

• Salida — Kolibri: texto en alemán o inglés generado libremente, llamadas a herramientas, rastros de razonamiento. Intern-Decision-4B: respuestas JSON tipadas con una probabilidad por opción.

• Parámetros — Kolibri: 78.103.074.560 en total, 3.457.573.120 activos. Intern-Decision-4B: 4,54 mil millones repartidos en cuatro fragmentos de safetensors en bfloat16, con una torre de visión congelada.

• Entrada — Kolibri: solo texto. Intern-Decision-4B: texto más hasta ocho imágenes.

• Capacidad de preguntas — Intern-Decision-4B: hasta 62 opciones por campo, en una sola pasada hacia adelante, con tipos de pregunta 'choice', 'score' y 'noul' (sí/no). Kolibri: ilimitado en principio, un token a la vez en la práctica.

• Idioma — Kolibri: alemán e inglés por construcción. Intern-Decision-4B: lo que sea que traiga Qwen3.5-4B, con todas las suites de evaluación publicadas en inglés.

• Latencia — Intern-Decision-4B: 44,16 ms de media, 44,03 ms de mediana y 44,60 ms de P95 por consulta en una sola RTX 4090, según su propia medición. Kolibri: no hay ninguna cifra publicada por consulta.

• Licencia — ambas Apache 2.0; Intern-Decision-4B se distribuye con el archivo de licencia de Qwen conservado junto a él.

A two-column comparison scoreboard titled 'Kolibri vs Intern-Decision 4B'. Left column Kolibri: Output freely generated text, Parameters 78.1B MoE / 3.46B active, Input text only, Context 262,144 native / 1M validated, Latency none published, Licence Apache 2.0. Right column Intern-Decision 4B: Output typed JSON with a probability per option, Parameters 4.54B bfloat16 with a frozen vision tower, Input text plus up to eight images, Options up to 62 per field in one forward pass, Latency 44.16 ms mean on one RTX 4090, Licence Apache 2.0. A footer line reads 'Kolibri figures vendor-reported; Intern-Decision 4B figures per its model card.' with the OrcaRouter logo in the bottom-right corner.

Por qué existe siquiera un scorer de 4B

El argumento a favor de Intern-Decision-4B no es que sea pequeño. Es que pedirle a un gran modelo generativo una probabilidad no es lo mismo que medirla, y la diferencia es medible.

El propio cuadro de referencia de la tarjeta presenta el argumento con una cantidad inusual de autodivulgación. A lo largo de siete suites de precisión, Intern-Decision-4B promedia 90,02 — frente a 88,74 del baseline más fuerte con el que se compara, un modelo llamado Jev. Pero la precisión es la mitad poco interesante. La tabla también reporta la puntuación Brier y el error de calibración esperado, y ahí el panorama es más exigente. El 4B registra un Brier de 0,347 y un ECE de 0,065, frente al 0,358 y 0,095 de Jev. Los hermanos menores son donde la historia de calibración se vuelve genuinamente informativa. Intern-Decision-2B obtiene un promedio de 84,68, muy por delante del 0.8B con 79,38 — y sin embargo su ECE de 0,100 es peor que el 0,066 del 0.8B y peor que el 0,065 del 4B, con un Brier de 0,437 frente al 0,530 del 0.8B. El más preciso de los dos modelos pequeños es el menos honesto sobre su propia confianza. Si hubieras asumido que la calibración mejora con la precisión, o con el número de parámetros, esa tabla es el contraejemplo en ambos aspectos.

Un segundo diagnóstico, separado, cubre 96 casos construidos con distribuciones de referencia exactas en lugar de etiquetas duras muestreadas: extracciones aleatorias, eventos compuestos, historial condicional y acertijos de probabilidad. El error del modelo 4B en ese piloto bajó de 0.628 a 0.550 en la métrica reportada, mientras que el modelo de comparación se situó en 0.595. La tarjeta deja claro que este piloto no se usó para ajustar ni seleccionar la temperatura publicada; la temperatura de 1.992418 del 4B se ajustó por separado en un conjunto de calibración. El equipo de InternLM también incorporó el propio benchmark al repositorio de GitHub —el generador determinista, las referencias y el evaluador offline—, lo que significa que la afirmación sobre la calibración es del tipo poco común que un tercero puede volver a ejecutar de verdad en lugar de aceptarla por fe.

Nada en el lanzamiento de Kolibri ofrece un equivalente. Su tabla comparativa informa la precisión en la tarea de catorce modelos en un único harness de proveedor, y la precisión es aquello con lo que se puede medir a un modelo generativo. No hay ninguna cifra de calibración, ni Brier ni ECE en ningún lugar del material, y no hay forma de pedirle «la probabilidad de que esta cláusula contractual sea exigible» que no implique tomar una muestra de una frase y leerla.

La única costura donde realmente se encuentran

Pon los dos uno al lado del otro en un pipeline real y las formas se vuelven obvias. Un flujo de trabajo de documentos en alemán necesita ambas mitades, y ninguna herramienta cubre la mitad de la otra.

Kolibri es la mitad que lee y escribe. Un equipo con contratos alemanes o documentación técnica obtiene una ventana nativa de 262,144 tokens, una caché KV FP8, un tokenizador bilingüe que Aleph Alpha reporta a 4.90 bytes promedio por token en texto web alemán, y llamada a herramientas de Hermes — es decir, un modelo que puede resumir un expediente, redactar una respuesta y ejecutar un bucle de herramientas. Lo que no puede hacer es decirte su propia confianza de una manera que puedas auditar, porque todo lo que emite es una cadena muestreada.

Intern-Decision-4B es la mitad que decide. Dada una página de texto en alemán y un conjunto fijo de opciones, devuelve una distribución calibrada en 44 milisegundos en una GPU de consumo, sin paso de generación y, por lo tanto, sin varianza de muestreo alguna. Lo que no puede hacer es producir el texto en alemán en primer lugar, y sus suites de evaluación publicadas están en inglés — su comportamiento en alemán se hereda de la base Qwen3.5-4B en lugar de haberse entrenado para ello, lo que constituye una limitación real para un despliegue en alemán y que nadie ha evaluado.

Así que la respuesta técnica honesta para un flujo de trabajo regulado en alemán es que estas son dos etapas de un mismo pipeline, no dos candidatos para una misma posición. La pregunta práctica es dónde se ejecuta cada una. Kolibri necesita dos H100 o una B200 y unos 78 GB. Intern-Decision-4B necesita una RTX 4090 y ejecuta una consulta en menos de 45 milisegundos. La asimetría de costes es de aproximadamente dos órdenes de magnitud en hardware, y apunta a un diseño en el que un scorer pequeño se ejecuta continuamente en cada caso y el generador grande solo se invoca cuando un caso realmente necesita prosa. Esa es una forma más barata y más favorable para la auditoría que enrutar cada caso a través del modelo de 78B para obtener una respuesta que luego hay que interpretar.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-4B, showing the card header, the description of it as a multimodal structured decision model fine-tuned from Qwen3.5-4B that returns an answer distribution in one forward pass, and the numbered 'How inference works' steps mapping each question's options to single-token symbols.

La realidad del hosting para ambos, y para qué sirve la capa

Ninguno de los modelos está disponible como API alojada, y lo comprobamos en lugar de suponerlo. Intern-Decision-4B no tiene endpoint de proveedor; su lanzamiento son los pesos, un repositorio de GitHub y un Hugging Face Space. Sus recuentos de descargas y me gusta han cambiado desde mediados de semana, lo que indica que la gente lo está adoptando, pero sigue sin haber una ruta de pago invocable en ningún lugar que podamos nombrar.

Kolibri tampoco tiene ningún SKU de API de Aleph Alpha: el lanzamiento consta de pesos, un informe técnico y una imagen de contenedor en ghcr.io/aleph-alpha/aleph-alpha-inference. Y no está en OrcaRouter: probamos el catálogo con todas las grafías del prefijo del proveedor y del nombre del modelo, y devuelve «no encontrado», lo cual preferimos decir antes que dar a entender lo contrario.

Lo que cambia aquí una capa de enrutamiento no es el acceso a estos dos modelos, sino la economía de decidir si comprar el hardware para cualquiera de los dos. La prueba honesta previa a la compra para la mitad generativa consiste en ejecutar la carga de trabajo contra un nivel pequeño de mezcla de expertos que ya está enrutado —la variante Gemma 4 26B-A4B, a 0,06 $ por millón de tokens de entrada y 0,33 $ por millón de salida, con una ventana de 262.144 tokens y entrada de texto, imagen y vídeo— en una clave compatible con OpenAI al precio de lista del proveedor sin añadir nada, y comprobar si la carga de trabajo de documentos en alemán realmente necesita 78.000 millones de parámetros antes de encargar las GPU. La mitad de decisión no tiene ese atajo, porque el comportamiento de distribución calibrada es la razón de ser del modelo y ningún nivel enrutado lo hace. Pero eso es en sí mismo el hallazgo: te dice que el scorer de 4B es la parte que realmente vas a autoalojar, y que el generador es la parte que merece la pena volver a probar contra algo que puedas alquilar esta misma tarde.

¿Qué lo resolvería?

Dos mediciones, y ninguna de las dos existe todavía.

El primero es Intern-Decision-4B con entrada en alemán. Todas las suites publicadas están en inglés y el modelo es un ajuste fino de una base multilingüe, así que su calibración en alemán es desconocida — y la calibración es exactamente la propiedad que no se transfiere gratis entre idiomas. Una versión en alemán del piloto de distribución de 96 casos sería el artefacto más informativo que cualquiera podría publicar sobre este modelo.

El segundo es el costo por decisión de Kolibri. Su afirmación de economía de servicio es una frontera de Pareto de calidad frente a tokens decodificados por segundo por GPU, y no hay una página de Artificial Analysis para Kolibri ni una replicación por terceros del arnés. Hasta que alguien lo ejecute, «78 mil millones de parámetros» es una especificación más que un costo, y el argumento para mantener un puntuador de 44 milisegundos delante de él sigue siendo un argumento de diseño, no uno medido.

Hasta entonces, la forma correcta de leer esta pareja no es como una competencia. Intern-Decision-4B es el lanzamiento técnicamente más interesante de los dos, porque la salida estructurada con reconocimiento de calibración es una capacidad que casi ningún modelo generativo ofrece, y su ficha técnica permite comprobar esa afirmación. Kolibri es el lanzamiento de mayor trascendencia, porque un laboratorio europeo que publica un modelo Apache 2.0 con 78 mil millones de parámetros junto con el pipeline de datos es un acontecimiento de cadena de suministro más que un acontecimiento de modelo. Ninguno reemplaza al otro. Los equipos que necesiten ambos deberían planificar para ambos y dimensionar el hardware en consecuencia, y el harness que los rodea es donde realmente se invierte el esfuerzo de ingeniería.

A screenshot of the InternLM 'Intern Large Models' organisation page on Hugging Face, showing the organisation header, its stated affiliation with Shanghai AI Laboratory, and a recent-activity feed listing models published within the last hour.