Cartel de título que dice “Kolibri vs Solar Mini 4”, con el subtítulo “El mismo presupuesto de 3B activos, dos apuestas muy diferentes”, y dos líneas en letra pequeña que dicen “Kolibri — 78.1B en total, pesos Apache 2.0, autoalojado” y “Solar Mini 4 — 35B en total, cerrado, API alojada”, sobre un fondo blanco con suaves acentos de degradado azul y cian y el logotipo de OrcaRouter en la parte inferior derecha.
Guides & Insights

Kolibri vs. Solar Mini 4: el mismo presupuesto de 3B activos, dos apuestas muy diferentes

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Dos modelos lanzados con diecisiete días de diferencia, ambos ajustados para gastar aproximadamente tres mil millones de parámetros activos por token, y difícilmente podrían ser más distintos a la hora de adoptarlos en la práctica. Kolibri de Aleph Alpha son 78,1 mil millones de parámetros de pesos Apache-2.0 que descargas y sirves por tu cuenta: no existe ningún endpoint alojado y, a día de hoy, no hay ni una sola puntuación independiente de él en ninguna parte. Solar Mini 4 de Upstage son 35 mil millones de parámetros que no puedes descargar en absoluto: existe solo como un endpoint de pago por uso, y ya cuenta con un Artificial Analysis Intelligence Index de 24,05. El número de parámetros activos te dice lo que cuesta ejecutar cada uno. Nada más de ese número te dice lo que te cuesta empezar.

La razón por la que los totales difieren tanto —78.1B frente a 35B con casi la misma fracción activa— es que ambos son diseños de mezcla de expertos dispersos, y los dos laboratorios tomaron decisiones opuestas sobre cuánta capacidad de expertos mantener en reserva. Kolibri incorpora 384 expertos y enruta a 1 compartido más 6 de ellos por token. Solar Mini 4 revela una división 35B/3B y nada sobre su número de expertos. Cuando dos modelos se anuncian con la misma cifra activa, el total de parámetros, no la cifra activa, es lo que decide tu factura de hardware, y aquí hay una diferencia de 2,2× con el mismo presupuesto de cómputo declarado.

Lo que realmente es cada uno

• Parámetros totales — Kolibri 78.10B vs Solar Mini 4 35B

• Parámetros activos por token — Kolibri 3.46B vs Solar Mini 4 3B

• Pesos — Kolibri Apache 2.0, pesos completos en Hugging Face vs Solar Mini 4 cerrado; solo API

• Contexto — Kolibri 1.048.576 tokens validados frente a Solar Mini 4 512K según los documentos de Upstage, 1.048.576 según la ficha del modelo de Artificial Analysis

• Salida máxima — Kolibri no limitado por el proveedor frente a Solar Mini 4, 128.000 tokens

• Idiomas — Kolibri en alemán e inglés frente a Solar Mini 4 en inglés, coreano y japonés

• Fecha de corte de conocimiento — Kolibri 18 de junio de 2026 vs. Solar Mini 4 de febrero de 2026

• Entrega — Kolibri autoalojado (vLLM) vs Solar Mini 4 alojado en la Console, el Playground y on-premises de Upstage

• Evaluación independiente — Kolibri ninguna publicada frente a Solar Mini 4 AA Intelligence Index 24.05

Kolibri: 78 mil millones de parámetros, y nadie fuera del laboratorio lo ha puntuado

Aleph Alpha publicó Kolibri el 3 de octubre de 2026, deliberadamente en el Día de la Reunificación Alemana, como el primero de una nueva familia y el sucesor de Kolibri Origin. La ficha del modelo es inusualmente franca sobre lo que se invirtió en él: 20 billones de tokens de preentrenamiento, 3,44 billones de entrenamiento intermedio y 201 mil millones de entrenamiento de contexto largo, ejecutado en 768 GPU B200 en 21 días por aproximadamente 6,4×10²³ FLOPs y unos 950 MWh. El proveedor también ofrece voluntariamente el recuento de fallos —38 interrupciones no planificadas, aproximadamente una cada 10.000 horas de GPU—, que es el tipo de cifra que los laboratorios suelen omitir.

Screenshot of Aleph Alpha's newsroom post “Kolibri Has Landed”, showing the 03/10/2026 release date, the line about releasing on the Day of German Reunification, and the architecture comparison table between Kolibri and Kolibri Origin.

La arquitectura es una historia limpia de MoE disperso. Cincuenta capas con una proporción de 4:1 entre atención de ventana deslizante (ventanas de 512 tokens) y atención global, que se activa solo cada quinta capa. Pesos FP8 con escalado por bloques de 128×128 y una caché KV en FP8. Kolibri Origin, en comparación, usaba 128 expertos con enrutamiento de ancho 8, una dimensión oculta de experto de 768 y atención completa en cada capa, sobre datos en inglés con fecha de corte en septiembre de 2024. Kolibri pasa a 384 expertos con enrutamiento de ancho 6 con una dimensión oculta de 512, y lleva ambas fechas de corte de idioma al 18 de junio de 2026.

El pipeline alemán es la parte que de verdad resulta difícil de comprar en otro sitio. Aleph Alpha entrenó su propio tokenizador UniBPE y reporta texto en alemán a 4,90 bytes por token, frente a 4,35 de GPT-5, 4,17 de Qwen3.5 y 4,13 de Gemini. Eso es un tokenizador que afirma lograr mejor compresión del alemán que cualquiera de los modelos multilingües de frontera, y es el mecanismo concreto que sustenta la propuesta de despliegue soberano: menos tokens por documento en alemán significa menos tokens facturados y una ventana efectiva más larga en el mismo hardware.

Cada cifra de rendimiento que existe para Kolibri proviene de la propia ficha del modelo de Aleph Alpha, y debe leerse así. La tabla reportada por el proveedor sitúa a Kolibri en un 75,5 general en las evaluaciones en inglés y 70,8 en alemán, 84,3 en GPQA Diamond en inglés frente a 81,3 en alemán, 21,5 en Humanity's Last Exam en inglés frente a 15,9 en alemán, 66,4 en SWE-Bench Verified, 85,9 en LiveCodeBench v6 y 68,3 en AA-LCR. Son cifras no auditadas. No hay una página de Artificial Analysis para Kolibri —la URL del modelo del tracker devuelve un 404—, así que nada de esa tabla ha sido reproducido de forma independiente, y el artículo que estás leyendo no puede hacerlo más sólido de lo que es.

Lo que la tarjeta sí consolida es la propuesta de servicio. El mínimo de hardware son dos A100 de 80 GB, o dos H100 SXM5, o una sola H200, B200 o B300. Una receta publicada de vLLM lo ejecuta con --kv-cache-dtype fp8 y parsers dedicados de razonamiento y de llamadas a herramientas, a temperatura 1.0, top-p 0.97 y top-k 128, con un reasoning_effort ajuste que abarca none, low, medium y high. Un solo B300 sirviendo un modelo de 78B con un contexto validado de 1M de tokens es la forma concreta de la oferta: compras el equipo y luego asumes el coste marginal de cada token.

Solar Mini 4: alquilas el slice activo de 3B en lugar de comprarlo

Solar Mini 4 llegó el 22 de septiembre de 2026 — instantánea solar-mini4-260922, alias solar-mini4 — como modelo pequeño orientado a agentes de Upstage: 35B en total, 3B activos, una fecha de corte de febrero de 2026, inglés, coreano y japonés, con modos de chat, razonamiento, salida estructurada y llamada a herramientas. Está disponible a través de la consola y el Playground de Upstage, y para despliegue en las instalaciones, pero no hay descarga de pesos ni licencia que inspeccionar. La documentación de Upstage también registra «Data not collected» para él, que es la línea de cumplimiento que importa si lo vas a poner frente a tráfico real.

Screenshot of Upstage's Console documentation page for Solar Mini 4, showing the snapshot identifier solar-mini4-260922, the release date 2026-09-22, 35B total and 3B active parameters, a 512K context window with 128K maximum output, the list price of $0.10 per million input, $0.40 per million output and $0.01 per million cached, and the note “Data not collected”.

A diferencia de Kolibri, Solar Mini 4 ha pasado por un harness independiente. Artificial Analysis lo sitúa en un Índice de Inteligencia de 24.05, con un 1.01% medido en Terminal-Bench 4.0, un 47.6% en SciCode, un 83.3% en AA-LCR y un 25.8% en Humanity's Last Exam. La publicación de lanzamiento de Upstage presenta el 24.1 como el Índice más alto entre los modelos con 3B de parámetros activos, por delante de Qwen3.6 35B A3B con 18 y de Nemotron 3.5 Lightning con 13 — un enfoque que es justo hasta donde llega, y vale la pena señalar que es exactamente tan limitado como suena, ya que es una afirmación sobre la clase de 3B activos y no sobre los modelos pequeños en general.

La medida que debería determinar cómo presupuestas para ello no es el Índice. El desglose de costes por tarea de Artificial Analysis sitúa a Solar Mini 4 en aproximadamente $0,36 por tarea del Intelligence Index, y unos $0,30 de eso —cerca del 82%— son escrituras de la caché de prompt. Las lecturas de caché cuestan $0,03 y la salida generada cuesta solo $0,035. El modelo emite unos 88.300 tokens de salida por tarea, de los cuales unos 71.600 son tokens de razonamiento. En otras palabras: es un modelo barato cuya factura está dominada por reescribir un contexto largo, no por los tokens que devuelve. Los costes por evaluación van desde $1,63 para Terminal-Bench 4.0 hasta $0,95 para AA-Briefcase. La velocidad de salida mediana es de 198 tokens por segundo, con un tiempo hasta el primer fragmento de 1,58 segundos.

El precio de cada camino

Solar Mini 4 no se ofrece hoy a precio de lista. La propia página de precios de Upstage tiene una escala con fechas para él: $0.03 por millón de entrada, $0.003 en caché y $0.12 de salida —un descuento de lanzamiento del 70%— hasta el 10 de octubre de 2026 UTC, luego $0.05 / $0.005 / $0.20 a partir del 11 de octubre, y finalmente el precio de lista de $0.10 / $0.01 / $0.40 a partir del 23 de octubre. La publicación de lanzamiento de Upstage describe el descuento de forma más vaga que el propio calendario de la página de precios; la escala anterior es la versión con fechas, y es la que conviene usar como base para planificar. Fíjate dónde está el descuento más pronunciado: la entrada en caché cae a una décima parte de la tarifa de entrada, lo que recompensa exactamente la carga de trabajo de contexto estable a largo plazo por la que cobra el perfil de costo de escritura en caché anterior.

El precio de Kolibri es una orden de compra. No hay una tarifa por millón de tokens con la que comparar porque no existe un medidor alojado: pagas por las GPUs y la electricidad, y la única señal pública de coste que ofrece el proveedor es el propio entrenamiento: unos 950 MWh para producir el modelo. Si ya cuentas con capacidad de inferencia, el coste marginal por token de Kolibri se aproxima al coste de la electricidad; si no la tienes, la entrada cuesta una máquina con dos A100 o algo mejor. Esa es una forma de compromiso radicalmente distinta a la de un modelo al que puedes llamar por millones de tokens y dejar de llamar mañana, y es la decisión real que plantean las dos opciones.

Donde se superponen, y donde falla la comparación

• Cómputo activo — casi idénticos: 3,46B frente a 3B por token

• Todo lo que se deriva de ello — no comparable, porque solo uno de los dos tiene alguna evidencia verificada

• Mejor puntuación medida — Solar Mini 4 tiene un Índice auditado de 24,05; Kolibri tiene una tabla del proveedor y ninguna puntuación auditada en absoluto

• Alemán — Kolibri es el único de los dos entrenado para ello, a 4,90 bytes por token; Solar Mini 4 no lo indica

• Coreano y japonés — Solar Mini 4 incluye ambos; Kolibri no incluye ninguno

• Contexto largo — Kolibri valida un total de 1,048,576 tokens; los propios documentos de Solar Mini 4 dicen 512K mientras que su ficha de Artificial Analysis dice 1M, así que trata el límite como dependiente del proveedor

• Tiempo hasta el primer token — Solar Mini 4: minutos, porque te registras; Kolibri: días, porque rackeas un

• Modelo de costes — por token, decreciente conforme a la escala de descuentos, frente a capital más energía

El resumen honesto es que esto no es un enfrentamiento que se resuelva en una tabla de clasificación. La tabla publicada por el proveedor Kolibri incluye incluso su propio conjunto de comparación —GLM-4.7 Flash 30B-A3B con 64,7 en inglés general, Nemotron 3 Nano 30B-A3B con 65,6, Qwen3.5 35B-A3B con 74,7, Qwen3.6 35B-A3B con 71,4, Gemma 4 26B-A4B IT con 71,9, todos frente al 75,5 de la propia Kolibri— y cada una de esas filas es una cifra de la propia Aleph Alpha, obtenida por el mismo laboratorio con su propio banco de pruebas. Es un mapa útil del vecindario de los 3B activos. No es una clasificación independiente.

Si lo que quieres hoy es un MoE de 3B activos en una clave

Ninguno de los dos modelos de esta comparación está en OrcaRouter, y vale la pena ser precisos sobre por qué. Kolibri aún no tiene inferencia alojada de ningún tipo: son pesos y una receta de vLLM, así que no hay nada a lo que un enrutador pueda apuntar. Solar Mini 4 lo sirven Upstage y el propio canal on-premises de Upstage; nosotros no lo enrutamos, y no enrutamos ningún modelo de Upstage. Si quieres cualquiera de los dos, lo obtienes de los propios proveedores.

La ruta que ofrecemos es la clase que rodea a todo esto: el segmento de MoE pequeños y dispersos en el que compiten ambos modelos. Gemma 4 26B-A4B IT está en el catálogo a $0.06 de entrada y $0.33 de salida por millón de tokens, con una ventana de 262.144 tokens. Qwen3.5 35B-A3B está a $0.057 / $0.459 y Qwen3.6 35B-A3B a $0.248 / $1.485, con una ventana de 262.144 tokens y 65.536 tokens de salida máxima. Es el mismo intercambio que hacen los dos modelos anteriores —una porción activa de 3B a 4B comprada al precio de un modelo pequeño—, disponible en una sola clave de API con el precio de lista del proveedor pasado con un 0 % de margen, de modo que un cambio de precio del proveedor llega a tu factura el mismo día en que se anuncia, y no en la siguiente renovación de contrato. La conmutación automática por error importa aquí más que de costumbre: cuando evalúas un modelo disperso sin probar, una segunda ruta detrás de la misma clave es lo que evita que una tarde mala se convierta en una caída del servicio.

A two-column comparison scoreboard titled “Kolibri vs Solar Mini 4 — the scoreboard”. The Kolibri column lists total parameters 78.1B, 3.46B active per token, Apache 2.0 downloadable weights, 1,048,576-token context, German and English, and no independent score published. The Solar Mini 4 column lists total parameters 35B, 3B active per token, closed API-only weights, a 512K-per-docs / 1M-per-Artificial-Analysis context, English, Korean and Japanese, and an Artificial Analysis Intelligence Index of 24.05. A footer line reads “Kolibri figures are Aleph Alpha's own, unaudited; Solar Mini 4 figures per Artificial Analysis and Upstage.”

Qué hacer y qué observar

Elige Kolibri si el alemán o el inglés son tu carga de trabajo, si los datos no pueden salir de tu propio rack, y si tienes —o estás dispuesto a comprar— las GPUs para servir 78B en FP8. En esa configuración es el único de estos dos modelos que es siquiera una opción, y el contexto validado de 1M tokens con un tokenizador alemán de 4.90 bytes por token es una ventaja real, aunque medida por el proveedor. Elige Solar Mini 4 si quieres estar en producción esta semana, si el coreano o el japonés están en el roadmap, y si tu carga de trabajo es un contexto largo y estable que el descuento por caché recompensa; presupuesta para escrituras de caché, no para tokens de salida.

La cuestión abierta es la misma para ambos, y es una cuestión de evidencia más que de capacidad. Los 75,5 y 84,3 de Kolibri son cifras de la propia Aleph Alpha en el harness de la propia Aleph Alpha, y hasta que un rastreador independiente lo ejecute, quien los cite está citando al laboratorio. El 24,05 de Solar Mini 4 es real y se ha reproducido, pero el Index es una instantánea de un modelo que aún está a mitad de la escalera de descuentos, y el precio de lista no llegará hasta el 23 de octubre. Presta atención a la primera evaluación independiente de Kolibri y observa cuánto cuesta realmente Solar Mini 4 cuando se agote la escalera, porque a $0,10 / $0,40 la economía de alquilar el segmento de 3B es distinta de la de los $0,03 / $0,12 que te cotizan hoy.