
Kolibri vs LFM2.5 2.6B Base: un despliegue soberano de 78B contra un checkpoint del tamaño de un teléfono
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 218 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Pon Kolibri junto a LFM2.5 2.6B Base y la lectura obvia es David y Goliat: 78,1 mil millones de parámetros frente a 2,69 mil millones, un despliegue mínimo de dos GPU frente a un modelo que, según Liquid AI, funciona en un teléfono. La lectura obvia es incorrecta, y no en la dirección que esperarías. Ninguno de los dos es un modelo que puedas asignar hoy a una tarea. Kolibri fue lanzado por Aleph Alpha el 3 de octubre de 2026 como un asistente completo, postentrenado y con llamada a herramientas, en alemán e inglés, con un plugin de servicio y una configuración de muestreo recomendada. LFM2.5 2.6B Base, publicado por Liquid AI a principios de agosto de 2026, es un punto de control preentrenado sin ningún ajuste por instrucciones, publicado específicamente para ser sometido a ajuste fino. Uno es un producto que despliegas. El otro es materia prima. Comparar su calidad es un error de categoría, y la pregunta interesante es qué tipo de materia prima necesita realmente tu proyecto.
La diferencia que decide la mayoría de las adquisiciones reales entre estos dos no está en los parámetros. Está en la licencia. Kolibri se distribuye bajo Apache 2.0. El LFM2.5 2.6B Base se distribuye bajo la LFM Open License v1.0, una licencia a medida (la ficha del modelo lo consigna como "license: other"), y esa diferencia es la que llega a un equipo legal en lugar de a un equipo de ingeniería.
Dos significados diferentes de "open weights"
Ambos modelos te permiten descargar los pesos y ejecutarlos. Lo que se te permite hacer después es donde se diferencian.
• Kolibri — Apache 2.0, sin cláusula de uso aceptable, sin umbral de número de usuarios, sin términos comerciales separados. La ficha de Aleph Alpha solo señala que el laboratorio es signatario del Código de Buenas Prácticas de la UE para la IA de Uso General (GPAI).
• LFM2.5 2.6B Base — la Licencia Abierta LFM v1.0, que es la propia licencia de Liquid AI en lugar de una estándar de la OSI. Es la misma licencia que rige el LFM2.5 2.6B postentrenado y el resto de la familia.
Para un equipo de investigación, cualquiera de las dos sirve. Para una empresa que tiene que declarar su posición de licencia en un documento de adquisición, una es una cantidad conocida y la otra es un documento que alguien tiene que leer. Eso es un costo real, se paga antes de que se genere un solo token, y es invisible en cualquier tabla comparativa.
Hay una segunda distinción dentro de la misma categoría, y es la que la propia ficha de Liquid AI se esfuerza por dejar clara. Base no es un asistente. No incorpora ajuste por instrucciones, lo que significa que no seguirá un prompt, no se abstendrá, no emitirá una llamada a herramienta y no se mantendrá en el tema — no porque sea débil, sino porque nunca fue entrenado para hacerlo. La ficha dice claramente que solo se recomienda para tareas que requieran un ajuste fino intensivo: asistentes específicos de idioma o de dominio, entrenamiento con datos propietarios o experimentación con enfoques novedosos de postentrenamiento. Todo lo que viene después del checkpoint base —ajuste fino supervisado, especialización del maestro, destilación on-policy, aprendizaje por refuerzo agéntico— es problema del comprador. Kolibri llega con todo eso ya hecho, en cuatro niveles de esfuerzo de razonamiento, con un analizador de llamadas a herramientas al estilo Hermes incluido junto a los pesos.
Qué aportan realmente los tamaños
Si dejamos a un lado el encuadre, los dos modelos están optimizados para restricciones opuestas.
• Parámetros — 78.103.074.560 en total con 3.457.573.120 activos por token en Kolibri, frente a 2,69 mil millones en total en el LFM2.5 Base, que utiliza una pila híbrida de 22 bloques de convolución corta con doble compuerta y 8 capas de atención con consultas agrupadas en lugar de un transformer de bloques uniformes.
• Contexto — 131.072 tokens en el LFM2.5 Base, frente a una ventana nativa de 262.144 tokens en Kolibri y 1.048.576 validados más allá de esta.
• Datos de entrenamiento — 34 billones de tokens en el LFM2.5 Base, frente a 20 billones en Kolibri extraídos de un conjunto sin procesar de más de 200 billones tras el filtrado y la deduplicación, de los cuales el 13,6 % era código.
• Idiomas — dieciséis en el LFM2.5 Base, incluidos el árabe, el chino, el japonés, el coreano, el tailandés y el vietnamita, frente a exactamente dos en Kolibri, el alemán y el inglés, por diseño explícito.
• Memoria — el LFM2.5 Base tiene compilaciones GGUF, ONNX y MLX publicadas junto a él y está diseñado para el despliegue en el borde; los pesos FP8 de Kolibri tienen una huella de ~78 GB y requieren un mínimo de dos tarjetas A100 de 80 GB, dos H100 SXM5, una H200, una B200 o una B300.
Lee esas cinco líneas en conjunto y el panorama deja de estar desequilibrado. El modelo de Liquid AI cubre diez veces más idiomas en hardware tres órdenes de magnitud más pequeño. El modelo de Aleph Alpha cubre dos idiomas con una ventana de contexto ocho veces más larga y una profundidad de especialización que solo se manifiesta dentro de sus propias evaluaciones verticales. Ninguno es una versión peor del otro; son respuestas a preguntas diferentes, y las preguntas son "¿puede ejecutarse sin un servidor?" y "¿puede razonar a través de un expediente regulatorio alemán?".

Solo uno de ellos tiene una puntuación medida, y no es el Base
Aquí está la parte que el emparejamiento oculta. Artificial Analysis sí tiene una página de modelo para LFM2.5-2.6B — pero para el modelo post-entrenado, no para el Base. Esa página reporta un Intelligence Index de 8, clasificado en el puesto n.º 9 de 49 modelos de su clase, con un contexto de 128.000 tokens, 2.700 millones de parámetros y la LFM Open License v1.0. Es una puntuación modesta y honesta: el modelo se mide, tiene un precio efectivamente de cero y se evalúa por lo que es — un modelo pequeño de razonamiento.
El checkpoint Base no tiene puntuación, y no puede tenerla. Un Índice de Inteligencia se calcula ejecutando un modelo frente a tareas de razonamiento y conocimiento; un checkpoint que no ha sido ajustado con instrucciones no tiene un comportamiento significativo en esas tareas. Liquid AI no publica ninguna tabla de evaluación para él, y esa ausencia es una afirmación sobre el artefacto, no una laguna en el informe.
La posición de Kolibri vuelve a ser distinta, y merece la pena enunciarla con precisión porque es fácil malinterpretarla. Tampoco existe una página de Artificial Analysis para Kolibri: lo comprobamos, y el modelo está por completo ausente de esa comparación. Lo que existe es la propia tabla de postentrenamiento de Aleph Alpha, donde Kolibri obtiene 75,5 en el promedio en inglés y 70,8 en el promedio en alemán en su harness, frente a 54,1 y 46,4 de su propio predecesor, Kolibri Origin. Son cifras obtenidas por el proveedor en una suite de evaluación creada por el proveedor, y no son convertibles en un Intelligence Index. Así que, de los dos modelos de este titular, uno tiene una puntuación independiente para una versión hermana, otro tiene una tabla del proveedor, y ninguno de los artefactos exactos que se comparan tiene una medición independiente en absoluto.

El hermano que cambia la recomendación
Juzgar el LFM2.5 2.6B Base por sí solo es la forma incorrecta de evaluar el lanzamiento de Liquid AI, porque el Base existe para servir al LFM2.5 2.6B post-entrenado, y los dos se lanzan juntos. Si no tienes intención de escribir un pipeline de ajuste fino, el Base no es tu modelo —el hermano post-entrenado sí lo es, y es el que tiene una puntuación pública y un precio publicado de prácticamente nada por token cuando lo alojas tú mismo.
Esa es la misma relación que Kolibri tiene con Kolibri Origin, y vale la pena hacer la comparación porque Aleph Alpha publicó la línea de tiempo. Origin terminó el preentrenamiento con 30,6 mil millones de parámetros y 3,27 mil millones activos el 11 de junio de 2026 y nunca se lanzó; Kolibri terminó el 11 de septiembre de 2026 con 78,1 mil millones y se lanzó el 3 de octubre. Dos modelos, tres meses, uno de ellos solo interno. La división equivalente de Liquid AI es pública en ambos sentidos: Base y post-entrenado, lado a lado, con compilaciones cuantizadas para llama.cpp, ONNX Runtime y MLX de Apple publicadas junto con el checkpoint nativo. Si tu plan es hacer fine-tuning, ese conjunto de herramientas circundante vale más que una fila de benchmark, porque determina cuánto del trabajo tienes que hacer tú mismo.
Qué implementar, según el requisito
Esta se reduce a una breve lista de decisiones en lugar de un ganador.
• Si el modelo debe ejecutarse sin un servidor —en un teléfono, una laptop, un dispositivo en una fábrica—, LFM2.5 2.6B Base es el único de los dos que es siquiera un candidato, y el LFM2.5 2.6B post-entrenado es el que realmente usarías como punto de partida. Kolibri no puede ejecutarse allí en ninguna cuantización.
• Si la carga de trabajo es razonamiento sobre documentos en alemán o inglés dentro de tu propio perímetro, con restricciones de datos regulados y una necesidad de comportamiento de abstención, LFM2.5 Base no es la forma correcta de artefacto y Kolibri apunta exactamente a ello — siempre que puedas suministrar dos aceleradores de 80 GB y aceptar una postura de licencia que puedas declarar en una línea.
• Si necesitas más que alemán e inglés, la familia de Liquid AI cubre dieciséis idiomas con 2.6B, y el argumento de la cobertura de idiomas se invierte a ese tamaño.
• Si necesitas un asistente desplegado este trimestre y no quieres ejecutar un pipeline de posentrenamiento, Kolibri está posentrenado; el LFM2.5 Base no lo está, y el modelo posentrenado LFM2.5 es un asistente mucho más pequeño que Kolibri en lugar de una versión más económica de este.
Para los equipos cuya carga de trabajo realmente se sitúa en el punto medio —unos pocos miles de millones de tokens al mes, contexto moderado, sin requisito normativo de poseer el hardware—, ninguno de estos es lo primero a lo que recurrirían. Los modelos de menos de 4B son baratos de autoalojar y difíciles de enrutar a escala porque el coste operativo de un despliegue puede superar la factura de tokens; un modelo de 78B tiene el problema contrario. El nivel que realmente se enruta es el intermedio, y ese nivel está en OrcaRouter hoy: Qwen3.5 35B-A3B a $0.057 por millón de entrada y $0.459 de salida, Qwen3.8-Flash a $0.15 y $0.47 con un contexto de 1M de tokens, o el modelo de mezcla de expertos Gemma 4 26B-A4B IT a $0.06 y $0.33. Esos son precios de lista del proveedor transferidos sin nada añadido por token, en una única clave compatible con OpenAI con conmutación por error, y son la respuesta honesta para un equipo que quiere medir su volumen real de tokens antes de comprometerse con un proyecto de ajuste fino o con un rack.
Para ser explícitos sobre lo que no ofrecemos: ni Kolibri ni LFM2.5 2.6B Base son enrutables en OrcaRouter hoy. Buscamos ambos en el catálogo bajo todas las grafías de proveedor y modelo, y ninguno de los dos está ahí. Kolibri es solo para autoalojamiento, y el LFM2.5 Base es un artefacto de ajuste fino que nunca estuvo pensado para estar detrás de una API.

La elección en una línea
Kolibri es un razonador alemán-inglés terminado, con licencia y documentado, de 78 mil millones de parámetros, que requiere dos aceleradores para ejecutarse. LFM2.5 2.6B Base es un punto de partida multilingüe inacabado de 2,69 mil millones de parámetros, que exige un pipeline de ajuste fino y cabe en tu bolsillo. La relación de parámetros entre ambos es de 29 a 1, y es el número menos informativo de este artículo.
