Una tarjeta de título generada que dice "Ember-1 vs LFM2.5 2.6B Base" con el subtítulo "Un comportamiento acabado frente a un sustrato crudo", sobre dos tarjetas: Ember-1 — "Kimi K3 reentrenado" y "servido, no descargado"; LFM2.5 2.6B Base — "checkpoint denso de 2.69B" y "sin ajuste por instrucciones".
Guides & Insights

Ember-1 vs LFM2.5 2.6B Base: Un comportamiento acabado frente a un sustrato crudo

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Ni Ember-1 ni LFM2.5 2.6B Base son modelos que puedas tomar y usar, y son inutilizables por razones opuestas. Ember-1, publicado por Fireworks Research el 23 de septiembre de 2026, es un derivado especializado de Kimi K3 de Moonshot AI que el laboratorio reentrenó para alcanzar la precisión de K3 con aproximadamente un 40 % menos de tokens: un comportamiento acabado, disponible solo como vista previa de investigación en la propia plataforma sin servidor del proveedor, sin pesos y sin precio publicado. LFM2.5 2.6B Base, publicado por Liquid AI el 4 de agosto de 2026, es un checkpoint preentrenado de 2,69 mil millones de parámetros bajo la LFM Open License v1.0 que no ha sido ajustado con instrucciones en absoluto y continuará tu texto en lugar de responder a tu pregunta: un sustrato sin procesar, descargable hoy, deliberadamente inacabado. Leerlos en paralelo es una buena forma de ver los dos argumentos que se están planteando sobre de dónde provienen ahora las ganancias de eficiencia.

La pregunta que ambos modelos están respondiendo

Ambos lanzamientos asumen la misma premisa: que las victorias fáciles de hacer más grande un modelo ya se han aprovechado en gran medida, y que el trabajo interesante se ha trasladado a cómo un modelo gasta lo que ya tiene. Los dos laboratorios responden a eso de manera diferente. Fireworks Research tomó un modelo de frontera existente y cambió su comportamiento. Liquid AI construyó un modelo pequeño desde cero y cambió la escala. Ninguno es una historia de nueva arquitectura, y ninguno intenta encabezar una tabla de clasificación.

La respuesta de Ember-1: conserva el modelo, reentrena el comportamiento

Ember-1 deja intacta la arquitectura de Kimi K3 y ataca una ineficiencia concreta. Los modelos de razonamiento pueden consumir más del 90 % de sus tokens generados en deliberación interna, y en un bucle de agente multiturno esas trazas se reproducen y se vuelven a facturar en cada turno posterior —Fireworks Research describe el crecimiento de contexto resultante como aproximadamente cuadrático en el número de turnos. La afirmación del laboratorio es que el razonamiento de K3 es más largo de lo que requiere la tarea y que el exceso puede eliminarse sin cambiar las respuestas. Informa haber ejecutado más de 50 experimentos de entrenamiento y más de 200 evaluaciones en su propia pila de entrenamiento serverless, y afirma que la longitud del razonamiento se redujo entre un 35 % y un 50 % sin pérdida de precisión en siete benchmarks y dos conjuntos de tráfico de producción de clientes. Todo eso está reportado por el proveedor y no ha sido reproducido.

Los resultados son desiguales de una manera que el número destacado oculta. Las reducciones de tokens de Ember-1 van del 51,9 % en Terminal Bench 2.1 al 5,9 % en τ-2 Bench Airline. En una prueba A/B de codificación en producción de un cliente, los tokens de salida cayeron de 49,3K a 29,9K mientras que la puntuación se mantuvo en 0,753 frente a 0,751 — una reducción del 71,3 % en los tokens de razonamiento. Eso es un efecto grande en una forma de carga de trabajo y uno casi invisible en otra, que es lo que cabría esperar de un modelo entrenado para dejar de pensar en exceso en lugar de pensar menos.

A two-column scoreboard titled "Ember-1 vs LFM2.5 2.6B Base — the scoreboard" comparing six dimensions. Ember-1: a retrained Kimi K3 derivative; parameters undisclosed; no published weights; context not published (base model 1M); published evaluation is seven benchmarks plus two A/B tests, vendor-run; obtained only as a serving preview. LFM2.5 2.6B Base: a pretrained base checkpoint with no instruction tuning; 2.69B dense parameters; weights under the LFM Open License v1.0; 131,072-token context; no published evaluation, by design; obtained by downloading and fine-tuning.

Respuesta de LFM2.5 2.6B Base: cambia la escala, mantén la receta

LFM2.5 2.6B Base es una apuesta de otro tipo. Es la arquitectura híbrida de Liquid AI a pequeña escala: 30 capas, de las cuales 22 son bloques de convolución corta con doble compuerta y 8 son capas de atención con consultas agrupadas, entrenada con unos 34 billones de tokens en 16 idiomas, con una ventana de contexto de 131.072 tokens. El checkpoint completo tiene 2,69B de parámetros densos, lo bastante pequeño como para que la conversación sobre el costo deje de girar en torno a los tokens y pase a girar en torno a cuál única GPU tienes libre.

Lo que lo hace inusual es lo que deliberadamente no hace. No hay ajuste por instrucciones, que es precisamente el sentido del sufijo «Base»: dale una pregunta y continuará el texto al estilo de la pregunta en lugar de responderla. La propia tarjeta de modelo de Liquid AI lo recomienda para tareas que requieren un ajuste intenso. Tampoco hay una evaluación publicada de él, y eso no es un descuido: evaluar un checkpoint base con benchmarks de seguimiento de instrucciones no mediría nada, porque el comportamiento que se mide aún no ha sido entrenado.

El contraste, una línea por dimensión

• Qué es — Ember-1: un derivado reentrenado de Kimi K3 con razonamiento acortado. LFM2.5 2.6B Base: un checkpoint preentrenado desde cero sin ajuste de instrucciones.

• Parámetros — Ember-1: no divulgados; heredados de Kimi K3. LFM2.5 2.6B Base: 2,69B denso.

• Pesos — Ember-1: ninguno publicado. LFM2.5 2.6B Base: disponible bajo la LFM Open License v1.0.

• Precio — Ember-1: ninguno publicado; los dólares del benchmark usan la tarifa de Kimi K3. LFM2.5 2.6B Base: descarga gratuita; tú aportas el hardware.

• Contexto — Ember-1: no publicado para la vista previa. LFM2.5 2.6B Base: 131.072 tokens.

• Evaluación publicada — Ember-1: siete benchmarks y dos pruebas A/B, todas ejecutadas por el proveedor. LFM2.5 2.6B Base: ninguna, por diseño.

• Lo que obtienes al final — Ember-1: un endpoint que produce un razonamiento más breve con una precisión de nivel K3. LFM2.5 2.6B Base: un punto de partida cuyo comportamiento es exactamente lo que le entrenes.

Dos tipos diferentes de extrañar

Las brechas en estos dos lanzamientos parecen simétricas y no lo son. La evaluación ausente de LFM2.5 2.6B Base es una propiedad del artefacto: un checkpoint base no tiene comportamiento que puntuar, y la falta de ajuste por instrucciones es una característica documentada, no una carencia. La ausencia no genera incertidumbre comercial, porque lo que se compra es un archivo con una licencia adjunta, y el entregable está completo en el momento en que finaliza la descarga.

Las piezas que le faltan a Ember-1 están genuinamente sin resolver. No hay un precio publicado, así que la afirmación sobre el costo es aritmética sobre la tarjeta de tarifas de Kimi K3, no una tarifa con la que se pueda presupuestar. No hay publicación de pesos, así que el modelo no puede sobrevivir a la decisión del proveedor de seguir sirviéndolo. Y la ventana de acceso se describe como temporal: Fireworks Research enmarca sus lanzamientos de investigación como ventanas serverless de dos semanas cuya permanencia depende de la demanda de la comunidad. Un preview que puede no existir el próximo mes es una propuesta distinta de un preview que simplemente no está probado, y el segundo A/B de clientes en el anuncio —aproximadamente 35 % menos tokens por tarea— te dice lo que el laboratorio espera, no lo que seguirá siendo accesible en noviembre.

Esa asimetría es la respuesta honesta a «cuál de estos está más listo». Ninguno está listo en el sentido de ser una dependencia de producción que se pueda usar directamente. LFM2.5 2.6B Base está terminado como materia prima y sin terminar como modelo. Ember-1 está terminado como modelo y sin terminar como servicio.

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-Base, showing 16,541 downloads in the last month, a safetensors model size of 3B parameters in BF16, the LFM1.0 licence, 16 languages, and a Model Details table listing LFM2.5-2.6B-Base as the pre-trained base model for fine-tuning alongside LFM2.5-2.6B for post-trained agentic workloads.

Qué hacer con cada uno este trimestre

Si tienes un pipeline de fine-tuning y una tarea acotada con etiquetas limpias, LFM2.5 2.6B Base es el más predecible de los dos. El checkpoint es pequeño, la licencia es permisiva, la arquitectura está diseñada para ser eficiente en inferencia, y el trabajo de convertirlo en algo útil —ajuste fino supervisado, un conjunto de evaluación, un stack de servicio— es trabajo que ya dominas de principio a fin. De todos modos, ejecutarás tus propias evals, porque Liquid AI no publicó ninguna.

Si tienes una carga de trabajo de agentes alojados cuya factura está dominada por tokens de razonamiento, Ember-1 aborda un término real de tu ecuación de costos, y vale la pena dedicarle esas dos semanas. La prueba correcta es el tráfico en la sombra contra tu proveedor actual: envía una parte de las solicitudes reales a ambos, compara las salidas y deja sin tocar los resultados en vivo. Ese es también el consejo que dio la cobertura crítica independiente del lanzamiento, junto con una advertencia justa: comprimir la deliberación corre el riesgo de perder un paso que el modelo necesitaba y, en un agente, eso se manifiesta más tarde como una llamada a herramienta incorrecta en lugar de una frase incorrecta.

Ninguno de los modelos está en OrcaRouter. Si quieres probar el patrón en lugar de estos dos artefactos —un modelo pequeño ajustable y un razonador alojado grande en un mismo pipeline—, eso es exactamente para lo que sirve el DSL de enrutamiento: componer varios modelos en una sola llamada y dejar que cada uno se encargue de la parte en la que es bueno, detrás de una sola clave y una sola factura. La comparación aquí vale la pena hacerla a nivel de arquitectura incluso aunque ambos endpoints específicos sigan fuera de alcance.

El intercambio, declarado una vez

Ember-1 vende certeza de comportamiento e incertidumbre de disponibilidad: un modelo cuya calidad se argumenta con cuidado y cuya disponibilidad es explícitamente condicional. LFM2.5 2.6B Base vende certeza de disponibilidad e incertidumbre de comportamiento: un archivo que siempre tendrás y cuya competencia es enteramente función del entrenamiento que le dediques. Los equipos con un problema de servicio y sin capacidad de entrenamiento deberían seguir la vista previa y esperar que se vuelva permanente. Los equipos con capacidad de entrenamiento y una tarea acotada deberían descargar la base y dejar de esperar la hoja de ruta de otros.

A screenshot of OrcaRouter's model page for Kimi K3, showing the MoonshotAI Kimi K3 listing priced at $3.00 per 1M input tokens and $15.00 per 1M output tokens, a p50 time-to-first-token of 8.00s, 749.2M tokens of traffic over seven days, a 1M-token context window and a Python snippet calling api.orcarouter.ai/v1.

Lo que realmente muestra el emparejamiento es que la "eficiencia" ha dejado de significar una sola cosa. Para Ember-1 significa menos tokens con la misma calidad en hardware ajeno. Para LFM2.5 2.6B Base significa un modelo lo bastante pequeño como para que el hardware deje de ser ajeno por completo. Ambas son buenas respuestas y no son intercambiables.