Una tarjeta de título generada que dice 'FrogNano-4B-2609 vs LFM2.5 2.6B Base' con el subtítulo 'un agente 4B terminado frente a un checkpoint preentrenado de 2.69B', tres chips que dicen 'post-entrenamiento por RL terminado', 'solo preentrenamiento, 2.69B denso en 30 capas' y 'sin ajuste por instrucciones', un pie de página que dice 'Ambas columnas reportadas por el proveedor; ningún tercero ha evaluado ninguno de los modelos', y el logotipo de OrcaRouter compuesto en la esquina inferior derecha.
Engineering & Research

FrogNano-4B-2609 vs LFM2.5 2.6B Base: un especialista terminado y una bolsa de pesos preentrenados

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Escribe una pregunta en LFM2.5 2.6B Base y continuará tu frase en lugar de responderla. Eso no es un defecto — Liquid AI lo publicó como el checkpoint preentrenado que subyace a la familia LFM2.5, con el ajuste de instrucciones deliberadamente reservado a su hermano no-Base, y la ficha dice claramente que está pensado para un ajuste fino intensivo. FrogNano-4B-2609 de Microsoft es lo que se ve en el otro extremo de ese pipeline: el mismo tipo de modelo de lenguaje pequeño, sometido a cinco iteraciones de aprendizaje por refuerzo en tareas sintéticas de repositorio hasta que emite llamadas a herramientas estructuradas y parches candidatos mediante un arnés de cinco herramientas. Ninguno de los dos tiene un benchmark independiente publicado. La diferencia es que uno de ellos ya ha completado su postentrenamiento, y saber cuál es toda la decisión.

Las cifras de FrogNano a continuación provienen de la tarjeta de modelo y el informe técnico de Microsoft. Las cifras de LFM provienen de la tarjeta de Liquid AI, su configuración de arquitectura y su archivo de licencia. Todos los números atribuidos a cualquiera de los proveedores están etiquetados como reportados por el proveedor, y ninguno de estos modelos ha pasado por la evaluación de un tercero —para LFM2.5 2.6B Base, eso es en gran medida por diseño, ya que un checkpoint sin ajuste por instrucciones no es un objetivo justo para un benchmark de chat.

La comparación solo funciona si sabes qué estás comparando.

Pon las dos fichas técnicas una al lado de la otra y lo primero que sale mal es el recuento de parámetros. LFM2.5 2.6B Base tiene 2,69 mil millones de parámetros densos en 30 capas — 22 bloques de convolución corta con doble compuerta y 8 capas de atención de consultas agrupadas, entrenado con aproximadamente 34 billones de tokens en 16 idiomas, con un vocabulario de 128.000 tokens y un contexto de 131.072 tokens. Su versión cuantizada ocupa alrededor de 1,67 GB en Q4_K_M.

La ficha de FrogNano-4B-2609 indica que su campo de parámetros corresponde al rango «500M-5B», y el resumen del modelo lo describe como aproximadamente 4,66 mil millones. La descarga zanja el debate: dos fragmentos safetensors que suman 9,32 GB de pesos BF16, 738 tensores, sobre una pila heredada, densa e híbrida de 32 capas de Gated DeltaNet y atención con compuertas. En el checkpoint hay una torre de visión de 24 capas que nunca fue post-entrenada.

Así que la proporción de tamaño es de aproximadamente 1,7 a uno, y la proporción de memoria se acerca más a 5,6 a uno en cuanto la cuantización entra en juego. Esa diferencia importa más que la línea de parámetros, porque ambos modelos son candidatos para autoalojamiento en lugar de endpoints, que es la única razón por la que pertenecen al mismo artículo.

• Uso previsto — LFM2.5 2.6B Base es materia prima para una ejecución de ajuste fino. FrogNano-4B-2609 es una política terminada para ingeniería de software a nivel de repositorio dentro del Leaf harness.

Seguimiento de instrucciones — LFM2.5 2.6B Base no incorpora esta capacidad de serie; la ficha de Liquid AI lo recomienda para tareas que requieren un ajuste fino intensivo. FrogNano-4B-2609 sigue una descripción de tarea y emite llamadas a herramientas estructuradas, porque eso es exactamente lo que entrenó su objetivo de RL.

• Contexto: 131.072 tokens para LFM2.5 2.6B Base, frente a aproximadamente 131K tokens combinados para la configuración evaluada de FrogNano. Nominalmente idénticos, pero la ventana de FrogNano tiene que albergar resultados de herramientas, salida de shell y registros de pruebas, no solo un prompt.

• Límite de salida — la configuración validada de FrogNano permite 8.192 tokens generados por turno del asistente. LFM2.5 2.6B Base no publica un equivalente, ya que no está diseñado para finalizar una respuesta.

• Modalidad — ambos son solo texto. Los componentes de visión de FrogNano son heredados y no son compatibles de forma explícita; LFM2.5 2.6B Base es de entrada y salida de texto por construcción.

• Licencia — LFM2.5 2.6B Base se rige por la LFM Open License v1.0, que es gratuita por debajo de los $10M de ingresos anuales y requiere una licencia aparte al alcanzar o superar ese umbral, con las obras derivadas heredando dicho tope. La ficha de FrogNano indica MIT en sus preliminares y Apache 2.0 en su cuerpo.

Lo que Microsoft pagó, y lo que tú mismo tendrías que pagar

Esta es la sección que soporta la carga, porque es aquella en la que una comparación de especificaciones induce a error.

Todo el valor añadido de FrogNano-4B-2609 es el post-entrenamiento, y Microsoft ha publicado el método. Parte de Qwen3.5-4B, que obtuvo un 39,4 % en SWE-bench Verified a través del harness Leaf como modelo general. Genera tareas candidatas de repositorio a partir de instantáneas reales, ejecuta rollouts desde el checkpoint actual para encontrar tareas que a veces resuelve, conserva esas, entrena y repite —cinco iteraciones, aproximadamente 1.500 entornos sintéticos validados en total, y sin destilación de un modelo más grande en ningún momento. El resultado en la propia tarjeta de Microsoft es 61,5 % en SWE-bench Verified, 37,6 % en SWE-bench Pro, 31,1 % en Terminal-Bench 2.0 y 47,3 % en PatchEval-Verified. El apéndice de eficiencia del artículo reporta la misma subida como 48,2 %, 53,4 %, 58,3 %, 58,6 % y 61,6 % a lo largo de las iteraciones, lo que es un recordatorio útil de que ni siquiera las dos tablas del mismo experimento del propio laboratorio coinciden en los escalones.

Ahora contrasta eso con LFM2.5 2.6B Base. Es el checkpoint previo a que comience ese trabajo. La recomendación de su propia ficha —ajustarlo— es precisamente la labor que documenta FrogNano: un entorno de tareas, una recompensa ejecutable, un arnés de servicio más prolongado y varias iteraciones de entrenamiento contra una política en movimiento. El artículo no afirma que eso sea fácil. Informa que los checkpoints intermedios se volvieron progresivamente más costosos de entrenar a medida que se alargaban las trazas de razonamiento, que hubo que añadir una penalización por longitud de registro para detener la deriva, y que las iteraciones posteriores perdieron la capacidad de llamada paralela a herramientas que tenía el modelo base, terminando en una tasa de llamadas concurrentes del 1,71 %. Cualquiera que planee ejecutar la receta de FrogNano sobre una base 2.6B diferente debería presupuestar específicamente esos tres problemas.

Lo que LFM2.5 2.6B Base ofrece es un tipo distinto de ventaja inicial: un presupuesto de preentrenamiento de 34 billones de tokens, una arquitectura híbrida documentada, una versión cuantizada ya existente y un contexto documentado de 131.072 tokens, todo con un tamaño que se ejecuta en hardware donde no cabría un checkpoint BF16 de 9,32 GB. Si tu tarea es lo bastante acotada como para que un ajuste fino pequeño supere a un modelo general, esa es una posición real, y si no lo es, te habrás ahorrado una ejecución de entrenamiento.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs LFM2.5 2.6B Base'. The left column reads State RL post-training complete, Params approx 4.66B with the card saying 500M-5B, Weights 9.32 GB BF16, Context about 131K evaluated, Licence MIT in front matter and Apache 2.0 in body, Independent scores none. The right column reads State pretrained checkpoint only, Params 2.69B dense, Weights 1.67 GB in Q4_K_M, Context 131,072 tokens, Licence LFM Open License v1.0, Independent scores none. A footer reads 'Both columns vendor-reported; no third party has scored either model.'

Lo que tienes que construir en cualquier caso

Ninguna de estas es una llamada de red, y eso determina la comparación práctica más que cualquier fila de especificaciones.

LFM2.5 2.6B Base quiere un entorno de ejecución de inferencia y una ejecución de entrenamiento. La tarjeta de Liquid AI enumera compilaciones en formato nativo, GGUF, ONNX y MLX, así que la parte de servicio está bien cubierta — llama.cpp en un portátil es una opción real para el checkpoint cuantizado. La parte de entrenamiento es cosa tuya: datos, objetivo, evaluación y una forma de saber si el resultado mejoró o simplemente cambió.

FrogNano-4B-2609 quiere un endpoint compatible con OpenAI con los parsers adecuados y un clúster de Kubernetes con permiso para gestionar pods y políticas de red. El README de Microsoft es inusualmente directo al afirmar que el arnés es una dependencia y no una comodidad, y la ficha indica que puntuaciones idénticas requieren que coincidan el checkpoint, el tokenizer, la configuración de servicio, las imágenes de tareas y el protocolo de evaluación. La configuración no es un detalle aquí — sírvelo sin un parser de razonamiento de Qwen3 y sin un parser de llamadas a herramientas de Qwen3 coder, y el modelo escribirá prosa donde el arnés espera una llamada a herramienta.

Esa es la forma de este enfrentamiento: por un lado, un proyecto de entrenamiento con un pequeño problema de servicio; por el otro, un proyecto de servicio con un gran problema de evaluación y sin nada de entrenamiento pendiente. Ambos son un par de tardes de trabajo. Solo uno de ellos es un trabajo de tardes que puede terminar en «el modelo no es lo bastante bueno» sin que sea culpa tuya.

A screenshot of the Hugging Face model card for microsoft/FrogNano-4B-2609 showing the model summary table with the Parameters row reading 500M-5B, the Context length row reading approximately 131K tokens in the evaluated coding-agent configuration, the Training Dates row reading Jun 2026 to Aug 2026, the Release date row reading 22-SEP-2026, the License row reading Apache License 2.0, the Qwen/Qwen3.5-4B model dependency, and the model overview naming the dense 32-layer hybrid Gated DeltaNet and gated-attention architecture.

Donde un router se gana su lugar en una configuración como esta

Estos dos modelos terminan dentro de un pipeline que también llama a algo alojado. El propio banco de evaluación de FrogNano es la prueba: el arnés Leaf se comunica con un endpoint compatible con OpenAI, lo que significa que se llega al modelo bajo prueba y a cualquier modelo con el que lo compares a través de la misma interfaz. Ese es un patrón que vale la pena copiar incluso cuando el motivo es solo la higiene, y es ahí donde un único endpoint hace algo concreto.

OrcaRouter ofrece más de 200 modelos detrás de una única clave compatible con OpenAI con un 0 % de recargo, así que los precios de lista de los proveedores se transmiten sin cambios y un cambio de precio de un proveedor se refleja en nuestro lado ese mismo día, que es la cifra que realmente cambia cuando decides si un especialista autoalojado supera a un general alojado en coste por tarea. La conmutación por error automática cubre la mitad alojada de esa comparación, no la que sirves tú mismo. No alojamos FrogNano-4B-2609 ni LFM2.5 2B Base; ambos son descargas. Lo que elimina una capa de enrutamiento es la segunda integración cada vez que cambia el lado alojado de tu stack.

Eligiendo uno, sinceramente

Elige LFM2.5 2.6B Base si tu tarea es acotada, tu hardware es pequeño y estás dispuesto a asumir tú mismo el entrenamiento: la licencia es gratuita por debajo de $10M en ingresos, la versión cuantizada es de 1.67 GB, y la propia ficha de Liquid AI lo recomienda exactamente para esto. La contrapartida es que obtienes un punto de partida, no una capacidad: nada en el lanzamiento te dice qué puntuaría una ejecución de RL con forma de FrogNano sobre él, y nadie ha publicado ninguna.

Elige FrogNano-4B-2609 si la tarea es ingeniería de software a nivel de repositorio y quieres que el post-entrenamiento ya esté hecho. Los 61,5 %, 37,6 %, 31,1 % y 47,3 % son resultados genuinos publicados por un laboratorio que describió su método en detalle —y también son, en este momento, un bucle cerrado: mismo laboratorio, mismo arnés de evaluación, misma línea base del modelo base. La descarga de 9,32 GB, la dependencia del arnés de evaluación y el licenciamiento compuesto son el precio de saltarte un proyecto de entrenamiento que, de otro modo, tendrías que ejecutar.

A generated pipeline card headed 'The same pipeline, two positions' showing three stages connected by arrows: 'Pretrained checkpoint' captioned LFM2.5 2.6B Base, 'RL on synthetic tasks, 5 iterations' captioned Microsoft's loop, and 'Finished agent' captioned FrogNano-4B-2609, with a footer reading 'Neither model has been independently evaluated; both appear as vendor-reported figures only.'

La reformulación útil es que no son competidores. LFM2.5 2.6B Base está aguas arriba de un proceso que produjo algo como FrogNano-4B-2609. Si te encuentras eligiendo entre ellos, la verdadera pregunta es si tu problema merece que te hagas cargo de una corrida de entrenamiento, y si la respuesta es no, el checkpoint de 4B con el arnés, el método publicado y la escalera de SWE-bench reportada por el proveedor es el que llega ya terminado.