Una tarjeta de título generada que dice 'FrogNano-4B-2609' con el subtítulo 'un agente de programación de 4B sobre la base Qwen3.5-4B', tres chips que dicen '59.6B bytes de pesos', 'la tarjeta dice 22-SEP-2026' y 'sin publicación de lanzamiento', un pie de página que dice 'Cifras según la tarjeta de modelo y el informe técnico de Microsoft; nada de esto se reproduce de forma independiente', y el logotipo de OrcaRouter compuesto en la esquina inferior derecha.
Engineering & Research

FrogNano-4B-2609: Microsoft lanzó un agente de programación de 4B en Hugging Face y nunca lo anunció

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El repositorio apareció el 17 de septiembre de 2026 con el commit inicial, y el propio checkpoint llegó cuatro minutos después. Luego, nada. Ni un tuit de Microsoft AI, ni una entrada en el blog de Microsoft Research, ni una página de lanzamiento. Siete semanas más tarde, microsoft/FrogNano-4B-2609 —un agente de programación de clase cuatro mil millones construido sobre Qwen3.5-4B — sigue sin tener ningún anuncio detrás, y ese silencio es el hecho más importante acerca de la publicación de este modelo. Lo que sí tiene es una ficha de modelo que afirma la existencia de un artículo y un harness, un repositorio de GitHub que resulta ser el harness y no el artículo, y un createdAt del 17 de septiembre bajo una ficha que dice "Fecha de lanzamiento 22-SEP-2026". Ambas fechas son improvisadas; ninguna es incorrecta; se contradicen entre sí.

¿Qué se publica realmente?

Todo lo que aparece a continuación se puede comprobar en el hub ahora mismo, y cada cifra de este artículo procede de la propia ficha de Microsoft o de los recuentos de bytes del propio repositorio. Nada ha sido reproducido por terceros: no hay ninguna entrada de Artificial Analysis, ninguna puntuación de arena y ninguna evaluación independiente de FrogNano en ningún sitio.

• Pesos — un repositorio público bajo la organización Microsoft, sin restricciones, etiquetado como MIT en el hub, 15 archivos, sin puerta de descarga y sin acuerdo que firmar.

• Pesos activados — 9,32 GB en dos fragmentos de safetensors, 59,6 mil millones de bytes de datos del repositorio, incluyendo el conjunto ory-free, 738 tensores en el índice.

• Arquitectura — Qwen3_5ForConditionalGeneration, la pila híbrida densa de 32 capas heredada de Qwen3.5-4B, con una torre de visión de 24 capas que, según la ficha, se heredó y nunca se post-entrenó.

• El propio campo de parámetros de la tarjeta — "500M-5B". Eso es una banda, no un número, y la descarga es el documento más preciso.

• Licencia — los datos preliminares de la tarjeta indican MIT. El cuerpo de la propia tarjeta indica Apache License 2.0, y el harness de GitHub realmente incluye un archivo LICENSE de MIT. Esas dos afirmaciones se refieren a artefactos distintos dentro de la misma versión.

• Anuncio — ninguno. Ni en el blog de Microsoft Research, ni en el sitio de investigación del propio equipo, ni en el feed de la organización de Hugging Face, salvo como un listado de repositorios.

Esa última línea es la que debería fijar la postura del lector para el resto de este texto. Un checkpoint subido en silencio no es un artefacto inferior a uno anunciado —su tarjeta suele ser más larga, porque nadie la está recortando para un comunicado de prensa—. Pero no ha pasado por el único filtro que un lanzamiento anunciado recibe gratis: que otras personas lo miren.

A screenshot of Microsoft's Hugging Face model card for FrogNano-4B-2609 showing the model summary table with rows for Developer (Microsoft Corporation), Description, Model architecture, Parameters (500M-5B), Inputs, Outputs, Context length (approximately 131K tokens in the evaluated coding-agent configuration), Training Dates (Jun 2026 to Aug 2026), Release date (22-SEP-2026), License (Apache License 2.0), the Qwen/Qwen3.5-4B model dependency, the 'Technical report;' and 'Leaf harness.' asset links, and the section 1 Model overview naming Qwen3.5-4B and the dense 32-layer hybrid Gated DeltaNet and gated-attention architecture.

Las puntuaciones, y quién produjo cada una de ellas.

Microsoft informa que FrogNano alcanza el 61.5% en SWE-bench Verified, el 37.6% en SWE-bench Pro, el 31.1% en Terminal-Bench 2.0 y el 47.3% en PatchEval-Verified, todo ello como tasas de resolución Avg@3 medidas a través del harness Leaf. La misma ficha proporciona el punto de partida: Qwen3.5-4B obtuvo un 39.4% en SWE-bench Verified bajo el mismo harness y presupuesto. Cinco iteraciones de aprendizaje por refuerzo lo llevaron a través de 49.1%, 53.1%, 56.7%, 59.1% y 61.5% — 22.1 puntos por encima del modelo base, lo que el propio enfoque de Microsoft redondea a una mejora relativa de alrededor del 56%.

Hay dos cosas en esa escalera en las que vale la pena detenerse, porque son puntos donde un resumen puede equivocarse, más que puntos donde el proveedor se equivocó.

La primera es la discrepancia de Iter 5. La tabla principal de la tarjeta dice 61.5% para la iteración final; el propio apéndice de eficiencia del artículo reporta la misma progresión de cinco puntos de control como 48.2%, 53.4%, 58.3%, 58.6% y 61.6%. Solo el último número está cerca, y solo el último número es el que todo el mundo cita. Trata la cifra final como el resultado estable y los peldaños intermedios como medidas de cosas diferentes, porque bajo una agregación distinta, claramente lo son.

El segundo es que FrogNano no es uniformemente mejor que el modelo del que partió en todos los ejes. Su tasa publicada de llamadas paralelas a herramientas es del 1,71 %. La ficha reconoce con franqueza que las iteraciones posteriores perdieron la capacidad de realizar varias llamadas a herramientas en un solo turno, y que el trabajo de consolidación del equipo existe en parte para recuperarla. Un modelo que resuelve más problemas mientras apenas emite llamadas concurrentes es una verdadera disyuntiva de ingeniería, no una nota al pie.

A generated two-column scoreboard reading 'Microsoft reports' on the left with rows Qwen3.5-4B base 39.4%, Iter 2 49.1%, Iter 4 59.1% and Iter 5 61.5%, and 'What is not verified' on the right with rows Independent evaluation: none, Parallel tool calls: 1.71%, Repository size: 59.6B bytes, Card release date: 22-SEP-2026 and Hub created: 17-SEP-2026, with a footer reading 'All scores vendor-reported through the Leaf harness; no third party has reproduced any of them.'

El arnés es el producto, y el repositorio es el arnés.

FrogNano no se ejecuta por sí solo. Emite llamadas estructuradas a cinco herramientas: Read, Write, Edit, Glob y Bash, y algo tiene que ejecutarlas en un entorno aislado y devolver la salida. Ese algo es Leaf, y aquí el rastro hace algo un tanto inusual.

La fila "recursos relacionados adicionales" de la ficha del modelo enlaza un informe técnico en aka.ms/frognano-tech-report y un arnés en github.com/microsoft/FrogNano. El enlace de aka.ms no apunta a un PDF; redirige directamente a la página de resumen de arXiv, que es donde se encuentra el informe real. El repositorio de GitHub, por su parte, no contiene código de entrenamiento, ni receta de RL ni checkpoints. Su propio README describe un arnés de evaluación que ejecuta agentes de programación en sandboxes de Kubernetes contra un endpoint compatible con OpenAI, y remite de vuelta al artículo de arXiv para la historia de entrenamiento. Así que los dos enlaces de recursos de la ficha son un puntero al artículo y un puntero a la respuesta del artículo, y el nombre es compartido.

Esto es importante para cualquiera que planee usar el modelo, por una razón práctica. La receta de servicio documentada es SGLang con --reasoning-parser qwen3 y --tool-call-parser qwen3_coder, y el entorno de pruebas quiere un endpoint que ya soporte llamadas a herramientas y razonamiento. Basta con equivocarse un poco en la configuración de parseo y el modelo produce texto donde el entorno de pruebas espera JSON, lo que, visto desde fuera, parece exactamente un modelo malo en lugar de una configuración mala. La tarjeta es explícita: cualquier puntuación coincidente requiere que coincidan el checkpoint, el tokenizador, la configuración de servicio, las imágenes de tarea y el protocolo de evaluación; eso es el proveedor diciéndote que el entorno de pruebas es la mitad del resultado.

También vale la pena decir claramente, para cualquiera que esté dimensionando hardware: un checkpoint de 9,32 GB en el contexto evaluado de la ficha no es un problema de inferencia de 9,32 GB. Las evaluaciones se ejecutaron con aproximadamente 131K tokens combinados y un presupuesto de 150 pasos. La memoria escala con el contexto, no con los pesos, y la ficha dice que la configuración mínima de GPU todavía "debe validarse antes del lanzamiento" — una frase que aparece en un modelo que ya se puede descargar.

Lo que el entrenamiento realmente hizo, en un párrafo

La contribución del artículo no es el modelo, sino el bucle. TaskPilot genera tareas candidatas de ingeniería de software a partir de instantáneas reales de repositorios, ejecuta rollouts desde el checkpoint actual contra ellas, conserva las que están cerca del límite de lo que la política a veces puede resolver y descarta los candidatos que son permanentemente triviales o permanentemente imposibles. El conjunto aceptado entrena el siguiente checkpoint. Ese siguiente checkpoint calibra entonces la siguiente ronda de generación de tareas, de modo que la distribución de tareas se mueve a medida que se mueve la política. En total, aproximadamente 1.500 entornos validados. Sin destilación: la tarjeta afirma directamente que el post-entrenamiento específico para agentes no utilizó trayectorias de solución, acciones, trazas de razonamiento ni objetivos de parche provenientes de modelos más fuertes. Los modelos más fuertes escriben tareas; no demuestran respuestas.

Microsoft ejecutó ese bucle durante cinco iteraciones y reporta una ganancia de 8,7 puntos antes de cualquier consolidación, con una penalización por longitud del registro añadida a mitad de la ejecución porque las trazas de razonamiento crecían más rápido de lo que mejoraban.

La tarjeta del modelo es inusualmente directa sobre dónde es frágil todo el enfoque. Los datos de entrenamiento son predominantemente Python y principalmente en inglés; el conjunto de lenguajes naturales admitidos que declara la tarjeta es únicamente el inglés y ningún otro, y no se reivindica explícitamente la cobertura multilingüe más amplia del modelo base. El rendimiento es sensible al arnés y a la calidad de las pruebas. Los parches generados «pueden ser incorrectos o inseguros a pesar de superar las pruebas disponibles». La tarjeta del modelo del 4B cierra ese párrafo con la frase que todo lector debería llevarse consigo: no debe utilizarse sin la revisión de personas cualificadas y sin pruebas independientes de regresión y de seguridad. Es una declaración de un proveedor sobre un producto suyo, y es una frase más útil que cualquiera de las filas de la tabla de puntuaciones que aparecen más arriba.

En qué situación deja esto a un comprador y dónde encaja un router

FrogNano no es un modelo al que se llame. No hay una API propia, ni un endpoint alojado, ni una imagen serverless. Es un checkpoint, y usarlo significa o bien levantar tu propio despliegue de SGLang detrás de un sandbox alojado en Kubernetes, o bien evaluarlo como componente dentro de un stack de agentes que ya operas. Esa es toda la ruta de adopción hoy, y ningún anuncio habría cambiado su forma.

Lo que una capa de enrutamiento puede hacer honestamente aquí es algo más limitado de lo que parece a primera vista. Si el plan es comparar un FrogNano autoalojado con un modelo de codificación alojado dentro de tu propio arnés, la mitad alojada es la que se beneficia de estar detrás de una sola clave en lugar de un segundo contrato: OrcaRouter ofrece más de 200 modelos detrás de un único endpoint compatible con OpenAI con un 0 % de recargo, lo que significa que los precios de lista de los proveedores se trasladan sin cambios y un cambio de precio de un proveedor se aplica de nuestro lado el mismo día. Eso importa para una comparativa cuyo resultado se decide por el coste por problema resuelto en lugar de por una sola cifra de benchmark. No alojamos FrogNano y no hay fecha para ello; los pesos y el trabajo de servido son tuyos.

A generated timeline card headed 'One model, three dates' with three markers: 17 September 2026 labelled 'Hugging Face creation timestamp', 22 September 2026 labelled 'Release date printed on the model card', and 2 October 2026 labelled 'Most recent file update', with a footer reading 'No announcement accompanied any of the three. Dates read from the Hugging Face repository history on 3 October 2026.'

Las tres cosas que lo resolverían

Primero, una reproducción independiente. Todas las cifras de este artículo —61.5, 37.6, 31.1, 47.3— fueron producidas por el laboratorio que entrenó el modelo, con un arnés que mantiene ese mismo laboratorio, frente a una cifra del modelo base que ese mismo laboratorio midió. Eso es una imagen completa e internamente coherente, y también es un bucle cerrado. La prueba útil es si alguien sin nada en juego reproduce el salto de 39.4 a 61.5 en las mismas 500 tareas sin el trabajo de calibración de Microsoft sobre el conjunto de tareas.

En segundo lugar, alguien tiene que verificar de principio a fin la afirmación sobre el arnés. El repositorio es público, lo cual es más de lo que logran muchos lanzamientos, pero es la infraestructura de evaluación. Si las cinco herramientas y el aislamiento del sandbox son realmente el mecanismo de rendimiento, un tercero que ejecute la configuración publicada debería situarse cerca de las cifras publicadas. Si no lo hacen, la discrepancia es el verdadero hallazgo.

Tercero, y lo más barato de responder: Microsoft debería decir si esto es un producto o un artefacto de publicación. La sección de distribución de la tarjeta trata los pesos, la tarjeta y el arnés como el entregable, lo cual se lee como una publicación en lugar de un lanzamiento. «Fecha de lanzamiento 22-SEP-2026» se lee como un lanzamiento. Un modelo anunciado habría resuelto esa ambigüedad en la primera frase de una entrada de blog, y no hay ninguna entrada de blog.

Hasta entonces, la postura correcta es la que el propio lanzamiento implica. FrogNano-4B-2609 es un checkpoint real, descargable, con licencia MIT y Apache y quizá no, con una tarjeta inusualmente exhaustiva, un arnés de evaluación público, una idea metodológica genuina y una tabla de clasificación que nunca ha sido tocada por nadie sin una dirección de Microsoft. Para un laboratorio, eso es un artefacto completo e interesante. Para un equipo a punto de poner un agente frente a un repositorio a las tres de la mañana, es una pista que vale la pena seguir y todavía no una decisión que valga la pena tomar.