Una tarjeta de título generada que dice 'FrogNano-4B-2609 vs Qwen 3.8' con el subtítulo 'un agente de 4B en tu propia GPU frente a un flagship alojado de 2.4T', tres chips que dicen 'descarga de 9.32 GB', '$2 de entrada / $6 de salida por millón' y 'hasta 150 pasos por tarea', un pie de página que dice 'Cifras de FrogNano según Microsoft; precios de Qwen3.8-Max según Alibaba. Nada de esto es independiente', y el logotipo de OrcaRouter compuesto en la esquina inferior derecha.
Guides & Insights

FrogNano-4B-2609 vs Qwen 3.8: Cuánto cuesta un agente de programación cuando los pesos son tuyos

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

microsoft/FrogNano-4B-2609 es un agente de repositorio de la clase de cuatro mil millones derivado de Qwen3.5-4B que descargas y sirves tú mismo. Qwen3.8-Max es el buque insignia alojado: un modelo disperso de mezcla de expertos de 2,4 billones de parámetros con aproximadamente 95 mil millones de parámetros activos por token, una ventana multimodal de un millón de tokens y una tarifa de 2,00 $ por millón de tokens de entrada y 6,00 $ por millón de tokens de salida, accesible con una clave de API desde el 3 de agosto de 2026. Uno de ellos cuesta una GPU y una tarde. El otro no cuesta nada hasta que lo usas, y luego cobra por token en las trayectorias más largas de uso común. Ese intercambio, y no la tabla de benchmarks, es el verdadero enfrentamiento.

Las cifras de FrogNano que aparecen aquí provienen de la tarjeta de modelo y el informe técnico de Microsoft; las cifras de Qwen3.8-Max provienen de los precios publicados por Alibaba y del registro del modelo en nuestro propio catálogo, con las puntuaciones independientes etiquetadas como cifras de Artificial Analysis dondequiera que aparezcan. Fíjese bien en la denominación: Qwen3.8, la versión de pesos abiertos, se ha anunciado pero no se ha lanzado, mientras que Qwen3.8-Max ya está disponible y tiene precio hoy. Todo lo que puede invocarse en este artículo es este último.

La aritmética que decide la comparación

Empieza por lo que cuesta una sola tarea, porque no es obvio y no es poco.

Las evaluaciones de FrogNano ejecutaron cada trayectoria con un presupuesto de 150 pasos dentro de aproximadamente 131K tokens combinados, con hasta 8.192 tokens generados por turno del asistente y un límite de 10.800 segundos. Multiplica los dos límites publicados y obtienes un techo de aproximadamente 1,23 millones de tokens generados para una trayectoria en el peor caso —lo que, a 6,00 $ por millón de tokens de salida de Qwen3.8-Max, supone aproximadamente 7,38 $ por una sola tarea que llegó hasta el final de su presupuesto. Eso es aritmética sobre dos números publicados, no una medición: las trayectorias reales se detienen antes, el promedio está muy por debajo del techo, y los resultados de herramientas y la salida de shell se facturan a la tarifa de entrada más económica en lugar de a la tarifa de salida. Pero establece la forma de la cosa. Un agente de programación no gasta unos cientos de tokens en una pregunta; gasta una conversación larga y cargada de razonamiento consigo mismo, y cada token de esa conversación se genera.

Ahora pon el otro lado del balance junto a él. FrogNano-4B-2609 son 9.32 GB de pesos BF16 en dos fragmentos, descargables sin control de acceso. Para servirlo se necesita SGLang con un analizador de razonamiento Qwen3 y un analizador de llamadas a herramientas de Qwen3 coder, además de un sandbox aislado para las cinco herramientas. A partir de ahí, el coste marginal de una trayectoria es la electricidad, y la memoria que ocupa es la que llegue a alcanzar tu contexto, en lugar de lo que pesan los pesos.

• Modelo de costos — FrogNano-4B-2609 tiene un costo de hardware fijo y un costo marginal casi nulo. Qwen3.8-Max tiene costo fijo cero y facturación por token, con un reparto de $2.00 / $6.00 que no carga nada al principio y lo carga todo al final a la tarifa de salida.

• Lo que compra el dinero — un agente de clase 4B en tu propio silicio, frente a un modelo de escala de frontera para el que nunca tienes que planificar la capacidad.

• Punto de equilibrio — se alcanza cuando tu volumen mensual de trayectorias multiplicado por la factura media de tokens por trayectoria supera el coste de la GPU que, de otro modo, alquilarías. Para un equipo que ejecuta un puñado de tareas de repositorio al día, esa línea queda muy lejos y el modelo alojado gana solo por comodidad.

Dos modelos que no hacen el mismo trabajo.

La comparación de costos solo es justa si los resultados son comparables, y aquí no lo son, que es la parte que la mayoría de las fichas técnicas entierra.

FrogNano-4B-2609 se post-entrenó exclusivamente en ingeniería de software a nivel de repositorio. Toda su interfaz es un bucle de cinco herramientas — Read, Write, Edit, Glob y Bash — ejecutado por el harness Leaf en un sandbox aislado, iterando hasta que el modelo deja de invocarlas. La ficha de Microsoft indica que su idioma compatible es el inglés y que su dominio de programación validado es Python, y afirma sin rodeos que los componentes de imagen y vídeo del checkpoint nunca se post-entrenaron y no son compatibles. No razona sobre tu arquitectura, no responde preguntas sobre tu negocio ni lee una captura de pantalla.

Qwen3.8-Max es un modelo general. La ficha de catálogo de Alibaba le asigna entrada de texto, imagen y vídeo con salida de texto y una ventana de contexto de 1.000.000 de tokens. Razona, escribe, lee documentos y mantiene una conversación, y su llamada a funciones es una característica de un modelo general más que el objetivo entero del checkpoint. Sus cifras de Artificial Analysis, leídas de la ficha el 2 de septiembre de 2026, son un Índice de Inteligencia de 45,4 y un Índice de Codificación de 76,2.

• Entrada — FrogNano-4B-2609 es solo texto. Qwen3.8-Max acepta texto, imágenes y vídeo.

Contexto: aproximadamente 131 000 tokens combinados para la configuración evaluada de FrogNano, frente a 1 000 000 para Qwen3.8-Max. Eso es un factor de siete y medio, y es más importante precisamente para las entradas del tamaño de un repositorio que recibe un agente de programación.

• Salida por turno — la configuración validada de FrogNano limita un único turno del asistente a 8192 tokens. Qwen3.8-Max no publica un límite equivalente por respuesta.

• Formato de salida — FrogNano emite llamadas a herramientas de Leaf estructuradas y necesita un entorno de ejecución para ejecutarlas. Qwen3.8-Max devuelve prosa o una llamada a función al cliente que ya tengas.

{{1}}Puntuaciones independientes de FrogNano-4B{{/1}} solamente; las {{2}}cifras de Qwen3.8-Mini de arriba son de terceros{{/2}}, de Artificial Analysis.

• Parámetros — aproximadamente 4,66B para FrogNano según la descripción de su propia ficha, frente a 2,4 billones en total y unos 95B activos para Qwen3.8-Max.

A screenshot of the OrcaRouter model page for Qwen3.8 Max showing the breadcrumb Home, Models, Qwen; the model name and the qwen/qwen3.8-max model id; the FEATURED badge with Vision, Tools, JSON and Reasoning capability chips; the 1M-token context, text, image and video input and text output row; the $2.00 and $6.00 per-million price cards with the p50 TTFT figure; the byline 'by Qwen, 2026-08-03'; the on-page section list for Code samples, Pricing, Performance, Public benchmarks, Community buzz, How it compares and FAQ; and the opening of the long description describing Qwen3.8-Max as Alibaba's newest flagship.

Donde el 4B realmente se gana su lugar

Hay un eje en el que un agente de 4B supera sin más a un modelo de frontera, y no es la precisión.

El artículo de FrogNano parte de Qwen3.5-4B, que obtuvo un 39,4 % en SWE-bench Verified a través del arnés Leaf como un modelo general sin más. Cinco iteraciones de aprendizaje por refuerzo sobre aproximadamente 1.500 tareas sintéticas lo llevaron al 61,5 %, y el apéndice del mismo artículo reporta la progresión por iteración como 48,2 %, 53,4 %, 58,3 %, 58,6 % y 61,6 %. El método —generar tareas calibradas a la frontera de aprendibilidad de la política actual, sin destilación de un modelo más fuerte— es la contribución, y la razón por la que un grupo de investigación sin presupuesto para modelos de frontera se interesaría.

Lee lo que eso implica para la comparación. La ficha de Microsoft es sincera al señalar que FrogNano no es uniformemente mejor que el modelo del que proviene: su tasa de llamadas paralelas a herramientas es del 1,71 %, porque las iteraciones posteriores perdieron la capacidad de realizar llamadas concurrentes, y el equipo añadió una etapa de consolidación para intentar recuperarla. Un modelo que resuelve más problemas mientras empeora en un comportamiento específico es un artefacto de ingeniería real con costuras visibles, y su ficha lo dice en lugar de ocultarlo.

Y el número de SWE-bench es un circuito cerrado. La línea base del modelo base, el arnés y la puntuación final provienen todos del mismo laboratorio, y las dos tablas del mismo artículo ofrecen dos escaleras distintas para el mismo experimento. La cifra de codificación de Qwen3.8-Max, en cambio, fue producida por Artificial Analysis y no por Alibaba: un tipo distinto de evidencia, un tipo distinto de confianza, y las dos nunca deberían restarse entre sí.

El 4B que todavía no puedes planificar del todo

Dos cosas se interponen entre FrogNano-4B-2609 y un lugar en producción, y ambas están en su propia documentación, no en la opinión de ningún revisor.

Lo primero es el hardware. La ficha indica que el requisito de pesos en BF16 es de aproximadamente 9,3 GB y luego añade que la memoria «aumenta sustancialmente a medida que el contexto combinado se aproxima a aproximadamente 131K tokens», antes de afirmar que el modelo mínimo exacto de GPU, la configuración de VRAM, las versiones del entorno de ejecución y el perfil de rendimiento «aún deben validarse antes del lanzamiento» — una frase que aparece en un modelo que ya se puede descargar. Nadie ha publicado una cifra de VRAM para la configuración evaluada, y la ficha no contiene ninguna.

El segundo es la postura de seguridad. La propia nota de alineación de Microsoft dice que el post-entrenamiento específico del agente no usó ningún conjunto de datos de preferencias de seguridad, rechazo, contenido dañino o adversariales, que en su lugar optimizó la corrección funcional y la evitación de regresiones, y que el modelo "no debería considerarse alineado en seguridad de forma independiente para un despliegue autónomo sin restricciones". La ficha termina nombrando los riesgos concretos: los parches pueden ser incorrectos o inseguros a pesar de pasar sus pruebas, el rendimiento es sensible a la calidad de esas pruebas, y cada parche candidato necesita una revisión humana cualificada y pruebas independientes de regresión y seguridad antes de su uso. Un modelo alojado de propósito general no conlleva ninguna de esas salvedades específicas, y además tampoco ejecutará un comando de shell en tu repositorio.

Una llave para el bando que elijas

Lo útil de hacer esta comparación en la práctica es que solo la mitad de ella consiste en una descarga. Qwen3.8-Max, y los modelos generales con los que compararías un agente autoalojado, son accesibles a través de un único endpoint compatible con OpenAI en OrcaRouter con un 0 % de margen — el precio de lista del proveedor se traslada tal cual, así que un cambio de precio del proveedor llega a nuestro lado el mismo día, que es la cifra que realmente se mueve cuando la factura de tokens de salida de un agente de programación es lo que intentas controlar. Eso también simplifica la cuestión del failover: si la mitad alojada de tu pipeline se degrada, el reintento es automático y el experimento continúa.

FrogNano-4B-2609 no es una de nuestras rutas y no hay fecha para él. Los pesos son tuyos para servirlos, y la ficha es honesta en que la configuración de servicio no se ha validado por completo. Lo que sí podemos hacer es que el otro lado de la comparación no cueste nada configurar, de modo que la pregunta que acabes respondiendo sea la verdadera: si un agente SWE-bench con 61,5% reportado por el proveedor, en tu propia GPU, supera a un modelo frontera tarificado por uso, en tus propias tareas, con tu propio volumen.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Qwen3.8-Max'. The left column reads Cost your GPU, electricity; Output tool calls and patches; Context about 131K evaluated; Input text only; Published score 61.5% SWE-bench Verified, vendor, unreproduced; Turn cap 8,192 tokens. The right column reads Cost $2.00 in / $6.00 out per million; Output prose or function call; Context 1,000,000 tokens; Input text, image, video; Published score AA Intelligence 45.4 and AA Coding 76.2, third-party; Turn cap not published. A footer reads 'FrogNano figures per Microsoft; Qwen3.8-Max scores per Artificial Analysis. Different benchmarks; not comparable.'

¿Cuál elegir?

Recurre a Qwen3.8-Max cuando el trabajo sea general, cuando el equipo de operaciones de otra persona deba encargarse de la capacidad, cuando la entrada pueda contener una imagen o un documento largo, o cuando necesites una respuesta hoy en lugar de una pila de servicio para el viernes. Sus puntuaciones de terceros significan que puedes predecir a grandes rasgos qué estás comprando, y su factura por token es un costo variable que puedes ver antes de comprometerte. Para un equipo que ejecuta una cantidad modesta de tareas de repositorio al mes, la aritmética no está ni cerca.

Recurre a FrogNano-4B-2609 cuando el volumen sea lo bastante alto como para que la facturación por token en trayectorias largas sea la restricción, cuando los datos no puedan salir de tu infraestructura, o cuando la pregunta de investigación —¿se puede entrenar a un agente pequeño hasta alcanzar competencia a nivel de repositorio sin un profesor?— sea lo que realmente estás poniendo a prueba. Ten en cuenta tres cosas desde el principio: el 61,5 % es una medición del propio laboratorio en un arnés mantenido por el laboratorio, nadie ha publicado una cifra de VRAM para la configuración evaluada, y la propia ficha dice que la configuración de servicio aún no está validada.

Lo que hace que valga la pena escribir sobre este emparejamiento es que comparten un ancestro dos generaciones atrás. FrogNano desciende de Qwen3.5-4B — un modelo general de la misma empresa cuyo modelo insignia de 2,4 billones de parámetros se encuentra al otro lado de esta página. Microsoft tomó el pequeño, realizó cinco iteraciones de RL en repositorios sintéticos y obtuvo un especialista. Alibaba fue por el otro camino y escaló. Ambas respuestas están publicadas, y la diferencia entre lo que cuesta la descarga y lo que cuesta la API es la forma honesta de elegir entre ellas.

A screenshot of the microsoft/FrogNano GitHub repository README showing the description that FrogNano evaluates coding agents with the Leaf harness in isolated Kubernetes sandboxes against OpenAI-compatible endpoints and five tools Read, Write, Edit, Glob and Bash; the requirements list naming a Kubernetes cluster with pod and network-policy permissions and an OpenAI-compatible endpoint with reasoning and tool-call parsers configured for Qwen3.5; the frognano-eval run commands; and the benchmark table listing SWE-bench Verified at 500 tasks with an 8,192-token cap, SWE-bench Pro at 731 with 32,000, Terminal-Bench 2.0 Verified at 89 with 32,000 and PatchEval Verified at 230 with 8,192.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario