Una tarjeta de título generada que dice 'FrogNano-4B-2609 vs Gemma 4 12B' con el subtítulo 'un agente de repositorio de 4B contra un generalista multimodal de 11,95B', tres chips que dicen '61,5% SWE-bench, reportado por el proveedor', '72,0% LiveCodeBench, reportado por el proveedor' y 'sin benchmark compartido', un pie de página que dice 'Diferentes benchmarks sin solapamiento; ambas tablas de puntuación reportadas por el proveedor', y el logotipo de OrcaRouter compuesto en la esquina inferior derecha.
Guides & Insights

FrogNano-4B-2609 vs Gemma 4 12B: 61,5 % en SWE-bench y nadie lo ha comprobado

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

de MicrosoftFrogNano-4B-2609 es un agente de programación de la clase de cuatro mil millones derivado de Qwen3.5-4B que reporta un 61,5 % en SWE-bench Verified. Gemma 4 12B es el modelo multimodal sin codificador de 11,95 mil millones de parámetros de DeepMind, y su tarjeta reporta un 72,0 % en LiveCodeBench v6. Esos son los dos números que un comprador pondrá uno al lado del otro, y ponerlos uno al lado del otro es el error. Provienen de benchmarks distintos, harnesses distintos, laboratorios distintos y —más importante aún— solo uno de ellos tiene una metodología de evaluación publicada que un extraño haya leído. Todo lo demás sobre esta comparación es una cuestión de qué es realmente cada modelo, y la respuesta es que no son en absoluto la misma categoría de cosa.

Las cifras de FrogNano que aparecen a continuación provienen de la ficha de modelo de Microsoft y de su informe técnico, ambos públicos desde septiembre y ninguno reproducido por nadie fuera del laboratorio. Las cifras de Gemma 4 12B provienen de la ficha de modelo de Google, que también es un documento de proveedor; la diferencia es que las cifras de Gemma tienen detrás veinte semanas y aproximadamente 2,6 millones de descargas de escrutinio, mientras que FrogNano ha tenido dos semanas y un contador de descargas que no ha pasado de un dígito.

Para qué sirve cada modelo

Esta es la parte que una ficha técnica oculta. FrogNano-4B-2609 no es un modelo general que resulta que es bueno en código. Es un checkpoint cuyo post-entrenamiento completo fue ingeniería de software a nivel de repositorio, y que está diseñado para ser dirigido por un arnés en lugar de para que se converse con él.

Sus cinco herramientas son Read, Write, Edit, Glob y Bash. Emite llamadas a ellas, un sandbox las ejecuta y devuelve la salida, y el bucle se repite hasta que el modelo deja de solicitarlas. La configuración evaluada es de 150 pasos de interacción dentro de aproximadamente 131K tokens combinados, y produjo un parche candidato por tarea. La ficha de Microsoft es explícita en que el modelo está destinado a repositorios con mucho código Python y en inglés, con entornos reproducibles y conjuntos de pruebas ejecutables, y en que los componentes de imagen y vídeo heredados del modelo base nunca recibieron post-entrenamiento y no son compatibles.

Gemma 4 12B es la forma opuesta. Es un modelo unificado de 48 capas con un contexto de 256K y sin codificador de visión o audio independiente: los parches de imagen en bruto y las formas de onda de audio se proyectan directamente en el espacio de embedding del único decodificador mediante capas lineales ligeras. Recibe texto, imagen y audio, y emite texto. Tiene un modo de pensamiento activado por un token en el prompt del sistema, llamada nativa a funciones, y la tarjeta de Google hace hincapié en enumerar los flujos de trabajo agénticos entre sus usos previstos.

Así que la verdadera pregunta no es cuál de los dos es más inteligente. Es si quieres un componente especializado que solo funciona dentro de un sistema que tú tienes que operar, o un modelo general que hace un trabajo decente en muchas cosas y puede ser invocado por cualquier cosa.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face showing the Gemma 4 12B Unified heading, the Any-to-Any, Transformers, Safetensors and image-text-to-text tags, the Apache 2.0 license line credited to Google DeepMind, and the model overview explaining that text, audio, image and video inputs are handled without separate encoders.

Línea por línea, donde realmente difieren

• Parámetros — FrogNano-4B-2609 publica una banda, «500M-5B», en una ficha cuya propia descripción indica aproximadamente 4,66 mil millones; la descarga lo fija en 9,32 GB de pesos BF16. Gemma 4 12B es 11,95B, declarado una vez y sin matices. La proporción es de aproximadamente 2,6 a uno, y aparece directamente en lo que tienes que alquilar.

• Contexto — La configuración evaluada de FrogNano es de unos 131 K tokens combinados, con el razonamiento y la salida de herramientas compartiendo el presupuesto. Gemma 4 12B cuenta con 256.000 tokens y, en su propia fila de ventana larga, obtiene un 43,4 % en MRCR v2 con ocho agujas a 128 K. Casi el doble de ventana, y el segundo número es una medición publicada en lugar de una afirmación de capacidad.

• Modalidad — FrogNano-4B-2609 es texto de entrada, texto de salida, a pesar de la torre de visión que se encuentra en su checkpoint. Gemma 4 12B es entrada de texto, imagen y audio.

• Límite de salida — la configuración validada de FrogNano permite 8.192 tokens generados por turno del asistente, y su ficha indica que la configuración de entrenamiento RL usó ese mismo límite. Gemma 4 12B no publica un límite equivalente por turno; la restricción allí es la ventana de 256K.

• Interfaz agéntica: FrogNano emite llamadas Leaf estructuradas y necesita un harness para ejecutarlas. Gemma 4 12B incluye llamada a funciones nativa en su forma ajustada por instrucciones y se puede invocar directamente.

• Licencia — Gemma 4 12B es Apache 2.0 bajo los términos de Gemma 4 de Google, declarado con claridad. La ficha de FrogNano es MIT en su material preliminar y Apache 2.0 en su propio cuerpo, que es el tipo de ambigüedad que termina en una revisión legal en lugar de en una nota al pie.

• Cifras — FrogNano reporta 61,5 % en SWE-bench Verified, 37,6 % en SWE-bench Pro, 31,1 % en Terminal-Bench 2.0 y 47,3 % en PatchEval-Verified. Gemma 4 12B reporta 77,2 % en MMLU Pro, 72,0 % en LiveCodeBench v6, un ELO de Codeforces de 1659, 78,8 % en GPQA Diamond y 69,0 % en Tau2. La ficha de Google no publica una fila de SWE-bench, y la ficha de Microsoft no publica LiveCodeBench. No hay ninguna coincidencia entre los dos cuadros de puntuaciones.

Esa última viñeta es la que debería acabar con el instinto de comparar por números. Ni un solo benchmark aparece en ambas tarjetas. Un lector que enfrenta 61.5 con 72.0 ha comparado una tasa de resolución de repositorios con una tasa de aprobación en programación competitiva, lo que es más o menos como comparar el tiempo de un maratón con el de los cien metros porque ambos se miden en segundos.

Por qué el silencio de Google sobre SWE-bench no es una señal de alerta

La conclusión tentadora de la lista con viñetas es que FrogNano tiene un número real en SWE-bench y Gemma no, así que FrogNano gana la cuestión de la codificación. Eso no se deduce, por una razón que vale la pena precisar.

Gemma 4 12B reporta Tau2 en 69,0 % —un benchmark de uso de herramientas agéntico sobre tres ejecuciones—, junto con su soporte de llamada a funciones y su posicionamiento explícito para flujos de trabajo agénticos. Un modelo que obtiene 69,0 en Tau2 no es un modelo que no pueda hacer trabajo agéntico; es un modelo cuyo proveedor eligió reportar rendimiento de uso de herramientas en lugar de resolución de repositorios. Google tampoco reporta filas de SWE-bench para el 26B o el 31B, lo cual es una decisión editorial de toda la familia y no una debilidad del 12B.

Mientras tanto, el resultado contraintuitivo del propio artículo de Microsoft es uno que un comprador de Gemma debería leer con atención. FrogNano parte de Qwen3.5-4B, un modelo general, que obtuvo un 39,4 % en SWE-bench Verified a través del arnés Leaf. Cinco rondas de aprendizaje por refuerzo en aproximadamente 1.500 tareas sintéticas lo llevaron al 61,5 %. La lección no es «los modelos pequeños no pueden programar», sino que un checkpoint general de 4B con un 39,4 % ya resolvía más de un tercio de un conjunto de problemas difícil, validado por humanos, cuando alguien lo ejecutó dentro de un bucle de agente competente. Gemma 4 12B es tres veces ese tamaño y veinte semanas más maduro. Nadie lo ha ejecutado a través de Leaf y, hasta que alguien lo haga, «Gemma no es un agente de repositorio» es una suposición, no un hallazgo.

El impuesto del arnés, que los marcadores ocultan por completo

Aquí está la asimetría práctica, y es la que decide la compra.

Gemma 4 12B es un modelo. Descarga 11.95B de pesos, apunta Transformers, vLLM o SGLang hacia ellos, envía texto, recibe texto. Google publica la ruta de servicio, la licencia no deja lugar a dudas, y una cantidad de personas equivalente a 2.6 millones de descargas ya se ha topado con las asperezas y las ha documentado. Si la tarea es "resumir esta traza de pila", "leer esta captura de pantalla y decirme qué está roto" o "llamar a esta función con estos argumentos", funciona hoy.

FrogNano-4B-2609 es un modelo más un arnés, y el propio README de Microsoft hace que el arnés no sea opcional. El repositorio en github.com/microsoft/FrogNano es el equipo de evaluación de Leaf, no el código de entrenamiento — necesita un clúster de Kubernetes, un espacio de nombres ya existente, permisos para gestionar pods y políticas de red, acceso de descarga a las imágenes de contenedor de benchmark, y un endpoint compatible con OpenAI configurado con los analizadores correctos de razonamiento y de llamadas a herramientas. La ficha de Microsoft declara la condición de coincidencia sin rodeos: obtener puntuaciones idénticas requiere que coincidan el checkpoint, el tokenizador, la configuración de servicio, las imágenes de las tareas y el protocolo de evaluación. La mitad del lanzamiento que genera la puntuación es la mitad que la ficha señala con un enlace de GitHub.

Hay un valor real en eso, y vale la pena nombrarlo en lugar de descartarlo. La contribución de FrogNano es un bucle de síntesis de tareas que regenera problemas de entrenamiento en función de la capacidad de la política actual —la afirmación del artículo es que un agente pequeño puede entrenarse hasta un nivel competitivo en tareas sintéticas sin destilación alguna, y eso abre un camino para cualquiera que no pueda costear un maestro de frontera. Su API es pública. Sus métodos son reproducibles en principio. Esa es una contribución más sólida que otro checkpoint incremental, y también es más trabajo del que la mayoría de los equipos están dispuestos a asumir.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Gemma 4 12B'. The left column reads Parameters approx 4.66B with the card saying 500M-5B, Context about 131K evaluated, Input text only, Harness required Leaf with 5 tools, SWE-bench Verified 61.5% vendor, and Independent evals none. The right column reads Parameters 11.95B, Context 256,000 tokens, Input text, image, audio, Harness none required, LiveCodeBench v6 72.0% vendor, and Independent evals widely run. A footer reads 'Different benchmarks, no overlap; both scoreboards vendor-reported.'

Si vas a elegir uno, elige según la tarea

Elige Gemma 4 12B si el trabajo mezcla modalidades, si algo necesita ver una imagen o escuchar audio, si el contexto tiene que sostener un árbol de archivos grande y una transcripción larga al mismo tiempo, o si quieres un modelo que cualquier framework pueda cargar sin un segundo sistema detrás. Su puntuación de 69.0 en Tau2 y su llamada a funciones nativa lo convierten en una elección defendible para pipelines agénticos, y nadie tiene que fiarse de la palabra de un laboratorio: el modelo ha sido evaluado por miles de personas y los resultados no son un secreto.

Elige FrogNano-4B-2609 si ya ejecutas un agente de repositorio en sandbox y quieres un checkpoint de clase 4B para incorporarlo, y si una descarga de 9,32 GB que cabe en hardware modesto es la restricción que impulsa la decisión. Sé realista con la secuencia: no estás comprando una puntuación, estás apostando por un método, y lo primero que descubrirás es si tu bucle de sondeo y tu analizador de llamadas a herramientas se parecen lo suficiente a Leaf. Algunos equipos obtendrán un comportamiento cercano al 61,5 % a la tercera tarde y otros pasarán dos semanas descubriendo que su conjunto de evaluación era más fácil que SWE-bench Verified, y nadie fuera del laboratorio puede decirte todavía cuál de los dos eres.

Si la decisión está realmente reñida, el experimento barato es ejecutar ambos dentro del mismo harness sobre tus propios casos en lugar de debatir cifras publicadas que no comparten ningún benchmark. OrcaRouter ofrece más de 200 modelos detrás de una única clave compatible con OpenAI sin margen de beneficio, por lo que los precios de lista de los proveedores se transfieren sin cambios, lo que permite poner un modelo general alojado y el resto de tu conjunto de candidatos detrás de un único endpoint y una única línea de facturación mientras decides. FrogNano no es una de nuestras rutas y no hay fecha para él; los pesos son una descarga que alojas tú mismo. Lo que sí podemos eliminar es la fricción del otro lado de la comparación: intercambiar modelos candidatos en tu propio harness sin un segundo contrato, un segundo SDK ni un segundo conjunto de credenciales.

A generated timeline card headed 'Two releases, twenty weeks apart' showing an upper bar labelled Gemma 4 12B uploaded 23 May 2026 with 2.6 million downloads across the family, and a lower bar labelled FrogNano-4B-2609 uploaded 17 September 2026 with no announcement, with a span marker of 20 weeks between them and a footer reading 'Download figures from Hugging Face on 3 October 2026.'

El resumen honesto es que el número 61.5 es trabajo real del laboratorio que lo creó, y que actualmente es la única razón para preferir FrogNano para programación. Cuando alguien fuera de Microsoft reproduzca 61.5 en las mismas 500 tareas —o no lo logre—, esta comparación tendrá una respuesta genuina. Hasta entonces, la opción predeterminada más segura para la mayoría de los equipos es el modelo de 11.95B con la licencia limpia, la medición publicada de contexto largo y veinte semanas de errores de otras personas ya absorbidos en su documentación.