
FrogNano-4B-2609 vs Gemma 4 12B: 61,5 % en SWE-bench y nadie lo ha comprobado
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 219 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
de MicrosoftFrogNano-4B-2609 es un agente de programación de la clase de cuatro mil millones derivado de Qwen3.5-4B que reporta un 61,5 % en SWE-bench Verified. Gemma 4 12B es el modelo multimodal sin codificador de 11,95 mil millones de parámetros de DeepMind, y su tarjeta reporta un 72,0 % en LiveCodeBench v6. Esos son los dos números que un comprador pondrá uno al lado del otro, y ponerlos uno al lado del otro es el error. Provienen de benchmarks distintos, harnesses distintos, laboratorios distintos y —más importante aún— solo uno de ellos tiene una metodología de evaluación publicada que un extraño haya leído. Todo lo demás sobre esta comparación es una cuestión de qué es realmente cada modelo, y la respuesta es que no son en absoluto la misma categoría de cosa.
Las cifras de FrogNano que aparecen a continuación provienen de la ficha de modelo de Microsoft y de su informe técnico, ambos públicos desde septiembre y ninguno reproducido por nadie fuera del laboratorio. Las cifras de Gemma 4 12B provienen de la ficha de modelo de Google, que también es un documento de proveedor; la diferencia es que las cifras de Gemma tienen detrás veinte semanas y aproximadamente 2,6 millones de descargas de escrutinio, mientras que FrogNano ha tenido dos semanas y un contador de descargas que no ha pasado de un dígito.
Para qué sirve cada modelo
Esta es la parte que una ficha técnica oculta. FrogNano-4B-2609 no es un modelo general que resulta que es bueno en código. Es un checkpoint cuyo post-entrenamiento completo fue ingeniería de software a nivel de repositorio, y que está diseñado para ser dirigido por un arnés en lugar de para que se converse con él.
Sus cinco herramientas son Read, Write, Edit, Glob y Bash. Emite llamadas a ellas, un sandbox las ejecuta y devuelve la salida, y el bucle se repite hasta que el modelo deja de solicitarlas. La configuración evaluada es de 150 pasos de interacción dentro de aproximadamente 131K tokens combinados, y produjo un parche candidato por tarea. La ficha de Microsoft es explícita en que el modelo está destinado a repositorios con mucho código Python y en inglés, con entornos reproducibles y conjuntos de pruebas ejecutables, y en que los componentes de imagen y vídeo heredados del modelo base nunca recibieron post-entrenamiento y no son compatibles.
Gemma 4 12B es la forma opuesta. Es un modelo unificado de 48 capas con un contexto de 256K y sin codificador de visión o audio independiente: los parches de imagen en bruto y las formas de onda de audio se proyectan directamente en el espacio de embedding del único decodificador mediante capas lineales ligeras. Recibe texto, imagen y audio, y emite texto. Tiene un modo de pensamiento activado por un token en el prompt del sistema, llamada nativa a funciones, y la tarjeta de Google hace hincapié en enumerar los flujos de trabajo agénticos entre sus usos previstos.
Así que la verdadera pregunta no es cuál de los dos es más inteligente. Es si quieres un componente especializado que solo funciona dentro de un sistema que tú tienes que operar, o un modelo general que hace un trabajo decente en muchas cosas y puede ser invocado por cualquier cosa.

Línea por línea, donde realmente difieren
• Parámetros — FrogNano-4B-2609 publica una banda, «500M-5B», en una ficha cuya propia descripción indica aproximadamente 4,66 mil millones; la descarga lo fija en 9,32 GB de pesos BF16. Gemma 4 12B es 11,95B, declarado una vez y sin matices. La proporción es de aproximadamente 2,6 a uno, y aparece directamente en lo que tienes que alquilar.
• Contexto — La configuración evaluada de FrogNano es de unos 131 K tokens combinados, con el razonamiento y la salida de herramientas compartiendo el presupuesto. Gemma 4 12B cuenta con 256.000 tokens y, en su propia fila de ventana larga, obtiene un 43,4 % en MRCR v2 con ocho agujas a 128 K. Casi el doble de ventana, y el segundo número es una medición publicada en lugar de una afirmación de capacidad.
• Modalidad — FrogNano-4B-2609 es texto de entrada, texto de salida, a pesar de la torre de visión que se encuentra en su checkpoint. Gemma 4 12B es entrada de texto, imagen y audio.
• Límite de salida — la configuración validada de FrogNano permite 8.192 tokens generados por turno del asistente, y su ficha indica que la configuración de entrenamiento RL usó ese mismo límite. Gemma 4 12B no publica un límite equivalente por turno; la restricción allí es la ventana de 256K.
• Interfaz agéntica: FrogNano emite llamadas Leaf estructuradas y necesita un harness para ejecutarlas. Gemma 4 12B incluye llamada a funciones nativa en su forma ajustada por instrucciones y se puede invocar directamente.
• Licencia — Gemma 4 12B es Apache 2.0 bajo los términos de Gemma 4 de Google, declarado con claridad. La ficha de FrogNano es MIT en su material preliminar y Apache 2.0 en su propio cuerpo, que es el tipo de ambigüedad que termina en una revisión legal en lugar de en una nota al pie.
• Cifras — FrogNano reporta 61,5 % en SWE-bench Verified, 37,6 % en SWE-bench Pro, 31,1 % en Terminal-Bench 2.0 y 47,3 % en PatchEval-Verified. Gemma 4 12B reporta 77,2 % en MMLU Pro, 72,0 % en LiveCodeBench v6, un ELO de Codeforces de 1659, 78,8 % en GPQA Diamond y 69,0 % en Tau2. La ficha de Google no publica una fila de SWE-bench, y la ficha de Microsoft no publica LiveCodeBench. No hay ninguna coincidencia entre los dos cuadros de puntuaciones.
Esa última viñeta es la que debería acabar con el instinto de comparar por números. Ni un solo benchmark aparece en ambas tarjetas. Un lector que enfrenta 61.5 con 72.0 ha comparado una tasa de resolución de repositorios con una tasa de aprobación en programación competitiva, lo que es más o menos como comparar el tiempo de un maratón con el de los cien metros porque ambos se miden en segundos.
Por qué el silencio de Google sobre SWE-bench no es una señal de alerta
La conclusión tentadora de la lista con viñetas es que FrogNano tiene un número real en SWE-bench y Gemma no, así que FrogNano gana la cuestión de la codificación. Eso no se deduce, por una razón que vale la pena precisar.
Gemma 4 12B reporta Tau2 en 69,0 % —un benchmark de uso de herramientas agéntico sobre tres ejecuciones—, junto con su soporte de llamada a funciones y su posicionamiento explícito para flujos de trabajo agénticos. Un modelo que obtiene 69,0 en Tau2 no es un modelo que no pueda hacer trabajo agéntico; es un modelo cuyo proveedor eligió reportar rendimiento de uso de herramientas en lugar de resolución de repositorios. Google tampoco reporta filas de SWE-bench para el 26B o el 31B, lo cual es una decisión editorial de toda la familia y no una debilidad del 12B.
Mientras tanto, el resultado contraintuitivo del propio artículo de Microsoft es uno que un comprador de Gemma debería leer con atención. FrogNano parte de Qwen3.5-4B, un modelo general, que obtuvo un 39,4 % en SWE-bench Verified a través del arnés Leaf. Cinco rondas de aprendizaje por refuerzo en aproximadamente 1.500 tareas sintéticas lo llevaron al 61,5 %. La lección no es «los modelos pequeños no pueden programar», sino que un checkpoint general de 4B con un 39,4 % ya resolvía más de un tercio de un conjunto de problemas difícil, validado por humanos, cuando alguien lo ejecutó dentro de un bucle de agente competente. Gemma 4 12B es tres veces ese tamaño y veinte semanas más maduro. Nadie lo ha ejecutado a través de Leaf y, hasta que alguien lo haga, «Gemma no es un agente de repositorio» es una suposición, no un hallazgo.
El impuesto del arnés, que los marcadores ocultan por completo
Aquí está la asimetría práctica, y es la que decide la compra.
Gemma 4 12B es un modelo. Descarga 11.95B de pesos, apunta Transformers, vLLM o SGLang hacia ellos, envía texto, recibe texto. Google publica la ruta de servicio, la licencia no deja lugar a dudas, y una cantidad de personas equivalente a 2.6 millones de descargas ya se ha topado con las asperezas y las ha documentado. Si la tarea es "resumir esta traza de pila", "leer esta captura de pantalla y decirme qué está roto" o "llamar a esta función con estos argumentos", funciona hoy.
FrogNano-4B-2609 es un modelo más un arnés, y el propio README de Microsoft hace que el arnés no sea opcional. El repositorio en github.com/microsoft/FrogNano es el equipo de evaluación de Leaf, no el código de entrenamiento — necesita un clúster de Kubernetes, un espacio de nombres ya existente, permisos para gestionar pods y políticas de red, acceso de descarga a las imágenes de contenedor de benchmark, y un endpoint compatible con OpenAI configurado con los analizadores correctos de razonamiento y de llamadas a herramientas. La ficha de Microsoft declara la condición de coincidencia sin rodeos: obtener puntuaciones idénticas requiere que coincidan el checkpoint, el tokenizador, la configuración de servicio, las imágenes de las tareas y el protocolo de evaluación. La mitad del lanzamiento que genera la puntuación es la mitad que la ficha señala con un enlace de GitHub.
Hay un valor real en eso, y vale la pena nombrarlo en lugar de descartarlo. La contribución de FrogNano es un bucle de síntesis de tareas que regenera problemas de entrenamiento en función de la capacidad de la política actual —la afirmación del artículo es que un agente pequeño puede entrenarse hasta un nivel competitivo en tareas sintéticas sin destilación alguna, y eso abre un camino para cualquiera que no pueda costear un maestro de frontera. Su API es pública. Sus métodos son reproducibles en principio. Esa es una contribución más sólida que otro checkpoint incremental, y también es más trabajo del que la mayoría de los equipos están dispuestos a asumir.

Si vas a elegir uno, elige según la tarea
Elige Gemma 4 12B si el trabajo mezcla modalidades, si algo necesita ver una imagen o escuchar audio, si el contexto tiene que sostener un árbol de archivos grande y una transcripción larga al mismo tiempo, o si quieres un modelo que cualquier framework pueda cargar sin un segundo sistema detrás. Su puntuación de 69.0 en Tau2 y su llamada a funciones nativa lo convierten en una elección defendible para pipelines agénticos, y nadie tiene que fiarse de la palabra de un laboratorio: el modelo ha sido evaluado por miles de personas y los resultados no son un secreto.
Elige FrogNano-4B-2609 si ya ejecutas un agente de repositorio en sandbox y quieres un checkpoint de clase 4B para incorporarlo, y si una descarga de 9,32 GB que cabe en hardware modesto es la restricción que impulsa la decisión. Sé realista con la secuencia: no estás comprando una puntuación, estás apostando por un método, y lo primero que descubrirás es si tu bucle de sondeo y tu analizador de llamadas a herramientas se parecen lo suficiente a Leaf. Algunos equipos obtendrán un comportamiento cercano al 61,5 % a la tercera tarde y otros pasarán dos semanas descubriendo que su conjunto de evaluación era más fácil que SWE-bench Verified, y nadie fuera del laboratorio puede decirte todavía cuál de los dos eres.
Si la decisión está realmente reñida, el experimento barato es ejecutar ambos dentro del mismo harness sobre tus propios casos en lugar de debatir cifras publicadas que no comparten ningún benchmark. OrcaRouter ofrece más de 200 modelos detrás de una única clave compatible con OpenAI sin margen de beneficio, por lo que los precios de lista de los proveedores se transfieren sin cambios, lo que permite poner un modelo general alojado y el resto de tu conjunto de candidatos detrás de un único endpoint y una única línea de facturación mientras decides. FrogNano no es una de nuestras rutas y no hay fecha para él; los pesos son una descarga que alojas tú mismo. Lo que sí podemos eliminar es la fricción del otro lado de la comparación: intercambiar modelos candidatos en tu propio harness sin un segundo contrato, un segundo SDK ni un segundo conjunto de credenciales.

El resumen honesto es que el número 61.5 es trabajo real del laboratorio que lo creó, y que actualmente es la única razón para preferir FrogNano para programación. Cuando alguien fuera de Microsoft reproduzca 61.5 en las mismas 500 tareas —o no lo logre—, esta comparación tendrá una respuesta genuina. Hasta entonces, la opción predeterminada más segura para la mayoría de los equipos es el modelo de 11.95B con la licencia limpia, la medición publicada de contexto largo y veinte semanas de errores de otras personas ya absorbidos en su documentación.
