
FrogNano-4B-2609 vs Intern Decision 4B: un modelo base, dos apuestas completamente diferentes
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 219 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Dos laboratorios tomaron el mismo checkpoint, Qwen3.5-4B, y lo llevaron en direcciones que no se parecen entre sí. microsoft/FrogNano-4B-2609 fue posentrenado con aprendizaje por refuerzo en aproximadamente 1.500 entornos sintéticos de ingeniería de software hasta que pudo emitir llamadas estructuradas a herramientas y parches de varios archivos a través de un arnés de cinco herramientas. internlm/Intern-Decision-4B fue ajustado para no emitir texto en absoluto: recibe un estado más un esquema de preguntas con nombre y devuelve una probabilidad calibrada para cada opción en una sola pasada hacia adelante. Uno escribe código. El otro se niega a escribir cualquier cosa y devuelve una distribución. Compararlos en calidad no tiene sentido; compararlos por lo que te cuesta ejecutarlos y aquello en lo que se puede confiar en ellos es el ejercicio honesto.
Ambos se lanzaron sin anuncio, que es la otra cosa que comparten. Ninguno tiene una entrada en Artificial Analysis, una calificación en ninguna arena ni una sola evaluación independiente. Todas las cifras que aparecen a continuación —la escala de SWE-bench por un lado, las filas de calibración Brier y ECE por el otro— las produjo el laboratorio que entrenó el modelo, con el propio banco de pruebas de ese laboratorio, y ninguna se ha enfrentado jamás a un conjunto de pruebas que no provenga de él mismo.
La bifurcación ocurrió antes de que existiera ninguno de los dos modelos.
El checkpoint base es un modelo denso híbrido de 32 capas de Gated DeltaNet y atención con compuertas, y ambos derivados heredan su esqueleto. Después de eso, los dos pipelines de post-entrenamiento no tienen nada en común.
El pipeline de Microsoft es un bucle cerrado. TaskPilot genera tareas candidatas de repositorio a partir de instantáneas reales, ejecuta rollouts desde el checkpoint actual para encontrar aquellas que la política a veces resuelve, las conserva y entrena. Cinco iteraciones, cada una calibrada con la política de la iteración anterior, terminando en 61,5% en SWE-bench Verified y 37,6% en SWE-bench Pro. Sin destilación — la tarjeta afirma que no se usaron trayectorias, acciones o rastros de razonamiento de modelos más fuertes como objetivos.
El pipeline de InternLM es un único objetivo supervisado sobre una forma de tarea fija. Al modelo se le proporciona un prompt de sistema, un estado, un esquema de decisión y un esqueleto JSON de asistente completo con un marcador de posición por campo. Ejecuta una única pasada forward causal, lee los logits en cada posición de marcador de posición y aplica un softmax solo sobre los símbolos candidatos permitidos de ese campo. La ficha de InternLM lo dice sin rodeos: esta ruta "no llama a generate() ni muestrea texto de forma libre."
Esa diferencia no es una diferencia de escala. Es una diferencia en qué es el artefacto en sí. FrogNano-4B-2609 es un agente que puede equivocarse de cien maneras interesantes y ser corregido mediante pruebas. Intern-Decision-4B es un puntuador cuyo modo de fallo es un número seguro de sí mismo.
Dos contratos, y ninguno de los dos es "enviar un prompt"
El contrato de FrogNano es un bucle. El modelo emite llamadas a Read, Write, Edit, Glob y Bash; el harness de Leaf las ejecuta dentro de un sandbox de repositorio aislado y devuelve la salida; el bucle continúa hasta que el modelo deja de llamar. Las evaluaciones se ejecutaron a 150 pasos dentro de aproximadamente 131K tokens combinados, con hasta 8,192 tokens generados por turno del asistente. El servicio necesita SGLang con un parser de razonamiento de Qwen3 y un parser de llamadas a herramientas de Qwen3 coder — si eso se hace mal, el modelo produce prosa donde el harness espera JSON, lo que desde fuera se ve exactamente como un modelo roto.
El contrato de Intern-Decision-4B es de un solo intento con un límite estricto. Las preguntas y las opciones mantienen su orden. Las opciones se asignan a símbolos de un solo token — A hasta Z, luego a hasta z, luego 0 hasta 9, que es la razón aritmética por la que una pregunta se limita a un máximo de 62 opciones. El límite del wrapper es de 8,192 tokens y la tarjeta de InternLM indica explícitamente que las entradas más largas se rechazan sin truncamiento. Se admiten tres tipos de pregunta: choice con un mapa ordenado de criterios, score con una lista o un mapa con claves numéricas, y noul, una pregunta binaria. Se permiten hasta ocho imágenes y sus tokens se cuentan contra los mismos 8,192.
• Forma de salida — FrogNano-4B-2609 emite llamadas a herramientas, texto de razonamiento y un parche. Intern-Decision-4B emite un símbolo por campo y nada más.
• Determinismo — FrogNano muestrea a temperatura 0.6 en tres semillas, por lo que es probabilístico por diseño. El argmax de Intern-Decision-4B está fijado por el paso hacia adelante; la temperatura ajustada solo mueve su confianza.
• Superficie de fallo — FrogNano puede alucinar una API, ampliar demasiado una edición o pasar las pruebas mientras introduce una vulnerabilidad, todo lo cual su tarjeta nombra. Intern-Decision-4B no puede alucinar una respuesta, porque solo puede elegir entre las opciones que tú proporcionaste — solo puede estar mal calibrado.
• Límite máximo de entrada — aproximadamente 131K tokens combinados para FrogNano en su configuración evaluada, frente a un límite estricto de 8.192 para Intern-Decision-4B, lo que representa un factor de dieciséis y no hay forma de evitarlo.
• Forma del costo — FrogNano factura por la trayectoria, y las trayectorias son largas. Intern-Decision-4B no tiene tokens de salida que facturar en absoluto.
• Parámetros — la ficha de FrogNano ofrece una banda de "500M-5B" y describe aproximadamente 4,66B, con una descarga BF16 de 9,32 GB; Intern-Decision-4B se indica en 4,54B con una torre de visión de 612 MB y un proyector de 54 MB junto con sus fragmentos de lenguaje.
El número que decide este emparejamiento
La tarjeta de InternLM sitúa a Intern-Decision-4B en 44,16 ms de latencia media y 44,03 ms de mediana en una sola RTX 4090 por la ruta local de Hugging Face, con un P95 de 44,60 ms. Vuelve a leer esa dispersión: de la mediana a la cola hay muy por debajo de un milisegundo, porque una pasada forward de forma fija casi no tiene nada que variar. Ese es todo el argumento a favor de la arquitectura.
La cifra correspondiente de FrogNano no está en milisegundos. Sus evaluaciones permitían un presupuesto de 150 pasos con un techo de agente de 10.800 segundos por tarea. Esas no son unidades comparables y nunca deberían ponerse en la misma frase que una afirmación de latencia, pero sí te dicen la forma del intercambio. Un modelo responde a una decisión en cuarenta y cuatro milisegundos y el otro pasa minutos de llamadas a herramientas persiguiendo un parche. Si tu problema es "enruta este ticket a una de seis colas y dime cuán seguro estás", el primero no es una versión más barata del segundo, es una máquina distinta.
Ambos laboratorios se midieron a sí mismos, y ambos conjuntos de mediciones deberían leerse como intenciones en lugar de resultados. InternLM informa de una media de siete conjuntos de 90,02, con una puntuación de Brier de 0,347 y un error de calibración esperado de 0,065, ajustado a una temperatura de 1,99241824 sobre 1.728 casos de calibración designados. Microsoft informa de un ascenso de cinco iteraciones del 39,4 % al 61,5 % en SWE-bench Verified, y el apéndice del mismo artículo informa de esa misma progresión como 48,2 %, 53,4 %, 58,3 %, 58,6 % y 61,6 % —un recordatorio de que, incluso dentro de un mismo laboratorio, el mismo hecho medido de dos maneras produce dos escaleras.

La señal está en aquello sobre lo que cada carta elige advertirte.
Ambas tarjetas son inusualmente honestas, y esa honestidad apunta en direcciones opuestas — lo cual es lo más útil de esta comparación.
La sección de limitaciones conocidas de Microsoft se lee como una advertencia de despliegue. Solo inglés y Python. El rendimiento es sensible al arnés y a la calidad de las pruebas. Parches que pueden ser incorrectos o inseguros a pesar de pasar sus pruebas. La propia frase de la tarjeta es que FrogNano «no debería considerarse alineado con la seguridad de forma independiente para un despliegue autónomo sin restricciones», y nombra la brecha específica: el post-entrenamiento específico del agente no usó datos de preferencia de seguridad, de rechazo ni adversariales, porque en su lugar optimizó la corrección funcional y la evitación de regresiones. También declara voluntariamente la tasa de llamadas paralelas a herramientas del 1,71 %, lo que significa que el modelo casi nunca activa dos herramientas en un mismo turno a pesar de que el arnés lo permite: una regresión real de capacidad respecto al modelo base que el equipo trató de recuperar añadiendo una etapa de consolidación.
La ficha de InternLM advierte sobre la clase opuesta de problema. No hay una superficie de alucinación sobre la cual advertir, así que las advertencias son sobre las entradas: el rechazo de 8,192, el techo de 62 opciones, el hecho de que la torre de texto subyacente declara un límite de posición de 262,144 tokens que el wrapper publicado se niega a usar. Su riesgo es que se confíe en una cifra presentada con seguridad más de lo que merece, y la ficha es sincera al decir que la calibración reduce una brecha con la línea base de Jev sin cerrarla en todos los segmentos.
Leídos juntos, describen dos posturas de confianza diferentes. FrogNano necesita supervisión porque actúa. Intern-Decision-4B necesita una auditoría porque puntúa — y un número que mueve una decisión de producción es exactamente el tipo de resultado que nadie piensa en probar.
Dónde encaja un enrutador, y una nota honesta sobre ambos
Ninguno de los dos modelos es un endpoint alojado. FrogNano se distribuye como pesos más un arnés de evaluación de Kubernetes; Intern-Decision-4B se distribuye como una clase de Python que importas después de descargar cuatro fragmentos. Para un equipo que quiera probar cualquiera de los dos frente a algo real, el patrón seguro es el mismo para ambos y no es nada glamoroso: colocar el componente experimental detrás de un fallback, de modo que una mala trayectoria o un día mal calibrado cueste un reintento en lugar de un incidente.
Ese patrón es para lo que sirve una capa de enrutamiento. OrcaRouter ejecuta más de 200 modelos detrás de una clave compatible con OpenAI con un 0 % de margen — precio de lista del proveedor pasado tal cual, así que un cambio de precio del proveedor llega a nuestro lado el mismo día — y su conmutación por error se sitúa delante del modelo general al que recurres, no delante de estos dos. Para ser claros: no ofrecemos FrogNano-4B-2609 ni Intern-Decision-4B, y no hay fecha para ninguno de los dos. Lo que te aporta un único endpoint aquí es que la comparación en sí resulta barata: una credencial, una línea de facturación y ninguna segunda integración cada vez que cambias el modelo general con el que comparas el especialista.

¿Cuál, y cuándo?
Usa Intern-Decision-4B cuando la respuesta ya existe en tu prompt y necesitas que se elija, con una confianza asociada, a un ritmo de miles por segundo. Enrutamiento de taxonomía fija, puntuación con rúbrica, extracción restringida por esquema, moderación contra un conjunto cerrado de etiquetas. La pasada hacia adelante de 44 milisegundos y la factura de cero tokens de salida son el producto, y la calibración es lo que hay que auditar antes de confiar en él.
Toma FrogNano-4B-2609 cuando la respuesta aún no existe y hay que descubrirla leyendo un repositorio y ejecutando sus pruebas. Ese es un proceso de varios minutos, en sandbox y revisable, y el 61.5% en SWE-bench Verified —reportado por el proveedor, no reproducido— es la mejor evidencia actual de que un checkpoint de 4B siquiera pueda hacerlo.
Lo que no debería pasar de ninguna manera es la costumbre de comparar sus puntuaciones. Un promedio de 90,02 en siete conjuntos y una tasa de 61,5 en SWE-bench Verified son mediciones de dos preguntas distintas, producidas por dos laboratorios, con dos arneses, y ninguno de los dos números ha pasado por manos de un tercero. Comparten un ancestro y nada más.

La única predicción genuinamente útil del ancestro compartido: dado que ambos modelos parten del mismo checkpoint de 4B, la diferencia entre ellos está casi por completo en el post-entrenamiento, lo que significa que la pregunta interesante para cualquiera que construya sobre Qwen3.5-4B es cuál de estas dos estructuras de recompensa se transfiere a su propio dominio. Un bucle de tareas sintéticas que se calibra contra su propia política, o una cabeza de puntuación de forma fija con una temperatura ajustada. Esas son dos recetas, ambas publicadas, ambas de laboratorios que todavía no han dejado que nadie más las ejecute. Es una situación poco común y vale la pena observarla en lugar de suscribirla.
