
Intern-Decision-0.8B vs Gemma 4 12B: una cabeza de puntuación frente a un generalista multimodal
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 592 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 187 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
La forma más barata de ver qué es Intern-Decision-0.8B —y qué no es— es ponerlo junto a Gemma 4 12B y luego advertir que la comparación gira casi por completo en torno a lo que cada modelo hace con su capa de salida. Gemma 4 12B, el modelo multimodal sin codificador de 11,95 mil millones de parámetros de DeepMind publicado el 3 de junio de 2026 bajo Apache 2.0, es un generalista generativo: le das texto, imágenes, audio o vídeo, y escribe una respuesta. Intern-Decision-0.8B, subido discretamente por InternLM a Hugging Face el 26 de septiembre de 2026 sin anuncio alguno, es un ajuste fino del mucho más pequeño Qwen3.5-0.8B que no produce texto en absoluto: recibe un estado, un esquema de preguntas con nombre y hasta ocho imágenes, y devuelve una distribución de probabilidad calibrada para cada pregunta tras una única pasada hacia adelante. Uno escribe. El otro puntúa. Todo lo que sigue se deriva de eso.
Eso hace que este sea un enfrentamiento extraño de enmarcar como una contienda, y vale la pena decirlo sin rodeos antes de las filas de especificaciones: estos dos no son sustitutos, y cualquiera que elija entre ellos ya ha planteado mal el problema. Gemma 4 12B responde a la pregunta "cuál debería ser la respuesta". Intern-Decision-0.8B responde a la pregunta "cuál de estas dieciséis opciones es, y qué tan seguro estás" — y lo hace sin un bucle de decodificador, que es de donde provienen las diferencias de latencia y costo. Por lo tanto, la comparación útil trata de cómo conectarías cada uno en un solo flujo de trabajo, no de cuál gana.
La mayor diferencia, con mucho, es el lado de salida de la factura
Gemma 4 12B se factura como cualquier modelo generativo: tokens de entrada y tokens de salida, ambos. Cuando le pides JSON estructurado, cada uno de esos tokens se genera, se muestrea y se factura, y cuanto más largo y más anidado sea tu esquema, más tokens de esos hay. Eso no es una crítica al modelo —es lo que hace un decodificador—, pero es la partida que las cabezas de decisión existen para eliminar. Intern-Decision-0.8B no tiene tokens de salida. Su ficha es explícita sobre el motivo: la ruta de inferencia nunca llama a generate()/, sino que lee los logits en las posiciones inmediatamente anteriores a cada marcador de posición <decision>/ en un esqueleto pre-renderizado y aplica un softmax únicamente sobre los símbolos candidatos permitidos para ese campo. El contador de uso llamado output_tokens/ cuenta campos puntuados, no texto.
La consecuencia se multiplica a escala. Un pipeline que etiqueta diez mil registros con Gemma 4 12B paga por diez mil documentos JSON; el mismo pipeline con Intern-Decision-0.8B paga por los prompts y nada más. Que el número absoluto sea grande depende por completo de tu volumen y tu esquema, y cualquiera que tenga un presupuesto por token puede calcularlo en una hoja de cálculo en diez minutos. Pero la dirección no está en disputa, y es la razón por la que ha aparecido toda una categoría de modelos de decisión pequeños.
Latencia, y por qué la brecha de parámetros es engañosa
• Modelo de rendimiento — Intern-Decision-0.8B: una sola pasada hacia adelante, sin bucle de decodificación. Gemma 4 12B: generación autorregresiva, un token a la vez.
• Latencia medida — Intern-Decision-0.8B: 33,98 ms de media / 37,50 ms p95 en una única RTX 4090 a través de la ruta local de Hugging Face, según la propia medición de InternLM. Gemma 4 12B: no existe ninguna cifra comparable de una sola pasada, porque no hay una sola pasada que medir.
• Huella — Intern-Decision-0.8B: alrededor de 1,73 GB de almacenamiento del repositorio, 852.985.920 parámetros repartidos en un fragmento de lenguaje de 1,50 GB, un fragmento de visión de 176 MB y un proyector de 25 MB. Gemma 4 12B: los materiales de lanzamiento de Google lo sitúan en 16 GB de VRAM o memoria unificada.
• Determinismo de la salida — Intern-Decision-0.8B: argmax sobre los logits de los candidatos, por lo que la misma entrada produce la misma etiqueta cada vez. Gemma 4 12B: muestreo a menos que fijes la temperatura en cero, e incluso entonces la etiqueta llega como texto que debes analizar.
La diferencia de 14 veces en el número de parámetros entre estos dos modelos no se traduce en nada parecido a una diferencia de 14 veces en el tiempo de ejecución en una tarea de decisión, porque el trabajo es de naturaleza distinta. Intern-Decision-0.8B dedica su única pasada a leer el prompt —el estado, el esquema, las descripciones de las opciones— y luego se detiene. Gemma 4 12B invierte esa misma lectura del prompt y después añade encima cada token de la respuesta. En un esquema de dieciséis campos con etiquetas descriptivas en las opciones, la fase de generación no es un error de redondeo; constituye la mayor parte del tiempo total. La propia tabla de InternLM lo demuestra sin pretenderlo: su hermano de 2B registra una media de 33,28 ms, marginalmente más rápido que los 33,98 ms del 0.8B. Cuando el procesamiento del prompt domina, el número de parámetros deja de ser la palanca.img src="2.png">

Donde {{1}}Gemma 4 12B{{/1}} simplemente está en otra categoría
Sería deshonesto dejar la ficha técnica en el encuadre de tarea de decisión, porque fuera de ese encuadre Gemma 4 12B no solo está por delante: está jugando a otro deporte.
Intern-Decision-0.8B acepta texto más hasta ocho imágenes, y esa es toda su superficie de entrada. Su techo de entrada predeterminado es de 8.192 tokens, que se rechazan en lugar de truncarse, lo cual está muy por debajo del embedding de posición máximo de 262.144 que anuncia su configuración: el techo, no la arquitectura, es la ventana práctica. Gemma 4 12B toma texto, imagen, audio y vídeo de forma nativa mediante un diseño sin codificador que proyecta parches y formas de onda sin procesar directamente en el espacio de embeddings, mantiene una ventana de contexto de 256K y devuelve texto. La tarjeta publicada de Google lo puntúa con 77,2 % en MMLU Pro, 77,5 % en AIME 2026 sin herramientas, 72,0 % en LiveCodeBench v6, 78,8 % en GPQA Diamond, 69,1 % en MMMU Pro y 79,7 % en MATH-Vision. Son cifras del proveedor procedentes de la propia tarjeta de evaluación de Google y, a diferencia de la tabla de Intern-Decision-0.8B, tienen un año de uso por terceros a sus espaldas, porque Gemma 4 se lanzó a un ecosistema —LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang, Unsloth— desde el primer día.
Los lanzamientos tampoco se parecen en nada, y el contraste es instructivo. Gemma 4 12B tuvo un blog de lanzamiento, un informe técnico en arXiv, una página de la familia de cinco modelos, una tarjeta de evaluación y un enlace de descarga el día en que apareció. Intern-Decision-0.8B tuvo una tarjeta de modelo con una URL de GitHub que devuelve 404 y un Space de demostración que devuelve 401, y apareció a menos de cuarenta segundos de dos hermanos mayores igualmente indocumentados. Uno de estos es un producto. El otro es un checkpoint que alguien decidió poner en internet.
Ambos son Apache 2.0, y eso no es una fila compartida trivial.
La única dimensión en la que los dos coinciden genuinamente es la licencia, y merece un párrafo porque es donde la decisión cambia para los usuarios comerciales. Ambos son Apache 2.0. Gemma 4 12B se distribuye bajo los términos de licencia de Gemma 4 alojados en Google, que la ficha del modelo identifica como Apache 2.0; Intern-Decision-0.8B lleva Apache-2.0 junto con un segundo LICENSE-QWEN/ archivo, que es el manejo correcto para un modelo derivado de los pesos de Qwen y una señal de que InternLM hizo el papeleo incluso para un lanzamiento que no anunció.
Eso distingue a ambos de la familia LFM2.5 de Liquid AI, cuya LFM Open License v1.0 condiciona los derechos comerciales a que tu entidad legal se mantenga por debajo de un umbral de ingresos anuales de 10 millones de dólares — una restricción real que un comprador de modelos de decisión que compara opciones debería leer antes de asumir que "pesos abiertos" significa lo mismo en todas partes. Si tu caso de uso es comercial y tus ingresos superan esa línea, Apache 2.0 y la licencia LFM no son intercambiables, y ni Gemma 4 12B ni Intern-Decision-0.8B conllevan la restricción.
El balance honesto sobre las cifras de Intern-Decision-0.8B
Todas las cifras de rendimiento de Intern-Decision-0.8B son reportadas por el proveedor y no se han reproducido. Eso no es una formalidad — es el estado actual de la evidencia, y debería regir cuánto peso se le otorga a la tabla. InternLM seleccionó los benchmarks, seleccionó a los competidores, ejecutó las evaluaciones y publicó los resultados, y no existe ninguna ejecución independiente en ninguna tabla de clasificación pública. Una búsqueda del modelo en Artificial Analysis no devuelve absolutamente nada.img src="3.png">

Con esa etiqueta puesta, la forma del resultado sigue siendo informativa. El 0.8B registra 77.35 en el benchmark Typed Decision de TypeSafe frente a 73.35 de Jev 1.13 —el modelo que da nombre al benchmark— y 94.52 en ToolACE frente a 91.29. Promedia 79.38 en el conjunto, con sus propios hermanos 2B y 4B en 84.68 y 90.02. La columna que debería hacer dudar a un comprador es WildJailBreak, donde obtiene 64.48 frente a 96.29 de Jev: una brecha de robustez de rechazo de ese tamaño es una propiedad del ajuste fino, y no está documentado en ninguna parte si proviene de la base Qwen3.5-0.8B, del objetivo de ajuste de decisión o del número de parámetros. Su perfil de calibración es la lectura más interesante —un Brier de 0.530 y un error de calibración esperado de 0.066, frente a 0.358 y 0.095 de Jev—, lo que significa que es menos preciso en general, pero sus confianzas declaradas siguen más de cerca su precisión. Para un flujo de trabajo basado en umbrales, esa distinción importa más que la precisión bruta, y es el tipo de cosa que InternLM no tenía incentivo para publicar.
En contraste, la ficha de evaluación de Gemma 4 12B también está reportada por el ejecutor —Google también ejecutó esos benchmarks—, pero ha estado en el mundo desde junio, se ha desplegado en todos los principales entornos de ejecución locales, y cualquier discrepancia habría salido a la luz. La brecha probatoria entre «sin reproducir durante una semana» y «sin reproducir durante cuatro meses y nadie lo ha contradicho» es la verdadera diferencia entre estas dos columnas.
Cómo los combinarías en realidad
El patrón que tiene sentido no es una elección. Una cabeza de decisión se encarga de las llamadas estructuradas —enrutamiento, triaje, clasificación, puntuación según una rúbrica—, donde el conjunto de respuestas es cerrado, la latencia importa y los tokens de salida son pura sobrecarga. Un generalista se encarga de todo lo que necesita prosa, código, síntesis o contexto largo: el resumen de escalado, la explicación de por qué el ticket pasó a facturación, el borrador que una persona edita.
Si estás tratando de averiguar dónde queda la frontera, el experimento más barato es poner ambas mitades detrás de un mismo endpoint. OrcaRouter enruta más de 200 modelos a través de una única API compatible con OpenAI, con conmutación por error automática y el precio de lista del proveedor transferido sin margen alguno, lo que significa que probar un modelo de decisión alojado y un modelo generalista alojado en el mismo script cuesta una clave y una tarde. Conviene ser preciso con una frontera aquí: Intern-Decision-0.8B no es uno de los nuestros — es un checkpoint con licencia Apache-2.0 que descargas y ejecutas tú mismo, y la razón de peso para elegir un modelo de 1,73 GB es que vive donde ya viven tus datos. La mitad generativa del patrón es la parte que está a una línea de distancia. En cuanto a Gemma 4 12B en concreto, tampoco está en nuestro catálogo; los tamaños de Gemma 4 que sí enrutamos son 31B y 26B A4B, y el 12B es una descarga local. img src="4.png">

El veredicto, entonces, no es un ganador. Intern-Decision-0.8B es una cabeza de puntuación barata, rápida y determinista de un laboratorio que aún no la ha explicado, con una tabla de referencia que nadie ha reproducido y una columna de robustez ante rechazos que debería probarse antes de acercarla a entradas no confiables. Gemma 4 12B es un generalista multimodal maduro de pesos abiertos con una ficha publicada, un informe técnico y catorce veces más parámetros, y es la herramienta equivocada para una llamada de clasificación de dieciséis campos —no porque sea peor, sino porque generar una respuesta a una pregunta cuyo conjunto de respuestas ya escribiste es una forma costosa de obtener una etiqueta.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
