
Intern-Decision-2B vs Gemma 4 12B: un techo de 8.192 tokens frente a una ventana de 256K
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 584 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 187 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Supongamos que lo que necesitas que se juzgue es un expediente de reclamación de seguro de cuarenta páginas. internlm/Intern-Decision-2B lo rechazará. No lo truncará, no lo resumirá — lo rechazará, porque el motor de inferencia incluido declara DecisionEngine(max_length=8192) y la tarjeta del modelo dice en lenguaje sencillo que las entradas de tamaño excesivo se "rechazan sin truncamiento." google/gemma-4-12B-it — Gemma 4 12B Unified — tomará el mismo documento, más las fotografías escaneadas grapadas a él, más la llamada telefónica grabada, y te escribirá una respuesta. Ese contraste es toda la comparación, y casi no tiene nada que ver con los recuentos de parámetros — 2.213.241.664 frente a 11.959.730.224 — que una lectura de la hoja de especificaciones pondría en primer lugar.
Intern-Decision-2B es el intermedio de los tres puntos de control de decisión que InternLM subió a Hugging Face el 26 de septiembre de 2026 sin anuncio alguno, ajustado finamente a partir de Qwen/Qwen3.5-2B y con licencia Apache-2.0, con los términos de Qwen conservados junto a ella. Gemma 4 12B Unified es el modelo multimodal sin codificador de Google DeepMind de mayo de 2026, un sistema de cualquier modalidad a cualquier modalidad que toma texto, imagen, audio y vídeo y genera texto en una ventana de 256.000 tokens en más de 140 idiomas. Uno de estos es un puntuador. El otro es un generalista que resulta capaz de puntuar mal si le das un prompt con cuidado. Decidir entre ellos es menos una cuestión de benchmark que una cuestión sobre qué forma tiene ya tu respuesta.
Cuando los dos no son en realidad comparables
Vale la pena ser directo sobre esto antes de las cifras, porque el enfrentamiento invita a una falsa simetría.
Intern-Decision-2B no produce tokens. Recibe un estado, de una a dieciséis preguntas con nombre con hasta 62 opciones cada una y, opcionalmente, hasta ocho imágenes; genera un esqueleto JSON de asistente con un marcador de posición <decision> por campo; ejecuta una única pasada forward causal; lee los logits en la posición inmediatamente anterior a cada marcador de posición; aplica softmax únicamente sobre los símbolos permitidos de ese campo; y aplica una temperatura ajustada de 2.100509348278. La salida es una distribución calibrada y un argmax por campo. La tarjeta declara lo negativo sin rodeos: "Esta API realiza puntuación estructurada de candidatos. No llama a generate() ni muestrea texto de forma libre."
Gemma 4 12B genera. Todo lo que hace —razonamiento con pensamiento configurable, llamada a funciones, OCR, comprensión de gráficos, reconocimiento de voz, cobertura de 140 idiomas— se ejecuta mediante un bucle de decodificación sobre un vocabulario de 262.144 entradas. Pídele una decisión de enrutamiento con probabilidades y obtendrás prosa que contiene un número, y el número será el que haya producido el muestreador, no un softmax sobre tu conjunto de opciones.
Así que la pregunta práctica no es «cuál es más preciso». Es «¿mi respuesta ya es un conjunto cerrado?». Si lo es, el 12B es una forma derrochadora de elegir de una lista. Si no lo es, Intern-Decision-2B no puede ayudarte en absoluto, a ningún nivel de precisión.
El techo de entrada es la línea más nítida entre ellos
Esta es la dimensión que hay que sopesar por encima de todas las demás, porque produce fallos graves en lugar de degradados.
• Longitud de entrada — Intern-Decision-2B acepta 8.192 tokens y rechaza cualquier cosa más larga, de forma ruidosa; Gemma 4 12B acepta 256.000 tokens y, según la propia ficha de Google, obtiene un 43,4 % en MRCR v2 eight-needle a 128k.
• Imágenes — hasta ocho para Intern-Decision-2B, y cuentan contra el mismo presupuesto de 8,192 tokens; relación de aspecto y resolución variables para Gemma 4 12B, con entrada intercalada de texto e imágenes en cualquier orden.
• Modalidades de entrada: texto e imagen para uno; texto, imagen, audio y video para el otro.
• Lenguaje — no se hace ninguna afirmación multilingüe en ninguna parte de la documentación de Intern-Decision; Gemma 4 abarca más de 140 idiomas preentrenados con una puntuación multilingüe evaluada de 83,4 en MMMLU para el 12B.
• Salida — una distribución tipada de respuestas JSON para uno; texto generado para el otro.
El límite de 8.192 no es arbitrario, y eso es precisamente lo que lo hace difícil de sortear. El objetivo de decisión lee un logit en una posición fija por campo, así que el prompt debe contener el estado, el esquema y el esqueleto completo en una sola pasada; no hay ninguna estrategia de fragmentación que preserve el contrato. Un ticket, un correo electrónico, un estado JSON breve, una captura de pantalla o dos — ese es el centro de diseño. Un documento que requiere recuperación es un documento para el que este modelo no está pensado.
Lo que cada uno te cuesta, contado con honestidad
Intern-Decision-2B no tiene endpoint alojado ni proveedor. La página de modelo de OrcaRouter para él devuelve un 404, y nada en este artículo constituye una afirmación de disponibilidad. Invocarlo implica descargar aproximadamente 4,46 GB de repositorio —un shard de lenguaje de 3,76 GB, una torre de visión de 612,5 MB, un proyector de 50,3 MB— y ejecutar inference.py junto a los pesos en un entorno de Python 3.12 con torch 2.9.1 y transformers 5.14.1, en una GPU que estás pagando tanto si puntúa decisiones como si no.
Eso no es una desventaja en todos los casos, y vale la pena hacer la aritmética en lugar de suponer. A 33,28 ms de media por solicitud en una sola RTX 4090, según la propia medición de InternLM, un Intern-Decision-2B alojado localmente no cobra nada por decisión. Un generalista alojado cobra por token, incluidos los tokens que gasta pensando antes de responder. A escala, un evaluador que ya posees es el instrumento más barato: el costo es la GPU y la ingeniería, no la llamada.
Gemma 4 12B Unified tampoco está en nuestro catálogo; si lo quieres, descargas 11,96 mil millones de parámetros en BF16 y lo sirves tú mismo. Donde nuestro catálogo sí tiene rutas reales de Gemma 4 es en los otros dos tamaños, y son económicos: Gemma 4 26B A4B a 0,06 $ por millón de tokens de entrada y 0,33 $ por millón de salida, y Gemma 4 31B a 0,13 $ y 0,38 $, ambos listados con contextos de 262.144 tokens y un tiempo hasta el primer token P50 que el catálogo muestra en 1,73 segundos. Si tu problema resulta ser de razonamiento general en lugar de una decisión de conjunto cerrado, eso es lo que hay que comparar con un puntuador ejecutado localmente — dos modelos más con una sola clave, precio de lista del proveedor transferido sin margen, y conmutación por error automática para que un modelo que aún estás evaluando nunca se convierta en un punto único de fallo en una ruta de producción.

Marcador, con las salvedades adjuntas
• Parámetros — Intern-Decision-2B 2.213.241.664 en BF16 más una torre de visión y un proyector; Gemma 4 12B Unified 11.959.730.224 en BF16.
• Contexto — 8,192 tokens, rechazado arriba, frente a 256,000 tokens.
• Salida — probabilidades calibradas y un argmax, sin texto; texto generado, token a token.
• Modalidad: texto más hasta ocho imágenes frente a entrada de texto, imagen, audio y vídeo, con salida de texto.
• Evidencia publicada: una tabla de proveedor con siete suites que promedia 84,68, con una puntuación de Brier de 0,437 y un ECE de 0,100, no reproducida por nadie fuera del laboratorio; una tarjeta de evaluación de Google con MMLU Pro 77,2 %, GPQA Diamond 78,8 %, AIME 2026 sin herramientas 77,5 % y LiveCodeBench v6 72,0, además de un listado independiente con un Artificial Analysis Intelligence Index de 14,2.
• Adopción — un me gusta y cero descargas en el checkpoint de 2B frente a una familia que lleva en circulación desde mayo con cuantizaciones, ajustes finos y derivados que se cuentan por cientos.
Lea las filas de evidencia de forma asimétrica, porque eso es lo que son. Los números de Google han sido indexados y reproducidos de forma independiente por terceros; los de InternLM no han sido ejecutados por nadie fuera del laboratorio, y la cifra de calibración, en particular, debería tratarse como una intención bien documentada hasta que se confronte con un conjunto de pruebas externo. El resumen honesto no es que la tabla del proveedor esté equivocada. Es que las dos columnas no tienen el mismo peso probatorio, y una comparación que imprime 84,68 junto a 77,2 sin decirlo está engañando a su lector.

Qué hacer con esto
Elige Intern-Decision-2B cuando la decisión esté realmente cerrada, el estado quepa cómodamente dentro de ocho mil tokens, quieras una probabilidad a la que puedas aplicar un umbral en lugar de un párrafo que tengas que interpretar, y tengas el hardware y las ganas de operar un checkpoint que nadie soporta todavía. El tamaño intermedio en concreto presenta la calibración publicada más débil de los tres que InternLM lanzó —ECE 0,100 frente a 0,066 para el modelo de la mitad de su tamaño y 0,065 para el de casi el doble—, así que, si vas a elegir dentro de esta familia, el 2B es el modelo sobre el que deberías ajustar tu propia temperatura, no el que deberías usar con confianza tal como viene.
Elige Gemma 4 12B —o, de forma más práctica, uno de los dos tamaños de Gemma 4 que realmente enrutamos— cuando la entrada sea más larga que una página, cuando haya audio o video o un idioma distinto del inglés, cuando la respuesta deba explicarse en lugar de seleccionarse sin más, o cuando no quieras hacerte cargo de la pila de inferencia. El 12B es el más pequeño de los modelos Gemma 4 con audio nativo; el 26B A4B activa alrededor de cuatro mil millones de parámetros por token y es la forma más económica de entrar en la familia.
Y si lo que en realidad tienes es un problema de puntuación con un documento largo adjunto, ninguno de estos es el instrumento adecuado: eso es un problema de recuperación disfrazado de artículo de comparación.

