Una tarjeta de título generada que dice «Intern-Decision-2B vs Gemma 4 12B», con el subtítulo «8,192 tokens contra 256,000», con las insignias «un evaluador que se niega» y «un generalista que escribe», con el logotipo de OrcaRouter compuesto en la esquina.
Guides & Insights

Intern-Decision-2B vs Gemma 4 12B: un techo de 8.192 tokens frente a una ventana de 256K

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Supongamos que lo que necesitas que se juzgue es un expediente de reclamación de seguro de cuarenta páginas. internlm/Intern-Decision-2B lo rechazará. No lo truncará, no lo resumirá — lo rechazará, porque el motor de inferencia incluido declara DecisionEngine(max_length=8192) y la tarjeta del modelo dice en lenguaje sencillo que las entradas de tamaño excesivo se "rechazan sin truncamiento." google/gemma-4-12B-it — Gemma 4 12B Unified — tomará el mismo documento, más las fotografías escaneadas grapadas a él, más la llamada telefónica grabada, y te escribirá una respuesta. Ese contraste es toda la comparación, y casi no tiene nada que ver con los recuentos de parámetros — 2.213.241.664 frente a 11.959.730.224 — que una lectura de la hoja de especificaciones pondría en primer lugar.

Intern-Decision-2B es el intermedio de los tres puntos de control de decisión que InternLM subió a Hugging Face el 26 de septiembre de 2026 sin anuncio alguno, ajustado finamente a partir de Qwen/Qwen3.5-2B y con licencia Apache-2.0, con los términos de Qwen conservados junto a ella. Gemma 4 12B Unified es el modelo multimodal sin codificador de Google DeepMind de mayo de 2026, un sistema de cualquier modalidad a cualquier modalidad que toma texto, imagen, audio y vídeo y genera texto en una ventana de 256.000 tokens en más de 140 idiomas. Uno de estos es un puntuador. El otro es un generalista que resulta capaz de puntuar mal si le das un prompt con cuidado. Decidir entre ellos es menos una cuestión de benchmark que una cuestión sobre qué forma tiene ya tu respuesta.

Cuando los dos no son en realidad comparables

Vale la pena ser directo sobre esto antes de las cifras, porque el enfrentamiento invita a una falsa simetría.

Intern-Decision-2B no produce tokens. Recibe un estado, de una a dieciséis preguntas con nombre con hasta 62 opciones cada una y, opcionalmente, hasta ocho imágenes; genera un esqueleto JSON de asistente con un marcador de posición <decision> por campo; ejecuta una única pasada forward causal; lee los logits en la posición inmediatamente anterior a cada marcador de posición; aplica softmax únicamente sobre los símbolos permitidos de ese campo; y aplica una temperatura ajustada de 2.100509348278. La salida es una distribución calibrada y un argmax por campo. La tarjeta declara lo negativo sin rodeos: "Esta API realiza puntuación estructurada de candidatos. No llama a generate() ni muestrea texto de forma libre."

Gemma 4 12B genera. Todo lo que hace —razonamiento con pensamiento configurable, llamada a funciones, OCR, comprensión de gráficos, reconocimiento de voz, cobertura de 140 idiomas— se ejecuta mediante un bucle de decodificación sobre un vocabulario de 262.144 entradas. Pídele una decisión de enrutamiento con probabilidades y obtendrás prosa que contiene un número, y el número será el que haya producido el muestreador, no un softmax sobre tu conjunto de opciones.

Así que la pregunta práctica no es «cuál es más preciso». Es «¿mi respuesta ya es un conjunto cerrado?». Si lo es, el 12B es una forma derrochadora de elegir de una lista. Si no lo es, Intern-Decision-2B no puede ayudarte en absoluto, a ningún nivel de precisión.

El techo de entrada es la línea más nítida entre ellos

Esta es la dimensión que hay que sopesar por encima de todas las demás, porque produce fallos graves en lugar de degradados.

• Longitud de entrada — Intern-Decision-2B acepta 8.192 tokens y rechaza cualquier cosa más larga, de forma ruidosa; Gemma 4 12B acepta 256.000 tokens y, según la propia ficha de Google, obtiene un 43,4 % en MRCR v2 eight-needle a 128k.

• Imágenes — hasta ocho para Intern-Decision-2B, y cuentan contra el mismo presupuesto de 8,192 tokens; relación de aspecto y resolución variables para Gemma 4 12B, con entrada intercalada de texto e imágenes en cualquier orden.

• Modalidades de entrada: texto e imagen para uno; texto, imagen, audio y video para el otro.

• Lenguaje — no se hace ninguna afirmación multilingüe en ninguna parte de la documentación de Intern-Decision; Gemma 4 abarca más de 140 idiomas preentrenados con una puntuación multilingüe evaluada de 83,4 en MMMLU para el 12B.

• Salida — una distribución tipada de respuestas JSON para uno; texto generado para el otro.

El límite de 8.192 no es arbitrario, y eso es precisamente lo que lo hace difícil de sortear. El objetivo de decisión lee un logit en una posición fija por campo, así que el prompt debe contener el estado, el esquema y el esqueleto completo en una sola pasada; no hay ninguna estrategia de fragmentación que preserve el contrato. Un ticket, un correo electrónico, un estado JSON breve, una captura de pantalla o dos — ese es el centro de diseño. Un documento que requiere recuperación es un documento para el que este modelo no está pensado.

Lo que cada uno te cuesta, contado con honestidad

Intern-Decision-2B no tiene endpoint alojado ni proveedor. La página de modelo de OrcaRouter para él devuelve un 404, y nada en este artículo constituye una afirmación de disponibilidad. Invocarlo implica descargar aproximadamente 4,46 GB de repositorio —un shard de lenguaje de 3,76 GB, una torre de visión de 612,5 MB, un proyector de 50,3 MB— y ejecutar inference.py junto a los pesos en un entorno de Python 3.12 con torch 2.9.1 y transformers 5.14.1, en una GPU que estás pagando tanto si puntúa decisiones como si no.

Eso no es una desventaja en todos los casos, y vale la pena hacer la aritmética en lugar de suponer. A 33,28 ms de media por solicitud en una sola RTX 4090, según la propia medición de InternLM, un Intern-Decision-2B alojado localmente no cobra nada por decisión. Un generalista alojado cobra por token, incluidos los tokens que gasta pensando antes de responder. A escala, un evaluador que ya posees es el instrumento más barato: el costo es la GPU y la ingeniería, no la llamada.

Gemma 4 12B Unified tampoco está en nuestro catálogo; si lo quieres, descargas 11,96 mil millones de parámetros en BF16 y lo sirves tú mismo. Donde nuestro catálogo sí tiene rutas reales de Gemma 4 es en los otros dos tamaños, y son económicos: Gemma 4 26B A4B a 0,06 $ por millón de tokens de entrada y 0,33 $ por millón de salida, y Gemma 4 31B a 0,13 $ y 0,38 $, ambos listados con contextos de 262.144 tokens y un tiempo hasta el primer token P50 que el catálogo muestra en 1,73 segundos. Si tu problema resulta ser de razonamiento general en lugar de una decisión de conjunto cerrado, eso es lo que hay que comparar con un puntuador ejecutado localmente — dos modelos más con una sola clave, precio de lista del proveedor transferido sin margen, y conmutación por error automática para que un modelo que aún estás evaluando nunca se convierta en un punto único de fallo en una ruta de producción.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 input and $0.38 output per million tokens, and a P50 time to first token of 1.73 seconds.

Marcador, con las salvedades adjuntas

• Parámetros — Intern-Decision-2B 2.213.241.664 en BF16 más una torre de visión y un proyector; Gemma 4 12B Unified 11.959.730.224 en BF16.

• Contexto — 8,192 tokens, rechazado arriba, frente a 256,000 tokens.

• Salida — probabilidades calibradas y un argmax, sin texto; texto generado, token a token.

• Modalidad: texto más hasta ocho imágenes frente a entrada de texto, imagen, audio y vídeo, con salida de texto.

• Evidencia publicada: una tabla de proveedor con siete suites que promedia 84,68, con una puntuación de Brier de 0,437 y un ECE de 0,100, no reproducida por nadie fuera del laboratorio; una tarjeta de evaluación de Google con MMLU Pro 77,2 %, GPQA Diamond 78,8 %, AIME 2026 sin herramientas 77,5 % y LiveCodeBench v6 72,0, además de un listado independiente con un Artificial Analysis Intelligence Index de 14,2.

• Adopción — un me gusta y cero descargas en el checkpoint de 2B frente a una familia que lleva en circulación desde mayo con cuantizaciones, ajustes finos y derivados que se cuentan por cientos.

Lea las filas de evidencia de forma asimétrica, porque eso es lo que son. Los números de Google han sido indexados y reproducidos de forma independiente por terceros; los de InternLM no han sido ejecutados por nadie fuera del laboratorio, y la cifra de calibración, en particular, debería tratarse como una intención bien documentada hasta que se confronte con un conjunto de pruebas externo. El resumen honesto no es que la tabla del proveedor esté equivocada. Es que las dos columnas no tienen el mismo peso probatorio, y una comparación que imprime 84,68 junto a 77,2 sin decirlo está engañando a su lector.

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Gemma 4 12B'. The left column reads: Parameters 2.21B BF16 plus vision tower; Context 8,192 tokens, refused above; Output probabilities and an argmax, no text; Input text plus up to 8 images; Published evidence vendor table, unreproduced; Licence Apache 2.0 plus LICENSE-QWEN. The right column reads: Parameters 11.96B BF16; Context 256,000 tokens; Output generated text, token by token; Input text, image, audio and video; Published evidence Google card, AA Index 14.2; Licence Apache 2.0, Gemma 4 terms. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the Gemma 4 12B figures come from Google's own card plus an independent Artificial Analysis index.

Qué hacer con esto

Elige Intern-Decision-2B cuando la decisión esté realmente cerrada, el estado quepa cómodamente dentro de ocho mil tokens, quieras una probabilidad a la que puedas aplicar un umbral en lugar de un párrafo que tengas que interpretar, y tengas el hardware y las ganas de operar un checkpoint que nadie soporta todavía. El tamaño intermedio en concreto presenta la calibración publicada más débil de los tres que InternLM lanzó —ECE 0,100 frente a 0,066 para el modelo de la mitad de su tamaño y 0,065 para el de casi el doble—, así que, si vas a elegir dentro de esta familia, el 2B es el modelo sobre el que deberías ajustar tu propia temperatura, no el que deberías usar con confianza tal como viene.

Elige Gemma 4 12B —o, de forma más práctica, uno de los dos tamaños de Gemma 4 que realmente enrutamos— cuando la entrada sea más larga que una página, cuando haya audio o video o un idioma distinto del inglés, cuando la respuesta deba explicarse en lugar de seleccionarse sin más, o cuando no quieras hacerte cargo de la pila de inferencia. El 12B es el más pequeño de los modelos Gemma 4 con audio nativo; el 26B A4B activa alrededor de cuatro mil millones de parámetros por token y es la forma más económica de entrar en la familia.

Y si lo que en realidad tienes es un problema de puntuación con un documento largo adjunto, ninguno de estos es el instrumento adecuado: eso es un problema de recuperación disfrazado de artículo de comparación.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.