Un título generado para Microsoft-Decision-1 vs Gemma 4 12B subtareas: un evaluador sin tokens de salida contra un escritor sin conjunto cerrado, con chips que dicen versus prosa, contexto de 32,768 tokens versus 256,000, solo texto versus texto, audio y video, y API alojada versus pesos abiertos.
Guides & Insights

Microsoft-Decision-1 vs Gemma 4 12B: Uno elige de tu lista, el otro te escribe una nueva

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Pon Microsoft-Decision-1 y Gemma 4 12B uno al lado del otro y la diferencia que lo decide todo no es el tamaño, la precisión ni la licencia — es lo que ocurre después de que el modelo ha leído tu entrada. Gemma 4 12B, el modelo multimodal sin codificador de 11,96 mil millones de parámetros de DeepMind lanzado el 3 de junio de 2026 bajo Apache 2.0, lee texto, imágenes, audio o vídeo y luego te escribe una respuesta, token a token, a lo largo de una ventana de 256.000 tokens y en más de 140 idiomas. Microsoft-Decision-1 pasó a disponibilidad general en Microsoft Foundry el 8 de octubre de 2026 como un puntuador solo de texto entrenado posteriormente con Qwen3.5-9B: le entregas un estado y una pregunta cuyas respuestas ya has enumerado, y devuelve una probabilidad calibrada para cada opción en una sola pasada de hasta 32.768 tokens, sin generar nada. Un modelo te dice cuál de tus opciones es la correcta. El otro te dice cuáles deberían haber sido las opciones — y te cobra por cada palabra de eso.

Enmarcar esto como un concurso sería un error de categoría, y vale la pena decirlo antes de las líneas de especificación y no después. Estos dos no son sustitutos; se sitúan en extremos opuestos de un flujo de trabajo. La pregunta útil es qué extremo estás construyendo en realidad, porque la respuesta determina si estás comprando un juez o un escritor.

La factura es donde la diferencia deja de ser filosófica

Gemma 4 12B se factura como se factura todo modelo generativo: tokens de entrada y tokens de salida, ambos. Cuando le pides JSON estructurado, cada carácter de ese JSON se genera, se muestrea y se paga; y cuanto más anidado sea tu esquema, más larga será la respuesta y mayor será esa partida. Eso no es un defecto del modelo. Es lo que hace un decodificador, y es precisamente la partida que las cabezas de decisión existen para eliminar.

Microsoft-Decision-1 no tiene un lado de salida que facturar. Ejecuta una única pasada hacia delante sobre tu estado, tu pregunta y tu conjunto de opciones, lee una puntuación para cada candidato y devuelve. La consecuencia se acumula con el volumen, no con el tamaño del prompt: un pipeline que etiqueta diez mil registros con Gemma 4 12B produce diez mil documentos JSON, y el mismo pipeline con un evaluador de decisiones produce diez mil prompts y nada más. Si el ahorro absoluto es grande depende por completo de tu volumen y de lo abultado de tu esquema, y cualquiera con un presupuesto por token puede resolverlo en una hoja de cálculo. La dirección no está en disputa.

Hay una segunda asimetría, más pequeña: Microsoft no publica una tarifa en la página del modelo Microsoft-Decision-1. Los precios enlazan a la propia página de precios de Microsoft, así que el costo por decisión es algo que se consulta en Azure y no en la ficha. Lo que sí establece la página es que el 0 % de la llamada son tokens de salida, y que la inferencia por lotes está deshabilitada: no se puede amortizar una ejecución de puntuación masiva mediante un canal por lotes como se haría con un modelo generativo.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Gemma 4 12B. Left column Microsoft-Decision-1 rows read: parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; output probabilities with zero output tokens; modalities in text only; weights hosted, not distributed. Right column Gemma 4 12B rows read: parameters 11.96B encoder-free multimodal; context 256,000 tokens; output generated text billed per token; modalities in text, image, audio, video; weights Apache 2.0 and self-serve. A footer line reads that the Gemma 4 12B figures are Google-reported and Microsoft-Decision-1 has published no benchmark figures.

La misma entrada, dos respuestas diferentes

Dale a ambos modelos un ticket de soporte al cliente y una pregunta. Microsoft-Decision-1 devuelve algo como 0,83 para «facturación», 0,11 para «técnico», 0,04 para «cancelación», 0,02 para «no se puede determinar». Tienes una etiqueta que se puede nombrar, un número contra el que puedes aplicar un umbral y una vía de abstención —Microsoft documenta que se admite una opción al estilo «no se puede determinar» cuando la evidencia proporcionada es insuficiente, que es lo que hace que funcione la lógica de escalado. Lo que no obtienes es una razón.

Entrega el ticket a Gemma 4 12B y obtienes un párrafo. Puede razonar sobre la solicitud con pensamiento configurable, llamar a funciones, leer una factura escaneada adjunta al ticket, transcribir el buzón de voz grapado a él y responder en el propio idioma del cliente. Cada una de esas cosas es algo que Decision-1 no puede hacer con precisión alguna: su superficie de entrada es texto y nada más, y no está diseñado explícitamente para responder preguntas abiertas, conversar, traducir ni resumir.

Ninguna de las salidas de Gemma 4 12B es una probabilidad. Pídele una decisión de enrutamiento con confianza y obtendrás prosa que contiene un número, y ese número es lo que haya producido el muestreador, no un softmax sobre el conjunto de opciones que suministraste. Si un umbral posterior depende de que ese número signifique algo, tienes entre manos un proyecto de calibración, no un puntuador.

Que tu pregunta tenga un conjunto cerrado es toda la decisión

Esta es la prueba que hay que aplicar antes que cualquier otra cosa, y se tarda unos diez minutos con una pizarra.

• Si tu respuesta proviene de una lista que puedes enumerar de antemano —una etiqueta, una calificación, un sí/no, una puntuación de rúbrica, una ruta—, Microsoft-Decision-1 es el instrumento correcto, y Gemma 4 12B es una forma derrochadora y menos fiable de elegir de esa lista. Estarías pagándole a un decodificador para que adivine un número que ya has acotado.

• Si tu respuesta no es un conjunto cerrado —resume esto, explica aquello, escribe la respuesta, describe el gráfico—, Microsoft-Decision-1 no puede ayudar a ningún precio. No tiene ninguna vía hacia la prosa, ningún campo de justificación ni ningún mecanismo para producir algo que no hayas enumerado como opción.

• Si es ambas cosas, tienes una canalización de dos modelos en lugar de una elección, y la interesante pregunta de diseño pasa a ser cuál de los dos es dueño del umbral de escalado. El evaluador lo establece; el redactor rellena lo que ocurre por encima y por debajo de él.

Donde Gemma 4 12B es simplemente otro deporte

Al margen del marco de decisión, Gemma 4 12B no está por delante en una línea — está jugando a un juego distinto, y fingir lo contrario sería deshonesto.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.

• Modalidades — Microsoft-Decision-1 solo admite texto de entrada y produce valores numéricos de salida. Gemma 4 12B acepta texto, imagen, audio y video de forma nativa mediante un diseño sin codificador que proyecta parches y formas de onda sin procesar directamente en el espacio de incrustaciones, con entrada intercalada en cualquier orden.

• Contexto — 32.768 tokens para Microsoft-Decision-1 frente a 256.000 para Gemma 4 12B, que obtiene un 43,4 % en MRCR v2 eight-needle a 128k según la propia ficha de Google.

• Idioma — 25 idiomas compatibles con Microsoft-Decision-1, y Microsoft advierte que la cobertura, la calidad y la calibración "pueden variar según el idioma" y señala los idiomas no ingleses de bajos recursos como un punto débil; más de 140 para Gemma 4 12B, con una cifra de MMMLU evaluada de 83,4 para este tamaño.

• Rendimiento publicado: la pestaña Benchmarks de Microsoft-Decision-1 incluye una metodología y ninguna cifra; Google publica 77,2 % en MMLU Pro, 77,5 % en AIME 2026 sin herramientas, 72,0 % en LiveCodeBench v6, 78,8 % en GPQA Diamond, 69,1 % en MMMU Pro y 79,7 % en MATH-Vision para Gemma 4 12B.

• Distribución — Microsoft-Decision-1 es una API alojada exclusiva de Foundry, sin pesos, sin descarga y sin ruta de ajuste fino. Gemma 4 12B son pesos Apache 2.0 que se lanzaron en un ecosistema disponible desde el primer día compuesto por LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang y Unsloth.

• Runtime — la puntuación de decisiones es de una sola pasada, sin bucle de decodificación, así que la latencia escala con el prompt en lugar de con la longitud de la respuesta; Gemma 4 12B genera token a token, y los materiales de lanzamiento de Google lo sitúan en 16 GB de VRAM o memoria unificada.

La fila del benchmark es la que merece una pausa, en la dirección que menos favorece a Microsoft. Los números de Gemma 4 12B también los reporta el proveedor, pero tienen a sus espaldas meses de uso por parte de terceros, en marcos de evaluación públicos, sobre hardware que otras personas poseen. La entrada de Microsoft en esta categoría es la más nueva y la menos verificable de las dos, a pesar de provenir de la empresa más grande.

Cuánto te cuesta realmente llamar a cada uno

Gemma 4 12B en su forma 12B no está en nuestro catálogo — si ese es el tamaño que quieres, consigues 11.96 mil millones de parámetros en BF16 y lo sirves tú mismo. Lo que sí tiene nuestro catálogo es el resto de la línea Gemma 4, y es económico: Gemma 4 26B A4B a $0.06 por millón de tokens de entrada y $0.33 por millón de salida, y Gemma 4 31B a $0.13 y $0.38, ambos listados con contextos de 262,144 tokens. Esos son precios de lista del proveedor transferidos sin añadir ningún margen por nuestra parte, detrás de una única clave compatible con OpenAI junto a más de otros 200 modelos. Si tu problema resulta ser razonamiento general en lugar de una decisión de conjunto cerrado, uno de esos dos tamaños es lo barato con lo que medir contra un scorer autooperado — y si prefieres no comprometerte con un único escritor, el failover automático mantiene viva la pata de generación de un bucle de scoring cuando un proveedor se degrada.

A screenshot of OrcaRouter's own model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 per million input tokens and $0.38 per million output tokens, and a P50 time to first token figure.

Microsoft-Decision-1 es una implementación de Foundry que usted mismo aprovisiona, y no está disponible a través de nosotros. Nada de este artículo constituye una declaración de disponibilidad respecto a Microsoft-Decision-1, en ninguno de los dos lados de la llamada.

En resumen

Microsoft-Decision-1 pasó a disponibilidad general en Microsoft Foundry el 8 de octubre de 2026: un evaluador de solo texto, de 32.768 tokens, sobre una base Qwen3.5-9B que devuelve probabilidades calibradas sobre las opciones que enumeres, con cero tokens de salida, sin pesos y sin cifras de referencia publicadas. Gemma 4 12B es un generalista multimodal sin codificador de 11,96B, publicado el 3 de junio de 2026 bajo Apache 2.0, que razona, lee imágenes y audio y escribe respuestas a lo largo de 256.000 tokens. Elige por la forma de tu respuesta, no por el número de parámetros: un conjunto cerrado pertenece al evaluador, uno abierto pertenece al redactor, y pagar a un decodificador para que seleccione de una lista que ya escribiste es la forma más común en que los equipos gastan diez veces lo que cuesta una decisión.

Lo que sí ofrece nuestro catálogo es el resto de la línea Gemma 4, y es económico: Gemma 4 26B A4B a $0.06 por millón de tokens de entrada y $0.33 por millón de salida, y Gemma 4 31B a $0.13 y $0.38.