
Microsoft-Decision-1 vs Gemma 4 12B: Uno elige de tu lista, el otro te escribe una nueva
- OrcaNUEVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 por 1M de tokens · 69 tok/s
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 367 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
Pon Microsoft-Decision-1 y Gemma 4 12B uno al lado del otro y la diferencia que lo decide todo no es el tamaño, la precisión ni la licencia — es lo que ocurre después de que el modelo ha leído tu entrada. Gemma 4 12B, el modelo multimodal sin codificador de 11,96 mil millones de parámetros de DeepMind lanzado el 3 de junio de 2026 bajo Apache 2.0, lee texto, imágenes, audio o vídeo y luego te escribe una respuesta, token a token, a lo largo de una ventana de 256.000 tokens y en más de 140 idiomas. Microsoft-Decision-1 pasó a disponibilidad general en Microsoft Foundry el 8 de octubre de 2026 como un puntuador solo de texto entrenado posteriormente con Qwen3.5-9B: le entregas un estado y una pregunta cuyas respuestas ya has enumerado, y devuelve una probabilidad calibrada para cada opción en una sola pasada de hasta 32.768 tokens, sin generar nada. Un modelo te dice cuál de tus opciones es la correcta. El otro te dice cuáles deberían haber sido las opciones — y te cobra por cada palabra de eso.
Enmarcar esto como un concurso sería un error de categoría, y vale la pena decirlo antes de las líneas de especificación y no después. Estos dos no son sustitutos; se sitúan en extremos opuestos de un flujo de trabajo. La pregunta útil es qué extremo estás construyendo en realidad, porque la respuesta determina si estás comprando un juez o un escritor.
La factura es donde la diferencia deja de ser filosófica
Gemma 4 12B se factura como se factura todo modelo generativo: tokens de entrada y tokens de salida, ambos. Cuando le pides JSON estructurado, cada carácter de ese JSON se genera, se muestrea y se paga; y cuanto más anidado sea tu esquema, más larga será la respuesta y mayor será esa partida. Eso no es un defecto del modelo. Es lo que hace un decodificador, y es precisamente la partida que las cabezas de decisión existen para eliminar.
Microsoft-Decision-1 no tiene un lado de salida que facturar. Ejecuta una única pasada hacia delante sobre tu estado, tu pregunta y tu conjunto de opciones, lee una puntuación para cada candidato y devuelve. La consecuencia se acumula con el volumen, no con el tamaño del prompt: un pipeline que etiqueta diez mil registros con Gemma 4 12B produce diez mil documentos JSON, y el mismo pipeline con un evaluador de decisiones produce diez mil prompts y nada más. Si el ahorro absoluto es grande depende por completo de tu volumen y de lo abultado de tu esquema, y cualquiera con un presupuesto por token puede resolverlo en una hoja de cálculo. La dirección no está en disputa.
Hay una segunda asimetría, más pequeña: Microsoft no publica una tarifa en la página del modelo Microsoft-Decision-1. Los precios enlazan a la propia página de precios de Microsoft, así que el costo por decisión es algo que se consulta en Azure y no en la ficha. Lo que sí establece la página es que el 0 % de la llamada son tokens de salida, y que la inferencia por lotes está deshabilitada: no se puede amortizar una ejecución de puntuación masiva mediante un canal por lotes como se haría con un modelo generativo.

La misma entrada, dos respuestas diferentes
Dale a ambos modelos un ticket de soporte al cliente y una pregunta. Microsoft-Decision-1 devuelve algo como 0,83 para «facturación», 0,11 para «técnico», 0,04 para «cancelación», 0,02 para «no se puede determinar». Tienes una etiqueta que se puede nombrar, un número contra el que puedes aplicar un umbral y una vía de abstención —Microsoft documenta que se admite una opción al estilo «no se puede determinar» cuando la evidencia proporcionada es insuficiente, que es lo que hace que funcione la lógica de escalado. Lo que no obtienes es una razón.
Entrega el ticket a Gemma 4 12B y obtienes un párrafo. Puede razonar sobre la solicitud con pensamiento configurable, llamar a funciones, leer una factura escaneada adjunta al ticket, transcribir el buzón de voz grapado a él y responder en el propio idioma del cliente. Cada una de esas cosas es algo que Decision-1 no puede hacer con precisión alguna: su superficie de entrada es texto y nada más, y no está diseñado explícitamente para responder preguntas abiertas, conversar, traducir ni resumir.
Ninguna de las salidas de Gemma 4 12B es una probabilidad. Pídele una decisión de enrutamiento con confianza y obtendrás prosa que contiene un número, y ese número es lo que haya producido el muestreador, no un softmax sobre el conjunto de opciones que suministraste. Si un umbral posterior depende de que ese número signifique algo, tienes entre manos un proyecto de calibración, no un puntuador.
Que tu pregunta tenga un conjunto cerrado es toda la decisión
Esta es la prueba que hay que aplicar antes que cualquier otra cosa, y se tarda unos diez minutos con una pizarra.
• Si tu respuesta proviene de una lista que puedes enumerar de antemano —una etiqueta, una calificación, un sí/no, una puntuación de rúbrica, una ruta—, Microsoft-Decision-1 es el instrumento correcto, y Gemma 4 12B es una forma derrochadora y menos fiable de elegir de esa lista. Estarías pagándole a un decodificador para que adivine un número que ya has acotado.
• Si tu respuesta no es un conjunto cerrado —resume esto, explica aquello, escribe la respuesta, describe el gráfico—, Microsoft-Decision-1 no puede ayudar a ningún precio. No tiene ninguna vía hacia la prosa, ningún campo de justificación ni ningún mecanismo para producir algo que no hayas enumerado como opción.
• Si es ambas cosas, tienes una canalización de dos modelos en lugar de una elección, y la interesante pregunta de diseño pasa a ser cuál de los dos es dueño del umbral de escalado. El evaluador lo establece; el redactor rellena lo que ocurre por encima y por debajo de él.
Donde Gemma 4 12B es simplemente otro deporte
Al margen del marco de decisión, Gemma 4 12B no está por delante en una línea — está jugando a un juego distinto, y fingir lo contrario sería deshonesto.

• Modalidades — Microsoft-Decision-1 solo admite texto de entrada y produce valores numéricos de salida. Gemma 4 12B acepta texto, imagen, audio y video de forma nativa mediante un diseño sin codificador que proyecta parches y formas de onda sin procesar directamente en el espacio de incrustaciones, con entrada intercalada en cualquier orden.
• Contexto — 32.768 tokens para Microsoft-Decision-1 frente a 256.000 para Gemma 4 12B, que obtiene un 43,4 % en MRCR v2 eight-needle a 128k según la propia ficha de Google.
• Idioma — 25 idiomas compatibles con Microsoft-Decision-1, y Microsoft advierte que la cobertura, la calidad y la calibración "pueden variar según el idioma" y señala los idiomas no ingleses de bajos recursos como un punto débil; más de 140 para Gemma 4 12B, con una cifra de MMMLU evaluada de 83,4 para este tamaño.
• Rendimiento publicado: la pestaña Benchmarks de Microsoft-Decision-1 incluye una metodología y ninguna cifra; Google publica 77,2 % en MMLU Pro, 77,5 % en AIME 2026 sin herramientas, 72,0 % en LiveCodeBench v6, 78,8 % en GPQA Diamond, 69,1 % en MMMU Pro y 79,7 % en MATH-Vision para Gemma 4 12B.
• Distribución — Microsoft-Decision-1 es una API alojada exclusiva de Foundry, sin pesos, sin descarga y sin ruta de ajuste fino. Gemma 4 12B son pesos Apache 2.0 que se lanzaron en un ecosistema disponible desde el primer día compuesto por LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang y Unsloth.
• Runtime — la puntuación de decisiones es de una sola pasada, sin bucle de decodificación, así que la latencia escala con el prompt en lugar de con la longitud de la respuesta; Gemma 4 12B genera token a token, y los materiales de lanzamiento de Google lo sitúan en 16 GB de VRAM o memoria unificada.
La fila del benchmark es la que merece una pausa, en la dirección que menos favorece a Microsoft. Los números de Gemma 4 12B también los reporta el proveedor, pero tienen a sus espaldas meses de uso por parte de terceros, en marcos de evaluación públicos, sobre hardware que otras personas poseen. La entrada de Microsoft en esta categoría es la más nueva y la menos verificable de las dos, a pesar de provenir de la empresa más grande.
Cuánto te cuesta realmente llamar a cada uno
Gemma 4 12B en su forma 12B no está en nuestro catálogo — si ese es el tamaño que quieres, consigues 11.96 mil millones de parámetros en BF16 y lo sirves tú mismo. Lo que sí tiene nuestro catálogo es el resto de la línea Gemma 4, y es económico: Gemma 4 26B A4B a $0.06 por millón de tokens de entrada y $0.33 por millón de salida, y Gemma 4 31B a $0.13 y $0.38, ambos listados con contextos de 262,144 tokens. Esos son precios de lista del proveedor transferidos sin añadir ningún margen por nuestra parte, detrás de una única clave compatible con OpenAI junto a más de otros 200 modelos. Si tu problema resulta ser razonamiento general en lugar de una decisión de conjunto cerrado, uno de esos dos tamaños es lo barato con lo que medir contra un scorer autooperado — y si prefieres no comprometerte con un único escritor, el failover automático mantiene viva la pata de generación de un bucle de scoring cuando un proveedor se degrada.

Microsoft-Decision-1 es una implementación de Foundry que usted mismo aprovisiona, y no está disponible a través de nosotros. Nada de este artículo constituye una declaración de disponibilidad respecto a Microsoft-Decision-1, en ninguno de los dos lados de la llamada.
En resumen
Microsoft-Decision-1 pasó a disponibilidad general en Microsoft Foundry el 8 de octubre de 2026: un evaluador de solo texto, de 32.768 tokens, sobre una base Qwen3.5-9B que devuelve probabilidades calibradas sobre las opciones que enumeres, con cero tokens de salida, sin pesos y sin cifras de referencia publicadas. Gemma 4 12B es un generalista multimodal sin codificador de 11,96B, publicado el 3 de junio de 2026 bajo Apache 2.0, que razona, lee imágenes y audio y escribe respuestas a lo largo de 256.000 tokens. Elige por la forma de tu respuesta, no por el número de parámetros: un conjunto cerrado pertenece al evaluador, uno abierto pertenece al redactor, y pagar a un decodificador para que seleccione de una lista que ya escribiste es la forma más común en que los equipos gastan diez veces lo que cuesta una decisión.
Lo que sí ofrece nuestro catálogo es el resto de la línea Gemma 4, y es económico: Gemma 4 26B A4B a $0.06 por millón de tokens de entrada y $0.33 por millón de salida, y Gemma 4 31B a $0.13 y $0.38.
