
Decision 3.0 vs. Microsoft-Decision-1: uno es una descarga, el otro es un SKU
- OrcaNUEVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 por 1M de tokens · 71 tok/s
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
El nivel 9B de Decision 3.0 y Microsoft-Decision-1 son, sobre el papel, el mismo producto. Ambos someten a Qwen3.5-9B a un entrenamiento posterior para convertirlo en un evaluador que responde a un conjunto fijo de respuestas candidatas con una probabilidad calibrada para cada una, sin llegar a generar jamás un token. Ambos apuntan a los mismos trabajos: enrutar una solicitud, calificar una salida según una rúbrica, autorizar una acción de agente, clasificar por prioridad una cola. Ambos salieron con menos de una semana de diferencia: Microsoft-Decision-1 pasó a estar disponible de forma general en Microsoft Foundry el 8 de octubre de 2026 y se anunció al día siguiente, y d3-flash se subió a Hugging Face a las 17:23 UTC del 10 de octubre de 2026.
La diferencia no es el modelo. Es lo que se te permite hacer con él. d3-flash es un checkpoint Apache-2.0 de 8,39 mil millones de parámetros que descargas y ejecutas, y ocupa el tercer lugar en una familia que empieza en 0,59 mil millones de parámetros y llega hasta 26,09 mil millones. Microsoft-Decision-1 es un endpoint alojado en Foundry, con pesos que no se distribuyen en absoluto, en una línea que, según Microsoft, hará rebase sobre sus propios modelos MAI más adelante. Uno de estos es un artefacto; el otro es un servicio. Casi todas las preguntas prácticas sobre este par se derivan de ese único hecho, incluidas las que parecen ser sobre benchmarks.
Dos decisiones sobre para qué sirve un modelo de decisión
La publicación de Microsoft es explícita sobre el alcance de una forma en que las fichas de modelo rara vez lo son. Las formas de pregunta admitidas son sí/no, opción múltiple, valoración, clasificación y calificación basada en rúbricas. Las exclusiones se enumeran con la misma claridad: no está diseñado para generación de texto, respuesta a preguntas abiertas, conversación, traducción o resumen, y no está pensado para tareas que requieran conocimiento ausente de la entrada. Realiza una sola pasada sobre hasta 32.768 tokens y emite cero tokens de salida porque no hay bucle de decodificación. Microsoft también admite una opción de abstención como «no se puede determinar» cuando la evidencia proporcionada es insuficiente, que es el detalle que hace que aplicar un umbral a la salida tenga algún sentido.
d3-flash se sitúa dentro de la misma caja conceptual —preguntas de Choice, Noul (sí/no) y Score, una pasada hacia adelante por pregunta, una probabilidad por opción, sin generación— y luego amplía el lado de la entrada. Donde Microsoft-Decision-1 es solo texto por diseño, d3-flash acepta texto o JSON, varias imágenes por solicitud de hasta 1,6 megapíxeles cada una, y varios vídeos leídos a 2 fotogramas por segundo. Cada pregunta de una solicitud ve todas las imágenes y vídeos adjuntos a ella. Es un modelo más pequeño que hace más con la entrada que recibe.
Esa es la primera división real, y no es una cuestión de gusto. Si la decisión que necesitas tomar es sobre una captura de pantalla, un recibo, un gráfico o un clip de una cámara, Microsoft-Decision-1 no puede tomarla. Esa es una frontera de capacidad, no una brecha de calidad, y ninguna cantidad de trabajo en precisión la cierra.
Qué publica cada uno, y cómo
Aquí los dos lanzamientos están haciendo tipos de prueba genuinamente distintos, y vale la pena separarlos en lugar de limitarse a alinear cifras.
Microsoft realizó una comparación de 36 benchmarks que abarcaba casi 150.000 preguntas mantenidas a ciegas respecto al entrenamiento, que cubría enrutamiento, ranking, contexto largo, tareas multilingües y fuera de distribución, razonamiento y seguridad, y afirma que su modelo resultó el mejor en todos esos conjuntos. Informa la latencia como una proporción en lugar de un número — p50 alrededor de 35 veces más rápido que GPT-6 Sol, y 2,5 veces más rápido que H2O-Lightning-4B v1.1, al que nombra como subcampeón. Documenta la robustez como un procedimiento: la misma solicitud perturbada de ocho maneras, una tasa media de cambio de decisión del 1,3 %, y cero cambios cuando se parafrasean las descripciones de las opciones o se invierten o se barajan las opciones. Probó la seguridad con 5.250 solicitudes en 11 benchmarks que abarcaban contenido dañino, jailbreaking e inyección de prompts. Declara el estándar de calibración que se exige a sí mismo — una predicción del 90 % debería ser correcta aproximadamente nueve de cada diez veces en casos representativos.
vLLM-SR publicó un índice. El Jev Decision Index 0.3.1 sitúa a d3 en 64.7, con d3-flash en public-suite 57.79, una ganancia declarada de 11.0 sobre el modelo 9B de Decision 2.0 en 46.76. También afirma que las 140,178 solicitudes públicas fueron respondidas sin ninguna sin respaldo, lo cual es una declaración de cobertura y no de precisión. La ficha revela que la fila propia de d3 es una evaluación interna, mientras que las filas de comparación junto a ella —Perplexity Decider v1.1, Fastino GLiDE, Jev, Torchcast Decision 27B— son datos en vivo del tablero. Y en el lado multimodal, los modelos de la familia d3 informan puntuaciones del Perception Test en las 19,140 preguntas de validación, con d3-flash en 73.3 frente a un suelo de azar de tres opciones de 33.3.
Así que: Microsoft publica una afirmación de amplitud con un método documentado y una cifra de robustez, y ninguna cifra de calibración por checkpoint. vLLM-SR publica una posición en la tabla de clasificación con una brecha de procedencia declarada entre su propia fila y las demás, además de un resultado en vídeo, y tampoco ninguna cifra de calibración. Ninguna de las dos tarjetas incluye una puntuación de Brier ni un número de error de calibración esperado para el modelo que describe. Para dos productos cuya propuesta de valor entera radica en que el número devuelto signifique algo, ese es el hueco compartido, y es lo más útil que cualquiera de los dos proveedores podría lanzar a continuación.

La distribución decide más que la ficha técnica
Aquí es donde la comparación deja de tratarse de modelos.
Con d3-flash obtienes pesos, un decision_config.json que fija la revisión base, un manifiesto SHA-256 por archivo, código de modelado personalizado, una cabeza de lectura y un conjunto de dependencias documentado que incluye transformers==5.17.0 y un paquete opcional de kernels CUDA para las capas de atención lineal. Puedes ejecutarlo en tu propio hardware, ajustarlo finamente, cuantizarlo, aislarlo en air-gap. También asumes el trabajo operativo: una clase de Python no es un endpoint, y la tarjeta no indica un presupuesto de tokens para estado más preguntas más descripciones de candidatos — max_length es null en la configuración enviada, así que ese límite es tuyo para descubrirlo.
Con Microsoft-Decision-1 obtienes un endpoint dentro de una cuenta de nube existente, con la autenticación, la disponibilidad regional y los controles de aprovisionamiento que conlleva, y no tienes que asumir nada del trabajo operativo. Tampoco obtienes nada del control. No hay repositorio que descargar, ni ruta de ajuste fino, ni opción de autoalojamiento; el ciclo de vida del modelo es de Microsoft, no tuyo, y un aviso de descontinuación o una migración a una columna vertebral distinta es un cambio que absorbes en lugar de uno que planificas. Microsoft ha dicho que se avecina una migración a sus propios modelos MAI, lo cual es una hoja de ruta razonable para un modelo cuyo objetivo es la puntuación rápida de una sola pasada, y también significa que el checkpoint concreto que evaluaste no es necesariamente el que estarás invocando dentro de un año.
La historia de la latencia también debe leerse con atención. La cifra destacada de Microsoft es una ratio frente a un modelo de propósito general mucho más grande, que es la comparación correcta para su argumento —la función de un modelo de decisión es sustituir una llamada generativa costosa por una de puntuación barata—, y 35x frente a GPT-6 Sol en p50 es el aspecto que tiene ese argumento cuando da en el clavo. Las cifras de vLLM-SR son absolutas, de una sola solicitud y una sola GPU, y muestran el impuesto de la modalidad con claridad: en una AMD Instinct MI325X, una solicitud de texto a d3-flash tarda una mediana de 19,1 ms, la misma solicitud con una imagen tarda 149,4 ms y, con un vídeo de diez segundos, 407,6 ms. Ambos conjuntos son reportados por el proveedor, sobre hardware diferente, y ninguno se ha reproducido fuera del laboratorio que lo produjo.

Cómo elegir
La regla de decisión es breve, lo cual es una buena señal de que los dos productos en realidad no compiten por el mismo espacio.
Elige Microsoft-Decision-1 si la decisión es solo texto, si ya ejecutas en Foundry y si ser una llamada en lugar de un despliegue es el objetivo principal: no hay GPU que comprar, ni contenedor que operar, ni ciclo de vida de modelo que gestionar. El material de apoyo de Microsoft también es el más utilizable de los dos para un equipo de plataforma: las perturbaciones, los recuentos de pruebas de seguridad y la afirmación de que se admite una opción de abstención son las cosas que necesitas para escribir una política de umbral, y el límite de 32.768 tokens se indica en lugar de dejarlo en blanco.
Elige Decision 3.0 — en la práctica, d3-flash o d3-mini — si alguna parte de la decisión depende de una imagen o un clip, si necesitas ejecutarlo en algún sitio al que una API alojada no pueda llegar, o si quieres afinar el scorer con tus propios casos etiquetados. La licencia Apache-2.0 y el manifiesto de hash a nivel de archivo hacen que sea una opción real y no teórica. Lo que aceptas a cambio es un presupuesto de entrada no declarado, ninguna calibración publicada y el hecho de que la familia tiene solo unos días, con prácticamente ningún uso externo que la respalde.
Si necesitas ambos —un puntuador alojado para la ruta de texto habitual y uno autoalojado para los casos multimodales o aislados, invocados a través de la misma interfaz—, entonces la postura honesta es que ningún proveedor te ofrece eso actualmente, y los dos formatos de solicitud son lo suficientemente parecidos como para unificarlos, pero no idénticos.
Dónde encaja OrcaRouter y dónde no
typesafe/jev-1.13 es el modelo de decisión de nuestro catálogo, servido mediante POST /v1/systemone con el mismo contrato de estado y preguntas con nombre que implementan los dos modelos anteriores: texto de entrada, JSON estructurado de salida, hasta aproximadamente 64K tokens de entrada, sin streaming, $0.042 por millón de tokens de entrada y sin cargo por finalización, porque nunca genera ninguna. Cabe destacar que la pregunta sobre el presupuesto de tokens al estilo Android que ninguna de las dos tarjetas anteriores responde por completo se responde aquí.
No ofrecemos ninguno de los dos modelos en esta comparación. Los checkpoints de Decision 3.0 se distribuyen como una ruta de inferencia local en un repositorio de Hugging Face en lugar de un endpoint enrutable, y Microsoft-Decision-1 se distribuye a través de la propia plataforma de Microsoft y varias plataformas de terceros — no a través de nosotros. Nada de lo aquí expuesto debe interpretarse como una afirmación de disponibilidad para ninguno de los dos.
Lo que la capa de enrutamiento realmente aporta en esta decisión está en la otra mitad del bucle. Un scorer es barato por construcción; el modelo que actúa sobre su salida no lo es, y emparejar un modelo de decisión con uno generativo normalmente implica dos integraciones, dos relaciones de facturación y dos modos de fallo. Llamar a ambos con una sola clave en más de 200 modelos — con conmutación automática por fallo cuando un proveedor se tambalea, y el precio de lista del proveedor repercutido con un 0 % de margen, de modo que un cambio de precio de un proveedor esté activo ese mismo día — significa que puedes cambiar el scorer sin tocar el punto de llamada. Eso importa más de lo habitual aquí, porque ambos modelos son lo bastante recientes como para que la decisión que tomes esta semana sea una que deberías poder revertir el mes que viene.

La pregunta que decidirá esto en seis meses
Dos equipos sometieron el mismo checkpoint base a un post-entrenamiento para convertirlo en el mismo tipo de producto en la misma semana y llegaron a conclusiones opuestas sobre cómo debería llegar a un cliente. Eso no es tanto una coincidencia temporal como una bifurcación en la forma en que se vende la categoría: como pesos o como servicio, como algo que posees o algo a lo que llamas.
Vigila tres señales. Si el cambio de base de Microsoft a MAI o a sus propios modelos altera el comportamiento de precisión y latencia que vende actualmente — y cuánto aviso previo reciben los clientes. Si vLLM-SR publica un presupuesto de entrada y una cifra de calibración para Decision 3.0, cerrando la brecha que impide que su índice sea accionable. Y si alguien fuera de cualquiera de los dos laboratorios ejecuta la suite pública con los pesos d3 publicados, porque en este momento el único número que zanjaría esta comparación es uno que ningún proveedor ha producido.
