
Microsoft-Decision-1 vs Kev: ¿Comprar una puntuación o poseer la receta que la produce?
- OrcaNUEVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 por 1M de tokens
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
Jared Palmer puso un comprobante junto a su modelo. La familia Kev —Kev-0.8B, Kev-4B y Kev-9B, construida sobre checkpoints base de pesos abiertos congelados con un adaptador LoRA de rango 16 y una pequeña cabeza de puntero— se lanzó el 24 de septiembre de 2026 con su receta de entrenamiento, sus recuentos de datos etapa por etapa y sus cifras de evaluación, todo publicado, y el titular honesto para cualquiera que la compare con Microsoft-Decision-1 es que Kev te dice mucho más sobre cómo reproducirse a sí misma. El evaluador de Microsoft pasó a disponibilidad general en Microsoft Foundry el 8 de octubre de 2026: una base Qwen3.5-9B entrenada posteriormente por Microsoft, contexto de 32.768 tokens, solo texto, pesos no distribuidos, una metodología de evaluación publicada y ningún resultado publicado. Ambos toman un estado y un conjunto de preguntas tipadas y devuelven una distribución calibrada en lugar de texto generado. Uno es un servicio; el otro es un método que puedes ejecutar en un cuaderno esta misma noche.
La razón por la que esa distinción decide este enfrentamiento en lugar de la capacidad: Kev-4B reporta un ECE de 0.017 en su prueba bloqueada fuera de dominio y Microsoft-Decision-1 no reporta nada, así que el argumento de calibración que suele zanjar una comparación entre evaluadores solo cuenta con un lado exponiendo su posición.
Lo que Kev publica en realidad
La tarjeta de Kev-4B es inusualmente específica, y la especificidad es lo que importa. El backbone es Qwen3.5-4B-Base, congelado en una revisión con nombre, con 24 capas de atención lineal Gated DeltaNet y 8 capas de atención completa con un tamaño oculto de 2.560. Sobre él se asienta un adaptador LoRA de rango 16 —33,8 millones de parámetros entrenables, aplicado a las proyecciones de atención, MLP y DeltaNet—, y una cabeza pointer que puntúa el token de cierre de cada opción frente al token final de la pregunta y aplica softmax. Una temperatura, T = 2,41, se almacena en el archivo de la cabeza y se aplica al cargar, y la tarjeta proporciona el valor ajustado y el hash del archivo. El entrenamiento se realizó por etapas con recuentos de registros publicados: una receta base de 12.576 registros, 1.425 para fechas y evidencia faltante, 5.219 narrativas reales de quejas del CFPB, 6.000 registros de habilidades y 5.320 registros de herramientas para desarrolladores, con etapas posteriores que reproducían las anteriores. La tarjeta también indica lo que no se usó: «No se usó ninguna salida de Jev (el modelo de decisión alojado por TypeSafe)».
La tabla de evaluación comparativa se presenta en la misma página y viene acompañada de los casos de fallo adjuntos, lo cual es más raro que los casos de éxito. Prueba bloqueada fuera de dominio de Transfer-v4: exactitud 0,838, Brier 0,224, ECE 0,017. Breadth-v1 sobre 14 conjuntos de datos reservados y 3.089 preguntas: exactitud de 0,690, ECE de 0,029. Prueba de Hard-v1: 0,803. Prueba de Documents-v1: 0,903. MMLU-Pro con diez opciones: 0,565. Aritmética de fechas: 0,65, señalada por el autor como el área más débil, con un flag de preprocesador ofrecido como solución parcial y una nota explícita de que no se volvió a medir. La sección de limitaciones añade que la calibración es una única temperatura dentro de la distribución, por lo que la cobertura se degrada fuera del dominio; que el orden de las opciones puede invertir una respuesta; y que las longitudes de más de 8.192 tokens se sirven pero no se validan. También se publican cifras de servicio: 18,1 ms para seis preguntas sobre un estado corto en una H100, 12,9 ms en caché, 14,3 GB de memoria residente de GPU.

Lo que Microsoft publica en su lugar
Microsoft-Decision-1 cubre gran parte del mismo terreno con una postura distinta. Puntúa preguntas de sí/no, opción múltiple, calificación, clasificación y rúbrica, admite opciones explícitas de abstención como «no se puede determinar», devuelve probabilidades en JSON y se ejecuta en una sola invocación con hasta 32K tokens —cuatro veces el contexto que valida Kev—. Se distribuye como una API alojada en Microsoft Foundry dentro del portafolio Direct from Azure, con implementación sin servidor y de punto de conexión unificado, SKU estándar, autenticación de Azure y una ruta de facturación unificada. La inferencia por lotes está deshabilitada, y no hay descarga de pesos ni ruta de ajuste fino.
La sección de evaluación describe benchmarks de decisión públicos y comunitarios, además de conjuntos internos reservados; métricas que incluyen exactitud y error de calibración; orden de opciones variado; pruebas estadísticas emparejadas; y una afirmación de que el modelo "rinde a la par de los modelos de decisión líderes y por delante de otros modelos de decisión abiertos evaluados con la misma metodología". No hay ninguna tabla. La tarjeta del modelo nombra sus propios límites con honestidad —las puntuaciones cambian con la redacción y el orden de las opciones, la calibración es más sólida en tipos de tareas familiares, no se producen explicaciones y la cobertura en idiomas distintos del inglés es la más débil—, pero una lista de limitaciones no es una medición de calibración. Quien establece un umbral de aceptación automática de 0,9 en Microsoft-Decision-1 lo hace por fe y lo ajusta en producción.

La parte de la comparación que cuesta dinero
La economía de Kev es la razón por la que este enfrentamiento está realmente reñido. La receta es una base congelada más un adaptador de 33,8 M, lo que significa que el modelo marginal que entrenas cuesta un cómputo del tamaño de un adaptador, no un cómputo del tamaño de un modelo fundacional. Puedes mantener la base en memoria una sola vez y cargar varios adaptadores —uno por dominio de decisión—, una forma de despliegue que la API alojada de Microsoft no puede expresar en absoluto. Si tus reglas de enrutamiento difieren de las de un juez genérico, Kev te permite entrenar la diferencia; Microsoft-Decision-1 te permite escribir un mejor prompt y esperar.
En cambio, la API alojada no conlleva ninguna superficie operativa. No hay ningún adaptador que rastrear, ni una pila de servicio que mantener caliente, ni una brecha de contexto entre lo validado y lo servido sobre la que razonar, ni riesgo de que una temperatura ajustada en un conjunto de datos se comporte de forma distinta en el tuyo. Para un equipo cuyo volumen de decisiones es modesto, el servicio es el artefacto más barato en horas de ingeniería, aunque los tokens cuesten dinero; para un equipo que puntúa millones de elementos al día, el adaptador autoalojado gana en coste unitario en el momento en que la GPU está pagada.
Hay una tercera vía que no utiliza ninguno de los dos modelos para la parte en la que cada uno es más débil, y ahí es donde se encuentra OrcaRouter. No alojamos Microsoft-Decision-1 ni Kev — un evaluador que devuelve probabilidades no es un destino de chat-completions, y ninguno de los dos modelos está en nuestro catálogo. La mitad generativa de un pipeline de decisión es lo que ofrecemos: el modelo que redacta la respuesta candidata, escribe la rúbrica o emite la llamada a herramienta que se puntúa. Todo eso está detrás de una única clave compatible con OpenAI con más de 200 modelos disponibles en ella al precio de lista del proveedor, trasladado con un 0 % de margen, así que un cambio de precio de un proveedor se refleja de nuestro lado el mismo día. Si estás construyendo un bucle de calificación o de triaje, la llamada de redacción se puede enrutar y la de puntuación no, y mantener clara esa frontera es lo que evita que un pipeline de puntuación se convierta silenciosamente en un pipeline de chat.

Cómo decidir
Elige Kev cuando necesites cifras antes de lanzar, cuando quieras ajustar con tus propias etiquetas de decisión, cuando quieras ejecutar la puntuación dentro de tu propio límite a coste marginal cero, o cuando quieras que varios dominios de decisión compartan un único modelo base residente. Sus cifras de ECE publicadas siguen siendo mediciones del propio autor con su propio arnés — considéralas una autoevaluación creíble, no un resultado auditado por terceros —, pero al menos son una escala declarada que puedes intentar reproducir, y la receta está justo ahí para reproducirlas.
Elige Microsoft-Decision-1cuando el factor decisivo sea la adquisición o la longitud del contexto: un endpoint gestionado de Azure con facturación unificada y un paquete de IA Responsable, 32K de entrada para documentos largos, y un proveedor al que escalar. Su tabla de benchmarks ausente no es un escándalo —muchos modelos alojados se lanzan sin una—, pero sí significa que la primera curva de calibración de este modelo la trazarán sus propios usuarios, y deberías planear ser uno de ellos, con tus propios datos etiquetados, antes de apuntarle un umbral de producción.
