
Microsoft-Decision-1 vs. Intern-Decision-4B: Uno publica su calibración, el otro publica su metodología
- OrcaNUEVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 por 1M de tokens
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
Pon Microsoft-Decision-1 junto a Intern-Decision-4B y obtienes una comparación que se decide menos por la capacidad que por lo que cada proveedor estuvo dispuesto a publicar. El modelo de Microsoft alcanzó la disponibilidad general en Microsoft Foundry el 8 de octubre de 2026: una base Qwen3.5-9B, entrenada posteriormente por Microsoft, solo texto, contexto de 32.768 tokens, pesos no distribuidos, una metodología de evaluación que describe exactitud, error de calibración y pruebas estadísticas pareadas — y ni un solo resultado. El Intern-Decision-4B de InternLM se publicó en Hugging Face el 26 de septiembre de 2026 a las 05:36:37 UTC sin ningún anuncio detrás, es un ajuste fino de Qwen3.5-4B, acepta imágenes además de texto, se ejecuta en 44 milisegundos en una sola RTX 4090 y muestra una tabla completa de cifras de Brier y de error de calibración esperado. Ambos devuelven una distribución de probabilidad sobre las opciones que proporciones. Solo uno de ellos te dice lo bien que lo hace.
Esa inversión —que el modelo más grande y mejor financiado sea el opaco— es toda la esencia de este enfrentamiento, y decide la elección para la mayoría de los equipos más rápido que cualquier línea de especificación.
El único número que los separa
InternLM informa Brier 0.347 y ECE 0.065 para Intern-Decision-4B en su conjunto de pruebas comparativas, con una puntuación media de 90.02 en Jevbench-Easy (100.00), Jevbench-Original (98.61), Jevbench-Hard (73.87), Typed Decision (80.55), ToolACE (96.45), AG News (90.82) y WildJailBreak (89.86). Son cifras reportadas por el proveedor en el propio banco de pruebas del proveedor y, en particular, las filas de Jevbench pertenecen a la propia familia de pruebas comparativas del proyecto; léelas como una autoevaluación, no como una verificación independiente. Pero son números con una escala declarada, y el ECE en particular es la cifra que te indica si un 0.8 devuelto merece que se actúe en consecuencia.
Microsoft no publica ningún equivalente. La pestaña Benchmarks de la página de catálogo de Microsoft-Decision-1 describe lo que se midió y afirma que el modelo "rinde a la par de los principales modelos de decisión y por delante de otros modelos de decisión abiertos evaluados con la misma metodología", con las áreas más fuertes nombradas como razonamiento, aplicación de reglas y robustez del formato de prompt, y las más débiles como conocimiento especializado del dominio. Sin Brier, sin ECE, sin tabla de exactitud. Si tu decisión de adopción necesita una cifra de calibración antes de poder dimensionar un umbral de escalado, uno de estos dos modelos te la da y el otro te pide que la midas tú mismo.

En lo que realmente difieren los dos contratos.
En apariencia, estos modelos aceptan la misma llamada. Tú proporcionas un estado, un esquema de preguntas con nombre y un conjunto fijo de opciones; recibes como resultado una probabilidad por opción sin un solo token de texto generado. Las diferencias aparecen en los límites de ese contrato.
• Modalidad — Microsoft-Decision-1 es explícitamente solo texto y no acepta ni produce contenido de imagen, audio o vídeo. Intern-Decision-4B acepta imágenes opcionales junto con el estado, hasta ocho por llamada, lo que lo convierte en un candidato para la clasificación de capturas de pantalla, la verificación del diseño de documentos y el enrutamiento de QA visual.
• Cardinalidad de preguntas — InternLM documenta de 1 a 16 preguntas por llamada, hasta 62 opciones cada una, en tres tipos de campo (opción, puntuación, noul). Microsoft documenta los formatos — sí/no, opción múltiple, valoración, clasificación, rúbrica — y una única invocación de hasta 32K tokens, pero no un límite máximo de preguntas por llamada.
• Contexto — Microsoft indica 32.768 tokens. La ficha de Intern-Decision-4B expresa sus límites en preguntas, opciones e imágenes en lugar de como una sola cifra de contexto, así que no puedes comparar ambos con un único número.
• Distribución — Microsoft-Decision-1 es una API alojada de Foundry; los pesos del modelo no se distribuyen y no hay descarga. Intern-Decision-4B es Apache-2.0 en Hugging Face con la licencia upstream de Qwen conservada como LICENSE-QWEN, lo que significa conservar esa licencia y los avisos upstream si lo redistribuyes.
• Perfil de coste — Los pesos de InternLM no cuestan nada de ejecutar y se cotizan en 44,16 ms de media y 44,60 ms en el P95, en una sola RTX 4090. El precio por token de Microsoft no aparece impreso en la página del modelo en absoluto.
• Gobernanza — Microsoft ofrece una evaluación de IA responsable, prácticas de despliegue documentadas y exclusiones explícitas (no para la generación de texto, preguntas y respuestas abiertas, conversación, traducción o resumen; no para ser el único decisor automatizado en decisiones de gran impacto sobre las personas). InternLM ofrece una tarjeta de modelo que es sincera en cuanto a su procedencia —pesos «modificados por ajuste de decisiones»— y nada que se parezca a un paquete de cumplimiento.

Dos razones muy diferentes por las que es difícil comparar las cifras de latencia
Microsoft-Decision-1 no publica una cifra de latencia, así que no hay nada que poner junto a la media de 44,16 ms de InternLM. Esa no es una omisión menor para esta carga de trabajo. Estos modelos existen para ser llamados muchas veces dentro de un pipeline —una vez por cada documento recuperado, una vez por cada llamada a herramienta propuesta, una vez por cada respuesta que se califica—, y la diferencia entre cuatro decisiones por segundo y cuarenta es la diferencia entre puntuar una muestra y puntuarlo todo. La cifra de InternLM se puede alcanzar hoy en hardware que puedes alquilar por horas; la de Microsoft tiene que medirse a través de tu propia implementación de Foundry, y la forma de implementación que elijas (serverless de pago por uso frente a rendimiento aprovisionado) la cambiará más que el propio modelo.
Aquí también es donde la mitad de OrcaRouter del patrón se vuelve relevante, y es solo la mitad generativa. No alojamos Microsoft-Decision-1 ni Intern-Decision-4B — un modelo que devuelve probabilidades en lugar de texto no es algo a lo que se enruten las completaciones de chat, y ninguno aparece en nuestro catálogo. Lo que está detrás de nuestra única clave compatible con OpenAI es el grupo de más de 200 modelos que se encarga de la escritura: el prompt del juez redactado por un modelo, las respuestas candidatas producidas por otros dos, la llamada a la herramienta que se puntúa antes de ejecutarse. El precio de lista del proveedor se pasa con un margen del 0 %, por lo que un recorte de precio en un generador está activo en nuestro lado el mismo día, y la conmutación por error automática mantiene viva la parte de generación de un bucle de puntuación cuando un solo proveedor se degrada — lo que importa más de lo habitual aquí, porque una canalización que puntúa todo lo que ve no tiene margen para reintentar una llamada estancada.

¿Quién debería tomar cuál?
Elige Intern-Decision-4B si alguna de estas condiciones es cierta: necesitas puntuar imágenes además de texto, necesitas un número de calibración antes de poder lanzar, quieres la opción de ejecutar el modelo en tu propio hardware dentro de un perímetro que controles, o quieres ajustarlo con fine-tuning. El último punto merece énfasis: un scorer de pesos abiertos de 4B con un wrapper documentado es un modelo que puedes adaptar a tus propias etiquetas, y Microsoft-Decision-1 es una API alojada sin ruta de fine-tuning y sin pesos que adaptar.
Elige Microsoft-Decision-1 si el obstáculo es la adquisición y no el rendimiento: necesitas autenticación de Azure, facturación unificada, gobernanza y una evaluación de IA Responsable del proveedor antes de que algo llegue a producción, y necesitas un contexto de 32K para documentos largos que los límites por llamada del 4B complican. Su falta de benchmarks publicados es un costo real, pero es un costo que puedes eliminar en una tarde ejecutando tu propio conjunto etiquetado por ambos modelos y comparando el ECE —que es lo que harías de todos modos antes de confiar en la tabla de cualquiera de los proveedores.
La incómoda respuesta es que ambos son lo suficientemente baratos de probar como para que la discusión apenas merezca la pena. Intern-Decision-4B necesita una GPU que probablemente ya tienes. Microsoft-Decision-1 necesita un despliegue en Foundry y una muestra de tus propias decisiones etiquetadas. Pasa tus datos por ambos, calcula la calibración en el subconjunto que te importa y deja que los números decidan, lo cual, como corresponde, es exactamente para lo que sirven estos modelos.
