
Microsoft-Decision-1 vs Liquid AI d1-3B: misma ventana de 32K, dos sentidos diferentes
- OrcaNUEVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 por 1M de tokens
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
Por una vez, la especificación cuadra. Microsoft-Decision-1, disponible de forma general en Microsoft Foundry desde el 8 de octubre de 2026, tiene 32.768 tokens de contexto. Lo mismo ocurre con Liquid AI d1-3B, subido a Hugging Face el 5 de octubre de 2026 y anunciado por Liquid AI dos días después. Ambos aceptan un estado más un conjunto de preguntas tipadas —sí/no, elección entre opciones nombradas, una posición en una escala ordenada— y ambos responden en una sola pasada hacia adelante con una distribución de probabilidad en lugar de texto generado; Laya, Intern-Decision-4B, Kev y el resto de este nicho no coinciden entre sí sobre la longitud de contexto, así que este es el único emparejamiento donde esa dimensión queda fuera y la comparación tiene que argumentarse sobre otra cosa.
Ese algo más resulta ser el canal de entrada. El modelo de Microsoft es solo de texto, explícitamente: «no acepta ni produce contenido de imagen, audio o video». El de Liquid AI incorpora un codificador visual SigLIP2 NaFlex de 400 millones de parámetros sobre una base lingüística de 2,6 mil millones de parámetros y alcanza los 3,12 mil millones de parámetros en total, y se creó exactamente para eso que Microsoft descartó: puntuar una captura de pantalla, un formulario escaneado o un fotograma de cámara frente a una pregunta fija. Esa división, más una diferencia de licencia que no tiene nada que ver con la capacidad, es todo el enfrentamiento.
Cuando los dos coinciden, lo cual es más de lo que se esperaría.
• Ventana de contexto — 32.768 tokens para Microsoft-Decision-1 y 32.768 tokens para Liquid AI d1-3B.
• Forma de salida — probabilidades calibradas sobre las opciones proporcionadas; ninguno genera texto, y el contador de uso de Liquid AI lo reporta como output_tokens: 0.
• Tipos de preguntas — tanto la elección de documento, la puntuación ordenada y el sí/no binario, y ambos te permiten definir el conjunto de opciones por solicitud en lugar de reentrenar una cabeza de vocabulario.
• Abstención — Microsoft documenta opciones explícitas de abstención como "no se puede determinar"; el esquema Decision Index de Liquid AI admite lo mismo a través de su conjunto de opciones.
• Inferencia de una sola pasada — una llamada por decisión en ambos lados, que es lo que hace que cualquiera de las dos sea viable a escala de pipeline.
Dos modelos que coinciden en las dos restricciones más difíciles de este nicho merecen una pausa. Una ventana de 32K es lo que hace que un evaluador de decisiones sea utilizable en un contrato completo, una política de varias páginas o un hilo de soporte largo; el checkpoint inglés de Laya de 512 tokens y los límites de preguntas por llamada de Intern-Decision-4B no. Si tu entrada es corta, casi todo este campo es intercambiable y la decisión trata sobre el alojamiento. Si tu entrada es larga, el campo se reduce a estos dos.
El sentido que solo uno de ellos tiene
Liquid AI d1-3B es multimodal, y el árbol de modelos deja claro el linaje: LFM2.5-2.6B-Base, luego LFM2.5-VL-3B, y después d1-3B entrenado posteriormente para decisiones calibradas en una sola pasada. Las imágenes entran a través del codificador SigLIP2 NaFlex, y la ficha reporta una media de 74.1 en once benchmarks públicos de imágenes frente a 73.9 del modelo de visión base, así que el ajuste de decisiones no le costó calidad de visión. También reporta el experimento inverso: si se quitan las imágenes, las mismas preguntas caen a 45.1, que es la evidencia más clara que se puede obtener de que el canal de percepción soporta la carga en lugar de ser decorativo.
Microsoft-Decision-1 no tiene equivalente, y la omisión es deliberada en lugar de ser algo inacabado. La ficha de Microsoft enumera los usos fuera de alcance como generación de texto, respuesta a preguntas abiertas, conversación, traducción y resumen, y además indica por separado que el modelo es solo texto. Para un pipeline que necesita puntuar la captura de pantalla de un formulario según una rúbrica, o decidir si un fotograma de cámara contiene un evento de seguridad, eso es una parada en seco: ninguna ingeniería de prompts recupera una modalidad que nunca se le dio al modelo.
Los recuentos de idiomas van en la dirección opuesta, y esta es la segunda brecha real. Microsoft-Decision-1 enumera 25 idiomas compatibles, y la empresa es franca al afirmar que la cobertura, la calidad y la calibración "pueden variar según el idioma", y señala los idiomas distintos del inglés y, en especial, los de menores recursos, como un área de bajo rendimiento. Liquid AI d1-3B declara 16 idiomas. En cuanto a amplitud, Microsoft va por delante sobre el papel; en cuanto a honestidad sobre lo que significa la amplitud, ambos proveedores dicen algo similar, y ninguno ha publicado la calibración por idioma.

La pestaña de benchmark, otra vez.
La página de Foundry de Microsoft-Decision-1 incluye una pestaña Benchmarks con una sección de metodología y sin cifras: benchmarks de decisión públicos y comunitarios, además de conjuntos internos reservados, métricas que abarcan exactitud y error de calibración, orden de opciones variado, pruebas estadísticas emparejadas, y una afirmación de que el modelo «rinde a la par de los modelos de decisión líderes y por delante de otros modelos de decisión abiertos evaluados con la misma metodología». Nada que comprobar, nada que reproducir.
Liquid AI d1-3B publica 48.57 en Decision Index 0.2.1 — y el matiz importa más que el número, porque Decision Index es el propio índice de Liquid AI y d1-3B es el propio modelo de Liquid AI. Es un resultado puntuado por el proveedor en un benchmark creado por el proveedor, posicionado por la compañía como el mejor entre los modelos de decisión por debajo de 10B y por delante de un modelo de 35B en la misma escala. Trata el 48.57 como una afirmación direccional, no como una cifra auditada. Junto a esto, la ficha enumera evaluaciones internas de formato de decisión con una media de 77.1, SQuAD 2.0 en 85.3, PAWS-X en 76.9 y DecisionBench 71.8 — todas autoinformadas, y el encuadre de "por debajo de 10B" es un calificador genuino en lugar de una evasiva, ya que el modelo es de 3.12B.
Así que la cuestión de la calibración se resuelve de la misma manera en todo este campo: Liquid AI te da un número producido en su propia escala, Microsoft te da una metodología y ningún número, y ninguno te da una medición independiente de terceros. La única cifra de calibración que importará para tu despliegue es la que calcules con tus propios datos etiquetados.

Servicio, licencias y lo que realmente estás comprando
La latencia de d1-3B está publicada y es la razón por la que existe el modelo. Ocho milisegundos por decisión en una RTX 4090, nueve en una AMD MI325X, con un rendimiento empaquetado de 475 y 1.106 por segundo con 64 estados. En hardware de borde: 30 ms en un Apple M5 Pro, 16 ms en una Jetson AGX Thor, 26 ms en una Jetson AGX Orin de 64 GB, 50 ms en una Orin Nano. Microsoft-Decision-1 no publica ninguna cifra de latencia en absoluto, y sus opciones integradas —una API de Foundry alojada con pago por uso o rendimiento aprovisionado reservado, con la inferencia por lotes deshabilitada— lo cual significa que la mides a través de tu propio despliegue. Eso no es una brecha pequeña para un modelo cuyo propósito entero es ser invocado una vez por cada documento recuperado o acción propuesta.
La licencia es donde los dos divergen de una manera que sorprende a la gente. Liquid AI d1-3B está etiquetado como lfm.1, no Apache 2.0 — la misma licencia de familia que el resto de la línea L de Liquid, que conlleva condiciones de uso que una licencia permisiva no tiene. Si tu revisión legal lo interpreta como compatible con OpenAI y sin condiciones, esto no es eso, y vale la pena leerlo antes de que se publique el modelo en lugar de después. Microsoft-Decision-1 no tiene pesos en absoluto: es un modelo alojado dentro del portafolio Direct from Azure, con autenticación de Azure, facturación unificada, sin descarga, y la cuestión de la licencia reemplazada por un acuerdo de servicio. Ninguno de los modelos se puede afinar mediante las rutas que documentan los proveedores, que es la limitación más marcada para un modelo de decisión: un evaluador que no puedes adaptar a tus propias etiquetas es un evaluador cuyos modos de error no puedes corregir, solo esquivar.
Enrutar alrededor de ellos es donde OrcaRouter encaja en este patrón, y solo en uno de sus lados. No alojamos ni Microsoft-Decision-1 ni Liquid AI d1-3B: ninguno devuelve texto, ninguno está en nuestro catálogo, y un endpoint de puntuación de probabilidades no es un objetivo de chat-completions. Lo que ofrecemos es la mitad generadora del bucle — el modelo que redacta la respuesta que tu evaluador calificará, extrae los campos que tu evaluador juzgará o propone la acción que tu evaluador aprobará. Eso es más de 200 modelos tras una única clave compatible con OpenAI al precio de lista del proveedor, traspasado con un 0 % de margen de beneficio, así que un cambio de precio del proveedor se aplica en nuestro lado el mismo día, y la conmutación por error automática cubre la llamada de generación en un bucle que no tiene latencia de sobra para reintentar.

Dos picks claros, y uno que no estuvo ni cerca
Elige Liquid AI d1-3B si algo en tu pipeline es una imagen. Triaje de capturas de pantalla, extracción de formularios, enrutamiento de QA visual, un moderador que puntúa fotogramas de cámara — no se puede hacer que Microsoft-Decision-1 haga esto, y d1-3B se creó para ello, con los benchmarks de visión publicados que respaldan la afirmación. Elige también si necesitas inferencia en el borde medida en decenas de milisegundos en un Jetson o un portátil, si quieres el modelo en tu propio hardware, o si una licencia que puedas leer le basta a tu asesor jurídico.
Elige Microsoft-Decision-1 si tu entrada es texto, tus documentos son largos, tu puerta de decisión es adquisiciones — autenticación de Azure, facturación unificada, una evaluación de IA responsable, un proveedor al que escalar — o tu tráfico cubre más de los 16 idiomas que enumera d1-3B. Acepta que su falta de cifra de latencia y de tabla de benchmarks significa que tus dos primeras semanas con él son de medición, no de integración.
El único caso que no admite discusión es el trabajo multimodal: ahí, la decisión se tomó cuando Microsoft escribió «text-only» en la tarjeta del modelo.
