
Microsoft-Decision-1 vs Liquid AI d1-omni-600M: un evaluador que escucha frente a un evaluador que solo lee
- OrcaNUEVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 por 1M de tokens · 55 tok/s
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 369 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
Estás enrutando reclamaciones en una mesa de seguros, y el archivo llega como tres cosas: un PDF, una fotografía de una puerta abollada y una llamada telefónica de noventa segundos. Liquid AI d1-omni-600M puede leer el documento, mirar la foto y escuchar la llamada, y luego responder a un conjunto de preguntas que escribiste de antemano — ¿está cubierto esto?, ¿qué categoría?, ¿qué gravedad?, en una escala de dos a diez — en una sola pasada, sin generar texto y sin nada que analizar. Microsoft-Decision-1 puede leer el documento. Se puso a disposición general en Microsoft Foundry el 8 de octubre de 2026 como un evaluador alojado, solo texto, entrenado posteriormente en Qwen3.5-9B con una ventana de 32.768 tokens, y su superficie de entrada termina ahí: sin imagen, sin audio, sin vídeo. Ambos devuelven probabilidades calibradas sobre las opciones que proporciones, ambos emiten cero tokens de salida, y ninguno ha publicado una cifra de calibración.
Esa última frase compartida es la parte incómoda de esta comparación. Los dos son los modelos de decisión de sensor más ancho y de sensor más estrecho que se lanzan este mes y, a pesar de toda la distancia arquitectónica que los separa, han quedado en exactamente la misma posición probatoria: pesos reales o un endpoint real, contratos documentados y ninguna cifra que alguien ajeno al proveedor pueda señalar cuando alguien pregunta si las probabilidades son confiables.
Dos ascendencias, no dos tamaños
La cifra de 587M invita a leer Liquid AI d1-omni-600M como un pariente reducido de los modelos que este blog ha cubierto antes. No lo es. El modelo se entrena a partir de LFM2.5-Encoder-350M, un codificador bidireccional, con un tronco compartido y una cabeza de decisión de 381M, un codificador de visión de 94M tomado de la línea LFM2.5-VL-450M y un FastConformer de 17 capas para audio. Microsoft-Decision-1 es una estirpe completamente distinta: un decodificador Qwen3.5-9B, entrenado posteriormente por Microsoft, alojado en Foundry, cuyos pesos no se distribuyen y no se ofrece ninguna vía de ajuste fino.
Bidireccional versus decodificador es el hecho arquitectónico que decide cómo se comporta cada uno, y también es la razón por la que los recuentos de parámetros son una distracción. Un codificador bidireccional lee todo el estado a la vez, que es la forma adecuada para un juicio sobre una entrada fija; un decodificador post-entrenado renuncia a la ruta de generación pero conserva el tokenizador, la ventana y el empaquetado empresarial que acompañan a un despliegue de foundry. Ninguno es una versión escalada del otro, y no se pueden intercambiar entre sí sin importar cómo se lea una tabla de benchmarks.
Lo que realmente te aporta la lista de entrada
Aquí es donde el d1-omni-600M más se distancia de todo lo demás dentro de la categoría, y donde una afirmación debe leerse con cuidado.
• Voz — Liquid AI d1-omni-600M acepta texto más hasta 30 segundos de voz y emite una decisión al respecto, algo que ningún evaluador de solo texto puede lograr con precisión alguna. Las modalidades no textuales de Microsoft-Decision-1 no existen.
• Exclusión mutua — el d1-omni-600M lanza un ValueError si las imágenes y el audio llegan en la misma solicitud. La superficie de sensores más amplia de la categoría sigue siendo una modalidad no textual a la vez, lo que supone una restricción real para esa mesa de siniestros.
• Recorte — su tarjeta indica 16,384 posiciones combinadas de texto, imagen y audio, y agrega que con imágenes presentes, el texto de estado y pregunta se recorta a 896 tokens para coincidir con el entrenamiento. Cualquier documento al que adjuntes una foto compite con ese recorte. Los 32,768 tokens de Microsoft-Decision-1 son todo texto y no se recortan.
• Formatos — el d1-omni-600M tiene tres tipos de preguntas: noul para una decisión binaria que devuelve P(sí) entre 0 y 1, choice para una etiqueta de un conjunto que usted nombre con una confianza y una probabilidad por opción, y score para una posición en una escala ordenada de dos a diez niveles con su distribución. Varias preguntas dependen de un mismo estado y se leen en una sola pasada, y el contador de uso informa output_tokens: 0. Microsoft documenta formas de sí/no, opción múltiple, calificación, clasificación y rúbrica, además de una opción de abstención admitida explícitamente, como «no se puede determinar», cuando la evidencia es insuficiente — el único detalle de diseño en la página de Microsoft que no tiene equivalente directo aquí.
• Tiempo de ejecución — el d1-omni-600M incluye código personalizado, necesita trust_remote_code=True, y su ficha recomienda float16 en GPU mientras advierte que bfloat16 cambió la respuesta principal en algunas filas. Esa es una sensibilidad en tiempo de servicio documentada por el proveedor, no un defecto. Microsoft-Decision-1 es un endpoint administrado donde la forma de implementación es tu única variable de tiempo de ejecución, y vale la pena señalar que la inferencia por lotes está deshabilitada: no hay canal sin conexión para amortizar una ejecución de puntuación masiva.

La brecha de evidencia, en ambas direcciones
Liquid AI publicó la familia abierta d1, incluido d1-omni-600M, el 7 de octubre de 2026 con una publicación de lanzamiento y un conjunto de documentación. Lo que no se publica es la cifra que haría concreta la afirmación multimodal. No hay ningún benchmark de precisión específico para su capacidad principal —la calidad de decisión de visión y audio que justifica los codificadores de 94M y 112M—, y la división de visión se omite del material de evaluación publicado. Tampoco se publica ninguna cifra de latencia, así que el rendimiento del modelo es algo que uno descubre en su propio hardware.
La postura de Microsoft es estructuralmente idéntica y está un paso más adelante. Su pestaña Benchmarks nombra las métricas —precisión, error de calibración, recall de seguridad, tasas de falsos positivos, consistencia de equidad—, afirma que la evaluación se llevó a cabo con benchmarks de decisión públicos y comunitarios, además de conjuntos de prueba internos reservados que no se usaron en el entrenamiento, que se varió el orden de las opciones, que se aplicaron pruebas estadísticas pareadas, y asegura que el modelo "tiene un rendimiento a la par de los principales modelos de decisión y por delante de otros modelos de decisión abiertos evaluados con la misma metodología". No publica ninguno de los resultados. Se indica que admite veinticinco idiomas, entre ellos el japonés, el coreano, el árabe, el vietnamita, el tailandés, el turco, el hindi, el bengalí, el suajili, el hebreo, el persa y el ucraniano, junto con la sincera advertencia de que la cobertura, la calidad y la calibración "pueden variar según el idioma" y de que los idiomas distintos del inglés, sobre todo los de menos recursos, son un punto débil. El precio tampoco figura en la página del modelo; esta enlaza a la página de precios de Microsoft.
Así que la comparación entre estos dos no es una de evidencia contra evidencia. Es una elección entre dos tipos de número faltante. Liquid AI ha lanzado la superficie del sensor y ha dejado la precisión de esa superficie sin medir públicamente. Liquid AI ha lanzado la ruta de adquisición —autenticación de Azure, gobernanza, una evaluación de IA responsable, una metodología documentada— y ha dejado la calibración de un producto sin cuantificar.

La pregunta de calibración que ninguno de los dos responde
En un modelo de decisión, la probabilidad es el producto. Todo lo que viene después es un umbral: 0,7 escala, 0,95 acepta automáticamente, y el coste de trazar mal esa línea se paga en malas decisiones automatizadas, no en tokens. En esta categoría hay al menos una familia que publica las cifras —los checkpoints de Intern-Decision de InternLM imprimen en sus tarjetas de modelo números de Brier y de error de calibración esperado—, y ninguno de los dos modelos de este artículo lo hace. Esa asimetría es la razón práctica para mantener el abanico amplio en lugar de decantarse solo por la arquitectura.
La buena noticia es que la prueba es barata y no requiere la cooperación del proveedor. Reúne un par de cientos de casos etiquetados que se parezcan a tu tráfico real, escribe el esquema de preguntas que tu aplicación enviaría realmente, ejecuta ambos modelos sobre ellos y calcula el error de calibración esperado en la salida. Entonces sabrás dos cosas que nadie fuera de los dos proveedores conoce actualmente: qué tan bien las probabilidades de Microsoft-Decision-1 siguen su exactitud en tu distribución, y si las rutas de audio e imagen del d1-omni-600M valen los codificadores que llevan. La propia guía documentada de Microsoft apunta en la misma dirección: valida con datos representativos, fija los umbrales a partir del costo de tus errores, incluye siempre una opción de abstención, aleatoriza el orden de las opciones y mantén a una persona en el bucle para las decisiones de gran impacto.
Dónde corresponde cada uno, y dónde corresponde OrcaRouter
Microsoft-Decision-1 pertenece a todos los casos en los que el material de decisión sea texto y el obstáculo sea la adquisición: un documento extenso, un pasaje recuperado, una llamada a herramienta propuesta, una respuesta generada que se califica con una rúbrica, con autenticación de Azure, facturación unificada y una evaluación de proveedor obligatorias antes de que algo llegue a producción. Es el instrumento más acotado y el más fácil de aprobar.
Liquid AI d1-omni-600M pertenece dondequiera que el material decisivo no sea texto — una foto adjunta a un formulario, una grabación corta de llamada, una captura de pantalla — y dondequiera que quieras pesos de lfm1.0 que puedas ejecutar y ajustar dentro de un límite que controles. Es el instrumento más amplio y el más difícil de validar, porque la afirmación multimodal es exactamente la parte que no tiene ningún benchmark publicado detrás.

Ninguno de los dos está en nuestro catálogo, y nada de lo aquí expuesto constituye una declaración de disponibilidad para ninguno de ellos. Un modelo que devuelve probabilidades en lugar de texto no es algo a lo que se enrutan finalizaciones de chat, y mantenerse fuera del asiento de puntuación es todo el diseño del instrumento. Lo que OrcaRouter ofrece es el lado generativo del mismo bucle: los más de 200 modelos detrás de una clave compatible con OpenAI que escriben la rúbrica contra la que tu puntuador evalúa, transcriben o resumen el material antes de que se convierta en un estado, y emiten la llamada de herramienta que tu puntuador aprueba antes de que se ejecute. El precio de lista del proveedor se transfiere con un margen del 0 %, por lo que una reducción de precio del proveedor en el lado generativo está activa en el nuestro el mismo día. La conmutación automática por error mantiene ese lado activo cuando un único proveedor se degrada —lo que una canalización que puntúa cada documento recuperado nota de inmediato—, y si quieres que se juzguen varios escritores en lugar de uno, el DSL de enrutamiento los compone en una sola llamada y la fusión de modelos informa su acuerdo como un campo que tu puntuador puede leer como cualquier otro.
En resumen
Microsoft-Decision-1 alcanzó la disponibilidad general en Microsoft Foundry el 8 de octubre de 2026: solo texto, 32.768 tokens, construido sobre un Qwen3.5-9B post-entrenado, alojado sin pesos, sin precio en la página del modelo, sin cifra de latencia y con una sección de benchmarks que describe su metodología sin imprimir un resultado. Liquid AI d1-omni-600M se subió el 7 de octubre de 2026 como un modelo de decisión con codificador bidireccional de 587M que lee texto, imágenes o 30 segundos de voz —una modalidad no textual a la vez, con el texto recortado a 896 tokens cuando hay imágenes presentes— bajo la licencia lfm1.0, sin benchmark de precisión para su capacidad principal, sin división de visión y sin latencia publicada. Elija en función de la modalidad y el control en lugar de las puntuaciones, porque las puntuaciones no existen: si su material es una fotografía o una llamada telefónica, solo uno de estos puede responder, y si es un documento de cuarenta páginas con una revisión de adquisiciones adjunta, solo el otro puede desplegarse.
Lo que OrcaRouter aporta es el lado generativo del mismo bucle: los más de 200 modelos detrás de una clave compatible con OpenAI que escriben la rúbrica contra la que tu evaluador califica, transcriben o resumen el material antes de que se convierta en un estado, y emiten la llamada a herramienta que tu evaluador aprueba antes de que se ejecute.
