Una tarjeta de título principal para los modelos de decisión de pesos abiertos de Liquid AI, encabezada por «Dos modelos que nunca escriben una palabra» con el subtítulo «Liquid AI d1-3B y d1-omni-600M, pesos abiertos, 7 de octubre de 2026», tres chips etiquetados como sí/no, elegir una etiqueta y puntuar en una escala, y un diagrama de un estado que entra en una única pasada hacia adelante que devuelve una probabilidad, una etiqueta y una puntuación.
Guides & Insights

Liquid AI d1-3B y d1-omni-600M: Pesos abiertos para modelos que nunca escriben una palabra

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Liquid AI d1-3B y Liquid AI d1-omni-600M se publicaron en Hugging Face el 7 de octubre de 2026, y los dos checkpoints tienen una propiedad que hace que todas las tablas comparativas que hayas leído este año tengan la forma equivocada. Ninguno de los dos genera texto. Le entregas a Liquid AI d1-3B un estado —un ticket de soporte, un payload JSON, una fotografía o los tres a la vez— y un conjunto de preguntas con nombre, y devuelve respuestas extraídas directamente de la distribución del modelo sobre tus opciones. Un sí/no como probabilidad. Una elección entre etiquetas con una confianza y un vector de probabilidad completo. Una posición en una escala ordenada. No hay paso de muestreo, ni JSON que parsear, ni generación descontrolada, y el propio contador de uso del proveedor lo reporta sin rodeos: output_tokens: 0. El modelo de 3B es el titular —obtiene 48,57 en el Decision Index 0.2.1 puntuado por el proveedor, por delante de todo lo que hay por debajo de 10B y por delante de un modelo de decisión doce veces más grande. El hermano de 600M es el que merece la pena seguir: lee imágenes y hasta treinta segundos de habla a través de los mismos pesos troncales, y está etiquetado como una versión temprana de investigación.

Qué es un modelo de decisión, en un párrafo

La categoría lleva un año gestándose bajo nombres como modelos de sistema-uno y clasificadores-que-no-son-clasificadores, y el par d1 es la formulación más limpia de ella hasta ahora. A un modelo generativo se le hace una pregunta y escribe una respuesta; esa respuesta hay que parsearla, el parseo puede fallar, y cada token que escribe te cuesta dinero y tiempo. A un modelo de decisión se le hace una pregunta y reporta lo que ya cree. Las preguntas de Liquid vienen en tres tipos. noul es una pregunta de sí/no, que se responde con P(sí) entre 0 y 1. choice elige una etiqueta de un conjunto con nombre y devuelve la etiqueta, una confianza y la probabilidad de cada opción. score sitúa el estado en una escala ordenada de dos a diez niveles y devuelve el nivel esperado junto con su distribución y su leyenda. Un estado puede llevar varias preguntas a la vez, y el estado y sus imágenes se leen una sola vez para todas ellas.

Esa última propiedad es todo el caso de negocio. Tres preguntas sobre un ticket cuestan 1,3 veces el tiempo de una pregunta, no 3 veces, porque el modelo hace una sola pasada hacia adelante sobre la entrada y lee varias respuestas de ella. No hay nada que escribir, así que no hay nada que escribir mal.

El 3B y el 600M están construidos desde direcciones opuestas

Aquí es donde el lanzamiento se vuelve técnicamente interesante, y es la parte que la cobertura del lanzamiento ha omitido en su mayor parte. Los dos modelos no comparten un linaje.

Liquid AI d1-3B desciende de LFM2.5-VL-3B, el modelo de visión-lenguaje de solo decodificador del proveedor. Cuenta con 3,12B de parámetros, un codificador de visión SigLIP2 NaFlex de 400M optimizado para formas, una ventana de contexto de 32.768 tokens, un vocabulario de 128.000 tokens y dieciséis idiomas documentados. Para construirlo, Liquid promedió los pesos de LFM2.5-2.6B y la columna vertebral de texto de LFM2.5-VL-3B, ajustó checkpoints de varias semillas aleatorias y mezclas de datos, y luego volvió a fusionar los resultados. El propio resumen del proveedor sobre lo que importó es refrescantemente poco glamuroso: entrenar con entradas largas, barajar el orden de las opciones de respuesta y buscar atajos en los datos de entrenamiento hicieron más por la cifra final que cualquier técnica avanzada.

Liquid AI d1-omni-600M desciende de LFM2.5-Encoder-350M, un codificador bidireccional —una especie de red completamente distinta—. Suma 587 M de parámetros repartidos en un tronco compartido de 381 M y una cabeza de decisión, un codificador de visión de 94 M tomado de LFM2.5-VL-450M, y un codificador de audio de 112 M construido a partir de un FastConformer de 17 capas. Todas las modalidades pasan por los mismos pesos del tronco. Su contexto es de 16.384 tokens que cubren posiciones de texto, imagen y audio a la vez, y cuando se adjuntan imágenes, el estado y el texto de la pregunta se recortan a 896 tokens porque es con lo que se entrenó. El audio recibe una advertencia que la ficha indica sin matices: la capacidad se entrenó con solicitudes entre un hablante de inglés y un asistente, y los clips se cortan a los treinta segundos.

Así que la familia no es un solo modelo en dos tamaños. Es un decodificador y un codificador, entrenados posteriormente para hacer el mismo trabajo con dos mecanismos completamente distintos, uno de los cuales ve y otro de los cuales oye.

A two-column scoreboard for Liquid AI d1-3B and d1-omni-600M showing d1-3B at Decision Index 48.57 with 3.12B parameters, text and image input and 8 ms per question on an RTX 4090, against d1-omni-600M at 15.95 with 587M parameters, text, image and audio input and no reported latency, footed 'All figures vendor-reported by Liquid AI, Oct 7 2026; no independent reproduction.'

Los números, y de quién son

Todas las cifras de esta sección son de Liquid. Las filas del Decision Index para los modelos d1 fueron puntuadas por el proveedor con el evaluador oficial —no se enviaron a la clasificación—, mientras que todas las filas de la competencia provienen de la clasificación pública en v0.2.1. Ningún laboratorio independiente ha reproducido nada de esto todavía, y los modelos tienen dos días de antigüedad en el momento de escribir esto.

• Decision Index 0.2.1 — Liquid AI d1-3B obtiene una puntuación de 48,57, con subpuntuaciones de Conocimiento 23,8, Lenguaje 56,4, Recuperación 52,8, Herramientas 74,5 y Artes 36,3. Liquid AI d1-omni-600M obtiene 15,95, con Herramientas en 15,1.

• Dónde se sitúa 48.57 — primero entre todo lo que está por debajo de 10B en la tabla que publicó el proveedor, y por delante de Decider 2-A3B con 47.11. Es segundo en general, por detrás de Winnow-12B con 50.02, que es cuatro veces más grande.

• Benchmarks de texto, según datos del proveedor — d1-3B promedia 82,9 en siete benchmarks públicos, por delante del 81,1 de Decider 4B; d1-omni-600M promedia 78,4, lo que supera el 77,1 de Decider 2B con aproximadamente una cuarta parte del número de parámetros. El 600M registra la mejor puntuación de toxicidad de la tabla (Civil Comments 95,8) y su mejor puntuación de paráfrasis (PAWS-X 79,5).

• Visión, según el proveedor: d1-3B promedia 74.1 en once benchmarks públicos de imágenes interpretados como decisiones sobre las opciones de cada benchmark, frente a 73.9 de su backbone LFM2.5-VL-3B. Eliminar las imágenes hace caer esas mismas preguntas a 45.1, que es como el proveedor demuestra que las respuestas provienen de los píxeles.

• Latencia, medida por el proveedor — una pregunta tarda 8 ms en una RTX 4090 y 9 ms en una AMD MI325X; 16 ms en una Jetson AGX Thor, 26 ms en una Jetson AGX Orin de 64 GB, 50 ms en la Jetson Orin Nano más pequeña, y 30 ms en un Apple M5 Pro. Sesenta y cuatro estados empaquetados en una sola pasada se ejecutan a 475 por segundo en la 4090.

• Lo que falta — d1-omni-600M no tiene ninguna tabla de inferencia. Liquid dice que está en desarrollo activo y simplemente no informa latencia para él. Tampoco hay ningún benchmark de decisión de audio en ninguna parte del lanzamiento, porque, en palabras del proveedor, los benchmarks dedicados a la decisión de audio actualmente son un problema abierto.

La afirmación que realmente está haciendo el comunicado

Dos días antes de que se publicaran los pesos, Liquid publicó la versión alojada de este modelo y la comparó con GPT-6.1 Sol y Claude Opus 5.5 en seis aplicaciones. Su resumen: d1 iguala o supera a GPT-6.1 Sol en cuatro de las seis, cuesta entre 19 y 200 veces menos, y responde más rápido en todas las tareas. Vale la pena leer la metodología publicada antes de repetir cualquiera de esas afirmaciones: cada aplicación se ejecutó una vez por modelo el 5 de octubre de 2026, los modelos de chat respondieron en JSON con su configuración de razonamiento predeterminada, y el costo de d1 se calculó a $0.04 por millón de tokens de entrada.

Las demostraciones son la mitad más persuasiva. Clasificar piezas buenas y defectuosas de cuatro líneas de producción —placas de circuito, velas, anacardos, chicles— con una precisión del 85 al 97 %, en un modelo que nunca fue entrenado para la tarea y la entendió a partir de una breve descripción. Un predicado SQL que responde sí o no para cada uno de 150 tickets de soporte. Un bucle de compactación de contexto que lee la salida de cada herramienta en la sesión de un agente de programación y la conserva, recorta o descarta, eliminando el 52 % de los tokens mientras conserva cada salida que la tarea necesita. En Tetris, añadir la pantalla a un juego totalmente describible con texto elevó la puntuación de 70 líneas eliminadas a 81 —un resultado de visión que no se puede obtener de un clasificador solo de texto, por muy bueno que sea.

Esas son demostraciones realizadas por el proveedor con tareas elegidas por el propio proveedor, y la sección de metodología lo dice. Aun así, siguen siendo la imagen más clara que se haya publicado de para qué sirve un modelo de decisión.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as open-weight models, d1-3B's Decision Index score of 48.57, and its latency figures of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Dónde se ejecuta y cuánto cuesta llamarlo

Los pesos abiertos están diseñados para la ejecución local y el proveedor hizo el trabajo de integración por adelantado: compatibilidad desde el primer día con llama.cpp, todo el stack de NVIDIA desde DGX hasta Jetson, cuantización NVFP4 y una variante de pesos/activaciones de 8 bits publicada junto con el checkpoint base. Las conversiones a GGUF ya están en Hugging Face. Si prefieres no alojar nada, Liquid sirve el d1 alojado desde su propia API —solo tokens de entrada, sin tokens de salida, con las imágenes facturadas como entrada a 1,5 tokens por parche de 32×32 píxeles, lo que hace que una imagen de 1024×1024 sean 1.536 tokens. El acceso solo de texto también está disponible a través de plataformas de terceros.

La nota honesta sobre enrutamiento: ni Liquid AI d1-3B ni Liquid AI d1-omni-600M están en nuestro catálogo, y este artículo no constituye una afirmación de disponibilidad para ninguno de los dos. Lo que el par d1 cambia para un enrutador es la forma del pipeline a su alrededor. Un modelo de decisión que responde en milisegundos y no cuesta nada en tokens de salida es un filtro, no un reemplazo — la separación de buenos y defectuosos y el triaje de tickets ocurren delante de la llamada generativa, y la llamada generativa es donde un único endpoint a través de más de 200 modelos, precios de lista aplicados con un 0 % de recargo, y conmutación automática por error realmente valen la pena. Diferente capa, mismo pipeline.

¿Qué resolvería la discusión?

Tres cosas siguen sin resolverse, y las tres son de esas que solo el tiempo cierra.

Lo primero es la reproducción independiente. Los números del Decision Index los generó el proveedor con el scorer oficial, y cada fila de los competidores se tomó de un leaderboard público, lo cual es un método defendible y no es lo mismo que un tercero ejecutando tu modelo. Lo segundo es el audio. Un checkpoint de 600M que enruta un comando de voz en un solo forward pass es una capacidad genuinamente nueva, y no existe ningún benchmark que mida si lo hace bien. Lo tercero es la propia categoría: cuando la respuesta se lee de una distribución en lugar de escribirse, los modos de fallo habituales de un modelo pequeño —entrar en bucle, desviarse, negarse, alucinar un formato— simplemente no pueden ocurrir, y nadie ha publicado una buena explicación de qué los sustituye. El error de calibración es el candidato obvio, y es exactamente lo que el campo de confianza de cada respuesta te invita a medir por tu cuenta.

Diez demos ejecutan Liquid AI d1-3B en bucle sobre la entrada de cámara en vivo en un espacio público de Hugging Face, que es la forma más barata de formarte tu propia opinión. Los pesos son gratuitos y las preguntas son concretas. Esa es una posición de partida mejor que la que ofrecen la mayoría de los lanzamientos de este año.

A capture of Liquid AI's documentation page for its decision models, showing the left-hand navigation including Decision Models and Liquid Nanos, the 'Open d1' banner announcing that visitors can now run d1-3B and d1-omni-600M locally, and the page's opening description of purpose-built models for structured decisions such as classification, routing and scoring in a single call with zero generation.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario