Una tarjeta de título principal encabezada por '¿Qué mitad de d1 necesitas?' con el subtítulo 'Liquid AI d1-omni-600M vs Liquid AI d1-3B - pesos abiertos, 7 de octubre de 2026', dos chips etiquetados 'precisión' y 'modalidades', y un diagrama en cascada en el que una tarjeta pequeña etiquetada d1-omni-600M alimenta a una tarjeta más grande etiquetada d1-3B mientras que una segunda flecha se ramifica hacia un chip que dice 'con suficiente confianza - responder aquí'.
Guides & Insights

Liquid AI d1-omni-600M vs Liquid AI d1-3B: ¿Qué mitad de la familia d1 necesitas realmente?

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Liquid AI d1-omni-600M y Liquid AI d1-3B se subieron a Hugging Face con menos de ocho horas de diferencia el 5 de octubre de 2026 y se lanzaron juntos en el mismo anuncio del 7 de octubre, lo que hace que la pregunta habitual —cuál es más nuevo, cuál es mejor— sea la equivocada. Son los dos extremos de un intercambio deliberado. Liquid AI d1-3B es el producto acabado: 3,12B de parámetros, un 48,57 en el Decision Index 0.2.1 puntuado por el proveedor, tablas de benchmark, latencia medida hasta en un Jetson Orin Nano, y un lugar descrito en la publicación de lanzamiento como la mayor calidad de decisión de su tamaño. Liquid AI d1-omni-600M es el experimento: 587M de parámetros, un 15,95 en el mismo índice, entrada de audio que el 3B no tiene, y una tarjeta de modelo que dice sin rodeos que es una versión temprana de investigación sin cifras de inferencia porque todavía está en desarrollo activo. Elegir entre ellos no es una decisión de calidad. Es una decisión sobre si necesitas las modalidades adicionales de la parte inferior de la familia o la precisión adicional de la parte superior, y los números respaldan esa división en lugar de difuminarla.

Todo lo que aparece a continuación proviene de las dos tarjetas de modelo y de la publicación de lanzamiento del 7 de octubre, respetando el etiquetado de la propia publicación de lanzamiento: las filas de d1 en el Decision Index fueron puntuadas por Liquid AI con el evaluador oficial en lugar de enviarse a la tabla de clasificación pública, y nada de esto ha sido reproducido de forma independiente.

Dos backbones que nunca iban a converger

La familia d1 no se limitó a reducir una sola receta. Los dos checkpoints parten de extremos opuestos del catálogo de modelos de Liquid y se encuentran en el punto medio.

L1 AI d1-3B se basa en LFM2.5-VL-3B, el modelo de visión-lenguaje de solo decodificador del proveedor, de agosto de 2026. Su base se creó promediando los pesos de LFM2.5-2.6B con el texto de LFM2.5-VL-3B, y luego se ajustaron finamente checkpoints con diferentes semillas aleatorias y mezclas de datos antes de fusionarlos de nuevo. Incluye un codificador Siglip2 NaFlex de 400M optimizado para formas, un contexto de 32.768 tokens, un vocabulario de 128.000 tokens y dieciséis documentados.

Liquid AI d1-omni-600M viene desde la dirección opuesta. Su tronco es LFM2.5-Encoder-350M, un codificador bidireccional, ajustado primero en tareas de decisión y luego extendido por etapas: un codificador FastConformer de 17 capas más un adaptador para audio, con el codificador de audio ajustado posteriormente contra un backbone de texto congelado, y luego una torre SigLIP2 extraída de LFM2.5-VL-450M con un adaptador y actualizaciones LoRA al backbone para visión. El modelo final se fusionó a partir de las actualizaciones de LoRA y se promedió con el punto de control anterior. Termina con 587 M de parámetros en total: un tronco y una cabeza de decisión compartidos de 381 M, un codificador de visión de 94 M y un codificador de audio de 112 M.

Decoder-only frente a bidireccional es la parte que hay que retener. El de 3B lee un estado y produce una decisión igual que un modelo de lenguaje produce una secuencia de tokens, una dirección a la vez. El de 600M lee todo el estado de una vez y decide, que es lo que uno esperaría de un encoder que nunca se construyó para generar. Ambos están entrenados para reportar respuestas a partir de la distribución del modelo con cero tokens de salida, pero la maquinaria subyacente no es de la misma clase de modelo, y la brecha de precisión que aparece a continuación es el coste visible del diseño más pequeño y con forma de encoder.

La dispersión del Índice de Decisión es grande, y las subpuntuaciones son más interesantes que el total

En el Decision Index 0.2.1, Liquid reporta 48.57 para Liquid AI d1-3B y 15.95 para Liquid AI d1-omni-600M, frente a 50.02 para Winnow-12B. Esa es una diferencia de 32 puntos entre dos checkpoints lanzados el mismo día por el mismo laboratorio, y leer las cinco subpuntuaciones explica de dónde viene.

• Conocimiento — 23,8 para Liquid AI d1-3B frente a 8,3 para Liquid AI d1-omni-600M

• Idioma — 56,4 frente a 12,9

• Recuperación — 52.8 frente a 35.0

• Herramientas — 74.5 frente a 15.1

• Artes — 36,3 frente a 6,8

Retrieval es el único ámbito en el que el modelo pequeño se mantiene firme: pierde menos de un tercio de la puntuación del 3B, mientras que en las otras cuatro categorías pierde entre el 60 y el 80 por ciento. Ese patrón es coherente con lo que es el 600M: un encoder entrenado con verdadera capacidad de representación para emparejar un estado con contenido, y mucha menos de la capacidad por capas que el 3B hereda de un decoder que fue preentrenado con muchísimo más lenguaje. Si tu carga de trabajo es una decisión con forma de recuperación —¿responde este pasaje a esta pregunta?, ¿cuál de estos documentos es relevante?—, el perfil del 600M es menos malo de lo que sugiere su total. Si tu carga de trabajo es una decisión de enrutamiento de herramientas, la brecha de 51 puntos en esa columna es la cifra en la que hay que fijarse.

La tabla de benchmarks de texto cuenta una historia más moderada que el índice, algo que conviene saber antes de usar cualquiera de las dos cifras para defender una postura. En siete benchmarks públicos, el 3B lidera con una media de 82,9 y el 600M alcanza 78,4. De hecho, el 600M pierde por poco en SQuAD 2.0 (74,0 frente a 85,3), PubMedQA (61,3 frente a 66,0), BoolQ (77,7 frente a 86,7) y XNLI (74,7 frente a 85,0), pero gana en la detección de toxicidad de Civil Comments (95,8 frente a 93,0) y en la identificación de paráfrasis de PAWS-X (79,5 frente a 76,9). El propio planteamiento de Liquid es que el 600M supera la media de 77,1 de Decider 2B con la cuarta parte de los parámetros. Dos conjuntos de benchmarks, dos veredictos aparentes distintos, ambos reportados por el proveedor: eso es lo que respaldan las pruebas, y nada más.

A two-column scoreboard for Liquid AI d1-omni-600M and Liquid AI d1-3B showing the 600M at Decision Index 0.2.1 of 15.95, 587M parameters, a text benchmark mean of 78.4, text plus image or audio input, a 16,384-token context and no reported latency, against the 3B at 48.57, 3.12B parameters, a mean of 82.9, text plus image input, a 32,768-token context and 8 ms for one question on an RTX 4090, footed 'All figures vendor-reported by Liquid AI, Oct 7 2026; no independent reproduction.'

Lo que el 600M tiene que el 3B no

La razón para tolerar una diferencia de 32 puntos en el índice es que Liquid AI d1-omni-600M hace algo que Liquid AI d1-3B no puede, y no es una diferencia de fidelidad.

Audio — Liquid AI d1-omni-600M admite hasta 30 segundos de voz por solicitud mediante su codificador FastConformer; Liquid AI d1-3B no admite ninguno.

• Mezcla de modalidades — el 600M acepta texto con imágenes o texto con audio, y lanza un ValueError si ambos llegan juntos; el 3B acepta texto e imágenes

• Ventana de contexto — 16,384 tokens en posiciones de texto, imagen y audio para el 600M, con el texto recortado a 896 tokens cuando hay imágenes; 32,768 tokens para el 3B

• Vocabulario — 65.536 para el 600M, 128.000 para el 3B

• Precisión — la tarjeta de 600M recomienda float16 en GPU y advierte que bfloat16 cambió la respuesta principal en algunas filas; la de 3B incluye 15 cuantizaciones, incluida una compilación w8a8

• Idiomas — el 600M enumera 16 idiomas en un conjunto diferente al de los 16 del 3B, y su audio se describe como entrenado con intercambios entre un hablante de inglés y un asistente, lo que es una porción muy limitada de lo que contiene una fuente de audio de producción.

La nota sobre el entrenamiento de audio es fácil de pasar por alto, y no debería serlo. Un modelo entrenado con intercambios en inglés entre hablante y asistente ha visto una sola geometría de hablantes, una sola estructura de turnos y una sola distribución de acentos. Desplegarlo con audio de centros de llamadas o grabaciones de campo es pedirle un comportamiento que la tarjeta no declara, y la publicación de lanzamiento es franca al afirmar que no existe ningún benchmark de decisiones de audio con el que comprobarlo — Liquid llama a eso "actualmente un problema abierto" e invita a la comunidad a crear uno.

A capture of Liquid AI's blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the announcement that d1-3B and d1-omni-600M were released that day, d1-3B's 48.57 Decision Index v0.2.1 score described as ahead of every model under 10B, and its latency figures of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Latencia: uno de los hermanos tiene las tablas, el otro tiene una nota al pie.

Para los modelos de decisión, la cifra interesante es la latencia de extremo a extremo, porque no hay decodificación que cronometrar. Liquid publica un conjunto completo para el 3B y ninguno para el 600M.

• Una pregunta — 8 ms en una RTX 4090, 9 ms en una MI325X, 16 ms en una Jetson AGX Thor, 26 ms en una Jetson AGX Orin 64 GB, 50 ms en un Orin Nano, 30 ms en un Apple M5 Pro

• Tres preguntas sobre un estado — 21 ms en la RTX 4090 y 20 ms en el AGX Thor, aproximadamente 1,3x el costo de una sola pregunta en lugar de 3x

• Un estado de 3.4K tokens — 102 ms en la 4090, 220 ms en el Thor, 1,640 ms en el Orin Nano

• Rendimiento empaquetado — 475 decisiones por segundo en la RTX 4090, 1.106 por segundo en la MI325X

• Una imagen de 384px — 17 ms en la 4090, 18 ms en la MI325X

Esas cifras describen únicamente a Liquid AI d1-3B. Para Liquid AI d1-omni-600M, la ficha del modelo indica que no se reportan cifras de inferencia porque el modelo es una versión de investigación temprana en desarrollo activo. No se trata de que el modelo pequeño sea más lento —lo contrario es casi seguro, ya que un quinto de los parámetros no se vuelve más lento a la misma precisión—, sino de que no existe ninguna cifra, y citar los milisegundos del 3B para el 600M sería una invención con una forma verosímil. Lo que se puede decir sin inventar nada es que, con la precisión float16 que recomienda la ficha, 587M de parámetros equivalen a del orden de 1,2 GB de pesos antes de las activaciones, lo cual es aritmética sobre un recuento de parámetros publicado, y no una medición.

La cascada es la verdadera respuesta para la mayoría de las cargas de trabajo

Como ambos checkpoints se publicaron juntos y devuelven el mismo tipo de objeto —una probabilidad, una etiqueta con una confianza o una puntuación ordenada—, se componen de una manera en la que dos modelos arbitrarios no lo hacen. El 600M puede hacer el cribado y el 3B puede adjudicar. Puntúa los elementos entrantes con Liquid AI d1-omni-600M y escala los que queden cerca de la mitad de su escala a Liquid AI d1-3B para obtener una decisión más precisa. Las reglas de escalado son la confianza y la distribución que el 600M ya devuelve, así que la lógica de enrutamiento no necesita ningún modelo adicional. En una carga de trabajo con una amplia mayoría de elementos fáciles, la mayor parte del tráfico nunca llega al 3B y la mayor parte del dinero nunca se gasta.

Ese patrón es también la razón por la que vale la pena ejecutar los dos modelos detrás de un router. A través de OrcaRouter, ambos quedarían detrás de una sola clave de API a el precio de lista de cada proveedor, trasladado con un 0 % de margen, por lo que la cascada es una regla de enrutamiento en lugar de una segunda integración, y un escalado que falla en la capa del proveedor se reintenta en un fallback en vez de hacer fallar la solicitud. La conmutación automática por error importa más aquí que en un modelo consolidado, porque una de las mitades de este par es un checkpoint cuyo comportamiento el propio proveedor describe como en desarrollo activo.

Nada de eso constituye una declaración de disponibilidad, y vale la pena establecer la distinción con claridad: los checkpoints abiertos de d1 no están en nuestro catálogo. La vía del proveedor es descargar los pesos y ejecutarlos localmente —el soporte de llama.cpp llegó desde el primer día a hardware de Apple, AMD, Qualcomm y NVIDIA— o acceder a ellos a través de la propia API del proveedor y plataformas de terceros.

Elegir, en una sola pasada

Si necesitas texto e imágenes, y la respuesta tiene que ser correcta, elige Liquid AI d1-3B. Tiene los benchmarks, las tablas de latencia, el contexto más amplio, el vocabulario más grande y las cuantizaciones, y es el miembro de la pareja que Liquid posiciona como líder en calidad de su tamaño.

Si necesitas voz en la ruta de decisión, elige Liquid AI d1-omni-600M, porque es la única opción de pesos abiertos en esta familia que acepta audio en absoluto, y acepta que lo estás adoptando por vibras y una demo hasta que alguien publique un benchmark de decisiones de audio o el split de visión retenido.

Si aún no sabes cuál de esos describe tu carga de trabajo, empieza con el 3B e instrumenta la confianza que devuelve. Las subpuntuaciones son la pista: una tarea que vive en las columnas Tools o Language va a recibir un mal servicio por parte del 600M, mientras que algo con forma de recuperación es el único caso en el que el checkpoint pequeño está más cerca de lo que su total implica. La familia existe para que puedas intercambiar precisión por huella, y el intercambio solo es seguro si sabes qué columna ocupa tu tarea.

A capture of the Hugging Face model card for LiquidAI/d1-omni-600M showing 76 likes, the image-text-to-text, Transformers and Safetensors tags, the 'd1_omni', 'system-one', 'multimodal', 'vision', 'audio' and 'decision-model' tags, and the opening description of a 600M parameter decision model that takes a state of text or JSON with images or a voice clip and returns typed answers with zero output tokens.

A través de OrcaRouter, ambos modelos están detrás de una sola clave de API con una regla de enrutamiento en lugar de una segunda integración, y una escalada que falla en la capa del proveedor se reintenta en una opción de respaldo en lugar de que la solicitud falle.