Una tarjeta de título principal con el encabezado 'Liquid AI d1-3B vs Granite 4.2 3B' y el subtítulo 'uno decide, uno escribe', que muestra una tarjeta a la izquierda etiquetada d1-3B con un icono de lista de verificación, la leyenda '3.12B - 32,768 tokens' y chips que dicen probabilidad, etiqueta y puntuación, y una tarjeta a la derecha etiquetada Granite 4.2 3B con un icono de burbuja de diálogo, la leyenda '3B - 128K tokens' y un chip que dice 'una respuesta escrita'.
Guides & Insights

Liquid AI d1-3B vs Granite 4.2 3B: Dos modelos 3B que nunca hacen el mismo trabajo

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Pon Liquid AI d1-3B y Granite 4.2 3B en la misma GPU y ambos cabrán cómodamente — 3,12B de parámetros por un lado, 3B por el otro. También se comportarán como si vinieran de disciplinas diferentes. Granite 4.2 3B, cuya propia ficha del modelo de IBM data del 25 de agosto de 2026, es un modelo de razonamiento: tres modos de pensamiento, un bloque <think> y una respuesta que se lee. Liquid AI d1-3B, subido a Hugging Face el 5 de octubre de 2026 y anunciado por Liquid dos días después, es un modelo de decisión: toma un estado más un conjunto explícito de preguntas tipadas y devuelve una probabilidad, una etiqueta o una posición en una escala en una sola pasada hacia adelante, reportando output_tokens: 0 porque nunca escribe nada. La pregunta útil no es cuál es mejor. Es cuál de tus llamadas es realmente una decisión, porque los dos repositorios están construidos para mitades opuestas de esa división.

¿Qué hay realmente en cada repositorio?

Todo lo que aparece a continuación proviene de las dos fichas de modelo y de la publicación del anuncio de Liquid. Nada de esto se ha reproducido de forma independiente, ningún tercero ha evaluado ninguno de los dos modelos con el mismo conjunto de pruebas, y las cifras de las fichas son de los propios proveedores.

• Tamaño — Liquid AI d1-3B, 3,12B en total, construido sobre LFM2.5-VL-3B de Liquid; Granite 4.2 3B, un transformer denso solo decodificador de 3B construido sobre granite-4.1-3b-base

• Salida — d1-3B devuelve probabilidades, etiquetas y niveles de confianza y no escribe ningún texto; Granite 4.2 3B genera tokens, incluida una cadena de pensamiento opcional dentro de las <think>etiquetas

• Contexto — d1-3B 32,768 tokens; Granite 4.2 3B 128K de forma nativa, con una extensión de contexto largo a 512K en la tarjeta

• Entrada — texto d1-3B, JSON, imágenes o una mezcla, mediante un codificador de visión SigLIP2 NaFlex 400M; Granite 4.2 3B solo texto

• Licencia — d1-3B bajo la Liquid's LFM Open License v1.0; Granite 4.2 3B bajo Apache 2.0

• Idiomas — d1-3B enumera 16; Granite 4.2 3B enumera doce probados, y la tarjeta señala que los demás no se han probado

• Servicio — d1-3B incluye código personalizado (trust_remote_code=True, transformers>=5.14), con repositorios GGUF y w8a8 en la misma familia y tarjetas documentadas para llama.cpp, Ollama y LM Studio; Granite 4.2 3B se ejecuta con vLLM 0.20+ o SGLang 0.5.18+ con un analizador de pensamiento personalizado

Dos de esas líneas hacen más trabajo que el resto. La fila de salida es todo el argumento de este artículo, y la fila de licencia es la que nadie incluye en la tabla comparativa.

A two-column scoreboard for Liquid AI d1-3B and Granite 4.2 3B. The d1-3B column reads: job answers a typed question; parameters 3.12B; output tokens billed 0; context 32,768 tokens; image input yes; one question 8 ms on an RTX 4090. The Granite 4.2 3B column reads: job writes a reasoned answer; parameters 3B; output tokens billed every token it writes; context 128K, to 512K extended; image input no; one question a full thinking pass. The footer reads 'Both columns vendor-reported, neither independently scored.'

Uno escribe una cadena de pensamiento, el otro se niega a escribir.

Granite 4.2 3B se gana su lugar pensando en voz alta. Su ficha documenta tres modos: activado por defecto, sin pensamiento y un modo de bajo esfuerzo que conserva la traza de razonamiento pero la acorta. Las pilas de servicio separan la traza de la respuesta final, de modo que tu aplicación recibe contenido limpio más un campo de razonamiento aparte. Eso es un buen diseño para una pregunta que necesita resolverse: un problema matemático, una rama de la lógica, un fragmento de código que hay que escribir antes de poder juzgarlo.

d1-3B no tiene ese modo, y su tarjeta lo dice sin rodeos: "No es un modelo de chat y no escribe texto." Una llamada declara preguntas con un tipo. noul es un sí/no que devuelve P(sí) entre 0 y 1. choice elige una etiqueta de un conjunto de opciones con nombre y devuelve la etiqueta, una confianza y una probabilidad por opción. score sitúa el estado en una escala ordenada de dos a diez y devuelve el nivel esperado con su distribución y leyenda. La señal se lee de los logits en una posición de relleno en una sola pasada, no se muestrea token por token, por lo que el bloque de uso puede informar cero tokens de salida sin mentir.

Esa diferencia cambia tu factura antes de cambiar tu precisión. Una llamada de clasificación de Granite que "piensa" durante 400 tokens es una llamada por la que pagas 400 tokens de salida, y la etiqueta que querías queda enterrada en prosa que luego un analizador tiene que recuperar. Una llamada a d1-3B solo factura la entrada. Si la mayor parte de tu tráfico es una etiqueta con una regla asociada, has estado pagando por el razonamiento, haya cambiado o no la etiqueta.

Donde Granite 4.2 3B es claramente la mejor opción

Tome los benchmarks de razonamiento al pie de la letra —son de IBM, ejecutados mediante una pipeline interna de NeMo Evaluator, y ninguna entidad externa los ha reproducido— y el 3B es inusualmente potente para su tamaño: AIME25 78,33, HMMT February 2025 66,67, GPQA 54,80, LiveCodeBench v6 69,71, MMLU-Pro 67,84, IFBench 74,33, BFCL v4 52,41, tau3-bench 45,78, y RULER 64K 67,52 cayendo a 55,30 a 128K.

De esa lista se derivan cuatro trabajos, y d1-3B no está en ninguno de ellos.

• Un contexto nativo de 128K, ampliable a 512K, frente a 32.768 tokens en d1-3B — si tu estado es un documento largo, la elección ya está hecha para ti

• Llamada a herramientas agéntica con un analizador documentado e integraciones de arnés para OpenCode, Pi y OpenHands, de lo cual un modelo de decisión no tiene equivalente

• Cualquier tarea cuya respuesta sea un párrafo: resumen, redacción, extracción a una estructura de formato libre, generación de código

• Ajuste fino y redistribución sin límite de ingresos, porque Apache 2.0 no tiene cláusula de umbral

Fíjate en lo que no está en la tarjeta de Granite: las filas de SWE-Bench y Terminal-Bench están marcadas como NA para el 3B. La etapa de aprendizaje por refuerzo agéntico de IBM se aplicó solo a los miembros de 8B y 30B de la familia, por lo que el modelo más pequeño no tiene las puntuaciones agénticas que sí tienen sus hermanos mayores. Un equipo que lea «Granite 4.2» y asuma que el 3B hereda el perfil agéntico de la familia se sorprenderá.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that releases d1-3B and d1-omni-600M as open-weight models, d1-3B's Decision Index score of 48.57 and the claim that it is ahead of every model under 10B, and its latency of 8 ms on an NVIDIA GeForce RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Donde d1-3B gana antes de que Granite termine de pensar

La propia tabla de latencia de Liquid, medida en caliente, una solicitud a la vez, es la parte más sólida de su argumento: una sola pregunta en 8 ms en una RTX 4090 y 9 ms en una AMD MI325X, 16 ms en una Jetson AGX Thor y 26 ms en una Jetson AGX Orin 64GB, con 64 estados empaquetados en una sola pasada a 475/s en la 4090 y 1,106/s en la MI325X. Para ponerlo en escala, ese es aproximadamente el tiempo que Granite 4.2 3B necesita para emitir unos pocos tokens de su traza de razonamiento.

Tres tipos de preguntas sobre un solo estado le cuestan a d1-3B 21 ms en la 4090 en lugar de tres llamadas separadas, porque el estado y sus imágenes se leen una vez para todas las preguntas. En una pila de moderación o enrutamiento que solía disparar una solicitud HTTP por regla, esa es la diferencia entre una cola de llamadas y una sola.

También ve. d1-3B obtiene una media de 74.1 en once benchmarks públicos de imágenes, frente a 73.9 de su modelo base, y la tarjeta señala que, al eliminar la imagen, las mismas preguntas puntúan 45.1 — las respuestas provienen de la imagen, no del prompt de texto. Las filas individuales van en ambos sentidos (CV-Bench 82.1 frente al 87.6 del modelo base, POPE 88.5 frente al 90.1), por lo que la afirmación sobre la visión es «a la par que el modelo base», no «mejor que él».

El contrapeso honesto: el 48.57 de d1-3B en Decision Index 0.2.1 fue producido por Liquid ejecutando el evaluador oficial por sí misma en lugar de mediante un envío a la tabla de clasificación, y las filas competidoras provienen de la tabla de clasificación pública. Su media de 77.1 en ocho tareas de benchmark como decisión y su 71.8 en DecisionBench también son de primera parte. Todo lo del lado de d1 en esta comparación no está verificado.

A capture of the Hugging Face model card for ibm-granite/granite-4.2-3b, showing the Apache 2.0 licence, the 3B parameter count, the decoder-only dense architecture built on Granite-4.1-3B-Base, the 128K native context with long-context extension to 512K, bfloat16 precision, the tested-language list and the built-in chain-of-thought reasoning mode.

Por qué un razonador de 3B no es un modelo de decisión de 3B

La opción tentadora es tratar Granite 4.2 3B como un sustituto más barato de d1-3B, o viceversa. Ambas fallan, y el fallo es estructural, no una cuestión de calidad.

Pídele a Granite que decida y obtienes una generación que debes parsear, una factura que escala según lo difícil que el modelo encontró la pregunta, y una latencia que depende del modo de pensamiento que seleccionaste. Pídele a d1-3B que razone y no obtienes nada en absoluto: no tiene un flujo de tokens en el que razonar. Los dos modelos están en lados opuestos de una línea que la mayoría de los pipelines cruzan varias veces por solicitud: algo tiene que decidir, y algo tiene que hablar. d1-3B pertenece al frente, donde una regla de triaje elige una ruta y devuelve una confianza calibrada. Granite 4.2 3B pertenece detrás de él, en la rama que necesita que se escriba una respuesta.

Existe una segunda trampa, más silenciosa. El valor de un modelo de decisión es la calibración: una confianza de 0,9 que acierta nueve de cada diez veces. La ficha de Granite 4.2 3B no publica métricas de calibración ni probabilidades; publica puntuaciones de precisión y razonamiento. Comparar a los dos en una tabla de clasificación de un benchmark no te dice nada sobre en cuál de ellos deberías confiar para fijar un umbral.

La línea de licencia que nadie pone en la tabla

Granite 4.2 3B se distribuye bajo Apache 2.0. d1-3B se distribuye bajo la LFM Open License v1.0, que parece permisiva hasta la Sección 5: el uso comercial se concede a condición de que usted o su entidad legal se mantengan por debajo de un umbral definido en el mismo documento como ingresos anuales de diez millones de dólares estadounidenses o más, y cualquier uso comercial por encima de esa línea simplemente no está licenciado. Las organizaciones sin ánimo de lucro y los usuarios de investigación quedan exceptuados.

Para un aficionado o una startup, esto no supone ningún problema. Para una empresa que cruza esa línea a mitad de año —o que podría ser adquirida por una—, los dos repositorios no son artefactos equivalentes, por muy similares que parezcan sus números de parámetros, y la revisión de la licencia tiene lugar mucho después de que alguien ya haya lanzado el prototipo. Es lo más barato de esta página de comprobar de forma temprana.

Ejecutar el par como una única canalización

Ninguno de los dos modelos está hoy en nuestro catálogo, así que esto no es una afirmación de disponibilidad: ambos son artefactos autoalojados y Granite 4.2 3B, en particular, no tiene ningún proveedor de inferencia listado en su ficha. Pero el patrón con el que un equipo acaba realmente es una llamada que decide y otra que habla, y ese patrón es donde una capa de enrutamiento se gana su lugar. OrcaRouter pone más de 200 modelos detrás de una sola clave de API con los precios de lista de los proveedores transferidos con un 0% de margen, de modo que una rebaja de precio de un proveedor llega a tu factura el mismo día en lugar de en la siguiente renovación de contrato, y la conmutación automática por error entre proveedores hace que el componente compartido en medio de un pipeline no se convierta en un único punto de fallo mientras todavía lo estás evaluando. Si quieres hacer una prueba A/B de d1-3B frente a un generalista alojado con tu propio tráfico antes de comprometerte con un despliegue autoalojado, el vecino enrutado más cercano al linaje de Granite es Gemma 4 31B a 0,13 $ por millón de tokens de entrada y 0,38 $ por millón de salida — un modelo mucho más grande, pero con el mismo papel de "generalista que escribe" en el pipeline.

El veredicto, enunciado como regla

Si lo que necesitas es un juicio —spam o no, qué cola, cuán urgente, si esta imagen coincide con esa descripción—, d1-3B es el único de los dos que hace el trabajo en una sola pasada, y lo hace en milisegundos de un solo dígito. Si lo que necesitas es una respuesta escrita, la lectura de un documento largo, una llamada a herramienta o un fragmento de código, Granite 4.2 3B es el que tiene un flujo de tokens, y las puntuaciones de razonamiento del 3B son realmente impresionantes para su tamaño —en las propias evaluaciones de IBM, sin que nadie las haya verificado todavía.

Lo que cambiaría el panorama no es una nueva fila en el benchmark. Es que un tercero puntúe ambos modelos con el mismo arnés de calibración, porque la propiedad que determina si se puede aplicar un umbral a un modelo es la que ninguna de las dos tarjetas te permite comparar hoy.