
Liquid AI d1-3B vs Granite 4.2 3B: Dos modelos 3B que nunca hacen el mismo trabajo
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Pon Liquid AI d1-3B y Granite 4.2 3B en la misma GPU y ambos cabrán cómodamente — 3,12B de parámetros por un lado, 3B por el otro. También se comportarán como si vinieran de disciplinas diferentes. Granite 4.2 3B, cuya propia ficha del modelo de IBM data del 25 de agosto de 2026, es un modelo de razonamiento: tres modos de pensamiento, un bloque <think> y una respuesta que se lee. Liquid AI d1-3B, subido a Hugging Face el 5 de octubre de 2026 y anunciado por Liquid dos días después, es un modelo de decisión: toma un estado más un conjunto explícito de preguntas tipadas y devuelve una probabilidad, una etiqueta o una posición en una escala en una sola pasada hacia adelante, reportando output_tokens: 0 porque nunca escribe nada. La pregunta útil no es cuál es mejor. Es cuál de tus llamadas es realmente una decisión, porque los dos repositorios están construidos para mitades opuestas de esa división.
¿Qué hay realmente en cada repositorio?
Todo lo que aparece a continuación proviene de las dos fichas de modelo y de la publicación del anuncio de Liquid. Nada de esto se ha reproducido de forma independiente, ningún tercero ha evaluado ninguno de los dos modelos con el mismo conjunto de pruebas, y las cifras de las fichas son de los propios proveedores.
• Tamaño — Liquid AI d1-3B, 3,12B en total, construido sobre LFM2.5-VL-3B de Liquid; Granite 4.2 3B, un transformer denso solo decodificador de 3B construido sobre granite-4.1-3b-base
• Salida — d1-3B devuelve probabilidades, etiquetas y niveles de confianza y no escribe ningún texto; Granite 4.2 3B genera tokens, incluida una cadena de pensamiento opcional dentro de las <think>etiquetas
• Contexto — d1-3B 32,768 tokens; Granite 4.2 3B 128K de forma nativa, con una extensión de contexto largo a 512K en la tarjeta
• Entrada — texto d1-3B, JSON, imágenes o una mezcla, mediante un codificador de visión SigLIP2 NaFlex 400M; Granite 4.2 3B solo texto
• Licencia — d1-3B bajo la Liquid's LFM Open License v1.0; Granite 4.2 3B bajo Apache 2.0
• Idiomas — d1-3B enumera 16; Granite 4.2 3B enumera doce probados, y la tarjeta señala que los demás no se han probado
• Servicio — d1-3B incluye código personalizado (trust_remote_code=True, transformers>=5.14), con repositorios GGUF y w8a8 en la misma familia y tarjetas documentadas para llama.cpp, Ollama y LM Studio; Granite 4.2 3B se ejecuta con vLLM 0.20+ o SGLang 0.5.18+ con un analizador de pensamiento personalizado
Dos de esas líneas hacen más trabajo que el resto. La fila de salida es todo el argumento de este artículo, y la fila de licencia es la que nadie incluye en la tabla comparativa.

Uno escribe una cadena de pensamiento, el otro se niega a escribir.
Granite 4.2 3B se gana su lugar pensando en voz alta. Su ficha documenta tres modos: activado por defecto, sin pensamiento y un modo de bajo esfuerzo que conserva la traza de razonamiento pero la acorta. Las pilas de servicio separan la traza de la respuesta final, de modo que tu aplicación recibe contenido limpio más un campo de razonamiento aparte. Eso es un buen diseño para una pregunta que necesita resolverse: un problema matemático, una rama de la lógica, un fragmento de código que hay que escribir antes de poder juzgarlo.
d1-3B no tiene ese modo, y su tarjeta lo dice sin rodeos: "No es un modelo de chat y no escribe texto." Una llamada declara preguntas con un tipo. noul es un sí/no que devuelve P(sí) entre 0 y 1. choice elige una etiqueta de un conjunto de opciones con nombre y devuelve la etiqueta, una confianza y una probabilidad por opción. score sitúa el estado en una escala ordenada de dos a diez y devuelve el nivel esperado con su distribución y leyenda. La señal se lee de los logits en una posición de relleno en una sola pasada, no se muestrea token por token, por lo que el bloque de uso puede informar cero tokens de salida sin mentir.
Esa diferencia cambia tu factura antes de cambiar tu precisión. Una llamada de clasificación de Granite que "piensa" durante 400 tokens es una llamada por la que pagas 400 tokens de salida, y la etiqueta que querías queda enterrada en prosa que luego un analizador tiene que recuperar. Una llamada a d1-3B solo factura la entrada. Si la mayor parte de tu tráfico es una etiqueta con una regla asociada, has estado pagando por el razonamiento, haya cambiado o no la etiqueta.
Donde Granite 4.2 3B es claramente la mejor opción
Tome los benchmarks de razonamiento al pie de la letra —son de IBM, ejecutados mediante una pipeline interna de NeMo Evaluator, y ninguna entidad externa los ha reproducido— y el 3B es inusualmente potente para su tamaño: AIME25 78,33, HMMT February 2025 66,67, GPQA 54,80, LiveCodeBench v6 69,71, MMLU-Pro 67,84, IFBench 74,33, BFCL v4 52,41, tau3-bench 45,78, y RULER 64K 67,52 cayendo a 55,30 a 128K.
De esa lista se derivan cuatro trabajos, y d1-3B no está en ninguno de ellos.
• Un contexto nativo de 128K, ampliable a 512K, frente a 32.768 tokens en d1-3B — si tu estado es un documento largo, la elección ya está hecha para ti
• Llamada a herramientas agéntica con un analizador documentado e integraciones de arnés para OpenCode, Pi y OpenHands, de lo cual un modelo de decisión no tiene equivalente
• Cualquier tarea cuya respuesta sea un párrafo: resumen, redacción, extracción a una estructura de formato libre, generación de código
• Ajuste fino y redistribución sin límite de ingresos, porque Apache 2.0 no tiene cláusula de umbral
Fíjate en lo que no está en la tarjeta de Granite: las filas de SWE-Bench y Terminal-Bench están marcadas como NA para el 3B. La etapa de aprendizaje por refuerzo agéntico de IBM se aplicó solo a los miembros de 8B y 30B de la familia, por lo que el modelo más pequeño no tiene las puntuaciones agénticas que sí tienen sus hermanos mayores. Un equipo que lea «Granite 4.2» y asuma que el 3B hereda el perfil agéntico de la familia se sorprenderá.

Donde d1-3B gana antes de que Granite termine de pensar
La propia tabla de latencia de Liquid, medida en caliente, una solicitud a la vez, es la parte más sólida de su argumento: una sola pregunta en 8 ms en una RTX 4090 y 9 ms en una AMD MI325X, 16 ms en una Jetson AGX Thor y 26 ms en una Jetson AGX Orin 64GB, con 64 estados empaquetados en una sola pasada a 475/s en la 4090 y 1,106/s en la MI325X. Para ponerlo en escala, ese es aproximadamente el tiempo que Granite 4.2 3B necesita para emitir unos pocos tokens de su traza de razonamiento.
Tres tipos de preguntas sobre un solo estado le cuestan a d1-3B 21 ms en la 4090 en lugar de tres llamadas separadas, porque el estado y sus imágenes se leen una vez para todas las preguntas. En una pila de moderación o enrutamiento que solía disparar una solicitud HTTP por regla, esa es la diferencia entre una cola de llamadas y una sola.
También ve. d1-3B obtiene una media de 74.1 en once benchmarks públicos de imágenes, frente a 73.9 de su modelo base, y la tarjeta señala que, al eliminar la imagen, las mismas preguntas puntúan 45.1 — las respuestas provienen de la imagen, no del prompt de texto. Las filas individuales van en ambos sentidos (CV-Bench 82.1 frente al 87.6 del modelo base, POPE 88.5 frente al 90.1), por lo que la afirmación sobre la visión es «a la par que el modelo base», no «mejor que él».
El contrapeso honesto: el 48.57 de d1-3B en Decision Index 0.2.1 fue producido por Liquid ejecutando el evaluador oficial por sí misma en lugar de mediante un envío a la tabla de clasificación, y las filas competidoras provienen de la tabla de clasificación pública. Su media de 77.1 en ocho tareas de benchmark como decisión y su 71.8 en DecisionBench también son de primera parte. Todo lo del lado de d1 en esta comparación no está verificado.

Por qué un razonador de 3B no es un modelo de decisión de 3B
La opción tentadora es tratar Granite 4.2 3B como un sustituto más barato de d1-3B, o viceversa. Ambas fallan, y el fallo es estructural, no una cuestión de calidad.
Pídele a Granite que decida y obtienes una generación que debes parsear, una factura que escala según lo difícil que el modelo encontró la pregunta, y una latencia que depende del modo de pensamiento que seleccionaste. Pídele a d1-3B que razone y no obtienes nada en absoluto: no tiene un flujo de tokens en el que razonar. Los dos modelos están en lados opuestos de una línea que la mayoría de los pipelines cruzan varias veces por solicitud: algo tiene que decidir, y algo tiene que hablar. d1-3B pertenece al frente, donde una regla de triaje elige una ruta y devuelve una confianza calibrada. Granite 4.2 3B pertenece detrás de él, en la rama que necesita que se escriba una respuesta.
Existe una segunda trampa, más silenciosa. El valor de un modelo de decisión es la calibración: una confianza de 0,9 que acierta nueve de cada diez veces. La ficha de Granite 4.2 3B no publica métricas de calibración ni probabilidades; publica puntuaciones de precisión y razonamiento. Comparar a los dos en una tabla de clasificación de un benchmark no te dice nada sobre en cuál de ellos deberías confiar para fijar un umbral.
La línea de licencia que nadie pone en la tabla
Granite 4.2 3B se distribuye bajo Apache 2.0. d1-3B se distribuye bajo la LFM Open License v1.0, que parece permisiva hasta la Sección 5: el uso comercial se concede a condición de que usted o su entidad legal se mantengan por debajo de un umbral definido en el mismo documento como ingresos anuales de diez millones de dólares estadounidenses o más, y cualquier uso comercial por encima de esa línea simplemente no está licenciado. Las organizaciones sin ánimo de lucro y los usuarios de investigación quedan exceptuados.
Para un aficionado o una startup, esto no supone ningún problema. Para una empresa que cruza esa línea a mitad de año —o que podría ser adquirida por una—, los dos repositorios no son artefactos equivalentes, por muy similares que parezcan sus números de parámetros, y la revisión de la licencia tiene lugar mucho después de que alguien ya haya lanzado el prototipo. Es lo más barato de esta página de comprobar de forma temprana.
Ejecutar el par como una única canalización
Ninguno de los dos modelos está hoy en nuestro catálogo, así que esto no es una afirmación de disponibilidad: ambos son artefactos autoalojados y Granite 4.2 3B, en particular, no tiene ningún proveedor de inferencia listado en su ficha. Pero el patrón con el que un equipo acaba realmente es una llamada que decide y otra que habla, y ese patrón es donde una capa de enrutamiento se gana su lugar. OrcaRouter pone más de 200 modelos detrás de una sola clave de API con los precios de lista de los proveedores transferidos con un 0% de margen, de modo que una rebaja de precio de un proveedor llega a tu factura el mismo día en lugar de en la siguiente renovación de contrato, y la conmutación automática por error entre proveedores hace que el componente compartido en medio de un pipeline no se convierta en un único punto de fallo mientras todavía lo estás evaluando. Si quieres hacer una prueba A/B de d1-3B frente a un generalista alojado con tu propio tráfico antes de comprometerte con un despliegue autoalojado, el vecino enrutado más cercano al linaje de Granite es Gemma 4 31B a 0,13 $ por millón de tokens de entrada y 0,38 $ por millón de salida — un modelo mucho más grande, pero con el mismo papel de "generalista que escribe" en el pipeline.
El veredicto, enunciado como regla
Si lo que necesitas es un juicio —spam o no, qué cola, cuán urgente, si esta imagen coincide con esa descripción—, d1-3B es el único de los dos que hace el trabajo en una sola pasada, y lo hace en milisegundos de un solo dígito. Si lo que necesitas es una respuesta escrita, la lectura de un documento largo, una llamada a herramienta o un fragmento de código, Granite 4.2 3B es el que tiene un flujo de tokens, y las puntuaciones de razonamiento del 3B son realmente impresionantes para su tamaño —en las propias evaluaciones de IBM, sin que nadie las haya verificado todavía.
Lo que cambiaría el panorama no es una nueva fila en el benchmark. Es que un tercero puntúe ambos modelos con el mismo arnés de calibración, porque la propiedad que determina si se puede aplicar un umbral a un modelo es la que ninguna de las dos tarjetas te permite comparar hoy.
