Una tarjeta de título principal con el encabezado «Liquid AI d1-3B vs Gemma 4 12B» y el subtítulo «un modelo de decisión frente a un generalista», que muestra una pequeña tarjeta de lista de verificación de 3,12B con un chip de probabilidad junto a una tarjeta más grande de 11,96B que lleva iconos de documento, forma de onda y fotograma de película, y un chip de respuesta escrita.
Guides & Insights

Liquid AI d1-3B vs Gemma 4 12B: Un modelo de decisión contra un generalista

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La forma más rápida de hacer mal esta comparación es poner Liquid AI d1-3B y Gemma 4 12B en el mismo benchmark y esperar a un ganador. No responden a la misma pregunta. Liquid AI d1-3B es un modelo de decisión de 3,12B publicado como pesos abiertos el 7 de octubre de 2026: le das un estado y un conjunto de preguntas con nombre y devuelve probabilidades, una etiqueta elegida y una confianza, con cero tokens de salida y ningún paso de generación. Gemma 4 12B es el generalista any-to-any sin encoder de Google, un checkpoint de 11,96B que acepta texto, imagen, audio y vídeo y escribe una respuesta en una ventana de 256.000 tokens en más de 140 idiomas. Uno de ellos te dice cuál de cuatro cosas es una placa de circuito. El otro te dice por qué. Compáralos solo por calidad y no aprendes nada, porque los resultados no son conmensurables, y los proveedores nunca los han comparado entre sí con benchmarks. Compáralos por lo que devuelve realmente una llamada, lo que cuesta y dónde se queda sin camino cada uno, y el emparejamiento se convierte en una prueba de límites genuinamente útil.

Dos contratos de salida diferentes

La distinción que hace todo el trabajo aquí es lo que vuelve por el cable.

Liquid AI d1-3B devuelve un objeto de respuesta estructurado. Cada pregunta de una solicitud declara un tipo — noul para sí/no con P(sí), choice para una de un conjunto de opciones con nombre, con una confianza y una probabilidad por opción, o score para una posición en una escala ordenada de dos a diez niveles, con el nivel esperado y su distribución. El modelo informa output_tokens: 0 porque no se escribe nada. Varias preguntas sobre un mismo estado se leen en una sola pasada hacia adelante, y el estado y sus imágenes se codifican una única vez para todas ellas.

Ge​mma 4 12B devuelve prosa. A veces devuelve el JSON que pediste, a veces devuelve un JSON que no es exactamente lo que pediste, y puede razonar antes de responder. Es, ante todo, un modelo de lenguaje: cualquier cosa que sepa clasificar, la expresa como texto. Eso es una fortaleza cuando la respuesta debe explicarse a una persona o alimentar un paso posterior que espera lenguaje, y un coste cuando lo único que necesitabas era una probabilidad.

Todo lo que viene después se deriva de eso. Una respuesta de d1-3B no puede fallar al analizarse. Tampoco puede explicarse a sí misma, y la tarjeta del modelo lo dice directamente: no es un modelo de chat y no escribe texto.

Dónde se encuentran los rastros de la evidencia

La procedencia de los dos conjuntos de números no es equivalente, y eso importa aquí más que los propios números.

• Decision Index 0.2.1 — Liquid AI d1-3B obtiene 48.57, puntuado por el proveedor con el evaluador oficial, primero entre los modelos de menos de 10B y por delante de Decider 35B-A3B con 47.11. Ge​mma 4 12B no está puntuado en el Decision Index en absoluto, así que esta fila no tiene equivalente.

• Benchmarks de razonamiento — Gemma 4 12B obtiene 77.5 en AIME 2026, 78.8 en ARC Diamond y 1,659 en Code Runner ELO, y tiene un Artificial Analysis Intelligence Index de 22 en modo de razonamiento y 13 con el razonamiento desactivado. Liquid AI d1-3 no tiene benchmark de razonamiento, porque un modelo de decisión no produce razonamiento.

• Contexto extenso — Ge​mma 4 12B acepta 256.000 tokens y obtiene un 43,4 % en MRCR v2 de ocho agujas a 128k en la propia ficha de Goo​gle. Liquid AI d1-3B acepta 32.768 tokens. Si tu "estado" es un documento de cuarenta páginas más escaneos, esa diferencia lo decide todo y no hay comparación.

• Visión — Liquid AI d1-3B promedia 74,1 en once benchmarks públicos de imágenes interpretados como decisiones sobre el conjunto de opciones de cada benchmark, frente a 73,9 del backbone LFM2.5-VL-3B a partir del cual se construyó, y el proveedor informa de que eliminar las imágenes hace caer las mismas preguntas a 45,1. La visión de Gemma 4 12B es más sólida y amplia, pero se reporta como calidad de generación, no como precisión de decisión sobre opciones con nombre.

• Idiomas — dieciséis documentados para Liquid AI d1-3B; más de 140 para Gemma 4 12B.

• Velocidad — Liquid AI d1-3B responde una pregunta en 8 ms en una RTX 4090, 16 ms en una Jetson AGX Thor, 26 ms en una Jetson AGX Orin de 64 GB y 50 ms en una Jetson Orin Nano, y empaqueta 64 estados en una sola pasada a 475 por segundo en la 4090. Gemma 4 12B genera, por lo que su latencia depende de cuántos tokens escribe.

• Calidad de la evidencia — Los resultados de Gemma 4 12B son de Google, publicados en junio de 2026 y desde entonces sometidos a escrutinio, cuantizados y vueltos a ejecutar por una gran comunidad. Los de Liquid AI d1-3B son de Liquid, publicados hace dos días, reproducidos por nadie fuera del laboratorio. Lee la segunda columna en consecuencia.

A two-column scoreboard for Liquid AI d1-3B and Gemma 4 12B. The d1-3B column reads: output a label, a confidence, zero tokens; 3.12B parameters; 32,768-token context; text and image input; 8 ms per question; Decision Index 48.57 (vendor). The Gemma 4 12B column reads: output generated text; 11.96B parameters; 256,000-token context; text, image, audio and video input; latency that scales with output length; Decision Index not scored. The footer reads 'd1-3B figures vendor-reported and unreproduced; Gemma 4 12B figures per Google, June 2026.'

El único ámbito en el que realmente compiten

Existe un solapamiento real, y no está en una tabla de clasificación. Es la llamada de LLM como juez.

Muchos pipelines de producción ya utilizan un generalista de tamaño medio como capa de evaluación: puntuar la urgencia de este ticket, decidir si esta salida supera una rúbrica, elegir qué herramienta debe invocar el agente a continuación, comprobar si un pasaje recuperado responde a la pregunta. Hoy en día, la mayoría de esas llamadas van a un modelo generativo al que se le pide emitir un número o una etiqueta como texto, y el número que emite es el que haya producido el muestreador, en lugar de un softmax sobre tu conjunto de opciones. Ese es el flujo de trabajo que Liquid AI d1-3B fue postentrenado para reemplazar, y las demos publicadas son todas versiones de él — un predicado SQL que responde sí o no para 150 tickets de soporte, un bucle de compactación de contexto de agente que conserva, recorta o descarta la salida de cada herramienta y elimina el 52% de los tokens, una aplicación de inspección visual que clasificó piezas buenas y defectuosas de cuatro líneas de producción con una precisión del 85 al 97% en una tarea para la que nunca fue entrenada.

Gemma 4 12B hace todos esos trabajos, y hace más que esos trabajos. También puede escribir el resumen, mantener un documento de 256K a la vista, aceptar una llamada telefónica grabada como entrada y responder en uno de más de 140 idiomas. Si tu canalización necesita una evaluación y una narración, el 12B hace dos trabajos con una sola llamada y el modelo de decisión 3B hace uno de ellos.

El límite es la longitud del contexto y la forma de la salida. Estado largo, entrada hablada, muchos idiomas, o una explicación que el lector espera — Gemma 4 12B, sin duda. Estado corto, un conjunto de opciones fijo, un presupuesto de latencia por solicitud en milisegundos de un solo dígito, o una garantía absoluta de que la respuesta se analizará — esa es la columna de d1-3B, y el generalista está pagando por capacidad que no vas a usar.

Cuánto cuesta llamar a cada uno

Ninguno de los dos modelos está en nuestro catálogo, así que no hay precio de enrutamiento que cotizar para ninguno de los dos: Ge​mma 4 12B no está entre los tamaños de Ge​mma que servimos, y Liquid AI d1-3B es un modelo de pesos abiertos que alojas por tu cuenta o al que accedes mediante la propia API del proveedor y plataformas de terceros. Como contexto sobre el lado adyacente a Gemini de esa familia, los dos tamaños de Ge​mma 4 que sí enrutamos figuran a $0.06 por millón de tokens de entrada y $0.33 por millón de tokens de salida para Ge​mma 4 26B A4B, y $0.13 y $0.38 para Ge​mma 4 31B, ambos con contextos de 262,144 tokens y entrada de texto, imagen y video. El precio medio de proveedor cotizado para Ge​mma 4 12B en otros lugares se sitúa cerca de $0.10 y $0.30.

El servicio alojado de Liquid d1 solo factura tokens de entrada, a $0.04 por millón, y las imágenes se cuentan como entrada a 1,5 tokens por cada parche de 32×32 píxeles. Por eso, una solicitud de decisión no tiene ninguna línea de tokens de salida, que es la razón estructural por la que la propia comparación de costos del proveedor frente a modelos mucho más grandes acaba donde acaba. Los pesos abiertos no tienen precio por llamada; se paga en hardware. Ambos tienen que ubicarse en el mismo pipeline que todo lo demás que invocas, que es la capa para la que existe un router: una sola API para más de 200 modelos, precios de lista de los proveedores traspasados con un 0% de margen, y conmutación automática por fallo para que un único fallo momentáneo de un proveedor upstream no se convierta en tu caída de servicio. Eso es la plomería que rodea la comparación, no la comparación.

A capture of Liquid AI's blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph announcing d1-3B and d1-omni-600M as open-weight models, the d1-3B Decision Index score of 48.57, and the latency figures of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Cómo decidir, honestamente

Empieza por el formato de respuesta en lugar del modelo. Si el sistema posterior puede consumir una probabilidad, una etiqueta y una confianza, y el conjunto de respuestas es pequeño y conocido, Liquid AI d1-3B no es una degradación respecto a un 12B — es un instrumento diferente, y los números de latencia lo convierten en un despliegue categóricamente distinto: 50 ms en un Jetson Orin Nano es un dispositivo que no tiene por qué ejecutar un 12B en absoluto.

Si la respuesta tiene que ser una oración, o el estado supera los treinta y dos mil tokens, o alguien va a pronunciarla, o el idioma de salida es bengalí, entonces Gemma 4 12B es el único de los dos que puede hacer el trabajo, y la comparación termina antes de empezar.

La posición genuinamente útil para la mayoría de los equipos es ambas cosas, en lugares distintos. Un modelo de decisión delante de la llamada costosa, haciendo el triaje, el enrutamiento y las comprobaciones de salvaguardas que no necesitan lenguaje; un generalista detrás de él para el trabajo que sí lo necesita. Esos son el mismo pipeline, uno es un filtro y el otro es la carga útil, y los equipos que más provecho sacarán del lanzamiento de d1 son los que ya están pagando un 12B para responder sí o no.

A capture of our own catalogue page for Google Gemma 4 31B, showing the model id google/gemma-4-31b-it, a release date of 2026-04-02, a 30.7B dense multimodal description with a 256K token context window, and headline pricing of $0.13 per million input tokens and $0.38 per million output tokens.