
Liquid AI d1-3B vs Qwen 3 8B: ¿Debería una carga de trabajo de clasificación de 8B pasarse a un Decision Model?
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Somewhere in most production stacks there is a Qwen 3 8B being paid to answer yes or no. It moderates a comment, tags a support ticket, decides whether a retrieved passage is relevant, or scores another model's output against a rubric — and it does that by generating text which something downstream then parses. Liquid AI d1-3B, the 3.12B decision model Liquid AI open-weighted on October 7, 2026, exists to do exactly that job without generating anything: a state in, a set of named questions in, and probabilities, labels and confidences out in a single forward pass with zero output tokens. Qwen 3 8B is the vendor's April 2025 open-weights workhorse — roughly 8.2B dense parameters, 119 languages, thinking on or off per request, and sixteen months of community deployment behind it. The question this pairing actually asks is narrow and practical: for the slice of your traffic that is a classification, is an 8B generalist the cheapest way to get a label in 2026, or has the shape of that job changed underneath it?
Lo que realmente le estás pagando a un 8B para que haga
Pon los dos contratos de salida uno al lado del otro y la ineficiencia es estructural, no incremental.
Una llamada de clasificación de Qwen 3 8B es una generación. Escribes un prompt que describe las etiquetas, el modelo opcionalmente razona sobre la entrada —y en este modelo puedes activar o desactivar ese razonamiento por solicitud, que es el control más útil que tiene para este tipo de trabajo— y luego devuelve una respuesta. Esa respuesta es texto. Si pediste JSON, normalmente obtendrás JSON y, de vez en cuando, obtendrás JSON dentro de una frase, o un preámbulo, o una explicación final que no querías. La etiqueta que te interesa está en alguna parte del flujo de tokens, y un analizador la recupera. Se te cobra por cada token que escribe el modelo, incluidos los que descartas.
Liquid AI d1-3B no tiene un flujo de tokens. Las preguntas se declaran con un tipo: noul para sí/no, respondidas como P(sí) entre 0 y 1; choice para una etiqueta de un conjunto de opciones con nombre, respondidas como la etiqueta más una confianza más una probabilidad por opción; score para una posición en una escala ordenada de dos a diez, respondidas como el nivel esperado con su distribución y leyenda. La respuesta lleva un total acumulado que dice output_tokens: 0. No hay nada que analizar porque no se escribió nada, y hay un accesor de probabilities sin procesar cuando quieres la distribución sin redondear en lugar del argmax.
La parte que cambia tu factura es lo que ocurre con varias preguntas. Un estado puede soportar muchas: ¿es una solicitud de reembolso?, ¿qué equipo debería encargarse de ella?, ¿qué urgencia tiene? El estado y sus imágenes se leen una vez, y Liquid informa que tres preguntas sobre un estado cuestan 1,3x el tiempo de una en lugar de 3x. Lo que no reduce es el cargo por entrada: la nota de facturación del proveedor es explícita en que cada pregunta se factura como su propio prompt, incluido su texto y todas sus imágenes. Menos latencia, los mismos tokens de entrada. Ese es un asterisco honesto en el titular, y es el tipo de cosa que solo se descubre leyendo el párrafo de precios en lugar del benchmark.

Lo que te aportan dieciséis meses de Qwen 3 8B
Antes de tratar el modelo más pequeño como una mejora, sé preciso sobre lo que aporta el modelo en funciones, porque es más que la cantidad de parámetros.
• Contexto — Qwen 3 8B ejecuta 32.768 tokens de forma nativa y se extiende a 131.072 validados mediante YaRN. Liquid AI d1-3B ejecuta 32.768 tokens fijos, sin una ruta de extensión documentada. Para un estado que es un documento largo, el 8B es el único de los dos que puede contenerlo.
• Idiomas — 119 idiomas y dialectos para Qwen 3 8B frente a dieciséis documentados para Liquid AI d1-3B.
• Control del razonamiento — Qwen 3 8B te permite activar o desactivar el pensamiento por solicitud. Liquid AI d1-3B no tiene ningún modo de razonamiento que controlar, lo cual es una simplificación o una limitación, según para qué estuvieras usando el pensamiento.
• Amplitud — el 8B escribe, explica, resume, traduce y programa. Liquid AI d1-3B no hace nada de eso. Su ficha lo dice claramente: no es un modelo de chat y no escribe texto.
• Evidencia — Qwen 3 8B cuenta con dieciséis meses de evaluación comparativa pública, cuantización, ajuste fino y uso en producción. La puntuación de 48,57 en el Decision Index de Liquid AI d1-3B fue producida por Liquid usando el evaluador oficial en lugar de presentarse a la tabla de clasificación pública, y tiene solo unos días sin reproducción por terceros.
• Visión — esta fila va en sentido contrario. Liquid AI d1-3B admite imágenes, y el proveedor reporta 74,1 en once benchmarks públicos de imágenes, interpretados como decisiones sobre el conjunto de opciones de cada benchmark, e informa que eliminar las imágenes reduce las mismas preguntas a 45,1. El Qwen 3 8B, solo texto, necesita un modelo de visión aparte delante para lograr algo de eso.
• Velocidad — una pregunta en 8 ms en una RTX 4090, 16 ms en una Jetson AGX Thor, 50 ms en una Jetson Orin Nano, y 64 estados empaquetados por pasada a 475 por segundo en la 4090. Un clasificador basado en generación no tiene una cifra comparable, porque su latencia depende de la longitud de la respuesta.
El resumen honesto es que el 8B es el mejor instrumento general y el modelo de decisión 3B es el mejor especializado, y la única pregunta que importa es qué proporción de tu tráfico es el caso especializado.
La aritmética de los costos, hecha con cuidado
Aquí es donde la comparación se amortiza por sí sola o no, así que vale la pena hacerla con una estructura real en lugar de un eslogan.
La afirmación que Liquid publicó dos días antes del lanzamiento de pesos abiertos es que su modelo de decisión alojado iguala o supera a GPT-6.1 Sol en cuatro de seis aplicaciones reales, con un costo de 19x a 200x menor, y responde más rápido en cada tarea. Lee la metodología antes de repetirla: cada aplicación se ejecutó una vez por modelo el 5 de octubre de 2026, los modelos de chat respondieron en JSON con su configuración de razonamiento predeterminada, y el costo de d1 se calculó a $0,04 por millón de tokens de entrada. Esa cifra de $0,04 es la tarifa de entrada del d1 alojado, y es la única tarifa que existe — no hay una línea de salida que añadir.
Ahora construye la misma forma de estimación para un clasificador Qwen 3 8B y la asimetría es visible sin citar el precio de ningún proveedor. El 8B tiene dos líneas facturables donde el modelo de decisión tiene una, y la segunda línea es la que crece: una clasificación que razona primero paga el razonamiento, y una clasificación que rellena su JSON paga el relleno. El cargo por entrada del modelo de decisión está fijado por el estado y las preguntas. El del 8B no está fijado por nada que puedas predecir solo a partir del estado.
Dos contrapesos impiden que esto se convierta en una derrota aplastante. Primero, el modelo de decisión factura cada pregunta como su propio prompt, así que hacer cinco preguntas sobre un documento largo quintuplica la entrada: el 8B hace las cinco en una sola llamada y paga por el documento una sola vez. Segundo, y más importante, un modelo de decisión solo puede responder preguntas para las que fue entrenado posteriormente a responder de esa forma. Cualquier cosa que requiera una explicación, un resumen o un juicio expresado con palabras te devuelve al generalista y, en la práctica, te devuelve a pagar por ambos.

En lo que los dos son realmente buenos
Si quitamos el benchmarking, la división es más limpia de lo que sugieren los recuentos de parámetros.
Liquid AI d1-3B es para el sí/no, la selección de una lista y la puntuación, con un umbral de latencia que ningún sistema generativo alcanza, en hardware que incluye un Jetson Orin Nano a 50 ms y un portátil. Las aplicaciones que Liquid demostró en octubre eran todas versiones de esa forma: un predicado SQL que responde sí o no para 150 tickets de soporte, un bucle de compactación de contexto de agente que conserva, recorta o descarta la salida de cada herramienta y elimina el 52% de los tokens, una aplicación de inspección que clasifica piezas buenas y defectuosas de cuatro líneas de producción con una precisión del 85 al 97% en una tarea para la que nunca había sido entrenada y que entendió a partir de una breve descripción. Esa última demostración es la declaración más clara de para qué sirve la categoría: un trabajo donde la respuesta es una de unas pocas cosas, el estado es una imagen y nunca se solicitó una explicación.
Qwen 3 8B es para el trabajo que tiene que volver como lenguaje, o abarcar 119 idiomas, o contener un documento de más de treinta y dos mil tokens, o razonar en voz alta antes de comprometerse. También es la respuesta correcta cuando la clasificación no es una de las tres formas anteriores — cuando el conjunto de etiquetas es abierto, cuando los criterios son lo suficientemente matizados como para que quisieras el razonamiento, cuando la misma llamada tiene que manejar el caso fácil y el difícil sin que tengas que enrutar entre dos modelos. Y es la opción segura cuando un revisor pregunta qué benchmarks independientes existen, porque la respuesta es: muchos, que se remontan a un año y medio.
Los equipos que aciertan con esto no eligen. Colocan el modelo de decisión delante del generalista, en la porción de tráfico donde la respuesta es un número, y dejan que el 8B se encargue de todo lo que necesita una frase. El filtro es 3B y 8 ms; el 8B se queda para la carga útil.
Desplegando el par
Liquid AI d1-3B llega como pesos con el trabajo de despliegue ya hecho: compatibilidad con llama.cpp desde el primer día, todo el stack de NVIDIA desde DGX hasta Jetson, cuantización NVFP4, una variante de 8 bits de pesos y activaciones, y conversiones GGUF en Hugging Face. Qwen 3 8B tiene el ecosistema de autoalojamiento más profundo de cualquier modelo en esta clase de pesos. Ninguno de los dos está en nuestro catálogo, y nada de lo aquí dicho constituye una afirmación de disponibilidad para ninguno de ellos: la vía alojada para Liquid AI d1-3B es la propia API del proveedor y plataformas de terceros, donde el alojado d1 tiene un precio basado únicamente en tokens de entrada de 0,04 $ por millón, con las imágenes facturadas a 1,5 tokens por cada parche de 32×32 píxeles.
Una vez que ambos están en la misma pipeline, el problema de enrutamiento deja de ser teórico. Tienes un modelo pequeño propio, un 8B que puedes alojar o alquilar, y las llamadas generativas que sin duda alquilas — y decidir por solicitud a cuál debe ir una entrada dada es exactamente la decisión para la que existe una capa de enrutamiento. Un único endpoint para más de 200 modelos, precios de lista de proveedores trasladados con 0 % de margen para que un cambio de precio de un proveedor esté activo de tu lado el mismo día, conmutación por error automática para que una mala tarde de un upstream no se convierta en tu interrupción del servicio. Cuando tu tráfico de clasificación se mide en miles de millones de llamadas al año, esa capa es donde realmente se recogen los ahorros de un modelo de decisión de 3B.
El veredicto
Si a tu 8B se le están haciendo preguntas cerradas —¿esto es tóxico?, ¿esto es relevante?, ¿a qué cola pertenece esto?, ¿qué urgencia tiene?—, estás pagando la factura de dos líneas de un generalista y la latencia de una generación por una etiqueta, y Liquid AI d1-3B es un reemplazo directo con un rastro de evidencia más débil y una diferencia de licencia real que sopesar. Acepta el límite de contexto de 32K, los dieciséis idiomas y el hecho de que nadie fuera de Liquid lo ha evaluado todavía.
Si a tu 8B se le pide explicar, resumir, traducir, retener un documento largo o razonar antes de decidir, esta comparación no se aplica a tu caso. Conserva el 8B y considera el modelo de decisión solo como un prefiltro para el tráfico que puedas identificar de antemano como del tipo fácil.
El número interesante que hay que observar no es la puntuación de referencia de ninguno de los dos modelos. Es la rapidez con la que llegue la primera reproducción independiente del d1 Decision Index, porque ese es el momento en que la comparación deja de ser la afirmación de un proveedor y empieza a ser un hecho con el que se puede planificar.

