
Liquid AI d1-3B vs MiniCPM5-2B: Probabilidades o prosa, a escala de portátil
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Dos modelos de pesos abiertos, ambos lo bastante pequeños como para ejecutarse en la máquina que tienes delante, y no coinciden en qué debería devolver un modelo. Liquid AI d1-3B es el modelo de decisión de 3,12B de Liquid AI, con pesos abiertos el 7 de octubre de 2026: lee un estado y un conjunto de preguntas con nombre y devuelve una etiqueta, una probabilidad por opción y una confianza, en una sola pasada hacia delante, sin generar nada. MiniCPM5-2B es el modelo denso de 2,52B de ModelBest y OpenBMB, presentado en la World Artificial Intelligence Conference el 19 de julio y publicado discretamente en Hugging Face a principios de septiembre de 2026 bajo Apache-2.0 — un asistente de razonamiento, programación y llamada a herramientas que escribe respuestas, llama a funciones en XML y ya tiene más de un millón de descargas. El más pequeño tiene cuatro veces la ventana de contexto y una licencia mucho más permisiva; el más grande no puede producir un token aunque quieras que lo haga. Cuál de esas dos formas pertenece a tu pipeline depende enteramente de si lo que está aguas abajo de la llamada quiere un número o una frase.
La reversión que vale la pena notar primero
Casi todas las expectativas intuitivas sobre este emparejamiento están al revés, así que empieza por ahí.
MiniCPM5-2B es el modelo más pequeño y tiene el contexto más largo: 131.072 tokens frente a los 32.768 de Liquid AI d1-3B. También es el de licencia más permisiva de los dos — Apache-2.0, sin restricciones de acceso, con los conjuntos de datos de entrenamiento publicados junto con los pesos como parte de la familia UltraData. Liquid AI d1-3B se distribuye bajo la propia licencia lfm1.0 de Liquid, que es descargable y ajustable, pero es una licencia de proveedor en lugar de una licencia permisiva estándar.
Liquid AI d1-3B es el modelo más grande —3.12B frente a 2.52B en total, aunque la comparación vuelve a invertirse en los parámetros no de embedding— y es el que no puede escribir. Tiene visión; el MiniCPM es solo texto. Está post-entrenado para exactamente una cosa; el MiniCPM está post-entrenado para muchas. Y mientras que el MiniCPM5-2B llega con una tabla comparativa que lo sitúa en lo más alto de su clase de tamaño, el Liquid AI d1-3B llega con una única puntuación de índice y un conjunto de tablas de latencia.
Nada de eso hace que uno sea mejor. Significa que los dos están orientados a tareas distintas, y la pista está en la forma de la respuesta que devuelve cada uno.
¿Qué vuelve por el cable?
MiniCPM5-2B es un modelo de lenguaje generativo. Razona, responde en prosa y emite llamadas a herramientas de estilo XML que el analizador minicpm5 integrado en SGLang convierte en tool_calls compatibles con OpenAI sin necesidad de un adaptador personalizado. Su post-entrenamiento es la parte interesante de su historia: 400 mil millones de tokens de ajuste fino supervisado con pensamiento profundo, luego aprendizaje por refuerzo con un algoritmo basado en crítico tomado de JustRL II, luego destilación on-policy que reincorpora dieciséis profesores de RL especializados —cinco de ellos agénticos— a una única red densa. La ficha atribuye al RL más la destilación una ganancia media de 10,96 puntos en razonamiento y tareas generales, y de 6,96 en las agénticas, y reporta una media de 53,9 en su propio conjunto de comparación, por encima del modelo más grande incluido en ese conjunto. Esas son cifras de ModelBest, producidas internamente, sin que se haya publicado aún una reproducción independiente.
Liquid AI d1-3B devuelve estructura. Una pregunta de tipo noul se devuelve como P(sí) entre 0 y 1. Una pregunta de tipo choice se devuelve como la etiqueta, una confianza y una probabilidad por opción. Una pregunta de tipo score se devuelve como un nivel esperado en una escala ordenada de dos a diez con su distribución y leyenda. El objeto de uso informa output_tokens: 0, y hay un accesor de probabilities sin procesar si quieres los vectores sin procesar. Su post-entrenamiento fue el tipo de trabajo opuesto: promediar dos checkpoints juntos, ajustar varias semillas en diferentes mezclas de datos, fusionarlos, luego dedicar el esfuerzo al entrenamiento con entradas largas, barajar el orden de las opciones de respuesta y eliminar atajos de los datos de entrenamiento — porque un modelo de decisión que aprende "la opción B suele ser correcta" en lugar de leer el estado es peor que inútil.
Uno le pide a un modelo que piense y luego diga algo. El otro le pregunta a un modelo qué es lo que ya cree.

Lado a lado, con la procedencia etiquetada
Todas las cifras que figuran a continuación son reportadas por el proveedor. Las cifras de MiniCPM5-2B provienen de la propia ficha de ModelBest y de su propio conjunto de comparación; las de Liquid AI d1-3B provienen de que Liquid ejecuta él mismo el evaluador oficial de Decision Index, en lugar de enviar el modelo a la tabla de clasificación pública. Ninguno de los dos modelos ha sido evaluado de forma independiente por un tercero en el momento del lanzamiento de pesos abiertos.
• Parámetros — Liquid AI d1-3B 3.12B en total con un codificador de visión SigLIP2 de 400M y un vocabulario de 128.000 tokens; MiniCPM5-2B 2.516.756.480 en total, 1.981.982.720 sin embeddings, 42 capas, 16 cabezas de consulta a 2 cabezas KV, vocabulario 130.560.
Contexto — 32.768 tokens para Liquid AI d1-3B; 131.072 para MiniCPM5-2B.
• Modalidades de entrada — texto e imágenes para Liquid AI d1-3B; solo texto para MiniCPM5-2B.
• Salida — probabilidades, etiquetas, confianzas y puntuaciones ordenadas, con cero tokens de salida, para Liquid AI d1-3B; texto generado, razonamiento y llamadas a herramientas XML para MiniCPM5-2B.
• Puntuación destacada — Liquid AI d1-3B 48.57 en Decision Index 0.2.1, primero entre los modelos de menos de 10B en la tabla del proveedor; MiniCPM5-2B un promedio de 53.9 en su propio conjunto de comparación, que es un conjunto distinto que mide cosas diferentes.
• Velocidad: 8 ms por pregunta en una RTX 4090, 26 ms en una Jetson AGX Orin de 64 GB, 50 ms en una Jetson Orin Nano, y 64 estados empaquetados por pasada a 475 por segundo para Liquid AI d1-3B. La velocidad de MiniCPM5-2B depende de cuántos tokens genera, así que no hay un único número que poner frente a él.
• Licencia — Apache-2.0, sin restricciones, datos de entrenamiento publicados, para MiniCPM5-2B; lfm1.0 de Liquid para Liquid AI d1-3B.
• Evidencia — más de un millón de descargas en Hugging Face y un mes de cuantización comunitaria para MiniCPM5-2B; dos días de existencia y ninguna ejecución por terceros para Liquid AI d1-3B.
El trabajo en el que cada uno es realmente bueno
Hay un flujo de trabajo que ambos modelos pueden realizar, y la diferencia en cómo lo hacen es todo el argumento.
Supón que estás clasificando tickets de soporte, o decidiendo si un pasaje recuperado responde a una pregunta, o puntuando la salida de un LLM según una rúbrica. MiniCPM5-2B puede hacer las tres cosas: es un razonador pequeño y capaz, con llamada a herramientas y un contexto largo, y lo ejecutarías como cualquier otro asistente, pidiendo una etiqueta y luego analizando lo que devuelva. A veces devuelve JSON limpio. A veces devuelve JSON con una explicación envolviéndolo. A veces devuelve la respuesta correcta con la forma equivocada, y ese fallo es un bug en tu analizador, no en el modelo.
Liquid AI d1-3B no puede hacer nada más, que es precisamente la idea. En las mismas tres tareas devuelve una probabilidad y una etiqueta, y nada que parsear; tres preguntas sobre un estado cuestan 1,3 veces el tiempo de una, y el modo de fallo pasa de "el formato se rompió" a "la confianza estaba mal calibrada", lo cual es al menos medible, porque la confianza está en la propia respuesta.
Donde MiniCPM5-2B gana de manera contundente es en todo lo que viene después de la decisión. Soporta 131K tokens, por lo que el estado puede ser todo un árbol de archivos de un repositorio o un documento largo en lugar de la primera página de uno. Escribe llamadas a herramientas de forma nativa. Es un modelo sobre el que puedes construir un pequeño agente, y fue post-entrenado explícitamente para trabajo agéntico. Y su licencia Apache-2.0 significa que la habitual conversación con abogados comerciales no tiene lugar.
Donde Liquid AI d1-3B se impone de forma contundente es en el piso de latencia y en la modalidad. Un dispositivo que ejecuta una decisión en 50 ms sin GPU no es un dispositivo que ejecuta MiniCPM5-2B; ambos viven en niveles de hardware distintos pese a los recuentos de parámetros similares. Y el 3B ve: el proveedor reporta 74.1 en once benchmarks públicos de imágenes interpretados como decisiones, frente a 73.9 del modelo de visión-lenguaje a partir del cual se construyó, e informa que eliminar las imágenes hace que las mismas preguntas se desplomen a 45.1, que es su manera de mostrar que las respuestas provienen de los píxeles. La inspección visual de una línea de producción no es una tarea que se le pueda encomendar en absoluto al 2B de solo texto.

Ejecutarlos, y la capa que los rodea
Ambas son historias de autoalojamiento, y en las dos ya se ha hecho el trabajo de despliegue. Liquid AI d1-3B llega con soporte de llama.cpp desde el primer día, la pila completa de NVIDIA desde DGX hasta Jetson, cuantización NVFP4, una compilación de 8 bits para pesos y activaciones, y conversiones GGUF ya publicadas. MiniCPM5-2B es una arquitectura LlamaForCausalLM simple que no requiere kernels personalizados, un único fragmento de safetensors BF16, compilaciones GGUF y MLX en la familia más amplia, y una preferencia documentada por SGLang cuando se necesita el analizador de llamadas a herramientas. Ninguna de las dos está en nuestro catálogo, y este artículo no constituye una declaración de disponibilidad para ninguna de ellas.
Las alternativas alojadas son la propia API del proveedor y plataformas de terceros. Liquid ofrece la versión alojada de d1 con un precio basado solo en tokens de entrada a $0.04 por millón, con las imágenes facturadas como entrada a 1,5 tokens por parche de 32×32 píxeles y sin línea de salida alguna; MiniCPM5-2B no tiene API propia, lo cual es normal para una versión de pesos abiertos con licencia Apache-2.0.
Aquello a lo que ambos alimentan es el mismo problema de arquitectura. Un modelo local de 2B o 3B que se encarga de la clasificación, el enrutamiento o las comprobaciones de barreras de seguridad se sitúa delante de las llamadas generativas que tú no alojas, y esa combinación —inferencia propia junto a inferencia alquilada— es justo lo que una capa de enrutamiento existe para absorber. Un único endpoint para más de 200 modelos, precios de lista de los proveedores repercutidos con un 0 % de margen para que un cambio de precio de un proveedor esté activo el mismo día, conmutación automática por error cuando un upstream se degrada. Poseer el modelo pequeño hace que la cuestión del enrutamiento sea más difícil, no más fácil, porque ahora la frontera entre tu hardware y el de otro es una decisión que tienes que tomar en cada solicitud.
Elige según el tipo de respuesta
Si lo que necesitas es una etiqueta, una probabilidad o una calificación, y el conjunto de opciones se conoce de antemano, Liquid AI d1-3B es el instrumento más honesto: fue creado para esa solicitud y la respuesta no va a llegar malformada. Acepta la licencia del proveedor, el contexto de 32K y el rastro de evidencia de dos días como el precio.
Si lo que necesitas es un modelo pequeño que sepa razonar, usar herramientas, manejar un documento extenso y responder con palabras, MiniCPM5-2B es la máquina más capaz por un amplio margen, y viene con Apache-2.0 y un millón de descargas que respaldan las pruebas de otras personas.
Los equipos que más partido sacarán a cualquiera de los dos lanzamientos son los que tienen ambos en funcionamiento: un modelo de decisión delante, donde la respuesta es un número y los milisegundos importan, y un modelo generativo pequeño detrás, para las partes del trabajo que necesitan lenguaje. No son competidores. Son un filtro y un altavoz.

