
Liquid AI d1-3B vs Intern-Decision-4B: ¿Qué Decisor Calibrado Necesitas Realmente?
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Dos modelos de pesos abiertos ahora responden preguntas sin escribir nada, y hasta que pones sus esquemas de E/S uno al lado del otro, parecen la misma idea dos veces. Liquid AI d1-3B, subido a Hugging Face el 5 de octubre de 2026 y anunciado por Liquid dos días después, es un modelo de decisión multimodal de 3,12B cuya tarjeta dice sin rodeos que «no es un modelo de chat y no escribe texto». Intern-Decision-4B de InternLM, subido discretamente a la organización de InternLM el 26 de septiembre de 2026, sin publicación de blog, sin tuit y sin página de lanzamiento que lo respalde, es un modelo de decisión de 4B ajustado a partir de Qwen3.5-4B que, asimismo, devuelve una distribución de respuestas para cada pregunta en una sola pasada hacia adelante. El mismo contrato en la superficie. Las diferencias que hay debajo —una licencia que te complicará, un contrato que puede escribir texto por accidente y máquinas que nadie ha comparado— son las que deciden cuál pertenece a tu stack.
Qué tan cerca están realmente los dos
Lo primero que hay que dejar claro es cuánto de esta comparación es un empate. Ambos modelos toman un estado y un esquema de preguntas con nombre, ambos leen la señal de los logits en una posición de placeholder en lugar de muestrear, ambos son multimodales, y ambos informan que no escribieron nada. En cuanto a la forma de la llamada, son casi idénticos, y las diferencias interesantes están en los detalles de los bordes.
• Tamaño — Liquid AI d1-3B, 3.12B en total, construido sobre LFM2.5-VL-3B de Liquid; Intern-Decision-4B 4B (aproximadamente 4.54B según el recuento de tensores que indica la ficha), ajustado a partir de Qwen3.5-4B
• Tipos de pregunta — d1-3B e Intern-Decision-4B usan los mismos tres: noul para sí/no, choice para uno de un conjunto con nombre, score para un punto en una escala ordenada
• Campos de respuesta — d1-3B devuelve la respuesta junto con la confianza y las probabilidades; el esquema de InternLM devuelve distribuciones más un valor de confianza que la tarjeta del modelo advierte que no es una probabilidad calibrada
• Límite de entrada — d1-3B: 32.768 tokens de contexto; Intern-Decision-4B, un límite de 8.192 tokens que rechaza de plano las solicitudes más largas en lugar de truncarlas, y las imágenes se contabilizan contra ese límite
• Licencia — d1-3B bajo la Licencia Abierta LFM de Liquid v1.0, Apache 2.0 en el lado de InternLM
• Idiomas — d1-3B enumera 16; la ficha de Intern-Decision-4B no indica ninguno
• Interfaz — d1-3B se distribuye como un modelo que cargas y llamas con trust_remote_code=True; Intern-Decision-4B se distribuye como una biblioteca de Python que pip install, con un backend implementado y el propio campo model de la solicitud que explícitamente no puede cambiar de checkpoints
• Puntuación propia de los proveedores — d1-3B 48,57 en la partición pública de Decision Index 0.2.1; Intern-Decision-4B 90,02 promediado en su propia tabla de siete conjuntos con una puntuación de Brier de 0,347 y un error de calibración esperado de 0,065
Esos dos últimos números no son comparables, y tratarlos como un marcador sería el error más fácil de cometer en esta página. Provienen de distintos entornos de prueba, distintos conjuntos de preguntas y distintos evaluadores.

La calibración es todo el producto, y solo uno de ellos lo respalda por escrito.
Un modelo de decisión solo justifica su latencia si el número que devuelve junto a la respuesta significa algo. En eso consiste la calibración: una confianza declarada de 0,9 debería acertar aproximadamente nueve de cada diez veces, y un modelo que está seguro y se equivoca es peor que uno que dice que no sabe.
InternLM es el que aborda esto. Su ficha documenta una temperatura ajustada de 1.99241824, derivada mediante minimización de la log-verosimilitud negativa sobre 1.728 casos de calibración designados, con 1.693 reservados para validación, e impresa con ocho decimales para que pueda reproducirse. También publica un piloto de antes y después sobre 96 casos que muestra el mecanismo funcionando en lugar de limitarse a afirmarlo: Brier 0.628 y ECE 0.213 antes de la calibración frente a 0.550 y 0.089 después. Brier y ECE son las dos medidas estándar de si las probabilidades declaradas son honestas, y la dirección del cambio es notable.
Liquid no publica ningún equivalente. La propia tarjeta de d1-3B incluye benchmarks de precisión —SQuAD 2.0 85.3, Civil Comments 93.0, intención de MASSIVE 87.3, PubMedQA 66.0, BoolQ 86.7, XNLI 85.0, PAWS-X 76.9, una media de 77.1— junto con su 48.57 en el Decision Index, y el argumento de venta declarado del modelo son las respuestas tipadas calibradas. Pero no hay ninguna fila de ECE, ninguna fila de Brier y ninguna temperatura ajustada publicada.
Esa asimetría no significa que el descendiente de Qwen3.5-4B esté mejor calibrado que un 3B construido sobre LFM2.5-VL-3B; significa que, entre estas dos tarjetas, una te da la aritmética para reproducir la afirmación y la otra te da la afirmación. Si tu pipeline pone un umbral sobre una confianza —enruta por encima de 0.8, escala por debajo de 0.4—, puedes validar el lado de InternLM esta noche y solo puedes hacer una comprobación puntual del lado de Liquid.
La salvedad aplica en ambos sentidos. Ambos conjuntos de números son de primera parte. Ninguno de los modelos ha sido puntuado por una parte independiente, y las afirmaciones sobre la calibración de InternLM se basan en el propio piloto de 96 casos de InternLM frente al propio ajuste de InternLM.
La licencia que te pide un número
Intern-Decision-4B es Apache 2.0, heredado de Qwen3.5-4B, con los avisos upstream conservados — uso comercial, redistribución, ajuste fino, sin ninguna cuestión de ingresos en ninguna parte.
d1-3B está bajo la Liquid's LFM Open License v1.0, y la Sección 5 es la parte que nadie lee hasta que lo hace el departamento de compras. El uso comercial solo se concede con la condición de que usted o su entidad jurídica se mantengan por debajo de un Umbral, definido en ese mismo documento como ingresos anuales de diez millones de dólares estadounidenses o más; el uso por encima de él simplemente no está licenciado. Las organizaciones sin ánimo de lucro y los usuarios de investigación quedan exceptuados.
Para un individuo o un equipo pequeño, ambos son gratuitos. Para cualquier cosa que tenga un departamento de finanzas, los dos repos son productos distintos, y la diferencia es un número por encima del cual o estás o no estás.
La cola de la tabla de benchmarks de d1-3B es su verdadera afirmación
La cifra destacada en la ficha de Liquid es 48.57 en Decision Index 0.2.1, por delante de las otras filas de modelos por debajo de 10B en una tabla que va desde Winnow-12B con 50.02 hasta Decider 2B con 28.97. Lo que hace que esa cifra merezca citarse es el índice de discriminación que se encuentra debajo. En las subpuntuaciones propias del Decision Index, d1-3B obtiene 74.5 en Herramientas y 36.3 en Artes, mientras que solo alcanza 23.8 en Conocimiento —frente a Decider 35B-A3B, un modelo de mezcla de expertos de 36B, 12 veces su tamaño, que obtiene 56.5 en Herramientas, 32.6 en Artes y 31.8 en Conocimiento.

En otras palabras, el 3B no es un modelo pequeño que sea uniformemente un poco peor. Es un modelo pequeño que es inusualmente fuerte en decisiones estructuradas al estilo de herramientas e inusualmente débil en preguntas que requieren conocimiento del mundo, y supera al 36B en las dos categorías que más se parecen al trabajo para el que fue creado. Si tus decisiones son «cuál de estas cinco acciones con nombre» y «si esto está fundamentado en el pasaje recuperado», la brecha de tamaño está haciendo menos trabajo de lo que esperarías. Si tus decisiones dependen de hechos que el modelo ya debe tener, espera que aparezca el 23.8.
Existe una segunda versión de ese argumento en el lado de la visión. d1-3B promedia 74,1 en once benchmarks públicos de imágenes frente a 73,9 de su propio modelo base, y si se eliminan las imágenes, las mismas preguntas obtienen 45,1, de modo que en las preguntas con imágenes las respuestas provienen genuinamente de la imagen. Está a la par de su modelo base en lugar de ser mejor que él, y las filas por benchmark juegan en ambos sentidos: CV-Bench 82,1 frente a 87,6, POPE 88,5 frente a 90,1, BLINK 59,2 frente a 58,7.
También vale la pena señalar la pausa en la ficha de InternLM: su alto agregado proviene de tareas basadas en preguntas, como Typed Decision 80.55 y ToolACE 96.45, mientras que Jevbench-Hard se sitúa en 73.87. Cuando el esquema se vuelve difícil, la puntuación baja.
Velocidad: la brecha no está donde la esperas
d1-3B anuncia 8 ms para una sola pregunta en una RTX 4090 y 9 ms en una MI325X, 21 ms para tres preguntas que comparten un estado, 16 ms en un Jetson AGX Thor, y un rendimiento empaquetado de 475 decisiones por segundo en la 4090 y 1.106 en la MI325X.
La tarjeta de Intern-Decision-4B mide 44,16 ms de media de extremo a extremo en la misma RTX 4090, con una mediana de 44,03 ms y 44,60 ms en P95.
Eso parece una mejora de 5x y no lo es, porque los dos están midiendo cosas diferentes. Los números de Liquid son llamadas al modelo en caliente, una solicitud a la vez, con la selección y compilación de kernels pagadas por adelantado —la ficha dice explícitamente que una sola pregunta cuesta 16 ms en la 4090 sin compilación de CUDA graph, y que la primera llamada con una forma nueva paga la compilación. Los 44 ms de InternLM son por consulta de extremo a extremo a través de una biblioteca de Python cuyo único backend implementado es la inferencia local de Hugging Face, así que arrastra la maquinaria que lo rodea. Ninguno de los dos números es incorrecto. Pon ambos bajo un mismo banco de pruebas, en una misma máquina, con la misma forma de solicitud, y la brecha se reduce a algo que querrías medir en lugar de suponer.
Lo que no está en duda es el techo. 8.192 tokens son un rechazo absoluto por parte de InternLM, y los tokens de imagen se gastan del mismo presupuesto, así que un documento largo más una captura de pantalla es una solicitud que vuelve rechazada en lugar de truncada. d1-3B te da 32.768 tokens con los que trabajar. Si tus estados son tickets e intercambios cortos, esa diferencia nunca te pasa factura. Si son del tamaño de una página, decide la cuestión antes que cualquier benchmark.
Ejecútalos como un panel, no como un intercambio
Responder a un sí/no específico y responder "cuál de seis cosas nombradas es esta, y qué tan seguro estás" son peticiones distintas, y las dos tarjetas están configuradas de forma lo suficientemente diferente —una con un techo de entrada estricto y un ajuste de calibración publicado, la otra con 32K de contexto y una mejor cola de puntuación— como para que el despliegue útil para un equipo que evalúa ambas a menudo no sea un reemplazo, sino un panel: el mismo estado planteado a ambos modelos, con las discrepancias derivadas a un humano o a un modelo más grande.
Ninguno de los dos modelos está en nuestro catálogo, y esto no es una afirmación de disponibilidad; ambos son artefactos autoalojados. Pero un panel es exactamente la forma en la que una capa de enrutamiento hace el trabajo en lugar del papeleo. OrcaRouter expone más de 200 modelos detrás de una sola clave de API con los precios de lista de los proveedores traspasados con un 0 % de margen —así que cuando un proveedor al que enrutas a través de nosotros baja su precio, tu factura cambia ese mismo día— y la conmutación automática por error entre proveedores evita que un panel de dos modelos se convierta en dos puntos únicos de fallo. Los modelos que enrutas hoy no son estos dos; son los generalistas alojados que estarías sustituyendo, como Qwen3.5-27B a 0,086 $ por millón de tokens de entrada y 0,688 $ por millón de salida, que es la cifra que un 3B autoalojado tiene que superar una vez que se ha contado la GPU.
Qué hacer esta semana
Si tus decisiones son estados cortos, la licencia tiene que superar la revisión de tu empresa y quieres la gama más amplia de objetivos de compilación —llama.cpp, Ollama, LM Studio, una ruta de lotes empaquetados que ejecuta 64 estados en una sola pasada—, d1-3B es el más orientado a producto de los dos y su discriminación entre herramientas y artes es lo más sólido que demuestra cualquiera de las dos fichas. Si tus decisiones se extienden por estados largos, o necesitas una licencia sin cláusula de ingresos, o quieres un ajuste de calibración que puedas reproducir y un arnés en el que el coste asociado ya esté contabilizado, Intern-Decision-4B es aquel cuya documentación sí puedes comprobar.

La parte incómoda es la misma en ambos casos: ninguna parte independiente ha ejecutado ninguno de los dos modelos, y no existe ninguna comparación de calibración que no haya sido encargada por el proveedor que redactó la ficha. Para una clase de modelos cuyo valor entero reside en el significado de un número junto a una respuesta, esa es la brecha que vale la pena cerrar antes de poner un umbral sobre cualquier cosa.
