
Intern-Decision-0.8B vs LFM2.5 2.6B Base: Dos formas de construir algo por tu cuenta
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 592 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 187 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Pon Intern-Decision-0.8B junto a LFM2.5 2.6B Base y la primera observación honesta es que ninguno de los dos es un producto en el sentido en que lo suele entender un comprador. Intern-Decision-0.8B es el checkpoint que InternLM subió a Hugging Face el 26 de septiembre de 2026 sin ningún anuncio —un ajuste fino de 852.985.920 parámetros de Qwen3.5-0.8B que responde a preguntas escritas y no emite texto, distribuido bajo Apache 2.0 con un enlace a GitHub que da 404. LFM2.5 2.6B Base es el checkpoint de texto preentrenado de 2.690 millones de parámetros de Liquid AI, publicado el 1 de agosto de 2026 como la base de la familia LFM2.5, y su propia ficha dice que “solo se recomienda para tareas que requieren un ajuste fino intensivo”. Uno está terminado y es limitado. El otro está inacabado y es general. Ambos asumen que eres tú quien hace el trabajo —y el trabajo no es el mismo trabajo.
Esa distinción es toda la comparación, y es la razón por la que una tabla de especificaciones directa resultaría engañosa. La pregunta que en realidad tiene un lector es «¿cuál de estos descargo?», y la respuesta depende de si lo que necesitas construir es una capa de decisión o una capacidad lingüística. Son proyectos distintos con plazos distintos.
Lo que cada modelo te entrega
Intern-Decision-0.8B llega como un sistema funcional. El repositorio incluye inference.py/, una clase DecisionEngine/, un esquema de solicitud documentado y un esquema de respuesta, y un ejemplo práctico que puedes ejecutar después de instalar cuatro dependencias de Python fijadas. Tú proporcionas un estado, de una a dieciséis preguntas con nombre, cada una con hasta 62 opciones, y, opcionalmente, hasta ocho imágenes, y recibes una distribución calibrada más una etiqueta argmax por campo. El motor lee logits en posiciones fijas de un esqueleto pre-renderizado en lugar de generar algo, así que no hay paso de decodificación, ni tokens de salida, ni JSON que reparar. Se ejecuta a partir de aproximadamente 1,73 GB de archivos.
LFM2.5 2.6B Base te ofrece lo contrario: capacidad en bruto sin interfaz. Es un modelo de lenguaje causal solo de texto con 30 capas organizadas en 22 bloques de convolución corta de doble compuerta y 8 capas de atención de consultas agrupadas, preentrenado con aproximadamente 34 billones de tokens en 16 idiomas, con un vocabulario de 128.000 tokens y una ventana de contexto de 131.072 tokens. No tiene ajuste por instrucciones propio ni benchmarks de tareas en la tarjeta, porque un checkpoint base no se puntúa: los modelos que entrenas a partir de él sí. El propio pipeline de postentrenamiento de Liquid es lo que lo convierte en el LFM2.5-2.6B agéntico, y ese pipeline es lo que se te pide reproducir, en parte o en su totalidad, para tu propio dominio.
Así que el eje no es el tamaño. Se trata de si la pieza que falta es un contrato de decisión o una corrida de entrenamiento.
El marcador, con las salvedades incluidas
• Tiempo hasta el primer resultado — Intern-Decision-0.8B: una tarde, cargando un checkpoint y llamando predict()/. LFM2.5 2.6B Base: el tiempo que tarde tu ejecución de preentrenamiento continuado o SFT, más el trabajo de datos para prepararlo.
• Parámetros — Intern-Decision-0.8B: 852.985.920 repartidos en un fragmento de lenguaje de 1,50 GB, un fragmento de visión de 176 MB y un proyector de 25 MB. LFM2.5 2.6B Base: 2,69B, aproximadamente 2,5 GB de pesos.
• Modalidades de entrada — Intern-Decision-0.8B: texto más hasta ocho imágenes, con pesos de visión presentes en el repositorio. LFM2.5 2.6B Base: solo texto, por diseño — el trabajo multimodal en la familia LFM2.5 reside en las variantes VL.
• Contexto práctico — Intern-Decision-0.8B: 8,192 tokens, rechazados en lugar de truncados, a pesar de un embedding de posición máximo de 262,144 en la configuración. LFM2.5 2.6B Base: 131,072 tokens nativos.
• Salida — Intern-Decision-0.8B: una distribución de probabilidad calibrada y una etiqueta argmax por campo, determinista. LFM2.5 2.6B Base: texto continuado, muestreado.
• Evaluaciones comparativas — Intern-Decision-0.8B: una tabla completa del proveedor en siete evaluaciones comparativas, no reproducida por nadie. LFM2.5 2.6B Base: ninguna publicada para la base en sí, por diseño.
• Licencia — Intern-Decision-0.8B: Apache 2.0, con un LICENSE-QWEN/ preservado para los pesos upstream. LFM2.5 2.6B Base: LFM Open License v1.0.

La fila de la licencia merece su propia sección
Ambas tarjetas dicen «open», y las dos palabras significan cosas sustancialmente diferentes. Intern-Decision-0.8B es Apache 2.0 — sin condición de ingresos, sin restricción de campo de uso, sin concesión comercial separada que negociar. El segundo archivo de licencia del repositorio es la licencia de Qwen heredada porque el modelo es un derivado de Qwen3.5-0.8B, lo cual es el tratamiento correcto y no una limitación.
LFM2.5 2.6B Base se distribuye bajo la LFM Open License v1.0, y vale la pena leer la sección 5 de esa licencia en su totalidad antes de que cualquier plan comercial dependa de ella. Los derechos otorgados para el Uso Comercial están condicionados a que usted o su entidad legal no superen un umbral definido en la licencia como ingresos anuales de 10 millones de dólares estadounidenses o más. Por encima de ese límite, el uso comercial de la obra o de un derivado no está licenciado bajo el acuerdo. El uso sin fines de lucro y de investigación está exceptuado. Esa es una frontera real y exigible y, como también se aplica a las obras derivadas, se propaga a todo lo que ajustes a partir de la base —que es todo el uso previsto de este checkpoint.
Hay una interpretación directa aquí: si estás construyendo comercialmente y tu entidad supera los $10M en ingresos anuales, LFM2.5 2.6B Base no es el mismo tipo de activo que Intern-Decision-0.8B, sin importar cómo se desempeñen ambos. Si estás por debajo del umbral, investigando o haciendo fine-tuning con un propósito no comercial, la distinción no aplica. En cualquier caso, es una pregunta que hay que responder antes de la ejecución de entrenamiento, no después.
Dónde cada uno es realmente la descarga correcta
LFM2.5 2.6B Base es la elección correcta cuando la capacidad que necesitas todavía no existe en un modelo terminado. La ficha de Liquid enumera explícitamente los casos previstos: asistentes específicos para un idioma, como el japonés; asistentes específicos para un dominio, como el médico; entrenamiento con datos propietarios que no puedes enviar a una API; o experimentar con enfoques novedosos de post-entrenamiento. El razonamiento que subyace a esa lista es que 34 billones de tokens de preentrenamiento multilingüe son caros de reproducir y casi gratuitos de heredar: compras un punto de partida que ya es competente en 16 idiomas y con un contexto de 128K, y dedicas tu propio cómputo a la parte que es específica para ti.
El respaldo del ecosistema para ese plan es inusualmente completo para un modelo tan nuevo. Liquid documenta el preentrenamiento de continuación, SFT, DPO y GRPO mediante Unsloth y TRL, con cuadernos para cada uno, y el checkpoint es compatible con Transformers, vLLM, SGLang, llama.cpp, MLX y LM Studio. Eso no es texto de marketing: es la diferencia entre un modelo base que puedes ajustar esta semana y uno que te pasas quince días pegando a un entrenador.
Intern-Decision-0.8B es la elección correcta cuando la capacidad que necesitas ya existe y el problema es su forma. Si tu tarea es una decisión acotada con un conjunto cerrado de respuestas — enrutar este ticket, puntuar esta reclamación, clasificar este registro según una rúbrica —, entonces un modelo generativo es una forma torpe de obtener una etiqueta, y un modelo base no es una forma de obtenerla en absoluto. Lo que quieres es algo que devuelva la distribución, te indique su confianza y lo haga en los mismos 34 milisegundos cada vez. La latencia medida de InternLM en una única RTX 4090 es de 33,98 ms de media con un p95 de 37,50 ms, y los propios números de la tarjeta muestran al hermano de 2B en 33,28 ms de media: un recordatorio de que, con estas longitudes de prompt, el costo está en leer el esquema, no en ejecutar los pesos.
El intercambio que estás haciendo es flexibilidad por un contrato. Un modelo base puede llegar a convertirse en cualquier cosa, con el tiempo, si tienes los datos y la capacidad de cómputo. Una cabeza de decisión ya es eso, y nunca se convertirá en otra cosa. Si tu esquema cambia de forma cada mes, eso es un costo real. Si no lo hace, no es un costo en absoluto.
Lo que nadie puede decirte sobre la tabla Intern-Decision
Cada cifra de rendimiento de Intern-Decision-0.8B está reportada por el proveedor, y la salvedad aquí es más seria de lo habitual porque el lanzamiento tiene una semana y carece por completo de documentación. No hay artículo, ni colección que reúna los tres tamaños, ni repositorio de GitHub funcional, ni evaluación independiente. Una búsqueda en Artificial Analysis no arroja nada para el modelo.
InternLM seleccionó los benchmarks, seleccionó los modelos de comparación —un conjunto dominado por modelos de decisión, incluidos Jev de TypeSafe y Laya y Kev de Convai— y publicó la tabla sin una publicación de lanzamiento.

Con esa etiqueta adjunta, la forma sigue mereciendo la pena leerse. Intern-Decision-0.8B publica 97.92 / 80.56 / 52.25 en las tres divisiones de Jevbench, 77.35 en Typed Decision y 94.52 en ToolACE, con un promedio de 79.38. Su perfil de calibración es la entrada más interesante: un Brier de 0.530 y un error de calibración esperado de 0.066, que es un ECE mejor que el 0.095 de Jev a pesar de un Brier peor. En términos simples, es menos preciso pero más honesto sobre cuán preciso es, y para un flujo de trabajo basado en umbrales ese orden importa más que el promedio. La columna que debería detener un despliegue es WildJailBreak con 64.48 frente al 96.29 de Jev. Un déficit de robustez ante rechazos tan grande es una propiedad del ajuste fino, y si pertenece a la base Qwen3.5-0.8B, al objetivo de ajuste de decisiones o al recuento de parámetros no está documentado en ninguna parte de la tarjeta.
La comparación con LFM2.5 2.6B Base en este eje no es «quién obtiene una puntuación más alta», porque el modelo base no tiene puntuaciones. Es que los números de un modelo no están auditados y los números del otro modelo no existen, y un lector que elige entre ellos está eligiendo con qué tipo de incógnita trabajar.
El pipeline que la mayoría de la gente acaba construyendo en realidad
Existe una configuración que usa ambos, y vale la pena nombrarla porque es donde aterrizan la mayoría de los sistemas de producción. La capa de decisión se encarga de las llamadas cerradas —triaje, enrutamiento, puntuación con rúbricas—, donde el conjunto de respuestas es conocido, la latencia se acumula a lo largo de un millón de registros y los tokens de salida son pura sobrecarga. La capa de lenguaje se encarga de todo lo que necesita prosa, síntesis o contexto largo: el resumen de escalado, la explicación adjunta a la etiqueta, el borrador que una persona edita. LFM2.5 2.6B Base es un sustrato plausible para la segunda mitad si tienes datos de dominio que merezca la pena usar para entrenar; una cabeza de decisión es la forma natural de la primera.
Combinar los dos es la parte delicada, y es la parte que vale la pena no construir a mano. El DSL de enrutamiento de OrcaRouter expresa el enrutamiento como código — YAML con condiciones CEL, desplegado sin necesidad de volver a desplegar —, de modo que una canalización que envía una clase de solicitud a un endpoint de decisión y otra a un modelo de lenguaje es una regla de enrutamiento en lugar de un balanceador de carga que mantienes tú mismo. La puerta de enlace cubre más de 200 modelos tras una única clave compatible con OpenAI, con el precio de lista del proveedor transferido tal cual y sin margen alguno, y no añade ningún margen al modelo que elijas. Para ser precisos sobre el límite: ni Intern-Decision-0.8B ni LFM2.5 2.6B Base son nuestros — ambos son checkpoints que descargas y ejecutas localmente, y en ambos casos esa es la cuestión, porque la razón para elegir un modelo de 2 GB es que se ejecuta donde ya están tus datos. Para lo que sirve una puerta de enlace es para la mitad de la pila a la que, de otro modo, estarías llamando externamente.
Si la capa de decisión es la pieza que quieres probar sin comprometer una ejecución de entrenamiento, un modelo de decisión alojado es el experimento más económico, y el Jev 1.13 de TypeSafe es el que InternLM tomó como referencia — disponible hoy a través de un único endpoint compatible con OpenAI a $0,042 por millón de tokens de entrada, con la salida facturada a cero.

¿Cuál, entonces?
Elige LFM2.5 2.6B Base si la capacidad aún no existe y tienes tanto los datos de dominio como el apetito para ejecutar un ajuste fino, y consulta el umbral de ingresos de $10M en la LFM Open License antes de construir sobre él comercialmente. Elige Intern-Decision-0.8B si la capacidad existe, las respuestas ya son enumerables en tu prompt, y lo que necesitas es una forma rápida, determinista y limpia en lo que respecta a licencias de obtener la etiqueta —aceptando que su documentación falta, sus benchmarks no han sido auditados y su comportamiento de rechazo ante entradas adversariales no ha sido probado por nadie fuera del laboratorio que lo ajustó. La segunda es la ruta más corta y la incógnita más grande. La primera es la ruta más larga y la más documentada, y ninguna de esas dos cosas equivale a ser mejor.
