Una tarjeta de título generada que dice «Intern-Decision-2B vs Laya», con el subtítulo «2.21B frente a 421M, sin que ninguno escriba un token», con las insignias «uno lanza un paquete pip» y «uno lanza un kit de reproducción», con el logotipo de OrcaRouter compuesto en la esquina.
Guides & Insights

Intern-Decision-2B vs Laya: 2,2 mil millones de parámetros frente a 421 millones, ambos negándose a escribir una respuesta

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

internlm/Intern-Decision-2B y convaiinnovations/laya son los dos modelos más similares en el nicho de los pequeños modelos de decisión, y el dato más útil de la comparación es que llegan allí por rutas opuestas. El checkpoint de 2.213.241.664 parámetros de InternLM lee el logit en una posición fija antes de un marcador de posición y nunca llama a generate(). El checkpoint de 421 millones de parámetros de Convai envía preguntas escritas a una cabeza de decisión sobre una base ModernBERT-large y devuelve probabilidades calibradas en una sola pasada hacia adelante. Ninguno escribe un token, ambos prometen probabilidades, ambos se limitan a cerca de ocho mil tokens de entrada, y el más pequeño es cinco veces más pequeño y aproximadamente mil veces más popular. Lo que los separa no es tanto la capacidad como el empaquetado, y la brecha de empaquetado decide la compra para la mayoría de los lectores.

Intern-Decision-2B apareció en Hugging Face a las 05:36 UTC del 26 de septiembre de 2026, la intermedia de tres tamaños que InternLM subió en cuarenta segundos sin anuncio alguno, con ajuste fino a partir de Qwen/Qwen3.5-2B bajo Apache-2.0. Laya se publicó por primera vez el 18 de septiembre de 2026 y desde entonces ha acumulado unos 3.700 me gusta, un paquete pip, un servidor HTTP compatible con Jev, integraciones con ONNX y LangChain y un cuaderno de ajuste fino. El contraste de madurez es el artículo.

La premisa que comparten, y los mecanismos que difieren

Ambas fichas sostienen que si tu problema es elegir entre respuestas conocidas, generar prosa es la operación equivocada. La formulación de Laya es "nunca genera texto, así que no hay nada que analizar y nada que alucinar". La de Intern-Decision-2B es que su API "realiza puntuación estructurada de candidatos. No llama a generate() ni muestrea texto de forma libre".

Los mecanismos son donde se separan.

Laya es un clasificador. Un codificador ModernBERT-large (395M, bidireccional, totalmente afinado) alimenta una cabeza de decisión entrenada desde cero — dos capas transformer, un puntuador de marcadores de opción y una cabeza de actuar/escalar — para un total de 421M. Las opciones comparten un presupuesto fijo de tokens (head_max_len, 192 tokens en el checkpoint en inglés, 256 en multilingüe), y el enrutador detecta el script y el idioma en menos de medio milisegundo antes de la pasada.

Intern-Decision-2B es un modelo de siguiente token al que se le ha prohibido convertirse en generador. Asigna las opciones de cada pregunta a símbolos de un solo token A–Z, a–z, 0–9; genera un esqueleto JSON completo de asistente con un marcador de posición <decision> por campo; ejecuta una pasada forward causal; lee los logits inmediatamente antes de cada marcador de posición; aplica softmax sobre los símbolos legales de ese campo; y aplica una temperatura ajustada de 2.100509348278. Por debajo hay un Qwen3_5ForConditionalGeneration estándar —24 capas, tres capas de atención lineal por cada capa de atención completa, una capa retenida de predicción multitoken, un límite de embeddings de 262.144 posiciones— además de una torre de visión y un proyector.

La consecuencia práctica de la diferencia es la capacidad de opciones. El presupuesto fijo por opción de Laya se desmorona en espacios de etiquetas amplios; su propia ficha documenta una pregunta de 77 etiquetas que obtiene 0,425 frente a 0,870 de TypeSafe Jev en la misma tarea, porque 77 opciones reciben alrededor de tres o cuatro tokens cada una. Intern-Decision-2B admite hasta 62 opciones por pregunta y hasta dieciséis preguntas, y 62 no es una preferencia, sino el recuento exacto de símbolos de un solo token que su contrato puede direccionar. Ninguno resulta cómodo más allá de unas pocas docenas de opciones; las formas del fallo difieren.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, and the opening description of Intern-Decision-2B as a multimodal structured decision model fine-tuned from Qwen3.5-2B that accepts a shared state, a schema of named questions and optional images.

Marcador

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Laya'. The left column reads: Parameters 2,213,241,664 plus vision tower; Input ceiling 8,192 tokens, refused above; Images up to eight; Speed 33.28 ms mean on one RTX 4090; Languages no multilingual claim made; Packaging a checkpoint and an inference script. The right column reads: Parameters 421M, one 842 MB safetensors file; Input ceiling 8,192 with max_len set, 1,024 default; Images none; Speed 103-332 questions/sec batched on one T4; Languages 100+ routed, 45 of 51 usable; Packaging pip install, HTTP server, ONNX, LangChain. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced and the Laya figures are Convai's own card, including its zero-shot typed-decisions result below the majority-class line.

• Parámetros — Intern-Decision-2B 2.213.241.664 en BF16 más una torre de visión y un proyector, unos 4,46 GB en disco; Laya 421M, un único archivo safetensors de 842 MB, con un checkpoint multilingüe separado de 644 MB.

• Límite de entrada — 8,192 tokens para ambos, ambos rechazan en lugar de truncar; ten en cuenta que los 8,192 de Laya se aplican a laya-multilingual y requiere max_len=8192, ya que el valor predeterminado incluido es 1,024.

• Imágenes — hasta ocho para Intern-Decision-2B, contabilizadas dentro del mismo presupuesto de tokens; sin ruta multimodal para Laya.

• Velocidad — 33,28 ms de media, 33,15 ms de P50 y 33,55 ms de P95 por solicitud en una RTX 4090 para Intern-Decision-2B; Laya reporta aproximadamente 33 ms por solicitud y entre 103 y 332 preguntas por segundo en lotes en una sola T4.

• Idiomas — Intern-Decision-2B no hace ninguna afirmación multilingüe; Laya enruta a través de más de 100 idiomas, e informa que 45 de 51 idiomas evaluados son utilizables a más de tres veces el azar, y 0,451 en intención MASSIVE en trece idiomas distintos del inglés frente a 0,306 de su checkpoint solo en inglés.

• Exactitud zero-shot — Intern-Decision-2B registra un promedio de 84,68 en siete suites de proveedores, con Brier 0,437 y ECE 0,100, todas sin reproducir; el checkpoint base en inglés de Laya obtiene 0,362 en el benchmark de 2.000 decisiones tipadas, que su propia ficha señala como por debajo de la línea de clase mayoritaria de 0,461.

• Empaquetado — un checkpoint, un inference.py y un repositorio de GitHub recién hecho público con código de entrenamiento y evaluación, frente a pip install laya, un servidor HTTP compatible con Jev, rutas rápidas de ONNX Runtime y TileLang, integraciones con MCP y LangChain, y un notebook de ajuste fino que se ejecuta en GPU de nivel gratuito.

La comparación más justa no es la que establece la hoja de especificaciones

Poner 84,68 junto a 0,362 raya en lo deshonesto, y vale la pena decir por qué en lugar de dejar los números como están.

El 0,362 de Laya es un checkpoint base medido zero-shot en un benchmark para el que no fue ajustado. Su propia tarjeta saca la conclusión de forma explícita: «Laya es una base rápida para especializar, no un motor de decisiones zero-shot». Con ajuste fino en la propia partición de entrenamiento de ese benchmark, alcanza 0,766, supera el techo de 0,735 del teacher y bate el 0,727 publicado de TypeSafe Jev en las mismas decisiones. El 84,68 de Intern-Decision-2B, por su parte, es un promedio del proveedor sobre siete suites cuyos conjuntos de prueba no son los que cita Laya, producido por el laboratorio que construyó el modelo, sin que ningún tercero lo haya ejecutado — el checkpoint muestra un «me gusta» y cero descargas. Comparar un resultado con ajuste fino con un resultado zero-shot, o un promedio del proveedor con una tabla de clasificación independiente, no es una comparación. Son dos mediciones distintas que comparten una tipografía.

Lo que es genuinamente comparable: ambos son pequeños, ambos son baratos de ejecutar y ninguno admite fine-tuning hacia tu dominio. El repositorio que InternLM publicó esta mañana hace que esa última parte sea materialmente más fácil de lo que era ayer, porque incluye el lanzador de entrenamiento, el objetivo de token siguiente enmascarado, un paquete verificado por hash de 10.751 filas de prueba repartidas en siete suites, y los scripts de ajuste de temperatura y de replay. Un laboratorio que distribuye un generador de calibración determinista y afirma que el replay no cambia ninguna decisión está invitando exactamente al tipo de adaptación que recomienda la tarjeta de Laya.

Cómo llamarías realmente a cualquiera de los dos

Ninguno de los dos modelos está en OrcaRouter. La página de modelo de OrcaRouter para Intern-Decision-2B devuelve 404 y tampoco hay una ruta para Laya; nada de esto es una afirmación de disponibilidad. Intern-Decision-2B significa descargar el checkpoint y ejecutar su motor incluido en tu propia GPU. Laya significa pip install laya y, si quieres la interfaz compatible con Jev, laya-serve en POST /v1/systemone.

La pregunta con forma de Orchestrator que subyace es si quieres una segunda superficie operativa para un scorer. Laya se ha diseñado para incrustarse — la misma forma de solicitud y respuesta que TypeSafe Jev, de modo que un cliente existente cambia una URL base y nada más. Intern-Decision-2B se ha diseñado para reproducirse, y hoy se necesita aproximadamente un día de trabajo de entorno antes de que regrese la primera decisión. Si la decisión de conjunto cerrado que estás tomando se parece en forma a cualquiera de estas, la alternativa alojada que ambas tarjetas usan como referencia es TypeSafe Jev 1.13, que sí tiene una ruta: $0,042 por millón de tokens de entrada, un contexto de 65K y un P50 de tiempo hasta el primer token de 178 ms, accesible con la misma clave que más de 200 otros modelos con precio de lista del proveedor traspasado con un margen del 0 %.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing the TypeSafe breadcrumb, the model name Jev 1.13, text input, and the description that Jev is a structured decision and evaluation model taking a state and named questions (noul / choice / score) and returning a structured answer for each, served non-streaming via POST /v1/systemone with up to about 64K input tokens.

Dónde gana cada uno

Laya gana en todo lo operativo. Un paquete pip frente a una descarga de checkpoint. Un enrutador para más de cien idiomas frente a ninguna promesa de multilingüismo. Rendimiento por lotes medido en cientos de preguntas por segundo frente a una cifra por solicitud sin ninguna estrategia de procesamiento por lotes. Dos años de músculo de ecosistema —ONNX, TileLang, LangChain, MCP— frente a un repositorio que lleva dos horas público.

Intern-Decision-2B gana en tres aspectos muy concretos. Acepta imágenes, cosa que Laya no hace. No arrastra deuda de ajuste fino: su 84.68 es una afirmación del proveedor en régimen zero-shot, mientras que el 0.766 que Laya presenta como cifra estrella corresponde a un checkpoint ajustado con el propio conjunto de entrenamiento del benchmark. Y está documentado con un kit de reproducción —un paquete de evaluación verificable y un stack de entrenamiento público—, lo que vale más que una fila en una tabla de clasificación para cualquiera que tenga que justificar el modelo ante otra persona.

El empate es la premisa. Ambos se niegan a generar, ambos te dan probabilidades a las que puedes aplicar un umbral, y ambos están por debajo de la longitud de entrada en la que se sitúan la mayoría de los documentos reales. Si tu estado es un ticket, un correo electrónico o un formulario, cualquiera de los dos sirve y Laya te llevará allí más rápido. Si tu estado tiene una captura de pantalla adjunta o tu organización necesita que la reproducción sea auditable, el checkpoint intermedio de InternLM es el que responde a esa objeción concreta; y según los propios números de InternLM, es el peor calibrado de sus tres hermanos, con un ECE de 0,100 frente a 0,066 y 0,065, así que ajusta tu propia temperatura antes de confiar en la confianza que reporta.