Una tarjeta de título generada que dice 'Intern-Decision-4B vs Laya', con el subtítulo 'dos modelos que responden sin generar un token', con tres chips que dicen '4.54B vs 421M', 'ambos una sola pasada hacia adelante' y 'ambos Apache-2.0'. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Engineering & Research

Intern-Decision-4B vs Laya: dos modelos que se niegan a escribir una respuesta, separados por diez veces en tamaño

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Hay una fila en la tarjeta del modelo Intern-Decision-4B que dice "Laya — 57.77". Cualquiera que haya leído la documentación propia de Laya reconocerá el significado de ese número: convaiinnovations/laya es un modelo de decisión no autorregresivo de 421 millones de parámetros, y 57.77 es el promedio que obtiene cuando se usa zero-shot en el benchmark de otro. Su propia tarjeta dice lo mismo de manera más directa: los checkpoints base se sitúan por debajo de la línea base de la clase mayoritaria en el benchmark de decisiones tipadas, con 0.362 frente a 0.461. Mientras tanto, internlm/Intern-Decision-4B es un modelo de 4.54 mil millones de parámetros construido exactamente para el mismo trabajo: tomar un estado y un conjunto de preguntas tipadas, ejecutar una pasada hacia adelante, devolver probabilidades calibradas, nunca generar un token. La misma apuesta arquitectónica, la misma forma de salida, la misma licencia Apache-2.0, diez veces los parámetros — y uno de ellos es una base para ajustar mientras que el otro afirma ser un motor zero-shot terminado.

Están de acuerdo en la premisa, que es la parte rara.

Ambas tarjetas defienden el mismo argumento, y merece la pena decirlo porque la mayor parte de la industria sostiene lo contrario. Si tu problema consiste en elegir entre un conjunto conocido de respuestas, generar prosa es la operación equivocada: pagas por tokens que luego descartas, necesitas un analizador y obtienes una explicación que no pediste en lugar de una probabilidad a la que puedas aplicar un umbral. La tarjeta de Laya lo formula así: «nunca genera texto, así que no hay nada que analizar ni nada que alucinar». La tarjeta de Intern-Decision-4B dice que su API «realiza una puntuación estructurada de candidatos. No llama a generate() ni muestrea texto libre».

Los mecanismos difieren de una manera instructiva. Laya introduce preguntas tipadas en una cabeza clasificadora y devuelve respuestas tipadas con probabilidades calibradas en una sola pasada hacia adelante, con una capa de enrutamiento que detecta la escritura y el idioma en menos de medio milisegundo antes de la pasada. Intern-Decision-4B asigna las opciones de cada pregunta a símbolos de un solo token, genera un esqueleto JSON de asistente con un marcador de posición por campo, lee los logits inmediatamente antes de cada marcador de posición y aplica softmax solo sobre los símbolos permitidos de ese campo. El de Laya es un problema de clasificación; el de InternLM es un problema de siguiente token que se niega a dejar que se convierta en un problema de generación.

A screenshot of the convaiinnovations/laya model card on Hugging Face, showing the title 'Laya', the description of it as a multilingual non-autoregressive System 1 decision model returning typed answers with calibrated probabilities in a single forward pass across 100+ languages, the pip install laya line, and the long-documents note about laya-multilingual reading up to 8,192 tokens with max_len=8192.

La brecha de tamaño y lo que permite conseguir

Pedir a dos modelos que hagan la misma tarea con 421M y 4,54B de parámetros produce el resultado que predecirías y, después, una sorpresa.

La parte predicha es la capacidad en preguntas difíciles. Intern-Decision-4B promedia 90,02 en siete conjuntos de evaluación, con una puntuación Brier de 0,347 y un error de calibración esperado de 0,065 según la propia medición de InternLM, y tarda 44,16 ms de media por consulta en una única RTX 4090. El checkpoint base en inglés de Laya tiene una precisión de 0,362 en el benchmark typed-decisions de 2.000 decisiones, que su propia ficha señala como por debajo de la línea de clase mayoritaria de 0,461 y apenas por encima de la línea base aleatoria de 0,318. Cuando el mismo checkpoint se ajusta con fine-tuning sobre la propia partición de entrenamiento de ese benchmark, la cifra salta a 0,766. La ficha de Laya extrae la conclusión por sí misma: «Laya es una base rápida para especializar, no un motor de decisiones zero-shot».

La sorpresa es que el modelo más pequeño gana claramente en dos dimensiones. Velocidad: Laya responde de 103 a 332 preguntas por segundo en lotes en una sola T4, y su ficha lo sitúa aproximadamente entre seis y ocho veces más rápido que TypeSafe Jev según la cifra de p50 de 236–276 ms medida de forma independiente que cita. Diez veces más parámetros no compran diez veces más rendimiento en la dirección opuesta: los 44,16 ms de Intern-Decision-4B son por consulta en una 4090, sin que se haya publicado nada sobre batching. Y en cuanto a idiomas: Laya, 45 de 51 idiomas evaluados utilizables a más de tres veces, con un 0,451 enrutado en intención de MASSIVE en trece idiomas distintos del inglés frente a 0,306 de su checkpoint solo en inglés. Intern-Decision-4B no hace ninguna afirmación multilingüe en absoluto.

Marcador

• Parámetros — 4.54B BF16 para Intern-Decision-4B, torre de texto más torre de visión más proyector; 421M para Laya, una única pila compacta de clase codificador.

• Límite de entrada: 8.192 tokens para ambos, y ambos rechazan en lugar de truncar; ten en cuenta que los 8.192 de Laya se aplican al checkpoint multilingüe, cuyo valor predeterminado de fábrica es 1.024.

• Multiplicidad: Intern-Decision-4B acepta de 1 a 16 preguntas y hasta 62 opciones cada una, y 62 no es arbitrario: es exactamente el número de símbolos de un solo token que su contrato de inferencia puede direccionar. Laya también acepta varias preguntas tipadas, pero su tarjeta documenta un colapso pronunciado más allá de aproximadamente 50 opciones, donde una pregunta de 77 etiquetas recibe solo tres o cuatro tokens de presupuesto por etiqueta y la precisión cae a 0.425.

• Imágenes — hasta ocho para Intern-Decision-4B, que cuentan contra el presupuesto de 8.192 tokens; sin ruta multimodal para Laya.

• Calibración — Intern-Decision-4B incluye una temperatura ajustada de 1,99241824 seleccionada mediante minimización de NLL sobre 1.728 casos, y reporta un ECE de 0,065 en su propia suite; Laya llega con exceso de confianza, y su ficha dice que reajustar una temperatura por tipo de pregunta y número de opciones hace pasar el ECE medio de 0,466 a 0,081.

• Postura de zero-shot — un checkpoint finalizado que alega un promedio de 90.02 frente a una base documentada que puntúa por debajo de la línea de la clase mayoritaria.

• Latencia — 44,16 ms de media, 44,03 ms de mediana en una RTX 4090 frente a 103 a 332 preguntas por segundo en lotes en una T4.

• Idiomas — ninguna afirmación publicada en contra de que 45 de 51 idiomas sean utilizables cuando se enrutan.

• Licencia — Apache-2.0 con la licencia upstream de Qwen preservada frente a Apache-2.0 con uso comercial etiquetado explícitamente.

A two-column comparison scoreboard titled 'Intern-Decision-4B vs Laya'. The left column reads: Parameters: 4.54B BF16; Output: probabilities, no text; Options per question: up to 62; Latency: 44.16 ms mean on one RTX 4090; Zero-shot: 90.02 average reported; Images: up to eight; License: Apache-2.0. The right column reads: Parameters: 421M; Output: typed answers, no text; Options per question: degrades past ~50; Latency: 103-332 q/s batched on one T4; Zero-shot: below majority class, 0.362; Images: none; License: Apache-2.0, commercial use tagged. A footer reads 'Intern-Decision figures per InternLM's model card; Laya figures per the Laya model card, including its own negative results.' The OrcaRouter logo is composited in the bottom-right corner.

Dos tarjetas, dos ideas muy distintas de la divulgación

Aquí es donde la comparación deja de ser una ficha técnica y se convierte en una cuestión de criterio, porque los dos proveedores documentan sus modelos con estilos opuestos.

La tarjeta de Laya publica sus propios fallos en detalle. Informa que el checkpoint en inglés obtiene una precisión de 0.000 en Khmer con una confianza de 0.952 —confiado aun estando equivocado, lo que hace que el filtrado por confianza sea inútil allí—. Informa que action.act_probability no aporta ninguna señal utilizable, pues arroja 1.0 para casi todas las entradas con un AUROC de 0.30 en 396 decisiones etiquetadas, y te dice que filtres por confianza en su lugar, que alcanza 0.77 en los mismos elementos. Nombra las preguntas de puntuación ordinal como "la primitiva más débil", citando 0.372 en SST-5. Una tarjeta que te dice cuáles de sus propias salidas ignorar hace algo que la mayoría de los proveedores no intenta.

La tarjeta de Intern-Decision-4B publica una tabla limpia y ningún caso de fallo. Sus advertencias son reales y de peso —la sección de calibración es inusualmente explícita en que la columna "antes" de su piloto no es lo que vería ningún usuario, y en que las etiquetas de la suite de pruebas no se usaron para seleccionar la temperatura—, pero la sección de evaluación son siete victorias y ninguna admisión. También incluye filas para cinco sistemas competidores que InternLM ejecutó en el harness de InternLM, incluida la fila de Laya que abre este artículo. Esos no son los números propios de esos proyectos, y leerlos como si lo fueran sería un error.

Así que la procedencia de las fuentes para este enfrentamiento es asimétrica de un modo que favorece al modelo más pequeño: la evidencia de Laya incluye defectos que documentó por cuenta propia, y la evidencia de Intern-Decision-4B nunca se ha enfrentado a un conjunto de pruebas que sus autores no hayan elegido.

¿A qué forma de problema se ajusta cada uno?

Dado un estado corto y estructurado en inglés, un conjunto cerrado de respuestas y la necesidad de una probabilidad confiable, Intern-Decision-4B es el objeto más capaz sobre el papel y el más caro en la práctica: cuatro fragmentos de safetensors, PyTorch 2.9.1 y Transformers 5.14.1 bajo Python 3.12, un motor residente y un wrapper que escribes tú mismo si quieres un endpoint HTTP. Dado un enrutamiento de alto volumen o una decisión de guardrail en decenas de idiomas donde el rendimiento es la restricción limitante, Laya es la mejor forma: pip install laya, un modelo de 421M y una tarjeta que ya te ha dicho que hagas fine-tuning antes de confiar en las probabilidades.

Lo único en lo que coinciden ambas fichas es en que no se debería confiar en ninguno de los dos modelos sin comprobar antes la calibración con tus propios datos en modo zero-shot — en el caso de Laya porque sus checkpoints base están prácticamente al nivel del azar en tipos de decisión que no le son familiares, y en el de Intern-Decision-4B porque su ECE de 0,065 procede de un conjunto de pruebas que reunieron sus propios autores.

Lo que un router cambia y no cambia aquí

Ninguno de estos modelos está en el catálogo de OrcaRouter, y conviene decirlo claramente en lugar de insinuar lo contrario: nuestras páginas de modelos devuelven un 404 tanto para Intern-Decision-4B como para Laya, y ninguna es una ruta que puedas invocar hoy. Lo que eso significa para los dos proyectos no es lo mismo. La licencia Apache-2.0 de Laya con una etiqueta de uso comercial significa que el obstáculo es puramente de empaquetado — es un paquete local de Python con una huella pequeña, que es el tipo de cosa que plausiblemente podría servirse. El obstáculo de Intern-Decision-4B también es de empaquetado, pero sus pesos BF16 de 4,54B y su techo de rechazo de 8.192 tokens lo convierten en un componente en lugar de un servicio.

Donde OrcaRouter sí ayuda es del otro lado de la decisión. Si tu problema de decisión estructurada resulta que, después de todo, necesita un paso de razonamiento, los modelos generales que pueden hacerlo están en una sola clave para más de 200 modelos, con el precio de lista del proveedor trasladado con un 0 % de margen y conmutación automática entre proveedores — de modo que el modelo que emparejas con un evaluador está a un endpoint de distancia, no a un segundo contrato.

La versión corta

Estos dos proyectos llegaron a la misma conclusión sobre cómo deberían tomarse las decisiones y luego discreparon en casi todo lo demás. Laya apuesta a que 421M de parámetros, un enrutamiento de idioma estricto y una honestidad implacable sobre sus propios defectos la convierten en una base rápida que uno especializa. Intern-Decision-4B apuesta a que diez veces los parámetros y un contrato de puntuación de un solo token cuidadosamente diseñado lo convierten en un motor zero-shot terminado. El experimento decisivo es uno que ninguno ha ejecutado en público: toma un conjunto de decisiones con respuestas computables, ejecuta ambos y comprueba si las probabilidades significan algo. Laya ha publicado a medias ese experimento y te ha mostrado dónde falla. Intern-Decision-4B no lo ha publicado en absoluto.

A generated comparison card titled 'Same bet, ten times the parameters'. The left side, 'Intern-Decision-4B', lists: 4.54B BF16; a finished zero-shot checkpoint claiming a 90.02 average across seven sets; fitted temperature 1.99241824; 44.16 ms mean per query on one RTX 4090; Apache-2.0 with the upstream Qwen license preserved. The right side, 'Laya', lists: 421M; a documented base below the majority-class line at 0.362, rising to 0.766 once fine-tuned on the benchmark's own training split; refitting one temperature per question type moves mean ECE from 0.466 to 0.081; 103 to 332 questions per second batched on one T4; Apache-2.0 tagged for commercial use. A footer reads 'Intern-Decision figures per InternLM's model card; Laya figures per the Laya model card, including its own negative results.' The OrcaRouter logo is composited in the bottom-right corner.