Une carte de titre générée portant « Intern-Decision-2B vs Laya », sous-titrée « 2,21B contre 421M, aucun des deux n’écrit un token », avec les badges « l’un livre un paquet pip » et « l’autre livre un kit de reproduction », avec le logo OrcaRouter incrusté dans le coin.
Guides & Insights

Intern-Decision-2B vs Laya : 2,2 milliards de paramètres contre 421 millions, tous deux refusant d’écrire une réponse

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

internlm/Intern-Decision-2B et convaiinnovations/laya sont les deux modèles les plus similaires de la niche des petits modèles de décision, et le fait le plus utile à propos de cette comparaison est qu'ils y parviennent par des voies opposées. Le checkpoint de 2 213 241 664 paramètres d'InternLM lit le logit à une position fixe avant un placeholder et n'appelle jamais generate(). Le checkpoint de 421 millions de paramètres de Convai envoie des questions typées à une tête de décision au-dessus d'un backbone ModernBERT-large et renvoie des probabilités calibrées en une seule passe avant. Ni l'un ni l'autre n'écrit de token, les deux promettent des probabilités, les deux plafonnent autour de huit mille tokens en entrée, et le plus petit est cinq fois plus petit et environ mille fois plus populaire. Ce qui les sépare n'est pas tant la capacité que le packaging, et l'écart de packaging décide de l'achat pour la plupart des lecteurs.

Intern-Decision-2B est apparu sur Hugging Face à 05:36 UTC le 26 septembre 2026, la taille intermédiaire des trois tailles qu'InternLM a téléversées en quarante secondes sans aucune annonce, affiné à partir de Qwen/Qwen3.5-2B sous Apache-2.0. Laya a été publiée pour la première fois le 18 septembre 2026 et a depuis accumulé environ 3 700 likes, un paquet pip, un serveur HTTP compatible Jev, des intégrations ONNX et LangChain et un notebook de fine-tuning. Le contraste de maturité est le sujet de l'article.

La prémisse qu’ils partagent, et les mécanismes qui diffèrent

Les deux fiches soutiennent que si votre problème consiste à choisir parmi des réponses connues, générer de la prose est la mauvaise opération. La formulation de Laya est « il ne génère jamais de texte, donc il n’y a rien à analyser et rien à halluciner ». Celle d’Intern-Decision-2B est que son API « effectue une notation structurée des candidats. Elle n’appelle pas generate() et n’échantillonne pas de texte libre ».

Les mécanismes sont là où ils se séparent.

Laya est un classifieur. Un encodeur ModernBERT-large (395 M, bidirectionnel, entièrement affiné) alimente une tête de décision entraînée à partir de zéro — deux couches de transformer, un scoreur de marqueurs d'option et une tête act/escalate — pour un total de 421 M. Les options partagent un budget de tokens fixe (head_max_len, 192 tokens sur le point de contrôle anglais, 256 sur le multilingue), et le routeur détecte l'écriture et la langue en moins d'une demi-milliseconde avant le passage.

Intern-Decision-2B est un modèle de prochain jeton qui a été interdit de devenir un générateur. Il mappe les options de chaque question sur des symboles à jeton unique A–Z, a–z, 0–9 ; rend un squelette JSON d'assistant complet avec un espace réservé <decision> par champ ; exécute une passe avant causale ; lit les logits immédiatement avant chaque espace réservé ; applique un softmax sur les symboles légaux de ce champ ; et applique une température ajustée de 2,100509348278. En dessous se trouve un Qwen3_5ForConditionalGeneration standard — 24 couches, trois couches d'attention linéaire pour une couche d'attention complète, une couche de prédiction multi-jetons conservée, un plafond d'incorporation de 262 144 positions — plus une tour de vision et un projecteur.

La conséquence pratique de la différence est l'option. Le budget fixe par étiquette de Lax s'effondre sur de vastes espaces d'étiquettes ; sa propre fiche documente une question à 77 étiquettes obtenant 0,425 contre TypeSafe Jev 0,870 sur la même tâche, 77 options recevant environ trois ou quatre jetons chacune. Intern-Decision-2B prend jusqu'à 62 options par question et jusqu'à seize options, et 62 n'est pas une préférence mais le nombre exact de symboles à jeton unique que son contrat peut adresser. Ni l'un ni l'autre n'est confortable au-delà de quelques dizaines d'options ; les formes de défaillance diffèrent.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, and the opening description of Intern-Decision-2B as a multimodal structured decision model fine-tuned from Qwen3.5-2B that accepts a shared state, a schema of named questions and optional images.

Tableau d'affichage

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Laya'. The left column reads: Parameters 2,213,241,664 plus vision tower; Input ceiling 8,192 tokens, refused above; Images up to eight; Speed 33.28 ms mean on one RTX 4090; Languages no multilingual claim made; Packaging a checkpoint and an inference script. The right column reads: Parameters 421M, one 842 MB safetensors file; Input ceiling 8,192 with max_len set, 1,024 default; Images none; Speed 103-332 questions/sec batched on one T4; Languages 100+ routed, 45 of 51 usable; Packaging pip install, HTTP server, ONNX, LangChain. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced and the Laya figures are Convai's own card, including its zero-shot typed-decisions result below the majority-class line.

• Paramètres — Intern-Decision-2B : 2 213 241 664 en BF16, plus une tour de vision et un projecteur, environ 4,46 Go sur disque ; Laya 421M, un unique fichier safetensors de 842 Mo, avec un checkpoint multilingue séparé de 644 Mo.

• Plafond d'entrée — 8 192 tokens pour les deux, les deux refusent plutôt que de tronquer ; notez que le 8 192 de Laya s'applique à laya-multilingual et nécessite max_len=8192, car la valeur par défaut livrée est de 1 024.

• Images — jusqu'à huit pour Intern-Decision-2B, comptabilisées dans le même budget de tokens ; aucun chemin multimodal pour Laya.

• Vitesse — 33,28 ms en moyenne, 33,15 ms P50, 33,55 ms P95 par requête sur une RTX 4090 pour Intern-Decision-2B ; Laya rapporte environ 33 ms par requête et 103–103 questions par seconde en traitement par lots sur une T4.

• Langues — Intern-Decision-2B ne revendique aucune capacité multilingue ; Laya effectue un routage sur plus de 100 langues, indiquant que 45 des 51 langues de référence sont utilisables à plus de trois fois le niveau aléatoire, et obtient 0,451 sur l’intention MASSIVE dans treize langues non anglaises, contre 0,306 pour son point de contrôle anglais uniquement.

• Exactitude zero-shot — Intern-Decision-2B affiche une moyenne de 84,68 sur sept suites de fournisseurs, avec un Brier de 0,437 et un ECE de 0,100, tous non reproduits ; le checkpoint anglais de base de Laya obtient 0,362 sur le benchmark typed-decisions à 2 000 décisions, que sa propre fiche signale comme inférieur au seuil de 0,461 de la classe majoritaire.

• Empaquetage — un checkpoint, un inference.py et un dépôt GitHub nouvellement public avec le code d’entraînement et d’évaluation, contre pip install laya, un serveur HTTP compatible Jev, des chemins rapides ONNX Runtime et TileLang, des intégrations MCP et LangChain, et un notebook de fine-tuning qui s’exécute sur des GPU de l’offre gratuite.

La comparaison la plus équitable n’est pas celle que la fiche technique établit.

Mettre 84,68 à côté de 0,362 frôle la malhonnêteté, et il vaut la peine de dire pourquoi plutôt que de laisser les chiffres en l’état.

Le 0,362 de Laya est un checkpoint de base mesuré en zero-shot sur un benchmark sur lequel il n’a pas été affiné. Sa propre fiche en tire explicitement la conclusion : « Laya est une base rapide à spécialiser, pas un moteur de décision zero-shot. » Affiné sur le propre split d’entraînement de ce benchmark, il atteint 0,766, franchissant le plafond de 0,735 du teacher et battant le 0,727 publié de TypeSafe Jev sur les mêmes décisions. Le 84,68 d’Intern-Decision-2B, en revanche, est une moyenne fournisseur sur 84 suites dont les jeux de test ne sont pas ceux que cite Laya, produite par le laboratoire qui a construit le modèle, sans qu’aucun tiers ne l’ait exécutée — le checkpoint affiche un like et zéro téléchargement. Comparer un résultat affiné à un résultat zero-shot, ou une moyenne fournisseur à un classement indépendant, n’est pas une comparaison. Ce sont deux mesures différentes qui partagent une police de caractères.

Ce qui est vraiment comparable : les deux sont petits, les deux sont peu coûteux à exécuter, et les deux sont impossibles à affiner pour votre domaine. Le dépôt qu’InternLM a publié ce matin rend cette dernière partie nettement plus facile qu’hier, car il fournit le lanceur d’entraînement, l’objectif de prochain token masqué, un ensemble vérifié par hachage de 10 751 lignes de test réparties sur sept suites, ainsi que les scripts d’ajustement de température et de rejeu. Un laboratoire qui fournit un générateur de calibration déterministe et affirme que le rejeu ne modifie aucune décision invite exactement le genre d’adaptation que recommande la fiche de Laya.

Comment vous appelleriez réellement l’un ou l’autre

Aucun des deux modèles n’est sur OrcaRouter. La page de modèle d’OrcaRouter pour Intern-Decision-2B renvoie une 404 et il n’y a pas de route Laya non plus ; rien ici n’est une affirmation de disponibilité. Intern-Decision-2B signifie télécharger le checkpoint et exécuter son moteur intégré sur votre propre GPU. Laya signifie pip install laya et, si vous voulez la surface compatible Jev, laya-serve sur POST /v1/systemone.

La question sous-jacente, en forme d'Orchestrateur, est de savoir si vous voulez une seconde surface opérationnelle pour un scorer. Laya est conçu pour être intégré — la même forme de requête et de réponse que TypeSafe Jev, de sorte qu'un client existant ne change qu'une URL de base, et rien d'autre. Intern-Decision-2B est conçu pour être reproduit, et aujourd'hui il faut compter environ une journée de travail sur l'environnement avant que la première décision ne revienne. Si la décision en ensemble fermé que vous prenez est de forme proche de l'une ou l'autre de ces options, l'alternative hébergée à laquelle les deux fiches se comparent est TypeSafe Jev 1.13, qui dispose bel et bien d'une route : 0,042 $ par million de jetons d'entrée, un contexte de 65 K et un temps jusqu'au premier jeton P50 de 178 ms, accessible avec la même clé que plus de 200 autres modèles, avec le prix catalogue du fournisseur répercuté à 0 % de marge.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing the TypeSafe breadcrumb, the model name Jev 1.13, text input, and the description that Jev is a structured decision and evaluation model taking a state and named questions (noul / choice / score) and returning a structured answer for each, served non-streaming via POST /v1/systemone with up to about 64K input tokens.

Là où chacun gagne

Laya l'emporte sur tout ce qui est opérationnel. Un paquet pip face à un téléchargement de checkpoint. Un routeur couvrant plus d'une centaine de langues face à l'absence de toute revendication multilingue. Un débit par lots mesuré en centaines de questions par seconde face à un chiffre par requête, sans aucune prise en charge du traitement par lots. Deux ans de puissance écosystémique — ONNX, TileLang, LangChain, MCP — face à un dépôt public depuis deux heures.

Intern-Decision-2B l'emporte sur trois points précis. Il prend en charge les images, ce que Laya ne fait pas. Il ne porte aucune dette de fine-tuning : son 84,68 est une revendication de fournisseur en zero-shot, tandis que le score phare de Laya, 0,766, appartient à un checkpoint fine-tuné sur le propre split d'entraînement du benchmark. Et il est documenté avec un kit de reproduction — un ensemble d'évaluation vérifiable et une pile d'entraînement publique — ce qui vaut plus qu'une ligne de classement pour quiconque doit justifier le modèle auprès de quelqu'un d'autre.

L’égalité est la prémisse. Les deux refusent de générer, les deux vous donnent des probabilités auxquelles vous pouvez appliquer un seuil, et les deux se situent en dessous de la longueur d’entrée où se trouvent la plupart des documents réels. Si votre état est un ticket, un e-mail ou un formulaire, l’un ou l’autre fera l’affaire et Laya vous y mènera plus vite. Si votre état comporte une capture d’écran en pièce jointe ou si votre organisation a besoin que la reproduction soit auditable, le checkpoint intermédiaire d’InternLM est celui qui répond à cette objection précise — et d’après les propres chiffres d’InternLM, il est le moins bien calibré de ses trois frères et sœurs, avec un ECE de 0,100 contre 0,066 et 0,065, donc ajustez votre propre température avant de vous fier au niveau de confiance qu’il indique.