
Intern-Decision-2B vs Laya : 2,2 milliards de paramètres contre 421 millions, tous deux refusant d’écrire une réponse
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 584 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 187 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
internlm/Intern-Decision-2B et convaiinnovations/laya sont les deux modèles les plus similaires de la niche des petits modèles de décision, et le fait le plus utile à propos de cette comparaison est qu'ils y parviennent par des voies opposées. Le checkpoint de 2 213 241 664 paramètres d'InternLM lit le logit à une position fixe avant un placeholder et n'appelle jamais generate(). Le checkpoint de 421 millions de paramètres de Convai envoie des questions typées à une tête de décision au-dessus d'un backbone ModernBERT-large et renvoie des probabilités calibrées en une seule passe avant. Ni l'un ni l'autre n'écrit de token, les deux promettent des probabilités, les deux plafonnent autour de huit mille tokens en entrée, et le plus petit est cinq fois plus petit et environ mille fois plus populaire. Ce qui les sépare n'est pas tant la capacité que le packaging, et l'écart de packaging décide de l'achat pour la plupart des lecteurs.
Intern-Decision-2B est apparu sur Hugging Face à 05:36 UTC le 26 septembre 2026, la taille intermédiaire des trois tailles qu'InternLM a téléversées en quarante secondes sans aucune annonce, affiné à partir de Qwen/Qwen3.5-2B sous Apache-2.0. Laya a été publiée pour la première fois le 18 septembre 2026 et a depuis accumulé environ 3 700 likes, un paquet pip, un serveur HTTP compatible Jev, des intégrations ONNX et LangChain et un notebook de fine-tuning. Le contraste de maturité est le sujet de l'article.
La prémisse qu’ils partagent, et les mécanismes qui diffèrent
Les deux fiches soutiennent que si votre problème consiste à choisir parmi des réponses connues, générer de la prose est la mauvaise opération. La formulation de Laya est « il ne génère jamais de texte, donc il n’y a rien à analyser et rien à halluciner ». Celle d’Intern-Decision-2B est que son API « effectue une notation structurée des candidats. Elle n’appelle pas generate() et n’échantillonne pas de texte libre ».
Les mécanismes sont là où ils se séparent.
Laya est un classifieur. Un encodeur ModernBERT-large (395 M, bidirectionnel, entièrement affiné) alimente une tête de décision entraînée à partir de zéro — deux couches de transformer, un scoreur de marqueurs d'option et une tête act/escalate — pour un total de 421 M. Les options partagent un budget de tokens fixe (head_max_len, 192 tokens sur le point de contrôle anglais, 256 sur le multilingue), et le routeur détecte l'écriture et la langue en moins d'une demi-milliseconde avant le passage.
Intern-Decision-2B est un modèle de prochain jeton qui a été interdit de devenir un générateur. Il mappe les options de chaque question sur des symboles à jeton unique A–Z, a–z, 0–9 ; rend un squelette JSON d'assistant complet avec un espace réservé <decision> par champ ; exécute une passe avant causale ; lit les logits immédiatement avant chaque espace réservé ; applique un softmax sur les symboles légaux de ce champ ; et applique une température ajustée de 2,100509348278. En dessous se trouve un Qwen3_5ForConditionalGeneration standard — 24 couches, trois couches d'attention linéaire pour une couche d'attention complète, une couche de prédiction multi-jetons conservée, un plafond d'incorporation de 262 144 positions — plus une tour de vision et un projecteur.
La conséquence pratique de la différence est l'option. Le budget fixe par étiquette de Lax s'effondre sur de vastes espaces d'étiquettes ; sa propre fiche documente une question à 77 étiquettes obtenant 0,425 contre TypeSafe Jev 0,870 sur la même tâche, 77 options recevant environ trois ou quatre jetons chacune. Intern-Decision-2B prend jusqu'à 62 options par question et jusqu'à seize options, et 62 n'est pas une préférence mais le nombre exact de symboles à jeton unique que son contrat peut adresser. Ni l'un ni l'autre n'est confortable au-delà de quelques dizaines d'options ; les formes de défaillance diffèrent.

Tableau d'affichage

• Paramètres — Intern-Decision-2B : 2 213 241 664 en BF16, plus une tour de vision et un projecteur, environ 4,46 Go sur disque ; Laya 421M, un unique fichier safetensors de 842 Mo, avec un checkpoint multilingue séparé de 644 Mo.
• Plafond d'entrée — 8 192 tokens pour les deux, les deux refusent plutôt que de tronquer ; notez que le 8 192 de Laya s'applique à laya-multilingual et nécessite max_len=8192, car la valeur par défaut livrée est de 1 024.
• Images — jusqu'à huit pour Intern-Decision-2B, comptabilisées dans le même budget de tokens ; aucun chemin multimodal pour Laya.
• Vitesse — 33,28 ms en moyenne, 33,15 ms P50, 33,55 ms P95 par requête sur une RTX 4090 pour Intern-Decision-2B ; Laya rapporte environ 33 ms par requête et 103–103 questions par seconde en traitement par lots sur une T4.
• Langues — Intern-Decision-2B ne revendique aucune capacité multilingue ; Laya effectue un routage sur plus de 100 langues, indiquant que 45 des 51 langues de référence sont utilisables à plus de trois fois le niveau aléatoire, et obtient 0,451 sur l’intention MASSIVE dans treize langues non anglaises, contre 0,306 pour son point de contrôle anglais uniquement.
• Exactitude zero-shot — Intern-Decision-2B affiche une moyenne de 84,68 sur sept suites de fournisseurs, avec un Brier de 0,437 et un ECE de 0,100, tous non reproduits ; le checkpoint anglais de base de Laya obtient 0,362 sur le benchmark typed-decisions à 2 000 décisions, que sa propre fiche signale comme inférieur au seuil de 0,461 de la classe majoritaire.
• Empaquetage — un checkpoint, un inference.py et un dépôt GitHub nouvellement public avec le code d’entraînement et d’évaluation, contre pip install laya, un serveur HTTP compatible Jev, des chemins rapides ONNX Runtime et TileLang, des intégrations MCP et LangChain, et un notebook de fine-tuning qui s’exécute sur des GPU de l’offre gratuite.
La comparaison la plus équitable n’est pas celle que la fiche technique établit.
Mettre 84,68 à côté de 0,362 frôle la malhonnêteté, et il vaut la peine de dire pourquoi plutôt que de laisser les chiffres en l’état.
Le 0,362 de Laya est un checkpoint de base mesuré en zero-shot sur un benchmark sur lequel il n’a pas été affiné. Sa propre fiche en tire explicitement la conclusion : « Laya est une base rapide à spécialiser, pas un moteur de décision zero-shot. » Affiné sur le propre split d’entraînement de ce benchmark, il atteint 0,766, franchissant le plafond de 0,735 du teacher et battant le 0,727 publié de TypeSafe Jev sur les mêmes décisions. Le 84,68 d’Intern-Decision-2B, en revanche, est une moyenne fournisseur sur 84 suites dont les jeux de test ne sont pas ceux que cite Laya, produite par le laboratoire qui a construit le modèle, sans qu’aucun tiers ne l’ait exécutée — le checkpoint affiche un like et zéro téléchargement. Comparer un résultat affiné à un résultat zero-shot, ou une moyenne fournisseur à un classement indépendant, n’est pas une comparaison. Ce sont deux mesures différentes qui partagent une police de caractères.
Ce qui est vraiment comparable : les deux sont petits, les deux sont peu coûteux à exécuter, et les deux sont impossibles à affiner pour votre domaine. Le dépôt qu’InternLM a publié ce matin rend cette dernière partie nettement plus facile qu’hier, car il fournit le lanceur d’entraînement, l’objectif de prochain token masqué, un ensemble vérifié par hachage de 10 751 lignes de test réparties sur sept suites, ainsi que les scripts d’ajustement de température et de rejeu. Un laboratoire qui fournit un générateur de calibration déterministe et affirme que le rejeu ne modifie aucune décision invite exactement le genre d’adaptation que recommande la fiche de Laya.
Comment vous appelleriez réellement l’un ou l’autre
Aucun des deux modèles n’est sur OrcaRouter. La page de modèle d’OrcaRouter pour Intern-Decision-2B renvoie une 404 et il n’y a pas de route Laya non plus ; rien ici n’est une affirmation de disponibilité. Intern-Decision-2B signifie télécharger le checkpoint et exécuter son moteur intégré sur votre propre GPU. Laya signifie pip install laya et, si vous voulez la surface compatible Jev, laya-serve sur POST /v1/systemone.
La question sous-jacente, en forme d'Orchestrateur, est de savoir si vous voulez une seconde surface opérationnelle pour un scorer. Laya est conçu pour être intégré — la même forme de requête et de réponse que TypeSafe Jev, de sorte qu'un client existant ne change qu'une URL de base, et rien d'autre. Intern-Decision-2B est conçu pour être reproduit, et aujourd'hui il faut compter environ une journée de travail sur l'environnement avant que la première décision ne revienne. Si la décision en ensemble fermé que vous prenez est de forme proche de l'une ou l'autre de ces options, l'alternative hébergée à laquelle les deux fiches se comparent est TypeSafe Jev 1.13, qui dispose bel et bien d'une route : 0,042 $ par million de jetons d'entrée, un contexte de 65 K et un temps jusqu'au premier jeton P50 de 178 ms, accessible avec la même clé que plus de 200 autres modèles, avec le prix catalogue du fournisseur répercuté à 0 % de marge.

Là où chacun gagne
Laya l'emporte sur tout ce qui est opérationnel. Un paquet pip face à un téléchargement de checkpoint. Un routeur couvrant plus d'une centaine de langues face à l'absence de toute revendication multilingue. Un débit par lots mesuré en centaines de questions par seconde face à un chiffre par requête, sans aucune prise en charge du traitement par lots. Deux ans de puissance écosystémique — ONNX, TileLang, LangChain, MCP — face à un dépôt public depuis deux heures.
Intern-Decision-2B l'emporte sur trois points précis. Il prend en charge les images, ce que Laya ne fait pas. Il ne porte aucune dette de fine-tuning : son 84,68 est une revendication de fournisseur en zero-shot, tandis que le score phare de Laya, 0,766, appartient à un checkpoint fine-tuné sur le propre split d'entraînement du benchmark. Et il est documenté avec un kit de reproduction — un ensemble d'évaluation vérifiable et une pile d'entraînement publique — ce qui vaut plus qu'une ligne de classement pour quiconque doit justifier le modèle auprès de quelqu'un d'autre.
L’égalité est la prémisse. Les deux refusent de générer, les deux vous donnent des probabilités auxquelles vous pouvez appliquer un seuil, et les deux se situent en dessous de la longueur d’entrée où se trouvent la plupart des documents réels. Si votre état est un ticket, un e-mail ou un formulaire, l’un ou l’autre fera l’affaire et Laya vous y mènera plus vite. Si votre état comporte une capture d’écran en pièce jointe ou si votre organisation a besoin que la reproduction soit auditable, le checkpoint intermédiaire d’InternLM est celui qui répond à cette objection précise — et d’après les propres chiffres d’InternLM, il est le moins bien calibré de ses trois frères et sœurs, avec un ECE de 0,100 contre 0,066 et 0,065, donc ajustez votre propre température avant de vous fier au niveau de confiance qu’il indique.
