
Intern-Decision-4B vs Laya : deux modèles qui refusent d’écrire une réponse, dix fois plus grands l’un que l’autre
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 592 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 187 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
Il y a une ligne dans la fiche modèle d'Intern-Decision-4B qui indique « Laya — 57,77 ». Quiconque a lu la documentation propre à Laya reconnaîtra la signification de ce nombre : convaiinnovations/laya est un modèle de décision non autorégressif de 421 millions de paramètres, et 57,77 est la moyenne qu'il obtient lorsqu'il est utilisé en zéro-shot sur le benchmark de quelqu'un d'autre. Sa propre fiche dit la même chose plus crûment — les checkpoints de base se situent en dessous de la baseline de la classe majoritaire sur le benchmark typed-decisions, à 0,362 contre 0,461. En parallèle, internlm/Intern-Decision-4B est un modèle de 4,54 milliards de paramètres conçu exactement pour la même tâche : prendre un état et un ensemble de questions typées, exécuter une seule passe avant, renvoyer des probabilités calibrées, ne jamais générer de token. Même pari architectural, même forme de sortie, même licence Apache-2.0, dix fois plus de paramètres — et l'un d'eux est une base à affiner tandis que l'autre prétend être un moteur zéro-shot abouti.
Ils sont d’accord sur la prémisse, et c’est là le rare.
Les deux fiches défendent la même thèse, et il vaut la peine de le dire, car la majeure partie du secteur défend l’inverse. Si votre problème consiste à choisir parmi un ensemble connu de réponses, générer de la prose est la mauvaise opération : vous payez pour des jetons que vous jetez, vous avez besoin d’un analyseur, et vous obtenez une explication que vous n’avez pas demandée au lieu d’une probabilité à laquelle vous pouvez appliquer un seuil. La fiche de Laya le formule ainsi : « il ne génère jamais de texte, donc il n’y a rien à analyser et rien à halluciner. » La fiche d’Intern-Decision-4B indique que son API « effectue une évaluation structurée des candidats. Elle n’appelle pas generate() ni n’échantillonne du texte libre. »
Les mécanismes diffèrent d'une manière instructive. Laya alimente une tête de classification avec des questions typées et renvoie des réponses typées avec des probabilités calibrées en une seule passe avant, avec une couche de routage qui détecte l'écriture et la langue en moins d'une demi-milliseconde avant la passe. Intern-Decision-4B mappe les options de chaque question sur des symboles à jeton unique, produit un squelette JSON d'assistant avec un espace réservé par champ, lit les logits immédiatement avant chaque espace réservé, et applique un softmax uniquement sur les symboles autorisés de ce champ. Celui de Laya est un problème de classification ; celui d'InternLM est un problème de jeton suivant qu'il refuse de laisser devenir un problème de génération.

L'écart de taille, et ce qu'il permet d'obtenir
Demander à deux modèles d’accomplir la même tâche avec 421 M et 4,54 Md de paramètres donne le résultat auquel on s’attend, puis une surprise.
La partie prédite est la capacité sur des questions difficiles. Intern-Decision-4B obtient une moyenne de 90,02 sur sept ensembles d'évaluation avec un score de Brier de 0,347 et une erreur de calibration attendue de 0,065 selon la mesure propre à InternLM, et il s'exécute en 44,16 ms en moyenne par requête sur une seule RTX 4090. Le checkpoint anglais de base de Laya affiche une exactitude de 0,362 sur le benchmark typed-decisions à 2 000 décisions, que sa propre fiche signale comme inférieure au seuil de 0,461 de la classe majoritaire et à peine au-dessus de la référence aléatoire de 0,318. Lorsque le même checkpoint est affiné sur la partition d'entraînement propre à ce benchmark, le chiffre passe à 0,766. La fiche de Laya en tire elle-même la conclusion : « Laya est une base rapide à spécialiser, pas un moteur de décision zero-shot. »
La surprise, c’est que le modèle plus petit l’emporte d’emblée sur deux dimensions. Vitesse : Laya répond à 103 à 332 questions par seconde en lots sur un seul T4, et sa fiche le situe environ six à huit fois plus rapide que TypeSafe Jev d’après la mesure indépendante de 236–276 ms en p50 qu’elle cite. Dix fois plus de paramètres n’achètent pas dix fois plus de débit dans l’autre sens — les 44,16 ms d’Intern-Decision-4B correspondent à une requête sur une 4090, sans aucune publication sur le traitement par lots. Et pour ce qui est des langues : Laya rapporte 45 des 51 langues évaluées comme utilisables à plus de trois fois le hasard, avec un score routé de 0,451 sur l’intention MASSIVE dans treize langues non anglaises, contre 0,306 pour son checkpoint uniquement anglais. Intern-Decision-4B ne revendique aucun caractère multilingue.
Tableau d'affichage
• Paramètres — 4,54 B en BF16 pour Intern-Decision-4B, tour de texte plus tour de vision plus projecteur ; 421 M pour Laya, une unique pile compacte de classe encodeur.
• Plafond d’entrée — 8 192 tokens pour les deux, et les deux refusent plutôt que de tronquer ; notez que les 8 192 de Laya s’appliquent au checkpoint multilingue, dont la valeur par défaut livrée est de 1 024.
• Multiplicité — Intern-Decision-4B prend de 1 à 16 questions et jusqu'à 62 options chacune, et 62 n'est pas arbitraire : c'est exactement le nombre de symboles à jeton unique que son contrat d'inférence peut adresser. Laya prend également plusieurs questions typées, mais sa fiche documente un effondrement brutal au-delà d'environ 50 options, où une question à 77 étiquettes ne dispose que de trois ou quatre jetons de budget par étiquette et la précision tombe à 0,425.
• Images — jusqu’à huit pour Intern-Decision-4B, comptées dans le budget de 8 192 tokens ; aucun chemin multimodal pour Laya.
• Calibration — Intern-Decision-4B embarque une température ajustée de 1,99241824 sélectionnée par minimisation de la NLL sur 1 728 cas, et rapporte une ECE de 0,065 sur sa propre suite ; Laya présente un excès de confiance, et sa fiche indique que réajuster une température par type de question et par nombre d’options fait passer l’ECE moyenne de 0,466 à 0,081.
• Posture zéro-shot — un checkpoint finalisé revendiquant une moyenne de 90,02 face à une base documentée dont le score est inférieur à la ligne de la classe majoritaire.
• Latence — 44,16 ms en moyenne, 44,03 ms en médiane sur un seul RTX 4090, contre 103 à 332 questions par seconde traitées par lots sur un seul T4.
• Langues — aucune allégation publiée à l’encontre de 45 des 51 langues utilisables lorsqu’elles sont routées.
• Licence — Apache-2.0 avec la licence Qwen amont préservée, par opposition à Apache-2.0 explicitement étiquetée pour un usage commercial.

Deux cartes, deux conceptions très différentes de la divulgation
C’est ici que la comparaison cesse d’être une fiche technique pour devenir une question de jugement, car les deux fournisseurs documentent leurs modèles dans des styles opposés.
La fiche de Laya publie ses propres échecs en détail. Elle rapporte que le checkpoint anglais obtient une précision de 0,000 sur le khmer avec une confiance de 0,952 — confiant tout en se trompant, ce qui rend le filtrage par confiance inutile dans ce cas. Elle rapporte que action.act_probability ne porte aucun signal exploitable, affichant 1,0 pour presque toutes les entrées, avec un AUROC de 0,30 sur 396 décisions étiquetées, et vous conseille de filtrer plutôt sur confidence, qui atteint 0,77 sur les mêmes éléments. Elle désigne les questions à score ordinal comme « la primitive la plus faible », citant 0,372 sur SST-5. Une fiche qui vous indique lesquelles de ses propres sorties ignorer fait quelque chose que la plupart des fournisseurs ne tentent même pas.
La fiche d'Intern-Decision-4B publie un tableau propre et aucun cas d'échec. Ses réserves sont réelles et déterminantes — la section sur la calibration est inhabituellement explicite : la colonne « avant » de son pilote ne correspond pas à ce que verrait un utilisateur, et les étiquettes de la suite de tests n'ont pas servi à choisir la température — mais la section d'évaluation, ce sont sept victoires et aucun aveu. Elle comporte aussi des lignes pour cinq systèmes concurrents qu'InternLM a exécutés sur le harnais d'InternLM, dont la ligne Laya qui ouvre cet article. Ce ne sont pas les chiffres propres à ces projets, et les lire comme tels serait une erreur.
Donc, la ligne de provenance pour cette confrontation est asymétrique d’une manière qui favorise le plus petit modèle : les preuves de Laya incluent des défauts qu’elle a documentés elle-même, et les preuves d’Intern-Decision-4B n’ont jamais été confrontées à un jeu de test que ses auteurs n’avaient pas choisi.
À quelle forme de problème chacun correspond-il ?
Étant donné un état court et structuré en anglais, un ensemble fermé de réponses et un besoin d'une probabilité fiable, Intern-Decision-4B est l'objet le plus capable sur le papier et le plus coûteux en pratique — quatre fragments safetensors, PyTorch 2.9.1 et Transformers 5.14.1 sous Python 3.12, un moteur résident, et un wrapper que vous écrivez vous-même si vous voulez un point de terminaison HTTP. Étant donné une décision de routage ou de garde-fou à haut volume dans des dizaines de langues où le débit est la contrainte limitante, Laya est la meilleure configuration : pip install laya, un modèle de 421M, et une fiche qui vous a déjà dit de procéder à un fine-tuning avant de faire confiance aux probabilités.
La seule chose sur laquelle les deux fiches s’accordent, c’est qu’aucun des deux modèles ne devrait être utilisé en zero-shot sans vérifier la calibration sur vos propres données — Laya parce que ses checkpoints de base sont proches du hasard sur des types de décision non familiers, Intern-Decision-4B parce que son ECE de 0,065 provient d’une suite assemblée par ses propres auteurs.
Ce qu’un routeur change et ne change pas ici
Aucun de ces deux modèles ne figure dans le catalogue OrcaRouter, et il vaut mieux le dire clairement plutôt que de le laisser entendre autrement : nos pages de modèles renvoient une erreur 404 pour Intern-Decision-4B comme pour Laya, et aucune des deux n'est une route que vous pouvez appeler aujourd'hui. Ce que cela signifie pour les deux projets n'est pas identique. La licence Apache-2.0 de Laya, assortie d'une étiquette d'utilisation commerciale, signifie que l'obstacle tient uniquement à l'empaquetage — il s'agit d'un paquet Python local à faible empreinte, le genre de chose qui pourrait vraisemblablement être servi. L'obstacle d'Intern-Decision-4B est également l'empaquetage, mais ses poids BF16 de 4,54 milliards et son plafond de refus de 8 192 jetons en font un composant plutôt qu'un service.
Là où OrcaRouter est vraiment utile, c'est en aval de la décision. Si votre problème de décision structurée s'avère finalement nécessiter une étape de raisonnement, les modèles généraux capables de le faire sont accessibles avec une seule clé pour plus de 200 modèles, avec le prix catalogue des fournisseurs répercuté à 0 % de marge et un basculement automatique entre fournisseurs — ainsi, le modèle que vous associez à un scorer n'est qu'à un point de terminaison de distance, et non à un second contrat.
La version courte
Ces deux projets sont parvenus à la même conclusion sur la manière dont les décisions devraient être prises, puis ont divergé sur presque tout le reste. Laya parie que 421 M de paramètres, un routage linguistique serré et une honnêteté impitoyable quant à ses propres défauts constituent une base rapide que l’on spécialise. Intern-Decision-4B parie que dix fois plus de paramètres et un contrat de notation à jeton unique soigneusement conçu font un moteur zero-shot abouti. L’expérience décisive est celle qu’aucun des deux n’a menée en public : prendre un ensemble de décisions dont les réponses sont calculables, exécuter les deux, et vérifier si les probabilités ont un sens. Laya n’a publié cette expérience qu’à moitié et vous a montré où elle échoue. Intern-Decision-4B ne l’a pas publiée du tout.

