
Laya vs Decider : un encodeur de 421M face à un mélange de 35B
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
Laya et Decider sont tous deux des modèles de décision à poids ouverts et non autorégressifs qui répondent à des questions typées — un choix dans une liste fournie, un score sur une grille ordonnée, une probabilité oui/non — en une seule passe avant, et ils se situent aux deux extrémités du spectre de taille. Convai Innovations a publié Laya le 18 septembre 2026 sous licence Apache 2.0 : un encodeur ModernBERT-large de 421 M pour l'anglais avec une fenêtre de 512 tokens, un checkpoint multilingue mmBERT-base de 322 M avec une fenêtre de 1 024 tokens couvrant plus de 100 langues, et un routeur qui détecte le système d'écriture et aiguille vers le bon. La famille Decider de Mapika va de decider-0.8b et decider-2b sur de petites bases génératives jusqu'à decider-35b-a3b, un mélange d'experts de 35 B avec environ 3 B de paramètres actifs. Les deux sont téléchargeables gratuitement et tous deux renvoient des probabilités plutôt que du texte. La raison pour laquelle ils ne sont pas interchangeables n'est pas le chiffre de précision que la plupart des articles mettent en avant.
Deux familles, un pari architectural

Le pari commun est qu'une décision n'a pas besoin d'une boucle de décodage. Un modèle génératif à qui l'on demande « ce ticket est-il une demande de remboursement ? » doit émettre des jetons, et dès qu'il émet des jetons, vous devez assumer l'analyse syntaxique, la validation de schéma et un chemin de nouvelle tentative pour la fois sur deux cents où il oublie une accolade. Laya et Decider contournent tous deux cela en lisant la réponse directement à partir d'une seule passe avant — Laya depuis un encodeur bidirectionnel, Decider à partir des logits des jetons d'options lettrées à un emplacement de réponse dédié dans l'invite.
C'est là que la ressemblance s'arrête. Laya est composé de deux petits encodeurs derrière un routeur linguistique, ce qui lui permet d'obtenir une fenêtre anglaise de 512 jetons et une fenêtre multilingue de 1 024 jetons avec 421M et 322M paramètres. Decider conserve un backbone génératif et ajoute une tête de lecture par-dessus : decider-2b est un fine-tuning supervisé de Qwen3.5-2B-Base suivi d'une passe de renforcement consciente de la calibration sur des tâches de navigation en direct et des jeux exacts, tandis que decider-35b-a3b gèle les experts routés et entraîne des matrices de blocs avec Muon. La conséquence pratique est que Decider hérite de la connaissance du monde d'un modèle de langage et Laya non. L'autre conséquence est que Decider hérite de l'empreinte d'un modèle de langage.

La documentation propre de Mapika situe decider-2b à 18 ms en médiane par décision sur un B300 en bf16, avec un batch de un, sans CUDA graphs ni compilation, et decider-35b-a3b à 41 ms sur la même configuration. Sur un GH200 avec des contextes de tickets de support d'environ 230 tokens et trois à cinq questions saisies, le même projet rapporte 49 ms en mode eager, 4,0 ms avec CUDA graphs et torch.compile, et environ 1 370 décisions par seconde avec un batch de 32. Ce sont des chiffres publiés par le fournisseur, issus de la propre documentation du projet, et non une mesure indépendante. Le chiffre phare de Laya est lui aussi publié par le fournisseur : 32,8 ms p50 par décision sur un Tesla T4, et 7,2 ms par question avec une taille de batch de 10.
La question de la calibration, à laquelle les deux projets répondent à des échelles différentes
La calibration est le chiffre qui compte le plus pour un modèle de décision, car tout l’intérêt de renvoyer une probabilité est que quelqu’un en aval fixera un seuil dessus. C’est aussi là que comparer directement Laya et Decider vous induira en erreur.
Laya est livré avec une erreur de calibration attendue de 0,466 sur sa propre fiche modèle, et la fiche indique clairement que le réajustement d’une température par type de question la fait passer à 0,081. Il s’agit là d’une divulgation d’une honnêteté inhabituelle, et cela signifie aussi que le checkpoint livré n’est pas l’artefact calibré. Le nombre que vous obtenez dès la sortie de la boîte est celui de 0,466.
Decider publie ses résultats sur un instrument entièrement différent. Le Decision Index — un classement ouvert qui a exécuté chaque reproduction ouverte de Jev sur 132 422 requêtes — place decider-35b-a3b quatrième au classement général à 54,3, derrière les 59,5 de Jev, et le présente comme le mieux calibré des 32 entrées, avec une erreur de calibration de 3,1 points et 0,4 % de réponses fausses à un niveau de confiance déclaré de 95 % ou plus. decider-2b rapporte 8,8 points et 0,9 %. Ce sont des chiffres publiés par le classement, et 3,1 points sur l’ECE à dix bins de l’Index ne correspond pas à la même mesure que le 0,466 de Laya sur sa propre évaluation. Les placer côte à côte dans un tableau serait une erreur de comparaison de pommes et d’oranges déguisée en rigueur. Ce que l’on peut dire, c’est que l’auteur de Decider a choisi d’être mesuré sur un classement tiers et que l’auteur de Laya a choisi de publier lui-même son chiffre de calibration le plus faible ; ni l’un ni l’autre n’a été audité par le harnais de l’autre.
Là où chacun l'emporte, dimension par dimension
• Backbone — Laya : encodeur ModernBERT-large 421M, bidirectionnel. Décideur : bases génératives Qwen3.5, de 0,8B à 35B-A3B.
• Langues — Laya : plus de 100 via un checkpoint multilingue de 322 M derrière un routeur. Decider : anglais uniquement, indiqué comme une limitation.
• Fenêtre de contexte — Laya : 512 tokens en anglais, 1 024 en multilingue. Decider : entrées jusqu'à 32k acceptées, entraîné jusqu'à 16k sur la génération v6, sondé jusqu'à 30k.
• Plafond d'ensemble d'options — Laya : se dégrade fortement au-delà d'environ 20 options, 0,425 sur Banking77 contre 0,870 pour Jev. Decider : Choice sur 2 à 255 options nommées, Score sur 2 à 10 niveaux décrits.
• Précision zero-shot — Laya : 0,362 sur le benchmark typed-decisions, en dessous de la référence de classe majoritaire de 0,461. Decider : non publié sous forme de valeur zero-shot ; le projet rapporte à la place des résultats spécifiques à la tâche.
• Calibration — Laya : ECE 0,466 en l'état, 0,081 après recalibrage de la température par type de question. Decider : 3,1 points sur le Decision Index pour le 35B, meilleur de 32 entrées.
• Raisonnement — Laya : aucun, par construction. Decider : aucun, indiqué explicitement — ce n'est qu'une lecture par correspondance de motifs, pas un raisonneur.
• Licence — Apache 2.0 pour les deux.
Encore un détail à connaître sur Decider avant de le choisir : le projet avertit que sélectionner un enregistrement par sa position dans un long tableau JSON est un cas peu convaincant, et recommande d'adresser les enregistrements par clé. C'est le genre de limitation que l'on ne découvre qu'en l'exécutant.
Ce que cela vous coûte de faire fonctionner l'un ou l'autre
Le profil de coût de Laya est un projet de fine-tuning. Le modèle est suffisamment petit pour tourner sur le CPU d'un ordinateur portable pour les charges de travail à faible débit, mais le score zero-shot du checkpoint anglais livré se situe en dessous de la baseline triviale, ce qui signifie qu'adopter Laya revient à adopter la tâche de constituer un ensemble labellisé, de procéder au fine-tuning et de réajuster la température par type de question. La récompense, c'est qu'une fois cela fait, l'artefact ne compte que 421 M de paramètres et répond en quelques dizaines de millisecondes sur un T4. Le checkpoint laya-typed-decisions fine-tuné par Convai lui-même atteint 0,766 sur le split d'entraînement du benchmark — un chiffre qui en dit plus sur le fine-tuning que sur le modèle de base, et la fiche modèle le dit elle-même.
Le profil de coût de Decider est une décision de service. Vous choisissez la quantité de GPU à louer, et la famille vous donne un véritable curseur : 18 ms sur un 2B contre 41 ms sur un 35B-A3B, le modèle plus grand offrant une marge de connaissances et de raisonnement sur GPQA, GSM8K, CRUXEval et MMLU que les petits modèles n’ont pas. Si votre tâche est étroite et vos étiquettes fixes, decider-2b est la machine la moins chère. Si votre tâche exige que le modèle connaisse des choses, vous payez pour le mélange.
Où OrcaRouter s’intègre — et où il ne s’intègre pas
Ni Laya ni Decider ne sont des modèles hébergés sur OrcaRouter. Vous téléchargez les poids et les exécutez vous-même, et rien ici ne change cela. Ce qui change, c'est l'autre moitié du schéma. Un modèle de décision typé n'est presque jamais toute l'application : quelque chose doit lire le ticket, résumer le fil de discussion, ou rédiger la réponse que la décision conditionne. Cette moitié est un appel génératif, et c'est la moitié pour laquelle OrcaRouter est conçu — plus de 200 modèles derrière une seule clé compatible OpenAI, au prix catalogue du fournisseur répercuté avec 0 % de marge, de sorte qu'une baisse de prix d'un fournisseur se répercute sur votre facture le jour même plutôt qu'au prochain renouvellement de contrat. Si vous affinez un checkpoint Laya sur les sorties d'un modèle de pointe, ou si vous routez entre decider-2b pour le triage et un grand modèle pour les 4 % difficiles, garder le côté génératif sur un seul point de terminaison signifie que le côté décision et le côté génération n'ont pas besoin de deux contrats et de deux SDK. Le basculement automatique couvre le cas où le grand modèle est la partie qui tombe en panne.
Lequel choisir
Choisissez Laya si vos entrées sont multilingues, si vos étiquettes sont peu nombreuses, si votre budget de latence se compte en dizaines de millisecondes sur du matériel modeste, et si vous êtes prêt à effectuer un fine-tuning — car il faudra bien y passer. Choisissez Decider si vos entrées sont en anglais, si vous avez besoin que le modèle apporte un peu de connaissances du monde dans la décision, et si vous préférez choisir une taille de modèle plutôt que d'exécuter un pipeline d'entraînement. Si vos ensembles d'options dépassent vingt étiquettes, consultez le chiffre Banking77 de Laya avant de vous engager ; si vos entrées sont de longs documents JSON que vous adressez par position, consultez la limitation déclarée de Decider avant de vous engager.
La comparaison qui permettrait réellement de trancher — les deux modèles sur des entrées strictement identiques, les mêmes invites, le même ordre d'options, le même balayage de seuils — n'existe pas encore. Tant qu'elle n'existe pas, la position honnête est que Laya présente la meilleure courbe de coûts et Decider les meilleures preuves de calibration, et que tous deux en sont à un stade suffisamment précoce pour que l'évaluation que vous construirez sur vos propres données vaille plus que les chiffres publiés par l'un ou l'autre projet.

