
Laya vs von : quand le benchmark des fournisseurs ne se transfère pas
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
Une tâche de classification de type de commit avec six étiquettes possibles, où deviner vous donne 8,3 % et von obtient 26,7 %. Une tâche de routage de fichiers où le même modèle obtient 8,8 %, à peine au-dessus du hasard. Une tâche binaire d'étendue des modifications avec une AUC de 0,513, ce qui équivaut à un pile ou face. Ces chiffres proviennent d'une évaluation tierce de von — le modèle open source System One de wfzyx, un encodeur ModernBERT-Large de 395M publié sous Apache 2.0 le 18 septembre 2026, le même jour que Laya de Convai Innovations. Sur le propre benchmark jabr v2 de von, le tableau est inverse : 71,5 % de précision macro sur 49 tâches et 869 cas, un routage de choix à 83,4 %, et un résultat ViZDoom de 9,38 éliminations moyennes en moins de 18 ms contre Jev de TypeSafe AI à 5,62 éliminations et environ 115 ms. Les deux ensembles de chiffres sont réels. L'écart entre eux est la chose la plus utile que quiconque ait publiée sur cette catégorie de modèles, et il s'applique aussi à Laya.
Deux modèles, deux backbones, un mode de défaillance commun
von et Laya sont des voisins proches sur le plan architectural, c'est pourquoi le problème de transfert est le bon prisme pour les comparer. Les deux sont des encodeurs non autorégressifs construits sur ModernBERT : von à 395M paramètres, le checkpoint anglais de Laya à 421M. Les deux exposent les mêmes trois primitives — choix dans une liste fournie, score sur une grille ordonnée, noul comme probabilité calibrée de oui — et les deux implémentent /v1/systemone comme format d'échange, afin qu'un client écrit pour Jev de TypeSafe puisse pointer vers un serveur local à la place. Les deux sont sous Apache 2.0. Les deux renvoient des probabilités plutôt que du texte, et aucun n'a de boucle de décodage dans laquelle halluciner.

Les différences résident dans l’histoire de l’entraînement. von a été préentraîné sur 2 billions de tokens de texte web général, de littérature technique et de code, puis affiné sur un corpus équilibré multidomaine d’environ 290 000 exemples couvrant les flux de travail opérationnels et d’entreprise, la sécurité et le DevOps, la sûreté et la modération de politiques, la linguistique, le triage et le raisonnement adversarial. Le post-entraînement a utilisé l’apprentissage par renforcement avec distribution de calibration, en minimisant un composite d’entropie croisée et de score de Brier avec lambda à 0,5, et la mise à l’échelle de température a convergé à T = 1,1692. Le checkpoint anglais de Laya est ModernBERT-large affiné pour la forme de décision typée, avec une fenêtre de 512 tokens, aux côtés d’un checkpoint multilingue mmBERT-base de 322 M couvrant plus de 100 langues derrière un routeur, et d’un p50 publié de 32,8 ms par décision sur une Tesla T4.
Le mode de défaillance partagé est que tous deux sont des encodeurs entraînés à produire une lecture, pas des raisonneurs. Le propre README de von indique explicitement qu'il cible les pipelines sensibles à la latence, où les modèles autorégressifs introduisent 500–2 000 ms de délai et des erreurs non déterministes d'analyse de schéma. Ce cadrage vous indique à quoi il sert : une classification rapide, déterministe et statistiquement calibrée. Il ne vous dit pas qu'il fonctionnera sur votre classification, et le benchmark indépendant, c'est ce qui se passe quand quelqu'un vérifie.
Lire honnêtement le propre benchmark de von
Les résultats de jabr v2 sont publiés par leur propriétaire et n'ont pas fait l'objet d'un audit indépendant, et la forme du benchmark compte autant que le score. Quarante-neuf tâches et 869 cas constituent une étendue raisonnable pour une évaluation de modèle décisionnel, et une exactitude macro de 71,5 % est un chiffre solide pour un encodeur de 395M. C'est dans la ventilation par domaine que cela devient instructif : triage des symptômes à 100,0 %, services à domicile à 95,7 %, routage urbain à 94,7 %, routage de choix global à 83,4 %. Ce sont les tâches autour desquelles le corpus d'entraînement a été construit — le README décrit les données de fine-tuning comme des flux de travail opérationnels et d'entreprise, la sécurité et le DevOps, la sûreté et la modération des politiques, la linguistique, le triage et le raisonnement adversarial. Un score élevé en triage des symptômes indique que le modèle a appris le domaine du triage, et non qu'il a appris à classer.

Le résultat ViZDoom est celui qui est le plus souvent cité, et il mérite une lecture attentive. Neuf virgule trois huit éliminations en moyenne dans « Defend the Center », huit graines, zero-shot à partir de texte de scène structuré, avec une latence inférieure à 18 ms, contre les 5,62 éliminations de Jev à environ 115 ms — une amélioration de +66,9 %. C’est un résultat frappant, et c’est aussi un environnement de jeu piloté par du texte structuré, où une politique réflexe rapide est exactement de la bonne forme. La façon dont le projet présente le paradigme System One — réflexe, parallèle, déterministe, statistiquement calibré — est une description fidèle de ce que cette tâche récompense.
Ensuite, l’évaluation par un tiers a testé von sur la classification des types de commit, le routage de fichiers, la détection de fonctionnalités et la notation de l’ampleur des changements, et il a perdu contre des baselines à base de mots-clés et de regex sur certaines d’entre elles. Une AUC de 0,513 sur la tâche binaire est le chiffre le plus parlant : un pile ou face, de la part d’un modèle dont la calibration a été réglée à T=1,1692 et dont le README affirme une erreur de calibration attendue quasi idéale. Ces deux choses peuvent être vraies. Un modèle peut être bien calibré sur la distribution sur laquelle il a été entraîné et inutile sur une distribution qu’il n’a jamais vue — et en fait, une bonne calibration sur la mauvaise distribution est pire qu’une calibration manifestement mauvaise, parce que les valeurs de confiance paraissent dignes de foi.
Le même test appliqué à Laya
Laya a déjà fait l’objet d’une version de ce traitement, et les résultats concordent avec ceux de von. Sur le benchmark typed-decisions de TypeSafe, Laya obtient 0,362 en zéro-shot, contre 0,318 pour l’aléatoire et 0,461 pour la baseline de classe majoritaire — plus proche du hasard que de la réponse triviale. Sa propre fiche de modèle énonce la conclusion : « Laya est une base rapide à spécialiser, pas un moteur de décision zéro-shot. » Au-delà d’environ vingt options, Laya se dégrade fortement, avec un score de 0,425 sur Banking77 contre 0,870 pour Jev. Dans un test réalisé par un tiers portant sur 100 messages d’urgence Mars-base, Jev a obtenu 100/100 et Laya 53/100. Dans un benchmark d’agent navigateur, Laya n’a accompli aucune des 50 tâches, déclarant prématurément avoir terminé dans 33 tentatives, dont 17 avant même d’entreprendre la moindre action — bien que les auteurs du benchmark notent que le modèle a été entraîné pour des tâches de jugement comme les tickets d’assistance et les factures, et non pour la navigation, ce qui constitue une précision de périmètre plutôt qu’un verdict.
Là où Laya se distingue de von, c'est dans ses propres revendications. Convai a publié le chiffre zero-shot peu flatteur et l'erreur de calibration attendue de 0,466 sur la fiche, à côté du 0,081 que produit le réajustement de température par type de question. Le README de von publie le chiffre flatteur de jabr v2 et la victoire sur ViZDoom. Les deux projets sont honnêtes sur ce qu'ils ont fait ; un seul d'entre eux met en avant un benchmark où le modèle se comporte mal. C'est une observation de sourcing, pas une accusation — mais si vous choisissez entre les deux sur la base des éléments publiés, notez que vous comparez un projet qui vous a montré son chiffre faible à un autre dont vous avez dû trouver le chiffre faible ailleurs.
Le contraste des spécifications, dimension par dimension
• Backbone — Laya : ModernBERT-large 421M anglais, mmBERT-base 322M multilingue. von : ModernBERT-Large 395M.
• Langues — Laya : plus de 100 via le checkpoint multilingue et un routeur. von : anglais, sans checkpoint multilingue publié.
• Fenêtre de contexte — Laya : 512 jetons en anglais, 1 024 en multilingue. von : non publié selon les mêmes modalités ; les cas jabr v2 sont de courtes décisions structurées.
• Latence — Laya : 32,8 ms p50 sur un T4, 7,2 ms par question avec un batch de 10. von : plage annoncée de moins de 15 ms à moins de 25 ms, moins de 18 ms lors de l’exécution ViZDoom.
• Précision rapportée — Laya : 0,362 en zero-shot, 0,766 après fine-tuning sur le propre split du benchmark, 0,425 sur Banking77. von : 71,5 % en macro sur les 49 tâches de jabr v2, 83,4 % en routage de choix, et 26,7 % sur le type de commit dans un test indépendant.
• Calibration — Laya : ECE 0,466 à la sortie, 0,081 après recalibrage de la température par type de question. von : température mise à l'échelle à T=1,1692 pendant le post-entraînement RLCD, avec une ECE annoncée comme quasi idéale sur sa propre distribution.
• Service — Laya : pip install laya, ainsi que des ports communautaires ONNX, Go et Apple MLX. von : des SDK Python et TypeScript, un serveur HTTP via von serve, des préréglages prêts à l'emploi pour le triage des tickets, la sécurité des e-mails, la modération et le triage des événements de sécurité.
• Matériel — Laya : CPU, CUDA et Apple MPS. de : NVIDIA CUDA, AMD ROCm, Apple Silicon MPS et CPU multithread.
• Licence — Apache 2.0 pour les deux.
La partie de von qui est véritablement distinctive
Les patterns composables de von sont la chose la plus sous-discutée de son dépôt. Le filtrage par confiance, la répartition de routes, le scoring composite et le routage en deux étapes sont livrés comme des patterns nommés aux côtés des presets — tri de tickets, sécurité des e-mails, modération, tri d'événements de sécurité — et ils encodent l'architecture dont un modèle de décision a réellement besoin en production. Un simple appel choix est rarement tout le système ; la forme utile, c'est un routeur de première étape peu coûteux qui répartit vers une seconde étape spécialisée, avec une porte de confiance qui escalade les cas incertains. von livre cela sous forme de pattern documenté plutôt que de vous laisser le soin de le faire.
Cela correspond parfaitement à ce qu'OrcaRouter fait du côté génératif, ce qu'il vaut la peine de dire clairement, car les deux moitiés de ce schéma sont généralement construites par des équipes différentes. Ni von ni Laya n'est hébergé sur OrcaRouter — ce sont dans les deux cas des poids que vous téléchargez et exécutez — et rien ici ne doit être interprété comme une affirmation selon laquelle nous les servons. Ce qui figure sur notre liste, c'est l'autre moitié : plus de 200 modèles génératifs derrière une seule clé compatible OpenAI à prix catalogue du fournisseur répercuté avec 0 % de marge, de sorte qu'une baisse de prix d'un fournisseur se répercute sur votre facture le jour même plutôt qu'au renouvellement. Si le seuil de confiance de von détermine que 4 % des requêtes nécessitent un modèle de pointe, c'est le DSL de routage qui intègre cette décision dans un seul appel au lieu de deux contrats et de deux SDK, et le basculement automatique est ce qui empêche la branche coûteuse de constituer un point de défaillance unique.
Que faire de deux modèles qui échouent tous les deux en dehors de leur distribution d’entraînement ?
La conclusion pratique de l’évaluation de von n’est pas que von soit un mauvais modèle. C’est que l’exactitude publiée d’un modèle de décision est une affirmation sur sa distribution d’entraînement, et le seul moyen de savoir si votre problème se situe dans cette distribution est de le tester. Le propre tableau de benchmark du README de von se compare à GLiNER2, un Qwen3.5 4B affiné, Laya et Jev de TypeSafe sur la taille, l’exactitude, la latence et l’hébergement — ce qui est un tableau utile, et aussi un tableau où chaque entrée d’exactitude sauf une provient du propre harnais de l’auteur.
Entre les deux : choisissez von si vous voulez un ensemble plus large de domaines publiés, une empreinte légèrement plus réduite, des schémas de service prêts à l'emploi pour le triage et la modération, et les preuves ViZDoom qu'il gère bien les décisions rapides sur du texte structuré. Choisissez Laya si vous avez besoin d'entrées multilingues — von n'a pas de point de contrôle multilingue et la variante mmBERT 322M de Laya couvre plus de 100 langues — ou si un chiffre de 32,8 ms sur T4 et une fenêtre anglaise de 512 tokens correspondent à votre charge de travail. Ne choisissez ni l'un ni l'autre sans passer un après-midi à annoter quelques centaines d'exemples issus de votre propre trafic et à tester les deux dessus. La documentation de chacun des deux projets vous oriente vers cette expérience, et le résultat tiers de von, c'est ce qui se produit quand personne ne la mène.
La seule chose qui changerait cette comparaison serait une évaluation appariée sur des entrées identiques, avec un diagramme de fiabilité pour chaque modèle. Elle n’existe pas. Tant qu’elle n’existe pas, le classement honnête se fait selon la qualité des preuves plutôt que selon le score : Laya a publié son pire chiffre, von a publié son meilleur, et le test indépendant de von est ce qui, pour l’un comme pour l’autre, ressemble le plus à une vérification externe.

