Une carte de titre générée affichant « Jev vs Laya » sur le sous-titre « 33 millisecondes sur un T4, et une baseline aléatoire », opposant Jev (moteur de décision fermé, hébergé, zero-shot, 0,727) à Laya (Apache 2.0, ModernBERT 421M, s'exécute localement, 0,362 zero-shot).
Engineering & Research

Jev vs Laya : 33 millisecondes sur un T4, et une baseline aléatoire

Auteur

Elias Hawthorne

Date de publication

Retour à tous les articles

La fiche de modèle de Laya contient la phrase qui tranche cette comparaison, et elle a été écrite par les personnes qui ont créé Laya. « Laya est une base rapide à spécialiser, pas un moteur de décision zero-shot. » Convai Innovations a publié Laya le 18 septembre 2026, trois jours après le lancement de Jev par TypeSafe AI, sous Apache 2.0, avec les poids sur Hugging Face et un pip install laya point d’entrée. Il répond à des questions typées en une seule passe avant, sans décodage token par token, ce qui est le même pari architectural que fait Jev. La promesse principale est une latence p50 de 32,8 millisecondes par décision sur une Tesla T4, présentée comme environ 7,8 fois plus rapide que le p50 publié de Jev, de 236 à 276 ms via son API hébergée. L’affirmation est vraie, et elle mesure aussi deux choses différentes — un GPU local contre un appel réseau — et le tableau de précision qui se trouve en dessous est ce qui devrait déterminer si vous le téléchargez. En zero-shot, Laya obtient 0,362 sur le benchmark de décisions typées de TypeSafe. Une réponse aléatoire obtient 0,318. La baseline de la classe majoritaire obtient 0,461. Laya, tel quel, est plus proche du hasard que de la baseline triviale.

Ce qu'est réellement Laya

A screenshot of the TypeSafe AI documentation for Jev, showing the typed Choice, Score and Noul primitives, the calibrated probability per answer, free output, and the roughly 32,000-token request budget.

Laya se présente sous la forme de deux checkpoints derrière un routeur intégré qui achemine chaque entrée vers le bon. Le checkpoint anglais est ModernBERT-large, avec 421 M de paramètres et un contexte de 512 tokens. La variante multilingue est mmBERT-base, avec 322 M de paramètres et une fenêtre de 1 024 tokens couvrant plus de 100 langues. Les deux sont non autorégressifs : une seule passe avant renvoie la réponse, donc pas de boucle de décodage, pas de JSON à analyser et aucun espace pour émettre du texte en dehors du type déclaré. Cette dernière propriété est la même garantie structurelle qu’offre Jev, atteinte par une autre voie, et elle est réellement précieuse pour quiconque a écrit une logique de réessai autour d’un modèle qui oublie parfois de fermer une accolade.

Jev est l’homologue fermé : le premier modèle System One de TypeSafe AI, lancé le 15 septembre 2026, hébergé et en accès anticipé, avec trois primitives typées — Choice à partir d’une liste que vous fournissez, Score sur une grille d’évaluation ordonnée, et Noul, une affirmation oui/non avec une probabilité calibrée. Toutes les questions sont évaluées en parallèle par rapport à une lecture partagée unique de l’état, la sortie est gratuite car il n’y a pas de jetons de sortie, et l’entrée est à 0,042 $ par million de jetons. Son architecture, son nombre de paramètres et sa puissance de calcul d’entraînement ne sont pas divulgués, et TypeSafe a déclaré que les détails étaient gardés secrets, avec peut-être un article plus tard.

L'affirmation sur la latence, mesurée comme il se doit

Le p50 de 32,8 ms de Laya sur un T4 est un chiffre bien réel, et même un bon chiffre. C’est dans la comparaison d’un facteur 7,8 avec les 236–276 ms de Jev que la prudence s’impose, et la fiche de Laya elle-même est d’une honnêteté inhabituelle sur la raison : les chiffres de Jev sont des nombres publiés par des tiers que Convai n’a jamais mesurés lui-même, et la comparaison oppose une passe avant locale sur GPU à un appel d’API hébergé qui inclut l’aller-retour réseau et la mise en file d’attente. Si l’on retire le réseau de l’équation, la comparaison architecturale se fait entre deux modèles à passe unique, l’un à 421 M de paramètres et l’autre d’une taille non divulguée que TypeSafe n’a jamais publiée.

Il y a aussi un chiffre de traitement par lots qu’il vaut la peine de connaître : avec un lot de dix, Laya rapporte 7,2 ms par question. C’est la forme du produit. Laya est conçu pour être exécuté localement à grande échelle, et les ports communautaires sur appareil tels que laya-mlx étendent cela à Apple Silicon. Les affirmations virales de « 50 fois plus rapide que Jev » ne sont pas étayées par les benchmarks publiés par le projet lui-même, et la formulation honnête est celle d’un large écart entre local et cloud, en partie architectural et en partie simplement dû à la différence entre votre GPU et l’API de quelqu’un d’autre.

Ce que disent les chiffres de précision, dans l’ordre

C'est là que la comparaison cesse d'être flatteuse, et il vaut la peine d'exposer cela dans l'ordre, car la séquence importe.

• Zéro-shot sur le benchmark typed-decisions de TypeSafe — Laya 0,362, aléatoire 0,318, classe majoritaire 0,461, Jev 0,727. Laya est au-dessus du hasard et en dessous de la référence triviale.

• Affiné sur la propre partition d’entraînement du benchmark — Laya 0,766 contre les 0,727 de Jev. Laya l’emporte, et cette victoire vient d’un checkpoint qui a vu les données d’entraînement du benchmark, ce qui en fait un constat sur le fine-tuning, pas sur le modèle de base.

• Classification d'intentions Banking77, où l'ensemble d'options est vaste — Laya 0,425 contre 0,870 pour Jev. Laya se dégrade fortement au-delà d'environ 20 options, et les champs Choice de Jev sont documentés pour gérer jusqu'à 255 avant que le modèle de scoring en deux étapes ne soit nécessaire.

• Calibration — Laya est livré avec une erreur de calibration attendue moyenne de 0,466, qui ne s’améliore à 0,081 qu’après un réajustement de température par type de question. Jev est entraîné avec une méthode que TypeSafe appelle RLCD, Reinforcement Learning for Calibrated Decisions, et fournit chaque réponse avec une distribution de probabilités — bien que TypeSafe indique aussi aux utilisateurs de valider les seuils sur leurs propres données étiquetées, et un audit indépendant a constaté que la calibration de Jev variait fortement selon la tâche.

Le schéma est sans ambiguïté. Laya est une base solide à affiner et un moteur de décision zéro-shot faible, et elle le dit elle-même. Jev est un puissant moteur de décision zéro-shot dont la calibration doit encore être vérifiée à chaque déploiement. Ce sont des produits différents avec des structures de prix différentes, et choisir entre eux est surtout une question de savoir si vous disposez de données étiquetées et d’une boucle d’entraînement.

L’arithmétique des coûts n’a pas la même forme que celle de Jev.

Jev coûte 0,042 $ par million de jetons d'entrée, la sortie étant gratuite, soit 42 $ par milliard, et un appel de taille maximale avec le budget de requête documenté d'environ 32 000 jetons coûte bien moins d'un centime. Le test indépendant d'Every a réalisé 777 jugements sur 37 documents pour environ un quart de centime.

Le coût par appel de Laya est nul à la marge et non nul au total, et le total n'est pas négligeable. Un modèle de 421 M de paramètres sur un T4 est peu coûteux à exécuter et vous coûte quand même un GPU, et l'étape de fine-tuning qui rend Laya compétitif est là où se situe la véritable dépense — l'étiquetage des données, l'exécution de l'entraînement, le harnais d'évaluation, et le réajustement de la température par type de question qui fait passer son erreur de calibration de 0,466 à 0,081. Pour une taxonomie fixe qui ne change jamais, c'est un coût unique qui s'amortit au volume. Pour une taxonomie qui dérive, c'est un coût récurrent, et la baseline zero-shot de Jev à 0,727 devient une bien meilleure affaire.

Il y a un troisième coût facile à négliger : le checkpoint anglais de Laya dispose d'une fenêtre de contexte de 512 jetons. Ce n'est pas un modèle de décision doté d'un petit budget de contexte — c'est un modèle de décision dimensionné pour un paragraphe. Le budget de requête d'environ 32 000 jetons de Jev est soixante fois plus grand, et même celui-ci est d'un ordre de grandeur inférieur aux modèles génératifs par rapport auxquels les deux sont tarifés. Si votre état est un fil de support plutôt qu'un message de support, la fenêtre d'aucun des deux modèles n'est la contrainte par rapport à laquelle vous devriez optimiser.

La question du déploiement est la véritable différence

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window and the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 on a T4, and the pip install entry point.

L'argument le plus fort de Laya n'est pas la latence. C'est que des poids sous licence Apache 2.0 sur Hugging Face signifient que la décision ne quitte jamais votre infrastructure et que le point de terminaison n'a jamais de limite de débit. Pour une décision de routage prise sur un dossier médical, un document juridique ou l'historique de compte d'un client, ce n'est pas une préférence — c'est le facteur décisif, et aucun point de terminaison hébergé, à quelque prix que ce soit, ne remporte cet argument. Jev de TypeSafe est en accès anticipé et sur liste d'attente, et sa propre documentation indique que les limites de débit peuvent changer sans préavis.

Le contre-argument, c’est ce à quoi vous renoncez. L’architecture plus vaste non divulguée de Jev fait le travail que les 421 M de paramètres de Laya ne peuvent pas faire : l’écart zéro-shot de 0,727 contre 0,362 et l’écart Banking77 de 0,870 contre 0,425 mesurent tous deux la quantité de connaissances présente dans le modèle avant que vous ne l’entraîniez. La réponse de Laya, c’est que vous fournissez vous-même ces connaissances par le fine-tuning, et sur un domaine étroit et fixe, cette réponse fonctionne — le résultat de 0,766 après fine-tuning en est la preuve.

Où se situe la couche de décision dans une pile réelle

Aucun des deux modèles ne génère de texte, donc aucun ne constitue à lui seul l'ensemble d'un workflow. Le schéma pour lequel les deux sont conçus repose sur deux modèles : une couche de décision qui effectue l'appel typé, et un modèle génératif qui prend en charge la partie nécessitant de la prose, du code ou une explication. OrcaRouter ne sert pas Jev ni Laya — Jev est le point de terminaison en accès anticipé de TypeSafe et Laya est un ensemble de poids que vous exécutez vous-même — mais la moitié générative de ce schéma est exactement ce que nous couvrons : plus de 200 modèles derrière une seule clé compatible OpenAI au prix catalogue du fournisseur, répercuté avec 0 % de marge, de sorte qu'un changement de prix d'un fournisseur est effectif de notre côté le jour même. L'architecture à deux modèles est testable sans second contrat fournisseur, et grâce au basculement automatique, le chemin génératif ne devient pas un point de défaillance unique pendant que vous décidez si la couche de décision bon marché est suffisamment bien calibrée pour automatiser.

Le verdict

Si vous disposez d'une taxonomie fixe et étroite, d'exemples étiquetés et d'une exigence de confidentialité ou de latence qui exclut une API hébergée, Laya est le choix le plus défendable, et les chiffres obtenus après affinage le confirment. Si vous avez besoin que la décision fonctionne immédiatement, sans configuration, si vos ensembles d'options dépassent vingt catégories, ou si l'état est plus long qu'un paragraphe, la fiche de modèle de Laya elle-même vous indique que ce n'est pas le produit pour ce travail — et le score zéro-shot de 0,362 face à une référence majoritaire de 0,461 est le chiffre à garder en tête quand on vous cite le chiffre de latence de 7,8x.

Ce que les deux ont en commun est plus utile que ce qui les sépare. Tous deux éliminent la classe d’erreurs issue du formatage de la sortie et ne font rien contre celle qui vient du jugement. Tous deux fournissent des probabilités, et aucun ne publie de diagramme de fiabilité auquel on puisse se fier sans vérification. Testez la calibration sur vos propres cas étiquetés avant d’automatiser avec l’un ou l’autre — la latence est déjà banalisée et la valeur de confiance est la partie qui doit être gagnée pour chaque déploiement.

A generated two-column scoreboard comparing Jev and Laya across the same six labelled dimensions, with a footer reading "Laya zero-shot vs random 0.318 and majority baseline 0.461; per Laya's own model card."