
Laya vs Kev : Deux recettes pour un modèle de décision local
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
Le nombre le plus utile dans la comparaison entre Laya et Kev est un reçu. Jared Palmer a entraîné la famille Kev pour environ 95 $ de temps H100 sur Modal, plus environ trois cents d'appels API pour les données d'évaluation, et a publié la recette en même temps que les poids. Convai Innovations a emprunté l'autre voie avec Laya : publié le 18 septembre 2026, trois jours après Jev de TypeSafe AI, sous Apache 2.0, avec les poids sur Hugging Face, pip install laya comme point d'entrée, et aucune pipeline d'entraînement — un checkpoint anglais ModernBERT-large de 421M, un modèle multilingue mmBERT-base de 322M, et un routeur qui choisit entre les deux. Kev est une famille de trois petits modèles de 0,8B, 4B et 9B, chacun composé d'une base gelée, d'un adaptateur LoRA de rang 16 et d'une petite tête de pointeur. Les deux répondent à des questions typées en une seule passe avant et aucun ne génère de texte. Le choix entre les deux est en réalité une décision quant à l'artefact que vous voulez posséder : un checkpoint ou une recette.
Ce que chaque projet livre réellement
Laya livre l'inférence. Le checkpoint anglais est un encodeur bidirectionnel avec une fenêtre de 512 tokens ; celui multilingue couvre plus de 100 langues avec une fenêtre de 1 024 tokens et tourne environ deux fois plus vite ; le routeur détecte le script en moins d'une demi-milliseconde. Il répond choice, score et noul — un choix dans une liste, un niveau attendu sur une grille ordonnée, et une probabilité calibrée qu'une affirmation soit vraie. Il existe un troisième checkpoint, laya-typed-decisions, qui est le même squelette de 421M affiné sur le split d'entraînement du benchmark typed-decisions. La fiche de modèle de Convai elle-même contient la phrase qui devrait régir la façon dont vous lisez chaque chiffre de Laya : « Laya est une base rapide à spécialiser, pas un moteur de décision zero-shot. »


Kev livre une méthode. Le dépôt documente decision-v7 : deux époques sur 10 000 exemples tirés de dix jeux de données publics, 896 exemples de politiques générés et 1 680 exemples construits à partir de 60 structures de règles générées. La tête évalue chaque option fournie par rapport au jeton decide de la question, puis applique un softmax au résultat. Parce que les checkpoints Qwen3.5 mélangent l'attention avec des couches récurrentes Gated DeltaNet qui ignorent les masques d'attention, chaque question s'exécute sur sa propre ligne, l'état partagé étant calculé une fois puis mis en cache — c'est ainsi que le modèle garde les questions isolées les unes des autres sans payer pour un nouveau préremplissage par question. Kev reproduit le contrat public /v1/systemone de TypeSafe, de sorte qu'un client SDK TypeSafe existant peut pointer vers un serveur Kev local en changeant l'URL de base. Le README indique qu'aucune sortie de Jev n'a été utilisée pour l'entraînement.
Les deux modes de défaillance sont différents, et c'est là toute l'histoire
Les deux modèles perdent face à Jev sur les tâches qui exigent de connaître des choses, mais ils perdent d'une manière qui appelle des mesures d'atténuation différentes.
Les faiblesses publiées de Laya concernent la forme de l'entrée. Sur le benchmark typed-decisions de TypeSafe, elle obtient 0,362 en zéro-shot, contre 0,318 pour une supposition aléatoire et 0,461 pour la baseline de classe majoritaire — plus proche du hasard que de la réponse triviale. Au-delà d'une vingtaine d'options environ, elle s'effondre : 0,425 sur Banking77 contre les 0,870 de Jev. Elle est suffisamment sensible à l'ordre pour qu'une simple inversion de l'ordre des options ait fait chuter l'exactitude de 13,75 points dans un test mené par un tiers, laissant un taux de réponses identiques de 42,5 %. Et les checkpoints livrés arrivent avec des températures invalides — la bibliothèque émet un avertissement à l'importation, ce qui signifie que le chiffre de calibration sur la fiche, une erreur de calibration attendue de 0,466, est le nombre que vous obtenez réellement avant de réajuster. Un réajustement par type de question le ramène à 0,081, mais c'est un travail que vous faites, pas un travail que le téléchargement effectue. Il existe une défaillance multilingue publiée qui mérite d'être lue en entier : sur les écritures non latines, le checkpoint anglais est catastrophiquement trop confiant, avec un exemple en khmer affichant une exactitude de 0,000 pour une confiance moyenne de 0,952.
Les faiblesses publiées de Kev concernent les connaissances et l'arithmétique. Kev-9B obtient 0,837 sur son propre test verrouillé sur de nouvelles sources — 0,832 pour le 4B et 0,668 pour le 0,8B — et environ 0,822 hors domaine sur la partition de développement, contre 0,857 pour Jev. L'écart se creuse là où des connaissances générales sont requises : MMLU autour de 70 % contre 90 % pour Jev, MMLU-Pro 0,515 contre 0,840, et l'arithmétique de dates à précision journalière 60 % contre 93 %. Sur un ensemble étroit de routage à étiquettes fixes, il l'emporte — une évaluation de routage de tickets d'assistance a placé Kev-9B à 0,952 contre 0,897 pour Jev — mais l'auteur précise explicitement qu'il s'agit de son propre banc d'essai, que les données d'entraînement de Jev ne sont pas divulguées et qu'aucune comparaison contrôlée n'est donc constructible. Kev reste également trop confiant sur de nouvelles sources ; le fait de régler KEV_TEMPERATURE=2.0 a réduit les erreurs confiantes de 8,7 % à 4,4 % dans les tests propres du projet, ce qui indique que la valeur par défaut n'est pas le réglage sûr.
En pratique : l’échec de Laya est déclenché par votre ensemble d’options et le formatage de vos prompts, et vous le corrigez par fine-tuning et réajustement. L’échec de Kev est déclenché par des questions qui exigent des faits, et vous le corrigez en cantonnant le modèle au routage et à la classification et en gardant ailleurs les appels dépendant des connaissances. Aucune des deux corrections n’est un drapeau de configuration.
Ce qu’il faut pour les servir
• Matériel — Laya : encodeurs 421M/322M, crédibles sur CPU pour de faibles débits et moins d'un gigaoctet de mémoire résidente pour le portage MLX sur Apple silicon. Kev : de 0,8B à 9B, nécessitant un GPU CUDA BF16 pour le 9B, avec l'architecture Qwen3.5 nécessitant flash-linear-attention sur CUDA et ROCm.
• Latence — Laya : 32,8 ms p50 par décision sur une Tesla T4, 7,2 ms par question avec un lot de 10. Kev : environ 300 ms pour cinq questions saisies à partir d’un modèle 4B sur un Mac de 32 Go en bf16, environ 40 ms sur un H100.
• Plafonds — Laya : fenêtre anglaise de 512 tokens, 1 024 en multilingue. Kev : choix parmi 1–255 options, score sur 2–255 niveaux, 384 tokens d’état d’entraînement avec 8 192 en service.
• Serveur — Laya : Python in-process, plus les ports communautaires ONNX, Go et Apple MLX. Kev : un serveur local lié à 127.0.0.1 sans authentification, un SDK npm, et des adaptateurs LangChain et LlamaIndex.
• Licence — Apache 2.0 pour les deux.
Deux notes opérationnelles qui n'apparaissent pas dans les chiffres phares. Le serveur de Kev est mono-requête et non authentifié par conception — c'est un sidecar local, pas quelque chose que l'on expose. Et la latence de Kev sur Mac est nettement plus mauvaise que sa latence sur H100, car les kernels DeltaNet rapides n'existent pas encore pour MLX, ce qui est exactement le genre de détail qui transforme une affirmation « tourne en local » en une affirmation « tourne en local sur le bon matériel ».
La moitié générative du motif
Ces deux modèles existent pour remplacer un appel bien précis : l’invocation LLM que vous faisiez uniquement pour obtenir en retour une étiquette ou une probabilité. Ils ne remplacent pas les appels où vous avez réellement besoin de prose. Un système de support qui utilise Kev-9B pour orienter un ticket a encore besoin d’un modèle pour résumer le fil de discussion et rédiger la réponse, et ce modèle ne sera pas un LoRA 9B doté d’une tête de pointeur.
C’est à ce point de jonction que se situe OrcaRouter, plutôt qu’une affirmation selon laquelle il hébergerait l’un ou l’autre. Ni Laya ni Kev ne figurent sur notre liste de modèles — ce sont des poids que vous téléchargez — et l’article serait trompeur s’il laissait entendre le contraire. Ce qui figure sur la liste, ce sont plus de 200 modèles génératifs derrière une seule clé compatible OpenAI au prix catalogue du fournisseur répercuté avec 0 % de marge. Si vous utilisez Kev pour décider à quel niveau de synthèse, parmi trois, appartient une requête, ou Laya pour évaluer si une réponse provisoire est acceptable, le volet génératif de ces deux boucles est un seul point de terminaison avec basculement automatique, au lieu d’un second contrat et d’un second SDK. Le DSL de routage est l’élément qui s’intègre le plus naturellement à une architecture de modèle de décision : combinez un modèle bon marché et un modèle coûteux en un seul appel et laissez la sortie du modèle de décision choisir la branche.
Que regarder ensuite
Le déficit de preuves est le même pour les deux, et il ne sera comblé par aucun des deux projets. Personne n'a exécuté Laya et Kev sur des entrées identiques octet pour octet avec les mêmes invites, le même ordre d'options et le même balayage du seuil de confiance. Les victoires phares de Laya proviennent de son propre banc d'essai ; les affirmations de quasi-parité de Kev proviennent du banc d'essai de son auteur ; l'audit de calibration qui a constaté que la calibration de Jev variait fortement selon la tâche — 44,7 % de précision et 0,325 d'erreur de calibration attendue sur une tâche prioritaire à politique cachée — était celui d'un tiers, et ni Laya ni Kev n'a bénéficié de ce traitement. Tant que personne ne le fait, les chiffres ci-dessus sont les meilleurs disponibles et ils ne sont pas comparables entre eux.
Si vous décidez aujourd'hui : prenez Kev si vous voulez un modèle de routage fonctionnel cette semaine sur un GPU que vous louez déjà, et acceptez qu'il ne connaîtra pas certaines choses. Prenez Laya si vos entrées sont multilingues ou si votre budget matériel correspond à un ordinateur portable, et prévoyez le fine-tuning comme partie intégrante du projet plutôt que comme une optimisation ultérieure. Dans les deux cas, évaluez sur vos propres données annotées avant de placer un seuil de confiance devant le trafic de production — les deux projets, dans leur propre documentation, vous le recommandent.

