Un carton de titre généré indiquant « Jev vs Kev » au-dessus du sous-titre « Un fine-tuning à 95 $ qui surpasse Jev sur les tickets d'assistance », opposant Jev (fermé, hébergé, architecture non divulguée, 0,042 $ par million d'entrées, sortie gratuite) à Kev (Apache 2.0, base Qwen3.5, 0,8B à 9B, environ 95 $ en temps H100).
Engineering & Research

Jev vs Kev : un fine-tune à 95 $ qui bat Jev sur les tickets de support

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Jared Palmer a publié Kev le 20 septembre 2026, cinq jours après le lancement de Jev par TypeSafe AI, et le chiffre important ne figure pas dans le tableau des benchmarks. Il est dans le README : l'ensemble a coûté environ 95 $ de temps H100 sur Modal, plus trois centimes d'appels à l'API Jev utilisés pour générer les données d'évaluation. Kev est sous Apache-2.0, auto-hébergeable, et se décline en trois tailles construites sur les poids de base Qwen3.5 — environ 0,8B, 4B et 9B — avec un adaptateur LoRA de rang 16 et une tête de pointeur greffés sur une base gelée plutôt qu'un modèle de décision construit de zéro. Il reproduit exactement l'API de décision typée de Jev : Choice, Score et Noul, suffisamment proches pour être compatibles avec le SDK Python de TypeSafe. Jev, quant à lui, a été lancé le 15 septembre 2026 comme le modèle System One hébergé et fermé de TypeSafe AI, renvoie des réponses typées avec une confiance calibrée et aucun texte du tout, et n'a jamais publié son architecture, son nombre de paramètres, son compute d'entraînement ni ses poids. La comparaison n'est donc pas vraiment une comparaison de modèles. C'est un test visant à déterminer quelle part de la valeur de Jev survit au fait d'être reproduite en un après-midi pour le prix d'un ordinateur portable d'occasion.

Ce que les benchmarks disent réellement

A screenshot of the TypeSafe AI documentation for Jev, showing the typed Choice, Score and Noul primitives, the calibrated probability returned with every answer, free output, and the roughly 32,000-token request budget with a 255-option Choice cap.

Le principal enseignement est que Kev s'en rapproche, et sur une tâche étroite, il l'emporte. Sur l'ensemble de test verrouillé de nouvelles sources de Kev, Kev-9B a obtenu 0,837 contre 0,857 pour Jev. Sur le routage de tickets d'assistance sur 900 tickets — l'ensemble scienthoon — Kev-9B a obtenu 0,952 contre 0,897 pour Jev, ce qui est le seul résultat publié où la reproduction ouverte dépasse le modèle qu'elle reproduit. Kev prend aussi légèrement l'avantage sur certaines tâches de reconnaissance logique. Sur les ensembles de décision SemiF, un ensemble structuré de 144 questions, Jev l'emporte 0,965 contre 0,917 pour Kev-9B.

Là où Kev perd, il perd lourdement. Précision hors domaine : Kev-8B à 79,6 % contre 85,7 % pour Jev. MMLU : 70 % contre 90 %. MMLU-Pro : 0,515 contre 0,840. Arithmétique des dates à la précision du jour : 60 % contre 93 %. Le schéma est constant — Kev est compétitif sur le routage et la classification étroits, là où l’ensemble d’étiquettes est petit et le domaine fixe, mais il s’effondre sur tout ce qui nécessite des connaissances du monde ou de l’arithmétique à plusieurs étapes, car un adaptateur de rang 16 sur un petit modèle de base figé n’est pas là où résident les connaissances du monde.

Chacun de ces chiffres provient du propre banc d’essai de Kev ou d’outils de suivi tiers, et le README de Palmer indique clairement qu’il ne s’agit pas d’une comparaison contrôlée — les données d’entraînement de Jev ne sont pas divulguées, il est donc impossible d’en construire une. Le README précise aussi qu’aucune sortie de Jev n’a été utilisée pour l’entraînement. Ces deux avertissements sont du genre à rendre les chiffres plus fiables, pas moins : la personne qui publie la comparaison est celle qui vous dit ce qu’elle ne peut pas prouver.

Ce que vous obtenez pour 95 $ que vous ne pouvez obtenir de Jev à aucun prix

A screenshot of the Kev repository page for jaredpalmer/kev, showing the Apache-2.0 licence, the Qwen3.5 base weights, the rank-16 LoRA and pointer-head recipe, the about-$95 H100 training cost, and the README statement that no Jev outputs were used for training.

La comparaison des coûts est précisément le point où les deux produits cessent d'être comparables. Jev coûte 0,042 $ par million de jetons d'entrée, la sortie étant gratuite, ce qui est bon marché d'une manière qu'il est vraiment difficile d'égaler par appel — mais c'est une API hébergée en accès anticipé, avec une liste d'attente, et TypeSafe a déclaré que les limites de débit pouvaient changer sans préavis. Kev, ce sont des poids que vous téléchargez. Le coût marginal de la dix-millionième classification, c'est votre propre électricité.

Quatre choses en découlent, et aucune d'entre elles ne concerne les scores de benchmark.

• Aucune donnée ne quitte votre infrastructure. Jev est un point de terminaison hébergé ; chaque état que vous lui envoyez — le ticket d'assistance, la ligne de journal, le dossier médical — va à TypeSafe. Kev s'exécute sur votre propre GPU, ce qui, pour les charges de travail réglementées, n'est pas une préférence mais le facteur décisif.

• Aucune limite de débit, aucune liste d'attente, aucun risque de dépréciation. La documentation de TypeSafe elle-même précise que les limites de débit peuvent changer sans préavis. Un checkpoint local ne comporte pas une telle clause.

• Vous pouvez l'affiner. Kev est une base à spécialiser, et la recette LoRA qui l'a produit est publique. Si votre taxonomie de routage comporte 40 classes qu'aucun modèle généraliste ne traite correctement, vous pouvez entraîner le modèle sur vos propres étiquettes — ce que Palmer a fait exactement, pour un coût de l'ordre de quelques dizaines de dollars plutôt que celui d'une équipe de ML.

C’est à vous de modifier le plafond de contexte. Le budget de requêtes documenté de Jev est d’environ 32 000 tokens, et les champs Choice sont limités à 255 options. Kev hérite de la fenêtre de Qwen3.5, qui est bien plus grande, et le plafond d’options est un détail d’implémentation de votre propre pile de service plutôt qu’une limite du fournisseur.

Ce que Jev a encore et que Kev n’a pas

Le point sur la calibration est celui qui ne se transpose pas proprement, et c'est le cœur de l'argumentaire de TypeSafe. Jev est entraîné avec une méthode que TypeSafe appelle RLCD — Reinforcement Learning for Calibrated Decisions — qui optimise pour que la valeur de confiance soit honnête plutôt que pour que la réponse soit préférée. Chaque réponse de Jev est livrée avec une distribution de probabilité sur les options, si bien que votre code peut définir des seuils : agir automatiquement dans la bande supérieure, signaler au milieu, escalader en bas.

Kev produit la même forme typée et les mêmes sorties de probabilité, car l’API est délibérément compatible. Que ces probabilités soient calibrées est une autre question, et la réponse honnête est que personne n’a publié de diagramme de fiabilité pour l’un ou l’autre modèle. Un audit de calibration distinct a rapporté que Jev obtenait une exactitude de 44,7 % avec une erreur de calibration attendue de 0,325 sur une tâche prioritaire à politique cachée, ce qui suggère que la calibration de Jev varie fortement selon la tâche plutôt que d’être une propriété universelle — et TypeSafe lui-même conseille aux utilisateurs de tester les seuils de confiance sur leurs propres exemples étiquetés plutôt que de se fier au comportement publié.

L'autre chose que Jev a, c'est qu'il n'a pas été entraîné sur Qwen3.5. Un modèle 9B avec un adaptateur de rang 16 a un plafond de connaissances, et l'écart MMLU-Pro de 0,515 contre 0,840 est ce plafond rendu visible. Si votre décision de routage nécessite occasionnellement de savoir ce qu'est une chose, l'architecture non divulguée plus grande de Jev fait un travail que l'adaptateur de Kev ne peut pas faire.

Latence et la forme du déploiement

La latence de bout en bout documentée de Jev est de 70–500 ms, contre 3–329 secondes pour les appels aux LLM de pointe dans la propre comparaison de TypeSafe, et ajouter des questions à un appel ne la fait guère bouger, car chaque question est évaluée en parallèle sur une même lecture partagée de l'état. Kev-9B sur un H100 sera du même ordre de grandeur pour une seule passe avant, mais la comparaison n'est pas à armes égales dans un sens comme dans l'autre : un 9B auto-hébergé sur un GPU partagé sous charge n'a pas la même latence qu'un point de terminaison hébergé, et un point de terminaison hébergé n'est pas la même chose qu'une machine dans votre propre rack. Ce que l'on peut affirmer sans nuance, c'est que les deux sont assez rapides pour un usage à chaque tour dans une boucle d'agent, et que la latence de Kev dépend du matériel que vous contrôlez plutôt que d'un niveau de service qu'on vous promet.

Le regard honnête sur la reproduction

Le fait que Kev existe tout court est une preuve concernant Jev, et cela mérite d’être nommé. Un modèle fermé dont le comportement peut être approché en cinq jours pour 95 $, par une seule personne, sur des poids de base publics, vous dit quelque chose sur la part de son avantage qui tient à l’architecture et sur celle qui tient aux données d’entraînement et au serving. Il ne s’ensuit pas que Jev soit facile à construire — la surface d’API est facile à copier, la calibration ne l’est pas. Mais cela signifie que l’avantage défensif n’est pas l’interface, et quiconque évalue Jev en vue d’une mise en production devrait intégrer à son calcul la possibilité qu’un fine-tuning d’une base ouverte lui fasse faire la majeure partie du chemin pour une fraction de l’engagement.

Ce qui est aussi l'argument pour ne pas miser encore une trajectoire de production sur l'un ou l'autre. Si vous évaluez Jev, la posture raisonnable est de l'essayer sans vous y engager — et OrcaRouter ne sert pas Jev, car le modèle de TypeSafe est en accès anticipé et parle son propre format de requête. Ce que nous couvrons, c'est la moitié générative du flux de travail dans lequel s'inscrivent ces modèles de décision : plus de 200 modèles derrière une seule clé compatible OpenAI, au prix catalogue du fournisseur répercuté avec 0 % de marge, avec basculement automatique. Une architecture à deux modèles, où une couche de décision peu coûteuse trie le trafic et où un modèle génératif traite le reste, est testable de notre côté sans un second contrat fournisseur, et si le composant de décision s'avère mal calibré sur vos données, c'est le chemin de basculement qui empêche que cela ne devienne un incident.

Le verdict

Si votre tâche de décision est étroite, à domaine fixe, à volume élevé et sensible à la confidentialité, Kev est aujourd'hui le choix le plus défendable, et de loin — vous possédez les poids, vous contrôlez le chemin des données, vous pouvez affiner le modèle sur vos propres étiquettes, et pour le routage des tickets d'assistance, le checkpoint 9B bat déjà Jev selon ses propres chiffres publiés. Si votre tâche de décision nécessite des connaissances générales, de l'arithmétique à plusieurs étapes, ou une valeur de confiance que vous comptez utiliser pour automatiser, le modèle non divulgué plus grand de Jev et son entraînement RLCD font un vrai travail, et l'adaptateur de Kev ne remplace ni l'un ni l'autre.

La seule chose qu'aucune des deux comparaisons ne permet de trancher, c'est la calibration, car personne n'a publié de diagramme de fiabilité pour l'un ou l'autre des modèles. Testez-la sur vos propres cas étiquetés avant d'automatiser avec l'un ou l'autre — la valeur de confiance est la partie de ces deux produits qui doit se gagner à chaque déploiement, tandis que la vitesse est déjà une commodité.

A generated two-column scoreboard comparing Jev and Kev across the same six labelled dimensions, with a footer reading "Kev figures per its own README and harness; not a controlled comparison."