Une carte de titre générée affichant « Clef », sous-titrée « les modèles de décision de Cloudflare qui n'écrivent jamais un token », avec deux pastilles indiquant « weights 30 sept. 2026 » et « blog 1er oct. 2026 ». Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Engineering & Research

Clef copie délibérément l'API de Jev — et c'est là que ça devient intéressant

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Clef est un modèle multimodal à 27 milliards de paramètres de Cloudflare qui répond à des questions typées et rien d'autre. Vous lui fournissez un état — texte, JSON, une image, une trame vidéo — plus un schéma allant jusqu'à 64 questions nommées, et il renvoie une probabilité pour chaque option autorisée en une seule passe avant. Pas de texte généré, pas de parseur, pas de boucle de décodage. Ce qui rend Cloudflare/clef intéressant à lire, ce n'est pas cette conception, qu'il a empruntée, mais le format de communication qu'il a choisi : Cloudflare a conçu Clef pour parler le corps de requête et de réponse de Jev System One, le modèle de décision que TypeSafe a livré en premier, servi au même chemin POST /v1/systemone. L'interopérabilité ici est tout l'argument commercial. Si votre pipeline pose déjà des questions à un modèle de décision sous cette forme, Clef est un changement d'URL et une chaîne de modèle, pas une migration.

Il est inhabituel qu’un article de lancement enterre cela, et Cloudflare ne l’enterre pas — la fiche de modèle affirme sans détour que l’API est « entièrement compatible avec Jev et SystemOne », et le blog commence par attribuer à TypeSafe le mérite d’avoir fait connaître la catégorie avant de positionner Clef comme la version de deuxième génération d’une expérience interne. Ainsi, la lecture honnête de cette publication comporte trois parties : ce que la décision de compatibilité vous apporte, ce que les propres chiffres de Cloudflare disent sur les cas où Clef gagne et perd, et ce qui reste non vérifié parce que chaque chiffre de ce tableau a été produit par le fournisseur qui livre le modèle.

La catégorie venait d’ailleurs

Le billet de Cloudflare est franc sur la filiation. L'idée d'un modèle qui renvoie des sorties structurées bornées plutôt que de la prose est attribuée au Jev System One de TypeSafe. La propre entrée en matière de Cloudflare a été une démo antérieure qui détournait un modèle de diffusion pour qu'il émette des probabilités déterministes en exposant les logprobs, ainsi que le travail communautaire de Matt Mastracci pour faire gérer ce schéma par le moteur d'inférence. Clef s'appuie sur ce concept avec une architecture différente, une tête de scoring conçue sur mesure et — la partie qui compte commercialement — un corps de requête identique à celui de l'acteur en place.

Quand un fournisseur copie à la fois le format de transmission d’un rival et se compare à l’index de ce rival, la compatibilité n’est pas une note de bas de page du modèle : c’est la stratégie produit. Remplacer un modèle de décision derrière un point de terminaison existant est le moyen le moins coûteux possible pour qu’un nouvel entrant soit testé, et l’expérience la moins coûteuse possible pour une équipe qui a déjà l’un de ces points de terminaison branché.

Ce qui a réellement été livré, et ce que cela coûte

• Paramètres — 27B, construit en gelant Qwen3.8-27B avec son encodeur visuel et en entraînant par-dessus une tête de schéma conjointe ainsi que des adaptateurs de rang faible de rang 256.

• Modèle frère — Clef-Flash, la même recette en 9B à partir de Qwen3.5-9B. Article séparé, compromis séparés.

• Contexte — 65 536 tokens, selon la page du modèle Workers AI et l'article de blog. L'utilitaire d'encodage fourni utilise par défaut la valeur max_length=16,384, une valeur par défaut plutôt qu'un plafond, mais la valeur par défaut que vous obtenez si vous utilisez le chargeur tel qu'il est fourni.

• Types de questions — noul (vrai/faux, renvoyant la probabilité de vrai), choix (de 2 à 26 options nommées), score (de 2 à 26 niveaux ordonnés). De 1 à 64 questions par requête.

• Prix — 0,24 $ par million de jetons d'entrée sur Workers AI de Cloudflare, ou auto-hébergé à partir de poids Apache-2.0 qui totalisent environ 55 Go répartis sur douze shards.

• Licence — Apache 2.0, suivant le checkpoint de base Qwen3.8-27B.

A single-column scoreboard titled 'Clef — the scoreboard', with six rows: Parameters: 27B, vision encoder kept; Trained from: Qwen3.8-27B, head plus rank-256 adapters; Context: 65,536 tokens; Output: a probability per option, no generated text; Latency: 209.3 ms median, 238.6 ms p95; Licence: Apache 2.0. A footer reads 'Cloudflare figures, self-run on the Jev Decision Index, unreproduced.' The OrcaRouter logo is composited in the bottom-right corner.

Là où il gagne, et là où il ne gagne pas

L'exécution du Decision Index de Cloudflare est la source de tout ce qui figure dans cette section, et le classement qui l'héberge appartient à Cloudflare. Rien de ce qui suit n'a été reproduit de manière indépendante. Lisez-le comme le meilleur argumentaire d'un fournisseur, et remarquez à quel point il est inégal.

Les victoires se concentrent là où un classifieur entraîné en interne devrait l'emporter. Clef obtient un macro-F1 d'intention de 94,2 sur BANKING77, contre 79,7 pour Jev, et de 97,4 contre 89,3 sur CLINC150 avec gestion du hors-périmètre — un écart de trente points qui constitue la cellule la plus déterminante du tableau, car refuser de classifier représente la moitié difficile du routage. Clef obtient également 86,7 sur CRUXEval, 94,0 sur CLadder et 83,0 sur le simulateur d'appareils ménagers.

Les pertes sont tout aussi réelles et appartiennent au même paragraphe. Sur les connaissances générales et le raisonnement difficile, l’ancien Jev l’emporte nettement : GPQA Diamond 78,3 contre 48,0, MMLU-Pro 82,7 contre 65,9, BBH 92,9 contre 73,7. Ce sont les trois plus grands écarts du tableau, et ils vont tous dans le même sens. Clef n’est pas non plus le meilleur modèle dans sa propre comparaison sur l’ensemble PhishNChips du domaine de la sécurité, où il obtient 79,6 et où une entrée concurrente obtient un score supérieur.

Sur les quatre évaluations de flux de travail de bout en bout, issues de l’ensemble d’évaluation public de TypeSafe lui-même et notées par rapport à des étiquettes consensuelles, les deux sont suffisamment proches pour que cela se joue à pile ou face. Clef remporte le traitement des factures sur les actions exactes, par 64,7 contre 61,8, et l’ensemble sur les incidents de sécurité, par 62,9 contre 61,7 ; Jev l’emporte sur l’observabilité des traces d’agents, par 71,6 contre 68,5 ; le service client est un match nul de 76,3 à 76,0 qui ne signifie rien à cette marge.

La latence est là où l’écart est structurel plutôt que marginal. Cloudflare rapporte 209,3 ms en médiane et 238,6 ms en p95 pour Clef, contre 524,1 et 536,0 pour Jev. Cet ordre découle de la conception non autorégressive plutôt que des particularités d’un benchmark, c’est pourquoi c’est le chiffre qui a le plus de chances de survivre au contact d’un déploiement réel. Les millisecondes absolues ont été mesurées sur le propre matériel de Cloudflare et ne veulent pas dire grand-chose en elles-mêmes.

La donnée la plus convaincante de l’annonce n’est pas une ligne de benchmark. Cloudflare affirme que son équipe de threat intelligence a confié un domaine à Clef aux côtés de son service de rendu de navigateur et a obtenu un verdict de catégorie en 2,2 secondes, contre 4,7 secondes pour son propre LLM généraliste le plus rapide sur le même workflow, avec davantage de classifications renvoyées. Anecdote interne, pas une étude — mais c’est le genre d’histoire qui explique pourquoi quelqu’un construirait cela plutôt que de prompter un modèle généraliste.

A headless capture of Cloudflare's blog post announcing Clef, showing the Cloudflare site header, the breadcrumb 'Blog', the banner date 'October 1, 2026', the headline 'Introducing Clef: our open-source decision models, and new RL fine-tuning platform', and the three named authors.

Deux choses que la référence API vous dit, et une qu’elle ne vous dit pas.

Les pièges documentés sont petits et méritent d'être lus avant de porter quoi que ce soit. Le champ confidence mesure à quel point les probabilités sont concentrées, et non la probabilité que la réponse soit correcte — un modèle bien calibré peut renvoyer une réponse correcte à faible confiance et une réponse erronée à confiance élevée. Et lorsque deux options sont à égalité, la réponse suit l'ordre des options du modèle, alors mettez votre option préférée en premier. Quiconque porte un classifieur basé sur des prompts sans lire ces deux phrases interprétera mal ses propres journaux.

La contrainte plus large n'est documentée nulle part parce qu'elle est structurelle. Clef ne dispose d'aucun chemin de génération de texte, ce qui signifie qu'il ne peut ni rédiger une réponse, ni résumer un fil de discussion, ni appeler un outil, ni tenir une conversation, et qu'il n'inventera pas une catégorie que vous n'avez pas déclarée. Toute la conception part du principe que vous pouvez énumérer à l'avance les réponses autorisées. Cela exclut discrètement une vaste classe de problèmes, et aucune performance de benchmark, aussi bonne soit-elle, n'y change quoi que ce soit.

Ce que vaut l'argument de la compatibilité

C’est ici que la release cesse d’être une revue de modèle pour devenir une question d’architecture. Si Clef parle la forme de requête de Jev, alors le modèle derrière votre point de terminaison de décision est une valeur de configuration, et la façon judicieuse de l’adopter est de le faire côte à côte plutôt qu’en remplacement — exécutez les deux sur votre propre trafic, gardez celui qui donne les meilleures mesures sur vos données, et faites en sorte que le basculement reste peu coûteux.

Clef lui-même ne figure pas sur notre liste de routes ; le catalogue OrcaRouter renvoie un 404 pour lui, et rien ici ne doit être lu comme une affirmation de disponibilité de notre part. Ce que nous proposons, c'est l'acteur en place que Clef a été conçu pour détrôner. Le Jev 1.13 de TypeSafe est une route répertoriée à 0,042 $ par million de jetons d'entrée sur un contexte de 65 536 jetons, servi via le même POST /v1/systemone corps, si bien qu'un test A/B entre les deux tient à une chaîne de modèle plutôt qu'à une réécriture. Avoir les deux derrière une seule clé — plus de 200 modèles, prix catalogue du fournisseur répercuté sans marge par jeton, basculement automatique entre fournisseurs — voilà ce qui permet à ce test de continuer à tourner après la semaine où quelqu'un décide de s'y intéresser, au lieu de se dégrader en un commentaire obsolète dans un fichier de configuration. Le modèle généraliste que vous gardez sous la main pour agir sur ce que conclut le modèle de décision est accessible depuis cette même clé, plutôt que via un second contrat.

A headless capture of the OrcaRouter model page for typesafe/jev-1.13, showing the TypeSafe breadcrumb, the model title, the description naming the noul, choice and score question types served over POST /v1/systemone, a code sample set to model 'typesafe/jev-1.13', and the performance strip reading p50 TTFT 148 ms.

Qu'est-ce qui changerait cette lecture ?

Quelqu'un en dehors de Cloudflare doit relancer le Decision Index. La suite est publique et les évaluations sont décrites comme reproductibles, donc une exécution par un tiers fait la différence entre le tableau d'un fournisseur et un fait — et les cellules qui comptent le plus sont celles qui pointent dans des directions opposées. Un 97,4 en détection d'intention hors périmètre à côté d'un 48,0 sur GPQA Diamond n'est pas une courbe de capacités lisse ; cela décrit un modèle qui est très bon pour les formes de classification dans sa distribution d'entraînement et beaucoup plus faible pour le raisonnement qu'il n'a pas vu. Si cela se vérifie lors de tests indépendants, c'est le fait le plus important sur le plan opérationnel concernant Clef et il n'est pas dans les points saillants.

Le trafic de production doit lui aussi ressembler au tableau des latences. Une médiane de 209 ms mesurée sur un seul H200 ne dit rien du p95 en situation de concurrence, et tout l'argument de vente de cette conception est qu'elle se situe dans un chemin critique.

Et la plateforme de fine-tuning doit produire quelque chose. L'article de Cloudflare décrit une boucle RL — AI Gateway pour capturer un jeu de données à partir de votre propre trafic, Workers AI pour générer des rollouts, Containers comme bac à sable de notation, Trainer pour mettre à jour les poids, puis redéployer sur Workers AI — dans le même article qui annonce les modèles, sans résultat client associé. Un Clef fine-tuné qui surpasse le modèle de base sur une tâche pour laquelle ce dernier n'a jamais été entraîné serait une preuve bien plus solide pour la catégorie que n'importe quelle ligne du tableau.

D'ici là, le résumé équitable est le suivant : Cloudflare a livré un véritable modèle de décision, réellement rapide et sous licence permissive, et l'a rendu trivialement interchangeable avec celui qui est venu en premier. C'est une meilleure histoire que celle qu'offrent la plupart des publications open source, et elle reste encore, jusqu'ici, entièrement le propre récit que le fournisseur fait de lui-même.