
Clef vs Qwen3.8-27B : un seul backbone, deux contrats de sortie
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 219 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Clef ne peut pas écrire une phrase, et il est construit à partir d'un modèle qui en est capable. Cloudflare/clef est un modèle de décision multimodal de 27 milliards de paramètres : vous lui fournissez un état et un schéma de questions typées, et il renvoie une probabilité pour chaque option autorisée sans produire le moindre jeton de prose. Le socle sous-jacent est Qwen3.8-27B, un modèle dense de vision-langage à poids ouverts, gelé sur place avec une petite tête supplémentaire greffée. Cela fait de cette page l'une des rares pages de comparaison modèle contre modèle où les deux parties ne sont pas du tout rivales — il s'agit d'un point de contrôle et de son dérivé, partageant 55 gigaoctets de poids et en désaccord sur le fait de savoir si la réponse est quelque chose que l'on lit ou quelque chose avec quoi l'on calcule.
Les poids des deux ont été rendus publics avant les mots. Cloudflare a créé le Cloudflare/clefdépôt sur Hugging Face à 21 h 15 UTC le 30 septembre 2026, sous licence Apache-2.0, et a publié l'article d'annonce — « Présentation de Clef : nos modèles de décision open source et notre nouvelle plateforme de fine-tuning par RL » — l'après-midi suivant. Pendant environ dix-huit heures, un modèle de 55 gigaoctets a été téléchargeable et exécuté sur les GPU de périphérie propres à Cloudflare avant que son fournisseur n'en dise le moindre mot. En trois jours, il disposait d'une page de la bibliothèque Ollama derrière Ollama 0.35.1 — c'est là que cet article l'a trouvé — et de versions NVFP4, FP8, EXL3, INT8, Q4 et Q8 provenant d'une douzaine de téléverseurs différents.
Ce que l’on peut savoir à partir du dépôt est d’une complétude inhabituelle, et il vaut la peine de distinguer cela de ce qui ne l’est pas. Ce que l’on peut savoir : l’architecture, le checkpoint de base, la licence, une implémentation de référence qui fonctionne, et une matrice d’évaluation complète. Ce que l’on ne peut pas savoir : si l’un de ces chiffres résiste à une nouvelle exécution par quelqu’un qui n’est pas Cloudflare. Chaque score attribué à Clef ci-dessous provient de l’exécution, par le fournisseur lui-même, d’une suite qu’il héberge. Cette asymétrie face à un modèle bénéficiant d’un mois d’utilisation indépendante constitue la véritable ossature de cette comparaison, et le reste du texte porte sur l’endroit où elle mord réellement.
Les deux dépôts, côte à côte
Commençons par le téléchargement, car c’est bien la similitude qui compte. Les safetensors de Clef totalisent 54,97 Go répartis sur douze shards. Ceux du modèle parent totalisent 55,56 Go répartis sur dix-huit. Clef conserve l’encodeur visuel de Qwen3.8-27B — le processeur, la tour de vision, tout le front-end multimodal — donc rien n’a été retiré pour le rendre plus petit. Ce que Cloudflare a ajouté, c’est une tête de schéma conjointe de 256 Mo : quatre couches, 1 024 de large, seize têtes, un feedforward de 4 096 de large, deux couches de routage qui lisent les états cachés finaux du backbone. La recette d’entraînement repose sur un backbone gelé, cette tête, et des adaptateurs de faible rang de rang 256, avec une entropie croisée à lissage des étiquettes pour les réponses de schéma valides, associée à une perte de Brier afin d’affiner la calibration.
Ensuite, la divergence, qui réside entièrement dans ce que le modèle est autorisé à émettre.
• Paramètres — Clef 27B, post-entraîné à partir de Qwen/Qwen3.8-27B. Qwen3.8-27B : 27B dense, 64 couches, 5 120 dimensions cachées, vocabulaire de 248 320 jetons, 16 × (3 × Gated DeltaNet → FFN) entrelacés avec Gated Attention.
• Sortie — Clef : un logit par option autorisée, avec softmax par question, aucun chemin de génération du tout. Qwen3.8-27B : des tokens, des appels d’outils et un bloc de raisonnement activé par défaut.
• Formes de questions — Clef accepte de 1 à 64 questions typées par requête sous trois formes : noul (probabilité de vrai), choice (2 à 255 options nommées), score (2 à 10 niveaux ordonnés, renvoyant une valeur pondérée par probabilité qui peut se situer entre eux). Qwen3.8-27B n'a pas un tel contrat ; vous obtenez de la prose et vous écrivez l'analyseur.
• Licence — Apache-2.0 pour les deux, c'est pourquoi la quantification tierce a été réalisée en un week-end.
• Coût de la moitié gelée — la tête de Clef fait 256 Mo contre 54,97 Go de backbone. La quasi-totalité du téléchargement est le parent. Si vous avez déjà Qwen3.8-27B sur le disque, vous le téléchargez une seconde fois pour obtenir un avis différent sur la manière de répondre.

Ce que coûte le re-heading, en deux chiffres
L'évaluation de Cloudflare est la suite Decision Index 0.2.1, exécutée en interne, et c'est un tableau sur les modèles de décision — six colonnes : Clef, Clef-flash, Jev, DiffusionGemma Jev, Kev 9B et Laya. Qwen3.8-27B n'y a pas de ligne, et Clef n'a pas de ligne dans l'Artificial Analysis Intelligence Index. Il n'y a donc pas de classement commun et cet article n'en inventera pas.
Il existe toutefois un benchmark que les deux parties ont passé, et l'écart est suffisamment large pour être le chiffre le plus déterminant de cette publication. Sur GPQA Diamond — des questions scientifiques de niveau troisième cycle, à choix multiples — Cloudflare mesure Clef à 48.0. Le parent se situe à 90.5 sur le banc d'évaluation d'Artificial Analysis et 89.2 sur la fiche de modèle du fournisseur lui-même. C'est une chute de quarante points en culture générale, et ce n'est pas un mystère : Clef répond en notant un ensemble fixe d'options qui lui a été fourni, et le choix multiple de culture générale est à peu près aussi loin de « router ce ticket » que les mêmes poids peuvent l'être. Considérez la comparaison comme indicative plutôt que contrôlée — deux bancs d'évaluation, deux laboratoires, ni celui du fournisseur ni celui de l'organisme de suivi. Mais la direction ne fait aucun doute, et c'est le prix du contrat.
Le même schéma se retrouve dans le reste des cellules polyvalentes de Clef. MMLU-Pro 65,9, BBH 73,7, CLINC150 avec gestion du hors-périmètre 97,4 pour le 27B contre 89,3 pour Jev — cette dernière est la rare cellule où le dérivé bat purement et simplement le modèle de décision plus ancien, et cela compte parce que refuser de classifier est la moitié difficile du routage. Là où Clef est fort, il est fort exactement là où un classifieur entraîné en interne devrait l'être : BANKING77 macro-F1 d'intention à 94,2, BFCL case-exact à 98,5, API-Bank à 91,9. Là où il est faible, un modèle de décision purement textuel d'un laboratoire concurrent — Jev de TypeSafe — le bat de trente points sur GPQA Diamond tout en facturant 0,042 $ par million de jetons d'entrée sur notre propre catalogue, ce qui rappelle utilement que « 27B » n'est pas en soi un argument.
Ce que le parent conserve, c’est tout ce que le Decision Index n’interroge pas. Sur sa propre fiche et dans les lignes issues d’AA, notre catalogue comporte : Terminal-Bench 2.1 à 73,0, SWE-bench Pro 61,7, LiveCodeBench v6 90,3, OSWorld-Verified 84,3, DeepSWE 1.1 à 42,2, AA Coding 68,1 au 35e rang sur 138 modèles échantillonnés. Aucun de ceux-ci n’a de ligne Clef, car Clef ne peut pas les tenter. Il n’a pas de chemin d’appel d’outils, pas de planification à long horizon, aucun moyen d’émettre le patch.
Ce que coûte une seule décision, et pourquoi la ligne de sortie est tout l’argument
La page du modèle Workers AI n'indique qu'un seul prix unitaire pour Clef : 0,24 $ par million de jetons d'entrée. Aucune ligne de sortie n'apparaît, et la raison se trouve dans les réponses. L'exemple documenté par Ollama lui-même — un ticket d'assistance orienté à travers trois questions — revient avec "usage": {"input_tokens": 1204, "output_tokens": 3}. Trois jetons de sortie pour trois questions. Que Cloudflare facture ou non ces trois jetons importe peu : le coût de sortie d'une décision n'est pas un tarif, c'est un décompte de questions.
Comparez cela à la grille tarifaire du parent sur notre propre catalogue, qui est de 0,33 $ par million de tokens d'entrée et 2,40 $ par million de tokens de sortie avec une fenêtre de 262 144 tokens. Même état de 1 204 tokens, même décision de routage unique :
• Clef — 1 204 jetons d'entrée à 0,24 $ par million représente environ 0,00029 $ par décision, et environ 289 $ par million de décisions. Ce chiffre ne bouge presque pas quand la réponse devient plus difficile, seulement quand l'état s'allonge.
• Qwen3.8-27B avec la réflexion désactivée — le même état coûte environ 0,00040 $ en entrée, plus environ dix jetons de sortie à 2,40 $ par million. Disons $0.00042, soit 421 $ par million. Clef est environ 1,5× moins cher, ce qui n'est pas l'histoire que quiconque raconte.
• Qwen3.8-27B avec la réflexion activée — ce qui est la valeur par défaut sur ce checkpoint. Si le modèle passe 400 tokens à déterminer dans laquelle de quatre catégories classer un e-mail de réinitialisation de mot de passe, cela coûte 0,00096 $ de plus et la décision se situe près de 0,0014 $, soit 1 357 $ par million. Ces 400 tokens constituent une hypothèse, pas une mesure, et le multiple évolue linéairement avec elle.
Ainsi, la version honnête de l’argument tarifaire est plus étroite qu’elle n’en a l’air au premier abord. Face à un généraliste fonctionnant avec la réflexion désactivée, Clef l’emporte en dollars par un facteur d’environ un et demi — un avantage réel, mais pas transformateur. Face au même modèle dans sa configuration par défaut, l’écart dépend de la verbosité, et la verbosité est précisément ce qu’un modèle de langage possède et qu’une conception de type « scorers-over-options » n’a pas du tout. C’est là l’affirmation structurelle : le coût de Clef est borné par la longueur de l’état, et celui du parent est borné par la quantité que le parent décide de dire.

Le seul nombre qui n'est pas proche
Cloudflare rapporte une latence médiane des requêtes de 209,3 ms pour Clef et un p95 de 238,6 ms, mesurés sur les 43 benchmarks de son exécution, sur ses propres GPU en périphérie. Personne en dehors de Cloudflare ne l'a reproduit, et l'infrastructure du fournisseur explique pourquoi ce chiffre est aussi bas — ce modèle est conçu pour se trouver sur le même réseau que l'appelant.
Pour le parent, nous pouvons faire mieux qu'un numéro de fournisseur, car c'est l'une de nos routes. Sur la fenêtre de sept jours se terminant le 2 octobre 2026, le playground d'OrcaRouter a mesuré Qwen3.8-27B à un p50 de 1 929 ms et 235,8 jetons de sortie par seconde, sur 136,3 millions de jetons de trafic au cours de cette fenêtre. La série quotidienne est la partie intéressante : le p95 se situe à exactement 10 000 ms sur six des sept jours, ce qui ressemble à un plafond plutôt qu'à une mesure, et le p50 oscille entre 1 751 ms et 4 296 ms selon le jour. Considérez la médiane comme environ neuf fois celle de Clef, et considérez la queue comme non informative jusqu'à ce que quelqu'un publie une vraie distribution.
Cet écart n'est pas une différence de réglage et il ne se comblera pas. Une passe en préremplissage uniquement, associée à une tête de notation parallèle, se termine en un seul passage ; un modèle autorégressif se termine quand il n'a plus rien à dire. Les chiffres absolus du fournisseur pour Clef méritent la remise habituelle, mais le classement est une propriété de l'architecture, pas du matériel de Cloudflare.
Le contexte est cité de trois manières pour l’un d’entre eux.
Les deux modèles acceptent du texte, du JSON, des images et de la vidéo. Les fenêtres ne sont pas identiques, et l'une d'elles est annoncée de façon incohérente selon l'endroit où l'on regarde.
• Clef, hébergé — 65 536 tokens, d'après la page du modèle Workers AI et le billet d'annonce. C'est le nombre qui s'impose à un appelant d'API, et la formulation de Cloudflare elle-même est comparative : deux fois l'état que contient la fenêtre de 32 K de Jev.
• Clé, sur — le config.json déclare max_position_embeddings de 262 144, car la version gelée est celle du parent et porte encore le plafond de position du parent. L'encode_record intégré utilise par défaut max_length=16,384, avec max_state_tokens disponible pour borner séparément. Aucun de ces trois nombres n'est faux ; ils répondent à des questions différentes, et un listing d'exécution qui annonce 256K lit la configuration, pas le point de terminaison.
• Qwen3.8-27B — 262 144 nativement, extensible à 1 000 000 avec la bonne configuration de service, d’après la fiche du fournisseur et la ligne de notre catalogue. Au minimum, quatre fois la fenêtre Clef hébergée.
La conséquence pratique est plus faible que ne le suggère le ratio. Clef consomme un état — un ticket, une facture, une capture d’écran —, pas une conversation, et l’un de ses arguments de vente est que vous pouvez lui confier une volumineuse charge utile aplatie et lui poser soixante-quatre questions à son sujet sans repayer la charge utile à chaque question. Le parent a besoin de la fenêtre parce qu’il doit garder l’historique, les résultats des outils et son propre raisonnement. Des exigences différentes, des plafonds différents.
Tous les deux voient les mêmes pixels
L'encodeur visuel est hérité, il ne s'agit donc pas d'un cas où un modèle serait multimodal et l'autre non. Clef accepte jusqu'à quatre images par requête, au format PNG, JPEG ou WebP encodé en base64, partagées par chaque question de la charge utile, et des images vidéo peuvent être ajoutées sous forme de tableaux de trames — l'exemple de reçu dans la fiche pose une question fermée pour savoir si un total est lisible, ce qui résume le principe en miniature. Qwen3.8-27B est un modèle vision-langage natif, avec OmniDocBench 1.5 à 91,1, RealWorldQA à 85,9 et CharXiv à 78,8 sur la fiche du fournisseur.
Ce qui diffère, c'est ce que vous obtenez en retour. Clef vous donne une décision champ par champ avec une probabilité associée, c'est-à-dire une réponse typée à propos d'un document. Le parent vous donne une description du document, que vous analysez ensuite. Pour une grande catégorie de travail documentaire — vérifier ce formulaire, localiser cette clause, ce total dépasse-t-il le seuil — la réponse typée représente tout le travail, et la description est une charge que vous payez puis que vous jetez.
Où passe réellement la limite
• Utilisez Clef — les réponses sont énumérables à l’avance et vous préférez ne pas écrire d’analyseur syntaxique. Routage, triage, contrôle d’accès, vérifications de politiques, extraction de champs de documents. Ensembles fermés, 2 à 255 options par question, jusqu’à 64 questions évaluées ensemble.
• Adoptez Clef — la décision se situe dans un chemin critique, et 209 ms contre 1 929 ms change ce que le pipeline peut faire. C’est la raison la plus forte de migrer, et c’est une raison de latence, pas de précision.
• Prenez Clef — vous voulez du déterminisme. Une option que vous n’avez pas déclarée ne peut pas revenir, car il n’y a aucune étape de génération pour la produire.
• Conservez Qwen3.8-27B — la réponse n'est pas un choix dans une liste : résumer, rédiger, raisonner sur un problème inédit, écrire du code, piloter des outils sur un long horizon. Clef n'est capable de rien de tout cela, et il ne vous le dira pas.
• Conservez Qwen3.8-27B — vous avez besoin que le modèle dise « aucune de ces options ». Un modèle de décision note les options qui lui ont été fournies. Donnez-lui un schéma de facturation/technique/commercial et une demande de confidentialité, et il renverra la moins mauvaise de ces trois plutôt qu’un refus. Le parent fait émerger la question que vous n’avez pas pensé à poser.
• Gardez Qwen3.8-27B — travail sur le contexte ou les longs documents. Quatre fois la fenêtre hébergée, avant l'extension au million de tokens.
Lisez cette liste comme un pipeline plutôt qu’un verdict, car c’est ce qu’elle est. L’architecture rend la relation littérale : Clef est la passe de préremplissage du parent avec un mécanisme de réponse différent à la fin. Une conception judicieuse place Clef en tête — décider de la route, de la priorité, de l’indicateur d’escalade — et garde Qwen3.8-27B derrière Clef pour agir sur la décision. Les deux sont des compléments qui se trouvent partager un téléchargement.
Où exécuter chacun d’eux
Clef est hébergé sur Workers AI de Cloudflare, au tarif de 0,24 $ par million de jetons d'entrée indiqué ci-dessus, et les poids Apache-2.0 vous appartiennent pour une exécution en local. La fiche dans la bibliothèque Ollama est la surface la plus récente : ollama pull clef nécessite Ollama 0.35.1 ou une version ultérieure, car le modèle s'exprime via le point de terminaison /v1/systemone qu'Ollama a ajouté pour les modèles de décision. Fiez-vous aux tags, pas au titre accrocheur — le tag par défaut et le tag clef:27b font 18 Go, soit une version quatre bits d'un modèle de 55 gigaoctets ; clef:27b-q8_0 fait 30 Go, clef:27b-nvfp4 fait 18 Go, clef:27b-mxfp8 fait 31 Go, et clef:27b-mlx-bf16 correspond aux 55 Go complets pour les puces Apple silicon. Le SDK Python de TypeSafe lui-même pourra dialoguer avec lui si vous le pointez vers un Ollama local et fournissez n'importe quelle clé API, que l'environnement d'exécution ignore. Un écueil qui vous jouera des tours en production : confidence mesure la concentration des probabilités, et non la probabilité que la réponse soit correcte, et les égalités sont tranchées selon l'ordre des options que vous avez déclaré.
Le parent est le plus simple à exposer derrière une API aujourd'hui. Qwen3.8-27B est routable sur OrcaRouter aux tarifs de 0,33 $ et 2,40 $ par million utilisés ci-dessus, avec une fenêtre de 262 144 jetons, et il fait partie des plus de 200 modèles accessibles via une seule clé compatible OpenAI. Comme le prix catalogue du fournisseur est répercuté sans marge (0 %), toute baisse de prix d'un fournisseur, d'un côté ou de l'autre de cette comparaison, est active sur nos routes le jour même où elle entre en vigueur.
Clef lui-même ne fait pas partie de nos routes — notre catalogue public ne renvoie rien à son sujet, et rien ici ne doit être interprété comme une affirmation de disponibilité de notre part. Ce que nous proposons, c'est le modèle qui rend le schéma de décision accessible sans compte Cloudflare : celui de TypeSafe, Jev 1.13, est une route répertoriée à 0,042 $ par million de jetons d'entrée avec un contexte de 65 536 jetons, mesuré à un p50 de 148 ms sur la même fenêtre de sept jours, et il utilise la même structure de requête POST /v1/systemone. Comme Clef est compatible avec l'API de Jev à dessein, un pipeline construit pour l'un ou l'autre n'est qu'à un changement de configuration de l'autre — ce qu'une couche de routage est là pour rendre gratuit. Gardez les deux accessibles, mesurez sur vos propres étiquettes, et laissez le gagnant être un point de données plutôt qu'un engagement architectural. Si un modèle de décision finit par contrôler l'accès d'un agent, le modèle qui agit sur la décision doit encore être accessible, et cette moitié est déjà derrière la même clé.

Qu'est-ce qui changerait cette lecture ?
Trois choses, par ordre croissant de l’ampleur avec laquelle elles le feraient bouger.
Une tierce partie doit relancer le Decision Index. La suite est publique et Cloudflare décrit les évaluations comme reproductibles, donc c’est réalisable — et la cellule hors périmètre de CLINC150 est celle à surveiller, car un 97,4 pour le 27B est soit un véritable avantage sur le 89,3 de Jev sur la moitié la plus difficile du routage, soit un artefact d’un harnais maison. Personne en dehors de Cloudflare ne le sait encore.
Il faut évaluer Clef et Qwen3.8-27B sur la même tâche de classification avec les mêmes étiquettes. C’est la seule comparaison qui permettrait de trancher si le changement de tête est un compromis sur la qualité ou une amélioration de la qualité pour les décisions à ensemble fermé, et aucun des deux fournisseurs n’a intérêt à la mener. D’ici là, l’écart de quarante points au GPQA reste la meilleure preuve disponible de ce qui a été retiré, et cette preuve porte sur la mauvaise tâche.
Et la latence de Clef doit présenter un p95 en situation de concurrence. La médiane de 209 ms a été mesurée par le fournisseur, sur du matériel qu’il contrôle, pour un modèle dont tout l’argument de vente est qu’il se trouve sur un chemin d’exécution chaud. Le classement face à un parent autorégressif est architectural et perdurera. Les millisecondes absolues sont le chiffre dont il faut se méfier, et c’est le chiffre sur lequel repose tout le dossier commercial.
Qwen3.8-27B est l'un des plus de 200 modèles accessibles via une seule clé compatible OpenAI — Qwen3.8-27B.
