
Clef vs LFM2.5 2.6B Base : 55 Go sur un H200, ou 5,4 Go sur un ordinateur portable
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 219 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Voici une comparaison où le matériel tranche le débat avant même que les modèles ne le fassent. Cloudflare/clef est un modèle de décision multimodal de 27 milliards de paramètres, post-entraîné à partir de Qwen3.8-27B, dont le dépôt pèse un peu plus de 55 Go, répartis sur douze shards de backbone plus une petite tête de schéma conjointe. LiquidAI/LFM2.5-2.6B-Base est un checkpoint texte uniquement de 2,69 milliards de paramètres dont les poids tiennent dans un seul fichier de 5,4 Go, publié par Liquid AI le 1er août 2026 sous la LFM Open License. La latence publiée par Cloudflare pour Clef — 209,3 ms en médiane, 238,6 ms en p95 — a été mesurée sur un seul H200. Le déploiement envisagé par Liquid AI pour sa famille LFM2.5 est un ordinateur portable, un téléphone ou une console portable Ryzen. Les deux fournisseurs décrivent leur modèle comme petit, rapide et efficace, et tous deux disent la vérité à propos d'une machine différente.
Il existe un second écart derrière le premier, et c'est celui qui change réellement les plans. Ni Clef ni LFM2.5 2.6B Base ne répond à une question d'emblée de la manière que vous attendez probablement. Clef arrive entièrement entraîné pour une tâche dont il ne peut pas dévier : il répond à des questions saisies, et il ne fera rien d'autre. Le checkpoint Liquid arrive sans entraînement pour quoi que ce soit — c'est un modèle de base, délibérément sans ajustement par instructions, et la propre fiche de Liquid AI indique qu'il n'est recommandé que pour un fine-tuning intensif. Donc la vraie question n'est pas de savoir lequel est le moins cher à exécuter. Il s'agit de savoir si vous achetez un composant fini ou une matière première, et la réponse est différente pour chacun d'eux.
Où chacun s'exécute, et pourquoi c'est là toute la comparaison.
La forme du déploiement n'est pas un détail secondaire pour ces deux modèles. Pour un modèle de décision, c'est l'architecture, car une passe avant de 209 ms et une histoire de « tourne sur la machine devant vous » sont la même affirmation racontée par les deux bouts.
• Paramètres — 27 B pour Clef, avec l'encodeur visuel Qwen3.8-27B conservé ; 2,69 B en texte seul pour LFM2.5 2.6B Base.
• Disque — un dépôt de 55 Go pour Clef ; un fichier safetensors de 5,4 Go pour le checkpoint Liquid, avec des builds GGUF, ONNX et MLX quantisés publiés à côté.
• Matériel — Cloudflare a testé Clef avec torch 2.11 et transformers 5.10.2 sur un seul H200, et ses chiffres de latence proviennent de cette exécution. Le modèle frère post-entraîné de ce point de contrôle, développé par Liquid AI, tourne à 220 jetons par seconde sur un Apple M5 Max et à 113 jetons/s sur un processeur AMD Ryzen, dans moins de 2,5 Go de mémoire, et le fournisseur indique que 30 jetons/s sont réalisables sur un téléphone.
• Contexte — 65 536 tokens pour Clef, d'après la page du modèle Workers AI et l'article de lancement ; 131 072 tokens pour LFM2.5 2.6B Base.
• Input — Clef lit le texte, le JSON, les images et les trames vidéo, puis les évalue conjointement. Le checkpoint Liquid est réservé au texte.
• Licence — Apache-2.0 pour Clef. LFM Open License v1.0 pour LFM2.5, qui est sous code source disponible plutôt que sous licence open source OSI : l'utilisation commerciale est conditionnée au fait que votre organisation reste sous les 10 millions de dollars de chiffre d'affaires annuel, et au-delà de ce seuil, la licence ne l'accorde tout simplement pas. Ce seuil est un fait d'approvisionnement, et non une note de bas de page.

Le coût par décision n'est pas la même question que le coût par token
La tentation, ici, est de diviser deux prix et de désigner un gagnant. Cela ne résiste pas au contact de ce que font les deux modèles.
Clef coûte 0,24 $ par million de jetons d'entrée sur Workers AI de Cloudflare. Sa sortie n'est pas de la prose, donc la ligne habituelle de jetons de sortie n'existe pas ; vous payez pour l'état, une fois, et recevez en retour une distribution. Pour une couche de routage qui prend des millions de petites décisions par jour, c'est là tout le coût d'exploitation, et c'est un chiffre que vous ne pouvez obtenir qu'auprès d'un fournisseur, plutôt qu'à partir de votre propre facture d'électricité.
LFM2.5 2.6B Base ne coûte rien par appel et ne peut pas prendre de décision. Pour en tirer un coût par décision, vous devez d’abord le fine-tuner sur votre tâche, ce qui implique de rassembler des données, de lancer un entraînement, d’évaluer le résultat, et seulement ensuite de découvrir ce qu’il vous coûte en kVA et en temps d’ingénierie. L’économie séduisante d’un checkpoint de 2,6 B est bien réelle, mais elle se situe en aval d’un travail qui n’a pas encore eu lieu, et la personne qui compare les prix par token est passée directement à côté.
La présentation honnête, c'est qu'il s'agit de deux achats différents. Clef est un composant avec un prix catalogue et une facture d'hébergement. Le checkpoint Liquid est une matière première dont le coût est la session d'entraînement que vous allez payer de toute façon — et dont le bénéfice est qu'ensuite vous possédez l'artefact en pleine propriété, auquel cas le coût marginal d'une décision est réellement l'électricité. Pour une tâche étroite, à fort volume et stable, cet arbitrage est souvent correct. Pour une tâche que vous n'avez pas encore spécifiée, il est à l'envers, car vous ne pouvez pas faire de fine-tuning vers une cible que vous ne pouvez pas décrire.
Une base non entraînée n'est pas un moins bon modèle, c'est une ligne de départ différente
Il est tentant de lire l’absence de tableau de benchmarks du checkpoint Liquid comme une faiblesse cachée. Ce n’est pas le cas. Évaluer un modèle de base pré-entraîné sur des benchmarks de suivi d’instructions mesurerait l’absence de fine-tuning, non la qualité du substrat, et c’est précisément pourquoi Liquid AI évalue le LFM2.5-2.6B post-entraîné et laisse le modèle de base non évalué. La case vide est vérifiable de votre côté, et c’est là tout l’intérêt : téléchargez 5,4 Go, lancez votre propre évaluation sur votre propre tâche, et connaissez la réponse avant de vous engager à servir quoi que ce soit.
Le tableau de Clef présente une forme de preuve opposée et pose le problème inverse. Cloudflare publie une quarantaine de lignes de benchmarks, un ensemble complet d'évaluation de workflow et une distribution de latence, et chacune d'elles a été produite par Cloudflare sur le propre Decision Index de Cloudflare, sans qu'aucun tiers n'en ait reproduit quoi que ce soit. La colonne Clef est bien plus informative que la colonne Liquid, et pas un seul chiffre qu'elle contient n'a été vérifié par qui que ce soit d'autre. C'est une affirmation plus forte qu'un vide, et plus faible qu'elle n'en a l'air.
Ce que vous pouvez mesurer vous-même se divise de la même façon. Avec le checkpoint Liquid, vous pouvez tout mesurer — il pèse 5,4 Go sur votre propre disque. Avec Clef, les poids Apache-2.0 sont tout autant les vôtres, à télécharger et à exécuter, mais égaler la médiane de 209 ms de Cloudflare exige la classe de GPU qu’utilise Cloudflare ; en pratique, la plupart des équipes le mesureront donc via le point de terminaison hébergé et hériteront de la disponibilité du fournisseur en même temps que de sa latence.
Où s'intègre la couche de routage, pour chacun d'eux
Ni Clef ni aucune variante de LFM2.5 n'est une route sur OrcaRouter, et cet article ne constitue en aucun cas une affirmation de disponibilité — le catalogue renvoie une erreur 404 pour les deux, donc Clef provient de Workers AI de Cloudflare ou de votre propre GPU, et le checkpoint Liquid provient de sa propre distribution.
Ce à quoi sert véritablement une couche de routage ici, c'est le schéma que les deux modèles impliquent. Un petit évaluateur borné qui décide, et un généraliste plus vaste qui agit sur la décision, forment par construction une architecture à deux modèles — et l'épine dorsale de Clef rend concrète la seconde moitié de cette équation, puisque le modèle à partir duquel Cloudflare a réalisé un post-entraînement, Qwen3.8 27B, est une route répertoriée à $0.33 par million de jetons d'entrée et $2.40 par million de jetons de sortie, sur un contexte de 262 144 jetons. Un seul point de terminaison devant plus de 200 modèles signifie que le décideur bon marché et l'acteur compétent se trouvent derrière la même clé, composés en un seul appel via le DSL de routage plutôt que câblés ensemble à la main, avec un basculement automatique pour qu'un mauvais après-midi chez un fournisseur n'entraîne pas le chemin de décision dans sa chute. Si, en revanche, vous hébergez vous-même le checkpoint Liquid et comparez votre fine-tuning aux modèles qu'il doit battre, c'est ce même point de terminaison qui fait de cette comparaison un simple changement de configuration plutôt qu'un cycle d'approvisionnement.
Le Jev 1.13 de TypeSafe mérite d'être cité, spécifiquement pour le cas de l'auto-hébergement : c'est le modèle de décision sur lequel Cloudflare a fait ses benchmarks, et il adopte délibérément la même POST /v1/systemoneforme de requête que Clef, c'est une route répertoriée à 0,042 $ par million de jetons d'entrée sur un contexte de 65 536 jetons, et c'est le moyen le moins coûteux en effort de déterminer si un modèle de décision borné aide votre pipeline avant de consacrer une session d'entraînement à un substrat qui n'a peut-être pas besoin d'exister.

Lequel, pour quoi
Prenez le checkpoint Liquid lorsque la tâche est étroite, à fort volume, suffisamment bien spécifiée pour que l’on puisse écrire des données d’entraînement pour elle, et limitée par l’une des deux contraintes strictes qu’une API routée ne peut pas résoudre : les données ne peuvent pas quitter votre infrastructure, ou la machine sur laquelle il doit tourner est celle qui se trouve sur votre bureau. Le seuil de chiffre d’affaires de LFM 1.0 est la première chose à vérifier, car il détermine si la licence est même disponible pour vous.
Choisissez Clef lorsque la décision est déjà énumérable, que l’état tient dans 64K, que la réponse nécessite une probabilité calibrée plutôt qu’une phrase, et que 209 ms dans un chemin critique est la propriété que vous achetez. Son schéma fixe est l’atout — une forme de sortie auditable, reproductible et sans parseur — et son empreinte de 55 GB est le prix du backbone qui le rend précis du premier coup plutôt qu’après un entraînement.
Ce qu'il ne faut pas faire, c'est choisir en fonction du nombre de paramètres. Un modèle de 2,69 B qui doit être entraîné avant de pouvoir répondre n'est pas une version réduite d'un modèle de 27 B qui en est déjà capable, et les deux nombres du titre — 55 Go et 5,4 Go — décrivent deux budgets différents, pas deux points sur une même échelle.

La question ouverte, et c’est la même pour les deux
Aucun des deux fournisseurs n'a publié de preuves qui résistent à un examen indépendant. Le test Decision Index de Cloudflare est auto-administré et non reproduit ; les chiffres de débit de Liquid AI sont les mesures du fournisseur lui-même, sur du matériel qu'il a choisi. Le LFM2.5 2.6B Base n'a aucun benchmark, par conception, et la table Clef en compte un très grand nombre, par choix.
Pour le point de contrôle Liquid, les preuves manquantes sont peu coûteuses à corriger et entièrement entre vos mains — le fichier est assez petit pour être évalué sur un ordinateur portable en un après-midi. Pour Clef, ce n’est pas le cas : reproduire la médiane de 209 ms exige le matériel qu’a utilisé Cloudflare et l’état que personne en dehors de Cloudflare n’a assemblé. Cette asymétrie, plus que tout ce qui figure dans l’une ou l’autre spécification, est ce qui devrait déterminer lequel de ces deux vous prévoyez ce mois-ci.
