Een gegenereerde titelkaart met de tekst 'Clef', met als ondertitel 'Cloudflare's beslissingsmodellen die nooit een token schrijven', met twee chips met de tekst 'weights 30 september 2026' en 'blog 1 oktober 2026'. Het OrcaRouter-logo is in de rechteronderhoek samengevoegd.
Engineering & Research

Clef kopieert Jevs API met opzet — en dat is het interessante deel

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Clef is een multimodaal model met 27 miljard parameters van Cloudflare dat getypte vragen beantwoordt en niets anders. Je geeft het een toestand — tekst, JSON, een afbeelding, een videoframe — plus een schema van maximaal 64 benoemde vragen, en het retourneert een waarschijnlijkheid voor elke toegestane optie in één forward pass. Geen gegenereerde tekst, geen parser, geen decoding-loop. Wat Cloudflare/clef de moeite waard maakt om over te lezen is niet dat ontwerp, dat het heeft geleend, maar het wire-formaat dat het heeft gekozen: Cloudflare heeft Clef gebouwd om de request- en response-body te spreken van Jev System One, het beslissingsmodel dat TypeSafe als eerste uitbracht, geserveerd op hetzelfde POST /v1/systemone pad. Interoperabiliteit is hier het hele commerciële argument. Als je pipeline al een beslissingsmodel vragen stelt in die vorm, is Clef een URL-wijziging en een modelstring, geen migratie.

Het is ongewoon dat een releasebericht zoiets begraaft, en Cloudflare begraaft het niet — de modelkaart stelt ronduit dat de API "volledig compatibel is met Jev en SystemOne", en de blog opent met de eer voor het op de kaart zetten van de categorie aan TypeSafe toe te schrijven, voordat Clef wordt gepositioneerd als de tweede generatie van een intern experiment. De eerlijke lezing van deze release bestaat dus uit drie delen: wat de compatibiliteitsbeslissing je oplevert, wat de eigen cijfers van Cloudflare zeggen over waar Clef wint en verliest, en wat onbevestigd blijft omdat elk cijfer in die tabel afkomstig is van de leverancier die het model levert.

De categorie kwam ergens anders vandaan.

Cloudflares bericht is openhartig over de herkomst. Het idee van een model dat gebonden gestructureerde outputs retourneert in plaats van proza, wordt toegeschreven aan TypeSafe's Jev System One. Cloudflares eigen weg hiernaartoe was een eerdere demo die een diffusiemodel omboog tot het afgeven van deterministische waarschijnlijkheden door logprobs bloot te leggen, plus communitywerk van Matt Mastracci om de inference-engine met dat patroon te laten omgaan. Clef bouwt voort op dat concept met een andere backbone, een speciaal daarvoor gebouwde scoring-head, en — het deel dat commercieel telt — een request body die overeenkomt met die van de gevestigde speler.

Wanneer een leverancier zowel het wire-formaat van een concurrent kopieert als zichzelf benchmarkt tegen de index van die concurrent, is de compatibiliteit geen voetnoot bij het model, maar de productstrategie. Een beslissingsmodel achter een bestaand endpoint verwisselen is de goedkoopste manier voor een nieuwkomer om te worden uitgeprobeerd, en het goedkoopste experiment voor een team dat er al een van deze heeft aangesloten.

Wat er daadwerkelijk is geleverd, en wat het kost

• Parameters — 27B, gebouwd door Qwen3.8-27B samen met zijn vision-encoder te bevriezen en daarbovenop een gezamenlijke schema-head plus low-rank adapters van rang 256 te trainen.

• Zustermodel — Clef-Flash, hetzelfde recept op 9B van Qwen3.5-9B. Apart artikel, aparte afwegingen.

• Context — 65.536 tokens, volgens de modelpagina van Workers AI en de blogpost. De meegeleverde encoding-helper gebruikt standaard max_length=16,384, een standaardwaarde en geen bovengrens, maar wel de standaardwaarde die je krijgt als je de loader gebruikt zoals hij wordt geleverd.

• Vraagtypen — noul (waar/onwaar, retourneert de kans op waar), keuze (2 tot 26 benoemde opties), score (2 tot 26 geordende niveaus). Eén tot 64 vragen per aanvraag.

• Prijs — $0,24 per miljoen invoertokens op Cloudflare's Workers AI, of zelf gehost vanaf Apache-2.0-gewichten van ongeveer 55 GB, verdeeld over twaalf shards.

• Licentie — Apache 2.0, volgend op het Qwen3.8-27B-basischeckpoint.

A single-column scoreboard titled 'Clef — the scoreboard', with six rows: Parameters: 27B, vision encoder kept; Trained from: Qwen3.8-27B, head plus rank-256 adapters; Context: 65,536 tokens; Output: a probability per option, no generated text; Latency: 209.3 ms median, 238.6 ms p95; Licence: Apache 2.0. A footer reads 'Cloudflare figures, self-run on the Jev Decision Index, unreproduced.' The OrcaRouter logo is composited in the bottom-right corner.

Waar het wint, en waar het niet wint.

De Decision Index-run van Cloudflare is de bron voor alles in deze sectie, en het leaderboard dat deze host is van Cloudflare. Niets hieronder is onafhankelijk gereproduceerd. Lees het als het gunstigste scenario van een leverancier, en let op hoe onevenwichtig het is.

De winstcluster waar een in-house getrainde classifier zou moeten winnen. Clef behaalt een macro-F1 van 94,2 op BANKING77-intent tegen 79,7 voor Jev, en 97,4 op CLINC150 met out-of-scope-afhandeling tegen 89,3 — een verschil van dertig punten dat de meest beslissingsrelevante cel in de tabel is, omdat weigeren te classificeren de moeilijke helft van routering is. Het behaalt ook 86,7 op CRUXEval, 94,0 op CLadder en 83,0 op de huishoudapparaten-simulator.

De verliezen zijn net zo reëel en horen in dezelfde alinea. Op algemene kennis en moeilijk redeneren wint de oudere Jev zonder meer: GPQA Diamond 78,3 tegen 48,0, MMLU-Pro 82,7 tegen 65,9, BBH 92,9 tegen 73,7. Dat zijn de drie grootste verschillen in de tabel en ze wijzen allemaal dezelfde kant op. Clef is ook niet het beste model in zijn eigen vergelijking op de PhishNChips-set in het beveiligingsdomein, waar het op 79,6 uitkomt en een concurrerende inzending hoger scoort.

Op de vier end-to-end workflow-evaluaties, afkomstig uit de eigen openbare evaluatieset van TypeSafe en gescoord tegen consensuslabels, liggen de twee zo dicht bij elkaar dat het een muntworp is. Clef wint factuurverwerking op exacte acties met 64,7 tegen 61,8 en de set beveiligingsincidenten met 62,9 tegen 61,7; Jev wint agent-trace-observability met 71,6 tegen 68,5; klantenservice is een 76,3-tegen-76,0-gelijkspel dat bij die marge niets betekent.

Latentie is waar de kloof structureel is in plaats van marginaal. Cloudflare rapporteert een mediaan van 209,3 ms en een p95 van 238,6 ms voor Clef, tegenover 524,1 en 536,0 voor Jev. Die ordening komt voort uit het non-autoregressieve ontwerp, niet uit de eigenaardigheden van een benchmark, en daarom is dit het getal dat het meest waarschijnlijk standhoudt in contact met een echte deployment. De absolute milliseconden zijn gemeten op de eigen hardware van Cloudflare en zeggen op zichzelf weinig.

Het meest overtuigende datapunt in de release is geen benchmarkrij. Cloudflare zegt dat zijn threat-intelligenceteam een domein aan Clef gaf naast zijn browser-renderingdienst en binnen 2,2 seconden een categorieoordeel kreeg, tegenover 4,7 seconden voor zijn eigen snelste algemene LLM in dezelfde workflow, met meer classificaties terug. Een interne anekdote, geen onderzoek — maar het is het soort verhaal dat verklaart waarom iemand dit zou bouwen in plaats van een algemeen model te prompten.

A headless capture of Cloudflare's blog post announcing Clef, showing the Cloudflare site header, the breadcrumb 'Blog', the banner date 'October 1, 2026', the headline 'Introducing Clef: our open-source decision models, and new RL fine-tuning platform', and the three named authors.

Twee dingen die de API-referentie je vertelt, en één die ze niet vertelt.

De gedocumenteerde valkuilen zijn klein en de moeite waard om te lezen voordat je iets porteert. Het confidence veld meet hoe geconcentreerd de waarschijnlijkheden zijn, niet de waarschijnlijkheid dat het antwoord correct is — een goed gekalibreerd model kan een correct antwoord met lage confidence teruggeven en een fout antwoord met hoge confidence. En wanneer twee opties gelijk zijn, volgt het antwoord de optievolgorde van het model, dus zet je voorkeursoptie eerst. Iedereen die een op prompts gebaseerde classifier porteert zonder die twee zinnen te lezen, zal hun eigen logs verkeerd interpreteren.

De grotere beperking staat nergens gedocumenteerd, omdat ze structureel is. Clef heeft helemaal geen pad voor tekstgeneratie, wat betekent dat het geen antwoord kan opstellen, geen thread kan samenvatten, geen tool kan aanroepen en geen gesprek kan voeren, en het zal geen categorie verzinnen die je niet hebt gedeclareerd. Het hele ontwerp gaat ervan uit dat je de toegestane antwoorden vooraf kunt opsommen. Dat sluit stilletjes een grote klasse van problemen uit, en geen enkele mate van benchmarkprestaties verandert dat.

Wat het compatibiliteitsargument waard is

Dit is het punt waarop de release ophoudt een modelreview te zijn en een architectuurvraagstuk wordt. Als Clef de requestvorm van Jev spreekt, dan is het model achter je beslissings-endpoint een configuratiewaarde, en de verstandige manier om het te adopteren is naast elkaar in plaats van als vervanging — laat beide draaien op je eigen verkeer, houd degene die het beter doet op jouw data, en zorg dat de omschakeling goedkoop blijft.

Clef zelf staat niet op onze routelijst; de OrcaRouter-catalogus geeft er een 404 voor terug, en niets hier mag worden opgevat als een beschikbaarheidsclaim van onze kant. Wat we wél voeren, is de incumbent die het moest verdringen. De Jev 1.13 van TypeSafe is een vermelde route tegen $0,042 per miljoen inputtokens met een context van 65.536 tokens, geserveerd via dezelfde POST /v1/systemone-body, dus een A/B-test tussen de twee is een modelstring in plaats van een herschrijving. Dat je beide achter één key hebt — meer dan 200 modellen, lijstprijs van de provider doorgegeven zonder opslag per token, automatische failover tussen providers — is wat die test draaiende houdt nadat de week voorbij is waarin iemand besluit zich er iets van aan te trekken, in plaats van te verworden tot een verouderde comment in een configbestand. Het algemene model dat je erbij houdt om te handelen naar wat het beslissingsmodel ook concludeert, is bereikbaar via diezelfde key in plaats van een tweede contract.

A headless capture of the OrcaRouter model page for typesafe/jev-1.13, showing the TypeSafe breadcrumb, the model title, the description naming the noul, choice and score question types served over POST /v1/systemone, a code sample set to model 'typesafe/jev-1.13', and the performance strip reading p50 TTFT 148 ms.

Wat zou deze aflezing veranderen?

Iemand buiten Cloudflare moet de Decision Index opnieuw uitvoeren. De suite is openbaar en de evals worden beschreven als reproduceerbaar, dus een uitvoering door een derde partij is het verschil tussen een leverancierstabel en een feit — en de cellen die er het meest toe doen, zijn de cellen die in tegengestelde richtingen wijzen. Een 97,4 op detectie van intenties buiten scope naast een 48,0 op GPQA Diamond is geen vloeiende capaciteitscurve; het beschrijft een model dat heel goed is in de classificatievormen in zijn trainingsdistributie en veel zwakker in redeneren dat het niet heeft gezien. Als dat standhoudt onder onafhankelijke tests, is het het operationeel belangrijkste feit over Clef, en het staat niet in de highlights.

Productieverkeer moet er ook uitzien als de latentietabel. Een mediaan van 209 ms gemeten op één H200 zegt niets over p95 onder concurrency, en het hele verkoopargument van het ontwerp is dat het in een hot path zit.

En het fine-tuningsplatform moet iets opleveren. Cloudflares post beschrijft een RL-loop — AI Gateway om een dataset uit je eigen verkeer vast te leggen, Workers AI om rollouts te genereren, Containers als de scoringssandbox, Trainer om gewichten bij te werken, en dan opnieuw uitrollen naar Workers AI — in dezelfde post waarin de modellen worden aangekondigd, zonder een klantresultaat erbij. Een fine-tuned Clef die het basismodel verslaat op een taak waarvoor het basismodel nooit is getraind, zou een veel sterker bewijs voor de categorie zijn dan welke rij dan ook in de tabel.

Tot dan is de eerlijke samenvatting deze: Cloudflare heeft een echt, onder een permissieve licentie uitgegeven, werkelijk snel beslissingsmodel uitgebracht en het moeiteloos verwisselbaar gemaakt met het model dat er als eerste was. Dat is een beter verhaal dan de meeste open releases bieden, en het is tot nu toe nog steeds volledig het eigen verhaal van de leverancier over zichzelf.