Ett genererat titelkort med texten 'Clef', med undertexten 'Cloudflares beslutsmodeller som aldrig skriver en token', med två etiketter med texten 'vikter 30 sep. 2026' och 'blogg 1 okt. 2026'. OrcaRouter-logotypen är komponerad i det nedre högra hörnet.
Engineering & Research

Clef kopierar Jevs API med avsikt — och det är den intressanta delen

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Clef är en multimodal modell med 27 miljarder parametrar från Cloudflare som svarar på typade frågor och inget annat. Du ger den ett tillstånd – text, JSON, en bild, en videobildruta – plus ett schema med upp till 64 namngivna frågor, och den returnerar en sannolikhet för varje tillåtet alternativ i en enda framåtpassning. Ingen genererad text, ingen parser, ingen avkodningsloop. Det som gör Cloudflare/clef värt att läsa om är inte den designen, som den lånade, utan det överföringsformat den valde: Cloudflare byggde Clef för att tala samma förfrågnings- och svarskropp som Jev System One, beslutsmodellen som TypeSafe släppte först, serverad på samma POST /v1/systemone-väg. Interoperabiliteten är här hela det kommersiella argumentet. Om din pipeline redan ställer frågor till en beslutsmodell i den formen är Clef en URL-ändring och en modellsträng, inte en migrering.

Det är en ovanlig sak för ett releaseinlägg att begrava, och Cloudflare begraver det inte – modellkortet säger rakt ut att API:et är "helt kompatibelt med Jev och SystemOne", och bloggen inleds med att ge TypeSafe äran för att ha satt kategorin på kartan innan den positionerar Clef som andra generationens version av ett internt experiment. Så den ärliga tolkningen av den här releasen har tre delar: vad kompatibilitetsbeslutet ger dig, vad Cloudflares egna siffror säger om var Clef vinner och förlorar, och vad som förblir overifierat eftersom varje siffra i den tabellen producerades av leverantören som levererar modellen.

Kategorin kom från någon annanstans.

Cloudflares inlägg är uppriktigt om härstamningen. Idén om en modell som returnerar begränsade strukturerade utdata i stället för prosa tillskrivs TypeSafe's Jev System One. Cloudflares egen väg in var en tidigare demo som fick en diffusionsmodell att avge deterministiska sannolikheter genom att exponera logprobs, plus community-arbete av Matt Mastracci för att få inferensmotorn att hantera det mönstret. Clef bygger vidare på det konceptet med en annan stomme, ett specialbyggt poängsättningshuvud och — den del som har kommersiell betydelse — en förfrågningskropp som matchar den etablerade aktörens.

När en leverantör både kopierar en rivals wire-format och benchmarkar sig mot rivalens index, är kompatibiliteten inte en fotnot till modellen, utan själva produktstrategin. Att byta ut en beslutsmodell bakom en befintlig endpoint är det billigaste möjliga sättet för en ny aktör att testas, och det billigaste möjliga experimentet för ett team som redan har en av dessa inkopplad.

Vad som faktiskt levererades, och vad det kostar

• Parametrar — 27B, byggd genom att frysa Qwen3.8-27B med dess visionskodare och träna ett gemensamt schemahuvud plus lågrangsadaptrar av rang 256 ovanpå.

• Syskon — Clef-Flash, samma recept på 9B från Qwen3.5-9B. Separat artikel, separata avvägningar.

• Kontext — 65 536 tokens, enligt Workers AI-modellsidan och blogginlägget. Den medföljande encoding-hjälpen använder som standard max_length=16,384, ett standardvärde snarare än ett tak, men standardvärdet du får om du använder loadern som den levereras.

• Frågetyper — noul (sant/falskt, returnerar sannolikheten för sant), val (2 till 26 namngivna alternativ), poäng (2 till 26 ordnade nivåer). En till 64 frågor per begäran.

• Pris — 0,24 USD per miljon indatatoken på Cloudflares Workers AI, eller självhostad från Apache-2.0-vikter som mäter ungefär 55 GB fördelat på tolv shards.

• Licens — Apache 2.0, i linje med bascheckpointen Qwen3.8-27B.

A single-column scoreboard titled 'Clef — the scoreboard', with six rows: Parameters: 27B, vision encoder kept; Trained from: Qwen3.8-27B, head plus rank-256 adapters; Context: 65,536 tokens; Output: a probability per option, no generated text; Latency: 209.3 ms median, 238.6 ms p95; Licence: Apache 2.0. A footer reads 'Cloudflare figures, self-run on the Jev Decision Index, unreproduced.' The OrcaRouter logo is composited in the bottom-right corner.

Där den vinner, och där den inte gör det

Cloudflares Decision-körning är källan till allt i det här avsnittet; topplistan som är värd för den tillhör Cloudflare. Inget nedan har oberoende reproducerats. Läs det som leverantörens bästa möjliga framställning och lägg märke till hur ojämnt det är.

Vinsterna klustrar sig där en hemmatränad klassificerare borde vinna. Clef tar hem BANKING77 intent macro-F1 på 94,2 mot Jevs 79,7, och CLINC150 med out-of-scope-hantering på 97,4 mot 89,3 — en trettiopunktslucka som är den mest beslutsrelevanta cellen i tabellen, eftersom att vägra klassificera är den svåra halvan av routing. Den tar också CRUXEval på 86,7, CLadder på 94,0 och simulatorn för hushållsapparater på 83,0.

Förlusterna är precis lika verkliga och hör hemma i samma stycke. När det gäller allmänkunskap och krävande resonemang vinner den äldre Jev klart: GPQA Diamond 78,3 mot 48,0, MMLU-Pro 82,7 mot 65,9, BBH 92,9 mot 73,7. Det är de tre största gapen i tabellen, och de pekar alla åt samma håll. Clef är inte heller den bästa modellen i sin egen jämförelse på säkerhetsdomänen PhishNChips-setet, där den landar på 79,6 och en konkurrerande post får högre poäng.

På de fyra end-to-end-arbetsflödesutvärderingarna, hämtade från TypeSafes eget offentliga utvärderingsset och poängsatta mot konsensusetiketter, är de två så nära varandra att det är en slantsingling. Clef tar fakturahantering på exakta åtgärder med 64,7 mot 61,8 och säkerhetsincidentset med 62,9 mot 61,7; Jev tar agent-trace-observerbarhet med 71,6 mot 68,5; kundtjänst är oavgjort 76,3 mot 76,0, vilket inte betyder något vid den marginalen.

Latens är där gapet är strukturellt snarare än marginellt. Cloudflare rapporterar 209,3 ms i median och 238,6 ms i p95 för Clef, mot 524,1 och 536,0 för Jev. Den ordningen följer av den icke-autoregressiva designen snarare än av en benchmarks egenheter, vilket är anledningen till att det är den siffra som sannolikt överlever kontakt med en verklig driftsättning. De absoluta millisekunderna mättes på Cloudflares egen hårdvara och säger i sig själva inte särskilt mycket.

Den mest övertygande datapunkten i lanseringen är inte en benchmarkrad. Cloudflare säger att dess hotunderrättelseteam gav en domän till Clef tillsammans med sin webbläsarrenderingstjänst och fick ett kategoribeslut på 2,2 sekunder, mot 4,7 sekunder för sin egen snabbaste allmänna LLM i samma arbetsflöde, med fler returnerade klassificeringar. En intern anekdot, inte en studie – men det är den typ av berättelse som förklarar varför någon skulle bygga detta i stället för att prompta en allmän modell.

A headless capture of Cloudflare's blog post announcing Clef, showing the Cloudflare site header, the breadcrumb 'Blog', the banner date 'October 1, 2026', the headline 'Introducing Clef: our open-source decision models, and new RL fine-tuning platform', and the three named authors.

Två saker som API-referensen berättar för dig, och en som den inte gör

De dokumenterade fallgroparna är små och värda att läsa innan du porterar något. Konfidensfältet mäter hur koncentrerade sannolikheterna är, inte sannolikheten att svaret är korrekt — en välkalibrerad modell kan returnera ett korrekt svar med låg konfidens och ett felaktigt med hög konfidens. Och när två alternativ är lika följer svaret modellens alternativordning, så placera det alternativ du föredrar först. Den som porterar en promptbaserad klassificerare utan att läsa de två meningarna kommer att misstolka sina egna loggar.

Den större begränsningen dokumenteras ingenstans eftersom den är strukturell. Clef har inte någon textgenereringsväg alls, vilket innebär att den inte kan utforma ett svar, sammanfatta en tråd, anropa ett verktyg eller föra en konversation, och den kommer inte att hitta på en kategori som du inte har deklarerat. Hela designen förutsätter att du kan räkna upp de tillåtna svaren i förväg. Det utesluter tyst en stor klass av problem, och ingen mängd benchmarkprestanda ändrar på det.

Vad kompatibilitetsargumentet är värt

Det är här releasen slutar vara en modellgranskning och blir en arkitekturfråga. Om Clef talar Jevs förfrågningsform, då är modellen bakom din beslutsendpoint ett konfigurationsvärde, och det kloka sättet att införa den är sida vid sida snarare än som en ersättning – kör båda mot din egen trafik, behåll den som mäter bättre på dina data, och låt växlingen förbli billig.

Clef i sig finns inte med i vår ruttlista; OrcaRouters katalog returnerar 404 för den, och inget här bör läsas som ett tillgänglighetsanspråk från oss. Det vi däremot tillhandahåller är den befintliga lösningen som Clef byggdes för att tränga undan. TypeSafes Jev 1.13 är en listad rutt till ett pris av $0.042 per miljon indatatokens över en kontext på 65 536 tokens, och serveras via samma anropskropp för POST /v1/systemone, så ett A/B-test mellan de två är en modellsträng snarare än en omskrivning. Att ha båda bakom en och samma nyckel – över 200 modeller, leverantörens listpris som förs vidare utan påslag per token, automatisk failover mellan leverantörer – är det som håller det testet igång efter veckan då någon bestämmer sig för att bry sig om det, i stället för att förfalla till en inaktuell kommentar i en konfigurationsfil. Den generella modellen du håller tillgänglig för att agera på vad beslutsmodellen än kommer fram till kan nås från samma nyckel i stället för ett andra kontrakt.

A headless capture of the OrcaRouter model page for typesafe/jev-1.13, showing the TypeSafe breadcrumb, the model title, the description naming the noul, choice and score question types served over POST /v1/systemone, a code sample set to model 'typesafe/jev-1.13', and the performance strip reading p50 TTFT 148 ms.

Vad skulle ändra den här avläsningen?

Någon utanför Cloudflare behöver köra Decision Index igen. Sviten är offentlig och utvärderingarna beskrivs som reproducerbara, så en tredjepartskörning är skillnaden mellan en leverantörs tabell och ett faktum — och cellerna som spelar störst roll är de som pekar i motsatta riktningar. 97,4 på avsiktsdetektering utanför scope bredvid 48,0 på GPQA Diamond är inte en jämn förmågekurva; det beskriver en modell som är mycket bra på de klassificeringsformer som finns i dess träningsfördelning och mycket svagare på resonemang den inte har sett. Om det står sig vid oberoende testning är det det mest operativt viktiga faktumet om Clef, och det finns inte med i höjdpunkterna.

Produktionstrafiken behöver också se ut som latenstabellen. En median på 209 ms uppmätt på en H200 säger inget om p95 under samtidighet, och designens hela säljargument är att den ligger i en hot path.

Och finjusteringsplattformen måste producera något. Cloudflares inlägg beskriver en RL-loop – AI Gateway för att fånga en datauppsättning från din egen trafik, Workers AI för att generera rollouts, Containers som sandlåda för poängsättning, Trainer för att uppdatera vikter, och sedan återdistribuera till Workers AI – i samma inlägg som tillkännager modellerna, utan ett kundresultat bifogat. En finjusterad Clef som slår basmodellen på en uppgift som basmodellen aldrig tränades för skulle vara mycket starkare bevis för kategorin än någon rad i tabellen.

Fram till dess är den rättvisa sammanfattningen denna: Cloudflare har släppt en riktig, med tillåtande licens, genuint snabb beslutsmodell och gjort den trivialt utbytbar mot den som kom först. Det är en bättre historia än vad de flesta öppna släpp erbjuder, och den är fortfarande, så här långt, helt och hållet leverantörens egen berättelse om sig själv.