Ett titelkort med texten “Clef vs Qwen3.8-27B — En stomme, två utdatakontrakt”, med två kort under: Clef, 27B-beslutsmodell, en logit per alternativ; och Qwen3.8-27B, 27B tät VLM, tokens och verktygsanrop.
Guides & Insights

Clef vs Qwen3.8-27B: En backbone, två utdatakontrakt

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Clef kan inte skriva en mening, och den är byggd av en modell som kan. Cloudflare/clef är en multimodal beslutsmodell med 27 miljarder parametrar: du ger den ett tillstånd och ett schema med typade frågor, och den returnerar en sannolikhet för varje tillåtet alternativ utan att producera en enda prosatoken. Ryggraden under den är Qwen3.8-27B, en tät vision-språkmodell med öppna vikter, fryst på plats med ett litet extra huvud påkopplat. Det gör detta till en av de få modell-mot-modell-sidorna där de två sidorna inte alls är rivaler — de är en checkpoint och dess derivat, som delar 55 gigabyte vikter och är oense om huruvida svaret är något man läser eller något man räknar ut.

Vikterna för båda blev offentliga innan orden blev det. Cloudflare skapade Cloudflare/clef-repositoriet på Hugging Face kl. 21:15 UTC den 30 september 2026, under Apache-2.0, och publicerade tillkännagivandeinlägget – "Introducing Clef: våra öppna beslutsmodeller och ny plattform för RL-finjustering" – eftermiddagen därpå. I ungefär arton timmar var en 55 gigabyte stor modell nedladdningsbar och kördes på Cloudflares egna edge-GPU:er innan dess leverantör sade något om den. Inom tre dagar hade den en Ollama-bibliotekssida bakom Ollama 0.35.1, vilket är där den här artikeln hittade den, och NVFP4-, FP8-, EXL3-, INT8-, Q4- och Q8-byggen från ett dussin olika uppladdare.

Det som går att veta utifrån repositoriet är ovanligt komplett, och det är värt att skilja det från det som inte går att veta. Går att veta: arkitekturen, bascheckpointen, licensen, en referensimplementation som körs, och en fullständig utvärderingsmatris. Går inte att veta: huruvida några av dessa siffror överlever en omkörning av någon som inte är Cloudflare. Varje poäng som tillskrivs Clef nedan kommer från leverantörens egen körning av en svit som leverantören hostar. Den asymmetrin gentemot en modell med en månads oberoende användning bakom sig är den ärliga ryggraden i den här jämförelsen, och resten av texten handlar om var den faktiskt biter.

De två repositorierna, sida vid sida

Börja med nedladdningen, eftersom likheten är poängen. Clefs safetensors uppgår till 54,97 GB över tolv shardar. Förälderns uppgår till 55,56 GB över arton. Clef behåller Qwen3.8-27B:s visionskodare – processorn, visionstornet, hela den multimodala front-end-delen – så inget skalades bort för att göra den mindre. Det Cloudflare lade till är ett gemensamt schemahuvud på 256 MB: fyra lager, 1 024 breda, sexton huvuden, en feedforward med bredden 4 096, två routningslager som läser basnätets slutliga dolda tillstånd. Träningsreceptet är ett fryst basnät, det huvudet och rang-256 lågrankade adaptrar, med etikettutjämnad korsentropi för giltiga schemasvar parade mot en Brier-förlust för att skärpa kalibreringen.

Sedan divergensen, som helt och hållet ligger i vad modellen tillåts sända ut.

• Parametrar — Clef 27B, eftertränad från Qwen/Qwen3.8-27B. Qwen3.8-27B 27B dense, 64 lager, 5 120 dolda, vokabulär på 248 320 token, 16 × (3 × Gated DeltaNet → FFN) varvat med Gated Attention.

• Utdata — Clef: en logit per tillåtet alternativ, softmaxad per fråga, ingen genereringsväg alls. Qwen3.8-27B: tokens, verktygsanrop och ett resonemangsblock som är aktiverat som standard.

• Frågeformat – Clef tar 1 till 64 typade frågor per begäran i tre former: noul (sannolikhet för sant), choice (2 till 255 namngivna alternativ), score (2 till 10 ordnade nivåer, som returnerar ett sannolikhetsviktat värde som kan hamna mellan dem). Qwen3.8-27B har inget sådant kontrakt; du får prosa och parsern får du skriva själv.

• Licens — Apache-2.0 på båda, vilket är anledningen till att tredjepartskvantiseringen kunde ske under en helg.

• Kostnaden för den frysta halvan – Clefs huvud är 256 MB mot 54,97 GB backbone. Nästan hela nedladdningen är föräldern. Om du redan har Qwen3.8-27B på disken laddar du ner den en andra gång för att få en annan åsikt om hur den ska svara.

A two-column scoreboard for Clef and Qwen3.8-27B across six dimensions: output, parameters, GPQA Diamond (48.0 vs 90.5), hosted context (65,536 vs 262,144 tokens), median latency (209.3 ms vs 1,929 ms) and list price ($0.24 per M in vs $0.33/$2.40 per M). A footer notes Clef's figures are vendor-reported and unreproduced, Qwen's GPQA is per Artificial Analysis, and latency was measured by each side on its own hardware.

Vad omrubriceringen kostar, i två siffror

Cloudflares utvärdering är sviten Decision Index 0.2.1, som körs internt, och det är en tabell över beslutsmodeller — sex kolumner: Clef, Clef-flash, Jev, DiffusionGemma Jev, Kev 9B och Laya. Qwen3.8-27B har ingen rad i den, och Clef har ingen rad i Artificial Analysis Intelligence Index. Så det finns ingen gemensam resultattavla och den här artikeln kommer inte att hitta på en.

Det finns dock ett benchmark som båda sidor har fått genomgå, och gapet är tillräckligt stort för att vara den mest beslutsrelevanta siffran i släppet. På GPQA Diamond – naturvetenskapliga frågor på forskarutbildningsnivå, flervalsfrågor – mäter Cloudflare Clef till 48.0. Föräldramodellen ligger på 90.5 i testramverket från Artificial Analysis och 89.2 i leverantörens eget modellkort. Det är en klyfta på fyrtio poäng i allmän kunskap, och det är ingen gåta: Clef svarar genom att poängsätta en fast uppsättning alternativ som den tilldelats, och flervalsfrågor i allmän kunskap ligger ungefär så långt från "routa detta ärende" som samma vikter kan riktas. Betrakta jämförelsen som vägledande snarare än kontrollerad – två testramverk, två labb, varken leverantörens eller bevakarens. Men riktningen råder det ingen tvekan om, och det är priset för kontraktet.

Samma mönster visar sig i resten av Clefs generella celler. MMLU-Pro 65,9, BBH 73,7, CLINC150 med hantering av out-of-scope 97,4 för 27B mot Jevs 89,3 — den sista är den sällsynta cellen där derivatet slår den äldre beslutsmodellen rakt av, och det spelar roll eftersom att vägra klassificera är den svåra halvan av routing. Där Clef är stark är den stark precis där en egentränad klassificerare borde vara: BANKING77 intent macro-F1 på 94,2, BFCL case-exact på 98,5, API-Bank på 91,9. Där den är svag slår en textbaserad beslutsmodell från ett konkurrerande labb — TypeSafe's Jev — den med trettio poäng på GPQA Diamond samtidigt som den fakturerar $0.042 per miljon input-tokens i vår egen katalog, vilket är en användbar påminnelse om att "27B" inte i sig är ett argument.

Det föräldern behåller är allt som Decision Index inte frågar om. På förälderns eget kort och i raderna med AA som källa har vår katalog: Terminal-Bench 2.1 på 73,0, SWE-bench Pro 61,7, LiveCodeBench v6 90,3, OSWorld-Verified 84,3, DeepSWE 1.1 på 42,2, AA Coding 68,1 på plats 35 av 138 samplade modeller. Ingen av dessa har en Clef-rad, eftersom Clef inte kan försöka sig på dem. Den har ingen väg för verktygsanrop, ingen långsiktig planering, inget sätt att emittera patchen.

Vad ett beslut kostar, och varför resultatraden är hela argumentet

Workers AI-modellsidan listar exakt ett enhetspris för Clef: 0,24 USD per miljon indatatoken. Det finns ingen utdatarad, och anledningen finns i svaren. Ollamas eget dokumenterade exempel – en supportbiljett som dirigeras genom tre frågor – kommer tillbaka med "usage": {"input_tokens": 1204, "output_tokens": 3}. Tre utdatatoken för tre frågor. Huruvida Cloudflare fakturerar dessa tre token är nästan irrelevant: utdatakostnaden för ett beslut är inte en taxa, det är ett antal frågor.

Jämför det med förälderns prislista i vår egen katalog, som är 0,33 $ per miljon indata-tokens och 2,40 $ per miljon utdata med ett fönster på 262 144 token. Samma tillstånd på 1 204 token, samma enda routingbeslut:

• Clef — 1 204 indatatokens till $0,24 per miljon är ungefär $0,00029 per beslut, och ungefär $289 per miljon beslut. Talet rör sig knappt när svaret blir svårare, bara när tillståndet blir längre.

• Qwen3.8-27B med tänkande inaktiverat – samma tillstånd kostar cirka 0,00040 USD i indata, plus ungefär tio utdatatokens till 2,40 USD per miljon. Kalla det 0,00042 USD, eller 421 USD per miljon. Clef är cirka 1,5 gånger billigare, vilket inte är den historia som någon berättar.

• Qwen3.8-27B med tänkandet påslaget – vilket är standard för denna checkpoint. Om modellen lägger 400 tokens på att resonera om vilket av fyra fack ett e-postmeddelande för lösenordsåterställning hör hemma i, är det ytterligare $0,00096 och beslutet landar nära $0,0014, eller $1 357 per miljon. De där 400 tokens är ett antagande, inte en mätning, och multipeln rör sig linjärt med det.

Den ärliga versionen av prisargumentet är snävare än vad det först verkar. Mot en generalist som körs med tänkandet avstängt vinner Clef på dollar med en faktor på ungefär ett och ett halvt – verkligt, men inte omvälvande. Mot samma modell i dess standardkonfiguration är gapet en funktion av ordrikedom, och ordrikedom är precis vad en språkmodell har och en design med poängsättning av alternativ inte har alls. Det är det strukturella påståendet: Clefs kostnad begränsas av tillståndets längd, och föräldramodellens begränsas av hur mycket föräldramodellen väljer att säga.

Cloudflare's Workers AI model page for clef, showing a 65,536-token context window, vision support, and unit pricing of $0.24 per million input tokens with no output line.

Det enda numret som inte är nära

Cloudflare rapporterar en medianlatens för förfrågningar på 209,3 ms för Clef och en p95 på 238,6 ms, uppmätt över de 43 benchmarktesterna i sin körning, på sina egna edge-GPU:er. Ingen utanför Cloudflare har reproducerat det, och leverantörens infrastruktur är anledningen till att siffran är så låg som den är – den här modellen är utformad för att ligga på samma nätverk som anroparen.

För föräldern kan vi göra bättre än en leverantörssiffra, eftersom den är en av våra rutter. Under sjudagarsfönstret som slutar den 2 oktober 2026 mätte OrcaRouters egen playground Qwen3.8-27B till en p50 på 1 929 ms och 235,8 utdatatokens per sekund, på 136,3 miljoner tokens trafik under det fönstret. Den dagliga serien är det intressanta: p95 ligger på exakt 10 000 ms sex av de sju dagarna, vilket läses som ett tak snarare än en mätning, och p50 varierar mellan 1 751 ms och 4 296 ms beroende på dag. Betrakta medianen som ungefär nio gånger Clefs, och betrakta svansen som oinformativ tills någon publicerar en riktig fördelning.

Det gapet är inte en fråga om finjustering, och det kommer inte att slutas. En genomgång med enbart prefill plus ett parallellt poängsättningshuvud blir klar i en enda svepning; en autoregressiv modell blir klar när den får slut på saker att säga. Leverantörens absoluta siffror för Clef förtjänar den vanliga rabatten, men rangordningen är en egenskap hos arkitekturen, inte hos Cloudflares hårdvara.

Kontexten citeras på tre sätt för en av dem.

Båda modellerna tar text, JSON, bilder och video. Fönstren är inte desamma, och ett av dem anges inkonsekvent beroende på var man läser.

• Clef, hostad — 65 536 tokens, enligt Workers AI-modellsidan och tillkännagivandeinlägget. Det är siffran som binder en API-anropare, och Cloudflares egen framställning är jämförande: dubbelt så mycket tillstånd som Jevs 32K-fönster rymmer.

• Clef, på disk — den släppta config.json deklarerar max_position_embeddings på 262 144, eftersom den frysta stommen är förälderns och fortfarande bär förälderns positionsgräns. Den medföljande encode_record-hjälpfunktionen har som standard max_length=16,384, med max_state_tokens tillgängligt för att begränsa tillståndet separat. Inget av dessa tre tal är fel; de svarar på olika frågor, och en runtime-lista som annonserar 256K läser konfigurationen, inte slutpunkten.

• Qwen3.8-27B — 262 144 inbyggt, utbyggbart till 1 000 000 med rätt serving-konfiguration, enligt leverantörens kort och vår katalograd. Minst fyra gånger det hostade Clef-fönstret.

Den praktiska konsekvensen är mindre än vad förhållandet antyder. Clef konsumerar ett tillstånd – en biljett, en faktura, en skärmbild – inte en konversation, och en av dess säljargument är att du kan ge den en stor tillplattad nyttolast och ställa sextiofyra frågor om den utan att betala för nyttolasten igen för varje fråga. Föräldern behöver fönstret eftersom den måste hålla historiken, verktygsresultaten och sitt eget resonemang. Olika krav, olika tak.

Båda två ser samma pixlar

Visionskodaren ärvs, så detta är inte ett fall där den ena modellen är multimodal och den andra inte. Clef accepterar upp till fyra bilder per begäran, base64-kodade PNG, JPEG eller WebP, delade av varje fråga i nyttolasten, och videorutor kan läggas till som rammatriser — kvittoexemplet i kortet ställer en ja/nej-fråga om huruvida en totalsumma är läsbar, vilket är designen i miniatyr. Qwen3.8-27B är en nativ visionsspråkmodell med OmniDocBench 1.5 på 91,1, RealWorldQA på 85,9 och CharXiv på 78,8 enligt leverantörens kort.

Det som skiljer är vad du får tillbaka. Clef ger dig ett fältvis beslut med en tillhörande sannolikhet, vilket är ett typat svar om ett dokument. Föräldern ger dig en beskrivning av dokumentet, som du sedan tolkar. För en stor klass av dokumentarbete — kontrollera det här formuläret, hitta den här klausulen, ligger den här summan över tröskelvärdet — är det typade svaret hela jobbet, och beskrivningen är overhead som du betalar för och sedan kastar bort.

Var gränsen faktiskt går

• Ta Clef – svaren kan räknas upp i förväg och du föredrar att slippa skriva en parser. Routning, triage, gating, policykontroller, extrahering av dokumentfält. Slutna mängder, 2 till 255 alternativ per fråga, upp till 64 frågor som poängsätts tillsammans.

• Välj Clef — beslutet ligger i en hot path och 209 ms mot 1 929 ms förändrar vad pipelinen kan göra. Detta är det enskilt starkaste skälet att byta, och det är ett latensskäl, inte ett noggrannhetsskäl.

• Ta Clef — du vill ha determinism. Ett alternativ som du inte har deklarerat kan inte komma tillbaka, eftersom det inte finns något genereringssteg som kan producera det.

• Behåll Qwen3.8-27B — svaret är inte ett val från en lista: sammanfatta, skriva utkast, resonera sig igenom ett nytt problem, skriva kod, styra verktyg över en lång horisont. Clef kan inte göra något av det, och det kommer inte att berätta det för dig.

• Behåll Qwen3.8-27B – du behöver modellen för att säga "ingen av dessa". En beslutsmodell poängsätter de alternativ den har fått. Ge den ett schema för fakturering/teknik/försäljning och en integritetsförfrågan, och den returnerar det minst dåliga av de tre i stället för ett avböjande. Föräldern synliggör frågan du inte tänkte på att ställa.

• Behåll Qwen3.8-27B – kontext- eller långdokumentarbete. Fyra gånger det hostade fönstret, innan miljontokensutökningen.

Läs den listan som en pipeline snarare än en dom, för det är vad den är. Arkitekturen gör relationen bokstavlig: Clef är förälderns prefill-pass med en annan svarsmekanism på slutet. En förnuftig design sätter Clef först – bestäm rutten, prioriteten, eskaleringsflaggan – och håller Qwen3.8-27B bakom den för att agera på beslutet. De två är komplement som råkar dela en nedladdning.

Var man ska köra var och en av dem

Clef hostas på Cloudflares Workers AI till priset $0,24 per miljon indata enligt ovan, och Apache-2.0-vikterna är dina att köra lokalt. Listningen i Ollama-biblioteket är den senaste vägen in: ollama pull clef kräver Ollama 0.35.1 eller senare, eftersom modellen talar via /v1/systemone slutpunkten som Ollama lade till för beslutsmodeller. Titta på taggarna, inte rubriken — standard- och clef:27b-taggarna är 18 GB, vilket är en fyrabitarsversion av en 55-gigabyte-modell; clef:27b-q8_0 är 30 GB, clef:27b-nvfp4 är 18 GB, clef:27b-mxfp8 är 31 GB, och clef:27b-mlx-bf16 är hela 55 GB för Apple silicon. TypeSafes egen Python-SDK kommer att kommunicera med den om du pekar den mot en lokal Ollama och anger valfri API-nyckel, som körtiden ignorerar. En varning som kommer att bita i produktion: confidence mäter hur koncentrerade sannolikheterna är, inte chansen att svaret är korrekt, och oavgjorda fall avgörs i den ordning du angett för alternativen.

Föräldern är den enklare att lägga bakom ett API i dag. Qwen3.8-27B kan routas på OrcaRouter till de priser på 0,33 $ och 2,40 $ per miljon som används ovan, med fönstret på 262 144 token, och den är en av över 200 modeller som nås via en enda OpenAI-kompatibel nyckel. Eftersom leverantörens listpris förs vidare med 0 % påslag, slår en leverantörsprissänkning på endera sidan av denna jämförelse igenom på våra rutter samma dag som den kommer.

Clef i sig är inte en av våra rutter – vår offentliga katalog returnerar ingenting för den, och ingenting här bör läsas som ett tillgänglighetsanspråk från oss. Det vi däremot tillhandahåller är den modell som gör beslutsmönstret nåbart utan ett Cloudflare-konto: TypeSafes Jev 1.13 är en listad rutt till $0.042 per miljon indatatokens med en kontext på 65 536 tokens, uppmätt till ett p50 på 148 ms över samma sjudagarsfönster, och den talar exakt samma POST /v1/systemone förfrågningsformat. Eftersom Clef avsiktligt är API-kompatibel med Jev är en pipeline byggd mot endera bara en konfigurationsändring bort från den andra – vilket är precis det fall ett routningslager finns för att göra gratis. Håll båda nåbara, mät på dina egna etiketter och låt vinnaren vara en datapunkt snarare än ett arkitektoniskt åtagande. Om en beslutsmodell till slut fungerar som grind för en agent måste modellen som agerar utifrån beslutet fortfarande vara nåbar, och den halvan ligger redan bakom samma nyckel.

OrcaRouter's own model page for qwen/qwen3.8-27b, showing a 262,144-token context window and pricing of $0.33 per million input tokens and $2.40 per million output tokens.

Vad skulle ändra den här avläsningen?

Tre saker, i stigande ordning efter hur mycket de skulle påverka det.

En tredje part behöver köra Decision Index igen. Sviten är offentlig och Cloudflare beskriver utvärderingarna som reproducerbara, så det är genomförbart – och CLINC150-cellen för out-of-scope är den man bör hålla ögonen på, eftersom en 97,4 för 27B antingen är en verklig fördel gentemot Jevs 89,3 på den svåraste halvan av routningen eller en artefakt av ett internt byggt utvärderingsramverk. Ingen utanför Cloudflare vet ännu.

Någon behöver poängsätta Clef och Qwen3.8-27B på samma klassificeringsuppgift med samma etiketter. Det är den enda jämförelse som skulle avgöra huruvida omrubriceringen är ett kvalitetsbyte eller en kvalitetsuppgradering för beslut i slutna uppsättningar, och ingen av leverantörerna har incitament att genomföra den. Fram till dess står GPQA-klyftan på fyrtio poäng som det bästa tillgängliga beviset för vad som togs bort, och det är bevis om fel uppgift.

Och Clefs latens behöver en p95 under samtidig belastning. Medianen på 209 ms mättes av leverantören, på hårdvara som leverantören kontrollerar, för en modell vars hela säljargument är att den ligger i en kritisk körväg. Ordningen gentemot en autoregressiv förälder är arkitektonisk och kommer att hålla. Det är de absoluta millisekunderna man bör misstro, och det är siffran som hela affärscaset vilar på.

Qwen3.8-27B är en av över 200 modeller som kan nås via en enda OpenAI-kompatibel nyckel — Qwen3.8-27B.