
Clef vs Qwen3.8-27B: Un backbone, due contratti di output
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 219 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Clef non è in grado di scrivere una frase, eppure è costruito a partire da un modello che ne è capace. Cloudflare/clef è un modello decisionale multimodale da 27 miliardi di parametri: gli si fornisce uno stato e uno schema di domande tipizzate, e restituisce una probabilità per ogni opzione consentita senza produrre un solo token di prosa. La spina dorsale sottostante è Qwen3.8-27B, un modello visione-linguaggio dense a pesi aperti, congelato sul posto con una piccola testa aggiuntiva. Questo lo rende una delle poche pagine modello-contro-modello in cui le due parti non sono affatto rivali — sono un checkpoint e il suo derivato, che condividono 55 gigabyte di pesi e non concordano su se la risposta sia qualcosa che si legge o qualcosa con cui si calcola.
I pesi di entrambi sono diventati pubblici prima di qualunque parola. Cloudflare ha creato il Cloudflare/clef repository su Hugging Face alle 21:15 UTC del 30 settembre 2026, con licenza Apache-2.0, e ha pubblicato il post di annuncio — «Presentiamo Clef: i nostri modelli decisionali open source e la nuova piattaforma di fine-tuning RL» — il pomeriggio successivo. Per circa diciotto ore un modello da 55 gigabyte è stato scaricabile e in esecuzione sulle GPU edge di Cloudflare prima che il suo fornitore dicesse qualcosa al riguardo. Nel giro di tre giorni aveva una pagina della libreria Ollama dietro Ollama 0.35.1, ed è lì che questo articolo l'ha trovato, oltre a build NVFP4, FP8, EXL3, INT8, Q4 e Q8 da una dozzina di uploader diversi.
Ciò che è conoscibile dal repository è insolitamente completo, e vale la pena separarlo da ciò che non lo è. Conoscibile: l'architettura, il checkpoint di base, la licenza, un'implementazione di riferimento funzionante e una matrice di valutazione completa. Non conoscibile: se qualcuno di quei numeri sopravviva a una nuova esecuzione da parte di qualcuno che non sia Cloudflare. Ogni punteggio attribuito a Clef di seguito proviene dall'esecuzione, da parte del fornitore stesso, di una suite ospitata dal fornitore. Questa asimmetria rispetto a un modello con un mese di utilizzo indipendente alle spalle è la spina dorsale onesta di questo confronto, e il resto del pezzo riguarda dove morde davvero.
I due repository, fianco a fianco
Inizia dal download, perché l'uguaglianza è il punto. I safetensors di Clef ammontano a 54,97 GB su dodici shard. Quelli del modello genitore ammontano a 55,56 GB su diciotto. Clef mantiene l'encoder visivo di Qwen3.8-27B — il processore, la torre visiva, l'intero front-end multimodale — quindi non è stato rimosso nulla per renderlo più piccolo. Ciò che Cloudflare ha aggiunto è una testa schema congiunta da 256 MB: quattro livelli, larghi 1.024, sedici teste, un feedforward largo 4.096, due livelli di routing che leggono gli stati nascosti finali del backbone. La ricetta di addestramento prevede un backbone congelato, quella testa e adattatori low-rank di rango 256, con entropia incrociata con smoothing delle etichette per le risposte di schema valide, affiancata a una perdita di Brier per affinare la calibrazione.
Poi la divergenza, che sta interamente in ciò che al modello è consentito emettere.
• Parametri — Clef 27B, post-addestrato da Qwen/Qwen3.8-27B. Qwen3.8-27B: 27B denso, 64 livelli, 5.120 hidden, vocabolario di 248.320 token, 16 × (3 × Gated DeltaNet → FFN) intercalati con Gated Attention.
• Output — Clef: un logit per ogni opzione consentita, con softmax per domanda, nessun percorso di generazione. Qwen3.8-27B: token, chiamate agli strumenti e un blocco di ragionamento attivo per impostazione predefinita.
• Forme delle domande — Clef accetta da 1 a 64 domande tipizzate per richiesta in tre forme: noul (probabilità di vero), choice (da 2 a 255 opzioni con nome), score (da 2 a 10 livelli ordinati, restituendo un valore ponderato per probabilità che può cadere tra di essi). Qwen3.8-27B non ha un contratto del genere; ottieni prosa e scrivi tu il parser.
• Licenza — Apache-2.0 su entrambi, ed è per questo che la quantizzazione di terze parti è avvenuta in un fine settimana.
• Il costo della metà congelata — la testa di Clef è di 256 MB contro 54,97 GB di backbone. Quasi l'intero download è costituito dal modello genitore. Se hai già Qwen3.8-27B sul disco, lo stai scaricando una seconda volta per ottenere un parere diverso su come rispondere.

Quanto costa la reintestazione, in due numeri
La valutazione di Cloudflare è la suite Decision Index 0.2.1, eseguita internamente, ed è una tabella sui modelli decisionali — sei colonne: Clef, Clef-flash, Jev, DiffusionGemma Jev, Kev 9B e Laya. Qwen3.8-27B non ha una riga al suo interno, e Clef non ha una riga nell'Artificial Analysis Intelligence Index. Quindi non esiste una classifica condivisa e questo articolo non ne inventerà una.
C'è, tuttavia, un benchmark a cui entrambe le parti sono state sottoposte, e il divario è abbastanza ampio da essere il numero più rilevante per la decisione nella release. Su GPQA Diamond — domande scientifiche di livello post-laurea, a scelta multipla — Cloudflare misura Clef a 48.0. Il modello padre si colloca a 90.5 sull'harness di Artificial Analysis e 89.2 sulla model card dello stesso fornitore. Si tratta di un precipizio di quaranta punti sulla conoscenza generale, e non è un mistero: Clef risponde assegnando un punteggio a un insieme fisso di opzioni che gli sono state fornite, e la scelta multipla di conoscenza generale è quanto di più lontano da «instrada questo ticket» si possa ottenere puntando gli stessi pesi. Considera il confronto come indicativo anziché controllato — due harness, due laboratori, né quello del fornitore né quello del tracker. Ma la direzione non è in dubbio, ed è il prezzo del contratto.
Lo stesso schema si manifesta nel resto delle celle general-purpose di Clef. MMLU-Pro 65,9, BBH 73,7, CLINC150 con gestione out-of-scope 97,4 per il 27B contro l'89,3 di Jev — quest'ultima è la rara cella in cui il derivato batte nettamente il modello decisionale più datato, e conta perché rifiutare di classificare è la metà difficile del routing. Dove Clef è forte, è forte esattamente dove dovrebbe esserlo un classificatore addestrato internamente: BANKING77 macro-F1 di intent a 94,2, BFCL case-exact a 98,5, API-Bank a 91,9. Dove è debole, un modello decisionale puramente testuale di un laboratorio concorrente — Jev di TypeSafe — lo batte di trenta punti su GPQA Diamond pur fatturando $0,042 per milione di token in input sul nostro catalogo, il che è un utile promemoria che "27B" non è di per sé un argomento.
Ciò che il parent conserva è tutto ciò che il Decision Index non chiede. Sulla sua scheda e nelle righe provenienti da AA, il nostro catalogo riporta: Terminal-Bench 2.1 a 73,0, SWE-bench Pro 61,7, LiveCodeBench v6 90,3, OSWorld-Verified 84,3, DeepSWE 1.1 a 42,2, AA Coding 68,1 in posizione 35 su 138 modelli campionati. Nessuno di questi ha una riga Clef, perché Clef non può affrontarli. Non ha alcun percorso di chiamata degli strumenti, nessuna pianificazione a lungo orizzonte, nessun modo per emettere la patch.
Quanto costa una decisione, e perché la riga di output è l'intero argomento
La pagina del modello Workers AI elenca esattamente un prezzo unitario per Clef: 0,24 $ per milione di token di input. Non c'è una riga di output, e il motivo è nelle risposte. L'esempio documentato di Ollama — un ticket di supporto instradato attraverso tre domande — restituisce "usage": {"input_tokens": 1204, "output_tokens": 3}. Tre token di output per tre domande. Che Cloudflare fatturi quei tre token è quasi irrilevante: il costo di output di una decisione non è una tariffa, è un conteggio di domande.
Confrontalo con il listino prezzi del modello parent sul nostro catalogo, che è 0,33 $ per milione di token di input e 2,40 $ per milione di output con una finestra di 262.144 token. Stesso stato di 1.204 token, stessa singola decisione di routing:
• Clef — 1.204 token di input a 0,24 $ per milione equivalgono a circa 0,00029 $ per decisione, e a circa 289 $ per milione di decisioni. Il numero si muove appena quando la risposta diventa più difficile, solo quando lo stato diventa più lungo.
• Qwen3.8-27B con il thinking disattivato — lo stesso stato costa circa $0,00040 in input, più circa dieci token di output a $2,40 per milione. Diciamo $0,00042, ovvero $421 per milione. Clef è circa 1,5× più economico, il che non è la storia che viene raccontata.
• Qwen3.8-27B con il ragionamento lasciato attivo — che è l'impostazione predefinita su questo checkpoint. Se il modello spende 400 token per ragionare su in quale di quattro categorie rientra un'email di reimpostazione password, sono altri $0,00096 e la decisione si attesta vicino a $0,0014, ovvero $1.357 per milione. Quei 400 token sono un'assunzione, non una misurazione, e il moltiplicatore si muove linearmente con essa.
Quindi la versione onesta dell’argomentazione sui prezzi è più ristretta di quanto sembri a prima vista. Nei confronti di un generalista che opera con il thinking disattivato, Clef vince in termini di dollari di un fattore di circa uno e mezzo — reale, ma non rivoluzionario. Nei confronti dello stesso modello nella sua configurazione predefinita, il divario è funzione della verbosità, e la verbosità è esattamente ciò che un modello linguistico ha e che un design con scorer sulle opzioni non ha affatto. Questa è la tesi strutturale: il costo di Clef è limitato dalla lunghezza dello stato, e quello del parent è limitato da quanto il parent decide di dire.

L'unico numero che non è vicino
Cloudflare riporta una latenza mediana delle richieste di 209,3 ms per Clef e un p95 di 238,6 ms, misurata sui 43 benchmark nella sua esecuzione, sulle proprie GPU edge. Nessuno al di fuori di Cloudflare l'ha riprodotta, e l'infrastruttura del fornitore è il motivo per cui il numero è così basso: questo modello è progettato per trovarsi sulla stessa rete del chiamante.
Per il genitore, possiamo fare meglio di un numero di fornitore, perché è una delle nostre rotte. Nella finestra di sette giorni che termina il 2 ottobre 2026, il playground di OrcaRouter ha misurato Qwen3.8-27B a un p50 di 1.929 ms e 235,8 token di output al secondo, su 136,3 milioni di token di traffico in quella finestra. La serie giornaliera è la parte interessante: il p95 si attesta esattamente a 10.000 ms in sei dei sette giorni, il che si legge come un tetto più che come una misurazione, e il p50 oscilla tra 1.751 ms e 4.296 ms a seconda del giorno. Considera la mediana circa nove volte quella di Clef, e considera la coda non informativa finché qualcuno non pubblica una distribuzione reale.
Quel divario non è una differenza di messa a punto e non si colmerà. Una passata di solo prefill più una testa di scoring parallela si conclude in un'unica scansione; un modello autoregressivo termina quando esaurisce ciò che ha da dire. I valori assoluti dichiarati dal fornitore per Clef meritano il solito sconto, ma l'ordinamento è una proprietà dell'architettura, non dell'hardware di Cloudflare.
Il contesto è citato in tre modi per uno di essi
Entrambi i modelli accettano testo, JSON, immagini e video. Le finestre non sono uguali, e una di esse viene indicata in modo incoerente a seconda di dove si legge.
• Clef, in hosting — 65.536 token, secondo la pagina del modello Workers AI e il post di annuncio. Questo è il numero che vincola un chiamante API, e l'inquadramento proprio di Cloudflare è comparativo: il doppio dello stato che la finestra da 32K di Jev contiene.
• Clef, su disco — il file rilasciato config.json dichiara max_position_embeddings di 262.144, perché il backbone congelato è quello del genitore e porta ancora il limite di posizione del genitore. L'helper encode_record incluso usa per impostazione predefinita max_length=16,384, con max_state_tokens disponibile per limitare separatamente lo stato. Nessuno di quei tre numeri è sbagliato; rispondono a domande diverse, e un elenco di runtime che pubblicizza 256K sta leggendo la configurazione, non l'endpoint.
• Qwen3.8-27B — 262.144 in modo nativo, estendibile a 1.000.000 con la giusta configurazione di serving, secondo la scheda del fornitore e la nostra riga di catalogo. Almeno quattro volte la finestra ospitata di Clef.
La conseguenza pratica è minore di quanto suggerisca il rapporto. Clef consuma uno stato — un ticket, una fattura, uno screenshot — non una conversazione, e uno dei suoi punti di forza è che puoi passargli un grande payload appiattito e porgli sessantaquattro domande senza pagare di nuovo il payload per ogni domanda. Il parent ha bisogno della finestra perché deve conservare la cronologia, i risultati degli strumenti e il proprio ragionamento. Requisiti diversi, tetti diversi.
Entrambi vedono gli stessi pixel
L'encoder di visione è ereditato, quindi non si tratta di un caso in cui un modello è multimodale e l'altro no. Clef accetta fino a quattro immagini per richiesta, in PNG, JPEG o WebP codificate in base64, condivise da ogni domanda nel payload, e i fotogrammi video possono essere aggiunti come array di frame — l'esempio dello scontrino nella scheda pone una domanda sì/no sulla leggibilità di un totale, che è il design in miniatura. Qwen3.8-27B è un modello visione-linguaggio nativo con OmniDocBench 1.5 a 91,1, RealWorldQA a 85,9 e CharXiv a 78,8 sulla scheda del fornitore.
Ciò che differisce è ciò che ottieni in risposta. Clef ti fornisce una decisione campo per campo con una probabilità associata, che è una risposta tipizzata su un documento. Il parent ti fornisce una descrizione del documento, che poi analizzi. Per una vasta classe di lavoro sui documenti — controlla questo modulo, individua questa clausola, questo totale è sopra la soglia — la risposta tipizzata è l'intero lavoro, e la descrizione è un sovraccarico che paghi e poi butti via.
Dove cade effettivamente la linea
• Scegli Clef — le risposte sono enumerabili in anticipo e preferiresti non scrivere un parser. Instradamento, triage, gating, verifiche delle policy, estrazione dei campi dai documenti. Insiemi chiusi, da 2 a 255 opzioni per domanda, fino a 64 domande valutate insieme.
• Scegli Clef — la decisione si trova in un hot path e 209 ms contro 1.929 ms cambia ciò che la pipeline può fare. Questa è la ragione più forte in assoluto per passare, ed è una ragione di latenza, non di accuratezza.
• Prendi Clef — vuoi determinismo. Un'opzione che non hai dichiarato non può ricomparire, perché non esiste un passaggio di generazione che la produca.
• Mantieni Qwen3.8-27B — la risposta non è una scelta da un elenco: riassumere, redigere, ragionare su un problema inedito, scrivere codice, pilotare strumenti su un lungo orizzonte. Clef non è in grado di fare nulla di tutto ciò, e non te lo dirà.
• Tieni Qwen3.8-27B — ti serve un modello che sappia dire "nessuna di queste". Un modello decisionale assegna un punteggio alle opzioni che gli sono state fornite. Dagli uno schema fatturazione/tecnico/vendite e una richiesta sulla privacy, e restituirà la meno peggiore di quelle tre anziché un rifiuto. Il parent fa emergere la domanda che non hai pensato di fare.
• Mantieni Qwen3.8-27B — per lavori su contesto o documenti lunghi. Quattro volte la finestra ospitata, prima dell'estensione a un milione di token.
Leggi quell'elenco come una pipeline invece che come un verdetto, perché è quello che è. L'architettura rende letterale la relazione: Clef è il passaggio di prefill del genitore con un diverso meccanismo di risposta in coda. Un design sensato mette Clef davanti — decide il percorso, la priorità, il flag di escalation — e tiene Qwen3.8-27B dietro di esso per agire sulla decisione. I due sono complementari che si trovano a condividere un download.
Dove eseguire ciascuno di essi
Clef è ospitato su Workers AI di Cloudflare alla cifra di 0,24 $ per milione di input indicata sopra, e i pesi Apache-2.0 sono tuoi da eseguire in locale. La voce nella libreria Ollama è la superficie più recente: ollama pull clef richiede Ollama 0.35.1 o successivo, perché il modello comunica tramite l'endpoint /v1/systemone che Ollama ha aggiunto per i modelli decisionali. Guarda i tag, non il titolo — i tag predefinito e clef:27b sono da 18 GB, cioè una build a quattro bit di un modello da 55 gigabyte; clef:27b-q8_0 è 30 GB, clef:27b-nvfp4 è 18 GB, clef:27b-mxfp8 è 31 GB, e clef:27b-mlx-bf16 è il formato completo da 55 GB per Apple silicon. L'SDK Python di TypeSafe stesso parlerà con esso se lo indirizzi verso un Ollama locale e fornisci una qualsiasi chiave API, che il runtime ignora. Un avvertimento che si farà sentire in produzione: confidence misura quanto sono concentrate le probabilità, non la probabilità che la risposta sia corretta, e i pareggi si risolvono nell'ordine delle opzioni dichiarato.
Il genitore è quello più facile da mettere dietro un'API oggi. Qwen3.8-27B è instradabile su OrcaRouter alle tariffe di $0,33 e $2,40 per milione usate sopra, con la finestra di 262.144 token, ed è uno dei oltre 200 modelli raggiungibili tramite una singola chiave compatibile con OpenAI. Poiché il prezzo di listino del provider viene trasferito con 0% di ricarico, un taglio di prezzo del fornitore su uno dei due lati di questo confronto è attivo sulle nostre rotte lo stesso giorno in cui viene applicato.
Clef stesso non è una delle nostre route — il nostro catalogo pubblico non restituisce nulla per esso, e nulla di quanto qui contenuto deve essere letto come una dichiarazione di disponibilità da parte nostra. Ciò che invece offriamo è il modello che rende raggiungibile il pattern decisionale senza un account Cloudflare: quello di TypeSafe, Jev 1.13 è una route elencata a $0,042 per milione di token di input con una finestra di contesto di 65.536 token, misurata a un p50 di 148 ms nella stessa finestra di sette giorni, e usa la stessa POST /v1/systemone come forma di richiesta. Poiché Clef è compatibile a livello API con Jev di proposito, una pipeline costruita per l'uno o per l'altro dista una modifica di configurazione dall'altro — ed è proprio il caso che un livello di routing esiste per rendere gratuito. Mantieni entrambi raggiungibili, misura sulle tue etichette, e lascia che il vincitore sia un dato piuttosto che un impegno architetturale. Se un modello decisionale finisce per fare da gate a un agente, il modello che agisce sulla decisione deve comunque essere raggiungibile, e quella metà è già dietro la stessa chiave.

Cosa cambierebbe questa lettura?
Tre cose, in ordine crescente di quanto lo sposterebbero.
Una terza parte deve rieseguire il Decision Index. La suite è pubblica e Cloudflare descrive le valutazioni come riproducibili, quindi è fattibile — e la cella fuori ambito di CLINC150 è quella da tenere d'occhio, perché un 97.4 per il 27B è o un vantaggio reale rispetto all'89.3 di Jev sulla metà più difficile del routing o un artefatto di un harness costruito in casa. Nessuno fuori da Cloudflare lo sa ancora.
Qualcuno deve assegnare un punteggio a Clef e Qwen3.8-27B sullo stesso compito di classificazione con le stesse etichette. È l'unico confronto che potrebbe stabilire se la sostituzione della testa sia un compromesso sulla qualità o un miglioramento qualitativo per le decisioni a insieme chiuso, e nessuno dei due fornitori ha un incentivo a eseguirlo. Fino ad allora, il divario di quaranta punti su GPQA resta la migliore prova disponibile su ciò che è stato rimosso, ed è una prova relativa al compito sbagliato.
E la latenza di Clef richiede un p95 in condizioni di concorrenza. La mediana di 209 ms è stata misurata dal fornitore, su hardware controllato dal fornitore, per un modello il cui intero argomento di vendita è che si trova in un hot path. L'ordinamento rispetto a un genitore autoregressivo è architetturale e sopravvivrà. I millisecondi assoluti sono il numero di cui diffidare, e sono il numero su cui si basa l'intero business case.
Qwen3.8-27B è uno dei oltre 200 modelli accessibili tramite un'unica chiave compatibile con OpenAI — Qwen3.8-27B.
