
Clef copia di proposito l'API di Jev — e questa è la parte interessante
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 219 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Clef è un modello multimodale da 27 miliardi di parametri di Cloudflare che risponde a domande tipizzate e a nient'altro. Gli si passa uno stato — testo, JSON, un'immagine, un fotogramma video — più uno schema con fino a 64 domande denominate, e restituisce una probabilità per ogni opzione consentita in un solo forward pass. Niente testo generato, niente parser, niente ciclo di decodifica. Ciò che rende Cloudflare/clef degno di essere letto non è quel design, che ha preso in prestito, ma il formato di trasmissione che ha scelto: Cloudflare ha costruito Clef per parlare il corpo di richiesta e risposta di Jev System One, il modello decisionale che TypeSafe ha rilasciato per primo, servito allo stesso percorso POST /v1/systemone. L'interoperabilità qui è l'intero argomento commerciale. Se la tua pipeline chiede già a un modello decisionale domande in quella forma, Clef è un cambio di URL e una stringa di modello, non una migrazione.
È una cosa insolita che un post di rilascio seppellisca una notizia del genere, e Cloudflare non la seppellisce: la model card afferma senza mezzi termini che l'API è «completamente compatibile con Jev e SystemOne», e il blog si apre riconoscendo a TypeSafe il merito di aver portato la categoria alla ribalta, prima di posizionare Clef come versione di seconda generazione di un esperimento interno. Quindi la lettura onesta di questo rilascio si articola in tre parti: cosa ti dà la decisione sulla compatibilità, cosa dicono i numeri della stessa Cloudflare su dove Clef vince e dove perde, e cosa resta non verificato, perché ogni cifra in quella tabella è stata prodotta dal fornitore che distribuisce il modello.
La categoria proviene da qualche altra parte
Il post di Cloudflare è franco sulla discendenza. L'idea di un modello che restituisce output strutturati limitati anziché prosa è attribuita a Jev System One di TypeSafe. La strada di Cloudflare è stata una demo precedente che ha piegato un modello di diffusione per emettere probabilità deterministiche esponendo i logprobs, più il lavoro della community di Matt Mastracci per far sì che il motore di inferenza gestisse quel pattern. Clef si basa su quel concetto con un backbone diverso, una testa di scoring appositamente costruita e — la parte che conta commercialmente — un corpo della richiesta che corrisponde a quello dell'incumbent.
Quando un fornitore sia copia il formato di trasmissione di un rivale sia si confronta con l'indice del rivale, la compatibilità non è una nota a piè di pagina del modello, è la strategia di prodotto. Sostituire un modello decisionale dietro un endpoint esistente è il modo più economico possibile per provare un nuovo entrante, e l'esperimento più economico possibile per un team che ne ha già uno di questi collegato.
Cosa è stato effettivamente rilasciato, e quanto costa
• Parametri — 27B, costruito congelando Qwen3.8-27B con il suo encoder visivo e addestrando, su di esso, una testa di schema congiunta più adattatori low-rank di rango 256.
• Gemello — Clef-Flash, la stessa ricetta a 9B da Qwen3.5-9B. Articolo separato, compromessi separati.
• Contesto — 65.536 token, secondo la pagina del modello Workers AI e il post del blog. L'helper di codifica incluso imposta come valore predefinito max_length=16.384, un valore predefinito e non un limite massimo, ma è il valore predefinito che si ottiene se si usa il loader così com'è fornito.
• Tipi di domanda — noul (vero/falso, restituisce la probabilità di vero), scelta (da 2 a 26 opzioni denominate), punteggio (da 2 a 26 livelli ordinati). Da una a 64 domande per richiesta.
• Prezzo — $0,24 per milione di token di input su Workers AI di Cloudflare, oppure self-hosted dai pesi Apache-2.0 che misurano circa 55 GB distribuiti su dodici shard.
• Licenza — Apache 2.0, seguendo il checkpoint base Qwen3.8-27B.

Dove vince, e dove no
Il run del Decision Index di Cloudflare è la fonte di tutto ciò che compare in questa sezione, e la classifica che lo ospita è di Cloudflare. Nulla di quanto segue è stato riprodotto in modo indipendente. Leggilo come il miglior caso presentato da un fornitore, e nota quanto sia disomogeneo.
Le vittorie si concentrano dove un classificatore addestrato in casa dovrebbe vincere. Clef ottiene 94,2 di macro-F1 sull'intento BANKING77 contro il 79,7 di Jev, e 97,4 su CLINC150 con gestione dell'out-of-scope contro 89,3 — un divario di trenta punti che è la cella più rilevante per le decisioni dell'intera tabella, perché rifiutarsi di classificare è la metà difficile del routing. Ottiene anche 86,7 su CRUXEval, 94,0 su CLadder e 83,0 sul simulatore di elettrodomestici.
Le perdite sono altrettanto reali e appartengono allo stesso paragrafo. Sulla conoscenza generale e sul ragionamento difficile il vecchio Jev vince nettamente: GPQA Diamond 78,3 a 48,0, MMLU-Pro 82,7 a 65,9, BBH 92,9 a 73,7. Quelli sono i tre divari più grandi nella tabella e puntano tutti nella stessa direzione. Clef inoltre non è il modello migliore nel proprio confronto sul set PhishNChips del dominio sicurezza, dove si ferma a 79,6 e una voce concorrente ottiene un punteggio superiore.
Sulle quattro valutazioni end-to-end dei flussi di lavoro, tratte dal set di valutazione pubblico di TypeSafe e misurate rispetto alle etichette di consenso, i due sono abbastanza vicini da equivalere a un lancio di moneta. Clef si aggiudica l'elaborazione delle fatture sulle azioni esatte con 64,7 a 61,8 e il set sugli incidenti di sicurezza 62,9 a 61,7; Jev si aggiudica l'osservabilità delle tracce degli agenti con 71,6 contro 68,5; il servizio clienti è un pareggio da 76,3 a 76,0 che non significa nulla a quel margine.
La latenza è il punto in cui il divario è strutturale, non marginale. Cloudflare riporta 209,3 ms di mediana e 238,6 ms al p95 per Clef, contro 524,1 e 536,0 per Jev. Questo ordinamento deriva dal design non autoregressivo, non dalle stranezze di un benchmark, ed è per questo che è il numero più probabilmente destinato a sopravvivere al contatto con un deployment reale. I millisecondi assoluti sono stati misurati sull'hardware di Cloudflare e, da soli, significano poco.
Il dato più convincente dell'annuncio non è una riga di benchmark. Cloudflare afferma che il suo team di threat intelligence ha affidato un dominio a Clef insieme al suo servizio di rendering del browser e ha ottenuto un verdetto di categoria in 2,2 secondi, contro i 4,7 secondi del suo LLM generalista più veloce sullo stesso flusso di lavoro, con più classificazioni restituite. Un aneddoto interno, non uno studio — ma è il tipo di storia che spiega perché qualcuno costruirebbe questo invece di rivolgere un prompt a un modello generico.

Due cose che il riferimento API ti dice, e una che non ti dice
Le trappole documentate sono piccole e vale la pena leggerle prima di fare il porting di qualsiasi cosa. Il campo di confidenza misura quanto sono concentrate le probabilità, non la probabilità che la risposta sia corretta — un modello ben calibrato può restituire una risposta corretta a bassa confidenza e una sbagliata ad alta confidenza. E quando due opzioni sono in parità, la risposta segue l'ordine delle opzioni del modello, quindi metti per prima l'opzione che preferisci. Chiunque faccia il porting di un classificatore basato su prompt senza leggere queste due frasi interpreterà male i propri log.
Il vincolo più grande non è documentato da nessuna parte perché è strutturale. Clef non ha alcun percorso di generazione testuale, il che significa che non può abbozzare una risposta, riassumere una discussione, chiamare uno strumento o sostenere una conversazione, e non inventerà una categoria che non hai dichiarato. L'intero design presuppone che tu possa enumerare in anticipo le risposte consentite. Ciò esclude silenziosamente un'ampia classe di problemi, e nessuna quantità di prestazioni nei benchmark lo cambia.
Quanto vale l'argomento della compatibilità
È qui che il rilascio smette di essere una revisione del modello e diventa una questione di architettura. Se Clef parla la forma di richiesta di Jev, allora il modello dietro al tuo endpoint di decisione è un valore di configurazione, e il modo sensato di adottarlo è affiancarlo, non sostituirlo: esegui entrambi sul tuo traffico, tieni quello che misura meglio sui tuoi dati e lascia che il passaggio resti economico.
Clef stesso non è nella nostra lista di route; il catalogo OrcaRouter restituisce un 404 per esso, e nulla di quanto segue va letto come una nostra dichiarazione di disponibilità. Quello che invece offriamo è l'incumbent che esso doveva soppiantare. Jev 1.13 di TypeSafe è una route presente in elenco a 0,042 $ per milione di token di input su un contesto di 65.536 token, erogata attraverso lo stesso POST /v1/systemone body, quindi un test A/B tra i due è una stringa di modello anziché una riscrittura. Avere entrambi dietro un'unica chiave — oltre 200 modelli, prezzo di listino del provider passato tal quale, senza alcun ricarico per token, failover automatico tra provider — è ciò che mantiene quel test in funzione dopo la settimana in cui qualcuno decide di interessarsene, invece di degradare in un commento obsoleto in un file di configurazione. Il modello generalista che tieni a disposizione per agire su qualunque cosa concluda il modello decisionale è raggiungibile da quella stessa chiave anziché da un secondo contratto.

Cosa cambierebbe questa lettura?
Qualcuno al di fuori di Cloudflare deve rieseguire il Decision Index. La suite è pubblica e le valutazioni sono descritte come riproducibili, quindi un'esecuzione di terze parti è la differenza tra la tabella di un fornitore e un fatto — e le celle che contano di più sono quelle che puntano in direzioni opposte. Un 97,4 sul rilevamento di intenti fuori ambito accanto a un 48,0 su GPQA Diamond non è una curva di capacità uniforme; descrive un modello molto bravo con le forme di classificazione presenti nella sua distribuzione di addestramento e molto più debole nel ragionamento che non ha visto. Se questo regge a test indipendenti, è il fatto operativamente più importante su Clef e non compare nei punti salienti.
Anche il traffico di produzione deve rispecchiare la tabella delle latenze. Una mediana di 209 ms misurata su un singolo H200 non dice nulla sulla p95 in condizioni di concorrenza, e il vero punto di forza di questo design è che si trova in un percorso critico.
E la piattaforma di fine-tuning deve produrre qualcosa. Il post di Cloudflare descrive un ciclo di RL — AI Gateway per acquisire un dataset dal tuo stesso traffico, Workers AI per generare rollout, Containers come sandbox di scoring, Trainer per aggiornare i pesi, poi ridistribuire su Workers AI — nello stesso post che annuncia i modelli, senza alcun risultato di cliente allegato. Un Clef sottoposto a fine-tuning che batte il modello base su un compito per cui il base non è mai stato addestrato sarebbe una prova molto più forte per la categoria di qualsiasi riga della tabella.
Fino ad allora, il riassunto equo è questo: Cloudflare ha distribuito un modello decisionale reale, con licenza permissiva e davvero veloce, e lo ha reso banale da scambiare con quello che è arrivato per primo. È una storia migliore di quella che offrono la maggior parte delle release aperte, e finora resta comunque interamente il resoconto che il fornitore dà di sé stesso.
