
Clef vs Gemma 4 12B: un'appliance decisionale da 64K token contro un generalista da 256K token
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 219 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Il numero più utile in un confronto tra Clef e Gemma 4 12B non è un punteggio di benchmark. È 65.536 contro 256.000 — le finestre di contesto. Cloudflare/clef è un modello decisionale multimodale da 27 miliardi di parametri, post-addestrato a partire da Qwen3.8-27B, che legge uno stato e uno schema di domande tipizzate e restituisce una probabilità per ogni risposta consentita in un'unica passata non autoregressiva. Gemma 4 12B — il checkpoint Unified, google/gemma-4-12B-it — è il modello any-to-any senza encoder da 11,95 miliardi di parametri del fornitore, rilasciato nell'estate del 2026, che genera testo su una finestra di 256.000 token in più di 140 lingue. Metti una cartella di contratti davanti a entrambi e il modello decisionale esaurisce lo spazio quattro volte prima, perché il suo tetto è di 65.536 token documentati mentre quello del generalista è 256.000. Questa asimmetria non è una nota a piè di pagina. Per un'intera classe di attività di instradamento — documenti lunghi, thread incollati, moduli multipagina — decide la scelta prima ancora che si discuta dell'accuratezza.
Quindi questa non è una pagina su quale modello sia migliore. È una pagina sui due assi sui quali differiscono davvero: quanto stato ciascuno può mantenere e che forma di risposta ciascuno è fisicamente in grado di produrre. Tutto il resto è o un numero dichiarato da un fornitore che nessuno ha riprodotto, o un confronto che non significa ciò che sembra.
Che cos'è ognuno, in un paragrafo ciascuno
Clef è il modello decisionale da 27B di Cloudflare, pubblicato sotto Apache-2.0 con i pesi su Hugging Face e un endpoint ospitato su Workers AI. Cloudflare ha congelato il backbone Qwen3.8-27B, incluso il suo encoder visivo, vi ha collegato una joint schema head più adattatori low-rank a rango 256, e lo ha addestrato con cross-entropy con label smoothing per risposte di schema valide insieme a una loss di Brier per affinare la calibrazione. Fornisci tu state — testo, JSON, immagini o fotogrammi video — e da una a 64 domande con nome, ciascuna tipizzata noul (vero/falso, che restituisce la probabilità di vero), choice (da 2 a 26 opzioni con nome) o score (da 2 a 26 livelli ordinati). Ciò che viene restituito è una distribuzione per ogni domanda e nient'altro. Non esiste alcun percorso di generazione di testo.
Gemma 4 12B è un modello generalista che genera testo. È privo di encoder: invece di torri separate per la visione o l'audio, porzioni di immagini grezze e forme d'onda vengono proiettate direttamente nello spazio di embedding del modello linguistico tramite livelli lineari leggeri, ed è questo che gli consente di accettare testo, immagini, video e audio senza una pipeline specifica per modalità. Ha modalità di pensiero configurabili, chiamata di funzioni nativa, un vocabolario da 262K e uno schema di attenzione ibrido che alterna attenzione a finestra scorrevole da 1.024 token con attenzione globale completa. È Apache-2.0 con affiancati i termini d'uso del fornitore, ed è il checkpoint che la maggior parte delle persone intende quando dice «esegui un modello di queste dimensioni in locale».
Una cosa da dire chiaramente prima di proseguire: nessuno dei due modelli è una route su OrcaRouter. Il nostro catalogo restituisce un 404 per cloudflare/clef e per il checkpoint 12B della stessa famiglia, e nulla in questo articolo deve essere interpretato come una dichiarazione di disponibilità da parte nostra. Ciò che effettivamente offriamo della famiglia Gemma sono le due dimensioni maggiori, e i loro prezzi compaiono più avanti.

L'elenco delle opzioni è un'interfaccia, e ha una modalità di errore
La differenza strutturale tra questi due sta in ciò che accade agli input che non rientrano.
• Output — Clef restituisce una probabilità per ogni opzione dichiarata, e solo quelle opzioni. Gemma 4 12B restituisce testo generato.
• Rifiuto — Clef non ha un'opzione "nessuna delle precedenti" a meno che tu non ne scriva una nei criteri. Gemma 4 12B può descrivere un caso che non rientra in nulla di ciò che hai chiesto.
• Modalità di errore — L'errore di Clef è silenzioso: una scelta sicura all'interno del tuo schema, nessuna eccezione sollevata, nessun ramo di fallback attivato. L'errore del generalista è di solito rumoroso: prosa che non è analizzabile.
• Testabilità — un insieme fisso di opzioni rende il componente riproducibile ed economico da verificare. Il testo libero lo rende flessibile e costoso da validare.
I numeri di Clef su quel problema di rifiuto sono le cifre più deboli che pubblica. Su CLINC150 con gestione out-of-scope — rilevamento dell'intento in cui una risposta valida è «questo non appartiene a nessuna categoria» — il 27B ottiene 97,4 di macro-F1, il miglior risultato nella tabella di Cloudflare e il motivo per cui vale la pena preferire il 27B al suo gemello 9B, che sullo stesso benchmark ottiene 66,8. Un divario di trenta punti tra due modelli costruiti con la stessa ricetta dice che il comportamento out-of-scope è ciò che si acquista con la scala del post-training, ed è ciò da cui la maggior parte delle pipeline di routing dipende silenziosamente. La mitigazione documentata da Cloudflare è una seconda domanda nello schema — aggiungere un campo noul che chiede se lo stato rientra o meno, e poi applicarvi una soglia — il che funziona, ed è compito tuo, non del modello.
Da dove vengono i numeri conta più di ciò che dicono
Ogni dato Clef in questo articolo proviene da Cloudflare: la sua model card, il suo post di lancio o la sua esecuzione del Decision Index. La suite stessa è di Cloudflare, e la classifica che ospita i punteggi è di Cloudflare. Si tratta di un fornitore che misura il proprio prodotto su hardware che controlla, contro un rivale la cui API replica deliberatamente. Nessuna terza parte ne ha riprodotto alcunché, e questo articolo non intende far finta del contrario.
La colonna Gemma 4 12B è un tipo diverso di prova. La scheda dello stesso fornitore pubblica MMLU Pro 77,2%, GPQA Diamond 78,8%, AIME 2026 senza strumenti al 77,5% e LiveCodeBench v6 al 72,0%. Artificial Analysis, un tracker indipendente, indicizza la configurazione di ragionamento con un Intelligence Index di 14,18, con un prezzo indicato di $0,10 / $0,30 per milione di token e una velocità mediana di output misurata di circa 113 token al secondo — e la sua stessa pagina nota che tali cifre dipendono dal carico di lavoro e dall'hardware.
La lettura onesta è che le due colonne non sono affatto comparabili. Una è una suite di valutazione della qualità delle decisioni di un fornitore, gestita dal fornitore stesso; l'altra è un mix di benchmark di fornitori e una valutazione indipendente di un modello generale. Citare un 97,4 accanto a un 77,2 come se fossero colonne della stessa tabella sarebbe la cosa più fuorviante che questa pagina potrebbe fare.
La latenza è l'unico punto in cui i due possono almeno essere discussi nelle stesse unità, e anche lì le avvertenze si accumulano. Cloudflare riporta Clef a 209,3 ms di mediana e 238,6 ms di p95, misurati sulla propria infrastruttura. Artificial Analysis misura il tempo al primo chunk del 12B a circa 2,4 secondi in una configurazione di reasoning, che include un budget di thinking che il modello decisionale non ha. Un passaggio non autoregressivo da 209 ms contro un avvio di generazione da 2,4 secondi è una vera differenza architetturale — un singolo forward pass contro un ciclo di decodifica — ed è l'argomento più forte che Clef ha per un hot path. È anche, a 27B, un modello che necessita di hardware di classe H200 per raggiungere quel valore, e Cloudflare fa pagare 0,24 $ per milione di token di input per eseguirlo per te.

Cosa ti offre davvero 64K di contesto
È nel contesto che questo confronto diventa pratico e che il generalista vince sulla carta con un ampio margine.
• Clef — 65.536 token, secondo la pagina del modello di Workers AI e il post di lancio; l'helper di codifica incluso usa come impostazione predefinita max_length=16,384, che è un valore predefinito e non un limite massimo, ma è il valore predefinito che otterrai se usi il loader così come viene fornito.
• Gemma 4 12B — 256.000 token, secondo la scheda del fornitore, con attenzione a finestra scorrevole da 1.024 token per contenere il costo del contesto lungo.
• Immagini — Clef valuta congiuntamente immagini e fotogrammi video con lo stato testuale tramite l'encoder visivo ereditato. Gemma 4 12B accetta testo, immagini, video e audio tramite il suo percorso senza encoder.
• Lingue — la scheda di Clef non rivendica alcun supporto multilingue; Gemma 4 12B è documentato in oltre 140 lingue.
Per un ticket, una fattura o uno screenshot renderizzato, 64K è generoso e la differenza è accademica. Per un contratto di 200 pagine che si vuole classificare campo per campo, è tutta un'altra questione: il generalista riesce a tenere in memoria il documento, mentre il modello decisionale no. La risposta di Clef a questo è il chunking, e suddividere un documento in chunk prima di decidere al suo riguardo significa aver già preso una decisione che spettava al modello. Questo è un limite reale e merita di essere dichiarato come tale.
Quanto pagheresti davvero, e dove
Nessuno dei due modelli è nel nostro catalogo, quindi la questione del prezzo si divide in tre.
• Clef — $0,24 per milione di token di input su Workers AI di Cloudflare, oppure self-hosted dai pesi Apache-2.0; la latenza pubblicata da Cloudflare è stata misurata su un singolo H200 con torch 2.11 e transformers 5.10.2, e le quantizzazioni della community comparse nel giro di due giorni suggeriscono che può essere spinto a dimensioni inferiori, con un costo in termini di accuratezza che nessuno ha misurato.
• Gemma 4 12B — qui non esiste alcuna rotta hosted. Devi scaricare circa 24 GB di pesi BF16 e servirli da solo, oppure rivolgerti a una piattaforma di terze parti. Non esiste un prezzo per token che possiamo indicare.
• Il sostituto instradato — Gemma 4 26B A4B, un mixture-of-experts con 25,2B parametri totali e 3,8B attivi, è quotato su OrcaRouter a $0,06 per milione di token di input e $0,33 per milione di token di output, con un contesto di 262.144 token. Gemma 4 31B, il fratello denso multimodale con thinking configurabile e function calling nativo, è quotato a $0,13 e $0,38. Entrambi sono su un'unica chiave con prezzo di listino del provider passato senza alcun ricarico per token e failover automatico tra i provider.
Quella riga finale è la versione onesta del nostro coinvolgimento in questo confronto. Se ciò di cui hai bisogno è un generalista che legge un lungo documento e scrive una frase, la via economica per ottenerne uno è una dimensione di Gemma 4 che serviamo effettivamente, e costa meno per milione di token rispetto all'auto-hosting di un 12B su GPU a noleggio. Se ciò di cui hai bisogno è una decisione delimitata nel percorso critico, la mediana di 209 ms di Clef è una vera proprietà architetturale, e la cosa più vicina nel nostro catalogo è Jev 1.13 di TypeSafe — il modello su cui Cloudflare ha fatto benchmark e da cui ha copiato il formato di trasmissione — a $0,042 per milione di token di input su un contesto di 65.536 token, servito attraverso la stessa POST /v1/systemone forma. Dato che i due sono compatibili a livello di API dietro un adattatore sottile, provare Clef contro l'incumbent è un esperimento più che una migrazione, e l'esperimento resta economico quando entrambe le parti sono raggiungibili tramite un unico endpoint.

La decisione, dichiarata come decisione
Scegli Clef quando le risposte sono enumerabili, lo stato rientra in 64K, la decisione si trova in un percorso sensibile alla latenza e sei disposto a farti carico tu stesso della classe residua. Il 97,4 del 27B sul rilevamento di intenti fuori ambito è il motivo per cui pagheresti per esso invece che per il fratello 9B, e la sua forma di output fissa è ciò che rende il componente verificabile senza un parser.
Scegli Gemma 4 12B quando l'input è lungo, quando la modalità è audio o video, quando la risposta deve essere in prosa, o quando le categorie non sono ancora note — perché «smista questa pila in qualunque raggruppamento abbia senso» è una richiesta che un modello decisionale non può accettare, non una che gestisce male. È un generalista con una valutazione indipendente alle spalle, e per il lavoro aperto questo vale più di una tabella di fornitore.
E sii scettico su entrambi i set di cifre, per il motivo che questo articolo continua a ripetere: Cloudflare non è stato riprodotto in modo indipendente su nulla, e quella scheda è la tabella di benchmark dello stesso fornitore. L'unico numero davvero interessante della coppia — se uno schema head da 27B mantenga davvero il suo punteggio out-of-scope di 97,4 su dati sui quali non è stato addestrato — è esattamente il numero che nessuno dei due fornitori può risolvere e che una terza parte potrebbe.
