
Clef vs LFM2.5 2.6B Base: 55 GB su un H200, o 5,4 GB su un laptop
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 219 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Ecco un confronto in cui è l'hardware a decidere la questione, prima ancora che lo facciano i modelli. Cloudflare/clef è un modello decisionale multimodale da 27 miliardi di parametri, post-addestrato da Qwen3.8-27B, il cui repository misura poco più di 55 GB su dodici shard del backbone più una piccola testa di schema congiunta. LiquidAI/LFM2.5-2.6B-Base è un checkpoint solo testo da 2,69 miliardi di parametri i cui pesi sono un singolo file da 5,4 GB, pubblicato da Liquid AI il 1º agosto 2026 sotto la LFM Open License. La latenza pubblicata da Cloudflare stessa per Clef — 209,3 ms di mediana, 238,6 ms al p95 — è stata misurata su una singola H200. La distribuzione prevista da Liquid AI per la sua famiglia LFM2.5 è un laptop, un telefono o un dispositivo portatile Ryzen. Entrambi i fornitori descrivono il proprio modello come piccolo, veloce ed efficiente, ed entrambi dicono la verità riguardo a una macchina diversa.
C'è un secondo divario dietro il primo, ed è quello che cambia davvero i piani. Né Clef né LFM2.5 2.6B Base risponde a una domanda fin da subito nel modo che probabilmente ti aspetti. Clef arriva completamente addestrato per un compito da cui non può deviare: risponde a domande digitate e non farà nient'altro. Il checkpoint Liquid arriva non addestrato a nulla — è un modello base, deliberatamente senza instruction tuning, e la scheda di Liquid AI stessa dice che è consigliato solo per un fine-tuning intensivo. Quindi la vera domanda non è quale dei due sia più economico da eseguire. È se stai acquistando un componente finito o un materiale di partenza, e la risposta è diversa per ciascuno dei due.
Dove viene eseguito ciascuno, e perché questo è tutto il confronto
La forma del deployment non è una nota a margine per questi due modelli. Per un modello decisionale è l'architettura, perché un forward pass da 209 ms e una storia che "gira sulla macchina davanti a te" sono la stessa affermazione raccontata da due estremità diverse.
• Parametri — 27B per Clef, con l'encoder visione Qwen3.8-27B mantenuto; 2,69B solo testo per LFM2.5 2.6B Base.
• Disco — un repository da 55 GB per Clef; un file safetensors da 5,4 GB per il checkpoint Liquid, con build GGUF, ONNX e MLX quantizzate pubblicate insieme ad esso.
• Hardware — Cloudflare ha testato Clef con torch 2.11 e transformers 5.10.2 su un singolo H200, e i suoi valori di latenza provengono da quella esecuzione. Il modello gemello post-addestrato di Liquid AI di questo checkpoint gira a 220 token al secondo su un Apple M5 Max e a 113 tok/s su una CPU AMD Ryzen, con meno di 2,5 GB di memoria, e il fornitore osserva che 30 tok/s sono raggiungibili su un telefono.
• Contesto — 65.536 token per Clef, secondo la pagina del modello Workers AI e il post di lancio; 131.072 token per LFM2.5 2.6B Base.
• Input — Clef legge testo, JSON, immagini e fotogrammi video e li valuta congiuntamente. Il checkpoint Liquid è solo testo.
• Licenza — Apache-2.0 per Clef. LFM Open License v1.0 per LFM2.5, che è source-available anziché open source OSI: l'uso commerciale è subordinato al fatto che la tua organizzazione rimanga al di sotto dei 10 milioni di dollari di fatturato annuo; al di sopra di tale soglia, la licenza semplicemente non lo concede. Quella soglia è un dato di fatto in fase di approvvigionamento, non una nota a piè di pagina.

Il costo per decisione non è la stessa questione del costo per token
La mossa allettante qui è dividere due prezzi e dichiarare un vincitore. Questo non regge al confronto con ciò che fanno i due modelli.
Clef costa $0,24 per milione di token di input su Workers AI di Cloudflare. Il suo output non è prosa, quindi la consueta voce dei token di output non esiste; paghi per lo stato, una volta sola, e ricevi in cambio una distribuzione. Per un livello di routing che prende milioni di piccole decisioni al giorno, quel numero è l'intero costo operativo, ed è un numero che puoi ottenere solo da un fornitore anziché dalla tua bolletta elettrica.
LFM2.5 2.6B Base non costa nulla per chiamata e non è in grado di prendere una decisione. Per ricavarne un costo per decisione devi prima fare fine-tuning sul tuo task, il che significa mettere insieme i dati, eseguire un job di addestramento, valutare il risultato e solo allora scoprire quanto ti costa in kVA e tempo di ingegneria. L'economia allettante di un checkpoint da 2,6 miliardi di parametri è reale, ma è a valle di un lavoro che non è ancora stato fatto, e chi confronta i prezzi per token l'ha saltata a piè pari.
Il modo onesto di inquadrare la questione è che si tratta di due acquisti diversi. Clef è un componente con un prezzo di listino e una bolletta di hosting. Il checkpoint Liquid è una materia prima il cui costo è la sessione di addestramento che pagherai in ogni caso — e il cui ritorno è che, alla fine, possiedi l’artefatto in modo definitivo, punto in cui il costo marginale di una decisione è davvero l’elettricità. Per un compito ristretto, ad alto volume e stabile, quello scambio è spesso corretto. Per un compito che non hai ancora specificato, è all’inverso, perché non puoi fare fine-tuning verso un obiettivo che non riesci a descrivere.
Una base non addestrata non è un modello peggiore, è una linea di partenza diversa.
È allettante interpretare l'assenza della tabella di benchmark del checkpoint Liquid come una debolezza nascosta. Non lo è. Valutare un modello base preaddestrato su benchmark di instruction-following misurerebbe l'assenza di fine-tuning, non la qualità del substrato, ed è esattamente per questo che Liquid AI sottopone a benchmark il modello LFM2.5-2.6B post-addestrato e lascia quello base senza valutazione. Il vuoto è verificabile dalla tua parte, e questo è il punto: scarica 5,4 GB, esegui la tua valutazione sul tuo compito e conosci la risposta prima di impegnarti a servire qualsiasi cosa.
La tabella di Clef ha la forma opposta di evidenza e ha il problema opposto. Cloudflare pubblica circa 40 righe di benchmark, un set completo di valutazione del flusso di lavoro e una distribuzione della latenza, e ognuna di esse è stata prodotta da Cloudflare sul Decision Index di Cloudflare stesso, senza che nessuna terza parte ne abbia riprodotto alcuna. La colonna di Clef è molto più informativa della colonna di Liquid, e nessuna cifra in essa è stata verificata da nessun altro. Questa è un'affermazione più forte di uno spazio vuoto, e più debole di quanto sembri.
Ciò che puoi misurare da solo si divide allo stesso modo. Con il checkpoint Liquid, puoi misurare tutto — sono 5,4 GB sul tuo disco. Con Clef, i pesi Apache-2.0 sono ugualmente tuoi da scaricare ed eseguire, ma eguagliare la mediana di 209 ms di Cloudflare richiede la classe di GPU usata da Cloudflare, quindi in pratica la maggior parte dei team lo misurerà tramite l'endpoint ospitato ed erediterà la disponibilità del fornitore insieme alla sua latenza.
Dove si inserisce il livello di routing, per ciascuno di essi
Né Clef né alcuna variante di LFM2.5 è una route su OrcaRouter, e questo articolo non è una dichiarazione di disponibilità — il catalogo restituisce un 404 per entrambi, quindi Clef proviene da Workers AI di Cloudflare o dalla tua GPU, e il checkpoint Liquid proviene dalla propria distribuzione.
A cosa serve davvero, qui, un livello di routing è il pattern che entrambi i modelli implicano. Un piccolo scorer dai limiti definiti che decide, e un generalista più grande che agisce sulla decisione, è per costruzione un'architettura a due modelli — e il backbone di Clef stesso rende concreta la seconda metà di questo quadro, dato che il modello su cui Cloudflare ha fatto il post-training, Qwen3.8 27B, è una route in listino a $0,33 per milione di token di input e $2,40 per milione di token di output su un contesto di 262.144 token. Un unico endpoint davanti a oltre 200 modelli significa che il decisore economico e l'attore capace stanno dietro la stessa chiave, composti in un'unica chiamata tramite il DSL di routing invece che collegati a mano, con failover automatico, così che una giornata storta di un provider non porti giù con sé il percorso decisionale. Se invece stai facendo self-hosting del checkpoint Liquid e confrontando il tuo fine-tune con i modelli che deve battere, lo stesso endpoint è ciò che rende quel confronto un cambio di configurazione invece di un ciclo di approvvigionamento.
Il Jev 1.13 di TypeSafe merita di essere menzionato nello specifico per il caso del self-hosting: è il modello decisionale su cui Cloudflare ha eseguito il benchmark e parla deliberatamente la stessa forma di richiesta POST /v1/systemone di Clef, è una route in listino a $0,042 per milione di token in input su un contesto di 65.536 token, ed è il modo a basso sforzo per scoprire se un modello decisionale limitato aiuta la tua pipeline prima di spendere un ciclo di addestramento su un substrato che potrebbe non aver bisogno di esistere.

Quale, per cosa
Scegli il checkpoint Liquid quando il compito è ristretto, ad alto volume, specificato abbastanza bene da poter scrivere dati di addestramento e vincolato da uno dei due vincoli rigidi che un'API instradata non può risolvere: i dati non possono lasciare la tua infrastruttura, oppure la macchina su cui deve essere eseguito è quella sulla tua scrivania. La soglia di ricavi di LFM 1.0 è la prima cosa da controllare, perché decide se la licenza è persino disponibile per te.
Scegli Clef quando la decisione è già enumerabile, lo stato entra in 64K, la risposta necessita di una probabilità calibrata piuttosto che di una frase, e 209 ms in un hot path è la proprietà che stai acquistando. Il suo schema fisso è la caratteristica — una forma di output verificabile, riproducibile e senza parser — e il suo footprint di 55 GB è il prezzo della backbone che lo rende accurato al primo tentativo invece che dopo un ciclo di addestramento.
Quello che non dovresti fare è scegliere in base al numero di parametri. Un modello da 2,69B che deve essere addestrato prima di poter rispondere non è una versione più piccola di un modello da 27B che già ci riesce, e i due numeri nel titolo — 55 GB e 5,4 GB — descrivono due budget diversi, non due punti sulla stessa scala.

La questione aperta, ed è la stessa per entrambi
Nessuno dei due fornitori ha pubblicato prove che resistano a un esame indipendente. La run del Decision Index di Cloudflare è autogestita e non replicata; i dati di throughput di Liquid AI sono misurazioni del fornitore stesso su hardware da esso scelto. LFM2.5 2.6B Base non ha alcun benchmark, per scelta progettuale, e la tabella Clef ne ha moltissimi, per scelta.
Per il checkpoint Liquid, le prove mancanti sono facili da rimediare e sono interamente nelle tue mani — il file è abbastanza piccolo da poterlo valutare su un portatile in un pomeriggio. Per Clef non è così: riprodurre la mediana di 209 ms richiede l'hardware che Cloudflare ha usato e lo stato che nessuno al di fuori di Cloudflare ha messo insieme. È questa asimmetria, più di qualsiasi cosa in entrambe le specifiche, a dover orientare su quale dei due impostare i tuoi piani questo mese.
