Een gegenereerde titelkaart met de tekst 'Clef vs LFM2.5 2.6B Base', met als ondertitel '55 GB op een H200 tegenover 5,4 GB op een laptop', met chips met de tekst '27B-beslissingsmodel' en '2,69B voorgetrainde basis'. Het OrcaRouter-logo is als compositie in de rechteronderhoek opgenomen.
Engineering & Research

Clef vs LFM2.5 2.6B Base: 55 GB op een H200, of 5,4 GB op een laptop

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Hier is een vergelijking waarin de hardware het pleidooi beslist voordat de modellen dat doen. Cloudflare/clef is een multimodaal beslissingsmodel met 27 miljard parameters, post-getraind op basis van Qwen3.8-27B, waarvan de repository iets meer dan 55 GB meet, verdeeld over twaalf backbone-shards plus een kleine joint-schema-head. LiquidAI/LFM2.5-2.6B-Base is een tekst-only checkpoint met 2,69 miljard parameters waarvan de gewichten één enkel bestand van 5,4 GB vormen, gepubliceerd door Liquid AI op 1 augustus 2026 onder de LFM Open License. Cloudflares eigen gepubliceerde latency voor Clef — 209,3 ms mediaan, 238,6 ms p95 — werd gemeten op één enkele H200. De beoogde inzet van Liquid AI voor zijn LFM2.5-familie is een laptop, een telefoon of een Ryzen-handheld. Beide leveranciers beschrijven hun model als klein, snel en efficiënt, en beide vertellen de waarheid over een andere machine.

Achter de eerste zit een tweede kloof, en dat is degene die plannen echt verandert. Noch Clef noch LFM2.5 2.6B Base beantwoordt een vraag direct uit de doos op de manier die je waarschijnlijk verwacht. Clef komt volledig getraind aan voor een taak waarvan het niet kan afwijken: het beantwoordt getypte vragen, en het doet niets anders. De Liquid-checkpoint komt helemaal ongetraind aan — het is een basismodel, bewust zonder instructietuning, en de eigen modelkaart van Liquid AI zegt dat het alleen wordt aanbevolen voor zware fine-tuning. De echte vraag is dus niet welke van de twee goedkoper is om te draaien. Het is de vraag of je een kant-en-klare component of een uitgangsmateriaal koopt, en het antwoord is voor elk van hen anders.

Waar elk van hen draait, en waarom dat de hele vergelijking is.

De deploymentvorm is voor deze twee modellen geen bijzaak. Voor een beslissingsmodel is die de architectuur, want een forward pass van 209 ms en een 'draait op de machine vóór je'-verhaal zijn dezelfde bewering, van verschillende kanten verteld.

• Parameters — 27B voor Clef, met behoud van de Qwen3.8-27B vision-encoder; 2,69B alleen tekst voor LFM2.5 2.6B Base.

• Schijf — een repository van 55 GB voor Clef; één safetensors-bestand van 5,4 GB voor het Liquid-checkpoint, met gekwantiseerde GGUF-, ONNX- en MLX-builds die daarnaast zijn gepubliceerd.

• Hardware — Cloudflare heeft Clef getest met torch 2.11 en transformers 5.10.2 op één enkele H200, en de latentiecijfers komen uit die run. Het nagetrainde zustermodel van dit checkpoint van Liquid AI draait op 220 tokens per seconde op een Apple M5 Max en 113 tok/s op een AMD Ryzen CPU, met minder dan 2,5 GB geheugen, en de leverancier merkt op dat 30 tok/s haalbaar is op een telefoon.

• Context — 65.536 tokens voor Clef, volgens de modelpagina van Workers AI en het lanceringsbericht; 131.072 tokens voor LFM2.5 2.6B Base.

• Invoer — Clef leest tekst, JSON, afbeeldingen en videoframes en scoort ze gezamenlijk. Het Liquid-checkpoint is alleen tekst.

• Licentie — Apache-2.0 voor Clef. LFM Open License v1.0 voor LFM2.5, dat source-available is in plaats van OSI open source: commercieel gebruik is afhankelijk van de voorwaarde dat uw organisatie onder de $10 miljoen aan jaarlijkse omzet blijft, en boven die grens verleent de licentie het eenvoudigweg niet. Die drempel is een inkoopfeit, geen voetnoot.

A two-column comparison scoreboard titled 'Clef vs LFM2.5 2.6B Base — the scoreboard'. The left column 'Clef' reads: Parameters: 27B multimodal; On disk: 55 GB repository; Context: 65,536 tokens; Output: probability per option, no text; Hardware: H200 class, 209.3 ms median; Licence: Apache 2.0. The right column 'LFM2.5 2.6B Base' reads: Parameters: 2.69B text-only; On disk: 5.4 GB single file; Context: 131,072 tokens; Output: untuned text continuation; Hardware: laptop, 220 tok/s on M5 Max; Licence: LFM 1.0, $10M revenue threshold. A footer reads 'Clef figures per Cloudflare; LFM figures per Liquid AI's cards. Neither independently reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

Kosten per beslissing is niet dezelfde vraag als kosten per token

De verleidelijke zet hier is om twee prijzen door elkaar te delen en een winnaar uit te roepen. Dat houdt geen stand tegen wat de twee modellen doen.

Clef kost $0,24 per miljoen inputtokens op Cloudflare's Workers AI. De output is geen proza, dus de gebruikelijke regel voor outputtokens bestaat niet; je betaalt één keer voor state en krijgt een verdeling terug. Voor een routeringslaag die dagelijks miljoenen kleine beslissingen neemt, is dat getal de volledige operationele kost, en het is een getal dat je alleen van een leverancier kunt krijgen, niet van je eigen elektriciteitsrekening.

LFM2.5 2.6B Base kost niets per aanroep en kan geen beslissing nemen. Om er een kosten-per-beslissing uit te halen, moet je het eerst fine-tunen op je taak, wat betekent: data verzamelen, een trainingstaak draaien, het resultaat evalueren en pas dan ontdekken wat het je kost aan kVA en engineeringtijd. De aantrekkelijke economie van een 2.6B-checkpoint is reëel, maar ze komt pas ná werk dat nog niet is gebeurd, en degene die prijzen per token vergelijkt, is daar regelrecht aan voorbijgegaan.

De eerlijke framing is dat dit twee verschillende aankopen zijn. Clef is een component met een lijstprijs en een hostingrekening. De Liquid checkpoint is een grondstof waarvan de kosten de trainingsrun zijn die je sowieso betaalt — en waarvan de opbrengst is dat je daarna het artefact volledig bezit, waarna de marginale kosten van een beslissing echt elektriciteit zijn. Voor een nauwe, hoogvolume, stabiele taak is die ruil vaak juist. Voor een taak die je nog niet hebt gespecificeerd, is het achterstevoren, omdat je niet kunt fine-tunen naar een doel dat je niet kunt beschrijven.

Een ongetraind basismodel is geen slechter model, het is een andere startlijn

Het is verleidelijk om de ontbrekende benchmarktabel van de Liquid-checkpoint op te vatten als een verborgen zwakte. Dat is het niet. Een vooraf getraind basismodel laten scoren op benchmarks voor het volgen van instructies zou het ontbreken van fine-tuning meten, niet de kwaliteit van het substraat, en dat is precies waarom Liquid AI de nagetrainde LFM2.5-2.6B benchmarkt en het basismodel ongeëvalueerd laat. De lege plek is van jouw kant verifieerbaar, en dat is het punt: download 5,4 GB, voer je eigen evaluatie uit op je eigen taak, en weet het antwoord voordat je je vastlegt op het serveren van wat dan ook.

De tabel van Clef is de tegenovergestelde vorm van bewijs en heeft het tegenovergestelde probleem. Cloudflare publiceert zo'n 40 benchmarkrijen, een volledige workflow-evaluatieset en een latency-distributie, en elk ervan is geproduceerd door Cloudflare op Cloudflares eigen Decision Index, zonder dat een derde partij ook maar iets ervan heeft gereproduceerd. De Clef-kolom is veel informatiever dan de Liquid-kolom, en geen enkel cijfer erin is door iemand anders gecontroleerd. Dat is een sterkere bewering dan een leegte, en een zwakkere dan het lijkt.

Wat je zelf kunt meten, valt op dezelfde manier uiteen. Met de Liquid-checkpoint kun je alles meten — het is 5,4 GB op je eigen schijf. Met Clef zijn de Apache-2.0-gewichten net zo goed van jou om te downloaden en te draaien, maar om de mediaan van 209 ms van Cloudflare te evenaren is de klasse GPU nodig die Cloudflare gebruikte, dus in de praktijk zullen de meeste teams het via het gehoste endpoint meten en zo de beschikbaarheid van de leverancier overnemen, net als de latentie.

Waar de routeringslaag past, voor elk van hen

Noch Clef, noch enige LFM2.5-variant is een route op OrcaRouter, en dit artikel is geen beschikbaarheidsclaim — de catalogus geeft voor beide een 404 terug, dus Clef komt van Cloudflare's Workers AI of je eigen GPU en het Liquid-checkpoint komt uit zijn eigen distributie.

Waar een routeringslaag hier werkelijk voor dient, is het patroon dat beide modellen impliceren. Een kleine, begrensde scorer die beslist, en een grotere generalist die op basis van die beslissing handelt, vormen per constructie een tweemodelarchitectuur — en Clefs eigen backbone maakt de tweede helft daarvan concreet, aangezien het model waarop Cloudflare post-training heeft gedaan, Qwen3.8 27B, een vermelde route is tegen $0,33 per miljoen inputtokens en $2,40 per miljoen outputtokens binnen een context van 262.144 tokens. Eén endpoint vóór meer dan 200 modellen betekent dat de goedkope beslisser en de capabele actor achter dezelfde sleutel zitten, samengevoegd tot één aanroep via de routing-DSL in plaats van handmatig aan elkaar geknoopt, met automatische failover zodat een slechte middag bij een provider het beslissingspad niet mee onderuit haalt. Als je in plaats daarvan de Liquid-checkpoint zelf host en je fine-tune vergelijkt met de modellen die hij moet verslaan, dan zorgt hetzelfde endpoint ervoor dat die vergelijking een configuratiewijziging is in plaats van een inkooptraject.

TypeSafe's Jev 1.13 verdient het om specifiek voor de self-hosting-case genoemd te worden: het is het beslissingsmodel waartegen Cloudflare heeft gebenchmarkt en het spreekt bewust dezelfde POST /v1/systemone requestvorm als Clef, het is een vermelde route tegen $0.042 per miljoen inputtokens bij een context van 65,536 tokens, en het is de manier met de minste inspanning om erachter te komen of een begrensd beslissingsmodel je pipeline helpt, voordat je een trainingsrun uitgeeft aan een substraat dat misschien niet hoeft te bestaan.

A headless capture of the OrcaRouter model page for qwen/qwen3.8-27b, showing the Qwen breadcrumb, the Qwen3.8 27B title with a 262K context marker, the text, image and video input modalities, and the site's Code samples, Pricing, Performance, Public benchmarks and FAQ navigation tabs.

Welke, waarvoor?

Kies het Liquid-checkpoint wanneer de taak nauw afgebakend is, een groot volume heeft, goed genoeg gespecificeerd is om trainingsdata voor te schrijven, en gebonden is aan een van de twee harde beperkingen die een gerouteerde API niet kan oplossen: de data mogen je infrastructuur niet verlaten, of de machine waarop het moet draaien is de machine die op je bureau staat. De omzetdrempel van LFM 1.0 is het eerste dat je moet controleren, want die bepaalt of de licentie überhaupt voor jou beschikbaar is.

Kies Clef wanneer de beslissing al opsombaar is, de toestand in 64K past, het antwoord een gekalibreerde waarschijnlijkheid nodig heeft in plaats van een zin, en 209 ms in een hot path de eigenschap is die je koopt. Het vaste schema ís de functie — een auditabele, reproduceerbare, parser-vrije uitvoervorm — en de voetafdruk van 55 GB is de prijs van de backbone die hem bij de eerste poging al nauwkeurig maakt in plaats van pas na een trainingsrun.

Wat je niet moet doen, is kiezen op basis van het aantal parameters. Een model van 2,69 miljard dat eerst moet worden getraind voordat het kan antwoorden, is geen kleinere versie van een model van 27 miljard dat al kan antwoorden, en de twee getallen in de titel — 55 GB en 5,4 GB — beschrijven twee verschillende budgetten, niet twee punten op één schaal.

A headless capture of the LiquidAI/LFM2.5-2.6B-Base model card on Hugging Face, showing the model title, the TextGeneration and Transformers and Safetensors tags, a 16-languages marker, the Liquid AI organisation, and the opening line describing the LFM2.5 family as hybrid models designed for on-device deployment.

De open vraag, en die is voor beide dezelfde.

Geen van beide leveranciers heeft bewijs gepubliceerd dat onafhankelijke toetsing doorstaat. De Decision Index-run van Cloudflare is in eigen beheer uitgevoerd en niet gereproduceerd; de doorvoercijfers van Liquid AI zijn de eigen metingen van de leverancier op hardware die hij zelf heeft gekozen. De LFM2.5 2.6B Base heeft bewust helemaal geen benchmark, en de Clef-tabel heeft er met opzet heel veel.

Voor het Liquid-checkpoint is het ontbrekende bewijs goedkoop te verhelpen en volledig in jouw handen — het bestand is klein genoeg om in een middag op een laptop te evalueren. Voor Clef is dat niet het geval: het reproduceren van de mediaan van 209 ms vereist de hardware die Cloudflare gebruikte en de toestand die niemand buiten Cloudflare heeft samengesteld. Die asymmetrie, meer dan wat dan ook in een van beide specificaties, zou moeten bepalen welke van deze twee je deze maand in je planning centraal stelt.