Ett genererat titelkort med texten "Clef vs LFM2.5 2.6B Base", med undertexten "55 GB på en H200 mot 5,4 GB på en bärbar dator", med chips där det står "27B-beslutsmodell" och "2,69B förtränad bas". OrcaRouter-logotypen är komponerad i det nedre högra hörnet.
Engineering & Research

Clef vs LFM2.5 2.6B Base: 55 GB på en H200, eller 5,4 GB på en bärbar dator

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Här är en jämförelse där hårdvaran avgör argumentet innan modellerna gör det. Cloudflare/clef är en multimodal beslutsmodell med 27 miljarder parametrar, eftertränad från Qwen3.8-27B, vars repositorium omfattar drygt 55 GB fördelat på tolv backbone-shards plus ett litet gemensamt schema-huvud. LiquidAI/LFM2.5-2.6B-Base är en checkpoint för enbart text med 2,69 miljarder parametrar, vars vikter utgörs av en enda fil på 5,4 GB, publicerad av Liquid AI den 1 augusti 2026 under LFM Open License. Cloudflares egen publicerade latens för Clef – 209,3 ms median, 238,6 ms p95 – mättes på en enda H200. Liquid AI avser att driftsätta sin LFM2.5-familj på en bärbar dator, en telefon eller en Ryzen-handhållen enhet. Båda leverantörerna beskriver sin modell som liten, snabb och effektiv, och båda talar sanning om en annan maskin.

Det finns en andra lucka bakom den första, och det är den som faktiskt förändrar planer. Varken Clef eller LFM2.5 2.6B Base svarar på en fråga direkt ur lådan på det sätt som du förmodligen förväntar dig. Clef levereras fulltränad för en uppgift som den inte kan avvika från: den svarar på frågor som skrivs in och gör inget annat. Liquid-checkpointen kommer otränad för allt — det är en basmodell, avsiktligt utan instruktionsträning, och Liquid AI:s eget modellkort säger att den endast rekommenderas för omfattande finjustering. Så den egentliga frågan är inte vilken av dem som är billigare att köra. Det handlar om huruvida du köper en färdig komponent eller ett utgångsmaterial, och svaret är olika för dem båda.

Var var och en körs, och varför det är hela jämförelsen

Driftsättningsformen är inte en bisak för dessa två modeller. För en beslutsmodell är den arkitekturen, eftersom en framåtpassning på 209 ms och en "körs på maskinen framför dig"-berättelse är samma påstående berättat från olika ändar.

• Parametrar — 27B för Clef, med Qwen3.8-27B-visionencodern bevarad; 2,69B endast text för LFM2.5 2.6B Base.

• Disk — ett 55 GB stort arkiv för Clef; en safetensors-fil på 5,4 GB för Liquid-checkpointen, med kvantiserade GGUF-, ONNX- och MLX-byggen publicerade vid sidan av.

• Hårdvara — Cloudflare testade Clef med torch 2.11 och transformers 5.10.2 på en enda H200, och dess latenssiffror kommer från den körningen. Liquid AI:s eftertränade syskon till denna checkpoint körs i 220 tokens per sekund på en Apple M5 Max och 113 tok/s på en AMD Ryzen-CPU, i under 2,5 GB minne, och tillverkaren noterar att 30 tok/s är uppnåeligt på en telefon.

• Kontext — 65 536 tokens för Clef, enligt Workers AI-modellsidan och lanseringsinlägget; 131 072 tokens för LFM2.5 2.6B Base.

• Indata — Clef läser text, JSON, bilder och videobildrutor och poängsätter dem tillsammans. Liquid-checkpointen är endast text.

• Licens — Apache-2.0 för Clef. LFM Open License v1.0 för LFM2.5, som är source-available snarare än OSI-öppen källkod: kommersiell användning är villkorad av att din organisation håller sig under 10 miljoner dollar i årlig omsättning, och över den gränsen beviljar licensen den helt enkelt inte. Det tröskelvärdet är ett upphandlingsfaktum, inte en fotnot.

A two-column comparison scoreboard titled 'Clef vs LFM2.5 2.6B Base — the scoreboard'. The left column 'Clef' reads: Parameters: 27B multimodal; On disk: 55 GB repository; Context: 65,536 tokens; Output: probability per option, no text; Hardware: H200 class, 209.3 ms median; Licence: Apache 2.0. The right column 'LFM2.5 2.6B Base' reads: Parameters: 2.69B text-only; On disk: 5.4 GB single file; Context: 131,072 tokens; Output: untuned text continuation; Hardware: laptop, 220 tok/s on M5 Max; Licence: LFM 1.0, $10M revenue threshold. A footer reads 'Clef figures per Cloudflare; LFM figures per Liquid AI's cards. Neither independently reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

Kostnad per beslut är inte samma fråga som kostnad per token

Det frestande draget här är att dividera två priser och utse en vinnare. Det håller inte när man ser till vad de två modellerna gör.

Clef kostar $0,24 per miljon indatatoken på Cloudflares Workers AI. Dess utdata är inte prosa, så den vanliga raden för utdatatoken finns inte; du betalar för tillstånd, en gång, och får en fördelning tillbaka. För ett routningslager som fattar miljontals små beslut om dagen är den siffran hela driftskostnaden, och det är en siffra du bara kan få från en leverantör snarare än från din egen elräkning.

LFM2.5 2.6B Base kostar ingenting per anrop och kan inte fatta ett beslut. För att få fram en kostnad per beslut ur den måste du först finjustera den på din uppgift, vilket innebär att samla in data, köra ett träningsjobb, utvärdera resultatet och först därefter upptäcka vad den kostar dig i kVA och ingenjörstid. Den attraktiva ekonomin hos en checkpoint på 2,6B är verklig, men den ligger nedströms arbete som ännu inte har gjorts, och personen som jämför priser per token har hoppat rakt förbi det.

Den ärliga beskrivningen är att detta är två olika köp. Clef är en komponent med ett listpris och en hostingräkning. Liquid-checkpointen är en råvara vars kostnad är den träningskörning du ändå kommer att betala för – och vars utdelning är att du efteråt äger artefakten helt och hållet, varpå marginalkostnaden för ett beslut verkligen är el. För en snäv, stabil uppgift med hög volym är den avvägningen ofta riktig. För en uppgift som du ännu inte har specificerat är det bakvänt, eftersom du inte kan finjustera mot ett mål som du inte kan beskriva.

En otränad basmodell är inte en sämre modell, den är en annan startlinje.

Det är frestande att tolka den saknade benchmarktabellen för Liquid-checkpointen som en dold svaghet. Det är det inte. Att poängsätta en förtränad basmodell på benchmarkar för instruktionsföljning skulle mäta frånvaron av finjustering, inte kvaliteten på substratet, vilket är precis varför Liquid AI benchmarkar den eftertränade LFM2.5-2.6B och lämnar basen outvärderad. Tomrummet går att verifiera från din sida, och det är poängen: ladda ner 5,4 GB, kör din egen utvärdering på din egen uppgift och vet svaret innan du bestämmer dig för att serva något.

Clefs tabell har motsatt form av bevisning och har det motsatta problemet. Cloudflare publicerar ett fyrtiotal benchmark-rader, en komplett uppsättning för arbetsflödesutvärdering och en latensfördelning, och varenda en av dem har tagits fram av Cloudflare på Cloudflares eget Decision Index, utan att någon tredje part har reproducerat något av det. Clef-kolumnen är långt mer informativ än Liquid-kolumnen, och inte en enda siffra i den har kontrollerats av någon annan. Det är ett starkare påstående än en tom ruta, och ett svagare än det verkar.

Det du själv kan mäta delas upp på samma sätt. Med Liquid-checkpointen kan du mäta allt – den är 5,4 GB på din egen disk. Med Clef är Apache-2.0-vikterna lika mycket dina att ladda ner och köra, men att matcha Cloudflares median på 209 ms kräver den GPU-klass som Cloudflare använde, så i praktiken kommer de flesta team att mäta den via den hostade slutpunkten och ärva leverantörens tillgänglighet tillsammans med dess latens.

Var routinglagret passar in, för var och en av dem

Varken Clef eller någon LFM2.5-variant är en route på OrcaRouter, och den här artikeln är inte ett påstående om tillgänglighet – katalogen returnerar 404 för båda, så Clef kommer från Cloudflares Workers AI eller din egen GPU och Liquid-checkpointen kommer från sin egen distribution.

Vad ett routningslager egentligen är till för här är det mönster som båda modellerna antyder. En liten avgränsad scorer som fattar beslut, och en större generalist som agerar på beslutet, är en tvåmodellsarkitektur per konstruktion – och Clefs egen backbone gör den andra halvan av det konkret, eftersom modellen som Cloudflare eftertränade från, Qwen3.8 27B, är en listad route till $0.33 per miljon input- och $2.40 per miljon output-tokens över ett kontextfönster på 262 144 tokens. En endpoint framför över 200 modeller innebär att den billiga beslutsfattaren och den kapabla aktören sitter bakom samma nyckel, komponerade till ett enda anrop genom routnings-DSL:en i stället för att kopplas ihop manuellt, med automatisk failover så att en leverantörs dåliga eftermiddag inte tar ner beslutsvägen med sig. Om du i stället självhostar Liquid-checkpointen och jämför din finjustering mot de modeller den måste slå, är samma endpoint det som gör den jämförelsen till en konfigurationsändring i stället för en upphandlingscykel.

TypeSafe:s Jev 1.13 förtjänar att nämnas särskilt för självhostningsfallet: det är den beslutsmodell som Cloudflare benchmarkade mot och som medvetet talar samma POST /v1/systemone-förfrågningsform som Clef, det är en listad rutt till $0.042 per miljon indatatoken över en kontext på 65 536 token, och det är det enkla sättet att ta reda på om en avgränsad beslutsmodell hjälper din pipeline innan du lägger en träningskörning på ett substrat som kanske inte behöver existera.

A headless capture of the OrcaRouter model page for qwen/qwen3.8-27b, showing the Qwen breadcrumb, the Qwen3.8 27B title with a 262K context marker, the text, image and video input modalities, and the site's Code samples, Pricing, Performance, Public benchmarks and FAQ navigation tabs.

Vilken, för vad?

Ta Liquid-checkpointen när uppgiften är avgränsad, högvolym, specificerad tillräckligt väl för att kunna skriva träningsdata för den och begränsad av en av de två hårda begränsningar som ett routat API inte kan åtgärda: data inte får lämna din infrastruktur, eller maskinen den måste köras på är den som står på ditt skrivbord. Tröskelvärdet för intäkter i LFM 1.0 är det första du bör kontrollera, eftersom det avgör om licensen ens är tillgänglig för dig.

Välj Clef när beslutet redan är enumererbart, tillståndet ryms i 64K, svaret behöver en kalibrerad sannolikhet snarare än en mening, och 209 ms i en het kodväg är egenskapen du köper. Dess fasta schema är finessen – ett granskningsbart, reproducerbart, parserfritt utdataform – och dess 55 GB fotavtryck är priset för ryggraden som gör den träffsäker på första försöket i stället för efter en träningskörning.

Det du inte bör göra är att välja utifrån antal parametrar. En 2,69B-modell som måste tränas innan den kan svara är inte en mindre version av en 27B-modell som redan kan det, och de två siffrorna i titeln – 55 GB och 5,4 GB – beskriver två olika budgetar, inte två punkter på en och samma skala.

A headless capture of the LiquidAI/LFM2.5-2.6B-Base model card on Hugging Face, showing the model title, the TextGeneration and Transformers and Safetensors tags, a 16-languages marker, the Liquid AI organisation, and the opening line describing the LFM2.5 family as hybrid models designed for on-device deployment.

Den öppna frågan, och den är densamma för båda.

Ingen av leverantörerna har publicerat bevis som håller för oberoende granskning. Cloudflares Decision Index-körning är egenutförd och inte reproducerad; Liquid AI:s genomströmningssiffror är leverantörens egna mätningar på hårdvara som den själv valt. LFM2.5 2.6B Base har inget benchmark alls, avsiktligt, och Clef-tabellen har väldigt många, av eget val.

För Liquid-checkpointen är de saknade bevisen billiga att åtgärda och helt i din hand — filen är tillräckligt liten för att utvärderas på en bärbar dator under en eftermiddag. För Clef är det inte det: att reproducera medianen på 209 ms kräver den hårdvara som Cloudflare använde och det tillstånd som ingen utanför Cloudflare har satt samman. Den asymmetrin, mer än något annat i någon av specifikationerna, är det som bör styra vilken av dessa två du planerar runt den här månaden.