
LFM2.5-2.6B-Base: Liquid AI:s tystaste släpp är det som finjusterare faktiskt ville ha
- qwenNYQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 per 1M tokens · 56 tok/s
- deepseekNYDeepSeek: DeepSeek V4 Flash 07312026-07-3150Intelligens69Kodning
- qwenNYQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens · 201 tok/s
- orcaNYOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNYAnthropic: Claude Opus 52026-07-2461Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2150Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1651Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1557Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligens77Kodning
- grokxAI: Grok 4.52026-07-0854Intelligens72Kodning
- tencentTencent: Hy32026-07-0641Intelligens59Kodning
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligens42Kodning
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligens39Kodning
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligens72Kodning
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligens52Kodning57Matematik
- z-aiZ.ai: GLM 5.22026-06-1651Intelligens69Kodning60Matematik
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligens61Kodning61Matematik
Läs av Hugging Face-räknarna den 5 augusti 2026, och gapet är svårt att missa: LFM2.5-2.6B, den agentiska on-device-modellen som Liquid AI lanserade den 4 augusti, ligger på 47 393 nedladdningar. LFM2.5-2.6B-Base, den förtränade checkpointen som alla dessa vikter härstammar från, ligger på 151. Samma organisation, samma arkitektur, samma vecka, en skillnad på 314 mot 1.
Bascheckpointen läckte inte och var inte dold. Den förekom i Liquids lanseringsinlägg i exakt en parentes — "Basmodellen (LFM2.5-2.6B-Base) och den posttränade modellen (LFM2.5-2.6B) finns tillgängliga idag på Hugging Face" — och det är hela den publicerade redogörelsen om den. Inga egna riktmärken, inget avsnitt, inget separat kort. Allt nedan är direkt avläst från repositoryt — modellkortet, config.json, LICENSE-filen och Hugging Face API:t — plus beräkningar vi gjort själva. När en siffra kommer från Liquids egna utvärderingar säger vi det, eftersom det viktigaste med just den här checkpointen är hur lite som faktiskt har mätts.
Det betyder mer än en fotnot antyder. En posttränad modell kan du bedöma genom att prova den. En basmodell är ett erbjudande om att spendera två veckor och en GPU-budget innan du lär dig något, så villkoren i erbjudandet – vad som ingår, vad den är licensierad för, vad som har utvärderats – är hela beslutet.
Vad finns egentligen i arkivet?
Nio filer, en shard av vikter, ingen modelleringskod. Kortets specifikationslista, verifierad mot config.json:
• 2,69B parametrar totalt, bfloat16, i en enda 5,39 GB model.safetensors. Planera lagring och VRAM utifrån den siffran, inte utifrån "2,6B."
• 30 layers, hybrid. The card says 22 double-gated short convolution blocks plus 8 GQA attention layers. The layer_types array in config.json confirms it exactly: 22 entries of conv and 8 of full_attention, the attention layers spaced roughly every third or fourth block rather than clustered.
• 2048 i dold bredd, 10752 i mellanlagret, 32 uppmärksamhetshuvuden över 8 nyckel-värde-huvuden — ett 4-till-1 GQA-förhållande — med delade in- och utdata-embeddings och en rope theta på 10 000 000.
• vokabulär på 128 000 tokens, och en tokenizer på 18 MB som hör till. Liquid dubblerade vokabulären i denna generation, vilket är en betydande kostnad vid 2,6B: med delade inbäddningar står vokabulärtabellen ensam för cirka 262M av parameterbudgeten, nära en tiondel av modellen.
• 34 biljoner träningstokens.Det är en ovanligt lång förträningskörning för denna storleksklass, och det är det enskilt starkaste skälet att överhuvudtaget titta på kontrollpunkten.
• 16 språk deklarerade: engelska, arabiska, kinesiska, franska, tyska, hindi, indonesiska, italienska, japanska, koreanska, polska, portugisiska, ryska, spanska, thailändska och vietnamesiska.
En inkonsekvens för den som planerar arbete med långa kontexter: kortet annonserar en kontextlängd på 131,072 tokens, medanconfig.json anger max_position_embeddings till 128,000. Liquids egen blogg och dokumentation säger båda 128K. Skillnaden på 3,072 token spelar ingen roll för de flesta, men om du skriver ett träningsskript som packar sekvenser till det annonserade maxvärdet, lita på konfigurationsfilen snarare än kortet.
Arkitektursträngen är den praktiska rubriken: model_type är lfm2 och klassen är Lfm2ForCausalLM — samma klass som LFM2 levererades med. LFM2.5 är utökad förträning och ny efterträning på en befintlig arkitektur, inte en ny sådan, så inget här behöver anpassad modelleringskod. Det är därför llama.cpp, vLLM, MLX, ONNX Runtime, SGLang och LM Studio alla stödde denna familj från dag ett, och varför finjusteringsvägen genom Unsloth och TRL fungerar utan patchar. Du behöver dock transformers>=5.0.0.
Kortet du får är den andra modellens kort.
Öppna basrepoet och den första rubriken är "LFM2.5-2.6B" — namnet på den posttränade modellen, inte den du tittar på. Det här är inte en petitess; hela sidan läses som instruct-kortet med ett basstycke inklippt i den, och tre av de efterlämnade artefakterna kan kosta dig rejält med tid.

• YAML-frontmattern säger base_mode: LiquidAI/LFM2.5-2.6B-Base. Två problem på en rad: nyckeln är en felstavning av Hugging Faces base_model, och den får basrepoet att peka på sig självt. Inget går sönder, men länkarna i modellträdet som du skulle förvänta dig från en korrekt deklarerad härstamning genereras inte från detta.
• Repositoryt är taggat med conversational och inkluderar en chat_template.jinja, så Hugging Face visar en "Chat template"-badge på en checkpoint som aldrig har instruktionsfinjusterats. En mall finns eftersom tokenizer-konfigurationen ärvdes, inte för att vikterna vet vad de ska göra med den.
• Snabbstartskodexemplet använder sedan den mallen. Python-exemplet på baskortet anropar tokenizer.apply_chat_template med ett {"role": "user"} meddelande och frågar "Vad är C. elegans?" — det klassiska sättet att få en basmodell att se trasig ut. Slå in en rå förtränad checkpoint i chattrundor och du får text som spårar ur, upprepar sig och fortsätter av sig själv, och det är lätt att tolka det som en dålig modell snarare än fel promptformat. Prompta den här som en textkompletterare, few-shot, med stoppsekvenser du styr.
• Varianstabellen listar endast den posttränade linjen — LFM2.5-2.6B, plus dess GGUF-, ONNX- och MLX-versioner. Det finns ingen GGUF- eller MLX-version av bascheckpointen alls, så "kör det lokalt ikväll i LM Studio" är inte aktuellt utan att du konverterar det själv.
Hugging Face rapporterar också att ingen inferensleverantör servar detta arkiv. Det finns ingen hostad slutpunkt för bascheckpunkten någonstans; om du vill ha dess logits, så hyr du GPU:n.
Det benchmarkavsnitt som inte finns.
Inget enda utvärderingsvärde har publicerats för LFM2.5-2.6B-Base. Varken MMLU, MMLU-Pro, GPQA, HellaSwag, ARC eller någon perplexitetssiffra – ingenting, på någon av Liquids tre ytor (modellkortet, lanseringsinlägget, dokumentationen). För en basmodell är detta en påfallande frånvaro, eftersom dessa kunskaps- och resonemangspoäng är precis hur du bedömer om 34T tokens av förträning lämnade dig något värt att finjustera.
Det som finns tillhör den posttränade syskonmodellen, rapporteras av Liquid och har inte oberoende reproducerats. I Liquids egna utvärderingar får LFM2.5-2.6B 51,87 på AIME25, 59,17 på IFBench, 80,07 på Multi-IF, 56,88 på BFCLv4, 77,83 på ToolSandbox och 26,89 på BrowseComp+ i OpenClaw-ramverket, mätt mot gemma-4-E2B-it (5,1B), gemma-4-E4B-it (8B), Qwen3.5-4B (4,7B) och Qwen3.5-9B (9,7B). Liquids sammanfattning är att den leder varje benchmark för instruktionsföljning och nästan varje benchmark för verktygsanvändning, och dess eget diagram är ärligt om undantagen: Qwen3.5-9B ligger före på AIME25 med 56,07 och på BFCLv4 med 60,13. Hastighetspåståendena följer samma regel — 220 tokens/s i avkodning på en M5 Max, 113 på en Ryzen AI Max+ 395, cirka 30 på en telefon, under 2,5 GB minne och ungefär 15 000 utdatatoken/s vid hög samtidighet på en H100 — allt uppmätt av leverantören, inget verifierat av någon annan ännu.
Fällan är att anta att något av det överförs. De poängen är produkten av en fyrastegs-pipeline som applicerats ovanpå denna kontrollpunkt: två omgångar av övervakad finjustering, per-domän-lärarspecialisering, multi-domän on-policy-destillation, sedan agentisk förstärkningsinlärning med GRPO som körs i riktiga testmiljöer. Verktygsanrop och instruktionsföljning är exakt de beteenden som den pipelinen installerar. Ta basvikterna så börjar du före allt detta. Det du ärver är förträningen — språken, världskunskapen, den långa kontextförmågan, den effektiva hybridarkitekturen — och du bör anta att du inte ärver något av den agentiska poängtavlan.
151 nedladdningar är inte bara tidigt — det avviker från familjens eget mönster.
Liquid skickar rutinmässigt ut bascheckpoints, så denna release är i sig inte anmärkningsvärd. Det är försummelsen som är mätbar. Att jämföra varje LFM2.5-basrepository med dess instruct-syskon samma dag ger en tydlig husnorm — och en tydlig avvikelse.

• LFM2.5-230M — 58 676 nedladdningar mot 6 982 för basmodellen: cirka 8 till 1.
• LFM2.5-350M — 94,526 mot 9,397: ungefär 10 mot 1.
• LFM2.5-1.2B — 583,914 för Instruct-bygget jämfört med 17,867 för basen: ungefär 33 till 1.
• LFM2.5-8B-A1B — 171,520 mot 3,996: ungefär 43 mot 1.
• LFM2.5-2.6B — 47,393 mot 151: ungefär 314 till 1.
En del av det är helt enkelt ålder; basrepot skapades den 1 augusti och instruktionsmodellen hade ett försprång på fyra dagar plus ett lanseringsinlägg. Men de äldre bascheckpunkterna i den här familjen landade mellan 8-till-1 och 43-till-1, så en storleksordning bortom den sämsta av dem är en verklig avvikelse snarare än en avrundningsartefakt från ett nytt repo.
Gillandena berättar en mer subtil historia. Basförvaret har 28 gillanden mot 151 nedladdningar — ungefär ett bokmärke för var femte nedladdning. Instruktionsmodellen har 232 gillanden mot 47 393, ungefär ett för var 204:e. Människor markerar bascheckpointen för att komma tillbaka till den, inte för att ladda ner den. Två community-fine-tuningar och sju kvantiseringar finns redan i dess modellträd, vilket är vad den ledande kanten av användning ser ut som innan volymen anländer.
"Utan begränsningar" är inte vad licensen säger.
Liquids lanseringssida beskriver releasen som open-weight: "Ladda ner, finjustera och distribuera utan begränsningar." Filen i repot säger något snävare, och det här är avsnittet att läsa två gånger om du överväger att bygga en produkt på dessa vikter.

Licensen är LFM Open License v1.0 — inte Apache-2.0, inte MIT, och inte samma villkor som de flesta små open-weight-modeller som du förmodligen jämför den med. Om jag citerar filen direkt: Sektion 5 har titeln "Commercial Use Limitation" och lyder: "De rättigheter som beviljas enligt denna licens för kommersiellt bruk är villkorade av att Du eller Din juridiska person inte överskrider Tröskeln," följt av "All kommersiell användning av Verket eller ett härlett verk av en juridisk person som överskrider Tröskeln är inte licensierad enligt detta avtal." Sektion 1 definierar Tröskeln som "en årlig intäkt på 10 miljoner US-dollar ($10,000,000) eller mer."
Så den praktiska tolkningen:
• Under 10 MUSD i årlig omsättning — du har en bred, evig, royaltyfri upplåtelse som omfattar reproduktion, bearbetningar, distribution och underlicensiering, inklusive kommersiellt bruk.
• På eller över 10 miljoner USD — kommersiell användning är inte licensierad enligt detta avtal. Inte "kräver erkännande," inte "kräver meddelande." Du måste kontakta Liquid, vilket förmodligen är anledningen till att kortet avslutas med en länk till deras säljteam.
• Derivatverk ärver begränsningen. Din finjustering av denna kontrollpunkt är ett Derivatverk, så en modell som du lägger ett kvartal på att träna har samma intäktsvillkorade rättighet. Om ditt företag passerar tröskeln — eller förvärvas av ett företag som redan har gjort det — ändras villkoren som din produkt är beroende av under den.
• Kvalificerade ideella organisationer undantas: Tröskelvärdet gäller inte för en 501(c)(3)-organisation eller utländsk motsvarighet som använder verket för icke-kommersiella eller forskningsändamål. Vanliga skyldigheter gäller också — vidarebefordra licensen, behåll attributionsmeddelandena, markera filer du har ändrat.
Inget av detta gör släppet snål; en tröskel på 10 miljoner dollar undantar nästan varje startup och forskare, och det är ett legitimt sätt att publicera vikter. Men "utan restriktioner" är marknadsföringstext som licensen motsäger, och diskrepansen svider som mest just här. Finjustering av en bascheckpoint är det dyraste och minst reversibla sättet att använda en modell. Det är det sämsta stället att upptäcka en intäktsklausul.
Vem bör egentligen ta denna checkpoint?
Liquids egen vägledning är uppfriskande snäv och värd att följa: kortet säger att den förtränade checkpointen är "endast rekommenderad för uppgifter som kräver tung finjustering, som språkspecifika (t.ex. japanska) eller domänspecifika (t.ex. medicinska) assistenter, träning på proprietära data, eller experiment med nya post-training-metoder." Det ordet "endast" gör verkligen jobbet. Om du vill ha en agent på enheten som anropar verktyg, är den posttränade LFM2.5-2.6B definitivt den bättre utgångspunkten och bascheckpointen kommer att slösa bort din månad.
Fallen där det verkligen är rätt val:
• Ett språk som efterträningen underbetjänar. 34 biljoner tokens över 16 språk är en stark flerspråkig grund, och Liquid har redan bevisat mönstret internt med en japansk byggversion i 1.2B-serien. Fortsatt förträning på ditt språk, följt av din egen instruktionsfinjustering, undviker att kämpa mot en engelskscentrerad eftertränad persona.
• En reglerad vertikal med proprietär data. Under 2,5 GB vid inferens, inget molnberoende och en tillräckligt tillåtande licens under intäktströskeln är en sällsynt kombination för medicinska, juridiska eller industriella driftsättningar där data inte kan lämna enheten.
• Post-träningsforskning.Liquid publicerade sitt recept — SFT, lärarspecialisering, MOPD, agentisk RL — och överlämnade sedan den exakta indatan till receptet tillsammans med utdatan. Att kunna köra din egen metod på samma startvikter och diffa mot en stark referensimplementation är ovanligt och värdefullt.
• Destilleringsmål. En 2.6B-hybrid som avkodar med 220 tokens/s på en bärbar dator är en attraktiv elev för att komprimera en mycket större lärare till något som går att leverera.
Det sista paret är där kostnaden faktiskt hamnar, och det är inte GPU-timmar — det är data. Liquids pipeline bygger på lärarspecialisering och on-policy-destillering, vilket innebär att det verkliga förkravet för att återskapa något liknande är en stor volym genererad data från starkare modeller, plus preferenspar och verifierbara belönings-rollouts. Det är ett jobb som involverar många modeller innan det blir ett träningsjobb: du vill jämföra kandidatlärare inom din domän och sedan generera i volym från den som vinner. Det är den del av arbetet som vår egen produkt är inriktad på — OrcaRouter sätter 200+ modeller bakom en API-nyckel med 0 % påslag, så vad du betalar för en syntetisk SFT-uppsättning är leverantörens listpris snarare än ett routingpåslag (när en leverantör sänker priser landar det hos oss samma dag), automatisk failover förhindrar att en tjugotimmars generationskörning dör på en leverantörs dåliga timme, och routing-DSL:et låter dig sprida en enda prompt över flera lärare och behålla det bästa svaret. För att vara tydlig med vad vi inte erbjuder: LFM2.5-2.6B-Base finns inte på OrcaRouter och ingen inferensleverantör hostar den — du kör dessa vikter själv. Vi är användbara för lärarna, inte eleven.
Samma uppdelning är värd att ha i åtanke för allt du levererar. Liquids inlägg hävdar att lokala agenter gör inferens gratis och tar bort kostnaden per token som en begränsning, vilket gäller för den marginella token men inte för den totala räkningen – du har förbetalt den i hårdvara, och en 2.6B-modell har fortfarande ett tak. Liquid säger det själv och avråder från denna familj för kodningsintensivt eller kunskapsintensivt agentarbete. Det hållbara mönstret är en finjusterad lokal modell som hanterar den högfrekventa vanliga vägen på enheten och eskalerar den svåra minoriteten till en frontier-modell via ett API, vilket bevarar integritets- och latensfördelarna där de spelar roll utan att låtsas att 2.6B parametrar kan göra allt.
Vägen från dessa vikter till något användbart
Lanseringsinlägget har ingenting att säga om detta, men baskortet bär tyst på det mest praktiska i hela arkivet: sju färdiga Colab-notebooks som täcker de exakta pipeline-steg som en baskontrollpunkt behöver. Två av dem är fortsatt förträning — en för textkomplettering, en för översättning — vilket är steget som bara är meningsfullt från basvikter och det som ingen skriver handledningar för. Resten täcker övervakad finjustering via Unsloth och TRL, DPO via TRL och GRPO via båda. Liquid levererar också LEAP Finetune som en egen träningsstack om du hellre inte vill sätta ihop en.
Om man läser Liquids fine-tuning-dokumentation mot den här modellens form, ser den realistiska sekvensen ut så här:
• Använd den som kompletterare först, innan du tränar något. Ignorera chattmallen på kortet. Few-shot, rå text, dina egna stoppsekvenser. Så här får du reda på om förträningen redan täcker din domän och ditt språk, vilket avgör om du överhuvudtaget behöver fortsatt förträning eller kan hoppa direkt till SFT.
• Fortsatt förträning endast om du tillför kunskap eller ett språk. Detta är den dyra grenen — korpus-skala, inte exempel-skala — och det enda som det posttränade syskonet verkligen inte kan ge dig.
• Sedan SFT med LoRA, på 500 till 5 000 exempel.Liquids egen vägledning är att kvalitet och distribution slår volym och att exemplen ska matcha produktionsindata. Vid 2,6B är ett LoRA-pass kort: dokumentationen anger en 1,2B-körning på minuter till tiotals minuter på ett modernt GPU, så den här storleken är fortfarande en eftermiddagsloop.
• Frys en undanhållen uppsättning innan du tränar. Rakt på sak, och värt att upprepa just för denna kontrollpunkt, eftersom det inte finns någon publicerad baslinje att jämföra med — ditt utvärderingsset är den enda siffran någon har.
• Preferens- eller RL-steg kommer sist, och endast om beteendet är problemet. DPO- och GRPO-recept finns för familjen, men de är en förfining ovanpå en modell som redan svarar; att sträcka sig efter dem innan SFT har landat är så projekt med bascheckpoints går i stå.
Notera vad som inte finns med på listan: ingenting här behöver en anpassad kernel, en patchad tränare eller en modelleringsfil. Eftersom LFM2.5 återanvänder LFM2-arkitekturen, passar bascheckpointen in i standardstacken, och hela kostnaden för detta projekt är korpusen och utvärderingssetet som du bygger för det.
Vad skulle förändra bilden
Tre saker är värda att bevaka, alla billiga för Liquid att lösa och ingen av dem löstes idag.
Den första är basutvärderingar. Ett enda MMLU-Pro- eller GPQA-resultat på den förtränade kontrollpunkten skulle berätta mer för finjusterare än alla agentiska riktmärken i lanseringsinlägget tillsammans, och det faktum att 34T token gick in gör frånvaron mer märklig, inte mindre. Den andra är själva kortet — ett basrepository vars rubrik namnger en annan modell, vars snabbstart applicerar en chattmall på en icke-chattmodell, och vars frontmatter stavar fel på base_model är en tio minuters fix som skulle hindra människor från att dra slutsatsen att vikterna är trasiga när instruktionerna är det. Den tredje är LFM2.5-teknikrapporten. Citeringsblocket pekar på arXiv 2511.23404, som är LFM2 teknikrapporten från november 2025; 2.5-generationens egen rapport är inte ute, så datamixen för förträning bakom dessa 34T token förblir inte offentliggjord.
Tills dess är den ärliga sammanfattningen att detta är en välspecificerad, långtränad, effektivt formgiven 2.6B-grundmodell med en ovanligt tydlig målgrupp, publicerad utan mätningar och med en intäktstaklicens, och hittills har nästan ingen tagit den ur lådan. Om du tillhör den målgrupp som kortet beskriver, är den värd din GPU-tid — och du kommer att vara bland de första någonstans att få veta hur bra den faktiskt är.
Frågor värda att besvara
Är detta samma checkpoint som LFM2.5-2.6B eftertränades från, eller en separat förträningskörning?
Modellkortet anger att LFM2.5-2.6B-Base "är den förtränade text-only-checkpointen som används för att skapa alla LFM2.5-2.6B-varianter", så det är den faktiska ingången till den publicerade pipelinen snarare än en parallell eller nedbantad version. Det är det som gör den användbar för post-training-forskning: din metod och Liquids fyra steg startar från identiska vikter, så en jämförelse mellan dem är meningsfull. Det är värt att notera att basrepositoryt skapades den 1 augusti och senast ändrades den 4 augusti, lanseringsdagen — kontrollera commit-historiken innan du antar att filen du laddade ner tidigt är den fil som faktiskt levererades.
Kan jag finjustera den och sälja resultatet?
Om din juridiska persons årliga intäkter understiger 10 000 000 USD, ja — LFM1.0-bidraget täcker kommersiell användning av derivatverk, förutsatt att licensen och attribueringsmeddelandena hålls intakta och att ändrade filer markeras. Vid eller över den tröskeln ligger kommersiell användning av modellen eller något som härletts från den utanför licensen och kräver en separat överenskommelse med Liquid. Tröskeln är knuten till din enhets intäkter snarare än till modellen eller de intäkter den genererar, så samma finjustering kan licensieras för ett företag men inte för ett annat, och ett företag som växer över gränsen behåller inte det bidrag det hade.
Varför inte bara finjustera den eftertränade LFM2.5-2.6B istället?
För de flesta projekt bör du göra det, och Liquids kort säger i praktiken samma sak. Anledningen att utgå från bascheckpunkten är när efterträningen arbetar emot dig snarare än för dig: tung fortsatt förträning på ett nytt språk eller en specialiserad korpus tenderar ändå att skada instruktionsanpassat beteende, och vägrarmönster, verktygsanropskonventioner och svarsstil som SFT och RL bakat in är svåra att ta bort och lätta att hamna i konflikt med. Om du lägger till kunskap eller ett språk, utgå från basen. Om du justerar beteende i marginalen, utgå från den eftertränade modellen och behåll de fyra arbetssteg som någon redan betalat för.
