
LFM2.5-2.6B-Base: Liquid AI의 가장 조용한 릴리스는 파인튜너들이 실제로 원했던 바로 그 모델이다
- qwenNEWQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 100만 토큰당 · 56 tok/s
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3150지능69코딩
- qwenNEWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당 · 201 tok/s
- orcaNEWOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNEWAnthropic: Claude Opus 52026-07-2461지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2150지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1651지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1557지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0951지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0955지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0959지능77코딩
- grokxAI: Grok 4.52026-07-0854지능72코딩
- tencentTencent: Hy32026-07-0641지능59코딩
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232지능42코딩
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226지능39코딩
- anthropicAnthropic: Claude Sonnet 52026-06-3053지능72코딩
- klingKling: Kling 3.0 Turbo2026-06-1757지능52코딩57수학
- z-aiZ.ai: GLM 5.22026-06-1651지능69코딩60수학
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242지능61코딩61수학
2026년 8월 5일 Hugging Face의 카운터를 살펴보면, 그 격차는 놓치기 어렵습니다: LFM2.5-2.6B는 Liquid AI가 8월 4일에 출시한 에이전틱 온디바이스 모델로, 다운로드 수는 47,393건입니다. LFM2.5-2.6B-Base는 그 모든 가중치의 기반이 되는 사전 학습 체크포인트로, 다운로드 수는 151건입니다. 같은 조직, 같은 아키텍처, 같은 주에 314대 1의 격차입니다.
기본 체크포인트는 유출되지도 않았고 숨겨지지도 않았습니다. 그것은 Liquid의 출시 게시물에서 정확히 한 쌍의 괄호 안에 등장했습니다 — "기본(LFM2.5-2.6B-Base) 및 사후 학습(LFM2.5-2.6B) 모델은 오늘 Hugging Face에서 이용할 수 있습니다" — 그리고 그것이 이에 대한 게시된 전체 설명입니다. 자체 벤치마크도 없고, 섹션도 없으며, 별도 카드도 없습니다. 아래의 모든 내용은 저장소에서 직접 읽은 것입니다 — 모델 카드, config.json, LICENSE 파일 및 Hugging Face API — 그리고 우리가 직접 수행한 계산까지 포함합니다. 숫자가 Liquid의 자체 평가에서 나온 경우에는 그렇게 명시합니다. 이 특정 체크포인트의 경우 가장 중요한 사실은 실제로 측정된 것이 얼마나 적은지이기 때문입니다.
그것은 각주가 암시하는 것보다 더 중요하다. 포스트 트레이닝된 모델은 직접 시도해 보고 판단할 수 있다. 기본 체크포인트는 무엇을 알기 전에 2주와 GPU 예산을 쓰게 만드는 제안이므로, 그 제안의 조건 — 무엇이 들어 있고, 어떤 용도로 라이선스되며, 무엇이 평가되었는지 — 가 결정의 전부다.
저장소에 실제로 무엇이 들어 있나요?
Nine files, one shard of weights, no modeling code. The card's specification list, corroborated against config.json:
• 총 2.69B 파라미터, bfloat16, 단일 5.39 GB model.safetensors입니다. 저장 공간과 VRAM은 그 숫자 기준으로 계획하세요. "2.6B" 기준이 아닙니다.
• 30개 레이어, 하이브리드. 카드에는 22개의 이중 게이트 단기 컨볼루션 블록과 8개의 GQA 어텐션 레이어가 있다고 나와 있습니다. layer_types 배열은 config.json에서 정확히 확인할 수 있습니다: conv 항목 22개와 full_attention 항목 8개이며, 어텐션 레이어는 한곳에 모여 있지 않고 대략 세 번째 또는 네 번째 블록마다 배치되어 있습니다.
• 은닉 너비 2048, 중간 크기 10752, 8개의 키-값 헤드에 대한 32개의 어텐션 헤드 — 4:1 GQA 비율 — 입력 및 출력 임베딩을 공유하고 rope theta는 10,000,000입니다.
• 128,000-토큰 어휘와 함께 제공되는 18 MB 토크나이저도 있습니다. Liquid는 이번 세대에서 어휘 크기를 두 배로 늘렸는데, 이는 2.6B 규모에서 의미 있는 비용입니다. 공유 임베딩을 사용하면 어휘 테이블만도 약 262M의 파라미터 예산을 차지하여, 모델의 약 10분의 1에 해당합니다.
• 34조 개의 학습 토큰. 이는 이 크기 등급에 비해 비정상적으로 긴 사전 학습 실행이며, 이 체크포인트를 살펴봐야 할 단 하나의 가장 강력한 이유입니다.
• 16개 언어 선언됨: 영어, 아랍어, 중국어, 프랑스어, 독일어, 힌디어, 인도네시아어, 이탈리아어, 일본어, 한국어, 폴란드어, 포르투갈어, 러시아어, 스페인어, 태국어, 베트남어.
long-context 작업을 계획하는 사람에게는 한 가지 불일치가 있습니다: 카드에는 컨텍스트 길이가 131,072토큰으로 광고되어 있는 반면, config.json에서는 max_position_embeddings이(가) 128,000으로 설정되어 있습니다. Liquid의 자체 블로그와 문서 모두 128K라고 말합니다. 3,072토큰 차이는 대부분의 사람에게 중요하지 않겠지만, 광고된 최대 길이까지 시퀀스를 패킹하는 학습 스크립트를 작성하는 경우에는 카드보다 구성 파일을 신뢰하세요.
아키텍처 문자열이 실질적인 핵심입니다: model_type은 lfm2이고 클래스는 Lfm2ForCausalLM — LFM2와 함께 제공된 동일한 클래스입니다. LFM2.5는 기존 아키텍처에 대한 확장된 사전 학습과 새로운 사후 학습으로, 새로운 것이 아니므로 여기에는 사용자 지정 모델링 코드가 필요하지 않습니다. 이것이 llama.cpp, vLLM, MLX, ONNX Runtime, SGLang 및 LM Studio가 모두 출시 첫날 이 제품군을 지원한 이유이며, Unsloth와 TRL을 통한 미세 조정 경로가 패치 없이 동작하는 이유입니다. 필요한 것은 transformers>=5.0.0입니다.
당신이 받는 카드는 다른 모델의 카드입니다.
Open the base repository and the first heading is "LFM2.5-2.6B" — the post-trained model's name, not the one you are looking at. This is not a nitpick; the whole page reads as the instruct card with a base paragraph spliced into it, and three of the artefacts left behind can cost you real time.

• YAML frontmatter에는 base_mode: LiquidAI/LFM2.5-2.6B-Base라고 명시되어 있습니다.한 줄에 두 가지 문제가 있습니다. 키는 Hugging Face의 base_model의 철자 오류이며, 기본 저장소를 자기 자신으로 가리킵니다. 아무것도 깨지지 않지만, 올바르게 선언된 계보에서 기대할 수 있는 모델 트리 링크는 이로 인해 생성되지 않습니다.
• 이 저장소는 conversational 태그가 지정되어 있으며 chat_template.jinja 파일을 포함합니다. 따라서 Hugging Face는 인스트럭션 튜닝이 전혀 되지 않은 체크포인트에 "Chat template" 배지를 표시합니다. 템플릿이 존재하는 이유는 토크나이저 구성이 상속되었기 때문이지, 가중치가 그 용도를 알기 때문이 아닙니다.
• 그런 다음 빠른 시작 스니펫은 해당 템플릿을 사용합니다. 기본 카드의 Python 예제는 tokenizer.apply_chat_template을(를) 다음과 같은 {"role": "user"} 메시지와 함께 호출하며 "C. elegans란 무엇인가?"라고 묻습니다. 이는 기본 모델이 고장난 것처럼 보이게 하는 전형적인 방법입니다. 원시 사전 학습 체크포인트를 채팅 턴으로 감싸면 표류하는, 반복되는, 스스로 이어지는 텍스트가 생성되고, 이를 잘못된 프롬프트 형식이 아니라 나쁜 모델로 오인하기 쉽습니다. 이 모델은 텍스트 완성기로, 퓨삿(few-shot) 방식으로, 사용자가 제어하는 중지 시퀀스와 함께 프롬프트하십시오.
• 변형 표에는 사후 훈련된 라인만 나열되어 있습니다 — LFM2.5-2.6B 및 해당 GGUF, ONNX, MLX 빌드가 포함됩니다. 기본 체크포인트의 GGUF 또는 MLX 빌드는 전혀 없으므로, 직접 변환하지 않는 한 "오늘 밤 LM Studio에서 로컬로 실행"은 불가능합니다.
Hugging Face는 또한 어떤 추론 제공자도 이 리포지토리를 서비스하지 않는다고 보고합니다. 기본 체크포인트에 대한 호스팅 엔드포인트는 어디에도 없습니다. 그 logits이 필요하면 GPU를 임대해야 합니다.
존재하지 않는 벤치마크 섹션
LFM2.5-2.6B-Base에 대해 공개된 평가 수치는 단 하나도 없습니다. MMLU도, MMLU-Pro도, GPQA도, HellaSwag도, ARC도, perplexity 수치도 — Liquid의 세 가지 표면(모델 카드, 출시 게시물, 문서) 어디에도 아무것도 없습니다. 베이스 체크포인트로서 이는 매우 눈에 띄는 누락입니다. 지식과 추론 점수야말로 34T 토큰의 사전 학습이 미세 조정할 가치가 있는 무언가를 남겼는지를 정확히 판단하는 기준이기 때문입니다.
존재하는 것은 포스트 트레이닝된 형제 모델에 속하며, Liquid가 보고한 것으로 아직 독립적으로 재현되지 않았다. Liquid의 자체 평가에서 LFM2.5-2.6B는 OpenClaw 하네스 내에서 gemma-4-E2B-it(5.1B), gemma-4-E4B-it(8B), Qwen3.5-4B(4.7B), Qwen3.5-9B(9.7B)와 비교하여 AIME25에서 51.87, IFBench에서 59.17, Multi-IF에서 80.07, BFCLv4에서 56.88, ToolSandbox에서 77.83, BrowseComp+에서 26.89를 기록했다. Liquid의 요약에 따르면 이 모델은 모든 지시 수행 벤치마크와 거의 모든 도구 사용 벤치마크에서 앞서며, 자체 차트는 예외를 솔직히 인정한다: Qwen3.5-9B가 AIME25에서 56.07, BFCLv4에서 60.13으로 앞선다. 속도 주장도 같은 규칙을 따른다. M5 Max에서 초당 220토큰 디코딩, Ryzen AI Max+ 395에서 113, 휴대폰에서 약 30, 메모리 2.5GB 미만, H100 하나에서 높은 동시성으로 초당 약 15K 출력 토큰 — 모두 공급업체 측정치이며, 아직 다른 누구도 검증하지 않았다.
The trap is assuming any of that transfers. Those scores are the product of a four-stage pipeline applied on top of this checkpoint: two rounds of supervised fine-tuning, per-domain teacher specialisation, multi-domain on-policy distillation, then agentic reinforcement learning with GRPO run inside real harnesses. Tool-calling and instruction-following are exactly the behaviours that pipeline installs. Take the base weights and you are starting before all of it. What you inherit is the pre-training — the languages, the world knowledge, the long-context capability, the efficient hybrid architecture — and you should assume you inherit none of the agentic scoreboard.
151회 다운로드는 단순히 이른 것만이 아니라 — 가족 고유의 패턴에서 벗어난 것입니다.
Liquid는 기본 체크포인트를 정기적으로 출시하므로, 이번 릴리스는 종류에 있어 특별할 것이 없다. 측정할 수 있는 것은 바로 그 소홀함이다. 각 LFM2.5 기본 저장소를 같은 날짜의 instruct 자매 모델과 비교하면 분명한 하우스 표준이 드러나고, 하나의 명확한 이상치도 드러난다.

• LFM2.5-230M — 기본 모델의 6,982회에 비해 58,676회 다운로드: 약 8 대 1.
• LFM2.5-350M — 94,526 대 9,397: 약 10 대 1.
• LFM2.5-1.2B — Instruct 빌드는 583,914건, 기본 빌드는 17,867건으로 약 33:1입니다.
• LFM2.5-8B-A1B — 171,520 대 3,996: 약 43 대 1.
• LFM2.5-2.6B — 47,393 대 151: 약 314 대 1.
그중 일부는 단순히 시간 때문입니다. 기본 저장소는 8월 1일에 생성되었고, 인스트럭트 모델은 4일의 선두 이점과 출시 게시물이 있었습니다. 그러나 이 계열의 더 오래된 기본 체크포인트들은 8:1에서 43:1 사이에 안정되었으므로, 그중 최악의 경우보다 한 자릿수 이상 벗어난 수치는 새 저장소의 반올림 오류라기보다 실제 이상 현상입니다.
좋아요 수는 더 미묘한 이야기를 들려줍니다. 기본 저장소는 다운로드 151회에 좋아요 28개로, 대략 다운로드 5회마다 북마크 1개꼴입니다. 인스트럭트 모델은 다운로드 47,393회에 좋아요 232개로, 약 204회마다 1개꼴입니다. 사람들은 기본 체크포인트를 내려받기보다는, 나중에 다시 찾아보려고 북마크해 두고 있습니다. 이미 두 개의 커뮤니티 파인튠과 일곱 개의 양자화 버전이 해당 모델 트리에 존재하는데, 이는 본격적인 유입이 있기 전 채택의 최전선이 어떤 모습인지 보여줍니다.
"제한 없이"라고 라이선스에 쓰여 있는 것은 아니다.
Liquid의 출시 페이지에서는 이번 릴리스를 오픈 가중치라고 설명합니다: "제한 없이 다운로드하고, 파인튜닝하고, 배포할 수 있습니다." 리포지토리의 파일에는 이보다 더 제한적인 내용이 명시되어 있으며, 이러한 가중치를 기반으로 제품을 구축하려 한다면 이 섹션을 두 번 읽어야 합니다.

라이선스는 LFM Open License v1.0 — Apache-2.0도 아니고, MIT도 아니며, 여러분이 아마 비교하고 있을 대부분의 소형 오픈웨이트 모델과도 조건이 같지 않습니다. 파일을 직접 인용하면, 섹션 5의 제목은 "상업적 사용 제한"이고 내용은 다음과 같습니다: "이 라이선스에 따라 부여된 상업적 사용 권리는 귀하 또는 귀하의 법인이 임계값을 초과하지 않는 경우에 한합니다," 이어서 "임계값을 초과하는 법인에 의한 저작물 또는 파생 저작물의 상업적 사용은 본 계약에 따라 허가되지 않습니다." 섹션 1은 임계값을 다음과 같이 정의합니다: "연간 수익이 미화 1천만 달러($10,000,000) 이상."
그래서 실용적인 해석은:
• 연간 매출 1,000만 달러 미만 — 복제, 2차적 저작물 작성, 배포 및 서브라이선싱을 포함한 광범위하고 영구적이며 로열티가 없는 권리가 부여되며, 상업적 이용도 포함됩니다.
• $1,000만 달러 이상 — 상업적 사용은 본 계약에 따라 라이선스가 부여되지 않습니다. '저작자 표시 필요'도 아니고 '통지 필요'도 아닙니다. Liquid에 문의해야 합니다. 아마도 이것이 카드 끝에 영업 팀 링크가 있는 이유일 것입니다.
• 파생 저작물은 그 제한을 상속받습니다. 이 체크포인트를 파인튜닝한 결과물은 파생 저작물이므로, 한 분기 동안 훈련시킨 모델도 동일한 수익 조건부 라이선스를 갖습니다. 회사가 기준을 초과하거나 — 이미 기준을 초과한 회사에 인수되면 — 제품이 의존하는 조건이 밑바닥에서 바뀌게 됩니다.
• 적격 비영리 단체는 제외됩니다: 임계값은 비상업적 또는 연구 목적으로 저작물을 사용하는 501(c)(3) 또는 이에 상응하는 외국 기관에는 적용되지 않습니다. 일반적인 의무도 적용됩니다 — 라이선스를 전달하고, 저작자 표시를 유지하고, 변경한 파일을 표시하십시오.
이 중 어느 것도 릴리스를 인색하게 만들지 않습니다. 1천만 달러 기준은 거의 모든 스타트업과 모든 연구자를 면제하며, 가중치를 공개하는 합법적인 방법입니다. 그러나 "제한 없음"은 라이선스가 모순되는 마케팅 문구이며, 그 불일치는 정확히 이 지점에서 가장 크게 문제가 됩니다. 기본 체크포인트를 파인튜닝하는 것은 모델을 도입하는 가장 비용이 많이 들고 가장 되돌리기 어려운 방식입니다. 그것이 수익 조항을 발견하기에 가장 나쁜 지점입니다.
실제로 이 체크포인트를 누가 맡아야 하나요?
Liquid 자체의 지침은 상쾌할 만큼 좁게 잡혀 있으며, 따를 가치가 있습니다. 카드에 따르면 사전 훈련된 체크포인트는 "무거운 파인튜닝이 필요한 작업, 예를 들어 언어 특화(예: 일본어) 또는 도메인 특화(예: 의료) 어시스턴트, 독점 데이터 훈련, 혹은 새로운 포스트트레이닝 접근법 실험에만 권장됩니다." 그 "only"라는 단어는 실질적인 의미를 담고 있습니다. 도구를 호출하는 온디바이스 에이전트를 원한다면, 포스트트레이닝된 LFM2.5-2.6B가 확실히 더 나은 시작점이며, 베이스 체크포인트로 시작하면 한 달을 허비하게 될 것입니다.
진정으로 올바른 선택인 경우:
• 포스트트레이닝이 충분히 지원하지 못하는 언어. 16개 언어에 걸친 34T 토큰은 강력한 다국어 기반이며, Liquid는 이미 1.2B 라인의 일본어 빌드로 이 패턴을 사내에서 입증했습니다. 여러분의 언어로 사전 학습을 이어간 다음 자체 지시 튜닝을 수행하면, 영어 중심의 포스트트레이닝된 페르소나와 싸울 필요가 없습니다.
• 독점 데이터를 가진 규제 산업 분야. 추론 시 2.5GB 미만, 클라우드 의존성 없음, 수익 기준 미만에서 충분히 허용적인 라이선스는 데이터가 기기를 벗어날 수 없는 의료, 법률, 산업 배포에 있어 드문 조합입니다.
• 사후 훈련 연구.Liquid는 SFT, 교사 전문화, MOPD, 에이전트 RL 등 자신의 레시피를 공개하고, 그 레시피에 대한 정확한 입력과 출력을 함께 제공했다. 동일한 시작 가중치로 자신의 방법을 실행하고 강력한 참조 구현과 비교할 수 있다는 것은 드물고 가치 있는 일이다.
• 증류 목표.노트북에서 초당 220토큰으로 디코딩하는 2.6B 하이브리드는 훨씬 더 큰 교사를 배포 가능한 무언가로 압축하기 위한 매력적인 학생이다.
그 마지막 쌍이 실제로 비용이 발생하는 지점이며, 그 비용은 GPU 시간이 아니라 데이터입니다. Liquid의 파이프라인은 교사 특화와 온-폴리시 증류에 기반하므로, 이와 유사한 것을 재현하기 위한 진정한 전제 조건은 더 강력한 모델에서 생성된 대량의 데이터와 선호 쌍, 검증 가능한 보상 롤아웃입니다. 이는 훈련 작업이라기보다 먼저 여러 모델이 필요한 작업입니다. 도메인에서 후보 교사 모델들을 비교한 다음, 승자로부터 대량으로 생성해야 하기 때문입니다. 이것이 바로 우리 제품이 겨냥하는 작업 영역입니다. OrcaRouter는 200개 이상의 모델을 0% 마크업으로 단일 API 키 뒤에 배치하므로, 합성 SFT 세트에 대해 지불하는 비용은 라우팅 프리미엄이 아니라 제공업체의 공식 가격입니다(벤더가 가격을 인하하면 그 혜택이 같은 날 우리 측에 반영됩니다). 자동 장애 조치는 20시간짜리 생성 실행이 특정 제공업체의 장애 시간에 중단되지 않도록 보장하며, 라우팅 DSL을 사용하면 단일 프롬프트를 여러 교사 모델로 분기시켜 최상의 답변을 유지할 수 있습니다. 우리가 제공하지 않는 것을 분명히 하자면, LFM2.5-2.6B-Base는 OrcaRouter에 없으며 어떤 추론 제공업체도 이를 호스팅하지 않습니다. 이 가중치는 직접 실행해야 합니다. 우리는 학생이 아니라 교사에게 유용합니다.
무엇을 출시하든 동일한 구분을 염두에 두는 것이 좋다. Liquid의 게시물은 로컬 에이전트가 추론을 무료로 만들고 토큰당 비용을 제약 조건에서 제거한다고 주장한다. 이는 한계 토큰에 대해서는 사실이지만 총 비용에 대해서는 사실이 아니다 — 이미 하드웨어에 선불로 지불했으며, 2.6B 모델에도 여전히 한계가 있다. Liquid 자신도 이 점을 인정하며, 코드 중심 또는 지식 집약적 에이전트 작업에는 이 모델군을 권장하지 않는다고 조언한다. 지속 가능한 패턴은 미세 조정된 로컬 모델이 기기에서 대량의 일반적인 경로를 처리하고, 어려운 소수의 경우를 API를 통해 프론티어 모델로 넘기는 것이다. 이렇게 하면 2.6B 파라미터가 모든 것을 할 수 있다고 가장하지 않으면서도, 프라이버시와 지연 시간 이점이 중요한 곳에서 유지된다.
이 가중치들로부터 실용적인 무언가로 이어지는 경로
The launch post에는 이에 대한 언급이 없지만, base card는 조용히 전체 저장소에서 {{1}}가장 실용적인 것을{{/1}} 담고 있습니다: base checkpoint가 필요로 하는 정확한 파이프라인 단계를 다루는 7개의 바로 실행 가능한 Colab 노트북입니다. 그중 두 개는 continued pre-training에 관한 것인데 — 하나는 text completion용, 하나는 translation용 — {{2}}이는 base weights에서만 의미가 있고 아무도 튜토리얼을 작성하지 않는 단계입니다.{{/2}} 나머지는 Unsloth와 TRL을 통한 supervised fine-tuning, TRL을 통한 DPO, 그리고 두 방식 모두를 통한 GRPO를 다룹니다. Liquid는 또한 직접 구성하고 싶지 않다면 자체 학습 스택으로 LEAP Finetune도 제공합니다.
Liquid의 파인튜닝 문서를 이 모델의 구조에 비추어 읽어 보면, 실제적인 순서는 다음과 같습니다:
• 어떤 훈련도 하기 전에 먼저 완성 모델(completer)로 프롬프트하세요.카드의 채팅 템플릿은 무시하세요. Few-shot, 원시 텍스트, 자신만의 정지 시퀀스를 사용하세요. 이렇게 하면 사전 학습이 이미 당신의 도메인과 언어를 다루는지 알 수 있으며, 이에 따라 지속 사전 학습이 전혀 필요한지, 아니면 바로 SFT로 건너뛸 수 있는지가 결정됩니다.
• 지식이나 언어를 추가하는 경우에만 지속적 사전 학습을 수행하세요. 이것은 비용이 많이 드는 분기입니다 — 코퍼스 규모이지 예시 규모가 아니며 — 사후 학습된 형제 모델이 진정으로 제공할 수 없는 유일한 것입니다.
• 그런 다음 LoRA를 사용한 SFT를 500~5,000개의 예시에 대해 수행합니다.Liquid 자체의 지침은 품질과 분포가 양보다 중요하며 예시가 프로덕션 입력과 일치해야 한다는 것입니다. 2.6B 규모에서 LoRA 패스는 짧습니다. 문서에 따르면 1.2B 실행은 최신 GPU 하나에서 몇 분에서 수십 분이 걸리므로, 이 크기는 여전히 오후에 한 번 돌려볼 수 있는 루프입니다.
• 학습 전에 보류(held-out) 세트를 고정하세요. 직설적으로 말하면, 특히 이 체크포인트에서 반복할 가치가 있는 이유는 비교할 만한 발표된 베이스라인이 없기 때문입니다 — 당신의 평가 세트가 모두가 참고할 유일한 수치입니다.
• 선호 또는 RL 단계는 마지막이며, 행동이 문제일 때만 수행합니다. DPO와 GRPO 레시피는 해당 모델 패밀리에 존재하지만, 이는 이미 답변하는 모델 위에서의 정제(refinement)입니다. SFT가 완료되기 전에 이것들을 사용하는 것은 베이스 체크포인트 프로젝트가 정체되는 방식입니다.
그 목록에 없는 것이 무엇인지 주목하세요: 여기 있는 그 어느 것도 커스텀 커널, 패치된 트레이너 또는 모델링 파일을 필요로 하지 않습니다. LFM2.5가 LFM2 아키텍처를 재사용하기 때문에 기본 체크포인트는 표준 스택에 그대로 들어가며, 이 프로젝트의 전체 비용은 여러분이 이를 위해 구축하는 코퍼스와 평가 세트뿐입니다.
무엇이 상황을 바꿀까요?
주목할 만한 세 가지가 있는데, 모두 Liquid가 해결하기에 비용이 적게 들지만 오늘은 그중 어느 것도 해결되지 않았습니다.
첫 번째는 베이스 모델 평가입니다. 사전 학습된 체크포인트의 MMLU-Pro 또는 GPQA 숫자 하나는 출시 게시물의 모든 에이전틱 벤치마크를 합친 것보다 파인튜너에게 더 많은 정보를 줄 것이며, 34T 토큰이 투입되었다는 사실은 그 부재를 더욱 의아하게 만들 뿐입니다. 두 번째는 모델 카드 자체입니다 — 헤딩이 다른 모델을 가리키고, 빠른 시작 가이드가 비챗 모델에 채팅 템플릿을 적용하며, frontmatter에서 철자가 틀린 base_model은 10분이면 고칠 수 있는 문제로, 지침이 잘못되었을 때 가중치가 손상되었다고 사람들이 결론 내리는 것을 막아줄 것입니다. 세 번째는 LFM2.5 기술 보고서입니다. 인용 블록은 arXiv 2511.23404를 가리키며, 이는 2025년 11월의 LFM2 기술 보고서입니다. 2.5 세대 자체의 논문은 아직 나오지 않았으므로 그 34T 토큰 뒤의 사전 학습 데이터 구성은 공개되지 않은 채로 남아 있습니다.
그때까지의 솔직한 요약은 이것이 명세가 잘 정의되고, 오래 훈련되었으며, 효율적으로 구성된 2.6B 파운데이션 모델로서, 유난히 명확한 대상 사용자를 가지고 있고, 측정값 없이 수익 상한 라이선스로 출시되었으며, 지금까지 거의 아무도 상자에서 꺼내지 않았다는 것입니다. 카드가 설명하는 대상 사용자에 해당한다면, GPU 시간을 투자할 가치가 있습니다 — 그리고 당신은 그것이 실제로 얼마나 좋은지 알게 될 전 세계에서 첫 번째 사람들 중 하나가 될 것입니다.
답할 가치가 있는 질문들
이것은 LFM2.5-2.6B가 사후 훈련된 것과 동일한 체크포인트인가요, 아니면 별도의 사전 훈련 실행인가요?
카드에는 LFM2.5-2.6B-Base가 "모든 LFM2.5-2.6B 변형을 만드는 데 사용된 사전 훈련된 텍스트 전용 체크포인트"라고 명시되어 있으므로, 이는 병렬 릴리스나 축소판이 아니라 게시된 파이프라인의 실제 입력값입니다. 바로 이것이 사후 훈련 연구에 유용한 이유입니다. 여러분의 방법과 Liquid의 4단계가 동일한 가중치에서 시작하므로 둘 사이의 비교가 의미 있습니다. 주목할 만한 점은 기본 저장소가 8월 1일에 생성되었고 출시일인 8월 4일에 마지막으로 수정되었다는 것입니다. 일찍 다운로드한 파일이 실제 출시된 파일이라고 단정하기 전에 커밋 기록을 확인하세요.
그것을 미세 조정하고 결과를 판매할 수 있나요?
귀하의 법인 연간 매출이 1,000만 달러 미만이라면, 네 — LFM1.0 권리는 파생 저작물의 상업적 사용을 포함하며, 단 라이선스 및 저작자 표시 고지를 유지하고 변경된 파일을 표시해야 합니다. 그 기준 이상인 경우, 모델 또는 그로부터 파생된 모든 것의 상업적 사용은 라이선스 범위를 벗어나며 Liquid와 별도의 계약이 필요합니다. 이 기준은 모델이나 그 모델이 창출하는 수익이 아닌 귀하의 법인 수익에 적용되므로, 동일한 파인튜닝 모델이 한 회사에는 라이선스될 수 있지만 다른 회사에는 그렇지 않을 수 있으며, 기준을 넘어 성장한 회사는 기존에 보유한 권리를 유지하지 못합니다.
그냥 사후 훈련된 LFM2.5-2.6B를 미세 조정하면 안 될까요?
대부분의 프로젝트에서는 그렇게 해야 하며, Liquid의 카드도 사실상 그렇게 말하고 있습니다. 기본 체크포인트에서 시작해야 하는 이유는 사후 학습(post-training)이 사용자에게 유리하게 작용하기보다 오히려 불리하게 작용할 때입니다: 새로운 언어나 전문 말뭉치에 대한 대규모 지속 사전 학습은 어쨌든 명령 튜닝된 동작을 손상시키는 경향이 있으며, SFT와 RL로 주입된 거부 패턴, 도구 호출 규약, 응답 스타일은 제거하기 어렵고 충돌하기 쉽습니다. 지식이나 언어를 추가하는 경우에는 기본 모델에서 시작하세요. 경계선상에서 동작을 조정하는 경우에는 사후 학습된 모델에서 시작하여 누군가 이미 비용을 지불한 네 단계의 작업을 유지하세요.
