
LFM2.5-8B-A1B-DSpark vs LFM2.5-2.6B-Base: 속도 부분 vs 원재료
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianNEWQwen3.8 27B2026-08-1552지능68코딩
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokNEWSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
- grokxAI: Grok 4.52026-07-0856지능72코딩
LFM2.5 제품군을 각 체크포인트가 단독으로 할 수 있는 작업에 따라 정렬하면, LFM2.5-8B-A1B-DSpark와 LFM2.5-2.6B-Base는 양 끝에 놓입니다 — 그리고 어느 쪽도 질문에 답할 수 없습니다. 전자는 327.7M 파라미터의 드래프트 모델로, 오로지 Liquid AI의 엣지 mixture-of-experts 모델이 토큰을 더 빨리 생성하도록 돕기 위해 존재합니다. 후자는 2.69B 파라미터의 사전 학습된 원시 체크포인트로, 오직 다른 무언가로 파인튜닝되기 위해 존재합니다. 둘 다 2026년 8월에 Liquid의 LFM Open License v1.0 하에 출시되었고, 둘 다 Hugging Face에서 다운로드 한 번이면 되며, 둘 다 실수로 받기 매우 쉽습니다 — 그 이름들이 같은 것의 두 가지 버전처럼 들리기 때문입니다.
이름이 함정이다. "{{1}}DSpark{{/1}}"는 이 패밀리의 반짝이는 새 플래그십처럼 읽히고, "{{2}}Base{{/2}}"는 실제로 실행할 수 있는 평범한 기본값처럼 읽힌다. 둘 다 사실이 아니다. {{1}}DSpark{{/1}} 체크포인트는 단독으로는 어떤 것에도 답할 수 없다 — 단지 {{3}}LFM2.5-8B-A1B{{/3}}가 검증할 토큰만 제안할 뿐이다. {{2}}Base{{/2}}도 답할 수 없지만, 그 이유는 정반대다 — 튜닝되지 않은 기반 모델로서 텍스트를 예측할 뿐, 채팅이나 에이전트 모델로 후속 학습된 적이 없다. 이것은 경쟁 관계가 아니라 파이프라인이다. 하나의 체크포인트는 서빙 스택의 맨 끝에 있고, 다른 하나는 학습 실행의 맨 처음에 있다.
이름만 같고 역할은 다른 두 체크포인트
LFM2.5-8B-A1B-DSpark(2026년 8월 20일 출시)는 추측 디코딩용 드래프트 모델입니다. 5계층 어텐션 전용 네트워크, 단계당 9개의 제안 토큰 블록, 그리고 대상 모델의 128,000개 토큰 어휘를 다루는 마르코프 헤드로 구성됩니다. 이를 LFM2.5-8B-A1B(총 8.3B, 활성 ~1.5B 파라미터 규모의 MoE로 5월 28일에 출시) 옆에 함께 로드하면, 드래프트가 다음 몇 개의 토큰을 추측하고 대상 모델이 전체 블록을 한 번의 순방향 패스로 검증하여 수락한 부분을 유지합니다. 대상 모델이 모든 토큰을 검사하므로 탐욕적 디코딩에서의 출력은 LFM2.5-8B-A1B를 단독으로 실행한 것과 동일합니다. Liquid의 말을 빌리자면 "구조적으로 무손실"입니다. 드래프트는 속도를 위한 부품이지 두뇌가 아닙니다. 이 드래프트는 LFM2.5-1.2B-Instruct 및 LFM2.5-2.6B용 형제 드래프트와 함께 출시되었으며, 각각 Safetensors 및 GGUF 형식으로 제공되고 SGLang과 llama.cpp에서 출시 당일부터 지원됩니다.
LFM2.5-2.6B-Base(2026년 8월 4일 출시)는 파이프라인의 반대쪽 끝에 해당합니다: 30개 층의 하이브리드 스택(22개의 이중 게이트 단기 컨볼루션 블록과 8개의 그룹 쿼리 어텐션 블록)으로 구성된 2.69B 파라미터 규모의 기반 모델로, 약 34조 개의 토큰으로 사전 학습되었으며, 중간 학습 단계에서 컨텍스트를 128K로 확장합니다. 이 모델에는 채팅 템플릿도, 인스트럭션 튜닝도, 공개된 벤치마크도 없으며, Liquid의 모델 카드 역시 광범위한 파인튜닝에만 권장합니다. 이 모델의 모든 목적은 4단계 사후 학습 파이프라인(2회의 SFT 라운드, 교사 전문화, 온폴리시 증류, 그 다음 에이전트 강화 학습)을 거쳐 도구 호출 에이전트 LFM2.5-2.6B로 변환되는 원재료가 되는 것입니다. 같은 패밀리, 같은 라이선스, 같은 다운로드 페이지. 그러나 하는 일은 완전히 다릅니다.
나란히: 7가지 차원, 두 가지 작업
두 체크포인트가 서로 다른 역할을 담당하기 때문에, 공정한 비교는 양측의 역할을 명확히 구분한다:
• 정의 — {{1}}LFM2.5-8B-A1B-DSpark{{/1}}은 0.3B 규모의 추측 디코딩 드래프트 모델이며, {{2}}LFM2.5-2.6B-Base{{/2}}는 2.69B 규모의 사전 학습만 수행한 기반 모델입니다.
• 실행 구성 — DSpark 드래프트는 LFM2.5-8B-A1B MoE(총 8.3B, 토큰당 약 1.5B 활성)와 짝을 이루며, Base는 단독으로 실행되지만 튜닝되지 않은 텍스트 예측으로만 동작한다.
• 단독 사용 — DSpark는 그 자체로는 아무것도 생성하지 않으며, 단지 대상을 가속화할 뿐입니다. Base는 텍스트를 생성하지만 유용한 제품 동작은 없습니다 — 지시 따르기, 도구 호출, 채팅 템플릿이 없습니다.
• 출력 품질 — DSpark는 제안된 모든 토큰이 검증되므로 대상의 정확한 greedy 출력을 상속합니다. Base는 설계상 어떤 작업에 대해서도 공개된 벤치마크가 없습니다.
• 속도 — DSpark는 공급업체가 측정한 H100 평균 2.54배(최대 3.18배) 및 M4 Max 1.18배를 자사 목표치에 추가하지만, 재현되지는 않았습니다. Base는 추론 속도에 대한 주장이 전혀 없습니다.
• 메모리 사용량 — DSpark는 대상 옆에 약 0.3GB의 드래프트 가중치를 추가합니다. Base는 전체 2.69B 규모로 2.5GB 미만에서 실행 가능하며, 이 제품군에서 가장 작은 본격적인 기반 모델입니다.
• 형식 및 가용성 — DSpark는 Safetensors 및 GGUF로 제공되며, 출시 첫날부터 SGLang 및 llama.cpp를 지원합니다. Base는 Safetensors와 GGUF, ONNX, MLX로 제공되며 Transformers, vLLM, SGLang, llama.cpp, MLX에서 실행됩니다. 현재 둘 다 어떤 추론 제공업체에서도 서비스되지 않으며, 둘 다 자체 호스팅 체크포인트입니다.

이 대결에서 유일한 숫자는 한 연구소에서 나왔다.
여기에 있는 모든 정량적 수치는 단일 공급업체의 측정값으로, 초안이 공개된 날 측정되었으며 아직 독립적으로 재현되지 않았습니다. 검증된 것이 아닌 유망한 결과로 읽으십시오. Liquid는 LFM2.5-8B-A1B-DSpark를 배치 크기 1, 온도 0에서 BF16의 단일 80GB H100과 SGLang 환경, 그리고 FP16 GGUF의 M4 Max MacBook Pro에서 llama.cpp의 실험적 Metal 커널로 측정했습니다. H100에서 이 쌍은 평균 2.54배(초당 418→1,074 토큰)를 기록했으며, MATH500에서 최고 단일 결과는 3.18배(428→1,362 tok/s), 제안된 토큰 10개 중 평균 약 7개가 수락되었습니다. M4 Max에서는 동일한 쌍이 평균 1.18배(90→106 tok/s)에 그쳤습니다. 이는 Liquid 자체가 지적한 온디바이스 엣지 케이스로, 블록 검증 시 현재 MoE Metal 백엔드에서 더 많은 전문가가 활성화되고 메모리 버스를 통해 더 많은 가중치 트래픽이 이동하기 때문입니다.
이 매치업의 Base 쪽에는 숫자가 전혀 없으며, 그 부재 자체가 사양입니다. LFM2.5-2.6B-Base는 사후 훈련이 아닌 사전 훈련만 거친 모델로, 아무도 그런 용도로 사용할 의도가 없었기에 채팅, 도구 사용, 에이전트 행동에 대해 평가된 적이 없습니다. 의미 있는 수치는 아키텍처에 있습니다: 2.69B 파라미터, 128K 컨텍스트, 16개 언어 토크나이저, 실행 시 2.5GB 미만. 기반 모델을 벤치마크하는 것이 아니라, 그것을 미세 조정한 결과물을 벤치마크하는 것입니다.
결정을 내리기 전에 언급할 만한 계열 특유의 아이러니가 하나 있습니다. 이 기사가 다루는 드래프트(8B-A1B용)는 바로 노트북에서 이득이 가장 작은(1.18×) 드래프트입니다. 반면 2.6B 계열용 형제 드래프트는 바로 이 Base의 후속 학습된 형제 모델을 가속하며, M4 Max에서 평균 2.27×의 속도 향상을 보이고 멀티 툴 함수 호출 지연 시간을 57% 단축합니다. 문제의 기기가 GPU 박스가 아니라 폰이나 노트북이라면, 속도 이야기의 핵심은 2.6B 경로에 있습니다.

그래서 어떤 걸 다운로드하나요?
당신은 이 둘 사이에서 직접 선택해야 할 필요가 없습니다. 그것들은 대안이 아니기 때문입니다 — 하지만 당신이 어떤 역할을 맡고 있는지는 알아야 합니다:
소유한 GPU에서 LFM2.5-8B-A1B를 서빙하고 동일한 하드웨어로 더 많은 초당 토큰 수를 얻고 싶다면, LFM2.5-8B-A1B-DSpark는 되돌릴 수 있는 추가 기능입니다. 8월 20일 DSpark 통합이 포함된 SGLang 또는 llama.cpp를 빌드하고, 실행 명령에서 드래프트를 지정하고, 그리디 디코딩을 유지하면 블록 크기는 드래프트의 config에서 자동으로 읽힙니다. 장점은 출력에 전혀 변화 없이 약 2.5배의 처리량을 얻는 것이고, 단점은 0.3GB의 추가 가중치와 해당 PR을 포함할 만큼 새로운 빌드가 필요하다는 것입니다. 두 speculative 플래그를 제거하면 기본 타깃 모델로 돌아갑니다.
자체 전문가 모델을 구축하려는 경우 — 도메인 모델, 맞춤형 언어 어시스턴트, 독점 데이터에 대한 파인튜닝 — LFM2.5-2.6B-Base는 오픈 가중치 생태계에서 가장 저렴한 진지한 시작점 중 하나입니다: 2.6B, 2.5GB 미만, 128K 컨텍스트, 다국어 토크나이저. DSpark 체크포인트는 이것에 전혀 도움이 되지 않습니다. 베이스 모델이 아니기 때문입니다.
실제로 Liquid의 온디바이스 에이전트 — 도구 호출, 다단계 작업 — 를 원한다면, 이 둘 중 어느 것도 원하는 것이 아닙니다. 사후 훈련된 LFM2.5-2.6B를 원하는 것이며, 이후에 자체 드래프트를 덧붙일지는 그다음에 결정하면 됩니다. Base는 훈련하려는 사람들을 위한 원자재이고, 8B-A1B 드래프트는 이미 MoE를 배포하는 사람들을 위한 속도 부품입니다. 더 빠른 에이전트를 원해서 Base를 다운로드하거나, 훈련용 기반을 원해서 드래프터를 다운로드하는 것은 잘못된 선택입니다.

두 가지가 연결되는 지점 — 그리고 라우터가 필요한 위치
두 체크포인트 모두 자체 호스팅 방식입니다. 드래프트는 자체 SGLang 또는 llama.cpp 스택 안에서만 존재하는 서빙 레이어 부속물이고, Base는 학습 산출물입니다. 둘 다 호스팅 카탈로그에는 등재되지 않으며, 토큰당 정가도 없습니다. 실제로 이는 어느 경로든 결국 이미 호출 중인 호스팅 모델 곁에 놓이게 된다는 뜻이며, 라우팅 레이어는 바로 그 혼합을 하나로 접어주기 위해 존재하는 연결 구조입니다.
서빙 측면에서, 드래프트 모델의 경제성은 단순하고 실제적입니다. 동일한 GPU에서 초당 토큰 수가 2.5× 더 많다는 것은 동일한 워크로드에 대해 시간이 2.5× 단축되고 대략 2.5× 적은 GPU가 필요하다는 뜻이며, 품질 변화는 없습니다. 하지만 그 레버리지는 추론을 직접 보유하고 있을 때만 존재합니다. API를 통해 8B-A1B를 호출하는 순간, 속도 향상은 제공업체가 갖게 됩니다. 바로 여기서 API 측면의 비교가 중요해지는 것입니다: 제공업체가 얼마를 청구하는지, 그리고 가격 인하가 발표된 당일에 사용자에게 전달되는지 여부입니다. 이것이 패스스루 라우터의 핵심입니다: 200개 이상의 모델에 걸친 하나의 API, 공급업체의 정가를 0% 마크업으로 전달하여 공급업체의 인하가 즉시 사용자 측에 반영되고, 자동 장애 조치를 통해 특정 공급업체의 지연 시간 급증이 사용자의 지연 시간이 되지 않습니다. 동일한 엔드포인트를 통해 자체 호스팅 LFM 스택을 앞세울 수도 있습니다. 이를 통해 새로운 드래프트 모델을 실제 트래픽에 대해 시험해 보면서 프로덕션 경로에 베팅하지 않을 수 있습니다.
LFM2.5-8B-A1B-DSpark와 LFM2.5-2.6B-Base는 같은 패밀리 이름을 공유하지만 정반대의 역할을 한다. 하나는 엣지 MoE에 결합되는 속도 부품이고, 다른 하나는 2.6B 에이전트가 성장해 나가는 조정되지 않은 두뇌다. 둘 다 단독으로는 실행되지 않는다. 이미 GPU에서 서빙 중인 MoE를 가속화하려면 드래프터를 선택하고, 2.6B 파운데이션을 자신만의 무언가로 파인튜닝하려면 Base를 선택하라. 그리고 작동하는 에이전트를 원했다면 둘 다 건너뛰어라 — 두 체크포인트의 공통점은 바로, 어느 것 하나도 단독으로는 쓸 만한 기능을 하지 못한다는 것이기 때문이다.
자주 묻는 질문
LFM2.5-8B-A1B-DSpark를 단독으로 실행할 수 있나요?
아니요. 이는 독립 출력이 없는 드래프트 모델입니다 — LFM2.5-8B-A1B 대상 모델이 이후 검증할 후보 토큰을 제안하기만 하므로, August 20 SGLang 또는 llama.cpp 통합 기반으로 구축된 투기적 디코딩 서빙 스택 내에서만 존재합니다. 단독으로 다운로드해도 질의할 수 있는 것은 아무것도 없습니다.
LFM2.5-2.6B-Base는 에이전트로 기기 내에서 실행되는 체크포인트인가요?
그대로는 아닙니다. Base는 명령 튜닝도 채팅 템플릿도 없는 원시 사전 학습 기반 모델입니다. Liquid의 온디바이스 에이전트로 실행되는 모델은 포스트 트레이닝된 LFM2.5-2.6B로, 이는 Base에서 4단계 포스트 트레이닝 파이프라인을 통해 생성됩니다. 더 빠른 성능을 원한다면 LFM2.5-2.6B-DSpark 드래프트와 함께 사용할 수 있습니다.
