LFM2.5-8B-A1B-DSpark와 Qwen3-8B를 비교하는 히어로 타이틀 카드로, '모델을 빠르게 만드는 드래프트, 모두가 이미 실행 중인 8B와의 대결'이라는 부제가 붙어 있다. 왼쪽에는 'Draft 327M' 박스가 토큰 칩을 쌓인 타일형 'LFM2.5-8B-A1B' MoE 카드로 보내고 있으며, 'SPECULATIVE DECODING' 라벨 아래에 바늘이 높게 올라간 속도계가 표시된다. 오른쪽에는 'Qwen3-8B'라고 표시된 채팅 말풍선 카드에 반짝임과 시계 아이콘이 있고, 'GENERALIST MODEL' 라벨 아래에 있다. 'August 2026' 날짜 태그와 OrcaRouter 로고는 오른쪽 하단 모서리에 합성되어 있다.
Guides & Insights

LFM2.5-8B-A1B-DSpark vs Qwen3-8B: 모델을 가속화하는 드래프트, 모두가 이미 실행하는 8B에 맞서

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Liquid AI는 2026년 8월 20일 LFM2.5-8B-A1B-DSpark 드래프트 체크포인트를 출시했다. 이는 327.7M(3억 2770만)개 파라미터 규모의 투기적 디코딩 보조 모델로, LFM2.5-8B-A1B 엣지 MoE가 단일 H100에서 최대 3.18배 더 빠르게 생성할 수 있게 해준다. 이 비교가 정직하려면 한 가지 사실이 테이블 위에 분명히 놓여 있어야 한다. DSpark 체크포인트는 직접 호출할 수 있는 모델이 아니다. 그것은 다른 모델을 가속할 뿐이다. 따라서 이번 출시가 제기하는 실제 배포 문제는 올해 내내 많은 팀이 저울질해 온 바로 그 질문, 즉 LFM2.5-8B-A1B 대 Qwen3-8B — 수명 주기상 서로 매우 다른 시점에 있는 두 8B급 오픈 가중치 모델이다.

여기서는 프레임이 평소보다 더 중요하다. 두 쪽이 같은 종류의 것이 아니기 때문이다. Qwen3-8B는 현재 셀프 호스팅하거나 토큰을 구매할 수 있는 완전하고 배포 가능한 모델이다. LFM2.5-8B-A1B도 완전하고 배포 가능한 모델이다. DSpark 드래프트는 그 모델의 버전이 아니라 애드온이다. 드래프트가 약속하는 모든 것은 공급업체가 측정한 값이며 하루밖에 안 된 것이다. 저장소와 형식에 관한 모든 것은 그저 확인해 보면 된다. 이 글은 이 두 범주를 분리해서 유지한다.

첫째, "DSpark"라는 단어는 이 문장에서 명사가 아닙니다.

{{1}}추측 디코딩은 저렴한 드래프트 모델을 실제 모델보다 앞서 실행한다. 드래프터가 다음 몇 개의 토큰을 추측하면, 타깃 모델은 단일 순방향 패스로 전체 블록을 검증하고, 일치하는 부분만 유지한다.{{/1}} {{2}}추측이 정확하다면, 가중치 로딩 패스 한 번의 비용으로 여러 토큰을 처리할 수 있다. 따라서 타깃 모델의 가중치를 건드리지 않고도 처리량이 증가한다. 그리고 타깃 모델이 제안된 모든 토큰을 검사하기 때문에, greedy 디코딩에서의 출력은 LFM2.5-8B-A1B만 단독으로 실행한 것과 동일하다.{{/2}} {{3}}Liquid는 이를 "구조적으로 무손실"이라고 부르며, 이것이 드래프트를 안전하게 부착할 수 있는 이유이다.{{/3}}

Liquid의 LFM2.5-8B-A1B-DSpark는 의도적으로 작게 설계된 드래프터입니다. 어텐션 전용 레이어 5개, 단계당 아홉 개의 제안 토큰 블록, 그리고 대상 모델의 128,000개 토큰 어휘에 대한 Markov 헤드로 구성되며, 채팅·코드·함수 호출 데이터를 혼합하여 15 에포크 동안 훈련되었고, 체크포인트는 손실이 아닌 수락률을 기준으로 선택되었습니다. 이 모델은 벤더가 그날 출시한 세 가지 드래프터 중 하나로, LFM2.5-1.2B-Instruct 및 LFM2.5-2.6B와 함께 각각 Safetensors 및 GGUF 형식으로 제공되며 출시 첫날부터 SGLang 및 llama.cpp를 지원합니다. 또한 8B급 모델과의 비교를 읽는 독자에게 중요한 점은, 이 모델은 어떤 추론 제공업체에서도 서비스되지 않으며 토큰당 가격도 없다는 것입니다. 이 모델은 오직 사용자 자신의 스페큘레이티브 디코딩 스택 안에서만 존재합니다.

A screenshot of the Hugging Face model page for LiquidAI/LFM2.5-8B-A1B-DSpark, showing the tags TextGeneration, Safetensors, sglang, qwen3_speculative-decoding, dspark and lfm2_lfm2_moe draft model, the lfm1.0 license, a 0.3B model size, the 'Inference Providers' section, and the card text 'LFM2.5-DSpark is a family of speculative-decoding draft models that adapt DSpark for the LFM2.5 architecture' (captured August 21, 2026).

실제로 배포되는 두 모델

드래프트를 걷어내면 실제 비교는 그것이 가속하는 모델과 기존 모델 사이의 것이 된다. 둘 다 오픈 가중치에 대략 8B급이지만, 유사점은 거기서 끝난다:

— 아키텍처 — {{1}}LFM2.5-8B-A1B는 총 8.3B 파라미터를 가진 sparse MoE로, 토큰당 약 1.5B만 활성화됩니다.{{/1}} 반면 {{2}}Qwen3-8B는 8.2B 규모의 dense 모델로, 모든 토큰에서 모든 파라미터를 활성화합니다.{{/2}}

출시 — LFM2.5-8B-A1B는 2026년 5월 28일에 출시되었고, Qwen3-8B는 2025년 4월에 출시되어 1년이 넘었으며 일부 서빙 플랫폼에서 이미 지원이 중단되었습니다.

• 컨텍스트 — LFM2.5-8B-A1B는 기본 128K 컨텍스트와 128K 토큰 어휘를 제공합니다. Qwen3-8B는 기본 32K를 제공하며, YaRN을 통해 약 128K까지 확장할 수 있습니다.

• 추론 — LFM2.5-8B-A1B는 명시적 사고 체인을 출력하는 추론 모델입니다. 반면 Qwen3-8B는 요청에 따라 사고 모드와 비사고 모드를 전환합니다.

• 지능 — Artificial Analysis에 따르면, LFM2.5-8B-A1B는 지능 지수 8을, Qwen3-8B는 8–8.3을 기록했으며, 둘 다 유사한 오픈 웨이트 모델의 중앙값인 9보다 낮습니다. 어느 쪽도 프런티어급 두뇌는 아니며, 두 모델 모두 이를 솔직히 인정하고 있습니다.

• 속도 — Artificial Analysis에 따르면, LFM2.5-8B-A1B는 제공업체 전반에서 초당 약 340토큰을 출력하는 반면, Qwen3-8B는 초당 약 37~40토큰으로 동급에서 가장 느린 축에 속합니다.

• 라이선스 — LFM2.5-8B-A1B는 Liquid의 LFM Open License v1.0을 따릅니다; Qwen3-8B는 Apache-2.0입니다.

A comparison scoreboard for LFM2.5-8B-A1B and Qwen3-8B. The left column shows the Liquid model as an MoE with 8.3B total and 1.5B active parameters, 128K native context, an AA Intelligence Index of 8 (median 9), roughly 340 tokens per second across providers, the DSpark draft adding up to 3.18x on an H100 but only 1.18x on an M4 Max, and self-host-only availability. The right column shows Qwen3-8B as a dense 8.2B model, 32K native context extended to ~128K via YaRN, an AA Intelligence Index of 8-8.3, roughly 37-40 tokens per second, no draft needed, and availability through Alibaba's API plus many open hosts, with a footer reading 'LFM speedups vendor-measured Aug 20 2026, unreproduced; throughput per Artificial Analysis; Qwen3-8B per Alibaba' and the OrcaRouter logo in the bottom-right corner.

속도에 있어서는 더 이상 박빙이 아닙니다.

8B급 오픈웨이트 대화 모델이 발전한 가장 큰 이유는 메모리 단위당 속도입니다. Qwen3-8B는 덴스 모델로, 생성되는 모든 토큰이 8.2B 가중치 전체를 메모리 버스를 통해 스트리밍하기 때문에 크기 대비 느리고 실제 VRAM이 필요합니다. LFM2.5-8B-A1B는 모든 토큰을 약 1.5B 활성 파라미터에 라우팅하는데, 이것이 바로 설계의 핵심입니다. 빠르고 가벼운 온디바이스 MoE라는 것이죠. Liquid의 자체 주장은 더 나아가, 벤더 보고 기준 M5 Max CPU에서 6GB 미만 메모리로 초당 약 253토큰을 처리한다고 합니다. 배포 가능한 모델의 원시 처리량 측면에서는 이 부분에서 드래프트는 중요하지 않습니다. MoE는 추측(speculation) 기법을 추가하기 전에 이미 덴스 8B보다 몇 배 빠르기 때문입니다.

가격 측면에서 둘 다 오픈 웨이트이므로, 자체 호스팅 비용은 하드웨어 비용만큼 듭니다. 호스팅 비교는 가용성 측면에서 한쪽으로 치우쳐 있습니다. Qwen3-8B는 알리바바의 API를 통해 백만 입력 토큰당 $0.18, 백만 출력 토큰당 $2.10의 정가로 제공되며, 다양한 서드파티 오픈 모델 호스트에서도 제공됩니다. LFM2.5-8B-A1B는 주목할 만한 퍼스트파티 호스팅 토큰 가격이 없으며, 드래프트에는 아예 없습니다. 즉, 오늘날 대부분의 팀이 Liquid의 엣지 MoE를 실행하는 실질적인 방법은 자체 호스팅, 즉 노트북, 엣지 박스, 또는 보유한 GPU에서 실행하는 것이며, 바로 그 환경에서 DSpark 드래프트가 관련 변수가 됩니다.

초안이 이번 결정에 실제로 가져오는 변화

초안은 단 하나의 축만 변경합니다: 사용자가 제어하는 서빙 스택에서 LFM2.5-8B-A1B가 토큰을 생성하는 속도입니다. 모델이 더 똑똑해지지 않으며, 답변 내용도 바뀌지 않습니다. 탐욕적(greedy) 출력은 단일 대상 모델과 비트 단위로 동일합니다. 도움이 되는 분야는 단일 요청 처리량의 GPU 서빙입니다. Liquid는 배치 크기 1, 온도 0 조건에서 5개 벤치마크에 걸쳐 단일 H100에서 평균 2.54배(418 → 1,074 tokens per second)를 측정했으며, MATH500에서 최고 3.18배를 기록했습니다. 거의 도움이 되지 않는 분야는 Apple 실리콘입니다. 동일 모델은 M4 Max에서 평균 1.18배(90 → 106 tok/s)에 그쳤습니다. 초안 토큰 블록을 검증하면 llama.cpp의 현재 Metal MoE 백엔드에서 더 많은 전문가가 활성화되고 더 많은 가중치 트래픽이 이동하기 때문입니다. 이는 추측 디코딩(speculative decoding)이 상쇄하려는 바로 그 비용입니다. 이 모든 수치는 출시일 당시의 벤더 측 자료이며, 독립적으로 재현된 것이 아닙니다.

이러한 구분은 하나의 결정 규칙에 직접 대응합니다. 자신이 소유한 GPU에서 LFM2.5-8B-A1B를 서빙한다면, 드래프트는 실질적인 비용 레버입니다. 동일한 실리콘에서 초당 약 2.5배 더 많은 토큰을 생성하면서 출력 변화는 전혀 없으며, 8월 20일 DSpark 통합이 포함된 빌드만 있으면 됩니다. 대신 API를 통해 모델을 호출한다면, 제공자가 속도 향상을 유지하며 드래프트는 당신에게 무관합니다. 그리고 기기가 노트북이나 휴대폰이라면, 이 특정 모델의 드래프트는 현재 거의 효과가 없습니다. 밀집 모델인 LFM2.5-1.2B-Instruct와 LFM2.5-2.6B를 위한 자매 드래프트가 각각 2.54배와 2.27배로 온디바이스에서 이점을 제공합니다. 한편 Qwen3-8B는 드래프트가 전혀 필요 없습니다. 단지 더 느리고 밀집된 모델일 뿐이며, 배포 가능하려면 추측 디코딩이 필요하지 않습니다.

A screenshot of the Hugging Face model page for Qwen/Qwen3-8B, showing the TextGeneration tag, Transformers and Safetensors formats, the qwen3 conversational tag, the apache-2.0 license, and the Qwen3 Highlights describing the ability to switch seamlessly between thinking mode and non-thinking mode (captured August 18, 2026).

Qwen3-8B가 출시된 지 1년이 지난 시점에서의 선택

Qwen3-8B는 지루하지만 올바른 기본값입니다: 성숙하고, Apache-2.0이며, 119개 언어를 지원하고, 사고/비사고 모드를 갖추고, 어디서나 제공되며, 채팅, 코드, 구조화된 텍스트를 위한 여전히 훌륭한 범용 모델입니다. 문제는 나이와 속도입니다 — 16개월 된 덴스 8B로, 해당 클래스에서는 느리고 일부 플랫폼에서는 이미 지원이 중단되었습니다. 이는 오늘 새로운 그린필드 프로젝트를 시작한다면 진지하게 받아들일 만한 유지보수 신호입니다.

LFM2.5-8B-A1B는 더 새롭고 더 좁은 베팅입니다: 소비자 하드웨어에서 빠른 속도로 도구 호출과 지시 수행을 위해 구축된 엣지 우선 MoE이며, GPU 자체 호스팅의 경우 선택적 서빙 부스트로 DSpark 드래프트가 제공됩니다. 더 똑똑한 모델은 아닙니다 — 둘 다 Artificial Analysis의 오픈 가중치 중앙값 아래에 있습니다 — 하지만 토큰당 메모리의 극히 일부만으로 훨씬 더 빠른 모델이며, 이것이 온디바이스 에이전트에게 중요한 트레이드오프입니다. 그 한계는 Qwen3-8B의 거울상입니다: 더 최근에 출시되었고, 퍼스트파티 호스팅 가격이 없으며, 공급업체 외에는 아무도 아직 재현하지 못한 수치를 가진 추측 디코딩 스토리입니다.

기반이 되는 라우팅 계층은 어느 쪽이든 동일하게 유지됩니다. LFM2.5-8B-A1B도 Qwen3-8B도 현재 OrcaRouter의 호스팅 카탈로그에는 없으므로, 솔직히 말하자면 라우터가 이 조합에 대해 해주는 일은 다음과 같습니다. 200개 이상의 호스팅 모델에 걸친 하나의 API로 공급업체 공시 가격을 0% 마크업으로 그대로 전달하여, 가격 인하가 발표된 당일에 플랫폼에 반영되게 하는 것, 자동 페일오버를 통해 검증되지 않은 새 모델을 프로덕션 경로로 삼기보다는 실제 트래픽으로 시험해볼 수 있게 하는 것, 그리고 직접 서빙하는 모델 앞에 둘 수 있는 라우팅 DSL을 통해 자체 호스팅 LFM2.5-8B-A1B 스택이 하나의 키 뒤에서 호스팅 엔드포인트와 공존할 수 있게 하는 것입니다.

노트북이나 엣지 박스용으로 빌드하고 있고 툴 호출 속도에 신경을 쓴다면, LFM2.5-8B-A1B가 시험해볼 방향입니다. 드래프트는 필요할 때 GPU 서빙 경로에서 무료 2.5배 성능을 제공합니다. 더 이상 고민할 필요 없는 범용 모델을 원한다면, Qwen3-8B도 여전히 작동합니다. 다만 이것은 2025년 초의 모델이며 생태계가 교체를 시작하고 있다는 점만 알아두세요. 드래프트도 타깃도 바꾸지 못하는 한 가지는 증거의 정직한 상태입니다. DSpark 릴리스에서 빠른 모든 것은 한 공급업체가 단 하루 동안 측정한 결과이며, 독립적인 벤치마크가 이 중 실제로 얼마나 신뢰할 수 있는지를 결정하는 미해결 과제입니다.