히어로 타이틀 카드에는 키커 '비전-언어 드래프터' 아래에 'LFM2.5-VL-3B-DSpark'가 표시되어 있고, 부제는 'Liquid AI의 LFM2.5-VL-3B용 279.5M 드래프터 - 가중치는 2026년 9월 18일, 누구도 이를 발표하기 6일 전에 공개됩니다.'입니다. 아래의 세 카드에는 '279.5M 드래프트 파라미터 - 4개 레이어, Markov 헤드, 신뢰도 헤드', '블록 크기 9 - Apple 실리콘에서는 8; 패스당 3.2-4.5개 토큰 수락' 그리고 '메모리 8.9% 더 사용 - 출력은 증명 가능하게 타깃의 출력과 동일하며, 변경되지 않음'이 적혀 있습니다. 푸터에는 '모든 속도 향상 수치는 Liquid AI가 자체 측정한 것이며, 아직 독립적인 재현은 존재하지 않습니다.'라고 적혀 있습니다. OrcaRouter 로고가 오른쪽 아래 모서리에 합성되어 있습니다.
Engineering & Research

LFM2.5-VL-3B-DSpark: 누구도 발표하기 6일 전에 출시된 Liquid AI의 279.5M 드래프터

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이 이야기에는 LFM2.5-VL-3B-DSpark가 새로운 모델인 버전도 있다. 하지만 아니다. 이 모델은 279.5M 파라미터의 추측 디코딩(speculative-decoding) 드래프트 모델로, 정확히 한 가지 목적을 위해 존재한다. 바로 Liquid AI 자체의 비전-언어 모델인 LFM2.5-VL-3B를 더 빠르게 디코딩하도록 만드는 것이며, 그 자체로는 쓸 만한 답변을 생성할 수 없다. 그럼에도 이것에 대해 읽을 가치가 있는 이유는 타임라인이다. 가중치는 2026년 9월 18일 아무런 발표도 없이 Hugging Face에 올라왔고, 엿새 동안 그대로 있다가 9월 24일에야 공급업체 블로그 게시물이 붙었다. Radar는 그 공백기에 해당 저장소를 포착했다.

그 격차는 또한 지금 알 수 있는 것의 경계이기도 합니다. 저장소에 있는 모든 것 — 파라미터 분석, 블록 크기, 프레임워크 통합, 라이선스 — 은 당신이나 제가 열어볼 수 있는 디스크상의 파일입니다. 모든 속도 향상 수치는 벤더가 측정한 것이며, Liquid 자체의 벤치마크 하네스에서 나온 것이고, 회사 외부의 누구도 재현 결과를 발표하지 않았습니다. 이 글은 그 두 묶음을 의도적으로 분리해 둡니다.

저장소가 실제로 포함하는 것

모델 카드를 열어 보면 이 물건의 형태는 명확합니다. LFM2.5-VL-3B-DSpark는 메타데이터에 대상이 고정되어 있는 드래프트 모델입니다: base_model: LiquidAI/LFM2.5-VL-3B. 다른 모델에 연결하는 것도, 단독으로 서빙하는 것도 아닙니다.

• 총 드래프트 파라미터 — 279.5M, BF16, 그중 193.0M은 4계층 디코더 스택, 65.5M은 마르코프 헤드, 21.0M은 은닉 상태 프로젝션, 6.4k는 정규화 계층과 신뢰도 헤드입니다

• 백본 — 4개의 전체 어텐션 레이어, 히든 크기 2,048, SiLU/SwiGLU를 사용하는 중간 크기 6,144, 32개의 어텐션 헤드와 8개의 키-값 헤드를 사용하는 그룹화된 쿼리 어텐션, 헤드 차원 64

• 추가 헤드 — 랭크 256의 마르코프 헤드와 신뢰도 헤드로, 이것이 DSpark 드래프팅을 일반 병렬 드래프터와 구별해 주는 요소입니다

• 블록 크기 — 학습 중에는 9, 추론 시에는 하드웨어에 따라 8 또는 9이며, Apple silicon에서는 특히 8입니다

• 어휘 — 128,000, 초안이 지니는 것이 아니라 타깃에 묶인

• 배포 스택에서의 가중치 — Liquid는 드래프터가 배포된 파라미터 수를 8.9% 증가시킨다고 밝힙니다.

A single-column infographic titled 'LFM2.5-VL-3B-DSpark - the numbers' with the subtitle 'Every figure below was measured by Liquid AI, on Liquid AI's hardware'. Six rows read: 'Decode speedup, single H100 80GB - SGLang' at '2.04x - 2.66x'; 'Decode speedup, Apple M5 Max - MLX-VLM' at '2.30x - 3.13x'; 'End-to-end speedup across all three stacks' at '1.30x - 2.62x'; 'Draft tokens accepted per verification pass' at '3.2 - 4.5'; 'Extra memory in the deployed stack' at '8.9%'; and 'Repository interest at time of writing' at '37 downloads, 6 likes'. The footer reads 'Vendor-measured. No third-party reproduction of any figure in this table exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

8.9%가 기억해야 할 숫자입니다. 이런 부류의 모델에 대한 제안은 결코 "더 빠른 추론은 공짜"가 아니라 "더 빠른 추론에는 모델 하나의 약 10분의 1에 해당하는 메모리 비용이 든다"는 것입니다. 3.1B 타깃 위에 279.5M개의 추가 파라미터가 있는 경우, 이는 드래프터 자체의 크기만으로 짐작되는 것보다 더 작은 부담입니다. 임베딩과 LM 헤드는 타깃에 묶여 있어 복제되지 않기 때문입니다.

DSpark는 Liquid 모델이기 이전에 DeepSeek의 기술이다

이름 때문에 혼동이 생기므로, 정확히 짚고 넘어갈 가치가 있다. DSpark는 Liquid AI가 만든 것이 아니며 모델 패밀리도 아니다. 그것은 별도의 연구 계보에서 나온 추측적 디코딩 프레임워크로, 2026년 7월 논문에서 준자기회귀 생성을 사용하는 신뢰도 스케줄링 추측적 디코딩으로 설명된다. 이 프레임워크의 세 가지 아이디어는 다음과 같다. 한 번의 순전파에서 전체 블록을 초안 작성하는 병렬 백본, 인접한 초안 토큰 사이에 일부 의존성을 복원하여 블록 끝에서 수용률이 붕괴하지 않게 하는 경량 순차 모듈, 그리고 초안 자체의 신뢰도가 꼬리 부분이 거부될 것임을 시사할 때 요청별로 검증 윈도우를 줄이는 검증기다.

Liquid가 한 일은 그 레시피를 비전-언어 모델에 적용하고 체크포인트를 출시한 것이다. 모델 카드는 이 이식이 들리는 것만큼 극적이지는 않다고 솔직히 인정한다. 드래프터의 관점에서 모달리티는 무관한데, 토큰이 은닉층에 도달할 때쯤이면 이미지 패치와 텍스트 토큰은 둘 다 그저 텐서일 뿐이기 때문이다. 그래서 텍스트 모델에서 개발된 기법이 재발명되지 않고 VLM으로 이식되는 것이며, 또한 드래프터를 새로운 기능으로 내세울 수 없는 이유이기도 하다.

리퀴드(Liquid)는 이미 텍스트 DSpark 드래프터를 출시했었다 — 2.6B, 8B-A1B, 1.2B-Instruct 동반 모델은 2026년 8월에 공개되었고, GGUF 내보내기는 8월 19일에 이어졌다. 비전 드래프터는 이 아이디어를 멀티모달 브랜치로 확장한 것으로, 라인업의 네 번째 또는 다섯 번째 항목이지 데뷔작이 아니다.

속도 향상 수치, 그리고 누가 이를 측정했는가

아래의 모든 수치는 Liquid가 자체 벤치마킹 인프라에서 수집한 것이며, 독립적으로 재현된 사례는 하나도 없습니다. 이를 기대 결과가 아니라 벤더가 제시한 상한선으로 보십시오. 이 카드는 디코드 속도 향상과 엔드투엔드 속도 향상을 구분하는데, 이는 헤드라인 수치보다 더 중요합니다.

• 최고의 디코딩 속도 향상 — COCO에서 3.13×, Apple M5 Max에서 MLX-VLM으로 측정, 블록 크기 8, FP16, 배치 크기 1, 온도 0

• 최고의 GPU 디코드 속도 향상 — COCO에서 2.66×, 단일 H100 80GB에서의 SGLang, BF16, 블록 크기 9

• llama.cpp 디코딩 최고 속도 향상 — COCO 기준 2.14배, Apple M3 Ultra, 블록 크기 8

• 6개 비전 태스크 전반에 걸친 H100 디코드 범위 — 2.04×~2.66×, 엔드투엔드 기준 1.64×~2.27×

• M5 Max 디코드 범위 — 2.30×~3.13×, 엔드투엔드 1.56×~2.62×

• M3 Ultra 디코드 범위 — 1.57×~2.14×, 엔드투엔드 1.30×~1.77×

• 드래프트 수용 — 세 스택 모두에서 타깃 검증 패스당 약 3.2~4.5개의 토큰이 수용됨

그 범위에 나타나는 패턴이 정직한 부분이다. 엔드투엔드 이득은 일관되게 각 쌍에서 더 작은 절반인데, 이는 드래프터가 디코딩만 가속하고 그 외에는 아무것도 가속하지 않기 때문이다. 또한 동일한 드래프터가 동일한 블록 크기에서 한 스택에서는 3.13×, 다른 스택에서는 1.57×에 도달한다는 점에도 주목하라 — 수락률은 드래프터와 워크로드의 속성이지만, 실제 경과 시간 이득은 하드웨어와 런타임 오버헤드의 속성이다. 스택이 명시되지 않은 "2.66× 더 빠르다"는 주장은 실행에 옮길 수 있는 주장이 아니다.

카드에 나오는 두 가지 정확성 요점은 분명히 짚고 넘어갈 가치가 있다. 왜냐하면 그것들이 바로 드래프터를 프로덕션에서 애초에 받아들일 수 있게 만드는 요소이기 때문이다. 그리디 디코딩에서는 추측 디코딩이 정확하다. 타깃이 제안된 모든 토큰을 검증하므로, 텍스트는 타깃이 단독으로 생성했을 것과 같다. 0이 아닌 온도에서 동일하게 맞춘 샘플링 설정에서는 타깃의 출력 분포를 보존한다. Liquid의 표현 — 속도 향상을 얻는 것이지 다른 모델을 얻는 것이 아니다 — 는 말하는 범위까지는 정확하며, 카드는 온도를 높이면 수용률이 낮아지고 따라서 처리량 이점이 잠식된다는 점을 솔직히 밝히고 있다.

Liquid 자체 게시물이 인정하는 것

A screenshot of Liquid AI's own blog post 'LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond', dated SEP 24, 2026, on the company's English-language site. A bar chart above the headline compares 'LFM2.5-VL-3B (Baseline)' with 'LFM2.5-VL-3B-DSpark', labelling the pair '67 tok/s' and '220 tok/s'. The visible opening text reads 'Today, we release an experimental DSpark draft model for our vision-language model (VLM) LFM2.5-VL-3B' and quotes 'decoding throughput improvements of up to 2.66 on GPUs and 3.13x on edge devices, with end-to-end throughput gains of up to 2.27 and 2.62', noting the model 'is available on Hugging Face, with support in llama.cpp, SGLang, and MLX-VLM'.

9월 24일 블로그 게시물은 한 가지 이유에서 모델 카드보다 더 유용하다: 한계를 명시하기 때문이다. 비전-언어 추론은 텍스트 추론에는 없는 프리필 비용을 지불한다 — 이미지는 비전 인코더를 통과해야 하고, 언어 백본은 그 인코더가 생성한 수백 개의 시각 토큰을 처리해야 한다. 기기에서는 그 프리필이 엔드투엔드 지연 시간을 지배한다. 추측 디코딩은 디코드만 가속한다. 비전 인코딩과 프리필은 그대로다. Liquid는 자사 제품에 대해 암달의 법칙을 끌어와, 프리필이 전체 소요 시간에서 큰 비중을 차지하는 경우 큰 디코드 속도 향상은 엔드투엔드 개선을 약간만 얻을 뿐이라고 지적한다.

그것은 구매 결정을 내리는 데 실질적인 제약이며, 이 드래프터가 개선하는 항목 목록에 첫 토큰까지의 시간이 없는 이유를 설명해 줍니다. 또한 그것은 가장 큰 이점을 얻는 워크로드가 큰 이미지에 대한 짧은 질문에 답하는 워크로드가 아니라, 적당한 크기의 이미지에서 긴 출력을 생성하는 워크로드 — 캡션, 긴 OCR 변환, 하나의 이미지를 계속 유지하는 다중 턴 대화 — 임을 암시합니다.

이 글은 두 가지 범위 제한을 추가로 제시합니다. 모든 수치는 비전 인코더와 언어 백본 모두에 16비트 처리를 사용하며, 양자화된 모델의 가속은 이번 릴리스의 범위를 벗어납니다. 3B 엣지 VLM의 최대 장점이 몇 기가바이트 안에서 실행된다는 점임을 고려하면, "속도 향상은 FP16에서 측정되었습니다"라는 점은 4비트 익스포트와 함께 사용할 계획이었던 사람이라면 누구나 주의 깊게 봐야 할 단서입니다. Liquid는 또한 드래프터가 전적으로 AMD 하드웨어에서 학습되었다고 언급합니다.

그것을 실행하기

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-VL-3B-DSpark showing 'Like 6', the license 'lfm1.0' and 'Model size 0.3B params  Tensor type BF16'. The card text specifies 'Target model: LiquidAI/LFM2.5-VL-3B', 'Draft parameters: 279.5M (BF16)', a backbone of 4 full attention layers at hidden_size=2048 with grouped-query attention (32 attention heads, 8 key-value heads, head_dim 64), a Markov head of rank 256 plus a confidence head, 'Block size: 9 during training; 8 or 9 at inference', a vocabulary of 128,000, and the notes 'On Apple silicon the drafter is run at block size 8 rather than 9' and 'Use each drafter checkpoint with its corresponding target model'. A related-papers panel lists 'MMSpec: Benchmarking Speculative Decoding for Vision-Language' (arXiv 2603.14989).

출시 첫날부터의 지원은 실제로 제공되며 세 가지 런타임을 아우르는데, 이는 대부분의 드래프터가 받는 것보다 많습니다. NVIDIA에서 SGLang은 v0.5.19 이상이 필요하며 드래프터를 --speculative-algorithm DSPARK와 함께 드래프트 경로 및 블록 크기 9로 처리합니다. Apple 실리콘에서 MLX-VLM은 v0.7.2 이상이 필요하며 드래프터가 --draft-model과 함께 전달될 때 이를 감지합니다. 한 가지 까다로운 점이 있습니다 — MLX-VLM의 DSpark 디코딩은 현재 그리디 샘플링을 사용하므로 temperature를 0으로 설정해야 합니다. llama.cpp의 경우 별도의 GGUF 저장소가 있으며, 약 567MB의 단일 F16 내보내기가 있고, 카드에는 양자화된 드래프터를 원본 safetensors 체크포인트가 아니라 양자화된 대상과 짝지으라고 명시되어 있습니다.

라우팅 계층이 이 상황에서 제 몫을 하는 지점은 이 모델이 아니다. OrcaRouter는 LFM2.5-VL-3B-DSpark나 LFM2.5-VL-3B를 라우팅하지 않으며, 이 조합은 직접 내려받아 서빙하는 자체 호스팅 드래프터 페어링이기 때문이다. 제 몫을 하는 지점은 이 모델을 둘러싼 나머지 스택이다. 소형 오픈 웨이트 비전 모델을 온디바이스에서 실행하는 바로 그 애플리케이션에는 보통 소형 모델이 감당할 수 없는 쿼리를 위한 폴백 경로가 있고, 그 경로를 200개 이상의 모델을 아우르는 단일 엔드포인트 — 각 제공업체의 정가로 청구되고 마크업이 전혀 붙지 않으며, 제공업체 성능이 저하되면 자동 페일오버 — 로 향하게 하는 편이 두 번째 벤더 계약을 세우는 것보다 통합 부담이 더 작다. 드래프터는 그 아키텍처의 한 축을 개선하고, 라우터는 다른 한 축이 두 번째 프로젝트가 되지 않게 붙잡아 주는 역할을 한다.

아직 알려지지 않은 것

작성 시점 기준으로 이 저장소의 다운로드 수는 37회, 좋아요는 6개입니다. 어떤 공개 벤치마크 집계 사이트에도 이 drafter에 대한 항목이 없고, 속도 향상 범위에 대한 제3자 재현도 없으며, Liquid가 테스트하지 않은 하드웨어에서의 acceptance rate에 대한 독립적인 측정도 없습니다. 이 카드에는 명백한 이유로 품질 벤치마크가 없습니다. 이 drafter는 구조상 출력 보존형이므로 품질 수치는 LFM2.5-VL-3B에 속하며, 이 카드는 자체 벤치마크를 만들어 내는 대신 해당 모델의 벤치마크를 가리킵니다.

메타데이터의 한 가지 세부 사항은 이것이 얼마나 새로운지를 살짝 보여준다: 모델에는 SGLang 라이브러리 태그와 이를 호출하기 위해 특별히 존재하는 SGLang 알고리즘 플래그가 붙어 있다. 프레임워크 지원은 발표보다 먼저 반영되어야 했는데, 이는 저장소와 블로그 게시물 사이의 6일 간격과 일치한다.

그러니까, 진짜로 유용하고 범위가 좁게 잡힌 엔지니어링 작업 하나가 출시된 지 일주일 뒤에 발표되었는데, 그 가치 제안의 전부가 당신이 갖고 있지 않을 수도 있는 하드웨어에서 공급업체가 측정한 숫자 하나에 달려 있다. H100이나 M-시리즈 Mac에서 LFM2.5-VL-3B를 서비스하고 있고 워크로드가 디코드 중심이라면, 메모리 비용은 8.9%이고 출력이 증명 가능하게 타깃의 것이므로 단점은 거의 0에 가깝다. 지연 시간이 프리필에 좌우되거나 4비트 익스포트에 기대를 걸고 있었다면, Liquid 자체의 게시물이 그것이 도움이 되지 않을 것이라고 알려준다. 재현 결과가 나온다면, 그것이 기다려야 할 대상이다.

OrcaRouter는 200개 이상의 모델을 하나의 키 뒤에 공급자 정가에 0% 마크업으로 제공하며, 폴백 경로를 라우팅 계층으로 표현합니다. 애플리케이션 코드가 아니라. 드래프터는 어느 쪽이든 자체 호스팅됩니다. 라우터는 작은 모델이 넘겨주는 구간이 두 번째 프로젝트가 되지 않도록 막아주는 역할을 합니다.