
LFM2.5-VL-3B: 엣지를 위한 Liquid AI의 새로운 3B 비전-언어 모델
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianNEWQwen3.8 27B2026-08-1552지능68코딩
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokNEWSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
LFM2.5-VL-3B에 대해 가장 먼저 알아야 할 점은 이 모델이 두 단계에 걸쳐 출시되었다는 것이다. 가중치는 2026년 8월 11일 Hugging Face에 공개되었다 — 전체 bf16 체크포인트, 벤치마크 표가 담긴 모델 카드, 16개 언어로 작성된 README, 그리고 어떤 발표도 없었다. 모델 카드에는 다운로드 수 0이 표시되어 있었다. 다음 날인 8월 12일, Liquid AI는 공식 글 "LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge"를 게시하면서 조용한 출시는 공식적인 출시가 되었다. 지금 이 글을 읽고 있다면, Liquid 연구소 밖에서 아직 거의 아무도 실행해 보지 않은 모델에 대한 가장 이른 시점의 독립 리뷰 중 하나를 읽고 있는 셈이다 — 그렇기에 여기서는 저장소에서 실제로 확인할 수 있는 것과 그렇지 않은 것을 다룬다.
LFM2.5-VL-3B란 무엇인가
LFM2.5-VL-3B는 이미지와 텍스트를 입력받아 텍스트를 출력하는 비전-언어 모델로, Liquid AI의 LFM2.5 텍스트 백본을 기반으로 합니다. 구체적으로, 언어 모델은 LFM2.5-2.6B이며 SigLIP2 NaFlex 400M 비전 인코더와 결합되어 총 약 31억 개의 파라미터를 가집니다. 이 모델은 단거리 게이트 컨볼루션 블록과 그룹화된 쿼리 어텐션이 교차 배치되는 패밀리의 하이브리드 아키텍처, 128,000토큰 어휘 사전, 32,768토큰 컨텍스트 윈도우를 유지합니다. 또한 16개 언어(영어, 아랍어, 중국어, 프랑스어, 독일어, 힌디어, 인도네시아어, 이탈리아어, 일본어, 한국어, 폴란드어, 포르투갈어, 러시아어, 스페인어, 태국어, 베트남어)를 지원하며, bfloat16 형식으로 제공되고 Liquid의 lfm1.0 오픈 라이선스에 따라 사용이 허가됩니다.
처음부터 새로 만든 모델이 아닙니다. 카드에는 LFM2.5의 멀티모달 변형으로 설명되어 있으며, 이전 LFM2-VL-3B를 기반으로 추가 중간 학습과 사후 학습을 거쳤습니다. 이러한 계보는 중요합니다. 시각 능력은 약 34조 개의 토큰으로 이미 사전 학습된 텍스트 모델 위에 얹혀 있으므로, 언어 측면은 장난감 수준이 아닙니다. 이는 텍스트 모델들이 사용하는 것과 동일한 계열의 엔진으로, 비전 인코더를 접목해 비전 작업용으로 재학습시킨 것입니다.
할 수 있는 것
Liquid의 글에서는 이전 LFM2-VL-3B에 비해 네 가지 개선점을 언급합니다: 화면 및 UI 이해, 함수 호출, grounding, 다중 이미지 입력. 쉽게 말해, 그 의미는 다음과 같습니다.
• Grounding — 자연어 질의("정지 표지판", "가격 열")로 객체를 가리키면 정규화된 위치가 반환됩니다.
• 화면 이해 — 화면에 무엇이 어디에 있는지에 대한 질문에 답변하며, ScreenSpot-v2에서 벤치마킹되었습니다.
• 레이아웃 주석이 포함된 OCR — 문서 구조도 반환하는 전체 페이지 OCR로, 23가지 레이아웃 레이블(텍스트, 제목, 목록, 표, 표 캡션, 차트, 수식, 코드, 페이지 머리글 및 바닥글 등)을 정규화된 정수 좌표로 제공합니다.
• 도구 사용 — JSON 형식의 도구 정의를 입력받아 tool-call 토큰 사이에 Python 스타일의 호출을 생성하고 최종적으로 일반 텍스트 답변을 반환하는 4단계 함수 호출 흐름입니다.
• 다중 이미지 입력 — 한 번의 턴에서 여러 이미지에 걸쳐 추론합니다.
Liquid가 자체적으로 적합하지 않은 경우에 대한 지침은 유난히 구체적입니다. 해당 카드는 단일 턴, 고처리량, 저지연 작업 — 자동차 분야의 준실시간 객체 감지, 스캔 문서의 일괄 OCR, 기기 내 메뉴 및 도로 표지판 번역 — 에 권장되며, 긴 맥락의 추론 중심 작업, 시각적 웹 디자인, 고도로 기술적인 설계도 질문에 대해서는 명시적으로 경고합니다.
숫자 — 전부 공급업체가 보고한 수치
이 섹션의 모든 수치는 Liquid AI 자체 모델 카드와 블로그 게시물에서 나온 것입니다. 그 중 어떤 것도 독립적으로 재현된 적이 없으며, 제3자가 체크포인트를 실행하기 전까지는 이를 사실이 아닌 주장으로 취급해야 합니다. 그 라벨은 여기서 실제로 중요한 역할을 합니다. 왜냐하면 기록상으로는 그 성과가 확실히 인상적이기 때문입니다:
• Grounding — RefCOCO 매크로 precision@1은 87.9로, 이전 LFM2-VL-3B의 57.1에서 상승한 수치입니다 — 약 30포인트 점프이며, Liquid는 이를 비전 사후 훈련 덕분으로 돌립니다.
• 화면 이해 — ScreenSpot-v2 평균 80.7로, Liquid는 Qwen3.5-4B에 귀속되는 78.5보다 앞선다고 보고합니다.
• 도구 사용 — ToolSandbox 59.5, LFM2-VL-3B에서 Liquid가 측정한 26.4의 두 배 이상; BFCLv4 32.5, 20.5에서 상승.
• 일반 비전 추론 — MME 73.1, MMStar 63.3, RealWorldQA 73.1, MMMB 83.0, ChartQA 81.3, MathVista 68.5, POPE 88.7.
• OCR — OCRBenchv2 (영어 하위 집합) 47.5, 43.9에서 상승.
• 까다로운 멀티모달 추론 — MMMU Pro 30.5, BLINK 61.5, MuirBench 58.3 — 3B 모델에서 예상되는 약한 부분입니다.
• 속도(벤더 실행) — Apple M5 Max에서 초당 228토큰, AMD Ryzen AI Max+ 395에서 초당 116토큰, Galaxy S26 Ultra에서 초당 20토큰으로, 모두 약 3.3GB 메모리 내에서 실행됩니다. vLLM을 사용하는 H100에서 Liquid는 높은 동시성에서 초당 약 11K 출력 토큰과 5프레임 클립에서 약 34ms의 첫 토큰까지의 시간을 주장하며, 이는 모델이 추론 대신 직접 답변하기 때문이라고 설명합니다.

하나의 3B 모델에 대한 주장으로는 많은 양이며, 모델 자체 카드의 바닥글에 있는 주의 사항을 다시 언급할 가치가 있습니다. 이것은 Liquid의 수치입니다. "실험실 평가에서 좋은 점수를 받는 것"과 "당신의 데이터에서도 견디는 것" 사이의 간격은 바로 이렇게 새로운 모델이 흔히 걸려 넘어지는 지점입니다.
아직 알려지지 않은 것
미해결 질문들의 솔직한 목록:
• 독립적인 벤치마크 없음 — 이 글을 쓰는 시점 기준으로 LFM2.5-VL-3B는 어떤 제3자 리더보드에도 등재되어 있지 않습니다. 위의 모든 점수는 공급업체가 보고한 것입니다.
• 호스팅된 엔드포인트 없음 — 아직 이를 제공하는 추론 제공업체가 없습니다. 셀프호스팅이 답입니다. 그게 전부입니다.
• 사용 데이터 없음 — 첫날 다운로드가 0이라는 것은 커뮤니티 피드백도, 파인튜닝도, "X에서 실행했더니 Y에서 고장 났어"라는 보고도 없다는 뜻이다. 실제 사용자들의 첫 보고는 아직 오지 않았다.
• 실험적 기능 — 레이아웃 어노테이션 출력은 Liquid 자체에서 "실험적"이며 "변경될 수 있고, 신뢰할 수 없으며, 구문 분석이 쉽지 않을 수 있습니다"로 표시됩니다. 아직 이에 기반한 파서를 구축하지 마십시오.
• 빈약한 서드파티 보도 — 첫 주 언론 보도는 대부분 짧은 뉴스 라운드업에 불과합니다. 아무도 심층적인 독립 테스트를 수행하지 않았습니다.

그렇다고 해서 모델이 나쁘다는 뜻은 아니다. 출시 후 며칠 동안 어떤 모델이든 입증되지 않듯, 아직 입증되지 않았다는 뜻이다.
직접 실행하는 방법
이렇게 어린 모델치고 생태계 스토리는 이례적으로 훌륭하다. 포맷 변형들이 가중치와 같은 날 출시되었다: llama.cpp용 GGUF, ONNX, Apple Silicon용 5가지 MLX 양자화, 그리고 Transformers, vLLM, SGLang용 네이티브 bf16 체크포인트가 함께 제공된다. Liquid는 llama.cpp, MLX, vLLM, SGLang, ONNX에서의 첫날 지원과 WebGPU 브라우저 데모를 명시한다. 권장 샘플링 파라미터는 temperature 0.2, top_k 50, 반복 패널티 1.0이며, 비전은 모델의 프로세서 구성으로 처리된다. 오늘 밤 노트북에서 시도해 보고 싶다면 MLX 또는 GGUF 빌드가 최단 경로다.
볼 것
LFM2.5-VL-3B가 과대광고 사이클을 넘어 중요한 모델이 될지 여부는 두 가지에 달려 있다. 첫째, 그라운딩 및 화면 이해 수치가 독립적 재현 테스트에서도 유지되는지다. ScreenSpot-v2에서 80.7, RefCOCO에서 87.9가 가장 검증해 볼 가치가 있는 두 수치인데, 바로 이 수치들이 이 모델을 진정한 파괴적 엣지 모델로 만들어 줄 것이기 때문이다. 둘째, 호스팅 엔드포인트가 등장하는지다. 그것이 "흥미로운 자체 호스팅 프로젝트"에서 "오늘 바로 출시 가능한 것"으로 평가를 바꾸기 때문이다. 그리고 바로 그때 라우팅 레이어가 제 역할을 한다. 200개 이상의 모델을 아우르는 하나의 API는, Liquid나 어떤 제공업체가 엔드포인트를 구축하는 날, 통합을 변경하지 않고도 이미 호출 중인 모델들 옆에 LFM2.5-VL-3B를 추가할 수 있게 해 준다. 제공업체 공시 가격에 마크업 없이 말이다. 자동 장애 조치를 통해 검증된 모델이 실패한 호출을 대신 처리하는 동안 실제 트래픽을 새 모델에 보낼 수도 있다. 그때까지는 유망한 자체 호스팅 스토리일 뿐이다. 일주일밖에 안 된 모델치고는 이미 대부분의 출시작이 얻는 것보다 더 많은 것이다.

