
Liquid AI d1-omni-600M vs LFM2.5-VL-3B: 하나는 결정하고, 하나는 묘사한다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Liquid AI d1-omni-600M과 LFM2.5-VL-3B는 둘 다 작고, 둘 다 멀티모달이며, 둘 다 같은 연구소가 Hugging Face에 동일한 lfm1.0 라이선스로 공개한 모델이다 — 그리고 이 둘을 짝지어 비교하는 것은 범주 오류이지만, 알고 보면 유용한 범주 오류다. LFM2.5-VL-3B는 2026년 8월 12일 Liquid AI의 엣지 비전-언어 모델로 등장했다: 3.1B 파라미터, 32,768토큰, 그리고 산문 형태의 출력. 스캔한 페이지를 주면 레이아웃을 반영한 텍스트로 전사 결과를 반환한다. Liquid AI d1-omni-600M은 2026년 10월 7일에 공개 d1 패밀리의 나머지와 함께 업로드되었으며, 동일한 입력에 대해 정반대의 일을 한다. 이는 587M 파라미터의 결정 모델이다: 상태에 이름 붙은 질문들을 붙이면, 이미 믿고 있는 것을 보고한다 — P(yes), 신뢰도와 함께 선택된 레이블, 순서형 2~10 척도상의 위치 — 단일 순전파로, 출력 토큰은 0개이고 하위에서 파싱할 것도 없다. "작은 멀티모달 Liquid 모델"을 검색했다면, 지금 눈앞에 두 가지 형태가 있으며, 어떤 형태를 고르느냐가 곧 결정이다.
이 페이지는 두 모델 카드와 10월 7일 릴리스 게시물, 그리고 리포지토리 자체가 실제로 확립하는 내용을 담고 있습니다. 또한 그것들이 어디에서 멈추는지도 분명히 밝힙니다. 이 비교의 어떤 내용도 Liquid AI 외부에서 재현된 적이 없으며, 두 모델 중 하나에 대해서는 공급업체가 자사의 대표 기능에 특화된 정확도 벤치마크를 전혀 공개하지 않았습니다.
두 개의 체크포인트, 나란히
스펙 시트는 거의 모든 측면에서 서로 다르며, 이는 애초에 같은 자리를 두고 경쟁하도록 만들어진 것이 아닌 두 모델에서 당연히 예상할 수 있는 일이다.
• 무엇인가 — LFM2.5-VL-3B는 텍스트를 작성하는 생성형 비전-언어 모델이고, Liquid AI d1-omni-600M은 구조화된 답변을 반환하며 토큰을 출력하지 않는 결정 모델입니다
• 파라미터 — LFM2.5-VL-3B의 경우 BF16에서 3.1B인 반면, Liquid AI d1-omni-600M은 587M이며, 그 자체가 381M의 공유 트렁크 및 결정 헤드에 94M의 비전 인코더와 112M의 오디오 인코더를 더한 구성이다.
• 백본 — LFM2.5-VL-3B는 LFM2.5-2.6B 언어 모델을 SigLIP2 NaFlex 형태 최적화 400M 비전 인코더와 결합한다; Liquid AI d1-omni-600M은 양방향 인코더인 LFM2.5-Encoder-350M로부터 훈련되었으며, LFM2.5-VL-450M에서 가져온 SigLIP2 타워와 오디오용 17계층 FastConformer를 갖춘다
• 입력 — LFM2.5-VL-3B용 텍스트와 이미지; 텍스트 + 이미지 또는 Liquid AI d1-omni-600M용 텍스트 + 최대 30초의 음성. 이는 이미지와 오디오가 동일한 요청으로 도착하면 ValueError를 발생시킵니다
• 컨텍스트 — LFM2.5-VL-3B는 32,768토큰인 반면, Liquid AI d1-omni-600M은 텍스트, 이미지, 오디오를 합쳐 16,384개 위치를 지원하며, 해당 모델 카드에는 이미지가 있을 때 상태 및 질문 텍스트가 학습과 맞추기 위해 896토큰으로 잘린다고 덧붙여져 있다
• 어휘 — LFM2.5-VL-3B의 경우 128,000개 토큰, Liquid AI d1-omni-600M의 경우 65,536개
• 런타임 — LFM2.5-VL-3B는 transformers와 vLLM에서 실행되며, 추측 디코딩을 위한 별도의 DSpark 드래프트 모델을 갖추고 있습니다. Liquid AI d1-omni-600M은 사용자 정의 코드를 제공하고 trust_remote_code=True가 필요하며, 해당 카드에서는 GPU에서 float16을 권장하는 한편 bfloat16이 일부 행에서 최상위 답변을 바꾸었다고 경고합니다.
• 라이선스 — 둘 다 lfm1.0이며, 파인튜닝 및 배포를 허용합니다
그 목록에서 한 줄이 나머지보다 더 많은 일을 하고 있다. Liquid AI d1-omni-600M은 디코더가 아니라 양방향 인코더를 기반으로 구축되었다. 그것은 LFM2.5-VL-3B의 크기를 줄인 것이 아니다. 그것은 다른 계보이며, 벤치마크 표를 어떻게 읽든 두 모델을 서로 바꿔 쓸 수 없는 아키텍처적 이유다.
출력 계약이 벤치마크보다 더 많은 것을 좌우한다
LFM2.5-VL-3B에 이미지에 관한 질문을 하면 언어로 된 답을 돌려받습니다. 그 답을 사람이 읽어야 하거나, 문자열로 기록해야 하거나, 산문을 기대하는 단계에 전달해야 할 때 이는 금전적 가치가 있습니다. 동시에 이는 엔지니어링으로 우회해야 하는 부담이기도 합니다: 생성된 출력이 옆길로 샐 수 있고, JSON 형태로 요청했는데 요청한 것과 다른 형태로 돌아올 수 있으며, 모든 토큰에 비용이 청구되고 대기 시간이 발생합니다. 이 모델은 단일 턴, 높은 처리량, 낮은 지연의 비전 작업 — 스캔 문서의 배치 OCR, 차량 내 실시간 감지, 표지판의 온디바이스 번역 — 을 위해 명시적으로 범위가 정해져 있으며, "이 설계도에서 무엇이 잘못되었나요?" 같은 긴 문맥과 추론이 많은 질문에서는 명시적으로 멀어지도록 조정되어 있습니다.
Liquid AI d1-omni-600M은 엄밀히 더 좁은 질문에 엄밀히 더 신뢰할 수 있는 범위로 답합니다. 인터페이스는 상태 — 텍스트, JSON, 하나 이상의 이미지, 또는 최대 30초의 음성 — 와 이름이 지정된 질문 집합으로 구성되며, 각 질문은 자체 유형을 선언합니다. noul 질문은 예/아니오이고 0과 1 사이의 P(yes)로 반환됩니다. choice 질문은 사용자가 지정한 집합에서 하나의 레이블을 선택하고 레이블, 신뢰도, 각 옵션의 확률을 반환합니다. score 질문은 상태를 2~10단계의 순서형 척도에 놓고 해당 분포와 함께 기대 레벨을 반환합니다. 여러 질문이 하나의 상태에 연결될 수 있으며 한 번의 패스에서 읽히므로, 모델 카드의 사용량 카운터는 output_tokens: 0을 보고합니다. 생성 단계가 없으며, 이는 파싱에 실패하는 출력이란 존재하지 않는다는 뜻입니다.
당신이 포기하게 되는 것은 생성된 답변이 담고 있지만 레이블은 담고 있지 않은 모든 것입니다: 추론, 완곡한 표현, 티켓에 붙여넣을 수 있는 문구, 같은 대화에서 후속 질문을 할 수 있는 능력. Liquid는 이를 분명히 말합니다 — 이 모델은 채팅 모델이 아니며 텍스트를 쓰지 않습니다. 파이프라인에서 판정 옆에 설명이 필요하다면, Liquid AI d1-omni-600M은 그 짝에서 잘못된 쪽이며, 정직한 답은 둘 다 실행하는 것입니다: LFM2.5-VL-3B는 이미지에 대한 판독을, Liquid AI d1-omni-600M은 그것에 대한 결정을 생성합니다.

Vision의 일대일 비교 수치는 없으며, 그것이 바로 이번 결과입니다.
본능적인 다음 수는 비전 벤치마크를 나란히 세우는 것이다. 그렇게 할 수는 없다. LFM2.5-VL-3B의 경우 벤더는 전체 세트를 공개한다 — RefCOCO Macro Precision@1 87.9, ScreenSpot-v2 80.7, ChartQA 81.3, POPE 88.7, MMStar 63.3, BLINK 61.5, MuirBench 58.3, ToolSandBox 59.5, OCRBench v2 English 47.5, 그리고 이전 LFM2-VL-3B의 71.1을 약간 앞서는 RealWorldQA 73.1. 이들 모두는 벤더가 보고한 것이며, 어느 것도 독립적으로 재실행된 적이 없다. 그럼에도 이들은 특정 역량에 관한 구체적인 주장이어서, 독자가 해당 연구소에 책임을 물을 수 있게 해준다.
Liquid AI d1-omni-600M의 경우, 릴리스 포스트는 Decision Index v0.3에 비공개 비전 분할이 포함되어 있으며 "이번 릴리스에서는 이에 대해 보고하지 않는다"고 말합니다. 그리고 대신 Liquid는 600M 체크포인트가 "세 가지 모달리티를 모두 처리한다"는 점을 검증했으며, 그 근거는 플레이그라운드 데모에 실려 있다고 합니다. 이것이 공개된 비전 기록의 전부입니다. 이 체크포인트에 대한 이미지 벤치마크 수치는 모델 카드나 출시 포스트 어디에도 없습니다. 같은 포스트는 오디오 쪽에서 무엇이 빠져 있는지를 훨씬 더 직접적으로 확인해 줍니다. 전용 오디오 의사결정 벤치마크는 벤더의 표현 그대로 "현재 미해결 문제"입니다.
그러므로 이 맞대결에 대한 올바른 해석은 비대칭적이며, 그렇게 명시해야 한다. LFM2.5-VL-3B는 수치가 함께 제시된 비전 능력을 입증했다. Liquid AI d1-omni-600M에는 형제 모델에서 빌려온 비전 인코더, 동결된 백본에 대해 학습된 어댑터, 데모, 그리고 약속이 있다. 이번 달에 배포 환경에서 모델이 이미지에 대해 정확해야 한다면, 3B는 둘 중 유일하게 기댈 만한 무언가가 있는 쪽이다.
속도: 이 중 하나만 측정되었습니다.
의사결정 모델은 아무것도 생성하지 않으므로 중요한 수치는 지연 시간이며, 이번에도 한쪽만 문서화되어 있다. LFM2.5-VL-3B는 Apple M5 Max에서 초당 228토큰, AMD Ryzen AI Max+ 395에서 초당 116토큰으로 제시되며, 둘 다 3.3GB 메모리 안에서 구동되고, Galaxy S26 Ultra에서는 약 초당 20토큰, vLLM 환경의 단일 H100에서는 대략 초당 11,000토큰이다. 이 수치들은 디코딩 처리량을 나타내는데, 이는 글을 쓰는 모델에 적합한 측정치다.
Liquid AI d1-omni-600M의 경우, 카드에는 추론 수치가 보고되지 않는다고 명시되어 있습니다. 이는 해당 모델이 초기 연구 릴리스이며 활발히 개발 중이기 때문입니다. 같은 패밀리의 d1-3B 형제 모델에는 지연 시간 표가 있습니다 — RTX 4090에서 질문 하나에 8ms, Jetson AGX Thor에서 16ms, Jetson AGX Orin 64GB에서 26ms, Orin Nano에서 50ms이며, 하나의 상태에 대해 질문 세 개를 처리하는 데는 질문 하나에 걸리는 시간의 약 1.3배가 듭니다. 이 수치들은 3B 결정 모델에 속하며 600M에 그대로 적용해서는 안 됩니다. Liquid AI d1-omni-600M의 경우, 아키텍처상 작고 빠른 모델임을 시사하지만 연구소 외부에서는 아무도 밀리초 단위 수치를 발표하지 않았다는 것이 정직한 입장입니다.
가중치 메모리 사용량은 최소한 추정할 수 있다. 카드가 권장하는 float16 정밀도에서 587M 파라미터는 활성화 이전 가중치 기준 약 1.2GB다 — 공개된 파라미터 수에 대한 산술 계산일 뿐, 벤더 측정치는 아니다 — LFM2.5-VL-3B에 대해 Liquid가 보고한 3.3GB 미만과 대비된다. 메가바이트 단위가 제약인 기기에서는 그 차이가 600M을 선택하는 근거가 된다.

그들 중에서 고르는 방법
출력 계약을 협상 가능한 것이 아니라 고정된 것으로 취급하면, 그 선택은 깔끔하게 해결된다.
를 선택하세요. LFM2.5-VL-3B결과물이 텍스트일 때: 레이아웃 주석이 포함된 전체 페이지 OCR, 자연어 질의로부터의 그라운딩 및 검출, 기기에서의 표지판 번역, 사람이나 다운스트림 언어 모델이 답변을 소비하는 모든 단계. 또한 32,768 토큰의 더 넓은 컨텍스트와 실전에서 더 깊은 언어 커버리지를 갖추고 있습니다. 답변 자체가 레이블이 아니라 언어이기 때문입니다.
를 다음 경우에 선택하세요: Liquid AI d1-omni-600M결과물이 결정일 때: 티켓 라우팅, 프레임 트리아지, 클립 검열, 가드레일 게이팅, 응답을 2~10 척도로 점수화하기 — 그리고 이 둘 중에서 유일하게 입력이 음성일 때. 이는 이 둘 중 오디오를 입력받는 유일한 모델로, 요청당 최대 30초까지 처리합니다. 다만 모델 카드에는 오디오가 영어 화자와 어시스턴트 간의 교환으로 훈련되었다고 적혀 있는데, 이는 여러분의 호출이 나오게 될 세상을 좁게 묘사한 것입니다.
어느 쪽도 선택하지 말고, 이미지에 대한 판독이나 판정이 아니라 이미지에 대한 추론이 필요한 작업이라면 범용 비전-언어 모델을 그대로 사용하세요. 두 모델 카드 모두 그 사용 사례와는 거리가 있음을 시사하며, Liquid AI d1-omni-600M에는 이를 시도할 메커니즘이 없습니다.
파이프라인을 거기에 걸지 않고 실험적 체크포인트를 시도해 보기
Liquid AI d1-omni-600M은 벤더 자체 표기에 따르면 초기 연구 릴리스이며, 그 비전 및 오디오 동작은 벤치마크되지 않았습니다. 이는 고객 앞에 배치하기보다 폴백 뒤에서 평가하고 싶은 모델의 바로 그런 프로필입니다. OrcaRouter는 하나의 API 키로 200개 이상의 모델을 라우팅하며, 제공업체 전반에 걸친 자동 장애 조치를 이용하면, 이는 이런 체크포인트를 라이브 경로에 올리는 저렴한 방법입니다: 실험적 경로의 성능이 저하되거나 제공업체가 다운되면, 요청은 코드 변경 없이 폴백으로 넘어갑니다. 동일한 키는 파이프라인이 넘겨주는 모든 모델을 각 제공업체의 정가에 0% 마크업으로 그대로 전달하므로, 벤더의 가격 인하가 같은 날 귀하의 가격이 됩니다.
한 가지 주의할 점이 있는데, 이는 매우 중요한 사항이므로 밝혀 둡니다. 오픈 d1 모델과 LFM2.5-VL 제품군은 현재 저희 카탈로그에 없습니다. 가중치를 직접 호스팅하는 것이 두 제품 모두에 대해 벤더가 권장하는 방식이며, Apple, AMD, Qualcomm, NVIDIA 하드웨어 전반에서 첫날부터 llama.cpp를 지원합니다. 또한 호스팅된 엔드포인트에서 실행하려면 벤더 자체 API나 서드파티 플랫폼을 이용해야 합니다. 이 페이지를 이용 가능성에 대한 주장으로 해석하는 것은 잘못입니다.

볼 만한 것
흥미로운 질문은 600M이 언젠가 3B를 무엇이든 능가하느냐가 아니다 — 그럴 일은 없고, 그렇게 만들어진 것도 아니다. 질문은 Liquid AI가 공개하지 않은 비공개 비전 분할을 공개할지, 그리고 그 연구소가 아직 존재하지 않는다고 말하는 오디오 판단 벤치마크를 누군가 만들지다. 그중 하나가 실현되기 전까지, Liquid AI d1-omni-600M과 LFM2.5-VL-3B 사이의 비교는 측정된 모델과 그럴듯한 모델 사이의 비교다. 측정되지 않은 작업 — 음성을 입력받아 판정을 내놓고, 기기에 올라갈 만큼 작은 작업 — 에서 600M은 이 계열에서 그것을 시도하는 유일한 오픈 웨이트 체크포인트이며, 스코어보드 없이 처음이 되는 것도 여전히 처음이 되는 것이다.
OrcaRouter는 하나의 API 키로 200개 이상의 모델을 라우팅하며, 각 제공업체의 정가를 0% 마크업으로 그대로 전달하므로 공급업체가 가격을 인하하면 그날 바로 여러분의 가격이 됩니다.
