'Liquid AI d1-3B vs LFM2.5-2.6B-Base'라는 제목의 히어로 타이틀 카드와 '결정 모델과 그 자신의 조상'이라는 부제목이 왼쪽에서 오른쪽으로 이어지는 가계도로 그려져 있습니다: LFM2.5-2.6B-Base 원시 가중치라고 표시된 카드, post-training이라고 표시된 화살표, d1-3B가 질문에 답한다고 표시된 카드가 있고, 왼쪽 카드 아래에는 keep-training 칩, 오른쪽 카드 아래에는 yes/no, label 및 score 칩이 있습니다.
Guides & Insights

Liquid AI d1-3B 대 LFM2.5-2.6B-Base: 의사 결정 모델과 그 자신의 조상

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이것은 두 경쟁자 사이의 맞대결이 아니다. Liquid AI가 2026년 10월 7일에 공개한 오픈 가중치 의사결정 모델 Liquid AI d1-3B는, 공급업체가 LFM2.5-2.6B의 가중치와 LFM2.5-VL-3B의 텍스트 백본을 평균하여 만든 베이스 위에 구축되었다. LFM2.5-2.6B-Base가 바로 그 첫 번째 부모다. Liquid가 2026년 8월 1일에 업로드한 원시 사전 학습 체크포인트로, 2.69B 파라미터, 34조 개의 학습 토큰, 131,072토큰 컨텍스트, 명령어 튜닝 없음, 채팅 템플릿 없음이다. 따라서 이 비교를 정직하게 프레이밍하면 후손 대 조상이다. 즉, 매우 특정한 작업에 맞게 후속 학습된 모델이, 그것을 빚어낸 원형 그대로의 기반 옆에 서 있는 것이다. 둘 중 하나는 오늘 밤 질문에 답한다. 다른 하나는 당신이 답을 얻어야 하는 질문이 아직 아무도 묻지 않은 질문일 때 시작하는 곳이다.

각각이 실제로 무엇인지

두 모델 카드는 생산 라인의 서로 다른 단계에서 나온 문서처럼 읽히며, 그 차이는 문체상의 것이 아니다.

Liquid AI d1-3B는 3.12B 파라미터, 400M 규모의 SigLIP2 NaFlex 비전 인코더, 32,768 토큰 컨텍스트 윈도, 128,000 토큰 어휘, 그리고 문서화된 16개 언어를 갖추고 있습니다. 이 모델은 결정 모델입니다. 상태와 이름이 지정된 질문들을 주면 예/아니오 확률, 신뢰도가 함께 표시된 선택 레이블과 전체 옵션 분포, 또는 정렬된 점수를 단일 순방향 패스로 반환하며, 출력 토큰은 전혀 생성하지 않습니다. 제공하는 것은 system_one 호출—하나의 상태에 여러 질문을 던지는 용도—, 패딩 없이 많은 요청을 한데 묶는 배치 변형, 그리고 원시 probabilities 접근자로, 기반이 되는 분포에 접근하기 위한 것입니다. 이 모델은 챗 모델이 아니며 텍스트를 작성하지 않습니다. 모델 카드에도 그렇게 적혀 있습니다.

LFM2.5-2.6B-Base는 30개 레이어에 2.69B 파라미터를 담고 있습니다 — 22개의 이중 게이트 숏 컨볼루션 블록과 8개의 그룹 쿼리 어텐션 블록 — 34조 토큰으로 학습되었고, 중간 학습 중 131,072토큰 컨텍스트로 확장되었으며, 동일한 128,000토큰 어휘와 동일한 16개 언어를 사용합니다. 이것은 명령 튜닝이 없고, 모델 카드에 벤치마크가 없으며, 경고처럼 읽히는 권장 사항이 있는 사전 학습된 텍스트 전용 체크포인트입니다: 대규모 파인튜닝이 필요한 작업에만 사용하세요. 텍스트를 완성합니다. 지시를 따르지 않습니다.

둘 다 Liquid 자체 오픈 라이선스에 따른 게이트 없는 다운로드입니다. 둘 다 텍스트 우선입니다. 둘 중 어느 것도 우리 카탈로그에 없으며, 여기 어떤 내용도 둘 중 어느 것에 대한 이용 가능성 주장이 아닙니다.

A two-column scoreboard for Liquid AI d1-3B and LFM2.5-2.6B-Base. The d1-3B column reads: role post-trained decision model; 3.12B parameters; 32,768-token context; text and image input; Decision Index 48.57 (vendor); answers a question in 8 ms. The base column reads: role raw pre-trained base; 2.69B parameters; 131,072-token context; text-only input; Decision Index not scoreable; answers a question only after you fine-tune. The footer reads 'd1-3B figures vendor-reported; the base checkpoint publishes no benchmark table.'

흥미로운 부분은 그 계보야

Liquid는 d1 릴리스를 만들기 위해 새 모델을 파인튜닝하지 않았다. 더 나은 시작점을 얻기 위해 두 체크포인트 — LFM2.5-2.6B와 LFM2.5-VL-3B의 텍스트 타워 — 를 평균낸 다음, 서로 다른 랜덤 시드와 데이터 혼합으로 여러 번의 학습을 파인튜닝하고 그것들을 다시 병합했다. 결과를 개선한 요인에 대한 벤더의 설명에는 별난 기법이 눈에 띄게 빠져 있다: 긴 입력으로 학습하기, 답변 선택지가 나타나는 순서 섞기, 훈련 데이터에서 지름길 제거하기가 그들이 시도한 어떤 고급 방법보다 더 큰 효과를 냈다.

그 단축 경로 제거 세부 사항은 잠시 짚고 넘어갈 가치가 있습니다. 왜냐하면 그것은 이 범주가 피하고자 존재하는 실패를 정확히 지목하기 때문입니다. 객관식 질문에 답하도록 훈련된 모델은 선택지 B가 보통 맞다거나 가장 긴 선택지가 이긴다는 것을 기꺼이 학습합니다. 훈련 중에 선택지 순서를 섞는 것이 바로 그것을 막아줍니다. 상태를 읽는 대신 위치 사전확률을 학습한 의사결정 모델은 쓸모없는 것보다 더 나쁩니다. 그것은 규모가 커질수록 확신을 가지고 틀리며, 진짜 의사결정 모델과 프롬프트를 붙인 분류기를 가르는 바로 그 지점입니다.

공급업체가 분명히 말하지 않기에, 분명히 짚고 넘어갈 만한 퇴행도 하나 있습니다: 기본 체크포인트는 131,072토큰 컨텍스트 윈도를 가지고 있고 Liquid AI d1-3B는 32,768을 가지고 있습니다. 결정 모델로의 사후 학습은 사용 가능한 컨텍스트의 4분의 3을 잃게 했습니다. 후손이 모든 축에서 조상보다 엄격히 우위에 있다고 상상하고 있었다면, 그렇지 않습니다. 그리고 장문 문서 결정은 더 오래된 체크포인트가 더 많은 여지를 가진 축입니다 — 원칙적으로는, 그것을 사용할 결정 헤드가 없기는 하지만요.

비대칭이 붙은 점수판

이 둘을 벤치마크에서 비교하는 것은 범주 오류다. 하지만 정보를 주는 형태를 지닌 범주 오류이므로, 여기 그 주의사항을 명시한 채로 제시한다. 모든 d1-3B 수치는 Liquid 자체의 수치로, 공개 리더보드에 제출된 것이 아니라 벤더가 공식 스코어러로 채점한 것이며, 어떤 제3자에 의해서도 재현되지 않았다. 모든 LFM2.5-2.6B-Base 수치는 빠져 있는데, 베이스 모델은 측정할 것이 없기 때문이다.

• Decision Index 0.2.1 — Liquid AI d1-3B 48.57, 공급업체의 표에서 10B 미만의 모든 항목 중 1위이며, 크기가 12배인 의사 결정 모델보다 앞서 있습니다. LFM2.5-2.6B-Base — 점수가 매겨지지 않았고, 의사 결정 헤드 없이는 점수를 매길 수 없습니다.

• 텍스트 벤치마크 — Liquid AI d1-3B는 이해력, 유해성, 의도, 의료 QA, 교차 언어 이해에 걸친 7개 공개 벤치마크에서 평균 82.9를 기록합니다. LFM2.5-2.6B-Base는 벤치마크 표를 전혀 공개하지 않습니다.

• 비전 — Liquid AI d1-3B는 의사 결정으로 해석되는 11개 이미지 벤치마크에서 평균 74.1을 기록합니다; 이미지를 제거하면 같은 질문이 45.1로 떨어집니다. LFM2.5-2.6B-Base는 텍스트 전용이며 비전 타워가 없습니다.

• 파라미터 — 3.12B 대 2.69B. 의사결정 모델이 둘 중 더 큰 쪽이며, 이는 일반적인 포스트 트레이닝 이야기와는 정반대입니다.

• 컨텍스트 — 131,072 대비 32,768 토큰. 이 행에서는 조상이 이기며, 조상이 이기는 행은 이 행뿐이다.

• 지연 시간 — Liquid AI d1-3B는 RTX 4090에서 단일 질문에 8 ms 만에 답하고 Jetson Orin Nano에서는 50 ms 만에 답하며, 4090에서는 64개의 패킹된 상태를 초당 475개씩 실행합니다. LFM2.5-2.6B-Base는 질문에 답하는 무언가로 파인튜닝하기 전까지는 제시할 지연 시간이 없으며, 그 시점의 수치는 여러분의 파인튜닝의 수치입니다.

A capture of Liquid AI's documentation page for its decision models, showing the left-hand navigation including Decision Models and Liquid Nanos, the 'Open d1' banner announcing that visitors can now run d1-3B and d1-omni-600M locally, and the page's opening description of purpose-built models for structured decisions such as classification, routing and scoring in a single call with zero generation.

실제로 당신이 무엇 사이에서 선택하고 있는지

여기서의 결정 규칙은 이례적으로 명확한데, 그 이유는 두 체크포인트가 같은 예산 항목을 두고 경쟁하지 않기 때문이다.

Liquid AI d1-3B는 질문이 이미 존재하고, 그것이 의사결정 모델이 처리하는 세 가지 형태 중 하나일 때 사용하세요. 예 혹은 아니오, 지정된 집합에서의 선택, 또는 순서가 있는 척도상의 평점입니다. 공개된 적용 사례들은 모두 알아볼 수 있는 실무 작업들입니다. 트리아지와 라우팅, 모더레이션, 의도 및 주제 분류, 추출 검증, 재순위화, 에이전트 가드레일, 시각적 검사 등입니다. 벤더가 10월 5일에 실행한 데모 수치에서는 d1을 GPT-6.1 Sol 및 Claude Opus 5.5와 여섯 개의 그러한 작업에서 비교했고, 네 개에서 GPT-6.1 Sol과 동등하거나 능가하면서 비용은 19배에서 200배 더 적다고 주장합니다. 방법론 페이지에는 각 적용 사례가 모델당 한 번씩만 실행되었다고 명확히 적혀 있으니, 주장의 세부 숫자가 아니라 주장의 형태를 발견된 사실로 받아들이세요. 정말로 인상적인 것은 검사 데모입니다. 모델이 학습한 적 없는 작업에서 짧은 설명만으로 이해한 뒤 네 개 생산 라인에 걸쳐 양품 대 불량품을 85~97% 정확도로 분류한 것입니다.

LFM2.5-2.6B-Base를 선택하세요아직 질문 자체가 존재하지 않을 때 말입니다. 이는 직접 소유하려는 파인튜닝을 위한 더 저렴한 출발점입니다 — 도메인 의사결정 헤드, 맞춤형 분류기, 아무도 체크포인트를 갖고 있지 않은 작업 말입니다. 아키텍처와 토크나이저, 긴 컨텍스트는 물려받고, 그 대가는 연산, 데이터, 평가로 치릅니다. 벤더가 d1을 중심으로 만든 네 가지 애플리케이션 중 두 가지는 처음부터가 아니라 오픈소스 프로젝트에서 출발했는데, 이는 베이스 체크포인트와 규율이 실제로 무엇을 만들어내는지 잘 보여주는 그림입니다.

실질적인 함정은 베이스 체크포인트를 바로 대체해 넣을 수 있는 것으로 취급하는 데 있다. 그것은 어시스턴트가 아니고, 프롬프트를 따르지 않으며, 챗 모델로서 평가하면 거의 0에 가까운 점수를 받는다 — 이는 그 품질에 관한 사실이 아니라 'base'가 무엇을 의미하는지에 관한 사실이다.

둘 중 하나를 셀프 호스팅하는 것, 그리고 그 위의 레이어

둘 다 가중치로 제공되며, 공급업체가 d1 쪽의 배포 작업을 처리했습니다: 출시 첫날부터의 llama.cpp 지원, DGX부터 Jetson까지의 전체 NVIDIA 스택, NVFP4 양자화, 8비트 가중치 및 활성화 변형, 그리고 Hugging Face에서의 GGUF 변환입니다. 기본 체크포인트는 더 넓은 LFM2.5 패밀리를 통해 자체적인 GGUF, ONNX, MLX 변형을 갖추고 있습니다. 직접 호스팅하고 싶지 않다면 Liquid는 호스팅된 d1을 자체 API에서 제공하며, 가격은 입력 토큰에 대해서만 책정되고, 이미지는 32×32픽셀 패치당 1.5토큰으로 청구됩니다. 텍스트 전용 액세스는 타사 플랫폼을 통해서도 이용할 수 있습니다.

두 경로 중 어느 쪽도 바꾸지 않는 것은 스택의 나머지 부분입니다. 직접 호스팅하는 모델은 계속 살아 있게 유지하고, 버전을 관리하고, 장애 조치해야 하는 모델입니다. 그리고 그 모델이 공급하는 결정은 여전히 당신이 호스팅하지 않는 생성 호출 옆에 놓입니다. 그 조합이 바로 라우터가 하나로 합치는 계층입니다. 200개 이상의 모델을 아우르는 단일 엔드포인트, 0% 마크업으로 제공업체 정가를 그대로 전달하므로 공급업체 가격 변경이 같은 날 당신 쪽에도 반영되고, 자동 장애 조치 덕분에 한 업스트림의 안 좋은 오후가 당신의 서비스 중단이 되지 않습니다. 그 옆에 3B 결정 모델을 셀프 호스팅하면 라우팅 문제는 완화되기보다 더 날카로워집니다. 이제 파이프라인의 절반은 소유하고 나머지 절반은 임대하기 때문입니다.

어느 것, 누구를 위한 것인가

이번 주에 답을 얻어야 하는 질문이 의사결정 모델이 취하는 세 가지 형태 중 하나이고, 그것이 다른 누군가가 이미 상상해 둔 질문이라면, 그 파생 모델은 완성되어 있고 무료이며 GPU가 없는 기기에서 50ms 만에 실행됩니다 — Liquid AI d1-3B를 선택하고 끝내세요.

만약 당신이 아직 아무도 묻지 않은 질문에 답하는 것을 만들고 있고, 그것을 소유할 데이터와 컴퓨트를 갖고 있다면, LFM2.5-2.6B-Base는 정직한 출발점이며, 이 글에 나오는 파생 모델이 당신이 앞으로 밟을 바로 그 경로를 통해 그것으로부터 만들어졌다는 점을 알아두는 것이 좋습니다.

그리고 그 두 상황 중 어느 쪽에 있는지 확실하지 않다면, 답은 거의 항상 첫 번째입니다. 의사결정 헤드로 포스트트레이닝하는 것은 비싼 선택이고, 남의 것을 돌리는 것은 무료입니다.

A capture of our own models catalogue page, showing the filter rail for input modalities, context length, input price, status, series and supported parameters, a header reading '207 models, 16 providers, one API key, one bill', sort control set to Newest, a model listing beginning with openai/gpt-5-search-api-2025-10-14, and a 'How to call any model' panel with the OpenAI-compatible endpoint https://api.orcarouter.ai/v1/chat/completions.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트