
Liquid AI d1-3B vs MiniCPM5-2B: 노트북 규모에서 확률인가 산문인가
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
두 오픈 웨이트 모델은 둘 다 눈앞에 있는 머신에서 실행할 수 있을 만큼 작지만, 모델이 무엇을 돌려주어야 하는지에 대해서는 서로 의견이 다르다. Liquid AI d1-3B는 Liquid AI의 3.12B 의사결정 모델로, 2026년 10월 7일에 오픈 웨이트로 공개되었다. 이 모델은 상태와 이름이 지정된 질문 세트를 읽고, 한 번의 순전파로 레이블, 각 옵션별 확률, 신뢰도를 반환하며, 아무것도 생성하지 않는다. MiniCPM5-2B는 ModelBest와 OpenBMB의 2.52B 덴스 모델로, 7월 19일 세계인공지능대회(World Artificial Intelligence Conference)에서 선보였고 2026년 9월 초 Apache-2.0 라이선스로 Hugging Face에 조용히 게시되었다. 답변을 작성하고 XML로 함수를 호출하는 추론·코딩·도구 호출 어시스턴트이며, 이미 100만 건이 넘는 다운로드를 기록했다. 더 작은 쪽은 컨텍스트 창이 네 배 더 크고 라이선스도 훨씬 더 관대하다. 더 큰 쪽은 원하더라도 토큰 하나를 생성할 수 없다. 이 두 가지 형태 중 어느 것이 여러분의 파이프라인에 들어가야 하는지는 전적으로 호출 이후 다운스트림에 있는 대상이 숫자를 원하는지 문장을 원하는지에 달려 있다.
가장 먼저 주목할 만한 반전
이 페어링에 대한 거의 모든 직관적 기대는 거꾸로 되어 있으니, 거기서부터 시작하세요.
MiniCPM5-2B는 더 작은 모델이며 더 긴 컨텍스트를 보유합니다: Liquid AI d1-3B의 32,768개에 비해 131,072개 토큰입니다. 또한 두 모델 중 라이선스가 더 관대합니다 — Apache-2.0, 게이팅 없음, 훈련 데이터셋은 UltraData 제품군의 일부로 가중치와 함께 공개됩니다. Liquid AI d1-3B는 Liquid 자체의 lfm1.0 라이선스로 배포되며, 다운로드 및 파인튜닝이 가능하지만 표준 퍼미시브 라이선스가 아닌 벤더 라이선스입니다.
Liquid AI d1-3B는 더 큰 모델입니다 — 전체 파라미터가 3.12B 대 2.52B이고, 비임베딩 파라미터에서는 비교가 다시 뒤집히긴 하지만 — 그리고 글을 쓸 수 없는 쪽은 바로 이 모델입니다. 이 모델은 시각 기능을 갖췄고, MiniCPM은 텍스트 전용입니다. 이 모델은 정확히 한 가지를 위해 포스트 트레이닝되었고, MiniCPM은 여러 가지를 위해 포스트 트레이닝되었습니다. 그리고 MiniCPM5-2B가 자신을 자기 크기 등급의 최상위에 올려놓는 비교 차트와 함께 등장하는 반면, Liquid AI d1-3B는 단일 지수 점수와 일련의 지연 시간 테이블을 함께 내놓습니다.
그 어떤 것도 한쪽이 더 낫다는 뜻이 아니다. 그것은 둘이 서로 다른 작업을 겨냥하고 있다는 의미이며, 결정적인 단서는 각자가 돌려주는 답의 형태다.
회선을 통해 무엇이 돌아오는가
MiniCPM5-2B는 생성형 언어 모델이다. 추론하고, 산문으로 답하며, SGLang에 내장된 minicpm5 파서가 OpenAI 호환 tool_calls로 변환하는 XML 스타일 도구 호출을 내보내며, 사용자 정의 어댑터 없이 작동한다. 이 모델의 사후 학습(post-training)은 그 이야기에서 흥미로운 부분이다: 4,000억 토큰의 심층 사고(deep-thinking) 지도 미세 조정, 그다음 JustRL II에서 차용한 크리틱 기반 알고리즘을 사용한 강화 학습, 그다음 16명의 특화된 RL 교사 — 그중 다섯은 에이전트형 — 를 하나의 고밀도 네트워크로 다시 접어 넣는 온폴리시 증류(on-policy distillation). 모델 카드는 RL과 증류를 통해 추론 및 일반 작업에서 평균 10.96점, 에이전트 작업에서 6.96점의 향상을 거두었다고 평가하며, 자체 비교 세트에서 평균 53.9점을 보고하는데, 이는 그 세트에 포함된 가장 큰 모델보다 높다. 이는 ModelBest의 수치로 내부에서 산출된 것이며, 아직 독립적인 재현 결과는 발표되지 않았다.
Liquid AI d1-3B는 구조를 반환합니다. noul 질문은 0과 1 사이의 P(yes)로 반환됩니다. 선택 질문은 레이블, 신뢰도, 각 옵션별 확률로 반환됩니다. 점수 질문은 2에서 10까지의 순서형 척도에서 기대 수준과 그 분포 및 범례를 반환합니다. usage 객체는 output_tokens: 0, 그리고 원시 probabilities 접근자가 있으며, 가공되지 않은 벡터를 원한다면 사용할 수 있습니다. 이 모델의 사후 학습은 정반대 종류의 작업이었습니다: 두 체크포인트를 함께 평균하고, 서로 다른 데이터 혼합으로 여러 시드를 미세 조정한 뒤 병합하고, 그다음 긴 입력 학습에 노력을 쏟았습니다. 답변 옵션 순서를 섞고 훈련 데이터에서 지름길을 제거하면서요 — 상태를 읽는 대신 "옵션 B가 보통 맞다"를 학습하는 결정 모델은 쓸모없는 것보다 더 나쁘기 때문입니다.
하나는 모델에게 생각한 뒤 무언가를 말하라고 요청한다. 다른 하나는 모델에게 이미 무엇을 믿고 있는지 묻는다.

나란히, 출처가 표시된 상태로
아래의 모든 수치는 벤더가 보고한 것입니다. MiniCPM5-2B의 수치는 ModelBest 자체 카드와 자체 비교 세트에서 나온 것이고, Liquid AI d1-3B의 수치는 Liquid가 공개 리더보드에 제출하는 대신 공식 Decision Index 스코어러를 직접 실행한 데서 나온 것입니다. 오픈 웨이트 릴리스 시점까지 두 모델 모두 제3자에 의해 독립적으로 벤치마크된 바 없습니다.
• 매개변수 — Liquid AI d1-3B는 총 3.12B이며, 400M SigLIP2 비전 인코더와 128,000개 토큰 어휘를 갖추고 있습니다; MiniCPM5-2B는 총 2,516,756,480개, 비임베딩 1,981,982,720개, 42개 레이어, 16개 쿼리 헤드에서 2개 KV 헤드로, 어휘 130,560개.
• 컨텍스트 — Liquid AI d1-3B의 경우 32,768 토큰; MiniCPM5-2B의 경우 131,072.
• 입력 모달리티 — Liquid AI d1-3B는 텍스트와 이미지, MiniCPM5-2B는 텍스트만.
• 출력 — 확률, 레이블, 신뢰도 및 정렬된 점수, 출력 토큰 0개, Liquid AI d1-3B의 경우; MiniCPM5-2B의 경우 생성된 텍스트, 추론 및 XML 도구 호출.
• 헤드라인 점수 — Liquid AI d1-3B는 Decision Index 0.2.1에서 48.57로, 공급업체 표에서 10B 미만 모델 중 1위입니다; MiniCPM5-2B는 자체 비교 세트에서 평균 53.9이며, 이는 서로 다른 것을 측정하는 다른 세트입니다.
• 속도 — RTX 4090에서는 질문당 8ms, Jetson AGX Orin 64GB에서는 26ms, Jetson Orin Nano에서는 50ms이며, Liquid AI d1-3B의 경우 패스당 64개의 패킹된 상태를 초당 475개 처리합니다. MiniCPM5-2B의 속도는 생성하는 토큰 수에 따라 달라지므로, 그와 맞세울 단일 수치는 없습니다.
• 라이선스 — Apache-2.0, 게이트 없음, 학습 데이터 공개, MiniCPM5-2B용; Liquid AI d1-3B용 Liquid의 lfm1.0.
• 근거 — MiniCPM5-2B의 경우 Hugging Face 다운로드 100만 건 이상과 한 달간의 커뮤니티 양자화; Liquid AI d1-3B는 존재한 지 이틀에 제3자 실행이 없음.
각자가 실제로 잘하는 일
두 모델 모두 할 수 있는 워크플로가 있는데, 그것을 해내는 방식의 차이가 바로 전부다.
지원 티켓을 분류하거나, 검색된 구절이 질문에 답하는지 판단하거나, LLM 출력을 루브릭에 따라 채점한다고 가정해 보세요. MiniCPM5-2B는 이 세 가지를 모두 할 수 있습니다. 도구 호출과 긴 컨텍스트를 갖춘 유능한 소형 추론 모델이며, 다른 어시스턴트처럼 실행하면서 레이블을 요청한 뒤 돌아오는 응답을 파싱하면 됩니다. 때로는 깔끔한 JSON을 반환합니다. 때로는 설명이 둘러싼 JSON을 반환합니다. 때로는 올바른 답을 잘못된 형태로 반환하는데, 그 실패는 모델이 아니라 파서의 버그입니다.
Liquid AI d1-3B는 다른 어떤 것도 할 수 없다. 바로 그게 핵심이다. 동일한 세 가지 작업에서 이 모델은 확률과 레이블만 반환하고 파싱할 것은 아무것도 없다. 하나의 상태에 대한 세 가지 질문은 하나일 때의 1.3배 시간이 들며, 실패 모드는 "형식이 깨졌다"에서 "신뢰도가 잘못 보정됐다"로 바뀐다. 후자는 최소한 측정 가능한데, 신뢰도가 응답 안에 바로 있기 때문이다.
MiniCPM5-2B가 완전히 우위를 점하는 지점은 그 결정 이후의 모든 것입니다. 131K 토큰을 보유하므로 상태는 문서의 첫 페이지가 아니라 저장소 전체 파일 트리나 긴 문서가 될 수 있습니다. 도구 호출을 네이티브로 작성합니다. 작은 에이전트를 그 위에 구축할 수 있는 모델이며, 에이전트 작업을 위해 명시적으로 사후 학습되었습니다. 그리고 Apache-2.0 라이선스 덕분에 흔한 상업용 변호사와의 대화는 일어나지 않습니다.
Liquid AI d1-3B가 확실히 우위를 점하는 부분은 지연 시간 하한과 모달리티다. GPU 없이 50ms 만에 판단을 실행하는 기기는 MiniCPM5-2B를 실행하는 기기가 아니다. 비슷한 파라미터 수에도 불구하고 이 둘은 서로 다른 하드웨어 등급에 속한다. 그리고 3B는 본다 — 벤더는 의사결정으로 해석되는 11개 공개 이미지 벤치마크에서 74.1을 보고하며, 이는 이것이 기반으로 만들어진 비전-언어 모델의 73.9와 대비된다. 또한 이미지를 제거하면 같은 질문들이 45.1로 무너진다고 보고하는데, 이는 답이 픽셀에서 나온다는 것을 보여주려는 그들의 방식이다. 생산 라인의 육안 검사는 텍스트 전용 2B가 아예 맡을 수 있는 작업이 아니다.

이들을 실행하는 것, 그리고 이들을 둘러싼 계층
둘 다 자체 호스팅 사례이며, 둘 다 배포 작업이 완료되었습니다. Liquid AI d1-3B는 출시 첫날부터 llama.cpp 지원, DGX부터 Jetson까지의 전체 NVIDIA 스택, NVFP4 양자화, 8비트 가중치 및 활성화 빌드, 그리고 이미 게시된 GGUF 변환을 제공합니다. MiniCPM5-2B는 사용자 정의 커널이 필요 없는 단순한 LlamaForCausalLM 아키텍처, 하나의 BF16 safetensors 샤드, 더 넓은 패밀리의 GGUF 및 MLX 빌드, 그리고 툴 호출 파서가 필요할 때 SGLang을 선호한다는 문서화된 내용을 갖추고 있습니다. 둘 다 우리 카탈로그에 없으며, 이 글은 둘 중 어느 것에 대한 가용성 주장도 아닙니다.
호스팅된 대안은 벤더 자체 API와 타사 플랫폼입니다. Liquid가 호스팅하는 것은 d1이며, 입력 토큰만 기준으로 백만 개당 $0.04로 가격이 책정되고, 이미지는 32×32픽셀 패치당 1.5토큰으로 입력으로 청구되며 출력 라인은 전혀 없습니다; MiniCPM5-2B는 자사 API가 없는데, 이는 Apache-2.0 오픈 웨이트 릴리스에서 일반적입니다.
이 둘이 결국 함께 흘러 들어가는 곳은 동일한 아키텍처 문제다. 분류, 라우팅 또는 가드레일 검사를 처리하는 로컬 2B나 3B 모델이 여러분이 직접 호스팅하지 않는 생성 호출 앞에 자리하고, 자체 추론 옆에 임대 추론이 나란히 놓인 그 혼합이야말로 라우팅 계층이 흡수하기 위해 존재하는 것이다. 200개 이상의 모델을 아우르는 단일 엔드포인트, 공급자 정가를 0% 마크업으로 그대로 전달하므로 벤더 가격 변경이 같은 날 바로 반영되고, 자동 장애 조치업스트림 하나가 성능 저하를 보일 때. 소형 모델을 직접 소유하면 라우팅 문제는 더 쉬워지는 게 아니라 더 어려워진다. 이제 여러분의 하드웨어와 다른 누군가의 하드웨어 사이의 경계를 요청마다 결정해야 하기 때문이다.
답변 유형별로 선택하세요
필요한 것이 레이블, 확률 또는 평점이고 선택지 집합이 사전에 알려져 있다면, Liquid AI d1-3B는 더 정직한 도구입니다 — 그것은 바로 그런 요청을 위해 만들어졌고, 답변은 잘못된 형식으로 도착하지 않을 것입니다. 벤더 라이선스, 32K 컨텍스트, 이틀 된 증거 흔적을 그 대가로 받아들이십시오.
추론하고, 도구를 호출하고, 긴 문서를 붙들고, 말로 답할 수 있는 작은 모델이 필요하다면, MiniCPM5-2B는 훨씬 더 유능한 기계이며, Apache-2.0과 백만 다운로드에 해당하는 다른 사람들의 테스트가 뒷받침하고 있습니다.
두 릴리스 중 어느 쪽에서든 최대의 효과를 얻을 팀은 둘 다를 운영하는 팀입니다: 앞단에는 답이 숫자이고 밀리초가 중요한 의사 결정 모델이, 그 뒤에는 언어가 필요한 작업 부분을 위한 작은 생성 모델이 있습니다. 이들은 경쟁자가 아닙니다. 이들은 필터와 스피커입니다.

