
Liquid AI d1-3B vs Granite 4.2 3B: 절대 같은 역할을 하지 않는 두 개의 3B 모델
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Liquid AI d1-3B와 Granite 4.2 3B를 같은 단일 GPU에 올리면 둘 다 넉넉하게 들어갑니다 — 한쪽에는 3.12B 매개변수, 다른 쪽에는 3B가 있습니다. 또한 마치 서로 다른 분야에서 온 것처럼 행동합니다. IBM 자체 모델 카드에 2026년 8월 25일자로 기재된 Granite 4.2 3B는 추론 모델입니다: 세 가지 사고 모드, <think> 블록, 그리고 읽게 되는 답변이 있습니다. 2026년 10월 5일 Hugging Face에 업로드되고 이틀 뒤 Liquid가 발표한 Liquid AI d1-3B는 결정 모델입니다: 상태와 명시적으로 타입이 지정된 질문 집합을 받아 한 번의 순전파로 확률, 레이블 또는 척도상의 위치를 반환하며, 다음을 보고합니다: output_tokens: 0 왜냐하면 아무것도 쓰지 않기 때문입니다. 유용한 질문은 어느 쪽이 더 나은가가 아닙니다. 여러분의 호출 중 어느 것이 실제로 결정인가입니다. 왜냐하면 두 저장소는 그 분할의 반대쪽 절반을 위해 만들어졌기 때문입니다.
각 저장소에는 실제로 무엇이 들어 있나요?
아래의 모든 내용은 두 모델 카드와 Liquid의 발표 게시물에서 가져온 것입니다. 여기 있는 어떤 것도 독립적으로 재현된 바 없으며, 제3자가 동일한 하네스에서 두 모델 중 어느 것도 평가한 적이 없고, 카드에 있는 수치는 각 공급업체 자체의 것입니다.
• 크기 — Liquid AI d1-3B 총 3.12B, Liquid의 LFM2.5-VL-3B 기반으로 구축; Granite 4.2 3B는 granite-4.1-3b-base 기반으로 구축된 3B 디코더 전용 dense 트랜스포머
• 출력 — d1-3B는 확률, 레이블, 신뢰도를 반환하고 텍스트를 전혀 작성하지 않습니다. Granite 4.2 3B는 선택적 사고 연쇄를 다음 태그 안에 포함하여 토큰을 생성합니다: <think> 태그
• 컨텍스트 — d1-3B 32,768 토큰; Granite 4.2 3B는 기본적으로 128K이며, 카드 상에서 512K까지의 장문 컨텍스트 확장이 포함되어 있습니다
• 입력 — d1-3B 텍스트, JSON, 이미지 또는 이들의 조합, SigLIP2 NaFlex 400M 비전 인코더를 통해; Granite 4.2 3B는 텍스트 전용
• 라이선스 — d1-3B는 Liquid의 LFM Open License v1.0에 따름; Granite 4.2 3B는 Apache 2.0에 따름
• 언어 — d1-3B는 16개를 나열하고, Granite 4.2 3B는 테스트된 12개를 나열하며, 카드에는 다른 항목들은 테스트되지 않았다고 표기되어 있습니다.
• 서빙 — d1-3B는 사용자 지정 코드를 포함합니다 (trust_remote_code=True, transformers>=5.14), 같은 패밀리의 GGUF 및 w8a8 리포지토리와 llama.cpp, Ollama, LM Studio용으로 문서화된 카드도 함께 제공되며; Granite 4.2 3B는 사용자 지정 사고 파서와 함께 vLLM 0.20+ 또는 SGLang 0.5.18+에서 실행됩니다
그중 두 행은 나머지보다 더 큰 역할을 한다. 출력 행은 이 글의 논지 전체이고, 라이선스 행은 아무도 비교표에 넣지 않는 항목이다.

하나는 사고의 연쇄를 쓰고, 다른 하나는 쓰기를 거부한다.
Granite 4.2 3B는 생각을 드러내는 방식으로 제 몫을 한다. 그 모델 카드에는 세 가지 모드가 문서화되어 있다: 기본적으로 사고가 켜지는 모드, 비사고 모드, 그리고 추론 흔적을 유지하되 더 짧게 만드는 저노력 모드. 서빙 스택은 추론 흔적을 최종 답변과 분리하므로, 애플리케이션은 깔끔한 콘텐츠와 별도의 추론 필드를 받는다. 이는 풀어내야 하는 질문, 즉 수학 문제, 논리 분기, 판단하기 전에 작성해야 하는 코드 조각에 좋은 설계다.
d1-3B에는 그런 모드가 없으며, 그 카드에도 노골적으로 이렇게 적혀 있습니다: "이것은 채팅 모델이 아니며 텍스트를 작성하지 않습니다." 호출은 유형과 함께 질문을 선언합니다. noul은 0과 1 사이의 P(yes)를 반환하는 예/아니오입니다. choice는 명명된 옵션 집합에서 라벨 하나를 선택하고 라벨, 신뢰도, 옵션별 확률을 반환합니다. score는 상태를 순서형 2~10 척도에 배치하고 기대 수준을 해당 분포 및 범례와 함께 반환합니다. 신호는 토큰별로 샘플링되는 것이 아니라 한 번의 패스로 플레이스홀더 위치의 로짓에서 읽히므로, 사용량 블록이 거짓말하지 않고 출력 토큰 0개를 보고할 수 있습니다.
그 차이는 정확도를 바꾸기 전에 청구서를 바꿉니다. 400토큰 동안 생각하는 Granite 분류 호출은 400개의 출력 토큰을 지불하는 호출이며, 원하는 레이블은 파서가 나중에 추출해야 하는 산문 속에 묻혀 있습니다. d1-3B 호출은 입력에 대해서만 과금됩니다. 트래픽 대부분이 규칙이 붙은 레이블이라면, 추론이 레이블을 바꿨든 바꾸지 않았든 그 추론에 계속 비용을 지불해 온 셈입니다.
Granite 4.2 3B가 분명히 더 나은 선택인 경우
추론 벤치마크를 액면 그대로 받아들인다면 — IBM 자체 벤치마크이고, 내부 NeMo Evaluator 파이프라인을 통해 실행되었으며, 외부에서 이를 재현한 곳은 없다 — 3B는 크기에 비해 유난히 강력하다: AIME25 78.33, HMMT February 2025 66.67, GPQA 54.80, LiveCodeBench v6 69.71, MMLU-Pro 67.84, IFBench 74.33, BFCL v4 52.41, tau3-bench 45.78, RULER 64K 67.52, 128K에서는 55.30으로 하락.
그 목록에서 네 가지 작업이 도출되며, d1-3B는 그중 어느 것에도 없습니다.
• 128K 네이티브 컨텍스트, 512K까지 확장 가능, d1-3B의 32,768 토큰과 대비 — 당신의 상태가 긴 문서라면, 선택은 알아서 내려집니다
• 문서화된 파서와 OpenCode, Pi, OpenHands용 하네스 통합을 갖춘 에이전트형 도구 호출 — 의사결정 모델에는 이에 상응하는 기능이 없음
• 답변이 한 단락인 모든 작업: 요약, 초안 작성, 자유 형식 구조로의 추출, 코드 생성
• 매출 상한 없이 파인튜닝 및 재배포가 가능합니다. Apache 2.0에는 임계값 조항이 없기 때문입니다.
Granite 카드에 없는 점을 주목하세요: 3B의 경우 SWE-Bench 및 Terminal-Bench 행이 NA로 표시됩니다. IBM의 에이전트형 강화 학습 단계는 이 패밀리의 8B와 30B 모델에만 적용되었으므로, 가장 작은 모델은 더 큰 형제 모델들이 보유한 에이전트 점수를 갖지 않습니다. "Granite 4.2"를 보고 3B가 패밀리의 에이전트 프로필을 물려받을 것이라고 가정하는 팀은 놀랄 것입니다.

Granite가 생각을 마치기도 전에 d1-3B가 이기는 곳
Liquid가 자체적으로 측정한 웜 상태의 지연 시간 표는, 한 번에 요청 하나씩 처리했을 때, 그 주장의 가장 강력한 부분이다: RTX 4090에서는 단일 질문에 8ms, AMD MI325X에서는 9ms, Jetson AGX Thor에서는 16ms, Jetson AGX Orin 64GB에서는 26ms이며, 64개 상태를 한 번의 패스로 묶어 4090에서는 475/s, MI325X에서는 1,106/s를 기록한다. 규모를 가늠하자면, 이는 Granite 4.2 3B가 자체 추론 흔적의 토큰 몇 개를 내보내는 데 필요한 시간과 대략 맞먹는다.
하나의 상태에 대해 세 가지 질문 유형을 처리하는 데는 4090에서 세 번의 개별 호출이 아니라 d1-3B로 21ms가 듭니다. 상태와 그 이미지가 모든 질문에 대해 한 번만 읽히기 때문입니다. 규칙마다 하나의 HTTP 요청을 발생시키던 모더레이션 또는 라우팅 스택에서 이는 호출 큐와 단일 호출의 차이입니다.
그것은 또한 볼 수 있다. d1-3B는 11개 공개 이미지 벤치마크에서 평균 74.1점을 기록했으며, 기본 모델은 73.9점이다. 모델 카드는 이미지를 제거하면 같은 질문의 점수가 45.1점이라고 지적한다 — 답은 텍스트 프롬프트가 아니라 그림에서 나오고 있다. 개별 행은 양쪽으로 갈린다(CV-Bench 82.1 대 기본 모델 87.6, POPE 88.5 대 90.1). 따라서 비전 관련 주장은 '기본 모델과 동등함'이지 '그보다 더 낫다'가 아니다.
정직한 균형추: Decision Index 0.2.1에서 d1-3B의 48.57은 리더보드 제출이 아니라 Liquid가 공식 스코어러를 직접 실행해 나온 결과이며, 비교 대상 행들은 공개 리더보드에서 나온 것이다. 벤치마크를 의사결정 과제로 삼은 여덟 과제에서의 77.1 평균과 DecisionBench에서의 71.8 역시 마찬가지로 자체 측정치다. 이 비교에서 d1 쪽에 있는 모든 것은 검증되지 않았다.

왜 3B 추론 모델은 3B 의사결정 모델이 아닌가
유혹적인 선택은 Granite 4.2 3B를 d1-3B의 더 저렴한 대체재로 취급하거나, 그 반대로 취급하는 것이다. 둘 다 실패하며, 그 실패는 품질의 문제라기보다 구조적인 문제다.
Granite에게 결정을 맡기면 파싱해야 하는 생성 결과, 모델이 그 질문을 얼마나 어렵게 판단했는지에 따라 커지는 요금, 그리고 선택한 사고 모드에 따라 달라지는 지연 시간을 얻게 된다. d1-3B에게 추론을 맡기면 아무것도 얻지 못한다 — 추론할 토큰 스트림 자체가 없기 때문이다. 두 모델은 대부분의 파이프라인이 요청마다 여러 번 넘나드는 경계선의 반대편에 있다: 무언가는 결정해야 하고, 무언가는 말해야 한다. d1-3B는 맨 앞, 즉 트리아지 규칙이 경로를 선택하고 보정된 신뢰도를 반환하는 곳에 속한다. Granite 4.2 3B는 그 뒤, 즉 답을 작성해야 하는 분기에 속한다.
두 번째, 더 은밀한 함정이 있습니다. 의사결정 모델의 가치는 캘리브레이션에 있습니다 — 열 번 중 아홉 번 맞는 0.9의 확신 말입니다. Granite 4.2 3B의 모델 카드는 어떤 캘리브레이션 지표도, 어떤 확률도 공개하지 않습니다; 정확도와 추론 점수를 공개합니다. 벤치마크 리더보드에서 이 둘을 비교하는 것은 임계값과 관련해 어느 쪽을 신뢰해야 하는지에 대해 아무것도 알려주지 않습니다.
아무도 표에 넣지 않는 라이선스 문구
Granite 4.2 3B는 Apache 2.0에 따라 배포됩니다. d1-3B는 LFM Open License v1.0에 따라 배포되는데, 이 라이선스는 섹션 5까지는 허용적으로 읽히지만, 섹션 5에서는 상업적 사용이 귀하 또는 귀하의 법인이 동일 문서에서 연간 매출 1천만 미국 달러 이상으로 정의된 기준선 아래에 머무는 조건으로 부여되며, 그 선을 넘는 상업적 사용에는 라이선스가 부여되지 않습니다. 비영리 단체와 연구 사용자는 예외로 인정됩니다.
취미로 하는 사람이나 스타트업에게 이건 문제가 되지 않는다. 연중에 그 경계를 넘어선 회사, 혹은 그런 회사에 인수될 가능성이 있는 회사에게는, 두 저장소가 파라미터 수만 비슷해 보여도 결코 동등한 결과물이 아니며, 라이선스 검토는 누군가 이미 프로토타입을 출시한 훨씬 뒤에나 이루어진다. 이 페이지에서 가장 저렴하게 일찍 확인할 수 있는 항목이다.
페어를 하나의 파이프라인으로 실행
두 모델 모두 오늘 우리 카탈로그에 없으므로, 이는 가용성 주장이 아닙니다: 둘 다 자체 호스팅 아티팩트이며, 특히 Granite 4.2 3B는 카드에 추론 제공업체가 전혀 나열되어 있지 않습니다. 그러나 팀이 실제로 도달하게 되는 패턴은 결정을 내리는 호출 하나와 말하는 호출 하나이며, 바로 그 패턴에서 라우팅 레이어가 제자리를 얻습니다. OrcaRouter는 하나의 API 키 뒤에 200개 이상의 모델을 두고 제공업체 정가를 0% 마크업으로 그대로 전달하므로, 벤더 가격 인하가 다음 계약 갱신 때가 아니라 같은 날 청구서에 반영되고, 제공업체 전반에 걸친 자동 장애 조치 덕분에 파이프라인 중간의 공유 구성 요소가 아직 평가 중일 때 단일 장애 지점이 되지 않습니다. 자체 호스팅 배포를 확정하기 전에 자체 트래픽으로 d1-3B를 호스팅된 범용 모델과 A/B 테스트해 보고 싶다면, Granite 계보에 가장 가까운 라우팅된 이웃은 백만 입력 토큰당 $0.13, 백만 출력 토큰당 $0.38인 Gemma 4 31B입니다 — 훨씬 큰 모델이지만 파이프라인에서 "글을 쓰는 범용 모델"이라는 같은 역할을 합니다.
규칙으로 표현된 판정
필요한 것이 판단 — 스팸인지 아닌지, 어느 큐에 넣을지, 얼마나 긴급한지, 이 이미지가 그 설명과 맞는지 — 이라면, d1-3B는 둘 중 유일하게 한 번의 패스로 그 일을 처리하며, 한 자릿수 밀리초 만에 해냅니다. 필요한 것이 서면 답변, 긴 문서 읽기, 도구 호출 또는 코드 한 조각이라면, 토큰 스트림이 애초에 존재하는 쪽은 Granite 4.2 3B이며, 3B의 추론 점수는 그 크기를 고려하면 정말 인상적입니다 — IBM 자체 평가에서, 아직 아무도 검증하지 않았다는 점을 감안하면요.
그림을 바꿀 것은 새로운 벤치마크 행이 아니다. 그것은 제3자가 두 모델을 동일한 캘리브레이션 하네스에서 채점하는 것이다. 왜냐하면 모델에 임계값을 설정할 수 있는지를 결정하는 그 속성은 오늘날 어느 쪽 카드로도 비교할 수 없게 되어 있는 바로 그 속성이기 때문이다.
