
Liquid AI d1-3B vs Intern-Decision-4B: 어떤 캘리브레이션된 결정자가 실제로 필요한가?
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
오픈 가중치 모델 두 개가 이제 아무것도 쓰지 않는 방식으로 질문에 답한다. 그리고 두 모델의 I/O 스키마를 나란히 놓기 전까지는 같은 아이디어가 두 번 반복된 것처럼 보인다. 2026년 10월 5일 Hugging Face에 업로드되고 이틀 뒤 Liquid가 발표한 Liquid AI d1-3B는 3.12B 멀티모달 결정 모델로, 모델 카드에는 그것이 "채팅 모델이 아니며 텍스트를 작성하지 않는다"라고 단호히 적혀 있다. InternLM의 Intern-Decision-4B는 2026년 9월 26일 블로그 글도, 트윗도, 출시 페이지도 없이 조용히 InternLM 조직에 업로드되었으며, Qwen3.5-4B에서 파인튜닝된 4B 결정 모델로, 마찬가지로 모든 질문에 대해 한 번의 순전파로 답변 분포를 반환한다. 표면적으로는 같은 계약이다. 그 이면의 차이점들 — 당신을 곤란하게 만들 라이선스, 실수로 텍스트를 쓸 수 있는 계약, 그리고 아무도 비교하지 않은 머신 — 이 어느 쪽이 당신의 스택에 속하는지를 결정한다.
그 둘이 실제로 얼마나 가까운지
먼저 분명히 하고 넘어가야 할 것은 이 비교에서 얼마나 많은 부분이 무승부인가이다. 두 모델 모두 상태와 이름이 지정된 질문들의 스키마를 받고, 둘 다 샘플링하는 대신 플레이스홀더 위치의 로짓에서 신호를 읽으며, 둘 다 멀티모달이고, 둘 다 아무것도 쓰지 않았다고 보고한다. 호출의 형태만 보면 두 모델은 거의 동일하며, 흥미로운 차이는 주변부의 세부 사항에 있다.
• 크기 — Liquid AI d1-3B 총 3.12B, Liquid의 LFM2.5-VL-3B 기반; Intern-Decision-4B 4B (카드에 인쇄된 텐서 수 기준 약 4.54B), Qwen3.5-4B에서 미세 조정됨
• 질문 유형 — d1-3B와 Intern-Decision-4B는 동일한 세 가지를 사용합니다: noul은 예/아니오용, choice는 지정된 집합 중 하나용, score는 순서가 있는 척도상의 한 점용
• 답변 필드 — d1-3B는 답변과 함께 신뢰도 및 확률을 반환합니다; InternLM 스키마는 분포와 함께 모델 카드에서 보정된 확률이 아니라고 경고하는 신뢰도 값을 반환합니다
• 입력 상한 — d1-3B는 32,768토큰의 컨텍스트; Intern-Decision-4B는 8,192토큰 상한으로, 더 긴 요청은 잘라내지 않고 아예 거부하며, 이미지도 이 상한에 포함된다
• 라이선스 — d1-3B는 Liquid의 LFM Open License v1.0, InternLM 측은 Apache 2.0
• 언어 — d1-3B는 16개를 나열함; Intern-Decision-4B의 카드에는 없음이라고 표시됨
• 인터페이스 — d1-3B는 trust_remote_code=True로 로드하고 호출하는 모델로 제공되며; Intern-Decision-4B는 pip install하는 Python 라이브러리로 제공되는데, 구현된 백엔드가 하나뿐이며 요청 자체의 model 필드로는 체크포인트를 전환할 수 없습니다
• 벤더 자체 점수 — d1-3B는 Decision Index 0.2.1 공개 분할에서 48.57; Intern-Decision-4B는 자체 7개 세트 표 전체에 걸쳐 평균 90.02이며, 브라이어 점수는 0.347, 기대 캘리브레이션 오차는 0.065.
마지막 두 숫자는 비교 가능한 대상이 아니며, 그것들을 점수판처럼 취급하는 것은 이 페이지에서 저지르기 가장 쉬운 단 하나의 실수일 것입니다. 그 숫자들은 서로 다른 하네스, 서로 다른 질문 세트, 서로 다른 채점기에서 나온 것입니다.

캘리브레이션이 제품의 전부이며, 그중 오직 하나만이 이를 문서로 보증합니다.
결정 모델은 답 옆에 반환하는 숫자가 의미를 가질 때에만 지연 시간만큼의 가치가 있다. 그것이 바로 보정이다: 제시된 신뢰도 0.9는 열 번 중 아홉 번 정도는 맞아야 하며, 확신하면서 틀린 모델은 모른다고 말하는 모델보다 더 나쁘다.
InternLM이 바로 이 문제를 다루는 모델이다. 그 모델 카드에는 1,728개의 지정된 캘리브레이션 사례에 대해 음의 로그 우도 최소화로 도출하고, 1,693개는 검증용으로 남겨 둔 뒤, 재현할 수 있도록 소수점 여덟 자리까지 표기한 피팅된 temperature 1.99241824가 문서화되어 있다. 또한 96개 사례에 대한 전후 파일럿을 공개하여, 메커니즘이 작동한다고 주장하기보다 실제로 작동함을 보여 준다: 캘리브레이션 전에는 Brier 0.628, ECE 0.213이었고 이후에는 0.550, 0.089였다. Brier와 ECE는 제시된 확률이 정직한지 판단하는 두 가지 표준 척도이며, 변화의 방향은 분명하고 폭도 크다.
Liquid은 이에 상응하는 것을 공개하지 않는다. d1-3B의 자체 카드에는 정확도 스타일 벤치마크가 실려 있다 — SQuAD 2.0 85.3, Civil Comments 93.0, MASSIVE intent 87.3, PubMedQA 66.0, BoolQ 86.7, XNLI 85.0, PAWS-X 76.9, 평균 77.1 — 와 Decision Index에서의 48.57이 함께 실려 있으며, 이 모델의 명시된 판매 포인트는 보정된 유형화 답변이다. 하지만 ECE 행도 없고, Brier 행도 없으며, 공개된 피팅된 temperature도 없다.
그 비대칭성은 Qwen3.5-4B에서 파생된 모델이 LFM2.5-VL-3B를 기반으로 구축된 3B보다 더 잘 캘리브레이션되었다는 뜻이 아니다. 그것은 이 두 카드 중에서 한쪽은 그 주장을 재현할 수 있는 산술을 제공하고 다른 쪽은 그 주장만 제공한다는 뜻이다. 파이프라인에서 신뢰도에 임계값을 두는 경우 — 0.8 초과는 라우팅하고 0.4 미만은 에스컬레이션 — 오늘 밤 InternLM 쪽은 검증할 수 있지만 Liquid 쪽은 표본 점검만 할 수 있다.
이 단서는 양쪽 모두에 적용된다. 두 수치 집합 모두 자사 데이터다. 어느 모델도 독립적인 제3자의 평가를 받지 않았으며, InternLM의 캘리브레이션 주장은 InternLM 자체의 적합(fit)에 대조한 InternLM 자체의 96개 사례 파일럿에 근거하고 있다.
당신에게 번호를 요구하는 라이선스
Intern-Decision-4B는 Apache 2.0이며, Qwen3.5-4B에서 계승되었고, 업스트림 고지는 그대로 유지됩니다 — 상업적 사용, 재배포, 파인튜닝, 그 어디에도 수익 관련 문제는 없습니다.
d1-3은 Liquid의 LFM Open License v1.0에 따르며, 제5조는 조달 담당자가 읽기 전까지는 아무도 읽지 않는 부분입니다. 상업적 사용은 귀하 또는 귀하의 법인이 같은 문서에서 연간 매출 1천만 달러 이상으로 정의된 임계값(Threshold)을 밑도는 경우에만 허용되며, 이를 초과하는 사용은 단순히 라이선스되지 않습니다. 비영리 및 연구 사용자는 예외로 빠져 있습니다.
개인이나 소규모 팀에게는 둘 다 무료입니다. 재무 부서가 있는 조직이라면 두 저장소는 서로 다른 제품이며, 그 차이는 당신이 넘었느냐 넘지 못했느냐의 숫자입니다.
d1-3B의 벤치마크 표 끝부분이 바로 그것의 진짜 주장이다
Liquid의 카드에 있는 대표 수치는 Decision Index 0.2.1에서 48.57로, Winnow-12B의 50.02부터 Decider 2B의 28.97까지 이어지는 표에서 10B 미만의 다른 행들보다 앞서 있습니다. 그 수치를 인용할 가치가 있게 만드는 것은 그 아래에 있는 변별 지수입니다. Decision Index 자체의 하위 점수에서 d1-3B는 Tools에서 74.5, Arts에서 36.3을 기록한 반면 Knowledge에서는 23.8에 그쳤습니다. — 크기가 12배인 36B mixture-of-experts 모델인 Decider 35B-A3B와 비교하면, 이 모델은 Tools에서 56.5, Arts에서 32.6, Knowledge에서 31.8을 기록합니다.

다시 말해 3B는 균일하게 조금씩 더 나쁜 작은 모델이 아니다. 그것은 구조화된 도구 스타일의 결정을 유난히 잘하고, 세계 지식이 필요한 질문에는 유난히 약한 작은 모델이며, 자신이 만들어진 목적과 가장 닮은 두 범주에서 36B를 이긴다. 당신의 결정이 “이 다섯 가지 이름 붙은 행동 중 어느 것인가”와 “이것이 검색된 구절에 근거하는가”에 관한 것이라면, 크기 격차는 예상보다 더 적은 역할을 한다. 당신의 결정이 모델이 이미 알고 있어야 하는 사실에 기대고 있다면, 23.8이 나타날 것으로 예상하라.
그 주장의 두 번째 버전은 비전 쪽에도 있다. d1-3B는 11개 공개 이미지 벤치마크에서 평균 74.1점을 기록했으며, 자체 베이스 모델은 73.9점이다. 그리고 이미지를 제거하면 동일한 질문들은 45.1점을 기록한다 — 따라서 이미지 질문에서 답은 진짜로 그림에서 나오는 것이다. 이는 자체 베이스 모델보다 더 나은 것이 아니라 그와 동등한 수준이며, 벤치마크별 행은 양쪽으로 갈린다: CV-Bench 82.1 대 87.6, POPE 88.5 대 90.1, BLINK 59.2 대 58.7.
InternLM 카드에서의 잠시 멈춤도 주목할 만합니다: 높은 종합 점수는 Typed Decision 80.55, ToolACE 96.45 같은 질문 기반 작업에서 나오는 반면, Jevbench-Hard는 73.87에 머뭅니다. 스키마가 어려워지는 곳에서 점수는 떨어집니다.
속도: 격차는 당신이 예상하는 곳에 있지 않습니다
d1-3B는 RTX 4090에서 단일 질문에 8ms, MI325X에서 9ms, 하나의 상태를 공유하는 세 질문에 21ms, Jetson AGX Thor에서 16ms, 그리고 4090에서 초당 475개 결정, MI325X에서 1,106개 결정의 패킹된 처리량을 광고한다.
Intern-Decision-4B의 카드는 동일한 RTX 4090에서 종단 간 평균 44.16ms를 측정했으며, 중앙값은 44.03ms, P95에서는 44.60ms입니다.
그건 5배의 승리처럼 보이지만 그렇지 않다. 둘이 서로 다른 것을 측정하고 있기 때문이다. Liquid의 수치는 웜 상태의 모델 호출로, 한 번에 요청 하나씩이며, 커널 선택과 컴파일 비용은 미리 치른다 — 카드에는 4090에서 CUDA 그래프 컴파일 없이 단일 질문에 16 ms가 든다고 명시되어 있고, 새로운 셰이프로 하는 첫 호출은 컴파일 비용을 치른다고 나와 있다. InternLM의 44 ms는 유일하게 구현된 백엔드가 로컬 Hugging Face 추론인 Python 라이브러리를 통과하는 쿼리당 종단 간 수치이므로, 주변 기계 장치까지 함께 포함한다. 어느 수치도 틀리지 않았다. 둘 다 하나의 하네스 아래, 한 대의 머신에서, 같은 형태의 요청으로 놓으면, 그 격차는 가정하기보다 측정하고 싶은 무언가로 줄어든다.
의문의 여지가 없는 것은 상한선이다. 8,192 토큰은 InternLM 쪽에서는 단호한 거부이며, 이미지 토큰도 같은 예산에서 나가므로 긴 문서에 스크린샷까지 더한 요청은 잘리는 대신 거부되어 돌아온다. d1-3B는 32,768 토큰을 가지고 작업할 수 있게 해준다. 여러분의 상태가 티켓과 짧은 주고받기라면 그 격차는 결코 문제가 되지 않는다. 그것들이 페이지 크기라면, 어떤 벤치마크보다도 먼저 그 문제를 결정짓는다.
그것들을 교체가 아니라 패널로 운영하세요
특정 예/아니오 질문에 답하는 것과 "이것이 여섯 가지 명명된 항목 중 어느 것이며, 얼마나 확신하는가"에 답하는 것은 서로 다른 요구 사항이다. 그리고 두 카드는 서로 다르게 설계되어 있다 — 하나는 엄격한 입력 상한과 공개된 캘리브레이션 적합도를 갖고, 다른 하나는 32K의 컨텍스트와 더 나은 스코어링 테일을 갖는다 — 그래서 둘 모두를 평가하는 팀에게 유용한 배포 방식은 종종 대체가 아니라 패널이다: 동일한 상태를 두 모델 모두에 제시하고, 불일치는 사람이나 더 큰 모델로 라우팅하는 것이다.
두 모델 모두 우리 카탈로그에 없으며, 이것은 가용성에 대한 주장이 아닙니다. 둘 다 자체 호스팅 아티팩트입니다. 하지만 패널은 라우팅 계층이 서류 작업이 아니라 실제 작업을 수행하는 바로 그 형태입니다. OrcaRouter는 하나의 API 키 뒤에 200개 이상의 모델을 제공하는데, 제공업체 정가를 0% 마크업으로 그대로 전달하며 — 따라서 여러분이 우리 뒤에서 라우팅하는 벤더가 가격을 인하하면 청구서도 같은 날 바뀌고 — 그리고 제공업체 전반의 자동 장애 조치는 2개 모델 패널이 두 개의 단일 장애점이 되는 것을 막습니다. 오늘 여러분이 라우팅하는 모델은 이 둘이 아닙니다. 그것은 여러분이 대체하게 될 호스팅 범용 모델들, 이를테면 입력 토큰 100만 개당 $0.086, 출력 100만 개당 $0.688인 Qwen3.5-27B이며, 이는 GPU까지 계산에 넣고 나면 자체 호스팅 3B가 넘어서야 하는 수치입니다.
이번 주에 무엇을 할까요
결정이 짧은 상태라면, 라이선스가 회사 검토를 통과해야 하고, 가능한 한 가장 넓은 범위의 빌드 대상 — llama.cpp, Ollama, LM Studio, 64개 상태를 한 번의 패스로 실행하는 패킹된 배치 경로 — 을 원한다면, d1-3B가 둘 중 더 제품화된 쪽이며, 도구 및 예술 판별력은 두 카드 중 어느 쪽이 보여주는 것 중에서도 가장 강력한 부분이다. 결정이 긴 상태에 걸쳐 있거나, 매출 조항이 없는 라이선스가 필요하거나, 재현할 수 있는 캘리브레이션 적합도와 주변 비용이 이미 계산에 포함된 하네스를 원한다면, Intern-Decision-4B가 실제로 서류를 확인할 수 있는 쪽이다.

불편한 부분은 둘 다 마찬가지입니다. 어떤 독립적인 주체도 두 모델 중 어느 것도 실행해 본 적이 없고, 카드를 작성한 공급업체가 의뢰하지 않은 보정 비교도 존재하지 않습니다. 답변 옆에 붙는 숫자의 의미가 전체 가치인 모델 클래스라면, 그것이야말로 무엇이든 임계값을 설정하기 전에 메워야 할 간극입니다.
