Microsoft-Decision-1 vs Liquid AI d1-3B를 위한 생성된 타이틀 카드로, 부제는 '컨텍스트 윈도우에 대해 의견이 일치하는 유일한 두 의사 결정 모델'이며, 칩에는 양쪽 모두 32,768 토큰이라고 적혀 있고, 텍스트 전용 vs 텍스트·이미지·오디오, 25개 언어 vs 16개 언어, 호스팅 API vs lfm1.0 가중치가 표시되며, 푸터에는 두 공급업체의 수치가 자체 보고이며 검증되지 않았음을 명시한다.
Guides & Insights

Microsoft-Decision-1 vs Liquid AI d1-3B: 동일한 32K 윈도우, 두 가지 다른 의미

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이번 한 번만큼은 스펙이 서로 맞아떨어진다. Microsoft-Decision-1은 2026년 10월 8일부터 Microsoft Foundry에서 일반 제공되며 32,768 토큰의 컨텍스트를 처리한다. 마찬가지로 Liquid AI d1-3B도 2026년 10월 5일 Hugging Face에 업로드되었고 이틀 뒤 Liquid AI가 발표했다. 둘 다 상태와 일련의 타입이 지정된 질문 — 예/아니오, 명명된 선택지 중 하나 고르기, 순서 척도 위의 위치 — 을 받아들이고, 생성된 텍스트 대신 확률 분포를 단일 순방향 패스로 답한다. Laya, Intern-Decision-4B, Kev 그리고 이 틈새의 나머지 모델들은 컨텍스트 길이를 두고 서로 의견이 갈리므로, 이 짝은 그 차원이 빠지는 유일한 조합이며 비교는 다른 무언가를 근거로 논증해야 한다.

나머지 다른 점은 입력 채널로 밝혀진다. 마이크로소프트의 모델은 명시적으로 텍스트 전용이다. "이미지, 오디오 또는 비디오 콘텐츠를 받아들이거나 생성하지 않는다." Liquid AI의 모델은 26억 개 파라미터 언어 백본 위에 4억 개 파라미터의 SigLIP2 NaFlex 비전 인코더를 탑재하고 총 31억 2천만 개 파라미터에 이르며, 마이크로소프트가 배제한 바로 그 일, 즉 스크린샷, 스캔한 양식 또는 카메라 프레임을 고정된 질문에 비추어 채점하는 일을 위해 만들어졌다. 이러한 구분, 그리고 성능과는 아무 관련이 없는 라이선스 차이가 이 맞대결의 전부다.

둘이 일치하는 부분은 예상보다 많다

• 컨텍스트 윈도우 — Microsoft-Decision-1의 경우 32,768 토큰, Liquid AI d1-3B의 경우 32,768 토큰.

• 출력 형태 — 제공된 옵션에 대한 보정된 확률이며, 둘 다 텍스트를 생성하지 않고, Liquid AI의 사용량 카운터는 이를 output_tokens: 0으로 보고합니다.

• 질문 유형 — 문서 선택, 순서형 점수, 이진 예/아니요를 모두 포함하며, 둘 다 어휘 헤드를 재훈련할 필요 없이 요청별로 옵션 집합을 정의할 수 있습니다.

• 보류 — Microsoft는 "판단할 수 없음"과 같은 명시적 보류 옵션을 문서화하고 있으며, Liquid AI의 Decision Index 스키마도 자체 옵션 집합을 통해 이를 지원합니다.

• 단일 패스 추론 — 양측 모두 결정마다 한 번의 호출로 처리하며, 이것이 둘 중 어느 쪽이든 파이프라인 규모에서 실행 가능하게 만듭니다.

이 니치에서 가장 까다로운 두 제약에 두 모델이 모두 동의한다는 점은 잠시 멈춰 생각해 볼 만하다. 32K 윈도가 의사결정 스코어러를 전체 계약서, 여러 페이지 분량의 정책 문서, 긴 지원 스레드에서 사용할 수 있게 해 주는 요소라면, 512토큰 영어 Laya 체크포인트와 Intern-Decision-4B의 호출당 질문 제한은 그렇지 않다. 입력이 짧다면 이 분야의 대부분은 서로 바꿔 써도 되고, 결정은 호스팅에 달려 있다. 입력이 길다면 선택의 폭은 이 둘로 좁아진다.

그들 중 오직 하나만이 가지고 있다는 느낌

Liquid AI d1-3B는 멀티모달이며, 모델 트리는 계보를 명확히 보여줍니다: LFM2.5-2.6B-Base, 그다음 LFM2.5-VL-3B, 그다음 단일 패스로 보정된 결정을 위해 후속 학습된 d1-3B입니다. 이미지는 SigLIP2 NaFlex 인코더를 통해 입력되며, 모델 카드는 11개 공개 이미지 벤치마크에서 평균 74.1을 보고하는데, 이는 베이스 비전 모델의 73.9와 대비됩니다 — 따라서 결정 튜닝이 비전 품질을 희생시키지 않았습니다. 또한 반대 실험도 보고합니다: 이미지를 제거하면 동일한 질문의 점수가 45.1로 떨어지는데, 이는 지각 채널이 장식이 아니라 핵심적인 역할을 한다는 가장 명확한 증거입니다.

Microsoft-Decision-1에는 이에 상응하는 것이 없으며, 이 누락은 미완성이 아니라 의도된 것이다. Microsoft의 카드는 범위 밖 용도로 텍스트 생성, 개방형 질문 응답, 대화, 번역 및 요약을 나열하고, 별도로 이 모델이 텍스트 전용이라고 명시한다. 양식 스크린샷을 평가 기준에 따라 채점해야 하거나 카메라 프레임에 안전 이벤트가 포함되어 있는지 판단해야 하는 파이프라인에게 이는 확실한 중단 지점이다 — 모델에 애초에 주어지지 않은 모달리티는 프롬프트 엔지니어링으로 되살릴 수 없다.

언어 수는 반대 방향으로 흘러가며, 이것이 두 번째 실질적인 격차이다. Microsoft-Decision-1은 지원 언어를 25개로 나열하며, 해당 회사는 커버리지, 품질 및 캘리브레이션이 "언어에 따라 다를 수 있다"고 솔직히 인정하고, 비영어권, 특히 저자원 언어를 성능 저조 영역으로 지목한다. Liquid AI d1-3B는 16개 언어를 명시한다. 범위 면에서 Microsoft가 서류상 앞서 있지만, 범위가 의미하는 바에 대한 솔직함에서는 두 공급업체 모두 비슷한 말을 하며, 어느 쪽도 언어별 캘리브레이션을 공개하지 않았다.

A generated two-column scoreboard for Microsoft-Decision-1 and Liquid AI d1-3B across six shared dimensions: context window 32,768 tokens for both; modality text-only versus text, images and audio through a 400M SigLIP2 NaFlex encoder on a 3.12B model; languages 25 versus 16; published scores none versus a vendor-scored value of 48.57 on Liquid AI's own Decision Index; weights not distributed versus lfm1.0 weights on Hugging Face; and latency not published versus 8 ms per decision on an RTX 4090 and 30 ms on an Apple M5 Pro. A footer notes both vendors' figures are self-reported and unreproduced.

벤치마크 탭, 또다시

Microsoft-Decision-1의 Foundry 페이지에는 방법론 섹션만 있고 수치는 없는 벤치마크 탭이 있습니다: 공개 및 커뮤니티 의사결정 벤치마크와 홀드아웃 내부 세트, 정확도와 캘리브레이션 오류를 포괄하는 지표, 선택지 순서 변경, 대응 통계 검정, 그리고 이 모델이 "동일한 방법론으로 평가된 선도적인 의사결정 모델과 대등하고 다른 오픈 의사결정 모델보다 앞선다"라는 주장이 있습니다. 확인할 것도, 재현할 것도 없습니다.

Liquid AI d1-3B가 Decision Index 0.2.1에서 48.57을 공개했다 — 그리고 그 단서는 숫자보다 더 중요하다. Decision Index는 Liquid AI 자체 지수이고 d1-3B는 Liquid AI 자체 모델이기 때문이다. 이는 벤더가 작성한 벤치마크에서 벤더가 채점한 결과로, 회사는 이를 10B 미만 의사결정 모델 중 최고이며 같은 척도에서 35B 모델보다 앞선다고 내세운다. 48.57은 감사된 수치가 아니라 방향성 주장으로 받아들여라. 이와 함께 카드에는 내부 의사결정 형식 평가 평균 77.1, SQuAD 2.0 85.3, PAWS-X 76.9, DecisionBench 71.8이 나열되어 있다 — 모두 자체 보고이며, "10B 미만"이라는 표현은 회피가 아니라 진짜 단서다. 모델이 3.12B이기 때문이다.

그래서 캘리브레이션 문제는 이 분야 전체에서 늘 그렇듯 같은 방식으로 귀결됩니다. Liquid AI는 자체 척도로 산출한 숫자를 내놓고, Microsoft는 방법론만 내놓을 뿐 숫자는 내놓지 않으며, 어느 쪽도 독립적인 제3자 측정값을 제공하지 않습니다. 배포에 실제로 중요해질 유일한 캘리브레이션 수치는 바로 자체 레이블링된 데이터로 직접 계산한 값입니다.

A screenshot of the Microsoft-Decision-1 model catalogue page on Microsoft Foundry, read 10 October 2026, headed Catalog / Models / Microsoft-Decision-1 with Details, Benchmarks, Responsible AI and License tabs. The visible text describes a decision-scoring model returning calibrated probability scores for fixed answer options instead of generated text, built on Alibaba's open-weight Qwen3.5-9B and post-trained by Microsoft, with quick facts listing publisher Microsoft, lifecycle Generally available (GA), context window 32768 and a Pricing field that links out rather than printing a rate.

서빙, 라이선스, 그리고 실제로 구매하는 것

d1-3B의 지연 시간은 공개되어 있으며, 그것이 이 모델이 존재하는 이유다. RTX 4090에서는 결정당 8밀리초, AMD MI325X에서는 9밀리초이고, 64개 상태에서 패킹된 처리량은 초당 475 및 1,106이다. 엣지 하드웨어에서는 Apple M5 Pro에서 30밀리초, Jetson AGX Thor에서 16밀리초, Jetson AGX Orin 64 GB에서 26밀리초, Orin Nano에서 50밀리초다. Microsoft-Decision-1은 지연 시간 수치를 전혀 공개하지 않으며, 설계에 내장된 옵션 — 종량제 또는 예약 프로비저닝 처리량 기반의 호스팅 Foundry API, 배치 추론 비활성화 — 은 자체 배포를 통해 측정해야 한다는 뜻이다. 검색된 문서나 제안된 작업마다 한 번씩 호출되는 것이 존재 목적 전체인 모델에게 이는 작은 간극이 아니다.

라이선스는 이 두 모델이 사람들을 놀라게 하는 방식으로 갈리는 지점입니다. Liquid AI d1-3B는 lfm1.0으로 태그되어 있으며, Apache 2.0이 아닙니다. 즉 Liquid의 나머지 LFM 제품군과 동일한 계열 라이선스로, 허용적 라이선스에는 없는 사용 조건이 붙어 있습니다. 법무 검토에서 이걸 '문자열이 붙지 않은 OpenAI 호환'으로 읽는다면, 이건 그게 아니며, 모델을 출시한 뒤가 아니라 출시하기 전에 읽어볼 가치가 있습니다. Microsoft-Decision-1은 가중치가 아예 없습니다. 이는 Direct from Azure 포트폴리오 아래의 호스팅 엔드포인트로, Azure 인증과 통합 청구를 사용하고 다운로드가 없으며 라이선스 문제는 서비스 계약으로 대체됩니다. 두 모델 모두 벤더가 문서화한 경로로는 파인튜닝할 수 없는데, 이는 의사결정 모델에게 가장 뼈아픈 제약입니다. 자신의 레이블에 맞게 조정할 수 없는 스코어러는 그 오류 양상을 고칠 수 없고, 그저 우회할 수만 있는 스코어러이기 때문입니다.

이 패턴에서 그들을 우회하는 라우팅이 바로 OrcaRouter가 있어야 할 자리이며, 그것도 한쪽 편에만 해당합니다. 우리는 Microsoft-Decision-1도 Liquid AI d1-3B도 호스팅하지 않습니다. 둘 다 텍스트를 반환하지 않고, 둘 다 우리 카탈로그에 없으며, 확률 채점 엔드포인트는 채팅 완성 대상이 아닙니다. 우리가 제공하는 것은 이 루프의 생성 절반, 즉 채점기가 평가할 답변을 초안하고, 채점기가 판단할 필드를 추출하거나, 채점기가 승인할 행동을 제안하는 모델입니다. 그것은 하나의 OpenAI 호환 키 뒤에 있는 200개 이상의 모델입니다 제공자 정가에 0% 마크업만 붙여 그대로 전달되므로, 벤더 가격 변경은 같은 날 우리 쪽에 반영되며, 자동 장애 조치는 재시도할 여유 지연 시간이 없는 루프에서 생성 호출을 담당합니다.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

깔끔한 선택 둘, 그리고 접전이 아닌 하나

를 선택하세요,Liquid AI d1-3B 파이프라인에 있는 무엇이든 이미지라면. 스크린샷 분류, 양식 추출, 시각적 QA 라우팅, 카메라 프레임에 점수를 매기는 중재자 — Microsoft-Decision-1은 이런 일을 하도록 만들 수 없으며, d1-3B는 이를 위해 만들어졌고 그 주장을 뒷받침하는 비전 벤치마크가 공개되어 있습니다. Jetson이나 노트북에서 수십 밀리초 단위로 측정되는 엣지 추론이 필요하거나, 모델을 자체 하드웨어에서 원하거나, 법률 고문이 읽을 수 있는 라이선스로 충분하다면 이것도 선택하세요.

을 선택하세요 Microsoft-Decision-1입력이 텍스트이고, 문서가 길며, 도입 관문이 조달이라면 — Azure 인증, 통합 청구, Responsible AI 평가, 에스컬레이션할 공급업체 — 또는 트래픽이 d1-3B가 나열한 16개 언어보다 더 많은 언어를 포괄한다면. 지연 시간 수치와 벤치마크 표가 없다는 점은 이 제품과 함께하는 첫 2주가 통합이 아니라 측정이라는 뜻임을 받아들이세요.

딱 하나, 논란의 여지가 없는 사례는 멀티모달 작업입니다. 그 부분에서는 마이크로소프트가 모델 카드에 "텍스트 전용"이라고 적었을 때 이미 선택이 끝났습니다.