'Liquid AI d1-3B vs Qwen 3 8B'라는 제목과 '8B 분류 워크로드를 더 작은 모델로 내려야 할까?'라는 부제목이 달린 히어로 타이틀 카드로, 들어오는 요청이 8 ms 및 0 출력 토큰으로 레이블이 붙은 작은 d1-3B 상자와 '답변을 작성함'으로 레이블이 붙은 더 큰 Qwen 3 8B 상자로 분기되는 파이프라인을 보여주며, 레이블 및 점수 칩은 작은 상자에서 나가고 산문 칩은 큰 상자에서 나갑니다.
Guides & Insights

Liquid AI d1-3B vs Qwen 3 8B: 8B 분류 워크로드를 의사결정 모델로 전환해야 할까?

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

대부분의 프로덕션 스택 어딘가에는 예/아니오를 답하도록 돈을 받는 Qwen 3 8B가 있다. 그것은 댓글을 조정하고, 지원 티켓에 태그를 달고, 검색된 구절이 관련성이 있는지 판단하거나, 다른 모델의 출력을 루브릭에 따라 점수 매긴다 — 그리고 그 일은 텍스트를 생성한 뒤 다운스트림의 무언가가 이를 파싱하는 방식으로 이루어진다. Liquid AI가 2026년 10월 7일에 오픈 가중치로 공개한 3.12B 의사결정 모델인 Liquid AI d1-3B는 바로 그 작업을 아무것도 생성하지 않고 수행하기 위해 존재한다: 상태 하나를 입력하고, 이름 붙은 질문들의 집합을 입력하면, 출력 토큰 0개로 단일 순방향 패스에서 확률, 레이블, 신뢰도가 나온다. Qwen 3 8B는 해당 벤더의 2025년 4월 오픈 가중치 주력 모델이다 — 대략 8.2B의 덴스 파라미터, 119개 언어, 요청별로 사고 켜기/끄기, 그리고 그 뒤의 16개월간의 커뮤니티 배포 이력이 있다. 이 조합이 실제로 던지는 질문은 좁고 실용적이다: 여러분의 트래픽 중 분류에 해당하는 부분에서, 2026년에 레이블 하나를 얻는 가장 저렴한 방법은 8B 범용 모델인가, 아니면 그 작업의 형태가 그 밑에서 이미 바뀌었는가?

당신이 실제로 8B에게 돈을 주고 시키는 일

두 출력 계약을 나란히 놓고 보면, 그 비효율은 점진적인 것이 아니라 구조적인 것이다.

Qwen 3 8B 분류 호출은 하나의 생성입니다. 레이블을 설명하는 프롬프트를 작성하면, 모델은 선택적으로 입력에 대해 추론하고 — 이 모델에서는 요청별로 그 추론을 켜거나 끌 수 있는데, 이것이 이런 종류의 작업에서 모델이 가진 가장 유용한 조절 장치입니다 — 그런 다음 답변을 작성해 돌려줍니다. 그 답변은 텍스트입니다. JSON을 요청했다면 보통 JSON을 받게 되지만, 때로는 문장 안에, 서두에, 또는 원치 않는 뒤따르는 설명 속에 JSON이 들어 있는 경우도 있습니다. 관심 있는 레이블은 토큰 스트림 어딘가에 있고, 파서가 그것을 추출합니다. 모델이 작성하는 모든 토큰에 대해 비용이 청구되며, 버리는 토큰도 포함됩니다.

Liquid AI d1-3B에는 토큰 스트림이 없습니다. 질문은 유형을 사용하여 선언됩니다: noul — 예/아니오의 경우, 0과 1 사이의 P(yes)로 답합니다; choice — 이름이 지정된 옵션 집합에서 하나의 레이블을 선택하는 경우, 레이블과 신뢰도, 그리고 옵션별 확률로 답합니다; score — 순서가 있는 2~10 척도상의 위치를 나타내며, 기대 수준과 그 분포 및 범례로 답합니다. 응답에는 output_tokens: 0으로 표시되는 누적 합계가 포함됩니다. 작성된 것이 없으므로 파싱할 것은 없으며, 원시 probabilities 접근자가 있으며, 이는 argmax 대신 반올림되지 않은 분포를 원할 때 사용할 수 있습니다.

청구서를 바꾸는 부분은 여러 질문을 함께 처리할 때 벌어지는 일이다. 하나의 상태가 여러 질문을 담을 수 있다: 환불 요청인지, 어느 팀이 담당해야 하는지, 얼마나 긴급한지. 상태와 그 이미지는 한 번만 읽히며, Liquid는 하나의 상태에 대한 세 가지 질문이 하나일 때의 3배가 아니라 1.3배의 시간이 든다고 보고한다. 그것이 줄이지 못하는 것은 입력 요금이다. 공급업체의 청구 안내에는 각 질문이 자체 프롬프트로 청구되며, 여기에는 해당 텍스트와 모든 이미지가 포함된다고 명시되어 있다. 지연 시간은 더 적고, 입력 토큰은 동일하다. 그것은 헤드라인에 붙는 정직한 별표이며, 벤치마크가 아니라 가격 책정 문단을 읽어야만 발견할 수 있는 종류의 것이다.

A two-column scoreboard for Liquid AI d1-3B and Qwen 3 8B. The d1-3B column reads: job a closed question answered; 3.12B parameters; output tokens billed 0; 32,768-token context; image input yes; one question in 8 ms on an RTX 4090. The Qwen 3 8B column reads: job text in, text out; about 8.2B dense parameters; output tokens billed every one it writes; 32,768 native context extending to 131,072 via YaRN; image input no; one answer as long as the answer is. The footer reads 'd1-3B figures vendor-reported; Qwen 3 8B figures per Alibaba, April 2025.'

Qwen 3 8B와 함께한 16개월이 당신에게 주는 것

더 작은 모델을 업그레이드로 취급하기 전에, 기존 모델이 무엇을 제공하는지 정확히 따져보세요. 그것은 단순한 파라미터 수 그 이상이니까요.

• 맥락 — Qwen 3 8B는 기본적으로 32,768 토큰을 처리하며, YaRN을 통해 검증된 131,072까지 확장됩니다. Liquid AI d1-3B는 32,768 토큰으로 고정되어 있고, 문서화된 확장 경로가 없습니다. 상태가 긴 문서인 경우, 8B는 둘 중 그것을 담을 수 있는 유일한 모델입니다.

• 언어 — Qwen 3 8B의 119개 언어와 방언 대 Liquid AI d1-3B에서 문서화된 16개.

• 추론 제어: Qwen 3 8B를 사용하면 턴마다 사고를 켜거나 끌 수 있습니다. Liquid AI d1-3B에는 제어할 수 있는 추론 모드가 없는데, 이는 사고를 무엇에 사용하고 있었는지에 따라 단순화일 수도 있고 한계일 수도 있습니다.

• 기능의 폭 — 8B는 글을 쓰고, 설명하고, 요약하고, 번역하고, 코딩한다. Liquid AI d1-3B는 그런 것들 중 어느 것도 하지 않는다. 모델 카드에 분명히 명시되어 있다: 이 모델은 채팅 모델이 아니며 텍스트를 작성하지 않는다.

• 근거 — Qwen 3 8B은 16개월에 걸친 공개 벤치마킹, 양자화, 파인튜닝 및 프로덕션 사용 기록을 보유하고 있습니다. Liquid AI d1-3B의 Decision Index 점수 48.57은 공개 리더보드에 제출된 것이 아니라 Liquid가 공식 채점기를 사용해 산출한 것이며, 나온 지 며칠밖에 되지 않았고 제3자 재현도 없습니다.

• 비전 — 이 행은 반대 방향으로 흘러간다. Liquid AI d1-3B는 이미지를 입력으로 받는데, 벤더는 열한 개의 공개 이미지 벤치마크 전반에서 74.1을 기록했다고 보고하며, 이는 각 벤치마크의 선택지 집합에 대한 결정으로 해석되고, 이미지를 제거하면 동일한 질문들이 45.1로 무너진다고 보고한다. 텍스트 전용 Qwen 3 8B는 그중 어느 것을 하려든 앞단에 별도의 비전 모델이 필요하다.

• 속도 — RTX 4090에서는 질문 하나를 8ms에, Jetson AGX Thor에서는 16ms에, Jetson Orin Nano에서는 50ms에 처리하며, 4090에서는 패스당 64개의 packed 상태를 초당 475개 처리합니다. 생성 기반 분류기는 이에 필적하는 수치가 없는데, 지연 시간이 답변의 길이에 따라 달라지기 때문입니다.

솔직히 요약하자면, 8B는 더 나은 범용 도구이고 3B 의사결정 모델은 더 나은 특화 도구이며, 중요한 유일한 질문은 당신의 트래픽 중 얼마나 많은 부분이 특화된 경우인가 하는 점입니다.

비용 계산, 신중하게 수행

비교가 본전을 뽑을지 못 뽑을지는 바로 여기서 결정되므로, 구호가 아니라 실제 구조를 갖추어 할 가치가 있습니다.

오픈 웨이트 공개 이틀 전에 Liquid가 발표한 주장은 자사의 호스티드 의사결정 모델이 6개 실제 애플리케이션 중 4개에서 GPT-6.1 Sol과 동등하거나 능가하며, 비용은 19배에서 200배 더 낮고, 모든 작업에서 더 빠르게 응답한다는 것이다. 이를 반복하기 전에 방법론을 읽어보라: 각 애플리케이션은 2026년 10월 5일에 모델당 한 번씩 실행되었고, 채팅 모델들은 기본 추론 설정에서 JSON으로 답했으며, d1의 비용은 백만 입력 토큰당 $0.04로 계산되었다. 그 $0.04 수치는 호스티드 d1 입력 요율이며, 그것이 존재하는 유일한 요율이다 — 추가할 출력 항목은 없다.

이제 Qwen 3 8B 분류기에 대해 동일한 형태의 추정치를 만들어 보세요. 그러면 누구의 공급자 가격도 인용하지 않고도 비대칭성이 드러납니다. 8B에는 과금 대상 항목이 두 개 있는 반면, 의사결정 모델에는 하나만 있습니다. 그리고 두 번째 항목이 바로 증가하는 항목입니다. 먼저 추론하는 분류는 그 추론에 대한 비용을 지불하고, JSON을 패딩하는 분류는 그 패딩에 대한 비용을 지불합니다. 의사결정 모델의 입력 요금은 상태와 질문에 의해 고정됩니다. 8B의 입력 요금은 상태만으로 예측할 수 있는 그 어떤 것에 의해서도 고정되지 않습니다.

두 가지 균형추가 이것이 참패로 이어지지 않게 막아준다. 첫째, 결정 모델은 각 질문을 자체 프롬프트로 청구하므로, 하나의 긴 문서에 대해 다섯 개의 질문을 하면 입력이 다섯 배가 된다 — 8B는 다섯 개를 한 번의 호출로 요청하고 문서에 대한 비용을 한 번만 지불한다. 둘째, 그리고 더 큰 문제는, 결정 모델은 그 형태로 답하도록 사후 훈련된 질문에만 답할 수 있다는 점이다. 설명, 요약 또는 말로 표현된 판단이 필요한 것은 무엇이든 당신을 다시 범용 모델로 돌려보내고, 실제로는 둘 모두에 대한 비용을 지불하는 상황으로 되돌린다.

A capture of Liquid AI's blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph announcing d1-3B and d1-omni-600M as open-weight models, the d1-3B Decision Index score of 48.57, and its latency of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

그 둘이 진정으로 잘하는 것

벤치마킹을 걷어내면, 그 구분은 파라미터 수가 시사하는 것보다 더 깔끔하다.

Liquid AI d1-3B는 예/아니오, 목록에서 고르기, 평점 매기기를 위한 모델이며, 어떤 생성형 모델도 도달하지 못하는 지연 하한에서, Jetson Orin Nano의 50ms와 노트북을 포함한 하드웨어에서 작동합니다. Liquid가 10월에 시연한 애플리케이션은 모두 그런 형태의 변형이었습니다 — 150건의 지원 티켓에 대해 예 또는 아니오로 답하는 SQL 프레디킷, 각 도구 출력을 유지·축소·삭제하고 토큰의 52%를 제거하는 에이전트 컨텍스트 압축 루프, 학습한 적이 없고 짧은 설명만으로 이해한 작업에서 네 개 생산 라인의 양품과 불량품을 85~97% 정확도로 분류하는 검사 앱. 마지막 데모는 이 범주가 무엇을 위한 것인지 가장 명확하게 보여줍니다: 답이 몇 가지 중 하나이고, 상태가 이미지이며, 설명은 애초에 요구되지 않는 작업입니다.

Qwen 3 8B는 언어로 돌아와야 하는 작업, 119개 언어를 아우르는 작업, 3만 2천 토큰이 넘는 문서를 담아야 하는 작업, 또는 결론을 내리기 전에 소리 내어 추론해야 하는 작업을 위한 모델입니다. 위의 세 가지 형태 중 어느 것에도 해당하지 않는 분류를 할 때도 이 모델이 정답입니다. 레이블 집합이 열려 있을 때, 기준이 미묘해서 사고 과정이 필요했을 때, 두 모델 사이에서 라우팅하지 않고도 같은 호출이 쉬운 사례와 어려운 사례를 모두 처리해야 할 때 말입니다. 그리고 검토자가 어떤 독립적 벤치마크가 있는지 물을 때도 안전한 선택입니다. 답은 이렇기 때문입니다. 1년 반 전까지 거슬러 올라가는 벤치마크가 아주 많습니다.

이걸 제대로 해내는 팀은 하나를 고르지 않는다. 그들은 결정 모델을 범용 모델 앞에 두고, 답이 숫자인 트래픽 부분에 적용하며, 문장이 필요한 모든 것은 8B가 처리하도록 맡긴다. 필터는 3B, 8ms이고, 8B는 페이로드를 위해 남는다.

페어 배포 중

Liquid AI d1-3B은 배포 작업이 이미 끝난 상태의 가중치로 등장합니다. 첫날부터 llama.cpp 지원, DGX부터 Jetson까지 이어지는 전체 NVIDIA 스택, NVFP4 양자화, 8비트 가중치·활성화 변형, 그리고 Hugging Face에서의 GGUF 변환까지 갖췄습니다. Qwen 3 8B는 이 가중치 등급의 어떤 모델보다도 가장 깊은 자체 호스팅 생태계를 보유하고 있습니다. 두 모델 모두 저희 카탈로그에는 없으며, 여기의 어떤 내용도 두 모델의 가용성을 주장하는 것이 아닙니다. Liquid AI d1-3B의 호스팅 경로는 벤더 자체 API와 서드파티 플랫폼이며, 그곳에서 호스팅되는 d1은 입력 토큰 기준으로만 백만 토큰당 $0.04이고, 이미지는 32×32픽셀 패치당 1.5토큰으로 청구됩니다.

둘 다 같은 파이프라인에 들어오고 나면, 라우팅 문제는 더 이상 이론적인 문제가 아니다. 직접 보유한 소형 모델, 직접 호스팅하거나 임대할 수 있는 8B 모델, 그리고 반드시 임대하게 되는 생성 호출이 있다 — 요청별로 주어진 입력이 어느 모델로 가야 하는지 결정하는 것, 바로 그것이 라우팅 계층이 존재하는 이유다.200개 이상의 모델을 아우르는 단일 엔드포인트, 공급자 정가가 0% 마크업으로 그대로 전달되므로 벤더의 가격 변경이 같은 날 여러분 쪽에 바로 반영되고, 자동 장애 조치덕분에 업스트림의 안 좋은 오후가 여러분의 장애로 이어지지 않는다. 분류 트래픽이 연간 수십억 건의 호출로 측정되는 규모라면, 3B 결정 모델에서 나오는 절감 효과가 실제로 거둬지는 곳은 바로 그 계층이다.

판결

8B 모델에 폐쇄형 질문 — 이것이 유해한가, 관련성이 있는가, 어느 큐에 들어가야 하는가, 얼마나 긴급한가 — 을 던지고 있다면, 당신은 레이블 하나를 얻기 위해 범용 모델의 두 줄짜리 청구서와 생성 지연을 치르는 셈이다. 그리고 Liquid AI d1-3B는 더 약한 검증 근거와 따져 봐야 할 실제 라이선스 차이를 안고 있는, 곧바로 대체할 수 있는 대안이다. 32K 컨텍스트 상한, 16개 언어, 그리고 Liquid 외부에서는 아직 아무도 이 모델을 평가하지 않았다는 사실을 받아들여라.

당신의 8B가 설명하거나, 요약하거나, 번역하거나, 긴 문서를 유지하거나, 결정을 내리기 전에 추론하도록 요청받는다면, 이 비교는 당신에게 해당되지 않습니다. 8B를 유지하고, 미리 쉬운 종류라고 식별할 수 있는 트래픽에 대한 사전 필터로만 의사결정 모델을 고려하세요.

주목할 만한 흥미로운 숫자는 어느 모델의 벤치마크 점수도 아니다. 그것은 d1 Decision Index의 첫 독립 재현이 얼마나 빨리 나오는가이다. 왜냐하면 바로 그때가 비교가 공급업체의 주장이기를 그치고, 그에 맞춰 계획을 세울 수 있는 사실이 되기 시작하는 순간이기 때문이다.

A capture of our own catalogue page for Qwen3 VL 8B Instruct, showing the model id qwen/qwen3-vl-8b-instruct, a release date of 2025-10-14, text, image and video input, a 131,072-token context window with 32K max output, a P50 time-to-first-token of 3.59 seconds, and pricing of $0.18 per million input tokens against $0.70 per million output tokens.