제목이 'Liquid AI d1-3B vs Gemma 4 12B'이고 부제가 '범용 모델에 맞서는 의사결정 모델'인 히어로 타이틀 카드로, 확률 칩이 있는 작은 3.12B 체크리스트 카드를 문서, 파형, 필름 프레임 아이콘과 서면 답변 칩을 갖춘 더 큰 11.96B 카드 옆에 보여 준다.
Guides & Insights

Liquid AI d1-3B vs Gemma 4 12B: 범용 모델에 맞선 의사결정 모델

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Liquid AI d1-3B와 Ge​mma 4 12B를 같은 벤치마크에 올려놓고 승자를 기다리는 것이 이 비교를 가장 빠르게 잘못 만드는 방법이다. 이 둘은 같은 질문에 답하지 않는다. Liquid AI d1-3B는 2026년 10월 7일 오픈 웨이트로 공개된 3.12B 결정 모델이다. 상태 하나와 이름이 붙은 질문 묶음을 주면 확률, 선택된 레이블, 신뢰도를 반환하며, 출력 토큰이 0개이고 생성 단계가 없다. Ge​mma 4 12B는 Goo​gle의 인코더 없는 any-to-any 범용 모델로, 텍스트·이미지·오디오·비디오를 입력받아 256,000토큰 창에 걸쳐 140개 이상의 언어로 답을 써 내는 11.96B 체크포인트다. 하나는 회로 기판이 네 가지 중 무엇인지 알려주고, 다른 하나는 그 이유를 알려준다. 품질만 놓고 비교하면 아무것도 배울 수 없다. 출력이 같은 기준으로 잴 수 있는 것이 아니기 때문이며, 두 벤더는 이 둘을 서로 견주어 벤치마킹한 적이 없다. 호출이 실제로 무엇을 반환하는지, 비용이 얼마인지, 그리고 각각이 어디서 한계에 부딪히는지를 기준으로 비교하면, 이 짝은 진정으로 유용한 경계 테스트가 된다.

두 가지 서로 다른 출력 계약

여기서 실질적인 역할을 하는 구분은 바로 회선을 타고 돌아오는 것입니다.

Liquid AI d1-3B는 구조화된 답변 객체를 반환합니다. 요청의 모든 질문은 유형을 선언합니다 — noul은 예/아니오와 P(yes)를 위한 것이고, choice는 이름이 지정된 옵션 세트 중 하나에 대해 각 옵션별 신뢰도와 확률을 제공하는 것이며, 또는 score는 순서가 있는 2~10단계 척도에서 예상 수준과 그 분포를 나타내는 위치를 위한 것입니다. 모델은 보고합니다: output_tokens: 0 왜냐하면 아무것도 작성되지 않기 때문입니다. 하나의 상태에 대한 여러 질문은 단일 순방향 패스에서 읽히며, 상태와 그 이미지는 모든 질문에 대해 한 번만 인코딩됩니다.

Ge​mma 4 12B는 산문을 반환합니다. 때로는 요청한 JSON을 반환하고, 때로는 정확히 요청하지 않은 JSON을 반환하며, 답변하기 전에 추론할 수 있습니다. 이는 무엇보다도 언어 모델입니다. 분류할 줄 아는 것은 무엇이든 텍스트로 표현합니다. 이는 답을 사람에게 설명해야 하거나 언어를 기대하는 다운스트림 단계에 입력해야 할 때는 강점이고, 필요한 것이 확률 하나뿐일 때는 비용입니다.

그로부터 이후의 모든 것이 따라온다. d1-3B 응답은 파싱에 실패할 수 없다. 또한 스스로를 설명할 수도 없으며, 모델 카드에도 그렇게 직접 나와 있다: 그것은 채팅 모델이 아니며 텍스트를 작성하지 않는다.

증거 흔적의 현주소

두 숫자 집합의 출처는 서로 동등하지 않으며, 여기서는 숫자 자체보다 그 점이 더 중요하다.

• Decision Index 0.2.1 — Liquid AI d1-3B는 48.57점을 기록했으며, 벤더가 공식 스코어러로 채점했고, 10B 미만 모델 중 1위이며 47.11점의 Decider 35B-A3B보다 앞서 있습니다. Gemma 4 12B는 Decision Index에서 전혀 채점되지 않으므로 이 행에는 대응 항목이 없습니다.

• 추론 벤치마크 — Gemma 4 12B는 AIME 2026에서 77.5, GPQA Diamond에서 78.8, Codeforces ELO 1,659를 기록하며, 추론 모드에서 Artificial Analysis Intelligence Index 22, 추론 기능을 끈 상태에서 13을 나타냅니다. Liquid AI d1-3B는 추론 벤치마크가 없는데, 이는 의사결정 모델이 점수를 매길 추론 흔적을 생성하지 않기 때문입니다.

• 긴 컨텍스트 — Gemma 4 12B는 256,000개 토큰을 지원하며, Google 자체 카드에서 128k 기준 MRv2 8-needle에서 43.4%를 기록합니다. Divergence d1-3B는 32,768개 토큰을 지원합니다. 당신의 "상태"가 40페이지 문서에 스캔본까지 더한 것이라면, 그 격차가 곧 결정의 전부이며 결코 근소하지 않습니다.

• 비전 — Liquid AI d1-3B는 11개 공개 이미지 벤치마크에서 각 벤치마크의 선택지 집합에 대한 결정으로 해석했을 때 평균 74.1을 기록했으며, 이 모델이 기반으로 삼은 LFM2.5-VL-3B 백본의 73.9와 비교됩니다. 또한 공급업체는 이미지를 제거하면 동일한 문항이 45.1로 떨어진다고 보고합니다. Ge​mma 4 12B의 비전은 더 강력하고 더 폭넓지만, 이는 명명된 선택지에 대한 결정 정확도가 아니라 생성 품질로 보고됩니다.

• 언어 — Liquid AI d1-3B의 경우 16개가 문서화되어 있음; Ge​mma 4 12B의 경우 140개 이상.

• 속도 — Liquid AI d1-3B는 RTX 4090에서 한 질문에 8ms, Jetson AGX Thor에서 16ms, Jetson AGX Orin 64GB에서 26ms, Jetson Orin Nano에서 50ms 만에 답하며, 4090에서는 초당 475회로 64개의 상태를 단일 패스에 담아낸다. Gemma 4 12B는 생성 방식이므로, 지연 시간은 출력하는 토큰 수에 따라 달라진다.

• 증거 품질 — Ge​mma 4 12B의 결과는 Goo​gle의 것이며, 2026년 6월에 발표된 뒤 대규모 커뮤니티가 뜯어보고, 양자화하고, 재실행해 왔다. Liquid AI d1-3B의 결과는 Liquid의 것이며, 이틀 전에 발표되었고, 연구소 밖에서는 아무도 재현하지 못했다. 두 번째 열은 그에 맞게 읽어야 한다.

A two-column scoreboard for Liquid AI d1-3B and Gemma 4 12B. The d1-3B column reads: output a label, a confidence, zero tokens; 3.12B parameters; 32,768-token context; text and image input; 8 ms per question; Decision Index 48.57 (vendor). The Gemma 4 12B column reads: output generated text; 11.96B parameters; 256,000-token context; text, image, audio and video input; latency that scales with output length; Decision Index not scored. The footer reads 'd1-3B figures vendor-reported and unreproduced; Gemma 4 12B figures per Google, June 2026.'

그들이 진정으로 경쟁하는 유일한 곳

실제로 겹치는 부분이 있으며, 그것은 리더보드에 있지 않습니다. 그것은 LLM-as-a-judge 호출입니다.

많은 프로덕션 파이프라인은 이미 중간 규모 범용 모델을 평가 계층으로 사용한다. 이 티켓의 긴급도를 점수화하고, 이 출력이 루브릭을 통과하는지 판단하고, 에이전트가 다음에 호출할 도구를 고르고, 검색된 구절이 질문에 답하는지 확인하는 식이다. 오늘날 이런 호출 대부분은 숫자나 레이블을 텍스트로 내놓도록 요청받는 생성 모델로 가며, 그 모델이 내놓는 숫자는 옵션 집합에 대한 소프트맥스가 아니라 샘플러가 만들어낸 값이다. Liquid AI d1-3B가 대체하도록 후속 학습된 워크플로가 바로 이것이며, 공개된 데모들은 모두 이 워크플로의 변형이다 — 150개 지원 티켓에 예/아니요로 답하는 SQL 조건자, 각 도구 출력을 유지하거나 다듬거나 버리면서 토큰의 52%를 제거하는 에이전트 컨텍스트 압축 루프, 한 번도 학습한 적 없는 작업에서 4개 생산 라인의 양품과 불량품을 85~97% 정확도로 분류한 시각 검사 앱.

Gemma 4 12B는 이러한 모든 작업을 수행하며, 그보다 더 많은 일도 해냅니다. 또한 요약을 작성하고, 256K 문서를 컨텍스트에 유지하며, 녹음된 전화 통화를 입력으로 받아 140개 이상의 언어 중 하나로 답변할 수 있습니다. 파이프라인에 평가와 내레이션이 필요하다면, 12B는 한 번의 호출로 두 가지 작업을 수행하고, 3B 의사 결정 모델은 그중 하나를 수행하는 것입니다.

경계는 컨텍스트 길이와 출력 형태입니다. 긴 상태, 음성 입력, 많은 언어, 또는 독자가 기대하는 설명 — Ge​mma 4 12B, 두말할 필요 없습니다. 짧은 상태, 고정된 옵션 세트, 한 자릿수 밀리초의 요청당 지연 시간 예산, 또는 답변이 파싱될 것이라는 확실한 보장 — 그것이 d1-3B 열이며, 범용 모델은 당신이 사용하지 않을 기능에 비용을 지불하고 있는 것입니다.

각각 통화하는 데 드는 비용

두 모델 모두 우리 카탈로그에 없으므로, 어느 쪽도 라우팅 가격을 제시할 수 없습니다 — Ge​mma 4 12B는 우리가 서비스하는 Ge​mma 크기 중 하나가 아니며, Liquid AI d1-3B는 직접 호스팅하거나 공급업체 자체 API 및 타사 플랫폼을 통해 접근하는 오픈 웨이트입니다. 해당 제품군에서 Gemini에 인접한 쪽에 대한 참고로, 우리가 실제로 라우팅하는 두 가지 Ge​mma 4 크기는 Ge​mma 4 26B A4B의 경우 백만 입력당 $0.06, 백만 출력당 $0.33으로, Ge​mma 4 31B의 경우 $0.13 및 $0.38로 책정되어 있으며, 둘 다 262,144토큰 컨텍스트와 텍스트, 이미지 및 비디오 입력을 지원합니다. 다른 곳에서 Ge​mma 4 12B에 대해 제시된 제공업체 가격의 중앙값은 약 $0.10 및 $0.30입니다.

Liquid의 호스팅형 d1은 입력 토큰에만 과금하며, 백만 개당 $0.04이고, 이미지는 32×32픽셀 패치당 1.5토큰의 입력으로 계산됩니다. 따라서 의사 결정 요청에는 출력 토큰 항목이 전혀 없는데, 이는 훨씬 더 큰 모델들과 비교한 공급업체 자체의 비용 비교가 그러한 결과에 도달하는 구조적 이유입니다. 오픈 웨이트에는 호출당 가격이 없으며, 비용은 하드웨어로 지불합니다. 둘 다 여러분이 호출하는 다른 모든 것과 동일한 파이프라인에 있어야 하며, 이것이 바로 라우터가 존재하는 계층입니다 — 200개 이상의 모델에 걸친 단일 API, 공급업체 정가를 0% 마크업으로 전달, 그리고 자동 장애 조치를 통해 단일 업스트림의 일시적 문제가 여러분의 서비스 중단으로 이어지지 않도록 합니다. 그것은 비교를 둘러싼 배관이지, 비교 자체가 아닙니다.

A capture of Liquid AI's blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph announcing d1-3B and d1-omni-600M as open-weight models, the d1-3B Decision Index score of 48.57, and the latency figures of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

솔직히, 어떻게 결정해야 할까

모델이 아니라 답변 형식에서 시작하라. 하위 시스템이 확률, 레이블, 신뢰도를 소비할 수 있고 답변 집합이 작고 알려져 있다면, Liquid AI d1-3B는 12B에서의 다운그레이드가 아니다 — 그것은 다른 도구이며, 지연 시간 수치는 그것을 범주적으로 다른 배포로 만든다: Jetson Orin Nano에서의 50ms는 12B를 돌릴 처지가 전혀 아닌 기기다.

만약 답변이 문장이어야 하거나, 상태가 3만 2천 토큰보다 길거나, 누군가 그것을 소리 내어 말하려 하거나, 출력 언어가 벵골어라면, Ge​mma 4 12B는 둘 중 이 작업을 할 수 있는 유일한 모델이며, 비교는 시작하기도 전에 끝난다.

대부분의 팀에게 진정으로 유용한 위치는 둘 다이며, 서로 다른 자리에 있습니다. 값비싼 호출 앞에는 결정 모델을 두어 언어가 필요 없는 분류, 라우팅, 가드레일 검사를 수행하게 하고, 그 뒤에는 범용 모델을 두어 언어가 필요한 작업을 맡깁니다. 이들은 같은 파이프라인이며, 하나는 필터이고 하나는 페이로드입니다 — 그리고 d1 릴리스에서 가장 많은 것을 얻을 팀은 이미 예/아니오를 답하기 위해 12B를 지불하고 있는 팀들입니다.

A capture of our own catalogue page for Google Gemma 4 31B, showing the model id google/gemma-4-31b-it, a release date of 2026-04-02, a 30.7B dense multimodal description with a 256K token context window, and headline pricing of $0.13 per million input tokens and $0.38 per million output tokens.